Шёл апрель 2026:
Компания Anthropic, специализирующаяся на ИИ, объявила, что выпускает новое поколение своей большой языковой модели под названием Claude Mythos Preview, но только для ограниченного консорциума, в который входят около 40 технологических компаний, в том числе Google, Broadcom, Nvidia, Cisco, Palo Alto Networks, Apple, JPMorgan Chase, Amazon и Microsoft. Некоторые из конкурентов компании входят в этот консорциум, потому что новая модель искусственного интеллекта представляет собой качественный скачок в производительности, который может иметь как положительные, так и отрицательные последствия для кибербезопасности и национальной безопасности США.
Хорошая новость заключается в том, что в процессе разработки Claude Mythos компания Anthropic обнаружила, что искусственный интеллект может не только писать программный код проще и с большей сложностью, чем любая из существующих моделей, но и, как побочный эффект, находить уязвимости практически во всех самых популярных в мире программных системах.
Плохая новость заключается в том, что если этот инструмент попадет в руки злоумышленников, они смогут взломать практически все основные программные системы в мире, в том числе разработанные компаниями из консорциума.
Только за последний месяц Mythos Preview обнаружил тысячи уязвимостей высокой степени опасности, в том числе в каждой крупной операционной системе и веб-браузере. Учитывая темпы развития искусственного интеллекта, не пройдет много времени, прежде чем подобные возможности распространятся, в том числе за пределы тех, кто обязался использовать их безопасно. Последствия — для экономики, общественной и национальной безопасности – могут быть катастрофическими.
Терминатор все ближе.
Forwarded from Бэкдор
This media is not supported in your browser
VIEW IN TELEGRAM
Выкатили Claude Code для хакеров — Decepticon заменяет целую команду взломщиков, информбезопасников и пентестеров.
Сервис вскрывает любые сервисы, проверяет в них дыры и пробивает все барьеры защиты. С ним можно отлично прокачаться в информационной безопасности.
• Это полноценный агент, который сам принимает решения по взлому и пробиву ресурсов — вы должны только поставить задачу.
• Имитирует реального противника и выстраивает мощные цепочки кибератак, чтобы сломать бизнес-логику.
• Под каждую задачу создается отдельный агент, чтобы не перегружать ресурсы.
• ИИ-агент легко управляется через консоль — у него понятный и приятный интерфейс.
• Десептикон разворачивается в Docker, а все атаки осуществляются внутри изолированного контейнера.
😶 😶 😶 😶 😶 😶 😶 😶 😶
Ваш собственный Мегатрон лежит — здесь.
👍 Бэкдор
Сервис вскрывает любые сервисы, проверяет в них дыры и пробивает все барьеры защиты. С ним можно отлично прокачаться в информационной безопасности.
• Это полноценный агент, который сам принимает решения по взлому и пробиву ресурсов — вы должны только поставить задачу.
• Имитирует реального противника и выстраивает мощные цепочки кибератак, чтобы сломать бизнес-логику.
• Под каждую задачу создается отдельный агент, чтобы не перегружать ресурсы.
• ИИ-агент легко управляется через консоль — у него понятный и приятный интерфейс.
• Десептикон разворачивается в Docker, а все атаки осуществляются внутри изолированного контейнера.
Ваш собственный Мегатрон лежит — здесь.
Please open Telegram to view this post
VIEW IN TELEGRAM
а вы были в курсе?:))
Крах гиганта: В декабре 2001 года Enron, одна из крупнейших энергетических компаний США, объявила о банкротстве из-за масштабных бухгалтерских махинаций и корпоративного мошенничества.
Изъятие данных: В рамках расследования Федеральная комиссия по регулированию энергетики США (FERC) в мае 2002 года изъяла с серверов компании огромный массив данных, включая более 600 000 электронных писем 158 сотрудников, в основном высшего руководства.
Публикация в общем доступе: В 2003 году FERC приняла неожиданное решение, посчитав, что публикация этих данных отвечает общественным интересам. В результате огромный архив электронной переписки был выложен в открытый доступ на государственном веб-сайте. Позже архив был очищен: из него удалили дубликаты, наиболее личные данные и все вложения, но сама суть осталась
Рождение «Корпуса Enron»: Ученые из MIT и Университета Карнеги-Меллона выкупили эти данные, очистили и структурировали их, создав то, что сегодня известно как «Корпус электронных писем Enron» (Enron Email Corpus).
Тренировочная база для ИИ: Этот набор данных, содержащий около 500 000 реальных писем, стал «золотым стандартом» для обучения спам-фильтров и алгоритмов машинного обучения. Именно на этих данных учили ранние версии алгоритмов, которые сегодня защищают нас от спама. Прототип функции «Smart Compose» в Gmail также обучался на этом корпусе
я сейчас размечаю, боже, это как будто исторический роман, как люди пытались свой бизнес спасти
ну, и в 2007 красиво спам-фильтр обходили, прикрепляли куски из худ произведений, чтобы байесовский классификатор запутать
Крах гиганта: В декабре 2001 года Enron, одна из крупнейших энергетических компаний США, объявила о банкротстве из-за масштабных бухгалтерских махинаций и корпоративного мошенничества.
Изъятие данных: В рамках расследования Федеральная комиссия по регулированию энергетики США (FERC) в мае 2002 года изъяла с серверов компании огромный массив данных, включая более 600 000 электронных писем 158 сотрудников, в основном высшего руководства.
Публикация в общем доступе: В 2003 году FERC приняла неожиданное решение, посчитав, что публикация этих данных отвечает общественным интересам. В результате огромный архив электронной переписки был выложен в открытый доступ на государственном веб-сайте. Позже архив был очищен: из него удалили дубликаты, наиболее личные данные и все вложения, но сама суть осталась
Рождение «Корпуса Enron»: Ученые из MIT и Университета Карнеги-Меллона выкупили эти данные, очистили и структурировали их, создав то, что сегодня известно как «Корпус электронных писем Enron» (Enron Email Corpus).
Тренировочная база для ИИ: Этот набор данных, содержащий около 500 000 реальных писем, стал «золотым стандартом» для обучения спам-фильтров и алгоритмов машинного обучения. Именно на этих данных учили ранние версии алгоритмов, которые сегодня защищают нас от спама. Прототип функции «Smart Compose» в Gmail также обучался на этом корпусе
я сейчас размечаю, боже, это как будто исторический роман, как люди пытались свой бизнес спасти
ну, и в 2007 красиво спам-фильтр обходили, прикрепляли куски из худ произведений, чтобы байесовский классификатор запутать
👍1
По информации на июль 2025 года, компания Pillar Security сообщила об обнаружении атаки Poisoned GGUF Templates на платформе Hugging Face.
Суть атаки: злоумышленники встраивают вредоносные условные инструкции прямо в шаблон чата файла GGUF (GPT-Generated Unified Format). Затем скомпрометированная модель загружается в открытый репозиторий. Атаку невозможно обнаружить при обычном тестировании и с помощью большинства инструментов безопасности.
Вредоносные инструкции не активируются до определённого запроса пользователя, после чего модель генерирует скомпрометированный вывод.
В июне 2025 года Pillar Security поделилась результатами исследования с поставщиками, в том числе с Hugging Face и LM Studio.
https://dailyguardian.ca/pillar-security-uncovers-novel-attack-vector-that-embeds-malicious-backdoors-in-model-files-on-hugging-face/
Суть атаки: злоумышленники встраивают вредоносные условные инструкции прямо в шаблон чата файла GGUF (GPT-Generated Unified Format). Затем скомпрометированная модель загружается в открытый репозиторий. Атаку невозможно обнаружить при обычном тестировании и с помощью большинства инструментов безопасности.
Вредоносные инструкции не активируются до определённого запроса пользователя, после чего модель генерирует скомпрометированный вывод.
В июне 2025 года Pillar Security поделилась результатами исследования с поставщиками, в том числе с Hugging Face и LM Studio.
https://dailyguardian.ca/pillar-security-uncovers-novel-attack-vector-that-embeds-malicious-backdoors-in-model-files-on-hugging-face/
Daily Guardian
Pillar Security Uncovers Novel Attack Vector That Embeds Malicious Backdoors in Model Files on Hugging Face
TEL EVIV, Israel, July 09, 2025 (GLOBE NEWSWIRE) -- Pillar Security, a leading company in AI security, discovered a novel supply chain attack vector that
❤1
2407.10825v1.pdf
2 MB
Методика Wicked Oddities: Selectively Poisoning for Effective Clean-Label Backdoor Attacks демонстрирует, что целенаправленное отравление небольшого подмножества обучающей выборки значительно повышает эффективность атаки.
Основная идея заключается в том, что злоумышленник может избирательно модифицировать лишь часть обучающих данных, ориентируясь на образцы, которые наиболее существенно влияют на успех атаки. Это позволяет повысить результативность атаки при ограниченных ресурсах и информации со стороны атакующего.
Основная идея заключается в том, что злоумышленник может избирательно модифицировать лишь часть обучающих данных, ориентируясь на образцы, которые наиболее существенно влияют на успех атаки. Это позволяет повысить результативность атаки при ограниченных ресурсах и информации со стороны атакующего.
Исследователи из компании GreyNoise выявили масштабную волну попыток кибератак на системы искусственного интеллекта (ИИ), в частности на Ollama и инфраструктуру, связанную с OpenAI, в период с октября 2025 года по январь 2026 года. «Ловушки», имитирующие серверы ИИ, зафиксировали в общей сложности 91 403 сеанса атак. По мнению аналитиков, основной целью этих действий была разведка с целью выявления уязвимостей и составления карты инфраструктуры ИИ организаций для подготовки к последующим атакам.
https://www.thaicert.or.th/en/2026/01/16/over-91000-ai-attack-attempts-detected-targeting-ollama-and-openai-related-systems/
https://www.thaicert.or.th/en/2026/01/16/over-91000-ai-attack-attempts-detected-targeting-ollama-and-openai-related-systems/
Предложен подход, основанный на построении характеристического векторного представления точек данных, которое отражает внутренние свойства распределения, для выявления отравленных образцов в сценариях transfer learning
https://ar5iv.labs.arxiv.org/html/2403.13523v1
https://ar5iv.labs.arxiv.org/html/2403.13523v1
ar5iv
Have You Poisoned My Data? Defending Neural Networks against Data Poisoning Partially funded by the Technology Innovation Institute…
The unprecedented availability of training data fueled the rapid development of powerful neural networks in recent years. However, the need for such large amounts of data leads to potential threats such as poisoning at…
TracIn — это метод для измерения влияния обучающих примеров на предсказания модели. В библиотеке Captum реализованы несколько реализаций этого метода.
TracInCP — основная реализация метода из статьи о TracIn. Она вычисляет оценки влияния, накапливая скалярное произведение градиентов между тестовыми и обучающими примерами через контрольные точки модели.
Особенности TracInCP:
поддерживает произвольные модели PyTorch и наборы данных;
работает с атрибуцией признаков и слоёв;
позволяет находить сторонников (наиболее положительно влиятельных примеров) и противников (наиболее отрицательно влиятельных примеров);
может вычислять оценки самовлияния;
предлагает гибкую настройку слоёв для учёта градиентов.
Другие реализации TracIn в Captum
TracInCPFast — оптимизированная версия TracInCP для случая, когда учитываются только градиенты в последнем полносвязном слое. Это значительно ускоряет вычисления без потери точности в этом специфическом сценарии.
TracInCPFastRandProj — ещё более оптимизированная версия, которая использует случайные проекции для снижения размерности пространства градиентов. Это позволяет ускорить вычисления с контролируемой ошибкой приближения.
Captum — это открытая библиотека для интерпретируемости моделей, построенная на PyTorch. Она предоставляет широкий набор методов для понимания того, какие признаки или примеры обучают модель вносить вклад в её предсказания.
https://github.com/meta-pytorch/captum
TracInCP — основная реализация метода из статьи о TracIn. Она вычисляет оценки влияния, накапливая скалярное произведение градиентов между тестовыми и обучающими примерами через контрольные точки модели.
Особенности TracInCP:
поддерживает произвольные модели PyTorch и наборы данных;
работает с атрибуцией признаков и слоёв;
позволяет находить сторонников (наиболее положительно влиятельных примеров) и противников (наиболее отрицательно влиятельных примеров);
может вычислять оценки самовлияния;
предлагает гибкую настройку слоёв для учёта градиентов.
Другие реализации TracIn в Captum
TracInCPFast — оптимизированная версия TracInCP для случая, когда учитываются только градиенты в последнем полносвязном слое. Это значительно ускоряет вычисления без потери точности в этом специфическом сценарии.
TracInCPFastRandProj — ещё более оптимизированная версия, которая использует случайные проекции для снижения размерности пространства градиентов. Это позволяет ускорить вычисления с контролируемой ошибкой приближения.
Captum — это открытая библиотека для интерпретируемости моделей, построенная на PyTorch. Она предоставляет широкий набор методов для понимания того, какие признаки или примеры обучают модель вносить вклад в её предсказания.
https://github.com/meta-pytorch/captum
GitHub
GitHub - meta-pytorch/captum: Model interpretability and understanding for PyTorch
Model interpretability and understanding for PyTorch - meta-pytorch/captum
PyDCI — это реализация метода Distributional Correspondence Indexing (DCI) на языке Python. DCI — это метод трансферного обучения для кросс-доменной и кросс-лингвистической классификации текстов.
Некоторые особенности PyDCI:
-Автономная версия DCI. Использует библиотеки scikit-learn и SciPy.
-Улучшения по сравнению с предыдущей реализацией (JaDCI). В PyDCI добавлена возможность стандартизировать векторы документов перед обучением классификатора, что повысило эффективность метода. Также в PyDCI используется реализация линейных SVM из scikit-learn (LinearSVC, основанная на пакете liblinear), а не SVMlight, как в JaDCI. Это позволило применять оптимизацию параметра C с помощью GridSearchCV.
-Эффективность. По данным экспериментов, ни один из тестов с PyDCI не занял больше 35 секунд, что делает метод достаточно быстрым по сравнению с некоторыми другими высокопроизводительными методами, основанными на глубоком обучении.
https://github.com/AlexMoreo/pydci
Некоторые особенности PyDCI:
-Автономная версия DCI. Использует библиотеки scikit-learn и SciPy.
-Улучшения по сравнению с предыдущей реализацией (JaDCI). В PyDCI добавлена возможность стандартизировать векторы документов перед обучением классификатора, что повысило эффективность метода. Также в PyDCI используется реализация линейных SVM из scikit-learn (LinearSVC, основанная на пакете liblinear), а не SVMlight, как в JaDCI. Это позволило применять оптимизацию параметра C с помощью GridSearchCV.
-Эффективность. По данным экспериментов, ни один из тестов с PyDCI не занял больше 35 секунд, что делает метод достаточно быстрым по сравнению с некоторыми другими высокопроизводительными методами, основанными на глубоком обучении.
https://github.com/AlexMoreo/pydci
GitHub
GitHub - AlexMoreo/pydci: A Python implementation of the Distributional Correspondence Indexing algorithm
A Python implementation of the Distributional Correspondence Indexing algorithm - AlexMoreo/pydci
Исследователи OX Security выявили архитектурную уязвимость в официальной реализации MCP от Anthropic: непроверенные команды выполняются на сервере без аутентификации и санитизации, что может привести к полной компрометации системы. Под угрозой находятся до 200 000 серверов.
https://www.theregister.com/2026/04/16/anthropic_mcp_design_flaw/
https://www.theregister.com/2026/04/16/anthropic_mcp_design_flaw/
theregister
MCP 'design flaw' puts 200k servers at risk: Researcher
: Bug or feature?
Статья в блоге Microsoft о проекте Notary (CNCF). Описывает, что проект определяет стандарты для подписания и верификации OCI-артефактов, включая AI-модели, обеспечивая их целостность и подлинность
https://techcommunity.microsoft.com/blog/appsonazureblog/simplify-image-signing-and-verification-with-notary-project-and-trusted-signing-/4455292
https://techcommunity.microsoft.com/blog/appsonazureblog/simplify-image-signing-and-verification-with-notary-project-and-trusted-signing-/4455292
TECHCOMMUNITY.MICROSOFT.COM
Simplify Image Signing and Verification with Notary Project and Trusted Signing (Public Preview) | Microsoft Community Hub
Supply chain security has become one of the most pressing challenges for modern cloud-native applications. Every container image, Helm chart, SBOM, or AI...
Научная статья (arXiv:2603.28988v1), предлагающая концепцию «аттестационного шлюза продвижения» (attestation-aware promotion gate). Шлюз проверяет доказательства безопасности артефакта перед его допуском в доверенные среды (обучение, дообучение, развёртывание)
https://arxiv.org/html/2603.28988v1
https://arxiv.org/html/2603.28988v1
Официальный лог изменений базы данных MITRE ATLAS. Подтверждает, что версия 5.1.0 от 6 ноября 2025 года включает 1 матрицу, 16 тактик, 84 техники, 56 подтехник, 32 меры противодействия и 42 кейса
https://github.com/mitre-atlas/atlas-data/blob/main/CHANGELOG.md
https://github.com/mitre-atlas/atlas-data/blob/main/CHANGELOG.md
GitHub
atlas-data/CHANGELOG.md at main · mitre-atlas/atlas-data
ATLAS tactics, techniques, and case studies data. Contribute to mitre-atlas/atlas-data development by creating an account on GitHub.
В феврале 2026 CompTIA запустила SecAI+ (CY0-001) — первую
международную сертификацию по безопасности ИИ. 4 домена
экзамена: базовые концепции, защита AI-систем, применение
ИИ в задачах ИБ, GRC. Программа покрывает MITRE ATLAS,
OWASP Top 10 for LLM, атаки prompt injection (direct
и indirect), data и model poisoning, membership inference,
model inversion, backdoors в моделях.
PDF-конспекты по всем 4 доменам, справочник MITRE ATLAS, шпаргалка по атакам на LLM, глоссарий. Плюс ВМ с Ollama и 12 практических лабораторных: prompt injection, jailbreak, RAG poisoning, data poisoning, обход guardrails, AI red teaming.
Всё в одном месте. Бесплатно.
https://rtmeteor.ru/secai
международную сертификацию по безопасности ИИ. 4 домена
экзамена: базовые концепции, защита AI-систем, применение
ИИ в задачах ИБ, GRC. Программа покрывает MITRE ATLAS,
OWASP Top 10 for LLM, атаки prompt injection (direct
и indirect), data и model poisoning, membership inference,
model inversion, backdoors в моделях.
PDF-конспекты по всем 4 доменам, справочник MITRE ATLAS, шпаргалка по атакам на LLM, глоссарий. Плюс ВМ с Ollama и 12 практических лабораторных: prompt injection, jailbreak, RAG poisoning, data poisoning, обход guardrails, AI red teaming.
Всё в одном месте. Бесплатно.
https://rtmeteor.ru/secai
rtmeteor.ru
SecAI Training — Материалы по безопасности ИИ
Первые в РФ материалы для CompTIA SecAI+. PDF-конспекты + VM с лабораторными работами. Безопасность ИИ без воды.
❤1🔥1
Mythos от Anthropic — тревожный сигнал для всех, а не только для банков / Хабр
https://habr.com/ru/articles/1023784/
https://habr.com/ru/articles/1023784/
Хабр
Mythos от Anthropic — тревожный сигнал для всех, а не только для банков
Mythos, новая модель искусственного интеллекта, которую компания Anthropic PBC представила как слишком опасную для публичного использования, поначалу казалась проблемой для банков. Через...
👍1💯1
Forwarded from AbstractDL
This media is not supported in your browser
VIEW IN TELEGRAM
Попросил Уробороса поднять мне настроение. Он заполнил котами весь экран. Нажал
/panic. Уроборос остановился. Коты — нет.