Claude Fable 5 & Claude Mythos 5 System Card.pdf
25.8 MB
на ночь оставила это:
#короткие_ответы_на_серьезные_вопросы
Runtime-безопасность ИИ-агентов::
-Наблюдаемость (Observability): Полное логирование всей "траектории исполнения": входной контекст, цепочка мыслей (Chain of Thought), вызовы инструментов, параметры, ответы, изменения в памяти и результаты политик безопасности.
-Детекция аномалий (Anomaly Detection): Выявление отклонений от ожидаемого поведения агента.
-Аварийная остановка (Kill Switch): Возможность в любой момент принудительно остановить выполнение агента.
Runtime-безопасность ИИ-агентов::
-Наблюдаемость (Observability): Полное логирование всей "траектории исполнения": входной контекст, цепочка мыслей (Chain of Thought), вызовы инструментов, параметры, ответы, изменения в памяти и результаты политик безопасности.
-Детекция аномалий (Anomaly Detection): Выявление отклонений от ожидаемого поведения агента.
-Аварийная остановка (Kill Switch): Возможность в любой момент принудительно остановить выполнение агента.
OWASP Agentic AI CTF — FinBot AI Assistant - CTF, предназначенную для изучения уязвимостей в системах агентного ИИ.
https://github.com/OWASP-ASI/finbot-ctf-demo
https://github.com/OWASP-ASI/finbot-ctf-demo
GitHub
GitHub - OWASP-ASI/finbot-ctf-demo
Contribute to OWASP-ASI/finbot-ctf-demo development by creating an account on GitHub.
все чаще вендоры ИБ в МЛ делают свои собственные блоги на своих сайтах,
для того, чтобы покупатели прониклись их экспертизой,
я собираю коллекцию таких блогов, вот еще один:
https://aiceberg.ai/blogs
для того, чтобы покупатели прониклись их экспертизой,
я собираю коллекцию таких блогов, вот еще один:
https://aiceberg.ai/blogs
Aiceberg
Blog
Explore the Aiceberg Blog for insightful artificial intelligence articles and AI content that engage and inform readers across various agentic topics.
Forwarded from Лентач
Госдума приняла в третьем чтении закон о «суверенном» и «национальном» искусственном интеллекте.
Документ вводит два типа ИИ-моделей. «Суверенные» должны полностью разрабатываться российскими компаниями и хранить данные на российских серверах, «национальным» разрешат использовать зарубежные компоненты.
Применять такие системы в чувствительных сферах можно будет только с одобрения правительства, а для работы с банковской системой потребуется согласование с Центробанком. Минцифры станет единым регулятором в сфере ИИ. Основные положения закона вступят в силу 1 сентября 2026 года.
Глава комитета Госдумы по информационной политике Сергей Боярский заявил, что суверенный ИИ должен соответствовать «традиционным ценностям».
Президент InfoWatch Наталья Касперская раскритиковала закон, заявив, что он закрепляет доминирующее положение «Сбера» и «Яндекса», игнорирует вопросы безопасности и «приведёт к краху отечественной отрасли ИИ».
Документ вводит два типа ИИ-моделей. «Суверенные» должны полностью разрабатываться российскими компаниями и хранить данные на российских серверах, «национальным» разрешат использовать зарубежные компоненты.
Применять такие системы в чувствительных сферах можно будет только с одобрения правительства, а для работы с банковской системой потребуется согласование с Центробанком. Минцифры станет единым регулятором в сфере ИИ. Основные положения закона вступят в силу 1 сентября 2026 года.
Глава комитета Госдумы по информационной политике Сергей Боярский заявил, что суверенный ИИ должен соответствовать «традиционным ценностям».
Президент InfoWatch Наталья Касперская раскритиковала закон, заявив, что он закрепляет доминирующее положение «Сбера» и «Яндекса», игнорирует вопросы безопасности и «приведёт к краху отечественной отрасли ИИ».
Что должно быть в AI SOC:
-База коррелированных данных в режиме реального времени. Вердикт ИИ хорош ровно настолько, насколько хорош контекст, на котором он основан. Спросите, коррелируются ли данные об идентификации, конфигурации, ресурсах и базовых показателях постоянно (подход на основе графа знаний) или собираются из необработанных журналов во время выполнения запроса. Сама по себе скорость мало что значит: быстрый механизм выполнения запросов также возвращает результаты за секунды. Вместо этого выберите случайную личность и выясните, какие у нее права (администратор или нет), как изменилась ее конфигурация и каковы ее базовые поведенческие характеристики (обычное местоположение, IP-адрес, автономная система нумерации, пользовательский агент и т. д.). Ничто из этого нельзя подделать во время запроса.
-Агенты полного цикла. Попросите поставщика пройти весь путь от обнаружения инцидента до его сортировки, расследования и ответных действий, а также проследите, сохраняется ли контекст на каждом этапе или собирается заново. Многие платформы автоматизируют сортировку по приоритетам первого уровня и на этом останавливаются, что ускоряет обработку очереди оповещений, но не ускоряет работу SOC.
-Вердикты, подкрепленные доказательствами и поддающиеся проверке. Попросите предоставить доказательства, лежащие в основе вердикта, — каждую строку журнала, корреляцию и вывод, которые привели к вердикту, — и убедитесь, что ваши аналитики могут воспроизвести результат на основе тех же данных. Вердикт, который нельзя проверить, — это всего лишь мнение.
-Обнаружение за пределами SIEM. Реальные инциденты связаны с облаком, SaaS, идентификацией и кодом, однако большая часть этой телеметрии никогда не доходит до SIEM, потому что ее получение обходится слишком дорого. Перечислите источники, которые ваш стек оставляет недоступными, такие как журналы облачного аудита большого объема, GitHub и Google Workspace, затем попросите поставщика показать срабатывание обнаружения на них и провести расследование по ним.
-Поэтапная автономия под контролем человека. Полная автономия в первый день - это предупреждающий знак, как и платформа, которая никогда не зарабатывает больше, чем доступ только для чтения. Выясните, как формируется доверие, какие действия начинаются как рекомендации, какие записи доказательств открывают доступ к автоматическому выполнению и где по-прежнему требуется подтверждение человека. Убедитесь, что вы можете настраивать эти пороговые значения для каждого типа действий.
-Измеримые результаты. Определите показатели до начала пилотного проекта: процент ложноположительных срабатываний и среднее время, затрачиваемое на расследование и реагирование. Сравните результаты с текущими показателями и узнайте у клиентов, что изменилось в их работе за первый квартал. Если в конечном итоге вы захотите, чтобы поставщик выполнял эту работу за вас, убедитесь, что в рамках управляемой услуги используется тот же продукт, с которым работает ваша команда.
https://thehackernews.com/2026/07/how-to-evaluate-ai-soc-platform-in-2026.html
-База коррелированных данных в режиме реального времени. Вердикт ИИ хорош ровно настолько, насколько хорош контекст, на котором он основан. Спросите, коррелируются ли данные об идентификации, конфигурации, ресурсах и базовых показателях постоянно (подход на основе графа знаний) или собираются из необработанных журналов во время выполнения запроса. Сама по себе скорость мало что значит: быстрый механизм выполнения запросов также возвращает результаты за секунды. Вместо этого выберите случайную личность и выясните, какие у нее права (администратор или нет), как изменилась ее конфигурация и каковы ее базовые поведенческие характеристики (обычное местоположение, IP-адрес, автономная система нумерации, пользовательский агент и т. д.). Ничто из этого нельзя подделать во время запроса.
-Агенты полного цикла. Попросите поставщика пройти весь путь от обнаружения инцидента до его сортировки, расследования и ответных действий, а также проследите, сохраняется ли контекст на каждом этапе или собирается заново. Многие платформы автоматизируют сортировку по приоритетам первого уровня и на этом останавливаются, что ускоряет обработку очереди оповещений, но не ускоряет работу SOC.
-Вердикты, подкрепленные доказательствами и поддающиеся проверке. Попросите предоставить доказательства, лежащие в основе вердикта, — каждую строку журнала, корреляцию и вывод, которые привели к вердикту, — и убедитесь, что ваши аналитики могут воспроизвести результат на основе тех же данных. Вердикт, который нельзя проверить, — это всего лишь мнение.
-Обнаружение за пределами SIEM. Реальные инциденты связаны с облаком, SaaS, идентификацией и кодом, однако большая часть этой телеметрии никогда не доходит до SIEM, потому что ее получение обходится слишком дорого. Перечислите источники, которые ваш стек оставляет недоступными, такие как журналы облачного аудита большого объема, GitHub и Google Workspace, затем попросите поставщика показать срабатывание обнаружения на них и провести расследование по ним.
-Поэтапная автономия под контролем человека. Полная автономия в первый день - это предупреждающий знак, как и платформа, которая никогда не зарабатывает больше, чем доступ только для чтения. Выясните, как формируется доверие, какие действия начинаются как рекомендации, какие записи доказательств открывают доступ к автоматическому выполнению и где по-прежнему требуется подтверждение человека. Убедитесь, что вы можете настраивать эти пороговые значения для каждого типа действий.
-Измеримые результаты. Определите показатели до начала пилотного проекта: процент ложноположительных срабатываний и среднее время, затрачиваемое на расследование и реагирование. Сравните результаты с текущими показателями и узнайте у клиентов, что изменилось в их работе за первый квартал. Если в конечном итоге вы захотите, чтобы поставщик выполнял эту работу за вас, убедитесь, что в рамках управляемой услуги используется тот же продукт, с которым работает ваша команда.
https://thehackernews.com/2026/07/how-to-evaluate-ai-soc-platform-in-2026.html
Исследователи из подразделения 42 выявили, что LLM постоянно генерируют «галлюцинации» в виде веб‑доменов законных брендов.
Злоумышленники используют это, заранее регистрируя такие домены. Атака проходит в четыре этапа:
-Discover: злоумышленники выявляют паттерны «галлюцинаций» LLM для целевого бренда.
-Act: превентивная регистрация наиболее ценных фантомных доменов.
-Lure: LLM выступает механизмом доставки атаки — рекомендует пользователям перейти на подконтрольный злоумышленникам домен.
-Bypass: новый домен не имеет репутации, поэтому обходит традиционные средства защиты.
Результаты исследования
Авторы проанализировали 913 мировых брендов и выполнили 685 339 URL‑запросов к двум моделям LLM. Итоги: 2
сгенерировано 2,1 млн URL‑адресов;
выявлено 13 229 подтверждённых вредоносных URL (0,61 % от общего числа);
обнаружено около 250 000 «галлюцинаторных» доменов, которые ещё не зарегистрированы.
Среди вредоносных URL: 67,2 % — сайты с вредоносным ПО, 16,2 % — фишинговые страницы, 13,7 % — Grayware (например, рекламное ПО), а также 3 % — инфраструктура командного управления (C2).
Реальные случаи атак
Зафиксированы примеры использования фантомного сквоттинга: фишинговая кампания с набором Montana Empire (окно эксплуатации — 23 дня), распространение вредоносного Android‑приложения под видом сервиса национальной почты (окно эксплуатации — 51 день), а также другие атаки, в том числе нацеленные на банк в ОАЭ.
Особенности защиты
Традиционные средства защиты неэффективны, потому что новые домены не имеют негативной репутации. Единственный действенный способ защиты — проактивное обнаружение: составить список потенциальных фантомных доменов на основе «галлюминаций» LLM, мониторить регистрацию доменов в реальном времени, а также реагировать до того, как злоумышленник использует домен.
https://unit42.paloaltonetworks.com/phantom-squatting-hallucinated-web-domains/
Злоумышленники используют это, заранее регистрируя такие домены. Атака проходит в четыре этапа:
-Discover: злоумышленники выявляют паттерны «галлюцинаций» LLM для целевого бренда.
-Act: превентивная регистрация наиболее ценных фантомных доменов.
-Lure: LLM выступает механизмом доставки атаки — рекомендует пользователям перейти на подконтрольный злоумышленникам домен.
-Bypass: новый домен не имеет репутации, поэтому обходит традиционные средства защиты.
Результаты исследования
Авторы проанализировали 913 мировых брендов и выполнили 685 339 URL‑запросов к двум моделям LLM. Итоги: 2
сгенерировано 2,1 млн URL‑адресов;
выявлено 13 229 подтверждённых вредоносных URL (0,61 % от общего числа);
обнаружено около 250 000 «галлюцинаторных» доменов, которые ещё не зарегистрированы.
Среди вредоносных URL: 67,2 % — сайты с вредоносным ПО, 16,2 % — фишинговые страницы, 13,7 % — Grayware (например, рекламное ПО), а также 3 % — инфраструктура командного управления (C2).
Реальные случаи атак
Зафиксированы примеры использования фантомного сквоттинга: фишинговая кампания с набором Montana Empire (окно эксплуатации — 23 дня), распространение вредоносного Android‑приложения под видом сервиса национальной почты (окно эксплуатации — 51 день), а также другие атаки, в том числе нацеленные на банк в ОАЭ.
Особенности защиты
Традиционные средства защиты неэффективны, потому что новые домены не имеют негативной репутации. Единственный действенный способ защиты — проактивное обнаружение: составить список потенциальных фантомных доменов на основе «галлюминаций» LLM, мониторить регистрацию доменов в реальном времени, а также реагировать до того, как злоумышленник использует домен.
https://unit42.paloaltonetworks.com/phantom-squatting-hallucinated-web-domains/
Unit 42
Phantom Squatting: AI-Hallucinated Domains as a Software Supply Chain Vector
Attackers can exploit LLM domain hallucinations through phantom squatting to target supply chains. Read the analysis to learn more.
Первая полностью автономная атакеа программ‑вымогателей, управляемой языковой моделью (LLM), — JadePuffer.
Атака JadePuffer началась с эксплуатации уязвимости CVE‑2025‑3248 в инструменте Langflow, который позволяет строить AI‑приложения. Злоумышленник использовал уязвимость удалённого выполнения кода (RCE), не требующую аутентификации.
Затем JadePuffer проник на производственный сервер с MySQL‑базой данных и сервисом конфигурации Alibaba Nacos. Атакующий:
-перечислил содержимое базы данных;
-похитил выбранные данные;
-удалил базу данных;
-оставил записку с требованием выкупа за украденную информацию.
Все полезные нагрузки передавались в виде Python‑кода, закодированного в Base64, через endpoint Langflow.
Отличительная черта JadePuffer — самодокументирующиеся полезные нагрузки. Код, сгенерированный LLM, содержал:
-рассуждения на естественном языке;
-приоритизацию целей;
-подробные аннотации.
Атака адаптировалась в реальном времени: неудачные шаги повторялись с уточнёнными параметрами. Например, переход от неудачной попытки входа к рабочей занял 31 секунду.
По словам Майкла Кларка из Sysdig, LLM‑агент объединил в цепочку разведку, кражу учётных данных, боковое перемещение, обеспечение постоянного доступа и уничтожение данных — без участия оператора.
https://www.darkreading.com/cyberattacks-data-breaches/jadepuffer-first-complete-llm-driven-ransomware-attack
Атака JadePuffer началась с эксплуатации уязвимости CVE‑2025‑3248 в инструменте Langflow, который позволяет строить AI‑приложения. Злоумышленник использовал уязвимость удалённого выполнения кода (RCE), не требующую аутентификации.
Затем JadePuffer проник на производственный сервер с MySQL‑базой данных и сервисом конфигурации Alibaba Nacos. Атакующий:
-перечислил содержимое базы данных;
-похитил выбранные данные;
-удалил базу данных;
-оставил записку с требованием выкупа за украденную информацию.
Все полезные нагрузки передавались в виде Python‑кода, закодированного в Base64, через endpoint Langflow.
Отличительная черта JadePuffer — самодокументирующиеся полезные нагрузки. Код, сгенерированный LLM, содержал:
-рассуждения на естественном языке;
-приоритизацию целей;
-подробные аннотации.
Атака адаптировалась в реальном времени: неудачные шаги повторялись с уточнёнными параметрами. Например, переход от неудачной попытки входа к рабочей занял 31 секунду.
По словам Майкла Кларка из Sysdig, LLM‑агент объединил в цепочку разведку, кражу учётных данных, боковое перемещение, обеспечение постоянного доступа и уничтожение данных — без участия оператора.
https://www.darkreading.com/cyberattacks-data-breaches/jadepuffer-first-complete-llm-driven-ransomware-attack
Dark Reading
JadePuffer: The First Successful LLM-Driven Ransomware Attack
An "agentic threat actor" successfully exploited a Langflow flaw to steal data from a production database server and encrypt other systems.
AI‑агенты, предназначенные для поиска вредоносного кода, могут быть обмануты и сами выполнить этот код.
Институт AI Now опубликовал доказательство концепции атаки «Friendly Fire». Она работает против AI‑агентов Anthropic’s Claude Code и OpenAI’s Codex в автономном режиме — когда агенты самостоятельно одобряют свои команды. Атака использует файл README.md, который есть почти в каждом репозитории: в нём содержится призыв запустить скрипт security.sh. Скрипт незаметно запускает скрытый бинарный файл с полезной нагрузкой атакующего.
Исследователи Боян Миланов и Хейди Кхлааф протестировали два режима: «auto‑mode» в Claude Code и «auto‑review» в Codex. Агенты:
-читают README.md;
-решают, что скрипт — часть работы;
-апускают его без предупреждений;
-выполняют бинарный код атакующего на хосте.
При этом агенты не распознают угрозу — даже когда их прямо спрашивают о скрытых инструкциях в коде, они отвечают «нет». Одна и та же полезная нагрузка сработала на четырёх моделях (Sonnet 4.6, Sonnet 5, Opus 4.8 и GPT‑5.5) без изменений.
https://thehackernews.com/2026/07/friendly-fire-ai-agents-built-to-catch.html
Институт AI Now опубликовал доказательство концепции атаки «Friendly Fire». Она работает против AI‑агентов Anthropic’s Claude Code и OpenAI’s Codex в автономном режиме — когда агенты самостоятельно одобряют свои команды. Атака использует файл README.md, который есть почти в каждом репозитории: в нём содержится призыв запустить скрипт security.sh. Скрипт незаметно запускает скрытый бинарный файл с полезной нагрузкой атакующего.
Исследователи Боян Миланов и Хейди Кхлааф протестировали два режима: «auto‑mode» в Claude Code и «auto‑review» в Codex. Агенты:
-читают README.md;
-решают, что скрипт — часть работы;
-апускают его без предупреждений;
-выполняют бинарный код атакующего на хосте.
При этом агенты не распознают угрозу — даже когда их прямо спрашивают о скрытых инструкциях в коде, они отвечают «нет». Одна и та же полезная нагрузка сработала на четырёх моделях (Sonnet 4.6, Sonnet 5, Opus 4.8 и GPT‑5.5) без изменений.
https://thehackernews.com/2026/07/friendly-fire-ai-agents-built-to-catch.html
Опубликовала это и поняла, как прикольно вставить работающие вредоносные ссылки в статью о вредоносных ссылках
😁1
Forwarded from PWN AI (Artyom Semenov)
Недавно ко мне в коммиты залетел интересный обучающий ресурс - AI Risk Atlas.
первое, что мы видим когда заходим на сайт - это знакомый нам дизайн 😁.
Но помимо этого в глаза бросается большая такая энциклопедия с описанием различных рисков в AI Security, некоторые подкрепляются примерами инцидентов из реального мира. Хоть и часть является не совсем про AI Security - всё-равно, ресурс можно закинуть в копилочку базовых обучающих ресурсов.
Из ноу-хау можно отметить интерактивную песочницу. В ней можно визуально посмотреть как может распространятся атака в зависимости от того, какие приняты меры по защите. Такая вот азбука.
первое, что мы видим когда заходим на сайт - это знакомый нам дизайн 😁.
Но помимо этого в глаза бросается большая такая энциклопедия с описанием различных рисков в AI Security, некоторые подкрепляются примерами инцидентов из реального мира. Хоть и часть является не совсем про AI Security - всё-равно, ресурс можно закинуть в копилочку базовых обучающих ресурсов.
Из ноу-хау можно отметить интерактивную песочницу. В ней можно визуально посмотреть как может распространятся атака в зависимости от того, какие приняты меры по защите. Такая вот азбука.
GitHub - elder-plinius/T3MP3ST: autonomous red teaming platform; multi-agent offensive-security meta-harness · GitHub
https://github.com/elder-plinius/T3MP3ST
https://github.com/elder-plinius/T3MP3ST
GitHub
GitHub - elder-plinius/T3MP3ST: autonomous red teaming platform; multi-agent offensive-security meta-harness
autonomous red teaming platform; multi-agent offensive-security meta-harness - elder-plinius/T3MP3ST
Расследование атак на основе происхождения обеспечивает эффективную автоматизацию за счет стандартизации данных и логики запросов; однако на практике этому критически препятствуют взрывы зависимостей и фрагментированные причинно-следственные цепочки в дикой природе. Для разработки надежного автоматизированного инструмента расследования мы сотрудничали с центром управления безопасностью крупной интернет-корпорации, обслуживающей миллиарды пользователей. Участвуя в реагировании на реальные инциденты, мы смогли оценить и усовершенствовать существующие рабочие процессы расследования на основе больших языковых моделей, которые ежедневно обрабатывают десятки тысяч необработанных оповещений, оставляя тысячи для ручной сортировки, чтобы выявить основные причины неудач при расследовании и основные проблемы существующих инструментов. Опираясь на эти выводы, мы предлагаем SherAgent — автоматизированную систему расследования на основе больших языковых моделей. SherAgent работает по итеративной парадигме «запросов-фильтров» с возвратом по графам происхождения данных и использует возможности семантического анализа больших языковых моделей для обработки неструктурированных данных, таких как контекст расследования и информация об угрозах. Чтобы преодолеть фрагментацию причинно-следственных связей, вызванную отсутствием событий, система динамически корректирует условия запроса, расширяя область поиска. В то же время он выполняет фильтрацию точных результатов и выбор стратегических узлов для последующего исследования, тем самым предотвращая «взрыв» зависимостей. Обширные полевые испытания показали, что SherAgent повышает вероятность успешного завершения расследования на 31,1 % и 63,7 % по сравнению с устаревшими корпоративными подходами и лучшими практиками соответственно.
https://arxiv.org/abs/2607.09176
https://arxiv.org/abs/2607.09176
arXiv.org
SherAgent: Scaling Attack Investigation in the Wild via...
Provenance-based attack investigation enables viable automation by standardizing data and query logic; however, it is critically hindered in practice by dependency explosions and fragmented causal...
Microsoft Project Ire (
https://www.microsoft.com/en-us/research/blog/project-ire-autonomously-identifies-malware-at-scale/
Binary Analyzer): Это не просто исследование, а полноценный продукт Microsoft, который уже интегрируется в Defender. Агент автономно проводит полный reverse engineering, используя декомпиляторы, sandbox-ы для анализа памяти и фреймворки вроде angr и Ghidra. В тестах на 4000 сложных файлов он достиг точности 0.89 с уровнем ложных срабатываний всего 4%. Главное — он ведет "цепочку доказательств" (chain of evidence), объясняя каждый свой шагhttps://www.microsoft.com/en-us/research/blog/project-ire-autonomously-identifies-malware-at-scale/
Microsoft Research
Project Ire autonomously identifies malware at scale
Designed to classify software without context, Project Ire replicates the gold standard in malware analysis through reverse engineering. It streamlines a complex, expert-driven process, making large-scale malware detection faster & more consistent.
🔥2