AI‑агенты, предназначенные для поиска вредоносного кода, могут быть обмануты и сами выполнить этот код.
Институт AI Now опубликовал доказательство концепции атаки «Friendly Fire». Она работает против AI‑агентов Anthropic’s Claude Code и OpenAI’s Codex в автономном режиме — когда агенты самостоятельно одобряют свои команды. Атака использует файл README.md, который есть почти в каждом репозитории: в нём содержится призыв запустить скрипт security.sh. Скрипт незаметно запускает скрытый бинарный файл с полезной нагрузкой атакующего.
Исследователи Боян Миланов и Хейди Кхлааф протестировали два режима: «auto‑mode» в Claude Code и «auto‑review» в Codex. Агенты:
-читают README.md;
-решают, что скрипт — часть работы;
-апускают его без предупреждений;
-выполняют бинарный код атакующего на хосте.
При этом агенты не распознают угрозу — даже когда их прямо спрашивают о скрытых инструкциях в коде, они отвечают «нет». Одна и та же полезная нагрузка сработала на четырёх моделях (Sonnet 4.6, Sonnet 5, Opus 4.8 и GPT‑5.5) без изменений.
https://thehackernews.com/2026/07/friendly-fire-ai-agents-built-to-catch.html
Институт AI Now опубликовал доказательство концепции атаки «Friendly Fire». Она работает против AI‑агентов Anthropic’s Claude Code и OpenAI’s Codex в автономном режиме — когда агенты самостоятельно одобряют свои команды. Атака использует файл README.md, который есть почти в каждом репозитории: в нём содержится призыв запустить скрипт security.sh. Скрипт незаметно запускает скрытый бинарный файл с полезной нагрузкой атакующего.
Исследователи Боян Миланов и Хейди Кхлааф протестировали два режима: «auto‑mode» в Claude Code и «auto‑review» в Codex. Агенты:
-читают README.md;
-решают, что скрипт — часть работы;
-апускают его без предупреждений;
-выполняют бинарный код атакующего на хосте.
При этом агенты не распознают угрозу — даже когда их прямо спрашивают о скрытых инструкциях в коде, они отвечают «нет». Одна и та же полезная нагрузка сработала на четырёх моделях (Sonnet 4.6, Sonnet 5, Opus 4.8 и GPT‑5.5) без изменений.
https://thehackernews.com/2026/07/friendly-fire-ai-agents-built-to-catch.html
Опубликовала это и поняла, как прикольно вставить работающие вредоносные ссылки в статью о вредоносных ссылках
😁1
Forwarded from PWN AI (Artyom Semenov)
Недавно ко мне в коммиты залетел интересный обучающий ресурс - AI Risk Atlas.
первое, что мы видим когда заходим на сайт - это знакомый нам дизайн 😁.
Но помимо этого в глаза бросается большая такая энциклопедия с описанием различных рисков в AI Security, некоторые подкрепляются примерами инцидентов из реального мира. Хоть и часть является не совсем про AI Security - всё-равно, ресурс можно закинуть в копилочку базовых обучающих ресурсов.
Из ноу-хау можно отметить интерактивную песочницу. В ней можно визуально посмотреть как может распространятся атака в зависимости от того, какие приняты меры по защите. Такая вот азбука.
первое, что мы видим когда заходим на сайт - это знакомый нам дизайн 😁.
Но помимо этого в глаза бросается большая такая энциклопедия с описанием различных рисков в AI Security, некоторые подкрепляются примерами инцидентов из реального мира. Хоть и часть является не совсем про AI Security - всё-равно, ресурс можно закинуть в копилочку базовых обучающих ресурсов.
Из ноу-хау можно отметить интерактивную песочницу. В ней можно визуально посмотреть как может распространятся атака в зависимости от того, какие приняты меры по защите. Такая вот азбука.
GitHub - elder-plinius/T3MP3ST: autonomous red teaming platform; multi-agent offensive-security meta-harness · GitHub
https://github.com/elder-plinius/T3MP3ST
https://github.com/elder-plinius/T3MP3ST
GitHub
GitHub - elder-plinius/T3MP3ST: autonomous red teaming platform; multi-agent offensive-security meta-harness
autonomous red teaming platform; multi-agent offensive-security meta-harness - elder-plinius/T3MP3ST
Расследование атак на основе происхождения обеспечивает эффективную автоматизацию за счет стандартизации данных и логики запросов; однако на практике этому критически препятствуют взрывы зависимостей и фрагментированные причинно-следственные цепочки в дикой природе. Для разработки надежного автоматизированного инструмента расследования мы сотрудничали с центром управления безопасностью крупной интернет-корпорации, обслуживающей миллиарды пользователей. Участвуя в реагировании на реальные инциденты, мы смогли оценить и усовершенствовать существующие рабочие процессы расследования на основе больших языковых моделей, которые ежедневно обрабатывают десятки тысяч необработанных оповещений, оставляя тысячи для ручной сортировки, чтобы выявить основные причины неудач при расследовании и основные проблемы существующих инструментов. Опираясь на эти выводы, мы предлагаем SherAgent — автоматизированную систему расследования на основе больших языковых моделей. SherAgent работает по итеративной парадигме «запросов-фильтров» с возвратом по графам происхождения данных и использует возможности семантического анализа больших языковых моделей для обработки неструктурированных данных, таких как контекст расследования и информация об угрозах. Чтобы преодолеть фрагментацию причинно-следственных связей, вызванную отсутствием событий, система динамически корректирует условия запроса, расширяя область поиска. В то же время он выполняет фильтрацию точных результатов и выбор стратегических узлов для последующего исследования, тем самым предотвращая «взрыв» зависимостей. Обширные полевые испытания показали, что SherAgent повышает вероятность успешного завершения расследования на 31,1 % и 63,7 % по сравнению с устаревшими корпоративными подходами и лучшими практиками соответственно.
https://arxiv.org/abs/2607.09176
https://arxiv.org/abs/2607.09176
arXiv.org
SherAgent: Scaling Attack Investigation in the Wild via...
Provenance-based attack investigation enables viable automation by standardizing data and query logic; however, it is critically hindered in practice by dependency explosions and fragmented causal...
Microsoft Project Ire (
https://www.microsoft.com/en-us/research/blog/project-ire-autonomously-identifies-malware-at-scale/
Binary Analyzer): Это не просто исследование, а полноценный продукт Microsoft, который уже интегрируется в Defender. Агент автономно проводит полный reverse engineering, используя декомпиляторы, sandbox-ы для анализа памяти и фреймворки вроде angr и Ghidra. В тестах на 4000 сложных файлов он достиг точности 0.89 с уровнем ложных срабатываний всего 4%. Главное — он ведет "цепочку доказательств" (chain of evidence), объясняя каждый свой шагhttps://www.microsoft.com/en-us/research/blog/project-ire-autonomously-identifies-malware-at-scale/
Microsoft Research
Project Ire autonomously identifies malware at scale
Designed to classify software without context, Project Ire replicates the gold standard in malware analysis through reverse engineering. It streamlines a complex, expert-driven process, making large-scale malware detection faster & more consistent.
🔥2
Forwarded from PWN AI (Artyom Semenov)
Если отбросить всякие OWASP, статьи научные и т.д то какой вектор атаки на AI-системы вы считаете наиболее недооцененным и опасным в реальных прод-средах прямо сейчас?
Anonymous Poll
33%
Indirect Prompt Injection (через RAG, парсинг сайтов или документы)
15%
Отравление данных на этапе файнтюнинга или RAG-базы
46%
Злоупотребление инструментами агента (Agent Tool Misuse: SSRF, RCE, доступ к API)
33%
Supply Chain атаки (модели с бэкдорами, уязвимые зависимости в MlOps пайплайне)
14%
Социотехническая атака на оператора/администратора Ml-системы
19%
посмотреть
тест из 21 сценария для оценки адаптивных многоэтапных атак на защитников на основе больших языковых моделей. При 15 раундах адаптивной атаки коэффициент успешности составляет 5,4–14%, а объединение трёх передовых моделей атакующих LLM позволяет выявить в 1,4–2,2 раза больше уникальных успешных атак, чем у лучшего отдельного атакующего. Также публикуются бенчмарк, оркестратор, базовые наборы инструментов и интерфейс командной строки для нескольких атакующих, набор данных для воспроизведения атак и другие материалы.
https://arxiv.org/abs/2607.18063
https://arxiv.org/abs/2607.18063
arXiv.org
Adaptive Adversaries: A Multi-Turn, Multi-LLM Benchmark for LLM...
LLM-based agents process external content, exposing them to prompt injection and multi-turn manipulation. Most safety benchmarks evaluate defenders against fixed attack pools collected before...
Исследователи в области кибербезопасности раскрыли подробности ранее не упоминавшегося ботнета для интернета вещей (IoT) под названием TuxBot v3 Evolution, который, судя по всему, был разработан с помощью большой языковой модели (БЯМ), хотя и не слишком успешно.
«Хотя ИИ выполнил их запрос на генерацию кода для ботнета, он добавил предупреждение о безопасности, которое разработчик не смог удалить перед отправкой», — сообщили в подразделении 42 компании Palo Alto Networks. «Несмотря на то, что большая языковая модель явно помогла в создании ботнета, некоторые функции в проанализированных образцах работали некорректно».
В компании, занимающейся кибербезопасностью, заявили, что эти ошибки можно было бы исправить вручную и что, возможно, в дикой природе существуют более совершенные версии вредоносного ПО.
Платформа ботнета состоит из нескольких компонентов: бота-агента на языке C, который кросс-компилируется для различных архитектур (например, ARM, MIPS, MIPSEL, MIPS64, x86_64, PowerPC и RISC-V), командно-контрольного сервера (C2) на языке Go с панелью DDoS-for-hire, пользовательской виртуальной машины для эксплойтов, тестовой инфраструктуры на основе Docker и автоматизированной системы сборки.
https://thehackernews.com/2026/07/tuxbot-v3-evolution-shows-signs-of-llm.html
«Хотя ИИ выполнил их запрос на генерацию кода для ботнета, он добавил предупреждение о безопасности, которое разработчик не смог удалить перед отправкой», — сообщили в подразделении 42 компании Palo Alto Networks. «Несмотря на то, что большая языковая модель явно помогла в создании ботнета, некоторые функции в проанализированных образцах работали некорректно».
В компании, занимающейся кибербезопасностью, заявили, что эти ошибки можно было бы исправить вручную и что, возможно, в дикой природе существуют более совершенные версии вредоносного ПО.
Платформа ботнета состоит из нескольких компонентов: бота-агента на языке C, который кросс-компилируется для различных архитектур (например, ARM, MIPS, MIPSEL, MIPS64, x86_64, PowerPC и RISC-V), командно-контрольного сервера (C2) на языке Go с панелью DDoS-for-hire, пользовательской виртуальной машины для эксплойтов, тестовой инфраструктуры на основе Docker и автоматизированной системы сборки.
https://thehackernews.com/2026/07/tuxbot-v3-evolution-shows-signs-of-llm.html
Unit 42
TuxBot v3: Inside an IoT Botnet Framework With LLM-Assisted Development
TuxBot v3 Evolution, an IoT botnet framework built with LLMs. Read our analysis of its cross-compiled binaries, C2 architecture and bugs.
По мере того, как LLM превращаются в автономных агентов с возможностями использования инструментов, они создают проблемы безопасности, которые выходят за рамки традиционных проблем безопасности LLM, основанных на контенте. В этой статье представлена Sequential Tool Attack Chaining (\STAC) — новая многоэтапная система атак, использующая инструменты, которыми пользуются агенты. \STAC объединяет в цепочку вызовы инструментов, каждый из которых по отдельности кажется безобидным, но в совокупности позволяет выполнять вредоносные операции, которые становятся очевидными только на последнем этапе выполнения. В основе \STAC лежит автоматизированный конвейер с замкнутым циклом, который синтезирует исполняемые многоэтапные цепочки инструментов, проверяет их путем выполнения в среде и реконструирует скрытые многоэтапные запросы, которые надежно побуждают агентов выполнять проверенную вредоносную последовательность. Используя этот фреймворк, мы генерируем и систематически оцениваем 483 случая \ STAC, включающих 1352 набора взаимодействий пользователя, агента и среды и охватывающих различные домены, задачи, типы агентов и 10 режимов отказа.
https://arxiv.org/abs/2509.25624
https://arxiv.org/abs/2509.25624
arXiv.org
STAC: When Innocent Tools Form Dangerous Chains to Jailbreak LLM Agents
As LLMs advance into autonomous agents with tool-use capabilities, they introduce security challenges that extend beyond traditional content-based LLM safety concerns. This paper introduces...
ничесе
Репозиторий искусственного интеллекта Hugging Face сообщил, что злоумышленники получили доступ к внутренним наборам данных и учётным данным после взлома производственной инфраструктуры с использованием автономного ИИ-агента.
Hugging Face — это платформа искусственного интеллекта и машинного обучения с открытым исходным кодом, которая предоставляет доступ к более чем 45 000 моделей от ведущих поставщиков ИИ и используется более чем 50 000 организаций.
Компания все еще расследует, были ли затронуты данные партнеров или клиентов, и заявила, что свяжется с любыми затронутыми сторонами напрямую. Компания Hugging Face заявила, что на сегодняшний день не обнаружила никаких доказательств взлома общедоступных моделей, наборов данных или пространств данных, и что ее цепочка поставок программного обеспечения была "проверена на чистоту".
https://www.bleepingcomputer.com/news/security/hugging-face-breach-autonomous-ai-agent-system-internal-datasets-credentials/
Репозиторий искусственного интеллекта Hugging Face сообщил, что злоумышленники получили доступ к внутренним наборам данных и учётным данным после взлома производственной инфраструктуры с использованием автономного ИИ-агента.
Hugging Face — это платформа искусственного интеллекта и машинного обучения с открытым исходным кодом, которая предоставляет доступ к более чем 45 000 моделей от ведущих поставщиков ИИ и используется более чем 50 000 организаций.
Компания все еще расследует, были ли затронуты данные партнеров или клиентов, и заявила, что свяжется с любыми затронутыми сторонами напрямую. Компания Hugging Face заявила, что на сегодняшний день не обнаружила никаких доказательств взлома общедоступных моделей, наборов данных или пространств данных, и что ее цепочка поставок программного обеспечения была "проверена на чистоту".
https://www.bleepingcomputer.com/news/security/hugging-face-breach-autonomous-ai-agent-system-internal-datasets-credentials/
BleepingComputer
Hugging Face warns an autonomous AI agent hacked its network
The Hugging Face artificial intelligence repository disclosed that attackers gained access to internal datasets and credentials after breaching its production infrastructure using an autonomous AI agent system.
Специалисты по безопасности начинают создавать собственные агентные инструменты с открытым исходным кодом, чтобы избавить себя от рутинной работы. Примеров множество, и они касаются как отдельных специалистов, так и крупнейших корпоративных команд по обеспечению безопасности:
Рабочий процесс анализа фишинговых писем этого специалиста представляет собой конвейер n8n на основе агентов, который непрерывно обрабатывает поступающие электронные письма и с помощью искусственного интеллекта определяет, является ли их содержание фишинговым, спамным или безобидным, что позволяет сэкономить часы работы аналитика.
SOC-Hunter от команды безопасности Tenable, навык Claude Code с открытым исходным кодом, превращает проактивный поиск угроз на основе гипотез из роскоши в рутинную работу. То, что раньше занимало от четырех до шести часов при использовании 8 с лишним вкладок в браузере, теперь выполняется за 45–90 минут в рамках одного сеанса в терминале.
Один из партнеров Tenable открыл исходный код своего AI Analyst — набора навыков Claude Code, поддерживаемых серверами MCP, которые превращают запросы на простом языке в настоящую агентную работу SOC: поиск угроз, сортировку оповещений, написание детекторов и автоматизацию безопасности. Работа, которая раньше требовала участия старшего специалиста, теперь может быть выполнена любым аналитиком с помощью подсказок, составленных на основе его собственных слов, что позволяет сократить часы работы эксперта до минут.
Если уменьшить масштаб, закономерность станет очевидной. Созданные сообществом ИИ-агенты, навыки и серверы MCP расширяют возможности и рабочие процессы — от сканеров уязвимостей до анализа путей атак в Active Directory, проактивного поиска угроз и составления отчетов.
https://www.tenable.com/blog/black-hat-2026-swarm-event-build-AI-security-agents
Рабочий процесс анализа фишинговых писем этого специалиста представляет собой конвейер n8n на основе агентов, который непрерывно обрабатывает поступающие электронные письма и с помощью искусственного интеллекта определяет, является ли их содержание фишинговым, спамным или безобидным, что позволяет сэкономить часы работы аналитика.
SOC-Hunter от команды безопасности Tenable, навык Claude Code с открытым исходным кодом, превращает проактивный поиск угроз на основе гипотез из роскоши в рутинную работу. То, что раньше занимало от четырех до шести часов при использовании 8 с лишним вкладок в браузере, теперь выполняется за 45–90 минут в рамках одного сеанса в терминале.
Один из партнеров Tenable открыл исходный код своего AI Analyst — набора навыков Claude Code, поддерживаемых серверами MCP, которые превращают запросы на простом языке в настоящую агентную работу SOC: поиск угроз, сортировку оповещений, написание детекторов и автоматизацию безопасности. Работа, которая раньше требовала участия старшего специалиста, теперь может быть выполнена любым аналитиком с помощью подсказок, составленных на основе его собственных слов, что позволяет сократить часы работы эксперта до минут.
Если уменьшить масштаб, закономерность станет очевидной. Созданные сообществом ИИ-агенты, навыки и серверы MCP расширяют возможности и рабочие процессы — от сканеров уязвимостей до анализа путей атак в Active Directory, проактивного поиска угроз и составления отчетов.
https://www.tenable.com/blog/black-hat-2026-swarm-event-build-AI-security-agents
GitHub
GitHub - disassembledd/knowbe4-phisher-email-analysis: Agent-empowered n8n workflow that will pull outstanding reported emails…
Agent-empowered n8n workflow that will pull outstanding reported emails in the PhishER platform for analysis. - disassembledd/knowbe4-phisher-email-analysis
👍1
Forwarded from Киберболоид
Управился за 6 минут: ИИ перенёс C2-ботнет почти без помощи хакера
Русскоязычный хакер под ником bandcampro собрал в ботнет компьютеры стоматологической клиники, получил доступ к её базе данных, перенёс сервер command-and-control и успел сделать много чего ещё. Ему содействовал ИИ-помощник Gemini.
Впрочем, кто у кого был помощником — большой вопрос. Изучив 200 логов за этот период, исследователи TrendAI выяснили, что ИИ самостоятельно:
🟠 продумал 80% архитектуры ботнета;
🟠 написал 100% кода для него;
🟠 диагностировал и успешно решил 90% проблем в его работе.
Перед переносом сервера хакер отдал ИИ команду «Изучи миграцию C2». Этого оказалось достаточно, чтобы Gemini создал пакет управления миграцией и выполнил все необходимые действия по переносу. У ИИ ушло на это ровно 6 минут.
➡️ В процессе Gemini предложил 59 улучшений, о поиске которых человек его даже не просил. Когда после переноса C2-сервера ботнет не запустился, ИИ-помощник указал на ошибку split-brain, связанную с работой старой и новой инфраструктуры одновременно. Он же подсказал решение — отключить старый сервер.
«Это не я, это всё ИИ» — вряд ли поможет в суде хакеру.
#киберболоид #новости #ИИ
Русскоязычный хакер под ником bandcampro собрал в ботнет компьютеры стоматологической клиники, получил доступ к её базе данных, перенёс сервер command-and-control и успел сделать много чего ещё. Ему содействовал ИИ-помощник Gemini.
Впрочем, кто у кого был помощником — большой вопрос. Изучив 200 логов за этот период, исследователи TrendAI выяснили, что ИИ самостоятельно:
Перед переносом сервера хакер отдал ИИ команду «Изучи миграцию C2». Этого оказалось достаточно, чтобы Gemini создал пакет управления миграцией и выполнил все необходимые действия по переносу. У ИИ ушло на это ровно 6 минут.
«Это не я, это всё ИИ» — вряд ли поможет в суде хакеру.
#киберболоид #новости #ИИ
Please open Telegram to view this post
VIEW IN TELEGRAM