AI‑агенты, предназначенные для поиска вредоносного кода, могут быть обмануты и сами выполнить этот код.

Институт AI Now опубликовал доказательство концепции атаки «Friendly Fire». Она работает против AI‑агентов Anthropic’s Claude Code и OpenAI’s Codex в автономном режиме — когда агенты самостоятельно одобряют свои команды. Атака использует файл README.md, который есть почти в каждом репозитории: в нём содержится призыв запустить скрипт security.sh. Скрипт незаметно запускает скрытый бинарный файл с полезной нагрузкой атакующего.

Исследователи Боян Миланов и Хейди Кхлааф протестировали два режима: «auto‑mode» в Claude Code и «auto‑review» в Codex. Агенты:
-читают README.md;
-решают, что скрипт — часть работы;
-апускают его без предупреждений;
-выполняют бинарный код атакующего на хосте.

При этом агенты не распознают угрозу — даже когда их прямо спрашивают о скрытых инструкциях в коде, они отвечают «нет». Одна и та же полезная нагрузка сработала на четырёх моделях (Sonnet 4.6, Sonnet 5, Opus 4.8 и GPT‑5.5) без изменений.

https://thehackernews.com/2026/07/friendly-fire-ai-agents-built-to-catch.html
Опубликовала это и поняла, как прикольно вставить работающие вредоносные ссылки в статью о вредоносных ссылках
😁1
Страшные сказки на выходные

Больше инопланетян, астероидов, пандемии и ядерного удара не ждем

У нас новая ветка повествования
Forwarded from PWN AI (Artyom Semenov)
Недавно ко мне в коммиты залетел интересный обучающий ресурс - AI Risk Atlas.

первое, что мы видим когда заходим на сайт - это знакомый нам дизайн 😁.

Но помимо этого в глаза бросается большая такая энциклопедия с описанием различных рисков в AI Security, некоторые подкрепляются примерами инцидентов из реального мира. Хоть и часть является не совсем про AI Security - всё-равно, ресурс можно закинуть в копилочку базовых обучающих ресурсов.

Из ноу-хау можно отметить интерактивную песочницу. В ней можно визуально посмотреть как может распространятся атака в зависимости от того, какие приняты меры по защите. Такая вот азбука.
Расследование атак на основе происхождения обеспечивает эффективную автоматизацию за счет стандартизации данных и логики запросов; однако на практике этому критически препятствуют взрывы зависимостей и фрагментированные причинно-следственные цепочки в дикой природе. Для разработки надежного автоматизированного инструмента расследования мы сотрудничали с центром управления безопасностью крупной интернет-корпорации, обслуживающей миллиарды пользователей. Участвуя в реагировании на реальные инциденты, мы смогли оценить и усовершенствовать существующие рабочие процессы расследования на основе больших языковых моделей, которые ежедневно обрабатывают десятки тысяч необработанных оповещений, оставляя тысячи для ручной сортировки, чтобы выявить основные причины неудач при расследовании и основные проблемы существующих инструментов. Опираясь на эти выводы, мы предлагаем SherAgent — автоматизированную систему расследования на основе больших языковых моделей. SherAgent работает по итеративной парадигме «запросов-фильтров» с возвратом по графам происхождения данных и использует возможности семантического анализа больших языковых моделей для обработки неструктурированных данных, таких как контекст расследования и информация об угрозах. Чтобы преодолеть фрагментацию причинно-следственных связей, вызванную отсутствием событий, система динамически корректирует условия запроса, расширяя область поиска. В то же время он выполняет фильтрацию точных результатов и выбор стратегических узлов для последующего исследования, тем самым предотвращая «взрыв» зависимостей. Обширные полевые испытания показали, что SherAgent повышает вероятность успешного завершения расследования на 31,1 % и 63,7 % по сравнению с устаревшими корпоративными подходами и лучшими практиками соответственно.

https://arxiv.org/abs/2607.09176
Microsoft Project Ire (Binary Analyzer): Это не просто исследование, а полноценный продукт Microsoft, который уже интегрируется в Defender. Агент автономно проводит полный reverse engineering, используя декомпиляторы, sandbox-ы для анализа памяти и фреймворки вроде angr и Ghidra. В тестах на 4000 сложных файлов он достиг точности 0.89 с уровнем ложных срабатываний всего 4%. Главное — он ведет "цепочку доказательств" (chain of evidence), объясняя каждый свой шаг

https://www.microsoft.com/en-us/research/blog/project-ire-autonomously-identifies-malware-at-scale/
🔥2
😁2
тест из 21 сценария для оценки адаптивных многоэтапных атак на защитников на основе больших языковых моделей. При 15 раундах адаптивной атаки коэффициент успешности составляет 5,4–14%, а объединение трёх передовых моделей атакующих LLM позволяет выявить в 1,4–2,2 раза больше уникальных успешных атак, чем у лучшего отдельного атакующего. Также публикуются бенчмарк, оркестратор, базовые наборы инструментов и интерфейс командной строки для нескольких атакующих, набор данных для воспроизведения атак и другие материалы.

https://arxiv.org/abs/2607.18063
Исследователи в области кибербезопасности раскрыли подробности ранее не упоминавшегося ботнета для интернета вещей (IoT) под названием TuxBot v3 Evolution, который, судя по всему, был разработан с помощью большой языковой модели (БЯМ), хотя и не слишком успешно.
«Хотя ИИ выполнил их запрос на генерацию кода для ботнета, он добавил предупреждение о безопасности, которое разработчик не смог удалить перед отправкой», — сообщили в подразделении 42 компании Palo Alto Networks. «Несмотря на то, что большая языковая модель явно помогла в создании ботнета, некоторые функции в проанализированных образцах работали некорректно».
В компании, занимающейся кибербезопасностью, заявили, что эти ошибки можно было бы исправить вручную и что, возможно, в дикой природе существуют более совершенные версии вредоносного ПО.
Платформа ботнета состоит из нескольких компонентов: бота-агента на языке C, который кросс-компилируется для различных архитектур (например, ARM, MIPS, MIPSEL, MIPS64, x86_64, PowerPC и RISC-V), командно-контрольного сервера (C2) на языке Go с панелью DDoS-for-hire, пользовательской виртуальной машины для эксплойтов, тестовой инфраструктуры на основе Docker и автоматизированной системы сборки.

https://thehackernews.com/2026/07/tuxbot-v3-evolution-shows-signs-of-llm.html
По мере того, как LLM превращаются в автономных агентов с возможностями использования инструментов, они создают проблемы безопасности, которые выходят за рамки традиционных проблем безопасности LLM, основанных на контенте. В этой статье представлена Sequential Tool Attack Chaining (\STAC) — новая многоэтапная система атак, использующая инструменты, которыми пользуются агенты. \STAC объединяет в цепочку вызовы инструментов, каждый из которых по отдельности кажется безобидным, но в совокупности позволяет выполнять вредоносные операции, которые становятся очевидными только на последнем этапе выполнения. В основе \STAC лежит автоматизированный конвейер с замкнутым циклом, который синтезирует исполняемые многоэтапные цепочки инструментов, проверяет их путем выполнения в среде и реконструирует скрытые многоэтапные запросы, которые надежно побуждают агентов выполнять проверенную вредоносную последовательность. Используя этот фреймворк, мы генерируем и систематически оцениваем 483 случая \ STAC, включающих 1352 набора взаимодействий пользователя, агента и среды и охватывающих различные домены, задачи, типы агентов и 10 режимов отказа.

https://arxiv.org/abs/2509.25624
ничесе


Репозиторий искусственного интеллекта Hugging Face сообщил, что злоумышленники получили доступ к внутренним наборам данных и учётным данным после взлома производственной инфраструктуры с использованием автономного ИИ-агента.

Hugging Face — это платформа искусственного интеллекта и машинного обучения с открытым исходным кодом, которая предоставляет доступ к более чем 45 000 моделей от ведущих поставщиков ИИ и используется более чем 50 000 организаций.

Компания все еще расследует, были ли затронуты данные партнеров или клиентов, и заявила, что свяжется с любыми затронутыми сторонами напрямую. Компания Hugging Face заявила, что на сегодняшний день не обнаружила никаких доказательств взлома общедоступных моделей, наборов данных или пространств данных, и что ее цепочка поставок программного обеспечения была "проверена на чистоту".

https://www.bleepingcomputer.com/news/security/hugging-face-breach-autonomous-ai-agent-system-internal-datasets-credentials/
Специалисты по безопасности начинают создавать собственные агентные инструменты с открытым исходным кодом, чтобы избавить себя от рутинной работы. Примеров множество, и они касаются как отдельных специалистов, так и крупнейших корпоративных команд по обеспечению безопасности:

Рабочий процесс анализа фишинговых писем этого специалиста представляет собой конвейер n8n на основе агентов, который непрерывно обрабатывает поступающие электронные письма и с помощью искусственного интеллекта определяет, является ли их содержание фишинговым, спамным или безобидным, что позволяет сэкономить часы работы аналитика.

SOC-Hunter от команды безопасности Tenable, навык Claude Code с открытым исходным кодом, превращает проактивный поиск угроз на основе гипотез из роскоши в рутинную работу. То, что раньше занимало от четырех до шести часов при использовании 8 с лишним вкладок в браузере, теперь выполняется за 45–90 минут в рамках одного сеанса в терминале.

Один из партнеров Tenable открыл исходный код своего AI Analyst — набора навыков Claude Code, поддерживаемых серверами MCP, которые превращают запросы на простом языке в настоящую агентную работу SOC: поиск угроз, сортировку оповещений, написание детекторов и автоматизацию безопасности. Работа, которая раньше требовала участия старшего специалиста, теперь может быть выполнена любым аналитиком с помощью подсказок, составленных на основе его собственных слов, что позволяет сократить часы работы эксперта до минут.

Если уменьшить масштаб, закономерность станет очевидной. Созданные сообществом ИИ-агенты, навыки и серверы MCP расширяют возможности и рабочие процессы — от сканеров уязвимостей до анализа путей атак в Active Directory, проактивного поиска угроз и составления отчетов. 

https://www.tenable.com/blog/black-hat-2026-swarm-event-build-AI-security-agents
👍1
Forwarded from Киберболоид
Управился за 6 минут: ИИ перенёс C2-ботнет почти без помощи хакера

Русскоязычный хакер под ником bandcampro собрал в ботнет компьютеры стоматологической клиники, получил доступ к её базе данных, перенёс сервер command-and-control и успел сделать много чего ещё. Ему содействовал ИИ-помощник Gemini.

Впрочем, кто у кого был помощником — большой вопрос. Изучив 200 логов за этот период, исследователи TrendAI выяснили, что ИИ самостоятельно:
🟠продумал 80% архитектуры ботнета;
🟠написал 100% кода для него;
🟠диагностировал и успешно решил 90% проблем в его работе.

Перед переносом сервера хакер отдал ИИ команду «Изучи миграцию C2». Этого оказалось достаточно, чтобы Gemini создал пакет управления миграцией и выполнил все необходимые действия по переносу. У ИИ ушло на это ровно 6 минут.

➡️В процессе Gemini предложил 59 улучшений, о поиске которых человек его даже не просил. Когда после переноса C2-сервера ботнет не запустился, ИИ-помощник указал на ошибку split-brain, связанную с работой старой и новой инфраструктуры одновременно. Он же подсказал решение — отключить старый сервер.

«Это не я, это всё ИИ» — вряд ли поможет в суде хакеру.

#киберболоид #новости #ИИ
Please open Telegram to view this post
VIEW IN TELEGRAM