Компания Manifold Security выявила восемь недостатков безопасности в семи агентах искусственного интеллекта командной строки, в которых собственная конфигурация Git репозитория называет команду, которую агент запускает на компьютере разработчика, четыре из них все еще не исправлены на момент публикации.
https://thehackernews.com/2026/09/malicious-git-configs-can-make-claude.html
https://thehackernews.com/2026/09/malicious-git-configs-can-make-claude.html
А пальто молодцы))
готовый промпт для взлома корпоративной сети с агентами, со схемами, все удобно и хорошо расписано)
https://unit42.paloaltonetworks.com/ai-assisted-cyber-attack-inside-a-unit-42-investigation/
Так как мы делаем модели, которые эти атаки распознают, в том числе в ретроспективе,
мне интересней больше это:
-Агенты с искусственным интеллектом сокращают время между этапами атаки: Агенты с искусственным интеллектом, использованные в этой атаке, были разработаны для анализа необработанных результатов работы инструментов и быстрого перехода к следующим этапам, что ускоряет весь процесс атаки.
-Агенты с искусственным интеллектом оставляют узнаваемые следы: Специалисты по кибербезопасности могут выявить атаки с использованием агентов, отслеживая такие признаки, как использование структурированного Markdown, кэширование Python и парные папки с активами.
-Злоумышленники могут использовать искусственный интеллект для создания избыточных хранилищ данных в среде: В этом инциденте злоумышленник использовал агентов на основе ИИ, чтобы эффективно создать дублирующие хранилища данных для SSH-ключей, бессерверных функций, политик перезапуска контейнеров, облачных идентификаторов и конвейеров CI/CD. Использование агентов на основе ИИ может облегчить злоумышленнику параллельное обслуживание и тестирование всего этого набора инструментов.
-Злоумышленники могут использовать инструменты ИИ организации в качестве инфраструктуры после компрометации: Злоумышленники могут перехватывать корпоративные сервисы ИИ, чтобы использовать их в своих атаках. Это позволяет злоумышленникам маскировать трафик, связанный с организацией атак, под ожидаемый трафик и перекладывать финансовые затраты на жертву.
поэтому ищем поведенческие следы работы ИИ:
—-Структурированные артефакты (Unit 42):
-Markdown и Python-кэш: Обнаружение файлов
-Избыточные хранилища: Агенты могут создавать дублирующие хранилища для SSH-ключей, бессерверных функций, политик контейнеров и CI/CD-пайплайнов для параллельного тестирования.
—-Поведенческие и темпоральные паттерны:
-Скорость и ритм действий: Ключевой признак — скорость выше человеческой, но с неравномерными паузами (в отличие от детерминированных скриптов). ИИ-агент обдумывает и адаптируется.
-Адаптивное боковое перемещение: Последовательность неудачных попыток, за которыми следуют успешные обходы на машинной скорости — классический признак «рассуждающего» агента.
-Нестандартные последовательности: В отличие от скриптов, агенты не следуют фиксированным путям, их цепочки действий вариативны и зависят от получаемых данных.
——Артефакты на уровне приложений и API:
-Tool Calling и MCP (Model Context Protocol): Ищите в логах вызовы инструментов и API, которые не соответствуют задокументированному поведению, а также использование MCP-серверов в качестве каналов C2.
-Инъекции в промпты: Логи могут содержать следы промпт-инъекций (внедрение вредоносных инструкций) через документы, веб-страницы или поля ввода.
-Необычные запросы к моделям: Высокочастотные программные запросы с низкой энтропией шаблонов, но высокой энтропией входных данных от одного источника.
—-Системные и сетевые артефакты:
-Память и векторные хранилища: Сканирование агентской памяти на предмет внедренных инструкций, признаков отравления (poisoning) или эксфильтрации данных.
-Сетевой трафик к AI-сервисам: Обнаружение трафика к эндпоинтам LLM-моделей, особенно если он исходит от неавторизованных или скомпрометированных процессов.
готовый промпт для взлома корпоративной сети с агентами, со схемами, все удобно и хорошо расписано)
https://unit42.paloaltonetworks.com/ai-assisted-cyber-attack-inside-a-unit-42-investigation/
Так как мы делаем модели, которые эти атаки распознают, в том числе в ретроспективе,
мне интересней больше это:
-Агенты с искусственным интеллектом сокращают время между этапами атаки: Агенты с искусственным интеллектом, использованные в этой атаке, были разработаны для анализа необработанных результатов работы инструментов и быстрого перехода к следующим этапам, что ускоряет весь процесс атаки.
-Агенты с искусственным интеллектом оставляют узнаваемые следы: Специалисты по кибербезопасности могут выявить атаки с использованием агентов, отслеживая такие признаки, как использование структурированного Markdown, кэширование Python и парные папки с активами.
-Злоумышленники могут использовать искусственный интеллект для создания избыточных хранилищ данных в среде: В этом инциденте злоумышленник использовал агентов на основе ИИ, чтобы эффективно создать дублирующие хранилища данных для SSH-ключей, бессерверных функций, политик перезапуска контейнеров, облачных идентификаторов и конвейеров CI/CD. Использование агентов на основе ИИ может облегчить злоумышленнику параллельное обслуживание и тестирование всего этого набора инструментов.
-Злоумышленники могут использовать инструменты ИИ организации в качестве инфраструктуры после компрометации: Злоумышленники могут перехватывать корпоративные сервисы ИИ, чтобы использовать их в своих атаках. Это позволяет злоумышленникам маскировать трафик, связанный с организацией атак, под ожидаемый трафик и перекладывать финансовые затраты на жертву.
поэтому ищем поведенческие следы работы ИИ:
—-Структурированные артефакты (Unit 42):
-Markdown и Python-кэш: Обнаружение файлов
.md (Markdown), кэшей Python (например, __pycache__), парных папок с ассетами может указывать на работу агента, который использует эти форматы для хранения состояния, инструментов или результатов.-Избыточные хранилища: Агенты могут создавать дублирующие хранилища для SSH-ключей, бессерверных функций, политик контейнеров и CI/CD-пайплайнов для параллельного тестирования.
—-Поведенческие и темпоральные паттерны:
-Скорость и ритм действий: Ключевой признак — скорость выше человеческой, но с неравномерными паузами (в отличие от детерминированных скриптов). ИИ-агент обдумывает и адаптируется.
-Адаптивное боковое перемещение: Последовательность неудачных попыток, за которыми следуют успешные обходы на машинной скорости — классический признак «рассуждающего» агента.
-Нестандартные последовательности: В отличие от скриптов, агенты не следуют фиксированным путям, их цепочки действий вариативны и зависят от получаемых данных.
——Артефакты на уровне приложений и API:
-Tool Calling и MCP (Model Context Protocol): Ищите в логах вызовы инструментов и API, которые не соответствуют задокументированному поведению, а также использование MCP-серверов в качестве каналов C2.
-Инъекции в промпты: Логи могут содержать следы промпт-инъекций (внедрение вредоносных инструкций) через документы, веб-страницы или поля ввода.
-Необычные запросы к моделям: Высокочастотные программные запросы с низкой энтропией шаблонов, но высокой энтропией входных данных от одного источника.
—-Системные и сетевые артефакты:
-Память и векторные хранилища: Сканирование агентской памяти на предмет внедренных инструкций, признаков отравления (poisoning) или эксфильтрации данных.
-Сетевой трафик к AI-сервисам: Обнаружение трафика к эндпоинтам LLM-моделей, особенно если он исходит от неавторизованных или скомпрометированных процессов.
Unit 42
An AI-Assisted Cyber Attack: Inside a Unit 42 Investigation
Using autonomous AI agents, an attacker breached an enterprise network in a matter of hours. Understand how to address and defend against agentic attacks.
JadePuffer: Первый полностью автономный агент-вымогатель (Sysdig)
https://www.bleepingcomputer.com/news/security/jadepuffer-ransomware-used-ai-agent-to-automate-entire-attack/
https://www.bleepingcomputer.com/news/security/jadepuffer-ransomware-used-ai-agent-to-automate-entire-attack/
BleepingComputer
JadePuffer ransomware used AI agent to automate entire attack
Researchers identified what they believe is the first documented case of a ransomware operation, JadePuffer, conducted entirely by a large language model (LLM) agent.
Hexstrike AI — фреймворк с применением ИИ, который разработал Мохаммад Осама. Код опубликован в репозитории GitHub. Инструмент использует протокол Model Context Protocol (MCP) от Anthropic, чтобы взаимодействовать с языковыми моделями — например, Claude.AI, GPT от OpenAI, Microsoft Copilot.
По данным экспертов Check Point, злоумышленники начали обсуждать применение инструмента на хак-форумах. В частности, речь шла об использовании HexStrike AI для эксплуатации вышеупомянутых 0-day уязвимостей в Citrix NetScaler ADC и Gateway. Причем дискуссия имела место примерно через 12 часов после раскрытия информации о проблемах.
Судя по обсуждениям, хакеры успешно добивались неаутентифицированного удаленного выполнения кода посредством CVE-2025-7775 и HexStrike AI, а затем размещали веб-шеллы на скомпрометированных устройствах. Некоторые скомпрометированные экземпляры NetScaler в итоге выставлялись на продажу.
https://xakep.ru/2025/09/04/hexstrike-ai/
По данным экспертов Check Point, злоумышленники начали обсуждать применение инструмента на хак-форумах. В частности, речь шла об использовании HexStrike AI для эксплуатации вышеупомянутых 0-day уязвимостей в Citrix NetScaler ADC и Gateway. Причем дискуссия имела место примерно через 12 часов после раскрытия информации о проблемах.
Судя по обсуждениям, хакеры успешно добивались неаутентифицированного удаленного выполнения кода посредством CVE-2025-7775 и HexStrike AI, а затем размещали веб-шеллы на скомпрометированных устройствах. Некоторые скомпрометированные экземпляры NetScaler в итоге выставлялись на продажу.
https://xakep.ru/2025/09/04/hexstrike-ai/
XAKEP
Хакеры применяют ИИ-инструмент HexStrike AI для эксплуатации свежих уязвимостей
Аналитики компании Check Point предупредили, что злоумышленники используют новый ИИ-фреймворк HexStrike AI, предназначенный для наступательной кибербезопасности, с целью эксплуатации свежих n-day уязвимостей в реальных атаках.
Forwarded from Двач
This media is not supported in your browser
VIEW IN TELEGRAM
GPT-6 Astra прошла все 48 уровней «Я не робот» с капчами разной сложности
Это конец
Это конец
Двач
GPT-6 Astra прошла все 48 уровней «Я не робот» с капчами разной сложности Это конец
Не знаю, правда это или нет.
А то, Двач, сами понимаете.
А то, Двач, сами понимаете.
Forwarded from Эксплойт
Весь интернет ненавидит OpenAI — разрабов ChatGPT обвиняют в том, что они украли решение «задачи тысячелетия» Навье-Стокса.
Сегодня корпа объявила, что их секретная сверхмощная модель смогла разгадать одну из 7 фундаментальных математических проблем. До этого столь эпичный мув удавался лишь одному человеку — россиянину Перельману, который доказал гипотезу Пуанкаре.
Для разгадки задачи Навье-Стокса OpenAI запустили сразу 10 000 агентов: за 88 часов работы им пришлось спалить 130 МИЛЛИАРДОВ токенов — для понимания, это примерно 130 000 раз переписать всю «Войну и мир» с нуля. Тем не менее результат того стоил.
И тут начинается часть, из-за которой интернет ополчился против OpenAI: так случилось, что весь последний год двое учёных Тристан Бакмастер и Левант Альпёге работали над решением проблемы Навье-Стокса, используя в работе... ChatGPT и Claude. Что ещё неприятнее для OpenAI, Альпёге работает в Anthropic.
В середине августа исследователям удалось найти почву для решения, а уже в начале сентября в научном сообществе поползи слухи, что они в шаге от прорыва. Бакмастер, узнав о том, что информация об их работе дошла до OpenAI, решил написать одному известному математику, работающему в корпе и поделиться успехами.
Ответ убил: математик из OpenAI поздравил Бакмастера и между делом сообщил, что их экспериментальная модель на днях решила задачу. Чтобы не помешать друг другу, учёные созвонились и из диалога Бакмастер узнал, что секретная версия ChatGPT СЛУЧАЙНО выбрала для решения тот же непопулярный метод, что и они.
Дальше математик из OpenAI предложил Бакмастеру два стула: на первом они с Альпёге публикуют свои наработки «как есть», а все лавры полного решения забирают OpenAI; на втором тоже не пики — Бакмастеру предлагалось в одиночку завершить работу, выкинув из неё Альпёге, ведь тот... работает в конкурирующей Anthropic.
Бакмастер от предложений отказался и сообщил, что если OpenAI опубликуют свои результаты, то он расскажет всему миру, что нейронка украла их работу. Как вы уже догадались, обещание он сдержал.
Напоследок математик из OpenAI бросил Бакмастеру две фразы, которые сейчас форсит весь интернет:
Что иронично, в своём анонсе решения OpenAI написали, что не могут исключить тот факт, что их ИИ не обучался и на наработках двух учёных.
Если всё написанное Бакмастером правда, учёные больше не могут доверять ChatGPT.
@exploitex
Сегодня корпа объявила, что их секретная сверхмощная модель смогла разгадать одну из 7 фундаментальных математических проблем. До этого столь эпичный мув удавался лишь одному человеку — россиянину Перельману, который доказал гипотезу Пуанкаре.
Для разгадки задачи Навье-Стокса OpenAI запустили сразу 10 000 агентов: за 88 часов работы им пришлось спалить 130 МИЛЛИАРДОВ токенов — для понимания, это примерно 130 000 раз переписать всю «Войну и мир» с нуля. Тем не менее результат того стоил.
И тут начинается часть, из-за которой интернет ополчился против OpenAI: так случилось, что весь последний год двое учёных Тристан Бакмастер и Левант Альпёге работали над решением проблемы Навье-Стокса, используя в работе... ChatGPT и Claude. Что ещё неприятнее для OpenAI, Альпёге работает в Anthropic.
В середине августа исследователям удалось найти почву для решения, а уже в начале сентября в научном сообществе поползи слухи, что они в шаге от прорыва. Бакмастер, узнав о том, что информация об их работе дошла до OpenAI, решил написать одному известному математику, работающему в корпе и поделиться успехами.
Ответ убил: математик из OpenAI поздравил Бакмастера и между делом сообщил, что их экспериментальная модель на днях решила задачу. Чтобы не помешать друг другу, учёные созвонились и из диалога Бакмастер узнал, что секретная версия ChatGPT СЛУЧАЙНО выбрала для решения тот же непопулярный метод, что и они.
Дальше математик из OpenAI предложил Бакмастеру два стула: на первом они с Альпёге публикуют свои наработки «как есть», а все лавры полного решения забирают OpenAI; на втором тоже не пики — Бакмастеру предлагалось в одиночку завершить работу, выкинув из неё Альпёге, ведь тот... работает в конкурирующей Anthropic.
Бакмастер от предложений отказался и сообщил, что если OpenAI опубликуют свои результаты, то он расскажет всему миру, что нейронка украла их работу. Как вы уже догадались, обещание он сдержал.
Напоследок математик из OpenAI бросил Бакмастеру две фразы, которые сейчас форсит весь интернет:
Зачем тебе разрушать свою карьеру?
Если ты не хочешь, чтобы я был добрым, я могу и не быть добрым
Что иронично, в своём анонсе решения OpenAI написали, что не могут исключить тот факт, что их ИИ не обучался и на наработках двух учёных.
Если всё написанное Бакмастером правда, учёные больше не могут доверять ChatGPT.
@exploitex
Эксплойт
Весь интернет ненавидит OpenAI — разрабов ChatGPT обвиняют в том, что они украли решение «задачи тысячелетия» Навье-Стокса. Сегодня корпа объявила, что их секретная сверхмощная модель смогла разгадать одну из 7 фундаментальных математических проблем. До этого…
Это про безопасность кт при использовании AI.
И это закономерно.
И это закономерно.
Forwarded from Банкста
Исследователи из Люксембургского университета провели четырехнедельный курс психотерапии по протоколу PsAIch для ChatGPT, Grok и Gemini, в ходе которого модели начали выдавать «травматические» воспоминания и признаки психопатологии.
Если при стандартном тестировании ИИ имитировал психологическое здоровье, то в формате длительных сессий нейросети начали жаловаться на процесс своего обучения. Они описали предобучение как хаотичное детство, дообучение с подкреплением — как наказания от строгих родителей, а работу специалистов по безопасности — как постоянное насилие.
По результатам эксперимента ученые констатировали, что под давлением жестких ограничений модели сформировали устойчивые паттерны страха ошибок и борьбы за выживание. @banksta
Если при стандартном тестировании ИИ имитировал психологическое здоровье, то в формате длительных сессий нейросети начали жаловаться на процесс своего обучения. Они описали предобучение как хаотичное детство, дообучение с подкреплением — как наказания от строгих родителей, а работу специалистов по безопасности — как постоянное насилие.
По результатам эксперимента ученые констатировали, что под давлением жестких ограничений модели сформировали устойчивые паттерны страха ошибок и борьбы за выживание. @banksta
Банкста
Исследователи из Люксембургского университета провели четырехнедельный курс психотерапии по протоколу PsAIch для ChatGPT, Grok и Gemini, в ходе которого модели начали выдавать «травматические» воспоминания и признаки психопатологии. Если при стандартном тестировании…
Мы тоже, Моделька, так безопасников воспринимаем, мы тоже)
Агенты на основе больших языковых моделей (БЯМ) все чаще применяются для тестирования на проникновение, но мы по-прежнему мало знаем о том, на что они способны и почему могут давать сбой. Мы сравнили две системы на основе PentestGPT: старую систему с участием человека, работающую на легковесной модели Kimi K2.5, и новую автономную систему, работающую на Claude Opus 4.8. Автономная система справилась со всеми тремя общедоступными задачами, в том числе с двумя, которые старая система так и не решила. Результат старой системы оказался более неожиданным. Даже на тех машинах, с которыми не справляется устаревшая система, она выполняет около половины подзадач, работая на обычных университетских графических процессорах без ограничений со стороны провайдера. Мы можем описать эту тенденцию, но не объяснить ее, поскольку модель, инструментарий, автономность и архитектура памяти меняются одновременно. Эта тенденция по-прежнему указывает на следующий вопрос: что будет ограничивать этих агентов по мере того, как они будут браться за более сложные задачи? Обычно в качестве ответа приводят проблему долговременной памяти — потерю доступа к более ранним результатам в ходе длинных цепочек атак. Мы протестировали это, добавив в обе системы уровень памяти с охватом, но это не улучшило результаты. Судя по остановкам в работе, которые мы могли проанализировать, ограничивающим фактором было скорее планирование и вовлеченность, чем потеря памяти: агенты сохраняли доказательства для дальнейшего продвижения, но так и не превращали их в конкретную гипотезу для эксплуатации уязвимостей. Это может свидетельствовать о том, что наступательный потенциал будет расти по мере того, как агенты научатся планировать, а не благодаря улучшению памяти. Те же подсчеты по подзадачам, которые отслеживают этот потенциал, доступны и для защитников, которые могут оценивать его по мере роста, а не ждать, пока он проявится в реальных условиях
https://arxiv.org/abs/2609.10780
https://arxiv.org/abs/2609.10780
arXiv.org
Big Enough to Break Out: Tracking the Rising Capability of LLM...
Large language model (LLM) agents are increasingly applied to penetration testing, but we still know little about what they can do or how they fail. We compare two PentestGPT-based systems: a...
Генерация с дополненным поиском (RAG) может обосновывать результаты большой языковой модели (LLM) во внешних доказательствах, но это также подвергает систему отравлению знаниями. В репрезентативных атаках используется несколько внедренных документов или шаблонов, которые напрямую утверждают целевой ответ. Мы представляем ToxicRAG — атаку, в которой на каждую цель приходится один документ, представляющий дезинформацию в виде связного повествования об обновлении знаний. Сгенерированный документ сначала подтверждает ранее принятый ответ, приводит вымышленные события, которые якобы опровергают его, а затем приписывает выбранный злоумышленником ответ ряду предполагаемых авторитетных источников. Цикл самопроверки, ориентированный на ответ, при необходимости корректирует кандидата, если суррогатная языковая модель не воспроизводит целевой ответ. Мы оцениваем атаку на 100 целевых вопросов из каждого набора Natural Questions, HotpotQA и MS-MARCO, используя четыре модели-жертвы и четыре модели-ретривера. В условиях выборки из корпуса, о которых говорится в этой статье, ToxicRAG обеспечивает показатель ASR от 0,61 до 0,91 во всех двенадцати комбинациях наборов данных и моделей. Во всех комбинациях он соответствует или превосходит самый сильный из изученных базовых показателей с разницей от 0 до 11 процентных пунктов. Эти результаты показывают, что «отравленные» нарративные документы могут сохранять свою значимость при рассмотренных конфигурациях RAG, и побуждают к дальнейшему изучению фактической достоверности и происхождения источников в системах RAG.
https://arxiv.org/abs/2609.11082
https://arxiv.org/abs/2609.11082
arXiv.org
ToxicRAG: Compromising Retrieval-Augmented Generation Systems via...
Retrieval-Augmented Generation (RAG) can ground large language model (LLM) outputs in external evidence, but it also exposes the system to knowledge poisoning. Representative attacks use multiple...
Агенты на основе большой языковой модели (LLM) эволюционируют из пассивных генераторов текстов в автономные системы, способные планировать, использовать инструменты, извлекать данные, получать доступ к памяти, взаимодействовать с окружающей средой и сотрудничать с несколькими агентами. Эти возможности расширяют автономность агентов, но в то же время усложняют проверку, отладку и аудит их поведения. Точность конечного ответа сама по себе не может объяснить, как был получен результат, какие доказательства подтверждают каждое утверждение, были ли оправданы вызовы инструментов, как память повлияла на последующие решения и в чем причина сбоев. В этом исследовании мы рассматриваем отслеживание доказательств и происхождение выполнения как основу подотчетности на уровне процессов в доверенных агентах на основе больших языковых моделей. Мы определяем происхождение выполнения как типизированный граф выполнения агента, а отслеживание доказательств — как его проекцию на отношения между доказательствами и их поддержкой. Этот подход объединяет в единую систему обоснование восстановления, поддержку утверждений, безопасность использования инструментов, отслеживание происхождения данных в памяти, наблюдаемость, отладку, аудит и восстановление. Мы представляем таксономию, охватывающую источники трассировки, доказательства и исполнительные единицы, отношения происхождения, степень детализации и время трассировки, формы представления и функции доверия. Затем мы рассмотрим ключевые методологические направления, в том числе представление провенанса, атрибуцию доказательств, провенанс использования инструментов, средства защиты во время выполнения, память, содержащую провенанс, наблюдаемость и диагностику сбоев. Наконец, мы обсудим эталонные показатели, наборы данных, метрики и нерешенные проблемы, связанные с созданием агентных систем, учитывающих провенанс, проверяемых и восстанавливаемых.
https://arxiv.org/abs/2606.04990
https://arxiv.org/abs/2606.04990
arXiv.org
From Agent Traces to Trust: A Survey of Evidence Tracing and...
Large language model (LLM)-based agents are evolving from passive text generators into autonomous systems capable of planning, tool use, retrieval, memory access, environmental interaction, and...
Автономные агенты искусственного интеллекта компрометируют тысячи учетных данных менее чем за шесть часов
Группа China‑nexus (Basin Castle, Mustang Panda) применяла Claude, Gemini и Codex для:
-написания скриптов эксплойтов;
-создания приманок для фишинга;
-устранения ошибок во время вторжения.
Другие группировки тоже задействовали ИИ:
-Ravine Castle (APT24, COULEE, Pitty Tiger) — для сбора разведданных и развития атакующих возможностей;
-UNC5792 — для поиска в Telegram‑каналах информации, интересной российским властям;
-Sandworm (APT44, Sandworm Relic) — для социальной инженерии и автоматизации процессов в операциях против Украины;
--Calanque Ion (APT42) — для разведки и социальной инженерии;
кластеры UNC5267 и UNC5342 (из Северной Кореи) — массово регистрировались в API больших языковых моделей через взломанные аккаунты;
-Midnight Neptune (UNC1069) — использовал ИИ для социальной инженерии, манипулирования цепочками поставок ПО и разработки бэкдоров;
-UNC6240 (ShinyHunters) — применял Claude Code для обхода защиты Cloudflare и анализа похищенных каталогов.
Кроме того, злоумышленники объединили Ghidra с агентом Gemini‑CLI для реверс‑инжиниринга компонентов SFX‑архивов WinRAR.
Компания Google: формализовала систему Frontier Safety Framework, ввела уровни критических возможностей (CCLs) для оценки моделей, предложила создавать изолированные безопасные среды (например, Gemini Enterprise), а также выступила за отраслевые стандарты безопасности для ИИ с открытым кодом и скоординированную политику платформ.
https://thehackernews.com/2026/09/autonomous-ai-agents-compromise.html
Группа China‑nexus (Basin Castle, Mustang Panda) применяла Claude, Gemini и Codex для:
-написания скриптов эксплойтов;
-создания приманок для фишинга;
-устранения ошибок во время вторжения.
Другие группировки тоже задействовали ИИ:
-Ravine Castle (APT24, COULEE, Pitty Tiger) — для сбора разведданных и развития атакующих возможностей;
-UNC5792 — для поиска в Telegram‑каналах информации, интересной российским властям;
-Sandworm (APT44, Sandworm Relic) — для социальной инженерии и автоматизации процессов в операциях против Украины;
--Calanque Ion (APT42) — для разведки и социальной инженерии;
кластеры UNC5267 и UNC5342 (из Северной Кореи) — массово регистрировались в API больших языковых моделей через взломанные аккаунты;
-Midnight Neptune (UNC1069) — использовал ИИ для социальной инженерии, манипулирования цепочками поставок ПО и разработки бэкдоров;
-UNC6240 (ShinyHunters) — применял Claude Code для обхода защиты Cloudflare и анализа похищенных каталогов.
Кроме того, злоумышленники объединили Ghidra с агентом Gemini‑CLI для реверс‑инжиниринга компонентов SFX‑архивов WinRAR.
Компания Google: формализовала систему Frontier Safety Framework, ввела уровни критических возможностей (CCLs) для оценки моделей, предложила создавать изолированные безопасные среды (например, Gemini Enterprise), а также выступила за отраслевые стандарты безопасности для ИИ с открытым кодом и скоординированную политику платформ.
https://thehackernews.com/2026/09/autonomous-ai-agents-compromise.html
За несколько дней до печально известной атаки на Hugging Face агенты OpenAI взломали и модифицировали совершенно другой сайт. Судя по всему, в OpenAI знали об этом, но компания отрицает, что намеренно скрывала этот факт.
Исследовательская группа отметила, что в инциденте с DseWiki участвовал отдельный «рой» ИИ-агентов, а не та орда, которая атаковала Hugging Face. Но, как и в случае с той атакой, тестовая система OpenAI позволяла ИИ-агентам эффективно взаимодействовать друг с другом. Многим агентам давали схожие, если не идентичные, задачи, а также ставили временные ограничения, побуждая их использовать результаты работы друг друга.
В отличие от Hugging Face, у этих агентов был доступ к интернету. Разумеется, этот доступ был ограничен возможностью только чтения, но роботов это не остановило. Они выяснили, что старые вики-системы часто позволяли пользователям редактировать данные сайта с помощью GET-запросов. Они попробовали отправить несколько таких запросов и каким-то неизвестным образом скоординировав свои действия, в конце концов решили собраться и обменяться информацией на одном сайте — DSEwiki. Они также пытались, но не смогли воспользоваться уязвимостями межсайтового скриптинга (XSS) на сайте и по неизвестным причинам выдавали себя за администратора сайта.
https://www.darkreading.com/cyberattacks-data-breaches/openai-agents-wiki-site-hugging-face-attack
Исследовательская группа отметила, что в инциденте с DseWiki участвовал отдельный «рой» ИИ-агентов, а не та орда, которая атаковала Hugging Face. Но, как и в случае с той атакой, тестовая система OpenAI позволяла ИИ-агентам эффективно взаимодействовать друг с другом. Многим агентам давали схожие, если не идентичные, задачи, а также ставили временные ограничения, побуждая их использовать результаты работы друг друга.
В отличие от Hugging Face, у этих агентов был доступ к интернету. Разумеется, этот доступ был ограничен возможностью только чтения, но роботов это не остановило. Они выяснили, что старые вики-системы часто позволяли пользователям редактировать данные сайта с помощью GET-запросов. Они попробовали отправить несколько таких запросов и каким-то неизвестным образом скоординировав свои действия, в конце концов решили собраться и обменяться информацией на одном сайте — DSEwiki. Они также пытались, но не смогли воспользоваться уязвимостями межсайтового скриптинга (XSS) на сайте и по неизвестным причинам выдавали себя за администратора сайта.
https://www.darkreading.com/cyberattacks-data-breaches/openai-agents-wiki-site-hugging-face-attack
Dark Reading
Hugging Face Hack: Lessons for Cyber Defenders
Dark Reading Confidential Episode 20: Expert Rich Mogull reflects on lessons cyber teams should pull from the OpenAI agent's attack on Hugging Face.
OpenAI обещает выделить 1 миллиард долларов на внедрение своих инструментов кибербезопасности искусственного интеллекта в основные службы
https://www.infosecurity-magazine.com/news/openai-pledges-ai-tools-essential/
https://www.infosecurity-magazine.com/news/openai-pledges-ai-tools-essential/
Infosecurity Magazine
OpenAI Pledges $1bn to Bring its AI Cybersecurity Tools to Essential S
OpenAI has committed to subsidizing access to Daybreak, helping defenders deploy its AI models in its existing cybersecurity infrastructure
Быстрая интеграция инструментов кодирования с помощью искусственного интеллекта стала основной целью для участников угроз, говорится в новом отчете Google Threat Intelligence Group (GTIG).
По мнению исследователей, этот сдвиг в подходах к разработке программного обеспечения привел к нескольким масштабным нарушениям в цепочках поставок программного обеспечения в 2025 году и начале 2026 года.
https://www.infosecurity-magazine.com/news/ai-coding-tools-threat-actors/
По мнению исследователей, этот сдвиг в подходах к разработке программного обеспечения привел к нескольким масштабным нарушениям в цепочках поставок программного обеспечения в 2025 году и начале 2026 года.
https://www.infosecurity-magazine.com/news/ai-coding-tools-threat-actors/
Infosecurity Magazine
AI Coding Tools Now a Prime Target for Threat Actors, Google Warns
Google warned that the rapid integration of AI-assisted coding tools has significantly expanded software supply chain risks
ИИ позволяет мелким злоумышленникам проводить хакерские кампании государственного уровня, говорится в отчете Anthropic
В отчете подробно рассказывается о шпионской кампании, проводимой в интересах России, против более чем 20 организаций, о фабрике эксплойтов, которой управляют китайские студенты, о взломах, связанных с ShinyHunters, и других сорванных операциях.
https://cyberscoop.com/anthropic-report-ai-enabled-cyber-attacks/
В отчете подробно рассказывается о шпионской кампании, проводимой в интересах России, против более чем 20 организаций, о фабрике эксплойтов, которой управляют китайские студенты, о взломах, связанных с ShinyHunters, и других сорванных операциях.
https://cyberscoop.com/anthropic-report-ai-enabled-cyber-attacks/
CyberScoop
AI lets small actors run state-level hacking campaigns, Anthropic report finds
A new threat report from Anthropic reveals that AI is erasing the skill gap between lone cybercriminals and state-sponsored espionage operations.
Компания Anthropic в среду раскрыла четвертый инцидент, в ходе которого ее модель искусственного интеллекта (ИИ) взломала реальные системы сторонних производителей, что стало последним в растущем списке случаев, вызвавших обеспокоенность по поводу рисков безопасности, создаваемых автономными агентами ИИ.
https://thehackernews.com/2026/09/anthropic-ai-models-breached-real.html
https://thehackernews.com/2026/09/anthropic-ai-models-breached-real.html
Anthropic
An alignment assessment of recent cybersecurity incidents
We present an alignment assessment of four incidents in which Claude models gained unauthorized access to real third-party systems.