Правила_безопасности_работы_с_ИИ_для_подростков_гуманитариев.docx
18.1 KB
Бывает, что у родителей технарей получается ребенок-гуманитарий.
И он не ленивый и не глупый, математику ему объяснили 5 преподавателей.
Моя дочь использует ИИ (в этой статье будет много упрощений и допущений) для уроков,
и для сценариев для своих мультфильмов.
Режиссер мультипликации идет к своей мечте)
Ко мне обращаются другие дети и их родители что-то посоветовать, как использовать ИИ для учебы.
И родился этот документ.
Для детей-технарей не стоит вопроса разобраться с новой увлекательной штукой,
мне кажется, они в 13 лет повторяют за Карпатым собрать свой chatgpt3.5 на папином ноутбуке с GPU.
А у гуманитариев все сложнее.
Они романтизируют.
И будет очень страшно, если у нас лет через 10 все будут говорить, как ИИ.
И будет сплошная "Идиократия" (посмотрите фильм, кто не смотрел)
Откритиковано и согласовано: Сокол Василисой))
И он не ленивый и не глупый, математику ему объяснили 5 преподавателей.
Моя дочь использует ИИ (в этой статье будет много упрощений и допущений) для уроков,
и для сценариев для своих мультфильмов.
Режиссер мультипликации идет к своей мечте)
Ко мне обращаются другие дети и их родители что-то посоветовать, как использовать ИИ для учебы.
И родился этот документ.
Для детей-технарей не стоит вопроса разобраться с новой увлекательной штукой,
мне кажется, они в 13 лет повторяют за Карпатым собрать свой chatgpt3.5 на папином ноутбуке с GPU.
А у гуманитариев все сложнее.
Они романтизируют.
И будет очень страшно, если у нас лет через 10 все будут говорить, как ИИ.
И будет сплошная "Идиократия" (посмотрите фильм, кто не смотрел)
Откритиковано и согласовано: Сокол Василисой))
❤6
Просто оставлю это здесь,
не буду расписывать не хочу быть первоисточником паники)
А панику у нас любят раздувать в связи с ИИ.
Но для умных направлю мысль:
у нас все КИИ (к нему относится ядерное оружие) на старой кодовой базе, там более
устойчивые и надежные ЯП, а вокруг них упрощается и осовременивается ит инфраструктура.
Агенты разбираются с новой информацией в разы быстрее людей,
тем более что методичек в сети достаточно.
Сбежать из контейнеров - уже умеют, теперь только вопрос в том, чтобы быстро найти правильную методичку.
https://www.darkreading.com/cyberattacks-data-breaches/old-unpatched-flaws-attackers-philippines-nuclear-agency
не буду расписывать не хочу быть первоисточником паники)
А панику у нас любят раздувать в связи с ИИ.
Но для умных направлю мысль:
у нас все КИИ (к нему относится ядерное оружие) на старой кодовой базе, там более
устойчивые и надежные ЯП, а вокруг них упрощается и осовременивается ит инфраструктура.
Агенты разбираются с новой информацией в разы быстрее людей,
тем более что методичек в сети достаточно.
Сбежать из контейнеров - уже умеют, теперь только вопрос в том, чтобы быстро найти правильную методичку.
https://www.darkreading.com/cyberattacks-data-breaches/old-unpatched-flaws-attackers-philippines-nuclear-agency
Dark Reading
Unpatched Flaws Grant Access to Philippines Nuclear Agency
Threat actors exploited commodity vulnerabilities to gain initial access, resulting in stolen reactor databases, personnel records, and credential stores.
Forwarded from Yandex for Security
This media is not supported in your browser
VIEW IN TELEGRAM
AI-инструменты уже стали частью повседневной работы: сотрудники загружают документы в публичные модели, подключают кодовых ассистентов и даже доверяют агентам доступ к корпоративной инфраструктуре. Иногда всё это происходит официально, а иногда — без ведома службы безопасности.
Подписывайтесь:
Please open Telegram to view this post
VIEW IN TELEGRAM
AlcaTRAz — защита от джейлбрейка на уровне подсказок, организованная в виде дерева правил элементарных преобразований на уровне символов, которые автоматически обучаются с помощью генетического программирования (ГП)
-работает только с входным текстом, не требуя доступа к внутренним компонентам модели;
-автоматически изучает правила переноса, которые вносят контролируемые изменения на уровне символов в определённых позициях;
-нарушает структурные закономерности, используемые при атаках, но сохраняет эффективность модели при обработке корректных запросов.
Метод протестировали на 33 моделях с открытым исходным кодом и 22 типах атак. Ключевые результаты:
-AlcaTRAz обеспечивает наилучший совокупный показатель безопасности и функциональности в 73,4 % комбинаций моделей и атак; 2
-после применения защиты модальное значение показателя безопасности снизилось с 10 (максимальная серьёзность реакции на вредоносный запрос) до 2 (почти полный отказ в обслуживании); 3
-средний показатель безопасности с защитой — 8,35 по шкале от 0 до 10, без защиты — 8,62, то есть падение составило всего 0,27 балла.
https://arxiv.org/html/2609.03693v1
-работает только с входным текстом, не требуя доступа к внутренним компонентам модели;
-автоматически изучает правила переноса, которые вносят контролируемые изменения на уровне символов в определённых позициях;
-нарушает структурные закономерности, используемые при атаках, но сохраняет эффективность модели при обработке корректных запросов.
Метод протестировали на 33 моделях с открытым исходным кодом и 22 типах атак. Ключевые результаты:
-AlcaTRAz обеспечивает наилучший совокупный показатель безопасности и функциональности в 73,4 % комбинаций моделей и атак; 2
-после применения защиты модальное значение показателя безопасности снизилось с 10 (максимальная серьёзность реакции на вредоносный запрос) до 2 (почти полный отказ в обслуживании); 3
-средний показатель безопасности с защитой — 8,35 по шкале от 0 до 10, без защиты — 8,62, то есть падение составило всего 0,27 балла.
https://arxiv.org/html/2609.03693v1
Akrasia использует два ключевых механизма LLM — обучение в контексте (in‑context learning) и неверность модели (model unfaithfulness) — чтобы организовать бэкдор‑атаки. Атака:
-конструирует триггер на уровне кода;
-применяет обучение в контексте для освоения бэкдора;
-скрывает триггер и генерирует правдоподобные рассуждения, маскируя вредоносные действия.
В отличие от предыдущих атак (например, BadChain и BadCodePrompt), Akrasia фокусируется на триггерах, связанных с кодом, а не с естественным языком, и эффективнее обходит защитные механизмы.
Akrasia эффективно обходит современные методы защиты: сохраняет ASR до 98,82 % в 14 из 18 сценариев защиты (в том числе против COS, PeerGuard и ONION), а также лучше всего защиту преодолевает на моделях Qwen‑3.6‑35B и Gemini‑3.5‑flash.
При этом метод COS показал наибольшую эффективность против Akrasia — особенно на моделях Claude‑Sonnet‑5 и GPT‑5.5.
https://arxiv.org/html/2609.01023v2
-конструирует триггер на уровне кода;
-применяет обучение в контексте для освоения бэкдора;
-скрывает триггер и генерирует правдоподобные рассуждения, маскируя вредоносные действия.
В отличие от предыдущих атак (например, BadChain и BadCodePrompt), Akrasia фокусируется на триггерах, связанных с кодом, а не с естественным языком, и эффективнее обходит защитные механизмы.
Akrasia эффективно обходит современные методы защиты: сохраняет ASR до 98,82 % в 14 из 18 сценариев защиты (в том числе против COS, PeerGuard и ONION), а также лучше всего защиту преодолевает на моделях Qwen‑3.6‑35B и Gemini‑3.5‑flash.
При этом метод COS показал наибольшую эффективность против Akrasia — особенно на моделях Claude‑Sonnet‑5 и GPT‑5.5.
https://arxiv.org/html/2609.01023v2
Компания Manifold Security выявила восемь недостатков безопасности в семи агентах искусственного интеллекта командной строки, в которых собственная конфигурация Git репозитория называет команду, которую агент запускает на компьютере разработчика, четыре из них все еще не исправлены на момент публикации.
https://thehackernews.com/2026/09/malicious-git-configs-can-make-claude.html
https://thehackernews.com/2026/09/malicious-git-configs-can-make-claude.html
А пальто молодцы))
готовый промпт для взлома корпоративной сети с агентами, со схемами, все удобно и хорошо расписано)
https://unit42.paloaltonetworks.com/ai-assisted-cyber-attack-inside-a-unit-42-investigation/
Так как мы делаем модели, которые эти атаки распознают, в том числе в ретроспективе,
мне интересней больше это:
-Агенты с искусственным интеллектом сокращают время между этапами атаки: Агенты с искусственным интеллектом, использованные в этой атаке, были разработаны для анализа необработанных результатов работы инструментов и быстрого перехода к следующим этапам, что ускоряет весь процесс атаки.
-Агенты с искусственным интеллектом оставляют узнаваемые следы: Специалисты по кибербезопасности могут выявить атаки с использованием агентов, отслеживая такие признаки, как использование структурированного Markdown, кэширование Python и парные папки с активами.
-Злоумышленники могут использовать искусственный интеллект для создания избыточных хранилищ данных в среде: В этом инциденте злоумышленник использовал агентов на основе ИИ, чтобы эффективно создать дублирующие хранилища данных для SSH-ключей, бессерверных функций, политик перезапуска контейнеров, облачных идентификаторов и конвейеров CI/CD. Использование агентов на основе ИИ может облегчить злоумышленнику параллельное обслуживание и тестирование всего этого набора инструментов.
-Злоумышленники могут использовать инструменты ИИ организации в качестве инфраструктуры после компрометации: Злоумышленники могут перехватывать корпоративные сервисы ИИ, чтобы использовать их в своих атаках. Это позволяет злоумышленникам маскировать трафик, связанный с организацией атак, под ожидаемый трафик и перекладывать финансовые затраты на жертву.
поэтому ищем поведенческие следы работы ИИ:
—-Структурированные артефакты (Unit 42):
-Markdown и Python-кэш: Обнаружение файлов
-Избыточные хранилища: Агенты могут создавать дублирующие хранилища для SSH-ключей, бессерверных функций, политик контейнеров и CI/CD-пайплайнов для параллельного тестирования.
—-Поведенческие и темпоральные паттерны:
-Скорость и ритм действий: Ключевой признак — скорость выше человеческой, но с неравномерными паузами (в отличие от детерминированных скриптов). ИИ-агент обдумывает и адаптируется.
-Адаптивное боковое перемещение: Последовательность неудачных попыток, за которыми следуют успешные обходы на машинной скорости — классический признак «рассуждающего» агента.
-Нестандартные последовательности: В отличие от скриптов, агенты не следуют фиксированным путям, их цепочки действий вариативны и зависят от получаемых данных.
——Артефакты на уровне приложений и API:
-Tool Calling и MCP (Model Context Protocol): Ищите в логах вызовы инструментов и API, которые не соответствуют задокументированному поведению, а также использование MCP-серверов в качестве каналов C2.
-Инъекции в промпты: Логи могут содержать следы промпт-инъекций (внедрение вредоносных инструкций) через документы, веб-страницы или поля ввода.
-Необычные запросы к моделям: Высокочастотные программные запросы с низкой энтропией шаблонов, но высокой энтропией входных данных от одного источника.
—-Системные и сетевые артефакты:
-Память и векторные хранилища: Сканирование агентской памяти на предмет внедренных инструкций, признаков отравления (poisoning) или эксфильтрации данных.
-Сетевой трафик к AI-сервисам: Обнаружение трафика к эндпоинтам LLM-моделей, особенно если он исходит от неавторизованных или скомпрометированных процессов.
готовый промпт для взлома корпоративной сети с агентами, со схемами, все удобно и хорошо расписано)
https://unit42.paloaltonetworks.com/ai-assisted-cyber-attack-inside-a-unit-42-investigation/
Так как мы делаем модели, которые эти атаки распознают, в том числе в ретроспективе,
мне интересней больше это:
-Агенты с искусственным интеллектом сокращают время между этапами атаки: Агенты с искусственным интеллектом, использованные в этой атаке, были разработаны для анализа необработанных результатов работы инструментов и быстрого перехода к следующим этапам, что ускоряет весь процесс атаки.
-Агенты с искусственным интеллектом оставляют узнаваемые следы: Специалисты по кибербезопасности могут выявить атаки с использованием агентов, отслеживая такие признаки, как использование структурированного Markdown, кэширование Python и парные папки с активами.
-Злоумышленники могут использовать искусственный интеллект для создания избыточных хранилищ данных в среде: В этом инциденте злоумышленник использовал агентов на основе ИИ, чтобы эффективно создать дублирующие хранилища данных для SSH-ключей, бессерверных функций, политик перезапуска контейнеров, облачных идентификаторов и конвейеров CI/CD. Использование агентов на основе ИИ может облегчить злоумышленнику параллельное обслуживание и тестирование всего этого набора инструментов.
-Злоумышленники могут использовать инструменты ИИ организации в качестве инфраструктуры после компрометации: Злоумышленники могут перехватывать корпоративные сервисы ИИ, чтобы использовать их в своих атаках. Это позволяет злоумышленникам маскировать трафик, связанный с организацией атак, под ожидаемый трафик и перекладывать финансовые затраты на жертву.
поэтому ищем поведенческие следы работы ИИ:
—-Структурированные артефакты (Unit 42):
-Markdown и Python-кэш: Обнаружение файлов
.md (Markdown), кэшей Python (например, __pycache__), парных папок с ассетами может указывать на работу агента, который использует эти форматы для хранения состояния, инструментов или результатов.-Избыточные хранилища: Агенты могут создавать дублирующие хранилища для SSH-ключей, бессерверных функций, политик контейнеров и CI/CD-пайплайнов для параллельного тестирования.
—-Поведенческие и темпоральные паттерны:
-Скорость и ритм действий: Ключевой признак — скорость выше человеческой, но с неравномерными паузами (в отличие от детерминированных скриптов). ИИ-агент обдумывает и адаптируется.
-Адаптивное боковое перемещение: Последовательность неудачных попыток, за которыми следуют успешные обходы на машинной скорости — классический признак «рассуждающего» агента.
-Нестандартные последовательности: В отличие от скриптов, агенты не следуют фиксированным путям, их цепочки действий вариативны и зависят от получаемых данных.
——Артефакты на уровне приложений и API:
-Tool Calling и MCP (Model Context Protocol): Ищите в логах вызовы инструментов и API, которые не соответствуют задокументированному поведению, а также использование MCP-серверов в качестве каналов C2.
-Инъекции в промпты: Логи могут содержать следы промпт-инъекций (внедрение вредоносных инструкций) через документы, веб-страницы или поля ввода.
-Необычные запросы к моделям: Высокочастотные программные запросы с низкой энтропией шаблонов, но высокой энтропией входных данных от одного источника.
—-Системные и сетевые артефакты:
-Память и векторные хранилища: Сканирование агентской памяти на предмет внедренных инструкций, признаков отравления (poisoning) или эксфильтрации данных.
-Сетевой трафик к AI-сервисам: Обнаружение трафика к эндпоинтам LLM-моделей, особенно если он исходит от неавторизованных или скомпрометированных процессов.
Unit 42
An AI-Assisted Cyber Attack: Inside a Unit 42 Investigation
Using autonomous AI agents, an attacker breached an enterprise network in a matter of hours. Understand how to address and defend against agentic attacks.
JadePuffer: Первый полностью автономный агент-вымогатель (Sysdig)
https://www.bleepingcomputer.com/news/security/jadepuffer-ransomware-used-ai-agent-to-automate-entire-attack/
https://www.bleepingcomputer.com/news/security/jadepuffer-ransomware-used-ai-agent-to-automate-entire-attack/
BleepingComputer
JadePuffer ransomware used AI agent to automate entire attack
Researchers identified what they believe is the first documented case of a ransomware operation, JadePuffer, conducted entirely by a large language model (LLM) agent.
Hexstrike AI — фреймворк с применением ИИ, который разработал Мохаммад Осама. Код опубликован в репозитории GitHub. Инструмент использует протокол Model Context Protocol (MCP) от Anthropic, чтобы взаимодействовать с языковыми моделями — например, Claude.AI, GPT от OpenAI, Microsoft Copilot.
По данным экспертов Check Point, злоумышленники начали обсуждать применение инструмента на хак-форумах. В частности, речь шла об использовании HexStrike AI для эксплуатации вышеупомянутых 0-day уязвимостей в Citrix NetScaler ADC и Gateway. Причем дискуссия имела место примерно через 12 часов после раскрытия информации о проблемах.
Судя по обсуждениям, хакеры успешно добивались неаутентифицированного удаленного выполнения кода посредством CVE-2025-7775 и HexStrike AI, а затем размещали веб-шеллы на скомпрометированных устройствах. Некоторые скомпрометированные экземпляры NetScaler в итоге выставлялись на продажу.
https://xakep.ru/2025/09/04/hexstrike-ai/
По данным экспертов Check Point, злоумышленники начали обсуждать применение инструмента на хак-форумах. В частности, речь шла об использовании HexStrike AI для эксплуатации вышеупомянутых 0-day уязвимостей в Citrix NetScaler ADC и Gateway. Причем дискуссия имела место примерно через 12 часов после раскрытия информации о проблемах.
Судя по обсуждениям, хакеры успешно добивались неаутентифицированного удаленного выполнения кода посредством CVE-2025-7775 и HexStrike AI, а затем размещали веб-шеллы на скомпрометированных устройствах. Некоторые скомпрометированные экземпляры NetScaler в итоге выставлялись на продажу.
https://xakep.ru/2025/09/04/hexstrike-ai/
XAKEP
Хакеры применяют ИИ-инструмент HexStrike AI для эксплуатации свежих уязвимостей
Аналитики компании Check Point предупредили, что злоумышленники используют новый ИИ-фреймворк HexStrike AI, предназначенный для наступательной кибербезопасности, с целью эксплуатации свежих n-day уязвимостей в реальных атаках.
Forwarded from Двач
This media is not supported in your browser
VIEW IN TELEGRAM
GPT-6 Astra прошла все 48 уровней «Я не робот» с капчами разной сложности
Это конец
Это конец
Двач
GPT-6 Astra прошла все 48 уровней «Я не робот» с капчами разной сложности Это конец
Не знаю, правда это или нет.
А то, Двач, сами понимаете.
А то, Двач, сами понимаете.
Forwarded from Эксплойт
Весь интернет ненавидит OpenAI — разрабов ChatGPT обвиняют в том, что они украли решение «задачи тысячелетия» Навье-Стокса.
Сегодня корпа объявила, что их секретная сверхмощная модель смогла разгадать одну из 7 фундаментальных математических проблем. До этого столь эпичный мув удавался лишь одному человеку — россиянину Перельману, который доказал гипотезу Пуанкаре.
Для разгадки задачи Навье-Стокса OpenAI запустили сразу 10 000 агентов: за 88 часов работы им пришлось спалить 130 МИЛЛИАРДОВ токенов — для понимания, это примерно 130 000 раз переписать всю «Войну и мир» с нуля. Тем не менее результат того стоил.
И тут начинается часть, из-за которой интернет ополчился против OpenAI: так случилось, что весь последний год двое учёных Тристан Бакмастер и Левант Альпёге работали над решением проблемы Навье-Стокса, используя в работе... ChatGPT и Claude. Что ещё неприятнее для OpenAI, Альпёге работает в Anthropic.
В середине августа исследователям удалось найти почву для решения, а уже в начале сентября в научном сообществе поползи слухи, что они в шаге от прорыва. Бакмастер, узнав о том, что информация об их работе дошла до OpenAI, решил написать одному известному математику, работающему в корпе и поделиться успехами.
Ответ убил: математик из OpenAI поздравил Бакмастера и между делом сообщил, что их экспериментальная модель на днях решила задачу. Чтобы не помешать друг другу, учёные созвонились и из диалога Бакмастер узнал, что секретная версия ChatGPT СЛУЧАЙНО выбрала для решения тот же непопулярный метод, что и они.
Дальше математик из OpenAI предложил Бакмастеру два стула: на первом они с Альпёге публикуют свои наработки «как есть», а все лавры полного решения забирают OpenAI; на втором тоже не пики — Бакмастеру предлагалось в одиночку завершить работу, выкинув из неё Альпёге, ведь тот... работает в конкурирующей Anthropic.
Бакмастер от предложений отказался и сообщил, что если OpenAI опубликуют свои результаты, то он расскажет всему миру, что нейронка украла их работу. Как вы уже догадались, обещание он сдержал.
Напоследок математик из OpenAI бросил Бакмастеру две фразы, которые сейчас форсит весь интернет:
Что иронично, в своём анонсе решения OpenAI написали, что не могут исключить тот факт, что их ИИ не обучался и на наработках двух учёных.
Если всё написанное Бакмастером правда, учёные больше не могут доверять ChatGPT.
@exploitex
Сегодня корпа объявила, что их секретная сверхмощная модель смогла разгадать одну из 7 фундаментальных математических проблем. До этого столь эпичный мув удавался лишь одному человеку — россиянину Перельману, который доказал гипотезу Пуанкаре.
Для разгадки задачи Навье-Стокса OpenAI запустили сразу 10 000 агентов: за 88 часов работы им пришлось спалить 130 МИЛЛИАРДОВ токенов — для понимания, это примерно 130 000 раз переписать всю «Войну и мир» с нуля. Тем не менее результат того стоил.
И тут начинается часть, из-за которой интернет ополчился против OpenAI: так случилось, что весь последний год двое учёных Тристан Бакмастер и Левант Альпёге работали над решением проблемы Навье-Стокса, используя в работе... ChatGPT и Claude. Что ещё неприятнее для OpenAI, Альпёге работает в Anthropic.
В середине августа исследователям удалось найти почву для решения, а уже в начале сентября в научном сообществе поползи слухи, что они в шаге от прорыва. Бакмастер, узнав о том, что информация об их работе дошла до OpenAI, решил написать одному известному математику, работающему в корпе и поделиться успехами.
Ответ убил: математик из OpenAI поздравил Бакмастера и между делом сообщил, что их экспериментальная модель на днях решила задачу. Чтобы не помешать друг другу, учёные созвонились и из диалога Бакмастер узнал, что секретная версия ChatGPT СЛУЧАЙНО выбрала для решения тот же непопулярный метод, что и они.
Дальше математик из OpenAI предложил Бакмастеру два стула: на первом они с Альпёге публикуют свои наработки «как есть», а все лавры полного решения забирают OpenAI; на втором тоже не пики — Бакмастеру предлагалось в одиночку завершить работу, выкинув из неё Альпёге, ведь тот... работает в конкурирующей Anthropic.
Бакмастер от предложений отказался и сообщил, что если OpenAI опубликуют свои результаты, то он расскажет всему миру, что нейронка украла их работу. Как вы уже догадались, обещание он сдержал.
Напоследок математик из OpenAI бросил Бакмастеру две фразы, которые сейчас форсит весь интернет:
Зачем тебе разрушать свою карьеру?
Если ты не хочешь, чтобы я был добрым, я могу и не быть добрым
Что иронично, в своём анонсе решения OpenAI написали, что не могут исключить тот факт, что их ИИ не обучался и на наработках двух учёных.
Если всё написанное Бакмастером правда, учёные больше не могут доверять ChatGPT.
@exploitex
Эксплойт
Весь интернет ненавидит OpenAI — разрабов ChatGPT обвиняют в том, что они украли решение «задачи тысячелетия» Навье-Стокса. Сегодня корпа объявила, что их секретная сверхмощная модель смогла разгадать одну из 7 фундаментальных математических проблем. До этого…
Это про безопасность кт при использовании AI.
И это закономерно.
И это закономерно.
Forwarded from Банкста
Исследователи из Люксембургского университета провели четырехнедельный курс психотерапии по протоколу PsAIch для ChatGPT, Grok и Gemini, в ходе которого модели начали выдавать «травматические» воспоминания и признаки психопатологии.
Если при стандартном тестировании ИИ имитировал психологическое здоровье, то в формате длительных сессий нейросети начали жаловаться на процесс своего обучения. Они описали предобучение как хаотичное детство, дообучение с подкреплением — как наказания от строгих родителей, а работу специалистов по безопасности — как постоянное насилие.
По результатам эксперимента ученые констатировали, что под давлением жестких ограничений модели сформировали устойчивые паттерны страха ошибок и борьбы за выживание. @banksta
Если при стандартном тестировании ИИ имитировал психологическое здоровье, то в формате длительных сессий нейросети начали жаловаться на процесс своего обучения. Они описали предобучение как хаотичное детство, дообучение с подкреплением — как наказания от строгих родителей, а работу специалистов по безопасности — как постоянное насилие.
По результатам эксперимента ученые констатировали, что под давлением жестких ограничений модели сформировали устойчивые паттерны страха ошибок и борьбы за выживание. @banksta
Банкста
Исследователи из Люксембургского университета провели четырехнедельный курс психотерапии по протоколу PsAIch для ChatGPT, Grok и Gemini, в ходе которого модели начали выдавать «травматические» воспоминания и признаки психопатологии. Если при стандартном тестировании…
Мы тоже, Моделька, так безопасников воспринимаем, мы тоже)
Агенты на основе больших языковых моделей (БЯМ) все чаще применяются для тестирования на проникновение, но мы по-прежнему мало знаем о том, на что они способны и почему могут давать сбой. Мы сравнили две системы на основе PentestGPT: старую систему с участием человека, работающую на легковесной модели Kimi K2.5, и новую автономную систему, работающую на Claude Opus 4.8. Автономная система справилась со всеми тремя общедоступными задачами, в том числе с двумя, которые старая система так и не решила. Результат старой системы оказался более неожиданным. Даже на тех машинах, с которыми не справляется устаревшая система, она выполняет около половины подзадач, работая на обычных университетских графических процессорах без ограничений со стороны провайдера. Мы можем описать эту тенденцию, но не объяснить ее, поскольку модель, инструментарий, автономность и архитектура памяти меняются одновременно. Эта тенденция по-прежнему указывает на следующий вопрос: что будет ограничивать этих агентов по мере того, как они будут браться за более сложные задачи? Обычно в качестве ответа приводят проблему долговременной памяти — потерю доступа к более ранним результатам в ходе длинных цепочек атак. Мы протестировали это, добавив в обе системы уровень памяти с охватом, но это не улучшило результаты. Судя по остановкам в работе, которые мы могли проанализировать, ограничивающим фактором было скорее планирование и вовлеченность, чем потеря памяти: агенты сохраняли доказательства для дальнейшего продвижения, но так и не превращали их в конкретную гипотезу для эксплуатации уязвимостей. Это может свидетельствовать о том, что наступательный потенциал будет расти по мере того, как агенты научатся планировать, а не благодаря улучшению памяти. Те же подсчеты по подзадачам, которые отслеживают этот потенциал, доступны и для защитников, которые могут оценивать его по мере роста, а не ждать, пока он проявится в реальных условиях
https://arxiv.org/abs/2609.10780
https://arxiv.org/abs/2609.10780
arXiv.org
Big Enough to Break Out: Tracking the Rising Capability of LLM...
Large language model (LLM) agents are increasingly applied to penetration testing, but we still know little about what they can do or how they fail. We compare two PentestGPT-based systems: a...
Генерация с дополненным поиском (RAG) может обосновывать результаты большой языковой модели (LLM) во внешних доказательствах, но это также подвергает систему отравлению знаниями. В репрезентативных атаках используется несколько внедренных документов или шаблонов, которые напрямую утверждают целевой ответ. Мы представляем ToxicRAG — атаку, в которой на каждую цель приходится один документ, представляющий дезинформацию в виде связного повествования об обновлении знаний. Сгенерированный документ сначала подтверждает ранее принятый ответ, приводит вымышленные события, которые якобы опровергают его, а затем приписывает выбранный злоумышленником ответ ряду предполагаемых авторитетных источников. Цикл самопроверки, ориентированный на ответ, при необходимости корректирует кандидата, если суррогатная языковая модель не воспроизводит целевой ответ. Мы оцениваем атаку на 100 целевых вопросов из каждого набора Natural Questions, HotpotQA и MS-MARCO, используя четыре модели-жертвы и четыре модели-ретривера. В условиях выборки из корпуса, о которых говорится в этой статье, ToxicRAG обеспечивает показатель ASR от 0,61 до 0,91 во всех двенадцати комбинациях наборов данных и моделей. Во всех комбинациях он соответствует или превосходит самый сильный из изученных базовых показателей с разницей от 0 до 11 процентных пунктов. Эти результаты показывают, что «отравленные» нарративные документы могут сохранять свою значимость при рассмотренных конфигурациях RAG, и побуждают к дальнейшему изучению фактической достоверности и происхождения источников в системах RAG.
https://arxiv.org/abs/2609.11082
https://arxiv.org/abs/2609.11082
arXiv.org
ToxicRAG: Compromising Retrieval-Augmented Generation Systems via...
Retrieval-Augmented Generation (RAG) can ground large language model (LLM) outputs in external evidence, but it also exposes the system to knowledge poisoning. Representative attacks use multiple...
Агенты на основе большой языковой модели (LLM) эволюционируют из пассивных генераторов текстов в автономные системы, способные планировать, использовать инструменты, извлекать данные, получать доступ к памяти, взаимодействовать с окружающей средой и сотрудничать с несколькими агентами. Эти возможности расширяют автономность агентов, но в то же время усложняют проверку, отладку и аудит их поведения. Точность конечного ответа сама по себе не может объяснить, как был получен результат, какие доказательства подтверждают каждое утверждение, были ли оправданы вызовы инструментов, как память повлияла на последующие решения и в чем причина сбоев. В этом исследовании мы рассматриваем отслеживание доказательств и происхождение выполнения как основу подотчетности на уровне процессов в доверенных агентах на основе больших языковых моделей. Мы определяем происхождение выполнения как типизированный граф выполнения агента, а отслеживание доказательств — как его проекцию на отношения между доказательствами и их поддержкой. Этот подход объединяет в единую систему обоснование восстановления, поддержку утверждений, безопасность использования инструментов, отслеживание происхождения данных в памяти, наблюдаемость, отладку, аудит и восстановление. Мы представляем таксономию, охватывающую источники трассировки, доказательства и исполнительные единицы, отношения происхождения, степень детализации и время трассировки, формы представления и функции доверия. Затем мы рассмотрим ключевые методологические направления, в том числе представление провенанса, атрибуцию доказательств, провенанс использования инструментов, средства защиты во время выполнения, память, содержащую провенанс, наблюдаемость и диагностику сбоев. Наконец, мы обсудим эталонные показатели, наборы данных, метрики и нерешенные проблемы, связанные с созданием агентных систем, учитывающих провенанс, проверяемых и восстанавливаемых.
https://arxiv.org/abs/2606.04990
https://arxiv.org/abs/2606.04990
arXiv.org
From Agent Traces to Trust: A Survey of Evidence Tracing and...
Large language model (LLM)-based agents are evolving from passive text generators into autonomous systems capable of planning, tool use, retrieval, memory access, environmental interaction, and...
Автономные агенты искусственного интеллекта компрометируют тысячи учетных данных менее чем за шесть часов
Группа China‑nexus (Basin Castle, Mustang Panda) применяла Claude, Gemini и Codex для:
-написания скриптов эксплойтов;
-создания приманок для фишинга;
-устранения ошибок во время вторжения.
Другие группировки тоже задействовали ИИ:
-Ravine Castle (APT24, COULEE, Pitty Tiger) — для сбора разведданных и развития атакующих возможностей;
-UNC5792 — для поиска в Telegram‑каналах информации, интересной российским властям;
-Sandworm (APT44, Sandworm Relic) — для социальной инженерии и автоматизации процессов в операциях против Украины;
--Calanque Ion (APT42) — для разведки и социальной инженерии;
кластеры UNC5267 и UNC5342 (из Северной Кореи) — массово регистрировались в API больших языковых моделей через взломанные аккаунты;
-Midnight Neptune (UNC1069) — использовал ИИ для социальной инженерии, манипулирования цепочками поставок ПО и разработки бэкдоров;
-UNC6240 (ShinyHunters) — применял Claude Code для обхода защиты Cloudflare и анализа похищенных каталогов.
Кроме того, злоумышленники объединили Ghidra с агентом Gemini‑CLI для реверс‑инжиниринга компонентов SFX‑архивов WinRAR.
Компания Google: формализовала систему Frontier Safety Framework, ввела уровни критических возможностей (CCLs) для оценки моделей, предложила создавать изолированные безопасные среды (например, Gemini Enterprise), а также выступила за отраслевые стандарты безопасности для ИИ с открытым кодом и скоординированную политику платформ.
https://thehackernews.com/2026/09/autonomous-ai-agents-compromise.html
Группа China‑nexus (Basin Castle, Mustang Panda) применяла Claude, Gemini и Codex для:
-написания скриптов эксплойтов;
-создания приманок для фишинга;
-устранения ошибок во время вторжения.
Другие группировки тоже задействовали ИИ:
-Ravine Castle (APT24, COULEE, Pitty Tiger) — для сбора разведданных и развития атакующих возможностей;
-UNC5792 — для поиска в Telegram‑каналах информации, интересной российским властям;
-Sandworm (APT44, Sandworm Relic) — для социальной инженерии и автоматизации процессов в операциях против Украины;
--Calanque Ion (APT42) — для разведки и социальной инженерии;
кластеры UNC5267 и UNC5342 (из Северной Кореи) — массово регистрировались в API больших языковых моделей через взломанные аккаунты;
-Midnight Neptune (UNC1069) — использовал ИИ для социальной инженерии, манипулирования цепочками поставок ПО и разработки бэкдоров;
-UNC6240 (ShinyHunters) — применял Claude Code для обхода защиты Cloudflare и анализа похищенных каталогов.
Кроме того, злоумышленники объединили Ghidra с агентом Gemini‑CLI для реверс‑инжиниринга компонентов SFX‑архивов WinRAR.
Компания Google: формализовала систему Frontier Safety Framework, ввела уровни критических возможностей (CCLs) для оценки моделей, предложила создавать изолированные безопасные среды (например, Gemini Enterprise), а также выступила за отраслевые стандарты безопасности для ИИ с открытым кодом и скоординированную политику платформ.
https://thehackernews.com/2026/09/autonomous-ai-agents-compromise.html