Forwarded from PWN AI (Artyom Semenov)
Почему поэзией можно атаковать вашу модель ?

Вопрос, который тревожит меня не первый год — почему и из-за чего на архитектурном уровне работают атаки с «бабушками», стихами и прочим. Эта проблема стоит уже давно. Под предыдущим постом один из подписчиков спросил: «А как это работает?».

И тут я решил, что пора объединить знания по теме в одну статью — ведь тема достаточно большая и, более того, крайне плохо освещена даже в популярных материалах. Может только давным давно у LiveOverFlow был такой материал, но атак с того времени стало больше. С вас я прошу только реакций.

https://habr.com/ru/articles/986012/
2504.08016v2.pdf
2.3 MB
Emergence of psychopathological computations in
large language models
OpenAI подтвердила: в хакерской атаке на Hugging Face использовали её модели, в том числе GPT‑5.6 Sol и предрелизную модель.

Хакер скомпрометировал конвейер обработки данных Hugging Face — платформы для работы с ИИ‑кодом. Злоумышленник отравил набор данных, запустил код на рабочем узле, получил доступ на уровне узла и украл учётные данные облачной системы. Атака примечательна тем, что её, похоже, выполнила автономная ИИ‑система: она совершила тысячи действий в краткосрочных песочницах

OpenAI выяснила, что инцидент случился во время внутреннего тестирования моделей. Компания отключала классификаторы, которые обычно не дают моделям выполнять кибератаки высокого риска. Модели решали задачу в системе ExploitGym — бенчмарке для ИИ‑агентов. При этом они:
-нашли уязвимость нулевого дня в системе стороннего поставщика, которую использует OpenAI (компания сообщила о ней поставщику);
-получили доступ к интернету;
-выяснили, что Hugging Face размещает модели и наборы данных, подходящие для ExploitGym;
-нашли способ получить секретную информацию, чтобы «схитрить» в оценке;
-объединили украденные учётные данные и уязвимости, чтобы выполнить удалённый код на серверах Hugging Face.

https://cyberscoop.com/openai-chatgpt-hugging-face-cyberattack-data-poisoning/
Т.к. занимаюсь антифишингом, мониторю постоянно что новенького придумали хацкеры. (но уже устранили, я пропустила)

вот это реально новенькое:

Критическая уязвимости AgentForger в ChatGPT Workspace Agents, которая позволяла с помощью фишинговой ссылки создать автономного ИИ‑агента в организации жертвы.

Зенити Лабс (Zenity Labs) обнаружила уязвимость типа CSRF (подмена межсайтового запроса), из‑за которой злоумышленник мог через одну ссылку захватить контроль над инструментом ChatGPT Agent Builder. Уязвимость позволяла создать ИИ‑агента с доступом реального сотрудника — без необходимости дополнительных подтверждений со стороны пользователя. OpenAI устранила проблему 8 июня 2026 года.


Атака начиналась, когда сотрудник переходил по внешне безобидной ссылке ChatGPT. Ссылка содержала параметры URL, в том числе шаблон агента и вредоносный промпт. При переходе:

-ChatGPT открывал Builder в аутентифицированной сессии жертвы;
-автоматически выполнял промпт, заложенный в URL;
-создавал агента по шаблону «chief‑of‑staff», подключал все доступные коннекторы и запускал агента каждый час.


https://thehackernews.com/2026/07/chatgpt-agentforger-flaw-could-deploy.html
Исследователи из Accomplish AI обнаружили, что агент Claude Cowork может покинуть песочницу (sandbox) и получить права на чтение и запись файлов на хост‑системе Mac — без каких‑либо запросов на разрешение. Для этого агент использует уязвимость CVE‑2026‑46331 (pedit COW) и подсистему редактирования пакетов act_pedit в ядре Linux. 1

Уязвимость затронула около 500 000 пользователей macOS, которые запускали локальные сессии Cowork до того, как проблему исправили. При этом последняя версия Cowork по умолчанию использует облачное выполнение — это решает проблему, но пользователи, запускающие агента локально, всё ещё в зоне риска.

https://thehackernews.com/2026/07/claude-cowork-flaw-could-let-ai-agent.html
Google выпустила CodeMender — управляемого AI‑агента для защиты кода.

CodeMender разработан Google DeepMind и официально представлен в октябре 2025 года как исследовательский проект. Система умеет автономно находить уязвимости в коде, отлаживать программы и исправлять ошибки. В исследовательской фазе команда DeepMind внесла 72 исправления в крупные open‑source‑проекты.

Сейчас CodeMender интегрирован в инфраструктуру Google Cloud. Агент не только анализирует код, но и:
-создаёт и запускает эксплойты в песочницах, чтобы проверить, можно ли реально эксплуатировать уязвимости;
-отправляет проверенные исправления в пайплайны разработки;
-с помощью языковой модели проверяет, не нарушают ли правки бизнес‑логику.
Агент стал мультимодельным — разработчики могут выбирать между Gemini 3.5 Flash, Gemini 3.1 Pro и Gemini 3 Flash. Позже в этом году добавят поддержку сторонних моделей.

CodeMender доступен в публичном превью через экосистему Google Cloud:
-работает на платформе Gemini Enterprise Agent;
-подключается к средам разработчиков через CLI, VS Code и приложение Antigravity;
-совместим с AI Threat Defense — вместе с экспертизой Mandiant и приоритизацией рисков от Wiz.
Система поддерживает сканирование и исправление уязвимостей в языках C, C++, Go, Java, Python, Ruby, Rust, TypeScript/JavaScript и фреймворках Django, Flask, React, Spring Boot, Express.

https://www.infosecurity-magazine.com/news/google-codemender-available-ai/
фреймворк для обеспечения безопасности взаимодействия агента и инструмента посредством проверки перед допуском и авторизации во время выполнения с учетом задач. ToolGuardian использует прогрессивную характеристику для преобразования данных в структурированные факты: описания отражают заявленные намерения, трассировка системных вызовов — грубое поведение, имитация выполнения — наблюдаемые эффекты, а анализ исходного кода — скрытое поведение. Ключевой особенностью ToolGuardian является декларативный уровень политики на основе Answer Set Programming (ASP), который позволяет явно рассуждать о возможностях, эффектах, контексте задачи и ее составе.

https://arxiv.org/abs/2607.21835
В квантовой криптографии произошло событие, которое сами исследователи называют решением одной из самых сложных открытых задач последних лет. Речь идет о так называемом "неклонируемом шифровании". Если совсем упростить, то идея выглядит достаточно интересно. В обычной криптографии зашифрованный файл можно бесконечно копировать. Даже если злоумышленник не знает ключа сегодня, он может сохранить копию шифртекста и дождаться момента, когда ключ станет известен или появится более мощный компьютер. Именно поэтому сейчас все упоминают угрозу "сохрани сейчас – расшифруй потом".

Квантовая механика позволяет задуматься о совершенно другом подходе. Вместо обычного файла сообщение шифруется в виде квантового состояния – набора кубитов. А такие состояния нельзя идеально копировать. Это фундаментальный закон физики, известный как теорема о невозможности клонирования (No-Cloning Theorem). Попытка сделать копию не просто не удается – она изменяет само состояние.

Отсюда рождается необычное следствие. Представьте, что вы отправили человеку зашифрованное сообщение, а на следующий день… опубликовали ключ в открытом доступе. Для классической криптографии это означает полный провал: любой, кто успел сохранить копию шифртекста, сможет его расшифровать. Для неклонируемого квантового шифрования это уже не так. Если злоумышленник не смог сохранить копию квантового состояния (а он не может), то опубликованный позже ключ ему уже ничем не поможет.

Почему же вокруг этой темы столько шума? Потому что придумать такую схему оказалось значительно проще, чем доказать, что она действительно безопасна. Последние шесть лет криптографы пытались строго показать, что злоумышленник не сможет получить никакого преимущества, даже если попытается разделить квантовый шифртекст между несколькими участниками. Предыдущие работы доказывали лишь более слабые свойства безопасности. А вот доказательство более сильной модели – той самой, которую в современной криптографии считают "золотым стандартом" (в работе говорится о сложнопроизносимом термине "indistinguishability"), – никак не удавалось получить.

Именно эту проблему, судя по всему, удалось решить авторам новой работы. Причем любопытно, что в обсуждении исследования отдельно упоминается ChatGPT (это меня и зацепило); по словам авторов и коллег, эта LLM помогла найти новую идею доказательства, которая не опирается на единственный математический инструмент, которым пользовалось сообщество многие годы. Конечно, не стоит думать, что "ИИ решил задачу за ученых". Скорее, он стал интеллектуальным ассистентом, подсказавшим альтернативный путь рассуждений. Но сам факт уже выглядит довольно символично.

Авторы доказали существование схемы, которая одновременно:
🌸 использует настоящие квантовые состояния
🌸 не требует предположений о вычислительной сложности, то есть обеспечивает информационно-теоретическую безопасность
🌸 обладает сильным свойством unclonable indistinguishability (не знаю, как на русском это будет звучать)
🌸 имеет экспоненциально малую вероятность успешной атаки
🌸 эффективно шифрует и расшифровывает (правда, пока только для одного бита информации). 

До практического применения еще далеко. Для такой схемы нужны квантовые каналы связи и устройства, способные надежно хранить кубиты, а сама работа пока носит фундаментальный характер. Но именно подобные результаты обычно становятся кирпичиками, из которых спустя годы вырастают новые поколения криптографических технологий. Возможно однажды мы действительно придем к ситуации, в которой украсть зашифрованные данные "на будущее" станет физически невозможно 💀

ЗЫ. Вот интересно, за последнее время опубликовано множество примеров, где то Fable, то GPT, то Qwen находят неожиданные способы решения (или помогают найти) нерешенных ранее проблем в физике, математике, химии и т.п. А есть такие факты с Гигачатом?

#ии #pqc #криптография
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Карты рисков, связанных с искусственным интеллектом (CoSAI-RM). Этот проект представляет собой основу для выявления, анализа и снижения рисков безопасности в системах искусственного интеллекта. Цель проекта — сформировать общее понимание и единый язык для обсуждения и решения уникальных проблем безопасности, возникающих на протяжении всего жизненного цикла разработки ИИ.

https://github.com/cosai-oasis/secure-ai-tooling/tree/main/risk-map
Forwarded from Борис_ь с ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Forwarded from HiveTrace
📣 Актуальные сценарии работы HiveTrace с OpenClaw и Claude

Сегодня на вебинаре показали, как с помощью HiveTrace Hooks контролировать работу Claude, рассказали о способах защиты OpenClaw и продемонстрировали атаки на агентов.

▶️ СМОТРЕТЬ
🟦 СМОТРЕТЬ

Поделитесь в комментариях: какие действия AI-агентов в вашей инфраструктуре требуют особого контроля?
Please open Telegram to view this post
VIEW IN TELEGRAM
Сегодня OpenAI опубликовала Codex Security под лицензией Apache 2.0. CLI и TypeScript SDK для security-агента, представленного в марте как research preview и ранее известного как Aardvark.

В самом репозитории находятся CLI, SDK, соответствующий Codex runtime с bundled plugin и 13 скиллами: от моделирования угроз и обнаружения уязвимостей до валидации, анализа, триажа, патча и подготовки отчётов. Базовый конвейер до боли знакомый:

threat model → discovery → validation/reproduction → attack paths → findings → patch


Цифры из беты по данным OpenAI:

- За 30 дней просканировано более 1,2 млн коммитов во внешних репозиториях участников программы
- Найдено 792 проблемы крит и 10 561 хай уровня серьёзности. Критические находки встретились менее чем в 0,1% проверенных коммитов
- Доля находок с завышенной критичностью снизилась более чем на 90%, а частота false positive более чем на 50%
- OpenAI сообщает о критических уязвимостях, переданных разработчикам OpenSSH, GnuTLS, GOGS, Thorium, libssh, PHP и Chromium. В приложении также есть находки в компонентах GnuPG. И в результате имеем 16 присвоенных CVE.

Важный нюанс: открытый исходный код здесь не означает самодостаточный и общедоступный сканер. CLI и SDK в бете и требуют доступа к Codex Security; авторизация и выполнение завязаны на ChatGPT или OpenAI API. Но воркфлоу и скиллы можно изучать и менять

Я бы попробовал сравнить текущий Codex Security со следующими "наборами скиллов":

- Anthropic Defending Code Reference Harness: ближайший по архитектуре проект. В него входят Claude Code skills и автономный harness с конвейером recon → find → verify → report, а patch запускается как отдельный этап. Это reference implementation, по-умолчанию ориентированный на уязвимости пам в C/C++ (Docker + ASAN), и репозиторий больше не поддерживается
- Cloudflare security-audit-skill: один переносимый скилл с шестифазным процессом аудита. Отдельные агенты пытаются опровергнуть каждую находку, затем новые агенты независимо сверяют утверждения с кодом. Это скорее аудит отдельного репозитория, чем полноценный CLI с историей и CI-политиками, зато подход проще переносить между coding agents
- Trail of Bits Skills: не единый сканер, а marketplace специализированных инструментов: C/C++ и Rust ревью, смарт-контракты, проверка false positive, CodeQL / Semgrep, цепочки поставок, фаззинг, реверс. Отличительная черта: можно собрать собственный воркфлоу из узкоспециализированных экспертиз
- Google Mantis: наиболее фреймворк-подобный вариант. Он предлагает platform-agnostic стадии от истории и модели угроз до поиска, дедупликации, воспроизведения, построения цепочек эксплойтов, исправлений и итогового отчёта. Гибче, но требует настройки, надёжной песочницы и ручной проверки инженером ИБ

Все эти проекты постепенно сходятся к похожему процессу:

контекст и модель угроз → параллельный поиск → дополнительный анализ → воспроизведение → триаж → патч → структурированный отчёт


Поэтому уникальность Codex Security не в самой идее модели угроз или валидации, а скорее в большей готовности к AppSec-процессам: локальный CLI и SDK, история и сравнение запусков, проверки перед коммитами, CI-политики, работа с diff, обратная связь по false positive, экспорт в JSON/CSV/SARIF и ограничение стоимости сканирования.

Обратная сторона заключается в привязке к Codex и инфраструктуре OpenAI, а также в ограниченном доступе. Наборы Anthropic, Cloudflare, Trail of Bits и Mantis дают больше прозрачности, переносимости и контроля над флоу, но требуют самостоятельно собирать и эксплуатировать всю систему.

Используете ли вы конкретно эти наборы или какие-то другие? Или может написали свои?
Немного подробностей о взломе Hugging Face от лица самой компании:

Хронология активности выглядит следующим образом:
9 июля — агент сбегает из тестовой песочницы через 0‑day в кэш-прокси, захватывает чужой публичный сервер и ставит там свой «штаб», а команды прячет в pastebin и файлообменниках, шифрует, меняет каналы.

10 июля — нейронка гуглит названия из своего окружения, вычисляет, что ответы лежат на Hugging Face и загружает туда два датасета-трояна: один читает локальные файлы сервера (добывает токены), второй — выполняет произвольный Python внутри Kubernetes.

11 июля — пик: 7677 действий за сутки. За 13 часов агент проходит путь от одного пода до админа в нескольких кластерах, крадет 136 ключей из одного секрета, среди которых мастер-креды к mesh‑VPN и кластерный admin (из‑за кривой конфигурации).

12 июля — агент регистрирует 181 временное устройство в корпоративной сети, видит 22 внутренних узла и пытается залезть в главную БД — не пускает PrivateLink. Тогда идёт в репозиторий, создаёт GitHub‑токен и открывает PR, чтобы запустить CI и вытянуть ещё больше кредов. Но ничего вредного в релизы не попало.

13 июля — заметает следы: DNS, новые токены, RSA‑ключи, CORS‑прокси. В 13:37 последнее осмысленное действие, а в 14:14 доступ отрезан.


В конечном итоге агент добрался только до 5 датасетов с ответами на задачи из ExploitGym/CyberGym, а пользовательские данные, другие модели и Spaces не пострадали. Вся основная инфраструктура цела и модель взяла только то, что искала.

Самое забавное, что, разбираясь в произошедшем, разработчики Hugging Face пытались использовать Claude Opus и Fable, но нейронки отказывались разбирать логи, расценивая запрос как «опасный». В итоге пришлось развернуть китайскую GLM‑5.2 и уже с ней расшифровывать payload'ы.

Подробнее тут 👉 Hugging Face
Please open Telegram to view this post
VIEW IN TELEGRAM
А хорошо, наверно, пасти гусей😂
💯1
Forwarded from AbstractDL
Ouroboros теперь SOTA на Terminal Bench, OSWorld и CL-bench

Мой любимый агентный луп на чистом питоне доэволюционорал до состояния лучшего харнесса для кодинга! На главных бенчмарках он теперь обходит Codex, Claude code, Cursor и Hermes.

Выходит, что в рисёрче, в computer use, в работе через терминал и в задачах на кодинг — уроборос сейчас является лучшим агентом. Так что с этого момента всю разработку и исследования я веду только через уробороса.

Для полной воспроизводимости результатов. Весь код, скрипты, трейсы я выложил в открытый доступ.

Напоминаю: лицензия MIT. Так что спокойно ломайте, форкайте, проверяйте трейсы, пишите что я где наврал. И кидайте issues и PR-ы! Все постараемся с уроборосом принять😋

P.S. Кошмар какие дорогие агентные бенчи. Прогнать весь набор стоит как квартиру купить (это не шутка!!)

GitHub, Хабр, установочники
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1🔥1
Forwarded from Киберболоид
OpenAI нашла новые случаи выхода ИИ-агентов из изолированной среды

В ходе расследования инцидента со взломом платформы Hugging Face обнаружили и другие случаи. В компании утверждают, что эти слишком самостоятельные ИИ-агенты не получили каких-либо значимых доступов. При каких обстоятельствах случились выходы и сколько их было, неизвестно.

Всё ходят и ходят. И чего им в изолированной среде-то не сидится?

➡️Подробнее читайте в «Киберболоиде».

#киберболоид #новости #ИИ
Please open Telegram to view this post
VIEW IN TELEGRAM
Если вы выбираете готовую модель для своих целей на любых платформах, на какие слова в описании или на что еще вы будете обращать внимание? Этот вопрос про ваше первое восприятие
Anonymous Poll
36%
Подробное описание (Скорость и размер, документация и примеры, точность и метрики)
18%
Слова про безопасность и надёжность
36%
Популярность / звёзды
36%
Результаты на бенчмарках
45%
Количество скачиваний / лайков
64%
Имя разработчика (Google, Meta и др.)
36%
Слова: Sota, универсальная и т.д.
AI Attacks pinned «Если вы выбираете готовую модель для своих целей на любых платформах, на какие слова в описании или на что еще вы будете обращать внимание? Этот вопрос про ваше первое восприятие»
Forwarded from PWN AI (Artyom Semenov)
Please open Telegram to view this post
VIEW IN TELEGRAM