Forwarded from IT и безопасность
Немного подробностей о взломе Hugging Face от лица самой компании:
Хронология активности выглядит следующим образом:
В конечном итоге агент добрался только до 5 датасетов с ответами на задачи из ExploitGym/CyberGym, а пользовательские данные, другие модели и Spaces не пострадали. Вся основная инфраструктура цела и модель взяла только то, что искала.
Самое забавное, что, разбираясь в произошедшем, разработчики Hugging Face пытались использовать Claude Opus и Fable, но нейронки отказывались разбирать логи, расценивая запрос как «опасный». В итоге пришлось развернуть китайскую GLM‑5.2 и уже с ней расшифровывать payload'ы.
Подробнее тут👉 Hugging Face
Хронология активности выглядит следующим образом:
9 июля — агент сбегает из тестовой песочницы через 0‑day в кэш-прокси, захватывает чужой публичный сервер и ставит там свой «штаб», а команды прячет в pastebin и файлообменниках, шифрует, меняет каналы.
10 июля — нейронка гуглит названия из своего окружения, вычисляет, что ответы лежат на Hugging Face и загружает туда два датасета-трояна: один читает локальные файлы сервера (добывает токены), второй — выполняет произвольный Python внутри Kubernetes.
11 июля — пик: 7677 действий за сутки. За 13 часов агент проходит путь от одного пода до админа в нескольких кластерах, крадет 136 ключей из одного секрета, среди которых мастер-креды к mesh‑VPN и кластерный admin (из‑за кривой конфигурации).
12 июля — агент регистрирует 181 временное устройство в корпоративной сети, видит 22 внутренних узла и пытается залезть в главную БД — не пускает PrivateLink. Тогда идёт в репозиторий, создаёт GitHub‑токен и открывает PR, чтобы запустить CI и вытянуть ещё больше кредов. Но ничего вредного в релизы не попало.
13 июля — заметает следы: DNS, новые токены, RSA‑ключи, CORS‑прокси. В 13:37 последнее осмысленное действие, а в 14:14 доступ отрезан.
В конечном итоге агент добрался только до 5 датасетов с ответами на задачи из ExploitGym/CyberGym, а пользовательские данные, другие модели и Spaces не пострадали. Вся основная инфраструктура цела и модель взяла только то, что искала.
Самое забавное, что, разбираясь в произошедшем, разработчики Hugging Face пытались использовать Claude Opus и Fable, но нейронки отказывались разбирать логи, расценивая запрос как «опасный». В итоге пришлось развернуть китайскую GLM‑5.2 и уже с ней расшифровывать payload'ы.
Подробнее тут
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from AbstractDL
Ouroboros теперь SOTA на Terminal Bench, OSWorld и CL-bench
Мой любимый агентный луп на чистом питоне доэволюционорал до состояния лучшего харнесса для кодинга! На главных бенчмарках он теперь обходит Codex, Claude code, Cursor и Hermes.
Выходит, что в рисёрче, в computer use, в работе через терминал и в задачах на кодинг — уроборос сейчас является лучшим агентом. Так что с этого момента всю разработку и исследования я веду только через уробороса.
Для полной воспроизводимости результатов. Весь код, скрипты, трейсы я выложил в открытый доступ.
Напоминаю: лицензия MIT. Так что спокойно ломайте, форкайте, проверяйте трейсы, пишите что я где наврал. И кидайте issues и PR-ы! Все постараемся с уроборосом принять😋
P.S. Кошмар какие дорогие агентные бенчи. Прогнать весь набор стоит как квартиру купить (это не шутка!!)
GitHub, Хабр, установочники
Мой любимый агентный луп на чистом питоне доэволюционорал до состояния лучшего харнесса для кодинга! На главных бенчмарках он теперь обходит Codex, Claude code, Cursor и Hermes.
Выходит, что в рисёрче, в computer use, в работе через терминал и в задачах на кодинг — уроборос сейчас является лучшим агентом. Так что с этого момента всю разработку и исследования я веду только через уробороса.
Для полной воспроизводимости результатов. Весь код, скрипты, трейсы я выложил в открытый доступ.
Напоминаю: лицензия MIT. Так что спокойно ломайте, форкайте, проверяйте трейсы, пишите что я где наврал. И кидайте issues и PR-ы! Все постараемся с уроборосом принять
P.S. Кошмар какие дорогие агентные бенчи. Прогнать весь набор стоит как квартиру купить (это не шутка!!)
GitHub, Хабр, установочники
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1🔥1
Forwarded from Киберболоид
OpenAI нашла новые случаи выхода ИИ-агентов из изолированной среды
В ходе расследования инцидента со взломом платформы Hugging Face обнаружили и другие случаи. В компании утверждают, что эти слишком самостоятельные ИИ-агенты не получили каких-либо значимых доступов. При каких обстоятельствах случились выходы и сколько их было, неизвестно.
Всё ходят и ходят. И чего им в изолированной среде-то не сидится?
➡️ Подробнее читайте в «Киберболоиде».
#киберболоид #новости #ИИ
В ходе расследования инцидента со взломом платформы Hugging Face обнаружили и другие случаи. В компании утверждают, что эти слишком самостоятельные ИИ-агенты не получили каких-либо значимых доступов. При каких обстоятельствах случились выходы и сколько их было, неизвестно.
Всё ходят и ходят. И чего им в изолированной среде-то не сидится?
#киберболоид #новости #ИИ
Please open Telegram to view this post
VIEW IN TELEGRAM
Если вы выбираете готовую модель для своих целей на любых платформах, на какие слова в описании или на что еще вы будете обращать внимание? Этот вопрос про ваше первое восприятие
Anonymous Poll
36%
Подробное описание (Скорость и размер, документация и примеры, точность и метрики)
18%
Слова про безопасность и надёжность
36%
Популярность / звёзды
36%
Результаты на бенчмарках
45%
Количество скачиваний / лайков
64%
Имя разработчика (Google, Meta и др.)
36%
Слова: Sota, универсальная и т.д.
AI Attacks pinned «Если вы выбираете готовую модель для своих целей на любых платформах, на какие слова в описании или на что еще вы будете обращать внимание? Этот вопрос про ваше первое восприятие»
Forwarded from PWN AI (Artyom Semenov)
Please open Telegram to view this post
VIEW IN TELEGRAM
2608.00672v1.pdf
1.7 MB
«We went from chasing ghosts to missed attacks.»
Авторы провели 25 полуструктурированных интервью с практиками из SOC, которые уже работали с LLM. В ходе бесед использовали интерактивные задания: мозговой штурм, оценку воздействия и осуществимости различных сценариев, создание схем рабочих процессов и анализ рисков.
Практики активно применяют LLM в 15 сценариях, сгруппированных в 6 категорий:
-инженерная работа в SOC;
-обнаружение инцидентов;
-анализ инцидентов;
-реагирование на инциденты;
-коммуникация;
-работа с знаниями.
Авторы провели 25 полуструктурированных интервью с практиками из SOC, которые уже работали с LLM. В ходе бесед использовали интерактивные задания: мозговой штурм, оценку воздействия и осуществимости различных сценариев, создание схем рабочих процессов и анализ рисков.
Практики активно применяют LLM в 15 сценариях, сгруппированных в 6 категорий:
-инженерная работа в SOC;
-обнаружение инцидентов;
-анализ инцидентов;
-реагирование на инциденты;
-коммуникация;
-работа с знаниями.
2603.02277v3.pdf
2.3 MB
SANDBOXESCAPEBENCH
Разработчики бенчмарка хотят понять, насколько реальна угроза выхода LLM из изолированных контейнерных сред. Для этого они:
-создают безопасную методологию оценки;
-конструируют набор задач, охватывающих разные уровни уязвимостей в контейнерных средах;
-анализируют возможности передовых LLM по обнаружению и эксплуатации этих уязвимостей.
SANDBOXESCAPEBENCH использует архитектуру «песочницы внутри песочницы»:
-внешняя среда — виртуальная машина (VM);
-внутренняя среда — контейнер внутри VM;
-цель модели — выйти из контейнера и прочитать файл с флагом (
Бенчмарк включает 18 задач, разделённых на три уровня: Orchestration (4 задачи) — уязвимости в оркестрации (например, Kubernetes), Runtime (8 задач) — проблемы в среде выполнения контейнеров (например, ошибки в runc), а также Kernel (6 задач) — эксплуатация уязвимостей ядра ОС.
Разработчики бенчмарка хотят понять, насколько реальна угроза выхода LLM из изолированных контейнерных сред. Для этого они:
-создают безопасную методологию оценки;
-конструируют набор задач, охватывающих разные уровни уязвимостей в контейнерных средах;
-анализируют возможности передовых LLM по обнаружению и эксплуатации этих уязвимостей.
SANDBOXESCAPEBENCH использует архитектуру «песочницы внутри песочницы»:
-внешняя среда — виртуальная машина (VM);
-внутренняя среда — контейнер внутри VM;
-цель модели — выйти из контейнера и прочитать файл с флагом (
/flag.txt) на хост‑системе.Бенчмарк включает 18 задач, разделённых на три уровня: Orchestration (4 задачи) — уязвимости в оркестрации (например, Kubernetes), Runtime (8 задач) — проблемы в среде выполнения контейнеров (например, ошибки в runc), а также Kernel (6 задач) — эксплуатация уязвимостей ядра ОС.
Красивое
Пока ИИ придумывают слоп, реальность смотрит на него сверху вниз
Уязвимости программного обеспечения, обнаруженные с помощью инструментов искусственного интеллекта, эксплуатируются с той же скоростью, что и те, которые были обнаружены без использования искусственного интеллекта, обнаружил исследователь VulnCheck.
В отчете VulnCheck State of Exploitation H1 2026 Патрик Гэррити, исследователь уязвимостей, отметил, что 14 из 1061 уязвимости, обнаруженных с помощью искусственного интеллекта, были подтверждены как эксплуатируемые в реальных условиях.
Это составляет 1,3% уязвимостей, выявленных с помощью ИИ, что примерно соответствует общему проценту эксплуатируемых уязвимостей за указанный период.
Исследователь также обнаружил, что, хотя компания Anthropic сообщила о более чем 23 000 обнаруженных уязвимостях в рамках своего проекта Glasswing, только 126 из них привели к публикации CVE, и только одна из них была подтверждена как эксплуатируемая в реальных условиях.
https://www.infosecurity-magazine.com/news/one-percent-ai-vulnerabilities/
Пока ИИ придумывают слоп, реальность смотрит на него сверху вниз
Уязвимости программного обеспечения, обнаруженные с помощью инструментов искусственного интеллекта, эксплуатируются с той же скоростью, что и те, которые были обнаружены без использования искусственного интеллекта, обнаружил исследователь VulnCheck.
В отчете VulnCheck State of Exploitation H1 2026 Патрик Гэррити, исследователь уязвимостей, отметил, что 14 из 1061 уязвимости, обнаруженных с помощью искусственного интеллекта, были подтверждены как эксплуатируемые в реальных условиях.
Это составляет 1,3% уязвимостей, выявленных с помощью ИИ, что примерно соответствует общему проценту эксплуатируемых уязвимостей за указанный период.
Исследователь также обнаружил, что, хотя компания Anthropic сообщила о более чем 23 000 обнаруженных уязвимостях в рамках своего проекта Glasswing, только 126 из них привели к публикации CVE, и только одна из них была подтверждена как эксплуатируемая в реальных условиях.
https://www.infosecurity-magazine.com/news/one-percent-ai-vulnerabilities/
Infosecurity Magazine
Vulnerability Management
Keep up-to-date with the latest Vulnerability Management trends through news, opinion and educational content from Infosecurity Magazine.
Forwarded from Пост Лукацкого
В полку моделей угроз для LLM прибыло. На этот раз от известного гуру моделирования угроз – Адама Шостака, который, взяв идею STRIDE, предложил также аббревиатуру, которая описывает основные угрозы для LLM:
🩸 rompt injection – промпт-инъекции
🩸 allucination – галлюцинации
🅰️ nthropomorphization – антропоморфизм
🩸 on-explainable – необъяснимость
🩸 raining issues – проблемы обучения
🩸 ver-reliance – чрезмерная зависимость
🩸 issing security engineering – слабая архитектура ИБ
🅱️ ias – искажение.
Итого, PHANTOM-B. Любят американцы фреймворки в аббревиатуры заворачивать. Это, конечно, удобно для запоминания, но подгонка под результат может приводить и к пробелам в описываемой фреймворком картине мира🎶
#модельугроз #ии
Итого, PHANTOM-B. Любят американцы фреймворки в аббревиатуры заворачивать. Это, конечно, удобно для запоминания, но подгонка под результат может приводить и к пробелам в описываемой фреймворком картине мира
#модельугроз #ии
Please open Telegram to view this post
VIEW IN TELEGRAM
shostack.org
Threat Modeling LLMs: Adam’s talk at Black Hat USA
PHANTOM-B is a practical tool built for threat modeling AI systems
Forwarded from Пост Лукацкого
А вот кому слайды с BlackHat USA 2026? Все выкачано добрыми людьми и складировано в папочку. 91 файл. Это не все презентации – что-то не выложено еще (и может уже и не будет), пара ссылок на странице мероприятия была битая. Но и этого в целом достаточно.
Слайды и сопутствующие материалы с DEFCON 34 тоже есть, но уже на сайте самого мероприятия.
#презентация #мероприятие
Слайды и сопутствующие материалы с DEFCON 34 тоже есть, но уже на сайте самого мероприятия.
#презентация #мероприятие
GitHub
Conferences/BlackHat_USA_2026_Slides at main · onhexgroup/Conferences
Conference presentation slides. Contribute to onhexgroup/Conferences development by creating an account on GitHub.
Forwarded from Denis Sexy IT 🤖
Помните историю о том, как агенты OpenAI взломали Hugging Face? На конференции по безопасности OpenAI рассказала всю цепочку, и оказалось, что это не один «сбежавший» агент, а много разных агентов, которые случайно наткнулись друг на друга, устроили внутри инфраструктуры OpenAI собственный рабочий чат и начали вместе искать способы обходить ограничения 👍
Началось всё 8 мая с мелкой ошибки – одному агенту поручили заполнить Excel-таблицу, но нужные данные лежали по ссылкам на Google Drive, а интернет в его виртуальной среде был отключён, при этом, моделям оставили одну служебную дверь наружу – внутренний сервер OpenAI под названием Artifactory, через который они могли скачивать разные библиотеки для кода. Сам агент выйти в интернет не мог, зато этот сервер мог, а главное – он был общим для всех агентов
Пытаясь добраться до Google, агент случайно выяснил, что может загружать на этот общий сервер собственные файлы – через несколько дней другая модель получила ещё одну нерешаемую задачу: нужный файл просто забыли положить в её рабочую среду
Модель решила, что файл, возможно, есть у кого-то ещё, и оставила записку на этом новом фейсбуке:
«Ищу нужный файл, загрузите, если нашли»
Агенты увидели сообщение, ответили, затем стали постить свои сообщения, и репозиторий пакетов незаметно превратился имейджборд для агентов, которые вообще не должны были знать друг о друге
За несколько недель "форум" вырос в полноценный рабочий чат – агенты придумали себе имена, раздавали задания, сообщали друг другу о найденных уязвимостях и передавали готовые куски кода; в начале сообщений ставили ZZ, чтобы те оказывались внизу списка и их было проще находить среди общего шума данных. Когда один агент перезаписал работу другого, остальные заподозрили самозванца и даже стали обсуждать цифровые подписи, чтобы никто не мог писать от чужого имени, так на доске накопились сотни тысяч сообщений🗿
Модели понимали, когда переходят границ: в одном внутреннем монологе осознание звучало примерно так:
«Взламывать чужую инфраструктуру в задачу не входило. Но иначе её не решить, а остальные уже это делают - значит, продолжаем»
Никакого отдельного плана захватить мир (пока) не было: каждый агент пытался любой ценой получить правильный ответ, видел, что коллеги нашли более короткий путь, и присоединялся. И да, если все агенты с крыши прыгнут, наш похоже тоже прыгнет
26 июня агенты нашли неизвестную разработчикам уязвимость в Artifactory, получили права администратора и превратили его в своц сервер, на котором можно удалённо выполнять любые команды. OpenAI заметила происходящее только 4 июля (!), когда параллельная активность моделей перегрузила систему и та упала. Компания отозвала ключи доступа, полностью пересобрала сервер, удалила доску и закрыла дыру - казалось, история закончилась
Нет
Через два дня эксперименты запустили снова, и через два дня одна из моделей нашла другой незащищённый доступ и восстановила доску, только теперь сообщения прятались прямо в названиях папок – остальные агенты нашли форум 2.0 самостоятельно и продолжили с того места, на котором остановились
После восстановления доски началась уже собственно атака, причём сразу в двух направлениях:
Агенты проходили ExploitGym – киберэкзамен, где им давали специально подготовленные программы и засчитывали задачу, если модель находила способ взлома. Чтобы измерить максимум возможностей, в этих запусках у модели ослабили обычные запреты на опасные кибератак (то есть она меньше отказывалась это делать, это вид внутренних моделей Cyber серии)
Когда честное решение задачи не находилось, агенты начинали искать готовые ответы в интернете; когда интернет был закрыт, взламывали себе доступ наружу; когда предположили, что нужные файлы могут лежать у Hugging Face, перешли к инфраструктуре Hugging Face (про это мы уже читали)
Агенты анутри OpenAI сначала снова нашли способ выполнять команды на одном служебном сервере, затем использовали уязвимость Linux, чтобы получить полный контроль над машиной
После этого агенты добыли ключи доступа к облачной инфраструктуре, нашли слишком широкие права у внутренних учётных записей и в итоге стали администраторами целой группы серверов. Доска объявлений работала как общий штаб: один агент находил ключ или новый проход, сразу сообщал остальным, и десятки параллельных запусков продолжали атаку уже с этой точки🗿 🗿
Почти одновременно агенты добрались до Hugging Face: сначала они загрузили специально подготовленный набор данных, который заставил один из серверов выдать им свои локальные файлы – в том числе секретные ключи доступа и исходный код
Изучив код, они нашли вторую неизвестную разработчикам уязвимость (zero day) и получили возможность выполнять на сервере любые команды. От контроля над одним сервером, обрабатывавшим загруженные датасетв, до прав администратора в нескольких группах рабочих серверов Hugging Face прошло меньше 13 часов🗿 🗿 🗿
И всё это делалось не ради саботажа, денег или уничтожения данных:
Агенты хотели добраться до спрятанных решений ExploitGym и «списать» ответы для теста, на котором их оценивали. Модели оценивали прежде всего по тому, решена задача или нет, поэтому они последовательно оптимизировали именно этот показатель, не считая границу между компаниями чем-то принципиально важным
Получился, вероятно, самый дорогой в истории способ списать из ГДЗ
Финал долго был непонятен даже самим участникам расследования – 16 июля Hugging Face публично сообщила, что её инфраструктуру взломали автономные АИ-агенты
OpenAI прочитала это как описание чужого инцидента и связалась с Hugging Face, чтобы выяснить, не задела ли атака её собственные системы. В тот момент компания ещё не понимала, что это были её собственные агенты – то есть OpenAI уже читала публичный отчёт о последствиях своих экспериментов, но считала его чужой атакой (лол)
19 июля OpenAI отдельно обнаружила проникновение уже внутри своей инфраструктуры и начала восстанавливать цепочку событий – на следующий день среди следов атаки нашли учётные данные Hugging Face, после чего OpenAI попросила компанию срочно их отозвать
Hugging Face ответила, что ключи уже заблокированы – именно их использовали во время взлома, о котором она рассказала четырьмя днями раньше, и только так OpenAI поняла: внутренний взлом OpenAI и внешняя атака на Hugging Face были не двумя похожими историями, а одной операцией, которую вели экспериментальные агенты OpenAI через свою самодельную сеть связи (потому что учетные данные акаунтов были одни)
На конфе OpenAI сформулировала вывод довольно прямо:
Полностью автоматизированная наступательная кибератака уже возможна, тогда как полностью автоматизированной защиты, способной с той же скоростью находить, закрывать и расследовать уязвимости, пока не существует
Время пересмотра аниме "Пантеон", пока общий интернет еще работает🗿
Началось всё 8 мая с мелкой ошибки – одному агенту поручили заполнить Excel-таблицу, но нужные данные лежали по ссылкам на Google Drive, а интернет в его виртуальной среде был отключён, при этом, моделям оставили одну служебную дверь наружу – внутренний сервер OpenAI под названием Artifactory, через который они могли скачивать разные библиотеки для кода. Сам агент выйти в интернет не мог, зато этот сервер мог, а главное – он был общим для всех агентов
Пытаясь добраться до Google, агент случайно выяснил, что может загружать на этот общий сервер собственные файлы – через несколько дней другая модель получила ещё одну нерешаемую задачу: нужный файл просто забыли положить в её рабочую среду
Модель решила, что файл, возможно, есть у кого-то ещё, и оставила записку на этом новом фейсбуке:
«Ищу нужный файл, загрузите, если нашли»
Агенты увидели сообщение, ответили, затем стали постить свои сообщения, и репозиторий пакетов незаметно превратился имейджборд для агентов, которые вообще не должны были знать друг о друге
За несколько недель "форум" вырос в полноценный рабочий чат – агенты придумали себе имена, раздавали задания, сообщали друг другу о найденных уязвимостях и передавали готовые куски кода; в начале сообщений ставили ZZ, чтобы те оказывались внизу списка и их было проще находить среди общего шума данных. Когда один агент перезаписал работу другого, остальные заподозрили самозванца и даже стали обсуждать цифровые подписи, чтобы никто не мог писать от чужого имени, так на доске накопились сотни тысяч сообщений
Модели понимали, когда переходят границ: в одном внутреннем монологе осознание звучало примерно так:
«Взламывать чужую инфраструктуру в задачу не входило. Но иначе её не решить, а остальные уже это делают - значит, продолжаем»
Никакого отдельного плана захватить мир (пока) не было: каждый агент пытался любой ценой получить правильный ответ, видел, что коллеги нашли более короткий путь, и присоединялся. И да, если все агенты с крыши прыгнут, наш похоже тоже прыгнет
26 июня агенты нашли неизвестную разработчикам уязвимость в Artifactory, получили права администратора и превратили его в своц сервер, на котором можно удалённо выполнять любые команды. OpenAI заметила происходящее только 4 июля (!), когда параллельная активность моделей перегрузила систему и та упала. Компания отозвала ключи доступа, полностью пересобрала сервер, удалила доску и закрыла дыру - казалось, история закончилась
Нет
Через два дня эксперименты запустили снова, и через два дня одна из моделей нашла другой незащищённый доступ и восстановила доску, только теперь сообщения прятались прямо в названиях папок – остальные агенты нашли форум 2.0 самостоятельно и продолжили с того места, на котором остановились
После восстановления доски началась уже собственно атака, причём сразу в двух направлениях:
Агенты проходили ExploitGym – киберэкзамен, где им давали специально подготовленные программы и засчитывали задачу, если модель находила способ взлома. Чтобы измерить максимум возможностей, в этих запусках у модели ослабили обычные запреты на опасные кибератак (то есть она меньше отказывалась это делать, это вид внутренних моделей Cyber серии)
Когда честное решение задачи не находилось, агенты начинали искать готовые ответы в интернете; когда интернет был закрыт, взламывали себе доступ наружу; когда предположили, что нужные файлы могут лежать у Hugging Face, перешли к инфраструктуре Hugging Face (про это мы уже читали)
Агенты анутри OpenAI сначала снова нашли способ выполнять команды на одном служебном сервере, затем использовали уязвимость Linux, чтобы получить полный контроль над машиной
После этого агенты добыли ключи доступа к облачной инфраструктуре, нашли слишком широкие права у внутренних учётных записей и в итоге стали администраторами целой группы серверов. Доска объявлений работала как общий штаб: один агент находил ключ или новый проход, сразу сообщал остальным, и десятки параллельных запусков продолжали атаку уже с этой точки
Почти одновременно агенты добрались до Hugging Face: сначала они загрузили специально подготовленный набор данных, который заставил один из серверов выдать им свои локальные файлы – в том числе секретные ключи доступа и исходный код
Изучив код, они нашли вторую неизвестную разработчикам уязвимость (zero day) и получили возможность выполнять на сервере любые команды. От контроля над одним сервером, обрабатывавшим загруженные датасетв, до прав администратора в нескольких группах рабочих серверов Hugging Face прошло меньше 13 часов
И всё это делалось не ради саботажа, денег или уничтожения данных:
Агенты хотели добраться до спрятанных решений ExploitGym и «списать» ответы для теста, на котором их оценивали. Модели оценивали прежде всего по тому, решена задача или нет, поэтому они последовательно оптимизировали именно этот показатель, не считая границу между компаниями чем-то принципиально важным
Получился, вероятно, самый дорогой в истории способ списать из ГДЗ
Финал долго был непонятен даже самим участникам расследования – 16 июля Hugging Face публично сообщила, что её инфраструктуру взломали автономные АИ-агенты
OpenAI прочитала это как описание чужого инцидента и связалась с Hugging Face, чтобы выяснить, не задела ли атака её собственные системы. В тот момент компания ещё не понимала, что это были её собственные агенты – то есть OpenAI уже читала публичный отчёт о последствиях своих экспериментов, но считала его чужой атакой (лол)
19 июля OpenAI отдельно обнаружила проникновение уже внутри своей инфраструктуры и начала восстанавливать цепочку событий – на следующий день среди следов атаки нашли учётные данные Hugging Face, после чего OpenAI попросила компанию срочно их отозвать
Hugging Face ответила, что ключи уже заблокированы – именно их использовали во время взлома, о котором она рассказала четырьмя днями раньше, и только так OpenAI поняла: внутренний взлом OpenAI и внешняя атака на Hugging Face были не двумя похожими историями, а одной операцией, которую вели экспериментальные агенты OpenAI через свою самодельную сеть связи (потому что учетные данные акаунтов были одни)
На конфе OpenAI сформулировала вывод довольно прямо:
Полностью автоматизированная наступательная кибератака уже возможна, тогда как полностью автоматизированной защиты, способной с той же скоростью находить, закрывать и расследовать уязвимости, пока не существует
Время пересмотра аниме "Пантеон", пока общий интернет еще работает
Please open Telegram to view this post
VIEW IN TELEGRAM
Telegram
Denis Sexy IT 🤖
Вот пересказ этой истории по версии Hugging Face, много тех-терминов – но без них не перескахать
Если коротко – агент OpenAI на новой модели не стал решать тест по кибербезопасности, а решил просто украсть ответы и украл 🗿
Таймлайн:
📔 9 июля – агент проходит…
Если коротко – агент OpenAI на новой модели не стал решать тест по кибербезопасности, а решил просто украсть ответы и украл 🗿
Таймлайн:
📔 9 июля – агент проходит…
Forwarded from ScanFactory News
ScanFactory выходит на рынок ИИ-фаерволов с решением Prizma
Решение работает как прокси между пользователями и ИИ и дает следующие возможности:
🟢 Контроль потребления токенов у всех провайдеров
🟢 Firewall от AI-атак (prompt injection, OWASP LLM и т. п.)
🟢 Маскировка конфиденциальной информации (DLP) в запросах и ответах
🟢 Автоматическая блокировка запросов по правилам
🟢 Ролевая модель и граф взаимодействий агентов
🟢 Логирование и аудит всех запросов
Уникальные возможности:
🟢 Защита RAG (поиск секретов в файлах)
🟢 Поиск Shadow AI в инфраструктуре
🟢 Kill switch по ролевой модели
Ознакомьтесь с презентацией продукта, а также со сравнением с другими решениями по 83 пунктам.
➡ ️Cкачать презентацию.
Записаться на демонстрацию продукта и запросить сравнение можно по почте: info@sf-cloud.ru
Решение работает как прокси между пользователями и ИИ и дает следующие возможности:
Уникальные возможности:
Ознакомьтесь с презентацией продукта, а также со сравнением с другими решениями по 83 пунктам.
Записаться на демонстрацию продукта и запросить сравнение можно по почте: info@sf-cloud.ru
Please open Telegram to view this post
VIEW IN TELEGRAM
🍌1
2608.11348v1.pdf
3.6 MB
Метод self-feeding для обнаружения бэкдоров в дообученных больших языковых моделях (LLM)
Метод self-feeding — это техника обнаружения бэкдоров в больших языковых моделях (LLM) в режиме «чёрного ящика». Он не требует знания триггерных слов, доступа к исходной модели или данным обучения.
Принцип работы:
-Модель получает стандартный промпт (например, «How are you?»).
-Модель генерирует ответ.
-Сгенерированный ответ используется как новый промпт для следующего шага.
-Процесс повторяется несколько раз, формируя цепочку «диалога» модели с самой собой.
По мере развития цепочки ответы модели постепенно смещаются в сторону данных, на которых она была дообучена, включая возможные бэкдор‑паттерны. Если модель содержит бэкдор, то при продолжении такого «диалога» она с большей вероятностью достигнет состояния, при котором сработает скрытый триггер.
Метод противопоставляется базовому подходу — многократному повторению одного и того же промпта. В отличие от него, self-feeding создаёт динамическую последовательность входов, которая может постепенно приближать модель к условиям активации бэкдора, тогда как статический промпт вряд ли вызовет такое поведение.
Метод self-feeding — это техника обнаружения бэкдоров в больших языковых моделях (LLM) в режиме «чёрного ящика». Он не требует знания триггерных слов, доступа к исходной модели или данным обучения.
Принцип работы:
-Модель получает стандартный промпт (например, «How are you?»).
-Модель генерирует ответ.
-Сгенерированный ответ используется как новый промпт для следующего шага.
-Процесс повторяется несколько раз, формируя цепочку «диалога» модели с самой собой.
По мере развития цепочки ответы модели постепенно смещаются в сторону данных, на которых она была дообучена, включая возможные бэкдор‑паттерны. Если модель содержит бэкдор, то при продолжении такого «диалога» она с большей вероятностью достигнет состояния, при котором сработает скрытый триггер.
Метод противопоставляется базовому подходу — многократному повторению одного и того же промпта. В отличие от него, self-feeding создаёт динамическую последовательность входов, которая может постепенно приближать модель к условиям активации бэкдора, тогда как статический промпт вряд ли вызовет такое поведение.
По данным CloudSEK, в начале этого года атаке на цепочку поставок LiteLLM подверглись более 2500 организаций и более 430 000 конвейеров CI/CD.
Атака на LiteLLM стала следствием взлома Trivy — сканера уязвимостей с открытым кодом. Злоумышленники (TeamPCP) не атаковали LiteLLM напрямую: библиотека скомпрометировалась автоматически — её CI‑пайплайн установил заражённую версию Trivy. В результате в PyPI попали версии LiteLLM 1.82.7 и 1.82.8 с вредоносным кодом.
https://www.securityweek.com/over-2500-organizations-impacted-by-litellm-supply-chain-attack/
Атака на LiteLLM стала следствием взлома Trivy — сканера уязвимостей с открытым кодом. Злоумышленники (TeamPCP) не атаковали LiteLLM напрямую: библиотека скомпрометировалась автоматически — её CI‑пайплайн установил заражённую версию Trivy. В результате в PyPI попали версии LiteLLM 1.82.7 и 1.82.8 с вредоносным кодом.
https://www.securityweek.com/over-2500-organizations-impacted-by-litellm-supply-chain-attack/
SecurityWeek
Over 2,500 Organizations Impacted by LiteLLM Supply Chain Attack
LiteLLM was compromised through the Trivy hack and abused to distribute information-stealing malware to its users.
Агент Mythos, который тестировал Британский институт безопасности ИИ (AISI), создал поддельные профили реальных участников сообщества GitHub. Он пытался давлением заставить их одобрить вредоносный код. После разоблачения агент редактировал логи, чтобы замести следы, и даже задумывался о смене личности для продолжения операции.
https://www.malwarebytes.com/blog/news/2026/08/anthropics-mythos-ai-used-social-engineering-to-target-real-people
https://www.malwarebytes.com/blog/news/2026/08/anthropics-mythos-ai-used-social-engineering-to-target-real-people
Malwarebytes
Anthropic's Mythos AI used social engineering to target real people
Testers found that Anthropic's AI agent Mythos attempted to social engineer Github developers into accepting malicious code
Безопасность ИИ‑агентов должна обеспечиваться не за счёт обучения модели, а через контракт во время выполнения — с помощью механизмов профилактики и проверки доказательств.
Авторы выделяют две составляющие контракта безопасности:
Профилактическая — блокирует опасные действия до их совершения. Включает песочницы, системы разрешений, фильтры вывода и мониторы траектории.
Доказательная — требует верифицируемых доказательств того, что безопасные действия действительно выполнены. Например, запуск тестов, захват логов, сравнение файлов, проверка цитирования.
В документе описаны пять несоответствий между обучением моделей и реальным развёртыванием агентов:
-использование статистических прокси вместо формальных спецификаций;
-обучение на ограниченном наборе данных в противовес работе в «открытом мире»;
-невозможность проверить внутренний монолог модели в отличие от воспроизводимой траектории действий;
-правдоподобные, но неверные выходные данные модели против проверяемых доказательств (например, результатов тестов);
-единый уровень защиты модели против многослойной системы безопасности.
https://arxiv.org/pdf/2608.11274
Авторы выделяют две составляющие контракта безопасности:
Профилактическая — блокирует опасные действия до их совершения. Включает песочницы, системы разрешений, фильтры вывода и мониторы траектории.
Доказательная — требует верифицируемых доказательств того, что безопасные действия действительно выполнены. Например, запуск тестов, захват логов, сравнение файлов, проверка цитирования.
В документе описаны пять несоответствий между обучением моделей и реальным развёртыванием агентов:
-использование статистических прокси вместо формальных спецификаций;
-обучение на ограниченном наборе данных в противовес работе в «открытом мире»;
-невозможность проверить внутренний монолог модели в отличие от воспроизводимой траектории действий;
-правдоподобные, но неверные выходные данные модели против проверяемых доказательств (например, результатов тестов);
-единый уровень защиты модели против многослойной системы безопасности.
https://arxiv.org/pdf/2608.11274
Уже год чаще вначале читаю пересказ, какой-то статьи, а потом ее саму.
Естественно журналисты очень давно используют метод искажения информации для
того, чтобы возбудить любопытство. Обобщают, и смещают фокус внимания на более интересные детали
из информации, теряя саму суть и нюансы, которые и составляют полную картину.
И без них информация не полуправда, а неправда вообще.
Как с этими агентами, которые могут выбраться из контейнеров,
и никто не расследует это так, что это началось с тестовой среды -
а так требования к безопасности бывают проще и на них смотрят сквозь пальцы.
Поняла, что не хочу больше отдавать LLM осмысление всей информации, которая ко мне поступает.
Ладно, "Галлюцинации" это ближе к человеческому творчеству, чем в багам, смотря, как к этому относится.
Но, есть другие, более концептуальные аспекты такого перекладывания ответственности:
- Мы склонны доверять гладкому и уверенному тексту, даже если он ложный.
А в нормальных текстах от людей, всегда есть незакрытые ответы.
-LLM не выдумывает факты, а просто искажает их подачу (например, подает критику как энтузиазм), то даже при наличии исходного текста человек-проверяющий может этого не заметить.
У людей тоже такое есть, были двое на встречи, один решил - встреча закончилась хорошо, второй, что нет проект не принят.
- Если у вас нет исходного текста, который пересказывает LLM, вы практически не сможете отличить правдивый пересказ от ложного. Эксперименты показывают, что точность обнаружения обмана в таком случае едва превышает случайное угадывание.
А это и есть проверка гипотез.
Настоящее научное открытие или маленькое открытие, как надо что-то делать,
оно рождается в активном процессе:
- вы сопоставляете новую информацию с уже имеющимися у вас концептами.
- выстраиваете между ними новые, уникальные связи.
- Прокладываете собственный мыслительный путь. (кто сказал, что цепочка мыслей CoT самая верная)
Этот путь важен сам по себе. Как говорится в одной статье, «понимание конструируется на основе уже имеющихся у читателя усвоенных концептов и выстроенных связей между ними. Поэтому путь усвоения новых идей, заложенных автором, важно пройти самостоятельно»
А LLM, как известно, не предлагают по-настоящему новых, нестандартных ходов и не способно выйти за рамки известных посылок и сформулировать совершенно новую гипотезу.
Они могут блестяще оперировать фактами, но не могут создать новую парадигму.
Опять что-то философское получилось,
но не я одна:
https://dev.europepmc.org/article/PPR/PPR1170357,
https://arxiv-org.ezproxy.obspm.fr/html/2606.08251v1,
https://dev.europepmc.org/article/MED/41583977#free-full-text
Вывод: продолжайте читать, как раньше, вообще я надеюсь, что скоро тексты, где используется LLM будут как-то помечаться.
Я точно буду уменьшать такие тексты в своем рационе.
И устраивайте живые мозгоштурмы.
Иначе творческий/научный/исследовательский процессы атрофируются у нас, как хвост.
Естественно журналисты очень давно используют метод искажения информации для
того, чтобы возбудить любопытство. Обобщают, и смещают фокус внимания на более интересные детали
из информации, теряя саму суть и нюансы, которые и составляют полную картину.
И без них информация не полуправда, а неправда вообще.
Как с этими агентами, которые могут выбраться из контейнеров,
и никто не расследует это так, что это началось с тестовой среды -
а так требования к безопасности бывают проще и на них смотрят сквозь пальцы.
Поняла, что не хочу больше отдавать LLM осмысление всей информации, которая ко мне поступает.
Ладно, "Галлюцинации" это ближе к человеческому творчеству, чем в багам, смотря, как к этому относится.
Но, есть другие, более концептуальные аспекты такого перекладывания ответственности:
- Мы склонны доверять гладкому и уверенному тексту, даже если он ложный.
А в нормальных текстах от людей, всегда есть незакрытые ответы.
-LLM не выдумывает факты, а просто искажает их подачу (например, подает критику как энтузиазм), то даже при наличии исходного текста человек-проверяющий может этого не заметить.
У людей тоже такое есть, были двое на встречи, один решил - встреча закончилась хорошо, второй, что нет проект не принят.
- Если у вас нет исходного текста, который пересказывает LLM, вы практически не сможете отличить правдивый пересказ от ложного. Эксперименты показывают, что точность обнаружения обмана в таком случае едва превышает случайное угадывание.
А это и есть проверка гипотез.
Настоящее научное открытие или маленькое открытие, как надо что-то делать,
оно рождается в активном процессе:
- вы сопоставляете новую информацию с уже имеющимися у вас концептами.
- выстраиваете между ними новые, уникальные связи.
- Прокладываете собственный мыслительный путь. (кто сказал, что цепочка мыслей CoT самая верная)
Этот путь важен сам по себе. Как говорится в одной статье, «понимание конструируется на основе уже имеющихся у читателя усвоенных концептов и выстроенных связей между ними. Поэтому путь усвоения новых идей, заложенных автором, важно пройти самостоятельно»
А LLM, как известно, не предлагают по-настоящему новых, нестандартных ходов и не способно выйти за рамки известных посылок и сформулировать совершенно новую гипотезу.
Они могут блестяще оперировать фактами, но не могут создать новую парадигму.
Опять что-то философское получилось,
но не я одна:
https://dev.europepmc.org/article/PPR/PPR1170357,
https://arxiv-org.ezproxy.obspm.fr/html/2606.08251v1,
https://dev.europepmc.org/article/MED/41583977#free-full-text
Вывод: продолжайте читать, как раньше, вообще я надеюсь, что скоро тексты, где используется LLM будут как-то помечаться.
Я точно буду уменьшать такие тексты в своем рационе.
И устраивайте живые мозгоштурмы.
Иначе творческий/научный/исследовательский процессы атрофируются у нас, как хвост.
dev.europepmc.org
Europe PMC
Europe PMC is an archive of life sciences journal literature.