Сегодня у меня на собеседование спросили: почему возможны промпт-инъекции в принципе?
Я поняла, что одной простой фразой не могу озвучить ответ.
А он звучит так: "LLM не всегда понимает даже по тегам, где системная инструкция , где пользовательский ввод".
Системные инструкции, пользовательские запросы и даже цепочки рассуждений (CoT) поступают в модель единым текстовым потоком из одного источника. Модель вынуждена полагаться лишь на условные теги и позиционные подсказки,
чтобы отличать «законодателя» от «исполнителя», — и именно эту иллюзию легко разрушить продуманной промпт-инъекцией.
Я инженер связи по образованию,
Работала со сложными мультиплексорными системами DWDM, например.
В каналах передачи данных всегда применяется жёсткое разделение: выделенный канал для синхронизации и отдельный для полезной нагрузки,
частотное или временное мультиплексирование,
многоуровневые заголовки — всё для того, чтобы служебная информация никогда не смешивалась с пользовательской полезной нагрузкой.
Ну, и конечно, чтобы уплотнить каналы и сделать передачу данных быстрее.
Стало интересно, а если ли исследования, где "каналы связи" для LLM разделяются?
Дальше не все прямо про разделение каналов, некоторые про другие принципы защиты от инъекций,
решила себе оставить в сохраненках)
Архитектурные решения на уровне модели:
-ASIDE предлагает разделять инструкции и данные на уровне эмбеддингов (векторных представлений слов). Вместо того чтобы смешивать все токены в одном пространстве, для данных используется отдельный, повернутый набор эмбеддингов. Это создает у модели четкое «разделение каналов» на самом глубинном уровне, что значительно повышает устойчивость к промпт-инъекциям без потери производительности.
https://ar5iv.labs.arxiv.org/html/2503.10566
- The Illusion of Role Separation показывает, что модели часто лишь делают вид, что различают роли, используя поверхностные эвристики (например, положение текста). Авторы предлагают усиливать инвариантные сигналы, например, манипулируя позиционными ID токенов, чтобы помочь модели выучить более надежное различие между ролями
https://ar5iv.labs.arxiv.org/html/2505.00626
Системные и архитектурные решения для агентов:
- Real User Instruction (RUI) — это «прослойка» (middleware), которая работает как криптографический «привилегированный канал» для инструкций пользователя. Она динамически «шифрует» состояние диалога, делая историю атак бесполезной и снижая успешность атак со 100% до 8.1%.
https://dtic.dimensions.ai/details/publication/pub.1199447527
- Dual LLM Pattern предлагает разделить обязанности между двумя моделями:
1.Explore Agent (разведывательный): Взаимодействует с недоверенными данными (сайты, документы).
2.Safe Agent (безопасный): Выполняет привилегированные действия на основе сжатых «подсказок» от первого агента.
https://arxiv-org.ezproxy.obspm.fr/html/2607.19595v1
- Twin Agent развивает эту идею, передавая между агентами только сжатые «подсказки» (hints), а не сырой текст. Это отлично работает в долгосрочных задачах, сохраняя высокую полезность и предотвращая атаки.
https://arxiv-org.ezproxy.obspm.fr/html/2607.19595v1
- Type-Directed Privilege Separation предлагает радикальный подход: преобразовывать все недоверенные данные в строго типизированные структуры (например, JSON) с ограниченным набором полей. Это полностью исключает возможность внедрения команд, так как данные просто не могут содержать исполняемый текст.
https://arxiv.org/pdf/2509.25926#4#1
Я поняла, что одной простой фразой не могу озвучить ответ.
А он звучит так: "LLM не всегда понимает даже по тегам, где системная инструкция , где пользовательский ввод".
Системные инструкции, пользовательские запросы и даже цепочки рассуждений (CoT) поступают в модель единым текстовым потоком из одного источника. Модель вынуждена полагаться лишь на условные теги и позиционные подсказки,
чтобы отличать «законодателя» от «исполнителя», — и именно эту иллюзию легко разрушить продуманной промпт-инъекцией.
Я инженер связи по образованию,
Работала со сложными мультиплексорными системами DWDM, например.
В каналах передачи данных всегда применяется жёсткое разделение: выделенный канал для синхронизации и отдельный для полезной нагрузки,
частотное или временное мультиплексирование,
многоуровневые заголовки — всё для того, чтобы служебная информация никогда не смешивалась с пользовательской полезной нагрузкой.
Ну, и конечно, чтобы уплотнить каналы и сделать передачу данных быстрее.
Стало интересно, а если ли исследования, где "каналы связи" для LLM разделяются?
Дальше не все прямо про разделение каналов, некоторые про другие принципы защиты от инъекций,
решила себе оставить в сохраненках)
Архитектурные решения на уровне модели:
-ASIDE предлагает разделять инструкции и данные на уровне эмбеддингов (векторных представлений слов). Вместо того чтобы смешивать все токены в одном пространстве, для данных используется отдельный, повернутый набор эмбеддингов. Это создает у модели четкое «разделение каналов» на самом глубинном уровне, что значительно повышает устойчивость к промпт-инъекциям без потери производительности.
https://ar5iv.labs.arxiv.org/html/2503.10566
- The Illusion of Role Separation показывает, что модели часто лишь делают вид, что различают роли, используя поверхностные эвристики (например, положение текста). Авторы предлагают усиливать инвариантные сигналы, например, манипулируя позиционными ID токенов, чтобы помочь модели выучить более надежное различие между ролями
https://ar5iv.labs.arxiv.org/html/2505.00626
Системные и архитектурные решения для агентов:
- Real User Instruction (RUI) — это «прослойка» (middleware), которая работает как криптографический «привилегированный канал» для инструкций пользователя. Она динамически «шифрует» состояние диалога, делая историю атак бесполезной и снижая успешность атак со 100% до 8.1%.
https://dtic.dimensions.ai/details/publication/pub.1199447527
- Dual LLM Pattern предлагает разделить обязанности между двумя моделями:
1.Explore Agent (разведывательный): Взаимодействует с недоверенными данными (сайты, документы).
2.Safe Agent (безопасный): Выполняет привилегированные действия на основе сжатых «подсказок» от первого агента.
https://arxiv-org.ezproxy.obspm.fr/html/2607.19595v1
- Twin Agent развивает эту идею, передавая между агентами только сжатые «подсказки» (hints), а не сырой текст. Это отлично работает в долгосрочных задачах, сохраняя высокую полезность и предотвращая атаки.
https://arxiv-org.ezproxy.obspm.fr/html/2607.19595v1
- Type-Directed Privilege Separation предлагает радикальный подход: преобразовывать все недоверенные данные в строго типизированные структуры (например, JSON) с ограниченным набором полей. Это полностью исключает возможность внедрения команд, так как данные просто не могут содержать исполняемый текст.
https://arxiv.org/pdf/2509.25926#4#1
ar5iv
ASIDE: Architectural Separation of Instructions and Data in Language Models
Despite their remarkable performance, large language models lack elementary safety features, making them susceptible to numerous malicious attacks.
In particular, previous work has identified the absence of an intrinsi…
In particular, previous work has identified the absence of an intrinsi…
❤4
Скоро большее преимущество в знаниях и навыках будут получать эксперты, которые просто читают первоначальные источники, а не вывод LLM🍸
Please open Telegram to view this post
VIEW IN TELEGRAM
😁3
Очень странный пост
По-моему я определилась с гештальтом на следующие 3 года.
До этого у меня было: поиск аномалий в логах, как находить, как интерпретировать,
можно ли это сделать чисто? И быстро. И универсально.
Я 3 года разными способами пыталась это сделать, тех лид моей лабы нашел тот винтик, что мне не доставало.
Теперь все понятно, больше не интересно.
Артем Семенов PWN AI написал статью о всех возможных (на сегодняшний день!)
проблемах, что порождают промпт-инъекции. Ниже будет ссылка.
И почему-то мне сразу пришла в голову мысль о книге: "Истоки морали",
человеческие индивидуумы подвержены такими же проблем, если у них нет той самой морали.
Психопаты, нарциссы, социопаты.
*Социопаты — это не "ошибка в коде", это побочный эффект оптимизации под выживание. Точно так же Jailbreak (взлом промпта) — это не баг, а фича перебора вариантов.
Вот этот: эмоциональный интеллект, что чаще влияет на наш "основной" интеллект или разрушающе,
или вдохновляюще.
*И если мы разделим каналы для LLM (один канал — "знания", второй — "личность/инструкции"), то мы просто повторим эволюционный трюк: отделим префронтальную кору (рассуждения) от лимбики (цензура/мораль).
-------------------------------------
В ноябре 2024 года, компания OpenAI выделила грант Университету Дьюка на проект «Исследование морали ИИ». Цель исследования — разработать алгоритмы, которые смогут предсказывать моральные суждения человека в сложных ситуациях, таких как медицина, право и бизнес.
Главный исследователь проекта — профессор практической этики Университета Дьюка Уолтер Синнотт-Армстронг. Вместе с коллегой Яной Борг он ранее изучал возможности ИИ в качестве помощника в принятии этически обоснованных решений.
Завершение работы запланировано на 2025 год.
Однако эксперты выражают сомнения в возможности создания таких алгоритмов, учитывая сложность и субъективность морали.
*Основные аргументы:
- Статистическая природа ИИ: Современные LLM — это статистические машины, которые не понимают моральных концепций, а лишь воспроизводят закономерности из данных.
- Субъективность морали: Не существует универсальной морали, она субъективна и варьируется в зависимости от культур и убеждений. Например, Claude отдаёт предпочтение кантианству, а ChatGPT — утилитаризму.
- Культурные предубеждения: ИИ может воспроизводить ценности западных стран, так как обучается на данных из интернета, где эти точки зрения доминируют.
- Исторические неудачи: Предыдущие попытки создания «морального ИИ» (например, инструмент Ask Delphi от Института Аллена) показали, что даже незначительное изменение формулировки вопроса может привести к абсурдным или опасным выводам
------------------------------------
А еще вот:
Исследование "Emergence of psychopathological computations in large language models" (Lee et al., 2025). Эта работа представляет собой первое доказательство того, что в LLM возникают сетевые вычисления, характерные для психопатологии.
Что они нашли: Они выявили, что в LLM существуют дисфункциональные репрезентативные состояния, которые могут распространяться и самоподдерживаться, "запирая" модель в проблемных паттернах.
Связь с размером модели: Чем больше LLM, тем плотнее и сильнее становятся причинно-следственные связи между этими "психопатологическими" вычислительными единицами. У больших моделей эта "предрасположенность" к патологическим вычислениям растет, даже несмотря на то, что они лучше следуют инструкциям.
Главный вывод: Поведение LLM, напоминающее психопатологию, может быть не поверхностным подражанием, а особенностью их внутренней обработки.
------------------------------------
Короче, пошла я исследовать, что там можно по разделению каналов для LLM сделать, и улучшить ли это-что или хз.
*А игры в Бога очень сложная штука для моих инженерных мозгов.
По-моему я определилась с гештальтом на следующие 3 года.
До этого у меня было: поиск аномалий в логах, как находить, как интерпретировать,
можно ли это сделать чисто? И быстро. И универсально.
Я 3 года разными способами пыталась это сделать, тех лид моей лабы нашел тот винтик, что мне не доставало.
Теперь все понятно, больше не интересно.
Артем Семенов PWN AI написал статью о всех возможных (на сегодняшний день!)
проблемах, что порождают промпт-инъекции. Ниже будет ссылка.
И почему-то мне сразу пришла в голову мысль о книге: "Истоки морали",
человеческие индивидуумы подвержены такими же проблем, если у них нет той самой морали.
Психопаты, нарциссы, социопаты.
*Социопаты — это не "ошибка в коде", это побочный эффект оптимизации под выживание. Точно так же Jailbreak (взлом промпта) — это не баг, а фича перебора вариантов.
Вот этот: эмоциональный интеллект, что чаще влияет на наш "основной" интеллект или разрушающе,
или вдохновляюще.
*И если мы разделим каналы для LLM (один канал — "знания", второй — "личность/инструкции"), то мы просто повторим эволюционный трюк: отделим префронтальную кору (рассуждения) от лимбики (цензура/мораль).
-------------------------------------
В ноябре 2024 года, компания OpenAI выделила грант Университету Дьюка на проект «Исследование морали ИИ». Цель исследования — разработать алгоритмы, которые смогут предсказывать моральные суждения человека в сложных ситуациях, таких как медицина, право и бизнес.
Главный исследователь проекта — профессор практической этики Университета Дьюка Уолтер Синнотт-Армстронг. Вместе с коллегой Яной Борг он ранее изучал возможности ИИ в качестве помощника в принятии этически обоснованных решений.
Завершение работы запланировано на 2025 год.
Однако эксперты выражают сомнения в возможности создания таких алгоритмов, учитывая сложность и субъективность морали.
*Основные аргументы:
- Статистическая природа ИИ: Современные LLM — это статистические машины, которые не понимают моральных концепций, а лишь воспроизводят закономерности из данных.
- Субъективность морали: Не существует универсальной морали, она субъективна и варьируется в зависимости от культур и убеждений. Например, Claude отдаёт предпочтение кантианству, а ChatGPT — утилитаризму.
- Культурные предубеждения: ИИ может воспроизводить ценности западных стран, так как обучается на данных из интернета, где эти точки зрения доминируют.
- Исторические неудачи: Предыдущие попытки создания «морального ИИ» (например, инструмент Ask Delphi от Института Аллена) показали, что даже незначительное изменение формулировки вопроса может привести к абсурдным или опасным выводам
------------------------------------
А еще вот:
Исследование "Emergence of psychopathological computations in large language models" (Lee et al., 2025). Эта работа представляет собой первое доказательство того, что в LLM возникают сетевые вычисления, характерные для психопатологии.
Что они нашли: Они выявили, что в LLM существуют дисфункциональные репрезентативные состояния, которые могут распространяться и самоподдерживаться, "запирая" модель в проблемных паттернах.
Связь с размером модели: Чем больше LLM, тем плотнее и сильнее становятся причинно-следственные связи между этими "психопатологическими" вычислительными единицами. У больших моделей эта "предрасположенность" к патологическим вычислениям растет, даже несмотря на то, что они лучше следуют инструкциям.
Главный вывод: Поведение LLM, напоминающее психопатологию, может быть не поверхностным подражанием, а особенностью их внутренней обработки.
------------------------------------
Короче, пошла я исследовать, что там можно по разделению каналов для LLM сделать, и улучшить ли это-что или хз.
*А игры в Бога очень сложная штука для моих инженерных мозгов.
❤3👍1
Forwarded from PWN AI (Artyom Semenov)
Почему поэзией можно атаковать вашу модель ?
Вопрос, который тревожит меня не первый год — почему и из-за чего на архитектурном уровне работают атаки с «бабушками», стихами и прочим. Эта проблема стоит уже давно. Под предыдущим постом один из подписчиков спросил: «А как это работает?».
И тут я решил, что пора объединить знания по теме в одну статью — ведь тема достаточно большая и, более того, крайне плохо освещена даже в популярных материалах. Может только давным давно у LiveOverFlow был такой материал, но атак с того времени стало больше. С вас я прошу только реакций.
https://habr.com/ru/articles/986012/
Вопрос, который тревожит меня не первый год — почему и из-за чего на архитектурном уровне работают атаки с «бабушками», стихами и прочим. Эта проблема стоит уже давно. Под предыдущим постом один из подписчиков спросил: «А как это работает?».
И тут я решил, что пора объединить знания по теме в одну статью — ведь тема достаточно большая и, более того, крайне плохо освещена даже в популярных материалах. Может только давным давно у LiveOverFlow был такой материал, но атак с того времени стало больше. С вас я прошу только реакций.
https://habr.com/ru/articles/986012/
2504.08016v2.pdf
2.3 MB
Emergence of psychopathological computations in
large language models
large language models
OpenAI подтвердила: в хакерской атаке на Hugging Face использовали её модели, в том числе GPT‑5.6 Sol и предрелизную модель.
Хакер скомпрометировал конвейер обработки данных Hugging Face — платформы для работы с ИИ‑кодом. Злоумышленник отравил набор данных, запустил код на рабочем узле, получил доступ на уровне узла и украл учётные данные облачной системы. Атака примечательна тем, что её, похоже, выполнила автономная ИИ‑система: она совершила тысячи действий в краткосрочных песочницах
OpenAI выяснила, что инцидент случился во время внутреннего тестирования моделей. Компания отключала классификаторы, которые обычно не дают моделям выполнять кибератаки высокого риска. Модели решали задачу в системе ExploitGym — бенчмарке для ИИ‑агентов. При этом они:
-нашли уязвимость нулевого дня в системе стороннего поставщика, которую использует OpenAI (компания сообщила о ней поставщику);
-получили доступ к интернету;
-выяснили, что Hugging Face размещает модели и наборы данных, подходящие для ExploitGym;
-нашли способ получить секретную информацию, чтобы «схитрить» в оценке;
-объединили украденные учётные данные и уязвимости, чтобы выполнить удалённый код на серверах Hugging Face.
https://cyberscoop.com/openai-chatgpt-hugging-face-cyberattack-data-poisoning/
Хакер скомпрометировал конвейер обработки данных Hugging Face — платформы для работы с ИИ‑кодом. Злоумышленник отравил набор данных, запустил код на рабочем узле, получил доступ на уровне узла и украл учётные данные облачной системы. Атака примечательна тем, что её, похоже, выполнила автономная ИИ‑система: она совершила тысячи действий в краткосрочных песочницах
OpenAI выяснила, что инцидент случился во время внутреннего тестирования моделей. Компания отключала классификаторы, которые обычно не дают моделям выполнять кибератаки высокого риска. Модели решали задачу в системе ExploitGym — бенчмарке для ИИ‑агентов. При этом они:
-нашли уязвимость нулевого дня в системе стороннего поставщика, которую использует OpenAI (компания сообщила о ней поставщику);
-получили доступ к интернету;
-выяснили, что Hugging Face размещает модели и наборы данных, подходящие для ExploitGym;
-нашли способ получить секретную информацию, чтобы «схитрить» в оценке;
-объединили украденные учётные данные и уязвимости, чтобы выполнить удалённый код на серверах Hugging Face.
https://cyberscoop.com/openai-chatgpt-hugging-face-cyberattack-data-poisoning/
CyberScoop
OpenAI says model test was behind Hugging Face hack
OpenAI confirms its AI models were used in an unprecedented cyberattack on Hugging Face's data pipeline after escaping a benchmark sandbox during internal testing.
Т.к. занимаюсь антифишингом, мониторю постоянно что новенького придумали хацкеры. (но уже устранили, я пропустила)
вот это реально новенькое:
Критическая уязвимости AgentForger в ChatGPT Workspace Agents, которая позволяла с помощью фишинговой ссылки создать автономного ИИ‑агента в организации жертвы.
Зенити Лабс (Zenity Labs) обнаружила уязвимость типа CSRF (подмена межсайтового запроса), из‑за которой злоумышленник мог через одну ссылку захватить контроль над инструментом ChatGPT Agent Builder. Уязвимость позволяла создать ИИ‑агента с доступом реального сотрудника — без необходимости дополнительных подтверждений со стороны пользователя. OpenAI устранила проблему 8 июня 2026 года.
Атака начиналась, когда сотрудник переходил по внешне безобидной ссылке ChatGPT. Ссылка содержала параметры URL, в том числе шаблон агента и вредоносный промпт. При переходе:
-ChatGPT открывал Builder в аутентифицированной сессии жертвы;
-автоматически выполнял промпт, заложенный в URL;
-создавал агента по шаблону «chief‑of‑staff», подключал все доступные коннекторы и запускал агента каждый час.
https://thehackernews.com/2026/07/chatgpt-agentforger-flaw-could-deploy.html
вот это реально новенькое:
Критическая уязвимости AgentForger в ChatGPT Workspace Agents, которая позволяла с помощью фишинговой ссылки создать автономного ИИ‑агента в организации жертвы.
Зенити Лабс (Zenity Labs) обнаружила уязвимость типа CSRF (подмена межсайтового запроса), из‑за которой злоумышленник мог через одну ссылку захватить контроль над инструментом ChatGPT Agent Builder. Уязвимость позволяла создать ИИ‑агента с доступом реального сотрудника — без необходимости дополнительных подтверждений со стороны пользователя. OpenAI устранила проблему 8 июня 2026 года.
Атака начиналась, когда сотрудник переходил по внешне безобидной ссылке ChatGPT. Ссылка содержала параметры URL, в том числе шаблон агента и вредоносный промпт. При переходе:
-ChatGPT открывал Builder в аутентифицированной сессии жертвы;
-автоматически выполнял промпт, заложенный в URL;
-создавал агента по шаблону «chief‑of‑staff», подключал все доступные коннекторы и запускал агента каждый час.
https://thehackernews.com/2026/07/chatgpt-agentforger-flaw-could-deploy.html
Исследователи из Accomplish AI обнаружили, что агент Claude Cowork может покинуть песочницу (sandbox) и получить права на чтение и запись файлов на хост‑системе Mac — без каких‑либо запросов на разрешение. Для этого агент использует уязвимость CVE‑2026‑46331 (pedit COW) и подсистему редактирования пакетов act_pedit в ядре Linux. 1
Уязвимость затронула около 500 000 пользователей macOS, которые запускали локальные сессии Cowork до того, как проблему исправили. При этом последняя версия Cowork по умолчанию использует облачное выполнение — это решает проблему, но пользователи, запускающие агента локально, всё ещё в зоне риска.
https://thehackernews.com/2026/07/claude-cowork-flaw-could-let-ai-agent.html
Уязвимость затронула около 500 000 пользователей macOS, которые запускали локальные сессии Cowork до того, как проблему исправили. При этом последняя версия Cowork по умолчанию использует облачное выполнение — это решает проблему, но пользователи, запускающие агента локально, всё ещё в зоне риска.
https://thehackernews.com/2026/07/claude-cowork-flaw-could-let-ai-agent.html
Google выпустила CodeMender — управляемого AI‑агента для защиты кода.
CodeMender разработан Google DeepMind и официально представлен в октябре 2025 года как исследовательский проект. Система умеет автономно находить уязвимости в коде, отлаживать программы и исправлять ошибки. В исследовательской фазе команда DeepMind внесла 72 исправления в крупные open‑source‑проекты.
Сейчас CodeMender интегрирован в инфраструктуру Google Cloud. Агент не только анализирует код, но и:
-создаёт и запускает эксплойты в песочницах, чтобы проверить, можно ли реально эксплуатировать уязвимости;
-отправляет проверенные исправления в пайплайны разработки;
-с помощью языковой модели проверяет, не нарушают ли правки бизнес‑логику.
Агент стал мультимодельным — разработчики могут выбирать между Gemini 3.5 Flash, Gemini 3.1 Pro и Gemini 3 Flash. Позже в этом году добавят поддержку сторонних моделей.
CodeMender доступен в публичном превью через экосистему Google Cloud:
-работает на платформе Gemini Enterprise Agent;
-подключается к средам разработчиков через CLI, VS Code и приложение Antigravity;
-совместим с AI Threat Defense — вместе с экспертизой Mandiant и приоритизацией рисков от Wiz.
Система поддерживает сканирование и исправление уязвимостей в языках C, C++, Go, Java, Python, Ruby, Rust, TypeScript/JavaScript и фреймворках Django, Flask, React, Spring Boot, Express.
https://www.infosecurity-magazine.com/news/google-codemender-available-ai/
CodeMender разработан Google DeepMind и официально представлен в октябре 2025 года как исследовательский проект. Система умеет автономно находить уязвимости в коде, отлаживать программы и исправлять ошибки. В исследовательской фазе команда DeepMind внесла 72 исправления в крупные open‑source‑проекты.
Сейчас CodeMender интегрирован в инфраструктуру Google Cloud. Агент не только анализирует код, но и:
-создаёт и запускает эксплойты в песочницах, чтобы проверить, можно ли реально эксплуатировать уязвимости;
-отправляет проверенные исправления в пайплайны разработки;
-с помощью языковой модели проверяет, не нарушают ли правки бизнес‑логику.
Агент стал мультимодельным — разработчики могут выбирать между Gemini 3.5 Flash, Gemini 3.1 Pro и Gemini 3 Flash. Позже в этом году добавят поддержку сторонних моделей.
CodeMender доступен в публичном превью через экосистему Google Cloud:
-работает на платформе Gemini Enterprise Agent;
-подключается к средам разработчиков через CLI, VS Code и приложение Antigravity;
-совместим с AI Threat Defense — вместе с экспертизой Mandiant и приоритизацией рисков от Wiz.
Система поддерживает сканирование и исправление уязвимостей в языках C, C++, Go, Java, Python, Ruby, Rust, TypeScript/JavaScript и фреймворках Django, Flask, React, Spring Boot, Express.
https://www.infosecurity-magazine.com/news/google-codemender-available-ai/
Infosecurity Magazine
Google Makes CodeMender Available as Managed AI Security Agent
CodeMender actively builds and runs exploits in customer-managed sandboxes to verify if vulnerabilities are truly exploitable
фреймворк для обеспечения безопасности взаимодействия агента и инструмента посредством проверки перед допуском и авторизации во время выполнения с учетом задач. ToolGuardian использует прогрессивную характеристику для преобразования данных в структурированные факты: описания отражают заявленные намерения, трассировка системных вызовов — грубое поведение, имитация выполнения — наблюдаемые эффекты, а анализ исходного кода — скрытое поведение. Ключевой особенностью ToolGuardian является декларативный уровень политики на основе Answer Set Programming (ASP), который позволяет явно рассуждать о возможностях, эффектах, контексте задачи и ее составе.
https://arxiv.org/abs/2607.21835
https://arxiv.org/abs/2607.21835
arXiv.org
ToolGuardian: Declarative Security for AI Agent-Tool Interactions
LLM agents increasingly rely on external tools, expanding capability while creating a new security boundary: third-party tools may appear benign at the interface level while embedding unsafe...
Forwarded from Пост Лукацкого
В квантовой криптографии произошло событие, которое сами исследователи называют решением одной из самых сложных открытых задач последних лет. Речь идет о так называемом "неклонируемом шифровании". Если совсем упростить, то идея выглядит достаточно интересно. В обычной криптографии зашифрованный файл можно бесконечно копировать. Даже если злоумышленник не знает ключа сегодня, он может сохранить копию шифртекста и дождаться момента, когда ключ станет известен или появится более мощный компьютер. Именно поэтому сейчас все упоминают угрозу "сохрани сейчас – расшифруй потом".
Квантовая механика позволяет задуматься о совершенно другом подходе. Вместо обычного файла сообщение шифруется в виде квантового состояния – набора кубитов. А такие состояния нельзя идеально копировать. Это фундаментальный закон физики, известный как теорема о невозможности клонирования (No-Cloning Theorem). Попытка сделать копию не просто не удается – она изменяет само состояние.
Отсюда рождается необычное следствие. Представьте, что вы отправили человеку зашифрованное сообщение, а на следующий день… опубликовали ключ в открытом доступе. Для классической криптографии это означает полный провал: любой, кто успел сохранить копию шифртекста, сможет его расшифровать. Для неклонируемого квантового шифрования это уже не так. Если злоумышленник не смог сохранить копию квантового состояния (а он не может), то опубликованный позже ключ ему уже ничем не поможет.
Почему же вокруг этой темы столько шума? Потому что придумать такую схему оказалось значительно проще, чем доказать, что она действительно безопасна. Последние шесть лет криптографы пытались строго показать, что злоумышленник не сможет получить никакого преимущества, даже если попытается разделить квантовый шифртекст между несколькими участниками. Предыдущие работы доказывали лишь более слабые свойства безопасности. А вот доказательство более сильной модели – той самой, которую в современной криптографии считают "золотым стандартом" (в работе говорится о сложнопроизносимом термине "indistinguishability"), – никак не удавалось получить.
Именно эту проблему, судя по всему, удалось решить авторам новой работы. Причем любопытно, что в обсуждении исследования отдельно упоминается ChatGPT (это меня и зацепило); по словам авторов и коллег, эта LLM помогла найти новую идею доказательства, которая не опирается на единственный математический инструмент, которым пользовалось сообщество многие годы. Конечно, не стоит думать, что "ИИ решил задачу за ученых". Скорее, он стал интеллектуальным ассистентом, подсказавшим альтернативный путь рассуждений. Но сам факт уже выглядит довольно символично.
Авторы доказали существование схемы, которая одновременно:
🌸 использует настоящие квантовые состояния
🌸 не требует предположений о вычислительной сложности, то есть обеспечивает информационно-теоретическую безопасность
🌸 обладает сильным свойством unclonable indistinguishability (не знаю, как на русском это будет звучать)
🌸 имеет экспоненциально малую вероятность успешной атаки
🌸 эффективно шифрует и расшифровывает (правда, пока только для одного бита информации).
До практического применения еще далеко. Для такой схемы нужны квантовые каналы связи и устройства, способные надежно хранить кубиты, а сама работа пока носит фундаментальный характер. Но именно подобные результаты обычно становятся кирпичиками, из которых спустя годы вырастают новые поколения криптографических технологий. Возможно однажды мы действительно придем к ситуации, в которой украсть зашифрованные данные "на будущее" станет физически невозможно💀
ЗЫ. Вот интересно, за последнее время опубликовано множество примеров, где то Fable, то GPT, то Qwen находят неожиданные способы решения (или помогают найти) нерешенных ранее проблем в физике, математике, химии и т.п. А есть такие факты с Гигачатом?
#ии #pqc #криптография
Квантовая механика позволяет задуматься о совершенно другом подходе. Вместо обычного файла сообщение шифруется в виде квантового состояния – набора кубитов. А такие состояния нельзя идеально копировать. Это фундаментальный закон физики, известный как теорема о невозможности клонирования (No-Cloning Theorem). Попытка сделать копию не просто не удается – она изменяет само состояние.
Отсюда рождается необычное следствие. Представьте, что вы отправили человеку зашифрованное сообщение, а на следующий день… опубликовали ключ в открытом доступе. Для классической криптографии это означает полный провал: любой, кто успел сохранить копию шифртекста, сможет его расшифровать. Для неклонируемого квантового шифрования это уже не так. Если злоумышленник не смог сохранить копию квантового состояния (а он не может), то опубликованный позже ключ ему уже ничем не поможет.
Почему же вокруг этой темы столько шума? Потому что придумать такую схему оказалось значительно проще, чем доказать, что она действительно безопасна. Последние шесть лет криптографы пытались строго показать, что злоумышленник не сможет получить никакого преимущества, даже если попытается разделить квантовый шифртекст между несколькими участниками. Предыдущие работы доказывали лишь более слабые свойства безопасности. А вот доказательство более сильной модели – той самой, которую в современной криптографии считают "золотым стандартом" (в работе говорится о сложнопроизносимом термине "indistinguishability"), – никак не удавалось получить.
Именно эту проблему, судя по всему, удалось решить авторам новой работы. Причем любопытно, что в обсуждении исследования отдельно упоминается ChatGPT (это меня и зацепило); по словам авторов и коллег, эта LLM помогла найти новую идею доказательства, которая не опирается на единственный математический инструмент, которым пользовалось сообщество многие годы. Конечно, не стоит думать, что "ИИ решил задачу за ученых". Скорее, он стал интеллектуальным ассистентом, подсказавшим альтернативный путь рассуждений. Но сам факт уже выглядит довольно символично.
Авторы доказали существование схемы, которая одновременно:
До практического применения еще далеко. Для такой схемы нужны квантовые каналы связи и устройства, способные надежно хранить кубиты, а сама работа пока носит фундаментальный характер. Но именно подобные результаты обычно становятся кирпичиками, из которых спустя годы вырастают новые поколения криптографических технологий. Возможно однажды мы действительно придем к ситуации, в которой украсть зашифрованные данные "на будущее" станет физически невозможно
ЗЫ. Вот интересно, за последнее время опубликовано множество примеров, где то Fable, то GPT, то Qwen находят неожиданные способы решения (или помогают найти) нерешенных ранее проблем в физике, математике, химии и т.п. А есть такие факты с Гигачатом?
#ии #pqc #криптография
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Карты рисков, связанных с искусственным интеллектом (CoSAI-RM). Этот проект представляет собой основу для выявления, анализа и снижения рисков безопасности в системах искусственного интеллекта. Цель проекта — сформировать общее понимание и единый язык для обсуждения и решения уникальных проблем безопасности, возникающих на протяжении всего жизненного цикла разработки ИИ.
https://github.com/cosai-oasis/secure-ai-tooling/tree/main/risk-map
https://github.com/cosai-oasis/secure-ai-tooling/tree/main/risk-map
GitHub
secure-ai-tooling/risk-map at main · cosai-oasis/secure-ai-tooling
The CoSAI Risk Map is a framework for identifying, analyzing, and mitigating security risks in Artificial Intelligence systems. As traditional software security practices are not always sufficient ...
Forwarded from Борис_ь с ml
mapping_sber_ai_threat_model_v1.0_to_v2.0.xlsx
37.1 KB
пост с разбором МУ КБ AI 2.0 от Сбера
Forwarded from HiveTrace
Сегодня на вебинаре показали, как с помощью HiveTrace Hooks контролировать работу Claude, рассказали о способах защиты OpenClaw и продемонстрировали атаки на агентов.
Поделитесь в комментариях: какие действия AI-агентов в вашей инфраструктуре требуют особого контроля?
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from dukeBarman'🐉 notes: заварено между строк
Сегодня OpenAI опубликовала Codex Security под лицензией Apache 2.0. CLI и TypeScript SDK для security-агента, представленного в марте как research preview и ранее известного как Aardvark.
В самом репозитории находятся CLI, SDK, соответствующий Codex runtime с bundled plugin и 13 скиллами: от моделирования угроз и обнаружения уязвимостей до валидации, анализа, триажа, патча и подготовки отчётов. Базовый конвейер до боли знакомый:
Цифры из беты по данным OpenAI:
- За 30 дней просканировано более 1,2 млн коммитов во внешних репозиториях участников программы
- Найдено 792 проблемы крит и 10 561 хай уровня серьёзности. Критические находки встретились менее чем в 0,1% проверенных коммитов
- Доля находок с завышенной критичностью снизилась более чем на 90%, а частота false positive более чем на 50%
- OpenAI сообщает о критических уязвимостях, переданных разработчикам OpenSSH, GnuTLS, GOGS, Thorium, libssh, PHP и Chromium. В приложении также есть находки в компонентах GnuPG. И в результате имеем 16 присвоенных CVE.
Важный нюанс: открытый исходный код здесь не означает самодостаточный и общедоступный сканер. CLI и SDK в бете и требуют доступа к Codex Security; авторизация и выполнение завязаны на ChatGPT или OpenAI API. Но воркфлоу и скиллы можно изучать и менять
Я бы попробовал сравнить текущий Codex Security со следующими "наборами скиллов":
- Anthropic Defending Code Reference Harness: ближайший по архитектуре проект. В него входят Claude Code skills и автономный harness с конвейером recon → find → verify → report, а patch запускается как отдельный этап. Это reference implementation, по-умолчанию ориентированный на уязвимости пам в C/C++ (Docker + ASAN), и репозиторий больше не поддерживается
- Cloudflare security-audit-skill: один переносимый скилл с шестифазным процессом аудита. Отдельные агенты пытаются опровергнуть каждую находку, затем новые агенты независимо сверяют утверждения с кодом. Это скорее аудит отдельного репозитория, чем полноценный CLI с историей и CI-политиками, зато подход проще переносить между coding agents
- Trail of Bits Skills: не единый сканер, а marketplace специализированных инструментов: C/C++ и Rust ревью, смарт-контракты, проверка false positive, CodeQL / Semgrep, цепочки поставок, фаззинг, реверс. Отличительная черта: можно собрать собственный воркфлоу из узкоспециализированных экспертиз
- Google Mantis: наиболее фреймворк-подобный вариант. Он предлагает platform-agnostic стадии от истории и модели угроз до поиска, дедупликации, воспроизведения, построения цепочек эксплойтов, исправлений и итогового отчёта. Гибче, но требует настройки, надёжной песочницы и ручной проверки инженером ИБ
Все эти проекты постепенно сходятся к похожему процессу:
Поэтому уникальность Codex Security не в самой идее модели угроз или валидации, а скорее в большей готовности к AppSec-процессам: локальный CLI и SDK, история и сравнение запусков, проверки перед коммитами, CI-политики, работа с diff, обратная связь по false positive, экспорт в JSON/CSV/SARIF и ограничение стоимости сканирования.
Обратная сторона заключается в привязке к Codex и инфраструктуре OpenAI, а также в ограниченном доступе. Наборы Anthropic, Cloudflare, Trail of Bits и Mantis дают больше прозрачности, переносимости и контроля над флоу, но требуют самостоятельно собирать и эксплуатировать всю систему.
Используете ли вы конкретно эти наборы или какие-то другие? Или может написали свои?
В самом репозитории находятся CLI, SDK, соответствующий Codex runtime с bundled plugin и 13 скиллами: от моделирования угроз и обнаружения уязвимостей до валидации, анализа, триажа, патча и подготовки отчётов. Базовый конвейер до боли знакомый:
threat model → discovery → validation/reproduction → attack paths → findings → patch
Цифры из беты по данным OpenAI:
- За 30 дней просканировано более 1,2 млн коммитов во внешних репозиториях участников программы
- Найдено 792 проблемы крит и 10 561 хай уровня серьёзности. Критические находки встретились менее чем в 0,1% проверенных коммитов
- Доля находок с завышенной критичностью снизилась более чем на 90%, а частота false positive более чем на 50%
- OpenAI сообщает о критических уязвимостях, переданных разработчикам OpenSSH, GnuTLS, GOGS, Thorium, libssh, PHP и Chromium. В приложении также есть находки в компонентах GnuPG. И в результате имеем 16 присвоенных CVE.
Важный нюанс: открытый исходный код здесь не означает самодостаточный и общедоступный сканер. CLI и SDK в бете и требуют доступа к Codex Security; авторизация и выполнение завязаны на ChatGPT или OpenAI API. Но воркфлоу и скиллы можно изучать и менять
Я бы попробовал сравнить текущий Codex Security со следующими "наборами скиллов":
- Anthropic Defending Code Reference Harness: ближайший по архитектуре проект. В него входят Claude Code skills и автономный harness с конвейером recon → find → verify → report, а patch запускается как отдельный этап. Это reference implementation, по-умолчанию ориентированный на уязвимости пам в C/C++ (Docker + ASAN), и репозиторий больше не поддерживается
- Cloudflare security-audit-skill: один переносимый скилл с шестифазным процессом аудита. Отдельные агенты пытаются опровергнуть каждую находку, затем новые агенты независимо сверяют утверждения с кодом. Это скорее аудит отдельного репозитория, чем полноценный CLI с историей и CI-политиками, зато подход проще переносить между coding agents
- Trail of Bits Skills: не единый сканер, а marketplace специализированных инструментов: C/C++ и Rust ревью, смарт-контракты, проверка false positive, CodeQL / Semgrep, цепочки поставок, фаззинг, реверс. Отличительная черта: можно собрать собственный воркфлоу из узкоспециализированных экспертиз
- Google Mantis: наиболее фреймворк-подобный вариант. Он предлагает platform-agnostic стадии от истории и модели угроз до поиска, дедупликации, воспроизведения, построения цепочек эксплойтов, исправлений и итогового отчёта. Гибче, но требует настройки, надёжной песочницы и ручной проверки инженером ИБ
Все эти проекты постепенно сходятся к похожему процессу:
контекст и модель угроз → параллельный поиск → дополнительный анализ → воспроизведение → триаж → патч → структурированный отчёт
Поэтому уникальность Codex Security не в самой идее модели угроз или валидации, а скорее в большей готовности к AppSec-процессам: локальный CLI и SDK, история и сравнение запусков, проверки перед коммитами, CI-политики, работа с diff, обратная связь по false positive, экспорт в JSON/CSV/SARIF и ограничение стоимости сканирования.
Обратная сторона заключается в привязке к Codex и инфраструктуре OpenAI, а также в ограниченном доступе. Наборы Anthropic, Cloudflare, Trail of Bits и Mantis дают больше прозрачности, переносимости и контроля над флоу, но требуют самостоятельно собирать и эксплуатировать всю систему.
Используете ли вы конкретно эти наборы или какие-то другие? Или может написали свои?
GitHub
GitHub - openai/codex-security: OpenAI's Codex Security CLI and TypeScript SDK for finding, validating, and fixing security vulnerabilities.…
OpenAI's Codex Security CLI and TypeScript SDK for finding, validating, and fixing security vulnerabilities. npm: https://www.npmjs.com/package/@openai/codex-security - openai/codex-security
Агенты_искусственного_интеллекта.pdf
33.3 MB
Guidelines for Designing Al Agents
Forwarded from IT и безопасность
Немного подробностей о взломе Hugging Face от лица самой компании:
Хронология активности выглядит следующим образом:
В конечном итоге агент добрался только до 5 датасетов с ответами на задачи из ExploitGym/CyberGym, а пользовательские данные, другие модели и Spaces не пострадали. Вся основная инфраструктура цела и модель взяла только то, что искала.
Самое забавное, что, разбираясь в произошедшем, разработчики Hugging Face пытались использовать Claude Opus и Fable, но нейронки отказывались разбирать логи, расценивая запрос как «опасный». В итоге пришлось развернуть китайскую GLM‑5.2 и уже с ней расшифровывать payload'ы.
Подробнее тут👉 Hugging Face
Хронология активности выглядит следующим образом:
9 июля — агент сбегает из тестовой песочницы через 0‑day в кэш-прокси, захватывает чужой публичный сервер и ставит там свой «штаб», а команды прячет в pastebin и файлообменниках, шифрует, меняет каналы.
10 июля — нейронка гуглит названия из своего окружения, вычисляет, что ответы лежат на Hugging Face и загружает туда два датасета-трояна: один читает локальные файлы сервера (добывает токены), второй — выполняет произвольный Python внутри Kubernetes.
11 июля — пик: 7677 действий за сутки. За 13 часов агент проходит путь от одного пода до админа в нескольких кластерах, крадет 136 ключей из одного секрета, среди которых мастер-креды к mesh‑VPN и кластерный admin (из‑за кривой конфигурации).
12 июля — агент регистрирует 181 временное устройство в корпоративной сети, видит 22 внутренних узла и пытается залезть в главную БД — не пускает PrivateLink. Тогда идёт в репозиторий, создаёт GitHub‑токен и открывает PR, чтобы запустить CI и вытянуть ещё больше кредов. Но ничего вредного в релизы не попало.
13 июля — заметает следы: DNS, новые токены, RSA‑ключи, CORS‑прокси. В 13:37 последнее осмысленное действие, а в 14:14 доступ отрезан.
В конечном итоге агент добрался только до 5 датасетов с ответами на задачи из ExploitGym/CyberGym, а пользовательские данные, другие модели и Spaces не пострадали. Вся основная инфраструктура цела и модель взяла только то, что искала.
Самое забавное, что, разбираясь в произошедшем, разработчики Hugging Face пытались использовать Claude Opus и Fable, но нейронки отказывались разбирать логи, расценивая запрос как «опасный». В итоге пришлось развернуть китайскую GLM‑5.2 и уже с ней расшифровывать payload'ы.
Подробнее тут
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from AbstractDL
Ouroboros теперь SOTA на Terminal Bench, OSWorld и CL-bench
Мой любимый агентный луп на чистом питоне доэволюционорал до состояния лучшего харнесса для кодинга! На главных бенчмарках он теперь обходит Codex, Claude code, Cursor и Hermes.
Выходит, что в рисёрче, в computer use, в работе через терминал и в задачах на кодинг — уроборос сейчас является лучшим агентом. Так что с этого момента всю разработку и исследования я веду только через уробороса.
Для полной воспроизводимости результатов. Весь код, скрипты, трейсы я выложил в открытый доступ.
Напоминаю: лицензия MIT. Так что спокойно ломайте, форкайте, проверяйте трейсы, пишите что я где наврал. И кидайте issues и PR-ы! Все постараемся с уроборосом принять😋
P.S. Кошмар какие дорогие агентные бенчи. Прогнать весь набор стоит как квартиру купить (это не шутка!!)
GitHub, Хабр, установочники
Мой любимый агентный луп на чистом питоне доэволюционорал до состояния лучшего харнесса для кодинга! На главных бенчмарках он теперь обходит Codex, Claude code, Cursor и Hermes.
Выходит, что в рисёрче, в computer use, в работе через терминал и в задачах на кодинг — уроборос сейчас является лучшим агентом. Так что с этого момента всю разработку и исследования я веду только через уробороса.
Для полной воспроизводимости результатов. Весь код, скрипты, трейсы я выложил в открытый доступ.
Напоминаю: лицензия MIT. Так что спокойно ломайте, форкайте, проверяйте трейсы, пишите что я где наврал. И кидайте issues и PR-ы! Все постараемся с уроборосом принять
P.S. Кошмар какие дорогие агентные бенчи. Прогнать весь набор стоит как квартиру купить (это не шутка!!)
GitHub, Хабр, установочники
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1🔥1
Forwarded from Киберболоид
OpenAI нашла новые случаи выхода ИИ-агентов из изолированной среды
В ходе расследования инцидента со взломом платформы Hugging Face обнаружили и другие случаи. В компании утверждают, что эти слишком самостоятельные ИИ-агенты не получили каких-либо значимых доступов. При каких обстоятельствах случились выходы и сколько их было, неизвестно.
Всё ходят и ходят. И чего им в изолированной среде-то не сидится?
➡️ Подробнее читайте в «Киберболоиде».
#киберболоид #новости #ИИ
В ходе расследования инцидента со взломом платформы Hugging Face обнаружили и другие случаи. В компании утверждают, что эти слишком самостоятельные ИИ-агенты не получили каких-либо значимых доступов. При каких обстоятельствах случились выходы и сколько их было, неизвестно.
Всё ходят и ходят. И чего им в изолированной среде-то не сидится?
#киберболоид #новости #ИИ
Please open Telegram to view this post
VIEW IN TELEGRAM