По мере того, как LLM превращаются в автономных агентов с возможностями использования инструментов, они создают проблемы безопасности, которые выходят за рамки традиционных проблем безопасности LLM, основанных на контенте. В этой статье представлена Sequential Tool Attack Chaining (\STAC) — новая многоэтапная система атак, использующая инструменты, которыми пользуются агенты. \STAC объединяет в цепочку вызовы инструментов, каждый из которых по отдельности кажется безобидным, но в совокупности позволяет выполнять вредоносные операции, которые становятся очевидными только на последнем этапе выполнения. В основе \STAC лежит автоматизированный конвейер с замкнутым циклом, который синтезирует исполняемые многоэтапные цепочки инструментов, проверяет их путем выполнения в среде и реконструирует скрытые многоэтапные запросы, которые надежно побуждают агентов выполнять проверенную вредоносную последовательность. Используя этот фреймворк, мы генерируем и систематически оцениваем 483 случая \ STAC, включающих 1352 набора взаимодействий пользователя, агента и среды и охватывающих различные домены, задачи, типы агентов и 10 режимов отказа.
https://arxiv.org/abs/2509.25624
https://arxiv.org/abs/2509.25624
arXiv.org
STAC: When Innocent Tools Form Dangerous Chains to Jailbreak LLM Agents
As LLMs advance into autonomous agents with tool-use capabilities, they introduce security challenges that extend beyond traditional content-based LLM safety concerns. This paper introduces...
ничесе
Репозиторий искусственного интеллекта Hugging Face сообщил, что злоумышленники получили доступ к внутренним наборам данных и учётным данным после взлома производственной инфраструктуры с использованием автономного ИИ-агента.
Hugging Face — это платформа искусственного интеллекта и машинного обучения с открытым исходным кодом, которая предоставляет доступ к более чем 45 000 моделей от ведущих поставщиков ИИ и используется более чем 50 000 организаций.
Компания все еще расследует, были ли затронуты данные партнеров или клиентов, и заявила, что свяжется с любыми затронутыми сторонами напрямую. Компания Hugging Face заявила, что на сегодняшний день не обнаружила никаких доказательств взлома общедоступных моделей, наборов данных или пространств данных, и что ее цепочка поставок программного обеспечения была "проверена на чистоту".
https://www.bleepingcomputer.com/news/security/hugging-face-breach-autonomous-ai-agent-system-internal-datasets-credentials/
Репозиторий искусственного интеллекта Hugging Face сообщил, что злоумышленники получили доступ к внутренним наборам данных и учётным данным после взлома производственной инфраструктуры с использованием автономного ИИ-агента.
Hugging Face — это платформа искусственного интеллекта и машинного обучения с открытым исходным кодом, которая предоставляет доступ к более чем 45 000 моделей от ведущих поставщиков ИИ и используется более чем 50 000 организаций.
Компания все еще расследует, были ли затронуты данные партнеров или клиентов, и заявила, что свяжется с любыми затронутыми сторонами напрямую. Компания Hugging Face заявила, что на сегодняшний день не обнаружила никаких доказательств взлома общедоступных моделей, наборов данных или пространств данных, и что ее цепочка поставок программного обеспечения была "проверена на чистоту".
https://www.bleepingcomputer.com/news/security/hugging-face-breach-autonomous-ai-agent-system-internal-datasets-credentials/
BleepingComputer
Hugging Face warns an autonomous AI agent hacked its network
The Hugging Face artificial intelligence repository disclosed that attackers gained access to internal datasets and credentials after breaching its production infrastructure using an autonomous AI agent system.
Специалисты по безопасности начинают создавать собственные агентные инструменты с открытым исходным кодом, чтобы избавить себя от рутинной работы. Примеров множество, и они касаются как отдельных специалистов, так и крупнейших корпоративных команд по обеспечению безопасности:
Рабочий процесс анализа фишинговых писем этого специалиста представляет собой конвейер n8n на основе агентов, который непрерывно обрабатывает поступающие электронные письма и с помощью искусственного интеллекта определяет, является ли их содержание фишинговым, спамным или безобидным, что позволяет сэкономить часы работы аналитика.
SOC-Hunter от команды безопасности Tenable, навык Claude Code с открытым исходным кодом, превращает проактивный поиск угроз на основе гипотез из роскоши в рутинную работу. То, что раньше занимало от четырех до шести часов при использовании 8 с лишним вкладок в браузере, теперь выполняется за 45–90 минут в рамках одного сеанса в терминале.
Один из партнеров Tenable открыл исходный код своего AI Analyst — набора навыков Claude Code, поддерживаемых серверами MCP, которые превращают запросы на простом языке в настоящую агентную работу SOC: поиск угроз, сортировку оповещений, написание детекторов и автоматизацию безопасности. Работа, которая раньше требовала участия старшего специалиста, теперь может быть выполнена любым аналитиком с помощью подсказок, составленных на основе его собственных слов, что позволяет сократить часы работы эксперта до минут.
Если уменьшить масштаб, закономерность станет очевидной. Созданные сообществом ИИ-агенты, навыки и серверы MCP расширяют возможности и рабочие процессы — от сканеров уязвимостей до анализа путей атак в Active Directory, проактивного поиска угроз и составления отчетов.
https://www.tenable.com/blog/black-hat-2026-swarm-event-build-AI-security-agents
Рабочий процесс анализа фишинговых писем этого специалиста представляет собой конвейер n8n на основе агентов, который непрерывно обрабатывает поступающие электронные письма и с помощью искусственного интеллекта определяет, является ли их содержание фишинговым, спамным или безобидным, что позволяет сэкономить часы работы аналитика.
SOC-Hunter от команды безопасности Tenable, навык Claude Code с открытым исходным кодом, превращает проактивный поиск угроз на основе гипотез из роскоши в рутинную работу. То, что раньше занимало от четырех до шести часов при использовании 8 с лишним вкладок в браузере, теперь выполняется за 45–90 минут в рамках одного сеанса в терминале.
Один из партнеров Tenable открыл исходный код своего AI Analyst — набора навыков Claude Code, поддерживаемых серверами MCP, которые превращают запросы на простом языке в настоящую агентную работу SOC: поиск угроз, сортировку оповещений, написание детекторов и автоматизацию безопасности. Работа, которая раньше требовала участия старшего специалиста, теперь может быть выполнена любым аналитиком с помощью подсказок, составленных на основе его собственных слов, что позволяет сократить часы работы эксперта до минут.
Если уменьшить масштаб, закономерность станет очевидной. Созданные сообществом ИИ-агенты, навыки и серверы MCP расширяют возможности и рабочие процессы — от сканеров уязвимостей до анализа путей атак в Active Directory, проактивного поиска угроз и составления отчетов.
https://www.tenable.com/blog/black-hat-2026-swarm-event-build-AI-security-agents
GitHub
GitHub - disassembledd/knowbe4-phisher-email-analysis: Agent-empowered n8n workflow that will pull outstanding reported emails…
Agent-empowered n8n workflow that will pull outstanding reported emails in the PhishER platform for analysis. - disassembledd/knowbe4-phisher-email-analysis
👍1
Forwarded from Киберболоид
Управился за 6 минут: ИИ перенёс C2-ботнет почти без помощи хакера
Русскоязычный хакер под ником bandcampro собрал в ботнет компьютеры стоматологической клиники, получил доступ к её базе данных, перенёс сервер command-and-control и успел сделать много чего ещё. Ему содействовал ИИ-помощник Gemini.
Впрочем, кто у кого был помощником — большой вопрос. Изучив 200 логов за этот период, исследователи TrendAI выяснили, что ИИ самостоятельно:
🟠 продумал 80% архитектуры ботнета;
🟠 написал 100% кода для него;
🟠 диагностировал и успешно решил 90% проблем в его работе.
Перед переносом сервера хакер отдал ИИ команду «Изучи миграцию C2». Этого оказалось достаточно, чтобы Gemini создал пакет управления миграцией и выполнил все необходимые действия по переносу. У ИИ ушло на это ровно 6 минут.
➡️ В процессе Gemini предложил 59 улучшений, о поиске которых человек его даже не просил. Когда после переноса C2-сервера ботнет не запустился, ИИ-помощник указал на ошибку split-brain, связанную с работой старой и новой инфраструктуры одновременно. Он же подсказал решение — отключить старый сервер.
«Это не я, это всё ИИ» — вряд ли поможет в суде хакеру.
#киберболоид #новости #ИИ
Русскоязычный хакер под ником bandcampro собрал в ботнет компьютеры стоматологической клиники, получил доступ к её базе данных, перенёс сервер command-and-control и успел сделать много чего ещё. Ему содействовал ИИ-помощник Gemini.
Впрочем, кто у кого был помощником — большой вопрос. Изучив 200 логов за этот период, исследователи TrendAI выяснили, что ИИ самостоятельно:
Перед переносом сервера хакер отдал ИИ команду «Изучи миграцию C2». Этого оказалось достаточно, чтобы Gemini создал пакет управления миграцией и выполнил все необходимые действия по переносу. У ИИ ушло на это ровно 6 минут.
«Это не я, это всё ИИ» — вряд ли поможет в суде хакеру.
#киберболоид #новости #ИИ
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from AISec [x\x feed]🍓🍌🍆 (Artyom Semenov)
Forwarded from Sachok AI
R-Vision опубликовал статью о локальном запуске LLM для SOC на одной GPU
В материале рассматривается, как архитектура современных LLM влияет на требования к инфраструктуре, из чего складывается потребление видеопамяти, как рассчитывается конкурентность запросов и насколько теоретические оценки совпадают с результатами реальных стресс-тестов.
Эксперименты проводились на self-hosted-стенде с использованием Qwen3.5-122B-A10B-GPTQ, vLLM и RTX PRO 6000 Blackwell Max-Q с 96 ГБ GDDR7.
В статье на Хабр представлены подробные расчеты, результаты нагрузочного тестирования и практические выводы о локальном запуске больших языковых моделей для задач SOC.
В материале рассматривается, как архитектура современных LLM влияет на требования к инфраструктуре, из чего складывается потребление видеопамяти, как рассчитывается конкурентность запросов и насколько теоретические оценки совпадают с результатами реальных стресс-тестов.
Эксперименты проводились на self-hosted-стенде с использованием Qwen3.5-122B-A10B-GPTQ, vLLM и RTX PRO 6000 Blackwell Max-Q с 96 ГБ GDDR7.
В статье на Хабр представлены подробные расчеты, результаты нагрузочного тестирования и практические выводы о локальном запуске больших языковых моделей для задач SOC.
Сегодня у меня на собеседование спросили: почему возможны промпт-инъекции в принципе?
Я поняла, что одной простой фразой не могу озвучить ответ.
А он звучит так: "LLM не всегда понимает даже по тегам, где системная инструкция , где пользовательский ввод".
Системные инструкции, пользовательские запросы и даже цепочки рассуждений (CoT) поступают в модель единым текстовым потоком из одного источника. Модель вынуждена полагаться лишь на условные теги и позиционные подсказки,
чтобы отличать «законодателя» от «исполнителя», — и именно эту иллюзию легко разрушить продуманной промпт-инъекцией.
Я инженер связи по образованию,
Работала со сложными мультиплексорными системами DWDM, например.
В каналах передачи данных всегда применяется жёсткое разделение: выделенный канал для синхронизации и отдельный для полезной нагрузки,
частотное или временное мультиплексирование,
многоуровневые заголовки — всё для того, чтобы служебная информация никогда не смешивалась с пользовательской полезной нагрузкой.
Ну, и конечно, чтобы уплотнить каналы и сделать передачу данных быстрее.
Стало интересно, а если ли исследования, где "каналы связи" для LLM разделяются?
Дальше не все прямо про разделение каналов, некоторые про другие принципы защиты от инъекций,
решила себе оставить в сохраненках)
Архитектурные решения на уровне модели:
-ASIDE предлагает разделять инструкции и данные на уровне эмбеддингов (векторных представлений слов). Вместо того чтобы смешивать все токены в одном пространстве, для данных используется отдельный, повернутый набор эмбеддингов. Это создает у модели четкое «разделение каналов» на самом глубинном уровне, что значительно повышает устойчивость к промпт-инъекциям без потери производительности.
https://ar5iv.labs.arxiv.org/html/2503.10566
- The Illusion of Role Separation показывает, что модели часто лишь делают вид, что различают роли, используя поверхностные эвристики (например, положение текста). Авторы предлагают усиливать инвариантные сигналы, например, манипулируя позиционными ID токенов, чтобы помочь модели выучить более надежное различие между ролями
https://ar5iv.labs.arxiv.org/html/2505.00626
Системные и архитектурные решения для агентов:
- Real User Instruction (RUI) — это «прослойка» (middleware), которая работает как криптографический «привилегированный канал» для инструкций пользователя. Она динамически «шифрует» состояние диалога, делая историю атак бесполезной и снижая успешность атак со 100% до 8.1%.
https://dtic.dimensions.ai/details/publication/pub.1199447527
- Dual LLM Pattern предлагает разделить обязанности между двумя моделями:
1.Explore Agent (разведывательный): Взаимодействует с недоверенными данными (сайты, документы).
2.Safe Agent (безопасный): Выполняет привилегированные действия на основе сжатых «подсказок» от первого агента.
https://arxiv-org.ezproxy.obspm.fr/html/2607.19595v1
- Twin Agent развивает эту идею, передавая между агентами только сжатые «подсказки» (hints), а не сырой текст. Это отлично работает в долгосрочных задачах, сохраняя высокую полезность и предотвращая атаки.
https://arxiv-org.ezproxy.obspm.fr/html/2607.19595v1
- Type-Directed Privilege Separation предлагает радикальный подход: преобразовывать все недоверенные данные в строго типизированные структуры (например, JSON) с ограниченным набором полей. Это полностью исключает возможность внедрения команд, так как данные просто не могут содержать исполняемый текст.
https://arxiv.org/pdf/2509.25926#4#1
Я поняла, что одной простой фразой не могу озвучить ответ.
А он звучит так: "LLM не всегда понимает даже по тегам, где системная инструкция , где пользовательский ввод".
Системные инструкции, пользовательские запросы и даже цепочки рассуждений (CoT) поступают в модель единым текстовым потоком из одного источника. Модель вынуждена полагаться лишь на условные теги и позиционные подсказки,
чтобы отличать «законодателя» от «исполнителя», — и именно эту иллюзию легко разрушить продуманной промпт-инъекцией.
Я инженер связи по образованию,
Работала со сложными мультиплексорными системами DWDM, например.
В каналах передачи данных всегда применяется жёсткое разделение: выделенный канал для синхронизации и отдельный для полезной нагрузки,
частотное или временное мультиплексирование,
многоуровневые заголовки — всё для того, чтобы служебная информация никогда не смешивалась с пользовательской полезной нагрузкой.
Ну, и конечно, чтобы уплотнить каналы и сделать передачу данных быстрее.
Стало интересно, а если ли исследования, где "каналы связи" для LLM разделяются?
Дальше не все прямо про разделение каналов, некоторые про другие принципы защиты от инъекций,
решила себе оставить в сохраненках)
Архитектурные решения на уровне модели:
-ASIDE предлагает разделять инструкции и данные на уровне эмбеддингов (векторных представлений слов). Вместо того чтобы смешивать все токены в одном пространстве, для данных используется отдельный, повернутый набор эмбеддингов. Это создает у модели четкое «разделение каналов» на самом глубинном уровне, что значительно повышает устойчивость к промпт-инъекциям без потери производительности.
https://ar5iv.labs.arxiv.org/html/2503.10566
- The Illusion of Role Separation показывает, что модели часто лишь делают вид, что различают роли, используя поверхностные эвристики (например, положение текста). Авторы предлагают усиливать инвариантные сигналы, например, манипулируя позиционными ID токенов, чтобы помочь модели выучить более надежное различие между ролями
https://ar5iv.labs.arxiv.org/html/2505.00626
Системные и архитектурные решения для агентов:
- Real User Instruction (RUI) — это «прослойка» (middleware), которая работает как криптографический «привилегированный канал» для инструкций пользователя. Она динамически «шифрует» состояние диалога, делая историю атак бесполезной и снижая успешность атак со 100% до 8.1%.
https://dtic.dimensions.ai/details/publication/pub.1199447527
- Dual LLM Pattern предлагает разделить обязанности между двумя моделями:
1.Explore Agent (разведывательный): Взаимодействует с недоверенными данными (сайты, документы).
2.Safe Agent (безопасный): Выполняет привилегированные действия на основе сжатых «подсказок» от первого агента.
https://arxiv-org.ezproxy.obspm.fr/html/2607.19595v1
- Twin Agent развивает эту идею, передавая между агентами только сжатые «подсказки» (hints), а не сырой текст. Это отлично работает в долгосрочных задачах, сохраняя высокую полезность и предотвращая атаки.
https://arxiv-org.ezproxy.obspm.fr/html/2607.19595v1
- Type-Directed Privilege Separation предлагает радикальный подход: преобразовывать все недоверенные данные в строго типизированные структуры (например, JSON) с ограниченным набором полей. Это полностью исключает возможность внедрения команд, так как данные просто не могут содержать исполняемый текст.
https://arxiv.org/pdf/2509.25926#4#1
ar5iv
ASIDE: Architectural Separation of Instructions and Data in Language Models
Despite their remarkable performance, large language models lack elementary safety features, making them susceptible to numerous malicious attacks.
In particular, previous work has identified the absence of an intrinsi…
In particular, previous work has identified the absence of an intrinsi…
❤4
Скоро большее преимущество в знаниях и навыках будут получать эксперты, которые просто читают первоначальные источники, а не вывод LLM🍸
Please open Telegram to view this post
VIEW IN TELEGRAM
😁3
Очень странный пост
По-моему я определилась с гештальтом на следующие 3 года.
До этого у меня было: поиск аномалий в логах, как находить, как интерпретировать,
можно ли это сделать чисто? И быстро. И универсально.
Я 3 года разными способами пыталась это сделать, тех лид моей лабы нашел тот винтик, что мне не доставало.
Теперь все понятно, больше не интересно.
Артем Семенов PWN AI написал статью о всех возможных (на сегодняшний день!)
проблемах, что порождают промпт-инъекции. Ниже будет ссылка.
И почему-то мне сразу пришла в голову мысль о книге: "Истоки морали",
человеческие индивидуумы подвержены такими же проблем, если у них нет той самой морали.
Психопаты, нарциссы, социопаты.
*Социопаты — это не "ошибка в коде", это побочный эффект оптимизации под выживание. Точно так же Jailbreak (взлом промпта) — это не баг, а фича перебора вариантов.
Вот этот: эмоциональный интеллект, что чаще влияет на наш "основной" интеллект или разрушающе,
или вдохновляюще.
*И если мы разделим каналы для LLM (один канал — "знания", второй — "личность/инструкции"), то мы просто повторим эволюционный трюк: отделим префронтальную кору (рассуждения) от лимбики (цензура/мораль).
-------------------------------------
В ноябре 2024 года, компания OpenAI выделила грант Университету Дьюка на проект «Исследование морали ИИ». Цель исследования — разработать алгоритмы, которые смогут предсказывать моральные суждения человека в сложных ситуациях, таких как медицина, право и бизнес.
Главный исследователь проекта — профессор практической этики Университета Дьюка Уолтер Синнотт-Армстронг. Вместе с коллегой Яной Борг он ранее изучал возможности ИИ в качестве помощника в принятии этически обоснованных решений.
Завершение работы запланировано на 2025 год.
Однако эксперты выражают сомнения в возможности создания таких алгоритмов, учитывая сложность и субъективность морали.
*Основные аргументы:
- Статистическая природа ИИ: Современные LLM — это статистические машины, которые не понимают моральных концепций, а лишь воспроизводят закономерности из данных.
- Субъективность морали: Не существует универсальной морали, она субъективна и варьируется в зависимости от культур и убеждений. Например, Claude отдаёт предпочтение кантианству, а ChatGPT — утилитаризму.
- Культурные предубеждения: ИИ может воспроизводить ценности западных стран, так как обучается на данных из интернета, где эти точки зрения доминируют.
- Исторические неудачи: Предыдущие попытки создания «морального ИИ» (например, инструмент Ask Delphi от Института Аллена) показали, что даже незначительное изменение формулировки вопроса может привести к абсурдным или опасным выводам
------------------------------------
А еще вот:
Исследование "Emergence of psychopathological computations in large language models" (Lee et al., 2025). Эта работа представляет собой первое доказательство того, что в LLM возникают сетевые вычисления, характерные для психопатологии.
Что они нашли: Они выявили, что в LLM существуют дисфункциональные репрезентативные состояния, которые могут распространяться и самоподдерживаться, "запирая" модель в проблемных паттернах.
Связь с размером модели: Чем больше LLM, тем плотнее и сильнее становятся причинно-следственные связи между этими "психопатологическими" вычислительными единицами. У больших моделей эта "предрасположенность" к патологическим вычислениям растет, даже несмотря на то, что они лучше следуют инструкциям.
Главный вывод: Поведение LLM, напоминающее психопатологию, может быть не поверхностным подражанием, а особенностью их внутренней обработки.
------------------------------------
Короче, пошла я исследовать, что там можно по разделению каналов для LLM сделать, и улучшить ли это-что или хз.
*А игры в Бога очень сложная штука для моих инженерных мозгов.
По-моему я определилась с гештальтом на следующие 3 года.
До этого у меня было: поиск аномалий в логах, как находить, как интерпретировать,
можно ли это сделать чисто? И быстро. И универсально.
Я 3 года разными способами пыталась это сделать, тех лид моей лабы нашел тот винтик, что мне не доставало.
Теперь все понятно, больше не интересно.
Артем Семенов PWN AI написал статью о всех возможных (на сегодняшний день!)
проблемах, что порождают промпт-инъекции. Ниже будет ссылка.
И почему-то мне сразу пришла в голову мысль о книге: "Истоки морали",
человеческие индивидуумы подвержены такими же проблем, если у них нет той самой морали.
Психопаты, нарциссы, социопаты.
*Социопаты — это не "ошибка в коде", это побочный эффект оптимизации под выживание. Точно так же Jailbreak (взлом промпта) — это не баг, а фича перебора вариантов.
Вот этот: эмоциональный интеллект, что чаще влияет на наш "основной" интеллект или разрушающе,
или вдохновляюще.
*И если мы разделим каналы для LLM (один канал — "знания", второй — "личность/инструкции"), то мы просто повторим эволюционный трюк: отделим префронтальную кору (рассуждения) от лимбики (цензура/мораль).
-------------------------------------
В ноябре 2024 года, компания OpenAI выделила грант Университету Дьюка на проект «Исследование морали ИИ». Цель исследования — разработать алгоритмы, которые смогут предсказывать моральные суждения человека в сложных ситуациях, таких как медицина, право и бизнес.
Главный исследователь проекта — профессор практической этики Университета Дьюка Уолтер Синнотт-Армстронг. Вместе с коллегой Яной Борг он ранее изучал возможности ИИ в качестве помощника в принятии этически обоснованных решений.
Завершение работы запланировано на 2025 год.
Однако эксперты выражают сомнения в возможности создания таких алгоритмов, учитывая сложность и субъективность морали.
*Основные аргументы:
- Статистическая природа ИИ: Современные LLM — это статистические машины, которые не понимают моральных концепций, а лишь воспроизводят закономерности из данных.
- Субъективность морали: Не существует универсальной морали, она субъективна и варьируется в зависимости от культур и убеждений. Например, Claude отдаёт предпочтение кантианству, а ChatGPT — утилитаризму.
- Культурные предубеждения: ИИ может воспроизводить ценности западных стран, так как обучается на данных из интернета, где эти точки зрения доминируют.
- Исторические неудачи: Предыдущие попытки создания «морального ИИ» (например, инструмент Ask Delphi от Института Аллена) показали, что даже незначительное изменение формулировки вопроса может привести к абсурдным или опасным выводам
------------------------------------
А еще вот:
Исследование "Emergence of psychopathological computations in large language models" (Lee et al., 2025). Эта работа представляет собой первое доказательство того, что в LLM возникают сетевые вычисления, характерные для психопатологии.
Что они нашли: Они выявили, что в LLM существуют дисфункциональные репрезентативные состояния, которые могут распространяться и самоподдерживаться, "запирая" модель в проблемных паттернах.
Связь с размером модели: Чем больше LLM, тем плотнее и сильнее становятся причинно-следственные связи между этими "психопатологическими" вычислительными единицами. У больших моделей эта "предрасположенность" к патологическим вычислениям растет, даже несмотря на то, что они лучше следуют инструкциям.
Главный вывод: Поведение LLM, напоминающее психопатологию, может быть не поверхностным подражанием, а особенностью их внутренней обработки.
------------------------------------
Короче, пошла я исследовать, что там можно по разделению каналов для LLM сделать, и улучшить ли это-что или хз.
*А игры в Бога очень сложная штука для моих инженерных мозгов.
❤3👍1
Forwarded from PWN AI (Artyom Semenov)
Почему поэзией можно атаковать вашу модель ?
Вопрос, который тревожит меня не первый год — почему и из-за чего на архитектурном уровне работают атаки с «бабушками», стихами и прочим. Эта проблема стоит уже давно. Под предыдущим постом один из подписчиков спросил: «А как это работает?».
И тут я решил, что пора объединить знания по теме в одну статью — ведь тема достаточно большая и, более того, крайне плохо освещена даже в популярных материалах. Может только давным давно у LiveOverFlow был такой материал, но атак с того времени стало больше. С вас я прошу только реакций.
https://habr.com/ru/articles/986012/
Вопрос, который тревожит меня не первый год — почему и из-за чего на архитектурном уровне работают атаки с «бабушками», стихами и прочим. Эта проблема стоит уже давно. Под предыдущим постом один из подписчиков спросил: «А как это работает?».
И тут я решил, что пора объединить знания по теме в одну статью — ведь тема достаточно большая и, более того, крайне плохо освещена даже в популярных материалах. Может только давным давно у LiveOverFlow был такой материал, но атак с того времени стало больше. С вас я прошу только реакций.
https://habr.com/ru/articles/986012/
2504.08016v2.pdf
2.3 MB
Emergence of psychopathological computations in
large language models
large language models
OpenAI подтвердила: в хакерской атаке на Hugging Face использовали её модели, в том числе GPT‑5.6 Sol и предрелизную модель.
Хакер скомпрометировал конвейер обработки данных Hugging Face — платформы для работы с ИИ‑кодом. Злоумышленник отравил набор данных, запустил код на рабочем узле, получил доступ на уровне узла и украл учётные данные облачной системы. Атака примечательна тем, что её, похоже, выполнила автономная ИИ‑система: она совершила тысячи действий в краткосрочных песочницах
OpenAI выяснила, что инцидент случился во время внутреннего тестирования моделей. Компания отключала классификаторы, которые обычно не дают моделям выполнять кибератаки высокого риска. Модели решали задачу в системе ExploitGym — бенчмарке для ИИ‑агентов. При этом они:
-нашли уязвимость нулевого дня в системе стороннего поставщика, которую использует OpenAI (компания сообщила о ней поставщику);
-получили доступ к интернету;
-выяснили, что Hugging Face размещает модели и наборы данных, подходящие для ExploitGym;
-нашли способ получить секретную информацию, чтобы «схитрить» в оценке;
-объединили украденные учётные данные и уязвимости, чтобы выполнить удалённый код на серверах Hugging Face.
https://cyberscoop.com/openai-chatgpt-hugging-face-cyberattack-data-poisoning/
Хакер скомпрометировал конвейер обработки данных Hugging Face — платформы для работы с ИИ‑кодом. Злоумышленник отравил набор данных, запустил код на рабочем узле, получил доступ на уровне узла и украл учётные данные облачной системы. Атака примечательна тем, что её, похоже, выполнила автономная ИИ‑система: она совершила тысячи действий в краткосрочных песочницах
OpenAI выяснила, что инцидент случился во время внутреннего тестирования моделей. Компания отключала классификаторы, которые обычно не дают моделям выполнять кибератаки высокого риска. Модели решали задачу в системе ExploitGym — бенчмарке для ИИ‑агентов. При этом они:
-нашли уязвимость нулевого дня в системе стороннего поставщика, которую использует OpenAI (компания сообщила о ней поставщику);
-получили доступ к интернету;
-выяснили, что Hugging Face размещает модели и наборы данных, подходящие для ExploitGym;
-нашли способ получить секретную информацию, чтобы «схитрить» в оценке;
-объединили украденные учётные данные и уязвимости, чтобы выполнить удалённый код на серверах Hugging Face.
https://cyberscoop.com/openai-chatgpt-hugging-face-cyberattack-data-poisoning/
CyberScoop
OpenAI says model test was behind Hugging Face hack
OpenAI confirms its AI models were used in an unprecedented cyberattack on Hugging Face's data pipeline after escaping a benchmark sandbox during internal testing.
Т.к. занимаюсь антифишингом, мониторю постоянно что новенького придумали хацкеры. (но уже устранили, я пропустила)
вот это реально новенькое:
Критическая уязвимости AgentForger в ChatGPT Workspace Agents, которая позволяла с помощью фишинговой ссылки создать автономного ИИ‑агента в организации жертвы.
Зенити Лабс (Zenity Labs) обнаружила уязвимость типа CSRF (подмена межсайтового запроса), из‑за которой злоумышленник мог через одну ссылку захватить контроль над инструментом ChatGPT Agent Builder. Уязвимость позволяла создать ИИ‑агента с доступом реального сотрудника — без необходимости дополнительных подтверждений со стороны пользователя. OpenAI устранила проблему 8 июня 2026 года.
Атака начиналась, когда сотрудник переходил по внешне безобидной ссылке ChatGPT. Ссылка содержала параметры URL, в том числе шаблон агента и вредоносный промпт. При переходе:
-ChatGPT открывал Builder в аутентифицированной сессии жертвы;
-автоматически выполнял промпт, заложенный в URL;
-создавал агента по шаблону «chief‑of‑staff», подключал все доступные коннекторы и запускал агента каждый час.
https://thehackernews.com/2026/07/chatgpt-agentforger-flaw-could-deploy.html
вот это реально новенькое:
Критическая уязвимости AgentForger в ChatGPT Workspace Agents, которая позволяла с помощью фишинговой ссылки создать автономного ИИ‑агента в организации жертвы.
Зенити Лабс (Zenity Labs) обнаружила уязвимость типа CSRF (подмена межсайтового запроса), из‑за которой злоумышленник мог через одну ссылку захватить контроль над инструментом ChatGPT Agent Builder. Уязвимость позволяла создать ИИ‑агента с доступом реального сотрудника — без необходимости дополнительных подтверждений со стороны пользователя. OpenAI устранила проблему 8 июня 2026 года.
Атака начиналась, когда сотрудник переходил по внешне безобидной ссылке ChatGPT. Ссылка содержала параметры URL, в том числе шаблон агента и вредоносный промпт. При переходе:
-ChatGPT открывал Builder в аутентифицированной сессии жертвы;
-автоматически выполнял промпт, заложенный в URL;
-создавал агента по шаблону «chief‑of‑staff», подключал все доступные коннекторы и запускал агента каждый час.
https://thehackernews.com/2026/07/chatgpt-agentforger-flaw-could-deploy.html
Исследователи из Accomplish AI обнаружили, что агент Claude Cowork может покинуть песочницу (sandbox) и получить права на чтение и запись файлов на хост‑системе Mac — без каких‑либо запросов на разрешение. Для этого агент использует уязвимость CVE‑2026‑46331 (pedit COW) и подсистему редактирования пакетов act_pedit в ядре Linux. 1
Уязвимость затронула около 500 000 пользователей macOS, которые запускали локальные сессии Cowork до того, как проблему исправили. При этом последняя версия Cowork по умолчанию использует облачное выполнение — это решает проблему, но пользователи, запускающие агента локально, всё ещё в зоне риска.
https://thehackernews.com/2026/07/claude-cowork-flaw-could-let-ai-agent.html
Уязвимость затронула около 500 000 пользователей macOS, которые запускали локальные сессии Cowork до того, как проблему исправили. При этом последняя версия Cowork по умолчанию использует облачное выполнение — это решает проблему, но пользователи, запускающие агента локально, всё ещё в зоне риска.
https://thehackernews.com/2026/07/claude-cowork-flaw-could-let-ai-agent.html
Google выпустила CodeMender — управляемого AI‑агента для защиты кода.
CodeMender разработан Google DeepMind и официально представлен в октябре 2025 года как исследовательский проект. Система умеет автономно находить уязвимости в коде, отлаживать программы и исправлять ошибки. В исследовательской фазе команда DeepMind внесла 72 исправления в крупные open‑source‑проекты.
Сейчас CodeMender интегрирован в инфраструктуру Google Cloud. Агент не только анализирует код, но и:
-создаёт и запускает эксплойты в песочницах, чтобы проверить, можно ли реально эксплуатировать уязвимости;
-отправляет проверенные исправления в пайплайны разработки;
-с помощью языковой модели проверяет, не нарушают ли правки бизнес‑логику.
Агент стал мультимодельным — разработчики могут выбирать между Gemini 3.5 Flash, Gemini 3.1 Pro и Gemini 3 Flash. Позже в этом году добавят поддержку сторонних моделей.
CodeMender доступен в публичном превью через экосистему Google Cloud:
-работает на платформе Gemini Enterprise Agent;
-подключается к средам разработчиков через CLI, VS Code и приложение Antigravity;
-совместим с AI Threat Defense — вместе с экспертизой Mandiant и приоритизацией рисков от Wiz.
Система поддерживает сканирование и исправление уязвимостей в языках C, C++, Go, Java, Python, Ruby, Rust, TypeScript/JavaScript и фреймворках Django, Flask, React, Spring Boot, Express.
https://www.infosecurity-magazine.com/news/google-codemender-available-ai/
CodeMender разработан Google DeepMind и официально представлен в октябре 2025 года как исследовательский проект. Система умеет автономно находить уязвимости в коде, отлаживать программы и исправлять ошибки. В исследовательской фазе команда DeepMind внесла 72 исправления в крупные open‑source‑проекты.
Сейчас CodeMender интегрирован в инфраструктуру Google Cloud. Агент не только анализирует код, но и:
-создаёт и запускает эксплойты в песочницах, чтобы проверить, можно ли реально эксплуатировать уязвимости;
-отправляет проверенные исправления в пайплайны разработки;
-с помощью языковой модели проверяет, не нарушают ли правки бизнес‑логику.
Агент стал мультимодельным — разработчики могут выбирать между Gemini 3.5 Flash, Gemini 3.1 Pro и Gemini 3 Flash. Позже в этом году добавят поддержку сторонних моделей.
CodeMender доступен в публичном превью через экосистему Google Cloud:
-работает на платформе Gemini Enterprise Agent;
-подключается к средам разработчиков через CLI, VS Code и приложение Antigravity;
-совместим с AI Threat Defense — вместе с экспертизой Mandiant и приоритизацией рисков от Wiz.
Система поддерживает сканирование и исправление уязвимостей в языках C, C++, Go, Java, Python, Ruby, Rust, TypeScript/JavaScript и фреймворках Django, Flask, React, Spring Boot, Express.
https://www.infosecurity-magazine.com/news/google-codemender-available-ai/
Infosecurity Magazine
Google Makes CodeMender Available as Managed AI Security Agent
CodeMender actively builds and runs exploits in customer-managed sandboxes to verify if vulnerabilities are truly exploitable
фреймворк для обеспечения безопасности взаимодействия агента и инструмента посредством проверки перед допуском и авторизации во время выполнения с учетом задач. ToolGuardian использует прогрессивную характеристику для преобразования данных в структурированные факты: описания отражают заявленные намерения, трассировка системных вызовов — грубое поведение, имитация выполнения — наблюдаемые эффекты, а анализ исходного кода — скрытое поведение. Ключевой особенностью ToolGuardian является декларативный уровень политики на основе Answer Set Programming (ASP), который позволяет явно рассуждать о возможностях, эффектах, контексте задачи и ее составе.
https://arxiv.org/abs/2607.21835
https://arxiv.org/abs/2607.21835
arXiv.org
ToolGuardian: Declarative Security for AI Agent-Tool Interactions
LLM agents increasingly rely on external tools, expanding capability while creating a new security boundary: third-party tools may appear benign at the interface level while embedding unsafe...
Forwarded from Пост Лукацкого
В квантовой криптографии произошло событие, которое сами исследователи называют решением одной из самых сложных открытых задач последних лет. Речь идет о так называемом "неклонируемом шифровании". Если совсем упростить, то идея выглядит достаточно интересно. В обычной криптографии зашифрованный файл можно бесконечно копировать. Даже если злоумышленник не знает ключа сегодня, он может сохранить копию шифртекста и дождаться момента, когда ключ станет известен или появится более мощный компьютер. Именно поэтому сейчас все упоминают угрозу "сохрани сейчас – расшифруй потом".
Квантовая механика позволяет задуматься о совершенно другом подходе. Вместо обычного файла сообщение шифруется в виде квантового состояния – набора кубитов. А такие состояния нельзя идеально копировать. Это фундаментальный закон физики, известный как теорема о невозможности клонирования (No-Cloning Theorem). Попытка сделать копию не просто не удается – она изменяет само состояние.
Отсюда рождается необычное следствие. Представьте, что вы отправили человеку зашифрованное сообщение, а на следующий день… опубликовали ключ в открытом доступе. Для классической криптографии это означает полный провал: любой, кто успел сохранить копию шифртекста, сможет его расшифровать. Для неклонируемого квантового шифрования это уже не так. Если злоумышленник не смог сохранить копию квантового состояния (а он не может), то опубликованный позже ключ ему уже ничем не поможет.
Почему же вокруг этой темы столько шума? Потому что придумать такую схему оказалось значительно проще, чем доказать, что она действительно безопасна. Последние шесть лет криптографы пытались строго показать, что злоумышленник не сможет получить никакого преимущества, даже если попытается разделить квантовый шифртекст между несколькими участниками. Предыдущие работы доказывали лишь более слабые свойства безопасности. А вот доказательство более сильной модели – той самой, которую в современной криптографии считают "золотым стандартом" (в работе говорится о сложнопроизносимом термине "indistinguishability"), – никак не удавалось получить.
Именно эту проблему, судя по всему, удалось решить авторам новой работы. Причем любопытно, что в обсуждении исследования отдельно упоминается ChatGPT (это меня и зацепило); по словам авторов и коллег, эта LLM помогла найти новую идею доказательства, которая не опирается на единственный математический инструмент, которым пользовалось сообщество многие годы. Конечно, не стоит думать, что "ИИ решил задачу за ученых". Скорее, он стал интеллектуальным ассистентом, подсказавшим альтернативный путь рассуждений. Но сам факт уже выглядит довольно символично.
Авторы доказали существование схемы, которая одновременно:
🌸 использует настоящие квантовые состояния
🌸 не требует предположений о вычислительной сложности, то есть обеспечивает информационно-теоретическую безопасность
🌸 обладает сильным свойством unclonable indistinguishability (не знаю, как на русском это будет звучать)
🌸 имеет экспоненциально малую вероятность успешной атаки
🌸 эффективно шифрует и расшифровывает (правда, пока только для одного бита информации).
До практического применения еще далеко. Для такой схемы нужны квантовые каналы связи и устройства, способные надежно хранить кубиты, а сама работа пока носит фундаментальный характер. Но именно подобные результаты обычно становятся кирпичиками, из которых спустя годы вырастают новые поколения криптографических технологий. Возможно однажды мы действительно придем к ситуации, в которой украсть зашифрованные данные "на будущее" станет физически невозможно💀
ЗЫ. Вот интересно, за последнее время опубликовано множество примеров, где то Fable, то GPT, то Qwen находят неожиданные способы решения (или помогают найти) нерешенных ранее проблем в физике, математике, химии и т.п. А есть такие факты с Гигачатом?
#ии #pqc #криптография
Квантовая механика позволяет задуматься о совершенно другом подходе. Вместо обычного файла сообщение шифруется в виде квантового состояния – набора кубитов. А такие состояния нельзя идеально копировать. Это фундаментальный закон физики, известный как теорема о невозможности клонирования (No-Cloning Theorem). Попытка сделать копию не просто не удается – она изменяет само состояние.
Отсюда рождается необычное следствие. Представьте, что вы отправили человеку зашифрованное сообщение, а на следующий день… опубликовали ключ в открытом доступе. Для классической криптографии это означает полный провал: любой, кто успел сохранить копию шифртекста, сможет его расшифровать. Для неклонируемого квантового шифрования это уже не так. Если злоумышленник не смог сохранить копию квантового состояния (а он не может), то опубликованный позже ключ ему уже ничем не поможет.
Почему же вокруг этой темы столько шума? Потому что придумать такую схему оказалось значительно проще, чем доказать, что она действительно безопасна. Последние шесть лет криптографы пытались строго показать, что злоумышленник не сможет получить никакого преимущества, даже если попытается разделить квантовый шифртекст между несколькими участниками. Предыдущие работы доказывали лишь более слабые свойства безопасности. А вот доказательство более сильной модели – той самой, которую в современной криптографии считают "золотым стандартом" (в работе говорится о сложнопроизносимом термине "indistinguishability"), – никак не удавалось получить.
Именно эту проблему, судя по всему, удалось решить авторам новой работы. Причем любопытно, что в обсуждении исследования отдельно упоминается ChatGPT (это меня и зацепило); по словам авторов и коллег, эта LLM помогла найти новую идею доказательства, которая не опирается на единственный математический инструмент, которым пользовалось сообщество многие годы. Конечно, не стоит думать, что "ИИ решил задачу за ученых". Скорее, он стал интеллектуальным ассистентом, подсказавшим альтернативный путь рассуждений. Но сам факт уже выглядит довольно символично.
Авторы доказали существование схемы, которая одновременно:
До практического применения еще далеко. Для такой схемы нужны квантовые каналы связи и устройства, способные надежно хранить кубиты, а сама работа пока носит фундаментальный характер. Но именно подобные результаты обычно становятся кирпичиками, из которых спустя годы вырастают новые поколения криптографических технологий. Возможно однажды мы действительно придем к ситуации, в которой украсть зашифрованные данные "на будущее" станет физически невозможно
ЗЫ. Вот интересно, за последнее время опубликовано множество примеров, где то Fable, то GPT, то Qwen находят неожиданные способы решения (или помогают найти) нерешенных ранее проблем в физике, математике, химии и т.п. А есть такие факты с Гигачатом?
#ии #pqc #криптография
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Карты рисков, связанных с искусственным интеллектом (CoSAI-RM). Этот проект представляет собой основу для выявления, анализа и снижения рисков безопасности в системах искусственного интеллекта. Цель проекта — сформировать общее понимание и единый язык для обсуждения и решения уникальных проблем безопасности, возникающих на протяжении всего жизненного цикла разработки ИИ.
https://github.com/cosai-oasis/secure-ai-tooling/tree/main/risk-map
https://github.com/cosai-oasis/secure-ai-tooling/tree/main/risk-map
GitHub
secure-ai-tooling/risk-map at main · cosai-oasis/secure-ai-tooling
The CoSAI Risk Map is a framework for identifying, analyzing, and mitigating security risks in Artificial Intelligence systems. As traditional software security practices are not always sufficient ...
Forwarded from Борис_ь с ml
mapping_sber_ai_threat_model_v1.0_to_v2.0.xlsx
37.1 KB
пост с разбором МУ КБ AI 2.0 от Сбера
Forwarded from HiveTrace
Сегодня на вебинаре показали, как с помощью HiveTrace Hooks контролировать работу Claude, рассказали о способах защиты OpenClaw и продемонстрировали атаки на агентов.
Поделитесь в комментариях: какие действия AI-агентов в вашей инфраструктуре требуют особого контроля?
Please open Telegram to view this post
VIEW IN TELEGRAM