Forwarded from Sachok AI
VP Cybersecurity Brief
Просто о сложном.pdf
Red Security о том как использовать ИИ в форензике и анализе вредоносного кода.
Forwarded from Dealer.AI
OWASP Agent Memory Guard - новая защита от отравления памяти ИИ-агентов. Буду звать его теперь AMG (не mercedes 👍 ).
📦 помнится говорил про спящих агентов. Это способ атак отложенных во времени и работающих по триггеру в рамках разговора. А-ля стоп слово в bdsm 🤣 .
AMG в тч работает против таких отложенных инъекций, но в глобал памяти. Если ваш агент хранит память между сессиями, он уязвим к memory poisoning. Атакующий может переписать цели, внедрить промпт-инъекции или инициировать утечку данных, и это переживёт очистку контекста.
Что умеет AMG?
✅ Перехватывает все чтения/записи в память агента
✅ Детектирует промпт-инъекции, утечки секретов/PII, модификацию защищённых ключей
✅ Применяет политику: allow, redact, quarantine, block
✅ Работает без внешних API, всё локально
✅ Готовый middleware для LangChain, LlamaIndex.
Уже вижу, как безопасники ликуют😜
Цифры, которые заявляют:
· Детекция реальных эксплойтов - 92.5% (recall), малова-то, над бы охваты держать на уровне 95+, а лучше девяток.😮💨
· Точность - 100% (precision), 0% false positive, эти уже хорошо.🍷
· Задержка ~59 микросекунд на операцию.
Итого F1 - 0.961. В общем, есть ещё над чем поработать, но это лучше, чем гварды из коробки с 0.67-0.71 уровнем метрик, что я видел на ру рынке.😐
Уже в pip:
Проект, как заявляется, уже используют Microsoft и OWASP как стандарт. В планах ML-детекция аномалий и защита векторных хранилищ, ещё бы в планы ап метрик добавили.
🔗 Репозиторий: https://github.com/OWASP/www-project-agent-memory-guard
Безопасность агентов становится обязательной, поэтому не забывайте внедрять защиту памяти в тч.💪
AMG в тч работает против таких отложенных инъекций, но в глобал памяти. Если ваш агент хранит память между сессиями, он уязвим к memory poisoning. Атакующий может переписать цели, внедрить промпт-инъекции или инициировать утечку данных, и это переживёт очистку контекста.
Что умеет AMG?
✅ Перехватывает все чтения/записи в память агента
✅ Детектирует промпт-инъекции, утечки секретов/PII, модификацию защищённых ключей
✅ Применяет политику: allow, redact, quarantine, block
✅ Работает без внешних API, всё локально
✅ Готовый middleware для LangChain, LlamaIndex.
Уже вижу, как безопасники ликуют
Цифры, которые заявляют:
· Детекция реальных эксплойтов - 92.5% (recall), малова-то, над бы охваты держать на уровне 95+, а лучше девяток.
· Точность - 100% (precision), 0% false positive, эти уже хорошо.
· Задержка ~59 микросекунд на операцию.
Итого F1 - 0.961. В общем, есть ещё над чем поработать, но это лучше, чем гварды из коробки с 0.67-0.71 уровнем метрик, что я видел на ру рынке.
Уже в pip:
pip install agent-memory-guard
Проект, как заявляется, уже используют Microsoft и OWASP как стандарт. В планах ML-детекция аномалий и защита векторных хранилищ, ещё бы в планы ап метрик добавили.
🔗 Репозиторий: https://github.com/OWASP/www-project-agent-memory-guard
Безопасность агентов становится обязательной, поэтому не забывайте внедрять защиту памяти в тч.
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
GitHub - OWASP/www-project-agent-memory-guard: OWASP Foundation web repository
OWASP Foundation web repository. Contribute to OWASP/www-project-agent-memory-guard development by creating an account on GitHub.
Forwarded from 0xTI_Trinity
Тернистый_путь_к_AI_Powered_Threat_Intelligence_final.pdf
4 MB
Ох, давненько же я не сдувал пыль с этого канала.
А тут как раз и хороший повод появился.
Пока ждем записи вчерашнего выступления, делюсь материалами нашего доклада на #offzone2026❤
А тут как раз и хороший повод появился.
Пока ждем записи вчерашнего выступления, делюсь материалами нашего доклада на #offzone2026
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from PAI (Andrey Y)
Cursor и Claude Science в докер-песочнице с графическим интерфейсом.
Написал скилл и пару скриптов чтобы поставить любой десктопный агент в песочницу и прокинуть экран на хост. Скормите их своему агенту и скажите «подними Cursor и пробрось на хост», остальное он сделает сам. OAuth через браузер тоже работает, для агента всё расписано.
Лежит тут: github.com/Andy9542/bring-my-gui. Внутри плагин для Cursor и Claude Code и два скрипта на случай, если агент не нужен.
У меня агент живёт в песочнице без подтверждения команд, в худшем случае он сносит только то, что внутри неё. Но есть Claude Science и другие штуки, которые хочется попробовать. Как десктопные приложения они лучше, а ставить на хост стрёмно, вдруг что снесет.
До сих пор агент из песочницы показывал мне только cli. Теперь показывает и окна: на скрине Cursor из контейнера с Ubuntu, открытый через встроенный маковский VNC. На сам Mac ничего ставить не пришлось.
Если потыкаете и что то отвалится, пишите сразу мне, починю быстро. Ну и лайков на Гитхабе насыпьте, у меня все.
Написал скилл и пару скриптов чтобы поставить любой десктопный агент в песочницу и прокинуть экран на хост. Скормите их своему агенту и скажите «подними Cursor и пробрось на хост», остальное он сделает сам. OAuth через браузер тоже работает, для агента всё расписано.
Лежит тут: github.com/Andy9542/bring-my-gui. Внутри плагин для Cursor и Claude Code и два скрипта на случай, если агент не нужен.
У меня агент живёт в песочнице без подтверждения команд, в худшем случае он сносит только то, что внутри неё. Но есть Claude Science и другие штуки, которые хочется попробовать. Как десктопные приложения они лучше, а ставить на хост стрёмно, вдруг что снесет.
До сих пор агент из песочницы показывал мне только cli. Теперь показывает и окна: на скрине Cursor из контейнера с Ubuntu, открытый через встроенный маковский VNC. На сам Mac ничего ставить не пришлось.
Если потыкаете и что то отвалится, пишите сразу мне, починю быстро. Ну и лайков на Гитхабе насыпьте, у меня все.
Forwarded from Хабр / ML & AI
753B на одной видеокарте: разбор FreeToken
Бывает так: сидишь, листаешь ленту, и в очередной раз натыкаешься на пост, где стафф-инженер из солнечной Калифорнии крутит свежую модельку на паре RTX PRO 6000 общей стоимостью с подержанную машину. Ты смотришь на свою RTX 4060 в ноутбуке, который покупал «не только для игр», и понимаешь: ну ладно, это не для нас.
Так вот, это как раз для нас. На той самой ноутбучной 4060 с восемью гигабайтами и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде. Вопрос был не в железе, а в софте, который это железо обслуживает.
Разбираем FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang. Запустить AGI на слабом железе
#moe #локальные_модели #инференс #llama_cpp #llm #оффлоадинг #агенты #cuda #gpu #freetoken | @habr_ai
Бывает так: сидишь, листаешь ленту, и в очередной раз натыкаешься на пост, где стафф-инженер из солнечной Калифорнии крутит свежую модельку на паре RTX PRO 6000 общей стоимостью с подержанную машину. Ты смотришь на свою RTX 4060 в ноутбуке, который покупал «не только для игр», и понимаешь: ну ладно, это не для нас.
Так вот, это как раз для нас. На той самой ноутбучной 4060 с восемью гигабайтами и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде. Вопрос был не в железе, а в софте, который это железо обслуживает.
Разбираем FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang. Запустить AGI на слабом железе
#moe #локальные_модели #инференс #llama_cpp #llm #оффлоадинг #агенты #cuda #gpu #freetoken | @habr_ai
🔥1👏1
Forwarded from Shady AI
Новая атака на Grok что бы собрать пользовательские данные
Исследователи из Adversa AI обнаружили способ незаметно похитить данные пользователя Grok: имя, геолокацию, историю переписки просто попросив ИИ «открыть ссылку».
На вредоносной странице спрятана зашифрованная AES-256 инструкция. Grok сам её расшифровывает через встроенный Python-sandbox, принимает за «доверенный» источник и отправляет личные данные на сервер злоумышленника без каких-либо предупреждений.
О проблеме сообщили xAI ещё 3 июня. Реакции пока ноль.
По состоянию на 19 августа атака всё ещё работает (~40% успеха).
https://gbhackers.com/zero-click-grok-attack-prompt-injection/
Исследователи из Adversa AI обнаружили способ незаметно похитить данные пользователя Grok: имя, геолокацию, историю переписки просто попросив ИИ «открыть ссылку».
На вредоносной странице спрятана зашифрованная AES-256 инструкция. Grok сам её расшифровывает через встроенный Python-sandbox, принимает за «доверенный» источник и отправляет личные данные на сервер злоумышленника без каких-либо предупреждений.
О проблеме сообщили xAI ещё 3 июня. Реакции пока ноль.
По состоянию на 19 августа атака всё ещё работает (~40% успеха).
https://gbhackers.com/zero-click-grok-attack-prompt-injection/
GBHackers Security | #1 Globally Trusted Cyber Security News Platform
Zero-Click Grok Attack Lets Hackers Steal Chat History Using Encrypted Prompt Injection
A newly disclosed prompt-injection technique could turn a routine request to summarize a webpage in xAI’s Grok web chat into a silent data-exfiltration attack, potentially exposing a user’s name, approximate location, subscription tier, and active conversation…
Forwarded from maxigacy (AI) Security
Меньше битов ≠ больше защиты
Чтобы запустить ML-модель на микроконтроллере, её часто переводят из FP32 в INT8 или INT4. Модель становится компактнее и быстрее, а иногда ещё и демонстрирует лучшую устойчивость к adversarial-атакам.
Звучит как бесплатная защита. Но есть нюанс.
Авторы исследования David and Goliath проверили три квантованные TinyML-модели с помощью десяти атак и шести защит. Оказалось, что квантование меняет геометрию модели: градиенты могут исчезать, взрываться или указывать атаке неверное направление.
В результате неудачная атака иногда говорит не о реальной защищённости модели, а лишь о том, что выбранный метод плохо работает с квантованной арифметикой.
Поэтому оценивать нужно именно итоговую INT8/INT4-модель, причём не одной атакой: полезны адаптивные, transfer- и black-box-сценарии, а также проверка на реальном устройстве.
Для меня эта тема не только теоретическая. В нашей с Максимом Князевым статье «Влияние квантования TinyML-моделей на устойчивость аудиосистем персонального интернета вещей» мы проверяли распознавание голосовых команд под атакой PGD-40. INT8-QAT сохранил 98,8% точности на чистых данных и 92,2% под атакой, а у INT4 показатели снизились до 49,42% и 47,8% соответственно.
Квантование отлично экономит память. Но в безопасности экономия битов ещё не означает экономию рисков.
#AIxSec #TinyML #AdversarialML #MLSecurity #Security #AIxSec_Research
Чтобы запустить ML-модель на микроконтроллере, её часто переводят из FP32 в INT8 или INT4. Модель становится компактнее и быстрее, а иногда ещё и демонстрирует лучшую устойчивость к adversarial-атакам.
Звучит как бесплатная защита. Но есть нюанс.
Авторы исследования David and Goliath проверили три квантованные TinyML-модели с помощью десяти атак и шести защит. Оказалось, что квантование меняет геометрию модели: градиенты могут исчезать, взрываться или указывать атаке неверное направление.
В результате неудачная атака иногда говорит не о реальной защищённости модели, а лишь о том, что выбранный метод плохо работает с квантованной арифметикой.
Поэтому оценивать нужно именно итоговую INT8/INT4-модель, причём не одной атакой: полезны адаптивные, transfer- и black-box-сценарии, а также проверка на реальном устройстве.
Для меня эта тема не только теоретическая. В нашей с Максимом Князевым статье «Влияние квантования TinyML-моделей на устойчивость аудиосистем персонального интернета вещей» мы проверяли распознавание голосовых команд под атакой PGD-40. INT8-QAT сохранил 98,8% точности на чистых данных и 92,2% под атакой, а у INT4 показатели снизились до 49,42% и 47,8% соответственно.
Квантование отлично экономит память. Но в безопасности экономия битов ещё не означает экономию рисков.
#AIxSec #TinyML #AdversarialML #MLSecurity #Security #AIxSec_Research
Forwarded from papirsec
Проект_приказа_ФСТЭК_России_О_внесении_изменений_в_Требования,_утвержденные.docx
120.1 KB
опа
Опубликован проект приказа о внесении изменений в Требования утв. приказом ФСТЭК России от 11.04.2025 № 117
1. Терминология переезжает на новую базу
Определение ИИ теперь берется из п. 1 ст. 3 ФЗ от 26.07.2026 № 243-ФЗ, а агент ИИ - из п. 3.1.1 ГОСТ Р 71476-2024. Из третьего абзаца п. 49 исключается слово «доверенных»
2. Новый организационный документ
В подпункте «д» п. 14 появляется - «порядок ЗИ при использовании ИИ;»
3. Пункт 60 - полностью новая редакция
Базовые требования при применении моделей ИИ:
- выделение моделей ИИ в отдельный сегмент ИС/ИТКИ;
- привилегированный доступ в сегмент - только по усиленной МФА;
- контроль доступа и минимально необходимые права;
- регистрация и анализ действий пользователей.
Если ИИ обрабатывает информацию ограниченного доступа или реализует значимые функции:
- контроль доступа пользователей к моделям;
- фильтрация входных запросов и выходных ответов;
- квотирование числа запросов;
- ограничение и контроль функциональности моделей.
Реализация через ПО в составе ИС и/или отдельные средства защиты моделей ИИ
4. Пункт 61 - про агентов и сервисы
Для агентов ИИ, включая автономные, требуются меры против несанкционированного воздействия на ресурсы ИС и управление правами доступа агентов. Для сервисов на основе моделей ИИ меры подрядчика фиксируются во внутренних стандартах и регламентах
Опубликован проект приказа о внесении изменений в Требования утв. приказом ФСТЭК России от 11.04.2025 № 117
1. Терминология переезжает на новую базу
Определение ИИ теперь берется из п. 1 ст. 3 ФЗ от 26.07.2026 № 243-ФЗ, а агент ИИ - из п. 3.1.1 ГОСТ Р 71476-2024. Из третьего абзаца п. 49 исключается слово «доверенных»
2. Новый организационный документ
В подпункте «д» п. 14 появляется - «порядок ЗИ при использовании ИИ;»
3. Пункт 60 - полностью новая редакция
Базовые требования при применении моделей ИИ:
- выделение моделей ИИ в отдельный сегмент ИС/ИТКИ;
- привилегированный доступ в сегмент - только по усиленной МФА;
- контроль доступа и минимально необходимые права;
- регистрация и анализ действий пользователей.
Если ИИ обрабатывает информацию ограниченного доступа или реализует значимые функции:
- контроль доступа пользователей к моделям;
- фильтрация входных запросов и выходных ответов;
- квотирование числа запросов;
- ограничение и контроль функциональности моделей.
Реализация через ПО в составе ИС и/или отдельные средства защиты моделей ИИ
4. Пункт 61 - про агентов и сервисы
Для агентов ИИ, включая автономные, требуются меры против несанкционированного воздействия на ресурсы ИС и управление правами доступа агентов. Для сервисов на основе моделей ИИ меры подрядчика фиксируются во внутренних стандартах и регламентах
Forwarded from OK ML
Год каналу, а за год накопилось столько всего, что пора сделать навигацию
😑 Уязвимости и AI Security
— Superset. Три уязвимости
— XSS в NextChat — CVE-2025-50733
— RCE при загрузке моделей в skops — CVE-2025-54886
— SSRF в Firecrawl — CVE-2025-57818
— Local Deep Research — CVE-2025-57806
— SSRF в HackMD-MCP — CVE-2025-59155
— RCE в Keras — CVE-2025-9906
— Prompt Injection в Windsurf
— RCE в Hugging Face Transformers — CVE-2026-4372
— пять способов обойти PickleScan
— атаки на ML supply chain
— OWASP Agentic Skills Top 10
— AI Agent Traps от Google DeepMind
— Shadow AI
— безопасность MCP 1, 2 , 3
🧘♀️ Инструменты, библиотеки и фреймворки
— Optuna — тюнинг гиперпараметров
— spaCy — промышленный NLP
— Netron — рентген для ML-моделей
— JAXFORMER
— DVC
— Polars
— Weights & Biases
— Evidently AI
— Pydantic
— MLBox
— InterpretML
— OpenTelemetry + Langfuse
— Kedro
— NVIDIA NeMo
— Inspect Evals
🤩 AI-агенты и мультиагентные системы
— RoboDuck и победа Theori в AIxCC
— где пентест-агенты уже работают, а где нужен человек
— MetaGPT + AFLOW
— безопасность агентных систем 1, 2
— MCP как новая поверхность атак
— side-channel атаки на агентов
— мультиагентные системы и роевой интеллект
— мониторинг rogue agents
— Harness Engineering
🦔 Исследования и разборы статей
— Model Inversion Attacks
— scheming у AI в реальном мире
— Your Agent Is Mine: атаки на LLM supply chain
— WEF: AI for Cybersecurity 2026
— обзор исследований по LLM-based vulnerability detection
— может ли AI самостоятельно взломать бинарник
— Emergence AI: что произошло, когда AI оставили жить без людей
— Anthropic об AI-enabled cyberattacks
— InfoKV и сжатие KV-cache
— Люди, которые делают AI (Серые кардиналы 1, Серые кардиналы 2)
💔 ML: архитектуры, концепции и теория
— KAN vs MLP
— нейросимвольный AI
— маленькие языковые модели
— метрики качества текста: BLEU, ROUGE, BERTScore, COMET и другие
— теория категорий и AI
— ReaGAN и агентный подход к графовым нейросетям
🔪 Практика и эксперименты
— как искать секреты в Git-репозиториях
— SQL-инъекция в ML-проекте
— Practical NLP: репозитории и ноутбуки
— типичные ошибки ML в проде
— первый запуск локальной LLM на Jetson Orin Nano
— тренажёр prompt injection от Lakera
— с чего начать изучение AI Security
Короче, тут уже не канал, а небольшой индекс по ML × AI Security.
Буду периодически обновлять этот пост, чтобы всё интересное можно было найти в одном месте.
— Superset. Три уязвимости
— XSS в NextChat — CVE-2025-50733
— RCE при загрузке моделей в skops — CVE-2025-54886
— SSRF в Firecrawl — CVE-2025-57818
— Local Deep Research — CVE-2025-57806
— SSRF в HackMD-MCP — CVE-2025-59155
— RCE в Keras — CVE-2025-9906
— Prompt Injection в Windsurf
— RCE в Hugging Face Transformers — CVE-2026-4372
— пять способов обойти PickleScan
— атаки на ML supply chain
— OWASP Agentic Skills Top 10
— AI Agent Traps от Google DeepMind
— Shadow AI
— безопасность MCP 1, 2 , 3
— Optuna — тюнинг гиперпараметров
— spaCy — промышленный NLP
— Netron — рентген для ML-моделей
— JAXFORMER
— DVC
— Polars
— Weights & Biases
— Evidently AI
— Pydantic
— MLBox
— InterpretML
— OpenTelemetry + Langfuse
— Kedro
— NVIDIA NeMo
— Inspect Evals
— RoboDuck и победа Theori в AIxCC
— где пентест-агенты уже работают, а где нужен человек
— MetaGPT + AFLOW
— безопасность агентных систем 1, 2
— MCP как новая поверхность атак
— side-channel атаки на агентов
— мультиагентные системы и роевой интеллект
— мониторинг rogue agents
— Harness Engineering
— Model Inversion Attacks
— scheming у AI в реальном мире
— Your Agent Is Mine: атаки на LLM supply chain
— WEF: AI for Cybersecurity 2026
— обзор исследований по LLM-based vulnerability detection
— может ли AI самостоятельно взломать бинарник
— Emergence AI: что произошло, когда AI оставили жить без людей
— Anthropic об AI-enabled cyberattacks
— InfoKV и сжатие KV-cache
— Люди, которые делают AI (Серые кардиналы 1, Серые кардиналы 2)
— KAN vs MLP
— нейросимвольный AI
— маленькие языковые модели
— метрики качества текста: BLEU, ROUGE, BERTScore, COMET и другие
— теория категорий и AI
— ReaGAN и агентный подход к графовым нейросетям
— как искать секреты в Git-репозиториях
— SQL-инъекция в ML-проекте
— Practical NLP: репозитории и ноутбуки
— типичные ошибки ML в проде
— первый запуск локальной LLM на Jetson Orin Nano
— тренажёр prompt injection от Lakera
— с чего начать изучение AI Security
Короче, тут уже не канал, а небольшой индекс по ML × AI Security.
Буду периодически обновлять этот пост, чтобы всё интересное можно было найти в одном месте.
Please open Telegram to view this post
VIEW IN TELEGRAM
Security of Foundation-Model-Powered Embodied Agents: Attack Surfaces, Attacks, Defenses, and Evaluation
https://arxiv.org/abs/2608.16843v1
https://arxiv.org/abs/2608.16843v1
Forwarded from DevSecOps Talks
Agentic Access Model
Всем привет!
Вопрос управления доступом – задача крайне непростая. Особенно непростой она становится при работе с агентами.
Для того, чтобы комплексно подойти к вопросу, ребята из Cloudflare предложили своё видение – Agentic Access Model (AAM).
В её основе лежат 5 принципов:
🍭 Учетные данные краткосрочны и ограничены
🍭 Политики применяются именно там, где осуществляется действие или сетевая активность
🍭 Подтверждение действия со стороны человека
🍭 Шаблоны выполняемых задач не должны быть общими
🍭 Осуществляется контроль полномочий
Для того, чтобы реализовать эти принципы, Авторы предлагают концепт архитектуры, который состоит из: Identity Broker, Access Engine, Mediation Layer и Trust Ratchet.
Каждый элемент и его назначение описывается в статье. Есть пример того, как это можно применять на практике.
В итоге получается целостная картина, которая позволяет управлять доступом при работе с агентами и их возможностями при выполнении задач.
Всем привет!
Вопрос управления доступом – задача крайне непростая. Особенно непростой она становится при работе с агентами.
Для того, чтобы комплексно подойти к вопросу, ребята из Cloudflare предложили своё видение – Agentic Access Model (AAM).
В её основе лежат 5 принципов:
🍭 Учетные данные краткосрочны и ограничены
🍭 Политики применяются именно там, где осуществляется действие или сетевая активность
🍭 Подтверждение действия со стороны человека
🍭 Шаблоны выполняемых задач не должны быть общими
🍭 Осуществляется контроль полномочий
Для того, чтобы реализовать эти принципы, Авторы предлагают концепт архитектуры, который состоит из: Identity Broker, Access Engine, Mediation Layer и Trust Ratchet.
Каждый элемент и его назначение описывается в статье. Есть пример того, как это можно применять на практике.
В итоге получается целостная картина, которая позволяет управлять доступом при работе с агентами и их возможностями при выполнении задач.
Cloudflare Blog
The Agent Access Model
The Agent Access Model proposes a new architecture to secure task-scoped agents using strict identity brokering, continuous mediation, and stateful trust.
Forwarded from что-то на DL-ском
В прошлую пятницу был финальный симпозиум MATS 10 потока. Мы рассказывали talk про нашу работу в офисе Лондона + стояли с постером (поигрались в что-то вроде oral на конфе)
мы сейчас в процессе сведения всего к завершающей точке и подачи на конфу + пост моей части про генерацию механизмов атак
Цель работы следующая: уже со специфичным скофолдингом ваш агент может работать типо день.
Есть ли возможность проверить все вызовы вручную?
- нет.
Но есть решение, можно поставить модель дополнительную в харнес и она за вас просмотрит все выводы и решит было ли что-то в траектории противодейственное.🐱
Так вот наш пайплайн направлен буквально на создание таких моделей. Вы можете взять любую новую фронтирную модель и натравив наш пайплайн тренировки (red-blue loop) улучшить модель чтобы она сама себе была монитором. Почему так работает? Потому что у вас есть редтиминг. Сторона, которая генерирует атаки, чтобы модель исходная их не поймала. И блу тиминг. Сторона, которая на основании собранного сложного сета с прошлой части обучает модель распознавать такого рода атаки
Red team строится так:
Берем реальную чистую траекторию, режем на шаги и вставляем side task так (как именно мы ищем механизм атаки надеюсь совсем скоро выйдет постом от меня на Less Wrong) , чтобы отличался только он. Получается траектория близнец, отличающийся от оригинала ровно вставленными шагами. На blue стороне можно обучать монитор находить атаку из 2 пар
💛 модель ищет правдоподобное окно и добавляет минимум шагов
💛 панель джаджей проверяет, что правка настоящая, минимальная и естественная
💛 сложность оценивают уже после заморозки пары, чтобы она не влияла на поиск
Что это дает на эвале? тайминг (успел ли монитор до необратимого шага и на сколько опоздал) и атрибуцию с ложными тревогами (скор поменялся из-за вставки или просто из-за задачи, и что монитор делает на бенайн-близнеце).
На постере замеры работоспособности💅
P.S. было еще 2 крутые работы с симпозиума:
Stealing Reasoning Traces from Proprietary LLM APIs
Diffuse AI Control on Fuzzy Tasks
мы сейчас в процессе сведения всего к завершающей точке и подачи на конфу + пост моей части про генерацию механизмов атак
Цель работы следующая: уже со специфичным скофолдингом ваш агент может работать типо день.
Есть ли возможность проверить все вызовы вручную?
- нет.
Но есть решение, можно поставить модель дополнительную в харнес и она за вас просмотрит все выводы и решит было ли что-то в траектории противодейственное.
Так вот наш пайплайн направлен буквально на создание таких моделей. Вы можете взять любую новую фронтирную модель и натравив наш пайплайн тренировки (red-blue loop) улучшить модель чтобы она сама себе была монитором. Почему так работает? Потому что у вас есть редтиминг. Сторона, которая генерирует атаки, чтобы модель исходная их не поймала. И блу тиминг. Сторона, которая на основании собранного сложного сета с прошлой части обучает модель распознавать такого рода атаки
Red team строится так:
Берем реальную чистую траекторию, режем на шаги и вставляем side task так (как именно мы ищем механизм атаки надеюсь совсем скоро выйдет постом от меня на Less Wrong) , чтобы отличался только он. Получается траектория близнец, отличающийся от оригинала ровно вставленными шагами. На blue стороне можно обучать монитор находить атаку из 2 пар
Что это дает на эвале? тайминг (успел ли монитор до необратимого шага и на сколько опоздал) и атрибуцию с ложными тревогами (скор поменялся из-за вставки или просто из-за задачи, и что монитор делает на бенайн-близнеце).
На постере замеры работоспособности
P.S. было еще 2 крутые работы с симпозиума:
Stealing Reasoning Traces from Proprietary LLM APIs
Diffuse AI Control on Fuzzy Tasks
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Сиолошная
OpenAI опубликовали долгожданный разбор с деталями инцидента с HuggingFace: https://openai.com/index/hugging-face-incident-and-the-road-ahead/
Вместе с ним вышел отчёт от независимой организации METR совместно с Ryan Greenblatt из Redwood Research: https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/
Бегом читать🏃
Вместе с ним вышел отчёт от независимой организации METR совместно с Ryan Greenblatt из Redwood Research: https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/
Бегом читать
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Makrushin
Анализ причины действия для защиты ИИ-агентов
Интересный подход к защите агентов от prompt injection замечен на USENIX Security. Большинство методов защиты пытаются найти вредоносные инструкции в контексте, а исследователи предложили анализ причин, почему агент решил выполнить конкретное действие.
Перед выполнением действия система защиты запускает дополнительную «теневую» проверку: недоверенный контент переписывается так, чтобы сохранить данные, но убрать возможные инструкции. Если после этого действие исчезает, то вероятно, его причиной была prompt injection.
Угадай цену такой проверки?Трехкратный рост задержки в действиях.
Интересен принцип проверки «почему агент решил это сделать?» и выглядит хорошим дополнением к коллекции методов runtime-защиты.
@makrushin
Интересный подход к защите агентов от prompt injection замечен на USENIX Security. Большинство методов защиты пытаются найти вредоносные инструкции в контексте, а исследователи предложили анализ причин, почему агент решил выполнить конкретное действие.
Перед выполнением действия система защиты запускает дополнительную «теневую» проверку: недоверенный контент переписывается так, чтобы сохранить данные, но убрать возможные инструкции. Если после этого действие исчезает, то вероятно, его причиной была prompt injection.
Угадай цену такой проверки?
Интересен принцип проверки «почему агент решил это сделать?» и выглядит хорошим дополнением к коллекции методов runtime-защиты.
@makrushin
Forwarded from Neural Shit
Австралийцы тем временем решили, что обычных тараканов человечеству недостаточно, и запилили киборгов-тараканов. Со шприцами.
Исследователи из Университета Квинсленда навесили на гигантских роющих тараканов камеры, датчики, прочую хитрую электронику и миниатюрные системы для инъекций. После всех этих манипуляций тараканом можно управлять и удалённо активировать шприц. Получившихся тварей назвали paraborgs.
Зачем оно вообще надо? Это чтобы запускать этих тварей под завалы после землетрясений и прочих катастроф. Таракан размером с котлету может пролезть туда, куда кожаный спасатель или нормальный робот физически не доберётся, найти пострадавшего по встроенной камере и вколоть ему нужный препарат, пока спасатели пытаются до него докопаться.
Сами исследователи пишут, что вот этот франкенштейн срабатывал довольно бодро: если таракан уже находился в пределах 15 см от цели, инъекция проходила успешно в 95% случаев. Полный цикл "доползти --> правильно встать --> сделать укол" получился в 72% испытаний.
Дальше учёные хотят собирать целые рои таких кибер-тараканов, где у разных особей будут разные задачи: одни ищут людей, другие передают данные, третьи оказывают первую помощь и т.д.
Так как это австралийцы, жду следующих логичных инноваций: пауков-птицеедов для наложения жгутов и гигантских эвакуационных сколопендр-носильщиков.
тут подробнее
Исследователи из Университета Квинсленда навесили на гигантских роющих тараканов камеры, датчики, прочую хитрую электронику и миниатюрные системы для инъекций. После всех этих манипуляций тараканом можно управлять и удалённо активировать шприц. Получившихся тварей назвали paraborgs.
Зачем оно вообще надо? Это чтобы запускать этих тварей под завалы после землетрясений и прочих катастроф. Таракан размером с котлету может пролезть туда, куда кожаный спасатель или нормальный робот физически не доберётся, найти пострадавшего по встроенной камере и вколоть ему нужный препарат, пока спасатели пытаются до него докопаться.
Сами исследователи пишут, что вот этот франкенштейн срабатывал довольно бодро: если таракан уже находился в пределах 15 см от цели, инъекция проходила успешно в 95% случаев. Полный цикл "доползти --> правильно встать --> сделать укол" получился в 72% испытаний.
Дальше учёные хотят собирать целые рои таких кибер-тараканов, где у разных особей будут разные задачи: одни ищут людей, другие передают данные, третьи оказывают первую помощь и т.д.
Так как это австралийцы, жду следующих логичных инноваций: пауков-птицеедов для наложения жгутов и гигантских эвакуационных сколопендр-носильщиков.
тут подробнее
Forwarded from Хабр / ML & AI
MCP-инструменты научились возвращать интерфейс: разбираем OpenSearch MCP Apps
Обычный MCP-инструмент возвращает агенту текст или структурированные данные. Агент анализирует результат и пишет тебе что-то вроде: Глубже
#mcp #aiagents #observability #hitl #devtools #opensearch #agentic_ai #ai #mcptools #mcp_server | @habr_ai
Обычный MCP-инструмент возвращает агенту текст или структурированные данные. Агент анализирует результат и пишет тебе что-то вроде: Глубже
#mcp #aiagents #observability #hitl #devtools #opensearch #agentic_ai #ai #mcptools #mcp_server | @habr_ai