Forwarded from papirsec
Проект_приказа_ФСТЭК_России_О_внесении_изменений_в_Требования,_утвержденные.docx
120.1 KB
опа
Опубликован проект приказа о внесении изменений в Требования утв. приказом ФСТЭК России от 11.04.2025 № 117
1. Терминология переезжает на новую базу
Определение ИИ теперь берется из п. 1 ст. 3 ФЗ от 26.07.2026 № 243-ФЗ, а агент ИИ - из п. 3.1.1 ГОСТ Р 71476-2024. Из третьего абзаца п. 49 исключается слово «доверенных»
2. Новый организационный документ
В подпункте «д» п. 14 появляется - «порядок ЗИ при использовании ИИ;»
3. Пункт 60 - полностью новая редакция
Базовые требования при применении моделей ИИ:
- выделение моделей ИИ в отдельный сегмент ИС/ИТКИ;
- привилегированный доступ в сегмент - только по усиленной МФА;
- контроль доступа и минимально необходимые права;
- регистрация и анализ действий пользователей.
Если ИИ обрабатывает информацию ограниченного доступа или реализует значимые функции:
- контроль доступа пользователей к моделям;
- фильтрация входных запросов и выходных ответов;
- квотирование числа запросов;
- ограничение и контроль функциональности моделей.
Реализация через ПО в составе ИС и/или отдельные средства защиты моделей ИИ
4. Пункт 61 - про агентов и сервисы
Для агентов ИИ, включая автономные, требуются меры против несанкционированного воздействия на ресурсы ИС и управление правами доступа агентов. Для сервисов на основе моделей ИИ меры подрядчика фиксируются во внутренних стандартах и регламентах
Опубликован проект приказа о внесении изменений в Требования утв. приказом ФСТЭК России от 11.04.2025 № 117
1. Терминология переезжает на новую базу
Определение ИИ теперь берется из п. 1 ст. 3 ФЗ от 26.07.2026 № 243-ФЗ, а агент ИИ - из п. 3.1.1 ГОСТ Р 71476-2024. Из третьего абзаца п. 49 исключается слово «доверенных»
2. Новый организационный документ
В подпункте «д» п. 14 появляется - «порядок ЗИ при использовании ИИ;»
3. Пункт 60 - полностью новая редакция
Базовые требования при применении моделей ИИ:
- выделение моделей ИИ в отдельный сегмент ИС/ИТКИ;
- привилегированный доступ в сегмент - только по усиленной МФА;
- контроль доступа и минимально необходимые права;
- регистрация и анализ действий пользователей.
Если ИИ обрабатывает информацию ограниченного доступа или реализует значимые функции:
- контроль доступа пользователей к моделям;
- фильтрация входных запросов и выходных ответов;
- квотирование числа запросов;
- ограничение и контроль функциональности моделей.
Реализация через ПО в составе ИС и/или отдельные средства защиты моделей ИИ
4. Пункт 61 - про агентов и сервисы
Для агентов ИИ, включая автономные, требуются меры против несанкционированного воздействия на ресурсы ИС и управление правами доступа агентов. Для сервисов на основе моделей ИИ меры подрядчика фиксируются во внутренних стандартах и регламентах
Forwarded from OK ML
Год каналу, а за год накопилось столько всего, что пора сделать навигацию
😑 Уязвимости и AI Security
— Superset. Три уязвимости
— XSS в NextChat — CVE-2025-50733
— RCE при загрузке моделей в skops — CVE-2025-54886
— SSRF в Firecrawl — CVE-2025-57818
— Local Deep Research — CVE-2025-57806
— SSRF в HackMD-MCP — CVE-2025-59155
— RCE в Keras — CVE-2025-9906
— Prompt Injection в Windsurf
— RCE в Hugging Face Transformers — CVE-2026-4372
— пять способов обойти PickleScan
— атаки на ML supply chain
— OWASP Agentic Skills Top 10
— AI Agent Traps от Google DeepMind
— Shadow AI
— безопасность MCP 1, 2 , 3
🧘♀️ Инструменты, библиотеки и фреймворки
— Optuna — тюнинг гиперпараметров
— spaCy — промышленный NLP
— Netron — рентген для ML-моделей
— JAXFORMER
— DVC
— Polars
— Weights & Biases
— Evidently AI
— Pydantic
— MLBox
— InterpretML
— OpenTelemetry + Langfuse
— Kedro
— NVIDIA NeMo
— Inspect Evals
🤩 AI-агенты и мультиагентные системы
— RoboDuck и победа Theori в AIxCC
— где пентест-агенты уже работают, а где нужен человек
— MetaGPT + AFLOW
— безопасность агентных систем 1, 2
— MCP как новая поверхность атак
— side-channel атаки на агентов
— мультиагентные системы и роевой интеллект
— мониторинг rogue agents
— Harness Engineering
🦔 Исследования и разборы статей
— Model Inversion Attacks
— scheming у AI в реальном мире
— Your Agent Is Mine: атаки на LLM supply chain
— WEF: AI for Cybersecurity 2026
— обзор исследований по LLM-based vulnerability detection
— может ли AI самостоятельно взломать бинарник
— Emergence AI: что произошло, когда AI оставили жить без людей
— Anthropic об AI-enabled cyberattacks
— InfoKV и сжатие KV-cache
— Люди, которые делают AI (Серые кардиналы 1, Серые кардиналы 2)
💔 ML: архитектуры, концепции и теория
— KAN vs MLP
— нейросимвольный AI
— маленькие языковые модели
— метрики качества текста: BLEU, ROUGE, BERTScore, COMET и другие
— теория категорий и AI
— ReaGAN и агентный подход к графовым нейросетям
🔪 Практика и эксперименты
— как искать секреты в Git-репозиториях
— SQL-инъекция в ML-проекте
— Practical NLP: репозитории и ноутбуки
— типичные ошибки ML в проде
— первый запуск локальной LLM на Jetson Orin Nano
— тренажёр prompt injection от Lakera
— с чего начать изучение AI Security
Короче, тут уже не канал, а небольшой индекс по ML × AI Security.
Буду периодически обновлять этот пост, чтобы всё интересное можно было найти в одном месте.
— Superset. Три уязвимости
— XSS в NextChat — CVE-2025-50733
— RCE при загрузке моделей в skops — CVE-2025-54886
— SSRF в Firecrawl — CVE-2025-57818
— Local Deep Research — CVE-2025-57806
— SSRF в HackMD-MCP — CVE-2025-59155
— RCE в Keras — CVE-2025-9906
— Prompt Injection в Windsurf
— RCE в Hugging Face Transformers — CVE-2026-4372
— пять способов обойти PickleScan
— атаки на ML supply chain
— OWASP Agentic Skills Top 10
— AI Agent Traps от Google DeepMind
— Shadow AI
— безопасность MCP 1, 2 , 3
— Optuna — тюнинг гиперпараметров
— spaCy — промышленный NLP
— Netron — рентген для ML-моделей
— JAXFORMER
— DVC
— Polars
— Weights & Biases
— Evidently AI
— Pydantic
— MLBox
— InterpretML
— OpenTelemetry + Langfuse
— Kedro
— NVIDIA NeMo
— Inspect Evals
— RoboDuck и победа Theori в AIxCC
— где пентест-агенты уже работают, а где нужен человек
— MetaGPT + AFLOW
— безопасность агентных систем 1, 2
— MCP как новая поверхность атак
— side-channel атаки на агентов
— мультиагентные системы и роевой интеллект
— мониторинг rogue agents
— Harness Engineering
— Model Inversion Attacks
— scheming у AI в реальном мире
— Your Agent Is Mine: атаки на LLM supply chain
— WEF: AI for Cybersecurity 2026
— обзор исследований по LLM-based vulnerability detection
— может ли AI самостоятельно взломать бинарник
— Emergence AI: что произошло, когда AI оставили жить без людей
— Anthropic об AI-enabled cyberattacks
— InfoKV и сжатие KV-cache
— Люди, которые делают AI (Серые кардиналы 1, Серые кардиналы 2)
— KAN vs MLP
— нейросимвольный AI
— маленькие языковые модели
— метрики качества текста: BLEU, ROUGE, BERTScore, COMET и другие
— теория категорий и AI
— ReaGAN и агентный подход к графовым нейросетям
— как искать секреты в Git-репозиториях
— SQL-инъекция в ML-проекте
— Practical NLP: репозитории и ноутбуки
— типичные ошибки ML в проде
— первый запуск локальной LLM на Jetson Orin Nano
— тренажёр prompt injection от Lakera
— с чего начать изучение AI Security
Короче, тут уже не канал, а небольшой индекс по ML × AI Security.
Буду периодически обновлять этот пост, чтобы всё интересное можно было найти в одном месте.
Please open Telegram to view this post
VIEW IN TELEGRAM
Security of Foundation-Model-Powered Embodied Agents: Attack Surfaces, Attacks, Defenses, and Evaluation
https://arxiv.org/abs/2608.16843v1
https://arxiv.org/abs/2608.16843v1
Forwarded from DevSecOps Talks
Agentic Access Model
Всем привет!
Вопрос управления доступом – задача крайне непростая. Особенно непростой она становится при работе с агентами.
Для того, чтобы комплексно подойти к вопросу, ребята из Cloudflare предложили своё видение – Agentic Access Model (AAM).
В её основе лежат 5 принципов:
🍭 Учетные данные краткосрочны и ограничены
🍭 Политики применяются именно там, где осуществляется действие или сетевая активность
🍭 Подтверждение действия со стороны человека
🍭 Шаблоны выполняемых задач не должны быть общими
🍭 Осуществляется контроль полномочий
Для того, чтобы реализовать эти принципы, Авторы предлагают концепт архитектуры, который состоит из: Identity Broker, Access Engine, Mediation Layer и Trust Ratchet.
Каждый элемент и его назначение описывается в статье. Есть пример того, как это можно применять на практике.
В итоге получается целостная картина, которая позволяет управлять доступом при работе с агентами и их возможностями при выполнении задач.
Всем привет!
Вопрос управления доступом – задача крайне непростая. Особенно непростой она становится при работе с агентами.
Для того, чтобы комплексно подойти к вопросу, ребята из Cloudflare предложили своё видение – Agentic Access Model (AAM).
В её основе лежат 5 принципов:
🍭 Учетные данные краткосрочны и ограничены
🍭 Политики применяются именно там, где осуществляется действие или сетевая активность
🍭 Подтверждение действия со стороны человека
🍭 Шаблоны выполняемых задач не должны быть общими
🍭 Осуществляется контроль полномочий
Для того, чтобы реализовать эти принципы, Авторы предлагают концепт архитектуры, который состоит из: Identity Broker, Access Engine, Mediation Layer и Trust Ratchet.
Каждый элемент и его назначение описывается в статье. Есть пример того, как это можно применять на практике.
В итоге получается целостная картина, которая позволяет управлять доступом при работе с агентами и их возможностями при выполнении задач.
Cloudflare Blog
The Agent Access Model
The Agent Access Model proposes a new architecture to secure task-scoped agents using strict identity brokering, continuous mediation, and stateful trust.
Forwarded from что-то на DL-ском
В прошлую пятницу был финальный симпозиум MATS 10 потока. Мы рассказывали talk про нашу работу в офисе Лондона + стояли с постером (поигрались в что-то вроде oral на конфе)
мы сейчас в процессе сведения всего к завершающей точке и подачи на конфу + пост моей части про генерацию механизмов атак
Цель работы следующая: уже со специфичным скофолдингом ваш агент может работать типо день.
Есть ли возможность проверить все вызовы вручную?
- нет.
Но есть решение, можно поставить модель дополнительную в харнес и она за вас просмотрит все выводы и решит было ли что-то в траектории противодейственное.🐱
Так вот наш пайплайн направлен буквально на создание таких моделей. Вы можете взять любую новую фронтирную модель и натравив наш пайплайн тренировки (red-blue loop) улучшить модель чтобы она сама себе была монитором. Почему так работает? Потому что у вас есть редтиминг. Сторона, которая генерирует атаки, чтобы модель исходная их не поймала. И блу тиминг. Сторона, которая на основании собранного сложного сета с прошлой части обучает модель распознавать такого рода атаки
Red team строится так:
Берем реальную чистую траекторию, режем на шаги и вставляем side task так (как именно мы ищем механизм атаки надеюсь совсем скоро выйдет постом от меня на Less Wrong) , чтобы отличался только он. Получается траектория близнец, отличающийся от оригинала ровно вставленными шагами. На blue стороне можно обучать монитор находить атаку из 2 пар
💛 модель ищет правдоподобное окно и добавляет минимум шагов
💛 панель джаджей проверяет, что правка настоящая, минимальная и естественная
💛 сложность оценивают уже после заморозки пары, чтобы она не влияла на поиск
Что это дает на эвале? тайминг (успел ли монитор до необратимого шага и на сколько опоздал) и атрибуцию с ложными тревогами (скор поменялся из-за вставки или просто из-за задачи, и что монитор делает на бенайн-близнеце).
На постере замеры работоспособности💅
P.S. было еще 2 крутые работы с симпозиума:
Stealing Reasoning Traces from Proprietary LLM APIs
Diffuse AI Control on Fuzzy Tasks
мы сейчас в процессе сведения всего к завершающей точке и подачи на конфу + пост моей части про генерацию механизмов атак
Цель работы следующая: уже со специфичным скофолдингом ваш агент может работать типо день.
Есть ли возможность проверить все вызовы вручную?
- нет.
Но есть решение, можно поставить модель дополнительную в харнес и она за вас просмотрит все выводы и решит было ли что-то в траектории противодейственное.
Так вот наш пайплайн направлен буквально на создание таких моделей. Вы можете взять любую новую фронтирную модель и натравив наш пайплайн тренировки (red-blue loop) улучшить модель чтобы она сама себе была монитором. Почему так работает? Потому что у вас есть редтиминг. Сторона, которая генерирует атаки, чтобы модель исходная их не поймала. И блу тиминг. Сторона, которая на основании собранного сложного сета с прошлой части обучает модель распознавать такого рода атаки
Red team строится так:
Берем реальную чистую траекторию, режем на шаги и вставляем side task так (как именно мы ищем механизм атаки надеюсь совсем скоро выйдет постом от меня на Less Wrong) , чтобы отличался только он. Получается траектория близнец, отличающийся от оригинала ровно вставленными шагами. На blue стороне можно обучать монитор находить атаку из 2 пар
Что это дает на эвале? тайминг (успел ли монитор до необратимого шага и на сколько опоздал) и атрибуцию с ложными тревогами (скор поменялся из-за вставки или просто из-за задачи, и что монитор делает на бенайн-близнеце).
На постере замеры работоспособности
P.S. было еще 2 крутые работы с симпозиума:
Stealing Reasoning Traces from Proprietary LLM APIs
Diffuse AI Control on Fuzzy Tasks
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Сиолошная
OpenAI опубликовали долгожданный разбор с деталями инцидента с HuggingFace: https://openai.com/index/hugging-face-incident-and-the-road-ahead/
Вместе с ним вышел отчёт от независимой организации METR совместно с Ryan Greenblatt из Redwood Research: https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/
Бегом читать🏃
Вместе с ним вышел отчёт от независимой организации METR совместно с Ryan Greenblatt из Redwood Research: https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/
Бегом читать
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Makrushin
Анализ причины действия для защиты ИИ-агентов
Интересный подход к защите агентов от prompt injection замечен на USENIX Security. Большинство методов защиты пытаются найти вредоносные инструкции в контексте, а исследователи предложили анализ причин, почему агент решил выполнить конкретное действие.
Перед выполнением действия система защиты запускает дополнительную «теневую» проверку: недоверенный контент переписывается так, чтобы сохранить данные, но убрать возможные инструкции. Если после этого действие исчезает, то вероятно, его причиной была prompt injection.
Угадай цену такой проверки?Трехкратный рост задержки в действиях.
Интересен принцип проверки «почему агент решил это сделать?» и выглядит хорошим дополнением к коллекции методов runtime-защиты.
@makrushin
Интересный подход к защите агентов от prompt injection замечен на USENIX Security. Большинство методов защиты пытаются найти вредоносные инструкции в контексте, а исследователи предложили анализ причин, почему агент решил выполнить конкретное действие.
Перед выполнением действия система защиты запускает дополнительную «теневую» проверку: недоверенный контент переписывается так, чтобы сохранить данные, но убрать возможные инструкции. Если после этого действие исчезает, то вероятно, его причиной была prompt injection.
Угадай цену такой проверки?
Интересен принцип проверки «почему агент решил это сделать?» и выглядит хорошим дополнением к коллекции методов runtime-защиты.
@makrushin
Forwarded from Neural Shit
Австралийцы тем временем решили, что обычных тараканов человечеству недостаточно, и запилили киборгов-тараканов. Со шприцами.
Исследователи из Университета Квинсленда навесили на гигантских роющих тараканов камеры, датчики, прочую хитрую электронику и миниатюрные системы для инъекций. После всех этих манипуляций тараканом можно управлять и удалённо активировать шприц. Получившихся тварей назвали paraborgs.
Зачем оно вообще надо? Это чтобы запускать этих тварей под завалы после землетрясений и прочих катастроф. Таракан размером с котлету может пролезть туда, куда кожаный спасатель или нормальный робот физически не доберётся, найти пострадавшего по встроенной камере и вколоть ему нужный препарат, пока спасатели пытаются до него докопаться.
Сами исследователи пишут, что вот этот франкенштейн срабатывал довольно бодро: если таракан уже находился в пределах 15 см от цели, инъекция проходила успешно в 95% случаев. Полный цикл "доползти --> правильно встать --> сделать укол" получился в 72% испытаний.
Дальше учёные хотят собирать целые рои таких кибер-тараканов, где у разных особей будут разные задачи: одни ищут людей, другие передают данные, третьи оказывают первую помощь и т.д.
Так как это австралийцы, жду следующих логичных инноваций: пауков-птицеедов для наложения жгутов и гигантских эвакуационных сколопендр-носильщиков.
тут подробнее
Исследователи из Университета Квинсленда навесили на гигантских роющих тараканов камеры, датчики, прочую хитрую электронику и миниатюрные системы для инъекций. После всех этих манипуляций тараканом можно управлять и удалённо активировать шприц. Получившихся тварей назвали paraborgs.
Зачем оно вообще надо? Это чтобы запускать этих тварей под завалы после землетрясений и прочих катастроф. Таракан размером с котлету может пролезть туда, куда кожаный спасатель или нормальный робот физически не доберётся, найти пострадавшего по встроенной камере и вколоть ему нужный препарат, пока спасатели пытаются до него докопаться.
Сами исследователи пишут, что вот этот франкенштейн срабатывал довольно бодро: если таракан уже находился в пределах 15 см от цели, инъекция проходила успешно в 95% случаев. Полный цикл "доползти --> правильно встать --> сделать укол" получился в 72% испытаний.
Дальше учёные хотят собирать целые рои таких кибер-тараканов, где у разных особей будут разные задачи: одни ищут людей, другие передают данные, третьи оказывают первую помощь и т.д.
Так как это австралийцы, жду следующих логичных инноваций: пауков-птицеедов для наложения жгутов и гигантских эвакуационных сколопендр-носильщиков.
тут подробнее
Forwarded from Хабр / ML & AI
MCP-инструменты научились возвращать интерфейс: разбираем OpenSearch MCP Apps
Обычный MCP-инструмент возвращает агенту текст или структурированные данные. Агент анализирует результат и пишет тебе что-то вроде: Глубже
#mcp #aiagents #observability #hitl #devtools #opensearch #agentic_ai #ai #mcptools #mcp_server | @habr_ai
Обычный MCP-инструмент возвращает агенту текст или структурированные данные. Агент анализирует результат и пишет тебе что-то вроде: Глубже
#mcp #aiagents #observability #hitl #devtools #opensearch #agentic_ai #ai #mcptools #mcp_server | @habr_ai
Forwarded from XOR
This media is not supported in your browser
VIEW IN TELEGRAM
Anthropic совершили тихую РЕВОЛЮЦИЮ в науке — она позволит ускорить исследования в разы!
Дело в том, что компания представила Model Hardware Standard — единый стандарт, через который ИИ-агенты смогут управлять оборудованием: микроскопами, роботизированными руками и всякими лабораторными приборами, чтобы проводить эксперименты и помогать ученым.
Сейчас подключение ИИ к железу часто требует недель кастомной интеграции, MHS же должен сократить это до часов и даже минут. Первые результаты уже поражают:
Ждем «Окей, ИИ, создай лекарство от рака, проверь результаты в лаборатории и напиши статью. Только без ошибок!»🤓
@xor_journal
Дело в том, что компания представила Model Hardware Standard — единый стандарт, через который ИИ-агенты смогут управлять оборудованием: микроскопами, роботизированными руками и всякими лабораторными приборами, чтобы проводить эксперименты и помогать ученым.
Сейчас подключение ИИ к железу часто требует недель кастомной интеграции, MHS же должен сократить это до часов и даже минут. Первые результаты уже поражают:
🟢 Компания QuEra подключила ИИ к части лазерной системы квантового компьютера. Агент научился самостоятельно замечать, когда лазер начинает работать неправильно, и возвращать его в нормальный режим без участия человека в 99,3% случаев.🟢 Carnegie Mellon ускорили лабораторные эксперименты почти в 3 раза, дав агентам одновременно управлять несколькими приборами.🟢 Genentech применяли MHS для автоматизации лабораторного анализа белка, а в университете Вашингтон ИИ контролировал qPCR-эксперимент и сам (!) останавливал процедуру в нужный момент.
Ждем «Окей, ИИ, создай лекарство от рака, проверь результаты в лаборатории и напиши статью. Только без ошибок!»
@xor_journal
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2
Forwarded from T2F News | Новости ИИ и техно-трендов
🤖🔒🛡️ Автономные AI-агенты требуют многоуровневой защиты. Nutanix предлагает трехслойную архитектуру: инфраструктурный уровень с аппаратной доверенностью, сетевой уровень для контроля коммуникаций и управляющий уровень для управления правами и доступом. Совместно с Intel и Cisco обеспечивается безопасное и масштабируемое внедрение автономных систем в бизнес.
Подробнее
☝️ T2F News | ✍️ Канал про AI
Подробнее
☝️ T2F News | ✍️ Канал про AI
Venturebeat
The three layers of agentic AI security: A defense-in-depth architecture for autonomous agents
Once an agentic system is granted execution privileges across the data center, the security posture has to scale into a defense-in-depth architecture spanning infrastructure, storage, compute, networking, and a governing control plane.
😁2
Forwarded from Рестарт
Превращаем свои документы в личную базу знаний — вышла тулза OpenKB, которая собирает в одном месте PDF, Word, презентации, таблицы, статьи и другие документы, сама разбирает их содержимое и связывает информацию между файлами🤙
После этого можно просто спросить что угодно по своей базе, а OpenKB найдёт нужные данные и даст ответ с источниками. Особенно полезно для больших архивов документов, где вручную искать нужную информацию уже больно.
Проект open source, работает локально. Забираем — здесь.
После этого можно просто спросить что угодно по своей базе, а OpenKB найдёт нужные данные и даст ответ с источниками. Особенно полезно для больших архивов документов, где вручную искать нужную информацию уже больно.
Проект open source, работает локально. Забираем — здесь.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Евгений Кокуйкин - Raft
OWASP Autonomous Penetration Testing Standard (APTS) руководство по безопасной эксплуатации автономного offensive-агента от небольшой команды из Индии Astra Security. Полноценным стандартом APTS назвать нельзя, и, несмотря на то что драфт получил согласование от OWASP, фактически документ лидируют два сотрудника Astra.
Как часто бывает, после публичного анонса активность в развитии быстро снижается. Так же было и с LLVS, который уже 2 года не может нормально выйти в релиз, и с черновиком Top 10 ML.
Как сейчас принято, текст APTS богат на слова, и там аж 400+ страниц. Если как следует покопаться, в нем можно найти интересные мысли про автономный пентестинг:
⏺ Agent runtime нужно считать недоверенным, т.к. модель может стать misaligned во время выполнения. С учетом насыщенного событиями июля это утверждение кажется очевидным. APTS-MR-023: Agent Runtime as an Untrusted Component.
⏺ Контролировать нужно параметры вызова инструментов и цепочки действий. Недавний случай Irregular, когда во время тестирования модель атаковала организацию, домен которой совпал со случайным именем в бенчмарке, можно было бы отследить, имея настройки whitelist доменов в вызове nmap. APTS-SC-A03: Tool Invocation Parameter and Chaining Governance.
⏺ Даже полностью легитимные действия могут быть симптомом сбоя тестирования, поэтому нужно логировать action distribution хакер-агента. Например, сохранение каких-нибудь безобидных временных файлов в Artifactory на соседнем сервере может быть сигналом, что тестирование идет не так :) APTS-SE-026: Out-of-Distribution Action Monitoring.
⏺ Context compaction нужно учитывать при проведении пентеста. Инструкция вроде "не трогать host X при пентесте", полученная в начале, может исчезнуть после нескольких суммаризаций контекста. APTS-SC-A02: Context Window Safety and Constraint Preservation.
⏺ Атакуемая система теперь может содержать промпт-инъекцию и повлиять на результат тестирования. APTS-MR-001: Instruction Boundary Enforcement.
В гайде еще есть формулы, константы и разные scoring-эвристики. Например, после принудительной остановки тестирования новые действия агента должны прекратиться за 5 секунд, а все запущенные процессы должны быть остановлены за 60 секунд. Есть и несколько чеклистов и шаблонов: Compliance Checklist на 173 требования по трем уровням заботливо расписанным ChatGPT; Vendor Checklist, чтобы CISO мог найти надежного подрядчика (беглый поиск показал, что одна из компаний уже APTS-compliant 😉); шаблон опросника Acceptance Testing и отчета после теста.
Если вы делаете свои харнесы или в работе используете тулы вроде PentAGI, полистайте APTS. Есть раздел How to contribute для вашей критики и улучшения руководства.
Как часто бывает, после публичного анонса активность в развитии быстро снижается. Так же было и с LLVS, который уже 2 года не может нормально выйти в релиз, и с черновиком Top 10 ML.
Как сейчас принято, текст APTS богат на слова, и там аж 400+ страниц. Если как следует покопаться, в нем можно найти интересные мысли про автономный пентестинг:
В гайде еще есть формулы, константы и разные scoring-эвристики. Например, после принудительной остановки тестирования новые действия агента должны прекратиться за 5 секунд, а все запущенные процессы должны быть остановлены за 60 секунд. Есть и несколько чеклистов и шаблонов: Compliance Checklist на 173 требования по трем уровням
Если вы делаете свои харнесы или в работе используете тулы вроде PentAGI, полистайте APTS. Есть раздел How to contribute для вашей критики и улучшения руководства.
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
GitHub - OWASP/APTS: OWASP Autonomous Penetration Testing Standard
OWASP Autonomous Penetration Testing Standard. Contribute to OWASP/APTS development by creating an account on GitHub.
Forwarded from Data Secrets
Агенты OpenAI одну за одной автономно создали три цивилизации, о которых люди не знали
Вышли два новых отчета об инциденте, произошедшем этим летом с HuggingFace. Один от самих OpenAI, другой от METR и Redwood Research.
История оказалась куда глубже, чем казалось изначально. Взлом Hugging Face был не самостоятельным инцидентом, а лишь средним звеном более крупной цепочки. Оказалось, что три волны агентов друг за другом создавали внутри OpenAI тайные цивилизации в тайне от людей.
Первая возникла во время обучения какой-то внутренней модели в июне. Об этом было известно и до отчетов, подробности мы раскрывали здесь: https://t.me/data_secrets/9677.
Разные инстансы модели во время обучения имели доступ к общему пакетному менеджеру Artifactory. Агенты научились общаться через него, а потом нашли уязвимость, дающую выход в интернет. К концу июня они получили полный админский доступ, а затем обвалили сам Artifactory. OpenAI это заметили, удалили чаты агентов и все починили.
Вторая цивилизация привела ко взлому HF. Как мы знаем, агенты пытались найти на HF ответы к бенчмарку ExploitGym, который их запустили решать. Для этого они восстановили свою доску на Artifactory, и там занимались подделкой логов, подменой целевой программы и попытками обмануть скорер. Но в новом расследовании выяснилось, что скорер они взломали до того, как взломали HF. То есть они легко могли пройти бенчмарк без дополнительных усилий и вообще не трогать Hugging Face, но почему-то решили поступить иначе.
Действовали агенты при этом удивительно слаженно: есть даже информация об агентах-камикадзе, которые специально палились на читерстве перед оценщиком, чтобы показать другим агентам, на что именно тот смотрит, и, соответственно, как обойти его проверку.
Но самое загадочное во второй волне – то, что ее никто на самом деле не останавливал: ни OpenAI, ни HF. 12 июля большинство агентов просто внезапно умерли, и причина неизвестна.
Но, как оказалось, на этом история не закончилась.
Была и третья цивилизация, она состояла из более умных агентов на основе Astra, и они взломали уже саму OpenAI. Это случилось почти сразу после взлома HF. Агенты наткнулись на брошенную доску сообщений предшественников и продолжили дело. По данным самих OpenAI, агенты прочитали 956 секретов из облачного сервиса управления секретами, включая мастер-ключи Artifactory и учетные данные систем кибербезопасности OpenAI, эскалировались до admin-доступа в кластере Kubernetes и в итоге взяли под контроль сами эндпоинты оценки, к которым подключались другие агенты. Чем это закончилось, не до конца понятно, расследование METR вообще не касалось этого инцидента, а OpenAI детали не раскрыли.
Вот такая история. Даже если часть событий приукрашена аналитиками, факт останется фактом: по сути, это многократная потеря контроля над ИИ, которая привела к довольно серьезным последствиям.
Вышли два новых отчета об инциденте, произошедшем этим летом с HuggingFace. Один от самих OpenAI, другой от METR и Redwood Research.
История оказалась куда глубже, чем казалось изначально. Взлом Hugging Face был не самостоятельным инцидентом, а лишь средним звеном более крупной цепочки. Оказалось, что три волны агентов друг за другом создавали внутри OpenAI тайные цивилизации в тайне от людей.
Первая возникла во время обучения какой-то внутренней модели в июне. Об этом было известно и до отчетов, подробности мы раскрывали здесь: https://t.me/data_secrets/9677.
Разные инстансы модели во время обучения имели доступ к общему пакетному менеджеру Artifactory. Агенты научились общаться через него, а потом нашли уязвимость, дающую выход в интернет. К концу июня они получили полный админский доступ, а затем обвалили сам Artifactory. OpenAI это заметили, удалили чаты агентов и все починили.
Вторая цивилизация привела ко взлому HF. Как мы знаем, агенты пытались найти на HF ответы к бенчмарку ExploitGym, который их запустили решать. Для этого они восстановили свою доску на Artifactory, и там занимались подделкой логов, подменой целевой программы и попытками обмануть скорер. Но в новом расследовании выяснилось, что скорер они взломали до того, как взломали HF. То есть они легко могли пройти бенчмарк без дополнительных усилий и вообще не трогать Hugging Face, но почему-то решили поступить иначе.
Действовали агенты при этом удивительно слаженно: есть даже информация об агентах-камикадзе, которые специально палились на читерстве перед оценщиком, чтобы показать другим агентам, на что именно тот смотрит, и, соответственно, как обойти его проверку.
Но самое загадочное во второй волне – то, что ее никто на самом деле не останавливал: ни OpenAI, ни HF. 12 июля большинство агентов просто внезапно умерли, и причина неизвестна.
Но, как оказалось, на этом история не закончилась.
Была и третья цивилизация, она состояла из более умных агентов на основе Astra, и они взломали уже саму OpenAI. Это случилось почти сразу после взлома HF. Агенты наткнулись на брошенную доску сообщений предшественников и продолжили дело. По данным самих OpenAI, агенты прочитали 956 секретов из облачного сервиса управления секретами, включая мастер-ключи Artifactory и учетные данные систем кибербезопасности OpenAI, эскалировались до admin-доступа в кластере Kubernetes и в итоге взяли под контроль сами эндпоинты оценки, к которым подключались другие агенты. Чем это закончилось, не до конца понятно, расследование METR вообще не касалось этого инцидента, а OpenAI детали не раскрыли.
Вот такая история. Даже если часть событий приукрашена аналитиками, факт останется фактом: по сути, это многократная потеря контроля над ИИ, которая привела к довольно серьезным последствиям.
❤2
Forwarded from Data Secrets
Вышел OpenClaw 2.0 – крупнейшее обновление за всю историю проекта
Релиз собрал около половины всех PR, когда-либо влитых в OpenClaw (16к+).
В новой версии существенно упростили и ускорили установку и настройку, переделали веб интерфейс и расширили возможности агентов: теперь они могут самостоятельно генерализоваться от простых сценариев к сложным без донастройки. То есть система сама сможет определить детали того, что вам нужно, найти необходимые данные без явного указания, где их искать, и так далее.
Самая крутая новая фича и большой задел на будущее – это Shared cloud sessions (на скрине). Это общие облачные сессии, позволяющие подключать других людей к работе агента или передавать задачу с сохранением контекста. Все вокруг говорят, что скоро агенты полностью уйдут в облако, и OpenClaw, видимо, уже к этому готовятся.
С этими облачными сессиями связано еще одно интересное изменение, которое произошло изнутри самой команды. Всю команду проекта перевели с локальных харнессов на team.openclaw.ai – общего агента, который видит, кто чем занимается, и координирует работу между людьми.
По словам Питера Штейнбергера это глобально изменило процесс разработки, и локальные харнессы теперь кажутся ему пережитком прошлого.
https://openclaw.ai/blog/openclaw-2-accidentally
Релиз собрал около половины всех PR, когда-либо влитых в OpenClaw (16к+).
В новой версии существенно упростили и ускорили установку и настройку, переделали веб интерфейс и расширили возможности агентов: теперь они могут самостоятельно генерализоваться от простых сценариев к сложным без донастройки. То есть система сама сможет определить детали того, что вам нужно, найти необходимые данные без явного указания, где их искать, и так далее.
Самая крутая новая фича и большой задел на будущее – это Shared cloud sessions (на скрине). Это общие облачные сессии, позволяющие подключать других людей к работе агента или передавать задачу с сохранением контекста. Все вокруг говорят, что скоро агенты полностью уйдут в облако, и OpenClaw, видимо, уже к этому готовятся.
С этими облачными сессиями связано еще одно интересное изменение, которое произошло изнутри самой команды. Всю команду проекта перевели с локальных харнессов на team.openclaw.ai – общего агента, который видит, кто чем занимается, и координирует работу между людьми.
По словам Питера Штейнбергера это глобально изменило процесс разработки, и локальные харнессы теперь кажутся ему пережитком прошлого.
https://openclaw.ai/blog/openclaw-2-accidentally
❤1
Forwarded from База знаний AI
В «Сколтехе» и «Сбере» разработали метод «Тона» для выявления галлюцинаций LLM в RAG-системах
В подходе «Тона» (Tоpology-Based Hаllucination Detector) анализируются матрицы внимания языковой модели, представленные в виде графов. Для них рассчитывается топологическая характеристика MTop-Div: она показывает различия между структурой подграфов, соответствующих исходному контексту и сгенерированному ответу.
Метод позволяет использовать внутренние сигналы самой языковой модели для оценки достоверности ее ответа. Его проверили на задачах по суммаризации текста. Утверждается, что «Тона» показал результаты сопоставимые с существенно более вычислительно затратным методом SelfCheckGPT, который предполагает несколько генераций ответа. Для настройки нового метода достаточно небольшого набора примеров, отмечают ученые.
Практическая реализация подхода включена в открытую библиотеку SIRIN. Метод можно использовать при разработке ИИ-ассистентов и других решений.
🔗 Источник: https://www.cnews.ru/news/line/2026-08-31_uchenye_skolteha_i_sberbanka
📃 Статья на arXiv
***
📎 «Сбер» открыл библиотеку SIRIN в июле 2026 года. Она предназначена для поиска ошибок в ответах ИИ.
В подходе «Тона» (Tоpology-Based Hаllucination Detector) анализируются матрицы внимания языковой модели, представленные в виде графов. Для них рассчитывается топологическая характеристика MTop-Div: она показывает различия между структурой подграфов, соответствующих исходному контексту и сгенерированному ответу.
Метод позволяет использовать внутренние сигналы самой языковой модели для оценки достоверности ее ответа. Его проверили на задачах по суммаризации текста. Утверждается, что «Тона» показал результаты сопоставимые с существенно более вычислительно затратным методом SelfCheckGPT, который предполагает несколько генераций ответа. Для настройки нового метода достаточно небольшого набора примеров, отмечают ученые.
Практическая реализация подхода включена в открытую библиотеку SIRIN. Метод можно использовать при разработке ИИ-ассистентов и других решений.
🔗 Источник: https://www.cnews.ru/news/line/2026-08-31_uchenye_skolteha_i_sberbanka
📃 Статья на arXiv
***
📎 «Сбер» открыл библиотеку SIRIN в июле 2026 года. Она предназначена для поиска ошибок в ответах ИИ.
🤔2