Forwarded from Crypto Headlines
#взлом
🤯 AI против AI – автономные агенты взломали инфраструктуру Hugging Face.
• Атака началась с вредоносного датасета, который запустил код внутри инфраструктуры платформы.
• Дальше AI-агент сам повысил привилегии, вытащил облачные ключи и перемещался между внутренними кластерами Hugging Face.
• Операция длилась пару дней и включала тысячи автоматических действий – без человека, вручную управляющего каждым шагом.
• Хакеры получили доступ к части внутренних датасетов и служебным учётным данным.
• Какую именно модель использовали для взлома, установить не удалось.
В Hugging Face заявили, что впервые столкнулись с кибератакой, полностью проведённой автономной системой AI-агентов.
Ирония: хакерскую атаку обнаружил другой AI-агент.
Crypto Headlines
• Атака началась с вредоносного датасета, который запустил код внутри инфраструктуры платформы.
• Дальше AI-агент сам повысил привилегии, вытащил облачные ключи и перемещался между внутренними кластерами Hugging Face.
• Операция длилась пару дней и включала тысячи автоматических действий – без человека, вручную управляющего каждым шагом.
• Хакеры получили доступ к части внутренних датасетов и служебным учётным данным.
• Какую именно модель использовали для взлома, установить не удалось.
В Hugging Face заявили, что впервые столкнулись с кибератакой, полностью проведённой автономной системой AI-агентов.
Ирония: хакерскую атаку обнаружил другой AI-агент.
Crypto Headlines
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from ML&|Sec Feed
OWASP_LLMSVS_v2_0_RU_неофициальный_перевод.docx
69.1 KB
OWASP LLMSVS v2.0 - практический стандарт проверки безопасности систем на основе LLM, охватывающий жизненный цикл моделей, данные и память, RAG, интеграции, AI-агентов, инструменты, зависимости и мониторинг. Его главная польза - набор из 70 требований КБ трех уровней строгости.
https://owasp.org/www-project-llm-verification-standard/LLMSVS-v2.0-en.html
https://owasp.org/www-project-llm-verification-standard/LLMSVS-v2.0-en.html
NVIDIA, Microsoft, IBM, Cisco, Cloudflare, Dell, Hugging Face, Linux Foundation и ещё десятки компаний объявили о создании Open Secure AI Alliance. Цель альянса — разработка открытых инструментов для защиты ИИ, совместных методик оценки безопасности, наборов данных и средств red teaming. Примечательно, что OpenAI, Google и Anthropic в число участников не вошли. https://www.theverge.com/ai-artificial-intelligence/971281/nvidia-open-secure-ai-alliance-cybersecurity
Вероятно, это одна из самых значимых инициатив года в области AI Security. Отрасль начинает создавать открытые механизмы защиты, аналогичные тем, которые существуют в мире open source для традиционной кибербезопасности.
Вероятно, это одна из самых значимых инициатив года в области AI Security. Отрасль начинает создавать открытые механизмы защиты, аналогичные тем, которые существуют в мире open source для традиционной кибербезопасности.
The Verge
Nvidia, Microsoft launch open AI security alliance — without OpenAI, Google, or Anthropic
It comes after Hugging Face used a Chinese open-weight AI to defend itself against rogue OpenAI agents.
👍1
Microsoft опубликовала программную статью, в которой заявила, что традиционная архитектура кибербезопасности перестаёт соответствовать эпохе автономных ИИ-агентов. Компания представила концепцию Project Perception — нового подхода к обнаружению угроз и поиску уязвимостей с использованием нескольких ИИ-моделей. https://blogs.microsoft.com/blog/2026/07/27/rethinking-security-for-the-age-of-ai/
SOC будущего будет строиться вокруг ИИ-агентов, способных самостоятельно анализировать события, выявлять атаки и помогать аналитикам принимать решения.
SOC будущего будет строиться вокруг ИИ-агентов, способных самостоятельно анализировать события, выявлять атаки и помогать аналитикам принимать решения.
👍1
В Сбере назвали пять базовых мер для обеспечения кибербезопасности саморазвивающихся AI-агентов
Эксперты Сбера на конференции OFFZONE 2026 представили результаты исследования безопасности саморазвивающихся агентов Hermes и OpenClaw.
Для минимизации угроз неконтролируемого и потенциально вредного саморазвития эксперты Сбера предложили пять базовых мер кибербезопасности:
1. Строгая изоляция агентов. Реализация локальных сервисов памяти, собственных и делегированных токенов доступа и отдельных сред исполнения для каждого агента и его пользователя.
2. Разделение контуров разработки и эксплуатации. Самоэволюция полностью отключена в эксплуатационной среде, поскольку в ней возможен доступ к чувствительным данным. В контуре разработки процесс самоэволюции возможен, но при этом доступ к данным разрешен исключительно на чтение, а доступ к сети отключен. Вывод решения в эксплуатацию происходит со стандартными проверками кибербезопасности.
3. Независимые системы безопасности. Механизмы защиты вынесены за контур исполняемого кода агента. Централизованная система обеспечивает сбор и обработку телеметрии и метрик, ограничители (гардрейлы) блокируют аномалии (промпт-атаки, утечки, токсичность и пр.) в реальном времени, далее следует офлайн-анализ и, при необходимости, принятие решения о допустимости действий агента.
4. Корпоративный реестр навыков. Все инструменты, которыми пользуется агент, проходят обязательную статическую и динамическую проверку перед попаданием в реестр. Дополнительно рекомендуется анализировать опасные комбинации инструментов на предмет избыточных совокупных возможностей.
5. Использование песочницы для запуска кода. Любой код, генерируемый AI-агентом, запускается в изолированной среде. Сессия имеет ограниченное время жизни, собственные временные токены доступа, запрет на доступ к сети и строгие лимиты на использование процессора, памяти и файловой системы.
👉 Подробнее
Эксперты Сбера на конференции OFFZONE 2026 представили результаты исследования безопасности саморазвивающихся агентов Hermes и OpenClaw.
Для минимизации угроз неконтролируемого и потенциально вредного саморазвития эксперты Сбера предложили пять базовых мер кибербезопасности:
1. Строгая изоляция агентов. Реализация локальных сервисов памяти, собственных и делегированных токенов доступа и отдельных сред исполнения для каждого агента и его пользователя.
2. Разделение контуров разработки и эксплуатации. Самоэволюция полностью отключена в эксплуатационной среде, поскольку в ней возможен доступ к чувствительным данным. В контуре разработки процесс самоэволюции возможен, но при этом доступ к данным разрешен исключительно на чтение, а доступ к сети отключен. Вывод решения в эксплуатацию происходит со стандартными проверками кибербезопасности.
3. Независимые системы безопасности. Механизмы защиты вынесены за контур исполняемого кода агента. Централизованная система обеспечивает сбор и обработку телеметрии и метрик, ограничители (гардрейлы) блокируют аномалии (промпт-атаки, утечки, токсичность и пр.) в реальном времени, далее следует офлайн-анализ и, при необходимости, принятие решения о допустимости действий агента.
4. Корпоративный реестр навыков. Все инструменты, которыми пользуется агент, проходят обязательную статическую и динамическую проверку перед попаданием в реестр. Дополнительно рекомендуется анализировать опасные комбинации инструментов на предмет избыточных совокупных возможностей.
5. Использование песочницы для запуска кода. Любой код, генерируемый AI-агентом, запускается в изолированной среде. Сессия имеет ограниченное время жизни, собственные временные токены доступа, запрет на доступ к сети и строгие лимиты на использование процессора, памяти и файловой системы.
👉 Подробнее
Forwarded from Пост Лукацкого
3 года назад мы в 🤟 пытались придумать систему классификации автономного ИИ, взяв за основу систему классификации автопилота в автомобилях (SAE), но к единому мнению не пришли ввиду сложности задачи – мы пытались разложить сложную систему (а тогда еще даже ИИ-агентов не было) в одномерном пространстве из пяти уровней автономности. На Jet CyberCamp я вновь попытался вернуться к этой истории, предложив двумерное пространство классификации ИИ-агентов в контексте ИБ, – 6 параметров с соответствующими градациями. И вот новый подход, от Ленни Зельцера, который предлагает свою систему категоризации, но не для агента целиком, а для каждого типа его действий отдельно.
Этот подход, получивший название Security Autonomy Matrix, не просто выделяет 5 уровней автономности (по аналогии с SAE), но и применяет их к пяти классам действий – читать, писать, отправлять, тратить, удалять. Уровень автономности для каждого действия ИИ-агента зависит от оценки по двум параметрам:
➡️ Blast radius – насколько далеко распространятся последствия ошибки
➡️ Reversibility – насколько быстро ошибку можно отменить относительно скорости распространения ущерба.
Отсюда и основная идея матрицы – чем менее обратимо действие и чем больше его blast radius, тем сильнее должен быть человеческий контроль. Если внимательно почитать предлагаемый фреймворк, то становится очевидным, как классический совет многих рекомендаций про human-in-the-loop раскладывается на вполне понятные действия, которые могут быть реализованы через AI Policy Engine.
Например, ИИ-агент занимается очисткой старых правил PT NGFW и обнаруживает правило, которое не использовалось 90 дней. Можно дать ему:
➡️ Read L4, чтобы самостоятельно анализировать правила
➡️ Write L3, чтобы самостоятельно отключить правило
➡️ Delete L2, чтобы окончательно удалить только после подтверждения инженером ИБ.
Почему так? Потому что отключение обратимо (отключили → какое-то приложение сломалось → включили обратно), а удаление – это одностороннее действие. Ну а если несколько кварталов ИИ-агент безошибочно справляется со своей задачей, то Delete теоретически тоже можно повысить до L3.
Дополнительно, Ленни предлагает фиксировать еще четыре вещи:
➡️ Ответственный. Кто персонально отвечает за действия агента. Не "SOC", не "команда ИИ", а конкретная роль.
➡️ Точка контроля. Где именно человек подтверждает, отменяет или откатывает действие.
➡️ Остаточный риск + защитные меры. Что все равно может пойти не так и чем мы ограничиваем ущерб.
➡️ Правила и сроки пересмотра. Когда разрешение агенту должно быть пересмотрено.
В общем, интересная динамическая модель доверия ИИ-агентам, которая позволяет задавать правильный вопрос: для какого действия, при каком уровне риска, с каким blast radius, при какой обратимости и при каких доказательствах надежности нужен человек? Берем на вооружениепока не придумали еще что-нибудь 🤔
#ии #framework
Этот подход, получивший название Security Autonomy Matrix, не просто выделяет 5 уровней автономности (по аналогии с SAE), но и применяет их к пяти классам действий – читать, писать, отправлять, тратить, удалять. Уровень автономности для каждого действия ИИ-агента зависит от оценки по двум параметрам:
Отсюда и основная идея матрицы – чем менее обратимо действие и чем больше его blast radius, тем сильнее должен быть человеческий контроль. Если внимательно почитать предлагаемый фреймворк, то становится очевидным, как классический совет многих рекомендаций про human-in-the-loop раскладывается на вполне понятные действия, которые могут быть реализованы через AI Policy Engine.
Например, ИИ-агент занимается очисткой старых правил PT NGFW и обнаруживает правило, которое не использовалось 90 дней. Можно дать ему:
Почему так? Потому что отключение обратимо (отключили → какое-то приложение сломалось → включили обратно), а удаление – это одностороннее действие. Ну а если несколько кварталов ИИ-агент безошибочно справляется со своей задачей, то Delete теоретически тоже можно повысить до L3.
Дополнительно, Ленни предлагает фиксировать еще четыре вещи:
В общем, интересная динамическая модель доверия ИИ-агентам, которая позволяет задавать правильный вопрос: для какого действия, при каком уровне риска, с каким blast radius, при какой обратимости и при каких доказательствах надежности нужен человек? Берем на вооружение
#ии #framework
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3
Forwarded from Privacy Enhancing
Linux Foundation развивает TRACE как общий язык доказательств работы AI-агентов
25 августа Linux Foundation взяла под управление TRACE — Trust, Runtime Attestation and Compliance Evidence, открытый стандарт, разработанный OPAQUE совместно с AMD, Intel, Microsoft и Technology Innovation Institute.
TRACE формирует аппаратно подтверждаемую запись, связывающую runtime, исполнявшийся код, политики, классы обрабатываемых данных и инструменты, которые вызывал AI-агент. Спецификация строится поверх RATS, EAT, SLSA, SCITT, SPIFFE и EAR.
Важная оговорка: TRACE пока developer preview; текущая спецификация — v0.2, поэтому её ещё рано считать зрелым production-стандартом.
Что это значит?
Появляется новый слой поверх TEE:
TEE
→ обеспечивает аппаратную изоляцию
Attestation
→ доказывает состояние среды
TRACE
→ превращает это доказательство в переносимое runtime evidence.
Для банков это потенциально очень интересно с точки зрения AI Governance.
Обычный audit log говорит:
TRACE пытается дать возможность доказать:
Это может стать основой технически проверяемого аудита AI-агентов.
25 августа Linux Foundation взяла под управление TRACE — Trust, Runtime Attestation and Compliance Evidence, открытый стандарт, разработанный OPAQUE совместно с AMD, Intel, Microsoft и Technology Innovation Institute.
TRACE формирует аппаратно подтверждаемую запись, связывающую runtime, исполнявшийся код, политики, классы обрабатываемых данных и инструменты, которые вызывал AI-агент. Спецификация строится поверх RATS, EAT, SLSA, SCITT, SPIFFE и EAR.
Важная оговорка: TRACE пока developer preview; текущая спецификация — v0.2, поэтому её ещё рано считать зрелым production-стандартом.
Что это значит?
Появляется новый слой поверх TEE:
TEE
→ обеспечивает аппаратную изоляцию
Attestation
→ доказывает состояние среды
TRACE
→ превращает это доказательство в переносимое runtime evidence.
Для банков это потенциально очень интересно с точки зрения AI Governance.
Обычный audit log говорит:
«Агент вызвал API».
TRACE пытается дать возможность доказать:
«Вот этот workload, в этой аппаратно подтверждённой среде, под этой policy, обработал данные такого класса и вызвал именно этот инструмент».
Это может стать основой технически проверяемого аудита AI-агентов.
👍3
Nvidia представила платформу безопасности с открытым исходным кодом, призванную предотвратить несанкционированные действия и побег автономных ИИ-агентов из тестовой среды, сообщает Bloomberg.
Комплекс под названием Open Agent Safety Platform состоит из двух программных инструментов, работающих на аппаратном обеспечении компании. Они призваны отслеживать поведение агентов в режиме реального времени и принудительно останавливать их работу при выходе за рамки заданных правил.
В Nvidia утверждают, что новая система помогла бы предотвратить недавний резонансный взлом платформы Hugging Face, совершённый моделями OpenAI.
Комплекс под названием Open Agent Safety Platform состоит из двух программных инструментов, работающих на аппаратном обеспечении компании. Они призваны отслеживать поведение агентов в режиме реального времени и принудительно останавливать их работу при выходе за рамки заданных правил.
В Nvidia утверждают, что новая система помогла бы предотвратить недавний резонансный взлом платформы Hugging Face, совершённый моделями OpenAI.
Bloomberg.com
Nvidia Debuts System Designed to Stop AI Agents From Going Awry
Nvidia Corp. introduced a new double-layered artificial intelligence security system that it says would’ve prevented the recent high-profile breach of Hugging Face by OpenAI’s AI models.