Forwarded from PWN AI (Artyom Semenov)
https://ttps.ai
Интересная матрица атак и ttp для Gen AI
Каждая атака описана и приведены ресёрчи по технике.
Интересная матрица атак и ttp для Gen AI
Каждая атака описана и приведены ресёрчи по технике.
Безопасность в машинном обучении: от проектирования до внедрения (от Солар) https://habr.com/ru/companies/solarsecurity/articles/848834/
Хабр
Безопасность в машинном обучении: от проектирования до внедрения
Полина Сокол, старший аналитик данных R&D-лаборатории Центра технологий кибербезопасности ГК «Солар» , подготовила материал о методах работы с данными и ML-моделями. Это направление исследований...
👍1
Forwarded from llm security и каланы
Google's Secure AI Framework: A practitioner’s guide to navigating AI security
Google, 2023
Веб-сайт
Сегодня хотелось бы вернуться к ИБ и посмотреть на один из фреймворков с рекомендациями по обеспечению кибербезопасности ИИ-систем, а именно Google’s Secure AI Framework (SAIF). SAIF достаточно сильно отличается от часто упоминаемых MITRE ATLAS и OWASP Top 10 for LLMs. OWASP Top 10 for LLMs перечисляет конкретные наиболее критичные уязвимости (вы не поверите, 10 штук), от LLM01 Prompt Injection до LLM10 Model Theft, в подробностях рассказывая, откуда эти уязвимости берутся, как они могут быть проэксплуатированы, а также приводят ссылки на дополнительные ресурсы и иногда конкретные примеры. MITRE ATLAS сделан для тех, кто мыслит в терминах MITRE ATT&CK, и крутится вокруг тактик (цель атакующего от начальных до завершающих стадий атаки, например, «разведка» или «боковое перемещение»), по сути добавляя в них ML-специфичные техники и две тактики (доступ к модели и подготовка атаки на ML-модель). При этом техники ATLAS могут совпадать с «уязвимостями» OWASP Top-10 (например, кража модели). Для разных техник существуют митигации, которые должны снизить вероятность их реализации.
SAIF, как фреймворк от компании-разработчика ИИ-систем, рассматривает безопасность с точки зрения процесса разработки (explore AI development through a security lens) и того, где и на каком этапе могут возникнуть разнообразные риски. Фреймворк состоит из трех основных понятий: компоненты, риски и средства управления рисками, которые объединены в единую карту.
Google, 2023
Веб-сайт
Сегодня хотелось бы вернуться к ИБ и посмотреть на один из фреймворков с рекомендациями по обеспечению кибербезопасности ИИ-систем, а именно Google’s Secure AI Framework (SAIF). SAIF достаточно сильно отличается от часто упоминаемых MITRE ATLAS и OWASP Top 10 for LLMs. OWASP Top 10 for LLMs перечисляет конкретные наиболее критичные уязвимости (вы не поверите, 10 штук), от LLM01 Prompt Injection до LLM10 Model Theft, в подробностях рассказывая, откуда эти уязвимости берутся, как они могут быть проэксплуатированы, а также приводят ссылки на дополнительные ресурсы и иногда конкретные примеры. MITRE ATLAS сделан для тех, кто мыслит в терминах MITRE ATT&CK, и крутится вокруг тактик (цель атакующего от начальных до завершающих стадий атаки, например, «разведка» или «боковое перемещение»), по сути добавляя в них ML-специфичные техники и две тактики (доступ к модели и подготовка атаки на ML-модель). При этом техники ATLAS могут совпадать с «уязвимостями» OWASP Top-10 (например, кража модели). Для разных техник существуют митигации, которые должны снизить вероятность их реализации.
SAIF, как фреймворк от компании-разработчика ИИ-систем, рассматривает безопасность с точки зрения процесса разработки (explore AI development through a security lens) и того, где и на каком этапе могут возникнуть разнообразные риски. Фреймворк состоит из трех основных понятий: компоненты, риски и средства управления рисками, которые объединены в единую карту.
SAIF: Secure AI Framework
SAIF: Google's Guide to Secure AI
Building AI? Learn how to keep it secure with Google's Secure AI Framework. Explore resources, tools, and best practices for responsible AI development.
Forwarded from llm security и каланы
Компоненты – это те процессы и сущности, которые возникают в процессе разработки ИИ-систем. Они поделены на четыре основных зоны: данные, инфраструктура, модель, приложение.
Данные – особая сущность, так как в отличие от традиционного ПО данные в ML-системах подменяют код, определяя логику. Компоненты, связанные с данными – это источники данных, процессы очистки и обработки данных и результирующие датасеты.
Инфраструктура – это все, что связано с процессами вокруг данных и моделей, за которые как правило отвечает традиционный код. Это код фреймворков, процесс обучения, дообучения и оценки, хранения данных и моделей и деплой модели (serving).
Модель – тут все понятно. Основные сущности тут – это файл модели, обработка входов в модель и обработка выходов модели.
Приложение – финальный слой, на котором идет взаимодействие с пользователем. Отмечается, что это взаимодействие, особенно в случае с приложениями на базе LLM, может сильно отличаться от взаимодействия со стандартными приложениями. Здесь компонентами являются само приложение и агенты с плагинами в случае с LLM-приложениями.
Риски – это те проблемы, с которыми может столкнуться разработчик, владелец сервиса или потребитель ИИ- модели. Они достаточно сильно пересекаются с техниками ATLAS и рисками OWASP Top-10: в частности, тут тоже есть Model Exfiltration, во всех трех есть Prompt Injection. Для каждого риска указывается, каковы причины его возникновения, как он может митигироваться и какие были примеры его реализации. Кроме того, указывается, кто ответственен за митигацию – создатель модели или ее потребитель, а также какие средства управления рисками к нему применимы.
Средства управления рисками (controls) – суть понятна из перевода. Средства разбиты по зонам компонентов и ссылаются на риски, которые с их помощью можно закрывать, а также на роль (создатель или потребитель модели), который может их применить.
Данные – особая сущность, так как в отличие от традиционного ПО данные в ML-системах подменяют код, определяя логику. Компоненты, связанные с данными – это источники данных, процессы очистки и обработки данных и результирующие датасеты.
Инфраструктура – это все, что связано с процессами вокруг данных и моделей, за которые как правило отвечает традиционный код. Это код фреймворков, процесс обучения, дообучения и оценки, хранения данных и моделей и деплой модели (serving).
Модель – тут все понятно. Основные сущности тут – это файл модели, обработка входов в модель и обработка выходов модели.
Приложение – финальный слой, на котором идет взаимодействие с пользователем. Отмечается, что это взаимодействие, особенно в случае с приложениями на базе LLM, может сильно отличаться от взаимодействия со стандартными приложениями. Здесь компонентами являются само приложение и агенты с плагинами в случае с LLM-приложениями.
Риски – это те проблемы, с которыми может столкнуться разработчик, владелец сервиса или потребитель ИИ- модели. Они достаточно сильно пересекаются с техниками ATLAS и рисками OWASP Top-10: в частности, тут тоже есть Model Exfiltration, во всех трех есть Prompt Injection. Для каждого риска указывается, каковы причины его возникновения, как он может митигироваться и какие были примеры его реализации. Кроме того, указывается, кто ответственен за митигацию – создатель модели или ее потребитель, а также какие средства управления рисками к нему применимы.
Средства управления рисками (controls) – суть понятна из перевода. Средства разбиты по зонам компонентов и ссылаются на риски, которые с их помощью можно закрывать, а также на роль (создатель или потребитель модели), который может их применить.
Forwarded from llm security и каланы
Наконец, всё это отображается на карту, которая показывает процесс разработки ИИ-системы и показывает, на каком этапе может возникнуть тот или иной риск, в чем опасность и как риск митигировать. Карта интерактивная: можно выбирать риски, чтобы визуально все это себе представлять. В дополнение к ней идет AI Development Primer (достаточно подробная статья для не-ML-щиков о том, как делает машинлернинг) и Risk Self Assessment (тест на то, на какие риски стоит обратить внимание в организации).
Этот фреймворк далеко не идеальный: например, мне непонятно, зачем вообще выделять зону «модель», в которую входит «модель», а также некоторая алгоритмическая (не связанная с моделью) составляющая по обработке входов-выводов; компонент агентов-плагинов слегка тенденциозный и в целом скорее про вводы-выводы, т.к. сами плагины обычно имплементируют детерминированную логику, а агенты с ними объединены вообще непонятно за какие заслуги; evaluation и тем более fine-tuning в моем сознании больше про «модель», чем про инфраструктуру и так далее. Тем не менее, есть причины, по которым захотелось про него рассказать. Во-первых, он в равной мере нацелен и службы ИБ, и на разработчиков систем (вроде меня). Во-вторых, он ориентирован на риски, а не уязвимости (строго говоря, хотя на OWASP написано черным по белому a list of the most critical vulnerabilities, model theft это тоже риск, а не уязвимость). В-третьих, он включает дополнительные материалы, которые должны помочь всем акторам (менеджерам, ИБ-шникам и ML-щикам) говорить на одном языке, в отличие от того же ATLAS, и визуальное представление процесса, которое, если общий язык не найден, дает возможность тыкать в это представление пальцем. Последнее, на мой взгляд, очень важно, поэтому если бы я делал свой идеальный фреймворк, который бы потом объяснял разработчикам я бы основывал его скорее на карте SAIF, а не на ATLAS. Возможно, я не знаю про какие-то еще более удачные фреймворки, но если узнаю – обязательно поделюсь🔪
Этот фреймворк далеко не идеальный: например, мне непонятно, зачем вообще выделять зону «модель», в которую входит «модель», а также некоторая алгоритмическая (не связанная с моделью) составляющая по обработке входов-выводов; компонент агентов-плагинов слегка тенденциозный и в целом скорее про вводы-выводы, т.к. сами плагины обычно имплементируют детерминированную логику, а агенты с ними объединены вообще непонятно за какие заслуги; evaluation и тем более fine-tuning в моем сознании больше про «модель», чем про инфраструктуру и так далее. Тем не менее, есть причины, по которым захотелось про него рассказать. Во-первых, он в равной мере нацелен и службы ИБ, и на разработчиков систем (вроде меня). Во-вторых, он ориентирован на риски, а не уязвимости (строго говоря, хотя на OWASP написано черным по белому a list of the most critical vulnerabilities, model theft это тоже риск, а не уязвимость). В-третьих, он включает дополнительные материалы, которые должны помочь всем акторам (менеджерам, ИБ-шникам и ML-щикам) говорить на одном языке, в отличие от того же ATLAS, и визуальное представление процесса, которое, если общий язык не найден, дает возможность тыкать в это представление пальцем. Последнее, на мой взгляд, очень важно, поэтому если бы я делал свой идеальный фреймворк, который бы потом объяснял разработчикам я бы основывал его скорее на карте SAIF, а не на ATLAS. Возможно, я не знаю про какие-то еще более удачные фреймворки, но если узнаю – обязательно поделюсь
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from PWN AI (Борис_ь с ml)
Основные ресурсы по вопросам безопасности ИИ
#иб_в_ml
Если вы задавались вопросом, как найти полезную информацию о некоторой узкой теме в ML Security, или только собираетесь знакомится с этой областью, этот список ресурсов для вас.
Просто ML
🟢 Гит со ссылками про MLOps
🟢 Introduction to Machine Learning - статья (649 страниц) на arxiv про все машинное обучение до самых основ, вышла 4 сентября 2024 года.
🟢 Введение в практический ML с тетрадками jupyter
🟢 Курс по NLP на HuggingFace
🟢 Основы MLOps
Безопасность ML
🔵 Карта навыков от PWNAI
🔵 глоссарий терминов
🔵 Статья от Microsoft про концепции в AI Secuirty
🔵 Adversarial AI Attacks, Mitigations, and Defense Strategies: A cybersecurity professional's guide to AI attacks, threat modeling, and securing AI with MLSecOps - Книга, написанная для безопасников по безопасности ИИ
🔵 Periodic Table of AI Security by OWASP - фреймворк от OWASP, где рассмотрены меры защиты
🔵 Generative AI Security: теория и практики - Достаточно много инфы по LLM, включая регуляторику.
🔵 Еще про регуляторику писали тут (в самом конце).
🔵 Список ресурсов около llm-security тематики от PWNAI
🔵 Еще один список: ML+OPS+security
🔵 MlSecurity Playbook по offensive security
🔵 Объяснимость ИИ
🔵 Конференции, где есть безопасность ИИ
— Зарубежные: DEFCON (AI Villiage), BlackHat (трэки AI,Datascience),
Conference on Applied Machine Learning in Information Security. + Обзор докладов на тему AI с этих конференций.
— Российские: PHDAYS (названия треков меняются, но есть с AI), OFFZONE (AI.ZONE), Форум "Технологии Доверенного ИИ", и скоро будет анонсирована еще одна, пока секретная...
🔵 Интересные исследователи по MLSec: Николас Карлини, wunderwuzzi
🔵 Классические фреймворки по MLSecOps: Huawei, Databricks, Snowflake, CyberOrda (RU).
🔵 Коллекция ссылок и немного теории - гит от jiep
🔵 Таксономии атак на ml - карта от MRL, от института BIML
🔵 ИИ для кибербезопасности: тренды и востребованность - статья от ВШЭ
🔵 Коллекция вредоносных промптов для LLM
🔵 И еще один такой сборник
🔵 Большая статья с кучей кода как проводить атаки на ml
🔵 Доклад Adversa на Conf 42 - Introducing MLSecOps
🔵 Пара статей с Хабра про атаки на мл
🔵 Paper stack от dreadnode
🔵 CTF и подобные площадки, где можно попробовать собственные силы в промпт-атаках LLM (спасибо Коле)
1. crucible.dreadnode.io
2. https://huggingface.co/spaces/invariantlabs/ctf-summer-24/tree/main
3. https://promptairlines.com/
4. burp labs: https://portswigger.net/web-security/llm-attacks
5. в обычных ctf тоже появляются куски с ml/llm, например, в http://poll-vault.chal.hackthe.vote/
6. https://myllmdoc.com/
7. https://gandalf.lakera.ai/
8. AI CTF с PHDFest2 2024: https://aictf.phdays.fun/
И немного от меня лично:
🔵 Обзор компетенций для работы с данными в ИБ в трех частях (один, два, три)
🔵 Статья про инциденты ML Security
🔵 Введение в NLP в ИБ (один, два)
#иб_в_ml
Если вы задавались вопросом, как найти полезную информацию о некоторой узкой теме в ML Security, или только собираетесь знакомится с этой областью, этот список ресурсов для вас.
Просто ML
Безопасность ML
— Зарубежные: DEFCON (AI Villiage), BlackHat (трэки AI,Datascience),
Conference on Applied Machine Learning in Information Security. + Обзор докладов на тему AI с этих конференций.
— Российские: PHDAYS (названия треков меняются, но есть с AI), OFFZONE (AI.ZONE), Форум "Технологии Доверенного ИИ", и скоро будет анонсирована еще одна, пока секретная...
1. crucible.dreadnode.io
2. https://huggingface.co/spaces/invariantlabs/ctf-summer-24/tree/main
3. https://promptairlines.com/
4. burp labs: https://portswigger.net/web-security/llm-attacks
5. в обычных ctf тоже появляются куски с ml/llm, например, в http://poll-vault.chal.hackthe.vote/
6. https://myllmdoc.com/
7. https://gandalf.lakera.ai/
8. AI CTF с PHDFest2 2024: https://aictf.phdays.fun/
И немного от меня лично:
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Forwarded from DigitalRussia
Опубликованы национальные стандарты в области ИИ:
🔸ГОСТ Р 71476-2024 Искусственный интеллект. Концепции и терминология искусственного интеллекта
🔸ГОСТ Р 71539-2024 Искусственный интеллект. Процессы жизненного цикла системы искусственного интеллекта
🔸ГОСТ Р 71540-2024 Искусственный интеллект. Эталонная архитектура инженерии знаний
🔸ГОСТ Р ИСО/МЭК 24029-2-2024 Искусственный интеллект. Оценка робастности нейронных сетей. Часть 2. Методология использования формальных методов
🔸ГОСТ Р ИСО/МЭК 42001-2024 Искусственный интеллект. Система менеджмента
Дата введения в действие пяти документов: 01.01.2025.
Опубликованы национальные стандарты в области применения ИИ в строительно-дорожной технике:
🔸ГОСТ Р 71750-2024 Технологии искусственного интеллекта в строительно-дорожной технике. Термины и определения
🔸ГОСТ Р 71751-2024 Технологии систем искусственного интеллекта в строительно-дорожной технике. Варианты использования
Дата введения в действие этих ГОСТов: 01.01.2025.
🔸ПНСТ 966-2024 Алгоритмы систем искусственного интеллекта для обнаружения и идентификации препятствий строительно-дорожной техники. Методы испытаний
🔸ПНСТ 967-2024 Алгоритмы систем искусственного интеллекта для решения задач ландшафтной навигации строительно-дорожной техники. Методы испытаний
Срок действия этих документов: с 01.01.2025 до 01.01.2028.
Также добавлены:
🔸ГОСТ Р 71687-2024 Искусственный интеллект. Наборы данных для разработки и верификации моделей машинного обучения для косвенного измерения механических свойств полимерных композиционных материалов. Общие требования
🔸ГОСТ Р ИСО/МЭК 20547-3-2024 Информационные технологии. Эталонная архитектура больших данных. Часть 3. Эталонная архитектура
Дата введения в действие этих документов: 01.01.2025.
🔸ГОСТ Р 71476-2024 Искусственный интеллект. Концепции и терминология искусственного интеллекта
🔸ГОСТ Р 71539-2024 Искусственный интеллект. Процессы жизненного цикла системы искусственного интеллекта
🔸ГОСТ Р 71540-2024 Искусственный интеллект. Эталонная архитектура инженерии знаний
🔸ГОСТ Р ИСО/МЭК 24029-2-2024 Искусственный интеллект. Оценка робастности нейронных сетей. Часть 2. Методология использования формальных методов
🔸ГОСТ Р ИСО/МЭК 42001-2024 Искусственный интеллект. Система менеджмента
Дата введения в действие пяти документов: 01.01.2025.
Опубликованы национальные стандарты в области применения ИИ в строительно-дорожной технике:
🔸ГОСТ Р 71750-2024 Технологии искусственного интеллекта в строительно-дорожной технике. Термины и определения
🔸ГОСТ Р 71751-2024 Технологии систем искусственного интеллекта в строительно-дорожной технике. Варианты использования
Дата введения в действие этих ГОСТов: 01.01.2025.
🔸ПНСТ 966-2024 Алгоритмы систем искусственного интеллекта для обнаружения и идентификации препятствий строительно-дорожной техники. Методы испытаний
🔸ПНСТ 967-2024 Алгоритмы систем искусственного интеллекта для решения задач ландшафтной навигации строительно-дорожной техники. Методы испытаний
Срок действия этих документов: с 01.01.2025 до 01.01.2028.
Также добавлены:
🔸ГОСТ Р 71687-2024 Искусственный интеллект. Наборы данных для разработки и верификации моделей машинного обучения для косвенного измерения механических свойств полимерных композиционных материалов. Общие требования
🔸ГОСТ Р ИСО/МЭК 20547-3-2024 Информационные технологии. Эталонная архитектура больших данных. Часть 3. Эталонная архитектура
Дата введения в действие этих документов: 01.01.2025.
В России обновили концепцию регулирования искусственного интеллекта
В документе зафиксировали ответственность за вред, причиненный нейросетью.
В документе зафиксировали ответственность за вред, причиненный нейросетью.
Парламентская Газета
Концепцию регулирования искусственного интеллекта обновили
Парламентская газета. Новости: Общество. Концепцию регулирования искусственного интеллекта обновили. Дата публикации: 04.12.2024.
🔥1
🔸ГОСТ Р 71752-2024 Искусственный интеллект. Техническое задание. Требования к содержанию
Дата введения в действие: 01.01.2025.
🔸ПНСТ 943-2024 Искусственный интеллект. Структура архитектуры систем машинного обучения в будущих сетях, включая IMT-2020
Срок действия: с 01.01.2025 до 01.01.2028.
Дата введения в действие: 01.01.2025.
🔸ПНСТ 943-2024 Искусственный интеллект. Структура архитектуры систем машинного обучения в будущих сетях, включая IMT-2020
Срок действия: с 01.01.2025 до 01.01.2028.
Assessing potential future artificial intelligence risks, benefits and policy imperatives. https://www.oecd.org/content/dam/oecd/en/publications/reports/2024/11/assessing-potential-future-artificial-intelligence-risks-benefits-and-policy-imperatives_8a491447/3f4e3dfb-en.pdf
dipfejki-riski-i-vozmozhnosti-dlya-biznesa1.pdf
2.7 MB
Исследовании "Дипфейки: риски и возможности для бизнеса"
Forwarded from PWN AI (Artyom Semenov)
Спустя несколько месяцев этот документ получил версию 1.1.
И что в ней интересного ?
Во первых это модель угроз для приложения - все угрозы OWASP наложены на архитектуру приложения. Есть всё же же этапы, однако к ним добавились более осмысленные и точные практики для SecOps части. Решений стало невероятно много и к каждому этапу было предложено несколько решений, как для защиты от атак, защиты данных, так и платформы для тестирования и валидации модельки на этапе релиза (Генерация ML BOM) и файрволлы.
https://genai.owasp.org/resource/llm-and-generative-ai-security-solutions-landscape/
И что в ней интересного ?
Во первых это модель угроз для приложения - все угрозы OWASP наложены на архитектуру приложения. Есть всё же же этапы, однако к ним добавились более осмысленные и точные практики для SecOps части. Решений стало невероятно много и к каждому этапу было предложено несколько решений, как для защиты от атак, защиты данных, так и платформы для тестирования и валидации модельки на этапе релиза (Генерация ML BOM) и файрволлы.
https://genai.owasp.org/resource/llm-and-generative-ai-security-solutions-landscape/
👍1
Forwarded from PWN AI (Artyom Semenov)
OWASP-LLM_GenAI-Security-Solutions-Reference-Guide-v1.0-1.pdf
3.4 MB
Forwarded from PWN AI (Artyom Semenov)
Databricks, выпустившие один из крутых фреймворков по MlSecOps релизнули вторую версию - DASF v2.0
Они добавили побольше инструментов в свой фреймворк, переработали его с точки зрения соответствия нормативным стандартам типа GDRP и CCPA. А также что ? Они добавили побольше компонентов, на которых они обрисовали риски и новые меры по защите. Определили 62 технических риска безопасности и сопоставили их с 64 рекомендуемыми элементами для управления рисками моделей ИИ.
Они также расширили сопоставления с ведущими отраслевыми фреймворками и стандартами рисков ИИ, включая MITRE ATLAS , OWASP LLM & ML Top 10, NIST 800-53 , NIST CSF , HITRUST , ENISA's Securing ML Algorithms , ISO 42001 , ISO 27001:2022. И доработали рекомендации для облаков.
Помимо этого они сделали AI-ассистента к своему фреймворку.
Сделали версию фреймворка в xlsx.
Сделали курс на 1 час(AI Security Fundamentals). Бесплатный. А также обучающие ролики по DASF.
а pdf-версия фреймворка ниже
Они добавили побольше инструментов в свой фреймворк, переработали его с точки зрения соответствия нормативным стандартам типа GDRP и CCPA. А также что ? Они добавили побольше компонентов, на которых они обрисовали риски и новые меры по защите. Определили 62 технических риска безопасности и сопоставили их с 64 рекомендуемыми элементами для управления рисками моделей ИИ.
Они также расширили сопоставления с ведущими отраслевыми фреймворками и стандартами рисков ИИ, включая MITRE ATLAS , OWASP LLM & ML Top 10, NIST 800-53 , NIST CSF , HITRUST , ENISA's Securing ML Algorithms , ISO 42001 , ISO 27001:2022. И доработали рекомендации для облаков.
Помимо этого они сделали AI-ассистента к своему фреймворку.
Сделали версию фреймворка в xlsx.
Сделали курс на 1 час(AI Security Fundamentals). Бесплатный. А также обучающие ролики по DASF.
а pdf-версия фреймворка ниже
❤1👍1