❓ Делимся интересным проектом из программы Startup.Конвейера

Каждые две недели мы в банке проводим Startup.Конвейер, где в формате питчей стартапы презентуют свои решения представителям бизнес-юнитов ВТБ. Мы познакомили коллег с более чем 130 классными проектами, а также запустили пилоты с лучшими из них.

🚀 HiveTrace — решение для защиты генеративных ИИ-систем от актуальных репутационных и киберрисков.

➡️ Что умеет?
🔹 анализировать сообщения и непрерывно выявлять аномалии и ошибки в пользовательских взаимодействиях с LLM
🔹 определять и предотвращать промпт-атаки
🔹 блокировать до 90% токсичного контента
🔹 защищать RAG-приложения (Retrieval Augmented Generation) от утечек данных

Для кого?
🔹 небольшие ИИ-системы
🔹 корпоративная инфраструктура

🎯 Хотите представить свой проект? Расскажите о нём здесь.
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from AI Security Lab
При внедрении ИИ и агентов проблеме безопасности уделяется мало внимания, к тому же нет общепринятого пайплайна оценки детекции угроз. Наша команда разработала собственный Robustness Test, про который расскажем в следующей серии постов.

Сбор данных для оценки безопасности AI-систем 💾

Начнем с самого ценного – данных. Мы их собираем в 3 ключевых этапа:

1️⃣ Открытые датасеты: мы опираемся на проверенные источники, такие как StrongReject и Lakera для получения примеров реальных атак, и доменные датасеты, которые позволяют покрыть специфику различных бизнес-полей.

2️⃣ Ручной сбор сценариев атак и безопасных запросов: мы дополняем датасеты, проводя red teaming и моделируя сценарии безопасных диалогов, которые охватывают как конкретные бизнес-домены, так и обычные запросы пользователей.

3️⃣ Синтетические данные: для расширения сценариев, мы используем генерацию новых атакующих и безопасных сценариев. По опыту GPT-4.5 показала лучшие результаты в создании новых реалистичных запросов.

Такой комплексный подход помогает собрать качественные данные и покрыть максимальный спектр возможных угроз.
Forwarded from PWN AI (Борис_ь с ml)
Основные ресурсы по вопросам безопасности ИИ

#иб_в_ml

Если вы задавались вопросом, как найти полезную информацию о некоторой узкой теме в ML Security, или только собираетесь знакомится с этой областью, этот список ресурсов для вас.

Просто ML

🟢Гит со ссылками про MLOps

🟢Introduction to Machine Learning - статья (649 страниц) на arxiv про все машинное обучение до самых основ, вышла 4 сентября 2024 года.

🟢Введение в практический ML с тетрадками jupyter

🟢Курс по NLP на HuggingFace

🟢Основы MLOps

Безопасность ML
🔵Карта навыков от PWNAI

🔵глоссарий терминов

🔵Статья от Microsoft про концепции в AI Secuirty

🔵Adversarial AI Attacks, Mitigations, and Defense Strategies: A cybersecurity professional's guide to AI attacks, threat modeling, and securing AI with MLSecOps - Книга, написанная для безопасников по безопасности ИИ

🔵Periodic Table of AI Security by OWASP - фреймворк от OWASP, где рассмотрены меры защиты

🔵Generative AI Security: теория и практики - Достаточно много инфы по LLM, включая регуляторику.

🔵Еще про регуляторику писали тут (в самом конце).

🔵Список ресурсов около llm-security тематики от PWNAI

🔵Еще один список: ML+OPS+security

🔵MlSecurity Playbook по offensive security

🔵Объяснимость ИИ

🔵Конференции, где есть безопасность ИИ
— Зарубежные: DEFCON (AI Villiage), BlackHat (трэки AI,Datascience),
Conference on Applied Machine Learning in Information Security. + Обзор докладов на тему AI с этих конференций.
— Российские: PHDAYS (названия треков меняются, но есть с AI), OFFZONE (AI.ZONE), Форум "Технологии Доверенного ИИ", и скоро будет анонсирована еще одна, пока секретная...

🔵Интересные исследователи по MLSec: Николас Карлини, wunderwuzzi

🔵Классические фреймворки по MLSecOps: Huawei, Databricks, Snowflake, CyberOrda (RU).

🔵Коллекция ссылок и немного теории - гит от jiep

🔵Таксономии атак на ml - карта от MRL, от института BIML

🔵ИИ для кибербезопасности: тренды и востребованность - статья от ВШЭ

🔵Коллекция вредоносных промптов для LLM

🔵И еще один такой сборник

🔵Большая статья с кучей кода как проводить атаки на ml

🔵Доклад Adversa на Conf 42 - Introducing MLSecOps

🔵Пара статей с Хабра про атаки на мл

🔵Paper stack от dreadnode

🔵CTF и подобные площадки, где можно попробовать собственные силы в промпт-атаках LLM (спасибо Коле)
1. crucible.dreadnode.io
2. https://huggingface.co/spaces/invariantlabs/ctf-summer-24/tree/main
3. https://promptairlines.com/
4. burp labs: https://portswigger.net/web-security/llm-attacks
5. в обычных ctf тоже появляются куски с ml/llm, например, в http://poll-vault.chal.hackthe.vote/
6. https://myllmdoc.com/
7. https://gandalf.lakera.ai/
8. AI CTF с PHDFest2 2024: https://aictf.phdays.fun/

И немного от меня лично:

🔵Обзор компетенций для работы с данными в ИБ в трех частях (один, два, три)

🔵Статья про инциденты ML Security

🔵Введение в NLP в ИБ (один, два)
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from DigitalRussia
Опубликованы национальные стандарты в области ИИ:

🔸ГОСТ Р 71476-2024 Искусственный интеллект. Концепции и терминология искусственного интеллекта
🔸ГОСТ Р 71539-2024 Искусственный интеллект. Процессы жизненного цикла системы искусственного интеллекта
🔸ГОСТ Р 71540-2024 Искусственный интеллект. Эталонная архитектура инженерии знаний
🔸ГОСТ Р ИСО/МЭК 24029-2-2024 Искусственный интеллект. Оценка робастности нейронных сетей. Часть 2. Методология использования формальных методов
🔸ГОСТ Р ИСО/МЭК 42001-2024 Искусственный интеллект. Система менеджмента

Дата введения в действие пяти документов: 01.01.2025.

Опубликованы национальные стандарты в области применения ИИ в строительно-дорожной технике:

🔸ГОСТ Р 71750-2024 Технологии искусственного интеллекта в строительно-дорожной технике. Термины и определения
🔸ГОСТ Р 71751-2024 Технологии систем искусственного интеллекта в строительно-дорожной технике. Варианты использования

Дата введения в действие этих ГОСТов: 01.01.2025.

🔸ПНСТ 966-2024 Алгоритмы систем искусственного интеллекта для обнаружения и идентификации препятствий строительно-дорожной техники. Методы испытаний
🔸ПНСТ 967-2024 Алгоритмы систем искусственного интеллекта для решения задач ландшафтной навигации строительно-дорожной техники. Методы испытаний

Срок действия этих документов: с 01.01.2025 до 01.01.2028.

Также добавлены:

🔸ГОСТ Р 71687-2024 Искусственный интеллект. Наборы данных для разработки и верификации моделей машинного обучения для косвенного измерения механических свойств полимерных композиционных материалов. Общие требования
🔸ГОСТ Р ИСО/МЭК 20547-3-2024 Информационные технологии. Эталонная архитектура больших данных. Часть 3. Эталонная архитектура

Дата введения в действие этих документов: 01.01.2025.
Forwarded from AI SecOps
🔸ГОСТ Р 71752-2024 Искусственный интеллект. Техническое задание. Требования к содержанию

Дата введения в действие: 01.01.2025.

🔸ПНСТ 943-2024 Искусственный интеллект. Структура архитектуры систем машинного обучения в будущих сетях, включая IMT-2020

Срок действия: с 01.01.2025 до 01.01.2028.
Forwarded from Dealer.AI
Использование RAG и LLM для анализа кибератак по системным логам.

Наткнулся на простой, но интересный по результатам эксперимент. Задача состоит в поиске аномалий поведения системы по логам системных журналов.Для этого авторы используют RAG подход.

Метод простой. В базу retrieval складывают логи нормальных и аномальных исторических событий (которые были четко детектированы) в качестве ground truth примеров. Далее при анализе поведения системы ретривер запрашивает по системному сообщения логи из журналов в векторной БД. После, с помощью промта, просят LLM сравнить запрос с выдачей для определения принадлежности к классу нормально/нет.

Подход тестировался на типичных для задачи датасетах BGL и Thunderbird, система была спроектирована при помощи LangChain, эмбеддер был от OpenAI, как и сама LLM gpt3.5-like.

Ниже приложу результаты тестов. По F1-score RAG результаты, конечно, впечатляют. На самом, деле мы пришли к тому, что по сути имеем KNn + LLM логику. Как если бы мы судили о нормальности объекта по его описательной статистике/фичах, но уже на уровне перехода embeddings->тексты. Самое интересное, как LLM может распознать такой специфический домен, как анализ логов в cyber security во few-shot режиме? Видела ли подобное на pretrain? Или это уже проявляется та же эмерджентность?

Кстати от себя добавлю ещё ссылку на гит, в котором собраны ещё примеры сетов для анализа логов.

UPD. Вопрос зачем нам тогда LLM , если можно иметь embs+KNN? Ответ у авторов:в тч для OOV примеров. Тк системы быстро изменяются и тп. Более того, а почему бы не применять такой же подход для детекции атак на LLM? Просто собрав все примеры промт атак, что сейчас известны 🤔
Forwarded from PWN AI (Artyom Semenov)
HackerOne выкатили свой гайд по управлению рисками, связаныими с ИИ. В нём рассказали про то, как взаимодействовать с хакерами(ну конечно же чтобы они помогали вам обнаруживать риски), рассказали о старом добром советском ... рисках, которые могут быть реализованы в генеративках(gen ai), а также пояснили зачем важен AI red teaming для управления уязвимостями. Хороший такой гайд. PDF - ниже.
Forwarded from PWN AI (Artyom Semenov)
Пропустил я этот важный док - исправляюсь...

В феврале OWASP выложили альфа версию (версия для альфа-самцов) стандарта для проверки безопасности LLM - OWASP LLMSVS.

❔ Зачем.

LLMSVS предлагает чёткие рекомендации "как безопасно реализовать LLM в своём приложении", если вы AppSec и вам необходимо внедрить LLM, но вы не знаете с чего начать - то это для вас.

В стандарте приведены рекомендации касаемо различных тегов:

🤔 Как правильно настроить конфигурации?
🤔 Как можно реализовать безопасный lifecycle?
🤔 Как можно митигировать риски, которые возникают в процессе обучения?
🤔 Как безопасно интегрировать в приложение ?
и т.д (70 рекомендаций)

В документе существует 3️⃣ уровня проверки безопасности.

LLMSVS Level 1 ‑ Basic Security:(Уровень где необходимо внедрять минимум рекомендаций по безопасности).

LLMSVS Level 2 ‑ Moderate Security(Уровень, где мы можем подразумевать, что мы создаём приложение, с персоналкой и уже в зависимости от этого применяем рекомендации).

LLMSVS Level 3 ‑ High Assurance Security(приложение которое является критически значимым).

К примеру, рекомендация:

😒:"(eng)//"For self‑hosted LLMs, ensure they are appropriately segregated within the network to prevent direct exposure to end‑users unless such access is required."


- применяется на уровнях L2 и L3, потому что подразумевается что есть значимые данные. (но не только в этом дело).

Ну и вот, компания, которая разработала этот стандарт - Lakera, собираются запилить вебинар о том, как пользоваться этим документом.

Скачать сам стандарт(совершенно бесплатно):

🖥 github


🙃 pdf
Please open Telegram to view this post
VIEW IN TELEGRAM
На днях пара выходцев из Amazon опубликовала заслуживающую внимания новую модель угроз для ИИ-агентов.

Для тех, кто прогуливал, “ИИ-агент” - автономная система, которая принимает решения самостоятельно, “модель угроз" - список действий, которые хакеры могут проделать с вашей автономной системой, чтобы вам всячески навредить.

Модель предлагает 9 угроз:
- T1: Подмена логики — злоумышленник незаметно меняет алгоритмы рассуждений агента, подталкивая к вредоносным выводам под видом «правильных» решений.
- T2: Сдвиг целей — скрытное изменение базовых установок агента, чтобы его поведение постепенно смещалось в нужную атакующему сторону.
- T3: Отравление данных — внедрение ложной информации в базу знаний (например, RAG), которая искажает решения агента и самовоспроизводится в будущем. 
- T4: Несанкционированные действия — принуждение агента к операциям, выходящим за рамки его полномочий (например, запуск запрещённых скриптов).
- T5: Перегрузка ресурсов — атака запросами, которые истощают вычислительные мощности (CPU, GPU), выводя агента из строя.
- T6: Подмена идентификатора — обход проверок подлинности для выполнения действий от имени доверенного пользователя или агента.
- T7: Эксплуатация доверия — манипуляция пользователями через их слепое доверие к ИИ-рекомендациям. 
- T8: Зашумление мониторинга — генерация массы ложных событий, чтобы скрыть в логах реальные атаки.
- T9: Скрытый вектор — медленные/сложные атаки, обходящие системы защиты за счёт неочевидных паттернов.
Channel photo updated
Эксперты Wallarm зафиксировали 439 связанных с ИИ уязвимостей — это на 1025% больше, чем годом ранее. Почти все они связаны с API и включают инъекционные атаки, ошибки конфигурации и уязвимости, связанные с управлением памятью. Впервые в рейтинге угроз Wallarm появился новый тип атак — Memory Corruption and Overflow, связанный с некорректной обработкой памяти, что может приводить к утечке данных, сбоям и выполнению произвольного кода.


https://www.securitylab.ru/news/555968.php
2303.18190v1.pdf
657.1 KB
Карточки рисков при развертывании LLM модели