maxigacy (AI) Security
206 subscribers
14 photos
7 links
https://maxigacy.pro

AI in Security × Security in AI

Старший инженер по информационной безопасности в Яндексе

Пишу о применении AI в ИБ и ИБ в AI

На едином треке «магистратура—аспирантура» по профилю "Безопасность ИИ" в НИУ ВШЭ

Личное мнение автора
Download Telegram
Prompt injection вместо сериала на выходных

В эти выходные читал статью Defeating Prompt Injections by Design Флориана Трамера и его коллег.

Авторы предлагают CaMeL — архитектурную защиту LLM-агентов от prompt injection. В её основе две модели:

P-LLM строит план по доверенному запросу и может работать с инструментами;
Q-LLM обрабатывает недоверенные данные, но не имеет доступа к инструментам.

CaMeL дополнительно разделяет потоки управления и данных и проверяет, какие данные разрешено передавать конкретным инструментам.

Главная мысль: вместо попытки научить LLM распознавать абсолютно все атаки лучше спроектировать систему так, чтобы даже успешная инъекция не привела к опасному действию.

Пожалуй, теперь это мой любимый формат выходных: практика английского и погружение в безопасность LLM-агентов.

А как проходят ваши выходные? Давайте поделимся в комментариях:)

#AIxSec #LLMSecurity #CaMeL #PromptInjection #Research
8👍3🔥3🤔2
Почему 0% успешных атак ещё не победа

Интересное исследование с говорящим названием The Attacker Moves Second. Среди авторов: Флориан Трамер, Николас Карлини и другие исследователи из ETH Zurich, Anthropic, Google DeepMind и OpenAI.

Авторы проверили 12 современных защит от jailbreak и prompt injection. Многие из них ранее показывали почти нулевой процент успешных атак.

Но стоило использовать адаптивного атакующего, то есть подбирать атаку специально под устройство конкретной защиты, и для большинства решений Attack Success Rate превысил 90%.

Тестировать защиту только на фиксированном наборе промптов недостаточно. Это примерно как проверять антивирус на угрозах, которые он уже видел.

В реальности атакующий знает, что перед ним стоит защита, изучает её поведение и меняет стратегию. Поэтому хороший LLM Security-тест должен проверять не только известные атаки, но и способность защиты выдерживать адаптацию противника.

Иначе красивый 0% ASR может означать лишь то, что атакующий ещё не сделал второй ход.

PS Тем временем нас уже больше сотки 🎉

Делитесь в комментариях как вам контент, может есть опредленные вопросы, которые я мог бы покрыть в следующих постах 🤗

#AIxSec #LLMSecurity #PromptInjection #Research
🔥8👏6👍5
Как пройти Week Offer Security и попасть в команду, которая занимается безопасностью AI

Об этом рассказывает Максим Гусев — старший инженер по информационной безопасности в Яндекс 360. До компании он прошёл путь от стажёра до DevSecOps/MLSecOps-инженера и техлида группы автоматизации в ИБ.

👳‍♂️ В карточках Максим делится, почему решил попробовать Week Offer, как проходили технические сессии и что делать, чтобы подготовиться к собеседованиям. А ещё рассказывает, чем занимаются в области безопасности ML и LLM сегодня.

➡️ Если вас заинтересовала его история, присоединяйтесь к Week Offer Security 12–18 сентября. Сейчас Яндекс ищет инженеров по информационной безопасности с опытом от двух лет.

📆 Регистрируйтесь до 4 сентября, проходите две технические секции и получите офер, если всё пройдёт успешно.

Подписывайтесь:
💬 @Яндекс нанимает разработчиков
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥128👍7🥰1
Меньше битов ≠ больше защиты

Чтобы запустить ML-модель на микроконтроллере, её часто переводят из FP32 в INT8 или INT4. Модель становится компактнее и быстрее, а иногда ещё и демонстрирует лучшую устойчивость к adversarial-атакам.
Звучит как бесплатная защита. Но есть нюанс.

Авторы исследования David and Goliath⁠ проверили три квантованные TinyML-модели с помощью десяти атак и шести защит. Оказалось, что квантование меняет геометрию модели: градиенты могут исчезать, взрываться или указывать атаке неверное направление.

В результате неудачная атака иногда говорит не о реальной защищённости модели, а лишь о том, что выбранный метод плохо работает с квантованной арифметикой.

Поэтому оценивать нужно именно итоговую INT8/INT4-модель, причём не одной атакой: полезны адаптивные, transfer- и black-box-сценарии, а также проверка на реальном устройстве.

Для меня эта тема не только теоретическая. В нашей с Максимом Князевым статье «Влияние квантования TinyML-моделей на устойчивость аудиосистем персонального интернета вещей»⁠ мы проверяли распознавание голосовых команд под атакой PGD-40. INT8-QAT сохранил 98,8% точности на чистых данных и 92,2% под атакой, а у INT4 показатели снизились до 49,42% и 47,8% соответственно.

Квантование отлично экономит память. Но в безопасности экономия битов ещё не означает экономию рисков.

#AIxSec #TinyML #AdversarialML #MLSecurity #Security #AIxSec_Research
7🤩6🔥4
Цифровой кофепоинт Яндекса

Самое ценное, что можно получить от работы в большой компании - это не строчка в резюме, новый грейд или опыт с очередным модным стеком.

Это люди, нетворк и чужие мысли.

Иногда одна случайная беседа на кухне даёт больше, чем несколько вечеров чтения статей. Кто-то расскажет, как устроена система, которую ты раньше видел только снаружи. Кто-то поделится провалом, который сэкономит тебе полгода собственных ошибок. В этом для меня и заключается ценность сильного профессионального окружения: рядом постоянно находятся люди, которые знают больше тебя в своей области и смотрят на привычные вещи совершенно иначе.

Коллеги собрали папку с Telegram-каналами ребят из Яндекса. Здесь авторы из разработки, ML, аналитики, продукта, менеджмента, безопасности и других направлений.

Кто-то публикует технические разборы, кто-то пишет о карьере и управлении, а кто-то делится профессиональными наблюдениями, которые хочется сразу унести в «Сохранённые».

Советую пробежаться по каналам и найти хотя бы двух-трёх авторов, за ходом мыслей которых вам действительно интересно следить, потому что хороший нетворк начинается не со знакомства. Он начинается с интереса к тому, как думает другой человек.

Забрать папку
👉 https://t.me/addlist/KaVv1NTpJKpmYmZi
🔥74👍3