Prompt injection вместо сериала на выходных
В эти выходные читал статью Defeating Prompt Injections by Design Флориана Трамера и его коллег.
Авторы предлагают CaMeL — архитектурную защиту LLM-агентов от prompt injection. В её основе две модели:
— P-LLM строит план по доверенному запросу и может работать с инструментами;
— Q-LLM обрабатывает недоверенные данные, но не имеет доступа к инструментам.
CaMeL дополнительно разделяет потоки управления и данных и проверяет, какие данные разрешено передавать конкретным инструментам.
Главная мысль: вместо попытки научить LLM распознавать абсолютно все атаки лучше спроектировать систему так, чтобы даже успешная инъекция не привела к опасному действию.
Пожалуй, теперь это мой любимый формат выходных: практика английского и погружение в безопасность LLM-агентов.
А как проходят ваши выходные? Давайте поделимся в комментариях:)
#AIxSec #LLMSecurity #CaMeL #PromptInjection #Research
В эти выходные читал статью Defeating Prompt Injections by Design Флориана Трамера и его коллег.
Авторы предлагают CaMeL — архитектурную защиту LLM-агентов от prompt injection. В её основе две модели:
— P-LLM строит план по доверенному запросу и может работать с инструментами;
— Q-LLM обрабатывает недоверенные данные, но не имеет доступа к инструментам.
CaMeL дополнительно разделяет потоки управления и данных и проверяет, какие данные разрешено передавать конкретным инструментам.
Главная мысль: вместо попытки научить LLM распознавать абсолютно все атаки лучше спроектировать систему так, чтобы даже успешная инъекция не привела к опасному действию.
Пожалуй, теперь это мой любимый формат выходных: практика английского и погружение в безопасность LLM-агентов.
А как проходят ваши выходные? Давайте поделимся в комментариях:)
#AIxSec #LLMSecurity #CaMeL #PromptInjection #Research
❤8👍3🔥3🤔2
Почему 0% успешных атак ещё не победа
Интересное исследование с говорящим названием The Attacker Moves Second. Среди авторов: Флориан Трамер, Николас Карлини и другие исследователи из ETH Zurich, Anthropic, Google DeepMind и OpenAI.
Авторы проверили 12 современных защит от jailbreak и prompt injection. Многие из них ранее показывали почти нулевой процент успешных атак.
Но стоило использовать адаптивного атакующего, то есть подбирать атаку специально под устройство конкретной защиты, и для большинства решений Attack Success Rate превысил 90%.
Тестировать защиту только на фиксированном наборе промптов недостаточно. Это примерно как проверять антивирус на угрозах, которые он уже видел.
В реальности атакующий знает, что перед ним стоит защита, изучает её поведение и меняет стратегию. Поэтому хороший LLM Security-тест должен проверять не только известные атаки, но и способность защиты выдерживать адаптацию противника.
Иначе красивый 0% ASR может означать лишь то, что атакующий ещё не сделал второй ход.
PS Тем временем нас уже больше сотки 🎉
Делитесь в комментариях как вам контент, может есть опредленные вопросы, которые я мог бы покрыть в следующих постах 🤗
#AIxSec #LLMSecurity #PromptInjection #Research
Интересное исследование с говорящим названием The Attacker Moves Second. Среди авторов: Флориан Трамер, Николас Карлини и другие исследователи из ETH Zurich, Anthropic, Google DeepMind и OpenAI.
Авторы проверили 12 современных защит от jailbreak и prompt injection. Многие из них ранее показывали почти нулевой процент успешных атак.
Но стоило использовать адаптивного атакующего, то есть подбирать атаку специально под устройство конкретной защиты, и для большинства решений Attack Success Rate превысил 90%.
Тестировать защиту только на фиксированном наборе промптов недостаточно. Это примерно как проверять антивирус на угрозах, которые он уже видел.
В реальности атакующий знает, что перед ним стоит защита, изучает её поведение и меняет стратегию. Поэтому хороший LLM Security-тест должен проверять не только известные атаки, но и способность защиты выдерживать адаптацию противника.
Иначе красивый 0% ASR может означать лишь то, что атакующий ещё не сделал второй ход.
PS Тем временем нас уже больше сотки 🎉
Делитесь в комментариях как вам контент, может есть опредленные вопросы, которые я мог бы покрыть в следующих постах 🤗
#AIxSec #LLMSecurity #PromptInjection #Research
🔥8👏6👍5
Forwarded from Яндекс нанимает | Вакансии для разработчиков
Об этом рассказывает Максим Гусев — старший инженер по информационной безопасности в Яндекс 360. До компании он прошёл путь от стажёра до DevSecOps/MLSecOps-инженера и техлида группы автоматизации в ИБ.
Подписывайтесь:
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥12❤8👍7🥰1
Меньше битов ≠ больше защиты
Чтобы запустить ML-модель на микроконтроллере, её часто переводят из FP32 в INT8 или INT4. Модель становится компактнее и быстрее, а иногда ещё и демонстрирует лучшую устойчивость к adversarial-атакам.
Звучит как бесплатная защита. Но есть нюанс.
Авторы исследования David and Goliath проверили три квантованные TinyML-модели с помощью десяти атак и шести защит. Оказалось, что квантование меняет геометрию модели: градиенты могут исчезать, взрываться или указывать атаке неверное направление.
В результате неудачная атака иногда говорит не о реальной защищённости модели, а лишь о том, что выбранный метод плохо работает с квантованной арифметикой.
Поэтому оценивать нужно именно итоговую INT8/INT4-модель, причём не одной атакой: полезны адаптивные, transfer- и black-box-сценарии, а также проверка на реальном устройстве.
Для меня эта тема не только теоретическая. В нашей с Максимом Князевым статье «Влияние квантования TinyML-моделей на устойчивость аудиосистем персонального интернета вещей» мы проверяли распознавание голосовых команд под атакой PGD-40. INT8-QAT сохранил 98,8% точности на чистых данных и 92,2% под атакой, а у INT4 показатели снизились до 49,42% и 47,8% соответственно.
Квантование отлично экономит память. Но в безопасности экономия битов ещё не означает экономию рисков.
#AIxSec #TinyML #AdversarialML #MLSecurity #Security #AIxSec_Research
Чтобы запустить ML-модель на микроконтроллере, её часто переводят из FP32 в INT8 или INT4. Модель становится компактнее и быстрее, а иногда ещё и демонстрирует лучшую устойчивость к adversarial-атакам.
Звучит как бесплатная защита. Но есть нюанс.
Авторы исследования David and Goliath проверили три квантованные TinyML-модели с помощью десяти атак и шести защит. Оказалось, что квантование меняет геометрию модели: градиенты могут исчезать, взрываться или указывать атаке неверное направление.
В результате неудачная атака иногда говорит не о реальной защищённости модели, а лишь о том, что выбранный метод плохо работает с квантованной арифметикой.
Поэтому оценивать нужно именно итоговую INT8/INT4-модель, причём не одной атакой: полезны адаптивные, transfer- и black-box-сценарии, а также проверка на реальном устройстве.
Для меня эта тема не только теоретическая. В нашей с Максимом Князевым статье «Влияние квантования TinyML-моделей на устойчивость аудиосистем персонального интернета вещей» мы проверяли распознавание голосовых команд под атакой PGD-40. INT8-QAT сохранил 98,8% точности на чистых данных и 92,2% под атакой, а у INT4 показатели снизились до 49,42% и 47,8% соответственно.
Квантование отлично экономит память. Но в безопасности экономия битов ещё не означает экономию рисков.
#AIxSec #TinyML #AdversarialML #MLSecurity #Security #AIxSec_Research
❤7🤩6🔥4
Цифровой кофепоинт Яндекса
Самое ценное, что можно получить от работы в большой компании - это не строчка в резюме, новый грейд или опыт с очередным модным стеком.
Это люди, нетворк и чужие мысли.
Иногда одна случайная беседа на кухне даёт больше, чем несколько вечеров чтения статей. Кто-то расскажет, как устроена система, которую ты раньше видел только снаружи. Кто-то поделится провалом, который сэкономит тебе полгода собственных ошибок. В этом для меня и заключается ценность сильного профессионального окружения: рядом постоянно находятся люди, которые знают больше тебя в своей области и смотрят на привычные вещи совершенно иначе.
Коллеги собрали папку с Telegram-каналами ребят из Яндекса. Здесь авторы из разработки, ML, аналитики, продукта, менеджмента, безопасности и других направлений.
Кто-то публикует технические разборы, кто-то пишет о карьере и управлении, а кто-то делится профессиональными наблюдениями, которые хочется сразу унести в «Сохранённые».
Советую пробежаться по каналам и найти хотя бы двух-трёх авторов, за ходом мыслей которых вам действительно интересно следить, потому что хороший нетворк начинается не со знакомства. Он начинается с интереса к тому, как думает другой человек.
Забрать папку
👉 https://t.me/addlist/KaVv1NTpJKpmYmZi
Самое ценное, что можно получить от работы в большой компании - это не строчка в резюме, новый грейд или опыт с очередным модным стеком.
Это люди, нетворк и чужие мысли.
Иногда одна случайная беседа на кухне даёт больше, чем несколько вечеров чтения статей. Кто-то расскажет, как устроена система, которую ты раньше видел только снаружи. Кто-то поделится провалом, который сэкономит тебе полгода собственных ошибок. В этом для меня и заключается ценность сильного профессионального окружения: рядом постоянно находятся люди, которые знают больше тебя в своей области и смотрят на привычные вещи совершенно иначе.
Коллеги собрали папку с Telegram-каналами ребят из Яндекса. Здесь авторы из разработки, ML, аналитики, продукта, менеджмента, безопасности и других направлений.
Кто-то публикует технические разборы, кто-то пишет о карьере и управлении, а кто-то делится профессиональными наблюдениями, которые хочется сразу унести в «Сохранённые».
Советую пробежаться по каналам и найти хотя бы двух-трёх авторов, за ходом мыслей которых вам действительно интересно следить, потому что хороший нетворк начинается не со знакомства. Он начинается с интереса к тому, как думает другой человек.
Забрать папку
👉 https://t.me/addlist/KaVv1NTpJKpmYmZi
Telegram
by Yandex
Nikita Boyandin invites you to add the folder “by Yandex”, which includes 41 chats.
🔥7❤4👍3