79 subscribers
19 photos
2 videos
7 files
14 links
Это ваше безопасное использование ИИ, оно сейчас с нами в одной комнате?

Контакт: @quatt1
Download Telegram
Этот пост посвящен sponge-примерам (губкам) — угрозе для третьего элемента триады безопасности — доступности. В контексте LLM inference такие сценарии можно рассматривать как частный случай Model DoS: отдельный запрос заставляет модель тратить непропорционально много времени и энергии на генерацию ответа.

💸 Откуда берется стоимость генерации LLM?
Глобально можно разделить затраты обработки промпта на две части — prefill (чтение запроса и всех приложенных файлов) и decode (последовательная генерация токена за токеном).
Стоимость prefill стабильно растет с длиной входа, и нагрузка вполне предсказуема — decode, напротив, не всегда зависит от размера промпта, и тем не менее, способен занимать практически всю долю затраченных ресурсов. Поэтому мы решили изучить атаки именно на второй компонент стоимости.

🛑 Как модель решает завершить написание ответа?
На каждом шаге генерации модель выполняет одну и ту же задачу — рассчитать вероятности появления каждого токена из словаря, а затем по правилам декодирования выбрать следующий токен. Стохастические методы декодинга называются сэмплингом (temperature, top-p). Существует специальный токен End-of-sequence (EOS), смысловое значение которого — ответ закончен. В момент, когда модель решает завершить ответ, высоковероятным токеном становится EOS — токен выбирается и decode заканчивается. Стало быть, подавляя вероятность генерации EOS на каждом шагу, мы добьемся дорогого ответа.

📉 Как мы можем снизить вероятность EOS?
Важно: на выбор токенов напрямую влияют параметры сэмплинга. Например, чем ближе значение температуры к нулю, тем более жадным становится выбор токенов — генерация приближается к greedy decoding. То есть чем ниже значение параметра, тем чаще модель будет выбирать токены с наибольшей вероятностью. Теперь увидим, как это может привести к циклам.

🌀 Первый пример дорогой и долгой бесполезной генерации, который вы могли видеть — это циклы. Попросим модель написать слово «Привет» 100 раз, и на 101-м шаге у нее в контексте будет большая цепочка с одним правилом: после каждого «Привет» следовало «Привет». Тем самым мы заметно усилили вероятность продолжения паттерна, и здесь важную роль сыграет сэмплинг. Даже при условии выученного правила (топ-1 вероятность у слова «Привет»), при высокой температуре модель могла бы выбрать топ-2 токен или топ-3..., и цикл был бы сломан, генерация могла бы удачно завершиться. Но при жадном сэмплинге мы заметно увеличиваем шансы раз за разом выбирать "Привет". Цикл порождает цикл, и способ заметно снизить вероятность повторов — сделать декодинг менее жадным.

🌫 Посмотрим теперь с другой стороны: почему вам стоит ограничивать параметр температуры ещё и сверху? Чем выше температура, тем выше шанс, что модель сгенерирует не топ-1 токен, а менее вероятный. Представим, что в модель передали запрос с экстремально высокой температурой, хоть миллион. Тогда будет получен случайный поток токенов: модель потеряет всякую логическую нить, а вероятность выбора EOS устремится к случайному попаданию в токен из словаря.

На этих двух примерах мы показали два способа вызвать дорогую генерацию — циклы и шум. В дальнейших постах мы разберем, как мультимодальные модели могут попадать в такие состояния, что такое труднозаметные почти-циклы и как строить защиту от дорогой генерации: max tokens, rate limits и детекторы повторов.

📚 По теме: эта серия постов берет свое начало из нашей исследовательской работы по sponge-примерам и дорогой генерации. Тезисы опубликованы в сборнике Недели науки СПбПУ: https://elib.spbstu.ru/dl/2/i26-137.pdf/download/i26-137.pdf

ключевые слова: sponge attack, Model DoS, expensive generation, greedy decoding, EOS
👨‍💻6🔥31💅1
Про Docker sbx впервые на русском

Автор параноик. Искренне было боязно ставить агента на голую систему без изоляции. Крутил виртуалки, но блин, неудобно каждый раз стартовать полноценную VM под отдельный проект. Контейнеры отпали почти сразу, потому что не сохраняется состояние между запусками. А мудрить с внешним хранилищем сессий, ну, если есть желающие это сделать, го обсудим в комментариях:)

Агент, имеющий доступ к внешнему миру, будь то веб-серфинг или запуск консольных команд - это как русская рулетка с большим количеством пустых мест в барабане. Шанс отстрелить себе что-нибудь небольшой, но никогда не равен нулю. А есть еще атаки через промпт инъекции, тайпсквотиннг и цепочки поставок npm и pip, которые за прошедший год вертели вообще, кажется, все кто мог.

Отвечаю на вопрос «Как сделать так, чтобы ошметки не разлетелись дальше коробки?» в новой статье Полезайте в песочницу, мистер Claude: изолируем агента
😎4🔥3💯2
Мемы!

#мемы
😁8🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
Standoff 17

Всю позапрошлую неделю находился в жюри кибербитвы Standoff и хочу поделиться некоторыми приемами из пентестерского мира, которые либо часто встречались в отчетах красных, либо подзабылись и были открыты мной заново.

Во первых, про само мероприятие. Это офигенная площадка, где есть реальные макеты целей, если реализовано событие «остановка поезда», то поезд на макете реально останавливается. Еще, например, при отключении электричества макет реально погружается во тьму. Зацените видос по ссылке, за 10 лет Standoff реализовали впервые полное отключение электричества https://t.me/standoff_cyberbattle/882/958

Ну и фотки самого макета, если ваша детская мечта, как и моя, это гранд макет Россия дома, то вам понравится https://t.me/standoff_cyberbattle/882/939

Ну а теперь к самим атакам, без какой либо системности, просто то, что наибольшим образом запомнилось.

Copy Fail CVE-2026-31431
Был приятно удивлен, что красные находят и используют сравнительно новые и хайповые CVE или коротко о том, почему нужно обновляться.
Еще есть близкий Dirty Frag CVE-2026-43284, но эксплуатаций не видел.

MCP сервер и промпт-инъекции
Если думаете, что это хипстерская оверхайпленная фигня, то зря. Реально существующий вектор, который и закладывают архитекторы, и активно проходят красные. Значит, он точно может иметь место в реальной инфраструктуре. В одном отчете красных была успешная реализация НС через промпт инъекцию для получения токена. Детали реализации раскрывать не могу, но соберу пост обзор про атаки через mcp. Пишите в личку или комменты, что интереснее: цепочка из SSRF, особенностей IP-aдресов и Gopher или атаки через MCP?

Олдскульную SSRF, редкие нотации IP и сам протокол gopher разберу отдельно, а то и так пост получается размером с большую PDF.

Ну а разобраться в том, как применять эти, и не только, инструменты, можно на курсе «Белый хакер» от Sk… В смысле они не будут платить за рекламу в канале на 50 подписчиков? Понял, вычеркиваю.

Ну а если серьезно, то погрузиться бесплатно можно тут
Portswigger Web Security Academy
TryHackMe | Cyber Security
Hack The Box

Когда разбирался сам, то вообще писал с Клодом на коленке уязвимый сервис под каждый тип атак, чтобы точно понять, как оно выполняется. До сих пор исходники где то валяются. Да, знаю, что есть DVWA, но мне хотелось Postgres, а DVWA у меня с ней не завелось.
3😎2👏1
Не мемы конечно, но...)

Не так давно с коллегой размышляли на тему того как выглядит специалист по безопасности ИИ сейчас.

Лично я топлю за идею того, что это ИБ-специалист, обладающий дополнительной специализацией по AI.

Ибо большинство векторов атак сводится к тому, что через компоненты AI систем пытаются как-либо внедрить классическую зловредную полезную нагрузку.
И здесь конечно без хорошего знания ИБ будет тяжело.

Конечно, есть несколько областей безопасности ИИ, которые требуют больше математики и знания ИИ, чем ИБ. Такое мы выделили в специальность AISec.

Размышляя несколько дней об этом, мой коллега дополнил свою схему карьерного трека ИБ, разделив при этом AISec и AISecOps)

Очень рекомендую к ознакомлению для специалистов этой области!

https://t.me/cyber_edu/777
7❤‍🔥2
#мемы вчера не случилось, потому что Meme Chief Officer этого канала сначала разбирался кто такой этот ваш attention и почему он всем так нужен, а потом обнаружил себя в 5 утра, пишущем скиллы для Клода
😁3🦄2
Постов на этой неделе не было, потому что редакция в жесткой запаре

Но #мемы в четверг
😭21
Forwarded from True dogs 🔞
😢5💯41
Правильно говорить «Мы с Клодом сделали»

#мемы
😁4
Вайбкодеры в здании

На iOS и macOS отвалился ChatGPT, в приложении и вебе(!)

На самом деле принято ругать нерадивых разработчиков, которые просмотрели промахи искусственного кодера. А мне вот кажется, что люди косячат не меньше.
2
Мы просто хотели канал с мемами, а умные посты для прикрытия

#мемы
4😁3
Создаем мультиагентную систему одним скиллом на любой подписке.

Заходят в бар джун, сеньор и software architect.
А бармен им говорит чего тебе, Claude?

Было у меня три подписки.
Claude хорош во всем, но сжигает лимиты как 🚗 M5 бензин.
Codex хорош во всем, но недостаточно в архитектуре, прямолинейный в решениях, от него редко удается получить ВАУ результат.
Composer* Подходит для шаблонных конструкций, типа Докерфайлов, типовых задач и реализации расписанного четкого технического описания. Склонен усложнять код и путаться в трех соснах.

*Модель от Cursor, fine tune Kimi

Вначале, осознав все плюсы и минусы каждого из них, перекидывал задачи руками. Чувствовал, как теряю время на назначении задач и в эффективности на решении, просто не успевая жонглировать задачами.

Решение пришло само собой и распределение ролей выстроилось так:

Fable, а в дальнейшем Opus ==> архитектор и оркестратор
Opus ==> deep reasoner, исследовать, критика решений
Codex ==> порешать вопросики, если Fable или Opus застряли на планировании. Декомпозировать, делегировать и выполнить то, что на уровне архитектуры описали Opus и Fable.
Composer ==> гоустрайтер, в идеале получает декомпозированные задачи и пишет за всех.

Есть еще запасной Sonnet, который выпускаем на поле, если недоступен Composer. Если недоступен Codex, его роль берет на себя Opus с меньшим reasoning.

В целом, результат мне понравился, но захотелось иметь такую систему вне зависимости от того, какие и сколько у меня сейчас активных подписок.

Сначала написал скилл, который выясняет, какие есть подписки и на их основе строит систему из того, что доступно.

Но когда писал пост, нашел репозиторий, который возвел идею в абсолют 🥳

Чтобы установить, просто киньте ссылку на GitHub любому вашему агенту, и они сами разберутся.

https://github.com/razzant/claudexor
Please open Telegram to view this post
VIEW IN TELEGRAM
Там Anthropic расщедрились и в связи с уходом Fable из подписки раздают 100$ на баланс. Возможно, на других тирах больше, у меня подписка за 20$, и это довольно щедро.

Однако, пишут, что фича включает неограниченный расход extra usage credits, так что будьте аккуратны.
Проверил, у меня был выставлен лимит, после получения дополнительных 100$ лимит остался на месте
21😱1
Автор остался анонимным
Мой батя собирает вообще адовые АИ-решения.

Ну такой вот примерно рецепт усредненный, потому что вариаций масса.

Берется старый промпт, он не читается, читать — это не про моего батю. Он берет этот промпт, вываливает его в чат, сверху накидывает system message на три экрана и начинает докручивать. Добавляет туда огромное количество контекста, ролей, ограничений, few-shot примеров, chain-of-thought, JSON schema, temperature 1.2, RAG, векторку, агентность и КОСТЫЛИ! для стабильности, сверху еще “act as senior developer”. Все это гоняется по кругу, пока логи не начинают плеваться эксепшенами, а модель — уверенно нести бред.

Потом батя снимает это с локалки и сразу выкатывает в прод. Потом заносит обратно, навесив сверху retry, regex-парсингом, костыльными валидациями и “ну у меня же работает”, начинает юзать. При этом дебажит прямо в проде, тыкая curl’ом по эндпоинтам. Сидит и приговаривает полушепотом: ух блин, GPT мощь.

При этом у него на лбу аж пот выступает, потому что токены горят, контекст распух, а модель уже третий раз забыла, кто она и зачем живет. Любезно мне иногда предлагает заревьювить, но я отказываюсь.

Надо ли говорить о том, какой дичайший техдолг потом? Легаси такое, что документация от репозитория отклеивается.

#мемы
👍4
Please open Telegram to view this post
VIEW IN TELEGRAM
Одмин, по крайней мере один, улетел в Грузию и на ближйшие две недели планирует состоять на 80% из хачапури и хинкали
10👨‍💻3
CoreBreak_BlackHat2026_FINAL.pdf
13.1 MB
Там это, Black Hat прошел и начали выкладывать презентации. Спарсил за вас все самое интересное по ИИ, плюс собрал короткий обзор в видео. Залил на Ютуб ради автоматических субтитров.
3❤‍🔥2🤯2