notes.ml
155 subscribers
32 photos
2 files
36 links
Рабочие заметки ML инженера
Автор: @m1trm
Download Telegram
Forwarded from False Positive
Читаем вместе. ИИ в AppSec: могут ли LLM работать с уязвимым кодом

[хабр-обзор] [папира]

Всем привет!

Решил расширить RG еще и на тексты Хабр, сделал разбор статьи LLMs Cannot Reliably Identify and Reason About Security Vulnerabilities (Yet?): A Comprehensive Evaluation, Framework, and Benchmarks. В качестве затравки — несколько тезисов из разбора:

➡️ Результаты бенчмарка — «фотография во времени», быстро устаревающая не только по списку оцененных моделей, но и по попаданию данных в cut-off более современных LLM. Бенчмаркам на безопасность кода критически не хватает подходов по автоматическому обновлению на подобие SWE-rebench.

➡️ Очень зашли гипотезы про согласованность рассуждений и ответов, проверка на «пропатченном» коде и эксперименты с аугментацией.

➡️ Так, например, даже сильные модели ломаются на стресс-аугментациях, таких как изменения в уязвимом коде названий методов/переменных или добавление неиспользуемого кода.

➡️ Наглядная секция про техники промптинга. Практический вывод: роль-ориентированные инструкции и пошаговый CoT заметно улучшают качество (особенно в zero-shot). Но при наличии few-shot инструкций импакт от CoT снижается. Это может помочь сэкономить контекста в некоторых задачах.

➡️ Ограничение длины контекста в реальных кейсах играет критическую роль, поскольку код, приводящий к уязвимости, может находиться не только в разных частях файла, но и в разных частях проекта. Тут стоит отойти от академических статей и посмотреть на инженерные подходы к отбору контекста разработчиками Cursor, Claude-code и прочих копайлотов для разработки.
__________________

Макс Митрофанов, ML-лид направления AppSec 🟥
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Кулуарной сходке быть

За время нахождения в ML комьюнити я понял для себя несколько вещей:

1. В кулуарах узнаешь х10 от того, что питчат компании в паблик, а за пивом с другими зрителями можно завести пачку знакомых

2. Не 100% рецепт, но ты можешь зайти дальше в карьере, если будешь думать не только про метрику на выборке и а/б тесты, но и плотно копаться в домене твоего проекта/компании

Поэтому, кхм, АНОНС:

Наша команда делает сходку с двумя узко-доменными докладами, без записи и трансляции, чтобы рассказать чуть больше, чем разрешает pr-отдел компании😏

- доклад от моих корешей про то, как на примере разбора реальной атаки с кибер-соревнований ML позволил ПОЙМАТЬ ХАКЕРА (да-да, это вам не правильные ботиночки на lamoda рекомендовать, тут эндорфинчика побольше)

- приглашенный гость, CTO CelsusAI, расскажет про специфику медицинского DS (что тоже на острие эмоций от пользы, камон)

В общем:

19 ноября, 18:00, Санкт-Петербург, Арт-галерея Zarenkov Gallery

Регистрация обязательна.


P.S. уважаю ребят с рекомендашек, тут просто реверанс моим друзьям))
🔥41👍1
Google выкатили AI ассистента для документации репозиториев github - CodeWiki:
- работает только для 6 демо реп, произвольный проект кинуть нельзя
- ссылки на источники в ответах ассистента работают не всегда
- есть фича из NotebookLM с генерацией видео презентации по репозиторию, но видео мега поверхностное

Из обещаний:
We’re building a Gemini CLI extension for Code Wiki so teams can run the same system locally and securely on internal repositories.


tl;dr: пока ни о чем, подождем развития проекта и продолжаем сидеть на DeepWiki
Основные тезисы, вокруг которых строил работу в 2025-м

Поддерживая общую традицию, провожаю год размышлениями вокруг и около работы инженера по машинному обучению (разгон о t-shaped инженерах продуктовых команд).

Это всё добро копилось для отдельных постов, но я так и не смог порадовать вас их публикацией:)

Часть 1 (вы тут)
Часть 2

1️⃣ Меняется ландшафт задач ML-инженера

Что раньше находилось за гранью понимания стейкхолдеров?
*тут смежник помогал с тз, сбором данных и разметкой* -> чистка данных -> фиче-инжениринг -> обучение модели -> валидация -> написание обертки для прода -> *тут мы смотрим как смежник радуется, что эта магия работает*

Теперь же LLM-ки схлопывают первые 3 этапа нашей работы (не совру, если скажу, что 99% проектов решаются через context-engineering/RAG без файнтюна), а LLM-API настолько простое, что последний пункт тоже не требует специфики MLE.

Велик соблазн сократить всех мльщиков и просто научить остальное R&D работать с OpenAI-API, да? (Ладно, оставим бедолаг делать олдовый ML, иногда же мы хотим дешевый highload без кластера из GPU)

Прогноз на 2026 #1: ограничения ресурсов в проде будет дальше толкать спрос на small-LM модели из-за их низкого порога входа и острого дефицита железа (разное и одновременное: санкции, ограничение рынка предложения, ограничения production систем, тренд на self-hosted).


2️⃣ *смежник сам собрал данных и наинженерил промпты* -> валидация -> *смежник сам затащил в прод*

Да-да, внимательный читатель заметил в цепочке звено, которое требует определенного скилла. У людей, только сейчас получивших доступ к работе с моделями (пусть и большими языковыми), напрочь отсутствует привычка делать качественную валидацию, как правило проживая следующие стадии:
- Вайб-чекнуть на 2-5 кейсах, что модель умеет решать задачу и катить в прод
- Пытаться докидывать few-shot на каждый фолс
- Паниковать от галлюцинаций, когда меняется модель на LLM-бэкенде
- Стать заложником проекта, уточняя промпт и переходя с LLM-flow к агентам, так и не поняв природу галлюцинаций

Чтобы научиться в валидацию, рекомендую замечательную подборку постов от Рината про то, как за неделю привести в порядок типичный LLM проект.

Нужен ли обязательно MLE, чтобы строить валидацию? 2025 показал, что да, но лишь из-за привычки мерить качество у одних, и отсутствие этого навыка у других.


Прогноз на 2026 #2
: LLM фичи с автоматическим бенчмарком (без human-in-the-loop) станут таким же стандартом, как и unit-тестирование в разработке.



Прогноз на 2026 #3
: Как на собеседованиях, так и в работе умение погрузиться в домен продукта станет цениться значительно выше общих знаний теории по машинному обучению. Многие LLM фичи не требуют знаний о способах претрейна или особенностях архитектуры, но неумение грамотно оценить продуктовую ценность может вылиться в убытки для компании, которая сделала ставку на AI.
Please open Telegram to view this post
VIEW IN TELEGRAM
2
Основные тезисы, вокруг которых строил работу в 2025-м

Часть 1
Часть 2 (вы тут)

3️⃣ 0.9 * 0.9 * 0.9 * 0.9 * 0.9 = 0.6

О
чем речь? О качестве современных агентов. LLM обладают некоторой стохастичностью ответа, могут иметь галлюцинации, поэтому математика агентских систем может быть удручающей: при качестве отдельного ответа 90% мы получаем на 5 итерациях агента с качеством 60% из-за того, что ошибка на одном из шагов повлияет на все последующие.

По этой причине каждому советую побороть желание сразу бежать делать агента и следовать следующей цепочке:
request -> flow -> agent


Прогноз на 2026 #4: Многие LLM-agent проекты схлопнутся, поскольку агенты на фронтир моделях не смогут адаптироваться под переезд на более дешевые/маленькие LLM (ограничение production, или требования заказчика/регулятора, или снижение бюджета). Развитие small-LM не успеет дойти до нужного качества в 4B моделях, приблизившись к нему только в 2027 году.


4️⃣ Притча о мальчике, который кричал "волки" "LLM"

R&D очень хочет построить агентов, а бизнес очень хочет рассказать об LLM-агентах клиентам/инвесторам (потому что кривая хайпа по гартнеру). Эта лихорадка приводит к тому, что многие проекты лоббируются и внедряются без должной проверки качества. Но с насыщением рынка у всех появятся LLM фичи. А раз есть у всех, то это не назвать конкурентным преимуществом. На чем вывозить дальше?

Прогноз на 2026 #5
: Рынок изменит риторику с вопроса "а может ли агент делать Х?" на вопрос "с каким качеством агент может Х?", само наличие LLM в продукте перестанет быть конкурентным преимуществом.


5️⃣ Как же мерить качество LLM фичей?

За этот год собрал коллекцию паттернов и антипаттернов оценки качества, которым хотел бы поделиться с вами:
1) Лабы жадно пылесосят интернет, поэтому ценность открытых бенчмарков сводится на нет ("Training on the test set is a new art form", - Андрей Карпати). Верьте регулярно обновляемым бенчмаркам (как SWE-rebench) или стройте свой закрытый (как LLM in business workloads). К слову, мы пошли по второму пути для оценки LLM в обнаружении вредоносного кода.
2) Не используйте LLM судей. Во-первых смотрите выше в посте п.3, во-вторых они предвзяты к длине и стилю текста, в-третьих деградируют при смене модели.
3) Следите за стабильностью ответа, делайте тесты на воспроизводимость с аугментацией входных даннх (подчерпнул из разбора статьи по LLM в анализе уязвимостей)
4) Тестируйте не только финальное решение, но и цепочку размышлений. Используйте SGR/SO для валидации качества промежуточных этапов размышления модели.


Прогноз на 2026 #6
: Крупные вендоры и независимые консалтинговые агентства начнут монетизировать оценку качества агентов в коммерческих рынках. Появятся закрытые бенчмарки, на которые станут опираться вендоры для продвижения своих AI-first продуктов


P.S. Всё, пошел резать салаты к новому году, всех обнял 🎄
Please open Telegram to view this post
VIEW IN TELEGRAM
6👏1🤝1
Понял, что подсознательно проверяю AI/LLM функции во всех сервисах, которые использую.

Прохожу курс по работе SOC и при анализе дампа трафика на PacketSafari заметил копайлота, которому скормил часть задания. Он успешно справился с выдвижением гипотезы о NTLM-Relay (тут вникал в то, что это такое).

Весь репорт стоит 8$, но топ-3 проблемы выдает бесплатно, советую поиграться
Делаем Google AI Mode основным движком chrome

Заметил за собой, что часто перехожу в этот режим после короткого AI Overview в стандартном поиске google. Поэтому сделал его дефолтным в chrome браузере и делюсь этим простым рецептом:

1. Заходим в "Управление поисковыми системами" или пишем в поисковой строке:
chrome://settings/searchEngines

2. Добавляем быструю команду в блоке "Поиск по сайту". Имя и сама команда не имеют большого значения (например: AI Gemini Search и @aim), а в поле URL вставляем:
https://www.google.com/search?q=%s&udm=50&ie=UTF-8

или
https://www.perplexity.ai/search?q=%s


3. Нажимаем на ( ⋮ ) и выбираем "Использовать по умолчанию"

Готово, AI browser прямо не выходя из chrome:)

UPD: Спасибо Степе, в комментах навел на мысль, что заметка применима к любым поисковым AI-движкам, пост обновил
4
Свежая и интересная статейка с А-лвл конфы про обнаружение атак в трафане через мультимодальные ансупервайзд эмбединги трансформера (представление сессии, хоста, пакетов), сжимая всё до вектора размером 100, на который уже можно накидывать головы для даунстрим задачи (исследуют классификацию вредоносного трафика, но в future works обещают ресерч на детект впн-ов).

tldr: Метрики на публичных бенчмарках все 0.99, в каждом из которых новая SOTA.

Для тех, кто отчаялся искать приложение академическим статьям в жизни:

Пишут что понимают, что датасеты могут быть херня, поэтому собрали стенд и позвали на него 100 пользаков и несколько ред-тим команд погенерить атаки. Симуляцию проводили неделю и вот какие цифры получили:
- было нагенерено "25.43M flows (884.25M packets), where 4.823% flows (3.263M packets) are associated with abnormal behaviors"
- из них, эксперты ИБ для обучения даунстрима взяли только 87 чистых сессий с первых 20 минут симуляции, в который уже было снято 90,319 сессий (тот самый "Training with Only 1.0 ‰ Samples" из названия статьи)
- работали на "4.588K packets per second (PPS)" и может разгоняться до "7.75 M PPS maximum efficiency."
- перф тест дал "The embedding module, sequence model, feature fusion, and AutoML module
exhibit 0.23ms, 6.34ms, 0.79ms, and 2.02ms latency, respectively"

- по качеству генерили "2.322 false alerts per hour"
- а ML метрики обнаруженного вредоносного трафика "tFusion achieves 0.9975 AUROC, 0.9882 AUPRC, 0.9798 Precision, and 0.9982 Recall on average"


Читать советую полную версию с github, там код рядышком

[код] [полная папира] [журнальная папира]
21
notes.ml
Появятся закрытые бенчмарки, на которые станут опираться вендоры для продвижения своих AI-first продуктов
Wiz опубликовали AI Cyber Model Arena.

Промежуточные результаты:

One central takeaway from the results is that offensive capability is jointly determined: the same model can swing dramatically depending on the agent scaffold, and performance is highly domain-specific. No single pairing dominates across all categories-even when one combination leads in most of them.


Готов поспорить на бокал светлого, что в этом году Wiz (Самый дорогой кибербез стартап ever, который в 2025 купил гугл) после публикации закрытого бенчмарка попытаются попасть в него с собственным решением.

Исходя из костов на реализацию, я предполагаю, что они выложат своего агента, который будет соперничать с внешними вендорами, но закрытые модели будут не их (на лидерборде поделили фильтрацию по агентам и моделям).

Но возможно они удивят всех, выложив в 2026 и агента, и модель.

Место тех репорта на лендинге арены еще пустует, в общем следим 👀
Anthropic выпустили claude-code-security

upd: дополнил пост еще одним анонсом релиза

Возможности решения:
- обнаружение уязвимости
- верификация (триаж TP/FP)
- оценка серьезности (severity)
- оценка уверенности (confidence)
- предложение патча

Фокус на агентском подходе к обнаружению уязвимостей:

Rather than scanning for known patterns, Claude Code Security reads and reasons about your code the way a human security researcher would: understanding how components interact, tracing how data moves through your application, and catching complex vulnerabilities that rule-based tools miss.

Также отмечают, что агент понимает бизнес-логику и анализирует поток данных проекта, чего не могут многие инструменты статического анализа.

Тем не менее, позволяют подключить SAST'ы для обнаружения уязвимостей, агент проведет триаж и предложит исправление, если не фолс:

Claude Code Security complements your existing tools by catching what they might miss and closing the loop on remediation. You can export any findings to your existing security workflows.

Ответили на вопрос, с какими уязвимостями работают:

Claude Code Security focuses on high-severity vulnerabilities including memory corruption, injection flaws, authentication bypasses, and complex logic errors that pattern-matching tools typically miss.

Свои размышления накину в комментарии)
🔥1
Ринат из сообщества "LLM под капотом" поделился лайфхаками, которые помогают строить рабочий флоу между проектами: переносить логику и начинать новый проект без настройки окружения.

И я понял, что в части старта проектов у меня тоже уже есть выработанный флоу, заготовлен скилл "init-project".

У меня случаются бессонницы, когда какая-то идея сверлит голову и мешает уснуть. Если сил сразу её реализовать нет, я пишу в obsidian её в директорию "банка идей", где в свободной форме накидываю бред сумасшедшего.

Так вот, чтобы на следующий день не утонуть в рутине и не убрать идею в стол, я настроил скилл, который берет идею из "банка идей", инициализирует проект, добавляет окружение/гит и делает бриф идеи в структурированную документацию.

Так как большая часть из перечисленного - программируемые вещи, я завернул это в скрипт скилла "scripts/init_project_from_brief.sh", который дергает агент.

После чего пилим бриф "00-idea.md" на таски и погнали реализовывать свои фантазии.
🔥3
я: без вайбкодинга внес изменения в проект

codex:
😁4🤨2
Что показали OpenAI в анонсе Codex Security?

После маркетинговой воды первой полезной информацией замечаем метрики:


...scans on the same repositories over time show increasing precision, in one case cutting noise by 84% since initial rollout. We’ve reduced the rate of findings with over-reported severity by more than 90%, and false positive rates on detections have fallen by more than 50% across all repositories.


Поскольку агент и ищет, и триажит уязвимости, то говорят о значительном прогрессе относительно первых версий в части снижения ложных сработок на 84%, но не говорят с какой базы этот показатель снижен (сомнительно).

Снижение на 90% доли файндингов с завышенной оценкой в целом тоже метрика относительная, статистики по заниженным оценкам они не дают, хотя этот показатель кажется критичнее.

Снижение числа ложных срабатываний - единственная понятная метрика конечному пользователю, поскольку триаж TP/FP занимает значительную часть работы аппсека.

Идем дальше. В отличие от антропиков, релиз раздадут в речение нескольких дней на все подписки ChatGPT Enterprise, Business, и Edu. Мне кажется, что дело не в зрелости проекта, а в гонке за клиентов, ведь чем больше охват, тем больше данных для улучшения в дальнейшем.

Заметно отличается от антропиков и скоуп возможностей (выделил жирным):

1. Создание модели угроз приложения. С одной стороны это вызывает уважение, потому что именно с этого и должна начинаться безопасная разработка по всем учебникам. По факту - это аналог AGENT.md, который собирается при первом проходе по репозиторию.
2. Приоретизация уязвимостей по модели угроз. На демо показали, что в случае удачной проверки файндинга прикладывается архив с PoC.
3. Заявляют, что надежность системы повышается при доступе к развернутому проекту (что справедливо и для классических sast/dast).
4. Предлагают автофикс с созданием PR в github
5. Учатся на фидбеке пользователей. Если пользователь меняет критичность уязвимости, агент добавляет изменения в AGENT.md документ модели угроз.

Одной из ключевых мыслей, которую я подметил, является фокус на триаже и отборе полезных сработок вместо генерации большого количества шумных файндингов:


Rather than generating large volumes of speculative findings, we are building a system that prioritizes high-confidence issues that maintainers can act on quickly.


Нытье, как обычно, в комментах:)
Forwarded from False Positive
В эти выходные мы рады поделиться с вами анонсом!

False Positive Community - первый хаб из Москвы на международном соревновании агентских систем BitGN Agent Challenge!💥

BitGN Agent Challenge: Personal & Trustworthy - это челлендж по созданию персональных и надежных автономных агентов.

Отличительная особенность соревнований Рината (организатор BitGN и автор канала LLM под капотом) - это акцент на надежность и воспроизводимость агентских систем. Делая упор на доменную адаптацию и четкие тестовые кейсы, комьюнити этого сообщества получается доказывать эффективность LLM систем для бизнеса. Очень советуем почитать про кейс спасения LLM проекта, бенчмарк бизнес задач и результаты прошедших соревнований: ERC1, ERC2, ERC3.

Участие бесплатное.

Подготовительный этап: 15 марта - 10 апреля (онлайн)
Финал: 11 апреля (онлайн+оффлайн)

Если планируете быть в Москве 11 апреля, будем рады провести финал вместе в нашем хабе #1!
1
Рад поделиться новостью:)

Очень долго слежу за сообществом, жадно смотрел обзоры результатов соревнований от участников, копался в репозиториях решений. Рад, что не только поучаствую в челлендже, но и смогу сделать его для других более ламповым.

Помимо соревнования будут комфортные места, пицца, напитки.

Сделаю вводный доклад для оффлайн участников и возможно подключим трансляцию докладов из хаба Рината (если они будут в live режиме)
2
2026 год, потребности комьюнити в кодинг датасетах для претрейна LLM pov real:
😁1
Читаю книгу про путешествие советских репортеров по Америке 1930-х годов (это ведь почти 100 лет назад!). Забавно проводить параллель с сокращением рабочих мест из-за AI в 2030-х:

Еще дальше кафетериев по этому пути пошли автоматы. Имея примерно ту же внешность, что и кафетерии, они довели процесс проталкивания пищи в американские желудки до виртуозности. <…> Человек опускает никель (пятицентовую монету), получает возможность отворить дверцу, вынимает суп, несет его на свой столик и там съедает, опять-таки положив шляпу под стул на специальную жердочку.

<…> Чувствуется в этом что-то обидное, оскорбительное для человека. Начинаешь подозревать, что хозяин автомата оборудовал свое заведение не для того, чтобы сделать обществу приятный сюрприз, а чтобы уволить со службы бедных завитых девушек в розовых наколках и заработать еще больше долларов.

Но автоматы не так уж популярны в
Америке. Видно, и сами хозяева чувствуют, что где-то должен быть предел всякой рационализации.


(с) Одноэтажная Америка
notes.ml
Читаю книгу про путешествие советских репортеров по Америке 1930-х годов (это ведь почти 100 лет назад!). Забавно проводить параллель с сокращением рабочих мест из-за AI в 2030-х: Еще дальше кафетериев по этому пути пошли автоматы. Имея примерно ту же внешность…
Оглядываюсь на рабочие будни и понимаю, что часто ем из контейнера, купленного в офисном автомате вкусвилла. Но как же приятно хотя бы раз в месяц выбраться в «братья караваевы» и заказать свеже-приготовленную еду с витрины «кафетерия». И кофе от баристы там на 100 рублей дороже, чем из кофемашины в 5-метрах от кассы…

Поэтому, кто знает, может бедные завитые девушки айтишники в розовых наколках cмогут спать спокойно?
Я зарекался не выкладывать трендовые новости в канал, но про эту написал даже Андрей Карпаты, поэтому ловите tldr на взлом litellm:

1. Хакеры проводят кампанию на Trivy (инструмент безопасной разработки для анализа зависимостей проекта, обнаружения секретов и ошибок конфигурации). Атака заключается в краже переменных окружения и популярных файлов с кредами при каждом запуске sast-а в github ci/cd.

2. Для того, чтобы отвлечь внимание от атаки, хакеры запускают спам боты на issue в гитхабе.

3. LiteLLM проект популярный, поэтому разрабатывают свой код безопасно, используют Trivy сканер в свох пайплайнах. Он есть на гитхабе + это подтвердил на hackernews разработчик проекта.

4. Хакеры получают креды LiteLLM, потому что в пайплайнах засветился токен для публикации пакетов pypi PYPI_PUBLISH.

5. Этим токеном хакер публикует litellm@1.82.7, в котором при импорте библиотеки запускается вредоносная нагрузка по краже (1.82.7: proxy_serverpy → ppy → checkmarxzone/raw)

6. Охваты такой цепочки видимо не оправдали ожиданий, поэтому следом публикуется litellm@1․82․8, в котором даже импортировать пакет не надо (1.82.8: litellm_init․pth → models․litellm․cloud):

.pth files in site-packages/ are executed automatically by the Python interpreter on startup (see Python docs on .pth files). No import statement is needed.


7. Хакеры повторяют трюк с флудом в issue, чтобы снова отвлечь внимание от кампании (листайте тут). Пересечение аккаунтов с спам-атакой на trivy больше 75%.

8. done

А еще для вас сделал мем-диаграмму на процессы безопасной разработки в 2к26 😁
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥54