False Positive
1.06K subscribers
68 photos
23 videos
70 links
PT ML Team
Download Telegram
Разбор докладов с AI-трека OFFZONE 2025. Часть 2

На прошлой встрече PT ML Reading Group специалист ML-команды Максим Митрофанов поделился разбором части докладов с конференции.

Мы обсудили:
🛑роль AI в работе SOC;
🛑применение LLM для интерпретации бинарных файлов;
🛑использование ML в NDR-системах;
🛑применение графовых, трансформерных и генеративных моделей в борьбе с вредоносными файлами.

А уже в эту пятницу мы продолжим разбирать материалы AI-трека.
Вадим Безбородов расскажет про:
🛑подходы к созданию AI-агентов для пентеста и реверса, а также о бенчмарках для их оценки;
🛑применение LLM в системах автоматизации и обнаружения угроз;
🛑методы защиты моделей и данных в продакшене.

📅 Ждём всех в Толке в пятницу, 19 сентября, 15:00.
🔗 Ссылка для подключения: Ктолк

#reading_group #conf #offzone2025
Please open Telegram to view this post
VIEW IN TELEGRAM
4👍4🔥4🤓2
🎥Выкладываем записи разборов AI-трека OFFZONE 2025

На последних двух встречах PT ML Reading Group Максим Митрофанов и Вадим Безбородов поделились своим мнением по каждому AI докладу с конференции и составили персональный рейтинг выступлений, на который можно опираться, если не знаете с чего начать просмотр докладов:)

Р.S. Рейтинг прикладываем первым комментарием к этому посту!

#reading_group #recording #conf #offzone2025
❤‍🔥8🔥74👍1
На очередной встрече PT ML Reading Group поговорим о том, как современные техники TLS-фингерпринтинга помогают находить вредоносные серверы и скрытую активность в зашифрованных каналах, а также о том, какую роль в этом играет машинное обучение.

Обсудим:
🛑TLS-фингерпринтинг — основные понятия, виды отпечатков (JA3, JA4, JA4+) и их отличия;
🛑причины, по которым JA4 лучше JA3;
🛑усиление TLS-фингерпринтинга с помощью машинного обучения.

Найти ответы на эти и другие вопросы нам помогут разборы статей:
🟡«Fingerprinting the Shadows: Unmasking Malicious Servers with Machine Learning‑Powered TLS Analysis»,
🟡«Experience Report: Using JA4+ Fingerprints for Malware Detection in Encrypted Traffic».

Встречу проведут:
🛑Коля Лыфенко — Dev Lead ML-команды
🛑Женя Бечкало — ESC AVLab Network Lead

📅Как обычно, встречаемся в пятницу!
🔗Подключайтесь: Ктолк, 3 октября, в 15:00

#reading_group #cybersecurity #classic_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
6🔥5😁2
Читаем вместе. ИИ в AppSec: могут ли LLM работать с уязвимым кодом

[хабр-обзор] [папира]

Всем привет!

Решил расширить RG еще и на тексты Хабр, сделал разбор статьи LLMs Cannot Reliably Identify and Reason About Security Vulnerabilities (Yet?): A Comprehensive Evaluation, Framework, and Benchmarks. В качестве затравки — несколько тезисов из разбора:

➡️ Результаты бенчмарка — «фотография во времени», быстро устаревающая не только по списку оцененных моделей, но и по попаданию данных в cut-off более современных LLM. Бенчмаркам на безопасность кода критически не хватает подходов по автоматическому обновлению на подобие SWE-rebench.

➡️ Очень зашли гипотезы про согласованность рассуждений и ответов, проверка на «пропатченном» коде и эксперименты с аугментацией.

➡️ Так, например, даже сильные модели ломаются на стресс-аугментациях, таких как изменения в уязвимом коде названий методов/переменных или добавление неиспользуемого кода.

➡️ Наглядная секция про техники промптинга. Практический вывод: роль-ориентированные инструкции и пошаговый CoT заметно улучшают качество (особенно в zero-shot). Но при наличии few-shot инструкций импакт от CoT снижается. Это может помочь сэкономить контекста в некоторых задачах.

➡️ Ограничение длины контекста в реальных кейсах играет критическую роль, поскольку код, приводящий к уязвимости, может находиться не только в разных частях файла, но и в разных частях проекта. Тут стоит отойти от академических статей и посмотреть на инженерные подходы к отбору контекста разработчиками Cursor, Claude-code и прочих копайлотов для разработки.
__________________

Макс Митрофанов, ML-лид направления AppSec 🟥
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥117👍4👏2
Что мы поняли о роли AI/ML в защите данных за последний год?

Сегодня, на Positive Security Day состоится долгожданный коммерческий релиз PT Data Security — продукта для защиты корпоративных данных, независимо от их типа и места хранения.
Наша команда разрабатывала одну из ключевых фич - ML-модуль классификации данных. Прошли путь с нуля — от идеи и конкурентного анализа до интеграции в продукт и оптимизации инференса.

Поэтому делимся нашим взглядом на роль AI/ML в классификации данных:

⚡️1. Метаданные ≠ данные

Мы провели конкурентный анализ и поняли, что большинство решений на рынке анализируют только метаданные — названия файлов/колонок/таблиц, расширения и описания к объектам.
Но в реальных компаниях данные часто выглядит так: “новый документ финал.docx” или "column123"

Так что “аналитика по названиям” быстро разбивается о реальность корпоративного хаоса.

⚡️2. Реальность рушит простые гипотезы

Мы собрали валидационную выборку, имитирующую корпоративные данные, и прогнали по ней несколько вендоров и open-source решений.
Результат: полнота <= 40% у regex-пайплайнов.
Регулярки просто не видят такие сущности, как имена, организации, телефоны, даты и многие другие — особенно в естественном тексте.

⚡️3. Значит, идем глубже — в контент

С первых итераций мы сделали ставку на анализ содержимого.
Для прототипов использовали Microsoft Presidio — удобный фреймворк, который позволил без интеграции в продукт опробовать наши ML-модели на сценарии защиты данных (но производительность фреймворка не позволяет использовать его в production).

Мы попробовали несколько ML подходов, остановившись на NER архитектуре. С учетом специфики РФ рынка, держали фокус на работе как с русским, так и с английским языком.
Подробности — в нашей статье на Хабре.

⚡️4. Идеальный баланс: ML + регулярки

Наш ML классифицирует только те сущности, для которых нет четких правил.
А регулярки, прошедшие жесткий отбор, дополняют модель.
Так мы собрали гибридную систему, которая сочетает точность правил и гибкость ML. Продукт позволяет объединять результаты работы обоих подходов в композитные правила для гибкой настройки.

⚡️5. А LLM?

Многие компании рассматривают применение LLM для решения той же задачи. Но когда у клиента миллионы файлов и тысячи таблиц, большие модели оказываются слишком прожорливыми и медлительными.

LLM имеют потенциал в качестве копайлотов для ИБ-специалиста, но не станут ядром системы, которая должна работать на масштабе и в реальном времени.

---

Поздравляем команду продукта в релизом и уходим готовить новые фичи, которые позволят еще надежнее защитить компании от утечек!


____________________________________

Вадим Безбородов, ML-инженер AppSec
Максим Митрофанов, ML-лид AppSec
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥9👍2
Один из способов ускорить инференс LLM — это использовать спекулятивное декодирование (Speculative Decoding), чтобы оптимизировать генерацию ответа. Маленькая модель генерирует черновые токены, а большая — их валидирует. Причём чем длиннее принятый фрагмент, тем больше прирост к скорости работы.

В то же время, узкое место классического SD — фиксированный размер чернового окна. При разношёрстных запросах часть проверок проходит впустую, потому что где‑то черновики совпадают почти полностью, а где‑то ломаются уже на первом токене.

В эту пятницу специалист ML-команды Екатерина Синькова разберёт статью «TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding». Ее авторы предлагают способ динамически выбирать число генерируемых черновых токенов на основе батча запросов, чтобы максимизировать число принятых токенов.

Катя расскажет:
🛑как работает спекулятивное декодирование,
🛑как авторы «TETRIS» обошли проблему фиксированного чернового окна,
🛑как размер батча и запросы в нём влияют на количество генерируемых черновых токенов,
🛑как это влияет на инференс LLM на практике.

📅 Ждём всех в Толке в пятницу, 17 октября, в 15:00 (GMT+3).
🔗 Ссылка для подключения: Ктолк

#reading_group #llm #deployment
Please open Telegram to view this post
VIEW IN TELEGRAM
6👍3🔥21
This is the normal way humanity learns to surmount challenges: We deny the problem, reality smacks us around a bit, and then we start treating the problem with more respect. The Titanic sank, and most people who were aboard died. But nowadays passenger ships have enough lifeboats, and nowadays if the captain said to board them then you’d board them. We don’t hype ships up as unsinkable anymore. We make a mistake the first time, and learn from it the second time. With ASI, there is no second time.


Автор призыва бомбить датацентры с GPU Eliezer Yudkowsky чуть больше месяца назад опубликовал книжку "If Anyone Builds It, Everyone Dies". В ней оказалось много сочного и убедительного контента про наше возможное темное будущее.

Насколько ИИ опаснее ядерных исследований, почему МЛ-инженеры — это алхимики из притчи с плохим концом и прочие ужасы, в этот Хэллоуин будет рассказывать Андрей Кузнецов, ML-директор PT.

📅 Пятница, 31 октября, 15:00 MSK.
🔗 Ссылка: Ктолк

#reading_group #ai #dark_future
🔥8🎃4👻3😁2🌚1
🍁Октябрь в PT ML Reading Group выдался насыщенным — от сетевой безопасности до философских обсуждений о развитии ИИ.
Делимся записями всех трёх встреч.

🎥 3 октябряКоля Лыфенко и Женя Бечкало рассказали, как современные техники TLS-фингерпринтинга в комбинации с ML-алгоритмами помогают находить вредоносные серверы и скрытую активность даже в зашифрованном трафике.
Встреча будет полезна ML-инженерам и вирусным аналитикам: ребята подробно разобрали, как детектировать угрозы в сети с помощью fingerprinting-подходов и моделей машинного обучения.

🎥 17 октябряКатя Синькова разобрала статью "TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding" и рассказала, как работает спекулятивное декодирование (Speculative Decoding).
Обсудили, как динамический выбор черновых токенов помогает ускорить инференс LLM, зачем нужен баланс между размером батча и длиной чернового окна, и какие приёмы можно применять на практике.
Полезно тем, кто разворачивает собственные LLM-сервисы и ищет способы оптимизации инференса.

🎥 31 октябряАндрей Кузнецов в формате живого общения рассказал о книге Элиезера Юдковского "If Anyone Builds It, Everyone Dies."
На встрече говорили о рисках создания ASI, сравнивали развитие ИИ с ядерными исследованиями и рассуждали о том, как понять, что человечество уже создало сильный ИИ.

Смотрите записи, делитесь своим мнением и подключайтесь к новым встречам RG — впереди ещё много интересного.😊

#reading_group #recording #ml #ai #cybersecurity #llm #dark_future
🔥94👍21
Пока OpenAI, Anthropic и Google соревнуются в строительстве дата-центров, бронируют гигаватты энергии и скупают миллионы GPU, назревает не самая очевидная, но фундаментальная проблема. Compute растёт экспоненциально, а вот данных для обучения ИИ становится недостаточно. По оценкам EpochAI, объём вычислений удваивается приблизительно каждые шесть месяцев, тогда как число доступных в Интернете текстов растет лишь на 3% в год.

Что делать, когда данные заканчиваются, а мощности не ограничены?

На ближайшей встрече разберём одну из самых интересных статей года — «Pre-training under Infinite Compute» от Stanford AI Lab. Это исследование предлагает новый взгляд на масштабирование LLM в эпоху, когда compute стремится к бесконечности, а объем данных ограничен.

🧠 Разбор проведёт Степан Кульчицкий, ведущий специалист ML-команды.

Обсудим:
📉 Какие существуют ограничения и недостатки закона масштабирования Chinchilla.
🧪 Как регуляризация и ансамбли спасают от переобучения на одном датасете.
👨‍🍳 Как получать лучшее качество без добавления новых данных.
🔭 Что нас ждет в ближайшем будущем.

📅 Ждём всех в Толке в пятницу, 14 ноября, в 15:00 MSK.
🔗 Ссылка для подключения: Ктолк

#reading_group #llm #data
🔥91👍1🤩1
Привет! А вы знаете зачем вообще нужны безопасники, как хакеры достигают целей и как от них защититься? ML-команда «Позитива» едет в Питер, чтобы разобрать настоящую атаку, и рассказать:

— как найти аномалии в потоке легитимных событий;
— почему нельзя обойтись без умного анализа трафика;
— какие модели помогают детектировать вредоносы;
— как помогают защищаться AI-агенты на самом деле.

Специальный гость митапа — Женя Никитин (CTO CelsusAI) расскажет, как масштабировать обучение в условиях ограниченных данных медтеха.

Без записи. Без повторов.

19 ноября, 18:00, Арт-галерея Zarenkov Gallery

Регистрируемся тут
🔥187😎6👍4👏1
Подъехали фоточки с нашего митапа!
🔥1712👍4👏1