Media is too big
VIEW IN TELEGRAM
На последней встрече PT ML Reading Group Александр Мамылов представил анализ статьи SingLoRA — новый метод создания адаптеров для LLM.
🎥Делимся записью и основными выводами:
• вспомнили, какие на данный момент существуют вариации LoRA и их ключевые особенности,
• разобрались в «математике» нового метода и в том, как авторы решили проблему квадратной матрицы,
• фреймворк PEFT пока не поддерживает SingLoRA, поэтому чтобы поиграться с ним на своих задачах можно использовать код из этого репозитория,
• протестировали SingLoRA на одной из наших задач: метрики изменились в пределах погрешности,
• использование одной матрицы заметно уменьшает размер адаптера и ускоряет его обучение, однако это не является главным ботлнеком при работе LLM в продакшене.
#reading_group #recording #nlp #llm
🎥Делимся записью и основными выводами:
• вспомнили, какие на данный момент существуют вариации LoRA и их ключевые особенности,
• разобрались в «математике» нового метода и в том, как авторы решили проблему квадратной матрицы,
• фреймворк PEFT пока не поддерживает SingLoRA, поэтому чтобы поиграться с ним на своих задачах можно использовать код из этого репозитория,
• протестировали SingLoRA на одной из наших задач: метрики изменились в пределах погрешности,
• использование одной матрицы заметно уменьшает размер адаптера и ускоряет его обучение, однако это не является главным ботлнеком при работе LLM в продакшене.
#reading_group #recording #nlp #llm
🔥3👏3❤1🤓1
Всем привет!
Знаем-знаем, в это время мы обычно публикуем анонс следующей Reading Group, но в этот раз мы выложили его на youtube!
*Шутка*
Мы очень хотели бы поделиться впечатлениями о прошедшей конференции OFFZONE, поэтому посвятим этому следующую Reading Group и перенесем встречу на 12 сентября, чтобы дождаться записей докладов, освежить их в памяти и рассказать вам день AI.Zone за 60 минут🏃♂️
А пока, хотели бы лучше понять, насколько наша аудитория знакома с этой конференцией:
Знаем-знаем, в это время мы обычно публикуем анонс следующей Reading Group, но в этот раз мы выложили его на youtube!
Мы очень хотели бы поделиться впечатлениями о прошедшей конференции OFFZONE, поэтому посвятим этому следующую Reading Group и перенесем встречу на 12 сентября, чтобы дождаться записей докладов, освежить их в памяти и рассказать вам день AI.Zone за 60 минут
А пока, хотели бы лучше понять, насколько наша аудитория знакома с этой конференцией:
Please open Telegram to view this post
VIEW IN TELEGRAM
😁2
Чтобы вы не скучали в пятницу без Reading Group — предлагаем вашему вниманию подборку интересных исследований от ребят из ML-команды.😊
🔵 AI-ассистент для генерации экспертного контента в SIEM (Александр Мамылов) — статья о том, как наш AI-асcистент автоматизирует подготовку правил нормализации и экспертного контента для SIEM, используя для этого кластеризацию логов и fine-tuning LLM.
🔵 Эволюция защиты в PT Data Security: от регулярных выражений к ML (Вадим Безбородов, Максим Митрофанов) — сравниваются классические методы обнаружения чувствительных данных (регулярные выражения) и современные ML-модели (NER, CASSED), которые показали существенно более высокую точность.
🔵 Не k-means единым: кластеризуем некластеризуемое (Тимур Касимов) — статья про применение алгоритмов типа MinHash и HDBSCAN вместо K-means для кластеризации логов, коммандлайнов и событий в SIEM и BAD.
#ml_team #reasearch
#ml_team #reasearch
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6🔥6👍4
Разбор докладов с AI-трека OFFZONE 2025. Часть 1
21–22 августа в Москве прошла техническая конференция по кибербезопасности OFFZONE 2025.
От нашей команды на конференции выступил Максим Митрофанов с докладом про создание своего бенчмарка для LLM. Кроме того, мы послушали другие выступления по теме AI в ИБ, на которых нас ждало много полезных инсайтов.
В эту пятницу специалисты нашей ML-команды Максим Митрофанов и Вадим Безбородов проведут разбор докладов AI-трека конференции, обсудят ключевые идеи выступлений и поделятся своими впечатлениями.
На встрече вы узнаете:
🛑 как применяют LLM в системах автоматизации и обнаружения угроз,
🛑 как строить AI-агентов для пентеста и реверса и какие бенчмарки при этом нужны,
🛑 как использовать ML для анализа трафика и триажа уязвимостей,
🛑 какие существуют подходы к защите моделей и данных в проде.
Разберем удачные кейсы и спорные решения, а также сформулируем выводы, которые можно будет применить в работе.
Ждем всех в Толке в пятницу, 12 сентября, в 15:00.
Ссылка для подключения: Ктолк.
#reading_group #conf #offzone2025 #ml_team
21–22 августа в Москве прошла техническая конференция по кибербезопасности OFFZONE 2025.
От нашей команды на конференции выступил Максим Митрофанов с докладом про создание своего бенчмарка для LLM. Кроме того, мы послушали другие выступления по теме AI в ИБ, на которых нас ждало много полезных инсайтов.
В эту пятницу специалисты нашей ML-команды Максим Митрофанов и Вадим Безбородов проведут разбор докладов AI-трека конференции, обсудят ключевые идеи выступлений и поделятся своими впечатлениями.
На встрече вы узнаете:
Разберем удачные кейсы и спорные решения, а также сформулируем выводы, которые можно будет применить в работе.
Ждем всех в Толке в пятницу, 12 сентября, в 15:00.
Ссылка для подключения: Ктолк.
#reading_group #conf #offzone2025 #ml_team
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥9🤩3⚡2👍1
False Positive
Разбор докладов с AI-трека OFFZONE 2025. Часть 1 21–22 августа в Москве прошла техническая конференция по кибербезопасности OFFZONE 2025. От нашей команды на конференции выступил Максим Митрофанов с докладом про создание своего бенчмарка для LLM. Кроме…
Мы начинаем)
UPD. Доступы поправили
UPD. Доступы поправили
❤2🔥2👍1
Разбор докладов с AI-трека OFFZONE 2025. Часть 2
На прошлой встрече PT ML Reading Group специалист ML-команды Максим Митрофанов поделился разбором части докладов с конференции.
Мы обсудили:
🛑 роль AI в работе SOC;
🛑 применение LLM для интерпретации бинарных файлов;
🛑 использование ML в NDR-системах;
🛑 применение графовых, трансформерных и генеративных моделей в борьбе с вредоносными файлами.
А уже в эту пятницу мы продолжим разбирать материалы AI-трека.
Вадим Безбородов расскажет про:
🛑 подходы к созданию AI-агентов для пентеста и реверса, а также о бенчмарках для их оценки;
🛑 применение LLM в системах автоматизации и обнаружения угроз;
🛑 методы защиты моделей и данных в продакшене.
📅 Ждём всех в Толке в пятницу, 19 сентября, 15:00.
🔗 Ссылка для подключения: Ктолк
#reading_group #conf #offzone2025
На прошлой встрече PT ML Reading Group специалист ML-команды Максим Митрофанов поделился разбором части докладов с конференции.
Мы обсудили:
А уже в эту пятницу мы продолжим разбирать материалы AI-трека.
Вадим Безбородов расскажет про:
📅 Ждём всех в Толке в пятницу, 19 сентября, 15:00.
🔗 Ссылка для подключения: Ктолк
#reading_group #conf #offzone2025
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍4🔥4🤓2
False Positive
Разбор докладов с AI-трека OFFZONE 2025. Часть 2 На прошлой встрече PT ML Reading Group специалист ML-команды Максим Митрофанов поделился разбором части докладов с конференции. Мы обсудили: 🛑 роль AI в работе SOC; 🛑 применение LLM для интерпретации бинарных…
Завершающая часть разбора уже в эфире)
🎥Выкладываем записи разборов AI-трека OFFZONE 2025
На последних двух встречах PT ML Reading Group Максим Митрофанов и Вадим Безбородов поделились своим мнением по каждому AI докладу с конференции и составили персональный рейтинг выступлений, на который можно опираться, если не знаете с чего начать просмотр докладов:)
Р.S. Рейтинг прикладываем первым комментарием к этому посту!
#reading_group #recording #conf #offzone2025
На последних двух встречах PT ML Reading Group Максим Митрофанов и Вадим Безбородов поделились своим мнением по каждому AI докладу с конференции и составили персональный рейтинг выступлений, на который можно опираться, если не знаете с чего начать просмотр докладов:)
Р.S. Рейтинг прикладываем первым комментарием к этому посту!
#reading_group #recording #conf #offzone2025
❤🔥8🔥7❤4👍1
На очередной встрече PT ML Reading Group поговорим о том, как современные техники TLS-фингерпринтинга помогают находить вредоносные серверы и скрытую активность в зашифрованных каналах, а также о том, какую роль в этом играет машинное обучение.
Обсудим:
🛑 TLS-фингерпринтинг — основные понятия, виды отпечатков (JA3, JA4, JA4+) и их отличия;
🛑 причины, по которым JA4 лучше JA3;
🛑 усиление TLS-фингерпринтинга с помощью машинного обучения.
Найти ответы на эти и другие вопросы нам помогут разборы статей:
🟡 «Fingerprinting the Shadows: Unmasking Malicious Servers with Machine Learning‑Powered TLS Analysis»,
🟡 «Experience Report: Using JA4+ Fingerprints for Malware Detection in Encrypted Traffic».
Встречу проведут:
🛑 Коля Лыфенко — Dev Lead ML-команды
🛑 Женя Бечкало — ESC AVLab Network Lead
📅Как обычно, встречаемся в пятницу!
🔗Подключайтесь: Ктолк, 3 октября, в 15:00
#reading_group #cybersecurity #classic_ml
Обсудим:
Найти ответы на эти и другие вопросы нам помогут разборы статей:
Встречу проведут:
📅Как обычно, встречаемся в пятницу!
🔗Подключайтесь: Ктолк, 3 октября, в 15:00
#reading_group #cybersecurity #classic_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6🔥5😁2
Читаем вместе. ИИ в AppSec: могут ли LLM работать с уязвимым кодом
[хабр-обзор] [папира]
Всем привет!
Решил расширить RG еще и на тексты Хабр, сделал разбор статьи LLMs Cannot Reliably Identify and Reason About Security Vulnerabilities (Yet?): A Comprehensive Evaluation, Framework, and Benchmarks. В качестве затравки — несколько тезисов из разбора:
➡️ Результаты бенчмарка — «фотография во времени», быстро устаревающая не только по списку оцененных моделей, но и по попаданию данных в cut-off более современных LLM. Бенчмаркам на безопасность кода критически не хватает подходов по автоматическому обновлению на подобие SWE-rebench.
➡️ Очень зашли гипотезы про согласованность рассуждений и ответов, проверка на «пропатченном» коде и эксперименты с аугментацией.
➡️ Так, например, даже сильные модели ломаются на стресс-аугментациях, таких как изменения в уязвимом коде названий методов/переменных или добавление неиспользуемого кода.
➡️ Наглядная секция про техники промптинга. Практический вывод: роль-ориентированные инструкции и пошаговый CoT заметно улучшают качество (особенно в zero-shot). Но при наличии few-shot инструкций импакт от CoT снижается. Это может помочь сэкономить контекста в некоторых задачах.
➡️ Ограничение длины контекста в реальных кейсах играет критическую роль, поскольку код, приводящий к уязвимости, может находиться не только в разных частях файла, но и в разных частях проекта. Тут стоит отойти от академических статей и посмотреть на инженерные подходы к отбору контекста разработчиками Cursor, Claude-code и прочих копайлотов для разработки.
__________________
Макс Митрофанов, ML-лид направления AppSec🟥
[хабр-обзор] [папира]
Всем привет!
Решил расширить RG еще и на тексты Хабр, сделал разбор статьи LLMs Cannot Reliably Identify and Reason About Security Vulnerabilities (Yet?): A Comprehensive Evaluation, Framework, and Benchmarks. В качестве затравки — несколько тезисов из разбора:
__________________
Макс Митрофанов, ML-лид направления AppSec
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥11❤7👍4👏2
Что мы поняли о роли AI/ML в защите данных за последний год?
Сегодня, на Positive Security Day состоится долгожданный коммерческий релиз PT Data Security — продукта для защиты корпоративных данных, независимо от их типа и места хранения.
Наша команда разрабатывала одну из ключевых фич - ML-модуль классификации данных. Прошли путь с нуля — от идеи и конкурентного анализа до интеграции в продукт и оптимизации инференса.
Поэтому делимся нашим взглядом на роль AI/ML в классификации данных:
⚡️ 1. Метаданные ≠ данные
Мы провели конкурентный анализ и поняли, что большинство решений на рынке анализируют только метаданные — названия файлов/колонок/таблиц, расширения и описания к объектам.
Но в реальных компаниях данные часто выглядит так: “новый документ финал.docx” или "column123"
Так что “аналитика по названиям” быстро разбивается о реальность корпоративного хаоса.
⚡️ 2. Реальность рушит простые гипотезы
Мы собрали валидационную выборку, имитирующую корпоративные данные, и прогнали по ней несколько вендоров и open-source решений.
Результат: полнота <= 40% у regex-пайплайнов.
Регулярки просто не видят такие сущности, как имена, организации, телефоны, даты и многие другие — особенно в естественном тексте.
⚡️ 3. Значит, идем глубже — в контент
С первых итераций мы сделали ставку на анализ содержимого.
Для прототипов использовали Microsoft Presidio — удобный фреймворк, который позволил без интеграции в продукт опробовать наши ML-модели на сценарии защиты данных (но производительность фреймворка не позволяет использовать его в production).
Мы попробовали несколько ML подходов, остановившись на NER архитектуре. С учетом специфики РФ рынка, держали фокус на работе как с русским, так и с английским языком.
Подробности — в нашей статье на Хабре.
⚡️ 4. Идеальный баланс: ML + регулярки
Наш ML классифицирует только те сущности, для которых нет четких правил.
А регулярки, прошедшие жесткий отбор, дополняют модель.
Так мы собрали гибридную систему, которая сочетает точность правил и гибкость ML. Продукт позволяет объединять результаты работы обоих подходов в композитные правила для гибкой настройки.
⚡️ 5. А LLM?
Многие компании рассматривают применение LLM для решения той же задачи. Но когда у клиента миллионы файлов и тысячи таблиц, большие модели оказываются слишком прожорливыми и медлительными.
LLM имеют потенциал в качестве копайлотов для ИБ-специалиста, но не станут ядром системы, которая должна работать на масштабе и в реальном времени.
---
Поздравляем команду продукта в релизом и уходим готовить новые фичи, которые позволят еще надежнее защитить компании от утечек!
____________________________________
Вадим Безбородов, ML-инженер AppSec
Максим Митрофанов, ML-лид AppSec
Сегодня, на Positive Security Day состоится долгожданный коммерческий релиз PT Data Security — продукта для защиты корпоративных данных, независимо от их типа и места хранения.
Наша команда разрабатывала одну из ключевых фич - ML-модуль классификации данных. Прошли путь с нуля — от идеи и конкурентного анализа до интеграции в продукт и оптимизации инференса.
Поэтому делимся нашим взглядом на роль AI/ML в классификации данных:
Мы провели конкурентный анализ и поняли, что большинство решений на рынке анализируют только метаданные — названия файлов/колонок/таблиц, расширения и описания к объектам.
Но в реальных компаниях данные часто выглядит так: “новый документ финал.docx” или "column123"
Так что “аналитика по названиям” быстро разбивается о реальность корпоративного хаоса.
Мы собрали валидационную выборку, имитирующую корпоративные данные, и прогнали по ней несколько вендоров и open-source решений.
Результат: полнота <= 40% у regex-пайплайнов.
Регулярки просто не видят такие сущности, как имена, организации, телефоны, даты и многие другие — особенно в естественном тексте.
С первых итераций мы сделали ставку на анализ содержимого.
Для прототипов использовали Microsoft Presidio — удобный фреймворк, который позволил без интеграции в продукт опробовать наши ML-модели на сценарии защиты данных (но производительность фреймворка не позволяет использовать его в production).
Мы попробовали несколько ML подходов, остановившись на NER архитектуре. С учетом специфики РФ рынка, держали фокус на работе как с русским, так и с английским языком.
Подробности — в нашей статье на Хабре.
Наш ML классифицирует только те сущности, для которых нет четких правил.
А регулярки, прошедшие жесткий отбор, дополняют модель.
Так мы собрали гибридную систему, которая сочетает точность правил и гибкость ML. Продукт позволяет объединять результаты работы обоих подходов в композитные правила для гибкой настройки.
Многие компании рассматривают применение LLM для решения той же задачи. Но когда у клиента миллионы файлов и тысячи таблиц, большие модели оказываются слишком прожорливыми и медлительными.
LLM имеют потенциал в качестве копайлотов для ИБ-специалиста, но не станут ядром системы, которая должна работать на масштабе и в реальном времени.
---
Поздравляем команду продукта в релизом и уходим готовить новые фичи, которые позволят еще надежнее защитить компании от утечек!
____________________________________
Вадим Безбородов, ML-инженер AppSec
Максим Митрофанов, ML-лид AppSec
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥9👍2
Один из способов ускорить инференс LLM — это использовать спекулятивное декодирование (Speculative Decoding), чтобы оптимизировать генерацию ответа. Маленькая модель генерирует черновые токены, а большая — их валидирует. Причём чем длиннее принятый фрагмент, тем больше прирост к скорости работы.
В то же время, узкое место классического SD — фиксированный размер чернового окна. При разношёрстных запросах часть проверок проходит впустую, потому что где‑то черновики совпадают почти полностью, а где‑то ломаются уже на первом токене.
В эту пятницу специалист ML-команды Екатерина Синькова разберёт статью «TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding». Ее авторы предлагают способ динамически выбирать число генерируемых черновых токенов на основе батча запросов, чтобы максимизировать число принятых токенов.
Катя расскажет:
🛑 как работает спекулятивное декодирование,
🛑 как авторы «TETRIS» обошли проблему фиксированного чернового окна,
🛑 как размер батча и запросы в нём влияют на количество генерируемых черновых токенов,
🛑 как это влияет на инференс LLM на практике.
📅 Ждём всех в Толке в пятницу, 17 октября, в 15:00 (GMT+3).
🔗 Ссылка для подключения: Ктолк
#reading_group #llm #deployment
В то же время, узкое место классического SD — фиксированный размер чернового окна. При разношёрстных запросах часть проверок проходит впустую, потому что где‑то черновики совпадают почти полностью, а где‑то ломаются уже на первом токене.
В эту пятницу специалист ML-команды Екатерина Синькова разберёт статью «TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding». Ее авторы предлагают способ динамически выбирать число генерируемых черновых токенов на основе батча запросов, чтобы максимизировать число принятых токенов.
Катя расскажет:
📅 Ждём всех в Толке в пятницу, 17 октября, в 15:00 (GMT+3).
🔗 Ссылка для подключения: Ктолк
#reading_group #llm #deployment
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6👍3🔥2✍1
This is the normal way humanity learns to surmount challenges: We deny the problem, reality smacks us around a bit, and then we start treating the problem with more respect. The Titanic sank, and most people who were aboard died. But nowadays passenger ships have enough lifeboats, and nowadays if the captain said to board them then you’d board them. We don’t hype ships up as unsinkable anymore. We make a mistake the first time, and learn from it the second time. With ASI, there is no second time.
Автор призыва бомбить датацентры с GPU Eliezer Yudkowsky чуть больше месяца назад опубликовал книжку "If Anyone Builds It, Everyone Dies". В ней оказалось много сочного и убедительного контента про наше возможное темное будущее.
Насколько ИИ опаснее ядерных исследований, почему МЛ-инженеры — это алхимики из притчи с плохим концом и прочие ужасы, в этот Хэллоуин будет рассказывать Андрей Кузнецов, ML-директор PT.
📅 Пятница, 31 октября, 15:00 MSK.
🔗 Ссылка: Ктолк
#reading_group #ai #dark_future
🔥8🎃4👻3😁2🌚1
False Positive
This is the normal way humanity learns to surmount challenges: We deny the problem, reality smacks us around a bit, and then we start treating the problem with more respect. The Titanic sank, and most people who were aboard died. But nowadays passenger ships…
Начнем сегодня чуть позже -- в 18 MSK
👍4😁4
False Positive
This is the normal way humanity learns to surmount challenges: We deny the problem, reality smacks us around a bit, and then we start treating the problem with more respect. The Titanic sank, and most people who were aboard died. But nowadays passenger ships…
Мы начинаем🎃
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3🔥2
🍁Октябрь в PT ML Reading Group выдался насыщенным — от сетевой безопасности до философских обсуждений о развитии ИИ.
Делимся записями всех трёх встреч.
🎥 3 октября — Коля Лыфенко и Женя Бечкало рассказали, как современные техники TLS-фингерпринтинга в комбинации с ML-алгоритмами помогают находить вредоносные серверы и скрытую активность даже в зашифрованном трафике.
Встреча будет полезна ML-инженерам и вирусным аналитикам: ребята подробно разобрали, как детектировать угрозы в сети с помощью fingerprinting-подходов и моделей машинного обучения.
🎥 17 октября — Катя Синькова разобрала статью "TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding" и рассказала, как работает спекулятивное декодирование (Speculative Decoding).
Обсудили, как динамический выбор черновых токенов помогает ускорить инференс LLM, зачем нужен баланс между размером батча и длиной чернового окна, и какие приёмы можно применять на практике.
Полезно тем, кто разворачивает собственные LLM-сервисы и ищет способы оптимизации инференса.
🎥 31 октября — Андрей Кузнецов в формате живого общения рассказал о книге Элиезера Юдковского "If Anyone Builds It, Everyone Dies."
На встрече говорили о рисках создания ASI, сравнивали развитие ИИ с ядерными исследованиями и рассуждали о том, как понять, что человечество уже создало сильный ИИ.
Смотрите записи, делитесь своим мнением и подключайтесь к новым встречам RG — впереди ещё много интересного.😊
#reading_group #recording #ml #ai #cybersecurity #llm #dark_future
Делимся записями всех трёх встреч.
🎥 3 октября — Коля Лыфенко и Женя Бечкало рассказали, как современные техники TLS-фингерпринтинга в комбинации с ML-алгоритмами помогают находить вредоносные серверы и скрытую активность даже в зашифрованном трафике.
Встреча будет полезна ML-инженерам и вирусным аналитикам: ребята подробно разобрали, как детектировать угрозы в сети с помощью fingerprinting-подходов и моделей машинного обучения.
🎥 17 октября — Катя Синькова разобрала статью "TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding" и рассказала, как работает спекулятивное декодирование (Speculative Decoding).
Обсудили, как динамический выбор черновых токенов помогает ускорить инференс LLM, зачем нужен баланс между размером батча и длиной чернового окна, и какие приёмы можно применять на практике.
Полезно тем, кто разворачивает собственные LLM-сервисы и ищет способы оптимизации инференса.
🎥 31 октября — Андрей Кузнецов в формате живого общения рассказал о книге Элиезера Юдковского "If Anyone Builds It, Everyone Dies."
На встрече говорили о рисках создания ASI, сравнивали развитие ИИ с ядерными исследованиями и рассуждали о том, как понять, что человечество уже создало сильный ИИ.
Смотрите записи, делитесь своим мнением и подключайтесь к новым встречам RG — впереди ещё много интересного.😊
#reading_group #recording #ml #ai #cybersecurity #llm #dark_future
🔥9❤4👍2✍1