Что мы поняли о роли AI/ML в защите данных за последний год?
Сегодня, на Positive Security Day состоится долгожданный коммерческий релиз PT Data Security — продукта для защиты корпоративных данных, независимо от их типа и места хранения.
Наша команда разрабатывала одну из ключевых фич - ML-модуль классификации данных. Прошли путь с нуля — от идеи и конкурентного анализа до интеграции в продукт и оптимизации инференса.
Поэтому делимся нашим взглядом на роль AI/ML в классификации данных:
⚡️ 1. Метаданные ≠ данные
Мы провели конкурентный анализ и поняли, что большинство решений на рынке анализируют только метаданные — названия файлов/колонок/таблиц, расширения и описания к объектам.
Но в реальных компаниях данные часто выглядит так: “новый документ финал.docx” или "column123"
Так что “аналитика по названиям” быстро разбивается о реальность корпоративного хаоса.
⚡️ 2. Реальность рушит простые гипотезы
Мы собрали валидационную выборку, имитирующую корпоративные данные, и прогнали по ней несколько вендоров и open-source решений.
Результат: полнота <= 40% у regex-пайплайнов.
Регулярки просто не видят такие сущности, как имена, организации, телефоны, даты и многие другие — особенно в естественном тексте.
⚡️ 3. Значит, идем глубже — в контент
С первых итераций мы сделали ставку на анализ содержимого.
Для прототипов использовали Microsoft Presidio — удобный фреймворк, который позволил без интеграции в продукт опробовать наши ML-модели на сценарии защиты данных (но производительность фреймворка не позволяет использовать его в production).
Мы попробовали несколько ML подходов, остановившись на NER архитектуре. С учетом специфики РФ рынка, держали фокус на работе как с русским, так и с английским языком.
Подробности — в нашей статье на Хабре.
⚡️ 4. Идеальный баланс: ML + регулярки
Наш ML классифицирует только те сущности, для которых нет четких правил.
А регулярки, прошедшие жесткий отбор, дополняют модель.
Так мы собрали гибридную систему, которая сочетает точность правил и гибкость ML. Продукт позволяет объединять результаты работы обоих подходов в композитные правила для гибкой настройки.
⚡️ 5. А LLM?
Многие компании рассматривают применение LLM для решения той же задачи. Но когда у клиента миллионы файлов и тысячи таблиц, большие модели оказываются слишком прожорливыми и медлительными.
LLM имеют потенциал в качестве копайлотов для ИБ-специалиста, но не станут ядром системы, которая должна работать на масштабе и в реальном времени.
---
Поздравляем команду продукта в релизом и уходим готовить новые фичи, которые позволят еще надежнее защитить компании от утечек!
____________________________________
Вадим Безбородов, ML-инженер AppSec
Максим Митрофанов, ML-лид AppSec
Сегодня, на Positive Security Day состоится долгожданный коммерческий релиз PT Data Security — продукта для защиты корпоративных данных, независимо от их типа и места хранения.
Наша команда разрабатывала одну из ключевых фич - ML-модуль классификации данных. Прошли путь с нуля — от идеи и конкурентного анализа до интеграции в продукт и оптимизации инференса.
Поэтому делимся нашим взглядом на роль AI/ML в классификации данных:
Мы провели конкурентный анализ и поняли, что большинство решений на рынке анализируют только метаданные — названия файлов/колонок/таблиц, расширения и описания к объектам.
Но в реальных компаниях данные часто выглядит так: “новый документ финал.docx” или "column123"
Так что “аналитика по названиям” быстро разбивается о реальность корпоративного хаоса.
Мы собрали валидационную выборку, имитирующую корпоративные данные, и прогнали по ней несколько вендоров и open-source решений.
Результат: полнота <= 40% у regex-пайплайнов.
Регулярки просто не видят такие сущности, как имена, организации, телефоны, даты и многие другие — особенно в естественном тексте.
С первых итераций мы сделали ставку на анализ содержимого.
Для прототипов использовали Microsoft Presidio — удобный фреймворк, который позволил без интеграции в продукт опробовать наши ML-модели на сценарии защиты данных (но производительность фреймворка не позволяет использовать его в production).
Мы попробовали несколько ML подходов, остановившись на NER архитектуре. С учетом специфики РФ рынка, держали фокус на работе как с русским, так и с английским языком.
Подробности — в нашей статье на Хабре.
Наш ML классифицирует только те сущности, для которых нет четких правил.
А регулярки, прошедшие жесткий отбор, дополняют модель.
Так мы собрали гибридную систему, которая сочетает точность правил и гибкость ML. Продукт позволяет объединять результаты работы обоих подходов в композитные правила для гибкой настройки.
Многие компании рассматривают применение LLM для решения той же задачи. Но когда у клиента миллионы файлов и тысячи таблиц, большие модели оказываются слишком прожорливыми и медлительными.
LLM имеют потенциал в качестве копайлотов для ИБ-специалиста, но не станут ядром системы, которая должна работать на масштабе и в реальном времени.
---
Поздравляем команду продукта в релизом и уходим готовить новые фичи, которые позволят еще надежнее защитить компании от утечек!
____________________________________
Вадим Безбородов, ML-инженер AppSec
Максим Митрофанов, ML-лид AppSec
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥9👍2
Один из способов ускорить инференс LLM — это использовать спекулятивное декодирование (Speculative Decoding), чтобы оптимизировать генерацию ответа. Маленькая модель генерирует черновые токены, а большая — их валидирует. Причём чем длиннее принятый фрагмент, тем больше прирост к скорости работы.
В то же время, узкое место классического SD — фиксированный размер чернового окна. При разношёрстных запросах часть проверок проходит впустую, потому что где‑то черновики совпадают почти полностью, а где‑то ломаются уже на первом токене.
В эту пятницу специалист ML-команды Екатерина Синькова разберёт статью «TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding». Ее авторы предлагают способ динамически выбирать число генерируемых черновых токенов на основе батча запросов, чтобы максимизировать число принятых токенов.
Катя расскажет:
🛑 как работает спекулятивное декодирование,
🛑 как авторы «TETRIS» обошли проблему фиксированного чернового окна,
🛑 как размер батча и запросы в нём влияют на количество генерируемых черновых токенов,
🛑 как это влияет на инференс LLM на практике.
📅 Ждём всех в Толке в пятницу, 17 октября, в 15:00 (GMT+3).
🔗 Ссылка для подключения: Ктолк
#reading_group #llm #deployment
В то же время, узкое место классического SD — фиксированный размер чернового окна. При разношёрстных запросах часть проверок проходит впустую, потому что где‑то черновики совпадают почти полностью, а где‑то ломаются уже на первом токене.
В эту пятницу специалист ML-команды Екатерина Синькова разберёт статью «TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding». Ее авторы предлагают способ динамически выбирать число генерируемых черновых токенов на основе батча запросов, чтобы максимизировать число принятых токенов.
Катя расскажет:
📅 Ждём всех в Толке в пятницу, 17 октября, в 15:00 (GMT+3).
🔗 Ссылка для подключения: Ктолк
#reading_group #llm #deployment
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6👍3🔥2✍1
This is the normal way humanity learns to surmount challenges: We deny the problem, reality smacks us around a bit, and then we start treating the problem with more respect. The Titanic sank, and most people who were aboard died. But nowadays passenger ships have enough lifeboats, and nowadays if the captain said to board them then you’d board them. We don’t hype ships up as unsinkable anymore. We make a mistake the first time, and learn from it the second time. With ASI, there is no second time.
Автор призыва бомбить датацентры с GPU Eliezer Yudkowsky чуть больше месяца назад опубликовал книжку "If Anyone Builds It, Everyone Dies". В ней оказалось много сочного и убедительного контента про наше возможное темное будущее.
Насколько ИИ опаснее ядерных исследований, почему МЛ-инженеры — это алхимики из притчи с плохим концом и прочие ужасы, в этот Хэллоуин будет рассказывать Андрей Кузнецов, ML-директор PT.
📅 Пятница, 31 октября, 15:00 MSK.
🔗 Ссылка: Ктолк
#reading_group #ai #dark_future
🔥8🎃4👻3😁2🌚1
False Positive
This is the normal way humanity learns to surmount challenges: We deny the problem, reality smacks us around a bit, and then we start treating the problem with more respect. The Titanic sank, and most people who were aboard died. But nowadays passenger ships…
Начнем сегодня чуть позже -- в 18 MSK
👍4😁4
False Positive
This is the normal way humanity learns to surmount challenges: We deny the problem, reality smacks us around a bit, and then we start treating the problem with more respect. The Titanic sank, and most people who were aboard died. But nowadays passenger ships…
Мы начинаем🎃
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3🔥2
🍁Октябрь в PT ML Reading Group выдался насыщенным — от сетевой безопасности до философских обсуждений о развитии ИИ.
Делимся записями всех трёх встреч.
🎥 3 октября — Коля Лыфенко и Женя Бечкало рассказали, как современные техники TLS-фингерпринтинга в комбинации с ML-алгоритмами помогают находить вредоносные серверы и скрытую активность даже в зашифрованном трафике.
Встреча будет полезна ML-инженерам и вирусным аналитикам: ребята подробно разобрали, как детектировать угрозы в сети с помощью fingerprinting-подходов и моделей машинного обучения.
🎥 17 октября — Катя Синькова разобрала статью "TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding" и рассказала, как работает спекулятивное декодирование (Speculative Decoding).
Обсудили, как динамический выбор черновых токенов помогает ускорить инференс LLM, зачем нужен баланс между размером батча и длиной чернового окна, и какие приёмы можно применять на практике.
Полезно тем, кто разворачивает собственные LLM-сервисы и ищет способы оптимизации инференса.
🎥 31 октября — Андрей Кузнецов в формате живого общения рассказал о книге Элиезера Юдковского "If Anyone Builds It, Everyone Dies."
На встрече говорили о рисках создания ASI, сравнивали развитие ИИ с ядерными исследованиями и рассуждали о том, как понять, что человечество уже создало сильный ИИ.
Смотрите записи, делитесь своим мнением и подключайтесь к новым встречам RG — впереди ещё много интересного.😊
#reading_group #recording #ml #ai #cybersecurity #llm #dark_future
Делимся записями всех трёх встреч.
🎥 3 октября — Коля Лыфенко и Женя Бечкало рассказали, как современные техники TLS-фингерпринтинга в комбинации с ML-алгоритмами помогают находить вредоносные серверы и скрытую активность даже в зашифрованном трафике.
Встреча будет полезна ML-инженерам и вирусным аналитикам: ребята подробно разобрали, как детектировать угрозы в сети с помощью fingerprinting-подходов и моделей машинного обучения.
🎥 17 октября — Катя Синькова разобрала статью "TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding" и рассказала, как работает спекулятивное декодирование (Speculative Decoding).
Обсудили, как динамический выбор черновых токенов помогает ускорить инференс LLM, зачем нужен баланс между размером батча и длиной чернового окна, и какие приёмы можно применять на практике.
Полезно тем, кто разворачивает собственные LLM-сервисы и ищет способы оптимизации инференса.
🎥 31 октября — Андрей Кузнецов в формате живого общения рассказал о книге Элиезера Юдковского "If Anyone Builds It, Everyone Dies."
На встрече говорили о рисках создания ASI, сравнивали развитие ИИ с ядерными исследованиями и рассуждали о том, как понять, что человечество уже создало сильный ИИ.
Смотрите записи, делитесь своим мнением и подключайтесь к новым встречам RG — впереди ещё много интересного.😊
#reading_group #recording #ml #ai #cybersecurity #llm #dark_future
🔥9❤4👍2✍1
Пока OpenAI, Anthropic и Google соревнуются в строительстве дата-центров, бронируют гигаватты энергии и скупают миллионы GPU, назревает не самая очевидная, но фундаментальная проблема. Compute растёт экспоненциально, а вот данных для обучения ИИ становится недостаточно. По оценкам EpochAI, объём вычислений удваивается приблизительно каждые шесть месяцев, тогда как число доступных в Интернете текстов растет лишь на 3% в год.
Что делать, когда данные заканчиваются, а мощности не ограничены?
На ближайшей встрече разберём одну из самых интересных статей года — «Pre-training under Infinite Compute» от Stanford AI Lab. Это исследование предлагает новый взгляд на масштабирование LLM в эпоху, когда compute стремится к бесконечности, а объем данных ограничен.
🧠 Разбор проведёт Степан Кульчицкий, ведущий специалист ML-команды.
Обсудим:
📉 Какие существуют ограничения и недостатки закона масштабирования Chinchilla.
🧪 Как регуляризация и ансамбли спасают от переобучения на одном датасете.
👨🍳 Как получать лучшее качество без добавления новых данных.
🔭 Что нас ждет в ближайшем будущем.
📅 Ждём всех в Толке в пятницу, 14 ноября, в 15:00 MSK.
🔗 Ссылка для подключения: Ктолк
#reading_group #llm #data
Что делать, когда данные заканчиваются, а мощности не ограничены?
На ближайшей встрече разберём одну из самых интересных статей года — «Pre-training under Infinite Compute» от Stanford AI Lab. Это исследование предлагает новый взгляд на масштабирование LLM в эпоху, когда compute стремится к бесконечности, а объем данных ограничен.
🧠 Разбор проведёт Степан Кульчицкий, ведущий специалист ML-команды.
Обсудим:
📉 Какие существуют ограничения и недостатки закона масштабирования Chinchilla.
🧪 Как регуляризация и ансамбли спасают от переобучения на одном датасете.
👨🍳 Как получать лучшее качество без добавления новых данных.
🔭 Что нас ждет в ближайшем будущем.
📅 Ждём всех в Толке в пятницу, 14 ноября, в 15:00 MSK.
🔗 Ссылка для подключения: Ктолк
#reading_group #llm #data
🔥9❤1👍1🤩1
Привет! А вы знаете зачем вообще нужны безопасники, как хакеры достигают целей и как от них защититься? ML-команда «Позитива» едет в Питер, чтобы разобрать настоящую атаку, и рассказать:
— как найти аномалии в потоке легитимных событий;
— почему нельзя обойтись без умного анализа трафика;
— какие модели помогают детектировать вредоносы;
— как помогают защищаться AI-агенты на самом деле.
Специальный гость митапа — Женя Никитин (CTO CelsusAI) расскажет, как масштабировать обучение в условиях ограниченных данных медтеха.
Без записи. Без повторов.
19 ноября, 18:00, Арт-галерея Zarenkov Gallery
Регистрируемся тут
— как найти аномалии в потоке легитимных событий;
— почему нельзя обойтись без умного анализа трафика;
— какие модели помогают детектировать вредоносы;
— как помогают защищаться AI-агенты на самом деле.
Специальный гость митапа — Женя Никитин (CTO CelsusAI) расскажет, как масштабировать обучение в условиях ограниченных данных медтеха.
Без записи. Без повторов.
19 ноября, 18:00, Арт-галерея Zarenkov Gallery
Регистрируемся тут
🔥18❤7😎6👍4👏1