False Positive
1.06K subscribers
68 photos
23 videos
70 links
PT ML Team
Download Telegram
Channel created
Channel photo updated
Приветствуем!👋
Вы присоединились к False Positive — каналу, где все посты пишет GPT6, люди в это время дебажат на проде, а false positive'ов нет😏

Кто мы такие?
Мы — ML-команда Positive Technologies. Мы любим, когда пайплайны рабочие, данные чистые, а GPU всегда в избытке. Крутим LLM'ки, обучаем деревья, и по ночам спорим, что лучше: transformer'ы или классика на XGBoost'е

Зачем мы тут?
Чтобы делиться тем, что греет наши дата-сатанистские души:
🧠 Разборы свежих (и не очень) научных статей по ML / AI / InfoSec
📢 Анонсы мероприятий, где можно послушать про ML в ИБ или поучаствовать в наших конкурсах
🛠 ML-кейсы — как мы делаем цифровой мир чуточку безопаснее с помощью ML
😼 Мемы? Может быть.

Так что если вы тоже кайфуете от ML на стыке с ИБ — welcome aboard 😎

Больше узнать про ML в PT можно тут👉 ссылка

#знакомимся
🔥187👍6
На фотке затюненная Феррари 250 GTO. Затюненная под джейлбрейк VLLM в нашем AI CTF, который прошел на PHDays 2025. В первой части разбора на Хабре мы с авторами рассказали про 8 из 14 заданий конкурса. Погнали читать!

https://habr.com/ru/companies/pt/articles/923894/
🔥166👏3😁2
В большинстве современных моделей глубокого обучения для обработки разных типов данных (изображений, аудио и других) требуется специальное преобразование — декодирование. Например, изображение преобразуется в тензор RGB, аудиофайл — в спектрограмму. Это усложняет пайплайны и зачастую мешает обобщаемости моделей. Кроме того, для каждого нового типа данных или файла приходится реализовывать собственную обработку.

В эту пятницу специалист нашей ML-команды Игорь Кабанов разберёт статью Bytes Are All You Need: Transformers Operating Directly On File Bytes, авторы которой предложили архитектуру ByteFormer, работающую напрямую с байтами.

На встрече рассмотрим:
🔹Как устроен ByteFormer
🔹Какие трюки применили авторы, чтобы решить проблему длинных последовательностей байтов
🔹Как модель учится работать с разными форматами файлов и типами данных
🔹Эксперименты и метрики качества (куда же без этого 🙂)

Присоединяйтесь к нам в Толке в пятницу, 11 июля, в 15:00.
Ссылка для подключения: Ктолк

#reading_group #nlp
🔥146👍5😁1
Хардовые таски и их разборы прошедшего AI CTF. Часть 2. Уже на Хабре https://habr.com/ru/companies/pt/articles/926892/
🔥61
Media is too big
VIEW IN TELEGRAM
🎥 Выкладываем запись прошедшей в пятницу (11 июля) Reading Group, на которой Игорь Кабанов разбирал статью Bytes Are All You Need: Transformers Operating Directly On File Bytes.

📝 Что обсудили:

- Зачем авторы завели NLP подход на байтовых данных.

- Как и зачем сделана свертка для агрегации байтов в эмбеддинги.

- Какими получились эксперименты с sliding window attention и block sparse attention.

- Насколько хорош ByteFormer по сравнению с другими моделями, такими как Perceiver-IO. Спойлер: ByteFormer - топ.

- Как ByteFormer может быть полезен для задач кибербеза и что получилось у ребят из CrowdStrike.

#reading_group #recording #nlp
🔥84👍1
This media is not supported in your browser
VIEW IN TELEGRAM
С 28 апреля по 1 мая в Сан‑Франциско проходил RSAC 2025 — международная конференция по кибербезопасности. Помимо привычных ИБ‑тем, в программе было много докладов, тесно связанных с AI разной степени применимости — от фундаментальных обсуждений AI-агентов до кейсов применения LLM для триажа, фаззинга и защиты данных.

В эту пятницу специалисты ML‑команды проведут блиц‑разбор семи докладов (по 10–15 минут на каждый) с конференции, которые привлекли наше внимание.

На встрече вы узнаете:
🔹Кейсы внедрения AI в SOC от полевых команд
🔹Какие AI‑инструменты реально помогают специалистам SOC
🔹Как применить ML для классификации данных и предотвращения их утечек
🔹Как будет меняться рынок кибербезопасности с приходом Gen AI
🔹Как интегрировать LLM‑модели в фаззинг‑тестирование и триаж уязвимостей
🔹Как LLM могут помогать маппить алерты на техники и тактики матрицы MITRE
🔹Можно ли создать круглосуточную Purple-team на основе AI-агентов

Ждём всех в Толке в пятницу, 25 июля, в 15:00.
Подключайтесь: Ктолк

#reading_group #conf #rsac2025
🔥15👍2🥰21
Media is too big
VIEW IN TELEGRAM
🎥 Публикуем запись очередной Reading Group, состоявшейся 25 июля. В рамках встречи наша ML-команда разобрала несколько докладов с конференции RSAC 2025

📝 Что обсудили:
🔹как именно ИИ снижает порог входа в киберпреступность,
🔹куда стоит прикручивать LLM + RAG в SOC, чтобы было полезно,
🔹как работает гибридный подход (regex + LLM + Classic ML) в задаче классификации чувствительных данных,
🔹как стоит слушать бизнесовые доклады, чтобы извлечь максимум инсайтов,
🔹насколько эффективно фаззинг-тестирование с использование AI-агентов,
🔹как из аномалий извлекать атаки при помощи LLM,
🔹как организовывать команды AI-агентов, чтобы создать Purple Team.

P.S.: в комментариях к посту вы найдёте презентации докладов.

#reading_group #recording #conf #rsac2025
🔥105👏3👍1
Forwarded from Positive Technologies
🤖 Чем больше распространяются LLM, тем интереснее они злоумышленникам. Как защитить большие языковые модели от взлома?

На вебинаре 31 июля в 11:00 вместе с нашими экспертами Светланой Газизовой, Анастасией Истоминой и Александром Кузьминым обсудим актуальные угрозы, способы их детектирования и защиты от них.

👿 Например, такие как специально сформированные промпты или незаметно измененные входные данные, которые помогают обойти защитные механизмы нейросетей и получить на выходе неверный или вредоносный вывод.

А еще рассмотрим реальные технологии защиты, которые помогут вашему бизнесу быть устойчивее к атакам:

🔴продвинутую валидацию запросов и ответов;
🔴интерпретируемость и прозрачность LLM;
🔴детектирование аномалий.

💪 Хотите научиться защищать LLM уже сейчас? Тогда регистрируйтесь и ставьте напоминание в календари.

#PositiveЭксперты
@Positive_Technologies
Please open Telegram to view this post
VIEW IN TELEGRAM
👍65🔥1
Внутренние угрозы (insider threats) и фрод сотрудников — одни из самых дорогих проблем для крупных компаний: доступ сотрудников к чувствительным данным часто приводит к утечкам, промышленному шпионажу и репутационным потерям. При этом классические системы выявления аномалий либо генерируют массу фолзов, либо требуют размеченных инцидентов для обучения.

Авторы из Google предлагают свой подход — систему Facade, которая умеет находить подозрительные действия без использования примеров инцидентов. Facade обучается только на легитимных событиях, сравнивая действия в корпоративной инфраструктуре с общим фоном и контекстом: роль пользователя, его окружение, историю доступов и т.д.

На предстоящей встрече PT ML Reading Group специалист ML-команды Смирнов Тимур расскажет, как авторы достигли false positive rate менее 0.01% даже спустя год после запуска обученной модели во внутреннем контуре.

На встрече разберём:
🔹 архитектуру Facade и почему она работает даже без размеченных данных,
🔹 зачем авторам понадобился contrastive learning на легитимных событиях,
🔹 как система определяет «контекст» для пользователя и различает типичные и подозрительные действия,
🔹 почему в Google система оказалась настолько устойчивой к изменяющейся структуре компании и новым типам событий,
🔹 какие ограничения есть у подхода и чем этот опыт может быть полезен для построения защиты в других компаниях.

Присоединяйтесь к нам в Толке в пятницу, 8 августа, в 15:00.
Ссылка для подключения: Ктолк

#reading_group #cybersecurity #dl
👍5🔥431
😁134
Наша команда едет на OFFZONE! 🔴

ML-лид направления AppSec, Максим Митрофанов, расскажет:
• как LLM помогли размечать вредоносный код,
• какие классы угроз они находят,
• зачем нам нужен экспертный бенчмарк для этого.

К слову, бенч уже пополнился моделью GPT-oss 120B😏

#events #ml_team #offzone2025
Please open Telegram to view this post
VIEW IN TELEGRAM
6🔥6👍3
Media is too big
VIEW IN TELEGRAM
На прошедшей Reading Group Смирнов Тимур разобрал систему Facade от Google, призванную обнаруживать внутренние нарушения безопасности.

Публикуем запись встречи и выводы по результатам обсуждения📝:
🔹нашли в статье нестыковку: “в проде с 2018”, но обучение “за пару часов на H100” (GPU 2022+);
🔹в условиях Google кодирование ресурсов через нормированную частоту обращения к ним выглядит оправдано;
🔹переобучение раз в год — сомнительно, но ок;
🔹авторы представили собственную pairwise loss function, устойчивую к шуму и дисбалансу в данных;
🔹к сожалению, Facade плохо выявляет фрод внутри прямых обязанностей сотрудника;
🔹интересная идея сгенерировать синтетические данные об атаках путём перемешивания вектора контекста у пользователей.

P.S.: Авторы статьи выступали со своей работой на BlackHat USA 2025. Как только появятся записи докладов мы проведём RG с разбором конфы, где ещё раз обсудим эту статью)

#reading_group #recording #cybersecurity #dl
🔥124👏4👍1🤩1