На фотке затюненная Феррари 250 GTO. Затюненная под джейлбрейк VLLM в нашем AI CTF, который прошел на PHDays 2025. В первой части разбора на Хабре мы с авторами рассказали про 8 из 14 заданий конкурса. Погнали читать!
https://habr.com/ru/companies/pt/articles/923894/
https://habr.com/ru/companies/pt/articles/923894/
🔥16❤6👏3😁2
В большинстве современных моделей глубокого обучения для обработки разных типов данных (изображений, аудио и других) требуется специальное преобразование — декодирование. Например, изображение преобразуется в тензор RGB, аудиофайл — в спектрограмму. Это усложняет пайплайны и зачастую мешает обобщаемости моделей. Кроме того, для каждого нового типа данных или файла приходится реализовывать собственную обработку.
В эту пятницу специалист нашей ML-команды Игорь Кабанов разберёт статью Bytes Are All You Need: Transformers Operating Directly On File Bytes, авторы которой предложили архитектуру ByteFormer, работающую напрямую с байтами.
На встрече рассмотрим:
🔹Как устроен ByteFormer
🔹Какие трюки применили авторы, чтобы решить проблему длинных последовательностей байтов
🔹Как модель учится работать с разными форматами файлов и типами данных
🔹Эксперименты и метрики качества (куда же без этого 🙂)
Присоединяйтесь к нам в Толке в пятницу, 11 июля, в 15:00.
Ссылка для подключения: Ктолк
#reading_group #nlp
В эту пятницу специалист нашей ML-команды Игорь Кабанов разберёт статью Bytes Are All You Need: Transformers Operating Directly On File Bytes, авторы которой предложили архитектуру ByteFormer, работающую напрямую с байтами.
На встрече рассмотрим:
🔹Как устроен ByteFormer
🔹Какие трюки применили авторы, чтобы решить проблему длинных последовательностей байтов
🔹Как модель учится работать с разными форматами файлов и типами данных
🔹Эксперименты и метрики качества (куда же без этого 🙂)
Присоединяйтесь к нам в Толке в пятницу, 11 июля, в 15:00.
Ссылка для подключения: Ктолк
#reading_group #nlp
🔥14❤6👍5😁1
False Positive
В большинстве современных моделей глубокого обучения для обработки разных типов данных (изображений, аудио и других) требуется специальное преобразование — декодирование. Например, изображение преобразуется в тензор RGB, аудиофайл — в спектрограмму. Это усложняет…
👆Запустили регулярную рубрику с разбором научных статей.
Подключайтесь, будет познавательно)
Подключайтесь, будет познавательно)
❤6
Прочитав вторую часть разбора AI CTF вы НЕ сможете
Anonymous Quiz
22%
Попрактиковаться в эльфийском
13%
Разобраться со спуфингом face recognition
0%
Понять, как склонировать голос для обхода voice recogntion
0%
Выяснить, как спрятать флаг в вычислительном графе ViT
66%
Вычислить админа канала по ip
Хардовые таски и их разборы прошедшего AI CTF. Часть 2. Уже на Хабре https://habr.com/ru/companies/pt/articles/926892/
🔥6❤1
Media is too big
VIEW IN TELEGRAM
🎥 Выкладываем запись прошедшей в пятницу (11 июля) Reading Group, на которой Игорь Кабанов разбирал статью Bytes Are All You Need: Transformers Operating Directly On File Bytes.
📝 Что обсудили:
- Зачем авторы завели NLP подход на байтовых данных.
- Как и зачем сделана свертка для агрегации байтов в эмбеддинги.
- Какими получились эксперименты с sliding window attention и block sparse attention.
- Насколько хорош ByteFormer по сравнению с другими моделями, такими как Perceiver-IO. Спойлер:ByteFormer - топ.
- Как ByteFormer может быть полезен для задач кибербеза и что получилось у ребят из CrowdStrike.
#reading_group #recording #nlp
📝 Что обсудили:
- Зачем авторы завели NLP подход на байтовых данных.
- Как и зачем сделана свертка для агрегации байтов в эмбеддинги.
- Какими получились эксперименты с sliding window attention и block sparse attention.
- Насколько хорош ByteFormer по сравнению с другими моделями, такими как Perceiver-IO. Спойлер:
- Как ByteFormer может быть полезен для задач кибербеза и что получилось у ребят из CrowdStrike.
#reading_group #recording #nlp
🔥8❤4👍1
This media is not supported in your browser
VIEW IN TELEGRAM
С 28 апреля по 1 мая в Сан‑Франциско проходил RSAC 2025 — международная конференция по кибербезопасности. Помимо привычных ИБ‑тем, в программе было много докладов, тесно связанных с AI разной степени применимости — от фундаментальных обсуждений AI-агентов до кейсов применения LLM для триажа, фаззинга и защиты данных.
В эту пятницу специалисты ML‑команды проведут блиц‑разбор семи докладов (по 10–15 минут на каждый) с конференции, которые привлекли наше внимание.
На встрече вы узнаете:
🔹Кейсы внедрения AI в SOC от полевых команд
🔹Какие AI‑инструменты реально помогают специалистам SOC
🔹Как применить ML для классификации данных и предотвращения их утечек
🔹Как будет меняться рынок кибербезопасности с приходом Gen AI
🔹Как интегрировать LLM‑модели в фаззинг‑тестирование и триаж уязвимостей
🔹Как LLM могут помогать маппить алерты на техники и тактики матрицы MITRE
🔹Можно ли создать круглосуточную Purple-team на основе AI-агентов
Ждём всех в Толке в пятницу, 25 июля, в 15:00.
Подключайтесь: Ктолк
#reading_group #conf #rsac2025
В эту пятницу специалисты ML‑команды проведут блиц‑разбор семи докладов (по 10–15 минут на каждый) с конференции, которые привлекли наше внимание.
На встрече вы узнаете:
🔹Кейсы внедрения AI в SOC от полевых команд
🔹Какие AI‑инструменты реально помогают специалистам SOC
🔹Как применить ML для классификации данных и предотвращения их утечек
🔹Как будет меняться рынок кибербезопасности с приходом Gen AI
🔹Как интегрировать LLM‑модели в фаззинг‑тестирование и триаж уязвимостей
🔹Как LLM могут помогать маппить алерты на техники и тактики матрицы MITRE
🔹Можно ли создать круглосуточную Purple-team на основе AI-агентов
Ждём всех в Толке в пятницу, 25 июля, в 15:00.
Подключайтесь: Ктолк
#reading_group #conf #rsac2025
🔥15👍2🥰2❤1
Media is too big
VIEW IN TELEGRAM
🎥 Публикуем запись очередной Reading Group, состоявшейся 25 июля. В рамках встречи наша ML-команда разобрала несколько докладов с конференции RSAC 2025
📝 Что обсудили:
🔹как именно ИИ снижает порог входа в киберпреступность,
🔹куда стоит прикручивать LLM + RAG в SOC, чтобы было полезно,
🔹как работает гибридный подход (regex + LLM + Classic ML) в задаче классификации чувствительных данных,
🔹как стоит слушать бизнесовые доклады, чтобы извлечь максимум инсайтов,
🔹насколько эффективно фаззинг-тестирование с использование AI-агентов,
🔹как из аномалий извлекать атаки при помощи LLM,
🔹как организовывать команды AI-агентов, чтобы создать Purple Team.
P.S.: в комментариях к посту вы найдёте презентации докладов.
#reading_group #recording #conf #rsac2025
📝 Что обсудили:
🔹как именно ИИ снижает порог входа в киберпреступность,
🔹куда стоит прикручивать LLM + RAG в SOC, чтобы было полезно,
🔹как работает гибридный подход (regex + LLM + Classic ML) в задаче классификации чувствительных данных,
🔹как стоит слушать бизнесовые доклады, чтобы извлечь максимум инсайтов,
🔹насколько эффективно фаззинг-тестирование с использование AI-агентов,
🔹как из аномалий извлекать атаки при помощи LLM,
🔹как организовывать команды AI-агентов, чтобы создать Purple Team.
P.S.: в комментариях к посту вы найдёте презентации докладов.
#reading_group #recording #conf #rsac2025
🔥10❤5👏3👍1
Forwarded from Positive Technologies
На вебинаре 31 июля в 11:00 вместе с нашими экспертами Светланой Газизовой, Анастасией Истоминой и Александром Кузьминым обсудим актуальные угрозы, способы их детектирования и защиты от них.
А еще рассмотрим реальные технологии защиты, которые помогут вашему бизнесу быть устойчивее к атакам:
💪 Хотите научиться защищать LLM уже сейчас? Тогда регистрируйтесь и ставьте напоминание в календари.
#PositiveЭксперты
@Positive_Technologies
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6❤5🔥1
Внутренние угрозы (insider threats) и фрод сотрудников — одни из самых дорогих проблем для крупных компаний: доступ сотрудников к чувствительным данным часто приводит к утечкам, промышленному шпионажу и репутационным потерям. При этом классические системы выявления аномалий либо генерируют массу фолзов, либо требуют размеченных инцидентов для обучения.
Авторы из Google предлагают свой подход — систему Facade, которая умеет находить подозрительные действия без использования примеров инцидентов. Facade обучается только на легитимных событиях, сравнивая действия в корпоративной инфраструктуре с общим фоном и контекстом: роль пользователя, его окружение, историю доступов и т.д.
На предстоящей встрече PT ML Reading Group специалист ML-команды Смирнов Тимур расскажет, как авторы достигли false positive rate менее 0.01% даже спустя год после запуска обученной модели во внутреннем контуре.
На встрече разберём:
🔹 архитектуру Facade и почему она работает даже без размеченных данных,
🔹 зачем авторам понадобился contrastive learning на легитимных событиях,
🔹 как система определяет «контекст» для пользователя и различает типичные и подозрительные действия,
🔹 почему в Google система оказалась настолько устойчивой к изменяющейся структуре компании и новым типам событий,
🔹 какие ограничения есть у подхода и чем этот опыт может быть полезен для построения защиты в других компаниях.
Присоединяйтесь к нам в Толке в пятницу, 8 августа, в 15:00.
Ссылка для подключения: Ктолк
#reading_group #cybersecurity #dl
Авторы из Google предлагают свой подход — систему Facade, которая умеет находить подозрительные действия без использования примеров инцидентов. Facade обучается только на легитимных событиях, сравнивая действия в корпоративной инфраструктуре с общим фоном и контекстом: роль пользователя, его окружение, историю доступов и т.д.
На предстоящей встрече PT ML Reading Group специалист ML-команды Смирнов Тимур расскажет, как авторы достигли false positive rate менее 0.01% даже спустя год после запуска обученной модели во внутреннем контуре.
На встрече разберём:
🔹 архитектуру Facade и почему она работает даже без размеченных данных,
🔹 зачем авторам понадобился contrastive learning на легитимных событиях,
🔹 как система определяет «контекст» для пользователя и различает типичные и подозрительные действия,
🔹 почему в Google система оказалась настолько устойчивой к изменяющейся структуре компании и новым типам событий,
🔹 какие ограничения есть у подхода и чем этот опыт может быть полезен для построения защиты в других компаниях.
Присоединяйтесь к нам в Толке в пятницу, 8 августа, в 15:00.
Ссылка для подключения: Ктолк
#reading_group #cybersecurity #dl
👍5🔥4❤3✍1
Наша команда едет на OFFZONE! 🔴
ML-лид направления AppSec, Максим Митрофанов, расскажет:
• как LLM помогли размечать вредоносный код,
• какие классы угроз они находят,
• зачем нам нужен экспертный бенчмарк для этого.
К слову, бенч уже пополнился моделью GPT-oss 120B😏
#events #ml_team #offzone2025
ML-лид направления AppSec, Максим Митрофанов, расскажет:
• как LLM помогли размечать вредоносный код,
• какие классы угроз они находят,
• зачем нам нужен экспертный бенчмарк для этого.
К слову, бенч уже пополнился моделью GPT-oss 120B😏
#events #ml_team #offzone2025
Please open Telegram to view this post
VIEW IN TELEGRAM
Telegram
notes.ml
LLM Benchmark in CyberSec
Вчера вышел релиз открытой модели от OpenAI, а сегодня мы уже протестировали 120B версию на внутреннем бенчмарке одной из задач ИБ - обнаружение вредоносного кода.
Хочется отметить, что модель стала лидером в категории тяжелых…
Вчера вышел релиз открытой модели от OpenAI, а сегодня мы уже протестировали 120B версию на внутреннем бенчмарке одной из задач ИБ - обнаружение вредоносного кода.
Хочется отметить, что модель стала лидером в категории тяжелых…
❤6🔥6👍3
Media is too big
VIEW IN TELEGRAM
На прошедшей Reading Group Смирнов Тимур разобрал систему Facade от Google, призванную обнаруживать внутренние нарушения безопасности.
Публикуем запись встречи и выводы по результатам обсуждения📝:
🔹нашли в статье нестыковку: “в проде с 2018”, но обучение “за пару часов на H100” (GPU 2022+);
🔹в условиях Google кодирование ресурсов через нормированную частоту обращения к ним выглядит оправдано;
🔹переобучение раз в год — сомнительно, но ок;
🔹авторы представили собственную pairwise loss function, устойчивую к шуму и дисбалансу в данных;
🔹к сожалению, Facade плохо выявляет фрод внутри прямых обязанностей сотрудника;
🔹интересная идея сгенерировать синтетические данные об атаках путём перемешивания вектора контекста у пользователей.
P.S.: Авторы статьи выступали со своей работой на BlackHat USA 2025. Как только появятся записи докладов мы проведём RG с разбором конфы, где ещё раз обсудим эту статью)
#reading_group #recording #cybersecurity #dl
Публикуем запись встречи и выводы по результатам обсуждения📝:
🔹нашли в статье нестыковку: “в проде с 2018”, но обучение “за пару часов на H100” (GPU 2022+);
🔹в условиях Google кодирование ресурсов через нормированную частоту обращения к ним выглядит оправдано;
🔹переобучение раз в год — сомнительно, но ок;
🔹авторы представили собственную pairwise loss function, устойчивую к шуму и дисбалансу в данных;
🔹к сожалению, Facade плохо выявляет фрод внутри прямых обязанностей сотрудника;
🔹интересная идея сгенерировать синтетические данные об атаках путём перемешивания вектора контекста у пользователей.
P.S.: Авторы статьи выступали со своей работой на BlackHat USA 2025. Как только появятся записи докладов мы проведём RG с разбором конфы, где ещё раз обсудим эту статью)
#reading_group #recording #cybersecurity #dl
🔥12❤4👏4👍1🤩1
🤖 Как развернуть свою LLM и не пройтись по полю из граблей
Self-hosted LLM — звучит пафосно. Но на практике это не только про независимость от внешних LLM-провайдеров и приватность данных, а ещё и про бесконечные вопросы: какую модель выбрать, сколько GPU купить, как деплоить, что мониторить и т.д.
🎙Уже завтра, 19 августа в 14:00, на вебинаре Алексей Парамонов и Алексей Пехтерев из команды PositiveLLM поделятся как мы в PT поднимали self-hosted LLM.
Темы вебинара:
🔹когда реально нужно запариваться с self-hosted, а когда хватит и внешнего API,
🔹как выбрать open-source модель из всего «зоопарка» LLM,
🔹фреймворки для развёртывания LLM: vLLM/SGLang/TensorRT-LLM,
🔹RAG vs fine-tuning — закон Парето в мире LLM,
🔹как выбрать подходящее железо,
🔹мониторинг наше всё. Считаем пользу от LLM для бизнеса.
Регистрируйтесь на вебинар, если не хотите учиться исключительно на собственных ошибках.
#webinar #ml_team #llm
Self-hosted LLM — звучит пафосно. Но на практике это не только про независимость от внешних LLM-провайдеров и приватность данных, а ещё и про бесконечные вопросы: какую модель выбрать, сколько GPU купить, как деплоить, что мониторить и т.д.
🎙Уже завтра, 19 августа в 14:00, на вебинаре Алексей Парамонов и Алексей Пехтерев из команды PositiveLLM поделятся как мы в PT поднимали self-hosted LLM.
Темы вебинара:
🔹когда реально нужно запариваться с self-hosted, а когда хватит и внешнего API,
🔹как выбрать open-source модель из всего «зоопарка» LLM,
🔹фреймворки для развёртывания LLM: vLLM/SGLang/TensorRT-LLM,
🔹RAG vs fine-tuning — закон Парето в мире LLM,
🔹как выбрать подходящее железо,
🔹мониторинг наше всё. Считаем пользу от LLM для бизнеса.
Регистрируйтесь на вебинар, если не хотите учиться исключительно на собственных ошибках.
#webinar #ml_team #llm
❤7👍5👏3
Промптинг LLM и RAG уже не вытягивают, а на полноценный fine-tune не хватает железа?
Хочется стабильного качества без недель перебора гиперпараметров?
💡 Тогда вам стоит попробовать SingLoRA — новый подход к PEFT (Parameter-Efficient Fine-Tuning), который почти в два раза эффективнее, чем классический метод LoRA.
Уже в эту пятницу наш коллега Александр Мамылов расскажет, почему SingLoRA имеет все шансы стать новым стандартом дообучения LLM на своих данных, и чем он выгодно отличается от существующих решений.
На встрече обсудим:
🔹 преимущества SingLoRA по сравнению с классическими двухматричными подходами LoRA и его вариантов DoRA/qLoRA,
🔹 за счёт чего достигается стабильность в создании адаптера к LLM,
🔹 разберём, насколько SingLoRA устойчив к изменению learning rate и других гиперпараметров,
🔹 оценим эффективность нового подхода на примере fine-tune LLM и Diffusion Model.
Ждём всех на очередной встрече PT ML Reading Group в пятницу, 22 августа, в 15:00.
Подключайтесь: Ктолк
#reading_group #nlp #llm
Хочется стабильного качества без недель перебора гиперпараметров?
Уже в эту пятницу наш коллега Александр Мамылов расскажет, почему SingLoRA имеет все шансы стать новым стандартом дообучения LLM на своих данных, и чем он выгодно отличается от существующих решений.
На встрече обсудим:
🔹 преимущества SingLoRA по сравнению с классическими двухматричными подходами LoRA и его вариантов DoRA/qLoRA,
🔹 за счёт чего достигается стабильность в создании адаптера к LLM,
🔹 разберём, насколько SingLoRA устойчив к изменению learning rate и других гиперпараметров,
🔹 оценим эффективность нового подхода на примере fine-tune LLM и Diffusion Model.
Ждём всех на очередной встрече PT ML Reading Group в пятницу, 22 августа, в 15:00.
Подключайтесь: Ктолк
#reading_group #nlp #llm
Please open Telegram to view this post
VIEW IN TELEGRAM
❤8👍5🔥5
Media is too big
VIEW IN TELEGRAM
На последней встрече PT ML Reading Group Александр Мамылов представил анализ статьи SingLoRA — новый метод создания адаптеров для LLM.
🎥Делимся записью и основными выводами:
• вспомнили, какие на данный момент существуют вариации LoRA и их ключевые особенности,
• разобрались в «математике» нового метода и в том, как авторы решили проблему квадратной матрицы,
• фреймворк PEFT пока не поддерживает SingLoRA, поэтому чтобы поиграться с ним на своих задачах можно использовать код из этого репозитория,
• протестировали SingLoRA на одной из наших задач: метрики изменились в пределах погрешности,
• использование одной матрицы заметно уменьшает размер адаптера и ускоряет его обучение, однако это не является главным ботлнеком при работе LLM в продакшене.
#reading_group #recording #nlp #llm
🎥Делимся записью и основными выводами:
• вспомнили, какие на данный момент существуют вариации LoRA и их ключевые особенности,
• разобрались в «математике» нового метода и в том, как авторы решили проблему квадратной матрицы,
• фреймворк PEFT пока не поддерживает SingLoRA, поэтому чтобы поиграться с ним на своих задачах можно использовать код из этого репозитория,
• протестировали SingLoRA на одной из наших задач: метрики изменились в пределах погрешности,
• использование одной матрицы заметно уменьшает размер адаптера и ускоряет его обучение, однако это не является главным ботлнеком при работе LLM в продакшене.
#reading_group #recording #nlp #llm
🔥3👏3❤1🤓1
Всем привет!
Знаем-знаем, в это время мы обычно публикуем анонс следующей Reading Group, но в этот раз мы выложили его на youtube!
*Шутка*
Мы очень хотели бы поделиться впечатлениями о прошедшей конференции OFFZONE, поэтому посвятим этому следующую Reading Group и перенесем встречу на 12 сентября, чтобы дождаться записей докладов, освежить их в памяти и рассказать вам день AI.Zone за 60 минут🏃♂️
А пока, хотели бы лучше понять, насколько наша аудитория знакома с этой конференцией:
Знаем-знаем, в это время мы обычно публикуем анонс следующей Reading Group, но в этот раз мы выложили его на youtube!
Мы очень хотели бы поделиться впечатлениями о прошедшей конференции OFFZONE, поэтому посвятим этому следующую Reading Group и перенесем встречу на 12 сентября, чтобы дождаться записей докладов, освежить их в памяти и рассказать вам день AI.Zone за 60 минут
А пока, хотели бы лучше понять, насколько наша аудитория знакома с этой конференцией:
Please open Telegram to view this post
VIEW IN TELEGRAM
😁2