Наша команда едет на OFFZONE! 🔴
ML-лид направления AppSec, Максим Митрофанов, расскажет:
• как LLM помогли размечать вредоносный код,
• какие классы угроз они находят,
• зачем нам нужен экспертный бенчмарк для этого.
К слову, бенч уже пополнился моделью GPT-oss 120B😏
#events #ml_team #offzone2025
ML-лид направления AppSec, Максим Митрофанов, расскажет:
• как LLM помогли размечать вредоносный код,
• какие классы угроз они находят,
• зачем нам нужен экспертный бенчмарк для этого.
К слову, бенч уже пополнился моделью GPT-oss 120B😏
#events #ml_team #offzone2025
Please open Telegram to view this post
VIEW IN TELEGRAM
Telegram
notes.ml
LLM Benchmark in CyberSec
Вчера вышел релиз открытой модели от OpenAI, а сегодня мы уже протестировали 120B версию на внутреннем бенчмарке одной из задач ИБ - обнаружение вредоносного кода.
Хочется отметить, что модель стала лидером в категории тяжелых…
Вчера вышел релиз открытой модели от OpenAI, а сегодня мы уже протестировали 120B версию на внутреннем бенчмарке одной из задач ИБ - обнаружение вредоносного кода.
Хочется отметить, что модель стала лидером в категории тяжелых…
❤6🔥6👍3
Media is too big
VIEW IN TELEGRAM
На прошедшей Reading Group Смирнов Тимур разобрал систему Facade от Google, призванную обнаруживать внутренние нарушения безопасности.
Публикуем запись встречи и выводы по результатам обсуждения📝:
🔹нашли в статье нестыковку: “в проде с 2018”, но обучение “за пару часов на H100” (GPU 2022+);
🔹в условиях Google кодирование ресурсов через нормированную частоту обращения к ним выглядит оправдано;
🔹переобучение раз в год — сомнительно, но ок;
🔹авторы представили собственную pairwise loss function, устойчивую к шуму и дисбалансу в данных;
🔹к сожалению, Facade плохо выявляет фрод внутри прямых обязанностей сотрудника;
🔹интересная идея сгенерировать синтетические данные об атаках путём перемешивания вектора контекста у пользователей.
P.S.: Авторы статьи выступали со своей работой на BlackHat USA 2025. Как только появятся записи докладов мы проведём RG с разбором конфы, где ещё раз обсудим эту статью)
#reading_group #recording #cybersecurity #dl
Публикуем запись встречи и выводы по результатам обсуждения📝:
🔹нашли в статье нестыковку: “в проде с 2018”, но обучение “за пару часов на H100” (GPU 2022+);
🔹в условиях Google кодирование ресурсов через нормированную частоту обращения к ним выглядит оправдано;
🔹переобучение раз в год — сомнительно, но ок;
🔹авторы представили собственную pairwise loss function, устойчивую к шуму и дисбалансу в данных;
🔹к сожалению, Facade плохо выявляет фрод внутри прямых обязанностей сотрудника;
🔹интересная идея сгенерировать синтетические данные об атаках путём перемешивания вектора контекста у пользователей.
P.S.: Авторы статьи выступали со своей работой на BlackHat USA 2025. Как только появятся записи докладов мы проведём RG с разбором конфы, где ещё раз обсудим эту статью)
#reading_group #recording #cybersecurity #dl
🔥12❤4👏4👍1🤩1
🤖 Как развернуть свою LLM и не пройтись по полю из граблей
Self-hosted LLM — звучит пафосно. Но на практике это не только про независимость от внешних LLM-провайдеров и приватность данных, а ещё и про бесконечные вопросы: какую модель выбрать, сколько GPU купить, как деплоить, что мониторить и т.д.
🎙Уже завтра, 19 августа в 14:00, на вебинаре Алексей Парамонов и Алексей Пехтерев из команды PositiveLLM поделятся как мы в PT поднимали self-hosted LLM.
Темы вебинара:
🔹когда реально нужно запариваться с self-hosted, а когда хватит и внешнего API,
🔹как выбрать open-source модель из всего «зоопарка» LLM,
🔹фреймворки для развёртывания LLM: vLLM/SGLang/TensorRT-LLM,
🔹RAG vs fine-tuning — закон Парето в мире LLM,
🔹как выбрать подходящее железо,
🔹мониторинг наше всё. Считаем пользу от LLM для бизнеса.
Регистрируйтесь на вебинар, если не хотите учиться исключительно на собственных ошибках.
#webinar #ml_team #llm
Self-hosted LLM — звучит пафосно. Но на практике это не только про независимость от внешних LLM-провайдеров и приватность данных, а ещё и про бесконечные вопросы: какую модель выбрать, сколько GPU купить, как деплоить, что мониторить и т.д.
🎙Уже завтра, 19 августа в 14:00, на вебинаре Алексей Парамонов и Алексей Пехтерев из команды PositiveLLM поделятся как мы в PT поднимали self-hosted LLM.
Темы вебинара:
🔹когда реально нужно запариваться с self-hosted, а когда хватит и внешнего API,
🔹как выбрать open-source модель из всего «зоопарка» LLM,
🔹фреймворки для развёртывания LLM: vLLM/SGLang/TensorRT-LLM,
🔹RAG vs fine-tuning — закон Парето в мире LLM,
🔹как выбрать подходящее железо,
🔹мониторинг наше всё. Считаем пользу от LLM для бизнеса.
Регистрируйтесь на вебинар, если не хотите учиться исключительно на собственных ошибках.
#webinar #ml_team #llm
❤7👍5👏3
Промптинг LLM и RAG уже не вытягивают, а на полноценный fine-tune не хватает железа?
Хочется стабильного качества без недель перебора гиперпараметров?
💡 Тогда вам стоит попробовать SingLoRA — новый подход к PEFT (Parameter-Efficient Fine-Tuning), который почти в два раза эффективнее, чем классический метод LoRA.
Уже в эту пятницу наш коллега Александр Мамылов расскажет, почему SingLoRA имеет все шансы стать новым стандартом дообучения LLM на своих данных, и чем он выгодно отличается от существующих решений.
На встрече обсудим:
🔹 преимущества SingLoRA по сравнению с классическими двухматричными подходами LoRA и его вариантов DoRA/qLoRA,
🔹 за счёт чего достигается стабильность в создании адаптера к LLM,
🔹 разберём, насколько SingLoRA устойчив к изменению learning rate и других гиперпараметров,
🔹 оценим эффективность нового подхода на примере fine-tune LLM и Diffusion Model.
Ждём всех на очередной встрече PT ML Reading Group в пятницу, 22 августа, в 15:00.
Подключайтесь: Ктолк
#reading_group #nlp #llm
Хочется стабильного качества без недель перебора гиперпараметров?
Уже в эту пятницу наш коллега Александр Мамылов расскажет, почему SingLoRA имеет все шансы стать новым стандартом дообучения LLM на своих данных, и чем он выгодно отличается от существующих решений.
На встрече обсудим:
🔹 преимущества SingLoRA по сравнению с классическими двухматричными подходами LoRA и его вариантов DoRA/qLoRA,
🔹 за счёт чего достигается стабильность в создании адаптера к LLM,
🔹 разберём, насколько SingLoRA устойчив к изменению learning rate и других гиперпараметров,
🔹 оценим эффективность нового подхода на примере fine-tune LLM и Diffusion Model.
Ждём всех на очередной встрече PT ML Reading Group в пятницу, 22 августа, в 15:00.
Подключайтесь: Ктолк
#reading_group #nlp #llm
Please open Telegram to view this post
VIEW IN TELEGRAM
❤8👍5🔥5
Media is too big
VIEW IN TELEGRAM
На последней встрече PT ML Reading Group Александр Мамылов представил анализ статьи SingLoRA — новый метод создания адаптеров для LLM.
🎥Делимся записью и основными выводами:
• вспомнили, какие на данный момент существуют вариации LoRA и их ключевые особенности,
• разобрались в «математике» нового метода и в том, как авторы решили проблему квадратной матрицы,
• фреймворк PEFT пока не поддерживает SingLoRA, поэтому чтобы поиграться с ним на своих задачах можно использовать код из этого репозитория,
• протестировали SingLoRA на одной из наших задач: метрики изменились в пределах погрешности,
• использование одной матрицы заметно уменьшает размер адаптера и ускоряет его обучение, однако это не является главным ботлнеком при работе LLM в продакшене.
#reading_group #recording #nlp #llm
🎥Делимся записью и основными выводами:
• вспомнили, какие на данный момент существуют вариации LoRA и их ключевые особенности,
• разобрались в «математике» нового метода и в том, как авторы решили проблему квадратной матрицы,
• фреймворк PEFT пока не поддерживает SingLoRA, поэтому чтобы поиграться с ним на своих задачах можно использовать код из этого репозитория,
• протестировали SingLoRA на одной из наших задач: метрики изменились в пределах погрешности,
• использование одной матрицы заметно уменьшает размер адаптера и ускоряет его обучение, однако это не является главным ботлнеком при работе LLM в продакшене.
#reading_group #recording #nlp #llm
🔥3👏3❤1🤓1
Всем привет!
Знаем-знаем, в это время мы обычно публикуем анонс следующей Reading Group, но в этот раз мы выложили его на youtube!
*Шутка*
Мы очень хотели бы поделиться впечатлениями о прошедшей конференции OFFZONE, поэтому посвятим этому следующую Reading Group и перенесем встречу на 12 сентября, чтобы дождаться записей докладов, освежить их в памяти и рассказать вам день AI.Zone за 60 минут🏃♂️
А пока, хотели бы лучше понять, насколько наша аудитория знакома с этой конференцией:
Знаем-знаем, в это время мы обычно публикуем анонс следующей Reading Group, но в этот раз мы выложили его на youtube!
Мы очень хотели бы поделиться впечатлениями о прошедшей конференции OFFZONE, поэтому посвятим этому следующую Reading Group и перенесем встречу на 12 сентября, чтобы дождаться записей докладов, освежить их в памяти и рассказать вам день AI.Zone за 60 минут
А пока, хотели бы лучше понять, насколько наша аудитория знакома с этой конференцией:
Please open Telegram to view this post
VIEW IN TELEGRAM
😁2
Чтобы вы не скучали в пятницу без Reading Group — предлагаем вашему вниманию подборку интересных исследований от ребят из ML-команды.😊
🔵 AI-ассистент для генерации экспертного контента в SIEM (Александр Мамылов) — статья о том, как наш AI-асcистент автоматизирует подготовку правил нормализации и экспертного контента для SIEM, используя для этого кластеризацию логов и fine-tuning LLM.
🔵 Эволюция защиты в PT Data Security: от регулярных выражений к ML (Вадим Безбородов, Максим Митрофанов) — сравниваются классические методы обнаружения чувствительных данных (регулярные выражения) и современные ML-модели (NER, CASSED), которые показали существенно более высокую точность.
🔵 Не k-means единым: кластеризуем некластеризуемое (Тимур Касимов) — статья про применение алгоритмов типа MinHash и HDBSCAN вместо K-means для кластеризации логов, коммандлайнов и событий в SIEM и BAD.
#ml_team #reasearch
#ml_team #reasearch
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6🔥6👍4
Разбор докладов с AI-трека OFFZONE 2025. Часть 1
21–22 августа в Москве прошла техническая конференция по кибербезопасности OFFZONE 2025.
От нашей команды на конференции выступил Максим Митрофанов с докладом про создание своего бенчмарка для LLM. Кроме того, мы послушали другие выступления по теме AI в ИБ, на которых нас ждало много полезных инсайтов.
В эту пятницу специалисты нашей ML-команды Максим Митрофанов и Вадим Безбородов проведут разбор докладов AI-трека конференции, обсудят ключевые идеи выступлений и поделятся своими впечатлениями.
На встрече вы узнаете:
🛑 как применяют LLM в системах автоматизации и обнаружения угроз,
🛑 как строить AI-агентов для пентеста и реверса и какие бенчмарки при этом нужны,
🛑 как использовать ML для анализа трафика и триажа уязвимостей,
🛑 какие существуют подходы к защите моделей и данных в проде.
Разберем удачные кейсы и спорные решения, а также сформулируем выводы, которые можно будет применить в работе.
Ждем всех в Толке в пятницу, 12 сентября, в 15:00.
Ссылка для подключения: Ктолк.
#reading_group #conf #offzone2025 #ml_team
21–22 августа в Москве прошла техническая конференция по кибербезопасности OFFZONE 2025.
От нашей команды на конференции выступил Максим Митрофанов с докладом про создание своего бенчмарка для LLM. Кроме того, мы послушали другие выступления по теме AI в ИБ, на которых нас ждало много полезных инсайтов.
В эту пятницу специалисты нашей ML-команды Максим Митрофанов и Вадим Безбородов проведут разбор докладов AI-трека конференции, обсудят ключевые идеи выступлений и поделятся своими впечатлениями.
На встрече вы узнаете:
Разберем удачные кейсы и спорные решения, а также сформулируем выводы, которые можно будет применить в работе.
Ждем всех в Толке в пятницу, 12 сентября, в 15:00.
Ссылка для подключения: Ктолк.
#reading_group #conf #offzone2025 #ml_team
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥9🤩3⚡2👍1
False Positive
Разбор докладов с AI-трека OFFZONE 2025. Часть 1 21–22 августа в Москве прошла техническая конференция по кибербезопасности OFFZONE 2025. От нашей команды на конференции выступил Максим Митрофанов с докладом про создание своего бенчмарка для LLM. Кроме…
Мы начинаем)
UPD. Доступы поправили
UPD. Доступы поправили
❤2🔥2👍1
Разбор докладов с AI-трека OFFZONE 2025. Часть 2
На прошлой встрече PT ML Reading Group специалист ML-команды Максим Митрофанов поделился разбором части докладов с конференции.
Мы обсудили:
🛑 роль AI в работе SOC;
🛑 применение LLM для интерпретации бинарных файлов;
🛑 использование ML в NDR-системах;
🛑 применение графовых, трансформерных и генеративных моделей в борьбе с вредоносными файлами.
А уже в эту пятницу мы продолжим разбирать материалы AI-трека.
Вадим Безбородов расскажет про:
🛑 подходы к созданию AI-агентов для пентеста и реверса, а также о бенчмарках для их оценки;
🛑 применение LLM в системах автоматизации и обнаружения угроз;
🛑 методы защиты моделей и данных в продакшене.
📅 Ждём всех в Толке в пятницу, 19 сентября, 15:00.
🔗 Ссылка для подключения: Ктолк
#reading_group #conf #offzone2025
На прошлой встрече PT ML Reading Group специалист ML-команды Максим Митрофанов поделился разбором части докладов с конференции.
Мы обсудили:
А уже в эту пятницу мы продолжим разбирать материалы AI-трека.
Вадим Безбородов расскажет про:
📅 Ждём всех в Толке в пятницу, 19 сентября, 15:00.
🔗 Ссылка для подключения: Ктолк
#reading_group #conf #offzone2025
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍4🔥4🤓2
False Positive
Разбор докладов с AI-трека OFFZONE 2025. Часть 2 На прошлой встрече PT ML Reading Group специалист ML-команды Максим Митрофанов поделился разбором части докладов с конференции. Мы обсудили: 🛑 роль AI в работе SOC; 🛑 применение LLM для интерпретации бинарных…
Завершающая часть разбора уже в эфире)
🎥Выкладываем записи разборов AI-трека OFFZONE 2025
На последних двух встречах PT ML Reading Group Максим Митрофанов и Вадим Безбородов поделились своим мнением по каждому AI докладу с конференции и составили персональный рейтинг выступлений, на который можно опираться, если не знаете с чего начать просмотр докладов:)
Р.S. Рейтинг прикладываем первым комментарием к этому посту!
#reading_group #recording #conf #offzone2025
На последних двух встречах PT ML Reading Group Максим Митрофанов и Вадим Безбородов поделились своим мнением по каждому AI докладу с конференции и составили персональный рейтинг выступлений, на который можно опираться, если не знаете с чего начать просмотр докладов:)
Р.S. Рейтинг прикладываем первым комментарием к этому посту!
#reading_group #recording #conf #offzone2025
❤🔥8🔥7❤4👍1
На очередной встрече PT ML Reading Group поговорим о том, как современные техники TLS-фингерпринтинга помогают находить вредоносные серверы и скрытую активность в зашифрованных каналах, а также о том, какую роль в этом играет машинное обучение.
Обсудим:
🛑 TLS-фингерпринтинг — основные понятия, виды отпечатков (JA3, JA4, JA4+) и их отличия;
🛑 причины, по которым JA4 лучше JA3;
🛑 усиление TLS-фингерпринтинга с помощью машинного обучения.
Найти ответы на эти и другие вопросы нам помогут разборы статей:
🟡 «Fingerprinting the Shadows: Unmasking Malicious Servers with Machine Learning‑Powered TLS Analysis»,
🟡 «Experience Report: Using JA4+ Fingerprints for Malware Detection in Encrypted Traffic».
Встречу проведут:
🛑 Коля Лыфенко — Dev Lead ML-команды
🛑 Женя Бечкало — ESC AVLab Network Lead
📅Как обычно, встречаемся в пятницу!
🔗Подключайтесь: Ктолк, 3 октября, в 15:00
#reading_group #cybersecurity #classic_ml
Обсудим:
Найти ответы на эти и другие вопросы нам помогут разборы статей:
Встречу проведут:
📅Как обычно, встречаемся в пятницу!
🔗Подключайтесь: Ктолк, 3 октября, в 15:00
#reading_group #cybersecurity #classic_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6🔥5😁2
Читаем вместе. ИИ в AppSec: могут ли LLM работать с уязвимым кодом
[хабр-обзор] [папира]
Всем привет!
Решил расширить RG еще и на тексты Хабр, сделал разбор статьи LLMs Cannot Reliably Identify and Reason About Security Vulnerabilities (Yet?): A Comprehensive Evaluation, Framework, and Benchmarks. В качестве затравки — несколько тезисов из разбора:
➡️ Результаты бенчмарка — «фотография во времени», быстро устаревающая не только по списку оцененных моделей, но и по попаданию данных в cut-off более современных LLM. Бенчмаркам на безопасность кода критически не хватает подходов по автоматическому обновлению на подобие SWE-rebench.
➡️ Очень зашли гипотезы про согласованность рассуждений и ответов, проверка на «пропатченном» коде и эксперименты с аугментацией.
➡️ Так, например, даже сильные модели ломаются на стресс-аугментациях, таких как изменения в уязвимом коде названий методов/переменных или добавление неиспользуемого кода.
➡️ Наглядная секция про техники промптинга. Практический вывод: роль-ориентированные инструкции и пошаговый CoT заметно улучшают качество (особенно в zero-shot). Но при наличии few-shot инструкций импакт от CoT снижается. Это может помочь сэкономить контекста в некоторых задачах.
➡️ Ограничение длины контекста в реальных кейсах играет критическую роль, поскольку код, приводящий к уязвимости, может находиться не только в разных частях файла, но и в разных частях проекта. Тут стоит отойти от академических статей и посмотреть на инженерные подходы к отбору контекста разработчиками Cursor, Claude-code и прочих копайлотов для разработки.
__________________
Макс Митрофанов, ML-лид направления AppSec🟥
[хабр-обзор] [папира]
Всем привет!
Решил расширить RG еще и на тексты Хабр, сделал разбор статьи LLMs Cannot Reliably Identify and Reason About Security Vulnerabilities (Yet?): A Comprehensive Evaluation, Framework, and Benchmarks. В качестве затравки — несколько тезисов из разбора:
__________________
Макс Митрофанов, ML-лид направления AppSec
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥11❤7👍4👏2
Что мы поняли о роли AI/ML в защите данных за последний год?
Сегодня, на Positive Security Day состоится долгожданный коммерческий релиз PT Data Security — продукта для защиты корпоративных данных, независимо от их типа и места хранения.
Наша команда разрабатывала одну из ключевых фич - ML-модуль классификации данных. Прошли путь с нуля — от идеи и конкурентного анализа до интеграции в продукт и оптимизации инференса.
Поэтому делимся нашим взглядом на роль AI/ML в классификации данных:
⚡️ 1. Метаданные ≠ данные
Мы провели конкурентный анализ и поняли, что большинство решений на рынке анализируют только метаданные — названия файлов/колонок/таблиц, расширения и описания к объектам.
Но в реальных компаниях данные часто выглядит так: “новый документ финал.docx” или "column123"
Так что “аналитика по названиям” быстро разбивается о реальность корпоративного хаоса.
⚡️ 2. Реальность рушит простые гипотезы
Мы собрали валидационную выборку, имитирующую корпоративные данные, и прогнали по ней несколько вендоров и open-source решений.
Результат: полнота <= 40% у regex-пайплайнов.
Регулярки просто не видят такие сущности, как имена, организации, телефоны, даты и многие другие — особенно в естественном тексте.
⚡️ 3. Значит, идем глубже — в контент
С первых итераций мы сделали ставку на анализ содержимого.
Для прототипов использовали Microsoft Presidio — удобный фреймворк, который позволил без интеграции в продукт опробовать наши ML-модели на сценарии защиты данных (но производительность фреймворка не позволяет использовать его в production).
Мы попробовали несколько ML подходов, остановившись на NER архитектуре. С учетом специфики РФ рынка, держали фокус на работе как с русским, так и с английским языком.
Подробности — в нашей статье на Хабре.
⚡️ 4. Идеальный баланс: ML + регулярки
Наш ML классифицирует только те сущности, для которых нет четких правил.
А регулярки, прошедшие жесткий отбор, дополняют модель.
Так мы собрали гибридную систему, которая сочетает точность правил и гибкость ML. Продукт позволяет объединять результаты работы обоих подходов в композитные правила для гибкой настройки.
⚡️ 5. А LLM?
Многие компании рассматривают применение LLM для решения той же задачи. Но когда у клиента миллионы файлов и тысячи таблиц, большие модели оказываются слишком прожорливыми и медлительными.
LLM имеют потенциал в качестве копайлотов для ИБ-специалиста, но не станут ядром системы, которая должна работать на масштабе и в реальном времени.
---
Поздравляем команду продукта в релизом и уходим готовить новые фичи, которые позволят еще надежнее защитить компании от утечек!
____________________________________
Вадим Безбородов, ML-инженер AppSec
Максим Митрофанов, ML-лид AppSec
Сегодня, на Positive Security Day состоится долгожданный коммерческий релиз PT Data Security — продукта для защиты корпоративных данных, независимо от их типа и места хранения.
Наша команда разрабатывала одну из ключевых фич - ML-модуль классификации данных. Прошли путь с нуля — от идеи и конкурентного анализа до интеграции в продукт и оптимизации инференса.
Поэтому делимся нашим взглядом на роль AI/ML в классификации данных:
Мы провели конкурентный анализ и поняли, что большинство решений на рынке анализируют только метаданные — названия файлов/колонок/таблиц, расширения и описания к объектам.
Но в реальных компаниях данные часто выглядит так: “новый документ финал.docx” или "column123"
Так что “аналитика по названиям” быстро разбивается о реальность корпоративного хаоса.
Мы собрали валидационную выборку, имитирующую корпоративные данные, и прогнали по ней несколько вендоров и open-source решений.
Результат: полнота <= 40% у regex-пайплайнов.
Регулярки просто не видят такие сущности, как имена, организации, телефоны, даты и многие другие — особенно в естественном тексте.
С первых итераций мы сделали ставку на анализ содержимого.
Для прототипов использовали Microsoft Presidio — удобный фреймворк, который позволил без интеграции в продукт опробовать наши ML-модели на сценарии защиты данных (но производительность фреймворка не позволяет использовать его в production).
Мы попробовали несколько ML подходов, остановившись на NER архитектуре. С учетом специфики РФ рынка, держали фокус на работе как с русским, так и с английским языком.
Подробности — в нашей статье на Хабре.
Наш ML классифицирует только те сущности, для которых нет четких правил.
А регулярки, прошедшие жесткий отбор, дополняют модель.
Так мы собрали гибридную систему, которая сочетает точность правил и гибкость ML. Продукт позволяет объединять результаты работы обоих подходов в композитные правила для гибкой настройки.
Многие компании рассматривают применение LLM для решения той же задачи. Но когда у клиента миллионы файлов и тысячи таблиц, большие модели оказываются слишком прожорливыми и медлительными.
LLM имеют потенциал в качестве копайлотов для ИБ-специалиста, но не станут ядром системы, которая должна работать на масштабе и в реальном времени.
---
Поздравляем команду продукта в релизом и уходим готовить новые фичи, которые позволят еще надежнее защитить компании от утечек!
____________________________________
Вадим Безбородов, ML-инженер AppSec
Максим Митрофанов, ML-лид AppSec
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥9👍2
Один из способов ускорить инференс LLM — это использовать спекулятивное декодирование (Speculative Decoding), чтобы оптимизировать генерацию ответа. Маленькая модель генерирует черновые токены, а большая — их валидирует. Причём чем длиннее принятый фрагмент, тем больше прирост к скорости работы.
В то же время, узкое место классического SD — фиксированный размер чернового окна. При разношёрстных запросах часть проверок проходит впустую, потому что где‑то черновики совпадают почти полностью, а где‑то ломаются уже на первом токене.
В эту пятницу специалист ML-команды Екатерина Синькова разберёт статью «TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding». Ее авторы предлагают способ динамически выбирать число генерируемых черновых токенов на основе батча запросов, чтобы максимизировать число принятых токенов.
Катя расскажет:
🛑 как работает спекулятивное декодирование,
🛑 как авторы «TETRIS» обошли проблему фиксированного чернового окна,
🛑 как размер батча и запросы в нём влияют на количество генерируемых черновых токенов,
🛑 как это влияет на инференс LLM на практике.
📅 Ждём всех в Толке в пятницу, 17 октября, в 15:00 (GMT+3).
🔗 Ссылка для подключения: Ктолк
#reading_group #llm #deployment
В то же время, узкое место классического SD — фиксированный размер чернового окна. При разношёрстных запросах часть проверок проходит впустую, потому что где‑то черновики совпадают почти полностью, а где‑то ломаются уже на первом токене.
В эту пятницу специалист ML-команды Екатерина Синькова разберёт статью «TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding». Ее авторы предлагают способ динамически выбирать число генерируемых черновых токенов на основе батча запросов, чтобы максимизировать число принятых токенов.
Катя расскажет:
📅 Ждём всех в Толке в пятницу, 17 октября, в 15:00 (GMT+3).
🔗 Ссылка для подключения: Ктолк
#reading_group #llm #deployment
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6👍3🔥2✍1