🍁Октябрь в PT ML Reading Group выдался насыщенным — от сетевой безопасности до философских обсуждений о развитии ИИ.
Делимся записями всех трёх встреч.
🎥 3 октября — Коля Лыфенко и Женя Бечкало рассказали, как современные техники TLS-фингерпринтинга в комбинации с ML-алгоритмами помогают находить вредоносные серверы и скрытую активность даже в зашифрованном трафике.
Встреча будет полезна ML-инженерам и вирусным аналитикам: ребята подробно разобрали, как детектировать угрозы в сети с помощью fingerprinting-подходов и моделей машинного обучения.
🎥 17 октября — Катя Синькова разобрала статью "TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding" и рассказала, как работает спекулятивное декодирование (Speculative Decoding).
Обсудили, как динамический выбор черновых токенов помогает ускорить инференс LLM, зачем нужен баланс между размером батча и длиной чернового окна, и какие приёмы можно применять на практике.
Полезно тем, кто разворачивает собственные LLM-сервисы и ищет способы оптимизации инференса.
🎥 31 октября — Андрей Кузнецов в формате живого общения рассказал о книге Элиезера Юдковского "If Anyone Builds It, Everyone Dies."
На встрече говорили о рисках создания ASI, сравнивали развитие ИИ с ядерными исследованиями и рассуждали о том, как понять, что человечество уже создало сильный ИИ.
Смотрите записи, делитесь своим мнением и подключайтесь к новым встречам RG — впереди ещё много интересного.😊
#reading_group #recording #ml #ai #cybersecurity #llm #dark_future
Делимся записями всех трёх встреч.
🎥 3 октября — Коля Лыфенко и Женя Бечкало рассказали, как современные техники TLS-фингерпринтинга в комбинации с ML-алгоритмами помогают находить вредоносные серверы и скрытую активность даже в зашифрованном трафике.
Встреча будет полезна ML-инженерам и вирусным аналитикам: ребята подробно разобрали, как детектировать угрозы в сети с помощью fingerprinting-подходов и моделей машинного обучения.
🎥 17 октября — Катя Синькова разобрала статью "TETRIS: Optimal Draft Token Selection for Batch Speculative Decoding" и рассказала, как работает спекулятивное декодирование (Speculative Decoding).
Обсудили, как динамический выбор черновых токенов помогает ускорить инференс LLM, зачем нужен баланс между размером батча и длиной чернового окна, и какие приёмы можно применять на практике.
Полезно тем, кто разворачивает собственные LLM-сервисы и ищет способы оптимизации инференса.
🎥 31 октября — Андрей Кузнецов в формате живого общения рассказал о книге Элиезера Юдковского "If Anyone Builds It, Everyone Dies."
На встрече говорили о рисках создания ASI, сравнивали развитие ИИ с ядерными исследованиями и рассуждали о том, как понять, что человечество уже создало сильный ИИ.
Смотрите записи, делитесь своим мнением и подключайтесь к новым встречам RG — впереди ещё много интересного.😊
#reading_group #recording #ml #ai #cybersecurity #llm #dark_future
🔥9❤4👍2✍1
Пока OpenAI, Anthropic и Google соревнуются в строительстве дата-центров, бронируют гигаватты энергии и скупают миллионы GPU, назревает не самая очевидная, но фундаментальная проблема. Compute растёт экспоненциально, а вот данных для обучения ИИ становится недостаточно. По оценкам EpochAI, объём вычислений удваивается приблизительно каждые шесть месяцев, тогда как число доступных в Интернете текстов растет лишь на 3% в год.
Что делать, когда данные заканчиваются, а мощности не ограничены?
На ближайшей встрече разберём одну из самых интересных статей года — «Pre-training under Infinite Compute» от Stanford AI Lab. Это исследование предлагает новый взгляд на масштабирование LLM в эпоху, когда compute стремится к бесконечности, а объем данных ограничен.
🧠 Разбор проведёт Степан Кульчицкий, ведущий специалист ML-команды.
Обсудим:
📉 Какие существуют ограничения и недостатки закона масштабирования Chinchilla.
🧪 Как регуляризация и ансамбли спасают от переобучения на одном датасете.
👨🍳 Как получать лучшее качество без добавления новых данных.
🔭 Что нас ждет в ближайшем будущем.
📅 Ждём всех в Толке в пятницу, 14 ноября, в 15:00 MSK.
🔗 Ссылка для подключения: Ктолк
#reading_group #llm #data
Что делать, когда данные заканчиваются, а мощности не ограничены?
На ближайшей встрече разберём одну из самых интересных статей года — «Pre-training under Infinite Compute» от Stanford AI Lab. Это исследование предлагает новый взгляд на масштабирование LLM в эпоху, когда compute стремится к бесконечности, а объем данных ограничен.
🧠 Разбор проведёт Степан Кульчицкий, ведущий специалист ML-команды.
Обсудим:
📉 Какие существуют ограничения и недостатки закона масштабирования Chinchilla.
🧪 Как регуляризация и ансамбли спасают от переобучения на одном датасете.
👨🍳 Как получать лучшее качество без добавления новых данных.
🔭 Что нас ждет в ближайшем будущем.
📅 Ждём всех в Толке в пятницу, 14 ноября, в 15:00 MSK.
🔗 Ссылка для подключения: Ктолк
#reading_group #llm #data
🔥9❤1👍1🤩1
Привет! А вы знаете зачем вообще нужны безопасники, как хакеры достигают целей и как от них защититься? ML-команда «Позитива» едет в Питер, чтобы разобрать настоящую атаку, и рассказать:
— как найти аномалии в потоке легитимных событий;
— почему нельзя обойтись без умного анализа трафика;
— какие модели помогают детектировать вредоносы;
— как помогают защищаться AI-агенты на самом деле.
Специальный гость митапа — Женя Никитин (CTO CelsusAI) расскажет, как масштабировать обучение в условиях ограниченных данных медтеха.
Без записи. Без повторов.
19 ноября, 18:00, Арт-галерея Zarenkov Gallery
Регистрируемся тут
— как найти аномалии в потоке легитимных событий;
— почему нельзя обойтись без умного анализа трафика;
— какие модели помогают детектировать вредоносы;
— как помогают защищаться AI-агенты на самом деле.
Специальный гость митапа — Женя Никитин (CTO CelsusAI) расскажет, как масштабировать обучение в условиях ограниченных данных медтеха.
Без записи. Без повторов.
19 ноября, 18:00, Арт-галерея Zarenkov Gallery
Регистрируемся тут
🔥18❤7😎6👍4👏1
False Positive
Пока OpenAI, Anthropic и Google соревнуются в строительстве дата-центров, бронируют гигаватты энергии и скупают миллионы GPU, назревает не самая очевидная, но фундаментальная проблема. Compute растёт экспоненциально, а вот данных для обучения ИИ становится…
Media is too big
VIEW IN TELEGRAM
Всем привет!
🎬Выкладываем запись с прошедшей RG с разбором статьи "Pretraining under infinite compute"
#reading_group #llm #data #recording
🎬Выкладываем запись с прошедшей RG с разбором статьи "Pretraining under infinite compute"
#reading_group #llm #data #recording
👍7👏3❤2🔥1
Вы когда-нибудь задумывались, почему ChatGPT уверенно врет вам про диссертацию Адама Стоквилда (Adam Stockwild), которую тот никогда не писал, или почему 0.11 для LLM больше чем 0.9?
Почему языковые модели, датасет для обучения которых едва ли меньше знаний всего человечества, проводят фактчекинг на уровне раздолбаев с задней парты, которые любой ценой пытаются сдать школьный тест?
Всё дело в том, как обучают и оценивают большие языковые модели.
В эту пятницу разберём новую статью от OpenAI «Why Language Models Hallucinate?». Узнаем, как вознаграждение (reward) при обучении превращает ИИ в фабрику фейков, и как это можно исправить.
На встрече Андрей Яковлев, специалист отдела экспертизы MaxPatrol HCC, расскажет:
🛑 почему даже идеальные данные не спасают от галлюцинаций;
🛑 как бинарные метрики вознаграждают ложь;
🛑 что нужно изменить в бенчмарках, чтобы AI был честнее.
📅 Ждём всех в Толке в пятницу, 28 ноября, в 15:00 MSK.
🔗 Ссылка для подключения: Ктолк
P.S.: Адама Стоквилда не существует 🙂
#reading_group #llm
Почему языковые модели, датасет для обучения которых едва ли меньше знаний всего человечества, проводят фактчекинг на уровне раздолбаев с задней парты, которые любой ценой пытаются сдать школьный тест?
Всё дело в том, как обучают и оценивают большие языковые модели.
В эту пятницу разберём новую статью от OpenAI «Why Language Models Hallucinate?». Узнаем, как вознаграждение (reward) при обучении превращает ИИ в фабрику фейков, и как это можно исправить.
На встрече Андрей Яковлев, специалист отдела экспертизы MaxPatrol HCC, расскажет:
📅 Ждём всех в Толке в пятницу, 28 ноября, в 15:00 MSK.
🔗 Ссылка для подключения: Ктолк
#reading_group #llm
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥7❤5👍4
False Positive
Вы когда-нибудь задумывались, почему ChatGPT уверенно врет вам про диссертацию Адама Стоквилда (Adam Stockwild), которую тот никогда не писал, или почему 0.11 для LLM больше чем 0.9? Почему языковые модели, датасет для обучения которых едва ли меньше знаний…
Мы начинаем обсуждать почему LLM галлюционируют и как с этим бороться☺️
🔥4
Media is too big
VIEW IN TELEGRAM
28 ноября Андрей Яковлев разобрал статью от OpenAI «Why Language Models Hallucinate?»
🎬Выкладываем запись встречи и делимся выводами:
🛑 галлюцинации возникают из-за статистического обучения (модель учится «угадывать» токены);
🛑 post-training не избавляют модель от галлюцинаций;
🛑 бинарные метрики бенчмарков поощряют угадывание, из-за чего модели оптимизированы быть "хорошо сдающими экзамены", а не честными;
🛑 решение — использование "честных" методов оценки и вознаграждения моделей.
#reading_group #recording #llm
🎬Выкладываем запись встречи и делимся выводами:
#reading_group #recording #llm
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥11❤6👍1
Под конец года многие компании порадовали нас новыми интересными релизами своих LLM. Только за последний месяц мы получили Gemini 3 Pro, Kimi-k2-thinking, GPT 5.1 и 5.2, Claude Opus 4.5, Mistral 3 и кучу других SOTA-моделей.
Что общего у этих релизов? Ни один из них не сопровождался какими-либо подробностями о внутреннем устройстве моделей. Но первого декабря небезызвестная компания DeepSeek выложила в открытый доступ LLM DeepSeek-V3.2 и DeepSeek-V3.2-Speciale, которые уделывают на бенчмарках почти все closed и open source модели.
На предстоящей встрече PT ML Reading Group специалист ML-команды Алексей Журин разберёт вышедший вместе с релизом технический отчёт «DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models».
На встрече выясним:
🔵 что общего у DeepSeek-V3.2 с предыдущими релизами;
🔵 какие проблемы, по мнению компании DeepSeek, мешают создавать качественные open-source-модели;
🔵 как работает DeepSeek Sparse Attention;
🔵 зачем для обучения LLM потребовалось генерировать синтетические данные;
🔵 чего стоит ждать от следующих релизов DeepSeek.
📅Встречаемся в пятницу, 12 декабря, в 15:00 МСК
🔗Подключайтесь: Ктолк
#reading_group #llm
Что общего у этих релизов? Ни один из них не сопровождался какими-либо подробностями о внутреннем устройстве моделей. Но первого декабря небезызвестная компания DeepSeek выложила в открытый доступ LLM DeepSeek-V3.2 и DeepSeek-V3.2-Speciale, которые уделывают на бенчмарках почти все closed и open source модели.
На предстоящей встрече PT ML Reading Group специалист ML-команды Алексей Журин разберёт вышедший вместе с релизом технический отчёт «DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models».
На встрече выясним:
📅Встречаемся в пятницу, 12 декабря, в 15:00 МСК
🔗Подключайтесь: Ктолк
#reading_group #llm
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥8❤5👍2
CyberPal 2.0: Семейство SLM, которые смогли
В октябре IBM зарелизили интересную работу https://arxiv.org/abs/2510.14113 по специализированным малым моделям (SLM) для кибербеза — CyberPal 2.0 (от 4B до 20B параметров).
Самое важное здесь — не сама архитектура (в базе лежат Qwen-3 и gpt-oss), а инжиниринг данных и пайплайн подготовки датасета SecKnowledge 2.0. Они показали, как за счет качественного синтетического CoT (Chain-of-Thought) и граундинга (grounding) можно выжать из SLM перформанс уровня больших языковых моделей.
Новый датасет: SecKnowledge 2.0
Главная проблема security-LLM — галлюцинации и поверхностные знания. IBM решили это не просто файнтюнингом на текстах, а сложным пайплайном обогащения данных.
Expert-in-the-loop Schema: Эксперты задают жесткие форматы вывода (Reasoning Traces) для конкретных тасков (всего 105 типов задач). Это не просто "ответь на вопрос", а пошаговые инструкции: "выдели IoC → сопоставь с TTPs → предложи митигацию".
RAG-driven Synthetic Generation: Чтобы синтетика не галлюцинировала, они встроили поиск в процесс генерации датасета (а не только на инференсе):
- Query Building: первая LLM генерит поисковые запросы на основе сырой инструкции.
- Filtering: вторая LLM отбирает только те запросы, которые реально закроют пробелы в знаниях.
- Retrieval: забирают инфу из веба или векторных баз.
- Re-writing: backbone-модель (gpt-oss-120b) переписывает ответ, используя найденные доказательства и соблюдая экспертную схему.
Итог: Датасет, где каждый шаг рассуждения (CoT) подкреплен ретривом, а не весами модели-учителя.
Дополнительная деталь: в итоговых данных для обучения, помимо датасета выше, 25% итоговой доли составили короткие ответы из оригинального SecKnowledge, не требующие длинных рассуждений.
Training Recipe: Base vs Post-Trained
Главный инсайт: Файнтюн базовой модели (Base) работает лучше, чем дообучение уже инструктивной (Instruct/Chat) версии.
- При старте с Qwen3-8B-Base прирост на бенчмарках составил ~15%.
- При старте с Qwen3-8B-Instruct прирост всего ~5%.
- На сложных задачах (Root Cause Mapping) разница колоссальная: +22.7% (Base) против +1.85% (Instruct).
Авторы говорят, что инструктивные модели уже "зажаты" своим RLHF/SFT, и переучивать их под специфичный доменный формат сложнее, чем накатывать знания на "чистый лист" (base).
Бенчмарки
CTI-RCM (Root Cause Mapping): Задача — связать CVE, баг-репорты и тикеты с CWE. Здесь нужно глубокое понимание, а не просто поиск по ключевым словам.
- CyberPal-20B занял 1-е место, обогнав GPT-4o, o1, o3-mini и Sec-Gemini v1.
- Даже мелкая CyberPal-4B заняла второе место.
CTI-MCQ: На тестах по Threat Intel (атакующие группы, тактики) модели дышат в спину Sec-Gemini.
Квантование
Для on-prem деплоя (что критично для SOC, где нельзя лить логи в облако):
- 8-bit: падение качества < 1%.
- 4-bit: падение 2-4%, но модель все еще значительно лучше базовых и конкурентов. 20B в 4 битах помещается на одну недорогую карту для быстрого инференса.
Выводы
1) Статья подтверждает тренд: Data Curation > Model Scale.
2) Если вы делаете своего security-агента:
- Не берите просто сырые репорты. Прогоните их через пайплайн генерации вопросов-ответов с валидацией через поиск.
- Дообучайте Base-версии моделей.
- Структурируйте CoT. Модель должна учиться "думать" по шаблону аналитика, а не просто генерировать текст.
#llm #cybersecurity
В октябре IBM зарелизили интересную работу https://arxiv.org/abs/2510.14113 по специализированным малым моделям (SLM) для кибербеза — CyberPal 2.0 (от 4B до 20B параметров).
Самое важное здесь — не сама архитектура (в базе лежат Qwen-3 и gpt-oss), а инжиниринг данных и пайплайн подготовки датасета SecKnowledge 2.0. Они показали, как за счет качественного синтетического CoT (Chain-of-Thought) и граундинга (grounding) можно выжать из SLM перформанс уровня больших языковых моделей.
Новый датасет: SecKnowledge 2.0
Главная проблема security-LLM — галлюцинации и поверхностные знания. IBM решили это не просто файнтюнингом на текстах, а сложным пайплайном обогащения данных.
Expert-in-the-loop Schema: Эксперты задают жесткие форматы вывода (Reasoning Traces) для конкретных тасков (всего 105 типов задач). Это не просто "ответь на вопрос", а пошаговые инструкции: "выдели IoC → сопоставь с TTPs → предложи митигацию".
RAG-driven Synthetic Generation: Чтобы синтетика не галлюцинировала, они встроили поиск в процесс генерации датасета (а не только на инференсе):
- Query Building: первая LLM генерит поисковые запросы на основе сырой инструкции.
- Filtering: вторая LLM отбирает только те запросы, которые реально закроют пробелы в знаниях.
- Retrieval: забирают инфу из веба или векторных баз.
- Re-writing: backbone-модель (gpt-oss-120b) переписывает ответ, используя найденные доказательства и соблюдая экспертную схему.
Итог: Датасет, где каждый шаг рассуждения (CoT) подкреплен ретривом, а не весами модели-учителя.
Дополнительная деталь: в итоговых данных для обучения, помимо датасета выше, 25% итоговой доли составили короткие ответы из оригинального SecKnowledge, не требующие длинных рассуждений.
Training Recipe: Base vs Post-Trained
Главный инсайт: Файнтюн базовой модели (Base) работает лучше, чем дообучение уже инструктивной (Instruct/Chat) версии.
- При старте с Qwen3-8B-Base прирост на бенчмарках составил ~15%.
- При старте с Qwen3-8B-Instruct прирост всего ~5%.
- На сложных задачах (Root Cause Mapping) разница колоссальная: +22.7% (Base) против +1.85% (Instruct).
Авторы говорят, что инструктивные модели уже "зажаты" своим RLHF/SFT, и переучивать их под специфичный доменный формат сложнее, чем накатывать знания на "чистый лист" (base).
Бенчмарки
CTI-RCM (Root Cause Mapping): Задача — связать CVE, баг-репорты и тикеты с CWE. Здесь нужно глубокое понимание, а не просто поиск по ключевым словам.
- CyberPal-20B занял 1-е место, обогнав GPT-4o, o1, o3-mini и Sec-Gemini v1.
- Даже мелкая CyberPal-4B заняла второе место.
CTI-MCQ: На тестах по Threat Intel (атакующие группы, тактики) модели дышат в спину Sec-Gemini.
Квантование
Для on-prem деплоя (что критично для SOC, где нельзя лить логи в облако):
- 8-bit: падение качества < 1%.
- 4-bit: падение 2-4%, но модель все еще значительно лучше базовых и конкурентов. 20B в 4 битах помещается на одну недорогую карту для быстрого инференса.
Выводы
1) Статья подтверждает тренд: Data Curation > Model Scale.
2) Если вы делаете своего security-агента:
- Не берите просто сырые репорты. Прогоните их через пайплайн генерации вопросов-ответов с валидацией через поиск.
- Дообучайте Base-версии моделей.
- Структурируйте CoT. Модель должна учиться "думать" по шаблону аналитика, а не просто генерировать текст.
#llm #cybersecurity
🔥7🤝2👍1
Media is too big
VIEW IN TELEGRAM
12 декабря Алексей Журин разобрал технический отчёт от DeepSeek: «DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models».
🎬Выкладываем запись встречи и делимся выводами:
🛑 post-train через дистилляцию знаний от экспертов — топ;
🛑 DeepSeek Sparse Attention (DSA) кратно снижает расходы на инференс моделей с большим контекстным окном;
🛑 для тюнинга под агентские задачи авторы разработали пайплайн генерации агентских задач;
🛑 в API модели появился reasoning tool-calling;
🛑 DeepSeek v3.2 — самая экономичная SOTA модель в open-source.
#reading_group #recording #llm
🎬Выкладываем запись встречи и делимся выводами:
#reading_group #recording #llm
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥9👍3❤1