Недавно наткнулся на курс Georgia Tech по LLM за 2026 год. Уже по одной программе его стоит сохранить.
По сути, это готовый список ключевых работ по современным большим языковым моделям, который уже отфильтровали за вас.
Начинается всё с базы — предобучение, эмбеддинги, MoE. Но дальше быстро переходят к Agent Harness, GRPO, DAPO, Self-Play RL, Test-Time Scaling и длинному контексту.
В следующих разделах есть Linear Transformer, Diffusion LM, безопасность моделей и механистическая интерпретируемость.
Причём в программу уже включены совсем свежие темы и работы вроде DeepSeek-V2, DeepSeek-V3.2, OpenHands и Absolute Zero.
Хорошо видно, куда сейчас смещается исследовательский фокус в LLM. Обучение более крупных моделей всё ещё важно, но огромная часть программы уже посвящена масштабированию инференса, работе агентов с инструментами и памятью, а также тому, как модели продолжают улучшаться через RL и взаимодействие со средой.
Если постоянно встречаете GRPO, Self-Play или Agent Harness, но не знаете, в каком порядке всё это изучать, можно просто идти по этой программе и читать работы одну за другой.
По сути, это готовый список ключевых работ по современным большим языковым моделям, который уже отфильтровали за вас.
Начинается всё с базы — предобучение, эмбеддинги, MoE. Но дальше быстро переходят к Agent Harness, GRPO, DAPO, Self-Play RL, Test-Time Scaling и длинному контексту.
В следующих разделах есть Linear Transformer, Diffusion LM, безопасность моделей и механистическая интерпретируемость.
Причём в программу уже включены совсем свежие темы и работы вроде DeepSeek-V2, DeepSeek-V3.2, OpenHands и Absolute Zero.
Хорошо видно, куда сейчас смещается исследовательский фокус в LLM. Обучение более крупных моделей всё ещё важно, но огромная часть программы уже посвящена масштабированию инференса, работе агентов с инструментами и памятью, а также тому, как модели продолжают улучшаться через RL и взаимодействие со средой.
Если постоянно встречаете GRPO, Self-Play или Agent Harness, но не знаете, в каком порядке всё это изучать, можно просто идти по этой программе и читать работы одну за другой.
«Руководство учёного и инженера по цифровой обработке сигналов» Стивена У. Смита.
Отличный справочник, когда работаешь с чем-либо в области цифровой обработки сигналов.
Автоматическое распознавание речи и диаризация — одни из основных применений в конвейере речевого инференса в автомобильном рабочем процессе.
https://dspguide.com/pdfbook.htm
Отличный справочник, когда работаешь с чем-либо в области цифровой обработки сигналов.
Автоматическое распознавание речи и диаризация — одни из основных применений в конвейере речевого инференса в автомобильном рабочем процессе.
https://dspguide.com/pdfbook.htm
Вырастили целое дерево из агентов 🌳
Мы в Авито разработали единую платформу для процессов. Самые лучшие и популярные становятся агентами. В итоге каждый сотрудник может создать свой процесс или воспользоваться готовым. Классно? Не то слово! Поэтому мы написали статью, как создавали это решение.
О чём узнаете, если прочитаете:
🔸 как устроена архитектура платформы,
🔸 как процесс становится агентом,
🔸 как измерять качество агентов.
Читать статью🚀
Мы в Авито разработали единую платформу для процессов. Самые лучшие и популярные становятся агентами. В итоге каждый сотрудник может создать свой процесс или воспользоваться готовым. Классно? Не то слово! Поэтому мы написали статью, как создавали это решение.
О чём узнаете, если прочитаете:
Читать статью
Please open Telegram to view this post
VIEW IN TELEGRAM
«Geometric Deep Learning» — очень интересный материал по математическим основам современного глубокого обучения.
В нём с единой точки зрения разбираются такие архитектуры, как CNN, GNN и трансформеры, с большим акцентом на симметрии, инвариантность, группы, графы и многообразия.
Математики в тексте довольно много, но при этом авторы подробно объясняют идеи словами. Многие формальные концепции сопровождаются интуитивными объяснениями, поэтому следить за теорией заметно проще.
Особенно полезный материал, если хочется понять математические идеи, лежащие в основе современных ИИ-моделей, а не только то, как эти модели реализуются.
https://arxiv.org/pdf/2104.13478
В нём с единой точки зрения разбираются такие архитектуры, как CNN, GNN и трансформеры, с большим акцентом на симметрии, инвариантность, группы, графы и многообразия.
Математики в тексте довольно много, но при этом авторы подробно объясняют идеи словами. Многие формальные концепции сопровождаются интуитивными объяснениями, поэтому следить за теорией заметно проще.
Особенно полезный материал, если хочется понять математические идеи, лежащие в основе современных ИИ-моделей, а не только то, как эти модели реализуются.
https://arxiv.org/pdf/2104.13478
Это чертовски масштабно: впервые персонализированное лечение рака на основе мРНК, созданное с помощью ИИ, успешно прошло испытание 3-й фазы.
Moderna и Merck секвенируют опухоль каждого пациента и сравнивают её со здоровой ДНК. Затем ИИ помогает определить, какие мутации опухоли с наибольшей вероятностью способны вызвать иммунный ответ.
На основе этих мишеней Moderna создаёт индивидуальное мРНК-лечение, кодирующее до 34 неоантигенов.
В более раннем испытании 2-й фазы за пациентами с хирургически удалённой меланомой высокого риска наблюдали в течение пяти лет:
— 68,8% оставались без рака по сравнению с 49,1% среди тех, кто получал только Keytruda
— риск рецидива или смерти был ниже на 49%
— риск отдалённых метастазов или смерти был ниже на 59%
Теперь успешно завершилось и гораздо более крупное испытание 3-й фазы с участием 1 137 пациентов.
Просто невероятно. Дарио был прав: рак будет излечен всего через несколько лет!
Moderna и Merck секвенируют опухоль каждого пациента и сравнивают её со здоровой ДНК. Затем ИИ помогает определить, какие мутации опухоли с наибольшей вероятностью способны вызвать иммунный ответ.
На основе этих мишеней Moderna создаёт индивидуальное мРНК-лечение, кодирующее до 34 неоантигенов.
В более раннем испытании 2-й фазы за пациентами с хирургически удалённой меланомой высокого риска наблюдали в течение пяти лет:
— 68,8% оставались без рака по сравнению с 49,1% среди тех, кто получал только Keytruda
— риск рецидива или смерти был ниже на 49%
— риск отдалённых метастазов или смерти был ниже на 59%
Теперь успешно завершилось и гораздо более крупное испытание 3-й фазы с участием 1 137 пациентов.
Просто невероятно. Дарио был прав: рак будет излечен всего через несколько лет!
«Суть линейной алгебры» от 3Blue1Brown
https://youtube.com/playlist?list=PLZHQObOWTQDPD3MizzM2xVFitgF8hE_ab
https://youtube.com/playlist?list=PLZHQObOWTQDPD3MizzM2xVFitgF8hE_ab
1
This media is not supported in your browser
VIEW IN TELEGRAM
Qwen3.8-27B теперь работает со скоростью 70 токенов/с прямо на ноутбуке.
Вышел DFlash 2 — новое поколение спекулятивного декодирования на основе блочной диффузии.
DFlash 2 разгоняет Qwen3.8-27B до 70 токенов/с на MacBook Pro с M5 Max. Ускорение авторегрессионного декодирования достигает 4,6 раза, а итоговый вывод остаётся полностью идентичным исходной модели — буквально ни одного отличающегося токена.⚡️
Уже доступны новые черновые модели для Qwen3.8-27B с нативной поддержкой SGLang, vLLM, llama.cpp и oMLX.
Суть подхода: https://inco.ai/blog/dflash2/
Вышел DFlash 2 — новое поколение спекулятивного декодирования на основе блочной диффузии.
DFlash 2 разгоняет Qwen3.8-27B до 70 токенов/с на MacBook Pro с M5 Max. Ускорение авторегрессионного декодирования достигает 4,6 раза, а итоговый вывод остаётся полностью идентичным исходной модели — буквально ни одного отличающегося токена.
Уже доступны новые черновые модели для Qwen3.8-27B с нативной поддержкой SGLang, vLLM, llama.cpp и oMLX.
Суть подхода: https://inco.ai/blog/dflash2/
Please open Telegram to view this post
VIEW IN TELEGRAM
У больших языковых моделей есть серьёзное слепое пятно: у них нет врождённого понимания физического мира.
Особенно хорошо это видно, когда мы спускаемся на квантовый уровень. Сложность квантовой динамики и стоимость управления ею растут экспоненциально.
Операторы Фурье становятся важным инструментом для изучения квантовой динамики молекул и ускорения обратного проектирования протоколов управления.
FNO предсказывает динамику в 10^7 раз быстрее, чем CUDA-Q от Nvidia с ускорением на GPU.
Стохастический планировщик импульсов и измерений на основе FNO показывает почти вдвое более высокий процент успешных результатов, чем подход на основе обучения с подкреплением.
https://arxiv.org/abs/2608.03702
Особенно хорошо это видно, когда мы спускаемся на квантовый уровень. Сложность квантовой динамики и стоимость управления ею растут экспоненциально.
Операторы Фурье становятся важным инструментом для изучения квантовой динамики молекул и ускорения обратного проектирования протоколов управления.
FNO предсказывает динамику в 10^7 раз быстрее, чем CUDA-Q от Nvidia с ускорением на GPU.
Стохастический планировщик импульсов и измерений на основе FNO показывает почти вдвое более высокий процент успешных результатов, чем подход на основе обучения с подкреплением.
https://arxiv.org/abs/2608.03702
KDD 2026
На прошлой неделе на острове Чеджу прошла KDD 2026 — одна из главных конференций по машинному обучению.
AI VK Research представила там сразу два исследования в области рекомендательных систем. Одно посвящено оптимизации рекомендаций на уровне всей сессии через REINFORCE, второе — использованию MDP и матричной факторизации для candidate generation.
Но интереснее посмотреть не только на сами работы, но и на то, какие темы сейчас обсуждают на одной из крупнейших ML-конференций и куда в целом движется research в RecSys.
Команда AI VK Research подготовила небольшой репортаж с KDD: презентации работ, конференция и все, что происходило вокруг.
На прошлой неделе на острове Чеджу прошла KDD 2026 — одна из главных конференций по машинному обучению.
AI VK Research представила там сразу два исследования в области рекомендательных систем. Одно посвящено оптимизации рекомендаций на уровне всей сессии через REINFORCE, второе — использованию MDP и матричной факторизации для candidate generation.
Но интереснее посмотреть не только на сами работы, но и на то, какие темы сейчас обсуждают на одной из крупнейших ML-конференций и куда в целом движется research в RecSys.
Команда AI VK Research подготовила небольшой репортаж с KDD: презентации работ, конференция и все, что происходило вокруг.
Telegram
AI VK Hub
Репортаж с KDD 2026 ⬆️
На прошлой неделе команда AI VK Research участвовала в KDD 2026 — одной из ключевых мировых ML-конференций. Наши ребята представили результаты двух своих исследований, посвящённых развитию рекомендательных систем.
Что обсуждали на…
На прошлой неделе команда AI VK Research участвовала в KDD 2026 — одной из ключевых мировых ML-конференций. Наши ребята представили результаты двух своих исследований, посвящённых развитию рекомендательных систем.
Что обсуждали на…
«Matrix Calculus for Machine Learning» — бесплатный конспект лекций на основе курса MIT по матричному анализу для машинного обучения.
Примерно 100 страниц, на которых довольно последовательно разбирается математическая база современных моделей — производные в векторных и матричных пространствах, производная как линейное отображение, якобианы, гессианы, матричные функции, производные собственных значений и собственных векторов и многое другое.
Самое полезное здесь в том, что авторы не останавливаются на чистой математике. Все эти идеи напрямую связываются с обратным режимом дифференцирования, обратным распространением ошибки и другими механизмами, на которых строится обучение современных моделей.
Материал строгий, но при этом читается вполне нормально. Если хочется не просто пользоваться формулами в машинном обучении, а действительно понимать, что происходит под капотом, это очень хороший ресурс.
https://arxiv.org/pdf/2501.14787
Примерно 100 страниц, на которых довольно последовательно разбирается математическая база современных моделей — производные в векторных и матричных пространствах, производная как линейное отображение, якобианы, гессианы, матричные функции, производные собственных значений и собственных векторов и многое другое.
Самое полезное здесь в том, что авторы не останавливаются на чистой математике. Все эти идеи напрямую связываются с обратным режимом дифференцирования, обратным распространением ошибки и другими механизмами, на которых строится обучение современных моделей.
Материал строгий, но при этом читается вполне нормально. Если хочется не просто пользоваться формулами в машинном обучении, а действительно понимать, что происходит под капотом, это очень хороший ресурс.
https://arxiv.org/pdf/2501.14787
Книга Дарижа Гринберга «Введение в теорию графов» теперь доступна бесплатно
Это серьёзное введение в теорию графов для продвинутого уровня. В книге объединены алгебраический подход, структурные теоремы и большое количество упражнений для практики.
Читать книгу вместе с ИИ-преподавателем: https://chapterpal.com/ebook/473a1c1b-c584-4430-b986-cd9c57085e67
Это серьёзное введение в теорию графов для продвинутого уровня. В книге объединены алгебраический подход, структурные теоремы и большое количество упражнений для практики.
Читать книгу вместе с ИИ-преподавателем: https://chapterpal.com/ebook/473a1c1b-c584-4430-b986-cd9c57085e67
Офигеть, теперь даже игровой ПК может запускать передовые модели с интерактивной скоростью, используя официальные веса без экстремального квантования.
Исследователи из UC Berkeley, MIT и UT Austin открыли исходный код FreeToken — системы, специально созданной для запуска сверхбольших MoE-моделей на обычных компьютерах.
В статье они показывают очень впечатляющие результаты:
Qwen3.6 35B → ноутбук с RTX 4060 8 ГБ → 39 токенов/с
DeepSeek-V4-Flash 284B → RTX 5090 → 22–25 токенов/с
GLM-5.2 753B → RTX PRO 6000 → 15 токенов/с
По сравнению с Ollama скорость генерации выше в 3–4 раза, а обработка входного контекста — в 6–30 раз быстрее.
То есть игровой ноутбук всего с 8 ГБ видеопамяти уже может запускать модель на 35 млрд параметров почти на 40 токенах в секунду.
И это даже быстрее медианной скорости генерации Codex в 33 токена/с, которую авторы приводят в статье.
Главная идея FreeToken в том, чтобы заставить GPU, CPU, оперативную память и PCIe работать вместе.
Поскольку MoE-модели для каждого токена активируют только небольшую часть экспертов, нет необходимости постоянно держать сотни миллиардов параметров в видеопамяти.
FreeToken сам решает, какие части модели оставить в VRAM, какие временно переносить из оперативной памяти на GPU, а какие вообще считать на CPU.
На этапе обработки входного контекста система заранее загружает экспертов следующего слоя. Во время генерации она динамически распределяет вычисления в зависимости от текущей скорости CPU, GPU и PCIe.
Есть даже отдельный Agent State Cache.
Когда агент вызывает инструменты, меняет контекст или продолжает старую задачу, FreeToken может пропускать большую часть повторной обработки контекста.
FreeToken поставляется с полноценным графическим интерфейсом.
Не нужно конвертировать модели в GGUF или собирать проект из исходного кода.
Также в FreeToken Desktop уже встроены агентные обвязки - выбираете модель, выбираете приложение и запускаете.
https://arxiv.org/abs/2608.16157
Исследователи из UC Berkeley, MIT и UT Austin открыли исходный код FreeToken — системы, специально созданной для запуска сверхбольших MoE-моделей на обычных компьютерах.
В статье они показывают очень впечатляющие результаты:
Qwen3.6 35B → ноутбук с RTX 4060 8 ГБ → 39 токенов/с
DeepSeek-V4-Flash 284B → RTX 5090 → 22–25 токенов/с
GLM-5.2 753B → RTX PRO 6000 → 15 токенов/с
По сравнению с Ollama скорость генерации выше в 3–4 раза, а обработка входного контекста — в 6–30 раз быстрее.
То есть игровой ноутбук всего с 8 ГБ видеопамяти уже может запускать модель на 35 млрд параметров почти на 40 токенах в секунду.
И это даже быстрее медианной скорости генерации Codex в 33 токена/с, которую авторы приводят в статье.
Главная идея FreeToken в том, чтобы заставить GPU, CPU, оперативную память и PCIe работать вместе.
Поскольку MoE-модели для каждого токена активируют только небольшую часть экспертов, нет необходимости постоянно держать сотни миллиардов параметров в видеопамяти.
FreeToken сам решает, какие части модели оставить в VRAM, какие временно переносить из оперативной памяти на GPU, а какие вообще считать на CPU.
На этапе обработки входного контекста система заранее загружает экспертов следующего слоя. Во время генерации она динамически распределяет вычисления в зависимости от текущей скорости CPU, GPU и PCIe.
Есть даже отдельный Agent State Cache.
Когда агент вызывает инструменты, меняет контекст или продолжает старую задачу, FreeToken может пропускать большую часть повторной обработки контекста.
FreeToken поставляется с полноценным графическим интерфейсом.
Не нужно конвертировать модели в GGUF или собирать проект из исходного кода.
Также в FreeToken Desktop уже встроены агентные обвязки - выбираете модель, выбираете приложение и запускаете.
https://arxiv.org/abs/2608.16157
Конспект лекций Стэнфорда по статистике и теории информации.
PDF → https://web.stanford.edu/class/stats311/lecture-notes.pdf
PDF → https://web.stanford.edu/class/stats311/lecture-notes.pdf