Это чертовски масштабно: впервые персонализированное лечение рака на основе мРНК, созданное с помощью ИИ, успешно прошло испытание 3-й фазы.
Moderna и Merck секвенируют опухоль каждого пациента и сравнивают её со здоровой ДНК. Затем ИИ помогает определить, какие мутации опухоли с наибольшей вероятностью способны вызвать иммунный ответ.
На основе этих мишеней Moderna создаёт индивидуальное мРНК-лечение, кодирующее до 34 неоантигенов.
В более раннем испытании 2-й фазы за пациентами с хирургически удалённой меланомой высокого риска наблюдали в течение пяти лет:
— 68,8% оставались без рака по сравнению с 49,1% среди тех, кто получал только Keytruda
— риск рецидива или смерти был ниже на 49%
— риск отдалённых метастазов или смерти был ниже на 59%
Теперь успешно завершилось и гораздо более крупное испытание 3-й фазы с участием 1 137 пациентов.
Просто невероятно. Дарио был прав: рак будет излечен всего через несколько лет!
Moderna и Merck секвенируют опухоль каждого пациента и сравнивают её со здоровой ДНК. Затем ИИ помогает определить, какие мутации опухоли с наибольшей вероятностью способны вызвать иммунный ответ.
На основе этих мишеней Moderna создаёт индивидуальное мРНК-лечение, кодирующее до 34 неоантигенов.
В более раннем испытании 2-й фазы за пациентами с хирургически удалённой меланомой высокого риска наблюдали в течение пяти лет:
— 68,8% оставались без рака по сравнению с 49,1% среди тех, кто получал только Keytruda
— риск рецидива или смерти был ниже на 49%
— риск отдалённых метастазов или смерти был ниже на 59%
Теперь успешно завершилось и гораздо более крупное испытание 3-й фазы с участием 1 137 пациентов.
Просто невероятно. Дарио был прав: рак будет излечен всего через несколько лет!
«Суть линейной алгебры» от 3Blue1Brown
https://youtube.com/playlist?list=PLZHQObOWTQDPD3MizzM2xVFitgF8hE_ab
https://youtube.com/playlist?list=PLZHQObOWTQDPD3MizzM2xVFitgF8hE_ab
1
This media is not supported in your browser
VIEW IN TELEGRAM
Qwen3.8-27B теперь работает со скоростью 70 токенов/с прямо на ноутбуке.
Вышел DFlash 2 — новое поколение спекулятивного декодирования на основе блочной диффузии.
DFlash 2 разгоняет Qwen3.8-27B до 70 токенов/с на MacBook Pro с M5 Max. Ускорение авторегрессионного декодирования достигает 4,6 раза, а итоговый вывод остаётся полностью идентичным исходной модели — буквально ни одного отличающегося токена.⚡️
Уже доступны новые черновые модели для Qwen3.8-27B с нативной поддержкой SGLang, vLLM, llama.cpp и oMLX.
Суть подхода: https://inco.ai/blog/dflash2/
Вышел DFlash 2 — новое поколение спекулятивного декодирования на основе блочной диффузии.
DFlash 2 разгоняет Qwen3.8-27B до 70 токенов/с на MacBook Pro с M5 Max. Ускорение авторегрессионного декодирования достигает 4,6 раза, а итоговый вывод остаётся полностью идентичным исходной модели — буквально ни одного отличающегося токена.
Уже доступны новые черновые модели для Qwen3.8-27B с нативной поддержкой SGLang, vLLM, llama.cpp и oMLX.
Суть подхода: https://inco.ai/blog/dflash2/
Please open Telegram to view this post
VIEW IN TELEGRAM
У больших языковых моделей есть серьёзное слепое пятно: у них нет врождённого понимания физического мира.
Особенно хорошо это видно, когда мы спускаемся на квантовый уровень. Сложность квантовой динамики и стоимость управления ею растут экспоненциально.
Операторы Фурье становятся важным инструментом для изучения квантовой динамики молекул и ускорения обратного проектирования протоколов управления.
FNO предсказывает динамику в 10^7 раз быстрее, чем CUDA-Q от Nvidia с ускорением на GPU.
Стохастический планировщик импульсов и измерений на основе FNO показывает почти вдвое более высокий процент успешных результатов, чем подход на основе обучения с подкреплением.
https://arxiv.org/abs/2608.03702
Особенно хорошо это видно, когда мы спускаемся на квантовый уровень. Сложность квантовой динамики и стоимость управления ею растут экспоненциально.
Операторы Фурье становятся важным инструментом для изучения квантовой динамики молекул и ускорения обратного проектирования протоколов управления.
FNO предсказывает динамику в 10^7 раз быстрее, чем CUDA-Q от Nvidia с ускорением на GPU.
Стохастический планировщик импульсов и измерений на основе FNO показывает почти вдвое более высокий процент успешных результатов, чем подход на основе обучения с подкреплением.
https://arxiv.org/abs/2608.03702
KDD 2026
На прошлой неделе на острове Чеджу прошла KDD 2026 — одна из главных конференций по машинному обучению.
AI VK Research представила там сразу два исследования в области рекомендательных систем. Одно посвящено оптимизации рекомендаций на уровне всей сессии через REINFORCE, второе — использованию MDP и матричной факторизации для candidate generation.
Но интереснее посмотреть не только на сами работы, но и на то, какие темы сейчас обсуждают на одной из крупнейших ML-конференций и куда в целом движется research в RecSys.
Команда AI VK Research подготовила небольшой репортаж с KDD: презентации работ, конференция и все, что происходило вокруг.
На прошлой неделе на острове Чеджу прошла KDD 2026 — одна из главных конференций по машинному обучению.
AI VK Research представила там сразу два исследования в области рекомендательных систем. Одно посвящено оптимизации рекомендаций на уровне всей сессии через REINFORCE, второе — использованию MDP и матричной факторизации для candidate generation.
Но интереснее посмотреть не только на сами работы, но и на то, какие темы сейчас обсуждают на одной из крупнейших ML-конференций и куда в целом движется research в RecSys.
Команда AI VK Research подготовила небольшой репортаж с KDD: презентации работ, конференция и все, что происходило вокруг.
Telegram
AI VK Hub
Репортаж с KDD 2026 ⬆️
На прошлой неделе команда AI VK Research участвовала в KDD 2026 — одной из ключевых мировых ML-конференций. Наши ребята представили результаты двух своих исследований, посвящённых развитию рекомендательных систем.
Что обсуждали на…
На прошлой неделе команда AI VK Research участвовала в KDD 2026 — одной из ключевых мировых ML-конференций. Наши ребята представили результаты двух своих исследований, посвящённых развитию рекомендательных систем.
Что обсуждали на…
«Matrix Calculus for Machine Learning» — бесплатный конспект лекций на основе курса MIT по матричному анализу для машинного обучения.
Примерно 100 страниц, на которых довольно последовательно разбирается математическая база современных моделей — производные в векторных и матричных пространствах, производная как линейное отображение, якобианы, гессианы, матричные функции, производные собственных значений и собственных векторов и многое другое.
Самое полезное здесь в том, что авторы не останавливаются на чистой математике. Все эти идеи напрямую связываются с обратным режимом дифференцирования, обратным распространением ошибки и другими механизмами, на которых строится обучение современных моделей.
Материал строгий, но при этом читается вполне нормально. Если хочется не просто пользоваться формулами в машинном обучении, а действительно понимать, что происходит под капотом, это очень хороший ресурс.
https://arxiv.org/pdf/2501.14787
Примерно 100 страниц, на которых довольно последовательно разбирается математическая база современных моделей — производные в векторных и матричных пространствах, производная как линейное отображение, якобианы, гессианы, матричные функции, производные собственных значений и собственных векторов и многое другое.
Самое полезное здесь в том, что авторы не останавливаются на чистой математике. Все эти идеи напрямую связываются с обратным режимом дифференцирования, обратным распространением ошибки и другими механизмами, на которых строится обучение современных моделей.
Материал строгий, но при этом читается вполне нормально. Если хочется не просто пользоваться формулами в машинном обучении, а действительно понимать, что происходит под капотом, это очень хороший ресурс.
https://arxiv.org/pdf/2501.14787
Книга Дарижа Гринберга «Введение в теорию графов» теперь доступна бесплатно
Это серьёзное введение в теорию графов для продвинутого уровня. В книге объединены алгебраический подход, структурные теоремы и большое количество упражнений для практики.
Читать книгу вместе с ИИ-преподавателем: https://chapterpal.com/ebook/473a1c1b-c584-4430-b986-cd9c57085e67
Это серьёзное введение в теорию графов для продвинутого уровня. В книге объединены алгебраический подход, структурные теоремы и большое количество упражнений для практики.
Читать книгу вместе с ИИ-преподавателем: https://chapterpal.com/ebook/473a1c1b-c584-4430-b986-cd9c57085e67
Офигеть, теперь даже игровой ПК может запускать передовые модели с интерактивной скоростью, используя официальные веса без экстремального квантования.
Исследователи из UC Berkeley, MIT и UT Austin открыли исходный код FreeToken — системы, специально созданной для запуска сверхбольших MoE-моделей на обычных компьютерах.
В статье они показывают очень впечатляющие результаты:
Qwen3.6 35B → ноутбук с RTX 4060 8 ГБ → 39 токенов/с
DeepSeek-V4-Flash 284B → RTX 5090 → 22–25 токенов/с
GLM-5.2 753B → RTX PRO 6000 → 15 токенов/с
По сравнению с Ollama скорость генерации выше в 3–4 раза, а обработка входного контекста — в 6–30 раз быстрее.
То есть игровой ноутбук всего с 8 ГБ видеопамяти уже может запускать модель на 35 млрд параметров почти на 40 токенах в секунду.
И это даже быстрее медианной скорости генерации Codex в 33 токена/с, которую авторы приводят в статье.
Главная идея FreeToken в том, чтобы заставить GPU, CPU, оперативную память и PCIe работать вместе.
Поскольку MoE-модели для каждого токена активируют только небольшую часть экспертов, нет необходимости постоянно держать сотни миллиардов параметров в видеопамяти.
FreeToken сам решает, какие части модели оставить в VRAM, какие временно переносить из оперативной памяти на GPU, а какие вообще считать на CPU.
На этапе обработки входного контекста система заранее загружает экспертов следующего слоя. Во время генерации она динамически распределяет вычисления в зависимости от текущей скорости CPU, GPU и PCIe.
Есть даже отдельный Agent State Cache.
Когда агент вызывает инструменты, меняет контекст или продолжает старую задачу, FreeToken может пропускать большую часть повторной обработки контекста.
FreeToken поставляется с полноценным графическим интерфейсом.
Не нужно конвертировать модели в GGUF или собирать проект из исходного кода.
Также в FreeToken Desktop уже встроены агентные обвязки - выбираете модель, выбираете приложение и запускаете.
https://arxiv.org/abs/2608.16157
Исследователи из UC Berkeley, MIT и UT Austin открыли исходный код FreeToken — системы, специально созданной для запуска сверхбольших MoE-моделей на обычных компьютерах.
В статье они показывают очень впечатляющие результаты:
Qwen3.6 35B → ноутбук с RTX 4060 8 ГБ → 39 токенов/с
DeepSeek-V4-Flash 284B → RTX 5090 → 22–25 токенов/с
GLM-5.2 753B → RTX PRO 6000 → 15 токенов/с
По сравнению с Ollama скорость генерации выше в 3–4 раза, а обработка входного контекста — в 6–30 раз быстрее.
То есть игровой ноутбук всего с 8 ГБ видеопамяти уже может запускать модель на 35 млрд параметров почти на 40 токенах в секунду.
И это даже быстрее медианной скорости генерации Codex в 33 токена/с, которую авторы приводят в статье.
Главная идея FreeToken в том, чтобы заставить GPU, CPU, оперативную память и PCIe работать вместе.
Поскольку MoE-модели для каждого токена активируют только небольшую часть экспертов, нет необходимости постоянно держать сотни миллиардов параметров в видеопамяти.
FreeToken сам решает, какие части модели оставить в VRAM, какие временно переносить из оперативной памяти на GPU, а какие вообще считать на CPU.
На этапе обработки входного контекста система заранее загружает экспертов следующего слоя. Во время генерации она динамически распределяет вычисления в зависимости от текущей скорости CPU, GPU и PCIe.
Есть даже отдельный Agent State Cache.
Когда агент вызывает инструменты, меняет контекст или продолжает старую задачу, FreeToken может пропускать большую часть повторной обработки контекста.
FreeToken поставляется с полноценным графическим интерфейсом.
Не нужно конвертировать модели в GGUF или собирать проект из исходного кода.
Также в FreeToken Desktop уже встроены агентные обвязки - выбираете модель, выбираете приложение и запускаете.
https://arxiv.org/abs/2608.16157
Конспект лекций Стэнфорда по статистике и теории информации.
PDF → https://web.stanford.edu/class/stats311/lecture-notes.pdf
PDF → https://web.stanford.edu/class/stats311/lecture-notes.pdf
Безумие: теперь можно буквально в прямом эфире смотреть, как обучают модель на 535 млрд параметров.
Профессор Стэнфорда и основатель simile_ai Перси Лян объявил, что на этой неделе официально стартует обучение их новой модели Marin 535B-A23B. И весь процесс обучения будет полностью открытым.
У Marin 535 млрд параметров, из которых 23 млрд активны. Для обучения команда подготовила 18,75 трлн токенов данных и развернула 11 стоек GB200 NVL72 — это примерно 792 ускорителя GB200.
Обучение планируют вести непрерывно около трёх месяцев. Общий объём вычислений составит примерно 2,7×10²⁴ FLOPs. После этого начнётся дополнительное обучение модели.
Перед запуском основной модели команда сначала обучила так называемую Scaling Ladder из четырёх моделей — от 1,6B-A61M до 27,7B-A1.2B. Эти меньшие модели использовали, чтобы заранее предсказать потери и поведение основной модели на 535 млрд параметров.
Теперь основное обучение уже запущено, и любой желающий может в реальном времени следить за кривыми обучения. Данные, журналы экспериментов и возникающие инженерные проблемы тоже будут постепенно публиковаться.
Подобное уже было. В 2022 году, когда BigScience обучала BLOOM на 176 млрд параметров, прогресс обучения и TensorBoard тоже были открыты.
Но теперь Marin поднимает масштаб публичного обучения сразу до 535 млрд параметров.
Судя по всему, это одно из крупнейших обучений большой модели, за которым человечество когда-либо могло наблюдать публично.
Следующие три месяца должны быть очень интересными. Насколько конкурентоспособной получится модель — это отдельный вопрос. Мне гораздо интереснее увидеть, как именно обучают и настраивают MoE-модель размером более 500 млрд параметров и сколько раз всё успеет сломаться по дороге.
Такие возможности появляются крайне редко. По сути, перед всем миром открывают эксперимент по обучению модели стоимостью в десятки миллионов долларов — то, что обычно могут видеть только сотрудники крупнейших ИИ-лабораторий.
Профессор Стэнфорда и основатель simile_ai Перси Лян объявил, что на этой неделе официально стартует обучение их новой модели Marin 535B-A23B. И весь процесс обучения будет полностью открытым.
У Marin 535 млрд параметров, из которых 23 млрд активны. Для обучения команда подготовила 18,75 трлн токенов данных и развернула 11 стоек GB200 NVL72 — это примерно 792 ускорителя GB200.
Обучение планируют вести непрерывно около трёх месяцев. Общий объём вычислений составит примерно 2,7×10²⁴ FLOPs. После этого начнётся дополнительное обучение модели.
Перед запуском основной модели команда сначала обучила так называемую Scaling Ladder из четырёх моделей — от 1,6B-A61M до 27,7B-A1.2B. Эти меньшие модели использовали, чтобы заранее предсказать потери и поведение основной модели на 535 млрд параметров.
Теперь основное обучение уже запущено, и любой желающий может в реальном времени следить за кривыми обучения. Данные, журналы экспериментов и возникающие инженерные проблемы тоже будут постепенно публиковаться.
Подобное уже было. В 2022 году, когда BigScience обучала BLOOM на 176 млрд параметров, прогресс обучения и TensorBoard тоже были открыты.
Но теперь Marin поднимает масштаб публичного обучения сразу до 535 млрд параметров.
Судя по всему, это одно из крупнейших обучений большой модели, за которым человечество когда-либо могло наблюдать публично.
Следующие три месяца должны быть очень интересными. Насколько конкурентоспособной получится модель — это отдельный вопрос. Мне гораздо интереснее увидеть, как именно обучают и настраивают MoE-модель размером более 500 млрд параметров и сколько раз всё успеет сломаться по дороге.
Такие возможности появляются крайне редко. По сути, перед всем миром открывают эксперимент по обучению модели стоимостью в десятки миллионов долларов — то, что обычно могут видеть только сотрудники крупнейших ИИ-лабораторий.
«Functional Analysis» — строгий продвинутый учебник по математике объёмом более 700 страниц для магистрантов, аспирантов и читателей с хорошей математической подготовкой.
В книге разбираются пространства Банаха и Гильберта, ограниченные операторы, двойственность, теоремы Хана — Банаха, топологии, спектральная теория, краевые задачи, теория полугрупп и приложения к квантовой механике, а также многие другие темы.
Для чтения нужна уверенная база по вещественному анализу и интегралу Лебега, поэтому это точно не вводный материал.
Делюсь, потому что книга очень полная, хорошо написана и её определённо стоит сохранить, если вы изучаете продвинутый математический анализ.
https://arxiv.org/pdf/2112.11166
В книге разбираются пространства Банаха и Гильберта, ограниченные операторы, двойственность, теоремы Хана — Банаха, топологии, спектральная теория, краевые задачи, теория полугрупп и приложения к квантовой механике, а также многие другие темы.
Для чтения нужна уверенная база по вещественному анализу и интегралу Лебега, поэтому это точно не вводный материал.
Делюсь, потому что книга очень полная, хорошо написана и её определённо стоит сохранить, если вы изучаете продвинутый математический анализ.
https://arxiv.org/pdf/2112.11166
Интерактивный учебник на 7 500 строк, который учит с нуля собирать современную языковую модель.
Весь путь реализован на Python, а код подробно прокомментирован, чтобы можно было последовательно разобраться, как устроено обучение GPT-подобной модели, а не просто запускать готовые библиотеки.
https://github.com/raiyanyahya/how-to-train-your-gpt
Весь путь реализован на Python, а код подробно прокомментирован, чтобы можно было последовательно разобраться, как устроено обучение GPT-подобной модели, а не просто запускать готовые библиотеки.
https://github.com/raiyanyahya/how-to-train-your-gpt
GitHub
GitHub - raiyanyahya/how-to-train-your-gpt: Build a modern LLM from scratch. Every line commented. Explained like we are five.
Build a modern LLM from scratch. Every line commented. Explained like we are five. - raiyanyahya/how-to-train-your-gpt