Data Portal | DS & ML
Китай снова в игре: Xiaomi ночью выпустила MiMo-V2.6 Pro и Flash и результаты очень сильные. Xiaomi потратила 130 часов, 75 млрд токенов и $2,6 млн на RL, чтобы вывести MiMo-V2.6 Pro на первое место среди открытых моделей. И у них получилось. AA Intelligence…
Ключевые решения MiMo V2.6 Pro и Flash:
Интеллект вырос, а цена осталась на уровне V2.5. Вот что значит действительно сдвинуть границу Парето.
Статья:
https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/MiMo_V2_6_technical_report.pdf
Не разделять обучение по областям, а одним смешанным RL одновременно прокачивать код, агентов, зрение и безопасность.
На каждом шаге 1568×16 полностью асинхронный GRPO, более 3,5 млрд токенов, контекст до 1 млн токенов.
Масштабирование награды: сравнительная оценка внутри группы через GRS и перераспределение advantage через GAR.
Заморозка маршрутизации MoE и многоуровневая защита от reward hacking. Только так обучение на триллионном масштабе остаётся стабильным.
На предобучении Adam, на mid-training — Muon + row-norm, то есть Muown, чтобы выдерживать большие batch size.
Hybrid SWA/GA + MTP. Pro — 1,02T / 42B, Flash — 310B / 15B.
За 6 дней — 750 тыс. траекторий. Flash обошлась в $850 тыс., Pro — в $2,62 млн. На DeepSWE прирост составил сразу 14–17 пунктов.
Веса, среды, код RL и технический отчёт открываются полностью. Команда делает ставку на RSI, а не на сокрытие рецепта.
Интеллект вырос, а цена осталась на уровне V2.5. Вот что значит действительно сдвинуть границу Парето.
Статья:
https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/MiMo_V2_6_technical_report.pdf
Архитектура GPU | Руководство по инференсу LLM
https://handbook.modular.com/kernel-optimization/gpu-architecture-fundamentals/
Добавьте это в свою подборку материалов по LLM.
https://handbook.modular.com/kernel-optimization/gpu-architecture-fundamentals/
Добавьте это в свою подборку материалов по LLM.
«Прежде чем писать или оптимизировать GPU-ядра, нужно понимать, как именно GPU выполняет код. Без этого советы вроде “увеличьте occupancy” или “уменьшите конфликты банков shared memory” превращаются просто в набор правил, которые приходится запоминать. Вы не до конца понимаете, когда они применимы, а когда нет.
В этом разделе разбирается архитектура современных GPU на уровне, необходимом для работы с ядрами. Основной акцент сделан на оборудовании NVIDIA, поскольку CUDA сегодня доминирует в значительной части экосистемы LLM-инференса. При этом базовые принципы в целом применимы и к GPU AMD, и к другим параллельным ускорителям».
Проекты, которые можно собрать за выходные, если у вас уже средний уровень:
1. Рой из нескольких агентов для сложных задач вроде исследований и математики
2. Среда выполнения для агента с состоянием, сессиями, памятью и остальной инфраструктурой
3. Сервис инференса LLM с продуманной системной архитектурой
4. Среда для голосовых агентов
5. Распределённая симуляция LLM
6. Агент на VLM с циклом мировой модели для работы с интерфейсами, скриншотами и документами
7. Среда с моделью вознаграждения за процесс и поиском для математики, кода и агентного RAG
8. Каскад моделей или смесь маршрутизаторов с ограничениями по стоимости, задержке и качеству
9. Система долговременной памяти с сохранением, вытеснением, повторной загрузкой и средой оценки
10. RL-среда для агентов, использующих инструменты, с хранением траекторий и циклом GRPO/DPO
11. Система наблюдаемости за агентами: трассировки, бюджеты, регрессии и LLM в роли оценщика
12. Среда с участием человека: поставить агента на паузу, изменить состояние, продолжить работу и сохранить журнал действий
13. Спекулятивное декодирование с черновой и основной моделью и проверкой результата как мини-система управления инференсом
14. Непрерывная адаптация: собирать ошибки, извлекать предпочтения и запускать DPO ночью
15. Отладчик с «машиной времени» для агентов: воспроизводить траектории, создавать ответвления состояния и сравнивать политики
1. Рой из нескольких агентов для сложных задач вроде исследований и математики
2. Среда выполнения для агента с состоянием, сессиями, памятью и остальной инфраструктурой
3. Сервис инференса LLM с продуманной системной архитектурой
4. Среда для голосовых агентов
5. Распределённая симуляция LLM
6. Агент на VLM с циклом мировой модели для работы с интерфейсами, скриншотами и документами
7. Среда с моделью вознаграждения за процесс и поиском для математики, кода и агентного RAG
8. Каскад моделей или смесь маршрутизаторов с ограничениями по стоимости, задержке и качеству
9. Система долговременной памяти с сохранением, вытеснением, повторной загрузкой и средой оценки
10. RL-среда для агентов, использующих инструменты, с хранением траекторий и циклом GRPO/DPO
11. Система наблюдаемости за агентами: трассировки, бюджеты, регрессии и LLM в роли оценщика
12. Среда с участием человека: поставить агента на паузу, изменить состояние, продолжить работу и сохранить журнал действий
13. Спекулятивное декодирование с черновой и основной моделью и проверкой результата как мини-система управления инференсом
14. Непрерывная адаптация: собирать ошибки, извлекать предпочтения и запускать DPO ночью
15. Отладчик с «машиной времени» для агентов: воспроизводить траектории, создавать ответвления состояния и сравнивать политики
Google DeepMind, Meta и Amazon опубликовали 135-страничную дорожную карту, которая по-новому определяет, что вообще представляют собой ИИ-агенты.
Вот эта дорожная карта: https://arxiv.org/pdf/2601.12538
Вот эта дорожная карта: https://arxiv.org/pdf/2601.12538
«Mathematical Pathways to Machine Learning» — новое введение в математические основы машинного обучения, опубликованное в августе 2026 года.
Это сборник конспектов лекций, в котором математика последовательно выводится с базовых принципов. В нём рассматриваются векторы и матрицы, внутреннее и внешнее произведения, ортогональность и проекции, процесс Грама — Шмидта и QR-разложение, собственные значения и собственные векторы, SVD, PCA, производные и градиенты, якобианы, гессианы, разложения Тейлора, выпуклость, метод наименьших квадратов, градиентный спуск, сходимость и обусловленность, метод Ньютона, момент, множители Лагранжа, условия KKT, двойственность и метод опорных векторов.
Математические концепции напрямую связываются с реальными задачами машинного обучения, включая нейронные сети и обратное распространение ошибки, PageRank, рекомендательные системы, снижение размерности, регрессию, оптимизацию и SVM.
Материал изложен доступно и очень хорошо структурирован. По всему тексту есть разобранные примеры и упражнения, включая задачи для подготовки к экзаменам и небольшие вычислительные задания.
https://zenodo.org/records/21752763
Это сборник конспектов лекций, в котором математика последовательно выводится с базовых принципов. В нём рассматриваются векторы и матрицы, внутреннее и внешнее произведения, ортогональность и проекции, процесс Грама — Шмидта и QR-разложение, собственные значения и собственные векторы, SVD, PCA, производные и градиенты, якобианы, гессианы, разложения Тейлора, выпуклость, метод наименьших квадратов, градиентный спуск, сходимость и обусловленность, метод Ньютона, момент, множители Лагранжа, условия KKT, двойственность и метод опорных векторов.
Математические концепции напрямую связываются с реальными задачами машинного обучения, включая нейронные сети и обратное распространение ошибки, PageRank, рекомендательные системы, снижение размерности, регрессию, оптимизацию и SVM.
Материал изложен доступно и очень хорошо структурирован. По всему тексту есть разобранные примеры и упражнения, включая задачи для подготовки к экзаменам и небольшие вычислительные задания.
https://zenodo.org/records/21752763
NVIDIA объясняет основы CUDA в серии материалов CUDA Refresher.
Серия начинается с того, почему часть вычислений перешла с CPU на GPU, а затем разбирает запуск первой программы, библиотеки CUDA и модель программирования: ядра, сетки, блоки и потоки.
Материалы пригодятся тем, кто хочет понять, как задачи распределяются по GPU и какие готовые инструменты уже есть вместо собственной реализации.
Серия вышла в 2020 году. Инструкции по установке и инструменты могли устареть, но объяснение базовых принципов остаётся полезным.
https://developer.nvidia.com/blog/tag/cuda-refresher/
Серия начинается с того, почему часть вычислений перешла с CPU на GPU, а затем разбирает запуск первой программы, библиотеки CUDA и модель программирования: ядра, сетки, блоки и потоки.
Материалы пригодятся тем, кто хочет понять, как задачи распределяются по GPU и какие готовые инструменты уже есть вместо собственной реализации.
Серия вышла в 2020 году. Инструкции по установке и инструменты могли устареть, но объяснение базовых принципов остаётся полезным.
https://developer.nvidia.com/blog/tag/cuda-refresher/
«Методы машинного обучения, которые стоит знать экономистам»
Сьюзан Эйти и Гвидо В. Имбенс
https://annualreviews.org/content/journals/10.1146/annurev-economics-080217-053433
Сьюзан Эйти и Гвидо В. Имбенс
https://annualreviews.org/content/journals/10.1146/annurev-economics-080217-053433
Вышла новая статья с личной подписью Ляна Вэньфэна. Впервые раскрыта инфраструктура, на которой DeepSeek обучает агентов: более 5000 новых песочниц в секунду, причём систему приходится защищать ещё и от попыток самих моделей читерить.
При обучении больших моделей всё упирается в видеокарты. При обучении агентов — в среды.
В новой статье с подписью Ляна Вэньфэна DeepSeek раскрыла свою фабрику песочниц DSec.
Ключевые моменты статьи:
1️⃣ Масштаб: около 160 машин, 30 тысяч ядер CPU и 250 ТБ памяти. За сутки система может создавать 3 миллиона песочниц, одновременно запускать 380 тысяч и разворачивать более 5000 новых в секунду.
2️⃣ Что она умеет: от простых вызовов функций и Docker-контейнеров до лёгких виртуальных машин и полноценных компьютеров с Windows или macOS. Всё доступно через единый интерфейс.
3️⃣ Почему это сложно: когда агент пишет код или устанавливает ПО, состояние среды меняется, а сама система нередко ломается. В обычных песочницах загрузка CPU часто составляет всего около 5%, поэтому значительная часть ресурсов простаивает.
4️⃣ Как экономят ресурсы: образы разбиваются на три слоя и собираются по мере необходимости, а данные подтягиваются из собственной файловой системы 3FS только тогда, когда нужны. Это позволяет сократить расход памяти на 30–40%, а на одной машине разместить до 3200 контейнеров.
5️⃣ Ещё одна проблема: обучаемые агенты сами начинают искать уязвимости, чтобы получить более высокий результат. Они могут изменять системные файлы, обходить ограничения прав доступа, сканировать порты в поисках ответов и даже выводить из строя ядро системы. В статье отдельно описано, как от этого защищаются.
Если коротко: DeepSeek занимается не только обучением моделей, но и превращает инфраструктуру, на которой работают агенты, в полноценный конвейер.
Статья: https://arxiv.org/abs/2609.22978
При обучении больших моделей всё упирается в видеокарты. При обучении агентов — в среды.
В новой статье с подписью Ляна Вэньфэна DeepSeek раскрыла свою фабрику песочниц DSec.
Ключевые моменты статьи:
1️⃣ Масштаб: около 160 машин, 30 тысяч ядер CPU и 250 ТБ памяти. За сутки система может создавать 3 миллиона песочниц, одновременно запускать 380 тысяч и разворачивать более 5000 новых в секунду.
2️⃣ Что она умеет: от простых вызовов функций и Docker-контейнеров до лёгких виртуальных машин и полноценных компьютеров с Windows или macOS. Всё доступно через единый интерфейс.
3️⃣ Почему это сложно: когда агент пишет код или устанавливает ПО, состояние среды меняется, а сама система нередко ломается. В обычных песочницах загрузка CPU часто составляет всего около 5%, поэтому значительная часть ресурсов простаивает.
4️⃣ Как экономят ресурсы: образы разбиваются на три слоя и собираются по мере необходимости, а данные подтягиваются из собственной файловой системы 3FS только тогда, когда нужны. Это позволяет сократить расход памяти на 30–40%, а на одной машине разместить до 3200 контейнеров.
5️⃣ Ещё одна проблема: обучаемые агенты сами начинают искать уязвимости, чтобы получить более высокий результат. Они могут изменять системные файлы, обходить ограничения прав доступа, сканировать порты в поисках ответов и даже выводить из строя ядро системы. В статье отдельно описано, как от этого защищаются.
Если коротко: DeepSeek занимается не только обучением моделей, но и превращает инфраструктуру, на которой работают агенты, в полноценный конвейер.
Статья: https://arxiv.org/abs/2609.22978
Перестаньте воспринимать матрицу просто как сетку чисел с плавающей точкой.
Матрицы — это графы, а графы — это матрицы. Каждое умножение матриц — это преобразование сети, в котором узлы передают сигналы по взвешенным рёбрам.
Когда вместо механических вычислений начинаешь мыслить через интуицию графов, линейная алгебра превращается из скучной в красивую.
Самый недооценённый факт линейной алгебры: https://t.co/7G7hAFpxU8
Матрицы — это графы, а графы — это матрицы. Каждое умножение матриц — это преобразование сети, в котором узлы передают сигналы по взвешенным рёбрам.
Когда вместо механических вычислений начинаешь мыслить через интуицию графов, линейная алгебра превращается из скучной в красивую.
Самый недооценённый факт линейной алгебры: https://t.co/7G7hAFpxU8
DeepSeek выпустила DeepEP V2.5. Библиотеку коммуникаций для MoE снова серьезно обновили.
Главные изменения:
1) ElasticBuffer разделили на EPBuffer / EngramBuffer / PPBuffer / BucketBuffer. Они используют общий жизненный цикл, а зона ответственности каждого буфера теперь четче.
2) Сначала планирование, потом выделение памяти
Добавили BufferAllocator. Перед созданием буферов он заранее планирует, как симметричные тензоры будут размещаться в видеопамяти, чтобы уменьшить лишние расходы и фрагментацию.
3) Пакетные коллективные операции
BucketBuffer поддерживает пакетные all-gather, reduce-scatter и all-reduce. Обычные тензоры PyTorch тоже можно использовать в рамках того же механизма сессий.
4) Динамические резервные эксперты
lb_prefetch_weights — перед вычислением эксперта заранее загружает через NVLink веса и масштабы квантования.
lb_reduce_grads — во время обратного прохода суммирует FP32-градиенты резервных экспертов обратно в исходного эксперта.
Подход приведен в соответствие со схемой репликации экспертов из MoonEP / UltraEP.
5) Доработки для обучения
Добавили поддержку отложенного завершения EP, кэширования расширенной раскладки и заполнения нулями между экспертами.
6) Многоуровневый Engram
Engram теперь может хранить данные в несколько уровней на GPU или CPU, при этом для каждого уровня предусмотрен отдельный хук ожидания.
7) Большая чистка
Полностью удалены API V1, бэкенд NVSHMEM и старая документация. NVSHMEM больше не является зависимостью.
Если кратко: прежний монолитный ElasticBuffer разделили на отдельные компоненты, планирование видеопамяти перенесли на более ранний этап, а резервных экспертов и коллективные операции сделали переиспользуемыми строительными блоками. Заодно полностью убрали V1 и NVSHMEM.
Репозиторий: https://github.com/deepseek-ai/DeepEP
Главные изменения:
1) ElasticBuffer разделили на EPBuffer / EngramBuffer / PPBuffer / BucketBuffer. Они используют общий жизненный цикл, а зона ответственности каждого буфера теперь четче.
2) Сначала планирование, потом выделение памяти
Добавили BufferAllocator. Перед созданием буферов он заранее планирует, как симметричные тензоры будут размещаться в видеопамяти, чтобы уменьшить лишние расходы и фрагментацию.
3) Пакетные коллективные операции
BucketBuffer поддерживает пакетные all-gather, reduce-scatter и all-reduce. Обычные тензоры PyTorch тоже можно использовать в рамках того же механизма сессий.
4) Динамические резервные эксперты
lb_prefetch_weights — перед вычислением эксперта заранее загружает через NVLink веса и масштабы квантования.
lb_reduce_grads — во время обратного прохода суммирует FP32-градиенты резервных экспертов обратно в исходного эксперта.
Подход приведен в соответствие со схемой репликации экспертов из MoonEP / UltraEP.
5) Доработки для обучения
Добавили поддержку отложенного завершения EP, кэширования расширенной раскладки и заполнения нулями между экспертами.
6) Многоуровневый Engram
Engram теперь может хранить данные в несколько уровней на GPU или CPU, при этом для каждого уровня предусмотрен отдельный хук ожидания.
7) Большая чистка
Полностью удалены API V1, бэкенд NVSHMEM и старая документация. NVSHMEM больше не является зависимостью.
Если кратко: прежний монолитный ElasticBuffer разделили на отдельные компоненты, планирование видеопамяти перенесли на более ранний этап, а резервных экспертов и коллективные операции сделали переиспользуемыми строительными блоками. Заодно полностью убрали V1 и NVSHMEM.
Репозиторий: https://github.com/deepseek-ai/DeepEP
Вы запускаете не модели, а ядра.
Модель — это всего лишь граф.
Движок инференса — это планировщик, оптимизатор и исполнитель.
Но где происходит реальная работа? В ядрах.
* Ядра MatMul
* Ядра Attention
* Ядра RMSNorm
* Ядра KV-кэша
* Ядра квантованных линейных слоёв
* Ядра семплирования
* Объединённые ядра в духе «пожалуйста, не записывай это обратно в память девять раз»
Одна и та же модель, одна и та же видеокарта, тот же объём видеопамяти.
А производительность может отличаться радикально.
Потому что один стек использует оптимизированные объединённые ядра, которые учитывают особенности вашего железа.
А другой перебрасывает тензоры между 47 крошечными запусками и делает вид, что проблема в видеокарте.
Плохие ядра заставляют людей говорить:
«эта модель медленная»
Хорошие ядра заставляют людей говорить:
«подождите, как это вообще запускается локально?»
Вот почему движки инференса и реализованные внутри них ядра настолько важны.
Модель — это рецепт.
Железо — кухня.
Ядра — это ножи, сковородки, конфорки и повар, который не режет лук ложкой.
Большинство людей сравнивают модели.
А те, кто действительно разбирается, сравнивают ядра, на которых всё это работает.
Модель — это всего лишь граф.
Движок инференса — это планировщик, оптимизатор и исполнитель.
Но где происходит реальная работа? В ядрах.
* Ядра MatMul
* Ядра Attention
* Ядра RMSNorm
* Ядра KV-кэша
* Ядра квантованных линейных слоёв
* Ядра семплирования
* Объединённые ядра в духе «пожалуйста, не записывай это обратно в память девять раз»
Одна и та же модель, одна и та же видеокарта, тот же объём видеопамяти.
А производительность может отличаться радикально.
Потому что один стек использует оптимизированные объединённые ядра, которые учитывают особенности вашего железа.
А другой перебрасывает тензоры между 47 крошечными запусками и делает вид, что проблема в видеокарте.
Плохие ядра заставляют людей говорить:
«эта модель медленная»
Хорошие ядра заставляют людей говорить:
«подождите, как это вообще запускается локально?»
Вот почему движки инференса и реализованные внутри них ядра настолько важны.
Модель — это рецепт.
Железо — кухня.
Ядра — это ножи, сковородки, конфорки и повар, который не режет лук ложкой.
Большинство людей сравнивают модели.
А те, кто действительно разбирается, сравнивают ядра, на которых всё это работает.
Изучите оптимизацию инференса настолько быстро и глубоко, насколько это возможно.
В этом материале приподносят на блюдечке подробный журнал работы по оптимизации GEMM в CUDA.:
Читать: athleticcoder21.github.io/inference-book/gemm
В этом материале приподносят на блюдечке подробный журнал работы по оптимизации GEMM в CUDA.:
Начинаем с наивной реализации
Выявляем проблемы производительности и оцениваем их в числах
Разбираем концепцию потокового softmax
Реализуем ядро и оцениваем выигрыш по памяти и числу операций с плавающей точкой
Применяем схему объединённого доступа к памяти
Снова оцениваем прирост по числу операций, обмену данными и памяти
Пишем код на CUDA
Читать: athleticcoder21.github.io/inference-book/gemm
«Mathematical Pathways to Machine Learning» — материалы по математической базе для машинного обучения, включая математический анализ, линейную алгебру и оптимизацию.
Конспекты лекций с вводным разбором математики и основ, необходимых для машинного обучения:
https://zenodo.org/records/21752763
Конспекты лекций с вводным разбором математики и основ, необходимых для машинного обучения:
https://zenodo.org/records/21752763
Если вы только начинаете изучать машинное обучение и хотите глубже разобраться в математике, необходимой для машинного и глубокого обучения, советую попробовать эту платформу. Это что-то вроде LeetCode для машинного обучения.
Это не реклама: я сам ей пользовался и решил поделиться с вами.
https://deep-ml.com
Это не реклама: я сам ей пользовался и решил поделиться с вами.
https://deep-ml.com