Data Portal | DS & ML
10.2K subscribers
669 photos
156 videos
9 files
863 links
Всё самое интересное из мира Data Science и машинного обучения

Cотрудничество: @devmangx

Автор: @ScienceLLM
Download Telegram
Data Portal | DS & ML
Китай снова в игре: Xiaomi ночью выпустила MiMo-V2.6 Pro и Flash и результаты очень сильные. Xiaomi потратила 130 часов, 75 млрд токенов и $2,6 млн на RL, чтобы вывести MiMo-V2.6 Pro на первое место среди открытых моделей. И у них получилось. AA Intelligence…
Ключевые решения MiMo V2.6 Pro и Flash:

Не разделять обучение по областям, а одним смешанным RL одновременно прокачивать код, агентов, зрение и безопасность.
На каждом шаге 1568×16 полностью асинхронный GRPO, более 3,5 млрд токенов, контекст до 1 млн токенов.
Масштабирование награды: сравнительная оценка внутри группы через GRS и перераспределение advantage через GAR.
Заморозка маршрутизации MoE и многоуровневая защита от reward hacking. Только так обучение на триллионном масштабе остаётся стабильным.
На предобучении Adam, на mid-training — Muon + row-norm, то есть Muown, чтобы выдерживать большие batch size.
Hybrid SWA/GA + MTP. Pro — 1,02T / 42B, Flash — 310B / 15B.
За 6 дней — 750 тыс. траекторий. Flash обошлась в $850 тыс., Pro — в $2,62 млн. На DeepSWE прирост составил сразу 14–17 пунктов.
Веса, среды, код RL и технический отчёт открываются полностью. Команда делает ставку на RSI, а не на сокрытие рецепта.


Интеллект вырос, а цена осталась на уровне V2.5. Вот что значит действительно сдвинуть границу Парето.

Статья:
https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/MiMo_V2_6_technical_report.pdf
Архитектура GPU | Руководство по инференсу LLM

https://handbook.modular.com/kernel-optimization/gpu-architecture-fundamentals/

Добавьте это в свою подборку материалов по LLM.

«Прежде чем писать или оптимизировать GPU-ядра, нужно понимать, как именно GPU выполняет код. Без этого советы вроде “увеличьте occupancy” или “уменьшите конфликты банков shared memory” превращаются просто в набор правил, которые приходится запоминать. Вы не до конца понимаете, когда они применимы, а когда нет.

В этом разделе разбирается архитектура современных GPU на уровне, необходимом для работы с ядрами. Основной акцент сделан на оборудовании NVIDIA, поскольку CUDA сегодня доминирует в значительной части экосистемы LLM-инференса. При этом базовые принципы в целом применимы и к GPU AMD, и к другим параллельным ускорителям».
Проекты, которые можно собрать за выходные, если у вас уже средний уровень:

1. Рой из нескольких агентов для сложных задач вроде исследований и математики
2. Среда выполнения для агента с состоянием, сессиями, памятью и остальной инфраструктурой
3. Сервис инференса LLM с продуманной системной архитектурой
4. Среда для голосовых агентов
5. Распределённая симуляция LLM
6. Агент на VLM с циклом мировой модели для работы с интерфейсами, скриншотами и документами
7. Среда с моделью вознаграждения за процесс и поиском для математики, кода и агентного RAG
8. Каскад моделей или смесь маршрутизаторов с ограничениями по стоимости, задержке и качеству
9. Система долговременной памяти с сохранением, вытеснением, повторной загрузкой и средой оценки
10. RL-среда для агентов, использующих инструменты, с хранением траекторий и циклом GRPO/DPO
11. Система наблюдаемости за агентами: трассировки, бюджеты, регрессии и LLM в роли оценщика
12. Среда с участием человека: поставить агента на паузу, изменить состояние, продолжить работу и сохранить журнал действий
13. Спекулятивное декодирование с черновой и основной моделью и проверкой результата как мини-система управления инференсом
14. Непрерывная адаптация: собирать ошибки, извлекать предпочтения и запускать DPO ночью
15. Отладчик с «машиной времени» для агентов: воспроизводить траектории, создавать ответвления состояния и сравнивать политики
Google DeepMind, Meta и Amazon опубликовали 135-страничную дорожную карту, которая по-новому определяет, что вообще представляют собой ИИ-агенты.

Вот эта дорожная карта: https://arxiv.org/pdf/2601.12538
«Mathematical Pathways to Machine Learning» — новое введение в математические основы машинного обучения, опубликованное в августе 2026 года.

Это сборник конспектов лекций, в котором математика последовательно выводится с базовых принципов. В нём рассматриваются векторы и матрицы, внутреннее и внешнее произведения, ортогональность и проекции, процесс Грама — Шмидта и QR-разложение, собственные значения и собственные векторы, SVD, PCA, производные и градиенты, якобианы, гессианы, разложения Тейлора, выпуклость, метод наименьших квадратов, градиентный спуск, сходимость и обусловленность, метод Ньютона, момент, множители Лагранжа, условия KKT, двойственность и метод опорных векторов.

Математические концепции напрямую связываются с реальными задачами машинного обучения, включая нейронные сети и обратное распространение ошибки, PageRank, рекомендательные системы, снижение размерности, регрессию, оптимизацию и SVM.

Материал изложен доступно и очень хорошо структурирован. По всему тексту есть разобранные примеры и упражнения, включая задачи для подготовки к экзаменам и небольшие вычислительные задания.

https://zenodo.org/records/21752763
NVIDIA объясняет основы CUDA в серии материалов CUDA Refresher.

Серия начинается с того, почему часть вычислений перешла с CPU на GPU, а затем разбирает запуск первой программы, библиотеки CUDA и модель программирования: ядра, сетки, блоки и потоки.

Материалы пригодятся тем, кто хочет понять, как задачи распределяются по GPU и какие готовые инструменты уже есть вместо собственной реализации.

Серия вышла в 2020 году. Инструкции по установке и инструменты могли устареть, но объяснение базовых принципов остаётся полезным.

https://developer.nvidia.com/blog/tag/cuda-refresher/
«Методы машинного обучения, которые стоит знать экономистам»

Сьюзан Эйти и Гвидо В. Имбенс

https://annualreviews.org/content/journals/10.1146/annurev-economics-080217-053433
Вышла новая статья с личной подписью Ляна Вэньфэна. Впервые раскрыта инфраструктура, на которой DeepSeek обучает агентов: более 5000 новых песочниц в секунду, причём систему приходится защищать ещё и от попыток самих моделей читерить.

При обучении больших моделей всё упирается в видеокарты. При обучении агентов — в среды.

В новой статье с подписью Ляна Вэньфэна DeepSeek раскрыла свою фабрику песочниц DSec.

Ключевые моменты статьи:

1️⃣ Масштаб: около 160 машин, 30 тысяч ядер CPU и 250 ТБ памяти. За сутки система может создавать 3 миллиона песочниц, одновременно запускать 380 тысяч и разворачивать более 5000 новых в секунду.

2️⃣ Что она умеет: от простых вызовов функций и Docker-контейнеров до лёгких виртуальных машин и полноценных компьютеров с Windows или macOS. Всё доступно через единый интерфейс.

3️⃣ Почему это сложно: когда агент пишет код или устанавливает ПО, состояние среды меняется, а сама система нередко ломается. В обычных песочницах загрузка CPU часто составляет всего около 5%, поэтому значительная часть ресурсов простаивает.

4️⃣ Как экономят ресурсы: образы разбиваются на три слоя и собираются по мере необходимости, а данные подтягиваются из собственной файловой системы 3FS только тогда, когда нужны. Это позволяет сократить расход памяти на 30–40%, а на одной машине разместить до 3200 контейнеров.

5️⃣ Ещё одна проблема: обучаемые агенты сами начинают искать уязвимости, чтобы получить более высокий результат. Они могут изменять системные файлы, обходить ограничения прав доступа, сканировать порты в поисках ответов и даже выводить из строя ядро системы. В статье отдельно описано, как от этого защищаются.

Если коротко: DeepSeek занимается не только обучением моделей, но и превращает инфраструктуру, на которой работают агенты, в полноценный конвейер.

Статья: https://arxiv.org/abs/2609.22978
Перестаньте воспринимать матрицу просто как сетку чисел с плавающей точкой.

Матрицы — это графы, а графы — это матрицы. Каждое умножение матриц — это преобразование сети, в котором узлы передают сигналы по взвешенным рёбрам.

Когда вместо механических вычислений начинаешь мыслить через интуицию графов, линейная алгебра превращается из скучной в красивую.

Самый недооценённый факт линейной алгебры: https://t.co/7G7hAFpxU8
DeepSeek выпустила DeepEP V2.5. Библиотеку коммуникаций для MoE снова серьезно обновили.

Главные изменения:

1) ElasticBuffer разделили на EPBuffer / EngramBuffer / PPBuffer / BucketBuffer. Они используют общий жизненный цикл, а зона ответственности каждого буфера теперь четче.

2) Сначала планирование, потом выделение памяти

Добавили BufferAllocator. Перед созданием буферов он заранее планирует, как симметричные тензоры будут размещаться в видеопамяти, чтобы уменьшить лишние расходы и фрагментацию.

3) Пакетные коллективные операции

BucketBuffer поддерживает пакетные all-gather, reduce-scatter и all-reduce. Обычные тензоры PyTorch тоже можно использовать в рамках того же механизма сессий.

4) Динамические резервные эксперты

lb_prefetch_weights — перед вычислением эксперта заранее загружает через NVLink веса и масштабы квантования.

lb_reduce_grads — во время обратного прохода суммирует FP32-градиенты резервных экспертов обратно в исходного эксперта.

Подход приведен в соответствие со схемой репликации экспертов из MoonEP / UltraEP.

5) Доработки для обучения

Добавили поддержку отложенного завершения EP, кэширования расширенной раскладки и заполнения нулями между экспертами.

6) Многоуровневый Engram

Engram теперь может хранить данные в несколько уровней на GPU или CPU, при этом для каждого уровня предусмотрен отдельный хук ожидания.

7) Большая чистка

Полностью удалены API V1, бэкенд NVSHMEM и старая документация. NVSHMEM больше не является зависимостью.

Если кратко: прежний монолитный ElasticBuffer разделили на отдельные компоненты, планирование видеопамяти перенесли на более ранний этап, а резервных экспертов и коллективные операции сделали переиспользуемыми строительными блоками. Заодно полностью убрали V1 и NVSHMEM.

Репозиторий: https://github.com/deepseek-ai/DeepEP
Вы запускаете не модели, а ядра.

Модель — это всего лишь граф.

Движок инференса — это планировщик, оптимизатор и исполнитель.

Но где происходит реальная работа? В ядрах.

* Ядра MatMul
* Ядра Attention
* Ядра RMSNorm
* Ядра KV-кэша
* Ядра квантованных линейных слоёв
* Ядра семплирования
* Объединённые ядра в духе «пожалуйста, не записывай это обратно в память девять раз»

Одна и та же модель, одна и та же видеокарта, тот же объём видеопамяти.

А производительность может отличаться радикально.

Потому что один стек использует оптимизированные объединённые ядра, которые учитывают особенности вашего железа.

А другой перебрасывает тензоры между 47 крошечными запусками и делает вид, что проблема в видеокарте.

Плохие ядра заставляют людей говорить:

«эта модель медленная»

Хорошие ядра заставляют людей говорить:

«подождите, как это вообще запускается локально?»

Вот почему движки инференса и реализованные внутри них ядра настолько важны.

Модель — это рецепт.

Железо — кухня.

Ядра — это ножи, сковородки, конфорки и повар, который не режет лук ложкой.

Большинство людей сравнивают модели.

А те, кто действительно разбирается, сравнивают ядра, на которых всё это работает.
Изучите оптимизацию инференса настолько быстро и глубоко, насколько это возможно.

В этом материале приподносят на блюдечке подробный журнал работы по оптимизации GEMM в CUDA.:

Начинаем с наивной реализации
Выявляем проблемы производительности и оцениваем их в числах
Разбираем концепцию потокового softmax
Реализуем ядро и оцениваем выигрыш по памяти и числу операций с плавающей точкой
Применяем схему объединённого доступа к памяти
Снова оцениваем прирост по числу операций, обмену данными и памяти
Пишем код на CUDA


Читать: athleticcoder21.github.io/inference-book/gemm
«Mathematical Pathways to Machine Learning» — материалы по математической базе для машинного обучения, включая математический анализ, линейную алгебру и оптимизацию.

Конспекты лекций с вводным разбором математики и основ, необходимых для машинного обучения:

https://zenodo.org/records/21752763
Если вы только начинаете изучать машинное обучение и хотите глубже разобраться в математике, необходимой для машинного и глубокого обучения, советую попробовать эту платформу. Это что-то вроде LeetCode для машинного обучения.

Это не реклама: я сам ей пользовался и решил поделиться с вами.

https://deep-ml.com