Data Portal | DS & ML
9.63K subscribers
645 photos
153 videos
9 files
844 links
Всё самое интересное из мира Data Science и машинного обучения

Cотрудничество: @devmangx

Автор: @ScienceLLM
Download Telegram
Курс в Стэнфорде «Современный разработчик программного обеспечения» стартует в следующий вторник.

В этом репозитории на GitHub будут публиковаться все задания. Там уже доступны задания с прошлого года.

https://github.com/mihail911/modern-software-dev-assignments
This media is not supported in your browser
VIEW IN TELEGRAM
Вышел подробный разбор управления роботами для тех, кто приходит в робототехнику из машинного обучения и не имеет профильной подготовки.

Автор на примере манипулятора SO-100 из проекта LeRobot показывает, что именно делает выход модели с сервоприводом, как работает ПИД-регулятор и почему дешёвые манипуляторы перелетают нужное положение.

Также разбираются запись данных при телеуправлении, пространство суставов и пространство задачи, прямая и обратная кинематика, ограничения рабочей области SO-100 и различия между тем, что предсказывают ACT и OpenVLA.

Всё сопровождается анимациями и практическими примерами. Следующий материал будет посвящён ACT.
Если вы изучаете экономику или интересуетесь пересечением эконометрики, причинно-следственного анализа и машинного обучения, стоит прочитать работу Сьюзан Эйти.

Она разбирает, что машинное обучение действительно может дать экономике и эконометрике, а где его возможности заканчиваются.

Особенно полезно для понимания того, чем прогнозирование отличается от установления причинно-следственных связей и почему хорошие предсказания сами по себе ещё не отвечают на экономические вопросы.

https://nber.org/books-and-chapters/economics-artificial-intelligence-agenda/impact-machine-learning-economics
MIT открыл полный курс по визуальной навигации для автономных систем.

Программа охватывает весь путь от восприятия окружающей среды до управления движением, а не отдельные алгоритмы. В курс входят 2D- и 3D-зрение, визуальная и визуально-инерциальная одометрия, SLAM, распознавание мест, построение карт, планирование траекторий и методы машинного обучения для задач навигации.

Курс рассчитан прежде всего на разработчиков робототехники, беспилотников и автономных автомобилей.

Все материалы доступны бесплатно, включая лекции, слайды и конспекты.

https://vnav.mit.edu
На выходные — отличный материал по современному программированию GPU для систем машинного обучения.

MLC Community разбирает архитектуру GPU практически с нуля: потоки и варпы, иерархию памяти, CUDA Cores и Tensor Cores, TMA, устройство Blackwell, GEMM и Flash Attention 4. Отдельный упор сделан на то, как писать действительно быстрые ядра и эффективно загружать вычислительные блоки GPU.

https://mlc.ai/modern-gpu-programming-for-mlsys/chapter_background/index.html
В открытом доступе появился GuppyLM — проект, который позволяет обучить языковую модель на 9 млн параметров с нуля примерно за пять минут.

Репозиторий включает весь процесс обучения и рассчитан на быстрые эксперименты с небольшими языковыми моделями без крупной инфраструктуры.

https://github.com/arman-bd/guppylm
Bespoke Labs выпустила Nimble — открытый аналог Jev с опубликованными данными, рецептом обучения и весами модели.

Nimble построен на Qwen3.5-9B и дообучен через LoRA без дистилляции из Jev. Сам Jev использовался только как ориентир для оценки качества.

Ключевой метод — контрастный отбор данных: в примерах меняется один критически важный факт, который должен изменить итоговое решение. Все данные синтетические и охватывают 10 категорий, при этом обучающая и тестовая выборки разделены.

Модель не генерирует длинный текст, а напрямую работает с вероятностями токенов возможных ответов через параллельное ограниченное декодирование.

На собственном наборе тестов базовый Qwen получил 66%, Nimble — 90%, Jev — 93%. Задержка на H100 составляет около 100 мс, а модель можно запускать локально на MacBook.

Обучение с подкреплением пока не использовалось.

Код:
https://github.com/bespokelabsai/nimble

Модель:
https://huggingface.co/bespokelabs/Bespoke-Nimble-9B

Ограничение — единого внешнего теста пока нет, поэтому качество за пределами этих 10 категорий ещё предстоит проверить.
Apple развивает MLX-LM — инструмент, который позволяет запускать и дообучать языковые модели прямо на Mac.

Проект создан командой ml-explore и уже набрал более 7 тыс. звёзд на GitHub.

Главное преимущество — простой запуск. Вместо ручного поиска квантованной версии модели и настройки среды достаточно одной команды и имени модели с Hugging Face. По умолчанию можно запустить 4-битную Llama 3.2 3B, а другую модель выбрать через параметр --model.

В той же среде поддерживаются LoRA и полное дообучение, в том числе для квантованных моделей. Вычисления можно распределять между несколькими машинами через mx.distributed.

Для длинного контекста есть вращающийся KV-кэш и кэш подсказок, поэтому при повторной работе с одним документом не нужно каждый раз заново обрабатывать весь контекст.

И главное — модель работает локально, поэтому данные остаются на устройстве.

https://github.com/ml-explore/mlx-lm
Вот один из лучших материалов для начала, если хотите понять, что процессор на самом деле делает.

https://youtu.be/GU8MnZI0snA
«Precalculus» — бесплатная книга, которую я рекомендую, когда меня спрашивают о хорошем ресурсе по базовой математике.

Она охватывает многие основы, необходимые перед переходом к математическому анализу и более продвинутой математике. Книга начинается с вещественных чисел, декартовой плоскости, отношений и функций, а затем переходит к линейным, квадратичным, полиномиальным, рациональным, показательным и логарифмическим функциям.

Также рассматриваются конические сечения, системы уравнений, матрицы, определители, последовательности, математическая индукция, биномиальная теорема и значительный объём тригонометрии, включая тождества, обратные тригонометрические функции, тригонометрические уравнения, полярные координаты, векторы и параметрические уравнения.

В книге больше 1 000 страниц, а по ходу глав есть множество упражнений и ответов к ним. Поэтому она подходит как для первого изучения этих тем, так и для повторения основ перед переходом к более продвинутой математике.

https://stitz-zeager.com/szprecalculus07042013.pdf
Исследователь OpenAI Алиса Лю прошла 57 собеседований перед тем, как попасть в компанию, а затем открыто опубликовала весь свой путь подготовки и поиска работы.

Если вы готовитесь к позициям Research Scientist или MTS, это один из самых насыщенных практических материалов, которые сейчас можно найти.

Можно использовать её конспекты напрямую или просто взять список тем и пройти их самостоятельно. Такое публикуют редко.

Конспекты по LLM:
https://alisawuffles.notion.site/alisa-s-book-of-llms

Математика:
https://alisawuffles.notion.site/math-notes

Разбор поиска работы и собеседований:
https://alisawuffles.github.io/blog/job-search/
Китай снова в игре: Xiaomi ночью выпустила MiMo-V2.6 Pro и Flash и результаты очень сильные.

Xiaomi потратила 130 часов, 75 млрд токенов и $2,6 млн на RL, чтобы вывести MiMo-V2.6 Pro на первое место среди открытых моделей. И у них получилось.

AA Intelligence Index — 46,32, выше Kimi K3 и Qwen3.8 Max. При этом цена осталась такой же, как у V2.5.

При сопоставимом уровне интеллекта стоимость запросов составляет всего 1/20–1/60 от международных флагманов:

• MiMo-V2.6 Pro — $0.435 / $0.87
• MiMo-V2.6 Flash — $0.14 / $0.28, примерно треть цены Pro
• DeepSeek V4 Pro — около $0.66–1.32 / $1.98–3.96, Pro дешевле примерно в 2–5 раз
• GLM-5.3 — около $1.40 / $4.40, Pro дешевле примерно в 3–5 раз
• Qwen3.8 Max — около $2 / $6, Pro дешевле примерно в 5–7 раз
• Gemini 3.5 Flash — около $1.50 / $9, Pro дешевле примерно в 3–10 раз
• Gemini 3.1 Pro — около $2 / $12, Pro дешевле примерно в 5–14 раз
• GPT-5.6 Sol — около $4–5 / $20, Pro дешевле примерно в 10–23 раза
• Claude Opus 5 — около $5 / $25, Pro дешевле примерно в 12–29 раз
• Claude Fable 5 — около $10 / $50, Pro дешевле примерно в 23–58 раз


Одна задача обходится примерно в $0.13.

Весь процесс обучения транслировался в реальном времени, а расходы и сбои публиковались онлайн. Вместе с моделью открыты веса, код RL и среды.
Data Portal | DS & ML
Китай снова в игре: Xiaomi ночью выпустила MiMo-V2.6 Pro и Flash и результаты очень сильные. Xiaomi потратила 130 часов, 75 млрд токенов и $2,6 млн на RL, чтобы вывести MiMo-V2.6 Pro на первое место среди открытых моделей. И у них получилось. AA Intelligence…
Ключевые решения MiMo V2.6 Pro и Flash:

Не разделять обучение по областям, а одним смешанным RL одновременно прокачивать код, агентов, зрение и безопасность.
На каждом шаге 1568×16 полностью асинхронный GRPO, более 3,5 млрд токенов, контекст до 1 млн токенов.
Масштабирование награды: сравнительная оценка внутри группы через GRS и перераспределение advantage через GAR.
Заморозка маршрутизации MoE и многоуровневая защита от reward hacking. Только так обучение на триллионном масштабе остаётся стабильным.
На предобучении Adam, на mid-training — Muon + row-norm, то есть Muown, чтобы выдерживать большие batch size.
Hybrid SWA/GA + MTP. Pro — 1,02T / 42B, Flash — 310B / 15B.
За 6 дней — 750 тыс. траекторий. Flash обошлась в $850 тыс., Pro — в $2,62 млн. На DeepSWE прирост составил сразу 14–17 пунктов.
Веса, среды, код RL и технический отчёт открываются полностью. Команда делает ставку на RSI, а не на сокрытие рецепта.


Интеллект вырос, а цена осталась на уровне V2.5. Вот что значит действительно сдвинуть границу Парето.

Статья:
https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/MiMo_V2_6_technical_report.pdf
Архитектура GPU | Руководство по инференсу LLM

https://handbook.modular.com/kernel-optimization/gpu-architecture-fundamentals/

Добавьте это в свою подборку материалов по LLM.

«Прежде чем писать или оптимизировать GPU-ядра, нужно понимать, как именно GPU выполняет код. Без этого советы вроде “увеличьте occupancy” или “уменьшите конфликты банков shared memory” превращаются просто в набор правил, которые приходится запоминать. Вы не до конца понимаете, когда они применимы, а когда нет.

В этом разделе разбирается архитектура современных GPU на уровне, необходимом для работы с ядрами. Основной акцент сделан на оборудовании NVIDIA, поскольку CUDA сегодня доминирует в значительной части экосистемы LLM-инференса. При этом базовые принципы в целом применимы и к GPU AMD, и к другим параллельным ускорителям».
Проекты, которые можно собрать за выходные, если у вас уже средний уровень:

1. Рой из нескольких агентов для сложных задач вроде исследований и математики
2. Среда выполнения для агента с состоянием, сессиями, памятью и остальной инфраструктурой
3. Сервис инференса LLM с продуманной системной архитектурой
4. Среда для голосовых агентов
5. Распределённая симуляция LLM
6. Агент на VLM с циклом мировой модели для работы с интерфейсами, скриншотами и документами
7. Среда с моделью вознаграждения за процесс и поиском для математики, кода и агентного RAG
8. Каскад моделей или смесь маршрутизаторов с ограничениями по стоимости, задержке и качеству
9. Система долговременной памяти с сохранением, вытеснением, повторной загрузкой и средой оценки
10. RL-среда для агентов, использующих инструменты, с хранением траекторий и циклом GRPO/DPO
11. Система наблюдаемости за агентами: трассировки, бюджеты, регрессии и LLM в роли оценщика
12. Среда с участием человека: поставить агента на паузу, изменить состояние, продолжить работу и сохранить журнал действий
13. Спекулятивное декодирование с черновой и основной моделью и проверкой результата как мини-система управления инференсом
14. Непрерывная адаптация: собирать ошибки, извлекать предпочтения и запускать DPO ночью
15. Отладчик с «машиной времени» для агентов: воспроизводить траектории, создавать ответвления состояния и сравнивать политики
Google DeepMind, Meta и Amazon опубликовали 135-страничную дорожную карту, которая по-новому определяет, что вообще представляют собой ИИ-агенты.

Вот эта дорожная карта: https://arxiv.org/pdf/2601.12538