Data Portal | DS & ML
9.64K subscribers
645 photos
153 videos
9 files
844 links
Всё самое интересное из мира Data Science и машинного обучения

Cотрудничество: @devmangx

Автор: @ScienceLLM
Download Telegram
На курс основателя Z.ai и профессора Цинхуа Тан Цзе пришло столько людей, что аудитория на 112 человек оказалась забита, а часть студентов слушала стоя в проходах.

И программа объясняет почему.

За 16 недель студентов проводят почти через весь путь создания современной большой языковой модели своими руками. Нужно написать токенизатор и Transformer с нуля, обучить модель на 0,1 млрд параметров, сделать attention-ядро на Triton, проверить ускорение на нескольких GPU, очистить сырые данные, построить scaling law, сравнить SFT, DPO и RLVR.

Финальный проект ещё сложнее. Нужно собрать проверяемую среду, обучить агента на длинных задачах и показать рабочую демонстрацию. Работа идёт командами по 2–3 человека, а отчёт оформляется на английском в формате NeurIPS.

Сам Тан Цзе считает, что битва за чат-модели в основном уже закончена. Следующий этап — модели, которые сами запоминают, учатся, выполняют длинные задачи и со временем становятся сильнее.

Поэтому курс, который формально всё ещё называется машинным обучением, уже строится вокруг базовых моделей, масштабирования, синтетических данных, обучения с подкреплением, агентов, непрерывного обучения и ИИ, который обучает другой ИИ.

Если умеешь только вызывать API, здесь будет тяжело.

Ирония в том, что всё это задаёт человек, который стоит за GLM. Студентам предлагают собирать всё с нуля, пока рядом у них уже открыт GLM-5.3, готовый помогать с каждой частью.
Z.ai рассказала, как GLM-5.3 помогала строить и оптимизировать инфраструктуру инференса для GLM-5.3-Flash.

От первого успешного запуска до готовности к продакшену система дошла меньше чем за две недели. За это время сквозная пропускная способность выросла примерно в три раза относительно первоначального варианта.

Главным оказался плотный цикл обратной связи. Локальные тесты на корректность, трассировки выполнения, микробенчмарки и сквозные замеры позволяли быстро проверять конкретные гипотезы, а не ориентироваться только на общие показатели производительности.

https://z.ai/blog/glm-built-its-inference-infrastructure
This media is not supported in your browser
VIEW IN TELEGRAM
Небольшое напоминание: вы можете дообучить более 500 моделей с открытым исходным кодом прямо в бесплатном Google Colab.

Можно даже загрузить PDF или CSV и превратить их в готовые синтетические датасеты.

1. Откройте Google Colab по ссылке.
2. Запустите блоки для установки Unsloth Studio.
3. Выберите модель.
4. Загрузите датасет.
5. Всё готово.

После этого модель, конечно же, можно экспортировать.

https://github.com/unslothai/unsloth

https://unsloth.ai/docs/new/studio#features
Jev вышел всего несколько дней назад, а NanoJev уже выложил в открытый доступ весь пайплайн. И это не просто обёртка над API: здесь модель для параллельного принятия решений на 0,6 млрд параметров, данные и полный пайплайн обучения.

NanoJev буквально раскладывает по полочкам весь подход: "состояние + вопрос → полное распределение вероятностей без декодирования токенов".

В основе — всего лишь Qwen3-0.6B. За один проход модель может параллельно обрабатывать сразу несколько состояний и несколько вопросов.

Число вариантов динамическое — от 2 до 255. Поддерживаются три типа структурированных решений: Choice, Boolean и Score.

В лабиринте 50×50 модель дошла до финиша за 244 шага, столкнувшись 36 раз. В «Змейке» 12×12 съела 27 единиц еды и при этом осталась жива.

Модель и данные полностью открыты. Есть всё сразу: обучение, оценка, постоянно работающий сервис инференса и демонстрация со сравнением в трёх колонках.

Планирование выполняется кодом, а модель отвечает за локальные решения. То есть это не попытка заставить обычную чат-модель в лоб играть в игру.

Репозиторий: https://github.com/TianyuCodings/NanoJev

Модель и данные: C-Tianyu/NanoJev на Hugging Face.

Закрытая модель только успела заявить, что она в 200 раз быстрее, а в открытом коде уже собрали и запустили сквозную реализацию System One — пусть пока и на уровне игрушечного прототипа.
Data Portal | DS & ML
Один из создателей ChatGPT представил принципиально новый тип ИИ-моделей. Два года, Диогу Алмейда, втайне разрабатывал Jev — модель, которая не пишет текст и не генерирует токены последовательно. Она получает любые неструктурированные данные и параллельно…
Media is too big
VIEW IN TELEGRAM
Jev уже пробуют применять в автономном вождении.

По словам автора эксперимента, меньше чем за час на новой модели удалось собрать в симуляции полный цикл принятия решений для машины.

Повороты, перестроения, проезд перекрёстков, выезд на шоссе. Для каждого действия модель возвращает не текст, а типизированные вероятности возможных решений вместе с уровнем уверенности.

В этом и отличие Jev от обычных чат-моделей. На вход подаётся состояние системы, на выходе получается набор допустимых действий и их вероятности.

Если такой подход действительно хорошо масштабируется, порог входа в создание систем автономного вождения может заметно снизиться.
Курс в Стэнфорде «Современный разработчик программного обеспечения» стартует в следующий вторник.

В этом репозитории на GitHub будут публиковаться все задания. Там уже доступны задания с прошлого года.

https://github.com/mihail911/modern-software-dev-assignments
This media is not supported in your browser
VIEW IN TELEGRAM
Вышел подробный разбор управления роботами для тех, кто приходит в робототехнику из машинного обучения и не имеет профильной подготовки.

Автор на примере манипулятора SO-100 из проекта LeRobot показывает, что именно делает выход модели с сервоприводом, как работает ПИД-регулятор и почему дешёвые манипуляторы перелетают нужное положение.

Также разбираются запись данных при телеуправлении, пространство суставов и пространство задачи, прямая и обратная кинематика, ограничения рабочей области SO-100 и различия между тем, что предсказывают ACT и OpenVLA.

Всё сопровождается анимациями и практическими примерами. Следующий материал будет посвящён ACT.
Если вы изучаете экономику или интересуетесь пересечением эконометрики, причинно-следственного анализа и машинного обучения, стоит прочитать работу Сьюзан Эйти.

Она разбирает, что машинное обучение действительно может дать экономике и эконометрике, а где его возможности заканчиваются.

Особенно полезно для понимания того, чем прогнозирование отличается от установления причинно-следственных связей и почему хорошие предсказания сами по себе ещё не отвечают на экономические вопросы.

https://nber.org/books-and-chapters/economics-artificial-intelligence-agenda/impact-machine-learning-economics
MIT открыл полный курс по визуальной навигации для автономных систем.

Программа охватывает весь путь от восприятия окружающей среды до управления движением, а не отдельные алгоритмы. В курс входят 2D- и 3D-зрение, визуальная и визуально-инерциальная одометрия, SLAM, распознавание мест, построение карт, планирование траекторий и методы машинного обучения для задач навигации.

Курс рассчитан прежде всего на разработчиков робототехники, беспилотников и автономных автомобилей.

Все материалы доступны бесплатно, включая лекции, слайды и конспекты.

https://vnav.mit.edu
На выходные — отличный материал по современному программированию GPU для систем машинного обучения.

MLC Community разбирает архитектуру GPU практически с нуля: потоки и варпы, иерархию памяти, CUDA Cores и Tensor Cores, TMA, устройство Blackwell, GEMM и Flash Attention 4. Отдельный упор сделан на то, как писать действительно быстрые ядра и эффективно загружать вычислительные блоки GPU.

https://mlc.ai/modern-gpu-programming-for-mlsys/chapter_background/index.html
В открытом доступе появился GuppyLM — проект, который позволяет обучить языковую модель на 9 млн параметров с нуля примерно за пять минут.

Репозиторий включает весь процесс обучения и рассчитан на быстрые эксперименты с небольшими языковыми моделями без крупной инфраструктуры.

https://github.com/arman-bd/guppylm
Bespoke Labs выпустила Nimble — открытый аналог Jev с опубликованными данными, рецептом обучения и весами модели.

Nimble построен на Qwen3.5-9B и дообучен через LoRA без дистилляции из Jev. Сам Jev использовался только как ориентир для оценки качества.

Ключевой метод — контрастный отбор данных: в примерах меняется один критически важный факт, который должен изменить итоговое решение. Все данные синтетические и охватывают 10 категорий, при этом обучающая и тестовая выборки разделены.

Модель не генерирует длинный текст, а напрямую работает с вероятностями токенов возможных ответов через параллельное ограниченное декодирование.

На собственном наборе тестов базовый Qwen получил 66%, Nimble — 90%, Jev — 93%. Задержка на H100 составляет около 100 мс, а модель можно запускать локально на MacBook.

Обучение с подкреплением пока не использовалось.

Код:
https://github.com/bespokelabsai/nimble

Модель:
https://huggingface.co/bespokelabs/Bespoke-Nimble-9B

Ограничение — единого внешнего теста пока нет, поэтому качество за пределами этих 10 категорий ещё предстоит проверить.
Apple развивает MLX-LM — инструмент, который позволяет запускать и дообучать языковые модели прямо на Mac.

Проект создан командой ml-explore и уже набрал более 7 тыс. звёзд на GitHub.

Главное преимущество — простой запуск. Вместо ручного поиска квантованной версии модели и настройки среды достаточно одной команды и имени модели с Hugging Face. По умолчанию можно запустить 4-битную Llama 3.2 3B, а другую модель выбрать через параметр --model.

В той же среде поддерживаются LoRA и полное дообучение, в том числе для квантованных моделей. Вычисления можно распределять между несколькими машинами через mx.distributed.

Для длинного контекста есть вращающийся KV-кэш и кэш подсказок, поэтому при повторной работе с одним документом не нужно каждый раз заново обрабатывать весь контекст.

И главное — модель работает локально, поэтому данные остаются на устройстве.

https://github.com/ml-explore/mlx-lm
Вот один из лучших материалов для начала, если хотите понять, что процессор на самом деле делает.

https://youtu.be/GU8MnZI0snA
«Precalculus» — бесплатная книга, которую я рекомендую, когда меня спрашивают о хорошем ресурсе по базовой математике.

Она охватывает многие основы, необходимые перед переходом к математическому анализу и более продвинутой математике. Книга начинается с вещественных чисел, декартовой плоскости, отношений и функций, а затем переходит к линейным, квадратичным, полиномиальным, рациональным, показательным и логарифмическим функциям.

Также рассматриваются конические сечения, системы уравнений, матрицы, определители, последовательности, математическая индукция, биномиальная теорема и значительный объём тригонометрии, включая тождества, обратные тригонометрические функции, тригонометрические уравнения, полярные координаты, векторы и параметрические уравнения.

В книге больше 1 000 страниц, а по ходу глав есть множество упражнений и ответов к ним. Поэтому она подходит как для первого изучения этих тем, так и для повторения основ перед переходом к более продвинутой математике.

https://stitz-zeager.com/szprecalculus07042013.pdf
Исследователь OpenAI Алиса Лю прошла 57 собеседований перед тем, как попасть в компанию, а затем открыто опубликовала весь свой путь подготовки и поиска работы.

Если вы готовитесь к позициям Research Scientist или MTS, это один из самых насыщенных практических материалов, которые сейчас можно найти.

Можно использовать её конспекты напрямую или просто взять список тем и пройти их самостоятельно. Такое публикуют редко.

Конспекты по LLM:
https://alisawuffles.notion.site/alisa-s-book-of-llms

Математика:
https://alisawuffles.notion.site/math-notes

Разбор поиска работы и собеседований:
https://alisawuffles.github.io/blog/job-search/
Китай снова в игре: Xiaomi ночью выпустила MiMo-V2.6 Pro и Flash и результаты очень сильные.

Xiaomi потратила 130 часов, 75 млрд токенов и $2,6 млн на RL, чтобы вывести MiMo-V2.6 Pro на первое место среди открытых моделей. И у них получилось.

AA Intelligence Index — 46,32, выше Kimi K3 и Qwen3.8 Max. При этом цена осталась такой же, как у V2.5.

При сопоставимом уровне интеллекта стоимость запросов составляет всего 1/20–1/60 от международных флагманов:

• MiMo-V2.6 Pro — $0.435 / $0.87
• MiMo-V2.6 Flash — $0.14 / $0.28, примерно треть цены Pro
• DeepSeek V4 Pro — около $0.66–1.32 / $1.98–3.96, Pro дешевле примерно в 2–5 раз
• GLM-5.3 — около $1.40 / $4.40, Pro дешевле примерно в 3–5 раз
• Qwen3.8 Max — около $2 / $6, Pro дешевле примерно в 5–7 раз
• Gemini 3.5 Flash — около $1.50 / $9, Pro дешевле примерно в 3–10 раз
• Gemini 3.1 Pro — около $2 / $12, Pro дешевле примерно в 5–14 раз
• GPT-5.6 Sol — около $4–5 / $20, Pro дешевле примерно в 10–23 раза
• Claude Opus 5 — около $5 / $25, Pro дешевле примерно в 12–29 раз
• Claude Fable 5 — около $10 / $50, Pro дешевле примерно в 23–58 раз


Одна задача обходится примерно в $0.13.

Весь процесс обучения транслировался в реальном времени, а расходы и сбои публиковались онлайн. Вместе с моделью открыты веса, код RL и среды.
Data Portal | DS & ML
Китай снова в игре: Xiaomi ночью выпустила MiMo-V2.6 Pro и Flash и результаты очень сильные. Xiaomi потратила 130 часов, 75 млрд токенов и $2,6 млн на RL, чтобы вывести MiMo-V2.6 Pro на первое место среди открытых моделей. И у них получилось. AA Intelligence…
Ключевые решения MiMo V2.6 Pro и Flash:

Не разделять обучение по областям, а одним смешанным RL одновременно прокачивать код, агентов, зрение и безопасность.
На каждом шаге 1568×16 полностью асинхронный GRPO, более 3,5 млрд токенов, контекст до 1 млн токенов.
Масштабирование награды: сравнительная оценка внутри группы через GRS и перераспределение advantage через GAR.
Заморозка маршрутизации MoE и многоуровневая защита от reward hacking. Только так обучение на триллионном масштабе остаётся стабильным.
На предобучении Adam, на mid-training — Muon + row-norm, то есть Muown, чтобы выдерживать большие batch size.
Hybrid SWA/GA + MTP. Pro — 1,02T / 42B, Flash — 310B / 15B.
За 6 дней — 750 тыс. траекторий. Flash обошлась в $850 тыс., Pro — в $2,62 млн. На DeepSWE прирост составил сразу 14–17 пунктов.
Веса, среды, код RL и технический отчёт открываются полностью. Команда делает ставку на RSI, а не на сокрытие рецепта.


Интеллект вырос, а цена осталась на уровне V2.5. Вот что значит действительно сдвинуть границу Парето.

Статья:
https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/MiMo_V2_6_technical_report.pdf