PCA — один из тех инструментов анализа данных, который очень быстро показывает то, что сложно заметить в сырой таблице.
Берёте большой набор данных, сжимаете его до двух главных компонент и сразу видите кластеры, выбросы и странные точки.
Дальше начинается самое интересное.
Если понять, что именно отражают PC1 и PC2, можно быстро разобраться, почему одни объекты образуют отдельные группы, а другие сильно выбиваются из общей картины.
Именно поэтому PCA полезен не только как способ уменьшить размерность данных. Это ещё и отличный способ находить закономерности и формулировать правильные вопросы к данным.
Берёте большой набор данных, сжимаете его до двух главных компонент и сразу видите кластеры, выбросы и странные точки.
Дальше начинается самое интересное.
Если понять, что именно отражают PC1 и PC2, можно быстро разобраться, почему одни объекты образуют отдельные группы, а другие сильно выбиваются из общей картины.
Именно поэтому PCA полезен не только как способ уменьшить размерность данных. Это ещё и отличный способ находить закономерности и формулировать правильные вопросы к данным.
Правильный способ обучения такой:
Нужно просто решать задачи и делать проекты.
Именно такой подход сделали для одной из лучших книг по основам статистики — кстати, одной из немногих, которые я действительно прочитал.
Всё очень просто:
Читаешь главу.
Решaешь все задачи по этой теме.
https://www.statlearning.com/
Нужно просто решать задачи и делать проекты.
Именно такой подход сделали для одной из лучших книг по основам статистики — кстати, одной из немногих, которые я действительно прочитал.
Всё очень просто:
Читаешь главу.
Решaешь все задачи по этой теме.
https://www.statlearning.com/
Если вы разберётесь в инфраструктуре инференса, без работы, скорее всего, не останетесь.
Этап 1. Системная база
C/C++ или Rust, производительность Python, Linux, иерархия памяти, выполнение на CPU и GPU.
Этап 2. Архитектура GPU
CUDA-ядра, тензорные ядра, видеопамять, пропускная способность памяти, загрузка SM и профилирование через nvidia-smi.
Этап 3. Как устроен инференс трансформеров
Prefill и decode, рост KV-кэша, расход памяти на attention и арифметическая интенсивность.
Этап 4. Движки для запуска моделей
vLLM, SGLang и TGI. Непрерывное пакетирование, PagedAttention, планирование запросов, баланс между пропускной способностью и задержкой.
Этап 5. Оптимизация KV-кэша
Кэширование префиксов, chunked prefill, квантизация KV-кэша, выгрузка кэша и повторное использование между сообщениями.
Этап 6. Квантизация и сжатие
FP8, INT8, AWQ, GPTQ и разреженность. Нужно уметь измерять, сколько качества вы теряете ради прироста скорости.
Этап 7. Ускоренное декодирование и параллелизм
Speculative decoding, Medusa, тензорный и конвейерный параллелизм.
Этап 8. Оптимизация на уровне ядер
Triton, FlashAttention, CUDA Graphs, объединение операций и профилирование через Nsight.
Этап 9. Распределённый инференс
Запуск на нескольких узлах, NVLink, InfiniBand, разделение prefill и decode, параллелизм экспертов в MoE.
Этап 10. Масштабирование и экономика
KEDA, холодный запуск, спотовые GPU, стоимость одного токена и загрузка вычислительных мощностей.
Этап 11. Маршрутизация и надёжность
Шлюзы для ИИ, резервные цепочки, лимиты запросов, TTFT, ITL, наблюдаемость и тестирование отказов.
Этап 12. Портфолио и замеры
Собственный кластер, опубликованные тесты задержки, пропускной способности и стоимости, разборы оптимизации ядер.
Большинство застревает на просмотре обучающих роликов.
Тех, кто реально строит такие системы, нанимают.
Этап 1. Системная база
C/C++ или Rust, производительность Python, Linux, иерархия памяти, выполнение на CPU и GPU.
Этап 2. Архитектура GPU
CUDA-ядра, тензорные ядра, видеопамять, пропускная способность памяти, загрузка SM и профилирование через nvidia-smi.
Этап 3. Как устроен инференс трансформеров
Prefill и decode, рост KV-кэша, расход памяти на attention и арифметическая интенсивность.
Этап 4. Движки для запуска моделей
vLLM, SGLang и TGI. Непрерывное пакетирование, PagedAttention, планирование запросов, баланс между пропускной способностью и задержкой.
Этап 5. Оптимизация KV-кэша
Кэширование префиксов, chunked prefill, квантизация KV-кэша, выгрузка кэша и повторное использование между сообщениями.
Этап 6. Квантизация и сжатие
FP8, INT8, AWQ, GPTQ и разреженность. Нужно уметь измерять, сколько качества вы теряете ради прироста скорости.
Этап 7. Ускоренное декодирование и параллелизм
Speculative decoding, Medusa, тензорный и конвейерный параллелизм.
Этап 8. Оптимизация на уровне ядер
Triton, FlashAttention, CUDA Graphs, объединение операций и профилирование через Nsight.
Этап 9. Распределённый инференс
Запуск на нескольких узлах, NVLink, InfiniBand, разделение prefill и decode, параллелизм экспертов в MoE.
Этап 10. Масштабирование и экономика
KEDA, холодный запуск, спотовые GPU, стоимость одного токена и загрузка вычислительных мощностей.
Этап 11. Маршрутизация и надёжность
Шлюзы для ИИ, резервные цепочки, лимиты запросов, TTFT, ITL, наблюдаемость и тестирование отказов.
Этап 12. Портфолио и замеры
Собственный кластер, опубликованные тесты задержки, пропускной способности и стоимости, разборы оптимизации ядер.
Большинство застревает на просмотре обучающих роликов.
Тех, кто реально строит такие системы, нанимают.
На курс основателя Z.ai и профессора Цинхуа Тан Цзе пришло столько людей, что аудитория на 112 человек оказалась забита, а часть студентов слушала стоя в проходах.
И программа объясняет почему.
За 16 недель студентов проводят почти через весь путь создания современной большой языковой модели своими руками. Нужно написать токенизатор и Transformer с нуля, обучить модель на 0,1 млрд параметров, сделать attention-ядро на Triton, проверить ускорение на нескольких GPU, очистить сырые данные, построить scaling law, сравнить SFT, DPO и RLVR.
Финальный проект ещё сложнее. Нужно собрать проверяемую среду, обучить агента на длинных задачах и показать рабочую демонстрацию. Работа идёт командами по 2–3 человека, а отчёт оформляется на английском в формате NeurIPS.
Сам Тан Цзе считает, что битва за чат-модели в основном уже закончена. Следующий этап — модели, которые сами запоминают, учатся, выполняют длинные задачи и со временем становятся сильнее.
Поэтому курс, который формально всё ещё называется машинным обучением, уже строится вокруг базовых моделей, масштабирования, синтетических данных, обучения с подкреплением, агентов, непрерывного обучения и ИИ, который обучает другой ИИ.
Если умеешь только вызывать API, здесь будет тяжело.
Ирония в том, что всё это задаёт человек, который стоит за GLM. Студентам предлагают собирать всё с нуля, пока рядом у них уже открыт GLM-5.3, готовый помогать с каждой частью.
И программа объясняет почему.
За 16 недель студентов проводят почти через весь путь создания современной большой языковой модели своими руками. Нужно написать токенизатор и Transformer с нуля, обучить модель на 0,1 млрд параметров, сделать attention-ядро на Triton, проверить ускорение на нескольких GPU, очистить сырые данные, построить scaling law, сравнить SFT, DPO и RLVR.
Финальный проект ещё сложнее. Нужно собрать проверяемую среду, обучить агента на длинных задачах и показать рабочую демонстрацию. Работа идёт командами по 2–3 человека, а отчёт оформляется на английском в формате NeurIPS.
Сам Тан Цзе считает, что битва за чат-модели в основном уже закончена. Следующий этап — модели, которые сами запоминают, учатся, выполняют длинные задачи и со временем становятся сильнее.
Поэтому курс, который формально всё ещё называется машинным обучением, уже строится вокруг базовых моделей, масштабирования, синтетических данных, обучения с подкреплением, агентов, непрерывного обучения и ИИ, который обучает другой ИИ.
Если умеешь только вызывать API, здесь будет тяжело.
Ирония в том, что всё это задаёт человек, который стоит за GLM. Студентам предлагают собирать всё с нуля, пока рядом у них уже открыт GLM-5.3, готовый помогать с каждой частью.
Z.ai рассказала, как GLM-5.3 помогала строить и оптимизировать инфраструктуру инференса для GLM-5.3-Flash.
От первого успешного запуска до готовности к продакшену система дошла меньше чем за две недели. За это время сквозная пропускная способность выросла примерно в три раза относительно первоначального варианта.
Главным оказался плотный цикл обратной связи. Локальные тесты на корректность, трассировки выполнения, микробенчмарки и сквозные замеры позволяли быстро проверять конкретные гипотезы, а не ориентироваться только на общие показатели производительности.
https://z.ai/blog/glm-built-its-inference-infrastructure
От первого успешного запуска до готовности к продакшену система дошла меньше чем за две недели. За это время сквозная пропускная способность выросла примерно в три раза относительно первоначального варианта.
Главным оказался плотный цикл обратной связи. Локальные тесты на корректность, трассировки выполнения, микробенчмарки и сквозные замеры позволяли быстро проверять конкретные гипотезы, а не ориентироваться только на общие показатели производительности.
https://z.ai/blog/glm-built-its-inference-infrastructure
z.ai
Toward Recursive Self-Improvement: How GLM Built Its Own Inference Infrastructure
This media is not supported in your browser
VIEW IN TELEGRAM
Небольшое напоминание: вы можете дообучить более 500 моделей с открытым исходным кодом прямо в бесплатном Google Colab.
Можно даже загрузить PDF или CSV и превратить их в готовые синтетические датасеты.
1. Откройте Google Colab по ссылке.
2. Запустите блоки для установки Unsloth Studio.
3. Выберите модель.
4. Загрузите датасет.
5. Всё готово.
После этого модель, конечно же, можно экспортировать.
https://github.com/unslothai/unsloth
https://unsloth.ai/docs/new/studio#features
Можно даже загрузить PDF или CSV и превратить их в готовые синтетические датасеты.
1. Откройте Google Colab по ссылке.
2. Запустите блоки для установки Unsloth Studio.
3. Выберите модель.
4. Загрузите датасет.
5. Всё готово.
После этого модель, конечно же, можно экспортировать.
https://github.com/unslothai/unsloth
https://unsloth.ai/docs/new/studio#features
Jev вышел всего несколько дней назад, а NanoJev уже выложил в открытый доступ весь пайплайн. И это не просто обёртка над API: здесь модель для параллельного принятия решений на 0,6 млрд параметров, данные и полный пайплайн обучения.
NanoJev буквально раскладывает по полочкам весь подход: "состояние + вопрос → полное распределение вероятностей без декодирования токенов".
В основе — всего лишь Qwen3-0.6B. За один проход модель может параллельно обрабатывать сразу несколько состояний и несколько вопросов.
Число вариантов динамическое — от 2 до 255. Поддерживаются три типа структурированных решений: Choice, Boolean и Score.
В лабиринте 50×50 модель дошла до финиша за 244 шага, столкнувшись 36 раз. В «Змейке» 12×12 съела 27 единиц еды и при этом осталась жива.
Модель и данные полностью открыты. Есть всё сразу: обучение, оценка, постоянно работающий сервис инференса и демонстрация со сравнением в трёх колонках.
Планирование выполняется кодом, а модель отвечает за локальные решения. То есть это не попытка заставить обычную чат-модель в лоб играть в игру.
Репозиторий: https://github.com/TianyuCodings/NanoJev
Модель и данные: C-Tianyu/NanoJev на Hugging Face.
Закрытая модель только успела заявить, что она в 200 раз быстрее, а в открытом коде уже собрали и запустили сквозную реализацию System One — пусть пока и на уровне игрушечного прототипа.
NanoJev буквально раскладывает по полочкам весь подход: "состояние + вопрос → полное распределение вероятностей без декодирования токенов".
В основе — всего лишь Qwen3-0.6B. За один проход модель может параллельно обрабатывать сразу несколько состояний и несколько вопросов.
Число вариантов динамическое — от 2 до 255. Поддерживаются три типа структурированных решений: Choice, Boolean и Score.
В лабиринте 50×50 модель дошла до финиша за 244 шага, столкнувшись 36 раз. В «Змейке» 12×12 съела 27 единиц еды и при этом осталась жива.
Модель и данные полностью открыты. Есть всё сразу: обучение, оценка, постоянно работающий сервис инференса и демонстрация со сравнением в трёх колонках.
Планирование выполняется кодом, а модель отвечает за локальные решения. То есть это не попытка заставить обычную чат-модель в лоб играть в игру.
Репозиторий: https://github.com/TianyuCodings/NanoJev
Модель и данные: C-Tianyu/NanoJev на Hugging Face.
Закрытая модель только успела заявить, что она в 200 раз быстрее, а в открытом коде уже собрали и запустили сквозную реализацию System One — пусть пока и на уровне игрушечного прототипа.
GitHub
GitHub - TianyuCodings/NanoJev: A nano replica of Jev: parallel decisions, dynamic candidates, and an end-to-end training pipeline.
A nano replica of Jev: parallel decisions, dynamic candidates, and an end-to-end training pipeline. - TianyuCodings/NanoJev
Data Portal | DS & ML
Один из создателей ChatGPT представил принципиально новый тип ИИ-моделей. Два года, Диогу Алмейда, втайне разрабатывал Jev — модель, которая не пишет текст и не генерирует токены последовательно. Она получает любые неструктурированные данные и параллельно…
Media is too big
VIEW IN TELEGRAM
Jev уже пробуют применять в автономном вождении.
По словам автора эксперимента, меньше чем за час на новой модели удалось собрать в симуляции полный цикл принятия решений для машины.
Повороты, перестроения, проезд перекрёстков, выезд на шоссе. Для каждого действия модель возвращает не текст, а типизированные вероятности возможных решений вместе с уровнем уверенности.
В этом и отличие Jev от обычных чат-моделей. На вход подаётся состояние системы, на выходе получается набор допустимых действий и их вероятности.
Если такой подход действительно хорошо масштабируется, порог входа в создание систем автономного вождения может заметно снизиться.
По словам автора эксперимента, меньше чем за час на новой модели удалось собрать в симуляции полный цикл принятия решений для машины.
Повороты, перестроения, проезд перекрёстков, выезд на шоссе. Для каждого действия модель возвращает не текст, а типизированные вероятности возможных решений вместе с уровнем уверенности.
В этом и отличие Jev от обычных чат-моделей. На вход подаётся состояние системы, на выходе получается набор допустимых действий и их вероятности.
Если такой подход действительно хорошо масштабируется, порог входа в создание систем автономного вождения может заметно снизиться.
Курс в Стэнфорде «Современный разработчик программного обеспечения» стартует в следующий вторник.
В этом репозитории на GitHub будут публиковаться все задания. Там уже доступны задания с прошлого года.
https://github.com/mihail911/modern-software-dev-assignments
В этом репозитории на GitHub будут публиковаться все задания. Там уже доступны задания с прошлого года.
https://github.com/mihail911/modern-software-dev-assignments
GitHub
GitHub - mihail911/modern-software-dev-assignments: Assignments for CS146S: The Modern Software Dev (Stanford University Fall 2026/2025)
Assignments for CS146S: The Modern Software Dev (Stanford University Fall 2026/2025) - mihail911/modern-software-dev-assignments
This media is not supported in your browser
VIEW IN TELEGRAM
Вышел подробный разбор управления роботами для тех, кто приходит в робототехнику из машинного обучения и не имеет профильной подготовки.
Автор на примере манипулятора SO-100 из проекта LeRobot показывает, что именно делает выход модели с сервоприводом, как работает ПИД-регулятор и почему дешёвые манипуляторы перелетают нужное положение.
Также разбираются запись данных при телеуправлении, пространство суставов и пространство задачи, прямая и обратная кинематика, ограничения рабочей области SO-100 и различия между тем, что предсказывают ACT и OpenVLA.
Всё сопровождается анимациями и практическими примерами. Следующий материал будет посвящён ACT.
Автор на примере манипулятора SO-100 из проекта LeRobot показывает, что именно делает выход модели с сервоприводом, как работает ПИД-регулятор и почему дешёвые манипуляторы перелетают нужное положение.
Также разбираются запись данных при телеуправлении, пространство суставов и пространство задачи, прямая и обратная кинематика, ограничения рабочей области SO-100 и различия между тем, что предсказывают ACT и OpenVLA.
Всё сопровождается анимациями и практическими примерами. Следующий материал будет посвящён ACT.
Если вы изучаете экономику или интересуетесь пересечением эконометрики, причинно-следственного анализа и машинного обучения, стоит прочитать работу Сьюзан Эйти.
Она разбирает, что машинное обучение действительно может дать экономике и эконометрике, а где его возможности заканчиваются.
Особенно полезно для понимания того, чем прогнозирование отличается от установления причинно-следственных связей и почему хорошие предсказания сами по себе ещё не отвечают на экономические вопросы.
https://nber.org/books-and-chapters/economics-artificial-intelligence-agenda/impact-machine-learning-economics
Она разбирает, что машинное обучение действительно может дать экономике и эконометрике, а где его возможности заканчиваются.
Особенно полезно для понимания того, чем прогнозирование отличается от установления причинно-следственных связей и почему хорошие предсказания сами по себе ещё не отвечают на экономические вопросы.
https://nber.org/books-and-chapters/economics-artificial-intelligence-agenda/impact-machine-learning-economics
MIT открыл полный курс по визуальной навигации для автономных систем.
Программа охватывает весь путь от восприятия окружающей среды до управления движением, а не отдельные алгоритмы. В курс входят 2D- и 3D-зрение, визуальная и визуально-инерциальная одометрия, SLAM, распознавание мест, построение карт, планирование траекторий и методы машинного обучения для задач навигации.
Курс рассчитан прежде всего на разработчиков робототехники, беспилотников и автономных автомобилей.
Все материалы доступны бесплатно, включая лекции, слайды и конспекты.
https://vnav.mit.edu
Программа охватывает весь путь от восприятия окружающей среды до управления движением, а не отдельные алгоритмы. В курс входят 2D- и 3D-зрение, визуальная и визуально-инерциальная одометрия, SLAM, распознавание мест, построение карт, планирование траекторий и методы машинного обучения для задач навигации.
Курс рассчитан прежде всего на разработчиков робототехники, беспилотников и автономных автомобилей.
Все материалы доступны бесплатно, включая лекции, слайды и конспекты.
https://vnav.mit.edu
На выходные — отличный материал по современному программированию GPU для систем машинного обучения.
MLC Community разбирает архитектуру GPU практически с нуля: потоки и варпы, иерархию памяти, CUDA Cores и Tensor Cores, TMA, устройство Blackwell, GEMM и Flash Attention 4. Отдельный упор сделан на то, как писать действительно быстрые ядра и эффективно загружать вычислительные блоки GPU.
https://mlc.ai/modern-gpu-programming-for-mlsys/chapter_background/index.html
MLC Community разбирает архитектуру GPU практически с нуля: потоки и варпы, иерархию памяти, CUDA Cores и Tensor Cores, TMA, устройство Blackwell, GEMM и Flash Attention 4. Отдельный упор сделан на то, как писать действительно быстрые ядра и эффективно загружать вычислительные блоки GPU.
https://mlc.ai/modern-gpu-programming-for-mlsys/chapter_background/index.html
В открытом доступе появился GuppyLM — проект, который позволяет обучить языковую модель на 9 млн параметров с нуля примерно за пять минут.
Репозиторий включает весь процесс обучения и рассчитан на быстрые эксперименты с небольшими языковыми моделями без крупной инфраструктуры.
https://github.com/arman-bd/guppylm
Репозиторий включает весь процесс обучения и рассчитан на быстрые эксперименты с небольшими языковыми моделями без крупной инфраструктуры.
https://github.com/arman-bd/guppylm
GitHub
GitHub - arman-bd/guppylm: A ~9M parameter LLM that talks like a small fish.
A ~9M parameter LLM that talks like a small fish. Contribute to arman-bd/guppylm development by creating an account on GitHub.
Bespoke Labs выпустила Nimble — открытый аналог Jev с опубликованными данными, рецептом обучения и весами модели.
Nimble построен на Qwen3.5-9B и дообучен через LoRA без дистилляции из Jev. Сам Jev использовался только как ориентир для оценки качества.
Ключевой метод — контрастный отбор данных: в примерах меняется один критически важный факт, который должен изменить итоговое решение. Все данные синтетические и охватывают 10 категорий, при этом обучающая и тестовая выборки разделены.
Модель не генерирует длинный текст, а напрямую работает с вероятностями токенов возможных ответов через параллельное ограниченное декодирование.
На собственном наборе тестов базовый Qwen получил 66%, Nimble — 90%, Jev — 93%. Задержка на H100 составляет около 100 мс, а модель можно запускать локально на MacBook.
Обучение с подкреплением пока не использовалось.
Код:
https://github.com/bespokelabsai/nimble
Модель:
https://huggingface.co/bespokelabs/Bespoke-Nimble-9B
Ограничение — единого внешнего теста пока нет, поэтому качество за пределами этих 10 категорий ещё предстоит проверить.
Nimble построен на Qwen3.5-9B и дообучен через LoRA без дистилляции из Jev. Сам Jev использовался только как ориентир для оценки качества.
Ключевой метод — контрастный отбор данных: в примерах меняется один критически важный факт, который должен изменить итоговое решение. Все данные синтетические и охватывают 10 категорий, при этом обучающая и тестовая выборки разделены.
Модель не генерирует длинный текст, а напрямую работает с вероятностями токенов возможных ответов через параллельное ограниченное декодирование.
На собственном наборе тестов базовый Qwen получил 66%, Nimble — 90%, Jev — 93%. Задержка на H100 составляет около 100 мс, а модель можно запускать локально на MacBook.
Обучение с подкреплением пока не использовалось.
Код:
https://github.com/bespokelabsai/nimble
Модель:
https://huggingface.co/bespokelabs/Bespoke-Nimble-9B
Ограничение — единого внешнего теста пока нет, поэтому качество за пределами этих 10 категорий ещё предстоит проверить.
GitHub
GitHub - bespokelabsai/nimble: Local typed decisions, contrastive data curation, and model evaluation.
Local typed decisions, contrastive data curation, and model evaluation. - bespokelabsai/nimble
Apple развивает MLX-LM — инструмент, который позволяет запускать и дообучать языковые модели прямо на Mac.
Проект создан командой ml-explore и уже набрал более 7 тыс. звёзд на GitHub.
Главное преимущество — простой запуск. Вместо ручного поиска квантованной версии модели и настройки среды достаточно одной команды и имени модели с Hugging Face. По умолчанию можно запустить 4-битную Llama 3.2 3B, а другую модель выбрать через параметр
В той же среде поддерживаются LoRA и полное дообучение, в том числе для квантованных моделей. Вычисления можно распределять между несколькими машинами через
Для длинного контекста есть вращающийся KV-кэш и кэш подсказок, поэтому при повторной работе с одним документом не нужно каждый раз заново обрабатывать весь контекст.
И главное — модель работает локально, поэтому данные остаются на устройстве.
https://github.com/ml-explore/mlx-lm
Проект создан командой ml-explore и уже набрал более 7 тыс. звёзд на GitHub.
Главное преимущество — простой запуск. Вместо ручного поиска квантованной версии модели и настройки среды достаточно одной команды и имени модели с Hugging Face. По умолчанию можно запустить 4-битную Llama 3.2 3B, а другую модель выбрать через параметр
--model.В той же среде поддерживаются LoRA и полное дообучение, в том числе для квантованных моделей. Вычисления можно распределять между несколькими машинами через
mx.distributed.Для длинного контекста есть вращающийся KV-кэш и кэш подсказок, поэтому при повторной работе с одним документом не нужно каждый раз заново обрабатывать весь контекст.
И главное — модель работает локально, поэтому данные остаются на устройстве.
https://github.com/ml-explore/mlx-lm
GitHub
GitHub - ml-explore/mlx-lm: Run LLMs with MLX
Run LLMs with MLX. Contribute to ml-explore/mlx-lm development by creating an account on GitHub.
Вот один из лучших материалов для начала, если хотите понять, что процессор на самом деле делает.
https://youtu.be/GU8MnZI0snA
https://youtu.be/GU8MnZI0snA