Можно ли строить модели мира полностью в скрытом пространстве, вообще без предсказания пикселей?
Исследователи представили Contrastive World Models.
Статья: arxiv.org/abs/2609.22175
Работа была написана независимо, между сменой позиций, с минимальными вычислительными ресурсами. Интересным направлением для дальнейших исследований было бы масштабирование CWM на более крупные области.
Исследователи представили Contrastive World Models.
Мы обучаем скрытые состояния так, чтобы максимизировать взаимную информацию с будущими наблюдениями — без декодеров и без восстановления пикселей.
Contrastive World Models дают:
существенно более устойчивые представления;
более эффективное обучение за счёт полного отказа от пиксельного декодера;
универсальный подход с минимальным числом предположений.
В стандартной целевой функции модели мира мы заменяем восстановление пикселей на Deep InfoMax — максимизируем взаимную информацию между скрытым состоянием и локальными признаками будущих наблюдений.
В экспериментах небольшого масштаба CWM показывает результаты на уровне базовых подходов с восстановлением пикселей и предсказанием через momentum в стандартных условиях, а при добавлении отвлекающих факторов или фонов из реального видео существенно превосходит оба подхода.
Статья: arxiv.org/abs/2609.22175
Работа была написана независимо, между сменой позиций, с минимальными вычислительными ресурсами. Интересным направлением для дальнейших исследований было бы масштабирование CWM на более крупные области.
Метрополис — Гастингс (MH) — это алгоритм Монте-Карло по цепям Маркова (MCMC) для генерации выборок из сложного вероятностного распределения, когда напрямую получать из него выборки затруднительно.
Для заданной целевой плотности π(x) алгоритм предлагает новое состояние x′ из распределения предложений q(x′|x) и принимает его с вероятностью
α(x,x′) = min{1, [π(x′)q(x|x′)]/[π(x)q(x′|x)]}.
Если предложенное состояние отклоняется, цепь остаётся в состоянии x. При выполнении подходящих условий полученная цепь Маркова имеет π в качестве стационарного распределения, поэтому средние значения по сгенерированным выборкам позволяют приближённо вычислять математические ожидания относительно целевого распределения.
MH — один из фундаментальных методов статистического машинного обучения, особенно в байесовском выводе. Когда апостериорное распределение p(θ|D) невозможно получить аналитически, MCMC позволяет генерировать приближённые выборки из апостериорного распределения и на их основе оценивать параметры, доверительные интервалы в байесовском смысле и предиктивные распределения.
Метод применяется в байесовской регрессии, иерархических моделях, моделях со скрытыми переменными, графических моделях и при оценке неопределённости.
Алгоритм также иллюстрирует одну из ключевых идей вычислительной статистики: вместо того чтобы напрямую решать задачу интегрирования или оптимизации, можно построить стохастический процесс, долгосрочное поведение которого воспроизводит нужное распределение.
Современные методы, такие как гамильтоновский метод Монте-Карло и метод Монте-Карло Ланжевена, развивают этот же принцип.
Для заданной целевой плотности π(x) алгоритм предлагает новое состояние x′ из распределения предложений q(x′|x) и принимает его с вероятностью
α(x,x′) = min{1, [π(x′)q(x|x′)]/[π(x)q(x′|x)]}.
Если предложенное состояние отклоняется, цепь остаётся в состоянии x. При выполнении подходящих условий полученная цепь Маркова имеет π в качестве стационарного распределения, поэтому средние значения по сгенерированным выборкам позволяют приближённо вычислять математические ожидания относительно целевого распределения.
MH — один из фундаментальных методов статистического машинного обучения, особенно в байесовском выводе. Когда апостериорное распределение p(θ|D) невозможно получить аналитически, MCMC позволяет генерировать приближённые выборки из апостериорного распределения и на их основе оценивать параметры, доверительные интервалы в байесовском смысле и предиктивные распределения.
Метод применяется в байесовской регрессии, иерархических моделях, моделях со скрытыми переменными, графических моделях и при оценке неопределённости.
Алгоритм также иллюстрирует одну из ключевых идей вычислительной статистики: вместо того чтобы напрямую решать задачу интегрирования или оптимизации, можно построить стохастический процесс, долгосрочное поведение которого воспроизводит нужное распределение.
Современные методы, такие как гамильтоновский метод Монте-Карло и метод Монте-Карло Ланжевена, развивают этот же принцип.
«Маленькая книга по основам генеративного ИИ» — интуитивное введение в математику: arxiv.org/pdf/2605.29713
Масштабирование вычислений на этапе инференса, часть 1. Себастьян Рашка.
Начинаем с модифицированной функции генерации текста: масштабирование температурой, top-p-фильтрация и мультиномиальное сэмплирование. Всё это нужно, чтобы получать более разнообразные ответы для self-consistency и best-of-N, повышая точность ответов более чем в 2 раза.
00:00 — Введение и краткое повторение
00:31 — Масштабирование на этапе обучения и инференса
07:52 — Что будем реализовывать
11:47 — Настройка ноутбука и загрузка модели
17:43 — Создание гибкой функции генерации текста
24:40 — Промптинг с цепочкой рассуждений
28:26 — Сэмплирование и разнообразие ответов
33:43 — Логиты следующего токена и жадное декодирование
38:20 — Масштабирование температурой шаг за шагом
42:46 — Softmax и вероятности токенов
47:42 — Мультиномиальное сэмплирование
54:51 — Добавление температурного сэмплирования в генерацию текста
59:31 — Top-p-фильтрация шаг за шагом
1:10:23 — Добавление top-p-фильтрации в генерацию текста
1:13:43 — Сэмплирование и водяные знаки для LLM
1:16:01 — Self-consistency и голосование большинством
1:20:36 — Реализация self-consistency
1:29:02 — Результаты на MATH-500
1:35:01 — Компромисс между точностью и объёмом вычислений
1:36:50 — Следующие шаги и самодоработка
https://www.youtube.com/watch?v=t5y-kS9nNxU
Начинаем с модифицированной функции генерации текста: масштабирование температурой, top-p-фильтрация и мультиномиальное сэмплирование. Всё это нужно, чтобы получать более разнообразные ответы для self-consistency и best-of-N, повышая точность ответов более чем в 2 раза.
00:00 — Введение и краткое повторение
00:31 — Масштабирование на этапе обучения и инференса
07:52 — Что будем реализовывать
11:47 — Настройка ноутбука и загрузка модели
17:43 — Создание гибкой функции генерации текста
24:40 — Промптинг с цепочкой рассуждений
28:26 — Сэмплирование и разнообразие ответов
33:43 — Логиты следующего токена и жадное декодирование
38:20 — Масштабирование температурой шаг за шагом
42:46 — Softmax и вероятности токенов
47:42 — Мультиномиальное сэмплирование
54:51 — Добавление температурного сэмплирования в генерацию текста
59:31 — Top-p-фильтрация шаг за шагом
1:10:23 — Добавление top-p-фильтрации в генерацию текста
1:13:43 — Сэмплирование и водяные знаки для LLM
1:16:01 — Self-consistency и голосование большинством
1:20:36 — Реализация self-consistency
1:29:02 — Результаты на MATH-500
1:35:01 — Компромисс между точностью и объёмом вычислений
1:36:50 — Следующие шаги и самодоработка
https://www.youtube.com/watch?v=t5y-kS9nNxU
YouTube
Build A Reasoning Model From Scratch 4: Inference Scaling 1 (Temperature, Top-p, Self-Consistency)
After motivating the use cases for inference-time scaling, this video first walks through temperature scaling, top-p filtering, and multinomial sampling to generate diverse answers with an LLM. Then, using these techniques, we implement self-consistency to…
Если речь идёт об инференсе, нельзя пропустить отдельную главу на эту тему в книге «How to Scale Your Model».
https://jax-ml.github.io/scaling-book/inference/
https://jax-ml.github.io/scaling-book/inference/
Когда в временном ряду отсутствует 90% данных: восстанавливайте динамику, а не отдельные значения
Большинство методов заполнения пропусков в научных временных рядах предсказывают недостающие значения по корреляциям в наблюдаемых данных.
Авторы исследования предлагают другой подход: сначала восстановить геометрию динамической системы.
С помощью вложения с задержкой по одной переменной, наблюдаемой без пропусков, можно реконструировать аттрактор системы в пространстве состояний. Переменная с пропусками даёт частичную реконструкцию той же динамики. Затем модель изучает отображение между двумя реконструированными многообразиями и с помощью гауссовского процесса восстанавливает недостающие состояния.
Главное здесь в том, что машинному обучению не нужно открывать динамику с нуля. Теория динамических систем даёт априорное знание: разные наблюдения одной системы должны отражать эквивалентную структуру пространства состояний. Гауссовский процесс изучает только отображение между этими представлениями.
Это особенно полезно, когда данных крайне мало. В 120-мерной системе Лоренца одна переменная наблюдается полностью, а у остальных 119 отсутствует 90% значений. При этом средняя корреляция восстановленных сигналов с истинными данными достигает 0,84. Для 120-мерной системы Рёсслера она составляет 0,81.
Подход работает и на реальных данных. При реконструкции 64-канальной ЭЭГ, где один сигнал доступен полностью, а в остальных отсутствует 90% значений, корреляция достигает примерно 0,9.
Для применения ИИ в науке вывод шире: если данные порождены динамической системой, её динамика ограничивает возможные значения в пропусках. Вместо того чтобы просить модель угадывать отдельные точки, можно восстановить скрытую структуру, благодаря которой эти точки возникают.
https://www.nature.com/articles/s41467-026-77922-1
Большинство методов заполнения пропусков в научных временных рядах предсказывают недостающие значения по корреляциям в наблюдаемых данных.
Авторы исследования предлагают другой подход: сначала восстановить геометрию динамической системы.
С помощью вложения с задержкой по одной переменной, наблюдаемой без пропусков, можно реконструировать аттрактор системы в пространстве состояний. Переменная с пропусками даёт частичную реконструкцию той же динамики. Затем модель изучает отображение между двумя реконструированными многообразиями и с помощью гауссовского процесса восстанавливает недостающие состояния.
Главное здесь в том, что машинному обучению не нужно открывать динамику с нуля. Теория динамических систем даёт априорное знание: разные наблюдения одной системы должны отражать эквивалентную структуру пространства состояний. Гауссовский процесс изучает только отображение между этими представлениями.
Это особенно полезно, когда данных крайне мало. В 120-мерной системе Лоренца одна переменная наблюдается полностью, а у остальных 119 отсутствует 90% значений. При этом средняя корреляция восстановленных сигналов с истинными данными достигает 0,84. Для 120-мерной системы Рёсслера она составляет 0,81.
Подход работает и на реальных данных. При реконструкции 64-канальной ЭЭГ, где один сигнал доступен полностью, а в остальных отсутствует 90% значений, корреляция достигает примерно 0,9.
Для применения ИИ в науке вывод шире: если данные порождены динамической системой, её динамика ограничивает возможные значения в пропусках. Вместо того чтобы просить модель угадывать отдельные точки, можно восстановить скрытую структуру, благодаря которой эти точки возникают.
https://www.nature.com/articles/s41467-026-77922-1
«Intermediate Microeconomics» — это бесплатный учебник, который содержит математическое изложение основных моделей, используемых в микроэкономике.
Книга рассматривает теорию потребителя, предпочтения и полезность, спрос, производственные функции и функции издержек, максимизацию прибыли, спрос и предложение, совершенную конкуренцию и общее равновесие, а затем переходит к монополии, олигополии, стратегиям ценообразования, теории игр, асимметричной информации, принятию решений в условиях неопределённости и многим другим темам.
Я считаю, что это интересный ресурс не только для изучения экономики, но и для понимания того, как математика формирует фундамент экономических моделей.
Такие рынки, как совершенная конкуренция, монополия и олигополия, можно описать через точные уравнения и математические зависимости, которые определяют, как принимать решения, устанавливать цены, выбирать объёмы производства и взаимодействовать с конкурентами.
https://open.oregonstate.education/intermediatemicroeconomics/
Книга рассматривает теорию потребителя, предпочтения и полезность, спрос, производственные функции и функции издержек, максимизацию прибыли, спрос и предложение, совершенную конкуренцию и общее равновесие, а затем переходит к монополии, олигополии, стратегиям ценообразования, теории игр, асимметричной информации, принятию решений в условиях неопределённости и многим другим темам.
Я считаю, что это интересный ресурс не только для изучения экономики, но и для понимания того, как математика формирует фундамент экономических моделей.
Такие рынки, как совершенная конкуренция, монополия и олигополия, можно описать через точные уравнения и математические зависимости, которые определяют, как принимать решения, устанавливать цены, выбирать объёмы производства и взаимодействовать с конкурентами.
https://open.oregonstate.education/intermediatemicroeconomics/
Соберите DeepSeek с нуля. 🙂
Автор сделал бесплатный 16-часовой курс на YouTube, где пошагово разбирает создание модели в стиле DeepSeek с нуля — от статей и теории до полного кода.
Внутри:
- механизм внимания с нормальным объяснением
- Multi-Head Latent Attention
- Grouped Query Attention
- позиционные кодировки
- Mixture of Experts
- и многое другое
Нужны только ноутбук и регулярность.
https://www.youtube.com/watch?v=QWNxQIq0hMo&list=PLPTV0NXA_ZSiOpKKlHCyOq9lnp-dLvlms
Автор сделал бесплатный 16-часовой курс на YouTube, где пошагово разбирает создание модели в стиле DeepSeek с нуля — от статей и теории до полного кода.
Внутри:
- механизм внимания с нормальным объяснением
- Multi-Head Latent Attention
- Grouped Query Attention
- позиционные кодировки
- Mixture of Experts
- и многое другое
Нужны только ноутбук и регулярность.
https://www.youtube.com/watch?v=QWNxQIq0hMo&list=PLPTV0NXA_ZSiOpKKlHCyOq9lnp-dLvlms
Please open Telegram to view this post
VIEW IN TELEGRAM
Модель Ember-1 сейчас активно обсуждают на Hacker News.
Исследовательская команда дообучила Kimi K3 так, чтобы модель рассуждала примерно на 40% короче.😳
Качество осталось на том же уровне, а сама модель стала примерно на 40% быстрее и дешевле.
И это хороший пример того, как сегодня имеет смысл строить передовые LLM. Если у вас есть несколько десятков миллионов долларов, необязательно обучать новую модель с нуля. Можно взять уже сильную существующую модель и вложить этот бюджет в её дообучение.
https://fireworks.ai/blog/ember-1
Ember-1 уже доступна в Cline, в том числе в новом десктопном приложении.
Исследовательская команда дообучила Kimi K3 так, чтобы модель рассуждала примерно на 40% короче.
Качество осталось на том же уровне, а сама модель стала примерно на 40% быстрее и дешевле.
И это хороший пример того, как сегодня имеет смысл строить передовые LLM. Если у вас есть несколько десятков миллионов долларов, необязательно обучать новую модель с нуля. Можно взять уже сильную существующую модель и вложить этот бюджет в её дообучение.
https://fireworks.ai/blog/ember-1
Ember-1 уже доступна в Cline, в том числе в новом десктопном приложении.
Please open Telegram to view this post
VIEW IN TELEGRAM
NVIDIA Model Optimizer — единая библиотека с современными методами оптимизации моделей: квантизацией, дистилляцией, прунингом, поиском архитектуры нейросетей, спекулятивным декодированием и другими техниками.
Она сжимает модели глубокого обучения для последующего запуска через TensorRT-LLM, TensorRT, vLLM и другие среды, чтобы ускорить инференс.
https://github.com/NVIDIA/Model-Optimizer
Она сжимает модели глубокого обучения для последующего запуска через TensorRT-LLM, TensorRT, vLLM и другие среды, чтобы ускорить инференс.
https://github.com/NVIDIA/Model-Optimizer
GitHub
GitHub - NVIDIA/Model-Optimizer: A unified library of SOTA model optimization techniques like quantization, distillation, pruning…
A unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downs...
«Game Theory with Engineering Applications» — это бесплатный сборник конспектов лекций MIT, который даёт математическое введение в теорию игр и дизайн механизмов, с особым акцентом на применение в инженерии, информатике и сетевых системах.
Материал разбит на 21 лекцию. В них рассматриваются игры в стратегической форме и концепции решений, равновесия Нэша, их существование и вычисление, непрерывные и разрывные игры, супермодулярные и потенциальные игры, эволюция и обучение в играх, игры в развернутой форме, решение Нэша для переговоров, повторяющиеся игры, байесовские равновесия Нэша и игры с неполной информацией, дизайн механизмов, а также теория общественного выбора и голосования.
Я просмотрел несколько конспектов лекций и нашёл их понятными и очень хорошо структурированными. Они достаточно компактные, но при этом дают достаточно объяснений, чтобы материал оставался доступным даже для тех, кто впервые знакомится с теорией игр.
https://ocw.mit.edu/courses/6-254-game-theory-with-engineering-applications-spring-2010/resources/mit6_254s10_lec05/
Материал разбит на 21 лекцию. В них рассматриваются игры в стратегической форме и концепции решений, равновесия Нэша, их существование и вычисление, непрерывные и разрывные игры, супермодулярные и потенциальные игры, эволюция и обучение в играх, игры в развернутой форме, решение Нэша для переговоров, повторяющиеся игры, байесовские равновесия Нэша и игры с неполной информацией, дизайн механизмов, а также теория общественного выбора и голосования.
Я просмотрел несколько конспектов лекций и нашёл их понятными и очень хорошо структурированными. Они достаточно компактные, но при этом дают достаточно объяснений, чтобы материал оставался доступным даже для тех, кто впервые знакомится с теорией игр.
https://ocw.mit.edu/courses/6-254-game-theory-with-engineering-applications-spring-2010/resources/mit6_254s10_lec05/
У каждого зрелого системного проекта рано или поздно должна появиться учебная версия.
TinyTorch — бесплатный курс с открытым исходным кодом. В нём вы с нуля создаёте работающий фреймворк для машинного обучения на чистом Python, используя тот же интерфейс программирования, что и в PyTorch. Путь начинается с тензоров и заканчивается трансформерами.
Видеокарта не нужна: курс работает на ноутбуке с 4 ГБ оперативной памяти. В нём 20 практических модулей, которые помогают разработчикам, студентам и инженерам разобраться во внутреннем устройстве PyTorch.
https://github.com/keith2018/TinyTorch
TinyTorch — бесплатный курс с открытым исходным кодом. В нём вы с нуля создаёте работающий фреймворк для машинного обучения на чистом Python, используя тот же интерфейс программирования, что и в PyTorch. Путь начинается с тензоров и заканчивается трансформерами.
Видеокарта не нужна: курс работает на ноутбуке с 4 ГБ оперативной памяти. В нём 20 практических модулей, которые помогают разработчикам, студентам и инженерам разобраться во внутреннем устройстве PyTorch.
https://github.com/keith2018/TinyTorch
GitHub
GitHub - keith2018/TinyTorch: A lightweight deep learning training framework implemented from scratch in C++, featuring a PyTorch…
A lightweight deep learning training framework implemented from scratch in C++, featuring a PyTorch-style API. - keith2018/TinyTorch
This media is not supported in your browser
VIEW IN TELEGRAM
Уже видели интерактивное объяснение Transformer?
Очень крутая визуализация того, как работает архитектура.
https://poloclub.github.io/transformer-explainer/
Очень крутая визуализация того, как работает архитектура.
https://poloclub.github.io/transformer-explainer/
This media is not supported in your browser
VIEW IN TELEGRAM
Вышел UniMate — открытая модель для генерации анимаций риггированных 3D-персонажей.
Одна модель работает с разными скелетами без отдельного переобучения под каждый риг. Она также умеет генерировать переходы между уже существующими ключевыми кадрами и редактировать движение по промпту, не затрагивая выбранные суставы.
Код опубликован под MIT, доступны и веса для тестирования.
https://github.com/Friedrich-M/UniMate
Одна модель работает с разными скелетами без отдельного переобучения под каждый риг. Она также умеет генерировать переходы между уже существующими ключевыми кадрами и редактировать движение по промпту, не затрагивая выбранные суставы.
Код опубликован под MIT, доступны и веса для тестирования.
https://github.com/Friedrich-M/UniMate
Подборка с объяснениями ключевых концепций и научных работ по машинному обучению:
https://github.com/dair-ai/ML-Papers-Explained
https://github.com/dair-ai/ML-Papers-Explained
GitHub
GitHub - dair-ai/ML-Papers-Explained: Explanation to key concepts in ML
Explanation to key concepts in ML. Contribute to dair-ai/ML-Papers-Explained development by creating an account on GitHub.
«Тригонометрия» — бесплатный открытый учебник по тригонометрии объёмом более 1000 страниц, который охватывает тему от основ до продвинутых разделов.
В книге рассматриваются углы и треугольники, тригонометрические отношения, единичная окружность, функции синуса, косинуса и тангенса, графики и их преобразования, радианы, решение треугольников, теоремы синусов и косинусов, тригонометрические тождества и уравнения, обратные тригонометрические функции, а также формулы суммы, разности и двойного угла.
В более поздних главах также разбираются векторы, скалярное произведение, полярные координаты и комплексные числа в полярной форме.
Каждый раздел содержит множество упражнений, поэтому учебник особенно полезен для закрепления теории на практике по мере прохождения материала.
https://louis.pressbooks.pub/trigonometry/
В книге рассматриваются углы и треугольники, тригонометрические отношения, единичная окружность, функции синуса, косинуса и тангенса, графики и их преобразования, радианы, решение треугольников, теоремы синусов и косинусов, тригонометрические тождества и уравнения, обратные тригонометрические функции, а также формулы суммы, разности и двойного угла.
В более поздних главах также разбираются векторы, скалярное произведение, полярные координаты и комплексные числа в полярной форме.
Каждый раздел содержит множество упражнений, поэтому учебник особенно полезен для закрепления теории на практике по мере прохождения материала.
https://louis.pressbooks.pub/trigonometry/
Нельзя просто выбрать модель и видеокарту и считать, что на этом всё.
Нужно выбрать формат файлов и путь выполнения ядер. Уже от них зависит, как именно будет работать GPU.
Начнём с самого цикла.
Текст превращается в токены. Токены проходят через Transformer. Механизм внимания определяет, какие предыдущие токены важны. Среда выполнения хранит KV-кэш, чтобы модель не пересчитывала весь разговор заново при каждом новом токене. Затем выбирается следующий токен, и цикл повторяется.
Модель не пишет весь ответ целиком за один проход. Она генерирует его по одному токену.
У этого цикла есть две фазы, и это разные задачи.
Prefill читает промпт и создаёт первый KV-кэш. Эта стадия сильно упирается в вычисления. Именно она во многом отвечает за паузу перед первым словом.
Decode генерирует ответ по одному токену. На этой стадии постоянно перечитываются веса и кэш, поэтому она сильнее зависит от пропускной способности памяти. Поэтому RTX PRO 6000 с 1,8 ТБ/с может заметно обгонять DGX Spark с 273 ГБ/с. Именно это ощущается как скорость «печатания».
Длинные промпты сильнее бьют по prefill. Длинные ответы — по decode. Длинные диалоги нагружают обе стадии, потому что растёт рабочая память.
Движок инференса — это не сама модель.
Это диспетчер трафика, менеджер памяти, планировщик, диспетчер ядер, система учёта кэша и API.
Он загружает веса, токенизирует вход, запускает прямой проход, выбирает следующий токен, хранит KV-кэш и отдаёт результат потоком.
Серьёзные движки ещё и выбирают ядра.
Ядро — это не «модель». Это конкретная тензорная программа: формы, раскладки, типы данных и то, какие именно операции разрешено выполнять железу.
На бумаге математика может быть одинаковой. Ядро — разное.
Формат файла тоже критически важен. Он определяет, что вообще можно загрузить, как это можно квантовать и насколько быстро всё будет работать.
Квантование — это не один переключатель.
Хранить веса в 4 битах — не то же самое, что выполнять вычисления в 4 битах. Квантование весов уменьшает размер модели. Активный контекст — отдельная история. Метка Q4 сама по себе ничего универсального не гарантирует.
Правильный формат — тот, под который в вашем движке есть оптимизированные ядра.
Именно из-за непонимания этого люди покупают RTX 5090, скачивают что-то с пометкой NVFP4 и всё равно не получают ожидаемую производительность.
Вот конкретный пример.
Я запустил Qwen 3.8 27B на RTX 5090. Два файла. Одна и та же модель. Та же видеокарта. В обеих папках написано NVFP4.
Но одна версия действительно выполняет 4-битную математику. Веса в 4 битах. Активации тоже в 4 битах. Матричные блоки могут умножать 4-битные значения на 4-битные.
Другая версия лишь хранит веса в 4 битах. Затем ядро распаковывает их и выполняет вычисления уже в 16 битах.
Это другой путь выполнения ядер.
RTX 5090 сама это не выбирала. Это определил чекпойнт. В особенности то, были ли активации тоже 4-битными.
Если нет, то корректного умножения 4 бит × 4 бита просто не существует. Движок тихо откатывается на другой вариант. Файл при этом всё равно нормально загружается.
Вот в чём разница между форматом, который можно загрузить, операцией, которую умеет выполнять бэкенд, и арифметикой, которую реально исполняет железо.
Это не одно и то же.
Поэтому prefill и decode тоже не получают одинаковый выигрыш.
Во время prefill токенов достаточно много, чтобы хорошо загрузить матричные блоки. Нативная 4-битная математика здесь действительно может дать заметный прирост.
Decode всё ещё идёт по весам и кэшу токен за токеном. Если рабочее состояние не было переведено в 4 бита, то и полноценного выигрыша от 4-битных вычислений на этой стадии не будет. Просто меняется узкое место.
Не тестируйте просто «модель».
Тестируйте весь стек, который реально собираетесь использовать. И отдельно измеряйте prefill и decode.
Нужно выбрать формат файлов и путь выполнения ядер. Уже от них зависит, как именно будет работать GPU.
Начнём с самого цикла.
Текст превращается в токены. Токены проходят через Transformer. Механизм внимания определяет, какие предыдущие токены важны. Среда выполнения хранит KV-кэш, чтобы модель не пересчитывала весь разговор заново при каждом новом токене. Затем выбирается следующий токен, и цикл повторяется.
Модель не пишет весь ответ целиком за один проход. Она генерирует его по одному токену.
У этого цикла есть две фазы, и это разные задачи.
Prefill читает промпт и создаёт первый KV-кэш. Эта стадия сильно упирается в вычисления. Именно она во многом отвечает за паузу перед первым словом.
Decode генерирует ответ по одному токену. На этой стадии постоянно перечитываются веса и кэш, поэтому она сильнее зависит от пропускной способности памяти. Поэтому RTX PRO 6000 с 1,8 ТБ/с может заметно обгонять DGX Spark с 273 ГБ/с. Именно это ощущается как скорость «печатания».
Длинные промпты сильнее бьют по prefill. Длинные ответы — по decode. Длинные диалоги нагружают обе стадии, потому что растёт рабочая память.
Движок инференса — это не сама модель.
Это диспетчер трафика, менеджер памяти, планировщик, диспетчер ядер, система учёта кэша и API.
Он загружает веса, токенизирует вход, запускает прямой проход, выбирает следующий токен, хранит KV-кэш и отдаёт результат потоком.
Серьёзные движки ещё и выбирают ядра.
Ядро — это не «модель». Это конкретная тензорная программа: формы, раскладки, типы данных и то, какие именно операции разрешено выполнять железу.
На бумаге математика может быть одинаковой. Ядро — разное.
Формат файла тоже критически важен. Он определяет, что вообще можно загрузить, как это можно квантовать и насколько быстро всё будет работать.
Квантование — это не один переключатель.
Хранить веса в 4 битах — не то же самое, что выполнять вычисления в 4 битах. Квантование весов уменьшает размер модели. Активный контекст — отдельная история. Метка Q4 сама по себе ничего универсального не гарантирует.
Правильный формат — тот, под который в вашем движке есть оптимизированные ядра.
Именно из-за непонимания этого люди покупают RTX 5090, скачивают что-то с пометкой NVFP4 и всё равно не получают ожидаемую производительность.
Вот конкретный пример.
Я запустил Qwen 3.8 27B на RTX 5090. Два файла. Одна и та же модель. Та же видеокарта. В обеих папках написано NVFP4.
Но одна версия действительно выполняет 4-битную математику. Веса в 4 битах. Активации тоже в 4 битах. Матричные блоки могут умножать 4-битные значения на 4-битные.
Другая версия лишь хранит веса в 4 битах. Затем ядро распаковывает их и выполняет вычисления уже в 16 битах.
Это другой путь выполнения ядер.
RTX 5090 сама это не выбирала. Это определил чекпойнт. В особенности то, были ли активации тоже 4-битными.
Если нет, то корректного умножения 4 бит × 4 бита просто не существует. Движок тихо откатывается на другой вариант. Файл при этом всё равно нормально загружается.
Вот в чём разница между форматом, который можно загрузить, операцией, которую умеет выполнять бэкенд, и арифметикой, которую реально исполняет железо.
Это не одно и то же.
Поэтому prefill и decode тоже не получают одинаковый выигрыш.
Во время prefill токенов достаточно много, чтобы хорошо загрузить матричные блоки. Нативная 4-битная математика здесь действительно может дать заметный прирост.
Decode всё ещё идёт по весам и кэшу токен за токеном. Если рабочее состояние не было переведено в 4 бита, то и полноценного выигрыша от 4-битных вычислений на этой стадии не будет. Просто меняется узкое место.
Не тестируйте просто «модель».
Тестируйте весь стек, который реально собираетесь использовать. И отдельно измеряйте prefill и decode.
Если хочешь стать дата-инженером, изучи эти концепции: https://de-concepts.ssp.sh
Дальше можно пройтись по практическим навыкам — от команд Linux, контейнеризации и языков программирования до оркестрации в Kubernetes.
Здесь собран набор основных инструментов, с которыми работает дата-инженер в 2026 году: https://toolkit.ssp.sh
А если хочется сразу перейти к практике, есть подборка из более чем 80 проектов с открытым исходным кодом, выходивших с 2022 года по сегодняшний день: https://oss-de-projects.ssp.sh
И если этого мало, есть Data Engineering Vault — больше 1000 связанных заметок по дата-инженерии, полностью бесплатно:: https://vault.ssp.sh
Дальше можно пройтись по практическим навыкам — от команд Linux, контейнеризации и языков программирования до оркестрации в Kubernetes.
Здесь собран набор основных инструментов, с которыми работает дата-инженер в 2026 году: https://toolkit.ssp.sh
А если хочется сразу перейти к практике, есть подборка из более чем 80 проектов с открытым исходным кодом, выходивших с 2022 года по сегодняшний день: https://oss-de-projects.ssp.sh
И если этого мало, есть Data Engineering Vault — больше 1000 связанных заметок по дата-инженерии, полностью бесплатно:: https://vault.ssp.sh