«Маленькая книга по основам генеративного ИИ» — интуитивное введение в математику: arxiv.org/pdf/2605.29713
Масштабирование вычислений на этапе инференса, часть 1. Себастьян Рашка.
Начинаем с модифицированной функции генерации текста: масштабирование температурой, top-p-фильтрация и мультиномиальное сэмплирование. Всё это нужно, чтобы получать более разнообразные ответы для self-consistency и best-of-N, повышая точность ответов более чем в 2 раза.
00:00 — Введение и краткое повторение
00:31 — Масштабирование на этапе обучения и инференса
07:52 — Что будем реализовывать
11:47 — Настройка ноутбука и загрузка модели
17:43 — Создание гибкой функции генерации текста
24:40 — Промптинг с цепочкой рассуждений
28:26 — Сэмплирование и разнообразие ответов
33:43 — Логиты следующего токена и жадное декодирование
38:20 — Масштабирование температурой шаг за шагом
42:46 — Softmax и вероятности токенов
47:42 — Мультиномиальное сэмплирование
54:51 — Добавление температурного сэмплирования в генерацию текста
59:31 — Top-p-фильтрация шаг за шагом
1:10:23 — Добавление top-p-фильтрации в генерацию текста
1:13:43 — Сэмплирование и водяные знаки для LLM
1:16:01 — Self-consistency и голосование большинством
1:20:36 — Реализация self-consistency
1:29:02 — Результаты на MATH-500
1:35:01 — Компромисс между точностью и объёмом вычислений
1:36:50 — Следующие шаги и самодоработка
https://www.youtube.com/watch?v=t5y-kS9nNxU
Начинаем с модифицированной функции генерации текста: масштабирование температурой, top-p-фильтрация и мультиномиальное сэмплирование. Всё это нужно, чтобы получать более разнообразные ответы для self-consistency и best-of-N, повышая точность ответов более чем в 2 раза.
00:00 — Введение и краткое повторение
00:31 — Масштабирование на этапе обучения и инференса
07:52 — Что будем реализовывать
11:47 — Настройка ноутбука и загрузка модели
17:43 — Создание гибкой функции генерации текста
24:40 — Промптинг с цепочкой рассуждений
28:26 — Сэмплирование и разнообразие ответов
33:43 — Логиты следующего токена и жадное декодирование
38:20 — Масштабирование температурой шаг за шагом
42:46 — Softmax и вероятности токенов
47:42 — Мультиномиальное сэмплирование
54:51 — Добавление температурного сэмплирования в генерацию текста
59:31 — Top-p-фильтрация шаг за шагом
1:10:23 — Добавление top-p-фильтрации в генерацию текста
1:13:43 — Сэмплирование и водяные знаки для LLM
1:16:01 — Self-consistency и голосование большинством
1:20:36 — Реализация self-consistency
1:29:02 — Результаты на MATH-500
1:35:01 — Компромисс между точностью и объёмом вычислений
1:36:50 — Следующие шаги и самодоработка
https://www.youtube.com/watch?v=t5y-kS9nNxU
YouTube
Build A Reasoning Model From Scratch 4: Inference Scaling 1 (Temperature, Top-p, Self-Consistency)
After motivating the use cases for inference-time scaling, this video first walks through temperature scaling, top-p filtering, and multinomial sampling to generate diverse answers with an LLM. Then, using these techniques, we implement self-consistency to…
Если речь идёт об инференсе, нельзя пропустить отдельную главу на эту тему в книге «How to Scale Your Model».
https://jax-ml.github.io/scaling-book/inference/
https://jax-ml.github.io/scaling-book/inference/
Когда в временном ряду отсутствует 90% данных: восстанавливайте динамику, а не отдельные значения
Большинство методов заполнения пропусков в научных временных рядах предсказывают недостающие значения по корреляциям в наблюдаемых данных.
Авторы исследования предлагают другой подход: сначала восстановить геометрию динамической системы.
С помощью вложения с задержкой по одной переменной, наблюдаемой без пропусков, можно реконструировать аттрактор системы в пространстве состояний. Переменная с пропусками даёт частичную реконструкцию той же динамики. Затем модель изучает отображение между двумя реконструированными многообразиями и с помощью гауссовского процесса восстанавливает недостающие состояния.
Главное здесь в том, что машинному обучению не нужно открывать динамику с нуля. Теория динамических систем даёт априорное знание: разные наблюдения одной системы должны отражать эквивалентную структуру пространства состояний. Гауссовский процесс изучает только отображение между этими представлениями.
Это особенно полезно, когда данных крайне мало. В 120-мерной системе Лоренца одна переменная наблюдается полностью, а у остальных 119 отсутствует 90% значений. При этом средняя корреляция восстановленных сигналов с истинными данными достигает 0,84. Для 120-мерной системы Рёсслера она составляет 0,81.
Подход работает и на реальных данных. При реконструкции 64-канальной ЭЭГ, где один сигнал доступен полностью, а в остальных отсутствует 90% значений, корреляция достигает примерно 0,9.
Для применения ИИ в науке вывод шире: если данные порождены динамической системой, её динамика ограничивает возможные значения в пропусках. Вместо того чтобы просить модель угадывать отдельные точки, можно восстановить скрытую структуру, благодаря которой эти точки возникают.
https://www.nature.com/articles/s41467-026-77922-1
Большинство методов заполнения пропусков в научных временных рядах предсказывают недостающие значения по корреляциям в наблюдаемых данных.
Авторы исследования предлагают другой подход: сначала восстановить геометрию динамической системы.
С помощью вложения с задержкой по одной переменной, наблюдаемой без пропусков, можно реконструировать аттрактор системы в пространстве состояний. Переменная с пропусками даёт частичную реконструкцию той же динамики. Затем модель изучает отображение между двумя реконструированными многообразиями и с помощью гауссовского процесса восстанавливает недостающие состояния.
Главное здесь в том, что машинному обучению не нужно открывать динамику с нуля. Теория динамических систем даёт априорное знание: разные наблюдения одной системы должны отражать эквивалентную структуру пространства состояний. Гауссовский процесс изучает только отображение между этими представлениями.
Это особенно полезно, когда данных крайне мало. В 120-мерной системе Лоренца одна переменная наблюдается полностью, а у остальных 119 отсутствует 90% значений. При этом средняя корреляция восстановленных сигналов с истинными данными достигает 0,84. Для 120-мерной системы Рёсслера она составляет 0,81.
Подход работает и на реальных данных. При реконструкции 64-канальной ЭЭГ, где один сигнал доступен полностью, а в остальных отсутствует 90% значений, корреляция достигает примерно 0,9.
Для применения ИИ в науке вывод шире: если данные порождены динамической системой, её динамика ограничивает возможные значения в пропусках. Вместо того чтобы просить модель угадывать отдельные точки, можно восстановить скрытую структуру, благодаря которой эти точки возникают.
https://www.nature.com/articles/s41467-026-77922-1
«Intermediate Microeconomics» — это бесплатный учебник, который содержит математическое изложение основных моделей, используемых в микроэкономике.
Книга рассматривает теорию потребителя, предпочтения и полезность, спрос, производственные функции и функции издержек, максимизацию прибыли, спрос и предложение, совершенную конкуренцию и общее равновесие, а затем переходит к монополии, олигополии, стратегиям ценообразования, теории игр, асимметричной информации, принятию решений в условиях неопределённости и многим другим темам.
Я считаю, что это интересный ресурс не только для изучения экономики, но и для понимания того, как математика формирует фундамент экономических моделей.
Такие рынки, как совершенная конкуренция, монополия и олигополия, можно описать через точные уравнения и математические зависимости, которые определяют, как принимать решения, устанавливать цены, выбирать объёмы производства и взаимодействовать с конкурентами.
https://open.oregonstate.education/intermediatemicroeconomics/
Книга рассматривает теорию потребителя, предпочтения и полезность, спрос, производственные функции и функции издержек, максимизацию прибыли, спрос и предложение, совершенную конкуренцию и общее равновесие, а затем переходит к монополии, олигополии, стратегиям ценообразования, теории игр, асимметричной информации, принятию решений в условиях неопределённости и многим другим темам.
Я считаю, что это интересный ресурс не только для изучения экономики, но и для понимания того, как математика формирует фундамент экономических моделей.
Такие рынки, как совершенная конкуренция, монополия и олигополия, можно описать через точные уравнения и математические зависимости, которые определяют, как принимать решения, устанавливать цены, выбирать объёмы производства и взаимодействовать с конкурентами.
https://open.oregonstate.education/intermediatemicroeconomics/
Соберите DeepSeek с нуля. 🙂
Автор сделал бесплатный 16-часовой курс на YouTube, где пошагово разбирает создание модели в стиле DeepSeek с нуля — от статей и теории до полного кода.
Внутри:
- механизм внимания с нормальным объяснением
- Multi-Head Latent Attention
- Grouped Query Attention
- позиционные кодировки
- Mixture of Experts
- и многое другое
Нужны только ноутбук и регулярность.
https://www.youtube.com/watch?v=QWNxQIq0hMo&list=PLPTV0NXA_ZSiOpKKlHCyOq9lnp-dLvlms
Автор сделал бесплатный 16-часовой курс на YouTube, где пошагово разбирает создание модели в стиле DeepSeek с нуля — от статей и теории до полного кода.
Внутри:
- механизм внимания с нормальным объяснением
- Multi-Head Latent Attention
- Grouped Query Attention
- позиционные кодировки
- Mixture of Experts
- и многое другое
Нужны только ноутбук и регулярность.
https://www.youtube.com/watch?v=QWNxQIq0hMo&list=PLPTV0NXA_ZSiOpKKlHCyOq9lnp-dLvlms
Please open Telegram to view this post
VIEW IN TELEGRAM
Модель Ember-1 сейчас активно обсуждают на Hacker News.
Исследовательская команда дообучила Kimi K3 так, чтобы модель рассуждала примерно на 40% короче.😳
Качество осталось на том же уровне, а сама модель стала примерно на 40% быстрее и дешевле.
И это хороший пример того, как сегодня имеет смысл строить передовые LLM. Если у вас есть несколько десятков миллионов долларов, необязательно обучать новую модель с нуля. Можно взять уже сильную существующую модель и вложить этот бюджет в её дообучение.
https://fireworks.ai/blog/ember-1
Ember-1 уже доступна в Cline, в том числе в новом десктопном приложении.
Исследовательская команда дообучила Kimi K3 так, чтобы модель рассуждала примерно на 40% короче.
Качество осталось на том же уровне, а сама модель стала примерно на 40% быстрее и дешевле.
И это хороший пример того, как сегодня имеет смысл строить передовые LLM. Если у вас есть несколько десятков миллионов долларов, необязательно обучать новую модель с нуля. Можно взять уже сильную существующую модель и вложить этот бюджет в её дообучение.
https://fireworks.ai/blog/ember-1
Ember-1 уже доступна в Cline, в том числе в новом десктопном приложении.
Please open Telegram to view this post
VIEW IN TELEGRAM
NVIDIA Model Optimizer — единая библиотека с современными методами оптимизации моделей: квантизацией, дистилляцией, прунингом, поиском архитектуры нейросетей, спекулятивным декодированием и другими техниками.
Она сжимает модели глубокого обучения для последующего запуска через TensorRT-LLM, TensorRT, vLLM и другие среды, чтобы ускорить инференс.
https://github.com/NVIDIA/Model-Optimizer
Она сжимает модели глубокого обучения для последующего запуска через TensorRT-LLM, TensorRT, vLLM и другие среды, чтобы ускорить инференс.
https://github.com/NVIDIA/Model-Optimizer
GitHub
GitHub - NVIDIA/Model-Optimizer: A unified library of SOTA model optimization techniques like quantization, distillation, pruning…
A unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downs...
«Game Theory with Engineering Applications» — это бесплатный сборник конспектов лекций MIT, который даёт математическое введение в теорию игр и дизайн механизмов, с особым акцентом на применение в инженерии, информатике и сетевых системах.
Материал разбит на 21 лекцию. В них рассматриваются игры в стратегической форме и концепции решений, равновесия Нэша, их существование и вычисление, непрерывные и разрывные игры, супермодулярные и потенциальные игры, эволюция и обучение в играх, игры в развернутой форме, решение Нэша для переговоров, повторяющиеся игры, байесовские равновесия Нэша и игры с неполной информацией, дизайн механизмов, а также теория общественного выбора и голосования.
Я просмотрел несколько конспектов лекций и нашёл их понятными и очень хорошо структурированными. Они достаточно компактные, но при этом дают достаточно объяснений, чтобы материал оставался доступным даже для тех, кто впервые знакомится с теорией игр.
https://ocw.mit.edu/courses/6-254-game-theory-with-engineering-applications-spring-2010/resources/mit6_254s10_lec05/
Материал разбит на 21 лекцию. В них рассматриваются игры в стратегической форме и концепции решений, равновесия Нэша, их существование и вычисление, непрерывные и разрывные игры, супермодулярные и потенциальные игры, эволюция и обучение в играх, игры в развернутой форме, решение Нэша для переговоров, повторяющиеся игры, байесовские равновесия Нэша и игры с неполной информацией, дизайн механизмов, а также теория общественного выбора и голосования.
Я просмотрел несколько конспектов лекций и нашёл их понятными и очень хорошо структурированными. Они достаточно компактные, но при этом дают достаточно объяснений, чтобы материал оставался доступным даже для тех, кто впервые знакомится с теорией игр.
https://ocw.mit.edu/courses/6-254-game-theory-with-engineering-applications-spring-2010/resources/mit6_254s10_lec05/
У каждого зрелого системного проекта рано или поздно должна появиться учебная версия.
TinyTorch — бесплатный курс с открытым исходным кодом. В нём вы с нуля создаёте работающий фреймворк для машинного обучения на чистом Python, используя тот же интерфейс программирования, что и в PyTorch. Путь начинается с тензоров и заканчивается трансформерами.
Видеокарта не нужна: курс работает на ноутбуке с 4 ГБ оперативной памяти. В нём 20 практических модулей, которые помогают разработчикам, студентам и инженерам разобраться во внутреннем устройстве PyTorch.
https://github.com/keith2018/TinyTorch
TinyTorch — бесплатный курс с открытым исходным кодом. В нём вы с нуля создаёте работающий фреймворк для машинного обучения на чистом Python, используя тот же интерфейс программирования, что и в PyTorch. Путь начинается с тензоров и заканчивается трансформерами.
Видеокарта не нужна: курс работает на ноутбуке с 4 ГБ оперативной памяти. В нём 20 практических модулей, которые помогают разработчикам, студентам и инженерам разобраться во внутреннем устройстве PyTorch.
https://github.com/keith2018/TinyTorch
GitHub
GitHub - keith2018/TinyTorch: A lightweight deep learning training framework implemented from scratch in C++, featuring a PyTorch…
A lightweight deep learning training framework implemented from scratch in C++, featuring a PyTorch-style API. - keith2018/TinyTorch
This media is not supported in your browser
VIEW IN TELEGRAM
Уже видели интерактивное объяснение Transformer?
Очень крутая визуализация того, как работает архитектура.
https://poloclub.github.io/transformer-explainer/
Очень крутая визуализация того, как работает архитектура.
https://poloclub.github.io/transformer-explainer/
This media is not supported in your browser
VIEW IN TELEGRAM
Вышел UniMate — открытая модель для генерации анимаций риггированных 3D-персонажей.
Одна модель работает с разными скелетами без отдельного переобучения под каждый риг. Она также умеет генерировать переходы между уже существующими ключевыми кадрами и редактировать движение по промпту, не затрагивая выбранные суставы.
Код опубликован под MIT, доступны и веса для тестирования.
https://github.com/Friedrich-M/UniMate
Одна модель работает с разными скелетами без отдельного переобучения под каждый риг. Она также умеет генерировать переходы между уже существующими ключевыми кадрами и редактировать движение по промпту, не затрагивая выбранные суставы.
Код опубликован под MIT, доступны и веса для тестирования.
https://github.com/Friedrich-M/UniMate
Подборка с объяснениями ключевых концепций и научных работ по машинному обучению:
https://github.com/dair-ai/ML-Papers-Explained
https://github.com/dair-ai/ML-Papers-Explained
GitHub
GitHub - dair-ai/ML-Papers-Explained: Explanation to key concepts in ML
Explanation to key concepts in ML. Contribute to dair-ai/ML-Papers-Explained development by creating an account on GitHub.
«Тригонометрия» — бесплатный открытый учебник по тригонометрии объёмом более 1000 страниц, который охватывает тему от основ до продвинутых разделов.
В книге рассматриваются углы и треугольники, тригонометрические отношения, единичная окружность, функции синуса, косинуса и тангенса, графики и их преобразования, радианы, решение треугольников, теоремы синусов и косинусов, тригонометрические тождества и уравнения, обратные тригонометрические функции, а также формулы суммы, разности и двойного угла.
В более поздних главах также разбираются векторы, скалярное произведение, полярные координаты и комплексные числа в полярной форме.
Каждый раздел содержит множество упражнений, поэтому учебник особенно полезен для закрепления теории на практике по мере прохождения материала.
https://louis.pressbooks.pub/trigonometry/
В книге рассматриваются углы и треугольники, тригонометрические отношения, единичная окружность, функции синуса, косинуса и тангенса, графики и их преобразования, радианы, решение треугольников, теоремы синусов и косинусов, тригонометрические тождества и уравнения, обратные тригонометрические функции, а также формулы суммы, разности и двойного угла.
В более поздних главах также разбираются векторы, скалярное произведение, полярные координаты и комплексные числа в полярной форме.
Каждый раздел содержит множество упражнений, поэтому учебник особенно полезен для закрепления теории на практике по мере прохождения материала.
https://louis.pressbooks.pub/trigonometry/
Нельзя просто выбрать модель и видеокарту и считать, что на этом всё.
Нужно выбрать формат файлов и путь выполнения ядер. Уже от них зависит, как именно будет работать GPU.
Начнём с самого цикла.
Текст превращается в токены. Токены проходят через Transformer. Механизм внимания определяет, какие предыдущие токены важны. Среда выполнения хранит KV-кэш, чтобы модель не пересчитывала весь разговор заново при каждом новом токене. Затем выбирается следующий токен, и цикл повторяется.
Модель не пишет весь ответ целиком за один проход. Она генерирует его по одному токену.
У этого цикла есть две фазы, и это разные задачи.
Prefill читает промпт и создаёт первый KV-кэш. Эта стадия сильно упирается в вычисления. Именно она во многом отвечает за паузу перед первым словом.
Decode генерирует ответ по одному токену. На этой стадии постоянно перечитываются веса и кэш, поэтому она сильнее зависит от пропускной способности памяти. Поэтому RTX PRO 6000 с 1,8 ТБ/с может заметно обгонять DGX Spark с 273 ГБ/с. Именно это ощущается как скорость «печатания».
Длинные промпты сильнее бьют по prefill. Длинные ответы — по decode. Длинные диалоги нагружают обе стадии, потому что растёт рабочая память.
Движок инференса — это не сама модель.
Это диспетчер трафика, менеджер памяти, планировщик, диспетчер ядер, система учёта кэша и API.
Он загружает веса, токенизирует вход, запускает прямой проход, выбирает следующий токен, хранит KV-кэш и отдаёт результат потоком.
Серьёзные движки ещё и выбирают ядра.
Ядро — это не «модель». Это конкретная тензорная программа: формы, раскладки, типы данных и то, какие именно операции разрешено выполнять железу.
На бумаге математика может быть одинаковой. Ядро — разное.
Формат файла тоже критически важен. Он определяет, что вообще можно загрузить, как это можно квантовать и насколько быстро всё будет работать.
Квантование — это не один переключатель.
Хранить веса в 4 битах — не то же самое, что выполнять вычисления в 4 битах. Квантование весов уменьшает размер модели. Активный контекст — отдельная история. Метка Q4 сама по себе ничего универсального не гарантирует.
Правильный формат — тот, под который в вашем движке есть оптимизированные ядра.
Именно из-за непонимания этого люди покупают RTX 5090, скачивают что-то с пометкой NVFP4 и всё равно не получают ожидаемую производительность.
Вот конкретный пример.
Я запустил Qwen 3.8 27B на RTX 5090. Два файла. Одна и та же модель. Та же видеокарта. В обеих папках написано NVFP4.
Но одна версия действительно выполняет 4-битную математику. Веса в 4 битах. Активации тоже в 4 битах. Матричные блоки могут умножать 4-битные значения на 4-битные.
Другая версия лишь хранит веса в 4 битах. Затем ядро распаковывает их и выполняет вычисления уже в 16 битах.
Это другой путь выполнения ядер.
RTX 5090 сама это не выбирала. Это определил чекпойнт. В особенности то, были ли активации тоже 4-битными.
Если нет, то корректного умножения 4 бит × 4 бита просто не существует. Движок тихо откатывается на другой вариант. Файл при этом всё равно нормально загружается.
Вот в чём разница между форматом, который можно загрузить, операцией, которую умеет выполнять бэкенд, и арифметикой, которую реально исполняет железо.
Это не одно и то же.
Поэтому prefill и decode тоже не получают одинаковый выигрыш.
Во время prefill токенов достаточно много, чтобы хорошо загрузить матричные блоки. Нативная 4-битная математика здесь действительно может дать заметный прирост.
Decode всё ещё идёт по весам и кэшу токен за токеном. Если рабочее состояние не было переведено в 4 бита, то и полноценного выигрыша от 4-битных вычислений на этой стадии не будет. Просто меняется узкое место.
Не тестируйте просто «модель».
Тестируйте весь стек, который реально собираетесь использовать. И отдельно измеряйте prefill и decode.
Нужно выбрать формат файлов и путь выполнения ядер. Уже от них зависит, как именно будет работать GPU.
Начнём с самого цикла.
Текст превращается в токены. Токены проходят через Transformer. Механизм внимания определяет, какие предыдущие токены важны. Среда выполнения хранит KV-кэш, чтобы модель не пересчитывала весь разговор заново при каждом новом токене. Затем выбирается следующий токен, и цикл повторяется.
Модель не пишет весь ответ целиком за один проход. Она генерирует его по одному токену.
У этого цикла есть две фазы, и это разные задачи.
Prefill читает промпт и создаёт первый KV-кэш. Эта стадия сильно упирается в вычисления. Именно она во многом отвечает за паузу перед первым словом.
Decode генерирует ответ по одному токену. На этой стадии постоянно перечитываются веса и кэш, поэтому она сильнее зависит от пропускной способности памяти. Поэтому RTX PRO 6000 с 1,8 ТБ/с может заметно обгонять DGX Spark с 273 ГБ/с. Именно это ощущается как скорость «печатания».
Длинные промпты сильнее бьют по prefill. Длинные ответы — по decode. Длинные диалоги нагружают обе стадии, потому что растёт рабочая память.
Движок инференса — это не сама модель.
Это диспетчер трафика, менеджер памяти, планировщик, диспетчер ядер, система учёта кэша и API.
Он загружает веса, токенизирует вход, запускает прямой проход, выбирает следующий токен, хранит KV-кэш и отдаёт результат потоком.
Серьёзные движки ещё и выбирают ядра.
Ядро — это не «модель». Это конкретная тензорная программа: формы, раскладки, типы данных и то, какие именно операции разрешено выполнять железу.
На бумаге математика может быть одинаковой. Ядро — разное.
Формат файла тоже критически важен. Он определяет, что вообще можно загрузить, как это можно квантовать и насколько быстро всё будет работать.
Квантование — это не один переключатель.
Хранить веса в 4 битах — не то же самое, что выполнять вычисления в 4 битах. Квантование весов уменьшает размер модели. Активный контекст — отдельная история. Метка Q4 сама по себе ничего универсального не гарантирует.
Правильный формат — тот, под который в вашем движке есть оптимизированные ядра.
Именно из-за непонимания этого люди покупают RTX 5090, скачивают что-то с пометкой NVFP4 и всё равно не получают ожидаемую производительность.
Вот конкретный пример.
Я запустил Qwen 3.8 27B на RTX 5090. Два файла. Одна и та же модель. Та же видеокарта. В обеих папках написано NVFP4.
Но одна версия действительно выполняет 4-битную математику. Веса в 4 битах. Активации тоже в 4 битах. Матричные блоки могут умножать 4-битные значения на 4-битные.
Другая версия лишь хранит веса в 4 битах. Затем ядро распаковывает их и выполняет вычисления уже в 16 битах.
Это другой путь выполнения ядер.
RTX 5090 сама это не выбирала. Это определил чекпойнт. В особенности то, были ли активации тоже 4-битными.
Если нет, то корректного умножения 4 бит × 4 бита просто не существует. Движок тихо откатывается на другой вариант. Файл при этом всё равно нормально загружается.
Вот в чём разница между форматом, который можно загрузить, операцией, которую умеет выполнять бэкенд, и арифметикой, которую реально исполняет железо.
Это не одно и то же.
Поэтому prefill и decode тоже не получают одинаковый выигрыш.
Во время prefill токенов достаточно много, чтобы хорошо загрузить матричные блоки. Нативная 4-битная математика здесь действительно может дать заметный прирост.
Decode всё ещё идёт по весам и кэшу токен за токеном. Если рабочее состояние не было переведено в 4 бита, то и полноценного выигрыша от 4-битных вычислений на этой стадии не будет. Просто меняется узкое место.
Не тестируйте просто «модель».
Тестируйте весь стек, который реально собираетесь использовать. И отдельно измеряйте prefill и decode.
Если хочешь стать дата-инженером, изучи эти концепции: https://de-concepts.ssp.sh
Дальше можно пройтись по практическим навыкам — от команд Linux, контейнеризации и языков программирования до оркестрации в Kubernetes.
Здесь собран набор основных инструментов, с которыми работает дата-инженер в 2026 году: https://toolkit.ssp.sh
А если хочется сразу перейти к практике, есть подборка из более чем 80 проектов с открытым исходным кодом, выходивших с 2022 года по сегодняшний день: https://oss-de-projects.ssp.sh
И если этого мало, есть Data Engineering Vault — больше 1000 связанных заметок по дата-инженерии, полностью бесплатно:: https://vault.ssp.sh
Дальше можно пройтись по практическим навыкам — от команд Linux, контейнеризации и языков программирования до оркестрации в Kubernetes.
Здесь собран набор основных инструментов, с которыми работает дата-инженер в 2026 году: https://toolkit.ssp.sh
А если хочется сразу перейти к практике, есть подборка из более чем 80 проектов с открытым исходным кодом, выходивших с 2022 года по сегодняшний день: https://oss-de-projects.ssp.sh
И если этого мало, есть Data Engineering Vault — больше 1000 связанных заметок по дата-инженерии, полностью бесплатно:: https://vault.ssp.sh