Тем временем в Китае.
«Последний ИИ, созданный людьми: на пути к настоящему рекурсивному самоулучшению».
Новая 75-страничная работа исследователей из Шанхайского университета Цзяотун, Университета Цинхуа, ByteDance, Shanghai AI Lab и других организаций описывает дорожную карту к настоящему рекурсивному самоулучшению.
Речь об ИИ-системах, которые не просто лучше выполняют задачи, а непрерывно улучшают сами механизмы, за счёт которых они становятся лучше.
Авторы описывают пять стадий роста автономности:
ИИ выполняет улучшения, разработанные человеком
сам выбирает стратегии собственного улучшения
сам решает, какой опыт и какие данные ему нужны
непрерывно адаптируется на основе обратной связи из реального мира
наконец достигает уровня L5, метаулучшения, где он изменяет и наследует сам процесс, используемый для создания более совершенных систем-преемников
https://arxiv.org/pdf/2609.11873
«Последний ИИ, созданный людьми: на пути к настоящему рекурсивному самоулучшению».
Новая 75-страничная работа исследователей из Шанхайского университета Цзяотун, Университета Цинхуа, ByteDance, Shanghai AI Lab и других организаций описывает дорожную карту к настоящему рекурсивному самоулучшению.
Речь об ИИ-системах, которые не просто лучше выполняют задачи, а непрерывно улучшают сами механизмы, за счёт которых они становятся лучше.
Авторы описывают пять стадий роста автономности:
ИИ выполняет улучшения, разработанные человеком
сам выбирает стратегии собственного улучшения
сам решает, какой опыт и какие данные ему нужны
непрерывно адаптируется на основе обратной связи из реального мира
наконец достигает уровня L5, метаулучшения, где он изменяет и наследует сам процесс, используемый для создания более совершенных систем-преемников
https://arxiv.org/pdf/2609.11873
image_2026-09-14_08-40-46.png
1.1 MB
Большинство слышит «дообучение» и сразу думает, что мы обновляем миллиарды весов большой языковой модели.
Но часто это не так.
Современные методы дообучения позволяют адаптировать модель, почти не трогая её исходные предобученные веса.
Если вы переходите из Data Science в AI Engineering, стоит знать эти 5 подходов.
1. LoRA — учим обновление, а не сами веса
Замораживаем W.
Обучаем две небольшие матрицы:
ΔW = BA
То есть:
W' = W + BA
Фактически мы учим небольшую поправку к модели.
2. LoRA-FA — замораживаем ещё больше
Замораживаем W и A.
Обучаем только B.
Идея та же, но обучаемых параметров ещё меньше.
3. VeRA — не обучаем даже сами матрицы
Фиксируем случайные A и B.
Обучаем только небольшие векторы масштабирования, которые управляют вкладом этих матриц.
Очень высокая параметрическая эффективность.
4. Delta-LoRA — позволяем базовой модели тоже меняться
В отличие от обычной LoRA, здесь W тоже может обновляться, но эти изменения направляются низкоранговой адаптацией.
5. LoRA+ — та же LoRA, но с другой оптимизацией
A и B обучаются с разными скоростями обучения.
Обычно:
ηB > ηA
Главная идея здесь в том, что дообучение не обязательно означает переобучение всей модели.
LoRA → 2 матрицы
LoRA-FA → 1 матрица
VeRA → векторы масштабирования
LoRA+ → 2 матрицы с разными скоростями обучения
Delta-LoRA → низкоранговые обновления + изменяющиеся базовые веса
Пять подходов к одному и тому же вопросу:
какой минимум нам на самом деле нужно обучать?
Именно это и есть параметрически эффективное дообучение — концепция, которую стоит понимать специалистам по Data Science при переходе в AI Engineering.
Но часто это не так.
Современные методы дообучения позволяют адаптировать модель, почти не трогая её исходные предобученные веса.
Если вы переходите из Data Science в AI Engineering, стоит знать эти 5 подходов.
1. LoRA — учим обновление, а не сами веса
Замораживаем W.
Обучаем две небольшие матрицы:
ΔW = BA
То есть:
W' = W + BA
Фактически мы учим небольшую поправку к модели.
2. LoRA-FA — замораживаем ещё больше
Замораживаем W и A.
Обучаем только B.
Идея та же, но обучаемых параметров ещё меньше.
3. VeRA — не обучаем даже сами матрицы
Фиксируем случайные A и B.
Обучаем только небольшие векторы масштабирования, которые управляют вкладом этих матриц.
Очень высокая параметрическая эффективность.
4. Delta-LoRA — позволяем базовой модели тоже меняться
В отличие от обычной LoRA, здесь W тоже может обновляться, но эти изменения направляются низкоранговой адаптацией.
5. LoRA+ — та же LoRA, но с другой оптимизацией
A и B обучаются с разными скоростями обучения.
Обычно:
ηB > ηA
Главная идея здесь в том, что дообучение не обязательно означает переобучение всей модели.
LoRA → 2 матрицы
LoRA-FA → 1 матрица
VeRA → векторы масштабирования
LoRA+ → 2 матрицы с разными скоростями обучения
Delta-LoRA → низкоранговые обновления + изменяющиеся базовые веса
Пять подходов к одному и тому же вопросу:
какой минимум нам на самом деле нужно обучать?
Именно это и есть параметрически эффективное дообучение — концепция, которую стоит понимать специалистам по Data Science при переходе в AI Engineering.
«Введение в высшую инженерную математику и математический анализ» — это открытый учебник, который охватывает функции, комплексные числа, линейную алгебру, математический анализ, производные и интегралы, последовательности и ряды, ряды Тейлора, обыкновенные дифференциальные уравнения и уравнения в частных производных, ряды Фурье, разделение переменных, преобразования Фурье и Лапласа и многое другое.
Также есть заключительная глава о нейронных сетях прямого распространения, в которой рассматриваются линейные и нелинейные сети, функции ReLU, регрессия и теория приближений.
Почти 500 страниц — это довольно серьёзный материал, и он доступен бесплатно здесь:
https://open.oregonstate.education/app/uploads/sites/246/2023/06/Introduction_to_Advanced_Engineering_Mathematics_and_AnalysisA.pdf
Также есть заключительная глава о нейронных сетях прямого распространения, в которой рассматриваются линейные и нелинейные сети, функции ReLU, регрессия и теория приближений.
Почти 500 страниц — это довольно серьёзный материал, и он доступен бесплатно здесь:
https://open.oregonstate.education/app/uploads/sites/246/2023/06/Introduction_to_Advanced_Engineering_Mathematics_and_AnalysisA.pdf
«A Mathematical Explanation of Transformers» — свежая статья, в которой авторы строят строгую математическую модель архитектуры трансформеров и больших языковых моделей.
Трансформер рассматривается как дискретизация непрерывного интегро-дифференциального уравнения. Self-attention описывается как нелокальный интегральный оператор, нормализация слоя — как проекция на множество с ограничениями, а полносвязные слои и функции активации включаются в ту же математическую схему.
Затем через расщепление операторов и численную дискретизацию авторы получают стандартную архитектуру Transformer и расширяют этот подход на многоголовое внимание, Vision Transformer и сверточные трансформеры.
Я уже делился несколькими материалами по математике нейросетей, трансформеров и больших языковых моделей, но в этой области постоянно появляется что-то новое и интересное.
https://arxiv.org/pdf/2510.03989
Трансформер рассматривается как дискретизация непрерывного интегро-дифференциального уравнения. Self-attention описывается как нелокальный интегральный оператор, нормализация слоя — как проекция на множество с ограничениями, а полносвязные слои и функции активации включаются в ту же математическую схему.
Затем через расщепление операторов и численную дискретизацию авторы получают стандартную архитектуру Transformer и расширяют этот подход на многоголовое внимание, Vision Transformer и сверточные трансформеры.
Я уже делился несколькими материалами по математике нейросетей, трансформеров и больших языковых моделей, но в этой области постоянно появляется что-то новое и интересное.
https://arxiv.org/pdf/2510.03989
Вы когда-нибудь задумывались, как модели машинного обучения предсказывают будущее?
За всем стоят теория вероятностей и статистика, а Python — тот самый инструмент, который приводит всё это в движение.
https://pyoflife.com/python-for-probability-statistics-and-machine-learning-pdf/
За всем стоят теория вероятностей и статистика, а Python — тот самый инструмент, который приводит всё это в движение.
https://pyoflife.com/python-for-probability-statistics-and-machine-learning-pdf/
PYOFLIFE
Python for probability statistics and machine learning - PYOFLIFE
Python is a popular programming language that has gained significant traction in the fields of probability, statistics, and machine learning.
Какой-то парень открыл исходный код инструмента, который преобразует PDF в Markdown со скоростью 100 страниц в секунду.
Он называется OpenDataLoader.
Работает полностью на процессоре и умеет обрабатывать сложную верстку, таблицы и вложенные структуры.
Полностью бесплатный.
https://github.com/opendataloader-project/opendataloader-pdf
Он называется OpenDataLoader.
Работает полностью на процессоре и умеет обрабатывать сложную верстку, таблицы и вложенные структуры.
Полностью бесплатный.
https://github.com/opendataloader-project/opendataloader-pdf
GitHub
GitHub - opendataloader-project/opendataloader-pdf: PDF Parser for AI-ready data. Automate PDF accessibility. Open-source.
PDF Parser for AI-ready data. Automate PDF accessibility. Open-source. - opendataloader-project/opendataloader-pdf
Inference is all you need.
Автор подробно описал процесс оптимизации ядра Softmax на CUDA.
В разборе он:
начинает с наивной реализации
находит и измеряет основные проблемы производительности
разбирает концепцию online softmax
реализует ядро и считает выигрыш по памяти и FLOPs
применяет последовательный доступ к памяти
снова измеряет выигрыш по FLOPs, обмену данными и памяти
пишет итоговый CUDA-код
Читать: https://heyyanshuman.com/posts/making_softmax_fast
Автор подробно описал процесс оптимизации ядра Softmax на CUDA.
В разборе он:
начинает с наивной реализации
находит и измеряет основные проблемы производительности
разбирает концепцию online softmax
реализует ядро и считает выигрыш по памяти и FLOPs
применяет последовательный доступ к памяти
снова измеряет выигрыш по FLOPs, обмену данными и памяти
пишет итоговый CUDA-код
Читать: https://heyyanshuman.com/posts/making_softmax_fast
Один из создателей ChatGPT представил принципиально новый тип ИИ-моделей.
Два года, Диогу Алмейда, втайне разрабатывал Jev — модель, которая не пишет текст и не генерирует токены последовательно.
Она получает любые неструктурированные данные и параллельно принимает заданные разработчиком решения. Например, выбирает одну категорию из списка, выставляет оценку или определяет вероятность утверждения.
Jev также запрещено использовать скрытую цепочку рассуждений. Сложное поведение должно собираться разработчиком из множества простых решений при помощи обычного кода.
Именно поэтому модель работает в 20–200 раз быстрее и обходится в 40–400 раз дешевле. Миллион входных токенов стоит 4,2 цента, а выход остаётся бесплатным навсегда (его вычисление настолько дёшево, что компания не видит смысла его считать.)
Компания заявляет о нулевых галлюцинациях. Jev не может выдать ответ вне заданных вариантов или нарушить структуру. При этом модель может выбрать неправильный вариант.
Это не замена GPT-6 Astra и не новый чат-бот. Jev создан для автоматизации, где программам не нужны тексты. Им нужны быстрые решения в заданном формате.
Два года, Диогу Алмейда, втайне разрабатывал Jev — модель, которая не пишет текст и не генерирует токены последовательно.
Она получает любые неструктурированные данные и параллельно принимает заданные разработчиком решения. Например, выбирает одну категорию из списка, выставляет оценку или определяет вероятность утверждения.
Jev также запрещено использовать скрытую цепочку рассуждений. Сложное поведение должно собираться разработчиком из множества простых решений при помощи обычного кода.
Именно поэтому модель работает в 20–200 раз быстрее и обходится в 40–400 раз дешевле. Миллион входных токенов стоит 4,2 цента, а выход остаётся бесплатным навсегда (его вычисление настолько дёшево, что компания не видит смысла его считать.)
Компания заявляет о нулевых галлюцинациях. Jev не может выдать ответ вне заданных вариантов или нарушить структуру. При этом модель может выбрать неправильный вариант.
Это не замена GPT-6 Astra и не новый чат-бот. Jev создан для автоматизации, где программам не нужны тексты. Им нужны быстрые решения в заданном формате.
This media is not supported in your browser
VIEW IN TELEGRAM
Как большая языковая модель работает на аппаратном уровне?
Если вы привыкли к программированию вокруг CPU, большая языковая модель может казаться чем-то почти магическим. Всё потому, что в ней сочетаются глубокая нейронная сеть, архитектура Transformer и GPU — процессор с огромным параллелизмом, на котором она работает. Кроме того, хотя большую языковую модель можно описать несколькими сотнями строк Python, под ними скрываются крупные и сложные слои программного обеспечения, которые одному человеку трудно понять целиком.
Автор проекта решил разобраться в этом вопросе и с нуля реализовал Qwen3-0.6B — от Transformer до симулятора набора инструкций — с помощью Claude Code в качестве проекта на выходные.
Он реализовал саму модель, набор инструкций GPU, компилятор и симулятор GPU, чтобы каждый слой системы был достаточно небольшим и его можно было понять целиком.
Сейчас он также работает над RTL-описанием GPU, чтобы запустить систему на FPGA, а в будущем, возможно, даже изготовить настоящий чип — просто ради интереса.
Что интересно, пользоваться проектом можно примерно как Claude или Codex, но он работает на CPU, поэтому его можно полностью отлаживать и трассировать.
Если вам было трудно связать между собой большие языковые модели и GPU, на которых они работают, репозиторий здесь:
https://github.com/penberg/titania
Если вы привыкли к программированию вокруг CPU, большая языковая модель может казаться чем-то почти магическим. Всё потому, что в ней сочетаются глубокая нейронная сеть, архитектура Transformer и GPU — процессор с огромным параллелизмом, на котором она работает. Кроме того, хотя большую языковую модель можно описать несколькими сотнями строк Python, под ними скрываются крупные и сложные слои программного обеспечения, которые одному человеку трудно понять целиком.
Автор проекта решил разобраться в этом вопросе и с нуля реализовал Qwen3-0.6B — от Transformer до симулятора набора инструкций — с помощью Claude Code в качестве проекта на выходные.
Он реализовал саму модель, набор инструкций GPU, компилятор и симулятор GPU, чтобы каждый слой системы был достаточно небольшим и его можно было понять целиком.
Сейчас он также работает над RTL-описанием GPU, чтобы запустить систему на FPGA, а в будущем, возможно, даже изготовить настоящий чип — просто ради интереса.
Что интересно, пользоваться проектом можно примерно как Claude или Codex, но он работает на CPU, поэтому его можно полностью отлаживать и трассировать.
Если вам было трудно связать между собой большие языковые модели и GPU, на которых они работают, репозиторий здесь:
https://github.com/penberg/titania
Data Portal | DS & ML
Один из создателей ChatGPT представил принципиально новый тип ИИ-моделей. Два года, Диогу Алмейда, втайне разрабатывал Jev — модель, которая не пишет текст и не генерирует токены последовательно. Она получает любые неструктурированные данные и параллельно…
image_2026-09-17_08-34-08.png
1.7 MB
Для тех, кому интересно, как работает Jev, сделали наглядное объяснение.
Он основан на модели Qwen2.5-RLCD, которую Harsha Gundala опубликовал на huggingface.
Идея в том, чтобы заменить авторегрессионную генерацию LLM одним проходом через декодер Transformer предобученной языковой модели, который всего один раз обрабатывает контекст и JSON-схему. Ключи и значения этих токенов сохраняются в KV-кэше.
Дальше для каждого поля JSON-схемы мы:
1. Снова пропускаем через декодер Transformer токены суффикса этого поля, повторно используя KV-кэш.
2. Получаем итоговое скрытое состояние и передаём его в голову языковой модели.
3. Получаем оценки, также называемые логитами, для всех токенов в словаре LLM.
4. Берём только оценки тех токенов, которые нужны для конкретного поля, и пропускаем их через softmax, чтобы получить вероятности, сумма которых равна 1.
5. Выбираем токен с самой высокой вероятностью.
Плюсы такого подхода:
1. Это быстро, потому что не нужно генерировать JSON-схему токен за токеном.
2. На выходе всегда корректный JSON, потому что не нужно надеяться, что модель сама сгенерирует валидную схему.
Он основан на модели Qwen2.5-RLCD, которую Harsha Gundala опубликовал на huggingface.
Идея в том, чтобы заменить авторегрессионную генерацию LLM одним проходом через декодер Transformer предобученной языковой модели, который всего один раз обрабатывает контекст и JSON-схему. Ключи и значения этих токенов сохраняются в KV-кэше.
Дальше для каждого поля JSON-схемы мы:
1. Снова пропускаем через декодер Transformer токены суффикса этого поля, повторно используя KV-кэш.
2. Получаем итоговое скрытое состояние и передаём его в голову языковой модели.
3. Получаем оценки, также называемые логитами, для всех токенов в словаре LLM.
4. Берём только оценки тех токенов, которые нужны для конкретного поля, и пропускаем их через softmax, чтобы получить вероятности, сумма которых равна 1.
5. Выбираем токен с самой высокой вероятностью.
Плюсы такого подхода:
1. Это быстро, потому что не нужно генерировать JSON-схему токен за токеном.
2. На выходе всегда корректный JSON, потому что не нужно надеяться, что модель сама сгенерирует валидную схему.
Есть идея, которая преследует исследователей ИИ с 1960-х: достаточно умная машина сможет улучшать саму себя, а каждое улучшение будет ускорять следующее.
Это называется RSI — рекурсивное самоулучшение.
Google и Google DeepMind на днях выложили очень интересную работу: Dream-RSI.
Она про RSI. Но способ, которым здесь делают RSI, сильно отличается от того, как мы обычно это себе представляли.
Модель не обучает сама себя и не меняет собственные веса. Вместо этого она начинает менять собственную "стратегию исследования".
Если говорить просто, каждый раз, когда агент выполняет задачу, он оставляет полную историю исследования: какие варианты пробовал, какие провалились, какая ветка сработала лучше всего, сколько вычислений было потрачено.
Dream-RSI напрямую превращает эти истории в Replay Simulator, после чего агент начинает постоянно "видеть сны" внутри него:
Ключевой момент в том, что результаты из истории уже были посчитаны. Поэтому для этих экспериментов вообще не нужно заново вызывать агента и оценщика.
Одно дорогое исследование можно использовать для тысяч экспериментов со стратегией почти с нулевой стоимостью выполнения.
После того как находится более хорошая стратегия, её снова разворачивают в реальном мире. И получается полный цикл:
Исследование → накопление истории → сны → улучшение Policy → новое исследование → новые сны.
Так и замыкается RSI Loop.
Результаты тоже очень хорошие. В задачах с GPU-ядрами VGG16 и LayerNorm достигли сопоставимой производительности, при этом потребовалось соответственно в 2,43 и 1,79 раза меньше генераций.
ConvDiv и ConvMax при похожем бюджете улучшили производительность соответственно в 2,09 и 1,44 раза.
Есть ещё один эксперимент, который мне кажется особенно интересным.
Они также попробовали более традиционный способ: обобщить опыт прошлых исследований и напрямую вставить его обратно в промпт, чтобы он направлял следующий раунд.
И результат, наоборот, стал хуже.
Потому что такие обобщённые "уроки" очень легко превращаются в предубеждения. Агент слишком рано концентрируется на нескольких направлениях, которые выглядят правильными, и в итоге теряет разнообразие исследования.
Поэтому самое важное в этой работе то, что она показывает другой путь к RSI.
Модели не обязательно сначала учиться изменять собственные веса. Агент может сначала научиться изменять собственный Harness.
Это называется RSI — рекурсивное самоулучшение.
Google и Google DeepMind на днях выложили очень интересную работу: Dream-RSI.
Она про RSI. Но способ, которым здесь делают RSI, сильно отличается от того, как мы обычно это себе представляли.
Модель не обучает сама себя и не меняет собственные веса. Вместо этого она начинает менять собственную "стратегию исследования".
Если говорить просто, каждый раз, когда агент выполняет задачу, он оставляет полную историю исследования: какие варианты пробовал, какие провалились, какая ветка сработала лучше всего, сколько вычислений было потрачено.
Dream-RSI напрямую превращает эти истории в Replay Simulator, после чего агент начинает постоянно "видеть сны" внутри него:
А что, если тогда сначала пойти по другой ветке? А что, если запустить больше параллельных задач? А что, если раньше остановить это направление?
Ключевой момент в том, что результаты из истории уже были посчитаны. Поэтому для этих экспериментов вообще не нужно заново вызывать агента и оценщика.
Одно дорогое исследование можно использовать для тысяч экспериментов со стратегией почти с нулевой стоимостью выполнения.
После того как находится более хорошая стратегия, её снова разворачивают в реальном мире. И получается полный цикл:
Исследование → накопление истории → сны → улучшение Policy → новое исследование → новые сны.
Так и замыкается RSI Loop.
Результаты тоже очень хорошие. В задачах с GPU-ядрами VGG16 и LayerNorm достигли сопоставимой производительности, при этом потребовалось соответственно в 2,43 и 1,79 раза меньше генераций.
ConvDiv и ConvMax при похожем бюджете улучшили производительность соответственно в 2,09 и 1,44 раза.
Есть ещё один эксперимент, который мне кажется особенно интересным.
Они также попробовали более традиционный способ: обобщить опыт прошлых исследований и напрямую вставить его обратно в промпт, чтобы он направлял следующий раунд.
И результат, наоборот, стал хуже.
Потому что такие обобщённые "уроки" очень легко превращаются в предубеждения. Агент слишком рано концентрируется на нескольких направлениях, которые выглядят правильными, и в итоге теряет разнообразие исследования.
Поэтому самое важное в этой работе то, что она показывает другой путь к RSI.
Модели не обязательно сначала учиться изменять собственные веса. Агент может сначала научиться изменять собственный Harness.
PCA — один из тех инструментов анализа данных, который очень быстро показывает то, что сложно заметить в сырой таблице.
Берёте большой набор данных, сжимаете его до двух главных компонент и сразу видите кластеры, выбросы и странные точки.
Дальше начинается самое интересное.
Если понять, что именно отражают PC1 и PC2, можно быстро разобраться, почему одни объекты образуют отдельные группы, а другие сильно выбиваются из общей картины.
Именно поэтому PCA полезен не только как способ уменьшить размерность данных. Это ещё и отличный способ находить закономерности и формулировать правильные вопросы к данным.
Берёте большой набор данных, сжимаете его до двух главных компонент и сразу видите кластеры, выбросы и странные точки.
Дальше начинается самое интересное.
Если понять, что именно отражают PC1 и PC2, можно быстро разобраться, почему одни объекты образуют отдельные группы, а другие сильно выбиваются из общей картины.
Именно поэтому PCA полезен не только как способ уменьшить размерность данных. Это ещё и отличный способ находить закономерности и формулировать правильные вопросы к данным.
Правильный способ обучения такой:
Нужно просто решать задачи и делать проекты.
Именно такой подход сделали для одной из лучших книг по основам статистики — кстати, одной из немногих, которые я действительно прочитал.
Всё очень просто:
Читаешь главу.
Решaешь все задачи по этой теме.
https://www.statlearning.com/
Нужно просто решать задачи и делать проекты.
Именно такой подход сделали для одной из лучших книг по основам статистики — кстати, одной из немногих, которые я действительно прочитал.
Всё очень просто:
Читаешь главу.
Решaешь все задачи по этой теме.
https://www.statlearning.com/
Если вы разберётесь в инфраструктуре инференса, без работы, скорее всего, не останетесь.
Этап 1. Системная база
C/C++ или Rust, производительность Python, Linux, иерархия памяти, выполнение на CPU и GPU.
Этап 2. Архитектура GPU
CUDA-ядра, тензорные ядра, видеопамять, пропускная способность памяти, загрузка SM и профилирование через nvidia-smi.
Этап 3. Как устроен инференс трансформеров
Prefill и decode, рост KV-кэша, расход памяти на attention и арифметическая интенсивность.
Этап 4. Движки для запуска моделей
vLLM, SGLang и TGI. Непрерывное пакетирование, PagedAttention, планирование запросов, баланс между пропускной способностью и задержкой.
Этап 5. Оптимизация KV-кэша
Кэширование префиксов, chunked prefill, квантизация KV-кэша, выгрузка кэша и повторное использование между сообщениями.
Этап 6. Квантизация и сжатие
FP8, INT8, AWQ, GPTQ и разреженность. Нужно уметь измерять, сколько качества вы теряете ради прироста скорости.
Этап 7. Ускоренное декодирование и параллелизм
Speculative decoding, Medusa, тензорный и конвейерный параллелизм.
Этап 8. Оптимизация на уровне ядер
Triton, FlashAttention, CUDA Graphs, объединение операций и профилирование через Nsight.
Этап 9. Распределённый инференс
Запуск на нескольких узлах, NVLink, InfiniBand, разделение prefill и decode, параллелизм экспертов в MoE.
Этап 10. Масштабирование и экономика
KEDA, холодный запуск, спотовые GPU, стоимость одного токена и загрузка вычислительных мощностей.
Этап 11. Маршрутизация и надёжность
Шлюзы для ИИ, резервные цепочки, лимиты запросов, TTFT, ITL, наблюдаемость и тестирование отказов.
Этап 12. Портфолио и замеры
Собственный кластер, опубликованные тесты задержки, пропускной способности и стоимости, разборы оптимизации ядер.
Большинство застревает на просмотре обучающих роликов.
Тех, кто реально строит такие системы, нанимают.
Этап 1. Системная база
C/C++ или Rust, производительность Python, Linux, иерархия памяти, выполнение на CPU и GPU.
Этап 2. Архитектура GPU
CUDA-ядра, тензорные ядра, видеопамять, пропускная способность памяти, загрузка SM и профилирование через nvidia-smi.
Этап 3. Как устроен инференс трансформеров
Prefill и decode, рост KV-кэша, расход памяти на attention и арифметическая интенсивность.
Этап 4. Движки для запуска моделей
vLLM, SGLang и TGI. Непрерывное пакетирование, PagedAttention, планирование запросов, баланс между пропускной способностью и задержкой.
Этап 5. Оптимизация KV-кэша
Кэширование префиксов, chunked prefill, квантизация KV-кэша, выгрузка кэша и повторное использование между сообщениями.
Этап 6. Квантизация и сжатие
FP8, INT8, AWQ, GPTQ и разреженность. Нужно уметь измерять, сколько качества вы теряете ради прироста скорости.
Этап 7. Ускоренное декодирование и параллелизм
Speculative decoding, Medusa, тензорный и конвейерный параллелизм.
Этап 8. Оптимизация на уровне ядер
Triton, FlashAttention, CUDA Graphs, объединение операций и профилирование через Nsight.
Этап 9. Распределённый инференс
Запуск на нескольких узлах, NVLink, InfiniBand, разделение prefill и decode, параллелизм экспертов в MoE.
Этап 10. Масштабирование и экономика
KEDA, холодный запуск, спотовые GPU, стоимость одного токена и загрузка вычислительных мощностей.
Этап 11. Маршрутизация и надёжность
Шлюзы для ИИ, резервные цепочки, лимиты запросов, TTFT, ITL, наблюдаемость и тестирование отказов.
Этап 12. Портфолио и замеры
Собственный кластер, опубликованные тесты задержки, пропускной способности и стоимости, разборы оптимизации ядер.
Большинство застревает на просмотре обучающих роликов.
Тех, кто реально строит такие системы, нанимают.
На курс основателя Z.ai и профессора Цинхуа Тан Цзе пришло столько людей, что аудитория на 112 человек оказалась забита, а часть студентов слушала стоя в проходах.
И программа объясняет почему.
За 16 недель студентов проводят почти через весь путь создания современной большой языковой модели своими руками. Нужно написать токенизатор и Transformer с нуля, обучить модель на 0,1 млрд параметров, сделать attention-ядро на Triton, проверить ускорение на нескольких GPU, очистить сырые данные, построить scaling law, сравнить SFT, DPO и RLVR.
Финальный проект ещё сложнее. Нужно собрать проверяемую среду, обучить агента на длинных задачах и показать рабочую демонстрацию. Работа идёт командами по 2–3 человека, а отчёт оформляется на английском в формате NeurIPS.
Сам Тан Цзе считает, что битва за чат-модели в основном уже закончена. Следующий этап — модели, которые сами запоминают, учатся, выполняют длинные задачи и со временем становятся сильнее.
Поэтому курс, который формально всё ещё называется машинным обучением, уже строится вокруг базовых моделей, масштабирования, синтетических данных, обучения с подкреплением, агентов, непрерывного обучения и ИИ, который обучает другой ИИ.
Если умеешь только вызывать API, здесь будет тяжело.
Ирония в том, что всё это задаёт человек, который стоит за GLM. Студентам предлагают собирать всё с нуля, пока рядом у них уже открыт GLM-5.3, готовый помогать с каждой частью.
И программа объясняет почему.
За 16 недель студентов проводят почти через весь путь создания современной большой языковой модели своими руками. Нужно написать токенизатор и Transformer с нуля, обучить модель на 0,1 млрд параметров, сделать attention-ядро на Triton, проверить ускорение на нескольких GPU, очистить сырые данные, построить scaling law, сравнить SFT, DPO и RLVR.
Финальный проект ещё сложнее. Нужно собрать проверяемую среду, обучить агента на длинных задачах и показать рабочую демонстрацию. Работа идёт командами по 2–3 человека, а отчёт оформляется на английском в формате NeurIPS.
Сам Тан Цзе считает, что битва за чат-модели в основном уже закончена. Следующий этап — модели, которые сами запоминают, учатся, выполняют длинные задачи и со временем становятся сильнее.
Поэтому курс, который формально всё ещё называется машинным обучением, уже строится вокруг базовых моделей, масштабирования, синтетических данных, обучения с подкреплением, агентов, непрерывного обучения и ИИ, который обучает другой ИИ.
Если умеешь только вызывать API, здесь будет тяжело.
Ирония в том, что всё это задаёт человек, который стоит за GLM. Студентам предлагают собирать всё с нуля, пока рядом у них уже открыт GLM-5.3, готовый помогать с каждой частью.