Anthropic платит до $650 000 в год специалистам, которые действительно глубоко понимают глубокое обучение.
И вот этот курс Нандо де Фрейтаса доступен бесплатно.
Это полноценная техническая база по глубокому обучению, которую он преподавал в Оксфорде до перехода в DeepMind..
https://www.youtube.com/playlist?list=PLE6Wd9FR--EfW8dtjAuPoTuPcqmOV53Fu
И вот этот курс Нандо де Фрейтаса доступен бесплатно.
Это полноценная техническая база по глубокому обучению, которую он преподавал в Оксфорде до перехода в DeepMind..
https://www.youtube.com/playlist?list=PLE6Wd9FR--EfW8dtjAuPoTuPcqmOV53Fu
Можно ли строить модели мира полностью в скрытом пространстве, вообще без предсказания пикселей?
Исследователи представили Contrastive World Models.
Статья: arxiv.org/abs/2609.22175
Работа была написана независимо, между сменой позиций, с минимальными вычислительными ресурсами. Интересным направлением для дальнейших исследований было бы масштабирование CWM на более крупные области.
Исследователи представили Contrastive World Models.
Мы обучаем скрытые состояния так, чтобы максимизировать взаимную информацию с будущими наблюдениями — без декодеров и без восстановления пикселей.
Contrastive World Models дают:
существенно более устойчивые представления;
более эффективное обучение за счёт полного отказа от пиксельного декодера;
универсальный подход с минимальным числом предположений.
В стандартной целевой функции модели мира мы заменяем восстановление пикселей на Deep InfoMax — максимизируем взаимную информацию между скрытым состоянием и локальными признаками будущих наблюдений.
В экспериментах небольшого масштаба CWM показывает результаты на уровне базовых подходов с восстановлением пикселей и предсказанием через momentum в стандартных условиях, а при добавлении отвлекающих факторов или фонов из реального видео существенно превосходит оба подхода.
Статья: arxiv.org/abs/2609.22175
Работа была написана независимо, между сменой позиций, с минимальными вычислительными ресурсами. Интересным направлением для дальнейших исследований было бы масштабирование CWM на более крупные области.
Метрополис — Гастингс (MH) — это алгоритм Монте-Карло по цепям Маркова (MCMC) для генерации выборок из сложного вероятностного распределения, когда напрямую получать из него выборки затруднительно.
Для заданной целевой плотности π(x) алгоритм предлагает новое состояние x′ из распределения предложений q(x′|x) и принимает его с вероятностью
α(x,x′) = min{1, [π(x′)q(x|x′)]/[π(x)q(x′|x)]}.
Если предложенное состояние отклоняется, цепь остаётся в состоянии x. При выполнении подходящих условий полученная цепь Маркова имеет π в качестве стационарного распределения, поэтому средние значения по сгенерированным выборкам позволяют приближённо вычислять математические ожидания относительно целевого распределения.
MH — один из фундаментальных методов статистического машинного обучения, особенно в байесовском выводе. Когда апостериорное распределение p(θ|D) невозможно получить аналитически, MCMC позволяет генерировать приближённые выборки из апостериорного распределения и на их основе оценивать параметры, доверительные интервалы в байесовском смысле и предиктивные распределения.
Метод применяется в байесовской регрессии, иерархических моделях, моделях со скрытыми переменными, графических моделях и при оценке неопределённости.
Алгоритм также иллюстрирует одну из ключевых идей вычислительной статистики: вместо того чтобы напрямую решать задачу интегрирования или оптимизации, можно построить стохастический процесс, долгосрочное поведение которого воспроизводит нужное распределение.
Современные методы, такие как гамильтоновский метод Монте-Карло и метод Монте-Карло Ланжевена, развивают этот же принцип.
Для заданной целевой плотности π(x) алгоритм предлагает новое состояние x′ из распределения предложений q(x′|x) и принимает его с вероятностью
α(x,x′) = min{1, [π(x′)q(x|x′)]/[π(x)q(x′|x)]}.
Если предложенное состояние отклоняется, цепь остаётся в состоянии x. При выполнении подходящих условий полученная цепь Маркова имеет π в качестве стационарного распределения, поэтому средние значения по сгенерированным выборкам позволяют приближённо вычислять математические ожидания относительно целевого распределения.
MH — один из фундаментальных методов статистического машинного обучения, особенно в байесовском выводе. Когда апостериорное распределение p(θ|D) невозможно получить аналитически, MCMC позволяет генерировать приближённые выборки из апостериорного распределения и на их основе оценивать параметры, доверительные интервалы в байесовском смысле и предиктивные распределения.
Метод применяется в байесовской регрессии, иерархических моделях, моделях со скрытыми переменными, графических моделях и при оценке неопределённости.
Алгоритм также иллюстрирует одну из ключевых идей вычислительной статистики: вместо того чтобы напрямую решать задачу интегрирования или оптимизации, можно построить стохастический процесс, долгосрочное поведение которого воспроизводит нужное распределение.
Современные методы, такие как гамильтоновский метод Монте-Карло и метод Монте-Карло Ланжевена, развивают этот же принцип.
«Маленькая книга по основам генеративного ИИ» — интуитивное введение в математику: arxiv.org/pdf/2605.29713
Масштабирование вычислений на этапе инференса, часть 1. Себастьян Рашка.
Начинаем с модифицированной функции генерации текста: масштабирование температурой, top-p-фильтрация и мультиномиальное сэмплирование. Всё это нужно, чтобы получать более разнообразные ответы для self-consistency и best-of-N, повышая точность ответов более чем в 2 раза.
00:00 — Введение и краткое повторение
00:31 — Масштабирование на этапе обучения и инференса
07:52 — Что будем реализовывать
11:47 — Настройка ноутбука и загрузка модели
17:43 — Создание гибкой функции генерации текста
24:40 — Промптинг с цепочкой рассуждений
28:26 — Сэмплирование и разнообразие ответов
33:43 — Логиты следующего токена и жадное декодирование
38:20 — Масштабирование температурой шаг за шагом
42:46 — Softmax и вероятности токенов
47:42 — Мультиномиальное сэмплирование
54:51 — Добавление температурного сэмплирования в генерацию текста
59:31 — Top-p-фильтрация шаг за шагом
1:10:23 — Добавление top-p-фильтрации в генерацию текста
1:13:43 — Сэмплирование и водяные знаки для LLM
1:16:01 — Self-consistency и голосование большинством
1:20:36 — Реализация self-consistency
1:29:02 — Результаты на MATH-500
1:35:01 — Компромисс между точностью и объёмом вычислений
1:36:50 — Следующие шаги и самодоработка
https://www.youtube.com/watch?v=t5y-kS9nNxU
Начинаем с модифицированной функции генерации текста: масштабирование температурой, top-p-фильтрация и мультиномиальное сэмплирование. Всё это нужно, чтобы получать более разнообразные ответы для self-consistency и best-of-N, повышая точность ответов более чем в 2 раза.
00:00 — Введение и краткое повторение
00:31 — Масштабирование на этапе обучения и инференса
07:52 — Что будем реализовывать
11:47 — Настройка ноутбука и загрузка модели
17:43 — Создание гибкой функции генерации текста
24:40 — Промптинг с цепочкой рассуждений
28:26 — Сэмплирование и разнообразие ответов
33:43 — Логиты следующего токена и жадное декодирование
38:20 — Масштабирование температурой шаг за шагом
42:46 — Softmax и вероятности токенов
47:42 — Мультиномиальное сэмплирование
54:51 — Добавление температурного сэмплирования в генерацию текста
59:31 — Top-p-фильтрация шаг за шагом
1:10:23 — Добавление top-p-фильтрации в генерацию текста
1:13:43 — Сэмплирование и водяные знаки для LLM
1:16:01 — Self-consistency и голосование большинством
1:20:36 — Реализация self-consistency
1:29:02 — Результаты на MATH-500
1:35:01 — Компромисс между точностью и объёмом вычислений
1:36:50 — Следующие шаги и самодоработка
https://www.youtube.com/watch?v=t5y-kS9nNxU
YouTube
Build A Reasoning Model From Scratch 4: Inference Scaling 1 (Temperature, Top-p, Self-Consistency)
After motivating the use cases for inference-time scaling, this video first walks through temperature scaling, top-p filtering, and multinomial sampling to generate diverse answers with an LLM. Then, using these techniques, we implement self-consistency to…
Если речь идёт об инференсе, нельзя пропустить отдельную главу на эту тему в книге «How to Scale Your Model».
https://jax-ml.github.io/scaling-book/inference/
https://jax-ml.github.io/scaling-book/inference/
Когда в временном ряду отсутствует 90% данных: восстанавливайте динамику, а не отдельные значения
Большинство методов заполнения пропусков в научных временных рядах предсказывают недостающие значения по корреляциям в наблюдаемых данных.
Авторы исследования предлагают другой подход: сначала восстановить геометрию динамической системы.
С помощью вложения с задержкой по одной переменной, наблюдаемой без пропусков, можно реконструировать аттрактор системы в пространстве состояний. Переменная с пропусками даёт частичную реконструкцию той же динамики. Затем модель изучает отображение между двумя реконструированными многообразиями и с помощью гауссовского процесса восстанавливает недостающие состояния.
Главное здесь в том, что машинному обучению не нужно открывать динамику с нуля. Теория динамических систем даёт априорное знание: разные наблюдения одной системы должны отражать эквивалентную структуру пространства состояний. Гауссовский процесс изучает только отображение между этими представлениями.
Это особенно полезно, когда данных крайне мало. В 120-мерной системе Лоренца одна переменная наблюдается полностью, а у остальных 119 отсутствует 90% значений. При этом средняя корреляция восстановленных сигналов с истинными данными достигает 0,84. Для 120-мерной системы Рёсслера она составляет 0,81.
Подход работает и на реальных данных. При реконструкции 64-канальной ЭЭГ, где один сигнал доступен полностью, а в остальных отсутствует 90% значений, корреляция достигает примерно 0,9.
Для применения ИИ в науке вывод шире: если данные порождены динамической системой, её динамика ограничивает возможные значения в пропусках. Вместо того чтобы просить модель угадывать отдельные точки, можно восстановить скрытую структуру, благодаря которой эти точки возникают.
https://www.nature.com/articles/s41467-026-77922-1
Большинство методов заполнения пропусков в научных временных рядах предсказывают недостающие значения по корреляциям в наблюдаемых данных.
Авторы исследования предлагают другой подход: сначала восстановить геометрию динамической системы.
С помощью вложения с задержкой по одной переменной, наблюдаемой без пропусков, можно реконструировать аттрактор системы в пространстве состояний. Переменная с пропусками даёт частичную реконструкцию той же динамики. Затем модель изучает отображение между двумя реконструированными многообразиями и с помощью гауссовского процесса восстанавливает недостающие состояния.
Главное здесь в том, что машинному обучению не нужно открывать динамику с нуля. Теория динамических систем даёт априорное знание: разные наблюдения одной системы должны отражать эквивалентную структуру пространства состояний. Гауссовский процесс изучает только отображение между этими представлениями.
Это особенно полезно, когда данных крайне мало. В 120-мерной системе Лоренца одна переменная наблюдается полностью, а у остальных 119 отсутствует 90% значений. При этом средняя корреляция восстановленных сигналов с истинными данными достигает 0,84. Для 120-мерной системы Рёсслера она составляет 0,81.
Подход работает и на реальных данных. При реконструкции 64-канальной ЭЭГ, где один сигнал доступен полностью, а в остальных отсутствует 90% значений, корреляция достигает примерно 0,9.
Для применения ИИ в науке вывод шире: если данные порождены динамической системой, её динамика ограничивает возможные значения в пропусках. Вместо того чтобы просить модель угадывать отдельные точки, можно восстановить скрытую структуру, благодаря которой эти точки возникают.
https://www.nature.com/articles/s41467-026-77922-1
«Intermediate Microeconomics» — это бесплатный учебник, который содержит математическое изложение основных моделей, используемых в микроэкономике.
Книга рассматривает теорию потребителя, предпочтения и полезность, спрос, производственные функции и функции издержек, максимизацию прибыли, спрос и предложение, совершенную конкуренцию и общее равновесие, а затем переходит к монополии, олигополии, стратегиям ценообразования, теории игр, асимметричной информации, принятию решений в условиях неопределённости и многим другим темам.
Я считаю, что это интересный ресурс не только для изучения экономики, но и для понимания того, как математика формирует фундамент экономических моделей.
Такие рынки, как совершенная конкуренция, монополия и олигополия, можно описать через точные уравнения и математические зависимости, которые определяют, как принимать решения, устанавливать цены, выбирать объёмы производства и взаимодействовать с конкурентами.
https://open.oregonstate.education/intermediatemicroeconomics/
Книга рассматривает теорию потребителя, предпочтения и полезность, спрос, производственные функции и функции издержек, максимизацию прибыли, спрос и предложение, совершенную конкуренцию и общее равновесие, а затем переходит к монополии, олигополии, стратегиям ценообразования, теории игр, асимметричной информации, принятию решений в условиях неопределённости и многим другим темам.
Я считаю, что это интересный ресурс не только для изучения экономики, но и для понимания того, как математика формирует фундамент экономических моделей.
Такие рынки, как совершенная конкуренция, монополия и олигополия, можно описать через точные уравнения и математические зависимости, которые определяют, как принимать решения, устанавливать цены, выбирать объёмы производства и взаимодействовать с конкурентами.
https://open.oregonstate.education/intermediatemicroeconomics/
Соберите DeepSeek с нуля. 🙂
Автор сделал бесплатный 16-часовой курс на YouTube, где пошагово разбирает создание модели в стиле DeepSeek с нуля — от статей и теории до полного кода.
Внутри:
- механизм внимания с нормальным объяснением
- Multi-Head Latent Attention
- Grouped Query Attention
- позиционные кодировки
- Mixture of Experts
- и многое другое
Нужны только ноутбук и регулярность.
https://www.youtube.com/watch?v=QWNxQIq0hMo&list=PLPTV0NXA_ZSiOpKKlHCyOq9lnp-dLvlms
Автор сделал бесплатный 16-часовой курс на YouTube, где пошагово разбирает создание модели в стиле DeepSeek с нуля — от статей и теории до полного кода.
Внутри:
- механизм внимания с нормальным объяснением
- Multi-Head Latent Attention
- Grouped Query Attention
- позиционные кодировки
- Mixture of Experts
- и многое другое
Нужны только ноутбук и регулярность.
https://www.youtube.com/watch?v=QWNxQIq0hMo&list=PLPTV0NXA_ZSiOpKKlHCyOq9lnp-dLvlms
Please open Telegram to view this post
VIEW IN TELEGRAM
Модель Ember-1 сейчас активно обсуждают на Hacker News.
Исследовательская команда дообучила Kimi K3 так, чтобы модель рассуждала примерно на 40% короче.😳
Качество осталось на том же уровне, а сама модель стала примерно на 40% быстрее и дешевле.
И это хороший пример того, как сегодня имеет смысл строить передовые LLM. Если у вас есть несколько десятков миллионов долларов, необязательно обучать новую модель с нуля. Можно взять уже сильную существующую модель и вложить этот бюджет в её дообучение.
https://fireworks.ai/blog/ember-1
Ember-1 уже доступна в Cline, в том числе в новом десктопном приложении.
Исследовательская команда дообучила Kimi K3 так, чтобы модель рассуждала примерно на 40% короче.
Качество осталось на том же уровне, а сама модель стала примерно на 40% быстрее и дешевле.
И это хороший пример того, как сегодня имеет смысл строить передовые LLM. Если у вас есть несколько десятков миллионов долларов, необязательно обучать новую модель с нуля. Можно взять уже сильную существующую модель и вложить этот бюджет в её дообучение.
https://fireworks.ai/blog/ember-1
Ember-1 уже доступна в Cline, в том числе в новом десктопном приложении.
Please open Telegram to view this post
VIEW IN TELEGRAM
NVIDIA Model Optimizer — единая библиотека с современными методами оптимизации моделей: квантизацией, дистилляцией, прунингом, поиском архитектуры нейросетей, спекулятивным декодированием и другими техниками.
Она сжимает модели глубокого обучения для последующего запуска через TensorRT-LLM, TensorRT, vLLM и другие среды, чтобы ускорить инференс.
https://github.com/NVIDIA/Model-Optimizer
Она сжимает модели глубокого обучения для последующего запуска через TensorRT-LLM, TensorRT, vLLM и другие среды, чтобы ускорить инференс.
https://github.com/NVIDIA/Model-Optimizer
GitHub
GitHub - NVIDIA/Model-Optimizer: A unified library of SOTA model optimization techniques like quantization, distillation, pruning…
A unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downs...