Лекция 8 курса по машинному обучению на графах посвящена графовым свёрточным сетям.
В лекции разбираются свёртки на сетках и графах, сопоставление с общим шаблоном, спектральная свёртка, преобразование Фурье, полиномы Чебышёва, изотропная и анизотропная агрегация, а также архитектуры ChebNet, GCN, GAT и GatedGCN.
https://storage.googleapis.com/xavierbresson/lectures/GML/lecture08_graph_convolutional_networks.pdf
В лекции разбираются свёртки на сетках и графах, сопоставление с общим шаблоном, спектральная свёртка, преобразование Фурье, полиномы Чебышёва, изотропная и анизотропная агрегация, а также архитектуры ChebNet, GCN, GAT и GatedGCN.
https://storage.googleapis.com/xavierbresson/lectures/GML/lecture08_graph_convolutional_networks.pdf
«Как обучить нейросеть» — краткий конспект лекций курса MIT по глубокому обучению за 2024 год. Он посвящён одному из фундаментальных вопросов нейросетей — как модель обучает свои веса.
В конспекте процесс обучения рассматривается с математической точки зрения. Разбираются прямой проход, функции потерь, градиенты, обратное распространение ошибки и градиентные методы оптимизации.
Думаю, это интересный материал для тех, кто хочет выйти за рамки общего интуитивного представления о нейросетях и начать разбираться в математике, на которой основано их обучение.
https://ocw.mit.edu/courses/6-7960-deep-learning-fall-2024/mit6_7960_f24_lec2.pdf
В конспекте процесс обучения рассматривается с математической точки зрения. Разбираются прямой проход, функции потерь, градиенты, обратное распространение ошибки и градиентные методы оптимизации.
Думаю, это интересный материал для тех, кто хочет выйти за рамки общего интуитивного представления о нейросетях и начать разбираться в математике, на которой основано их обучение.
https://ocw.mit.edu/courses/6-7960-deep-learning-fall-2024/mit6_7960_f24_lec2.pdf
«Изучение математики. Почему память, практика и техника важнее таланта»
Чтобы освоить математику, необходимо запомнить большой объём информации, правил, способов упрощения и приёмов решения задач. Другого пути нет. Теория полезна, но в меру.
Это как изучение языка. Если слишком сосредоточиться на грамматике, никогда не научишься свободно на нём говорить.
https://algebrica.org/learning-mathematics/
Чтобы освоить математику, необходимо запомнить большой объём информации, правил, способов упрощения и приёмов решения задач. Другого пути нет. Теория полезна, но в меру.
Это как изучение языка. Если слишком сосредоточиться на грамматике, никогда не научишься свободно на нём говорить.
https://algebrica.org/learning-mathematics/
Algebrica
Learning Mathematics | Algebrica
Why Memory, Practice, and Technique Matter More Than Talent
Modern Robotics: Mechanics, Planning, and Control.
Сохраните на потом.
Это полноценный учебник по робототехнике уровня магистратуры от Кевина Линча и Фрэнка Парка, изданный Cambridge University Press.
Внутри:
- конфигурационные пространства
- кинематика
- динамика
- генерация траекторий
- планирование движения
- управление роботами
По сути, это современная математическая база того, как роботы двигаются и взаимодействуют с окружающим миром.
https://hades.mech.northwestern.edu/images/7/7f/MR.pdf
Сохраните на потом.
Это полноценный учебник по робототехнике уровня магистратуры от Кевина Линча и Фрэнка Парка, изданный Cambridge University Press.
Внутри:
- конфигурационные пространства
- кинематика
- динамика
- генерация траекторий
- планирование движения
- управление роботами
По сути, это современная математическая база того, как роботы двигаются и взаимодействуют с окружающим миром.
https://hades.mech.northwestern.edu/images/7/7f/MR.pdf
This media is not supported in your browser
VIEW IN TELEGRAM
Нашёл хороший ресурс для интерактивного изучения машинного обучения и ИИ — VizLearn.
Можно поэкспериментировать с градиентным спуском, SVM, PCA, методом Байеса, токенизацией BPE, Q/K/V, KV-кэшем, квантизацией и многим другим. Меняешь входные данные и видишь, как меняются сами вычисления.
Бесплатно, без регистрации.
https://vizlearn.in
Можно поэкспериментировать с градиентным спуском, SVM, PCA, методом Байеса, токенизацией BPE, Q/K/V, KV-кэшем, квантизацией и многим другим. Меняешь входные данные и видишь, как меняются сами вычисления.
Бесплатно, без регистрации.
https://vizlearn.in
Reasoning from Scratch, шестой выпуск. Себастьян Рашка
Введение и практическая реализация обучения с подкреплением с проверяемыми наградами RLVR и Group Relative Policy Optimization GRPO.
00:00 — Введение
01:54 — Чем reasoning-модель отличается от обычной
04:25 — Цепочки рассуждений и возможности модели
08:29 — Награды за точность и формат ответа
11:34 — «Aha-моменты» и обучение DeepSeek-R1
14:41 — Глубина рассуждений и длина ответа
18:38 — RLHF и RLVR
23:04 — GRPO против PPO
26:40 — Объяснение GRPO на аналогии с готовкой
31:43 — KL-компонент и упрощённый GRPO
35:04 — Загрузка предобученной модели
36:07 — Загрузка обучающих данных MATH
39:26 — Генерация ответов модели
46:30 — Расчёт проверяемых наград
49:55 — Расчёт преимуществ
51:54 — Логарифмические вероятности токенов и последовательностей
55:29 — Реализация логарифмических вероятностей последовательностей
57:37 — Исправление ошибки режима инференса
1:02:24 — Расчёт функции потерь GRPO
1:04:37 — Собираем один шаг GRPO целиком
1:09:19 — Цикл обучения GRPO
1:12:57 — Настройки обучения, логирование и чекпоинты
1:17:24 — Запуск обучения и разбор результатов
1:19:28 — Загрузка и оценка чекпоинтов
1:22:33 — Результаты MATH-500 и стабильность обучения
1:24:05 — Требования к памяти и следующие шаги
https://www.youtube.com/watch?v=237Hf7Q3lgg
Введение и практическая реализация обучения с подкреплением с проверяемыми наградами RLVR и Group Relative Policy Optimization GRPO.
00:00 — Введение
01:54 — Чем reasoning-модель отличается от обычной
04:25 — Цепочки рассуждений и возможности модели
08:29 — Награды за точность и формат ответа
11:34 — «Aha-моменты» и обучение DeepSeek-R1
14:41 — Глубина рассуждений и длина ответа
18:38 — RLHF и RLVR
23:04 — GRPO против PPO
26:40 — Объяснение GRPO на аналогии с готовкой
31:43 — KL-компонент и упрощённый GRPO
35:04 — Загрузка предобученной модели
36:07 — Загрузка обучающих данных MATH
39:26 — Генерация ответов модели
46:30 — Расчёт проверяемых наград
49:55 — Расчёт преимуществ
51:54 — Логарифмические вероятности токенов и последовательностей
55:29 — Реализация логарифмических вероятностей последовательностей
57:37 — Исправление ошибки режима инференса
1:02:24 — Расчёт функции потерь GRPO
1:04:37 — Собираем один шаг GRPO целиком
1:09:19 — Цикл обучения GRPO
1:12:57 — Настройки обучения, логирование и чекпоинты
1:17:24 — Запуск обучения и разбор результатов
1:19:28 — Загрузка и оценка чекпоинтов
1:22:33 — Результаты MATH-500 и стабильность обучения
1:24:05 — Требования к памяти и следующие шаги
https://www.youtube.com/watch?v=237Hf7Q3lgg
YouTube
Build A Reasoning Model From Scratch 6: Reinforcement Learning 1 (Implementing GRPO for RLVR)
This video covers a from-scratch implementation of Reinforcement Learning with Verifiable Rewards (RLVR) using the Group Relative Policy Optimization (GRPO) algorithm in Python to train a small reasoning model.
- Reasoning playlist: https://www.youtube.…
- Reasoning playlist: https://www.youtube.…
«Speech and Language Processing» от Stanford — большой бесплатный ресурс по современному NLP и большим языковым моделям.
Последний черновик 2026 года доступен онлайн бесплатно и разбирает тему как с математической, так и с вычислительной стороны.
Книга разбита на главы, каждую можно отдельно скачать в PDF. К главам также приложены слайды лекций.
Внутри есть основы языковых моделей, эмбеддинги и векторная семантика, нейросети, Transformers и self-attention, предобучение, постобучение, prompting, машинный перевод, извлечение информации, ответы на вопросы, распознавание речи и много других базовых тем современного NLP.
Особенно интересна глава про Transformers и предобучение. Там self-attention выводится через Q/K/V, а дальше идут multi-head attention, позиционная информация, Transformer-блоки, языковое моделирование, предобучение и декодирование.
Если хотите разобраться в фундаменте современных языковых моделей, это точно стоит сохранить как справочник.
web.stanford.edu/~jurafsky/slp3/
Последний черновик 2026 года доступен онлайн бесплатно и разбирает тему как с математической, так и с вычислительной стороны.
Книга разбита на главы, каждую можно отдельно скачать в PDF. К главам также приложены слайды лекций.
Внутри есть основы языковых моделей, эмбеддинги и векторная семантика, нейросети, Transformers и self-attention, предобучение, постобучение, prompting, машинный перевод, извлечение информации, ответы на вопросы, распознавание речи и много других базовых тем современного NLP.
Особенно интересна глава про Transformers и предобучение. Там self-attention выводится через Q/K/V, а дальше идут multi-head attention, позиционная информация, Transformer-блоки, языковое моделирование, предобучение и декодирование.
Если хотите разобраться в фундаменте современных языковых моделей, это точно стоит сохранить как справочник.
web.stanford.edu/~jurafsky/slp3/
Harvard бесплатно выложил один из лучших курсов по системам для ИИ, которые я видел.
CS249r идёт далеко за пределы архитектуры моделей. Здесь разбирается именно инженерная часть, от которой зависит, можно ли модель нормально обучать и эффективно запускать: процессоры, иерархия памяти, передача данных, ускорители, распределённые вычисления, инференс, квантование, сервинг, надёжность и развёртывание.
И это не просто учебник.
Внутри есть два открытых тома по ML Systems, TinyTorch для сборки собственного ML-фреймворка с нуля, интерактивные лабораторные прямо в браузере, MLSys·im для экспериментов с узкими местами железа и инфраструктуры, StaffML для практики по системам и слайды лекций самого курса.
В одном TinyTorch — 20 последовательных модулей. В лабораторных можно менять параметры системы и сразу смотреть, что становится узким местом, а не просто читать теорию.
Я бы изучал это уже после того, как нормально разобрался с нейросетями и Transformers.
Понимать, как работает attention, полезно. Но понимать, почему KV-кэш съедает память, когда инференс упирается в пропускную способность, почему batching меняет throughput и почему добавление GPU в какой-то момент перестаёт нормально масштабироваться — это уже совсем другой уровень.
Всё здесь:
mlsysbook.ai
GitHub: https://github.com/harvard-edge/cs249r_book
CS249r идёт далеко за пределы архитектуры моделей. Здесь разбирается именно инженерная часть, от которой зависит, можно ли модель нормально обучать и эффективно запускать: процессоры, иерархия памяти, передача данных, ускорители, распределённые вычисления, инференс, квантование, сервинг, надёжность и развёртывание.
И это не просто учебник.
Внутри есть два открытых тома по ML Systems, TinyTorch для сборки собственного ML-фреймворка с нуля, интерактивные лабораторные прямо в браузере, MLSys·im для экспериментов с узкими местами железа и инфраструктуры, StaffML для практики по системам и слайды лекций самого курса.
В одном TinyTorch — 20 последовательных модулей. В лабораторных можно менять параметры системы и сразу смотреть, что становится узким местом, а не просто читать теорию.
Я бы изучал это уже после того, как нормально разобрался с нейросетями и Transformers.
Понимать, как работает attention, полезно. Но понимать, почему KV-кэш съедает память, когда инференс упирается в пропускную способность, почему batching меняет throughput и почему добавление GPU в какой-то момент перестаёт нормально масштабироваться — это уже совсем другой уровень.
Всё здесь:
mlsysbook.ai
GitHub: https://github.com/harvard-edge/cs249r_book
GitHub
GitHub - harvard-edge/cs249r_book: Machine Learning Systems: Foundations, Scaling, Agentic AI, and Physical AI (Vols I–IV) • Harvard…
Machine Learning Systems: Foundations, Scaling, Agentic AI, and Physical AI (Vols I–IV) • Harvard CS249r | https://mlsysbook.ai - harvard-edge/cs249r_book
Европа вступает в гонку языковых моделей: Германия впервые выпустила модель с результатом почти 97% в математике.
Kolibri от Aleph Alpha: 78 млрд параметров. 3,46 млрд активных. Контекст до 1 млн токенов. Открытые веса под лицензией Apache 2.0.
Для дообучения использовали ответы китайских моделей: GLM от Zhipu и Qwen от Alibaba.
Хорошие небольшие модели могут создавать не только в США и Китае.😋
Kolibri от Aleph Alpha: 78 млрд параметров. 3,46 млрд активных. Контекст до 1 млн токенов. Открытые веса под лицензией Apache 2.0.
Для дообучения использовали ответы китайских моделей: GLM от Zhipu и Qwen от Alibaba.
Хорошие небольшие модели могут создавать не только в США и Китае.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
«Основы компьютерного зрения» — бесплатная онлайн-книга издательства MIT Press, которая даёт широкое введение в компьютерное зрение с точки зрения обработки изображений и машинного обучения.
В ней разбираются формирование изображений, обучение и обратное распространение ошибки, фильтрация изображений и анализ Фурье, CNN, RNN и трансформеры, генеративные модели, обучение представлений, трёхмерная геометрия, оценка движения, распознавание объектов, модели, работающие с изображениями и текстом, и многое другое.
Особенно мне нравится, что вся книга доступна прямо в HTML: с понятной и удобной вёрсткой, множеством схем и визуализаций, которые помогают разобраться в концепциях.
https://visionbook.mit.edu
В ней разбираются формирование изображений, обучение и обратное распространение ошибки, фильтрация изображений и анализ Фурье, CNN, RNN и трансформеры, генеративные модели, обучение представлений, трёхмерная геометрия, оценка движения, распознавание объектов, модели, работающие с изображениями и текстом, и многое другое.
Особенно мне нравится, что вся книга доступна прямо в HTML: с понятной и удобной вёрсткой, множеством схем и визуализаций, которые помогают разобраться в концепциях.
https://visionbook.mit.edu
This media is not supported in your browser
VIEW IN TELEGRAM
Начни изучать программирование GPU с одной полностью анимированной лекции на YouTube. Это первое видео в серии о программировании GPU с Triton.
Каждая идея объясняется наглядно, с помощью анимации — как в GIF из этого поста, только на протяжении целого часа.
Ты каждый день пишешь
В лекции разбираются:
— Как GPU встроен в компьютер: PCIe, NVLink, серверы и кластеры.
— Что внутри NVIDIA H100: потоковые мультипроцессоры, вычислительные линии FP32, планировщик варпов, тензорные ядра и разделяемая память.
— Потоки, варпы, блоки и сетки — и как каждый поток находит свой элемент.
— Память: SRAM и DRAM, DDR, GDDR и HBM, кеши, задержка и пропускная способность.
— Как ускорить работу с памятью: скрытие задержек, объединение обращений к памяти и слияние ядер.
— Зачем нужен Triton и как он позволяет мыслить тайлами вместо потоков.
— Ограничения по пропускной способности памяти и вычислительной мощности, арифметическая интенсивность и модель Roofline.
— Механизм внимания, матрица N × N и то, как FlashAttention решает связанную с ней проблему.
Знание CUDA и устройства железа не требуется.
Что дальше:
— Лекция 2: построчно напишем наше первое ядро на Triton для сложения векторов. Опубликую через несколько дней.
— Новые лекции о программировании GPU и оптимизации инференса.
— Запланированная серия о глубоком обучении для аудио.
Полная лекция:
https://youtu.be/dEZP1qUNTOk
Каждая идея объясняется наглядно, с помощью анимации — как в GIF из этого поста, только на протяжении целого часа.
Ты каждый день пишешь
c = a + b в PyTorch. Эта лекция показывает, что GPU на самом деле делает с этим выражением.В лекции разбираются:
— Как GPU встроен в компьютер: PCIe, NVLink, серверы и кластеры.
— Что внутри NVIDIA H100: потоковые мультипроцессоры, вычислительные линии FP32, планировщик варпов, тензорные ядра и разделяемая память.
— Потоки, варпы, блоки и сетки — и как каждый поток находит свой элемент.
— Память: SRAM и DRAM, DDR, GDDR и HBM, кеши, задержка и пропускная способность.
— Как ускорить работу с памятью: скрытие задержек, объединение обращений к памяти и слияние ядер.
— Зачем нужен Triton и как он позволяет мыслить тайлами вместо потоков.
— Ограничения по пропускной способности памяти и вычислительной мощности, арифметическая интенсивность и модель Roofline.
— Механизм внимания, матрица N × N и то, как FlashAttention решает связанную с ней проблему.
Знание CUDA и устройства железа не требуется.
Что дальше:
— Лекция 2: построчно напишем наше первое ядро на Triton для сложения векторов. Опубликую через несколько дней.
— Новые лекции о программировании GPU и оптимизации инференса.
— Запланированная серия о глубоком обучении для аудио.
Полная лекция:
https://youtu.be/dEZP1qUNTOk
«Разбираемся в трансформерах и механизмах внимания» — краткое математическое введение в механизм внимания, одну из ключевых идей современных языковых моделей.
Документ разбирает токенизацию и эмбеддинги, запросы, ключи и значения, оценки и веса внимания, многоголовое внимание, самовнимание, причинное внимание и маскирование, перекрёстное внимание и базовую структуру архитектуры Transformer.
Также в нём представлены важные методы, которые делают механизм внимания в современных LLM эффективнее: KV-кеширование, внимание с группировкой запросов (GQA), многозапросное внимание (MQA) и латентное внимание.
https://arxiv.org/pdf/2604.00965
Документ разбирает токенизацию и эмбеддинги, запросы, ключи и значения, оценки и веса внимания, многоголовое внимание, самовнимание, причинное внимание и маскирование, перекрёстное внимание и базовую структуру архитектуры Transformer.
Также в нём представлены важные методы, которые делают механизм внимания в современных LLM эффективнее: KV-кеширование, внимание с группировкой запросов (GQA), многозапросное внимание (MQA) и латентное внимание.
https://arxiv.org/pdf/2604.00965
Видеолекции от Раджа Дандекаря:
— Создаём LLM с нуля
— Создаём DeepSeek с нуля
— Принципы диффузионных моделей
— Создаём диффузионную языковую модель с нуля
— Создаём LLM с нуля
— Создаём DeepSeek с нуля
— Принципы диффузионных моделей
— Создаём диффузионную языковую модель с нуля
Google выпустила EmbeddingGemma 2.
Это первая открытая мультимодальная модель для эмбеддингов, изначально работающая с текстом, кодом, изображениями, видео и аудио.
740 млн параметров. Модульная архитектура. Модель создана для запуска прямо на устройстве, а не в дата-центре.
При этом она обходит некоторые специализированные модели, которые более чем вдвое крупнее.
В паре с Gemma 4 можно собрать полностью локальный RAG с упором на приватность.
https://huggingface.co/google/embeddinggemma-2
https://huggingface.co/unsloth/embeddinggemma-2-GGUF
Это первая открытая мультимодальная модель для эмбеддингов, изначально работающая с текстом, кодом, изображениями, видео и аудио.
740 млн параметров. Модульная архитектура. Модель создана для запуска прямо на устройстве, а не в дата-центре.
При этом она обходит некоторые специализированные модели, которые более чем вдвое крупнее.
В паре с Gemma 4 можно собрать полностью локальный RAG с упором на приватность.
https://huggingface.co/google/embeddinggemma-2
https://huggingface.co/unsloth/embeddinggemma-2-GGUF
1. Математические основы машинного обучения
https://t.co/6jaPNJW9wH
2. Математические основы генеративных моделей
https://t.co/LTmMWZcZNS
3. Математические основы генеративного ИИ
https://t.co/EURxtNfMmx
https://t.co/6jaPNJW9wH
2. Математические основы генеративных моделей
https://t.co/LTmMWZcZNS
3. Математические основы генеративного ИИ
https://t.co/EURxtNfMmx