«Speech and Language Processing» от Stanford — большой бесплатный ресурс по современному NLP и большим языковым моделям.
Последний черновик 2026 года доступен онлайн бесплатно и разбирает тему как с математической, так и с вычислительной стороны.
Книга разбита на главы, каждую можно отдельно скачать в PDF. К главам также приложены слайды лекций.
Внутри есть основы языковых моделей, эмбеддинги и векторная семантика, нейросети, Transformers и self-attention, предобучение, постобучение, prompting, машинный перевод, извлечение информации, ответы на вопросы, распознавание речи и много других базовых тем современного NLP.
Особенно интересна глава про Transformers и предобучение. Там self-attention выводится через Q/K/V, а дальше идут multi-head attention, позиционная информация, Transformer-блоки, языковое моделирование, предобучение и декодирование.
Если хотите разобраться в фундаменте современных языковых моделей, это точно стоит сохранить как справочник.
web.stanford.edu/~jurafsky/slp3/
Последний черновик 2026 года доступен онлайн бесплатно и разбирает тему как с математической, так и с вычислительной стороны.
Книга разбита на главы, каждую можно отдельно скачать в PDF. К главам также приложены слайды лекций.
Внутри есть основы языковых моделей, эмбеддинги и векторная семантика, нейросети, Transformers и self-attention, предобучение, постобучение, prompting, машинный перевод, извлечение информации, ответы на вопросы, распознавание речи и много других базовых тем современного NLP.
Особенно интересна глава про Transformers и предобучение. Там self-attention выводится через Q/K/V, а дальше идут multi-head attention, позиционная информация, Transformer-блоки, языковое моделирование, предобучение и декодирование.
Если хотите разобраться в фундаменте современных языковых моделей, это точно стоит сохранить как справочник.
web.stanford.edu/~jurafsky/slp3/
Harvard бесплатно выложил один из лучших курсов по системам для ИИ, которые я видел.
CS249r идёт далеко за пределы архитектуры моделей. Здесь разбирается именно инженерная часть, от которой зависит, можно ли модель нормально обучать и эффективно запускать: процессоры, иерархия памяти, передача данных, ускорители, распределённые вычисления, инференс, квантование, сервинг, надёжность и развёртывание.
И это не просто учебник.
Внутри есть два открытых тома по ML Systems, TinyTorch для сборки собственного ML-фреймворка с нуля, интерактивные лабораторные прямо в браузере, MLSys·im для экспериментов с узкими местами железа и инфраструктуры, StaffML для практики по системам и слайды лекций самого курса.
В одном TinyTorch — 20 последовательных модулей. В лабораторных можно менять параметры системы и сразу смотреть, что становится узким местом, а не просто читать теорию.
Я бы изучал это уже после того, как нормально разобрался с нейросетями и Transformers.
Понимать, как работает attention, полезно. Но понимать, почему KV-кэш съедает память, когда инференс упирается в пропускную способность, почему batching меняет throughput и почему добавление GPU в какой-то момент перестаёт нормально масштабироваться — это уже совсем другой уровень.
Всё здесь:
mlsysbook.ai
GitHub: https://github.com/harvard-edge/cs249r_book
CS249r идёт далеко за пределы архитектуры моделей. Здесь разбирается именно инженерная часть, от которой зависит, можно ли модель нормально обучать и эффективно запускать: процессоры, иерархия памяти, передача данных, ускорители, распределённые вычисления, инференс, квантование, сервинг, надёжность и развёртывание.
И это не просто учебник.
Внутри есть два открытых тома по ML Systems, TinyTorch для сборки собственного ML-фреймворка с нуля, интерактивные лабораторные прямо в браузере, MLSys·im для экспериментов с узкими местами железа и инфраструктуры, StaffML для практики по системам и слайды лекций самого курса.
В одном TinyTorch — 20 последовательных модулей. В лабораторных можно менять параметры системы и сразу смотреть, что становится узким местом, а не просто читать теорию.
Я бы изучал это уже после того, как нормально разобрался с нейросетями и Transformers.
Понимать, как работает attention, полезно. Но понимать, почему KV-кэш съедает память, когда инференс упирается в пропускную способность, почему batching меняет throughput и почему добавление GPU в какой-то момент перестаёт нормально масштабироваться — это уже совсем другой уровень.
Всё здесь:
mlsysbook.ai
GitHub: https://github.com/harvard-edge/cs249r_book
GitHub
GitHub - harvard-edge/cs249r_book: Machine Learning Systems: Foundations, Scaling, Agentic AI, and Physical AI (Vols I–IV) • Harvard…
Machine Learning Systems: Foundations, Scaling, Agentic AI, and Physical AI (Vols I–IV) • Harvard CS249r | https://mlsysbook.ai - harvard-edge/cs249r_book
Европа вступает в гонку языковых моделей: Германия впервые выпустила модель с результатом почти 97% в математике.
Kolibri от Aleph Alpha: 78 млрд параметров. 3,46 млрд активных. Контекст до 1 млн токенов. Открытые веса под лицензией Apache 2.0.
Для дообучения использовали ответы китайских моделей: GLM от Zhipu и Qwen от Alibaba.
Хорошие небольшие модели могут создавать не только в США и Китае.😋
Kolibri от Aleph Alpha: 78 млрд параметров. 3,46 млрд активных. Контекст до 1 млн токенов. Открытые веса под лицензией Apache 2.0.
Для дообучения использовали ответы китайских моделей: GLM от Zhipu и Qwen от Alibaba.
Хорошие небольшие модели могут создавать не только в США и Китае.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
«Основы компьютерного зрения» — бесплатная онлайн-книга издательства MIT Press, которая даёт широкое введение в компьютерное зрение с точки зрения обработки изображений и машинного обучения.
В ней разбираются формирование изображений, обучение и обратное распространение ошибки, фильтрация изображений и анализ Фурье, CNN, RNN и трансформеры, генеративные модели, обучение представлений, трёхмерная геометрия, оценка движения, распознавание объектов, модели, работающие с изображениями и текстом, и многое другое.
Особенно мне нравится, что вся книга доступна прямо в HTML: с понятной и удобной вёрсткой, множеством схем и визуализаций, которые помогают разобраться в концепциях.
https://visionbook.mit.edu
В ней разбираются формирование изображений, обучение и обратное распространение ошибки, фильтрация изображений и анализ Фурье, CNN, RNN и трансформеры, генеративные модели, обучение представлений, трёхмерная геометрия, оценка движения, распознавание объектов, модели, работающие с изображениями и текстом, и многое другое.
Особенно мне нравится, что вся книга доступна прямо в HTML: с понятной и удобной вёрсткой, множеством схем и визуализаций, которые помогают разобраться в концепциях.
https://visionbook.mit.edu
This media is not supported in your browser
VIEW IN TELEGRAM
Начни изучать программирование GPU с одной полностью анимированной лекции на YouTube. Это первое видео в серии о программировании GPU с Triton.
Каждая идея объясняется наглядно, с помощью анимации — как в GIF из этого поста, только на протяжении целого часа.
Ты каждый день пишешь
В лекции разбираются:
— Как GPU встроен в компьютер: PCIe, NVLink, серверы и кластеры.
— Что внутри NVIDIA H100: потоковые мультипроцессоры, вычислительные линии FP32, планировщик варпов, тензорные ядра и разделяемая память.
— Потоки, варпы, блоки и сетки — и как каждый поток находит свой элемент.
— Память: SRAM и DRAM, DDR, GDDR и HBM, кеши, задержка и пропускная способность.
— Как ускорить работу с памятью: скрытие задержек, объединение обращений к памяти и слияние ядер.
— Зачем нужен Triton и как он позволяет мыслить тайлами вместо потоков.
— Ограничения по пропускной способности памяти и вычислительной мощности, арифметическая интенсивность и модель Roofline.
— Механизм внимания, матрица N × N и то, как FlashAttention решает связанную с ней проблему.
Знание CUDA и устройства железа не требуется.
Что дальше:
— Лекция 2: построчно напишем наше первое ядро на Triton для сложения векторов. Опубликую через несколько дней.
— Новые лекции о программировании GPU и оптимизации инференса.
— Запланированная серия о глубоком обучении для аудио.
Полная лекция:
https://youtu.be/dEZP1qUNTOk
Каждая идея объясняется наглядно, с помощью анимации — как в GIF из этого поста, только на протяжении целого часа.
Ты каждый день пишешь
c = a + b в PyTorch. Эта лекция показывает, что GPU на самом деле делает с этим выражением.В лекции разбираются:
— Как GPU встроен в компьютер: PCIe, NVLink, серверы и кластеры.
— Что внутри NVIDIA H100: потоковые мультипроцессоры, вычислительные линии FP32, планировщик варпов, тензорные ядра и разделяемая память.
— Потоки, варпы, блоки и сетки — и как каждый поток находит свой элемент.
— Память: SRAM и DRAM, DDR, GDDR и HBM, кеши, задержка и пропускная способность.
— Как ускорить работу с памятью: скрытие задержек, объединение обращений к памяти и слияние ядер.
— Зачем нужен Triton и как он позволяет мыслить тайлами вместо потоков.
— Ограничения по пропускной способности памяти и вычислительной мощности, арифметическая интенсивность и модель Roofline.
— Механизм внимания, матрица N × N и то, как FlashAttention решает связанную с ней проблему.
Знание CUDA и устройства железа не требуется.
Что дальше:
— Лекция 2: построчно напишем наше первое ядро на Triton для сложения векторов. Опубликую через несколько дней.
— Новые лекции о программировании GPU и оптимизации инференса.
— Запланированная серия о глубоком обучении для аудио.
Полная лекция:
https://youtu.be/dEZP1qUNTOk
«Разбираемся в трансформерах и механизмах внимания» — краткое математическое введение в механизм внимания, одну из ключевых идей современных языковых моделей.
Документ разбирает токенизацию и эмбеддинги, запросы, ключи и значения, оценки и веса внимания, многоголовое внимание, самовнимание, причинное внимание и маскирование, перекрёстное внимание и базовую структуру архитектуры Transformer.
Также в нём представлены важные методы, которые делают механизм внимания в современных LLM эффективнее: KV-кеширование, внимание с группировкой запросов (GQA), многозапросное внимание (MQA) и латентное внимание.
https://arxiv.org/pdf/2604.00965
Документ разбирает токенизацию и эмбеддинги, запросы, ключи и значения, оценки и веса внимания, многоголовое внимание, самовнимание, причинное внимание и маскирование, перекрёстное внимание и базовую структуру архитектуры Transformer.
Также в нём представлены важные методы, которые делают механизм внимания в современных LLM эффективнее: KV-кеширование, внимание с группировкой запросов (GQA), многозапросное внимание (MQA) и латентное внимание.
https://arxiv.org/pdf/2604.00965
Видеолекции от Раджа Дандекаря:
— Создаём LLM с нуля
— Создаём DeepSeek с нуля
— Принципы диффузионных моделей
— Создаём диффузионную языковую модель с нуля
— Создаём LLM с нуля
— Создаём DeepSeek с нуля
— Принципы диффузионных моделей
— Создаём диффузионную языковую модель с нуля
Google выпустила EmbeddingGemma 2.
Это первая открытая мультимодальная модель для эмбеддингов, изначально работающая с текстом, кодом, изображениями, видео и аудио.
740 млн параметров. Модульная архитектура. Модель создана для запуска прямо на устройстве, а не в дата-центре.
При этом она обходит некоторые специализированные модели, которые более чем вдвое крупнее.
В паре с Gemma 4 можно собрать полностью локальный RAG с упором на приватность.
https://huggingface.co/google/embeddinggemma-2
https://huggingface.co/unsloth/embeddinggemma-2-GGUF
Это первая открытая мультимодальная модель для эмбеддингов, изначально работающая с текстом, кодом, изображениями, видео и аудио.
740 млн параметров. Модульная архитектура. Модель создана для запуска прямо на устройстве, а не в дата-центре.
При этом она обходит некоторые специализированные модели, которые более чем вдвое крупнее.
В паре с Gemma 4 можно собрать полностью локальный RAG с упором на приватность.
https://huggingface.co/google/embeddinggemma-2
https://huggingface.co/unsloth/embeddinggemma-2-GGUF
1. Математические основы машинного обучения
https://t.co/6jaPNJW9wH
2. Математические основы генеративных моделей
https://t.co/LTmMWZcZNS
3. Математические основы генеративного ИИ
https://t.co/EURxtNfMmx
https://t.co/6jaPNJW9wH
2. Математические основы генеративных моделей
https://t.co/LTmMWZcZNS
3. Математические основы генеративного ИИ
https://t.co/EURxtNfMmx