Data Portal | DS & ML
10.5K subscribers
695 photos
160 videos
9 files
890 links
Всё самое интересное из мира Data Science и машинного обучения

Cотрудничество: @devmangx

Автор: @ScienceLLM

№ 8204670314
Download Telegram
«Speech and Language Processing» от Stanford — большой бесплатный ресурс по современному NLP и большим языковым моделям.

Последний черновик 2026 года доступен онлайн бесплатно и разбирает тему как с математической, так и с вычислительной стороны.

Книга разбита на главы, каждую можно отдельно скачать в PDF. К главам также приложены слайды лекций.

Внутри есть основы языковых моделей, эмбеддинги и векторная семантика, нейросети, Transformers и self-attention, предобучение, постобучение, prompting, машинный перевод, извлечение информации, ответы на вопросы, распознавание речи и много других базовых тем современного NLP.

Особенно интересна глава про Transformers и предобучение. Там self-attention выводится через Q/K/V, а дальше идут multi-head attention, позиционная информация, Transformer-блоки, языковое моделирование, предобучение и декодирование.

Если хотите разобраться в фундаменте современных языковых моделей, это точно стоит сохранить как справочник.

web.stanford.edu/~jurafsky/slp3/
Harvard бесплатно выложил один из лучших курсов по системам для ИИ, которые я видел.

CS249r идёт далеко за пределы архитектуры моделей. Здесь разбирается именно инженерная часть, от которой зависит, можно ли модель нормально обучать и эффективно запускать: процессоры, иерархия памяти, передача данных, ускорители, распределённые вычисления, инференс, квантование, сервинг, надёжность и развёртывание.

И это не просто учебник.

Внутри есть два открытых тома по ML Systems, TinyTorch для сборки собственного ML-фреймворка с нуля, интерактивные лабораторные прямо в браузере, MLSys·im для экспериментов с узкими местами железа и инфраструктуры, StaffML для практики по системам и слайды лекций самого курса.

В одном TinyTorch — 20 последовательных модулей. В лабораторных можно менять параметры системы и сразу смотреть, что становится узким местом, а не просто читать теорию.

Я бы изучал это уже после того, как нормально разобрался с нейросетями и Transformers.

Понимать, как работает attention, полезно. Но понимать, почему KV-кэш съедает память, когда инференс упирается в пропускную способность, почему batching меняет throughput и почему добавление GPU в какой-то момент перестаёт нормально масштабироваться — это уже совсем другой уровень.

Всё здесь:

mlsysbook.ai

GitHub: https://github.com/harvard-edge/cs249r_book
Европа вступает в гонку языковых моделей: Германия впервые выпустила модель с результатом почти 97% в математике.

Kolibri от Aleph Alpha: 78 млрд параметров. 3,46 млрд активных. Контекст до 1 млн токенов. Открытые веса под лицензией Apache 2.0.

Для дообучения использовали ответы китайских моделей: GLM от Zhipu и Qwen от Alibaba.

Хорошие небольшие модели могут создавать не только в США и Китае. 😋
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
«Основы компьютерного зрения» — бесплатная онлайн-книга издательства MIT Press, которая даёт широкое введение в компьютерное зрение с точки зрения обработки изображений и машинного обучения.

В ней разбираются формирование изображений, обучение и обратное распространение ошибки, фильтрация изображений и анализ Фурье, CNN, RNN и трансформеры, генеративные модели, обучение представлений, трёхмерная геометрия, оценка движения, распознавание объектов, модели, работающие с изображениями и текстом, и многое другое.

Особенно мне нравится, что вся книга доступна прямо в HTML: с понятной и удобной вёрсткой, множеством схем и визуализаций, которые помогают разобраться в концепциях.

https://visionbook.mit.edu
This media is not supported in your browser
VIEW IN TELEGRAM
Начни изучать программирование GPU с одной полностью анимированной лекции на YouTube. Это первое видео в серии о программировании GPU с Triton.

Каждая идея объясняется наглядно, с помощью анимации — как в GIF из этого поста, только на протяжении целого часа.

Ты каждый день пишешь c = a + b в PyTorch. Эта лекция показывает, что GPU на самом деле делает с этим выражением.

В лекции разбираются:

— Как GPU встроен в компьютер: PCIe, NVLink, серверы и кластеры.
— Что внутри NVIDIA H100: потоковые мультипроцессоры, вычислительные линии FP32, планировщик варпов, тензорные ядра и разделяемая память.
— Потоки, варпы, блоки и сетки — и как каждый поток находит свой элемент.
— Память: SRAM и DRAM, DDR, GDDR и HBM, кеши, задержка и пропускная способность.
— Как ускорить работу с памятью: скрытие задержек, объединение обращений к памяти и слияние ядер.
— Зачем нужен Triton и как он позволяет мыслить тайлами вместо потоков.
— Ограничения по пропускной способности памяти и вычислительной мощности, арифметическая интенсивность и модель Roofline.
— Механизм внимания, матрица N × N и то, как FlashAttention решает связанную с ней проблему.

Знание CUDA и устройства железа не требуется.

Что дальше:

— Лекция 2: построчно напишем наше первое ядро на Triton для сложения векторов. Опубликую через несколько дней.
— Новые лекции о программировании GPU и оптимизации инференса.
— Запланированная серия о глубоком обучении для аудио.

Полная лекция:
https://youtu.be/dEZP1qUNTOk
«Разбираемся в трансформерах и механизмах внимания» — краткое математическое введение в механизм внимания, одну из ключевых идей современных языковых моделей.

Документ разбирает токенизацию и эмбеддинги, запросы, ключи и значения, оценки и веса внимания, многоголовое внимание, самовнимание, причинное внимание и маскирование, перекрёстное внимание и базовую структуру архитектуры Transformer.

Также в нём представлены важные методы, которые делают механизм внимания в современных LLM эффективнее: KV-кеширование, внимание с группировкой запросов (GQA), многозапросное внимание (MQA) и латентное внимание.

https://arxiv.org/pdf/2604.00965
Google выпустила EmbeddingGemma 2.

Это первая открытая мультимодальная модель для эмбеддингов, изначально работающая с текстом, кодом, изображениями, видео и аудио.

740 млн параметров. Модульная архитектура. Модель создана для запуска прямо на устройстве, а не в дата-центре.

При этом она обходит некоторые специализированные модели, которые более чем вдвое крупнее.

В паре с Gemma 4 можно собрать полностью локальный RAG с упором на приватность.

https://huggingface.co/google/embeddinggemma-2

https://huggingface.co/unsloth/embeddinggemma-2-GGUF
1. Математические основы машинного обучения
https://t.co/6jaPNJW9wH

2. Математические основы генеративных моделей
https://t.co/LTmMWZcZNS

3. Математические основы генеративного ИИ
https://t.co/EURxtNfMmx