Data Portal | DS & ML
10.5K subscribers
695 photos
160 videos
9 files
890 links
Всё самое интересное из мира Data Science и машинного обучения

Cотрудничество: @devmangx

Автор: @ScienceLLM

№ 8204670314
Download Telegram
Лекция 8 курса по машинному обучению на графах посвящена графовым свёрточным сетям.

В лекции разбираются свёртки на сетках и графах, сопоставление с общим шаблоном, спектральная свёртка, преобразование Фурье, полиномы Чебышёва, изотропная и анизотропная агрегация, а также архитектуры ChebNet, GCN, GAT и GatedGCN.

https://storage.googleapis.com/xavierbresson/lectures/GML/lecture08_graph_convolutional_networks.pdf
«Как обучить нейросеть» — краткий конспект лекций курса MIT по глубокому обучению за 2024 год. Он посвящён одному из фундаментальных вопросов нейросетей — как модель обучает свои веса.

В конспекте процесс обучения рассматривается с математической точки зрения. Разбираются прямой проход, функции потерь, градиенты, обратное распространение ошибки и градиентные методы оптимизации.

Думаю, это интересный материал для тех, кто хочет выйти за рамки общего интуитивного представления о нейросетях и начать разбираться в математике, на которой основано их обучение.

https://ocw.mit.edu/courses/6-7960-deep-learning-fall-2024/mit6_7960_f24_lec2.pdf
«Изучение математики. Почему память, практика и техника важнее таланта»

Чтобы освоить математику, необходимо запомнить большой объём информации, правил, способов упрощения и приёмов решения задач. Другого пути нет. Теория полезна, но в меру.

Это как изучение языка. Если слишком сосредоточиться на грамматике, никогда не научишься свободно на нём говорить.

https://algebrica.org/learning-mathematics/
Modern Robotics: Mechanics, Planning, and Control.

Сохраните на потом.

Это полноценный учебник по робототехнике уровня магистратуры от Кевина Линча и Фрэнка Парка, изданный Cambridge University Press.

Внутри:

- конфигурационные пространства
- кинематика
- динамика
- генерация траекторий
- планирование движения
- управление роботами

По сути, это современная математическая база того, как роботы двигаются и взаимодействуют с окружающим миром.

https://hades.mech.northwestern.edu/images/7/7f/MR.pdf
This media is not supported in your browser
VIEW IN TELEGRAM
Нашёл хороший ресурс для интерактивного изучения машинного обучения и ИИ — VizLearn.

Можно поэкспериментировать с градиентным спуском, SVM, PCA, методом Байеса, токенизацией BPE, Q/K/V, KV-кэшем, квантизацией и многим другим. Меняешь входные данные и видишь, как меняются сами вычисления.

Бесплатно, без регистрации.

https://vizlearn.in
Reasoning from Scratch, шестой выпуск. Себастьян Рашка

Введение и практическая реализация обучения с подкреплением с проверяемыми наградами RLVR и Group Relative Policy Optimization GRPO.

00:00 — Введение
01:54 — Чем reasoning-модель отличается от обычной
04:25 — Цепочки рассуждений и возможности модели
08:29 — Награды за точность и формат ответа
11:34 — «Aha-моменты» и обучение DeepSeek-R1
14:41 — Глубина рассуждений и длина ответа
18:38 — RLHF и RLVR
23:04 — GRPO против PPO
26:40 — Объяснение GRPO на аналогии с готовкой
31:43 — KL-компонент и упрощённый GRPO
35:04 — Загрузка предобученной модели
36:07 — Загрузка обучающих данных MATH
39:26 — Генерация ответов модели
46:30 — Расчёт проверяемых наград
49:55 — Расчёт преимуществ
51:54 — Логарифмические вероятности токенов и последовательностей
55:29 — Реализация логарифмических вероятностей последовательностей
57:37 — Исправление ошибки режима инференса
1:02:24 — Расчёт функции потерь GRPO
1:04:37 — Собираем один шаг GRPO целиком
1:09:19 — Цикл обучения GRPO
1:12:57 — Настройки обучения, логирование и чекпоинты
1:17:24 — Запуск обучения и разбор результатов
1:19:28 — Загрузка и оценка чекпоинтов
1:22:33 — Результаты MATH-500 и стабильность обучения
1:24:05 — Требования к памяти и следующие шаги

https://www.youtube.com/watch?v=237Hf7Q3lgg
«Speech and Language Processing» от Stanford — большой бесплатный ресурс по современному NLP и большим языковым моделям.

Последний черновик 2026 года доступен онлайн бесплатно и разбирает тему как с математической, так и с вычислительной стороны.

Книга разбита на главы, каждую можно отдельно скачать в PDF. К главам также приложены слайды лекций.

Внутри есть основы языковых моделей, эмбеддинги и векторная семантика, нейросети, Transformers и self-attention, предобучение, постобучение, prompting, машинный перевод, извлечение информации, ответы на вопросы, распознавание речи и много других базовых тем современного NLP.

Особенно интересна глава про Transformers и предобучение. Там self-attention выводится через Q/K/V, а дальше идут multi-head attention, позиционная информация, Transformer-блоки, языковое моделирование, предобучение и декодирование.

Если хотите разобраться в фундаменте современных языковых моделей, это точно стоит сохранить как справочник.

web.stanford.edu/~jurafsky/slp3/
Harvard бесплатно выложил один из лучших курсов по системам для ИИ, которые я видел.

CS249r идёт далеко за пределы архитектуры моделей. Здесь разбирается именно инженерная часть, от которой зависит, можно ли модель нормально обучать и эффективно запускать: процессоры, иерархия памяти, передача данных, ускорители, распределённые вычисления, инференс, квантование, сервинг, надёжность и развёртывание.

И это не просто учебник.

Внутри есть два открытых тома по ML Systems, TinyTorch для сборки собственного ML-фреймворка с нуля, интерактивные лабораторные прямо в браузере, MLSys·im для экспериментов с узкими местами железа и инфраструктуры, StaffML для практики по системам и слайды лекций самого курса.

В одном TinyTorch — 20 последовательных модулей. В лабораторных можно менять параметры системы и сразу смотреть, что становится узким местом, а не просто читать теорию.

Я бы изучал это уже после того, как нормально разобрался с нейросетями и Transformers.

Понимать, как работает attention, полезно. Но понимать, почему KV-кэш съедает память, когда инференс упирается в пропускную способность, почему batching меняет throughput и почему добавление GPU в какой-то момент перестаёт нормально масштабироваться — это уже совсем другой уровень.

Всё здесь:

mlsysbook.ai

GitHub: https://github.com/harvard-edge/cs249r_book
Европа вступает в гонку языковых моделей: Германия впервые выпустила модель с результатом почти 97% в математике.

Kolibri от Aleph Alpha: 78 млрд параметров. 3,46 млрд активных. Контекст до 1 млн токенов. Открытые веса под лицензией Apache 2.0.

Для дообучения использовали ответы китайских моделей: GLM от Zhipu и Qwen от Alibaba.

Хорошие небольшие модели могут создавать не только в США и Китае. 😋
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
«Основы компьютерного зрения» — бесплатная онлайн-книга издательства MIT Press, которая даёт широкое введение в компьютерное зрение с точки зрения обработки изображений и машинного обучения.

В ней разбираются формирование изображений, обучение и обратное распространение ошибки, фильтрация изображений и анализ Фурье, CNN, RNN и трансформеры, генеративные модели, обучение представлений, трёхмерная геометрия, оценка движения, распознавание объектов, модели, работающие с изображениями и текстом, и многое другое.

Особенно мне нравится, что вся книга доступна прямо в HTML: с понятной и удобной вёрсткой, множеством схем и визуализаций, которые помогают разобраться в концепциях.

https://visionbook.mit.edu
This media is not supported in your browser
VIEW IN TELEGRAM
Начни изучать программирование GPU с одной полностью анимированной лекции на YouTube. Это первое видео в серии о программировании GPU с Triton.

Каждая идея объясняется наглядно, с помощью анимации — как в GIF из этого поста, только на протяжении целого часа.

Ты каждый день пишешь c = a + b в PyTorch. Эта лекция показывает, что GPU на самом деле делает с этим выражением.

В лекции разбираются:

— Как GPU встроен в компьютер: PCIe, NVLink, серверы и кластеры.
— Что внутри NVIDIA H100: потоковые мультипроцессоры, вычислительные линии FP32, планировщик варпов, тензорные ядра и разделяемая память.
— Потоки, варпы, блоки и сетки — и как каждый поток находит свой элемент.
— Память: SRAM и DRAM, DDR, GDDR и HBM, кеши, задержка и пропускная способность.
— Как ускорить работу с памятью: скрытие задержек, объединение обращений к памяти и слияние ядер.
— Зачем нужен Triton и как он позволяет мыслить тайлами вместо потоков.
— Ограничения по пропускной способности памяти и вычислительной мощности, арифметическая интенсивность и модель Roofline.
— Механизм внимания, матрица N × N и то, как FlashAttention решает связанную с ней проблему.

Знание CUDA и устройства железа не требуется.

Что дальше:

— Лекция 2: построчно напишем наше первое ядро на Triton для сложения векторов. Опубликую через несколько дней.
— Новые лекции о программировании GPU и оптимизации инференса.
— Запланированная серия о глубоком обучении для аудио.

Полная лекция:
https://youtu.be/dEZP1qUNTOk
«Разбираемся в трансформерах и механизмах внимания» — краткое математическое введение в механизм внимания, одну из ключевых идей современных языковых моделей.

Документ разбирает токенизацию и эмбеддинги, запросы, ключи и значения, оценки и веса внимания, многоголовое внимание, самовнимание, причинное внимание и маскирование, перекрёстное внимание и базовую структуру архитектуры Transformer.

Также в нём представлены важные методы, которые делают механизм внимания в современных LLM эффективнее: KV-кеширование, внимание с группировкой запросов (GQA), многозапросное внимание (MQA) и латентное внимание.

https://arxiv.org/pdf/2604.00965
Google выпустила EmbeddingGemma 2.

Это первая открытая мультимодальная модель для эмбеддингов, изначально работающая с текстом, кодом, изображениями, видео и аудио.

740 млн параметров. Модульная архитектура. Модель создана для запуска прямо на устройстве, а не в дата-центре.

При этом она обходит некоторые специализированные модели, которые более чем вдвое крупнее.

В паре с Gemma 4 можно собрать полностью локальный RAG с упором на приватность.

https://huggingface.co/google/embeddinggemma-2

https://huggingface.co/unsloth/embeddinggemma-2-GGUF
1. Математические основы машинного обучения
https://t.co/6jaPNJW9wH

2. Математические основы генеративных моделей
https://t.co/LTmMWZcZNS

3. Математические основы генеративного ИИ
https://t.co/EURxtNfMmx