Data Portal | DS & ML
10.1K subscribers
657 photos
153 videos
9 files
851 links
Всё самое интересное из мира Data Science и машинного обучения

Cотрудничество: @devmangx

Автор: @ScienceLLM
Download Telegram
Если хотите разобраться, как обучить большую модель с нуля, рекомендую посмотреть вот это ↓

Сооснователь ARC Prize и создатель Keras Франсуа Шолле недавно посоветовал путь для изучения LLM с нуля.

Он сказал, что если вам 17 лет или вообще сколько угодно и вы хотите с нуля научиться создавать LLM, просто прочитайте главы 15 и 16 его книги *Deep Learning with Python*.

Я бегло их просмотрел, и эти две главы точно стоит сохранить.

Глава 15 начинается с самых базовых языковых моделей и постепенно доходит до

Character-level Language Model → Seq2Seq → Attention → QKV → Scaled Dot-Product Attention → Multi-Head Attention → Self-Attention → Transformer

Там даже есть отдельный раздел с объяснением того, почему вообще работает Dot-Product Attention.

Сам он говорит, что это одно из лучших объяснений этой темы.

Автор не останавливается на формулах вроде QKᵀ / √d. Он начинает с Word2Vec и пространства эмбеддингов, а затем объясняет, как Transformer слой за слоем через Attention постепенно превращает связи между токенами в отношения расстояний в векторном пространстве.

Глава 16 ещё практичнее. В ней напрямую показывают, как обучить mini-GPT с нуля.

Разбирается, как взять почти 1 миллиард токенов из C4, собрать словарь SentencePiece на 32 тысячи токенов, настроить mini-GPT на 41 миллион параметров с 8 слоями, 8 головами внимания и размером скрытого состояния 512, а затем самостоятельно собрать конвейер данных, сделать weight tying, прогрев скорости обучения, предобучение и генерацию с temperature и top-k.

От токенизатора, конвейера данных, causal attention, weight tying и прогрева скорости обучения до предобучения, greedy decoding, temperature и top-k sampling. По сути, вас шаг за шагом проводят через полный процесс обучения GPT.

Для этого даже не нужен дорогой сервер.

В официальном примечании указано, что весь пример можно запустить на бесплатной T4 в Google Colab. Обучение займёт около 6 часов. На A100 — чуть больше часа.

Дальше в книге разбираются Gemma, SFT, RLHF, RAG и мультимодальные модели.

Поэтому если меня спросят

«Я никогда раньше не обучал большую модель. С чего начать?»

Эти две главы действительно могут быть отличной отправной точкой.

Третье издание *Deep Learning with Python* сейчас доступно для бесплатного чтения онлайн, а все сопутствующие ноутбуки полностью открыты. Их можно просто загрузить в Colab и запустить.

В 2026 году для изучения LLM уже необязательно сразу садиться и разбирать сотню научных статей.

Если один раз самостоятельно обучить GPT на 41 миллион параметров от подготовки данных до генерации текста, очень многие концепции после этого естественным образом складываются в единую картину.
Полный курс по Hugging Face Transformers.

Что вы изучите:

— Поймёте устройство трансформеров и LLM без отношения к ним как к «чёрному ящику»
— Разберётесь, как модели обучаются, оптимизируются и улучшаются на данных
— Научитесь работать с последовательностями, текстом и задачами языкового моделирования
— Сформируете практическое понимание этой части LLM и генеративного ИИ
— Разберётесь с последовательностными моделями вроде RNN и LSTM для задач обработки естественного языка

https://www.youtube.com/playlist?list=PLOj3JD_j8uXEsxFZGcRyjI_ZawoSvCfti
«Learning Mathematics» — самая читаемая публикация за всю историю алгебры.

Автор очень лично рассказывает о том, что математика — не что-то, доступное только людям с особым талантом или врождённым даром.

Ей может научиться каждый — постепенно, шаг за шагом, с практикой, временем и упорством.

Если вы хотя бы раз думали «математика просто не для меня», возможно, эту статью стоит прочитать.

https://algebrica.org/learning-mathematics/
Нашёл отличный открытый курс от Zhejiang University — Large Model Basics.

У проекта уже больше 16 тысяч звёзд на GitHub, и это не просто один учебник.

Внутри последовательно разобраны Transformer, архитектуры больших моделей, промпты, цепочки рассуждений, LoRA, редактирование моделей, RAG и другие базовые темы.

Но самое полезное здесь — структура.

К каждой главе приложен список оригинальных научных работ. Отдельно собраны классические статьи и еженедельные подборки с arXiv.

То есть можно сначала разобраться в теме по учебнику, а потом сразу идти в первоисточники.

Сейчас многие изучают LLM очень фрагментарно. Сегодня агенты, завтра обучение с подкреплением, послезавтра Harness.

В итоге знаний становится много, но между ними остаются огромные дыры.

А этот репозиторий как раз выглядит как нормальная карта, по которой можно системно закрыть фундамент.

https://github.com/ZJU-LLMs/Foundations-of-LLMs
Бесплатный курс по современной робототехнике.

Учебник Modern Robotics Кевина Линча и Фрэнка Парка теперь доступен в формате полноценного курса на YouTube.

В программе шесть частей. Основы движения роботов, кинематика, динамика, планирование и управление движением, манипуляция и колёсные мобильные роботы, а в конце итоговый проект по мобильной манипуляции.

Разбираются пространство конфигураций, движения твёрдых тел, прямая и обратная кинематика, динамика, построение траекторий, планирование движения, управление роботами, захват объектов и мобильные роботы.

Вместе с курсом доступны задачи с решениями, экзамены Seoul National University за 2017–2020 годы, видеолекции и код на Python, MATLAB и Mathematica.

Курс можно пройти бесплатно на YouTube.
Использование искусственного интеллекта как полноценного участника команды при анализе данных.

Курс Габора Бекеша «Data Analysis with AI», обновлённый летом 2026 года, больше ориентирован на практику, чем на теорию.

И при этом он полностью бесплатный и с открытым исходным кодом.

https://gabors-data-analysis.com/ai-course/
Представляю вам сильно обновлённую открытую книгу Machine Learning Engineering за август 2026 года.

https://github.com/stas00/ml-engineering

Если удобнее читать в PDF, теперь в ней уже 498 страниц.

https://github.com/stas00/ml-engineering#ebook-versions-of-the-book

Книга получила огромное обновление. Характеристики современного высокопроизводительного железа привели в актуальное состояние, а многие примеры и разборы обновили под свежие версии PyTorch, CUDA и других критически важных компонентов для машинного обучения.

Также исправили множество ошибок и неточностей.
Нашёл ещё один хороший бесплатный учебник — Classical Mechanics.

Это больше 300 страниц классической механики уровня первого курса университета.

Внутри скорость и ускорение, импульс, кинетическая энергия, силы, работа и мощность, движение в двух измерениях, вращательная динамика, гравитация, гармонические колебания, волны и многое другое.

Что особенно хорошо — авторы постоянно связывают физику с математикой.

Например, скорость рассматривается как производная координаты, а ускорение как вторая производная. И дальше эта логика проходит через весь учебник.

Есть много разобранных примеров и задач, а объяснения при этом довольно доступные.

Если хотите системно подтянуть механику и заодно лучше почувствовать, как математика описывает физический мир, точно стоит сохранить.

https://scholarworks.uark.edu/oer/3/
«Математические методы в науке о данных с Python» Себастьяна Роша.

https://mmids-textbook.github.io
NVIDIA AI Infrastructure & Operations (NCA-AIIO) — полный курс для подготовки к сертификационному экзамену.

Что вы изучите

• Получите практическое понимание этого направления глубокого обучения
• Разберётесь, как модели обучаются, оптимизируются и улучшаются на данных
• Научитесь подготавливать данные и признаки для построения моделей
• Поймёте, как объединять поиск, эмбеддинги и генерацию в практические ИИ-системы
• Научитесь работать с последовательностями, текстом и языковым моделированием
• Перейдёте от ноутбуков к развёртываемым ИИ-системам с мониторингом

https://www.youtube.com/playlist?list=PLFR3p8fW9K1_oHvOcDfDGxKXL_iKWC1Y8
«Mathematics of Data Science» — это недавний учебник, опубликованный в июле 2026 года и доступный бесплатно. Он написан специально для тех, кто хочет разобраться в математике, лежащей в основе фундаментальных концепций, методов и применений современной науки о данных.

В книге рассматриваются геометрия и теория вероятностей в пространствах высокой размерности, концентрация меры, сингулярное разложение, метод главных компонент, линейная регрессия и регуляризация, нелинейное снижение размерности, диффузионные карты, случайные проекции, оптимизация, классификация, метод опорных векторов, оценки обобщающей способности и многое другое.

Особенно интересна глава 5. Она полностью посвящена графам, сетям и кластеризации, включая k-means и спектральную кластеризацию. Также в ней даётся интуитивное математическое объяснение Google PageRank и показывается, как структуру ссылок между веб-страницами можно представить и анализировать, чтобы оценить их относительную значимость.

Разделы о задачах классификации тоже стоит прочитать. В них рассматриваются бинарные и линейные классификаторы, логистическая регрессия, матрицы ошибок, ROC-анализ, метод опорных векторов, многоклассовая классификация и математические основы обобщающей способности.

https://arxiv.org/pdf/2607.11938
Однажды в 1963 году во время скучного совещания Станислав Улам нарисовал квадрат, поставил в центре число 1, а затем начал записывать целые числа по возрастанию в виде спирали, расходящейся к краям листа.

После этого он обвёл все простые числа и сразу заметил странную вещь. Они явно стремились выстраиваться вдоль диагональных линий, расходящихся от центральной единицы.

По словам самого Улама, расположение простых чисел «выглядит крайне неслучайным».

Улам поспешил домой и продолжил спираль, охватив гораздо больше чисел. Странный рисунок никуда не исчез.

Простые числа продолжали собираться в скопления, которые формировали красивую структуру, при этом заранее предсказать её было невозможно.

Сегодня с помощью компьютеров эту закономерность можно исследовать практически без ограничений.

Получается удивительно богатое сочетание симметрии и неожиданности, чем-то напоминающее фракталы.
За последние несколько лет сам процесс исследований в ML/NLP изменился с невероятной скоростью.

Аспирантка CMU Эмми Лю в тексте «When We Did Research By Hand» вспоминает свой путь в аспирантуре и условно делит эти годы на три этапа.

2021 год. Чтение статей, написание кода, отладка, запуск экспериментов — практически всё делалось вручную.

После появления ChatGPT ИИ начинает помогать с написанием кода, но всё ещё остаётся инструментом для копирования кода и бесконечной отладки.

Теперь, в эпоху агентов, реализация обычных экспериментов всё реже становится узким местом. Когда идея уже сформулирована, значительную часть кода и экспериментов можно просто передать кодинг-агенту.

И здесь возникает вполне реальный вопрос.

Если «написать код и запустить эксперименты» становится всё дешевле, какие навыки исследователя остаются действительно ценными?

Она даже задаётся вопросом, не будут ли в будущем аспирантов оценивать в первую очередь не по количеству опубликованных статей, а по тому, способны ли они руководить командой агентов и с её помощью развивать целостное и последовательное исследовательское направление.

Количество научных работ продолжит расти, а даже рецензии уже начинают массово генерироваться с помощью LLM. В результате вся система конференций и рецензирования может оказаться вынуждена измениться.

Но я всё ещё согласен с одной мыслью, которую она оставляет в конце.

По крайней мере пока именно людям предстоит решать, какие проблемы действительно стоит исследовать и почему ими вообще стоит заниматься.

Агенты могут всё сильнее ускорять эксперименты, но вопрос «что именно мы вообще хотим узнать?» может стать только ещё важнее.
Та же самая модель, но если временно подставить более подходящий Harness, её производительность действительно может превзойти даже более сильные передовые модели.

В этой работе предлагается JIT-Agent, который специально учится тому, «как проектировать Harness для агента».

Раньше Harness и конфигурация агента в основном заранее проектировались людьми, а затем переиспользовались для разных задач.

JIT-Agent работает иначе. Сначала он смотрит на текущую задачу, а затем прямо на месте генерирует под неё отдельный Harness.

Сам Harness разбивается на четыре части: память, планирование, действия и оркестрация инструментов и Skills.

Если во время выполнения что-то ломается, система автоматически исправляет Harness на основе отчётов об ошибках. По мере накопления задач наиболее успешные Harness попадают в библиотеку опыта и продолжают влиять на последующие генерации.

Результаты довольно показательные.

После добавления JIT-Agent к DeepSeek-V4-Flash результат на DeepSearchQA вырос с 76,2 до 85,1, превысив 76,0 у GPT-5.6.

GLM-5.2 на отдельных задачах получает прирост до 20,2 процентного пункта.

При сравнении с фиксированными базовыми конфигурациями JIT-Agent также использовал меньше всего токенов и требовал наименьших затрат на API во всех шести экспериментальных группах. В среднем экономия составила 36% относительно самого дешёвого фиксированного Harness.

То есть масштабировать агентов можно не только за счёт более сильных моделей и увеличения вычислений на этапе инференса.

Можно отдельно обучать систему, которая будет учиться отвечать на другой вопрос:

«Как именно должен быть организован агент для этой конкретной задачи?»
Один из лучших курсов по основам робототехники, которые я знаю, полностью бесплатный и доступен на YouTube.

Курс Classical Control Theory от brianbdouglas

46 видео, никакой платной подписки, только учебный материал для тех, кто хочет заниматься робототехникой и автоматизацией.

Курс разбирает фундаментальный слой, на котором до сих пор держится огромная часть робототехники и автоматизации:

→ управление с обратной связью, передаточные функции и ПИД-регуляторы
→ временная и частотная области, преобразования Фурье и Лапласа
→ устойчивость, корневые годографы и диаграммы Боде
→ идентификация систем и моделирование физических объектов
→ практические примеры с роботизированным автомобилем, которые связывают всё вместе

Кто-то наверняка скажет, что это уже устарело и сейчас наступила эпоха «робототехники 2.0», фундаментальных моделей и физического ИИ.

Но есть одна проблема.

В конечном счёте любая такая модель всё равно отправляет какое-то число на двигатель.

Кто-то должен удерживать сустав робота в заданном положении, компенсировать внешние возмущения и сохранять устойчивость при изменении нагрузки.

Именно этим занимается теория управления.

Она никуда не исчезает только потому, что выше по системе теперь находится нейросеть.

Теория управления — это то, что превращает красивую демонстрацию робота в систему, способную стабильно повторять результат.

Если хочется понимать робототехнику глубже роликов с демонстрациями, я бы начинал именно отсюда.

https://youtube.com/playlist?list=PLUMWjy5jgHK1NC52DXXrriwihVrYZKqjk
Архитектура Apple Silicon оказалась почти идеальной для запуска больших языковых моделей.

Всё благодаря сочетанию быстрой памяти, высокой пропускной способности и единой архитектуры памяти.

Mac Studio M5 Ultra с 512 ГБ памяти и пропускной способностью 1,2 ТБ/с способен целиком уместить GLM-5.3-Flash на 320 млрд параметров в FP8 и выдавать около 60 токенов в секунду локально, прямо на рабочем столе.

Альтернатива на ПК?

Примерно 10 RTX 5090 стоимостью более $20 000 и своя небольшая электростанция.

Полная версия GLM-5.3-Flash на 320 млрд параметров в FP8 весит около 306 ГБ.

У одной RTX 5090 всего 32 ГБ видеопамяти. Поэтому только для размещения весов модели понадобится минимум 10 видеокарт.

10 × 32 ГБ = 320 ГБ.

Mac Studio решает эту проблему за счёт единого пула памяти объёмом до 512 ГБ с пропускной способностью 1,2 ТБ/с.

Вместо того чтобы собирать ПК-кластер из множества видеокарт, бороться с задержками шины PCIe и энергопотреблением в районе 5000 Вт, можно загрузить всю модель объёмом 306 ГБ вместе с огромным контекстом и KV-кэшем в один настольный компьютер.
Почему фундаментальные знания действительно важны и играют огромную роль — поэтому не пропускайте курсы по основам информатики в университете.

Устройство операционных систем, иерархия памяти, принцип работы предсказания переходов, проблемы выравнивания памяти, привязка процессов к ядрам, ложное совместное использование кэша — и это лишь верхушка айсберга.

Очень многие вещи, которые кажутся теорией в университете, напрямую влияют на то, насколько быстро и эффективно работает настоящий софт.

И хороший пример — vLLM. Его PagedAttention буквально использует идею виртуальной памяти и страничного управления из операционных систем, чтобы эффективнее управлять KV-кэшем LLM. В результате vLLM показал ускорение обработки запросов в 2–4 раза при сопоставимой задержке.

Именно поэтому фундаментальные знания никуда не исчезают. Они становятся ещё ценнее по мере того, как программное обеспечение всё сильнее упирается в железо.

https://arxiv.org/pdf/2309.06180
От машинного обучения и визуализации данных до временных рядов и финансовых данных.

В одном репозитории собрано 920 открытых проектов на Python, разбитых на 34 категории.

Хорошая подборка, если хочется быстро находить проверенные библиотеки и инструменты для ML, анализа данных и смежных задач, а не искать всё по GitHub вручную.

🔗 https://github.com/lukasmasuch/best-of-ml-python
Cambridge в этот раз просто выкатил настоящую бомбу.

Целая подборка классических учебников по ИИ и машинному обучению теперь доступна бесплатно в PDF.

Если хочется нормально разобраться в машинном обучении и не тратить деньги на переоценённые курсы, этих десяти книг хватит, чтобы построить очень крепкую базу.

От простого к сложному.

1️⃣ Understanding Machine Learning

Одна из лучших книг для входа с нуля. Разбирает основные теоретические алгоритмы машинного обучения.

🔗 https://cs.huji.ac.il/~shais/UnderstandingMachineLearning/understanding-machine-learning-theory-algorithms.pdf

2️⃣ Mathematical Foundations of Machine Learning

Если с математикой пока не очень уверенно, я бы начал именно отсюда.

🔗 https://mml-book.github.io/book/mml-book.pdf

3️⃣ Mathematical Analysis of Machine Learning Algorithms

Уже более глубокое погружение в математические принципы алгоритмов машинного обучения.

🔗 https://tongzhang-ml.org/lt-book/lt-book.pdf

4️⃣ Theoretical Principles of Deep Learning

Теоретические основы глубокого обучения и понимание того, почему всё это вообще работает.

🔗 https://arxiv.org/pdf/2106.10165

5️⃣ Neural Networks and Learning Machines

Системный разбор нейронных сетей и принципов их обучения.

🔗 https://arxiv.org/pdf/1901.05639

6️⃣ Graph Deep Learning

Хорошая отправная точка для тех, кто хочет разобраться в графовых нейронных сетях.

🔗 https://yaoma24.github.io/dlg_book/dlg_book.pdf

7️⃣ Machine Learning: A Probabilistic Perspective

Позволяет посмотреть на машинное обучение через вероятностный и алгоритмический подход.

🔗 https://people.csail.mit.edu/moitra/docs/bookexv2.pdf

8️⃣ Probability Theory: Theory and Examples

Фундаментальная теория вероятностей. Очень полезна, если хочется понимать машинное обучение глубже уровня использования готовых библиотек.

🔗 https://sites.math.duke.edu/~rtd/PTE/PTE5_011119.pdf

9️⃣ Fundamentals of Applied Probability

Больше внимания практическому применению теории вероятностей.

🔗 https://sites.math.duke.edu/~rtd/EP4A/EP4A_April2021.pdf

🔟 Advanced Data Analysis

Уже продвинутый уровень для тех, кто хочет серьёзно прокачаться в анализе данных.

🔗 https://stat.cmu.edu/~cshalizi/ADAfaEPoV/ADAfaEPoV.pdf
Очень сильный материал для тех, кто работает с эконометрикой и Data Science — конспекты Космы Шализи «Advanced Data Analysis».

Материал выходит далеко за рамки традиционных предположений и хорошо связывает классические методы с непараметрическими подходами, включая причинно-следственный анализ, ядерную регрессию и сплайны.

PDF на 900+ страниц
https://stat.cmu.edu/~cshalizi/ADAfaEPoV/ADAfaEPoV.pdf

Страница книги и дополнительные материалы