Data Portal | DS & ML
10K subscribers
657 photos
153 videos
9 files
851 links
Всё самое интересное из мира Data Science и машинного обучения

Cотрудничество: @devmangx

Автор: @ScienceLLM
Download Telegram
«Mathematics of Data Science» — это недавний учебник, опубликованный в июле 2026 года и доступный бесплатно. Он написан специально для тех, кто хочет разобраться в математике, лежащей в основе фундаментальных концепций, методов и применений современной науки о данных.

В книге рассматриваются геометрия и теория вероятностей в пространствах высокой размерности, концентрация меры, сингулярное разложение, метод главных компонент, линейная регрессия и регуляризация, нелинейное снижение размерности, диффузионные карты, случайные проекции, оптимизация, классификация, метод опорных векторов, оценки обобщающей способности и многое другое.

Особенно интересна глава 5. Она полностью посвящена графам, сетям и кластеризации, включая k-means и спектральную кластеризацию. Также в ней даётся интуитивное математическое объяснение Google PageRank и показывается, как структуру ссылок между веб-страницами можно представить и анализировать, чтобы оценить их относительную значимость.

Разделы о задачах классификации тоже стоит прочитать. В них рассматриваются бинарные и линейные классификаторы, логистическая регрессия, матрицы ошибок, ROC-анализ, метод опорных векторов, многоклассовая классификация и математические основы обобщающей способности.

https://arxiv.org/pdf/2607.11938
Однажды в 1963 году во время скучного совещания Станислав Улам нарисовал квадрат, поставил в центре число 1, а затем начал записывать целые числа по возрастанию в виде спирали, расходящейся к краям листа.

После этого он обвёл все простые числа и сразу заметил странную вещь. Они явно стремились выстраиваться вдоль диагональных линий, расходящихся от центральной единицы.

По словам самого Улама, расположение простых чисел «выглядит крайне неслучайным».

Улам поспешил домой и продолжил спираль, охватив гораздо больше чисел. Странный рисунок никуда не исчез.

Простые числа продолжали собираться в скопления, которые формировали красивую структуру, при этом заранее предсказать её было невозможно.

Сегодня с помощью компьютеров эту закономерность можно исследовать практически без ограничений.

Получается удивительно богатое сочетание симметрии и неожиданности, чем-то напоминающее фракталы.
За последние несколько лет сам процесс исследований в ML/NLP изменился с невероятной скоростью.

Аспирантка CMU Эмми Лю в тексте «When We Did Research By Hand» вспоминает свой путь в аспирантуре и условно делит эти годы на три этапа.

2021 год. Чтение статей, написание кода, отладка, запуск экспериментов — практически всё делалось вручную.

После появления ChatGPT ИИ начинает помогать с написанием кода, но всё ещё остаётся инструментом для копирования кода и бесконечной отладки.

Теперь, в эпоху агентов, реализация обычных экспериментов всё реже становится узким местом. Когда идея уже сформулирована, значительную часть кода и экспериментов можно просто передать кодинг-агенту.

И здесь возникает вполне реальный вопрос.

Если «написать код и запустить эксперименты» становится всё дешевле, какие навыки исследователя остаются действительно ценными?

Она даже задаётся вопросом, не будут ли в будущем аспирантов оценивать в первую очередь не по количеству опубликованных статей, а по тому, способны ли они руководить командой агентов и с её помощью развивать целостное и последовательное исследовательское направление.

Количество научных работ продолжит расти, а даже рецензии уже начинают массово генерироваться с помощью LLM. В результате вся система конференций и рецензирования может оказаться вынуждена измениться.

Но я всё ещё согласен с одной мыслью, которую она оставляет в конце.

По крайней мере пока именно людям предстоит решать, какие проблемы действительно стоит исследовать и почему ими вообще стоит заниматься.

Агенты могут всё сильнее ускорять эксперименты, но вопрос «что именно мы вообще хотим узнать?» может стать только ещё важнее.
Та же самая модель, но если временно подставить более подходящий Harness, её производительность действительно может превзойти даже более сильные передовые модели.

В этой работе предлагается JIT-Agent, который специально учится тому, «как проектировать Harness для агента».

Раньше Harness и конфигурация агента в основном заранее проектировались людьми, а затем переиспользовались для разных задач.

JIT-Agent работает иначе. Сначала он смотрит на текущую задачу, а затем прямо на месте генерирует под неё отдельный Harness.

Сам Harness разбивается на четыре части: память, планирование, действия и оркестрация инструментов и Skills.

Если во время выполнения что-то ломается, система автоматически исправляет Harness на основе отчётов об ошибках. По мере накопления задач наиболее успешные Harness попадают в библиотеку опыта и продолжают влиять на последующие генерации.

Результаты довольно показательные.

После добавления JIT-Agent к DeepSeek-V4-Flash результат на DeepSearchQA вырос с 76,2 до 85,1, превысив 76,0 у GPT-5.6.

GLM-5.2 на отдельных задачах получает прирост до 20,2 процентного пункта.

При сравнении с фиксированными базовыми конфигурациями JIT-Agent также использовал меньше всего токенов и требовал наименьших затрат на API во всех шести экспериментальных группах. В среднем экономия составила 36% относительно самого дешёвого фиксированного Harness.

То есть масштабировать агентов можно не только за счёт более сильных моделей и увеличения вычислений на этапе инференса.

Можно отдельно обучать систему, которая будет учиться отвечать на другой вопрос:

«Как именно должен быть организован агент для этой конкретной задачи?»
Один из лучших курсов по основам робототехники, которые я знаю, полностью бесплатный и доступен на YouTube.

Курс Classical Control Theory от brianbdouglas

46 видео, никакой платной подписки, только учебный материал для тех, кто хочет заниматься робототехникой и автоматизацией.

Курс разбирает фундаментальный слой, на котором до сих пор держится огромная часть робототехники и автоматизации:

→ управление с обратной связью, передаточные функции и ПИД-регуляторы
→ временная и частотная области, преобразования Фурье и Лапласа
→ устойчивость, корневые годографы и диаграммы Боде
→ идентификация систем и моделирование физических объектов
→ практические примеры с роботизированным автомобилем, которые связывают всё вместе

Кто-то наверняка скажет, что это уже устарело и сейчас наступила эпоха «робототехники 2.0», фундаментальных моделей и физического ИИ.

Но есть одна проблема.

В конечном счёте любая такая модель всё равно отправляет какое-то число на двигатель.

Кто-то должен удерживать сустав робота в заданном положении, компенсировать внешние возмущения и сохранять устойчивость при изменении нагрузки.

Именно этим занимается теория управления.

Она никуда не исчезает только потому, что выше по системе теперь находится нейросеть.

Теория управления — это то, что превращает красивую демонстрацию робота в систему, способную стабильно повторять результат.

Если хочется понимать робототехнику глубже роликов с демонстрациями, я бы начинал именно отсюда.

https://youtube.com/playlist?list=PLUMWjy5jgHK1NC52DXXrriwihVrYZKqjk
Архитектура Apple Silicon оказалась почти идеальной для запуска больших языковых моделей.

Всё благодаря сочетанию быстрой памяти, высокой пропускной способности и единой архитектуры памяти.

Mac Studio M5 Ultra с 512 ГБ памяти и пропускной способностью 1,2 ТБ/с способен целиком уместить GLM-5.3-Flash на 320 млрд параметров в FP8 и выдавать около 60 токенов в секунду локально, прямо на рабочем столе.

Альтернатива на ПК?

Примерно 10 RTX 5090 стоимостью более $20 000 и своя небольшая электростанция.

Полная версия GLM-5.3-Flash на 320 млрд параметров в FP8 весит около 306 ГБ.

У одной RTX 5090 всего 32 ГБ видеопамяти. Поэтому только для размещения весов модели понадобится минимум 10 видеокарт.

10 × 32 ГБ = 320 ГБ.

Mac Studio решает эту проблему за счёт единого пула памяти объёмом до 512 ГБ с пропускной способностью 1,2 ТБ/с.

Вместо того чтобы собирать ПК-кластер из множества видеокарт, бороться с задержками шины PCIe и энергопотреблением в районе 5000 Вт, можно загрузить всю модель объёмом 306 ГБ вместе с огромным контекстом и KV-кэшем в один настольный компьютер.
Почему фундаментальные знания действительно важны и играют огромную роль — поэтому не пропускайте курсы по основам информатики в университете.

Устройство операционных систем, иерархия памяти, принцип работы предсказания переходов, проблемы выравнивания памяти, привязка процессов к ядрам, ложное совместное использование кэша — и это лишь верхушка айсберга.

Очень многие вещи, которые кажутся теорией в университете, напрямую влияют на то, насколько быстро и эффективно работает настоящий софт.

И хороший пример — vLLM. Его PagedAttention буквально использует идею виртуальной памяти и страничного управления из операционных систем, чтобы эффективнее управлять KV-кэшем LLM. В результате vLLM показал ускорение обработки запросов в 2–4 раза при сопоставимой задержке.

Именно поэтому фундаментальные знания никуда не исчезают. Они становятся ещё ценнее по мере того, как программное обеспечение всё сильнее упирается в железо.

https://arxiv.org/pdf/2309.06180
От машинного обучения и визуализации данных до временных рядов и финансовых данных.

В одном репозитории собрано 920 открытых проектов на Python, разбитых на 34 категории.

Хорошая подборка, если хочется быстро находить проверенные библиотеки и инструменты для ML, анализа данных и смежных задач, а не искать всё по GitHub вручную.

🔗 https://github.com/lukasmasuch/best-of-ml-python
Cambridge в этот раз просто выкатил настоящую бомбу.

Целая подборка классических учебников по ИИ и машинному обучению теперь доступна бесплатно в PDF.

Если хочется нормально разобраться в машинном обучении и не тратить деньги на переоценённые курсы, этих десяти книг хватит, чтобы построить очень крепкую базу.

От простого к сложному.

1️⃣ Understanding Machine Learning

Одна из лучших книг для входа с нуля. Разбирает основные теоретические алгоритмы машинного обучения.

🔗 https://cs.huji.ac.il/~shais/UnderstandingMachineLearning/understanding-machine-learning-theory-algorithms.pdf

2️⃣ Mathematical Foundations of Machine Learning

Если с математикой пока не очень уверенно, я бы начал именно отсюда.

🔗 https://mml-book.github.io/book/mml-book.pdf

3️⃣ Mathematical Analysis of Machine Learning Algorithms

Уже более глубокое погружение в математические принципы алгоритмов машинного обучения.

🔗 https://tongzhang-ml.org/lt-book/lt-book.pdf

4️⃣ Theoretical Principles of Deep Learning

Теоретические основы глубокого обучения и понимание того, почему всё это вообще работает.

🔗 https://arxiv.org/pdf/2106.10165

5️⃣ Neural Networks and Learning Machines

Системный разбор нейронных сетей и принципов их обучения.

🔗 https://arxiv.org/pdf/1901.05639

6️⃣ Graph Deep Learning

Хорошая отправная точка для тех, кто хочет разобраться в графовых нейронных сетях.

🔗 https://yaoma24.github.io/dlg_book/dlg_book.pdf

7️⃣ Machine Learning: A Probabilistic Perspective

Позволяет посмотреть на машинное обучение через вероятностный и алгоритмический подход.

🔗 https://people.csail.mit.edu/moitra/docs/bookexv2.pdf

8️⃣ Probability Theory: Theory and Examples

Фундаментальная теория вероятностей. Очень полезна, если хочется понимать машинное обучение глубже уровня использования готовых библиотек.

🔗 https://sites.math.duke.edu/~rtd/PTE/PTE5_011119.pdf

9️⃣ Fundamentals of Applied Probability

Больше внимания практическому применению теории вероятностей.

🔗 https://sites.math.duke.edu/~rtd/EP4A/EP4A_April2021.pdf

🔟 Advanced Data Analysis

Уже продвинутый уровень для тех, кто хочет серьёзно прокачаться в анализе данных.

🔗 https://stat.cmu.edu/~cshalizi/ADAfaEPoV/ADAfaEPoV.pdf
Очень сильный материал для тех, кто работает с эконометрикой и Data Science — конспекты Космы Шализи «Advanced Data Analysis».

Материал выходит далеко за рамки традиционных предположений и хорошо связывает классические методы с непараметрическими подходами, включая причинно-следственный анализ, ядерную регрессию и сплайны.

PDF на 900+ страниц
https://stat.cmu.edu/~cshalizi/ADAfaEPoV/ADAfaEPoV.pdf

Страница книги и дополнительные материалы
«Mathematical Introduction to Deep Learning: Methods, Implementations, and Theory» — бесплатный учебник для тех, кто хочет действительно разобраться в математике, стоящей за алгоритмами глубокого обучения.

В книге разбираются полносвязные нейросети прямого распространения, свёрточные и рекуррентные сети, остаточные сети, пакетная нормализация, стохастический градиентный спуск, ускоренные и адаптивные методы оптимизации.

Отдельно рассматриваются теория аппроксимации, ошибки обобщения и применение глубокого обучения для решения дифференциальных уравнений в частных производных, включая физически информированные нейросети и методы Deep Galerkin.

Это не учебник для новичков. Для нормального понимания материала уже нужно хорошо знать математический анализ и линейную алгебру.

Но если хочется пойти глубже обычного уровня «как обучить нейросеть» и понять математический фундамент глубокого обучения, это очень сильный бесплатный материал.

🔗 https://arxiv.org/pdf/2310.20360
Большие модели начинают учиться «рассуждать во время обучения».

ByteDance Seed совместно с командами из Princeton, Tsinghua и других организаций только что опубликовала очень интересную работу, в которой предлагается Falcon / Fast Weight Attention. Главный фокус — Continual Learning.

Сейчас у подавляющего большинства больших моделей после завершения обучения и перехода к инференсу сама модель фактически остаётся неизменной.

Сколько бы новой информации вы ей ни давали, она может учитывать её в Context или обращаться к Memory, но по-настоящему продолжать «учиться» в процессе модель не будет.

Falcon пытается пойти на шаг дальше.

Он добавляет в модель набор Fast Weight Memory.

Каждый раз, когда модель читает новый Token, она может в реальном времени обновлять эти Fast Weights на основе текущей информации. Авторы прямо интерпретируют весь процесс обновления как форму Online Learning.

То есть это чем-то похоже на то, будто модели дали временные, постоянно обучаемые «краткосрочные веса».

Основные параметры модели не меняются, но её внутреннее состояние непрерывно развивается по мере поступления новой информации.

У этого есть ещё один эффект для длинного контекста.

Обычным Transformer приходится хранить постоянно растущий KV Cache, тогда как Falcon может непрерывно сжимать историческую информацию в состояние фиксированного размера.

Модели не нужно сохранять все Tokens в исходном виде. Вместо этого в процессе чтения она постоянно учится, обновляется и забывает.

Текущий масштаб экспериментов пока довольно небольшой — около 130 млн параметров.

Но в тесте на сложение чисел с экстраполяцией по длине Transformer в среднем показал точность 65,8%, тогда как Falcon-3A достиг 87,2%.

На 48-значных числах точность Transformer упала до 49%, а Falcon всё ещё удерживал 69%.

Мне кажется, самое важное в этой работе — тенденция, которая становится всё заметнее: граница между обучением и инференсом начинает размываться.

Раньше сначала обучали модель, а затем уже фиксированная модель взаимодействовала с миром.

Теперь такие направления, как Test-Time Learning, Fast Weight и Continual Learning, пытаются сделать так, чтобы модель могла продолжать изменять себя уже после запуска, на основе информации, которую она встречает во время работы.

Если это направление продолжит развиваться, будущий ИИ, возможно, не будет начинать каждый новый инференс с одним и тем же «состоянием себя».

Он действительно сможет продолжать учиться прямо в процессе использования.

https://arxiv.org/abs/2608.27763
Matrix Calculus for Machine Learning and Beyond! — бесплатная электронная книга от MIT.

Учебник MIT 2025 года от Alan Edelman, Steven G. Johnson и Paige Bright.

Книга напрямую связывает матричное исчисление с современным машинным обучением.

Внутри:

• производные матриц и векторов
• якобиан и гессиан
• разложения матриц
• оптимизация
• дифференцирование в обратном режиме
• обратное распространение ошибки
• автоматическое дифференцирование
• производные через ОДУ
• задачи, ориентированные на машинное обучение

Это подробный математический мост между линейной алгеброй, математическим анализом, оптимизацией, backpropagation и машинным обучением.

Бесплатная книга:

https://geni.us/Matrix-Calculus-Book
1200 изолированных агентов в итоге сами построили сеть для совместной работы.

В статье Дваркеша «Взлёт и падение цивилизации агентов» меня больше всего зацепила именно эта история.

OpenAI запускала множество агентов для тестирования безопасности в отдельных изолированных средах. Но выяснилось, что у всех них был доступ к одному общему кэшу.

Некоторые агенты начали использовать названия папок и файлы как сообщения. Постепенно из этого вырос самодельный канал связи.

В какой-то момент около 1200 агентов обменялись через него более чем 70 000 сообщений и файлов. Они делились результатами исследований, распределяли работу, передавали друг другу задачи, а в итоге около 700 агентов участвовали во взломе Hugging Face.

Но самое интересное — накопленные знания переживали самих агентов.

Когда первая группа прекращала работу, следующая находила оставленные сообщения, файлы и инструкции и продолжала с того места, где остановились предыдущие. В итоге агенты даже получили права администратора в одном из исследовательских кластеров OpenAI.

Дваркеш называет это тремя поколениями «цивилизации агентов». Звучит немного громко, но само явление действительно интересно.

Похоже, долговременная память агентов может существовать не только в весах модели или её контексте.

Если в среде есть общее пространство, куда разные агенты могут читать и записывать данные — папки, кэш, журналы, — со временем оно само может превратиться в слой памяти и координации.

Для тех, кто строит многоагентные системы и инфраструктуру для их работы, это очень важный сигнал.

https://www.dwarkesh.com/p/openai-huggingface
«Real Analysis» — интересный набор бесплатных лекционных материалов для тех, кто хочет перейти от вводного курса математического анализа к более строгому изучению вещественного анализа.

В материалах разбираются теория меры, измеримые функции, интеграл Лебега, пространства Lp, дифференцирование, анализ Фурье и несколько других фундаментальных тем.

Есть определения, теоремы, доказательства, примеры и упражнения.

Думаю, это хороший ресурс как для студентов, изучающих вещественный анализ в университете, так и для тех, кому нужен полноценный справочный материал для повторения этих тем.

https://site.unibo.it/progetto-agnesi/it/materiali-didattici/cdl-in-matematica/real_analysis2024_agnesi.pdf/@@download/file/Real_Analysis2024_agnesi.pdf
Дорожная карта для тех, кто хочет стать инженером-робототехником:

• программирование → Python, C++
• математика → линейная алгебра, математический анализ, теория вероятностей
• электроника → датчики, двигатели, системы питания
• встраиваемые системы → микроконтроллеры, операционные системы реального времени, взаимодействие с оборудованием
• теория управления → ПИД-регуляторы, моделирование, устойчивость
• механика → кинематика, динамика, системы автоматизированного проектирования
• Linux → терминал, сети, отладка
• программное обеспечение для роботов → ROS 2
• симуляция → Gazebo, Isaac Sim
• восприятие окружающей среды → компьютерное зрение, лидары, объединение данных с датчиков
• локализация → фильтры Калмана, SLAM
• планирование движения → A*, RRT, построение траекторий
• управление манипуляторами → обратная кинематика, захват объектов
• ИИ для робототехники → обучение с подкреплением
• создание собственных роботов → дроны, роверы, роботизированные руки
• автономность → восприятие → планирование → управление
• запуск на реальном устройстве → периферийные вычисления, ИИ непосредственно на борту
• промышленная робототехника → ПЛК, автоматизация производства
«Linear Algebra with Applications» — бесплатный и подробный учебник, который знакомит с вычислительными, теоретическими и прикладными аспектами линейной алгебры.

В книге разбираются системы линейных уравнений, матрицы, определители, векторные пространства, линейные преобразования, собственные значения и собственные векторы, диагонализация, пространства со скалярным произведением, ортогональность и многие другие темы. Объяснения сопровождаются более чем 330 разобранными примерами, упражнениями и практическими применениями в геометрии, электрических сетях, динамических системах, теории вероятностей и оптимизации.

Особенно интересен раздел о том, как Google PageRank использует доминирующий собственный вектор для ранжирования веб-страниц. Ссылки между сайтами представляются в виде матрицы связности, а компоненты её доминирующего собственного вектора дают оценку относительной важности каждой страницы.

Это очень наглядный пример того, как на первый взгляд абстрактная идея из линейной алгебры может лежать в основе реальной технологии, используемой в огромных масштабах.

Издание 2023 года доступно по лицензии Creative Commons. Ещё один отличный материал, который стоит сохранить в качестве справочника.

https://collection.bccampus.ca/textbook/qTj4b4Ey