Data Portal | DS & ML
8.37K subscribers
542 photos
140 videos
5 files
737 links
Всё самое интересное из мира LLM, Data Science и машинного обучения

adds: @devmangx
Автор: @ScienceLLM
Download Telegram
Algorithms Джеффа Эриксона — одна из лучших книг по алгоритмам.

Иллюстрации в ней просто отличные. Очень рекомендую.

https://jeffe.cs.illinois.edu/teaching/algorithms/
Please open Telegram to view this post
VIEW IN TELEGRAM
Минимальная реализация архитектуры Kimi K3, сделанная специально для того, чтобы её можно было нормально прочитать, запустить на CPU или в Google Colab и сверять код с оригинальным техническим отчётом.

KDA, Gated MLA, Attention Residuals и Stable LatentMoE здесь сохранены, но некоторые части упрощены ради читаемости.
Event loop — одна из базовых концепций асинхронного программирования. И поскольку ИИ-агенты по своей природе во многом работают асинхронно, важно понимать, что происходит внутри.

Материал в основном посвящён libuv, но многие принципы там общие и с ними точно стоит быть знакомым.

https://docs.libuv.org/en/v1.x/guide.html
«The Simple Mathematics of Large Language Models» — короткая бесплатная статья для тех, кто хочет разобраться в математике современных LLM и таких систем, как ChatGPT и Claude.

Раньше я уже делился несколькими материалами, которые подробно разбирают математику этих систем, но обычно они довольно объёмные. Здесь всего около 20 страниц, поэтому это хороший вариант, если нужен компактный вводный материал без необходимости сразу браться за большой учебник.

В статье разбираются представления токенов, контекст, механизм внимания как обучаемое взвешенное усреднение, проекции и билинейные формы, многоголовое внимание, нормализация, позиционная информация, softmax, метод максимального правдоподобия, кросс-энтропия и градиентный спуск.

Вместе эти темы дают компактное математическое представление о том, как работает языковая модель.

https://www.crc.business-school.ed.ac.uk/sites/crc/files/2026-02/Mathematics_of_LLMs_2026.pdf

Сохраните в закладки — может пригодиться как быстрый справочник.

Для тех, кто хочет погрузиться в тему на более продвинутом уровне, также рекомендую этот материал:

https://arxiv.org/pdf/2501.09223
«A Recipe for Training Neural Networks» от Андрея Карпати.

Материал уже не новый, но набор тем в нём до сих пор ощущается очень актуальным.

Это практическое руководство по обучению нейросетей: как выстраивать процесс, находить ошибки, отлаживать обучение и постепенно улучшать модель без хаотичных экспериментов.

https://karpathy.github.io/2019/04/25/recipe/
Новое исследование Meta.

Сегодня агентные harness-системы всё ещё в основном собираются вручную.

Из-за этого сложно настраивать устойчивые harness-системы для длинных задач.

В новой работе агенты офлайн обучаются политике работы с harness, а затем во время выполнения задачи используют её, чтобы создавать и обновлять внешнее состояние harness.

EvoHarness-RL обучает именно такую политику. В качестве состояния harness агенту доступны Belief, Progress и Experience, с которыми политика может работать.

Сначала supervised fine-tuning обучает пространство действий harness, затем cost-aware GRPO учится, когда во время длинного запуска нужно читать состояние, обновлять его и объединять накопленную информацию.

Qwen3-8B достигает 96,9% на ALFWorld.

В ходе обучения проявляются два эффекта.

Harness annealing. Повторяющиеся паттерны использования harness постепенно встраиваются в политику самой модели, и агент переходит от частых обращений к более выборочному доступу.

Harness evolution. Обновления прогресса и консолидация опыта сжимают рабочее пространство в компактное состояние, адаптированное под текущую задачу.

Работа показывает, что агентам на длинных задачах больше даёт обучаемая политика координации, чем просто более мощные инструменты или больше памяти.

Статья:
https://arxiv.org/abs/2608.05446
Пожалуй, лучшее объяснение ChatGPT Work, которое я видел.
Из архивов — курс Machine Learning Hardware and Systems 2022 года от профессора Мохамеда Абдельфаттаха из Корнеллского университета.

https://youtube.com/playlist?list=PL0mFAhrXqy9CuopJhAB8GVu_Oy7J0ery6
Ещё один отличный ресурс — LLM Inference Handbook от Modular.

https://handbook.modular.com
«The Mathematics of Bitcoin» — короткая работа, которая разбирает Bitcoin с математической точки зрения.

В ней используются теория вероятностей, случайные процессы, мартингалы, комбинаторика и специальные функции, чтобы исследовать механизмы протокола Bitcoin.

В частности, авторы разбирают вероятность двойной траты, прибыльность майнинга, генерацию блоков, стратегии майнеров и устойчивость протокола.

Если хочется копнуть глубже, ещё рекомендую «Bitcoin and Cryptocurrency Technologies» от Принстонского университета. Это уже гораздо более широкое введение в криптографические хеш-функции, цифровые подписи, консенсус, Proof of Work, майнинг, транзакции, анонимность, безопасность и систему стимулов в криптовалютах.

Сохраните обе работы в закладки. Это хорошие материалы, если интересно разобраться в математике и технических механизмах Bitcoin.

The Mathematics of Bitcoin:
https://arxiv.org/pdf/2003.00001

Bitcoin and Cryptocurrency Technologies:
https://d28rh4a8wq0iu5.cloudfront.net/bitcointech/readings/princeton_bitcoin_book.pdf
Сильная новая работа от Meta.

Обычно законы масштабирования предполагают, что размер модели и объём данных влияют на ошибку независимо друг от друга.

В этой работе авторы вводят Skaling law — закон, который связывает ёмкость модели и данные через единый параметр взаимодействия.

Дополнительный член снижает среднюю абсолютную процентную ошибку примерно в 1,5–3 раза как при интерполяции, так и при экстраполяции.

Самые заметные улучшения — в режимах, где данных мало или модель сильно переобучают. Именно там стандартные законы Chinchilla и Kaplan начинают заметно промахиваться.

Ещё одна важная часть: вместе с разреженной сеткой небольших запусков метод позволяет экстраполировать всю картину примерно с в 10 раз меньшими вычислительными затратами, чем при равномерном переборе.

Почему это важно?

Сегодня модели часто обучают и разворачивают далеко за пределами классического вычислительно-оптимального режима. Если закон масштабирования остаётся точным и там, причём его можно оценить на небольших запусках, это напрямую меняет то, как можно планировать бюджет на предобучение.

Работа: https://arxiv.org/abs/2608.07222
Google DeepMind утверждает, что привычный RAG упирается в фундаментальный предел.

Последние три года стандартный ответ почти на любую задачу с памятью или данными для ИИ выглядел одинаково: разбить данные на части, положить их в векторную базу и искать по эмбеддингам.

Обычно предполагается, что если поиск работает плохо, проблема лишь в качестве модели: больше данных, больше параметров, лучше обучение — и всё станет точнее.

В новой работе DeepMind показывает, что это не всегда так.

Главная проблема — подход, где целый документ или сложный запрос сжимается в один вектор фиксированной длины, а затем релевантность определяется через близость этих векторов.

Авторы математически показывают, что у такого подхода есть жёсткий предел: количество различных комбинаций документов, которые система способна корректно различать для разных запросов, ограничено размерностью пространства эмбеддингов.

И этот предел нельзя просто пробить дополнительным обучением или увеличением объёма данных.

Для проверки авторы создали набор LIMIT и протестировали современные модели эмбеддингов с тысячами измерений. На сложных запросах с несколькими зависимостями одновекторное представление начинает терять важный контекст и возвращать нерелевантные документы.

Причина довольно простая: один вектор плохо подходит для описания сложных связей между множеством документов и условий одновременно.

Если память агента полностью построена на обычном одновекторном поиске, то на сложных задачах это уже не просто вопрос хороших эмбеддингов или правильного промпта. Ограничение заложено в самой архитектуре.

Похоже, следующий шаг для RAG — уход от идеи «один документ = один вектор» к более сложным схемам представления и поиска.

https://arxiv.org/pdf/2508.21038
Что скрывается за монетизацией поиска и реков в Авито 👀

Рассчитать ожидаемую выручку сложнее, чем кажется: нельзя просто умножить вероятность на ставку. На практике всё упирается в данные, метрики и бизнес-ограничения.

Если вам интересно, как работает наше ранжирование, приходите на Хабр почитать и оставить комментарии.
Please open Telegram to view this post
VIEW IN TELEGRAM
«Patterns, Predictions, and Actions» — бесплатная книга по математическим основам машинного обучения. Она сочетает понятное изложение с математикой, на которой построен современный ML.

В книге разбираются предсказание, обучение с учителем, оптимизация, обобщающая способность моделей, глубокое обучение, датасеты, причинность, последовательное принятие решений и обучение с подкреплением.

Отдельно авторы объясняют, как предсказания превращаются в решения, какую роль играют данные и бенчмарки, а также где у машинного обучения есть ограничения и какие последствия возникают при его использовании на практике.

По уровню это примерно вводный курс магистратуры. Нужна рабочая база по линейной алгебре, матанализу и теории вероятностей.

Хорошая книга для тех, кто хочет не просто научиться запускать модели, а начать понимать ML от математического фундамента до практических последствий.

https://mlstory.org/pdf/patterns.pdf
«Introduction to Probability» — отличный бесплатный учебник MIT по теории вероятностей.

В книге разбираются вероятностные модели, условная вероятность, независимость, формула Байеса, дискретные и непрерывные случайные величины, распределения вероятностей, математическое ожидание, дисперсия, ковариация, корреляция, условное ожидание, преобразования и свёртки, процессы Бернулли и Пуассона, цепи Маркова, закон больших чисел и центральная предельная теорема.

Объяснения очень понятные, математика строгая, но без лишнего усложнения. Плюс внутри много примеров и задач с полными решениями.

Особенно полезна для самостоятельного изучения или как справочник, когда нужно быстро освежить конкретную тему по вероятностям.

Для машинного обучения это уже прямо фундаментальная база. Теория вероятностей нужна почти везде: от статистики и байесовских методов до обучения моделей, оценки неопределённости и генеративных моделей.

Сохраняйте в закладки. Пригодится.

https://vfu.bg/en/e-Learning/Math--Bertsekas_Tsitsiklis_Introduction_to_probability.pdf
This media is not supported in your browser
VIEW IN TELEGRAM
Вот как, по-хорошему, нужно преподавать машинное обучение.

Наблюдать за тем, как модели реально учатся, невероятно залипательно. 🤩

http://ml-visualized.com
Please open Telegram to view this post
VIEW IN TELEGRAM
«Analysis of Functions of a Single Variable» — бесплатный учебник по вещественному и комплексному анализу.

В книге разбираются вещественные и комплексные числа, последовательности, пределы, бесконечные ряды, функции, непрерывность, равномерная сходимость, дифференцирование, разложения Тейлора, интегрирование, длина дуги и контурные интегралы.

Также выводятся ключевые результаты: теорема Грина, теорема Коши, теорема о вычетах и основная теорема алгебры.

Особенно полезна книга тем, что в ней много аккуратных доказательств и математических выводов. Она рассчитана на старшие курсы бакалавриата и первый год магистратуры и хорошо подходит как переход от обычного матанализа к строгому вещественному и комплексному анализу.

Если изучаете эти темы, стоит сохранить.

https://spot.colorado.edu/~baggett/book.pdf
Теорема Байеса — одна из фундаментальных концепций в Data Science.

Но мне понадобилось два года, чтобы по-настоящему понять её важность.

За 2 минуты расскажу самое полезное, что узнал за последние два года изучения байесовской статистики. Поехали.

1. Предыстория

Работа «An Essay towards solving a Problem in the Doctrine of Chances» была опубликована в 1763 году, через два года после смерти Томаса Байеса.

В ней Байес рассматривал задачу обратной вероятности — основу того, что сегодня известно как байесовская вероятность.

2. Теорема Байеса

Теорема Байеса даёт математическую формулу, позволяющую обновлять вероятность гипотезы по мере появления новых данных.

Она описывает, как пересматривать существующие предположения с учётом новых свидетельств. Этот процесс называется байесовским выводом.

3. Байесовская статистика

Байесовская статистика рассматривает вероятность как меру уверенности в событии, а не только как частоту его появления.

Эта уверенность может основываться на уже имеющихся знаниях об условиях, связанных с рассматриваемым событием или экспериментом.

Благодаря этому можно делать вероятностные выводы о неизвестных параметрах.

Например, вместо одного конкретного значения параметра байесовский подход даёт распределение возможных значений, тем самым отражая неопределённость.

4. Байесовский и частотный подходы

Байесовский вывод основан на обновлении вероятностей по мере поступления новых данных. Это довольно естественно и во многом соответствует тому, как мы рассуждаем в реальной жизни.

В частотной статистике вероятность интерпретируется как частота события при большом количестве повторений.

Проблема, которую я вижу в частотном подходе, заключается в том, что часто используются заранее выбранные распределения, например нормальное, хотя это не всегда имеет смысл.

5. Байесовское машинное обучение

Когда нужна реальная оценка уверенности и принятие решений на основе вероятностей, байесовские методы особенно полезны.

Например:

Моделирование неопределённости. В отличие от многих традиционных методов машинного обучения, которые выдают одну оценку, байесовские методы работают с распределениями.

Анализ временных рядов. Байесовские методы особенно полезны там, где важно учитывать неопределённость будущих значений.

6. Применение в бизнесе

Компании могут использовать теорему Байеса для оценки различных рисков: рыночных, кредитных или операционных.

По мере появления новой информации вероятность каждого риска можно постоянно обновлять, принимая на этой основе более обоснованные решения.