Data Portal | DS & ML
8.37K subscribers
542 photos
140 videos
5 files
737 links
Всё самое интересное из мира LLM, Data Science и машинного обучения

adds: @devmangx
Автор: @ScienceLLM
Download Telegram
«An Introduction to Real Analysis» Джона К. Хантера — бесплатный набор университетских лекционных материалов и строгое введение в математический анализ.

Книга начинается с множеств, функций и чисел, а затем переходит к последовательностям, рядам, топологии вещественных чисел, пределам, непрерывности, дифференцированию, последовательностям и рядам функций, степенным рядам, интегралу Римана и его приложениям, а также метрическим, нормированным и топологическим пространствам.

Материал подойдёт студентам, которые уже знакомы с calculus и хотят перейти к более строгой, основанной на доказательствах математике. Изложение понятное, а уровень соответствует университетскому курсу по real analysis.

Полная версия конспектов доступна на сайте автора:

https://math.ucdavis.edu/~hunter/intro_analysis_pdf/intro_analysis.html
В открытом доступе есть один из самых известных учебников MIT по computer science — Structure and Interpretation of Computer Programs (SICP).

Это больше 650 страниц не столько про конкретный язык, сколько про то, как вообще думать о программах и вычислениях.
Вместо очередного фреймворка здесь разбираются базовые идеи: абстракции, рекурсия, higher-order functions, состояние, lazy evaluation, устройство интерпретаторов, компиляция и register machines.

SICP много лет использовался в MIT как вводный материал по computer science, и его ценность как раз в том, что он учит смотреть на код глубже, чем на набор синтаксических конструкций.

Книга доступна бесплатно целиком:
https://web.mit.edu/6.001/6.037/sicp.pdf
Kimi K3 получилась куда интереснее, чем просто «ещё одна огромная MoE-модель».

По сути Moonshot взяли архитектурные идеи из Kimi Linear и масштабировали их с 48B до 2.8T параметров. Сейчас K3 — крупнейшая open-weight модель.

Из нового появился LatentMoE — подход, где большие linear layers дополнительно сжимают через down-projection. Общий вектор здесь понятный: сделать такую гигантскую модель дешевле и эффективнее на инференсе.

Поэтому обычные компоненты постепенно заменяются более оптимизированными версиями: MoE → LatentMoE, стандартный attention → multi-head latent attention и Kimi Delta Attention.

Отдельно интересны attention residuals. Это уже не столько про ускорение, сколько про улучшение передачи информации между слоями. Residual-связи соединяются между слоями, а их вклад определяется через attention score. По отчёту, это немного, но стабильно улучшает validation loss и downstream performance, ценой примерно +4% к обучению и +2% к инференсу.

Ещё один необычный момент — в Kimi K3 вообще нет RoPE. Модель полностью использует NoPE, то есть обходится без positional embeddings. Для frontier-модели это довольно редкий подход.

Ну и K3 теперь нативно мультимодальная.

В целом архитектура выглядит сложной, но почти все изменения хорошо укладываются в одну идею: масштабировать модель до безумных размеров, не превращая инференс в полный кошмар.
Новое исследование Meta и CMU про agentic context management для long-horizon задач.

Стоит сохранить.

Продакшен-агенты накапливают всё больше контекста с каждым шагом. Обычно проблему решают через сжатие по порогу токенов, отбрасывая остальное. Из-за этого компрессия может сработать в момент, который вообще не связан с текущей задачей агента.

В ACM агенту дают отдельные инструменты для управления контекстом. Он сам решает, когда что-то сжать, переносит отброшенные детали во внешнее хранилище памяти и позже запрашивает их обратно, если они снова понадобятся. По сути, информация переезжает из краткосрочного контекста в долгосрочную память.

Авторы также построили post-training pipeline на качественных демонстрациях управления контекстом. Это дало 27% относительного прироста на BrowseComp-Plus и позволило приблизиться к open-source моделям, которые примерно в 40 раз крупнее.

Лучшее управление контекстом снижает пиковое потребление токенов, позволяет агенту дольше исследовать задачу до упора в контекстное окно и делает результаты стабильнее между независимыми запусками одной и той же задачи.

Код, данные и чекпоинты опубликованы.

Paper: https://arxiv.org/abs/2607.23809
Kimi вместе с kvcache-ai открыли исходный код AgentENV.

AgentENV — это распределённая система для масштабного запуска агентных окружений. Её компоненты используются для agentic RL-тренировки Kimi K3 и поддерживают быстрые snapshot, resume и fork для параллельных агентных воркфлоу в большом масштабе.
ТОП-5 БЕСПЛАТНЫХ КУРСОВ ПО ИИ-АГЕНТАМ:

1. Hugging Face — AI Agents Course
> https://huggingface.co/learn/agents-course

2. DeepLearningAI — AI Agents in LangGraph
> https://deeplearning.ai/courses/ai-agents-in-langgraph

3. DeepLearningAI — Multi AI Agent Systems with CrewAI
> https://deeplearning.ai/short-courses/multi-ai-agent-systems-with-crewai/

4. Microsoft Learn — AI Agents for Beginners
> https://microsoft.github.io/AI-For-Beginners/agentic-ai/

5. DeepLearningAI — Building Code Agents with Hugging Face smolagents
> https://deeplearning.ai/courses/building-code-agents-with-hugging-face-smolagents
This media is not supported in your browser
VIEW IN TELEGRAM
Stateful и Stateless-ядро MCP. Крупнейшее обновление MCP от Anthropic

Объясню, что это значит.

До этого релиза общение с MCP-сервером напоминало телефонный звонок. Обе стороны выполняли initialize-рукопожатие, после чего сервер возвращал идентификатор сессии, который передавался во всех последующих запросах.

Сессия была живым объектом внутри конкретного серверного процесса и хранила согласованное состояние.

Представьте ресторан, где только принявший заказ официант знает, что именно вы заказали. Всё работает, пока он не уходит домой.

Поскольку состояние находилось внутри одного процесса, балансировщик не мог распределять запросы между тремя инстансами MCP-сервера. Командам приходилось привязывать клиентов через sticky sessions либо выносить состояние сессий в общее хранилище. Это мешало автоскейлингу, а перезапуск одного процесса обрывал все открытые сессии.

В последнем обновлении от этой схемы полностью отказались. Рукопожатие и заголовок Mcp-Session-Id удалили. Теперь каждый запрос сам передаёт версию протокола, идентификатор клиента и его возможности в поле _meta.

Если клиенту нужен список возможностей заранее, он может вызвать server/discover, но это необязательно.
Теперь ресторан работает иначе: каждый запрос похож на письменный бланк заказа, который может обработать любой официант.

Поэтому запрос может попасть на любой инстанс за обычным round-robin-балансировщиком. Общее хранилище сессий больше не требуется. MCP-серверы становятся обычными HTTP-сервисами, которые можно запускать на serverless- и edge-платформах и спокойно перезапускать.

Удаление сессий сломало три функции, поэтому каждую реализовали заново.

Инструменты, которым нужно задать пользователю вопрос во время вызова, раньше отправляли его через удерживаемый открытым поток. Теперь сервер возвращает input_required, а клиент повторяет запрос, прикрепив ответы.

Названия методов и инструментов перенесли в заголовки Mcp-Method и Mcp-Name. Теперь шлюз или rate limiter может маршрутизировать и учитывать запросы, не разбирая тело JSON-RPC.

Ответы со списками теперь содержат ttlMs и cacheScope. Клиенты могут кешировать каталоги инструментов вместо повторной загрузки после каждого переподключения.

Состояние никуда не исчезло — его перенесли туда, где модель может его видеть.
Если приложению нужна непрерывность между вызовами, инструмент возвращает явный handle, а модель передаёт его аргументом при следующем вызове.

Идентификатор сессии в заголовке невидим для модели. Handle в аргументах она может прочитать, передать между инструментами и восстановить после неудачного вызова.

Официальная спецификация
«Exploring Combinatorial Mathematics» Ричарда Грассла и Оскара Левина — бесплатный open-source учебник по комбинаторике, доступный онлайн и в PDF.

Книга написана для graduate-курса по дискретной математике и особенно подойдёт тем, кто уже немного знаком с математическими доказательствами.

Внутри — как базовые, так и продвинутые темы:

— треугольник Паскаля и биномиальные коэффициенты
— методы подсчёта
— рекуррентные соотношения
— числа Фибоначчи и Каталана
— принцип включения-исключения
— производящие функции
— числа Стирлинга и Белла
— разбиения целых чисел
— теория графов и раскраска графов
— теория Рамсея
— паросочетания в двудольных графах
— и многое другое.

В каждой главе есть практические задания, задачи, подсказки и решения, поэтому учебник подходит и для университетского курса, и для самостоятельного изучения.

https://openmathbooks.org/ecm/ecm.html
This media is not supported in your browser
VIEW IN TELEGRAM
Как собрать свою AI-модель с нуля?

Этот ресурс проводит через весь процесс примерно за 90 минут.

Пошагово:
— токенизация
— pre-training
— fine-tuning

В конце можно уже общаться со своей собственной моделью.

Всё локально, без логов и платежей.

https://languagemodelbuilder.com
«Теория информации, логический вывод и алгоритмы обучения» Дэвида Маккея — полезный справочник по теории информации, байесовскому выводу, машинному обучению, кодам коррекции ошибок, информатике и нейронным сетям.

Книга начинается с фундаментальных принципов и охватывает энтропию, сжатие данных, теорию вероятностей, байесовские методы, графические модели, методы Монте-Карло, теорию кодирования, нейронные сети, кластеризацию, разреженные графы и многие другие темы.

Объяснения сопровождаются примерами и диаграммами, которые помогают лучше разобраться в рассматриваемых концепциях. Материал изложен строго, но доступно для читателей с базовой математической подготовкой.

Полная 640-страничная версия книги доступна бесплатно:

[https://inference.org.uk/itprnn/book.pdf]
Media is too big
VIEW IN TELEGRAM
Shen Sean Chen открыл исходный код cвоего локального ИИ-ассистента

Проект демонстрирует работу Agent Harness и Loop Engineering на примере реального кода. Ассистент полностью запускается на ноутбуке пользователя, а его основной цикл занимает около 95 строк на Python.

Вся система представляет собой один цикл:
сообщение → поиск в памяти → запуск агента → вызов инструментов → трассировка → оценка → сохранение в память → развитие навыков

Память хранится в одном файле SQLite. В проект также встроены детерминированные и LLM-as-a-judge оценки с проверкой перед релизом, Telegram-шлюз, голосовая активация и инструменты для работы с Apple Calendar.

В демонстрации ассистент добавляет в календарь четвертьфинал чемпионата мира, запоминает друзей пользователя и отвечает через Telegram.
«Элементарный анализ: подход через бесконечно малые» Х. Джерома Кейслера — бесплатный учебник по математическому анализу с особенно понятными и хорошо написанными объяснениями.

Книга охватывает действительные и гипердействительные числа, дифференцирование, непрерывные функции, интегрирование и его применения, пределы, аналитическую геометрию, тригонометрические, экспоненциальные и логарифмические функции, бесконечные ряды, векторы, частные производные, кратные интегралы, векторный анализ и дифференциальные уравнения.

Подробные объяснения сопровождаются множеством примеров, упражнений и диаграмм, которые помогают лучше понять основные идеи. Думаю, эту книгу полезно держать под рукой как справочник по перечисленным темам, особенно студентам, которым нужны понятные объяснения и много материала для практики.

https://people.math.wisc.edu/~hkeisler/keislercalc-06-03-26.pdf
Если вы AI-инженер, изучите:

* Roofline-модель и почему декодирование упирается в пропускную способность памяти
* Разверните vLLM и SGLang, а затем изучите код их планировщиков
* Разберитесь в Paged Attention по коду, а не по статье
* Настройте наблюдаемость до того, как начнёте что-либо оптимизировать
* Отслеживайте TTFT, задержку между токенами, пропускную способность и глубину очереди
* Используйте Grafana и Prometheus для дашбордов инференса
* Включите prefix caching и выясните, для каких нагрузок он полезен
* Изучите continuous batching и chunked prefill
* Проведите нагрузочные тесты с более чем 1000 одновременных запросов
* Указывайте p50, p95 и p99, а не только среднее значение
* Освойте компромиссы разных видов квантизации: FP8, INT4, AWQ и GPTQ
* Изучите speculative decoding и выясните, в каких случаях он перестаёт помогать
* Настройте вытеснение KV-кэша для длинного контекста
* Попробуйте раздельный сервинг prefill и decode
* Изучите Kubernetes для AI-нагрузок и настройте автоскейлинг по глубине очереди
* Разберитесь, как стоимость инференса влияет на юнит-экономику
* Создайте собственный роутер моделей с учётом стоимости, задержки и качества
* Реализуйте систему управления бюджетом токенов для каждого запроса
* Создайте один сервис инференса и публично опубликуйте его бенчмарки
* Читайте исследования об инференсе вместо новостей о релизах моделей
* Начните делиться результатами своих тестов оптимизации


Автор подготовил 10-недельный план, который охватывает все эти темы при занятиях по 30 минут в день. Он состоит из 50 сессий: часть посвящена теории, а часть — разработке собственного сервиса.

Все сессии ведут к одному результату: сервису инференса, который вы развернёте, оснастите наблюдаемостью, нагрузочно протестируете с более чем 1000 одновременных запросов, оптимизируете и опубликуете в виде воспроизводимого бенчмарка.

План открыт на GitHub, контрибьюты приветствуются — особенно свежие материалы, которые стоит добавить. Я сам прохожу этот план и продолжу делиться контентом на эту тему, так что следите за обновлениями.

GitHub: http://github.com/patchy631/time-to-first-token
Новое исследование Google DeepMind.

SkillSmith рассматривает веса модели как дополнительную модальность, которую LLM может читать напрямую. Модифицированная модель получает существующие веса префикса вместе с подробным текстовым описанием того, как способность связана с целевой задачей, а затем сразу генерирует новые веса префикса, реализующие нужный навык.

Объединение навыков становится операцией во время инференса вместо отдельного этапа обучения. Команда называет этот подход параметрическим синтезом, управляемым инструкциями.

Результаты превосходят показатели, которых по отдельности достигают адаптация только по тексту и адаптация только по весам.

Статья: https://arxiv.org/abs/2607.27497
Google и Anthropic сходятся в одном вопросе: как должен работать retrieval.

Обе компании вынесли его из приложения и превратили в отдельный сервис, который вызывают агенты.

* MCP от Anthropic предоставляет retrieval как инструмент, вызываемый агентом.
* Google реализовала похожую схему: RAG Engine находится внутри платформы Gemini для агентов рядом с MCP-серверами.

Компании пришли к этому, потому что старый наивный RAG строился как одноразовый пайплайн внутри одного приложения и создавал две проблемы:

* Первая — устаревшие эмбеддинги. Они отражают состояние источника на момент индексации. Когда документ или строка меняется, индекс расходится с источником и остаётся неверным до повторного запуска пайплайна.
* Вторая — связанная инфраструктура. Логика retrieval находится внутри одного приложения, поэтому другому приходится дублировать коннекторы, разбиение на чанки и создание эмбеддингов вместо повторного использования готовых компонентов.

Обе проблемы решаются разделением ingestion и выполнения запросов, при этом ingestion работает как постоянно активный слой.

Он непрерывно синхронизирует данные по хешам содержимого, поэтому эмбеддинги пересчитываются только для изменившихся данных. Слой доступен через единый API, и чат-бот с агентом обращаются к одному индексу.

Затем агент вызывает этот слой как инструмент внутри цикла: рассуждает, запускает поиск, читает результат и уточняет запрос — вместо однократного retrieval в самом начале.

Диаграмма ниже показывает все три этапа: наивный RAG, постоянно работающий слой и использующего его агента.

Это помогает, но пока решает не все проблемы. На каждом из трёх этапов единицей retrieval остаётся чанк текста.

Сам по себе чанк ничего не знает о семантических границах, версии или источнике. Сплиттер делит документы в основном по количеству токенов, поэтому чанк может закончиться посреди таблицы или аргумента.

Из-за этого поиск может вернуть верхнюю часть таблицы без строк или вывод без подтверждающих его рассуждений.

Переход к структурированной единице — эмбеддингу вопроса вместе с проверенным ответом — решает эту проблему.

Автор подготовил полный разбор этого подхода. В нём сырые чанки заменяются структурированными блоками, каждый из которых содержит собственные данные об источнике и версии.

Подход сокращает размер корпуса в 40 раз и повышает релевантность векторного поиска в 2,3 раза.
This media is not supported in your browser
VIEW IN TELEGRAM
«Understanding Transformers and Attention Mechanisms» — очень интересная статья, в которой архитектура Transformer рассматривается с точки зрения прикладной математики.

Авторы начинают с представления текста в виде векторов и математически объясняют, как механизм внимания обрабатывает эти векторы и кодирует контекстную информацию. Затем переходят к Multi-Head Attention и показывают, как устроены основные компоненты архитектуры Transformer.

В статье также разбираются более современные методы снижения вычислительных затрат и расхода памяти при работе внимания, включая KV-кэширование, Grouped Query Attention и Latent Attention.

Это полезный материал для тех, кто хочет разобраться в трансформерах глубже их общей архитектуры и увидеть линейную алгебру, лежащую в основе современных языковых моделей.

[https://arxiv.org/pdf/2604.00965]
NVIDIA представила и открыла исходный код NOOA — нового фреймворка для создания ИИ-агентов.

Его главная идея — описывать агента как один Python-класс, а не разносить логику по промптам, схемам инструментов, колбэкам и графам выполнения.

В NOOA:
• методы — это действия агента;
• поля — его состояние;
• docstring становятся промптами;
• тип возвращаемого значения задаёт контракт ответа.

Самая интересная особенность — «пустые» методы. Если тело метода содержит только ..., его реализацию во время выполнения генерирует LLM. Если внутри есть обычный Python-код, он выполняется без участия модели. Так в одном классе сразу видно, где модель может принимать решения, а где поведение полностью детерминировано.

Ещё одна сильная сторона — работа с данными. Если методу передать список из 100 элементов, модель увидит только имя переменной, её тип, размер и несколько элементов с начала и конца. Все данные остаются в памяти процесса, а модель взаимодействует с ними через код, который пишет на лету. Благодаря этому ограничения начинают определяться не размером контекстного окна, а ресурсами машины, на которой выполняется код.

По словам NVIDIA, на SWE-bench Verified с GPT-5.5 NOOA набирает 82,2% против 78,6% у OpenCode, используя примерно вдвое меньше обращений к модели и токенов.

Статья: http://arxiv.org/abs/2607.20709
Репозиторий: http://github.com/nvidia-nemo/labs-OO-Agents
Теперь Kimi K3 с 2,78 трлн параметров можно запустить на одном CPU и 8,24 ГБ оперативной памяти. Проект полностью open source.

Он называется kimi-k3-in-c.

Большинство inference-стеков предполагают, что для запуска передовой MoE-модели нужен кластер GPU и более 5 ТБ памяти. Здесь весь движок занимает 176 КБ и написан на переносимом C99.

Он работает без BLAS, PyTorch, CUDA, каких-либо фреймворков, GPU и AVX-512.

Чекпоинт размером 1,56 ТБ хранится на NVMe. Для каждого токена активируются только 16 из 896 экспертов, поэтому остальные 93% подгружаются с диска по мере необходимости и не занимают оперативную память.

Плотная часть модели работает с любым доступным объёмом памяти: 8, 32, 128 или 224 ГБ. Веса остаются теми же, а результат побайтово совпадает при любом лимите памяти.

Что умеет проект:

→ Запускает инференс Kimi K3 на ноутбуке с 8 ГБ свободной памяти

→ Читает веса MXFP4 напрямую, без деквантизации в float32

→ Стримит основную часть модели с диска через O_DIRECT, обходя page cache

→ Сохраняет фиксированный размер состояния KDA attention независимо от длины контекста

→ Выдаёт побайтово идентичный результат в scalar-, OpenMP- и AVX2-реализациях

→ Проверяет каждое ядро на соответствие референсной реализации на PyTorch

Весь проект занимает 45 МБ: шесть файлов на C и один Python-скрипт для упаковки весов.

И это всё.
Как выглядят задачи машинного обучения в бигтехе?

Открыта регистрация на E-CUP 2026 Students — ежегодное соревнование от Ozon Tech. В этом сезоне — для студентов, которые интересуются ML, Data Science, Big Data и аналитикой данных.

Вас ждут три трека: поиск дубликатов товаров, ИИ-модерация карточек маркетплейса и прогнозирование поведения пользователей. Все задачи основаны на реальных обезличенных данных Ozon.

Участвовать можно по одиночке или в команде до пяти человек. Соревнование проходит онлайн с финалом на масштабной конференции E-CODE.

Что ждёт участников:
- призовой фонд 7 200 000 ₽;
- обратная связь от инженеров Ozon Tech;
- нетворк с экспертами индустрии;
- лимитированный мерч;
- билеты на конференцию E-CODE, где наградят победителей.

Подробнее — на сайте E-CUP 2026 Students.
➡️ Регистрация уже открыта!

Присоединяйтесь, чтобы выйти за рамки учебных проектов, попробовать свои силы в задачах настоящего бигтеха и сравнить своё решение с лучшими участниками.
«The Little Book of Generative AI Foundations» — компактная книга о математических основах современных генеративных моделей. Её цель — представить основные семейства моделей в рамках единой концепции и показать математические связи между ними.

Книга начинается с линейной алгебры, метода главных компонент (PCA) и автокодировщиков. Затем рассматриваются вероятностный PCA, вариационные автокодировщики (VAE), диффузионные модели с удалением шума (denoising diffusion models), генеративные модели непрерывного времени, методы на основе score-функции, сэмплирование Ланжевена, нормализующие потоки (normalizing flows), авторегрессионные модели, GAN, модели на основе энергии (energy-based models) и многое другое.

Это полезный материал для понимания роли вероятности, оптимизации, латентных переменных, стохастических процессов и оценки плотности распределения в генеративном ИИ. Сохраните в закладки: книга хорошо написана, легко читается и содержит множество полезных концепций, благодаря чему может служить отличным справочным материалом.

https://arxiv.org/abs/2605.29713