Data Portal | DS & ML
8.37K subscribers
542 photos
140 videos
5 files
737 links
Всё самое интересное из мира LLM, Data Science и машинного обучения

adds: @devmangx
Автор: @ScienceLLM
Download Telegram
Google и Anthropic сходятся в одном вопросе: как должен работать retrieval.

Обе компании вынесли его из приложения и превратили в отдельный сервис, который вызывают агенты.

* MCP от Anthropic предоставляет retrieval как инструмент, вызываемый агентом.
* Google реализовала похожую схему: RAG Engine находится внутри платформы Gemini для агентов рядом с MCP-серверами.

Компании пришли к этому, потому что старый наивный RAG строился как одноразовый пайплайн внутри одного приложения и создавал две проблемы:

* Первая — устаревшие эмбеддинги. Они отражают состояние источника на момент индексации. Когда документ или строка меняется, индекс расходится с источником и остаётся неверным до повторного запуска пайплайна.
* Вторая — связанная инфраструктура. Логика retrieval находится внутри одного приложения, поэтому другому приходится дублировать коннекторы, разбиение на чанки и создание эмбеддингов вместо повторного использования готовых компонентов.

Обе проблемы решаются разделением ingestion и выполнения запросов, при этом ingestion работает как постоянно активный слой.

Он непрерывно синхронизирует данные по хешам содержимого, поэтому эмбеддинги пересчитываются только для изменившихся данных. Слой доступен через единый API, и чат-бот с агентом обращаются к одному индексу.

Затем агент вызывает этот слой как инструмент внутри цикла: рассуждает, запускает поиск, читает результат и уточняет запрос — вместо однократного retrieval в самом начале.

Диаграмма ниже показывает все три этапа: наивный RAG, постоянно работающий слой и использующего его агента.

Это помогает, но пока решает не все проблемы. На каждом из трёх этапов единицей retrieval остаётся чанк текста.

Сам по себе чанк ничего не знает о семантических границах, версии или источнике. Сплиттер делит документы в основном по количеству токенов, поэтому чанк может закончиться посреди таблицы или аргумента.

Из-за этого поиск может вернуть верхнюю часть таблицы без строк или вывод без подтверждающих его рассуждений.

Переход к структурированной единице — эмбеддингу вопроса вместе с проверенным ответом — решает эту проблему.

Автор подготовил полный разбор этого подхода. В нём сырые чанки заменяются структурированными блоками, каждый из которых содержит собственные данные об источнике и версии.

Подход сокращает размер корпуса в 40 раз и повышает релевантность векторного поиска в 2,3 раза.
This media is not supported in your browser
VIEW IN TELEGRAM
«Understanding Transformers and Attention Mechanisms» — очень интересная статья, в которой архитектура Transformer рассматривается с точки зрения прикладной математики.

Авторы начинают с представления текста в виде векторов и математически объясняют, как механизм внимания обрабатывает эти векторы и кодирует контекстную информацию. Затем переходят к Multi-Head Attention и показывают, как устроены основные компоненты архитектуры Transformer.

В статье также разбираются более современные методы снижения вычислительных затрат и расхода памяти при работе внимания, включая KV-кэширование, Grouped Query Attention и Latent Attention.

Это полезный материал для тех, кто хочет разобраться в трансформерах глубже их общей архитектуры и увидеть линейную алгебру, лежащую в основе современных языковых моделей.

[https://arxiv.org/pdf/2604.00965]
NVIDIA представила и открыла исходный код NOOA — нового фреймворка для создания ИИ-агентов.

Его главная идея — описывать агента как один Python-класс, а не разносить логику по промптам, схемам инструментов, колбэкам и графам выполнения.

В NOOA:
• методы — это действия агента;
• поля — его состояние;
• docstring становятся промптами;
• тип возвращаемого значения задаёт контракт ответа.

Самая интересная особенность — «пустые» методы. Если тело метода содержит только ..., его реализацию во время выполнения генерирует LLM. Если внутри есть обычный Python-код, он выполняется без участия модели. Так в одном классе сразу видно, где модель может принимать решения, а где поведение полностью детерминировано.

Ещё одна сильная сторона — работа с данными. Если методу передать список из 100 элементов, модель увидит только имя переменной, её тип, размер и несколько элементов с начала и конца. Все данные остаются в памяти процесса, а модель взаимодействует с ними через код, который пишет на лету. Благодаря этому ограничения начинают определяться не размером контекстного окна, а ресурсами машины, на которой выполняется код.

По словам NVIDIA, на SWE-bench Verified с GPT-5.5 NOOA набирает 82,2% против 78,6% у OpenCode, используя примерно вдвое меньше обращений к модели и токенов.

Статья: http://arxiv.org/abs/2607.20709
Репозиторий: http://github.com/nvidia-nemo/labs-OO-Agents
Теперь Kimi K3 с 2,78 трлн параметров можно запустить на одном CPU и 8,24 ГБ оперативной памяти. Проект полностью open source.

Он называется kimi-k3-in-c.

Большинство inference-стеков предполагают, что для запуска передовой MoE-модели нужен кластер GPU и более 5 ТБ памяти. Здесь весь движок занимает 176 КБ и написан на переносимом C99.

Он работает без BLAS, PyTorch, CUDA, каких-либо фреймворков, GPU и AVX-512.

Чекпоинт размером 1,56 ТБ хранится на NVMe. Для каждого токена активируются только 16 из 896 экспертов, поэтому остальные 93% подгружаются с диска по мере необходимости и не занимают оперативную память.

Плотная часть модели работает с любым доступным объёмом памяти: 8, 32, 128 или 224 ГБ. Веса остаются теми же, а результат побайтово совпадает при любом лимите памяти.

Что умеет проект:

→ Запускает инференс Kimi K3 на ноутбуке с 8 ГБ свободной памяти

→ Читает веса MXFP4 напрямую, без деквантизации в float32

→ Стримит основную часть модели с диска через O_DIRECT, обходя page cache

→ Сохраняет фиксированный размер состояния KDA attention независимо от длины контекста

→ Выдаёт побайтово идентичный результат в scalar-, OpenMP- и AVX2-реализациях

→ Проверяет каждое ядро на соответствие референсной реализации на PyTorch

Весь проект занимает 45 МБ: шесть файлов на C и один Python-скрипт для упаковки весов.

И это всё.
Как выглядят задачи машинного обучения в бигтехе?

Открыта регистрация на E-CUP 2026 Students — ежегодное соревнование от Ozon Tech. В этом сезоне — для студентов, которые интересуются ML, Data Science, Big Data и аналитикой данных.

Вас ждут три трека: поиск дубликатов товаров, ИИ-модерация карточек маркетплейса и прогнозирование поведения пользователей. Все задачи основаны на реальных обезличенных данных Ozon.

Участвовать можно по одиночке или в команде до пяти человек. Соревнование проходит онлайн с финалом на масштабной конференции E-CODE.

Что ждёт участников:
- призовой фонд 7 200 000 ₽;
- обратная связь от инженеров Ozon Tech;
- нетворк с экспертами индустрии;
- лимитированный мерч;
- билеты на конференцию E-CODE, где наградят победителей.

Подробнее — на сайте E-CUP 2026 Students.
➡️ Регистрация уже открыта!

Присоединяйтесь, чтобы выйти за рамки учебных проектов, попробовать свои силы в задачах настоящего бигтеха и сравнить своё решение с лучшими участниками.
«The Little Book of Generative AI Foundations» — компактная книга о математических основах современных генеративных моделей. Её цель — представить основные семейства моделей в рамках единой концепции и показать математические связи между ними.

Книга начинается с линейной алгебры, метода главных компонент (PCA) и автокодировщиков. Затем рассматриваются вероятностный PCA, вариационные автокодировщики (VAE), диффузионные модели с удалением шума (denoising diffusion models), генеративные модели непрерывного времени, методы на основе score-функции, сэмплирование Ланжевена, нормализующие потоки (normalizing flows), авторегрессионные модели, GAN, модели на основе энергии (energy-based models) и многое другое.

Это полезный материал для понимания роли вероятности, оптимизации, латентных переменных, стохастических процессов и оценки плотности распределения в генеративном ИИ. Сохраните в закладки: книга хорошо написана, легко читается и содержит множество полезных концепций, благодаря чему может служить отличным справочным материалом.

https://arxiv.org/abs/2605.29713
Генеральный директор Nvidia Дженсен Хуанг объявил о запуске Alpamayo 2 Super — открытой передовой reasoning-модели для автономных транспортных средств.

Alpamayo не просто распознаёт окружающий мир — модель анализирует сложные дорожные ситуации, рассуждает над ними и оценивает возможные действия перед выполнением манёвра.

Она анализирует данные с камер вокруг автомобиля, чтобы понимать контекст, прогнозировать, что произойдёт дальше, и принимать решения о действиях машины.

Это один из главных сдвигов в автономном вождении: переход от простого сбора данных с сенсоров к системам, которые способны интерпретировать окружающий мир и действовать на основе этого понимания.

Модель может стать основой для систем автономного вождения в роботакси, грузовиках, шаттлах, фургонах доставки, тракторах и других мобильных роботах.

Alpamayo 2 Super выпускается для коммерческого использования под лицензией OpenMDW-1.1, чтобы команды могли изучать модель, дообучать её и разворачивать в собственных системах.

По словам Дженсенона - следующая волна ИИ это робототехника, и автономные транспортные средства станут одним из ключевых направлений её развития.
Please open Telegram to view this post
VIEW IN TELEGRAM
Google DeepMind выпустила книгу How to Scale Your Model.

В ней разбирается, как эффективно масштабировать и запускать модели в условиях ограниченных вычислительных ресурсов — например, в автомобильных системах, где требования моделей постоянно растут, а доступные ресурсы ограничены.

Такие сценарии требуют глубокого понимания закономерностей масштабирования, и именно этому посвящена книга.

https://jax-ml.github.io/scaling-book
Exa теперь входит в число крупнейших поисковых индексов в мире.

Для тех, кто не в курсе: Exa — это поисковая система и API, созданные специально для ИИ-агентов.

Несмотря на то, что Claude, Codex и Gemini уже предлагают встроенный веб-поиск, многие пока не используют подключение агентов к полноценным поисковым системам.

Некоторые всё ещё используют подходы, где агенту приходится самостоятельно управлять браузером, что часто менее эффективно. Специализированные поисковые API вроде Exa или Parallel позволяют агентам быстрее находить и обрабатывать нужную информацию.

Сейчас Exa индексирует 80 млрд страниц и отслеживает 1,4 трлн URL. Компания рассчитывает выйти на масштаб Google к началу 2027 года.

По оценке Exa:

> Google — около 1 трлн страниц в индексе;
> Bing — около 500 млрд;
> Yandex — около 200 млрд;
> Brave — примерно 40 млрд.

Большая часть веба — низкокачественный контент, который может ухудшать ответы ИИ. Поэтому Exa сканирует значительно больше данных, чем отдаёт в результатах поиска, а затем использует ИИ для фильтрации шума.

По пиковому QPS оценки выглядят так:

> Bing — около 30 тыс. запросов/с;
> Google — около 500 тыс. запросов/с.

Агентный трафик сильно отличается от обычного поиска: один запрос может запускать десятки параллельных подзапросов (fan-out), а нагрузка может резко возрастать из-за массового запуска агентов. Поэтому Exa уже готовится к инфраструктуре уровня Bing.

По их прогнозу, через 2 года ИИ-агенты будут выполнять поиск с частотой в несколько миллионов запросов в секунду. Для этого потребуется инфраструктура, которая будет значительно больше существующих поисковых индексов.
Вычисления для ИИ скоро отправятся на орбиту.

NVIDIA и SpaceX официально объединяются для создания космического дата-центра.

В рамках проекта спутник Starmind AI1 получит вычислительный модуль на базе NVIDIA Vera Rubin NVL72.

Он будет использовать солнечную энергию для работы ИИ-инфраструктуры на орбите, обеспечивая высокопроизводительные вычисления с передачей результатов на Землю.

Эпоха космических дата-центров скоро начнётся. 🚀
Please open Telegram to view this post
VIEW IN TELEGRAM
MIT 6.824 (распределённые системы) — один из лучших бесплатных инженерных курсов в интернете.

Вместо чистой теории весь курс построен вокруг чтения и разбора фундаментальных работ из реальных систем:

GFS (Google File System) — архитектура с одним главным узлом, распределение чанков и работа с eventual consistency при больших нагрузках на добавление данных.

Raft — выбор лидера, репликация журнала и инварианты безопасности. Алгоритм разбирается намного доступнее, чем Paxos.

ZooKeeper — координация без блокировок, системы с преобладанием чтения, линейно согласованные записи и eventual consistency для чтений через watches.

Spanner — глобально распределённые транзакции, двухфазный commit поверх Paxos и использование TrueTime (атомные часы + GPS) для обеспечения внешней согласованности.

Также в курсе разбираются MapReduce, Spark, Frangipani, Memcached от Facebook и другие системы.

Если хотите выйти за пределы поверхностного system design и понять, как внутри устроены реальные распределённые хранилища и системы консенсуса, этот курс — настоящий клад.

Плейлист: https://youtube.com/playlist?list=PLrw6a1wE39_tb2fErI4-WkMbsvGQk9_UB
«Визуальный разбор квантования» от Maarten Grootendorst — один из лучших разборов этой темы, которые я видел.

https://newsletter.maartengrootendorst.com/p/a-visual-guide-to-quantization

По мере того как инференс переходит на более ограниченные устройства (например, автомобили и edge-устройства), понимание компромисса между точностью и потреблением памяти при квантовании становится обязательным.
Стэнфордский семинар об архитектуре NVIDIA H100.

Подробный разбор потоковых мультипроцессоров Hopper, Transformer Engine, межсоединений NVLink и подходов к оптимизации HPC- и ИИ-нагрузок.

https://youtu.be/MC223HlPdK0
«Introduction to Machine Learning» — ещё один бесплатный учебник по машинному обучению объёмом около 600 страниц, который делает акцент на глубоком математическом понимании предмета.

Книга начинается с математической базы, необходимой для дальнейшего изучения: линейной алгебры, математического анализа, теории вероятностей, матричного анализа и методов оптимизации. Затем разбираются основные алгоритмы обучения с учителем: линейная и логистическая регрессия, метод ближайших соседей, деревья решений, случайные леса, бустинг и нейронные сети.

Значительная часть книги посвящена вероятностным и генеративным моделям. Рассматриваются методы Монте-Карло, графические модели, байесовские сети, вариационные методы, нормализующие потоки, вариационные автокодировщики (VAE) и генеративно-состязательные сети (GAN).

В заключительных главах обсуждаются кластеризация, метод главных компонент (PCA), обучение на многообразиях и теоретические оценки способности моделей к обобщению.

На мой взгляд, это отличный справочник для тех, кто хочет получить широкое представление о машинном обучении и разобраться в математике, лежащей в основе ключевых методов, а не воспринимать их как «чёрный ящик».

https://arxiv.org/pdf/2409.02668
"Integration Strategies" — это материал на Algebrica, посвящённый основным методам вычисления интегралов: от самых простых примеров до более сложных задач.

Интегрирование часто становится механическим процессом после того, как выбран правильный метод, но сам выбор метода обычно бывает непростым. В отличие от дифференцирования, интегрирование чаще требует стратегии: нужно распознать структуру подынтегрального выражения и преобразовать его в более простой вид, а не усложнять задачу применением неподходящего подхода.

На странице собраны основные стратегии интегрирования вместе со ссылками на теоретические основы. Материал может использоваться как учебное пособие и как быстрый справочник при решении задач.

Если вы изучаете интегральное исчисление или просто повторяете тему, возможно, этот материал будет полезен.
https://algebrica.org/integration-strategies/
Algorithms Джеффа Эриксона — одна из лучших книг по алгоритмам.

Иллюстрации в ней просто отличные. Очень рекомендую.

https://jeffe.cs.illinois.edu/teaching/algorithms/
Please open Telegram to view this post
VIEW IN TELEGRAM
Минимальная реализация архитектуры Kimi K3, сделанная специально для того, чтобы её можно было нормально прочитать, запустить на CPU или в Google Colab и сверять код с оригинальным техническим отчётом.

KDA, Gated MLA, Attention Residuals и Stable LatentMoE здесь сохранены, но некоторые части упрощены ради читаемости.
Event loop — одна из базовых концепций асинхронного программирования. И поскольку ИИ-агенты по своей природе во многом работают асинхронно, важно понимать, что происходит внутри.

Материал в основном посвящён libuv, но многие принципы там общие и с ними точно стоит быть знакомым.

https://docs.libuv.org/en/v1.x/guide.html