Data Portal | DS & ML
8.37K subscribers
542 photos
140 videos
5 files
737 links
Всё самое интересное из мира LLM, Data Science и машинного обучения

adds: @devmangx
Автор: @ScienceLLM
Download Telegram
Новое исследование Google DeepMind.

SkillSmith рассматривает веса модели как дополнительную модальность, которую LLM может читать напрямую. Модифицированная модель получает существующие веса префикса вместе с подробным текстовым описанием того, как способность связана с целевой задачей, а затем сразу генерирует новые веса префикса, реализующие нужный навык.

Объединение навыков становится операцией во время инференса вместо отдельного этапа обучения. Команда называет этот подход параметрическим синтезом, управляемым инструкциями.

Результаты превосходят показатели, которых по отдельности достигают адаптация только по тексту и адаптация только по весам.

Статья: https://arxiv.org/abs/2607.27497
Google и Anthropic сходятся в одном вопросе: как должен работать retrieval.

Обе компании вынесли его из приложения и превратили в отдельный сервис, который вызывают агенты.

* MCP от Anthropic предоставляет retrieval как инструмент, вызываемый агентом.
* Google реализовала похожую схему: RAG Engine находится внутри платформы Gemini для агентов рядом с MCP-серверами.

Компании пришли к этому, потому что старый наивный RAG строился как одноразовый пайплайн внутри одного приложения и создавал две проблемы:

* Первая — устаревшие эмбеддинги. Они отражают состояние источника на момент индексации. Когда документ или строка меняется, индекс расходится с источником и остаётся неверным до повторного запуска пайплайна.
* Вторая — связанная инфраструктура. Логика retrieval находится внутри одного приложения, поэтому другому приходится дублировать коннекторы, разбиение на чанки и создание эмбеддингов вместо повторного использования готовых компонентов.

Обе проблемы решаются разделением ingestion и выполнения запросов, при этом ingestion работает как постоянно активный слой.

Он непрерывно синхронизирует данные по хешам содержимого, поэтому эмбеддинги пересчитываются только для изменившихся данных. Слой доступен через единый API, и чат-бот с агентом обращаются к одному индексу.

Затем агент вызывает этот слой как инструмент внутри цикла: рассуждает, запускает поиск, читает результат и уточняет запрос — вместо однократного retrieval в самом начале.

Диаграмма ниже показывает все три этапа: наивный RAG, постоянно работающий слой и использующего его агента.

Это помогает, но пока решает не все проблемы. На каждом из трёх этапов единицей retrieval остаётся чанк текста.

Сам по себе чанк ничего не знает о семантических границах, версии или источнике. Сплиттер делит документы в основном по количеству токенов, поэтому чанк может закончиться посреди таблицы или аргумента.

Из-за этого поиск может вернуть верхнюю часть таблицы без строк или вывод без подтверждающих его рассуждений.

Переход к структурированной единице — эмбеддингу вопроса вместе с проверенным ответом — решает эту проблему.

Автор подготовил полный разбор этого подхода. В нём сырые чанки заменяются структурированными блоками, каждый из которых содержит собственные данные об источнике и версии.

Подход сокращает размер корпуса в 40 раз и повышает релевантность векторного поиска в 2,3 раза.
This media is not supported in your browser
VIEW IN TELEGRAM
«Understanding Transformers and Attention Mechanisms» — очень интересная статья, в которой архитектура Transformer рассматривается с точки зрения прикладной математики.

Авторы начинают с представления текста в виде векторов и математически объясняют, как механизм внимания обрабатывает эти векторы и кодирует контекстную информацию. Затем переходят к Multi-Head Attention и показывают, как устроены основные компоненты архитектуры Transformer.

В статье также разбираются более современные методы снижения вычислительных затрат и расхода памяти при работе внимания, включая KV-кэширование, Grouped Query Attention и Latent Attention.

Это полезный материал для тех, кто хочет разобраться в трансформерах глубже их общей архитектуры и увидеть линейную алгебру, лежащую в основе современных языковых моделей.

[https://arxiv.org/pdf/2604.00965]
NVIDIA представила и открыла исходный код NOOA — нового фреймворка для создания ИИ-агентов.

Его главная идея — описывать агента как один Python-класс, а не разносить логику по промптам, схемам инструментов, колбэкам и графам выполнения.

В NOOA:
• методы — это действия агента;
• поля — его состояние;
• docstring становятся промптами;
• тип возвращаемого значения задаёт контракт ответа.

Самая интересная особенность — «пустые» методы. Если тело метода содержит только ..., его реализацию во время выполнения генерирует LLM. Если внутри есть обычный Python-код, он выполняется без участия модели. Так в одном классе сразу видно, где модель может принимать решения, а где поведение полностью детерминировано.

Ещё одна сильная сторона — работа с данными. Если методу передать список из 100 элементов, модель увидит только имя переменной, её тип, размер и несколько элементов с начала и конца. Все данные остаются в памяти процесса, а модель взаимодействует с ними через код, который пишет на лету. Благодаря этому ограничения начинают определяться не размером контекстного окна, а ресурсами машины, на которой выполняется код.

По словам NVIDIA, на SWE-bench Verified с GPT-5.5 NOOA набирает 82,2% против 78,6% у OpenCode, используя примерно вдвое меньше обращений к модели и токенов.

Статья: http://arxiv.org/abs/2607.20709
Репозиторий: http://github.com/nvidia-nemo/labs-OO-Agents
Теперь Kimi K3 с 2,78 трлн параметров можно запустить на одном CPU и 8,24 ГБ оперативной памяти. Проект полностью open source.

Он называется kimi-k3-in-c.

Большинство inference-стеков предполагают, что для запуска передовой MoE-модели нужен кластер GPU и более 5 ТБ памяти. Здесь весь движок занимает 176 КБ и написан на переносимом C99.

Он работает без BLAS, PyTorch, CUDA, каких-либо фреймворков, GPU и AVX-512.

Чекпоинт размером 1,56 ТБ хранится на NVMe. Для каждого токена активируются только 16 из 896 экспертов, поэтому остальные 93% подгружаются с диска по мере необходимости и не занимают оперативную память.

Плотная часть модели работает с любым доступным объёмом памяти: 8, 32, 128 или 224 ГБ. Веса остаются теми же, а результат побайтово совпадает при любом лимите памяти.

Что умеет проект:

→ Запускает инференс Kimi K3 на ноутбуке с 8 ГБ свободной памяти

→ Читает веса MXFP4 напрямую, без деквантизации в float32

→ Стримит основную часть модели с диска через O_DIRECT, обходя page cache

→ Сохраняет фиксированный размер состояния KDA attention независимо от длины контекста

→ Выдаёт побайтово идентичный результат в scalar-, OpenMP- и AVX2-реализациях

→ Проверяет каждое ядро на соответствие референсной реализации на PyTorch

Весь проект занимает 45 МБ: шесть файлов на C и один Python-скрипт для упаковки весов.

И это всё.
Как выглядят задачи машинного обучения в бигтехе?

Открыта регистрация на E-CUP 2026 Students — ежегодное соревнование от Ozon Tech. В этом сезоне — для студентов, которые интересуются ML, Data Science, Big Data и аналитикой данных.

Вас ждут три трека: поиск дубликатов товаров, ИИ-модерация карточек маркетплейса и прогнозирование поведения пользователей. Все задачи основаны на реальных обезличенных данных Ozon.

Участвовать можно по одиночке или в команде до пяти человек. Соревнование проходит онлайн с финалом на масштабной конференции E-CODE.

Что ждёт участников:
- призовой фонд 7 200 000 ₽;
- обратная связь от инженеров Ozon Tech;
- нетворк с экспертами индустрии;
- лимитированный мерч;
- билеты на конференцию E-CODE, где наградят победителей.

Подробнее — на сайте E-CUP 2026 Students.
➡️ Регистрация уже открыта!

Присоединяйтесь, чтобы выйти за рамки учебных проектов, попробовать свои силы в задачах настоящего бигтеха и сравнить своё решение с лучшими участниками.
«The Little Book of Generative AI Foundations» — компактная книга о математических основах современных генеративных моделей. Её цель — представить основные семейства моделей в рамках единой концепции и показать математические связи между ними.

Книга начинается с линейной алгебры, метода главных компонент (PCA) и автокодировщиков. Затем рассматриваются вероятностный PCA, вариационные автокодировщики (VAE), диффузионные модели с удалением шума (denoising diffusion models), генеративные модели непрерывного времени, методы на основе score-функции, сэмплирование Ланжевена, нормализующие потоки (normalizing flows), авторегрессионные модели, GAN, модели на основе энергии (energy-based models) и многое другое.

Это полезный материал для понимания роли вероятности, оптимизации, латентных переменных, стохастических процессов и оценки плотности распределения в генеративном ИИ. Сохраните в закладки: книга хорошо написана, легко читается и содержит множество полезных концепций, благодаря чему может служить отличным справочным материалом.

https://arxiv.org/abs/2605.29713
Генеральный директор Nvidia Дженсен Хуанг объявил о запуске Alpamayo 2 Super — открытой передовой reasoning-модели для автономных транспортных средств.

Alpamayo не просто распознаёт окружающий мир — модель анализирует сложные дорожные ситуации, рассуждает над ними и оценивает возможные действия перед выполнением манёвра.

Она анализирует данные с камер вокруг автомобиля, чтобы понимать контекст, прогнозировать, что произойдёт дальше, и принимать решения о действиях машины.

Это один из главных сдвигов в автономном вождении: переход от простого сбора данных с сенсоров к системам, которые способны интерпретировать окружающий мир и действовать на основе этого понимания.

Модель может стать основой для систем автономного вождения в роботакси, грузовиках, шаттлах, фургонах доставки, тракторах и других мобильных роботах.

Alpamayo 2 Super выпускается для коммерческого использования под лицензией OpenMDW-1.1, чтобы команды могли изучать модель, дообучать её и разворачивать в собственных системах.

По словам Дженсенона - следующая волна ИИ это робототехника, и автономные транспортные средства станут одним из ключевых направлений её развития.
Please open Telegram to view this post
VIEW IN TELEGRAM
Google DeepMind выпустила книгу How to Scale Your Model.

В ней разбирается, как эффективно масштабировать и запускать модели в условиях ограниченных вычислительных ресурсов — например, в автомобильных системах, где требования моделей постоянно растут, а доступные ресурсы ограничены.

Такие сценарии требуют глубокого понимания закономерностей масштабирования, и именно этому посвящена книга.

https://jax-ml.github.io/scaling-book
Exa теперь входит в число крупнейших поисковых индексов в мире.

Для тех, кто не в курсе: Exa — это поисковая система и API, созданные специально для ИИ-агентов.

Несмотря на то, что Claude, Codex и Gemini уже предлагают встроенный веб-поиск, многие пока не используют подключение агентов к полноценным поисковым системам.

Некоторые всё ещё используют подходы, где агенту приходится самостоятельно управлять браузером, что часто менее эффективно. Специализированные поисковые API вроде Exa или Parallel позволяют агентам быстрее находить и обрабатывать нужную информацию.

Сейчас Exa индексирует 80 млрд страниц и отслеживает 1,4 трлн URL. Компания рассчитывает выйти на масштаб Google к началу 2027 года.

По оценке Exa:

> Google — около 1 трлн страниц в индексе;
> Bing — около 500 млрд;
> Yandex — около 200 млрд;
> Brave — примерно 40 млрд.

Большая часть веба — низкокачественный контент, который может ухудшать ответы ИИ. Поэтому Exa сканирует значительно больше данных, чем отдаёт в результатах поиска, а затем использует ИИ для фильтрации шума.

По пиковому QPS оценки выглядят так:

> Bing — около 30 тыс. запросов/с;
> Google — около 500 тыс. запросов/с.

Агентный трафик сильно отличается от обычного поиска: один запрос может запускать десятки параллельных подзапросов (fan-out), а нагрузка может резко возрастать из-за массового запуска агентов. Поэтому Exa уже готовится к инфраструктуре уровня Bing.

По их прогнозу, через 2 года ИИ-агенты будут выполнять поиск с частотой в несколько миллионов запросов в секунду. Для этого потребуется инфраструктура, которая будет значительно больше существующих поисковых индексов.
Вычисления для ИИ скоро отправятся на орбиту.

NVIDIA и SpaceX официально объединяются для создания космического дата-центра.

В рамках проекта спутник Starmind AI1 получит вычислительный модуль на базе NVIDIA Vera Rubin NVL72.

Он будет использовать солнечную энергию для работы ИИ-инфраструктуры на орбите, обеспечивая высокопроизводительные вычисления с передачей результатов на Землю.

Эпоха космических дата-центров скоро начнётся. 🚀
Please open Telegram to view this post
VIEW IN TELEGRAM
MIT 6.824 (распределённые системы) — один из лучших бесплатных инженерных курсов в интернете.

Вместо чистой теории весь курс построен вокруг чтения и разбора фундаментальных работ из реальных систем:

GFS (Google File System) — архитектура с одним главным узлом, распределение чанков и работа с eventual consistency при больших нагрузках на добавление данных.

Raft — выбор лидера, репликация журнала и инварианты безопасности. Алгоритм разбирается намного доступнее, чем Paxos.

ZooKeeper — координация без блокировок, системы с преобладанием чтения, линейно согласованные записи и eventual consistency для чтений через watches.

Spanner — глобально распределённые транзакции, двухфазный commit поверх Paxos и использование TrueTime (атомные часы + GPS) для обеспечения внешней согласованности.

Также в курсе разбираются MapReduce, Spark, Frangipani, Memcached от Facebook и другие системы.

Если хотите выйти за пределы поверхностного system design и понять, как внутри устроены реальные распределённые хранилища и системы консенсуса, этот курс — настоящий клад.

Плейлист: https://youtube.com/playlist?list=PLrw6a1wE39_tb2fErI4-WkMbsvGQk9_UB
«Визуальный разбор квантования» от Maarten Grootendorst — один из лучших разборов этой темы, которые я видел.

https://newsletter.maartengrootendorst.com/p/a-visual-guide-to-quantization

По мере того как инференс переходит на более ограниченные устройства (например, автомобили и edge-устройства), понимание компромисса между точностью и потреблением памяти при квантовании становится обязательным.
Стэнфордский семинар об архитектуре NVIDIA H100.

Подробный разбор потоковых мультипроцессоров Hopper, Transformer Engine, межсоединений NVLink и подходов к оптимизации HPC- и ИИ-нагрузок.

https://youtu.be/MC223HlPdK0
«Introduction to Machine Learning» — ещё один бесплатный учебник по машинному обучению объёмом около 600 страниц, который делает акцент на глубоком математическом понимании предмета.

Книга начинается с математической базы, необходимой для дальнейшего изучения: линейной алгебры, математического анализа, теории вероятностей, матричного анализа и методов оптимизации. Затем разбираются основные алгоритмы обучения с учителем: линейная и логистическая регрессия, метод ближайших соседей, деревья решений, случайные леса, бустинг и нейронные сети.

Значительная часть книги посвящена вероятностным и генеративным моделям. Рассматриваются методы Монте-Карло, графические модели, байесовские сети, вариационные методы, нормализующие потоки, вариационные автокодировщики (VAE) и генеративно-состязательные сети (GAN).

В заключительных главах обсуждаются кластеризация, метод главных компонент (PCA), обучение на многообразиях и теоретические оценки способности моделей к обобщению.

На мой взгляд, это отличный справочник для тех, кто хочет получить широкое представление о машинном обучении и разобраться в математике, лежащей в основе ключевых методов, а не воспринимать их как «чёрный ящик».

https://arxiv.org/pdf/2409.02668
"Integration Strategies" — это материал на Algebrica, посвящённый основным методам вычисления интегралов: от самых простых примеров до более сложных задач.

Интегрирование часто становится механическим процессом после того, как выбран правильный метод, но сам выбор метода обычно бывает непростым. В отличие от дифференцирования, интегрирование чаще требует стратегии: нужно распознать структуру подынтегрального выражения и преобразовать его в более простой вид, а не усложнять задачу применением неподходящего подхода.

На странице собраны основные стратегии интегрирования вместе со ссылками на теоретические основы. Материал может использоваться как учебное пособие и как быстрый справочник при решении задач.

Если вы изучаете интегральное исчисление или просто повторяете тему, возможно, этот материал будет полезен.
https://algebrica.org/integration-strategies/
Algorithms Джеффа Эриксона — одна из лучших книг по алгоритмам.

Иллюстрации в ней просто отличные. Очень рекомендую.

https://jeffe.cs.illinois.edu/teaching/algorithms/
Please open Telegram to view this post
VIEW IN TELEGRAM
Минимальная реализация архитектуры Kimi K3, сделанная специально для того, чтобы её можно было нормально прочитать, запустить на CPU или в Google Colab и сверять код с оригинальным техническим отчётом.

KDA, Gated MLA, Attention Residuals и Stable LatentMoE здесь сохранены, но некоторые части упрощены ради читаемости.