Data Portal | DS & ML
8.37K subscribers
543 photos
140 videos
5 files
738 links
Всё самое интересное из мира LLM, Data Science и машинного обучения

adds: @devmangx
Автор: @ScienceLLM
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
Kimi K3 обучила тернарную модель с нуля.

Каждый линейный слой в ней тернарный: каждый вес строго равен −1, 0 или +1.

И… это работает. Причём почти ничего не стоит.

Архитектура и датасет те же, что и в stories15M Андрея Карпаты. Его модель с полной точностью используется как базовая, а эта — её тернарный аналог.

Итоговый val loss с тернарными весами: 1,6074.
У версии той же модели с полной точностью: 1,5970. Разница: всего +0,01.

Во время обучения forward pass модели всегда выполнялся только с тернарными весами. FP32-веса служили лишь вспомогательной структурой для вычисления градиентов. То есть тернарные веса — не сжатая копия модели. Они и есть сама модель. FP32-чекпоинт можно просто выбросить.

После того как линейные слои стали почти бесплатными — 1 байт на вес и никаких умножений — FP32-матрица эмбеддингов начала занимать 70% всего хранилища модели.

Удешевляешь очевидную часть — и сразу обнаруживается настоящий bottleneck.

https://github.com/brianbell-x/ternary15M

веса - https://huggingface.co/brianbellx/ternary15M
This media is not supported in your browser
VIEW IN TELEGRAM
Кто-то смог запустить CUDA-код на Apple Silicon без переписывания исходников под Metal.

Для этого разработчики собрали цепочку компиляторов, которая автоматически переводит CUDA в код для GPU Apple. В работе использовали GPT-5.6 Sol.

Решение проверили не на простом демо, а на полноценной 3D-симуляции жидкости с сортировкой частиц, атомарными операциями и построением списков соседей.

На одном чипе Apple симуляция выполнилась за 6 секунд, тогда как на CPU тот же код работал около минуты. GPU при этом был загружен полностью, а заметных потерь из-за трансляции не обнаружили.

Если подход окажется применим к другим проектам, часть существующего CUDA-софта можно будет запускать на Mac без ручного портирования. Проект выложен в открытый доступ.

https://github.com/mosaic-group/openfpm/pull/18
NVIDIA сократили время запуска DeepSeek-V4 Pro с 8 минут до менее чем 2 минут, перенеся веса в память GPU по самому быстрому маршруту — через GPU-to-GPU RDMA.

Этого удалось добиться с помощью NVIDIA ModelExpress (MX) — сервиса распределения весов и управления кешем в NVIDIA Dynamo. Тот же подход ускоряет не только инференс, но и постобучение с использованием RL.

MX переиспользует кеши ядер, а воркеры инференса получают обновлённые веса напрямую с других GPU через NIXL. Это позволяет отказаться от централизованной рассылки и вывести перенос весов за пределы критического пути.
// Управление контекстом агентных систем //

Отличное чтение на выходные.

Сохраните в закладки.

Продакшен-агенты чаще ломаются не из-за слабого рассуждения, а из-за того, что накапливается в их контексте. История диалога, большие промпты, огромные описания инструментов и постоянно растущие результаты их вызовов добавляются на каждом шаге.

Обычно эту проблему пытаются решить через хранение и извлечение: создают место, куда можно складывать воспоминания, а затем находить их при необходимости. Однако новое исследование утверждает, что такой взгляд слишком узкий, и предлагает более широкую дисциплину — Agentic Context Management.

Она состоит из пяти базовых операций:

* проектирование;
* загрузка;
* определение области контекста;
* предвосхищение;
* сжатие с консолидацией.

При наивном накоплении стоимость токенов растёт квадратично относительно длины диалога. Грубая суммаризация снижает рост до линейного, но в какой-то момент приводит к резкому падению точности. Только сжатие, проверенное на сохранение исходного смысла, позволяет получить линейную стоимость без потери важной информации.

В референсной реализации сообщается о результате 92% на LongMemEval и 93,2% на LoCoMo.

Почему это важно?

Управление контекстом становится полноценной продакшен-задачей, которая затрагивает всю организацию. Эти пять операций дают структурированный способ понять, на что именно расходуется ваш токен-бюджет.

Статья: https://arxiv.org/abs/2607.21503
В основе Kimi 3 лежит новый механизм под названием delta attention, который не хранит постоянно растущий KV-кеш. Именно поэтому модель может работать с контекстом в миллион токенов без взрывного роста потребления памяти.

Но прежде чем разбираться в delta attention, нужно понять, как работает обычный attention.

По сути, это поиск по таблице. Каждый токен хранит:

- key — что-то вроде адреса;
- value — содержимое по этому адресу.

Чтобы сформировать выход, токен отправляет query, сравнивает его со всеми ключами в последовательности и получает смесь значений, ключи которых подошли лучше всего. Именно это показано в верхней части схемы.

Обычный attention хранит каждую такую пару key-value в виде списка — по одной записи на токен. Этот список и называется KV-кешем.

Он растёт вместе с длиной последовательности, поэтому каждому новому токену приходится просматривать весь кеш, чтобы сформировать результат. Если удвоить длину контекста, удвоятся и объём хранения, и количество операций поиска. Отсюда берутся квадратичная стоимость и быстро растущее потребление памяти.

Delta attention сохраняет сам механизм поиска, но избавляется от списка.

Вся история сжимается в одну матрицу фиксированного размера, которая продолжает работать как таблица поиска. Передаёте ей ключ — она возвращает значение, которое прошлый контекст связал с этим ключом.
Неважно, тысяча токенов в контексте или миллион - размер матрицы остаётся прежним.

Самая сложная часть это запись новых данных.
Нельзя просто добавить новую пару в матрицу фиксированного размера (новые записи начнут накладываться на старые и смешиваться с ними). Delta rule решает эту проблему в два шага для каждого токена. Они показаны в нижней части схемы.

Сначала чтение, затем запись.
Матрице передаётся ключ нового токена, после чего проверяется, какое значение память уже возвращает по этому адресу — то есть её текущая оценка.

Записывается не само значение, а разница.
Текущая оценка сравнивается со значением, которое нужно сохранить. В матрицу записывается только расхождение между ними. Это расхождение и называется delta. Оно корректирует старую ассоциацию, а не накладывает поверх неё новую.

Матрица также позволяет старым записям постепенно затухать. Благодаря этому память фиксированного размера может продолжать поглощать длинную последовательность, не переполняясь.

Именно в этом заключается разница, показанная на схеме.

Обычный attention запоминает всё, сохраняя каждую запись, и платит за это квадратичной стоимостью повторного сканирования.

Delta attention запоминает, постоянно перезаписывая одну матрицу, и работает с линейной стоимостью.
Но компромисс здесь реальный.

Сжатая матрица не может хранить каждый токен абсолютно точно, поэтому восстановление конкретного токена становится приблизительным. Именно поэтому в реальных моделях обычно комбинируют оба подхода: несколько слоёв full attention оставляют для точного поиска, а остальные работают в линейном режиме.

Вся разница сводится к одному глаголу:
Обычный attention добавляет. Delta attention корректирует.

Подробнее: https://kimi.com/blog/kimi-k3
«Mathematics of Neural Networks» — компактный вводный материал по deep learning с упором на математику.

Книга постепенно разбирает базовые идеи современных нейросетей: supervised learning, искусственные нейроны и функции активации, feed-forward сети, stochastic gradient descent, глубокие нейросети, инициализацию весов, CNN, automatic differentiation и backpropagation, а также оптимизаторы Adam, RMSProp и Adagrad.

Отдельно затрагиваются equivariance, группы Ли, однородные пространства и geometric deep learning.

Материал рассчитан на студентов и тех, кто хочет сначала выстроить прочную математическую базу по нейросетям, а уже потом переходить к более сложным источникам. Несмотря на вводный уровень, изложение остаётся достаточно строгим и хорошо показывает математические принципы, лежащие в основе современных deep learning-систем.

https://arxiv.org/pdf/2403.04807
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
11 методов оценки LLM, которые стоит знать AI-инженерам:

Две eval-метрики могут поставить одни и те же две модели в противоположном порядке — и при этом обе будут правы.
Например, модель может перефразировать эталонный ответ и получить почти ноль по BLEU, но при этом оказаться почти на вершине по BERTScore для того же самого результата.

И ни одна из метрик не ошибается: BLEU измеряет совпадение формулировок, а BERTScore лучше улавливает смысл.
Именно поэтому оценка LLM разбита на несколько подходов, каждый из которых опирается на свои предположения.

Reference-based — когда есть ground truth:
BLEU
ROUGE
BERTScore

Judge-based — когда ground truth нет:
G-Eval
LLM-as-Judge
LLM juries

Human и deterministic:
Human eval
DAG

Для агентов:
Trajectory accuracy
Multi-turn eval

Как gate перед продом: Safety eval

На практике большинство этих метрик уже реализованы в Opik — open-source проекте с 20k+ звёзд на GitHub. Он позволяет запускать evals поверх traced production data и начать работу буквально с нескольких строк кода.

GitHub: https://github.com/comet-ml/opik

Но сами метрики лишь показывают, какой кейс сломался.

Остальная работа обычно всё ещё делается вручную: нужно открыть trace, понять, на каком span всё пошло не так, изменить prompt или описание tool, повторно запустить кейс и проверить, что исправление не сломало что-то ещё.

Сооснователь автора сделал подробный walkthrough с кодом, который автоматизирует этот цикл с помощью Opik.

В нём показан полный workflow: неудачный trace диагностируется, исправление прогоняется на том же input, где возникла ошибка, а затем этот input остаётся в eval set как regression case, чтобы проблема не повторилась.
«An Introduction to Real Analysis» Джона К. Хантера — бесплатный набор университетских лекционных материалов и строгое введение в математический анализ.

Книга начинается с множеств, функций и чисел, а затем переходит к последовательностям, рядам, топологии вещественных чисел, пределам, непрерывности, дифференцированию, последовательностям и рядам функций, степенным рядам, интегралу Римана и его приложениям, а также метрическим, нормированным и топологическим пространствам.

Материал подойдёт студентам, которые уже знакомы с calculus и хотят перейти к более строгой, основанной на доказательствах математике. Изложение понятное, а уровень соответствует университетскому курсу по real analysis.

Полная версия конспектов доступна на сайте автора:

https://math.ucdavis.edu/~hunter/intro_analysis_pdf/intro_analysis.html
В открытом доступе есть один из самых известных учебников MIT по computer science — Structure and Interpretation of Computer Programs (SICP).

Это больше 650 страниц не столько про конкретный язык, сколько про то, как вообще думать о программах и вычислениях.
Вместо очередного фреймворка здесь разбираются базовые идеи: абстракции, рекурсия, higher-order functions, состояние, lazy evaluation, устройство интерпретаторов, компиляция и register machines.

SICP много лет использовался в MIT как вводный материал по computer science, и его ценность как раз в том, что он учит смотреть на код глубже, чем на набор синтаксических конструкций.

Книга доступна бесплатно целиком:
https://web.mit.edu/6.001/6.037/sicp.pdf
Kimi K3 получилась куда интереснее, чем просто «ещё одна огромная MoE-модель».

По сути Moonshot взяли архитектурные идеи из Kimi Linear и масштабировали их с 48B до 2.8T параметров. Сейчас K3 — крупнейшая open-weight модель.

Из нового появился LatentMoE — подход, где большие linear layers дополнительно сжимают через down-projection. Общий вектор здесь понятный: сделать такую гигантскую модель дешевле и эффективнее на инференсе.

Поэтому обычные компоненты постепенно заменяются более оптимизированными версиями: MoE → LatentMoE, стандартный attention → multi-head latent attention и Kimi Delta Attention.

Отдельно интересны attention residuals. Это уже не столько про ускорение, сколько про улучшение передачи информации между слоями. Residual-связи соединяются между слоями, а их вклад определяется через attention score. По отчёту, это немного, но стабильно улучшает validation loss и downstream performance, ценой примерно +4% к обучению и +2% к инференсу.

Ещё один необычный момент — в Kimi K3 вообще нет RoPE. Модель полностью использует NoPE, то есть обходится без positional embeddings. Для frontier-модели это довольно редкий подход.

Ну и K3 теперь нативно мультимодальная.

В целом архитектура выглядит сложной, но почти все изменения хорошо укладываются в одну идею: масштабировать модель до безумных размеров, не превращая инференс в полный кошмар.
Новое исследование Meta и CMU про agentic context management для long-horizon задач.

Стоит сохранить.

Продакшен-агенты накапливают всё больше контекста с каждым шагом. Обычно проблему решают через сжатие по порогу токенов, отбрасывая остальное. Из-за этого компрессия может сработать в момент, который вообще не связан с текущей задачей агента.

В ACM агенту дают отдельные инструменты для управления контекстом. Он сам решает, когда что-то сжать, переносит отброшенные детали во внешнее хранилище памяти и позже запрашивает их обратно, если они снова понадобятся. По сути, информация переезжает из краткосрочного контекста в долгосрочную память.

Авторы также построили post-training pipeline на качественных демонстрациях управления контекстом. Это дало 27% относительного прироста на BrowseComp-Plus и позволило приблизиться к open-source моделям, которые примерно в 40 раз крупнее.

Лучшее управление контекстом снижает пиковое потребление токенов, позволяет агенту дольше исследовать задачу до упора в контекстное окно и делает результаты стабильнее между независимыми запусками одной и той же задачи.

Код, данные и чекпоинты опубликованы.

Paper: https://arxiv.org/abs/2607.23809
Kimi вместе с kvcache-ai открыли исходный код AgentENV.

AgentENV — это распределённая система для масштабного запуска агентных окружений. Её компоненты используются для agentic RL-тренировки Kimi K3 и поддерживают быстрые snapshot, resume и fork для параллельных агентных воркфлоу в большом масштабе.
ТОП-5 БЕСПЛАТНЫХ КУРСОВ ПО ИИ-АГЕНТАМ:

1. Hugging Face — AI Agents Course
> https://huggingface.co/learn/agents-course

2. DeepLearningAI — AI Agents in LangGraph
> https://deeplearning.ai/courses/ai-agents-in-langgraph

3. DeepLearningAI — Multi AI Agent Systems with CrewAI
> https://deeplearning.ai/short-courses/multi-ai-agent-systems-with-crewai/

4. Microsoft Learn — AI Agents for Beginners
> https://microsoft.github.io/AI-For-Beginners/agentic-ai/

5. DeepLearningAI — Building Code Agents with Hugging Face smolagents
> https://deeplearning.ai/courses/building-code-agents-with-hugging-face-smolagents
This media is not supported in your browser
VIEW IN TELEGRAM
Stateful и Stateless-ядро MCP. Крупнейшее обновление MCP от Anthropic

Объясню, что это значит.

До этого релиза общение с MCP-сервером напоминало телефонный звонок. Обе стороны выполняли initialize-рукопожатие, после чего сервер возвращал идентификатор сессии, который передавался во всех последующих запросах.

Сессия была живым объектом внутри конкретного серверного процесса и хранила согласованное состояние.

Представьте ресторан, где только принявший заказ официант знает, что именно вы заказали. Всё работает, пока он не уходит домой.

Поскольку состояние находилось внутри одного процесса, балансировщик не мог распределять запросы между тремя инстансами MCP-сервера. Командам приходилось привязывать клиентов через sticky sessions либо выносить состояние сессий в общее хранилище. Это мешало автоскейлингу, а перезапуск одного процесса обрывал все открытые сессии.

В последнем обновлении от этой схемы полностью отказались. Рукопожатие и заголовок Mcp-Session-Id удалили. Теперь каждый запрос сам передаёт версию протокола, идентификатор клиента и его возможности в поле _meta.

Если клиенту нужен список возможностей заранее, он может вызвать server/discover, но это необязательно.
Теперь ресторан работает иначе: каждый запрос похож на письменный бланк заказа, который может обработать любой официант.

Поэтому запрос может попасть на любой инстанс за обычным round-robin-балансировщиком. Общее хранилище сессий больше не требуется. MCP-серверы становятся обычными HTTP-сервисами, которые можно запускать на serverless- и edge-платформах и спокойно перезапускать.

Удаление сессий сломало три функции, поэтому каждую реализовали заново.

Инструменты, которым нужно задать пользователю вопрос во время вызова, раньше отправляли его через удерживаемый открытым поток. Теперь сервер возвращает input_required, а клиент повторяет запрос, прикрепив ответы.

Названия методов и инструментов перенесли в заголовки Mcp-Method и Mcp-Name. Теперь шлюз или rate limiter может маршрутизировать и учитывать запросы, не разбирая тело JSON-RPC.

Ответы со списками теперь содержат ttlMs и cacheScope. Клиенты могут кешировать каталоги инструментов вместо повторной загрузки после каждого переподключения.

Состояние никуда не исчезло — его перенесли туда, где модель может его видеть.
Если приложению нужна непрерывность между вызовами, инструмент возвращает явный handle, а модель передаёт его аргументом при следующем вызове.

Идентификатор сессии в заголовке невидим для модели. Handle в аргументах она может прочитать, передать между инструментами и восстановить после неудачного вызова.

Официальная спецификация
«Exploring Combinatorial Mathematics» Ричарда Грассла и Оскара Левина — бесплатный open-source учебник по комбинаторике, доступный онлайн и в PDF.

Книга написана для graduate-курса по дискретной математике и особенно подойдёт тем, кто уже немного знаком с математическими доказательствами.

Внутри — как базовые, так и продвинутые темы:

— треугольник Паскаля и биномиальные коэффициенты
— методы подсчёта
— рекуррентные соотношения
— числа Фибоначчи и Каталана
— принцип включения-исключения
— производящие функции
— числа Стирлинга и Белла
— разбиения целых чисел
— теория графов и раскраска графов
— теория Рамсея
— паросочетания в двудольных графах
— и многое другое.

В каждой главе есть практические задания, задачи, подсказки и решения, поэтому учебник подходит и для университетского курса, и для самостоятельного изучения.

https://openmathbooks.org/ecm/ecm.html
This media is not supported in your browser
VIEW IN TELEGRAM
Как собрать свою AI-модель с нуля?

Этот ресурс проводит через весь процесс примерно за 90 минут.

Пошагово:
— токенизация
— pre-training
— fine-tuning

В конце можно уже общаться со своей собственной моделью.

Всё локально, без логов и платежей.

https://languagemodelbuilder.com
«Теория информации, логический вывод и алгоритмы обучения» Дэвида Маккея — полезный справочник по теории информации, байесовскому выводу, машинному обучению, кодам коррекции ошибок, информатике и нейронным сетям.

Книга начинается с фундаментальных принципов и охватывает энтропию, сжатие данных, теорию вероятностей, байесовские методы, графические модели, методы Монте-Карло, теорию кодирования, нейронные сети, кластеризацию, разреженные графы и многие другие темы.

Объяснения сопровождаются примерами и диаграммами, которые помогают лучше разобраться в рассматриваемых концепциях. Материал изложен строго, но доступно для читателей с базовой математической подготовкой.

Полная 640-страничная версия книги доступна бесплатно:

[https://inference.org.uk/itprnn/book.pdf]
Media is too big
VIEW IN TELEGRAM
Shen Sean Chen открыл исходный код cвоего локального ИИ-ассистента

Проект демонстрирует работу Agent Harness и Loop Engineering на примере реального кода. Ассистент полностью запускается на ноутбуке пользователя, а его основной цикл занимает около 95 строк на Python.

Вся система представляет собой один цикл:
сообщение → поиск в памяти → запуск агента → вызов инструментов → трассировка → оценка → сохранение в память → развитие навыков

Память хранится в одном файле SQLite. В проект также встроены детерминированные и LLM-as-a-judge оценки с проверкой перед релизом, Telegram-шлюз, голосовая активация и инструменты для работы с Apple Calendar.

В демонстрации ассистент добавляет в календарь четвертьфинал чемпионата мира, запоминает друзей пользователя и отвечает через Telegram.
«Элементарный анализ: подход через бесконечно малые» Х. Джерома Кейслера — бесплатный учебник по математическому анализу с особенно понятными и хорошо написанными объяснениями.

Книга охватывает действительные и гипердействительные числа, дифференцирование, непрерывные функции, интегрирование и его применения, пределы, аналитическую геометрию, тригонометрические, экспоненциальные и логарифмические функции, бесконечные ряды, векторы, частные производные, кратные интегралы, векторный анализ и дифференциальные уравнения.

Подробные объяснения сопровождаются множеством примеров, упражнений и диаграмм, которые помогают лучше понять основные идеи. Думаю, эту книгу полезно держать под рукой как справочник по перечисленным темам, особенно студентам, которым нужны понятные объяснения и много материала для практики.

https://people.math.wisc.edu/~hkeisler/keislercalc-06-03-26.pdf