В основе Kimi 3 лежит новый механизм под названием delta attention, который не хранит постоянно растущий KV-кеш. Именно поэтому модель может работать с контекстом в миллион токенов без взрывного роста потребления памяти.
Но прежде чем разбираться в delta attention, нужно понять, как работает обычный attention.
По сути, это поиск по таблице. Каждый токен хранит:
- key — что-то вроде адреса;
- value — содержимое по этому адресу.
Чтобы сформировать выход, токен отправляет
Обычный attention хранит каждую такую пару key-value в виде списка — по одной записи на токен. Этот список и называется KV-кешем.
Он растёт вместе с длиной последовательности, поэтому каждому новому токену приходится просматривать весь кеш, чтобы сформировать результат. Если удвоить длину контекста, удвоятся и объём хранения, и количество операций поиска. Отсюда берутся квадратичная стоимость и быстро растущее потребление памяти.
Delta attention сохраняет сам механизм поиска, но избавляется от списка.
Вся история сжимается в одну матрицу фиксированного размера, которая продолжает работать как таблица поиска. Передаёте ей ключ — она возвращает значение, которое прошлый контекст связал с этим ключом.
Неважно, тысяча токенов в контексте или миллион - размер матрицы остаётся прежним.
Самая сложная часть это запись новых данных.
Нельзя просто добавить новую пару в матрицу фиксированного размера (новые записи начнут накладываться на старые и смешиваться с ними). Delta rule решает эту проблему в два шага для каждого токена. Они показаны в нижней части схемы.
→ Сначала чтение, затем запись.
Матрице передаётся ключ нового токена, после чего проверяется, какое значение память уже возвращает по этому адресу — то есть её текущая оценка.
→ Записывается не само значение, а разница.
Текущая оценка сравнивается со значением, которое нужно сохранить. В матрицу записывается только расхождение между ними. Это расхождение и называется delta. Оно корректирует старую ассоциацию, а не накладывает поверх неё новую.
Матрица также позволяет старым записям постепенно затухать. Благодаря этому память фиксированного размера может продолжать поглощать длинную последовательность, не переполняясь.
Именно в этом заключается разница, показанная на схеме.
Обычный attention запоминает всё, сохраняя каждую запись, и платит за это квадратичной стоимостью повторного сканирования.
Delta attention запоминает, постоянно перезаписывая одну матрицу, и работает с линейной стоимостью.
Но компромисс здесь реальный.
Сжатая матрица не может хранить каждый токен абсолютно точно, поэтому восстановление конкретного токена становится приблизительным. Именно поэтому в реальных моделях обычно комбинируют оба подхода: несколько слоёв full attention оставляют для точного поиска, а остальные работают в линейном режиме.
Вся разница сводится к одному глаголу:
Обычный attention добавляет. Delta attention корректирует.
Подробнее: https://kimi.com/blog/kimi-k3
Но прежде чем разбираться в delta attention, нужно понять, как работает обычный attention.
По сути, это поиск по таблице. Каждый токен хранит:
- key — что-то вроде адреса;
- value — содержимое по этому адресу.
Чтобы сформировать выход, токен отправляет
query, сравнивает его со всеми ключами в последовательности и получает смесь значений, ключи которых подошли лучше всего. Именно это показано в верхней части схемы.Обычный attention хранит каждую такую пару key-value в виде списка — по одной записи на токен. Этот список и называется KV-кешем.
Он растёт вместе с длиной последовательности, поэтому каждому новому токену приходится просматривать весь кеш, чтобы сформировать результат. Если удвоить длину контекста, удвоятся и объём хранения, и количество операций поиска. Отсюда берутся квадратичная стоимость и быстро растущее потребление памяти.
Delta attention сохраняет сам механизм поиска, но избавляется от списка.
Вся история сжимается в одну матрицу фиксированного размера, которая продолжает работать как таблица поиска. Передаёте ей ключ — она возвращает значение, которое прошлый контекст связал с этим ключом.
Неважно, тысяча токенов в контексте или миллион - размер матрицы остаётся прежним.
Самая сложная часть это запись новых данных.
Нельзя просто добавить новую пару в матрицу фиксированного размера (новые записи начнут накладываться на старые и смешиваться с ними). Delta rule решает эту проблему в два шага для каждого токена. Они показаны в нижней части схемы.
→ Сначала чтение, затем запись.
Матрице передаётся ключ нового токена, после чего проверяется, какое значение память уже возвращает по этому адресу — то есть её текущая оценка.
→ Записывается не само значение, а разница.
Текущая оценка сравнивается со значением, которое нужно сохранить. В матрицу записывается только расхождение между ними. Это расхождение и называется delta. Оно корректирует старую ассоциацию, а не накладывает поверх неё новую.
Матрица также позволяет старым записям постепенно затухать. Благодаря этому память фиксированного размера может продолжать поглощать длинную последовательность, не переполняясь.
Именно в этом заключается разница, показанная на схеме.
Обычный attention запоминает всё, сохраняя каждую запись, и платит за это квадратичной стоимостью повторного сканирования.
Delta attention запоминает, постоянно перезаписывая одну матрицу, и работает с линейной стоимостью.
Но компромисс здесь реальный.
Сжатая матрица не может хранить каждый токен абсолютно точно, поэтому восстановление конкретного токена становится приблизительным. Именно поэтому в реальных моделях обычно комбинируют оба подхода: несколько слоёв full attention оставляют для точного поиска, а остальные работают в линейном режиме.
Вся разница сводится к одному глаголу:
Обычный attention добавляет. Delta attention корректирует.
Подробнее: https://kimi.com/blog/kimi-k3
3
Интересная работа про оптимизацию обвязки ИИ-агентов на основе их собственных прошлых запусков.
MemoHarness оптимизирует не только промпт, а всю обвязку агента — от контекста и инструментов до памяти и оркестрации.
После запусков система запоминает, какие решения сработали, а при новой задаче находит похожие случаи и подстраивает обвязку под них.
При этом не нужны дополнительные метки, обучение через градиенты или дорогостоящий поиск вариантов.
На бенчмарке для shell-агентов MemoHarness получил 0,806 против 0,722 у лучшей системы с фиксированной обвязкой. При этом стоимость выполнения одной задачи оказалась ниже, чем у сильнейших коммерческих решений.
Статья: https://arxiv.org/abs/2607.14159
MemoHarness оптимизирует не только промпт, а всю обвязку агента — от контекста и инструментов до памяти и оркестрации.
После запусков система запоминает, какие решения сработали, а при новой задаче находит похожие случаи и подстраивает обвязку под них.
При этом не нужны дополнительные метки, обучение через градиенты или дорогостоящий поиск вариантов.
На бенчмарке для shell-агентов MemoHarness получил 0,806 против 0,722 у лучшей системы с фиксированной обвязкой. При этом стоимость выполнения одной задачи оказалась ниже, чем у сильнейших коммерческих решений.
Статья: https://arxiv.org/abs/2607.14159
При разработке под сервисы Cloudflare не забывайте про официальные скиллы: https://github.com/cloudflare/skills
Они охватывают почти все сервисы Cloudflare и очень часто обновляются. Каждый раз, когда мне нужно интегрировать какой-либо сервис Cloudflare, я сначала заглядываю туда — это очень удобно.
А для более продвинутых операций также доступен MCP-сервис.
Они охватывают почти все сервисы Cloudflare и очень часто обновляются. Каждый раз, когда мне нужно интегрировать какой-либо сервис Cloudflare, я сначала заглядываю туда — это очень удобно.
А для более продвинутых операций также доступен MCP-сервис.
GitHub
GitHub - cloudflare/skills: Skills for teaching agents how to build on Cloudflare.
Skills for teaching agents how to build on Cloudflare. - cloudflare/skills
This media is not supported in your browser
VIEW IN TELEGRAM
Скилл для Codex, который проверяет Mac и показывает, что можно безопасно удалить, чтобы освободить место на диске.
Он сканирует систему и ищет:
> кэши, логи, старые установщики, артефакты сборки, папки
https://github.com/Kappaemme-git/codex-mac-storage-cleanup
Он сканирует систему и ищет:
> кэши, логи, старые установщики, артефакты сборки, папки
node_modules, данные Xcode, остаточные файлы Docker и другие данные, которые могут занимать место впустую.https://github.com/Kappaemme-git/codex-mac-storage-cleanup
4
Media is too big
VIEW IN TELEGRAM
Основатель Kimi Ян Чжилинь считался выдающимся талантом задолго до успеха Kimi 3.
Ещё в 2014 году, во время защиты стипендии в Университете Цинхуа, наставник назвал его одним из самых способных студентов, которых встречал за последние годы.
К тому моменту он уже был первым на потоке, получал почти максимальные оценки, опубликовал три статьи на крупных научных конференциях, а его алгоритмы использовали Tencent, Sina и Huawei. Кроме того, он победил команды Стэнфорда и Колумбийского университета в международном соревновании по прогнозированию рака.
При этом он успевал играть на барабанах и писать песни для собственной студенческой группы.
Поэтому успех Kimi трудно назвать внезапным. За ним стоят как минимум 12 лет работы.
Ещё в 2014 году, во время защиты стипендии в Университете Цинхуа, наставник назвал его одним из самых способных студентов, которых встречал за последние годы.
К тому моменту он уже был первым на потоке, получал почти максимальные оценки, опубликовал три статьи на крупных научных конференциях, а его алгоритмы использовали Tencent, Sina и Huawei. Кроме того, он победил команды Стэнфорда и Колумбийского университета в международном соревновании по прогнозированию рака.
При этом он успевал играть на барабанах и писать песни для собственной студенческой группы.
Поэтому успех Kimi трудно назвать внезапным. За ним стоят как минимум 12 лет работы.
Media is too big
VIEW IN TELEGRAM
Claude, собери мне Battlefield 7, не допускай ошибок: Мэтт Шумер с одного промпта собрал онлайн-шутер на Three.js с помощью Opus 5. И всё это без каких-либо внешних ассетов. 🚬
промпт и код здесь
промпт и код здесь
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Сэм Альтман в своём новом интервью: «Мы уже находимся в сингулярности».
Смотря на скорость прогресса и количество прорывов, в это действительно легко поверить. А последствия всего происходящего сейчас практически невозможно предсказать.
И при этом 99% людей за пределами нашего пузыря даже не понимают, что сейчас происходит.
Смотря на скорость прогресса и количество прорывов, в это действительно легко поверить. А последствия всего происходящего сейчас практически невозможно предсказать.
И при этом 99% людей за пределами нашего пузыря даже не понимают, что сейчас происходит.
This media is not supported in your browser
VIEW IN TELEGRAM
ChatGPT Work agent теперь умеет работать с сайтами, где нужен вход в аккаунт.
Пользователь один раз берёт управление облачным браузером на себя и проходит авторизацию. После этого агент может продолжить задачу самостоятельно уже внутри залогиненной сессии.
Авторизация сохраняется между сессиями, поэтому каждый раз входить заново не придётся.😜
Пользователь один раз берёт управление облачным браузером на себя и проходит авторизацию. После этого агент может продолжить задачу самостоятельно уже внутри залогиненной сессии.
Авторизация сохраняется между сессиями, поэтому каждый раз входить заново не придётся.
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Для геймдева: разработчик выложил в опенсорс свой набор скиллов для разработки игр на Three.js.
С их помощью можно собрать изометрическую action RPG с управлением камерой, VFX, звуком, ассетами монстров, боевой системой и другими игровыми механиками.
Всё доступно бесплатно:
Skills:
https://github.com/MengTo/Skills
Демо игры:
https://vesperfall.mengto.chatgpt.site
Каталог игровых ассетов:
https://vesperfall.mengto.chatgpt.site/asset-catalog
С их помощью можно собрать изометрическую action RPG с управлением камерой, VFX, звуком, ассетами монстров, боевой системой и другими игровыми механиками.
Всё доступно бесплатно:
Skills:
https://github.com/MengTo/Skills
Демо игры:
https://vesperfall.mengto.chatgpt.site
Каталог игровых ассетов:
https://vesperfall.mengto.chatgpt.site/asset-catalog
This media is not supported in your browser
VIEW IN TELEGRAM
Я всё это смотреть не буду.
Теперь и не нужно — появился опенсорс скилл, который позволяет Claude разбирать видео по ссылке почти как человек.
Он работает с YouTube, Loom, TikTok, локальными файлами и всем, что поддерживает
yt-dlp.С его помощью агент может разобрать запуск конкурента по хукам, визуалу и структуре, найти баг по записи экрана, сделать краткое резюме длинного выступления с точными таймкодами или вытащить из продуктового видео только реальные изменения без маркетинга.
Под капотом
yt-dlp сначала забирает доступные субтитры, а ffmpeg извлекает кадры с учётом смены сцен, чтобы не тратить токены на десятки одинаковых изображений. Claude получает кадры с таймкодами, а если субтитров нет, подключается Groq Whisper.Для Claude Code:
/plugin marketplace add bradautomates/claude-video
/plugin install watch@claude-video
Для Codex, Cursor и Gemini CLI:
npx skills add bradautomates/claude-video -g
p.s. Для видео длиннее 10 минут лучше указывать нужный фрагмент через
--start и --end, иначе полный разбор может заметно расходовать токены.Please open Telegram to view this post
VIEW IN TELEGRAM
2
This media is not supported in your browser
VIEW IN TELEGRAM
А что, так можно было: существует браузер для ИИ-агентов и веб-скрейпинга, который не тащит за собой полноценный Chrome.
Пока обычный headless Chrome всё равно поднимает огромный браузерный стек ради страницы, которую никто не увидит, Lightpanda этот слой просто убирает.
Он написан с нуля на Zig, не является форком Chromium и, по заявлению авторов, работает в 11 раз быстрее и использует в 9 раз меньше памяти, чем Chrome в headless-режиме.
> установка одной командой через Docker
> работает с Playwright, Puppeteer и chromedp через CDP
> порт
У проекта уже 11,8 тыс. звёзд на GitHub.💪
Пока обычный headless Chrome всё равно поднимает огромный браузерный стек ради страницы, которую никто не увидит, Lightpanda этот слой просто убирает.
Он написан с нуля на Zig, не является форком Chromium и, по заявлению авторов, работает в 11 раз быстрее и использует в 9 раз меньше памяти, чем Chrome в headless-режиме.
> установка одной командой через Docker
> работает с Playwright, Puppeteer и chromedp через CDP
> порт
9222У проекта уже 11,8 тыс. звёзд на GitHub.
Please open Telegram to view this post
VIEW IN TELEGRAM