Развитие темы про добавление памяти в различные архитектуры. В работе решают проблему ограниченного размера рекуррентного состояния в SSM-подобных моделях (здесь Gated DeltaNet) через увеличение этой памяти на несколько порядков одновременно с реализацией разреженных чтения и записи в неё. Мне кажется, это в каком-то смысле реимплементация старых добрых Neural Turing Machines (NTM) на новом субстрате. Теперь оно и скейлится неплохо.
Sparse Delta Memory: Scaling the State of Linear RNNs through Sparsity
Loïc Cabannes, Pierre-Emmanuel Mazaré, Gergely Szilvasy, Matthijs Douze, Maria Lomeli, Ilze Amanda Auzina, Justin Carpentier, Gabriel Synnaeve, Hervé Jégou
Paper: https://arxiv.org/abs/2607.07386
Review: https://arxiviq.substack.com/p/sparse-delta-memory-scaling-the-state
Code: https://github.com/facebookresearch/sparse-delta-memory
Model: N/A
# TL;DR
ЧТО сделали: Авторы представили Sparse Delta Memory (SDM) — новую архитектуру, которая кардинально увеличивает ёмкость рекуррентного состояния гейтированных линейных RNN. Вместо плотных (dense) обновлений матриц здесь используется разреженная схема адресации для чтения и записи. Это позволяет масштабировать скрытое состояние модели на три порядка при строгом сохранении количества FLOP (isoFLOP) и числа параметров на уровне базовых плотных моделей.
ПОЧЕМУ это важно: Классические трансформеры отлично справляются с извлечением информации из длинного контекста, но упираются в квадратичный и неограниченный рост KV-кэша. Линейные RNN и модели в пространствах состояний (SSM) требуют фиксированных вычислений на токен, но ограничены в ёмкости состояния, что сильно ухудшает recall. SDM разрешает этот компромисс, обеспечивая неизменную сложность вычислений при инференсе на последовательностях до 1 миллиона токенов и значительно превосходя плотные архитектуры на длинном контексте.
Для практиков: SDM позволяет обрабатывать сверхдлинные контексты без раздувания KV-кэша на GPU, сохраняя постоянную скорость декодирования. Модель обучили эффективно благодаря кастомным CUDA-кернелам и оптимизированному бэкпропу, который сжимает пиковую память состояния с 226 ГБ до всего 8 ГБ без потери качества.
Добавлять большую память тут: https://t.me/gonzo_ML_podcasts/4472
Sparse Delta Memory: Scaling the State of Linear RNNs through Sparsity
Loïc Cabannes, Pierre-Emmanuel Mazaré, Gergely Szilvasy, Matthijs Douze, Maria Lomeli, Ilze Amanda Auzina, Justin Carpentier, Gabriel Synnaeve, Hervé Jégou
Paper: https://arxiv.org/abs/2607.07386
Review: https://arxiviq.substack.com/p/sparse-delta-memory-scaling-the-state
Code: https://github.com/facebookresearch/sparse-delta-memory
Model: N/A
# TL;DR
ЧТО сделали: Авторы представили Sparse Delta Memory (SDM) — новую архитектуру, которая кардинально увеличивает ёмкость рекуррентного состояния гейтированных линейных RNN. Вместо плотных (dense) обновлений матриц здесь используется разреженная схема адресации для чтения и записи. Это позволяет масштабировать скрытое состояние модели на три порядка при строгом сохранении количества FLOP (isoFLOP) и числа параметров на уровне базовых плотных моделей.
ПОЧЕМУ это важно: Классические трансформеры отлично справляются с извлечением информации из длинного контекста, но упираются в квадратичный и неограниченный рост KV-кэша. Линейные RNN и модели в пространствах состояний (SSM) требуют фиксированных вычислений на токен, но ограничены в ёмкости состояния, что сильно ухудшает recall. SDM разрешает этот компромисс, обеспечивая неизменную сложность вычислений при инференсе на последовательностях до 1 миллиона токенов и значительно превосходя плотные архитектуры на длинном контексте.
Для практиков: SDM позволяет обрабатывать сверхдлинные контексты без раздувания KV-кэша на GPU, сохраняя постоянную скорость декодирования. Модель обучили эффективно благодаря кастомным CUDA-кернелам и оптимизированному бэкпропу, который сжимает пиковую память состояния с 226 ГБ до всего 8 ГБ без потери качества.
Добавлять большую память тут: https://t.me/gonzo_ML_podcasts/4472
arXiv.org
Sparse Delta Memory: Scaling the State of Linear RNNs through Sparsity
Linear attention models allow a fixed state size and a fixed amount of compute per token. However, due to their limited state size, linear attention models fall behind in long-context recall...
👍7❤1🤔1
В комнату входит состязательная психометрика. Забавно, что "персоны" моделей существенно разные — Клод кооперативен, а GPT склонна к обману.
Measuring Intelligence Beyond Human Scale
Jerry Han, Rafael Moschopoulos, Ella Colby, Vishrut Goyal, Andrew Tu, Kia Ghods, Mark Braverman, Elad Hazan / Princeton Superalignment
Paper: https://arxiv.org/abs/2607.07040
Review: https://arxiviq.substack.com/p/measuring-intelligence-beyond-human
Code: N/A
Model: N/A
# TL;DR
ЧТО сделали: Авторы представили SepaRank — теоретико-игровой фреймворк для оценки моделей, основанный на «состязательной психометрике». Вместо статичных бенчмарков, созданных людьми, модели оцениваются в двойных ролях: как авторы задач (пропозеры) и как их решатели (солверы). Пропозеры получают награду за генерацию публичных бинарных вопросов, которые максимизируют дисперсию (несогласие) в ответах пула моделей-солверов, в то время как солверы оцениваются по точности ответов с помощью Brier loss.
ПОЧЕМУ это важно: Когда возможности ИИ приближаются к уровню людей-экспертов и превосходят его, традиционные абсолютные бенчмарки быстро насыщаются. При этом людям-экспертам становится всё труднее придумывать или проверять сложные, дискриминирующие вопросы. Переходя от абсолютной оценки к относительной (по принципу «один ко многим»), SepaRank создаёт автоматический, самомасштабируемый лидерборд без участия судей. Он естественным образом нейтрализует популярные стратегии обхода правил, такие как запросы к скрытому состоянию или алгоритмические лазейки.
Для практиков: Для технических лидеров и исследователей ИИ эта работа предлагает сдвиг парадигмы (всё как мы любим!) в оценке LLM. Она доказывает, что мы можем надёжно ранжировать сверхчеловеческие системы, позволяя им самим нащупывать и вскрывать границы возможностей друг друга. Такое динамическое взаимодействие не только решает проблему насыщения бенчмарков, но и генерирует поток сложных out-of-distribution данных для обучения, которые можно напрямую использовать в RLHF и циклах пост-тренинга.
Состязательно измерять психов здесь: https://t.me/gonzo_ML_podcasts/4484
Measuring Intelligence Beyond Human Scale
Jerry Han, Rafael Moschopoulos, Ella Colby, Vishrut Goyal, Andrew Tu, Kia Ghods, Mark Braverman, Elad Hazan / Princeton Superalignment
Paper: https://arxiv.org/abs/2607.07040
Review: https://arxiviq.substack.com/p/measuring-intelligence-beyond-human
Code: N/A
Model: N/A
# TL;DR
ЧТО сделали: Авторы представили SepaRank — теоретико-игровой фреймворк для оценки моделей, основанный на «состязательной психометрике». Вместо статичных бенчмарков, созданных людьми, модели оцениваются в двойных ролях: как авторы задач (пропозеры) и как их решатели (солверы). Пропозеры получают награду за генерацию публичных бинарных вопросов, которые максимизируют дисперсию (несогласие) в ответах пула моделей-солверов, в то время как солверы оцениваются по точности ответов с помощью Brier loss.
ПОЧЕМУ это важно: Когда возможности ИИ приближаются к уровню людей-экспертов и превосходят его, традиционные абсолютные бенчмарки быстро насыщаются. При этом людям-экспертам становится всё труднее придумывать или проверять сложные, дискриминирующие вопросы. Переходя от абсолютной оценки к относительной (по принципу «один ко многим»), SepaRank создаёт автоматический, самомасштабируемый лидерборд без участия судей. Он естественным образом нейтрализует популярные стратегии обхода правил, такие как запросы к скрытому состоянию или алгоритмические лазейки.
Для практиков: Для технических лидеров и исследователей ИИ эта работа предлагает сдвиг парадигмы (всё как мы любим!) в оценке LLM. Она доказывает, что мы можем надёжно ранжировать сверхчеловеческие системы, позволяя им самим нащупывать и вскрывать границы возможностей друг друга. Такое динамическое взаимодействие не только решает проблему насыщения бенчмарков, но и генерирует поток сложных out-of-distribution данных для обучения, которые можно напрямую использовать в RLHF и циклах пост-тренинга.
Состязательно измерять психов здесь: https://t.me/gonzo_ML_podcasts/4484
arXiv.org
Measuring Intelligence Beyond Human Scale
How can we measure intelligence beyond human capability?
Human-authored benchmarks saturate, and above human capability, examiners may not know which tasks are both hard and verifiable. We argue...
Human-authored benchmarks saturate, and above human capability, examiners may not know which tasks are both hard and verifiable. We argue...
👍12🔥7💯1
Большие модели — это, конечно, классно, но это удел избранных. Нам, простым смертным, нужно что-то разумного размера, но способное работать с задачами на длинных горизонтах.
Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent
Agents-A1 Team, Shanghai Artificial Intelligence Laboratory
Paper: https://arxiv.org/abs/2606.30616
Review: https://arxiviq.substack.com/p/scaling-the-horizon-not-the-parameters
Code: https://github.com/InternScience/Agents-A1
Model: https://huggingface.co/InternScience/Agents-A1
# TL;DR
ЧТО сделали: Авторы представили Agents-A1 — агентную MoE-модель на 35 миллиардов параметров (35B), обученную выполнять сложные многошаговые действия со средней длиной контекста в 45 тысяч токенов. Обучение проходило в три этапа: полнодоменный SFT-файнтюнинг, RL-обучение учителей на уровне отдельных доменов и on-policy дистилляция от нескольких учителей с динамической маршрутизацией, объединившая специализированные навыки без конфликта градиентов.
ПОЧЕМУ это важно: Исследование доказывает, что масштабирование горизонта принятия решений с использованием структурированной обратной связи на уровне процессов — это жизнеспособная альтернатива простому увеличению числа параметров. Явное моделирование переходов состояний агента и дистилляция нескольких специализированных учителей позволяют легковесной 35B модели не уступать триллионным проприетарным гигантам на сложных задачах с длинным контекстом.
Для практиков: Авторы делятся рецептом, как объединить противоречивые паттерны поведения (например, долгое рассуждение в один ход и короткие интерактивные вызовы инструментов) через сопоставление выходов учителей на усечённом словаре (Salient Vocabulary Alignment, SVA) и доменно-нормализованную функцию потерь (лосс).
Дистиллировать учителей здесь: https://t.me/gonzo_ML_podcasts/4496
Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent
Agents-A1 Team, Shanghai Artificial Intelligence Laboratory
Paper: https://arxiv.org/abs/2606.30616
Review: https://arxiviq.substack.com/p/scaling-the-horizon-not-the-parameters
Code: https://github.com/InternScience/Agents-A1
Model: https://huggingface.co/InternScience/Agents-A1
# TL;DR
ЧТО сделали: Авторы представили Agents-A1 — агентную MoE-модель на 35 миллиардов параметров (35B), обученную выполнять сложные многошаговые действия со средней длиной контекста в 45 тысяч токенов. Обучение проходило в три этапа: полнодоменный SFT-файнтюнинг, RL-обучение учителей на уровне отдельных доменов и on-policy дистилляция от нескольких учителей с динамической маршрутизацией, объединившая специализированные навыки без конфликта градиентов.
ПОЧЕМУ это важно: Исследование доказывает, что масштабирование горизонта принятия решений с использованием структурированной обратной связи на уровне процессов — это жизнеспособная альтернатива простому увеличению числа параметров. Явное моделирование переходов состояний агента и дистилляция нескольких специализированных учителей позволяют легковесной 35B модели не уступать триллионным проприетарным гигантам на сложных задачах с длинным контекстом.
Для практиков: Авторы делятся рецептом, как объединить противоречивые паттерны поведения (например, долгое рассуждение в один ход и короткие интерактивные вызовы инструментов) через сопоставление выходов учителей на усечённом словаре (Salient Vocabulary Alignment, SVA) и доменно-нормализованную функцию потерь (лосс).
Дистиллировать учителей здесь: https://t.me/gonzo_ML_podcasts/4496
arXiv.org
Scaling the Horizon, Not the Parameters: Reaching...
We introduce Agents-A1, a 35B Mixture-of-Experts Agentic Model that reaches trillion-parameter-level performance by scaling the agent horizon. We investigate agent-horizon scaling from two...
👍12❤1😁1
Just in case, я неожиданно стал соорганизатором конференции Superintelligence Conference (SiC26), которая пройдёт в этом году 9-11 сентября в Университете Экзетера, в UK. Дедлайн на подачу статей расширен до 3 августа, так что если вам есть что сказать по этой теме, не стесняйтесь отправить свой сабмишн :)
Подробности call for papers тут: https://www.superintelligenceconference.org/call-for-papers
Подробности call for papers тут: https://www.superintelligenceconference.org/call-for-papers
www.superintelligenceconference.org
Superintelligence Conference
9th-11th September 2026
University of Exeter, UK
Shape the Future of Superintelligence, AI and Society
University of Exeter, UK
Shape the Future of Superintelligence, AI and Society
🔥30🎉3👍1🍓1👀1
Улучшенный зацикленный трансформер с латентным ризонингом, который теперь работает для языковой модели размером 3B и не теряет в качестве по сравнению с обычным текстовым CoT. И при этом быстрее в несколько раз.
Сочетание universal transformer (шаренные веса и сильно уменьшенный memory footprint по сравнению с полным трансформером) и латентного ризонинга (более быстрая генерация, поскольку обходим бутылочное горлышко токенизации, а тут ещё и параллелим процесс) — это сильное комбо.
Bridging the Gap Between Latent and Explicit Reasoning with Looped Transformers
Ying Fan, Anej Svete, Kangwook Lee
Paper: https://arxiv.org/abs/2606.31779
Review: https://arxiviq.substack.com/p/bridging-the-gap-between-latent-and
Code: https://github.com/yingfan-bot/lotus
Model: N/A
# TL;DR
ЧТО сделали: Авторы представляют LOTUS (Looped Transformers with parallel supervision on latents) — новый фреймворк для латентных рассуждений. Он проецирует последовательные шаги цепочки рассуждений (CoT) в непрерывные латентные блоки, которые обрабатываются параллельно с помощью циклической (looped) архитектуры трансформера с разделяемыми весами. В отличие от предыдущих латентных методов, страдающих от дрейфа репрезентаций и бутылочного горлышка последовательной генерации, LOTUS использует параллельный прямой надзор (supervision) на уровне токенов через собственную голову языкового моделирования базовой модели.
ПОЧЕМУ это важно: Хотя явные цепочки рассуждений (explicit CoT) обеспечивают высокую точность, их последовательная генерация токен за токеном работает медленно и требует больших вычислительных ресурсов. LOTUS — это первый метод латентных рассуждений, который успешно преодолел разрыв в качестве по сравнению с явным CoT на масштабе моделей в 3B параметров. Он сохраняет точность, обеспечивая ускорение фазы размышлений в 2.5–6.9 раза, предлагая эффективную альтернативу для масштабирования вычислений на этапе инференса (test-time compute).
Для практиков: LOTUS позволяет перенести «мыслительный процесс» LLM в скрытые состояния без потери качества и значительно ускорить инференс на GPU (особенно на фазе генерации рассуждений), избавляя от необходимости дорогого последовательного авторегрессионного декодирования длинных CoT-цепочек.
Крутить латенты тут: https://t.me/gonzo_ML_podcasts/4511
Сочетание universal transformer (шаренные веса и сильно уменьшенный memory footprint по сравнению с полным трансформером) и латентного ризонинга (более быстрая генерация, поскольку обходим бутылочное горлышко токенизации, а тут ещё и параллелим процесс) — это сильное комбо.
Bridging the Gap Between Latent and Explicit Reasoning with Looped Transformers
Ying Fan, Anej Svete, Kangwook Lee
Paper: https://arxiv.org/abs/2606.31779
Review: https://arxiviq.substack.com/p/bridging-the-gap-between-latent-and
Code: https://github.com/yingfan-bot/lotus
Model: N/A
# TL;DR
ЧТО сделали: Авторы представляют LOTUS (Looped Transformers with parallel supervision on latents) — новый фреймворк для латентных рассуждений. Он проецирует последовательные шаги цепочки рассуждений (CoT) в непрерывные латентные блоки, которые обрабатываются параллельно с помощью циклической (looped) архитектуры трансформера с разделяемыми весами. В отличие от предыдущих латентных методов, страдающих от дрейфа репрезентаций и бутылочного горлышка последовательной генерации, LOTUS использует параллельный прямой надзор (supervision) на уровне токенов через собственную голову языкового моделирования базовой модели.
ПОЧЕМУ это важно: Хотя явные цепочки рассуждений (explicit CoT) обеспечивают высокую точность, их последовательная генерация токен за токеном работает медленно и требует больших вычислительных ресурсов. LOTUS — это первый метод латентных рассуждений, который успешно преодолел разрыв в качестве по сравнению с явным CoT на масштабе моделей в 3B параметров. Он сохраняет точность, обеспечивая ускорение фазы размышлений в 2.5–6.9 раза, предлагая эффективную альтернативу для масштабирования вычислений на этапе инференса (test-time compute).
Для практиков: LOTUS позволяет перенести «мыслительный процесс» LLM в скрытые состояния без потери качества и значительно ускорить инференс на GPU (особенно на фазе генерации рассуждений), избавляя от необходимости дорогого последовательного авторегрессионного декодирования длинных CoT-цепочек.
Крутить латенты тут: https://t.me/gonzo_ML_podcasts/4511
arXiv.org
Bridging the Gap Between Latent and Explicit Reasoning with Looped...
Language models typically reason via explicit chain-of-thought (CoT), generating intermediate steps token-by-token. Latent CoT offers an alternative: it performs multi-step reasoning in the...
👍6