gonzo-обзоры ML статей
24.3K subscribers
3.75K photos
3 videos
3 files
1.69K links
Авторы:
Гриша Сапунов, ранее руководитель разработки Яндекс-Новостей, ныне CTO Intento. Области интересов: AI/ML/DL, биоинформатика.
Лёша Тихонов, ранее аналитик в Яндексе, автор Автопоэта, Нейронной Обороны... Области интересов: discrete domain, NLP, RL.
Download Telegram
Развитие темы про добавление памяти в различные архитектуры. В работе решают проблему ограниченного размера рекуррентного состояния в SSM-подобных моделях (здесь Gated DeltaNet) через увеличение этой памяти на несколько порядков одновременно с реализацией разреженных чтения и записи в неё. Мне кажется, это в каком-то смысле реимплементация старых добрых Neural Turing Machines (NTM) на новом субстрате. Теперь оно и скейлится неплохо.

Sparse Delta Memory: Scaling the State of Linear RNNs through Sparsity

Loïc Cabannes, Pierre-Emmanuel Mazaré, Gergely Szilvasy, Matthijs Douze, Maria Lomeli, Ilze Amanda Auzina, Justin Carpentier, Gabriel Synnaeve, Hervé Jégou
Paper: https://arxiv.org/abs/2607.07386
Review: https://arxiviq.substack.com/p/sparse-delta-memory-scaling-the-state
Code: https://github.com/facebookresearch/sparse-delta-memory
Model: N/A

# TL;DR

ЧТО сделали: Авторы представили Sparse Delta Memory (SDM) — новую архитектуру, которая кардинально увеличивает ёмкость рекуррентного состояния гейтированных линейных RNN. Вместо плотных (dense) обновлений матриц здесь используется разреженная схема адресации для чтения и записи. Это позволяет масштабировать скрытое состояние модели на три порядка при строгом сохранении количества FLOP (isoFLOP) и числа параметров на уровне базовых плотных моделей.

ПОЧЕМУ это важно: Классические трансформеры отлично справляются с извлечением информации из длинного контекста, но упираются в квадратичный и неограниченный рост KV-кэша. Линейные RNN и модели в пространствах состояний (SSM) требуют фиксированных вычислений на токен, но ограничены в ёмкости состояния, что сильно ухудшает recall. SDM разрешает этот компромисс, обеспечивая неизменную сложность вычислений при инференсе на последовательностях до 1 миллиона токенов и значительно превосходя плотные архитектуры на длинном контексте.

Для практиков: SDM позволяет обрабатывать сверхдлинные контексты без раздувания KV-кэша на GPU, сохраняя постоянную скорость декодирования. Модель обучили эффективно благодаря кастомным CUDA-кернелам и оптимизированному бэкпропу, который сжимает пиковую память состояния с 226 ГБ до всего 8 ГБ без потери качества.

Добавлять большую память тут: https://t.me/gonzo_ML_podcasts/4472
👍71🤔1
Forwarded from gonzo_ML_podcasts
👍3🥰1
В комнату входит состязательная психометрика. Забавно, что "персоны" моделей существенно разные — Клод кооперативен, а GPT склонна к обману.

Measuring Intelligence Beyond Human Scale
Jerry Han, Rafael Moschopoulos, Ella Colby, Vishrut Goyal, Andrew Tu, Kia Ghods, Mark Braverman, Elad Hazan / Princeton Superalignment
Paper: https://arxiv.org/abs/2607.07040
Review: https://arxiviq.substack.com/p/measuring-intelligence-beyond-human
Code: N/A
Model: N/A

# TL;DR

ЧТО сделали: Авторы представили SepaRank — теоретико-игровой фреймворк для оценки моделей, основанный на «состязательной психометрике». Вместо статичных бенчмарков, созданных людьми, модели оцениваются в двойных ролях: как авторы задач (пропозеры) и как их решатели (солверы). Пропозеры получают награду за генерацию публичных бинарных вопросов, которые максимизируют дисперсию (несогласие) в ответах пула моделей-солверов, в то время как солверы оцениваются по точности ответов с помощью Brier loss.

ПОЧЕМУ это важно: Когда возможности ИИ приближаются к уровню людей-экспертов и превосходят его, традиционные абсолютные бенчмарки быстро насыщаются. При этом людям-экспертам становится всё труднее придумывать или проверять сложные, дискриминирующие вопросы. Переходя от абсолютной оценки к относительной (по принципу «один ко многим»), SepaRank создаёт автоматический, самомасштабируемый лидерборд без участия судей. Он естественным образом нейтрализует популярные стратегии обхода правил, такие как запросы к скрытому состоянию или алгоритмические лазейки.

Для практиков: Для технических лидеров и исследователей ИИ эта работа предлагает сдвиг парадигмы (всё как мы любим!) в оценке LLM. Она доказывает, что мы можем надёжно ранжировать сверхчеловеческие системы, позволяя им самим нащупывать и вскрывать границы возможностей друг друга. Такое динамическое взаимодействие не только решает проблему насыщения бенчмарков, но и генерирует поток сложных out-of-distribution данных для обучения, которые можно напрямую использовать в RLHF и циклах пост-тренинга.

Состязательно измерять психов здесь: https://t.me/gonzo_ML_podcasts/4484
👍12🔥7💯1
Forwarded from gonzo_ML_podcasts
🔥3👍1
Большие модели — это, конечно, классно, но это удел избранных. Нам, простым смертным, нужно что-то разумного размера, но способное работать с задачами на длинных горизонтах.

Scaling the Horizon, Not the Parameters: Reaching Trillion-Parameter Performance with a 35B Agent
Agents-A1 Team, Shanghai Artificial Intelligence Laboratory
Paper: https://arxiv.org/abs/2606.30616
Review: https://arxiviq.substack.com/p/scaling-the-horizon-not-the-parameters
Code: https://github.com/InternScience/Agents-A1
Model: https://huggingface.co/InternScience/Agents-A1

# TL;DR

ЧТО сделали: Авторы представили Agents-A1 — агентную MoE-модель на 35 миллиардов параметров (35B), обученную выполнять сложные многошаговые действия со средней длиной контекста в 45 тысяч токенов. Обучение проходило в три этапа: полнодоменный SFT-файнтюнинг, RL-обучение учителей на уровне отдельных доменов и on-policy дистилляция от нескольких учителей с динамической маршрутизацией, объединившая специализированные навыки без конфликта градиентов.

ПОЧЕМУ это важно: Исследование доказывает, что масштабирование горизонта принятия решений с использованием структурированной обратной связи на уровне процессов — это жизнеспособная альтернатива простому увеличению числа параметров. Явное моделирование переходов состояний агента и дистилляция нескольких специализированных учителей позволяют легковесной 35B модели не уступать триллионным проприетарным гигантам на сложных задачах с длинным контекстом.

Для практиков: Авторы делятся рецептом, как объединить противоречивые паттерны поведения (например, долгое рассуждение в один ход и короткие интерактивные вызовы инструментов) через сопоставление выходов учителей на усечённом словаре (Salient Vocabulary Alignment, SVA) и доменно-нормализованную функцию потерь (лосс).

Дистиллировать учителей здесь: https://t.me/gonzo_ML_podcasts/4496
👍121😁1
Forwarded from gonzo_ML_podcasts
👍2😁2
Just in case, я неожиданно стал соорганизатором конференции Superintelligence Conference (SiC26), которая пройдёт в этом году 9-11 сентября в Университете Экзетера, в UK. Дедлайн на подачу статей расширен до 3 августа, так что если вам есть что сказать по этой теме, не стесняйтесь отправить свой сабмишн :)

Подробности call for papers тут: https://www.superintelligenceconference.org/call-for-papers
🔥30🎉3👍1🍓1👀1
Улучшенный зацикленный трансформер с латентным ризонингом, который теперь работает для языковой модели размером 3B и не теряет в качестве по сравнению с обычным текстовым CoT. И при этом быстрее в несколько раз.

Сочетание universal transformer (шаренные веса и сильно уменьшенный memory footprint по сравнению с полным трансформером) и латентного ризонинга (более быстрая генерация, поскольку обходим бутылочное горлышко токенизации, а тут ещё и параллелим процесс) — это сильное комбо.

Bridging the Gap Between Latent and Explicit Reasoning with Looped Transformers

Ying Fan, Anej Svete, Kangwook Lee
Paper: https://arxiv.org/abs/2606.31779
Review: https://arxiviq.substack.com/p/bridging-the-gap-between-latent-and
Code: https://github.com/yingfan-bot/lotus
Model: N/A

# TL;DR

ЧТО сделали: Авторы представляют LOTUS (Looped Transformers with parallel supervision on latents) — новый фреймворк для латентных рассуждений. Он проецирует последовательные шаги цепочки рассуждений (CoT) в непрерывные латентные блоки, которые обрабатываются параллельно с помощью циклической (looped) архитектуры трансформера с разделяемыми весами. В отличие от предыдущих латентных методов, страдающих от дрейфа репрезентаций и бутылочного горлышка последовательной генерации, LOTUS использует параллельный прямой надзор (supervision) на уровне токенов через собственную голову языкового моделирования базовой модели.

ПОЧЕМУ это важно: Хотя явные цепочки рассуждений (explicit CoT) обеспечивают высокую точность, их последовательная генерация токен за токеном работает медленно и требует больших вычислительных ресурсов. LOTUS — это первый метод латентных рассуждений, который успешно преодолел разрыв в качестве по сравнению с явным CoT на масштабе моделей в 3B параметров. Он сохраняет точность, обеспечивая ускорение фазы размышлений в 2.5–6.9 раза, предлагая эффективную альтернативу для масштабирования вычислений на этапе инференса (test-time compute).

Для практиков: LOTUS позволяет перенести «мыслительный процесс» LLM в скрытые состояния без потери качества и значительно ускорить инференс на GPU (особенно на фазе генерации рассуждений), избавляя от необходимости дорогого последовательного авторегрессионного декодирования длинных CoT-цепочек.

Крутить латенты тут: https://t.me/gonzo_ML_podcasts/4511
👍6