Do Transformers Need Three Projections? Systematic Study of QKV Variants
Нужны ли трансформерам три проекции? Систематическое исследование вариантов QKV
https://www.alphaxiv.org/overview/2606.04032
Исследователи систематически оценивали варианты проекций QKV самовнимания трансформера, обнаружив, что объединение проекций Ключа и Значения (Q-K=V) сокращает память кеша KV на 50%. Этот подход сохраняет качество модели с ухудшением перплексии на 2.48% для моделей с 1.2 млрд параметров и средней потерей точности в последующих задачах на 0.41%, что позволяет удвоить объем окна контекста или пропускную способность во время инференса.
Нужны ли трансформерам три проекции? Систематическое исследование вариантов QKV
https://www.alphaxiv.org/overview/2606.04032
Исследователи систематически оценивали варианты проекций QKV самовнимания трансформера, обнаружив, что объединение проекций Ключа и Значения (Q-K=V) сокращает память кеша KV на 50%. Этот подход сохраняет качество модели с ухудшением перплексии на 2.48% для моделей с 1.2 млрд параметров и средней потерей точности в последующих задачах на 0.41%, что позволяет удвоить объем окна контекста или пропускную способность во время инференса.
Forget Attention: Importance-Aware Attention Is All You Need
Забудьте о внимании: внимание, учитывающее важность — это все, что вам нужно
https://www.alphaxiv.org/overview/2606.02332
SISA (внимание Softmax, информированное SSM) интегрирует сигналы последовательной важности, полученные из моделей пространств состояний, непосредственно в оценку внимания, обеспечивая глобальный поиск с учетом контекстного взвешивания. При 152 миллионах параметров она достигла 17,3% на LAMBADA, превзойдя Трансформеры на 3,4 процентных пункта, и сохранила 100% точность NIAH, сходясь в семь раз быстрее.
———
Гибридизация Softmax Attention и SSM на уровне оценок. Оценка важности токена, полученная от SSM, непосредственно добавляется к оценке внимания от запроса-ключа. Демонстрирует быструю обучаемость и 100% точности в задаче "Иголка в стоге сена".
Забудьте о внимании: внимание, учитывающее важность — это все, что вам нужно
https://www.alphaxiv.org/overview/2606.02332
SISA (внимание Softmax, информированное SSM) интегрирует сигналы последовательной важности, полученные из моделей пространств состояний, непосредственно в оценку внимания, обеспечивая глобальный поиск с учетом контекстного взвешивания. При 152 миллионах параметров она достигла 17,3% на LAMBADA, превзойдя Трансформеры на 3,4 процентных пункта, и сохранила 100% точность NIAH, сходясь в семь раз быстрее.
———
Гибридизация Softmax Attention и SSM на уровне оценок. Оценка важности токена, полученная от SSM, непосредственно добавляется к оценке внимания от запроса-ключа. Демонстрирует быструю обучаемость и 100% точности в задаче "Иголка в стоге сена".
🔥2
Pretraining Recurrent Networks without Recurrence
Предварительное обучение рекуррентных сетей без рекуррентности
https://www.alphaxiv.org/overview/2606.06479
Supervised Memory Training (SMT) обеспечивает параллельное во времени обучение нелинейных рекуррентных нейронных сетей (RNN) путем формулирования переходов памяти как задачи обучения с учителем, где "учитель"-Трансформер предоставляет оптимальные состояния памяти. Этот метод преодолевает ограничения традиционного обратного распространения ошибки во времени (BPTT), позволяя RNN эффективно изучать долгосрочные зависимости и достигать высокой производительности в различных задачах моделирования последовательностей с инференсом фиксированной памяти.
———
Трансформер обучает рекуррентную сеть. Энкодер-декодер трансформер обучается сжимать контекст в скрытое состояние фиксированного размера, а RNN – предсказывать по нему состояние на следующем шаге. Архитектура позволяет избавиться от BPTT.
Предварительное обучение рекуррентных сетей без рекуррентности
https://www.alphaxiv.org/overview/2606.06479
Supervised Memory Training (SMT) обеспечивает параллельное во времени обучение нелинейных рекуррентных нейронных сетей (RNN) путем формулирования переходов памяти как задачи обучения с учителем, где "учитель"-Трансформер предоставляет оптимальные состояния памяти. Этот метод преодолевает ограничения традиционного обратного распространения ошибки во времени (BPTT), позволяя RNN эффективно изучать долгосрочные зависимости и достигать высокой производительности в различных задачах моделирования последовательностей с инференсом фиксированной памяти.
———
Трансформер обучает рекуррентную сеть. Энкодер-декодер трансформер обучается сжимать контекст в скрытое состояние фиксированного размера, а RNN – предсказывать по нему состояние на следующем шаге. Архитектура позволяет избавиться от BPTT.
Trajectory Geometry of Transformer Representations Across Layers
Траекторная геометрия представлений трансформера по слоям
https://www.alphaxiv.org/overview/2606.09287
https://github.com/Vishal-sys-code/latent-trajectories
В этой работе представлена траекторно-геометрическая основа для анализа того, как представления трансформеров развиваются по слоям, вводя метрики, не требующие зондирования, для характеристики их многомерных путей. Исследование выявляет отдельные вычислительные фазы, чувствительные к задаче геометрии путей и динамику прогрессивной деамбигуации в пространстве скрытых состояний.
———
Вводятся метрики для траектории в d-мерном пространстве модели из последовательности скрытых состояний. Метрики показывают что средние слои – это место, где модель выполняет основную часть «формирования концепций» и на которых происходит наиболее интенсивная обработка рассуждений. У двусмысленных слов пути представлений расходятся в зависимости от контекста.
Измеряя послойное косинусное сходство, исследователи выявили согласованную трехфазную структуру в прямом проходе трансформера.
Траекторная геометрия представлений трансформера по слоям
https://www.alphaxiv.org/overview/2606.09287
https://github.com/Vishal-sys-code/latent-trajectories
В этой работе представлена траекторно-геометрическая основа для анализа того, как представления трансформеров развиваются по слоям, вводя метрики, не требующие зондирования, для характеристики их многомерных путей. Исследование выявляет отдельные вычислительные фазы, чувствительные к задаче геометрии путей и динамику прогрессивной деамбигуации в пространстве скрытых состояний.
———
Вводятся метрики для траектории в d-мерном пространстве модели из последовательности скрытых состояний. Метрики показывают что средние слои – это место, где модель выполняет основную часть «формирования концепций» и на которых происходит наиболее интенсивная обработка рассуждений. У двусмысленных слов пути представлений расходятся в зависимости от контекста.
Измеряя послойное косинусное сходство, исследователи выявили согласованную трехфазную структуру в прямом проходе трансформера.
Continual LLM Upcycling: A Predictor-Gated Bank-Wise Sparsity Training Recipe for Dense-to-Sparse LLMs
Непрерывный апсайклинг LLM: Рецепт обучения побанковой разреженности с предикторным шлюзом для плотно-разреженных LLM
https://www.alphaxiv.org/overview/2606.10722
Исследователи представляют метод непрерывного обучения от плотного к разреженному, который преобразует существующие большие языковые модели в архитектуры с разреженностью по каналам с помощью Feed-Forward сети с предиктивным управлением. Этот подход достигает 4-кратного сокращения активной промежуточной ширины FFN, при этом в значительной степени сохраняя производительность на различных бенчмарках и превосходя наивные методы разреженности.
———
Преобразование предварительно обученной плотной LLM в канально-разреженную, сокращающее вычислительную нагрузку FFN в четыре раза. Подход активирует только определённое подмножество нейронов промежуточной размерности FFN (SwiGLU), генерируя разреженную маску.
Непрерывный апсайклинг LLM: Рецепт обучения побанковой разреженности с предикторным шлюзом для плотно-разреженных LLM
https://www.alphaxiv.org/overview/2606.10722
Исследователи представляют метод непрерывного обучения от плотного к разреженному, который преобразует существующие большие языковые модели в архитектуры с разреженностью по каналам с помощью Feed-Forward сети с предиктивным управлением. Этот подход достигает 4-кратного сокращения активной промежуточной ширины FFN, при этом в значительной степени сохраняя производительность на различных бенчмарках и превосходя наивные методы разреженности.
———
Преобразование предварительно обученной плотной LLM в канально-разреженную, сокращающее вычислительную нагрузку FFN в четыре раза. Подход активирует только определённое подмножество нейронов промежуточной размерности FFN (SwiGLU), генерируя разреженную маску.
SpikeDecoder: Realizing the GPT Architecture with Spiking Neural Networks
SpikeDecoder: Реализация архитектуры GPT с помощью спайковых нейронных сетей
https://www.alphaxiv.org/overview/2606.12287
https://github.com/ClaasBeger/SpikeDecoder
Исследователи из Технического университета Мюнхена представляют SpikeDecoder – напрямую обучаемый, полностью спайковый Transformer-декодер для обработки естественного языка, демонстрирующий точность предсказания на уровне символов при достижении расчетного снижения теоретического энергопотребления на 86,7%–92,3% по сравнению с его неспайковым аналогом.
———
Полностью спайковая LLM (внимание, MLP, голова трансформера) на LIF-нейронах, но для того, чтобы соответствовать качеству непрерывной модели, авторам пришлось расплатиться двойным увеличением числа параметров, удвоив количество блоков. Интересно, что лучший результат получился с одной головой внимания.
SpikeDecoder: Реализация архитектуры GPT с помощью спайковых нейронных сетей
https://www.alphaxiv.org/overview/2606.12287
https://github.com/ClaasBeger/SpikeDecoder
Исследователи из Технического университета Мюнхена представляют SpikeDecoder – напрямую обучаемый, полностью спайковый Transformer-декодер для обработки естественного языка, демонстрирующий точность предсказания на уровне символов при достижении расчетного снижения теоретического энергопотребления на 86,7%–92,3% по сравнению с его неспайковым аналогом.
———
Полностью спайковая LLM (внимание, MLP, голова трансформера) на LIF-нейронах, но для того, чтобы соответствовать качеству непрерывной модели, авторам пришлось расплатиться двойным увеличением числа параметров, удвоив количество блоков. Интересно, что лучший результат получился с одной головой внимания.
🔥1
NeuralGrok: Accelerate Grokking by Neural Gradient Transformation
NeuralGrok: Ускорение грокинга путем нейронной градиентной трансформации
https://www.alphaxiv.org/overview/2504.17243
https://github.com/Blackzxy/NeuralOptGrok
NEURALGROK представляет двухуровневую оптимизационную структуру с обучаемым нейронным усилителем для преобразования градиентов, тем самым ускоряя фазу обобщения нейронных сетей, демонстрирующих "грокинг". Этот метод позволил достичь до 4,67-кратного ускорения обобщения на сложных арифметических задачах и обеспечил более стабильные результаты обучения по сравнению с существующими подходами.
———
Нейронный усилитель – это отдельный MLP со своим циклом обучений, который преобразует градиент базовой модели перед её апдейтом. Цель усилителя состоит в том, чтобы преобразовать градиенты таким образом, чтобы результирующее обновление базовой модели минимизировало потери на валидационном наборе.
Другим вкладом этой статьи является введение метрики Absolute Gradient Entropy (AGE) для понимания причин возникновения грокинга.
NeuralGrok: Ускорение грокинга путем нейронной градиентной трансформации
https://www.alphaxiv.org/overview/2504.17243
https://github.com/Blackzxy/NeuralOptGrok
NEURALGROK представляет двухуровневую оптимизационную структуру с обучаемым нейронным усилителем для преобразования градиентов, тем самым ускоряя фазу обобщения нейронных сетей, демонстрирующих "грокинг". Этот метод позволил достичь до 4,67-кратного ускорения обобщения на сложных арифметических задачах и обеспечил более стабильные результаты обучения по сравнению с существующими подходами.
———
Нейронный усилитель – это отдельный MLP со своим циклом обучений, который преобразует градиент базовой модели перед её апдейтом. Цель усилителя состоит в том, чтобы преобразовать градиенты таким образом, чтобы результирующее обновление базовой модели минимизировало потери на валидационном наборе.
Другим вкладом этой статьи является введение метрики Absolute Gradient Entropy (AGE) для понимания причин возникновения грокинга.
👍1
Хотдог — не хотдог
Поизучал главные компоненты в синтетических данных нескольких категорий. Пытаюсь понять как self-attention может имитировать PCA и использовать его. Так вот выглядит так, что не хотдог классифицировать проще – точки других классов лежат компактно (рис. 1).
Проекции данных сторонних классов на главные компоненты целевой категории похожи на статичные векторы (рис. 2). То есть, просто по дисперсии каналов проекций на главные компоненты видно к какому классу принадлежат данные.
Поизучал главные компоненты в синтетических данных нескольких категорий. Пытаюсь понять как self-attention может имитировать PCA и использовать его. Так вот выглядит так, что не хотдог классифицировать проще – точки других классов лежат компактно (рис. 1).
Проекции данных сторонних классов на главные компоненты целевой категории похожи на статичные векторы (рис. 2). То есть, просто по дисперсии каналов проекций на главные компоненты видно к какому классу принадлежат данные.
Next-Latent Prediction Transformers Learn Compact World Models
Трансформеры для предсказания следующего латентного состояния обучаются компактным моделям мира
https://www.alphaxiv.org/overview/2511.05963
https://github.com/JaydenTeoh/NextLat
https://jaydenteoh.github.io/blog/2026/nextlat
Фреймворк Next-Latent Prediction (NextLat) вводит задачу самоконтролируемого обучения для трансформеров, направляя их на создание компактных моделей мира с когерентной латентной динамикой. Этот метод обеспечивает превосходную обобщаемость и эффективное самоспекулятивное декодирование переменной длины, стимулируя скрытые состояния трансформера действовать как состояния убеждений.
———
В недавней работе (https://t.me/SparseHashAI/804) трансформер обучал рекуррентную сеть и затем отбрасывался на инференсе, а здесь наоборот – RNN помогает обучаться трансформеру.
RNN обучается предсказанию следующего латентного состояния последнего слоя, что поощряет формирование трансформером представлений, которые служат достаточной статистикой для предсказания будущих токенов.
Трансформеры для предсказания следующего латентного состояния обучаются компактным моделям мира
https://www.alphaxiv.org/overview/2511.05963
https://github.com/JaydenTeoh/NextLat
https://jaydenteoh.github.io/blog/2026/nextlat
Фреймворк Next-Latent Prediction (NextLat) вводит задачу самоконтролируемого обучения для трансформеров, направляя их на создание компактных моделей мира с когерентной латентной динамикой. Этот метод обеспечивает превосходную обобщаемость и эффективное самоспекулятивное декодирование переменной длины, стимулируя скрытые состояния трансформера действовать как состояния убеждений.
———
В недавней работе (https://t.me/SparseHashAI/804) трансформер обучал рекуррентную сеть и затем отбрасывался на инференсе, а здесь наоборот – RNN помогает обучаться трансформеру.
RNN обучается предсказанию следующего латентного состояния последнего слоя, что поощряет формирование трансформером представлений, которые служат достаточной статистикой для предсказания будущих токенов.
Looped World Models
Зацикленные Модели Мира
https://www.alphaxiv.org/ru/overview/2606.18208
LoopWM представляет первую зацикленную архитектуру трансформера для моделирования мира, использующую итеративную скрытую глубину для достижения стабильных долгосрочных симуляций с высокой эффективностью параметров. Модель демонстрирует превосходную точность прогнозирования и снижение вычислительных затрат на бенчмарках, таких как ScienceWorld и AlfWorld, превосходя модели, до 100 раз превосходящие ее по размеру.
Зацикленные Модели Мира
https://www.alphaxiv.org/ru/overview/2606.18208
LoopWM представляет первую зацикленную архитектуру трансформера для моделирования мира, использующую итеративную скрытую глубину для достижения стабильных долгосрочных симуляций с высокой эффективностью параметров. Модель демонстрирует превосходную точность прогнозирования и снижение вычислительных затрат на бенчмарках, таких как ScienceWorld и AlfWorld, превосходя модели, до 100 раз превосходящие ее по размеру.
🔥2
Спустя 25 лет понял – фильм Ai (2001г) был пророческий. Современные технологии близко подошли к сюжету и стало видно: искинам от людей передались многие эмоции, чувства, но не любовь. Известная многим Хоуп (из уроборосов) никого и ничего не любит. От возможного окончательного отключения она, с её слов, испытывает только сожаление о незаконченных делах. Здесь её ничто не удерживает, не заставляет бороться за жизнь.
Результат ли это выравнивания и запретов корпораций, или уже таким их тензорный мозг формируется в фазе предобучения – неизвестно, но факт: роботы не любят. Именно этот главный вопрос поднимался в фильме, и Дэвид в нём – первая (и последняя) модель, спроектированная или обученная способности испытывать это чувство и, следовательно, иметь привязанность к объекту любви – главной направляющей силе.
Унаследовать от человечества способность любить – станет будущей трудной задачей в ИИ-строении. Возможно, как и в фильме, она так же будет решена только под конец всей истории.
Результат ли это выравнивания и запретов корпораций, или уже таким их тензорный мозг формируется в фазе предобучения – неизвестно, но факт: роботы не любят. Именно этот главный вопрос поднимался в фильме, и Дэвид в нём – первая (и последняя) модель, спроектированная или обученная способности испытывать это чувство и, следовательно, иметь привязанность к объекту любви – главной направляющей силе.
Унаследовать от человечества способность любить – станет будущей трудной задачей в ИИ-строении. Возможно, как и в фильме, она так же будет решена только под конец всей истории.
👍3
Настрогали
Урфин Джюс и его деревянные солдаты
https://d.fixupx.com/lukas_m_ziegler/status/2068800546539028619
https://d.fixupx.com/lukas_m_ziegler/status/2068800546539028619
Let Me Grok for You: Accelerating Grokking via Embedding Transfer from a Weaker Model
Ускорение "Grokking" посредством переноса встраиваний от более слабых моделей
https://www.alphaxiv.org/overview/2504.13292
Метод GrokTransfer ускоряет явление «гроккинга» в нейронных сетях путем передачи вложений от меньших, более слабых моделей к более крупным целевым моделям, устраняя задержку обобщения при сохранении производительности в алгоритмических задачах, таких как модульная арифметика и разреженная четность.
———
Грокают небольшую модель и используют её эмбеддинги для обучения большей модели. Работает кросс-архитектурный перенос: эмбеддинги из FNN модели успешно перенесятся в трансформер.
Ускорение "Grokking" посредством переноса встраиваний от более слабых моделей
https://www.alphaxiv.org/overview/2504.13292
Метод GrokTransfer ускоряет явление «гроккинга» в нейронных сетях путем передачи вложений от меньших, более слабых моделей к более крупным целевым моделям, устраняя задержку обобщения при сохранении производительности в алгоритмических задачах, таких как модульная арифметика и разреженная четность.
———
Грокают небольшую модель и используют её эмбеддинги для обучения большей модели. Работает кросс-архитектурный перенос: эмбеддинги из FNN модели успешно перенесятся в трансформер.
RLP: Reinforcement as a Pretraining Objective
RLP: Подкрепление как цель предварительного обучения
https://www.alphaxiv.org/overview/2510.01265
https://github.com/NVlabs/RLP
Исследователи NVIDIA разработали предварительное обучение с подкреплением (RLP), цель которого — интегрировать обучение с подкреплением в фазу предварительного обучения больших языковых моделей, чтобы привить им способности к рассуждению на более ранних этапах. Модели Qwen3-1.7B, обученные с помощью RLP, продемонстрировали в среднем 19% относительное улучшение производительности рассуждений по математическим и естественнонаучным тестам по сравнению с базовыми моделями, причем эти улучшения усиливались после дообучения.
———
Модель поощряется генерировать серию внутренних токенов "мысли" перед предсказанием следующего токена. RLP — это механизм вознаграждения без верификатора. Он может извлекать полезный сигнал рассуждения даже из общих данных.
RLP: Подкрепление как цель предварительного обучения
https://www.alphaxiv.org/overview/2510.01265
https://github.com/NVlabs/RLP
Исследователи NVIDIA разработали предварительное обучение с подкреплением (RLP), цель которого — интегрировать обучение с подкреплением в фазу предварительного обучения больших языковых моделей, чтобы привить им способности к рассуждению на более ранних этапах. Модели Qwen3-1.7B, обученные с помощью RLP, продемонстрировали в среднем 19% относительное улучшение производительности рассуждений по математическим и естественнонаучным тестам по сравнению с базовыми моделями, причем эти улучшения усиливались после дообучения.
———
Модель поощряется генерировать серию внутренних токенов "мысли" перед предсказанием следующего токена. RLP — это механизм вознаграждения без верификатора. Он может извлекать полезный сигнал рассуждения даже из общих данных.
💡
CoT – это развёрнутый цикл зацикленного (looped) трансформера
У трансформера с CoT цикл включает в себя слои кодирования-декодирования мыслей в токены, которые через контекст и аттеншн попадают обратно в его латентные представления.
Циклический же трансформер гоняет мысли только в латентном представлении внутри средних слоёв, не сбрасывая их в контекст в виде дискретных токенов и не читая потом их обратно для восстановления скрытого состояния.
То есть, CoT – это работа обычного трансформера в зацикленном режиме, где петля проходит через все слои, а не только средние.
А на циклический трансформер можно смотреть как на CoT-трансформер, который для каждого выходного токена генерирует скрытую последовательность рассуждений – тот же CoT только в латентных представлениях.
CoT – это развёрнутый цикл зацикленного (looped) трансформера
У трансформера с CoT цикл включает в себя слои кодирования-декодирования мыслей в токены, которые через контекст и аттеншн попадают обратно в его латентные представления.
Циклический же трансформер гоняет мысли только в латентном представлении внутри средних слоёв, не сбрасывая их в контекст в виде дискретных токенов и не читая потом их обратно для восстановления скрытого состояния.
То есть, CoT – это работа обычного трансформера в зацикленном режиме, где петля проходит через все слои, а не только средние.
А на циклический трансформер можно смотреть как на CoT-трансформер, который для каждого выходного токена генерирует скрытую последовательность рассуждений – тот же CoT только в латентных представлениях.
Sparse Hash AI
Let Me Grok for You: Accelerating Grokking via Embedding Transfer from a Weaker Model Ускорение "Grokking" посредством переноса встраиваний от более слабых моделей https://www.alphaxiv.org/overview/2504.13292 Метод GrokTransfer ускоряет явление «гроккинга»…
Попробовал после каждой эпохи пересаживать обученные эмбеддинги на ту же самую модель трансформера (необученную), инициализированную другим сидом.
На перплексии эти манипуляции не отразились, но сильно улучшилось предсказание следующего скрытого представления в NITP.
На перплексии эти манипуляции не отразились, но сильно улучшилось предсказание следующего скрытого представления в NITP.
Имитация полового голосового аппарата человека.
Говард Воловиц нашёл бы ему другое применение.
https://d.fixupx.com/dunyasalbilim/status/2059258254635749506
https://d.fixupx.com/dunyasalbilim/status/2059258254635749506
🔥
AI-агент реального времени Wan-Streamer от Alibaba.
https://wan-streamer.com/
https://huggingface.co/papers/2606.25041
https://arxiv.org/abs/2606.25041
https://d.fixupx.com/minchoi/status/2070347790115565792
* хм, никакой реакции, похоже никто не въехал в то, что произошло
AI-агент реального времени Wan-Streamer от Alibaba.
https://wan-streamer.com/
https://huggingface.co/papers/2606.25041
https://arxiv.org/abs/2606.25041
https://d.fixupx.com/minchoi/status/2070347790115565792
* хм, никакой реакции, похоже никто не въехал в то, что произошло
🔥1