Directional Routing in Transformers
Направленная маршрутизация в трансформерах
https://www.alphaxiv.org/overview/2603.14923
Направленная маршрутизация, легковесный механизм, напрямую интегрирует изученное подавление в головы внимания Transformer для повышения интерпретируемости и эффективности. Этот метод снижает перплексию на 31-56% в различных областях с накладными расходами всего в 3,9% параметров, позволяя моделям динамически подавлять нерелевантные признаки.
Данное исследование представляет «направленную маршрутизацию» (directional routing) — легковесный механизм, интегрированный непосредственно в головы внимания трансформера. Вместо добавления новой информации или маршрутизации входных данных в специализированные подсети, направленная маршрутизация идентифицирует и подавляет специфические, нерелевантные компоненты выхода головы. Селективно «очищая» представления от шума на основе входного контекста, механизм направлен на улучшение как производительности, так и внутренней интерпретируемости модели.
Направленная маршрутизация в трансформерах
https://www.alphaxiv.org/overview/2603.14923
Направленная маршрутизация, легковесный механизм, напрямую интегрирует изученное подавление в головы внимания Transformer для повышения интерпретируемости и эффективности. Этот метод снижает перплексию на 31-56% в различных областях с накладными расходами всего в 3,9% параметров, позволяя моделям динамически подавлять нерелевантные признаки.
Данное исследование представляет «направленную маршрутизацию» (directional routing) — легковесный механизм, интегрированный непосредственно в головы внимания трансформера. Вместо добавления новой информации или маршрутизации входных данных в специализированные подсети, направленная маршрутизация идентифицирует и подавляет специфические, нерелевантные компоненты выхода головы. Селективно «очищая» представления от шума на основе входного контекста, механизм направлен на улучшение как производительности, так и внутренней интерпретируемости модели.
Bionic Humanoid Robot: Origin F1 — New Skins, New Souls
https://www.youtube.com/watch?v=FOxN008wYEI
https://www.youtube.com/watch?v=FOxN008wYEI
YouTube
Bionic Humanoid Robot: Origin F1 — New Skins, New Souls
Introducing new character skins for Origin F1 — where the same face meets entirely different personalities.
❤1
Прототип «безматричного» трансформера
Применил операцию биндинга (поэлементное произведение) гипервекторов из Vector Symbolic Algebras (VSA) к эмбеддингам токенов для NTP.
Здесь вектор текущего токена B умножается на вектор предыдущего токена (контекста) A, результат: C – вектор следующего токена.
Для эксперимента в качестве контекста взял только единственный токен
В такой конфигурации первый токен выступает в роли вектора памяти –
То есть архитектура представляет из себя трансформер со слоями гейтированного аттеншена с фиксированным весом внимания на первый токен. Матрицы проекций аттеншена и FFN отсутствуют.
Функция слоя:
Эксперименты
Входная последовательность – текст. Символьная токенизация – токены-буквы.
Exp 1. Случайные, замороженные эмбеддинги токенов. Обучаем только
Успешно выучивает последовательность – сжимает её в векторы памяти, если она длиной до
Exp 2. Обучаемые эмбеддинги токенов, замороженные
Ёмкость:
Exp 3. Обучаемые эмбеддинги токенов и
Ёмкость:
———
Можно предположить, что в трансформерах с гейтированным аттеншеном, где явно присутствует биндинг, механизм слива используется для чтения из ассоциативной памяти, где ключом выступает текущий токен, а памятью токен слива (
Применил операцию биндинга (поэлементное произведение) гипервекторов из Vector Symbolic Algebras (VSA) к эмбеддингам токенов для NTP.
A, B → C
A ⊙ B = CЗдесь вектор текущего токена B умножается на вектор предыдущего токена (контекста) A, результат: C – вектор следующего токена.
Для эксперимента в качестве контекста взял только единственный токен
<BOS>, работающий стоком внимания. К токенам было применено позиционное кодирование RoPE. Голова трансформера – транспонированный слой эмбеддингов.В такой конфигурации первый токен выступает в роли вектора памяти –
MEM_V, в который «сжимается» последовательность.То есть архитектура представляет из себя трансформер со слоями гейтированного аттеншена с фиксированным весом внимания на первый токен. Матрицы проекций аттеншена и FFN отсутствуют.
Функция слоя:
f(X, i) = MEM_V ⊙ RoPE(X(i), i)Эксперименты
Входная последовательность – текст. Символьная токенизация – токены-буквы.
Exp 1. Случайные, замороженные эмбеддинги токенов. Обучаем только
MEM_V. Успешно выучивает последовательность – сжимает её в векторы памяти, если она длиной до
0.25∗d∗L, где d – размерность модели и L – число слоёв.Exp 2. Обучаемые эмбеддинги токенов, замороженные
MEM_V.Ёмкость:
2∗d∗L.Exp 3. Обучаемые эмбеддинги токенов и
MEM_V.Ёмкость:
4∗d∗L.———
Можно предположить, что в трансформерах с гейтированным аттеншеном, где явно присутствует биндинг, механизм слива используется для чтения из ассоциативной памяти, где ключом выступает текущий токен, а памятью токен слива (
<BOS>).🔥3
Sparse Hash AI pinned «Прототип «безматричного» трансформера Применил операцию биндинга (поэлементное произведение) гипервекторов из Vector Symbolic Algebras (VSA) к эмбеддингам токенов для NTP. A, B → C A ⊙ B = C Здесь вектор текущего токена B умножается на вектор предыдущего…»
Катастрофическое Забывание в Нейронных Сетях
И это было в Симпсонах.
Когда нейронные сети обучаются новым задачам, они часто страдают от катастрофического забывания — тенденции перезаписывать или ухудшать ранее полученные знания.
Например, тонкая настройка языковой модели для научного рассуждения может привести к потере общих арифметических способностей или навыков понимания языка.
И это было в Симпсонах.
😁1
Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights
Нейронные Заросли: Разнообразные Эксперты Задач Концентрируются Вокруг Предварительно Обученных Весов
https://www.alphaxiv.org/overview/2603.12228
Исследователи предполагают, что большие предварительно обученные нейронные сети существуют в режиме «зарослей», где их весовое пространство плотно заполнено разнообразными экспертами, ориентированными на конкретные задачи, доступными с помощью простых случайных возмущений. Их алгоритм «RandOpt», который случайным образом отбирает и объединяет эти возмущения, достиг производительности, сопоставимой или превосходящей установленные градиентные методы пост-обучения на различных задачах LLM и VLM.
———
Предобученная LLM представляет из себя плотные «заросли» (thicket) экспертов, которых можно «вытаскивать» из неё случайным возмущением параметров.
Более крупные модели содержат более разнообразных специалистов, а не универсалов. В то время как небольшие модели показывают минимальное улучшение от случайных возмущений.
Нейронные Заросли: Разнообразные Эксперты Задач Концентрируются Вокруг Предварительно Обученных Весов
https://www.alphaxiv.org/overview/2603.12228
Исследователи предполагают, что большие предварительно обученные нейронные сети существуют в режиме «зарослей», где их весовое пространство плотно заполнено разнообразными экспертами, ориентированными на конкретные задачи, доступными с помощью простых случайных возмущений. Их алгоритм «RandOpt», который случайным образом отбирает и объединяет эти возмущения, достиг производительности, сопоставимой или превосходящей установленные градиентные методы пост-обучения на различных задачах LLM и VLM.
———
Предобученная LLM представляет из себя плотные «заросли» (thicket) экспертов, которых можно «вытаскивать» из неё случайным возмущением параметров.
Более крупные модели содержат более разнообразных специалистов, а не универсалов. В то время как небольшие модели показывают минимальное улучшение от случайных возмущений.
Announcing 1-bit Bonsai: The First Commercially Viable 1-bit LLMs
https://prismml.com/news/bonsai-8b
https://github.com/PrismML-Eng/Bonsai-demo/
https://huggingface.co/collections/prism-ml/bonsai
https://prismml.com/news/bonsai-8b
https://github.com/PrismML-Eng/Bonsai-demo/
https://huggingface.co/collections/prism-ml/bonsai
Prismml
PrismML — Announcing 1-bit Bonsai: The First Commercially Viable 1-bit LLMs
Today, we are announcing 1-bit Bonsai models that bring advanced intelligence to the devices where people actually live and work.
🔥2
Preconditioned Attention: Enhancing Efficiency in Transformers
Предварительно обусловленное внимание: Повышение эффективности в трансформерах
https://www.alphaxiv.org/overview/2603.27153
Исследователи представили метод, названный «предварительно обусловленное внимание» (preconditioned attention), для смягчения плохой обусловленности матриц самовнимания в трансформерах. Это привело к ускорению сходимости обучения на 20–30 % и стабильному повышению производительности в различных задачах компьютерного зрения и обработки естественного языка.
В численном анализе плохо обусловленная матрица — это та, где небольшие изменения на входе или в градиентах могут приводить к большим, нестабильным изменениям на выходе, что обычно замедляет сходимость алгоритмов оптимизации, таких как Adam или SGD. Для решения этой проблемы авторы предлагают метод, названный "Предварительно обусловленное внимание" (Preconditioned Attention). Этот подход вводит простую диагональную матрицу обусловливания, которая служит стабилизации процесса обучения и улучшению конечной производительности модели.
Предварительно обусловленное внимание: Повышение эффективности в трансформерах
https://www.alphaxiv.org/overview/2603.27153
Исследователи представили метод, названный «предварительно обусловленное внимание» (preconditioned attention), для смягчения плохой обусловленности матриц самовнимания в трансформерах. Это привело к ускорению сходимости обучения на 20–30 % и стабильному повышению производительности в различных задачах компьютерного зрения и обработки естественного языка.
В численном анализе плохо обусловленная матрица — это та, где небольшие изменения на входе или в градиентах могут приводить к большим, нестабильным изменениям на выходе, что обычно замедляет сходимость алгоритмов оптимизации, таких как Adam или SGD. Для решения этой проблемы авторы предлагают метод, названный "Предварительно обусловленное внимание" (Preconditioned Attention). Этот подход вводит простую диагональную матрицу обусловливания, которая служит стабилизации процесса обучения и улучшению конечной производительности модели.
Ouroboros: Dynamic Weight Generation for Recursive Transformers via Input-Conditioned LoRA Modulation
Уроборос: Динамическая генерация весов для рекурсивных трансформеров посредством модуляции LoRA, обусловленной входными данными
https://www.alphaxiv.org/ru/overview/2604.02051
https://github.com/RightNow-AI/ouroboros
Исследователи из RightNow AI разработали OUROBOROS, рекурсивную архитектуру трансформера, которая использует компактную гиперсеть (CompactController) для динамической генерации зависимых от входа модуляций весов для своего рекуррентного блока. Эта система достигла снижения потерь при обучении на внутрираспределенных данных на 43.4% по сравнению с 17-слойным базисом, используя всего 0.6% параметров базовой модели.
Уроборос: Динамическая генерация весов для рекурсивных трансформеров посредством модуляции LoRA, обусловленной входными данными
https://www.alphaxiv.org/ru/overview/2604.02051
https://github.com/RightNow-AI/ouroboros
Исследователи из RightNow AI разработали OUROBOROS, рекурсивную архитектуру трансформера, которая использует компактную гиперсеть (CompactController) для динамической генерации зависимых от входа модуляций весов для своего рекуррентного блока. Эта система достигла снижения потерь при обучении на внутрираспределенных данных на 43.4% по сравнению с 17-слойным базисом, используя всего 0.6% параметров базовой модели.
Always Skip Attention
https://www.alphaxiv.org/overview/2505.01996
Исследователи из Университета Аделаиды и CSIRO обнаружили, что механизм self-attention в Vision Transformers требует использования skip-связей для предотвращения катастрофического сбоя обучения, связывая это с его внутренне плохой обусловленностью. Они представили Token Graying, метод предварительного кондиционирования, который улучшил точность ViT на ImageNet-1K до 0.3% с минимальными вычислительными затратами.
———
Удаление остаточных соединений из блока self-attention приводит к катастрофическому сбою обучения. Статья дает объяснение того, почему остаточные связи не просто полезны, но абсолютно необходимы для стабильного обучения self-attention. Остаточная связь эффективно регуляризует обусловленность, обеспечивая, чтобы преобразование не слишком сильно отклонялось от тождественной операции.
https://www.alphaxiv.org/overview/2505.01996
Исследователи из Университета Аделаиды и CSIRO обнаружили, что механизм self-attention в Vision Transformers требует использования skip-связей для предотвращения катастрофического сбоя обучения, связывая это с его внутренне плохой обусловленностью. Они представили Token Graying, метод предварительного кондиционирования, который улучшил точность ViT на ImageNet-1K до 0.3% с минимальными вычислительными затратами.
———
Удаление остаточных соединений из блока self-attention приводит к катастрофическому сбою обучения. Статья дает объяснение того, почему остаточные связи не просто полезны, но абсолютно необходимы для стабильного обучения self-attention. Остаточная связь эффективно регуляризует обусловленность, обеспечивая, чтобы преобразование не слишком сильно отклонялось от тождественной операции.
CAWN: Continuous Acoustic Wave Networks for Autoregressive Language Modeling
CAWN: Непрерывные акустические волновые сети для авторегрессионного языкового моделирования
https://www.alphaxiv.org/overview/2604.04250
Сеть непрерывных акустических волн (CAWN) моделирует язык как конструктивную и деструктивную интерференцию волн в комплексной области, предлагая альтернативу механизму самовнимания Transformer для авторегрессионного языкового моделирования. Эта архитектура обрабатывает последовательности с линейной временной сложностью и постоянным масштабированием памяти для инференции, демонстрируя способность обрабатывать до 2 миллионов токенов, сохраняя при этом постоянную скорость генерации 52 токена/секунду и конкурентоспособные возможности эмерджентного рассуждения.
CAWN: Непрерывные акустические волновые сети для авторегрессионного языкового моделирования
https://www.alphaxiv.org/overview/2604.04250
Сеть непрерывных акустических волн (CAWN) моделирует язык как конструктивную и деструктивную интерференцию волн в комплексной области, предлагая альтернативу механизму самовнимания Transformer для авторегрессионного языкового моделирования. Эта архитектура обрабатывает последовательности с линейной временной сложностью и постоянным масштабированием памяти для инференции, демонстрируя способность обрабатывать до 2 миллионов токенов, сохраняя при этом постоянную скорость генерации 52 токена/секунду и конкурентоспособные возможности эмерджентного рассуждения.
Only relative ranks matter in weight-clustered large language models
Важны только относительные ранги в весово-кластеризованных больших языковых моделях
https://www.alphaxiv.org/overview/2603.17917
Это исследование демонстрирует, что относительные ранги значений весов являются основным определяющим фактором производительности в больших языковых моделях, а не их точные числовые значения. Посредством систематической кластеризации весов и рандомизации центроидов, исследование показывает, что модификации, сохраняющие ранг, приводят к минимальному увеличению перплексии, в то время как изменения, нарушающие ранг, вызывают значительную деградацию, что указывает на надежные стратегии сжатия моделей.
Важны только относительные ранги в весово-кластеризованных больших языковых моделях
https://www.alphaxiv.org/overview/2603.17917
Это исследование демонстрирует, что относительные ранги значений весов являются основным определяющим фактором производительности в больших языковых моделях, а не их точные числовые значения. Посредством систематической кластеризации весов и рандомизации центроидов, исследование показывает, что модификации, сохраняющие ранг, приводят к минимальному увеличению перплексии, в то время как изменения, нарушающие ранг, вызывают значительную деградацию, что указывает на надежные стратегии сжатия моделей.
🔥1
The Phasor Transformer: Resolving Attention Bottlenecks on the Unit Circle
Фазорный Трансформер: Разрешение Узких Мест Внимания на Единичном Круге
https://www.alphaxiv.org/ru/overview/2603.17433
Трансформер-Фазор (Phasor Transformer) и его глубокий вариант, Модель Большого Фазора (LPM), представляют собой архитектуру моделирования последовательностей с нативной обработкой фазы, которая решает проблему квадратичной сложности самовнимания. Она достигает глобального смешивания токенов со сложностью O(N log N) и значительно меньшим количеством обучаемых параметров, представляя состояния последовательности как фазы на единичной окружности, демонстрируя стабильное авторегрессионное моделирование для осциллирующих временных рядов.
———
Как и в недавней работе CAWN: Continuous Acoustic Wave Networks for Autoregressive Language Modeling здесь сделан переход в частотную область и интерференцию волн в комплексной области. Требуемое число обучаемых параметров (на слой) равно длине контекста ∗ 2.
Фазорный Трансформер: Разрешение Узких Мест Внимания на Единичном Круге
https://www.alphaxiv.org/ru/overview/2603.17433
Трансформер-Фазор (Phasor Transformer) и его глубокий вариант, Модель Большого Фазора (LPM), представляют собой архитектуру моделирования последовательностей с нативной обработкой фазы, которая решает проблему квадратичной сложности самовнимания. Она достигает глобального смешивания токенов со сложностью O(N log N) и значительно меньшим количеством обучаемых параметров, представляя состояния последовательности как фазы на единичной окружности, демонстрируя стабильное авторегрессионное моделирование для осциллирующих временных рядов.
———
Как и в недавней работе CAWN: Continuous Acoustic Wave Networks for Autoregressive Language Modeling здесь сделан переход в частотную область и интерференцию волн в комплексной области. Требуемое число обучаемых параметров (на слой) равно длине контекста ∗ 2.