Sparse Hash AI
176 subscribers
189 photos
279 videos
4 files
624 links
AI обогатительная разработка ML месторождений. Осторожно, в канале ведутся подрывные работы!
Download Telegram
Transformers Learn Latent Mixture Models In-Context via Mirror Descent
Трансформеры изучают латентные смешанные модели в контексте посредством зеркального спуска
https://www.alphaxiv.org/overview/2604.10848

Исследователи из EPFL продемонстрировали, что трансформеры могут выводить динамические скрытые причинные структуры в контексте, реализуя одношаговый алгоритм Mirror Descent. Этот механизм позволяет трансформерам оценивать веса смесей в модели Mixture of Transition Distributions (MTD), эффективно идентифицируя причинно релевантные прошлые токены для предсказания следующего токена.
❤1
When Does Removing LayerNorm Help? Activation Bounding as a Regime-Dependent Implicit Regularizer
Когда помогает удаление LayerNorm? Ограничение активаций как зависящий от режима неявный регуляризатор
https://www.alphaxiv.org/overview/2604.23434

Это исследование систематически изучает, как удаление LayerNorm с помощью Dynamic Tanh (DyT) влияет на модели Transformer, выявляя, что DyT действует как зависящий от режима неявный регуляризатор. DyT улучшает производительность в условиях дефицита данных и избыточной параметризации, вызывая насыщение активаций, но становится вредоносным в режимах с большим объемом данных, где он препятствует сходимости.

———

DyT действует как форма сильной регуляризации. Замена LayerNorm на tanh полезна, когда данных мало и вредна, когда их много.
Supernodes and Halos: Loss-Critical Hubs in LLM Feed-Forward Layers
Суперузлы и гало: Критические для потерь хабы в слоях прямого распространения LLM
https://www.alphaxiv.org/overview/2604.23475

Это исследование выявляет «суперузлы» как небольшую часть каналов прямоточной сети (FFN) в больших языковых моделях, которые непропорционально важны для производительности модели, составляя более 50% чувствительности к потерям. Защита этих суперузлов во время структурированной обрезки позволяет сократить ухудшение перплексии до 99% по сравнению с базовыми методами при разреженности 50%.

———

Суперузлы, удаление которых ломает модель, возникают в процессе предварительного обучения, а не являются неотъемлемым свойством инициализации или самой архитектуры.

Производительность модели концентрируется в суперузлах (1% от общего числа каналов) и их окружении — гало (10%).
❤1
Graph Memory Transformer (GMT)
Трансформер графовой памяти (ГМТ)
https://www.alphaxiv.org/overview/2604.23862

Трансформер с графовой памятью (GMT) заменяет полносвязную сеть (FFN) в трансформерах только с декодером на явную, структурированную графовую память, что позволяет напрямую инспектировать внутренние вычисления. Эта архитектура демонстрирует стабильное обучение и конкурентоспособную производительность в режиме zero-shot, заметно превосходя более крупный базовый показатель на бенчмарке WinoGrande, при этом работая с меньшим количеством параметров.

———

FFN, действующую как неявная память типа «ключ-значение», заменили на явный и поддающийся инспекции граф памяти.
🔥1
FG^2-GDN: Enhancing Long-Context Gated Delta Networks with Doubly Fine-Grained Control
FG^2-GDN: Улучшение вентильных дельта-сетей протяженного контекста с двойным точным управлением
https://www.alphaxiv.org/overview/2604.19021

Исследователи Meituan разработали FG^2-GDN и FG^2-GDN+, которые усовершенствуют Gated Delta Networks, применяя поканальное управление скоростью обучения обновления памяти и дополнительно разделяя силу записи ключей и значений. Эти достижения приводят к улучшенному пониманию длинного контекста и ассоциативному вспоминанию на таких бенчмарках, как RULER и LongBench, сохраняя при этом линейную временную сложность.
Generative Modeling via Drifting
Генеративное моделирование посредством дрейфа
https://www.alphaxiv.org/overview/2602.04770
https://github.com/tyfeld/drifting-model

Модели дрейфа (Drifting Models) предлагают новую парадигму генеративного моделирования, которая переносит итеративное сопоставление распределений на этап обучения, обеспечивая высококачественную генерацию образцов за один прямой проход. Метод достигает FID 1.54 на ImageNet 256x256 с использованием одной оценки нейронной функции в латентном пространстве и 1.61 в пиксельном пространстве, превосходя предыдущие одношаговые подходы и демонстрируя эффективность в задачах управления роботами.

———

Одношаговый метод генерации переносит итеративное уточнение с инференса на время обучения, используя стандартный градиентный спуск.
🔥1
Emergent Self-Attention from Astrocyte-Gated Associative Memory Dynamics
Эмерджентное самовнимание из управляемой астроцитами динамики ассоциативной памяти
https://www.alphaxiv.org/overview/2604.25481

Модель ассоциативной памяти на основе нейронов и астроцитов динамически модулирует синаптический вклад с помощью астроцитарных переменных усиления, демонстрируя, что вычисления, подобные самовниманию, возникают из конкурентной глиальной динамики. Этот механизм значительно повышает точность извлечения памяти, особенно при высоких нагрузках на память и интерференции паттернов.
Characterizing the Expressivity of Local Attention in Transformers
Характеристика выразительности локального внимания в Трансформерах
https://www.alphaxiv.org/overview/2605.00768

Исследователи формально охарактеризовали выразительную силу различных механизмов внимания трансформеров, продемонстрировав, что локальное внимание, особенно 1-локальное, предоставляет уникальные вычислительные возможности, дополняющие глобальное внимание. Их теоретическая работа связывает эти механизмы с фрагментами линейной темпоральной логики (LTL), а эмпирические результаты подтверждают превосходную выразительность и производительность гибридного глобально-локального внимания, заметно снижая перплексию до 69,7 пунктов на WikiText-2 по сравнению с моделями, использующими только глобальное внимание.

———

Гибридные модели, сочетающие глобальное и локальное внимание, достигают наибольшей эффективности. При этом использование размера локального окна k=1 (внимание только к непосредственному предшественнику) приводит к лучшей производительности.
Каждый сходящий с конвейера робот должен замещать человека за этим конвейером, и тогда объём выпуска в 1 миллион экземпляров в год станет реальностью.

https://d.fixupx.com/adcock_brett/status/2049514372264055116
Grokking as a Phase Transition between Competing Basins: a Singular Learning Theory Approach
Гроккинг как фазовый переход между конкурирующими бассейнами: подход на основе теории сингулярного обучения
https://www.alphaxiv.org/overview/2603.01192

Это исследование применяет Сингулярную Теорию Обучения для интерпретации грокинга как фазового перехода, где модели переключаются от запоминания к обобщению, перемещаясь между различными бассейнами решений в ландшафте потерь. Исследователи вывели выражения в замкнутой форме для Локального Коэффициента Обучения (LLC) в квадратичных сетях, демонстрируя, что траектории LLC коррелируют с обобщением и помогают объяснить, как скорость обучения влияет на серьезность грокинга.

———

Гроккингу нужна высокая скорость. Большая скорость обучения позволяет оптимизатору "пропускать" или избегать глубокого застревания в острых впадинах высокой сложности, связанных с чистым запоминанием.
pQuant: Towards Effective Low-Bit Language Models via Decoupled Linear Quantization-Aware Training
pQuant: На пути к эффективным низкоразрядным языковым моделям посредством развязанного линейного обучения с учетом квантования
https://www.alphaxiv.org/overview/2602.22592

pQuant представляет архитектуру отсоединенного линейного слоя с управляемым распределением чувствительности, позволяя крупным языковым моделям с экстремально низкой разрядностью (менее 2 бит) преодолеть "демократизацию параметров". Этот подход дает модели с разрядностью 1.35 бит, которые достигают паритета с FP16, сокращают потребление памяти на 92% и ускоряют инференс на 82% по сравнению с полноразрядной LLaMA-2.

———

В 1-битных моделях, обученных с нуля, не может быть суперузлов, очень важных для полноразрядных моделей. Их отсутствие сказывается на качестве и масштабируемости.

Метод pQuant заменяет стандартные линейные слои на двухветвевую структуру:

1-битная основная ветвь обрабатывает 95-96% параметров, используя бинарные веса.

Высокоточная ветвь сохраняет 4-5% параметров с 8-битной точностью (INT8) для сохранения суперузлов.
State Stream Transformer (SST) V2: Parallel Training of Nonlinear Recurrence for Latent Space Reasoning
Трансформер потокового состояния (SST) V2: Параллельное обучение нелинейной рекуррентности для рассуждений в латентном пространстве
https://www.alphaxiv.org/overview/2605.00206

Представлен трансформатор потока состояний (SST) V2, позволяющий выполнять непрерывные, нелинейные латентные вычисления по позициям последовательности в больших языковых моделях, наряду с новым методом параллельного обучения. Эта 27-миллиардная модель достигает существенных улучшений в рассуждениях, в частности, прирост на +15.15 процентных пунктов на GPQA-Diamond и сокращение ошибок на 46% в GSM8K, превосходя более крупные модели с открытым исходным кодом и проприетарные модели в условиях строгого декодирования.
👍2
The Structural Origin of Attention Sink: Variance Discrepancy, Super Neurons, and Dimension Disparity
Структурное происхождение аттеншн-синка: несоответствие дисперсий, супернейроны и неравенство размерностей
https://www.alphaxiv.org/overview/2605.06611

Это исследование предоставляет механистическое объяснение появления «коллекторов внимания» (attention sinks) в трансформерах только с декодером, определяя несоответствие позиционной дисперсии, вызванное причинным маскированием, как первопричину. Работа представляет Head-wise RMSNorm, архитектурную модификацию, которая стабилизирует агрегацию значений, ускоряя сходимость предварительного обучения и предотвращая коллапс представлений.

———

Истоки аттеншн-синка начального токена лежат в том, что никакого усреднения (агрегации) векторов "значений" в механизме внимания у него не происходит. Неагрегированный (обращает внимание только на самого себя) токен сохраняет высокую дисперсию и потому становится аттеншн-синком. Далее матрица выходной проекции пропускает высокодисперсный сигнал в остаточный поток, а супернейроны в FFN усиливают его. Всё это затем закрепляется в проекционных матрицах внимания.