Sparse Hash AI
176 subscribers
189 photos
279 videos
4 files
624 links
AI обогатительная разработка ML месторождений. Осторожно, в канале ведутся подрывные работы!
Download Telegram
Этот пришёл последним, но прошёл 21 км.

https://d.fixupx.com/AlertaMundoNews/status/2046361644737995183
❤2
KVNN: Learnable Multi-Kernel Volterra Neural Networks
KVNN: Обучаемые многоядерные нейронные сети Вольтерра
https://www.alphaxiv.org/overview/2604.15141

Ядрализованные нейронные сети Вольтерры (kVNN) представляют собой модульный слой для глубокого обучения, который интегрирует нелинейные взаимодействия более высокого порядка через обучаемое мульти-ядерное представление, уменьшая сложность модели при одновременном повышении производительности. Подход демонстрирует улучшенные компромиссы между точностью и эффективностью в таких задачах, как распознавание действий на видео и шумоподавление изображений, часто превосходя существующие методы с меньшим количеством параметров.
The Linear Centroids Hypothesis: How Deep Network Features Represent Data
Гипотеза линейных центроидов: Как признаки глубоких сетей представляют данные
https://www.alphaxiv.org/overview/2604.11962

В данной работе представлена гипотеза линейных центроидов (LCH) как основа для интерпретируемости глубоких сетей, предполагающая, что признаки соответствуют линейным направлениям центроидов, которые суммируют локальное функциональное поведение сети. Показано, что LCH уменьшает ложную идентификацию признаков и улучшает производительность методов интерпретации, таких как разреженные автокодировщики, обнаружение цепей и карты значимости в различных моделях.
Nonparametric Teaching of Attention Learners
Непараметрическое обучение обучающихся с вниманием
https://www.alphaxiv.org/overview/2602.20461

Парадигма AtteNT для непараметрического обучения внимательных моделей аналитически связывает градиентный спуск, основанный на параметрах, с функциональным градиентным спуском. Этот метод сокращает время дообучения LLM в среднем на 12,78% и время обучения ViT с нуля на 20,58%, одновременно обеспечивая улучшение производительности, такое как прирост δ1 на 5,1% в оценке глубины для ViT.

———

Предлагается обучать на примерах, которые дают наибольшую ошибку.
Transformers Learn Latent Mixture Models In-Context via Mirror Descent
Трансформеры изучают латентные смешанные модели в контексте посредством зеркального спуска
https://www.alphaxiv.org/overview/2604.10848

Исследователи из EPFL продемонстрировали, что трансформеры могут выводить динамические скрытые причинные структуры в контексте, реализуя одношаговый алгоритм Mirror Descent. Этот механизм позволяет трансформерам оценивать веса смесей в модели Mixture of Transition Distributions (MTD), эффективно идентифицируя причинно релевантные прошлые токены для предсказания следующего токена.
❤1
When Does Removing LayerNorm Help? Activation Bounding as a Regime-Dependent Implicit Regularizer
Когда помогает удаление LayerNorm? Ограничение активаций как зависящий от режима неявный регуляризатор
https://www.alphaxiv.org/overview/2604.23434

Это исследование систематически изучает, как удаление LayerNorm с помощью Dynamic Tanh (DyT) влияет на модели Transformer, выявляя, что DyT действует как зависящий от режима неявный регуляризатор. DyT улучшает производительность в условиях дефицита данных и избыточной параметризации, вызывая насыщение активаций, но становится вредоносным в режимах с большим объемом данных, где он препятствует сходимости.

———

DyT действует как форма сильной регуляризации. Замена LayerNorm на tanh полезна, когда данных мало и вредна, когда их много.
Supernodes and Halos: Loss-Critical Hubs in LLM Feed-Forward Layers
Суперузлы и гало: Критические для потерь хабы в слоях прямого распространения LLM
https://www.alphaxiv.org/overview/2604.23475

Это исследование выявляет «суперузлы» как небольшую часть каналов прямоточной сети (FFN) в больших языковых моделях, которые непропорционально важны для производительности модели, составляя более 50% чувствительности к потерям. Защита этих суперузлов во время структурированной обрезки позволяет сократить ухудшение перплексии до 99% по сравнению с базовыми методами при разреженности 50%.

———

Суперузлы, удаление которых ломает модель, возникают в процессе предварительного обучения, а не являются неотъемлемым свойством инициализации или самой архитектуры.

Производительность модели концентрируется в суперузлах (1% от общего числа каналов) и их окружении — гало (10%).
❤1
Graph Memory Transformer (GMT)
Трансформер графовой памяти (ГМТ)
https://www.alphaxiv.org/overview/2604.23862

Трансформер с графовой памятью (GMT) заменяет полносвязную сеть (FFN) в трансформерах только с декодером на явную, структурированную графовую память, что позволяет напрямую инспектировать внутренние вычисления. Эта архитектура демонстрирует стабильное обучение и конкурентоспособную производительность в режиме zero-shot, заметно превосходя более крупный базовый показатель на бенчмарке WinoGrande, при этом работая с меньшим количеством параметров.

———

FFN, действующую как неявная память типа «ключ-значение», заменили на явный и поддающийся инспекции граф памяти.
🔥1
FG^2-GDN: Enhancing Long-Context Gated Delta Networks with Doubly Fine-Grained Control
FG^2-GDN: Улучшение вентильных дельта-сетей протяженного контекста с двойным точным управлением
https://www.alphaxiv.org/overview/2604.19021

Исследователи Meituan разработали FG^2-GDN и FG^2-GDN+, которые усовершенствуют Gated Delta Networks, применяя поканальное управление скоростью обучения обновления памяти и дополнительно разделяя силу записи ключей и значений. Эти достижения приводят к улучшенному пониманию длинного контекста и ассоциативному вспоминанию на таких бенчмарках, как RULER и LongBench, сохраняя при этом линейную временную сложность.
Generative Modeling via Drifting
Генеративное моделирование посредством дрейфа
https://www.alphaxiv.org/overview/2602.04770
https://github.com/tyfeld/drifting-model

Модели дрейфа (Drifting Models) предлагают новую парадигму генеративного моделирования, которая переносит итеративное сопоставление распределений на этап обучения, обеспечивая высококачественную генерацию образцов за один прямой проход. Метод достигает FID 1.54 на ImageNet 256x256 с использованием одной оценки нейронной функции в латентном пространстве и 1.61 в пиксельном пространстве, превосходя предыдущие одношаговые подходы и демонстрируя эффективность в задачах управления роботами.

———

Одношаговый метод генерации переносит итеративное уточнение с инференса на время обучения, используя стандартный градиентный спуск.
🔥1
Emergent Self-Attention from Astrocyte-Gated Associative Memory Dynamics
Эмерджентное самовнимание из управляемой астроцитами динамики ассоциативной памяти
https://www.alphaxiv.org/overview/2604.25481

Модель ассоциативной памяти на основе нейронов и астроцитов динамически модулирует синаптический вклад с помощью астроцитарных переменных усиления, демонстрируя, что вычисления, подобные самовниманию, возникают из конкурентной глиальной динамики. Этот механизм значительно повышает точность извлечения памяти, особенно при высоких нагрузках на память и интерференции паттернов.
Characterizing the Expressivity of Local Attention in Transformers
Характеристика выразительности локального внимания в Трансформерах
https://www.alphaxiv.org/overview/2605.00768

Исследователи формально охарактеризовали выразительную силу различных механизмов внимания трансформеров, продемонстрировав, что локальное внимание, особенно 1-локальное, предоставляет уникальные вычислительные возможности, дополняющие глобальное внимание. Их теоретическая работа связывает эти механизмы с фрагментами линейной темпоральной логики (LTL), а эмпирические результаты подтверждают превосходную выразительность и производительность гибридного глобально-локального внимания, заметно снижая перплексию до 69,7 пунктов на WikiText-2 по сравнению с моделями, использующими только глобальное внимание.

———

Гибридные модели, сочетающие глобальное и локальное внимание, достигают наибольшей эффективности. При этом использование размера локального окна k=1 (внимание только к непосредственному предшественнику) приводит к лучшей производительности.
Каждый сходящий с конвейера робот должен замещать человека за этим конвейером, и тогда объём выпуска в 1 миллион экземпляров в год станет реальностью.

https://d.fixupx.com/adcock_brett/status/2049514372264055116
Grokking as a Phase Transition between Competing Basins: a Singular Learning Theory Approach
Гроккинг как фазовый переход между конкурирующими бассейнами: подход на основе теории сингулярного обучения
https://www.alphaxiv.org/overview/2603.01192

Это исследование применяет Сингулярную Теорию Обучения для интерпретации грокинга как фазового перехода, где модели переключаются от запоминания к обобщению, перемещаясь между различными бассейнами решений в ландшафте потерь. Исследователи вывели выражения в замкнутой форме для Локального Коэффициента Обучения (LLC) в квадратичных сетях, демонстрируя, что траектории LLC коррелируют с обобщением и помогают объяснить, как скорость обучения влияет на серьезность грокинга.

———

Гроккингу нужна высокая скорость. Большая скорость обучения позволяет оптимизатору "пропускать" или избегать глубокого застревания в острых впадинах высокой сложности, связанных с чистым запоминанием.
pQuant: Towards Effective Low-Bit Language Models via Decoupled Linear Quantization-Aware Training
pQuant: На пути к эффективным низкоразрядным языковым моделям посредством развязанного линейного обучения с учетом квантования
https://www.alphaxiv.org/overview/2602.22592

pQuant представляет архитектуру отсоединенного линейного слоя с управляемым распределением чувствительности, позволяя крупным языковым моделям с экстремально низкой разрядностью (менее 2 бит) преодолеть "демократизацию параметров". Этот подход дает модели с разрядностью 1.35 бит, которые достигают паритета с FP16, сокращают потребление памяти на 92% и ускоряют инференс на 82% по сравнению с полноразрядной LLaMA-2.

———

В 1-битных моделях, обученных с нуля, не может быть суперузлов, очень важных для полноразрядных моделей. Их отсутствие сказывается на качестве и масштабируемости.

Метод pQuant заменяет стандартные линейные слои на двухветвевую структуру:

1-битная основная ветвь обрабатывает 95-96% параметров, используя бинарные веса.

Высокоточная ветвь сохраняет 4-5% параметров с 8-битной точностью (INT8) для сохранения суперузлов.