Sparse Hash AI
176 subscribers
189 photos
279 videos
4 files
624 links
AI обогатительная разработка ML месторождений. Осторожно, в канале ведутся подрывные работы!
Download Telegram
Generalization at the Edge of Stability
Обобщение на грани стабильности
https://www.alphaxiv.org/overview/2604.19740

В этом исследовании вводится Sharpness Dimension (SD) как новая мера сложности, выведенная из теории случайных динамических систем, с целью объяснить обобщение в нейронных сетях, работающих на 'грани стабильности'. Исследование устанавливает теоретическую границу обобщения, связанную с SD, и эмпирически демонстрирует ее сильную корреляцию с производительностью обобщения в различных архитектурах, включая MLP и GPT-2, а также предлагает понимание феномена 'грокинга'.

———

Объясняет, почему перепараметризованные модели не переобучаются так сильно, как предсказывала бы классическая теория.
"Голова в горшке" – Origin F1

Вангую, что с распространением таких голов, владельцы станут заказывать мейкап для них.

https://d.fixupx.com/Yuhang__Hu/status/2046825104236216403
Sessa: Selective State Space Attention
Sessa: Избирательное внимание в пространстве состояний
https://www.alphaxiv.org/overview/2604.18580
https://github.com/LibratioAI/sessa

Исследователи разработали Sessa, новую архитектуру моделирования последовательностей, которая устраняет ограничения трансформеров и моделей пространственных состояний в сценариях с длинным контекстом путем интеграции внимания, зависящего от входных данных, в рекуррентный путь обратной связи. Sessa теоретически достигает более медленного, степенного затухания памяти и обеспечивает гибкие профили избирательного извлечения, включая незатухающее или усиливающееся влияние от удаленных токенов, превосходящие базовые модели в синтетических задачах с длинным контекстом.
👍1
Прошёл полумарафон дроидов в Пекине. В этом году вдвое улучшили прошлогодний результат.

https://d.fixupx.com/cixliv/status/2046066920995373421
Этот пришёл последним, но прошёл 21 км.

https://d.fixupx.com/AlertaMundoNews/status/2046361644737995183
❤2
KVNN: Learnable Multi-Kernel Volterra Neural Networks
KVNN: Обучаемые многоядерные нейронные сети Вольтерра
https://www.alphaxiv.org/overview/2604.15141

Ядрализованные нейронные сети Вольтерры (kVNN) представляют собой модульный слой для глубокого обучения, который интегрирует нелинейные взаимодействия более высокого порядка через обучаемое мульти-ядерное представление, уменьшая сложность модели при одновременном повышении производительности. Подход демонстрирует улучшенные компромиссы между точностью и эффективностью в таких задачах, как распознавание действий на видео и шумоподавление изображений, часто превосходя существующие методы с меньшим количеством параметров.
The Linear Centroids Hypothesis: How Deep Network Features Represent Data
Гипотеза линейных центроидов: Как признаки глубоких сетей представляют данные
https://www.alphaxiv.org/overview/2604.11962

В данной работе представлена гипотеза линейных центроидов (LCH) как основа для интерпретируемости глубоких сетей, предполагающая, что признаки соответствуют линейным направлениям центроидов, которые суммируют локальное функциональное поведение сети. Показано, что LCH уменьшает ложную идентификацию признаков и улучшает производительность методов интерпретации, таких как разреженные автокодировщики, обнаружение цепей и карты значимости в различных моделях.
Nonparametric Teaching of Attention Learners
Непараметрическое обучение обучающихся с вниманием
https://www.alphaxiv.org/overview/2602.20461

Парадигма AtteNT для непараметрического обучения внимательных моделей аналитически связывает градиентный спуск, основанный на параметрах, с функциональным градиентным спуском. Этот метод сокращает время дообучения LLM в среднем на 12,78% и время обучения ViT с нуля на 20,58%, одновременно обеспечивая улучшение производительности, такое как прирост δ1 на 5,1% в оценке глубины для ViT.

———

Предлагается обучать на примерах, которые дают наибольшую ошибку.
Transformers Learn Latent Mixture Models In-Context via Mirror Descent
Трансформеры изучают латентные смешанные модели в контексте посредством зеркального спуска
https://www.alphaxiv.org/overview/2604.10848

Исследователи из EPFL продемонстрировали, что трансформеры могут выводить динамические скрытые причинные структуры в контексте, реализуя одношаговый алгоритм Mirror Descent. Этот механизм позволяет трансформерам оценивать веса смесей в модели Mixture of Transition Distributions (MTD), эффективно идентифицируя причинно релевантные прошлые токены для предсказания следующего токена.
❤1
When Does Removing LayerNorm Help? Activation Bounding as a Regime-Dependent Implicit Regularizer
Когда помогает удаление LayerNorm? Ограничение активаций как зависящий от режима неявный регуляризатор
https://www.alphaxiv.org/overview/2604.23434

Это исследование систематически изучает, как удаление LayerNorm с помощью Dynamic Tanh (DyT) влияет на модели Transformer, выявляя, что DyT действует как зависящий от режима неявный регуляризатор. DyT улучшает производительность в условиях дефицита данных и избыточной параметризации, вызывая насыщение активаций, но становится вредоносным в режимах с большим объемом данных, где он препятствует сходимости.

———

DyT действует как форма сильной регуляризации. Замена LayerNorm на tanh полезна, когда данных мало и вредна, когда их много.
Supernodes and Halos: Loss-Critical Hubs in LLM Feed-Forward Layers
Суперузлы и гало: Критические для потерь хабы в слоях прямого распространения LLM
https://www.alphaxiv.org/overview/2604.23475

Это исследование выявляет «суперузлы» как небольшую часть каналов прямоточной сети (FFN) в больших языковых моделях, которые непропорционально важны для производительности модели, составляя более 50% чувствительности к потерям. Защита этих суперузлов во время структурированной обрезки позволяет сократить ухудшение перплексии до 99% по сравнению с базовыми методами при разреженности 50%.

———

Суперузлы, удаление которых ломает модель, возникают в процессе предварительного обучения, а не являются неотъемлемым свойством инициализации или самой архитектуры.

Производительность модели концентрируется в суперузлах (1% от общего числа каналов) и их окружении — гало (10%).
❤1
Graph Memory Transformer (GMT)
Трансформер графовой памяти (ГМТ)
https://www.alphaxiv.org/overview/2604.23862

Трансформер с графовой памятью (GMT) заменяет полносвязную сеть (FFN) в трансформерах только с декодером на явную, структурированную графовую память, что позволяет напрямую инспектировать внутренние вычисления. Эта архитектура демонстрирует стабильное обучение и конкурентоспособную производительность в режиме zero-shot, заметно превосходя более крупный базовый показатель на бенчмарке WinoGrande, при этом работая с меньшим количеством параметров.

———

FFN, действующую как неявная память типа «ключ-значение», заменили на явный и поддающийся инспекции граф памяти.
🔥1
FG^2-GDN: Enhancing Long-Context Gated Delta Networks with Doubly Fine-Grained Control
FG^2-GDN: Улучшение вентильных дельта-сетей протяженного контекста с двойным точным управлением
https://www.alphaxiv.org/overview/2604.19021

Исследователи Meituan разработали FG^2-GDN и FG^2-GDN+, которые усовершенствуют Gated Delta Networks, применяя поканальное управление скоростью обучения обновления памяти и дополнительно разделяя силу записи ключей и значений. Эти достижения приводят к улучшенному пониманию длинного контекста и ассоциативному вспоминанию на таких бенчмарках, как RULER и LongBench, сохраняя при этом линейную временную сложность.
Generative Modeling via Drifting
Генеративное моделирование посредством дрейфа
https://www.alphaxiv.org/overview/2602.04770
https://github.com/tyfeld/drifting-model

Модели дрейфа (Drifting Models) предлагают новую парадигму генеративного моделирования, которая переносит итеративное сопоставление распределений на этап обучения, обеспечивая высококачественную генерацию образцов за один прямой проход. Метод достигает FID 1.54 на ImageNet 256x256 с использованием одной оценки нейронной функции в латентном пространстве и 1.61 в пиксельном пространстве, превосходя предыдущие одношаговые подходы и демонстрируя эффективность в задачах управления роботами.

———

Одношаговый метод генерации переносит итеративное уточнение с инференса на время обучения, используя стандартный градиентный спуск.
🔥1
Emergent Self-Attention from Astrocyte-Gated Associative Memory Dynamics
Эмерджентное самовнимание из управляемой астроцитами динамики ассоциативной памяти
https://www.alphaxiv.org/overview/2604.25481

Модель ассоциативной памяти на основе нейронов и астроцитов динамически модулирует синаптический вклад с помощью астроцитарных переменных усиления, демонстрируя, что вычисления, подобные самовниманию, возникают из конкурентной глиальной динамики. Этот механизм значительно повышает точность извлечения памяти, особенно при высоких нагрузках на память и интерференции паттернов.
Characterizing the Expressivity of Local Attention in Transformers
Характеристика выразительности локального внимания в Трансформерах
https://www.alphaxiv.org/overview/2605.00768

Исследователи формально охарактеризовали выразительную силу различных механизмов внимания трансформеров, продемонстрировав, что локальное внимание, особенно 1-локальное, предоставляет уникальные вычислительные возможности, дополняющие глобальное внимание. Их теоретическая работа связывает эти механизмы с фрагментами линейной темпоральной логики (LTL), а эмпирические результаты подтверждают превосходную выразительность и производительность гибридного глобально-локального внимания, заметно снижая перплексию до 69,7 пунктов на WikiText-2 по сравнению с моделями, использующими только глобальное внимание.

———

Гибридные модели, сочетающие глобальное и локальное внимание, достигают наибольшей эффективности. При этом использование размера локального окна k=1 (внимание только к непосредственному предшественнику) приводит к лучшей производительности.