Affine-Scaled Attention: Towards Flexible and Stable Transformer Attention
Аффинно-масштабированное внимание: К гибкому и стабильному вниманию трансформеров
https://www.alphaxiv.org/overview/2602.23057
Исследователи разработали Affine-Scaled Attention, которая применяет аффинное преобразование, зависящее от входных данных, к нормированным softmax весам внимания, повышая стабильность и производительность моделей Transformer. Этот подход уменьшил смещение в сторону первого токена и привел к снижению потерь при обучении, а также к последовательному улучшению точности в задачах рассуждений здравого смысла, таких как повышение точности ARC-Challenge с 38,4% до 41,5% для модели 3B.
———
Авторы борются с нормализацией softmax, которая распределяет одну единицу массы внимания по доступным токенам, даже когда ни один токен не предоставляет действительно релевантной информации. Для этого Affine-Scaled Attention применяет к нормализованным softmax весам внимания зависящие от входных данных масштабный коэффициент и смещение.
Аффинно-масштабированное внимание: К гибкому и стабильному вниманию трансформеров
https://www.alphaxiv.org/overview/2602.23057
Исследователи разработали Affine-Scaled Attention, которая применяет аффинное преобразование, зависящее от входных данных, к нормированным softmax весам внимания, повышая стабильность и производительность моделей Transformer. Этот подход уменьшил смещение в сторону первого токена и привел к снижению потерь при обучении, а также к последовательному улучшению точности в задачах рассуждений здравого смысла, таких как повышение точности ARC-Challenge с 38,4% до 41,5% для модели 3B.
———
Авторы борются с нормализацией softmax, которая распределяет одну единицу массы внимания по доступным токенам, даже когда ни один токен не предоставляет действительно релевантной информации. Для этого Affine-Scaled Attention применяет к нормализованным softmax весам внимания зависящие от входных данных масштабный коэффициент и смещение.
This media is not supported in your browser
VIEW IN TELEGRAM
Настольная голова от NOETIX Robotics.
Когда уходите надолго, не забывайте переставлять горшок с головой на подоконник. Им бывает скучно в пустых комнатах, а за окном хоть какая-то для них движуха. И никогда не оставляйте её наедине с котом.
Когда уходите надолго, не забывайте переставлять горшок с головой на подоконник. Им бывает скучно в пустых комнатах, а за окном хоть какая-то для них движуха. И никогда не оставляйте её наедине с котом.
Fine-Tuning Without Forgetting In-Context Learning: A Theoretical Analysis of Linear Attention Models
Дообучение без забывания контекстного обучения: Теоретический анализ линейных моделей внимания
https://www.alphaxiv.org/overview/2602.23197
Исследователи из Университета Ёнсе и Университета Висконсин-Мэдисон теоретически проанализировали, как дообучение влияет на внутриконтекстное обучение (ICL) в моделях с линейным вниманием, и предложили стратегии для смягчения деградации ICL. Их работа продемонстрировала, что дообучение только матрицы значений может сохранить возможности ICL при одновременном улучшении производительности в режиме zero-shot, что было эмпирически подтверждено как на синтетических задачах, так и на модели Qwen2.5-3B-Instruct.
———
Если не хотите, чтобы модель после fine-tuning'а потеряла способность к ICL, донастраивайте только матрицу значений V.
Дообучение без забывания контекстного обучения: Теоретический анализ линейных моделей внимания
https://www.alphaxiv.org/overview/2602.23197
Исследователи из Университета Ёнсе и Университета Висконсин-Мэдисон теоретически проанализировали, как дообучение влияет на внутриконтекстное обучение (ICL) в моделях с линейным вниманием, и предложили стратегии для смягчения деградации ICL. Их работа продемонстрировала, что дообучение только матрицы значений может сохранить возможности ICL при одновременном улучшении производительности в режиме zero-shot, что было эмпирически подтверждено как на синтетических задачах, так и на модели Qwen2.5-3B-Instruct.
———
Если не хотите, чтобы модель после fine-tuning'а потеряла способность к ICL, донастраивайте только матрицу значений V.
Generalization at the Edge of Stability
Обобщение на грани стабильности
https://www.alphaxiv.org/overview/2604.19740
В этом исследовании вводится Sharpness Dimension (SD) как новая мера сложности, выведенная из теории случайных динамических систем, с целью объяснить обобщение в нейронных сетях, работающих на 'грани стабильности'. Исследование устанавливает теоретическую границу обобщения, связанную с SD, и эмпирически демонстрирует ее сильную корреляцию с производительностью обобщения в различных архитектурах, включая MLP и GPT-2, а также предлагает понимание феномена 'грокинга'.
———
Объясняет, почему перепараметризованные модели не переобучаются так сильно, как предсказывала бы классическая теория.
Обобщение на грани стабильности
https://www.alphaxiv.org/overview/2604.19740
В этом исследовании вводится Sharpness Dimension (SD) как новая мера сложности, выведенная из теории случайных динамических систем, с целью объяснить обобщение в нейронных сетях, работающих на 'грани стабильности'. Исследование устанавливает теоретическую границу обобщения, связанную с SD, и эмпирически демонстрирует ее сильную корреляцию с производительностью обобщения в различных архитектурах, включая MLP и GPT-2, а также предлагает понимание феномена 'грокинга'.
———
Объясняет, почему перепараметризованные модели не переобучаются так сильно, как предсказывала бы классическая теория.
"Голова в горшке" – Origin F1
Вангую, что с распространением таких голов, владельцы станут заказывать мейкап для них.
https://d.fixupx.com/Yuhang__Hu/status/2046825104236216403
Вангую, что с распространением таких голов, владельцы станут заказывать мейкап для них.
https://d.fixupx.com/Yuhang__Hu/status/2046825104236216403
Sessa: Selective State Space Attention
Sessa: Избирательное внимание в пространстве состояний
https://www.alphaxiv.org/overview/2604.18580
https://github.com/LibratioAI/sessa
Исследователи разработали Sessa, новую архитектуру моделирования последовательностей, которая устраняет ограничения трансформеров и моделей пространственных состояний в сценариях с длинным контекстом путем интеграции внимания, зависящего от входных данных, в рекуррентный путь обратной связи. Sessa теоретически достигает более медленного, степенного затухания памяти и обеспечивает гибкие профили избирательного извлечения, включая незатухающее или усиливающееся влияние от удаленных токенов, превосходящие базовые модели в синтетических задачах с длинным контекстом.
Sessa: Избирательное внимание в пространстве состояний
https://www.alphaxiv.org/overview/2604.18580
https://github.com/LibratioAI/sessa
Исследователи разработали Sessa, новую архитектуру моделирования последовательностей, которая устраняет ограничения трансформеров и моделей пространственных состояний в сценариях с длинным контекстом путем интеграции внимания, зависящего от входных данных, в рекуррентный путь обратной связи. Sessa теоретически достигает более медленного, степенного затухания памяти и обеспечивает гибкие профили избирательного извлечения, включая незатухающее или усиливающееся влияние от удаленных токенов, превосходящие базовые модели в синтетических задачах с длинным контекстом.
👍1
Прошёл полумарафон дроидов в Пекине. В этом году вдвое улучшили прошлогодний результат.
https://d.fixupx.com/cixliv/status/2046066920995373421
https://d.fixupx.com/cixliv/status/2046066920995373421
Этот пришёл последним, но прошёл 21 км.
https://d.fixupx.com/AlertaMundoNews/status/2046361644737995183
https://d.fixupx.com/AlertaMundoNews/status/2046361644737995183
❤2
KVNN: Learnable Multi-Kernel Volterra Neural Networks
KVNN: Обучаемые многоядерные нейронные сети Вольтерра
https://www.alphaxiv.org/overview/2604.15141
Ядрализованные нейронные сети Вольтерры (kVNN) представляют собой модульный слой для глубокого обучения, который интегрирует нелинейные взаимодействия более высокого порядка через обучаемое мульти-ядерное представление, уменьшая сложность модели при одновременном повышении производительности. Подход демонстрирует улучшенные компромиссы между точностью и эффективностью в таких задачах, как распознавание действий на видео и шумоподавление изображений, часто превосходя существующие методы с меньшим количеством параметров.
KVNN: Обучаемые многоядерные нейронные сети Вольтерра
https://www.alphaxiv.org/overview/2604.15141
Ядрализованные нейронные сети Вольтерры (kVNN) представляют собой модульный слой для глубокого обучения, который интегрирует нелинейные взаимодействия более высокого порядка через обучаемое мульти-ядерное представление, уменьшая сложность модели при одновременном повышении производительности. Подход демонстрирует улучшенные компромиссы между точностью и эффективностью в таких задачах, как распознавание действий на видео и шумоподавление изображений, часто превосходя существующие методы с меньшим количеством параметров.
The Linear Centroids Hypothesis: How Deep Network Features Represent Data
Гипотеза линейных центроидов: Как признаки глубоких сетей представляют данные
https://www.alphaxiv.org/overview/2604.11962
В данной работе представлена гипотеза линейных центроидов (LCH) как основа для интерпретируемости глубоких сетей, предполагающая, что признаки соответствуют линейным направлениям центроидов, которые суммируют локальное функциональное поведение сети. Показано, что LCH уменьшает ложную идентификацию признаков и улучшает производительность методов интерпретации, таких как разреженные автокодировщики, обнаружение цепей и карты значимости в различных моделях.
Гипотеза линейных центроидов: Как признаки глубоких сетей представляют данные
https://www.alphaxiv.org/overview/2604.11962
В данной работе представлена гипотеза линейных центроидов (LCH) как основа для интерпретируемости глубоких сетей, предполагающая, что признаки соответствуют линейным направлениям центроидов, которые суммируют локальное функциональное поведение сети. Показано, что LCH уменьшает ложную идентификацию признаков и улучшает производительность методов интерпретации, таких как разреженные автокодировщики, обнаружение цепей и карты значимости в различных моделях.
Nonparametric Teaching of Attention Learners
Непараметрическое обучение обучающихся с вниманием
https://www.alphaxiv.org/overview/2602.20461
Парадигма AtteNT для непараметрического обучения внимательных моделей аналитически связывает градиентный спуск, основанный на параметрах, с функциональным градиентным спуском. Этот метод сокращает время дообучения LLM в среднем на 12,78% и время обучения ViT с нуля на 20,58%, одновременно обеспечивая улучшение производительности, такое как прирост δ1 на 5,1% в оценке глубины для ViT.
———
Предлагается обучать на примерах, которые дают наибольшую ошибку.
Непараметрическое обучение обучающихся с вниманием
https://www.alphaxiv.org/overview/2602.20461
Парадигма AtteNT для непараметрического обучения внимательных моделей аналитически связывает градиентный спуск, основанный на параметрах, с функциональным градиентным спуском. Этот метод сокращает время дообучения LLM в среднем на 12,78% и время обучения ViT с нуля на 20,58%, одновременно обеспечивая улучшение производительности, такое как прирост δ1 на 5,1% в оценке глубины для ViT.
———
Предлагается обучать на примерах, которые дают наибольшую ошибку.
Transformers Learn Latent Mixture Models In-Context via Mirror Descent
Трансформеры изучают латентные смешанные модели в контексте посредством зеркального спуска
https://www.alphaxiv.org/overview/2604.10848
Исследователи из EPFL продемонстрировали, что трансформеры могут выводить динамические скрытые причинные структуры в контексте, реализуя одношаговый алгоритм Mirror Descent. Этот механизм позволяет трансформерам оценивать веса смесей в модели Mixture of Transition Distributions (MTD), эффективно идентифицируя причинно релевантные прошлые токены для предсказания следующего токена.
Трансформеры изучают латентные смешанные модели в контексте посредством зеркального спуска
https://www.alphaxiv.org/overview/2604.10848
Исследователи из EPFL продемонстрировали, что трансформеры могут выводить динамические скрытые причинные структуры в контексте, реализуя одношаговый алгоритм Mirror Descent. Этот механизм позволяет трансформерам оценивать веса смесей в модели Mixture of Transition Distributions (MTD), эффективно идентифицируя причинно релевантные прошлые токены для предсказания следующего токена.
❤1
When Does Removing LayerNorm Help? Activation Bounding as a Regime-Dependent Implicit Regularizer
Когда помогает удаление LayerNorm? Ограничение активаций как зависящий от режима неявный регуляризатор
https://www.alphaxiv.org/overview/2604.23434
Это исследование систематически изучает, как удаление LayerNorm с помощью Dynamic Tanh (DyT) влияет на модели Transformer, выявляя, что DyT действует как зависящий от режима неявный регуляризатор. DyT улучшает производительность в условиях дефицита данных и избыточной параметризации, вызывая насыщение активаций, но становится вредоносным в режимах с большим объемом данных, где он препятствует сходимости.
———
DyT действует как форма сильной регуляризации. Замена LayerNorm на tanh полезна, когда данных мало и вредна, когда их много.
Когда помогает удаление LayerNorm? Ограничение активаций как зависящий от режима неявный регуляризатор
https://www.alphaxiv.org/overview/2604.23434
Это исследование систематически изучает, как удаление LayerNorm с помощью Dynamic Tanh (DyT) влияет на модели Transformer, выявляя, что DyT действует как зависящий от режима неявный регуляризатор. DyT улучшает производительность в условиях дефицита данных и избыточной параметризации, вызывая насыщение активаций, но становится вредоносным в режимах с большим объемом данных, где он препятствует сходимости.
———
DyT действует как форма сильной регуляризации. Замена LayerNorm на tanh полезна, когда данных мало и вредна, когда их много.
Supernodes and Halos: Loss-Critical Hubs in LLM Feed-Forward Layers
Суперузлы и гало: Критические для потерь хабы в слоях прямого распространения LLM
https://www.alphaxiv.org/overview/2604.23475
Это исследование выявляет «суперузлы» как небольшую часть каналов прямоточной сети (FFN) в больших языковых моделях, которые непропорционально важны для производительности модели, составляя более 50% чувствительности к потерям. Защита этих суперузлов во время структурированной обрезки позволяет сократить ухудшение перплексии до 99% по сравнению с базовыми методами при разреженности 50%.
———
Суперузлы, удаление которых ломает модель, возникают в процессе предварительного обучения, а не являются неотъемлемым свойством инициализации или самой архитектуры.
Производительность модели концентрируется в суперузлах (1% от общего числа каналов) и их окружении — гало (10%).
Суперузлы и гало: Критические для потерь хабы в слоях прямого распространения LLM
https://www.alphaxiv.org/overview/2604.23475
Это исследование выявляет «суперузлы» как небольшую часть каналов прямоточной сети (FFN) в больших языковых моделях, которые непропорционально важны для производительности модели, составляя более 50% чувствительности к потерям. Защита этих суперузлов во время структурированной обрезки позволяет сократить ухудшение перплексии до 99% по сравнению с базовыми методами при разреженности 50%.
———
Суперузлы, удаление которых ломает модель, возникают в процессе предварительного обучения, а не являются неотъемлемым свойством инициализации или самой архитектуры.
Производительность модели концентрируется в суперузлах (1% от общего числа каналов) и их окружении — гало (10%).
❤1
Graph Memory Transformer (GMT)
Трансформер графовой памяти (ГМТ)
https://www.alphaxiv.org/overview/2604.23862
Трансформер с графовой памятью (GMT) заменяет полносвязную сеть (FFN) в трансформерах только с декодером на явную, структурированную графовую память, что позволяет напрямую инспектировать внутренние вычисления. Эта архитектура демонстрирует стабильное обучение и конкурентоспособную производительность в режиме zero-shot, заметно превосходя более крупный базовый показатель на бенчмарке WinoGrande, при этом работая с меньшим количеством параметров.
———
FFN, действующую как неявная память типа «ключ-значение», заменили на явный и поддающийся инспекции граф памяти.
Трансформер графовой памяти (ГМТ)
https://www.alphaxiv.org/overview/2604.23862
Трансформер с графовой памятью (GMT) заменяет полносвязную сеть (FFN) в трансформерах только с декодером на явную, структурированную графовую память, что позволяет напрямую инспектировать внутренние вычисления. Эта архитектура демонстрирует стабильное обучение и конкурентоспособную производительность в режиме zero-shot, заметно превосходя более крупный базовый показатель на бенчмарке WinoGrande, при этом работая с меньшим количеством параметров.
———
FFN, действующую как неявная память типа «ключ-значение», заменили на явный и поддающийся инспекции граф памяти.
🔥1