Sparse Hash AI
176 subscribers
189 photos
279 videos
4 files
624 links
AI обогатительная разработка ML месторождений. Осторожно, в канале ведутся подрывные работы!
Download Telegram
LT2: Linear-Time Looped Transformers
ЛТ2: Линейновременные Зацикленные Трансформеры
https://www.alphaxiv.org/overview/2605.20670
https://github.com/chili-lab/LT2

LT2 представляет рекуррентные трансформеры с линейным временем (Linear-Time Looped Transformers) путем интеграции субквадратичных механизмов внимания в рекуррентные архитектуры, значительно преодолевая квадратичные вычислительные узкие места и ограничения по памяти предыдущих Looped Transformers. Новые гибридные варианты сравнялись или превзошли Looped Transformers с полным вниманием по производительности языкового моделирования и точности в режиме zero-shot, сохраняя при этом постоянную скорость декодирования и расширяя предел нехватки памяти при длинных последовательностях.

———

Циклический трансформер с субквадратичным вниманием.
Bug or Feature²: Weight Drift, Activation Sparsity, and Spikes
Баг или фича²: Дрейф весов, разреженность активаций и спайки
https://www.alphaxiv.org/overview/2605.17659
https://github.com/On-Point-RND/BugOrFeature

Исследование изучает новые свойства в нейронных сетях, такие как отрицательный дрейф весов и разреженность активаций, раскрывая их механистическое происхождение из взаимодействий между функциями потерь и активации. Оно представляет такие методы, как Процентное Центрирование для контролируемой разреженности и Остановку Накопления для повышения пропускной способности обучения, демонстрируя устойчивость к разреженности до 91% в GPT-nano с минимальной потерей производительности и полным восстановлением пропускной способности.
👍1
Winfree Oscillatory Neural Network
Осциллирующая нейронная сеть Уинфри
https://www.alphaxiv.org/overview/2605.20922
https://github.com/Jiawen-Dai/WONN

Колебательная нейронная сеть Винфри (WONN) представляет архитектуру, основанную на синхронизации, которая конкурентоспособно масштабируется для крупномасштабных бенчмарков компьютерного зрения и сложных задач рассуждения. WONN достигает высокой производительности со значительно меньшим количеством параметров, демонстрируя эмерджентную бимодальную фазовую организацию и динамическое решение задач посредством коллективного выравнивания.
ScheduleFree+: Scaling Learning-Rate-Free & Schedule-Free Learning to Large Language Models
ScheduleFree+: Масштабирование обучения без темпа и расписания до больших языковых моделей
https://www.alphaxiv.org/overview/2605.19095

ScheduleFree+ представляет оптимизированный метод обучения больших языковых моделей без скорости обучения, преодолевая предыдущие ограничения масштабирования за счет повторного внедрения внутреннего импульса и использования взвешивания по обратной норме градиента. Подход стабильно превосходит традиционные графики скорости обучения, сокращая время обучения на 31% при эквивалентных потерях в сценариях длительного обучения и предлагая предсказуемое затухание потерь 1/√t.
One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs
Один LR не подходит всем: Послойные скорости обучения для LLM, руководимые тяжелыми хвостами
https://www.alphaxiv.org/overview/2605.22297
https://github.com/hed-ucas/Layer-wise-Learning-Rate

Layerwise Learning Rate (LLR) представляет собой адаптивную стратегию оптимизации предварительного обучения для больших языковых моделей, регулирующую скорости обучения для каждого слоя на основе тяжелонагруженных спектральных свойств весовых матриц, руководствуясь теорией саморегуляции с тяжелыми хвостами (HT-SR). Этот подход обеспечивает более низкую валидационную перплексию и улучшенную точность zero-shot для LLaMa и GPT-nano, а также ускорение обучения до 1,5 раз.

———

Слоям задаётся индивидуальная динамическая скорость обучения по метрике, отслеживающей качество их оптимизации. Присваивая более высокие скорости обучения недооптимизированным слоям, LLR заставляет эти слои "догонять" остальную часть модели, способствуя более сбалансированному процессу обучения.
Hyundai – официальный спонсор чемпионата мира по футболу FIFA – использует Atlas от Boston Dynamics в качестве главного героя своего брендинга.

https://d.fixupx.com/HMGnewsroom/status/2059064033169547450
Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention
Вентильный DeltaNet-2: Развязка стирания и записи в линейном внимании
https://www.alphaxiv.org/ru/overview/2605.22791
https://github.com/NVlabs/GatedDeltaNet-2

Gated DeltaNet-2, разработанный исследователями NVIDIA, улучшает линейные рекуррентные модели внимания за счет разделения операций стирания и записи памяти с помощью отдельных поканальных вентилей. Этот усовершенствованный подход повышает производительность в задачах языкового моделирования, рассуждений на основе здравого смысла и извлечения информации, демонстрируя особые улучшения в бенчмарках с длинным контекстом, требующих надежного контроля помех.
Equilibrium Reasoners: Learning Attractors Enables Scalable Reasoning
Равновесные системы рассуждения: Обучение аттракторам обеспечивает масштабируемое рассуждение
https://www.alphaxiv.org/overview/2605.21488
https://github.com/locuslab/EqR

Исследователи из Университета Карнеги-Меллона разработали Equilibrium Reasoners (EqR) – итеративную модельную платформу, которая использует обусловленные задачей аттракторы в скрытом пространстве для достижения масштабируемого и обобщаемого рассуждения. EqR, обученная с помощью новых методов, достигла более 99% точности на Sudoku-Extreme, адаптивно масштабируя вычислительную глубину и ширину.

———

Данное исследование изучает, почему некоторые модели эффективно масштабируются, и предлагает фреймворк под названием Рассуждающие равновесные системы (Equilibrium Reasoners, EqR) для обеспечения надёжных, обобщаемых рассуждений.
Weight Decay Regimes in Grokking Transformers: Cheap Online Diagnostics
Режимы затухания весов в "гроккающих" трансформерах: дешевая онлайн-диагностика
https://www.alphaxiv.org/overview/2605.20441

Исследователи количественно оценили влияние затухания весов на "гроккинг" в трансформерах, установив критические пороги и показатели масштабирования для режимов запоминания и обобщения. Исследование также представило эффективные онлайн-диагностики, среднюю попарную косинусную схожесть головок внимания и стандартное отклонение энтропии, для мониторинга динамики внимания и характеристики различных фаз обучения.
attention_head_diagnostic.py
9.1 KB
🛠

Две полезные метрики для голов внимания из Weight Decay Regimes in Grokking Transformers: Cheap Online Diagnostics:

mean pairwise attention-head cosine similarity (средняя попарная косинусная схожесть голов внимания)

Эта метрика измеряет, насколько схожи паттерны внимания между различными головами в трансформере. Высокое значение (близкое к 1,0) указывает на то, что головы сильно скоординированы или "синхронизированы", тогда как более низкое значение предполагает, что они выполняют разнообразные задачи.

entropy standard deviation (стандартное отклонение энтропии):

Метрика измеряет разброс (дисперсию) энтропии внимания между различными головами внутри каждого слоя. Она отслеживает изменение сложности (энтропии) паттернов внимания между различными головами. Служит мерой "дифференциации", количественно определяющей, насколько головы специализировались на разных ролях.
Sparse Hash AI
attention_head_diagnostic.py
... entropy standard deviation

Низкое значение (близкое к 0): все головы в слое имеют одинаковую степень «сфокусированности» внимания (либо все полностью рассеяны, либо одинаково сильно сжаты). Это характерно для случайной инициализации или режима полного коллапса модели при слишком сильной регуляризации weight decay (λ = 10).

Высокое значение: головы дифференцировались. Одни головы внимания сфокусировались на конкретных триггерах (низкая энтропия), в то время как другие остались распределенными (высокая энтропия).
The Geometric Inductive Bias of Grokking: Bypassing Phase Transitions via Architectural Topology
Геометрическое индуктивное смещение гроккинга: Обход фазовых переходов через архитектурную топологию
https://www.alphaxiv.org/overview/2603.05228

Это исследование изучает, как конкретные архитектурные модификации в моделях Transformer могут ускорить или обойти феномен "гроккинга" (grokking), путем согласования индуктивных смещений модели с присущими задаче математическими симметриями. Исследователи обнаружили, что ограничение величины представлений и абляция маршрутизации внимания, зависящей от данных, значительно сократили фазу запоминания для задач модульной арифметики.

———

У трансформера слишком много степеней свободы. Если его внутреннюю геометрию ограничить под задачу, то он почти сразу грокается.
❤1
Learning Compositional Latent Structure with Vector Networks
Обучение композиционной латентной структуры с векторными сетями
https://www.alphaxiv.org/overview/2605.28007

Векторные сети представляют иерархическую рекуррентную архитектуру, которая структурно встраивает композиционную генерализацию, заменяя плотные матрицы весов библиотекой многократно используемых атомов весов ранга 1. Этот подход позволяет сети явно составлять трансформации, специфичные для входных данных, демонстрируя улучшенную производительность вне распределения в различных композиционных задачах.

———

Архитектура перекликается с self-attention и слоями памяти. Обучается локально.
Attention-based PCA
PCA на основе внимания
https://www.alphaxiv.org/overview/2605.18315

Упрощенные одноранговые слои внимания, обученные с использованием цели неконтролируемой реконструкции на гауссовых данных, восстанавливают ведущий главный собственный вектор ковариационной матрицы данных, демонстрируя присущую им способность к анализу главных компонент. Это поведение установлено для режимов с бесконечным и конечным контекстом и распространяется на модели со всплесковой ковариацией.

———

Работа устанавливает связь между вниманием и методом главных компонент (PCA). Внимание изначально предрасположено к изучению спектральных свойств данных, таких как главные компоненты. Голова внимания, по сути, выполняет задачу уменьшения размерности на основе ковариации данных.
Lngram: N-gram Conditional Memory in Latent Space
Lngram: N-грамма условная память в латентном пространстве
https://www.alphaxiv.org/ru/overview/2605.24869

Lngram — это модуль условной памяти в латентном пространстве, разработанный для повышения эффективности трансформеров путем разделения извлечения статических знаний и композиционного рассуждения посредством изученных дискретных символов. Модуль улучшает производительность в задачах обработки естественного языка, визуально-языковых и визуально-языково-действенных задачах, демонстрируя при этом эффективную адаптацию к домену.