Sparse Hash AI
176 subscribers
189 photos
279 videos
4 files
624 links
AI обогатительная разработка ML месторождений. Осторожно, в канале ведутся подрывные работы!
Download Telegram
Freeze Deep, Train Shallow: Interpretable Layer Allocation for Continued Pre-Training
Замораживай глубокие, тренируй поверхностные: Интерпретируемое распределение слоев для продолженного предобучения
https://www.alphaxiv.org/overview/2605.11416

LayerTracer — это диагностическая платформа, которая количественно определяет функциональную дифференциацию между слоями больших языковых моделей для целенаправленного продолженного предварительного обучения. Она показала, что неглубокие слои чувствительны к обновлениям, в то время как глубокие слои консолидируют выполнение задач, что позволило применить интерпретируемую стратегию «обучай неглубокие, замораживай глубокие» (train-shallow, freeze-deep), которая улучшила производительность на бенчмарках, сократив при этом количество обучаемых параметров примерно на 50%.

———

Основной принцип данной работы: Замораживай глубокие, тренируй поверхностные. Тренируя поверхностные, чувствительные слои, модель может усваивать новые предметно-специфичные паттерны. Замораживая глубокие, стабильные зоны выполнения, модель сохраняет сложные способности к рассуждению, которые она приобрела во время своего первоначального, крупномасштабного предварительного обучения.
SymbolicLight V1: Spike-Gated Dual-Path Language Modeling with High Activation Sparsity and Sub-Billion-Scale Pre-Training Evidence
SymbolicLight V1: Спайк-управляемое двухпутевое языковое моделирование с высокой разреженностью активаций и свидетельства предобучения в субмиллиардном масштабе
https://www.alphaxiv.org/overview/2605.21333
https://github.com/SymbolicLight-AGI/SymbolicLight-V1
https://huggingface.co/SymbolicLight-AGI/SymbolicLight-V1

Исследователи представили SymbolicLight V1, языковую модель с двойным путем, управляемую спайками, которая объединяет бинарные спайки с непрерывными представлениями. Эта архитектура достигла средней перплексии валидации 8.905 на двуязычном корпусе, поддерживая при этом разреженность активации более 89%, демонстрируя конкурентоспособную производительность по сравнению с плотными трансформерами и предлагая путь для энергоэффективного ИИ на нейроморфном оборудовании.
LT2: Linear-Time Looped Transformers
ЛТ2: Линейновременные Зацикленные Трансформеры
https://www.alphaxiv.org/overview/2605.20670
https://github.com/chili-lab/LT2

LT2 представляет рекуррентные трансформеры с линейным временем (Linear-Time Looped Transformers) путем интеграции субквадратичных механизмов внимания в рекуррентные архитектуры, значительно преодолевая квадратичные вычислительные узкие места и ограничения по памяти предыдущих Looped Transformers. Новые гибридные варианты сравнялись или превзошли Looped Transformers с полным вниманием по производительности языкового моделирования и точности в режиме zero-shot, сохраняя при этом постоянную скорость декодирования и расширяя предел нехватки памяти при длинных последовательностях.

———

Циклический трансформер с субквадратичным вниманием.
Bug or Feature²: Weight Drift, Activation Sparsity, and Spikes
Баг или фича²: Дрейф весов, разреженность активаций и спайки
https://www.alphaxiv.org/overview/2605.17659
https://github.com/On-Point-RND/BugOrFeature

Исследование изучает новые свойства в нейронных сетях, такие как отрицательный дрейф весов и разреженность активаций, раскрывая их механистическое происхождение из взаимодействий между функциями потерь и активации. Оно представляет такие методы, как Процентное Центрирование для контролируемой разреженности и Остановку Накопления для повышения пропускной способности обучения, демонстрируя устойчивость к разреженности до 91% в GPT-nano с минимальной потерей производительности и полным восстановлением пропускной способности.
👍1
Winfree Oscillatory Neural Network
Осциллирующая нейронная сеть Уинфри
https://www.alphaxiv.org/overview/2605.20922
https://github.com/Jiawen-Dai/WONN

Колебательная нейронная сеть Винфри (WONN) представляет архитектуру, основанную на синхронизации, которая конкурентоспособно масштабируется для крупномасштабных бенчмарков компьютерного зрения и сложных задач рассуждения. WONN достигает высокой производительности со значительно меньшим количеством параметров, демонстрируя эмерджентную бимодальную фазовую организацию и динамическое решение задач посредством коллективного выравнивания.
ScheduleFree+: Scaling Learning-Rate-Free & Schedule-Free Learning to Large Language Models
ScheduleFree+: Масштабирование обучения без темпа и расписания до больших языковых моделей
https://www.alphaxiv.org/overview/2605.19095

ScheduleFree+ представляет оптимизированный метод обучения больших языковых моделей без скорости обучения, преодолевая предыдущие ограничения масштабирования за счет повторного внедрения внутреннего импульса и использования взвешивания по обратной норме градиента. Подход стабильно превосходит традиционные графики скорости обучения, сокращая время обучения на 31% при эквивалентных потерях в сценариях длительного обучения и предлагая предсказуемое затухание потерь 1/√t.
One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs
Один LR не подходит всем: Послойные скорости обучения для LLM, руководимые тяжелыми хвостами
https://www.alphaxiv.org/overview/2605.22297
https://github.com/hed-ucas/Layer-wise-Learning-Rate

Layerwise Learning Rate (LLR) представляет собой адаптивную стратегию оптимизации предварительного обучения для больших языковых моделей, регулирующую скорости обучения для каждого слоя на основе тяжелонагруженных спектральных свойств весовых матриц, руководствуясь теорией саморегуляции с тяжелыми хвостами (HT-SR). Этот подход обеспечивает более низкую валидационную перплексию и улучшенную точность zero-shot для LLaMa и GPT-nano, а также ускорение обучения до 1,5 раз.

———

Слоям задаётся индивидуальная динамическая скорость обучения по метрике, отслеживающей качество их оптимизации. Присваивая более высокие скорости обучения недооптимизированным слоям, LLR заставляет эти слои "догонять" остальную часть модели, способствуя более сбалансированному процессу обучения.
Hyundai – официальный спонсор чемпионата мира по футболу FIFA – использует Atlas от Boston Dynamics в качестве главного героя своего брендинга.

https://d.fixupx.com/HMGnewsroom/status/2059064033169547450
Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention
Вентильный DeltaNet-2: Развязка стирания и записи в линейном внимании
https://www.alphaxiv.org/ru/overview/2605.22791
https://github.com/NVlabs/GatedDeltaNet-2

Gated DeltaNet-2, разработанный исследователями NVIDIA, улучшает линейные рекуррентные модели внимания за счет разделения операций стирания и записи памяти с помощью отдельных поканальных вентилей. Этот усовершенствованный подход повышает производительность в задачах языкового моделирования, рассуждений на основе здравого смысла и извлечения информации, демонстрируя особые улучшения в бенчмарках с длинным контекстом, требующих надежного контроля помех.
Equilibrium Reasoners: Learning Attractors Enables Scalable Reasoning
Равновесные системы рассуждения: Обучение аттракторам обеспечивает масштабируемое рассуждение
https://www.alphaxiv.org/overview/2605.21488
https://github.com/locuslab/EqR

Исследователи из Университета Карнеги-Меллона разработали Equilibrium Reasoners (EqR) – итеративную модельную платформу, которая использует обусловленные задачей аттракторы в скрытом пространстве для достижения масштабируемого и обобщаемого рассуждения. EqR, обученная с помощью новых методов, достигла более 99% точности на Sudoku-Extreme, адаптивно масштабируя вычислительную глубину и ширину.

———

Данное исследование изучает, почему некоторые модели эффективно масштабируются, и предлагает фреймворк под названием Рассуждающие равновесные системы (Equilibrium Reasoners, EqR) для обеспечения надёжных, обобщаемых рассуждений.
Weight Decay Regimes in Grokking Transformers: Cheap Online Diagnostics
Режимы затухания весов в "гроккающих" трансформерах: дешевая онлайн-диагностика
https://www.alphaxiv.org/overview/2605.20441

Исследователи количественно оценили влияние затухания весов на "гроккинг" в трансформерах, установив критические пороги и показатели масштабирования для режимов запоминания и обобщения. Исследование также представило эффективные онлайн-диагностики, среднюю попарную косинусную схожесть головок внимания и стандартное отклонение энтропии, для мониторинга динамики внимания и характеристики различных фаз обучения.
attention_head_diagnostic.py
9.1 KB
🛠

Две полезные метрики для голов внимания из Weight Decay Regimes in Grokking Transformers: Cheap Online Diagnostics:

mean pairwise attention-head cosine similarity (средняя попарная косинусная схожесть голов внимания)

Эта метрика измеряет, насколько схожи паттерны внимания между различными головами в трансформере. Высокое значение (близкое к 1,0) указывает на то, что головы сильно скоординированы или "синхронизированы", тогда как более низкое значение предполагает, что они выполняют разнообразные задачи.

entropy standard deviation (стандартное отклонение энтропии):

Метрика измеряет разброс (дисперсию) энтропии внимания между различными головами внутри каждого слоя. Она отслеживает изменение сложности (энтропии) паттернов внимания между различными головами. Служит мерой "дифференциации", количественно определяющей, насколько головы специализировались на разных ролях.
Sparse Hash AI
attention_head_diagnostic.py
... entropy standard deviation

Низкое значение (близкое к 0): все головы в слое имеют одинаковую степень «сфокусированности» внимания (либо все полностью рассеяны, либо одинаково сильно сжаты). Это характерно для случайной инициализации или режима полного коллапса модели при слишком сильной регуляризации weight decay (λ = 10).

Высокое значение: головы дифференцировались. Одни головы внимания сфокусировались на конкретных триггерах (низкая энтропия), в то время как другие остались распределенными (высокая энтропия).
The Geometric Inductive Bias of Grokking: Bypassing Phase Transitions via Architectural Topology
Геометрическое индуктивное смещение гроккинга: Обход фазовых переходов через архитектурную топологию
https://www.alphaxiv.org/overview/2603.05228

Это исследование изучает, как конкретные архитектурные модификации в моделях Transformer могут ускорить или обойти феномен "гроккинга" (grokking), путем согласования индуктивных смещений модели с присущими задаче математическими симметриями. Исследователи обнаружили, что ограничение величины представлений и абляция маршрутизации внимания, зависящей от данных, значительно сократили фазу запоминания для задач модульной арифметики.

———

У трансформера слишком много степеней свободы. Если его внутреннюю геометрию ограничить под задачу, то он почти сразу грокается.
❤1