All Circuits Lead to Rome: Rethinking Functional Anisotropy in Circuit and Sheaf Discovery for LLMs
Все схемы ведут в Рим: Переосмысление функциональной анизотропии в обнаружении схем и пучков для БЯМ
https://www.alphaxiv.org/overview/2605.12671
Эмпирически и теоретически, одна задача в больших языковых моделях может поддерживаться несколькими структурно различными вычислительными механизмами, что оспаривает предположение о том, что каждая функция соответствует уникальной внутренней схеме. Исследование представляет метод для обнаружения этих разнообразных механизмов, обнаруживая, что два функционально идентичных пучка для идентификации косвенного дополнения могут иметь структурное перекрытие всего в 4,1%.
———
LLM обладают "функциональным изобилием" механизмов: множеством структурно различных цепей, которые могут сосуществовать и независимо выполнять одну и ту же задачу во время нормальной работы модели.
Авторы предлагают "Гипотезу Распределённой Плотной Схемы" (Distributive Dense Circuit Hypothesis). Они утверждают, что в высокоразмерных моделях, таких как большие языковые модели (LLM), один и тот же математический результат может быть достигнут многими различными комбинациями компонентов.
Все схемы ведут в Рим: Переосмысление функциональной анизотропии в обнаружении схем и пучков для БЯМ
https://www.alphaxiv.org/overview/2605.12671
Эмпирически и теоретически, одна задача в больших языковых моделях может поддерживаться несколькими структурно различными вычислительными механизмами, что оспаривает предположение о том, что каждая функция соответствует уникальной внутренней схеме. Исследование представляет метод для обнаружения этих разнообразных механизмов, обнаруживая, что два функционально идентичных пучка для идентификации косвенного дополнения могут иметь структурное перекрытие всего в 4,1%.
———
LLM обладают "функциональным изобилием" механизмов: множеством структурно различных цепей, которые могут сосуществовать и независимо выполнять одну и ту же задачу во время нормальной работы модели.
Авторы предлагают "Гипотезу Распределённой Плотной Схемы" (Distributive Dense Circuit Hypothesis). Они утверждают, что в высокоразмерных моделях, таких как большие языковые модели (LLM), один и тот же математический результат может быть достигнут многими различными комбинациями компонентов.
Variational Linear Attention: Stable Associative Memory for Long-Context Transformers
Вариационное линейное внимание: Устойчивая ассоциативная память для трансформеров с длинным контекстом
https://www.alphaxiv.org/overview/2605.11196
Вариационное линейное внимание (VLA) решает проблему нестабильности памяти механизмов линейного внимания в трансформерах с длинным контекстом, переформулируя обновления памяти как задачу онлайн-регуляризованных наименьших квадратов. Этот подход приводит к самоограничивающемуся состоянию памяти (норма Фробениуса ниже 15 при T=1000, что более чем в 100 раз меньше) и стабильному потоку градиентов, достигая почти идеального ассоциативного вызова там, где другие модели терпят неудачу.
———
DeltaNet: Использует обученный скалярный гейт для равномерного затухания всего состояния памяти. Хотя это предотвращает неограниченный рост, это "тупой" подход — он забывает все одинаково, даже если лишь малая часть памяти нуждается в обновлении.
VLA: Использует матрично-значное адаптивное штрафование. Она может выборочно защищать определенные "направления" в памяти, перезаписывая другие. Эта геометрическая гибкость позволяет ей сохранять старые, стабильные ассоциации даже по мере интеграции новой информации.
Вариационное линейное внимание: Устойчивая ассоциативная память для трансформеров с длинным контекстом
https://www.alphaxiv.org/overview/2605.11196
Вариационное линейное внимание (VLA) решает проблему нестабильности памяти механизмов линейного внимания в трансформерах с длинным контекстом, переформулируя обновления памяти как задачу онлайн-регуляризованных наименьших квадратов. Этот подход приводит к самоограничивающемуся состоянию памяти (норма Фробениуса ниже 15 при T=1000, что более чем в 100 раз меньше) и стабильному потоку градиентов, достигая почти идеального ассоциативного вызова там, где другие модели терпят неудачу.
———
DeltaNet: Использует обученный скалярный гейт для равномерного затухания всего состояния памяти. Хотя это предотвращает неограниченный рост, это "тупой" подход — он забывает все одинаково, даже если лишь малая часть памяти нуждается в обновлении.
VLA: Использует матрично-значное адаптивное штрафование. Она может выборочно защищать определенные "направления" в памяти, перезаписывая другие. Эта геометрическая гибкость позволяет ей сохранять старые, стабильные ассоциации даже по мере интеграции новой информации.
👍1
Towards Effective Theory of LLMs: A Representation Learning Approach
На пути к эффективной теории больших языковых моделей: подход, основанный на обучении представлений
https://www.alphaxiv.org/overview/2605.09294
Это исследование представляет Репрезентативную Эффективную Теорию (РЭТ), фреймворк для понимания вычислений Больших Языковых Моделей (LLM) путем изучения абстрактных макросостояний из траекторий скрытых состояний. Метод предоставляет интерпретируемые пути рассуждений, позволяет раннее предсказание поведения, такого как подхалимство, и предлагает причинные механизмы для управления генерацией LLM, превосходя базовые показатели по точности самопрогнозирования и метрикам интерпретируемости.
———
Основная идея РЭТ заключается в отображении высокоразмерных, зашумленных скрытых состояний LLM (микросостояний) в низкоразмерное пространство (макросостояния), которое сохраняет только ту информацию, которая необходима для предсказания будущего внутреннего состояния модели (аналогичной JEPA).
На пути к эффективной теории больших языковых моделей: подход, основанный на обучении представлений
https://www.alphaxiv.org/overview/2605.09294
Это исследование представляет Репрезентативную Эффективную Теорию (РЭТ), фреймворк для понимания вычислений Больших Языковых Моделей (LLM) путем изучения абстрактных макросостояний из траекторий скрытых состояний. Метод предоставляет интерпретируемые пути рассуждений, позволяет раннее предсказание поведения, такого как подхалимство, и предлагает причинные механизмы для управления генерацией LLM, превосходя базовые показатели по точности самопрогнозирования и метрикам интерпретируемости.
———
Основная идея РЭТ заключается в отображении высокоразмерных, зашумленных скрытых состояний LLM (микросостояний) в низкоразмерное пространство (макросостояния), которое сохраняет только ту информацию, которая необходима для предсказания будущего внутреннего состояния модели (аналогичной JEPA).
Freeze Deep, Train Shallow: Interpretable Layer Allocation for Continued Pre-Training
Замораживай глубокие, тренируй поверхностные: Интерпретируемое распределение слоев для продолженного предобучения
https://www.alphaxiv.org/overview/2605.11416
LayerTracer — это диагностическая платформа, которая количественно определяет функциональную дифференциацию между слоями больших языковых моделей для целенаправленного продолженного предварительного обучения. Она показала, что неглубокие слои чувствительны к обновлениям, в то время как глубокие слои консолидируют выполнение задач, что позволило применить интерпретируемую стратегию «обучай неглубокие, замораживай глубокие» (train-shallow, freeze-deep), которая улучшила производительность на бенчмарках, сократив при этом количество обучаемых параметров примерно на 50%.
———
Основной принцип данной работы: Замораживай глубокие, тренируй поверхностные. Тренируя поверхностные, чувствительные слои, модель может усваивать новые предметно-специфичные паттерны. Замораживая глубокие, стабильные зоны выполнения, модель сохраняет сложные способности к рассуждению, которые она приобрела во время своего первоначального, крупномасштабного предварительного обучения.
Замораживай глубокие, тренируй поверхностные: Интерпретируемое распределение слоев для продолженного предобучения
https://www.alphaxiv.org/overview/2605.11416
LayerTracer — это диагностическая платформа, которая количественно определяет функциональную дифференциацию между слоями больших языковых моделей для целенаправленного продолженного предварительного обучения. Она показала, что неглубокие слои чувствительны к обновлениям, в то время как глубокие слои консолидируют выполнение задач, что позволило применить интерпретируемую стратегию «обучай неглубокие, замораживай глубокие» (train-shallow, freeze-deep), которая улучшила производительность на бенчмарках, сократив при этом количество обучаемых параметров примерно на 50%.
———
Основной принцип данной работы: Замораживай глубокие, тренируй поверхностные. Тренируя поверхностные, чувствительные слои, модель может усваивать новые предметно-специфичные паттерны. Замораживая глубокие, стабильные зоны выполнения, модель сохраняет сложные способности к рассуждению, которые она приобрела во время своего первоначального, крупномасштабного предварительного обучения.
SymbolicLight V1: Spike-Gated Dual-Path Language Modeling with High Activation Sparsity and Sub-Billion-Scale Pre-Training Evidence
SymbolicLight V1: Спайк-управляемое двухпутевое языковое моделирование с высокой разреженностью активаций и свидетельства предобучения в субмиллиардном масштабе
https://www.alphaxiv.org/overview/2605.21333
https://github.com/SymbolicLight-AGI/SymbolicLight-V1
https://huggingface.co/SymbolicLight-AGI/SymbolicLight-V1
Исследователи представили SymbolicLight V1, языковую модель с двойным путем, управляемую спайками, которая объединяет бинарные спайки с непрерывными представлениями. Эта архитектура достигла средней перплексии валидации 8.905 на двуязычном корпусе, поддерживая при этом разреженность активации более 89%, демонстрируя конкурентоспособную производительность по сравнению с плотными трансформерами и предлагая путь для энергоэффективного ИИ на нейроморфном оборудовании.
SymbolicLight V1: Спайк-управляемое двухпутевое языковое моделирование с высокой разреженностью активаций и свидетельства предобучения в субмиллиардном масштабе
https://www.alphaxiv.org/overview/2605.21333
https://github.com/SymbolicLight-AGI/SymbolicLight-V1
https://huggingface.co/SymbolicLight-AGI/SymbolicLight-V1
Исследователи представили SymbolicLight V1, языковую модель с двойным путем, управляемую спайками, которая объединяет бинарные спайки с непрерывными представлениями. Эта архитектура достигла средней перплексии валидации 8.905 на двуязычном корпусе, поддерживая при этом разреженность активации более 89%, демонстрируя конкурентоспособную производительность по сравнению с плотными трансформерами и предлагая путь для энергоэффективного ИИ на нейроморфном оборудовании.
LT2: Linear-Time Looped Transformers
ЛТ2: Линейновременные Зацикленные Трансформеры
https://www.alphaxiv.org/overview/2605.20670
https://github.com/chili-lab/LT2
LT2 представляет рекуррентные трансформеры с линейным временем (Linear-Time Looped Transformers) путем интеграции субквадратичных механизмов внимания в рекуррентные архитектуры, значительно преодолевая квадратичные вычислительные узкие места и ограничения по памяти предыдущих Looped Transformers. Новые гибридные варианты сравнялись или превзошли Looped Transformers с полным вниманием по производительности языкового моделирования и точности в режиме zero-shot, сохраняя при этом постоянную скорость декодирования и расширяя предел нехватки памяти при длинных последовательностях.
———
Циклический трансформер с субквадратичным вниманием.
ЛТ2: Линейновременные Зацикленные Трансформеры
https://www.alphaxiv.org/overview/2605.20670
https://github.com/chili-lab/LT2
LT2 представляет рекуррентные трансформеры с линейным временем (Linear-Time Looped Transformers) путем интеграции субквадратичных механизмов внимания в рекуррентные архитектуры, значительно преодолевая квадратичные вычислительные узкие места и ограничения по памяти предыдущих Looped Transformers. Новые гибридные варианты сравнялись или превзошли Looped Transformers с полным вниманием по производительности языкового моделирования и точности в режиме zero-shot, сохраняя при этом постоянную скорость декодирования и расширяя предел нехватки памяти при длинных последовательностях.
———
Циклический трансформер с субквадратичным вниманием.
Bug or Feature²: Weight Drift, Activation Sparsity, and Spikes
Баг или фича²: Дрейф весов, разреженность активаций и спайки
https://www.alphaxiv.org/overview/2605.17659
https://github.com/On-Point-RND/BugOrFeature
Исследование изучает новые свойства в нейронных сетях, такие как отрицательный дрейф весов и разреженность активаций, раскрывая их механистическое происхождение из взаимодействий между функциями потерь и активации. Оно представляет такие методы, как Процентное Центрирование для контролируемой разреженности и Остановку Накопления для повышения пропускной способности обучения, демонстрируя устойчивость к разреженности до 91% в GPT-nano с минимальной потерей производительности и полным восстановлением пропускной способности.
Баг или фича²: Дрейф весов, разреженность активаций и спайки
https://www.alphaxiv.org/overview/2605.17659
https://github.com/On-Point-RND/BugOrFeature
Исследование изучает новые свойства в нейронных сетях, такие как отрицательный дрейф весов и разреженность активаций, раскрывая их механистическое происхождение из взаимодействий между функциями потерь и активации. Оно представляет такие методы, как Процентное Центрирование для контролируемой разреженности и Остановку Накопления для повышения пропускной способности обучения, демонстрируя устойчивость к разреженности до 91% в GPT-nano с минимальной потерей производительности и полным восстановлением пропускной способности.
👍1
Winfree Oscillatory Neural Network
Осциллирующая нейронная сеть Уинфри
https://www.alphaxiv.org/overview/2605.20922
https://github.com/Jiawen-Dai/WONN
Колебательная нейронная сеть Винфри (WONN) представляет архитектуру, основанную на синхронизации, которая конкурентоспособно масштабируется для крупномасштабных бенчмарков компьютерного зрения и сложных задач рассуждения. WONN достигает высокой производительности со значительно меньшим количеством параметров, демонстрируя эмерджентную бимодальную фазовую организацию и динамическое решение задач посредством коллективного выравнивания.
Осциллирующая нейронная сеть Уинфри
https://www.alphaxiv.org/overview/2605.20922
https://github.com/Jiawen-Dai/WONN
Колебательная нейронная сеть Винфри (WONN) представляет архитектуру, основанную на синхронизации, которая конкурентоспособно масштабируется для крупномасштабных бенчмарков компьютерного зрения и сложных задач рассуждения. WONN достигает высокой производительности со значительно меньшим количеством параметров, демонстрируя эмерджентную бимодальную фазовую организацию и динамическое решение задач посредством коллективного выравнивания.
ScheduleFree+: Scaling Learning-Rate-Free & Schedule-Free Learning to Large Language Models
ScheduleFree+: Масштабирование обучения без темпа и расписания до больших языковых моделей
https://www.alphaxiv.org/overview/2605.19095
ScheduleFree+ представляет оптимизированный метод обучения больших языковых моделей без скорости обучения, преодолевая предыдущие ограничения масштабирования за счет повторного внедрения внутреннего импульса и использования взвешивания по обратной норме градиента. Подход стабильно превосходит традиционные графики скорости обучения, сокращая время обучения на 31% при эквивалентных потерях в сценариях длительного обучения и предлагая предсказуемое затухание потерь 1/√t.
ScheduleFree+: Масштабирование обучения без темпа и расписания до больших языковых моделей
https://www.alphaxiv.org/overview/2605.19095
ScheduleFree+ представляет оптимизированный метод обучения больших языковых моделей без скорости обучения, преодолевая предыдущие ограничения масштабирования за счет повторного внедрения внутреннего импульса и использования взвешивания по обратной норме градиента. Подход стабильно превосходит традиционные графики скорости обучения, сокращая время обучения на 31% при эквивалентных потерях в сценариях длительного обучения и предлагая предсказуемое затухание потерь 1/√t.
One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs
Один LR не подходит всем: Послойные скорости обучения для LLM, руководимые тяжелыми хвостами
https://www.alphaxiv.org/overview/2605.22297
https://github.com/hed-ucas/Layer-wise-Learning-Rate
Layerwise Learning Rate (LLR) представляет собой адаптивную стратегию оптимизации предварительного обучения для больших языковых моделей, регулирующую скорости обучения для каждого слоя на основе тяжелонагруженных спектральных свойств весовых матриц, руководствуясь теорией саморегуляции с тяжелыми хвостами (HT-SR). Этот подход обеспечивает более низкую валидационную перплексию и улучшенную точность zero-shot для LLaMa и GPT-nano, а также ускорение обучения до 1,5 раз.
———
Слоям задаётся индивидуальная динамическая скорость обучения по метрике, отслеживающей качество их оптимизации. Присваивая более высокие скорости обучения недооптимизированным слоям, LLR заставляет эти слои "догонять" остальную часть модели, способствуя более сбалансированному процессу обучения.
Один LR не подходит всем: Послойные скорости обучения для LLM, руководимые тяжелыми хвостами
https://www.alphaxiv.org/overview/2605.22297
https://github.com/hed-ucas/Layer-wise-Learning-Rate
Layerwise Learning Rate (LLR) представляет собой адаптивную стратегию оптимизации предварительного обучения для больших языковых моделей, регулирующую скорости обучения для каждого слоя на основе тяжелонагруженных спектральных свойств весовых матриц, руководствуясь теорией саморегуляции с тяжелыми хвостами (HT-SR). Этот подход обеспечивает более низкую валидационную перплексию и улучшенную точность zero-shot для LLaMa и GPT-nano, а также ускорение обучения до 1,5 раз.
———
Слоям задаётся индивидуальная динамическая скорость обучения по метрике, отслеживающей качество их оптимизации. Присваивая более высокие скорости обучения недооптимизированным слоям, LLR заставляет эти слои "догонять" остальную часть модели, способствуя более сбалансированному процессу обучения.
Hyundai – официальный спонсор чемпионата мира по футболу FIFA – использует Atlas от Boston Dynamics в качестве главного героя своего брендинга.
https://d.fixupx.com/HMGnewsroom/status/2059064033169547450
https://d.fixupx.com/HMGnewsroom/status/2059064033169547450
Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention
Вентильный DeltaNet-2: Развязка стирания и записи в линейном внимании
https://www.alphaxiv.org/ru/overview/2605.22791
https://github.com/NVlabs/GatedDeltaNet-2
Gated DeltaNet-2, разработанный исследователями NVIDIA, улучшает линейные рекуррентные модели внимания за счет разделения операций стирания и записи памяти с помощью отдельных поканальных вентилей. Этот усовершенствованный подход повышает производительность в задачах языкового моделирования, рассуждений на основе здравого смысла и извлечения информации, демонстрируя особые улучшения в бенчмарках с длинным контекстом, требующих надежного контроля помех.
Вентильный DeltaNet-2: Развязка стирания и записи в линейном внимании
https://www.alphaxiv.org/ru/overview/2605.22791
https://github.com/NVlabs/GatedDeltaNet-2
Gated DeltaNet-2, разработанный исследователями NVIDIA, улучшает линейные рекуррентные модели внимания за счет разделения операций стирания и записи памяти с помощью отдельных поканальных вентилей. Этот усовершенствованный подход повышает производительность в задачах языкового моделирования, рассуждений на основе здравого смысла и извлечения информации, демонстрируя особые улучшения в бенчмарках с длинным контекстом, требующих надежного контроля помех.
Equilibrium Reasoners: Learning Attractors Enables Scalable Reasoning
Равновесные системы рассуждения: Обучение аттракторам обеспечивает масштабируемое рассуждение
https://www.alphaxiv.org/overview/2605.21488
https://github.com/locuslab/EqR
Исследователи из Университета Карнеги-Меллона разработали Equilibrium Reasoners (EqR) – итеративную модельную платформу, которая использует обусловленные задачей аттракторы в скрытом пространстве для достижения масштабируемого и обобщаемого рассуждения. EqR, обученная с помощью новых методов, достигла более 99% точности на Sudoku-Extreme, адаптивно масштабируя вычислительную глубину и ширину.
———
Данное исследование изучает, почему некоторые модели эффективно масштабируются, и предлагает фреймворк под названием Рассуждающие равновесные системы (Equilibrium Reasoners, EqR) для обеспечения надёжных, обобщаемых рассуждений.
Равновесные системы рассуждения: Обучение аттракторам обеспечивает масштабируемое рассуждение
https://www.alphaxiv.org/overview/2605.21488
https://github.com/locuslab/EqR
Исследователи из Университета Карнеги-Меллона разработали Equilibrium Reasoners (EqR) – итеративную модельную платформу, которая использует обусловленные задачей аттракторы в скрытом пространстве для достижения масштабируемого и обобщаемого рассуждения. EqR, обученная с помощью новых методов, достигла более 99% точности на Sudoku-Extreme, адаптивно масштабируя вычислительную глубину и ширину.
———
Данное исследование изучает, почему некоторые модели эффективно масштабируются, и предлагает фреймворк под названием Рассуждающие равновесные системы (Equilibrium Reasoners, EqR) для обеспечения надёжных, обобщаемых рассуждений.
Weight Decay Regimes in Grokking Transformers: Cheap Online Diagnostics
Режимы затухания весов в "гроккающих" трансформерах: дешевая онлайн-диагностика
https://www.alphaxiv.org/overview/2605.20441
Исследователи количественно оценили влияние затухания весов на "гроккинг" в трансформерах, установив критические пороги и показатели масштабирования для режимов запоминания и обобщения. Исследование также представило эффективные онлайн-диагностики, среднюю попарную косинусную схожесть головок внимания и стандартное отклонение энтропии, для мониторинга динамики внимания и характеристики различных фаз обучения.
Режимы затухания весов в "гроккающих" трансформерах: дешевая онлайн-диагностика
https://www.alphaxiv.org/overview/2605.20441
Исследователи количественно оценили влияние затухания весов на "гроккинг" в трансформерах, установив критические пороги и показатели масштабирования для режимов запоминания и обобщения. Исследование также представило эффективные онлайн-диагностики, среднюю попарную косинусную схожесть головок внимания и стандартное отклонение энтропии, для мониторинга динамики внимания и характеристики различных фаз обучения.