Sparse Hash AI
176 subscribers
189 photos
279 videos
4 files
624 links
AI обогатительная разработка ML месторождений. Осторожно, в канале ведутся подрывные работы!
Download Telegram
Generative Modeling via Drifting
Генеративное моделирование посредством дрейфа
https://www.alphaxiv.org/overview/2602.04770
https://github.com/tyfeld/drifting-model

Модели дрейфа (Drifting Models) предлагают новую парадигму генеративного моделирования, которая переносит итеративное сопоставление распределений на этап обучения, обеспечивая высококачественную генерацию образцов за один прямой проход. Метод достигает FID 1.54 на ImageNet 256x256 с использованием одной оценки нейронной функции в латентном пространстве и 1.61 в пиксельном пространстве, превосходя предыдущие одношаговые подходы и демонстрируя эффективность в задачах управления роботами.

———

Одношаговый метод генерации переносит итеративное уточнение с инференса на время обучения, используя стандартный градиентный спуск.
🔥1
Emergent Self-Attention from Astrocyte-Gated Associative Memory Dynamics
Эмерджентное самовнимание из управляемой астроцитами динамики ассоциативной памяти
https://www.alphaxiv.org/overview/2604.25481

Модель ассоциативной памяти на основе нейронов и астроцитов динамически модулирует синаптический вклад с помощью астроцитарных переменных усиления, демонстрируя, что вычисления, подобные самовниманию, возникают из конкурентной глиальной динамики. Этот механизм значительно повышает точность извлечения памяти, особенно при высоких нагрузках на память и интерференции паттернов.
Characterizing the Expressivity of Local Attention in Transformers
Характеристика выразительности локального внимания в Трансформерах
https://www.alphaxiv.org/overview/2605.00768

Исследователи формально охарактеризовали выразительную силу различных механизмов внимания трансформеров, продемонстрировав, что локальное внимание, особенно 1-локальное, предоставляет уникальные вычислительные возможности, дополняющие глобальное внимание. Их теоретическая работа связывает эти механизмы с фрагментами линейной темпоральной логики (LTL), а эмпирические результаты подтверждают превосходную выразительность и производительность гибридного глобально-локального внимания, заметно снижая перплексию до 69,7 пунктов на WikiText-2 по сравнению с моделями, использующими только глобальное внимание.

———

Гибридные модели, сочетающие глобальное и локальное внимание, достигают наибольшей эффективности. При этом использование размера локального окна k=1 (внимание только к непосредственному предшественнику) приводит к лучшей производительности.
Каждый сходящий с конвейера робот должен замещать человека за этим конвейером, и тогда объём выпуска в 1 миллион экземпляров в год станет реальностью.

https://d.fixupx.com/adcock_brett/status/2049514372264055116
Grokking as a Phase Transition between Competing Basins: a Singular Learning Theory Approach
Гроккинг как фазовый переход между конкурирующими бассейнами: подход на основе теории сингулярного обучения
https://www.alphaxiv.org/overview/2603.01192

Это исследование применяет Сингулярную Теорию Обучения для интерпретации грокинга как фазового перехода, где модели переключаются от запоминания к обобщению, перемещаясь между различными бассейнами решений в ландшафте потерь. Исследователи вывели выражения в замкнутой форме для Локального Коэффициента Обучения (LLC) в квадратичных сетях, демонстрируя, что траектории LLC коррелируют с обобщением и помогают объяснить, как скорость обучения влияет на серьезность грокинга.

———

Гроккингу нужна высокая скорость. Большая скорость обучения позволяет оптимизатору "пропускать" или избегать глубокого застревания в острых впадинах высокой сложности, связанных с чистым запоминанием.
pQuant: Towards Effective Low-Bit Language Models via Decoupled Linear Quantization-Aware Training
pQuant: На пути к эффективным низкоразрядным языковым моделям посредством развязанного линейного обучения с учетом квантования
https://www.alphaxiv.org/overview/2602.22592

pQuant представляет архитектуру отсоединенного линейного слоя с управляемым распределением чувствительности, позволяя крупным языковым моделям с экстремально низкой разрядностью (менее 2 бит) преодолеть "демократизацию параметров". Этот подход дает модели с разрядностью 1.35 бит, которые достигают паритета с FP16, сокращают потребление памяти на 92% и ускоряют инференс на 82% по сравнению с полноразрядной LLaMA-2.

———

В 1-битных моделях, обученных с нуля, не может быть суперузлов, очень важных для полноразрядных моделей. Их отсутствие сказывается на качестве и масштабируемости.

Метод pQuant заменяет стандартные линейные слои на двухветвевую структуру:

1-битная основная ветвь обрабатывает 95-96% параметров, используя бинарные веса.

Высокоточная ветвь сохраняет 4-5% параметров с 8-битной точностью (INT8) для сохранения суперузлов.
State Stream Transformer (SST) V2: Parallel Training of Nonlinear Recurrence for Latent Space Reasoning
Трансформер потокового состояния (SST) V2: Параллельное обучение нелинейной рекуррентности для рассуждений в латентном пространстве
https://www.alphaxiv.org/overview/2605.00206

Представлен трансформатор потока состояний (SST) V2, позволяющий выполнять непрерывные, нелинейные латентные вычисления по позициям последовательности в больших языковых моделях, наряду с новым методом параллельного обучения. Эта 27-миллиардная модель достигает существенных улучшений в рассуждениях, в частности, прирост на +15.15 процентных пунктов на GPQA-Diamond и сокращение ошибок на 46% в GSM8K, превосходя более крупные модели с открытым исходным кодом и проприетарные модели в условиях строгого декодирования.
👍2
The Structural Origin of Attention Sink: Variance Discrepancy, Super Neurons, and Dimension Disparity
Структурное происхождение аттеншн-синка: несоответствие дисперсий, супернейроны и неравенство размерностей
https://www.alphaxiv.org/overview/2605.06611

Это исследование предоставляет механистическое объяснение появления «коллекторов внимания» (attention sinks) в трансформерах только с декодером, определяя несоответствие позиционной дисперсии, вызванное причинным маскированием, как первопричину. Работа представляет Head-wise RMSNorm, архитектурную модификацию, которая стабилизирует агрегацию значений, ускоряя сходимость предварительного обучения и предотвращая коллапс представлений.

———

Истоки аттеншн-синка начального токена лежат в том, что никакого усреднения (агрегации) векторов "значений" в механизме внимания у него не происходит. Неагрегированный (обращает внимание только на самого себя) токен сохраняет высокую дисперсию и потому становится аттеншн-синком. Далее матрица выходной проекции пропускает высокодисперсный сигнал в остаточный поток, а супернейроны в FFN усиливают его. Всё это затем закрепляется в проекционных матрицах внимания.
Why Does Reinforcement Learning Generalize? A Feature-Level Mechanistic Study of Post-Training in Large Language Models
Почему обучение с подкреплением обобщает? Механистическое исследование пост-обучения на уровне признаков в больших языковых моделях
https://www.alphaxiv.org/overview/2604.25011

Механистическое исследование выясняет, почему пост-обучение с подкреплением (RL) улучшает обобщение в больших языковых моделях, в то время как контролируемая донастройка (SFT) часто приводит к забыванию, выявляя, что RL в основном перевзвешивает существующие признаки для обеспечения надежного, не зависящего от задачи обобщения, в отличие от SFT, которое вводит множество специализированных признаков.

———

RL выявляет и усиливает компактный набор внутренних признаков, уже присутствующие в базовой модели после предварительного обучения, но находящиеся в «спящем» или недостаточно активированном состоянии, которые действуют как "универсальный движок рассуждений".
Gyan: An Explainable Neuro-Symbolic Language Model
Гьян: Объяснимая нейро-символьная языковая модель
https://www.alphaxiv.org/overview/2605.04759

Gyan представляет нейросимвольную архитектуру без использования трансформеров, которая обеспечивает полностью объяснимую и композиционную языковую модель, демонстрируя передовые результаты на таких бенчмарках, как MS MARCO, PubMedQA и MMLU-Medicine, при этом используя незначительные вычислительные ресурсы. Модель создает прозрачное представление значения для уменьшения галлюцинаций и улучшения интерпретируемости.
NOBLE: Accelerating Transformers with Nonlinear Low-Rank Branches
NOBLE: Ускорение Трансформеров с нелинейными низкоранговыми ветвями
https://www.alphaxiv.org/overview/2603.06492

Итан Смит разработал NOBLE, метод, который дополняет линейные слои Трансформера нелинейными низкоранговыми ветвями, специально предназначенными для предварительного обучения моделей с нуля. Эта архитектурная модификация позволила сократить количество шагов обучения до 1,47 раза и увеличить общую скорость настенных часов в 1,17-1,22 раза для моделей до 1,5 миллиарда параметров, неизменно обеспечивая меньшие потери при оценке в различных задачах.

———

Расширяет линейные слои подобно LoRA с помощью низкоранговой ветви, но с нелинейностью CosNet.
Spring-block theory of feature learning in deep neural networks
Пружинно-блочная теория обучения признакам в глубоких нейронных сетях
https://www.alphaxiv.org/overview/2407.19353

Исследователи разработали теорию пружинно-блочной цепи для моделирования извлечения признаков в глубоких нейронных сетях, демонстрируя, что динамика обучения ГНС может быть сопоставлена с фазовой диаграммой шум-нелинейность, где линейное распределение разделения данных по слоям коррелирует с более высокой точностью тестирования.

———

Теория пружинно-маятникового механизма показывает сильную корреляцию между линейностью кривой нагрузки и обобщающей способностью.
❤1
Заменим людей на роботов, они будут вкалывать 24/7.

Робот, — С меня хватит.

https://d.fixupx.com/SetPixels/status/2054710299702575269