Sparse Hash AI
176 subscribers
189 photos
279 videos
4 files
624 links
AI обогатительная разработка ML месторождений. Осторожно, в канале ведутся подрывные работы!
Download Telegram
pQuant: Towards Effective Low-Bit Language Models via Decoupled Linear Quantization-Aware Training
pQuant: На пути к эффективным низкоразрядным языковым моделям посредством развязанного линейного обучения с учетом квантования
https://www.alphaxiv.org/overview/2602.22592

pQuant представляет архитектуру отсоединенного линейного слоя с управляемым распределением чувствительности, позволяя крупным языковым моделям с экстремально низкой разрядностью (менее 2 бит) преодолеть "демократизацию параметров". Этот подход дает модели с разрядностью 1.35 бит, которые достигают паритета с FP16, сокращают потребление памяти на 92% и ускоряют инференс на 82% по сравнению с полноразрядной LLaMA-2.

———

В 1-битных моделях, обученных с нуля, не может быть суперузлов, очень важных для полноразрядных моделей. Их отсутствие сказывается на качестве и масштабируемости.

Метод pQuant заменяет стандартные линейные слои на двухветвевую структуру:

1-битная основная ветвь обрабатывает 95-96% параметров, используя бинарные веса.

Высокоточная ветвь сохраняет 4-5% параметров с 8-битной точностью (INT8) для сохранения суперузлов.
State Stream Transformer (SST) V2: Parallel Training of Nonlinear Recurrence for Latent Space Reasoning
Трансформер потокового состояния (SST) V2: Параллельное обучение нелинейной рекуррентности для рассуждений в латентном пространстве
https://www.alphaxiv.org/overview/2605.00206

Представлен трансформатор потока состояний (SST) V2, позволяющий выполнять непрерывные, нелинейные латентные вычисления по позициям последовательности в больших языковых моделях, наряду с новым методом параллельного обучения. Эта 27-миллиардная модель достигает существенных улучшений в рассуждениях, в частности, прирост на +15.15 процентных пунктов на GPQA-Diamond и сокращение ошибок на 46% в GSM8K, превосходя более крупные модели с открытым исходным кодом и проприетарные модели в условиях строгого декодирования.
👍2
The Structural Origin of Attention Sink: Variance Discrepancy, Super Neurons, and Dimension Disparity
Структурное происхождение аттеншн-синка: несоответствие дисперсий, супернейроны и неравенство размерностей
https://www.alphaxiv.org/overview/2605.06611

Это исследование предоставляет механистическое объяснение появления «коллекторов внимания» (attention sinks) в трансформерах только с декодером, определяя несоответствие позиционной дисперсии, вызванное причинным маскированием, как первопричину. Работа представляет Head-wise RMSNorm, архитектурную модификацию, которая стабилизирует агрегацию значений, ускоряя сходимость предварительного обучения и предотвращая коллапс представлений.

———

Истоки аттеншн-синка начального токена лежат в том, что никакого усреднения (агрегации) векторов "значений" в механизме внимания у него не происходит. Неагрегированный (обращает внимание только на самого себя) токен сохраняет высокую дисперсию и потому становится аттеншн-синком. Далее матрица выходной проекции пропускает высокодисперсный сигнал в остаточный поток, а супернейроны в FFN усиливают его. Всё это затем закрепляется в проекционных матрицах внимания.
Why Does Reinforcement Learning Generalize? A Feature-Level Mechanistic Study of Post-Training in Large Language Models
Почему обучение с подкреплением обобщает? Механистическое исследование пост-обучения на уровне признаков в больших языковых моделях
https://www.alphaxiv.org/overview/2604.25011

Механистическое исследование выясняет, почему пост-обучение с подкреплением (RL) улучшает обобщение в больших языковых моделях, в то время как контролируемая донастройка (SFT) часто приводит к забыванию, выявляя, что RL в основном перевзвешивает существующие признаки для обеспечения надежного, не зависящего от задачи обобщения, в отличие от SFT, которое вводит множество специализированных признаков.

———

RL выявляет и усиливает компактный набор внутренних признаков, уже присутствующие в базовой модели после предварительного обучения, но находящиеся в «спящем» или недостаточно активированном состоянии, которые действуют как "универсальный движок рассуждений".
Gyan: An Explainable Neuro-Symbolic Language Model
Гьян: Объяснимая нейро-символьная языковая модель
https://www.alphaxiv.org/overview/2605.04759

Gyan представляет нейросимвольную архитектуру без использования трансформеров, которая обеспечивает полностью объяснимую и композиционную языковую модель, демонстрируя передовые результаты на таких бенчмарках, как MS MARCO, PubMedQA и MMLU-Medicine, при этом используя незначительные вычислительные ресурсы. Модель создает прозрачное представление значения для уменьшения галлюцинаций и улучшения интерпретируемости.
NOBLE: Accelerating Transformers with Nonlinear Low-Rank Branches
NOBLE: Ускорение Трансформеров с нелинейными низкоранговыми ветвями
https://www.alphaxiv.org/overview/2603.06492

Итан Смит разработал NOBLE, метод, который дополняет линейные слои Трансформера нелинейными низкоранговыми ветвями, специально предназначенными для предварительного обучения моделей с нуля. Эта архитектурная модификация позволила сократить количество шагов обучения до 1,47 раза и увеличить общую скорость настенных часов в 1,17-1,22 раза для моделей до 1,5 миллиарда параметров, неизменно обеспечивая меньшие потери при оценке в различных задачах.

———

Расширяет линейные слои подобно LoRA с помощью низкоранговой ветви, но с нелинейностью CosNet.
Spring-block theory of feature learning in deep neural networks
Пружинно-блочная теория обучения признакам в глубоких нейронных сетях
https://www.alphaxiv.org/overview/2407.19353

Исследователи разработали теорию пружинно-блочной цепи для моделирования извлечения признаков в глубоких нейронных сетях, демонстрируя, что динамика обучения ГНС может быть сопоставлена с фазовой диаграммой шум-нелинейность, где линейное распределение разделения данных по слоям коррелирует с более высокой точностью тестирования.

———

Теория пружинно-маятникового механизма показывает сильную корреляцию между линейностью кривой нагрузки и обобщающей способностью.
❤1
Заменим людей на роботов, они будут вкалывать 24/7.

Робот, — С меня хватит.

https://d.fixupx.com/SetPixels/status/2054710299702575269
🔥
Revisiting Transformer Layer Parameterization Through Causal Energy Minimization
Пересмотр параметризации слоя трансформера посредством минимизации причинной энергии
https://www.alphaxiv.org/overview/2605.07588

Исследователи из Microsoft представили Causal Energy Minimization (CEM) – фреймворк, который переосмысливает слои Трансформера как шаги оптимизации на условных энергетических функциях, формально выводя существующие параметризации Multi-Head Attention и Gated MLP и позволяя разрабатывать новые, более параметрически эффективные варианты. Модели, полученные с помощью CEM, с рекурсивными обновлениями достигли тестовой перплексии, сравнимой с базовыми показателями Llama при умеренных масштабах, используя при этом меньше параметров.

———

Слои attention и MLP – это "физическая" реализация шагов оптимизации энергетических функций. Соответственно, дублирование слоёв как и их зацикливание в "рассуждающих" моделях – это просто несколько дополнительных шагов градиентного спуска минимизации энергетической функции.
Грогу на красной дорожке на премьере сериала «The Mandalorian and Grogu» в Лос-Анджелесе.

https://d.fixupx.com/Variety/status/2055084203872788537
A Single-Layer Model Can Do Language Modeling
Однослойная модель может выполнять языковое моделирование
https://www.alphaxiv.org/overview/2605.10643
https://github.com/steve-z-wang/grounded-prediction-network

Предлагается однослойная рекуррентная архитектура, Grounded Prediction Networks (GPNs), для языкового моделирования, черпающая вдохновение из временной глубины биологических систем. Вариант GPN+M достиг перплексии FineWeb в 18.06, и его централизованная матричная память спонтанно разделилась на функционально различные пулы быстрого и медленного сохранения во время обучения.
🔥
Deep Learning as Neural Low-Degree Filtering: A Spectral Theory of Hierarchical Feature Learning
Глубокое обучение как нейронная низкостепенная фильтрация: Спектральная теория иерархического изучения признаков
https://www.alphaxiv.org/overview/2605.13612
https://github.com/IdePHICS/Neural-LoFi-Theory

В этой статье представлена нейронная низкостепенная фильтрация (Neural LoFi), теоретическая основа, объясняющая, как глубокие нейронные сети обучаются иерархическим представлениям с помощью итеративной спектральной процедуры, где каждый слой выбирает признаки на основе низкой сложности и высокой корреляции с меткой по низкостепенным статистикам. Neural LoFi, алгоритм без обратного распространения ошибки, достигает производительности, сравнимой с градиентным спуском, и количественно предсказывает требуемую сложность выборки для появления признаков.
🔥1
The Truth Lies Somewhere in the Middle (of the Generated Tokens)
Истина лежит где-то посередине (сгенерированных токенов)
https://www.alphaxiv.org/overview/2605.09969
https://github.com/sophicle/tokens

Исследователи из MIT демонстрируют, что усреднение скрытых состояний токенов, генерируемых авторегрессионными языковыми моделями, дает высококачественные семантические представления, превосходящие эмбеддинги, полученные из токенов подсказки. Этот метод, оцененный в областях "зрение-язык", рассуждения и белков, показывает, что семантическая информация распределена по траектории генерации и позволяет идентифицировать интерпретируемые фазы представления.