Sparse Hash AI
176 subscribers
189 photos
279 videos
4 files
624 links
AI обогатительная разработка ML месторождений. Осторожно, в канале ведутся подрывные работы!
Download Telegram
The Structural Origin of Attention Sink: Variance Discrepancy, Super Neurons, and Dimension Disparity
Структурное происхождение аттеншн-синка: несоответствие дисперсий, супернейроны и неравенство размерностей
https://www.alphaxiv.org/overview/2605.06611

Это исследование предоставляет механистическое объяснение появления «коллекторов внимания» (attention sinks) в трансформерах только с декодером, определяя несоответствие позиционной дисперсии, вызванное причинным маскированием, как первопричину. Работа представляет Head-wise RMSNorm, архитектурную модификацию, которая стабилизирует агрегацию значений, ускоряя сходимость предварительного обучения и предотвращая коллапс представлений.

———

Истоки аттеншн-синка начального токена лежат в том, что никакого усреднения (агрегации) векторов "значений" в механизме внимания у него не происходит. Неагрегированный (обращает внимание только на самого себя) токен сохраняет высокую дисперсию и потому становится аттеншн-синком. Далее матрица выходной проекции пропускает высокодисперсный сигнал в остаточный поток, а супернейроны в FFN усиливают его. Всё это затем закрепляется в проекционных матрицах внимания.
Why Does Reinforcement Learning Generalize? A Feature-Level Mechanistic Study of Post-Training in Large Language Models
Почему обучение с подкреплением обобщает? Механистическое исследование пост-обучения на уровне признаков в больших языковых моделях
https://www.alphaxiv.org/overview/2604.25011

Механистическое исследование выясняет, почему пост-обучение с подкреплением (RL) улучшает обобщение в больших языковых моделях, в то время как контролируемая донастройка (SFT) часто приводит к забыванию, выявляя, что RL в основном перевзвешивает существующие признаки для обеспечения надежного, не зависящего от задачи обобщения, в отличие от SFT, которое вводит множество специализированных признаков.

———

RL выявляет и усиливает компактный набор внутренних признаков, уже присутствующие в базовой модели после предварительного обучения, но находящиеся в «спящем» или недостаточно активированном состоянии, которые действуют как "универсальный движок рассуждений".
Gyan: An Explainable Neuro-Symbolic Language Model
Гьян: Объяснимая нейро-символьная языковая модель
https://www.alphaxiv.org/overview/2605.04759

Gyan представляет нейросимвольную архитектуру без использования трансформеров, которая обеспечивает полностью объяснимую и композиционную языковую модель, демонстрируя передовые результаты на таких бенчмарках, как MS MARCO, PubMedQA и MMLU-Medicine, при этом используя незначительные вычислительные ресурсы. Модель создает прозрачное представление значения для уменьшения галлюцинаций и улучшения интерпретируемости.
NOBLE: Accelerating Transformers with Nonlinear Low-Rank Branches
NOBLE: Ускорение Трансформеров с нелинейными низкоранговыми ветвями
https://www.alphaxiv.org/overview/2603.06492

Итан Смит разработал NOBLE, метод, который дополняет линейные слои Трансформера нелинейными низкоранговыми ветвями, специально предназначенными для предварительного обучения моделей с нуля. Эта архитектурная модификация позволила сократить количество шагов обучения до 1,47 раза и увеличить общую скорость настенных часов в 1,17-1,22 раза для моделей до 1,5 миллиарда параметров, неизменно обеспечивая меньшие потери при оценке в различных задачах.

———

Расширяет линейные слои подобно LoRA с помощью низкоранговой ветви, но с нелинейностью CosNet.
Spring-block theory of feature learning in deep neural networks
Пружинно-блочная теория обучения признакам в глубоких нейронных сетях
https://www.alphaxiv.org/overview/2407.19353

Исследователи разработали теорию пружинно-блочной цепи для моделирования извлечения признаков в глубоких нейронных сетях, демонстрируя, что динамика обучения ГНС может быть сопоставлена с фазовой диаграммой шум-нелинейность, где линейное распределение разделения данных по слоям коррелирует с более высокой точностью тестирования.

———

Теория пружинно-маятникового механизма показывает сильную корреляцию между линейностью кривой нагрузки и обобщающей способностью.
❤1
Заменим людей на роботов, они будут вкалывать 24/7.

Робот, — С меня хватит.

https://d.fixupx.com/SetPixels/status/2054710299702575269
🔥
Revisiting Transformer Layer Parameterization Through Causal Energy Minimization
Пересмотр параметризации слоя трансформера посредством минимизации причинной энергии
https://www.alphaxiv.org/overview/2605.07588

Исследователи из Microsoft представили Causal Energy Minimization (CEM) – фреймворк, который переосмысливает слои Трансформера как шаги оптимизации на условных энергетических функциях, формально выводя существующие параметризации Multi-Head Attention и Gated MLP и позволяя разрабатывать новые, более параметрически эффективные варианты. Модели, полученные с помощью CEM, с рекурсивными обновлениями достигли тестовой перплексии, сравнимой с базовыми показателями Llama при умеренных масштабах, используя при этом меньше параметров.

———

Слои attention и MLP – это "физическая" реализация шагов оптимизации энергетических функций. Соответственно, дублирование слоёв как и их зацикливание в "рассуждающих" моделях – это просто несколько дополнительных шагов градиентного спуска минимизации энергетической функции.
Грогу на красной дорожке на премьере сериала «The Mandalorian and Grogu» в Лос-Анджелесе.

https://d.fixupx.com/Variety/status/2055084203872788537
A Single-Layer Model Can Do Language Modeling
Однослойная модель может выполнять языковое моделирование
https://www.alphaxiv.org/overview/2605.10643
https://github.com/steve-z-wang/grounded-prediction-network

Предлагается однослойная рекуррентная архитектура, Grounded Prediction Networks (GPNs), для языкового моделирования, черпающая вдохновение из временной глубины биологических систем. Вариант GPN+M достиг перплексии FineWeb в 18.06, и его централизованная матричная память спонтанно разделилась на функционально различные пулы быстрого и медленного сохранения во время обучения.
🔥
Deep Learning as Neural Low-Degree Filtering: A Spectral Theory of Hierarchical Feature Learning
Глубокое обучение как нейронная низкостепенная фильтрация: Спектральная теория иерархического изучения признаков
https://www.alphaxiv.org/overview/2605.13612
https://github.com/IdePHICS/Neural-LoFi-Theory

В этой статье представлена нейронная низкостепенная фильтрация (Neural LoFi), теоретическая основа, объясняющая, как глубокие нейронные сети обучаются иерархическим представлениям с помощью итеративной спектральной процедуры, где каждый слой выбирает признаки на основе низкой сложности и высокой корреляции с меткой по низкостепенным статистикам. Neural LoFi, алгоритм без обратного распространения ошибки, достигает производительности, сравнимой с градиентным спуском, и количественно предсказывает требуемую сложность выборки для появления признаков.
🔥1
The Truth Lies Somewhere in the Middle (of the Generated Tokens)
Истина лежит где-то посередине (сгенерированных токенов)
https://www.alphaxiv.org/overview/2605.09969
https://github.com/sophicle/tokens

Исследователи из MIT демонстрируют, что усреднение скрытых состояний токенов, генерируемых авторегрессионными языковыми моделями, дает высококачественные семантические представления, превосходящие эмбеддинги, полученные из токенов подсказки. Этот метод, оцененный в областях "зрение-язык", рассуждения и белков, показывает, что семантическая информация распределена по траектории генерации и позволяет идентифицировать интерпретируемые фазы представления.
Sparse Hash AI
The Truth Lies Somewhere in the Middle (of the Generated Tokens) Истина лежит где-то посередине (сгенерированных токенов) https://www.alphaxiv.org/overview/2605.09969 https://github.com/sophicle/tokens Исследователи из MIT демонстрируют, что усреднение скрытых…
💡

Последовательность скрытых представлений сгенерированных токенов как шаги оптимизации семантического представления

В работе скрытые представления суммировались в качественное семантическое представление. Если скрытое представление представить как шаг оптимизации семантического описания последовательности, а не сжатие её в это представление, то суммирование представлений – это суммирование шагов оптимизации семантического описания. При этом каждый шаг в отдельности не будет столь информативен, что наблюдается на практике.

Хотя можно было бы ожидать, что «конечный» токен генерации будет наиболее информативным, действуя как краткое изложение последовательности, эмпирические данные говорят об обратном.


Кроме того эта сходимость семантического представления, кмк, может быть связана со сходимостью в неявной оптимизации во время ICL.
Stories in Space: In-Context Learning Trajectories in Conceptual Belief Space
Истории в Пространстве: Траектории обучения в контексте в Пространстве концептуальных убеждений
https://www.alphaxiv.org/overview/2605.12412

Исследователи изучили, как большие языковые модели обновляют свои убеждения во время обучения в контексте, моделируя этот процесс как траектории через «пространства концептуальных убеждений», которые представляют собой низкоразмерные, геометрически структурированные представления понятий. Они обнаружили, что эта динамика убеждений линейно декодируется из внутренних активаций, а причинно-следственные интервенции по управлению подтвердили функциональную значимость и геометрическую взаимосвязанность этих концептуальных представлений.

———

Работа исследует как LLM представляют и обновляют сложные, абстрактные концепции — такие как "счастье", "напряжение" или "трагедия" — при обработке текста. Можно видеть как внутреннее "убеждение" модели о мире развивается со временем. Это демонстрирует, что даже когда LLM не получает прямого запроса думать о таких понятиях, как "гнев" или "приключение", она внутренне поддерживает представление этих концепций.