Sparse Hash AI
176 subscribers
189 photos
279 videos
4 files
623 links
AI обогатительная разработка ML месторождений. Осторожно, в канале ведутся подрывные работы!
Download Telegram
Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning
Случайное Внимание: Переосмысление Вытеснения из KV-кэша для Эффективного Рассуждения
https://www.alphaxiv.org/abs/2609.03430

———

Часть кэша можно отбрасывать просто случайным образом и качество будет сопоставимо с сильнейшим из методов вытеснения, но не для задачи «иголка в стоге сена», где метод терпит неудачу. И основное открытие работы – не трогать промпт.
Language Models Can Control Their Own Attention
Языковые модели могут управлять своим вниманием
https://www.alphaxiv.org/abs/2609.02737

———

LLM дали возможность самой решать на какую часть кэша смотреть: глобальную, локальную или фрагмент. Это не требует обучения весов, достаточно LLM в промпте показать («zero-shot») как через теги управлять внешним механизмом обновления маски внимания для следующих шагов генерации.
Multi-Head Self Attention is a Parameter Identification Mechanism
Многоголовочное самовнимание — это механизм идентификации параметров
https://www.alphaxiv.org/abs/2609.01231

———

Дано математическое обоснование MHA – использование нескольких голов вместо одной большой значительно улучшает долю параметров, которые уникально значимы для вывода модели – «идентифицируемые».

В одноголовом внимании половина параметров «неидентифицируемые» – бесполезные, на них впустую тратятся вычисления. В MHA по мере увеличения числа голов доля полезных весов приближается к 1.
Lngram v2: Latent N-Gram Memory with Interpretable Discrete Representations
Lngram v2: Латентная N-грамная память с интерпретируемыми дискретными представлениями
https://www.alphaxiv.org/abs/2609.03426

———

В основе Lngram v2 лежит преобразование непрерывных скрытых состояний в дискретные сигнатуры.
Дискретизируя непрерывные скрытые состояния в обучаемые «символы» и сохраняя их в точной n-граммной памяти, архитектура позволяет модели извлекать релевантную информацию, используя дискретные адреса, а не только плотное внимание.
🔥1
⚒️

Параллельный трансформер

Сделал вот такую архитектуру c блоками трансформера, включенными параллельно, но их выходы суммируются через остаточное соединение. Также у каждого блока свой отдельный слой эмбеддинга.

После добавления NITP получил инверсный разрыв обобщения (разница между ошибкой обучения и ошибкой тестирования) – запоминание отстаёт от обобщения.
👍1
Fingers as Legs: Learning Self-Supported Locomotion and Manipulation with an Anthropomorphic Hand
Пальцы вместо ног: обучение самоопорному передвижению и манипулированию с помощью антропоморфной кисти
https://www.alphaxiv.org/abs/2609.17172

https://d.fixupx.com/CyberRobooo/status/2100236102561087547
A Mathematical Theory of Reusable Neural Bases for Network Compression
Математическая теория повторно используемых нейронных базисов для сжатия сетей
https://www.alphaxiv.org/abs/2609.01550

———

Сокращает число параметров, представляя слои MLP и головы внимания как взвешенные суммы повторно используемых нелинейных базисных функций.

Также предлагает интерпретацию нейронных базисных функций через векторные поля. Разные слои могут выбирать различные комбинации одних и тех же полей, объединяясь, они формируют более разнообразные поля.
Your Transformer Can Hold Two Thoughts at Once: Evidence of Linear Superposition in LLMs
Ваш трансформер способен одновременно удерживать две мысли: свидетельства линейной суперпозиции в больших языковых моделях
https://www.alphaxiv.org/abs/2609.29845

———

Если на вход LLM одновременно подать усреднённые эмбеддинги от двух входных текстов, то на выходе модель продолжит оба текста сразу (суперпозиция распределений вероятностей следующих токенов).

суперпозиция является внутренним свойством архитектуры Transformer, а не возникающим в результате обучения эффектом

мы предлагаем процедуру управляемого декодирования, которая разделяет суперпозиционные выходы и позволяет одновременно генерировать два связных продолжения за один прямой проход.
LLM Layers Immediately Correct Each Other
Слои LLM немедленно корректируют друг друга
https://www.alphaxiv.org/abs/2609.07876

———

Слой трансформера избирательно исправляет часть вклада предыдущего слоя, одновременно внося собственный вклад.

В 5 из 7 протестированных моделях следующий слой (attention + MLP) трансформера выборочно удаляет из остаточного потока признаки, только что добавленные в него предыдущим слоем.

Слой i+1 корректирует свой выход в ответ на вклад слоя i, этим занимаются первые две трети слоёв. Анти-корреляция находится между MLP соседних блоков, тогда как вклады attention в среднем положительно коррелируют.

Эта функциональность развивается во время обучения, а не является архитектурной особенностью.

Например, когда токен «202» встречается в числе «1,808,202», слой i может одновременно активировать направления, соответствующие «сотне», «тысяче» и «миллиону», тогда как слой i+1, имея доступ к соседним цифрам, отменяет все направления, кроме «миллиона».
🔥1
ARM: Attention with Routed-Memory for Learnable Sparse Control
ARM: внимание с маршрутизируемой памятью для обучаемого разреженного управления
https://www.alphaxiv.org/abs/2609.24417

———

Модель хранит кеш в памяти фиксированного размера, объединяет новую информацию с содержимым выбранных ячеек и позволяет модели выбирать, сколько блоков памяти извлекать для каждого входного текста.
👍1
Global Divergence, Local Convergence: Representation Geometry in SSMs and Transformers
Глобальное расхождение, локальное сближение: геометрия представлений в SSM и трансформерах
https://www.alphaxiv.org/abs/2609.08692

SSM равномерно распределяют информацию о представлениях по всем измерениям, тогда как в представлениях трансформеров доминирует одно главное направление

обе архитектуры обладают практически одинаковой эффективной емкостью

обе архитектуры кодируют понятия в подпространствах удивительно близкой размерности

доминирующее главное направление трансформеров само по себе не кодирует больше концептуальной информации