T^2MLR: Transformer with Temporal Middle-Layer Recurrence
T^2MLR: Трансформер с временной среднеслойной рекуррентностью
https://www.alphaxiv.org/abs/2607.15178
———
Добавили рекуррентность к средним слоям. CE упала незначительно, но улучшился ризонинг.
T^2MLR: Трансформер с временной среднеслойной рекуррентностью
https://www.alphaxiv.org/abs/2607.15178
———
Добавили рекуррентность к средним слоям. CE упала незначительно, но улучшился ризонинг.
LoGo: Token-Level Dynamic Local-Global Attention
LoGo: Динамическое локально-глобальное внимание на уровне токенов
https://www.alphaxiv.org/abs/2608.29539
———
Для каждого токена принимается решение – требуется ли токену глобальный контекст или только локальный.
Наверно можно использовать совместно с Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry
LoGo: Динамическое локально-глобальное внимание на уровне токенов
https://www.alphaxiv.org/abs/2608.29539
———
Для каждого токена принимается решение – требуется ли токену глобальный контекст или только локальный.
Наверно можно использовать совместно с Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry
Sliding-window beats linear attention
Скользящее окно превосходит линейное внимание
https://www.alphaxiv.org/abs/2608.28444
———
Скользящее окно со стоками (attention sinks) лучше линейного внимания, даже когда окно длиной всего 64 токена.
———
Кмк не хватает кэша для сохранения части глобальной информации, как сделано в A Hippocampus for Linear Attention: An Exact Memory for What the Recurrent State Forgets.
Скользящее окно превосходит линейное внимание
https://www.alphaxiv.org/abs/2608.28444
———
Скользящее окно со стоками (attention sinks) лучше линейного внимания, даже когда окно длиной всего 64 токена.
———
Кмк не хватает кэша для сохранения части глобальной информации, как сделано в A Hippocampus for Linear Attention: An Exact Memory for What the Recurrent State Forgets.
Normalized Low-Rank Adaptation
Нормализованная низкоранговая адаптация
https://www.alphaxiv.org/abs/2608.31036
———
Нормализуют матрицу нисходящей проекции в LoRA, что обеспечивает хорошую обусловленность латентного представления.
На тесте NoRA последовательно превосходила стандартную LoRA и PiSSA, DoRA и RSLoRA.
Нормализованная низкоранговая адаптация
https://www.alphaxiv.org/abs/2608.31036
———
Нормализуют матрицу нисходящей проекции в LoRA, что обеспечивает хорошую обусловленность латентного представления.
На тесте NoRA последовательно превосходила стандартную LoRA и PiSSA, DoRA и RSLoRA.
Headless 4NE1 Walks through Zurich
https://www.youtube.com/watch?v=tZO97d281hY
https://d.fixupx.com/ZappyZappy7/status/2093012813518369279
https://www.youtube.com/watch?v=tZO97d281hY
https://d.fixupx.com/ZappyZappy7/status/2093012813518369279
Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning
Случайное Внимание: Переосмысление Вытеснения из KV-кэша для Эффективного Рассуждения
https://www.alphaxiv.org/abs/2609.03430
———
Часть кэша можно отбрасывать просто случайным образом и качество будет сопоставимо с сильнейшим из методов вытеснения, но не для задачи «иголка в стоге сена», где метод терпит неудачу. И основное открытие работы – не трогать промпт.
Случайное Внимание: Переосмысление Вытеснения из KV-кэша для Эффективного Рассуждения
https://www.alphaxiv.org/abs/2609.03430
———
Часть кэша можно отбрасывать просто случайным образом и качество будет сопоставимо с сильнейшим из методов вытеснения, но не для задачи «иголка в стоге сена», где метод терпит неудачу. И основное открытие работы – не трогать промпт.
Language Models Can Control Their Own Attention
Языковые модели могут управлять своим вниманием
https://www.alphaxiv.org/abs/2609.02737
———
LLM дали возможность самой решать на какую часть кэша смотреть: глобальную, локальную или фрагмент. Это не требует обучения весов, достаточно LLM в промпте показать («zero-shot») как через теги управлять внешним механизмом обновления маски внимания для следующих шагов генерации.
Языковые модели могут управлять своим вниманием
https://www.alphaxiv.org/abs/2609.02737
———
LLM дали возможность самой решать на какую часть кэша смотреть: глобальную, локальную или фрагмент. Это не требует обучения весов, достаточно LLM в промпте показать («zero-shot») как через теги управлять внешним механизмом обновления маски внимания для следующих шагов генерации.
Multi-Head Self Attention is a Parameter Identification Mechanism
Многоголовочное самовнимание — это механизм идентификации параметров
https://www.alphaxiv.org/abs/2609.01231
———
Дано математическое обоснование MHA – использование нескольких голов вместо одной большой значительно улучшает долю параметров, которые уникально значимы для вывода модели – «идентифицируемые».
В одноголовом внимании половина параметров «неидентифицируемые» – бесполезные, на них впустую тратятся вычисления. В MHA по мере увеличения числа голов доля полезных весов приближается к 1.
Многоголовочное самовнимание — это механизм идентификации параметров
https://www.alphaxiv.org/abs/2609.01231
———
Дано математическое обоснование MHA – использование нескольких голов вместо одной большой значительно улучшает долю параметров, которые уникально значимы для вывода модели – «идентифицируемые».
В одноголовом внимании половина параметров «неидентифицируемые» – бесполезные, на них впустую тратятся вычисления. В MHA по мере увеличения числа голов доля полезных весов приближается к 1.
Lngram v2: Latent N-Gram Memory with Interpretable Discrete Representations
Lngram v2: Латентная N-грамная память с интерпретируемыми дискретными представлениями
https://www.alphaxiv.org/abs/2609.03426
———
В основе Lngram v2 лежит преобразование непрерывных скрытых состояний в дискретные сигнатуры.
Lngram v2: Латентная N-грамная память с интерпретируемыми дискретными представлениями
https://www.alphaxiv.org/abs/2609.03426
———
В основе Lngram v2 лежит преобразование непрерывных скрытых состояний в дискретные сигнатуры.
Дискретизируя непрерывные скрытые состояния в обучаемые «символы» и сохраняя их в точной n-граммной памяти, архитектура позволяет модели извлекать релевантную информацию, используя дискретные адреса, а не только плотное внимание.
🔥1
⚒️
Параллельный трансформер
Сделал вот такую архитектуру c блоками трансформера, включенными параллельно, но их выходы суммируются через остаточное соединение. Также у каждого блока свой отдельный слой эмбеддинга.
После добавления NITP получил инверсный разрыв обобщения (разница между ошибкой обучения и ошибкой тестирования) – запоминание отстаёт от обобщения.
Параллельный трансформер
Сделал вот такую архитектуру c блоками трансформера, включенными параллельно, но их выходы суммируются через остаточное соединение. Также у каждого блока свой отдельный слой эмбеддинга.
После добавления NITP получил инверсный разрыв обобщения (разница между ошибкой обучения и ошибкой тестирования) – запоминание отстаёт от обобщения.
👍1
Fingers as Legs: Learning Self-Supported Locomotion and Manipulation with an Anthropomorphic Hand
Пальцы вместо ног: обучение самоопорному передвижению и манипулированию с помощью антропоморфной кисти
https://www.alphaxiv.org/abs/2609.17172
https://d.fixupx.com/CyberRobooo/status/2100236102561087547
Пальцы вместо ног: обучение самоопорному передвижению и манипулированию с помощью антропоморфной кисти
https://www.alphaxiv.org/abs/2609.17172
https://d.fixupx.com/CyberRobooo/status/2100236102561087547
A Mathematical Theory of Reusable Neural Bases for Network Compression
Математическая теория повторно используемых нейронных базисов для сжатия сетей
https://www.alphaxiv.org/abs/2609.01550
———
Сокращает число параметров, представляя слои MLP и головы внимания как взвешенные суммы повторно используемых нелинейных базисных функций.
Также предлагает интерпретацию нейронных базисных функций через векторные поля. Разные слои могут выбирать различные комбинации одних и тех же полей, объединяясь, они формируют более разнообразные поля.
Математическая теория повторно используемых нейронных базисов для сжатия сетей
https://www.alphaxiv.org/abs/2609.01550
———
Сокращает число параметров, представляя слои MLP и головы внимания как взвешенные суммы повторно используемых нелинейных базисных функций.
Также предлагает интерпретацию нейронных базисных функций через векторные поля. Разные слои могут выбирать различные комбинации одних и тех же полей, объединяясь, они формируют более разнообразные поля.