ARM: Attention with Routed-Memory for Learnable Sparse Control
ARM: внимание с маршрутизируемой памятью для обучаемого разреженного управления
https://www.alphaxiv.org/abs/2609.24417
———
Модель хранит кеш в памяти фиксированного размера, объединяет новую информацию с содержимым выбранных ячеек и позволяет модели выбирать, сколько блоков памяти извлекать для каждого входного текста.
ARM: внимание с маршрутизируемой памятью для обучаемого разреженного управления
https://www.alphaxiv.org/abs/2609.24417
———
Модель хранит кеш в памяти фиксированного размера, объединяет новую информацию с содержимым выбранных ячеек и позволяет модели выбирать, сколько блоков памяти извлекать для каждого входного текста.
👍1
Global Divergence, Local Convergence: Representation Geometry in SSMs and Transformers
Глобальное расхождение, локальное сближение: геометрия представлений в SSM и трансформерах
https://www.alphaxiv.org/abs/2609.08692
Глобальное расхождение, локальное сближение: геометрия представлений в SSM и трансформерах
https://www.alphaxiv.org/abs/2609.08692
SSM равномерно распределяют информацию о представлениях по всем измерениям, тогда как в представлениях трансформеров доминирует одно главное направление
обе архитектуры обладают практически одинаковой эффективной емкостью
обе архитектуры кодируют понятия в подпространствах удивительно близкой размерности
доминирующее главное направление трансформеров само по себе не кодирует больше концептуальной информации
RiLM: Parameter-Efficient Language Modeling via Geodesic Decoding
RiLM: эффективное языковое моделирование с малым числом параметров посредством геодезического декодирования
https://www.alphaxiv.org/abs/2609.10305
———
Рекуррентная модель с гиперболической геометрией на шаре Пуанкаре.
RiLM: эффективное языковое моделирование с малым числом параметров посредством геодезического декодирования
https://www.alphaxiv.org/abs/2609.10305
———
Рекуррентная модель с гиперболической геометрией на шаре Пуанкаре.
🔥 A Unifying Perspective on Language Model Representations: From Filler-Role Structure to Mechanistic Interpretability
Объединяющая перспектива о представлениях языковых моделей: От ролево-слотовой структуры к механистической интерпретируемости
https://www.alphaxiv.org/abs/2608.29034
———
Представлена гипотеза тензорного произведения представлений (TPR) на замену гипотезе линейного представления (LRH) (предполагающей, что понятия представлены как направления в многомерном векторном пространстве).
В TPR информация скрытого состояния организована в пары наполнителей («что») и ролей («где» или «как»), например: «субъект» – «объект».
Представление понятия является композиционной структурой – это просто сумма тензорных произведений эмбеддингов связываемых пар* с последующей векторизацией.
* как сумма внешних произведений пар ключей и значений в RNN, связывающая и объединяющая их в одно общее состояние
Гипотеза TRP объясняет работу формулы «king − man + woman ≈ queen», линейного зондирования, разреженных автокодировщиков (SAE) и патчинга активаций.
TPR может точно имитировать скрытые состояния реальной, обученной нейронной сети.
Авторы построили собственные зонды-энкодеры и смогли достичь точности классификации, почти идентичной линейным зондам, обученным с помощью стандартных методов машинного обучения.
Также авторы аналитически вывели веса для SAE и обнаружили, что SAE, построенные из TPEs, достигали высокого качества реконструкции и идентифицировали значимые признаки.
Патчинг на основе TPE дал результаты, которые были практически неотличимы от стандартного патчинга, с корреляцией около 1.0.
TPEs аппроксимировали состояния рекуррентных нейронных сетей (RNN и LSTM) с точностью замещения более 99.9%. Это означает, что если заменить внутреннее состояние RNN на рассчитанное состояние TPE, RNN продолжает функционировать идеально.
Объединяющая перспектива о представлениях языковых моделей: От ролево-слотовой структуры к механистической интерпретируемости
https://www.alphaxiv.org/abs/2608.29034
———
Представлена гипотеза тензорного произведения представлений (TPR) на замену гипотезе линейного представления (LRH) (предполагающей, что понятия представлены как направления в многомерном векторном пространстве).
В TPR информация скрытого состояния организована в пары наполнителей («что») и ролей («где» или «как»), например: «субъект» – «объект».
Представление понятия является композиционной структурой – это просто сумма тензорных произведений эмбеддингов связываемых пар* с последующей векторизацией.
* как сумма внешних произведений пар ключей и значений в RNN, связывающая и объединяющая их в одно общее состояние
Гипотеза TRP объясняет работу формулы «king − man + woman ≈ queen», линейного зондирования, разреженных автокодировщиков (SAE) и патчинга активаций.
TPR может точно имитировать скрытые состояния реальной, обученной нейронной сети.
Авторы построили собственные зонды-энкодеры и смогли достичь точности классификации, почти идентичной линейным зондам, обученным с помощью стандартных методов машинного обучения.
Также авторы аналитически вывели веса для SAE и обнаружили, что SAE, построенные из TPEs, достигали высокого качества реконструкции и идентифицировали значимые признаки.
Патчинг на основе TPE дал результаты, которые были практически неотличимы от стандартного патчинга, с корреляцией около 1.0.
TPEs аппроксимировали состояния рекуррентных нейронных сетей (RNN и LSTM) с точностью замещения более 99.9%. Это означает, что если заменить внутреннее состояние RNN на рассчитанное состояние TPE, RNN продолжает функционировать идеально.
🔥3
Forwarded from Futuris (Anton)
This media is not supported in your browser
VIEW IN TELEGRAM
как делают передовые модели🥳 🥳 🤭
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2
A Model with No Head and Many Thoughts
Модель без головы и множеством мыслей
https://www.alphaxiv.org/abs/2608.31069
———
Soft Latent Thinking – метод, который во время рассуждения заменяет LM-голову на легковесный проектор, обеспечивая авторегрессивное развертывание в пространстве эмбеддингов, где шаги рассуждения остаются непрерывными, а не токенизированными.
Модель без головы и множеством мыслей
https://www.alphaxiv.org/abs/2608.31069
———
Soft Latent Thinking – метод, который во время рассуждения заменяет LM-голову на легковесный проектор, обеспечивая авторегрессивное развертывание в пространстве эмбеддингов, где шаги рассуждения остаются непрерывными, а не токенизированными.
A Controlled Study of Attention-Only Transformers
Контролируемое исследование трансформеров, использующих только внимание
https://www.alphaxiv.org/abs/2607.18363
———
Считается, что слои FFN служат «параметрической памятью» модели, функционируя как хранилища ключ-значение. В работе исследовалась упрощенная архитектура трансформера с удалёнными слоями FFN (Simple Attention Networks, SANs).
При равном количестве параметров разницы в производительности между SAN и FFN-трансформерами практически нет. SAN испытывает трудности только при недостаточном контексте и превосходит модель с FFN, когда его достаточно.
В SAN матрица выходной проекции внимания берёт на себя роль, обычно выполняемую FFN, действуя как основное хранилище изученного контента.
Контролируемое исследование трансформеров, использующих только внимание
https://www.alphaxiv.org/abs/2607.18363
———
Считается, что слои FFN служат «параметрической памятью» модели, функционируя как хранилища ключ-значение. В работе исследовалась упрощенная архитектура трансформера с удалёнными слоями FFN (Simple Attention Networks, SANs).
При равном количестве параметров разницы в производительности между SAN и FFN-трансформерами практически нет. SAN испытывает трудности только при недостаточном контексте и превосходит модель с FFN, когда его достаточно.
В SAN матрица выходной проекции внимания берёт на себя роль, обычно выполняемую FFN, действуя как основное хранилище изученного контента.
🔥1