Your Transformer Can Hold Two Thoughts at Once: Evidence of Linear Superposition in LLMs
Ваш трансформер способен одновременно удерживать две мысли: свидетельства линейной суперпозиции в больших языковых моделях
https://www.alphaxiv.org/abs/2609.29845
———
Если на вход LLM одновременно подать усреднённые эмбеддинги от двух входных текстов, то на выходе модель продолжит оба текста сразу (суперпозиция распределений вероятностей следующих токенов).
Ваш трансформер способен одновременно удерживать две мысли: свидетельства линейной суперпозиции в больших языковых моделях
https://www.alphaxiv.org/abs/2609.29845
———
Если на вход LLM одновременно подать усреднённые эмбеддинги от двух входных текстов, то на выходе модель продолжит оба текста сразу (суперпозиция распределений вероятностей следующих токенов).
суперпозиция является внутренним свойством архитектуры Transformer, а не возникающим в результате обучения эффектом
мы предлагаем процедуру управляемого декодирования, которая разделяет суперпозиционные выходы и позволяет одновременно генерировать два связных продолжения за один прямой проход.
LLM Layers Immediately Correct Each Other
Слои LLM немедленно корректируют друг друга
https://www.alphaxiv.org/abs/2609.07876
———
Слой трансформера избирательно исправляет часть вклада предыдущего слоя, одновременно внося собственный вклад.
В 5 из 7 протестированных моделях следующий слой (attention + MLP) трансформера выборочно удаляет из остаточного потока признаки, только что добавленные в него предыдущим слоем.
Слой i+1 корректирует свой выход в ответ на вклад слоя i, этим занимаются первые две трети слоёв. Анти-корреляция находится между MLP соседних блоков, тогда как вклады attention в среднем положительно коррелируют.
Эта функциональность развивается во время обучения, а не является архитектурной особенностью.
Слои LLM немедленно корректируют друг друга
https://www.alphaxiv.org/abs/2609.07876
———
Слой трансформера избирательно исправляет часть вклада предыдущего слоя, одновременно внося собственный вклад.
В 5 из 7 протестированных моделях следующий слой (attention + MLP) трансформера выборочно удаляет из остаточного потока признаки, только что добавленные в него предыдущим слоем.
Слой i+1 корректирует свой выход в ответ на вклад слоя i, этим занимаются первые две трети слоёв. Анти-корреляция находится между MLP соседних блоков, тогда как вклады attention в среднем положительно коррелируют.
Эта функциональность развивается во время обучения, а не является архитектурной особенностью.
Например, когда токен «202» встречается в числе «1,808,202», слой i может одновременно активировать направления, соответствующие «сотне», «тысяче» и «миллиону», тогда как слой i+1, имея доступ к соседним цифрам, отменяет все направления, кроме «миллиона».
🔥1
ARM: Attention with Routed-Memory for Learnable Sparse Control
ARM: внимание с маршрутизируемой памятью для обучаемого разреженного управления
https://www.alphaxiv.org/abs/2609.24417
———
Модель хранит кеш в памяти фиксированного размера, объединяет новую информацию с содержимым выбранных ячеек и позволяет модели выбирать, сколько блоков памяти извлекать для каждого входного текста.
ARM: внимание с маршрутизируемой памятью для обучаемого разреженного управления
https://www.alphaxiv.org/abs/2609.24417
———
Модель хранит кеш в памяти фиксированного размера, объединяет новую информацию с содержимым выбранных ячеек и позволяет модели выбирать, сколько блоков памяти извлекать для каждого входного текста.
👍1
Global Divergence, Local Convergence: Representation Geometry in SSMs and Transformers
Глобальное расхождение, локальное сближение: геометрия представлений в SSM и трансформерах
https://www.alphaxiv.org/abs/2609.08692
Глобальное расхождение, локальное сближение: геометрия представлений в SSM и трансформерах
https://www.alphaxiv.org/abs/2609.08692
SSM равномерно распределяют информацию о представлениях по всем измерениям, тогда как в представлениях трансформеров доминирует одно главное направление
обе архитектуры обладают практически одинаковой эффективной емкостью
обе архитектуры кодируют понятия в подпространствах удивительно близкой размерности
доминирующее главное направление трансформеров само по себе не кодирует больше концептуальной информации
RiLM: Parameter-Efficient Language Modeling via Geodesic Decoding
RiLM: эффективное языковое моделирование с малым числом параметров посредством геодезического декодирования
https://www.alphaxiv.org/abs/2609.10305
———
Рекуррентная модель с гиперболической геометрией на шаре Пуанкаре.
RiLM: эффективное языковое моделирование с малым числом параметров посредством геодезического декодирования
https://www.alphaxiv.org/abs/2609.10305
———
Рекуррентная модель с гиперболической геометрией на шаре Пуанкаре.
🔥 A Unifying Perspective on Language Model Representations: From Filler-Role Structure to Mechanistic Interpretability
Объединяющая перспектива о представлениях языковых моделей: От ролево-слотовой структуры к механистической интерпретируемости
https://www.alphaxiv.org/abs/2608.29034
———
Представлена гипотеза тензорного произведения представлений (TPR) на замену гипотезе линейного представления (LRH) (предполагающей, что понятия представлены как направления в многомерном векторном пространстве).
В TPR информация скрытого состояния организована в пары наполнителей («что») и ролей («где» или «как»), например: «субъект» – «объект».
Представление понятия является композиционной структурой – это просто сумма тензорных произведений эмбеддингов связываемых пар* с последующей векторизацией.
* как сумма внешних произведений пар ключей и значений в RNN, связывающая и объединяющая их в одно общее состояние
Гипотеза TRP объясняет работу формулы «king − man + woman ≈ queen», линейного зондирования, разреженных автокодировщиков (SAE) и патчинга активаций.
TPR может точно имитировать скрытые состояния реальной, обученной нейронной сети.
Авторы построили собственные зонды-энкодеры и смогли достичь точности классификации, почти идентичной линейным зондам, обученным с помощью стандартных методов машинного обучения.
Также авторы аналитически вывели веса для SAE и обнаружили, что SAE, построенные из TPEs, достигали высокого качества реконструкции и идентифицировали значимые признаки.
Патчинг на основе TPE дал результаты, которые были практически неотличимы от стандартного патчинга, с корреляцией около 1.0.
TPEs аппроксимировали состояния рекуррентных нейронных сетей (RNN и LSTM) с точностью замещения более 99.9%. Это означает, что если заменить внутреннее состояние RNN на рассчитанное состояние TPE, RNN продолжает функционировать идеально.
Объединяющая перспектива о представлениях языковых моделей: От ролево-слотовой структуры к механистической интерпретируемости
https://www.alphaxiv.org/abs/2608.29034
———
Представлена гипотеза тензорного произведения представлений (TPR) на замену гипотезе линейного представления (LRH) (предполагающей, что понятия представлены как направления в многомерном векторном пространстве).
В TPR информация скрытого состояния организована в пары наполнителей («что») и ролей («где» или «как»), например: «субъект» – «объект».
Представление понятия является композиционной структурой – это просто сумма тензорных произведений эмбеддингов связываемых пар* с последующей векторизацией.
* как сумма внешних произведений пар ключей и значений в RNN, связывающая и объединяющая их в одно общее состояние
Гипотеза TRP объясняет работу формулы «king − man + woman ≈ queen», линейного зондирования, разреженных автокодировщиков (SAE) и патчинга активаций.
TPR может точно имитировать скрытые состояния реальной, обученной нейронной сети.
Авторы построили собственные зонды-энкодеры и смогли достичь точности классификации, почти идентичной линейным зондам, обученным с помощью стандартных методов машинного обучения.
Также авторы аналитически вывели веса для SAE и обнаружили, что SAE, построенные из TPEs, достигали высокого качества реконструкции и идентифицировали значимые признаки.
Патчинг на основе TPE дал результаты, которые были практически неотличимы от стандартного патчинга, с корреляцией около 1.0.
TPEs аппроксимировали состояния рекуррентных нейронных сетей (RNN и LSTM) с точностью замещения более 99.9%. Это означает, что если заменить внутреннее состояние RNN на рассчитанное состояние TPE, RNN продолжает функционировать идеально.
🔥3
Forwarded from Futuris (Anton)
This media is not supported in your browser
VIEW IN TELEGRAM
как делают передовые модели🥳 🥳 🤭
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2
A Model with No Head and Many Thoughts
Модель без головы и множеством мыслей
https://www.alphaxiv.org/abs/2608.31069
———
Soft Latent Thinking – метод, который во время рассуждения заменяет LM-голову на легковесный проектор, обеспечивая авторегрессивное развертывание в пространстве эмбеддингов, где шаги рассуждения остаются непрерывными, а не токенизированными.
Модель без головы и множеством мыслей
https://www.alphaxiv.org/abs/2608.31069
———
Soft Latent Thinking – метод, который во время рассуждения заменяет LM-голову на легковесный проектор, обеспечивая авторегрессивное развертывание в пространстве эмбеддингов, где шаги рассуждения остаются непрерывными, а не токенизированными.
A Controlled Study of Attention-Only Transformers
Контролируемое исследование трансформеров, использующих только внимание
https://www.alphaxiv.org/abs/2607.18363
———
Считается, что слои FFN служат «параметрической памятью» модели, функционируя как хранилища ключ-значение. В работе исследовалась упрощенная архитектура трансформера с удалёнными слоями FFN (Simple Attention Networks, SANs).
При равном количестве параметров разницы в производительности между SAN и FFN-трансформерами практически нет. SAN испытывает трудности только при недостаточном контексте и превосходит модель с FFN, когда его достаточно.
В SAN матрица выходной проекции внимания берёт на себя роль, обычно выполняемую FFN, действуя как основное хранилище изученного контента.
Контролируемое исследование трансформеров, использующих только внимание
https://www.alphaxiv.org/abs/2607.18363
———
Считается, что слои FFN служат «параметрической памятью» модели, функционируя как хранилища ключ-значение. В работе исследовалась упрощенная архитектура трансформера с удалёнными слоями FFN (Simple Attention Networks, SANs).
При равном количестве параметров разницы в производительности между SAN и FFN-трансформерами практически нет. SAN испытывает трудности только при недостаточном контексте и превосходит модель с FFN, когда его достаточно.
В SAN матрица выходной проекции внимания берёт на себя роль, обычно выполняемую FFN, действуя как основное хранилище изученного контента.
🔥1