Sparse Hash AI
176 subscribers
189 photos
279 videos
4 files
624 links
AI обогатительная разработка ML месторождений. Осторожно, в канале ведутся подрывные работы!
Download Telegram
ARM: Attention with Routed-Memory for Learnable Sparse Control
ARM: внимание с маршрутизируемой памятью для обучаемого разреженного управления
https://www.alphaxiv.org/abs/2609.24417

———

Модель хранит кеш в памяти фиксированного размера, объединяет новую информацию с содержимым выбранных ячеек и позволяет модели выбирать, сколько блоков памяти извлекать для каждого входного текста.
👍1
Global Divergence, Local Convergence: Representation Geometry in SSMs and Transformers
Глобальное расхождение, локальное сближение: геометрия представлений в SSM и трансформерах
https://www.alphaxiv.org/abs/2609.08692

SSM равномерно распределяют информацию о представлениях по всем измерениям, тогда как в представлениях трансформеров доминирует одно главное направление

обе архитектуры обладают практически одинаковой эффективной емкостью

обе архитектуры кодируют понятия в подпространствах удивительно близкой размерности

доминирующее главное направление трансформеров само по себе не кодирует больше концептуальной информации
RiLM: Parameter-Efficient Language Modeling via Geodesic Decoding
RiLM: эффективное языковое моделирование с малым числом параметров посредством геодезического декодирования
https://www.alphaxiv.org/abs/2609.10305

———

Рекуррентная модель с гиперболической геометрией на шаре Пуанкаре.
🔥 A Unifying Perspective on Language Model Representations: From Filler-Role Structure to Mechanistic Interpretability
Объединяющая перспектива о представлениях языковых моделей: От ролево-слотовой структуры к механистической интерпретируемости
https://www.alphaxiv.org/abs/2608.29034

———

Представлена гипотеза тензорного произведения представлений (TPR) на замену гипотезе линейного представления (LRH) (предполагающей, что понятия представлены как направления в многомерном векторном пространстве).

В TPR информация скрытого состояния организована в пары наполнителей («что») и ролей («где» или «как»), например: «субъект» – «объект».

Представление понятия является композиционной структурой – это просто сумма тензорных произведений эмбеддингов связываемых пар* с последующей векторизацией.

* как сумма внешних произведений пар ключей и значений в RNN, связывающая и объединяющая их в одно общее состояние

Гипотеза TRP объясняет работу формулы «king − man + woman ≈ queen», линейного зондирования, разреженных автокодировщиков (SAE) и патчинга активаций.

TPR может точно имитировать скрытые состояния реальной, обученной нейронной сети.

Авторы построили собственные зонды-энкодеры и смогли достичь точности классификации, почти идентичной линейным зондам, обученным с помощью стандартных методов машинного обучения.

Также авторы аналитически вывели веса для SAE и обнаружили, что SAE, построенные из TPEs, достигали высокого качества реконструкции и идентифицировали значимые признаки.

Патчинг на основе TPE дал результаты, которые были практически неотличимы от стандартного патчинга, с корреляцией около 1.0.

TPEs аппроксимировали состояния рекуррентных нейронных сетей (RNN и LSTM) с точностью замещения более 99.9%. Это означает, что если заменить внутреннее состояние RNN на рассчитанное состояние TPE, RNN продолжает функционировать идеально.
🔥3
Forwarded from Futuris (Anton)
This media is not supported in your browser
VIEW IN TELEGRAM
как делают передовые модели🥳🥳🤭
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2
A Model with No Head and Many Thoughts
Модель без головы и множеством мыслей
https://www.alphaxiv.org/abs/2608.31069

———

Soft Latent Thinking – метод, который во время рассуждения заменяет LM-голову на легковесный проектор, обеспечивая авторегрессивное развертывание в пространстве эмбеддингов, где шаги рассуждения остаются непрерывными, а не токенизированными.
3D реинкарнация восьмибиток

https://d.fixupx.com/voxelphotonics/status/2084106023405818028
A Controlled Study of Attention-Only Transformers
Контролируемое исследование трансформеров, использующих только внимание
https://www.alphaxiv.org/abs/2607.18363

———

Считается, что слои FFN служат «параметрической памятью» модели, функционируя как хранилища ключ-значение. В работе исследовалась упрощенная архитектура трансформера с удалёнными слоями FFN (Simple Attention Networks, SANs).

При равном количестве параметров разницы в производительности между SAN и FFN-трансформерами практически нет. SAN испытывает трудности только при недостаточном контексте и превосходит модель с FFN, когда его достаточно.

В SAN матрица выходной проекции внимания берёт на себя роль, обычно выполняемую FFN, действуя как основное хранилище изученного контента.
🔥1