Sparse Hash AI
176 subscribers
189 photos
279 videos
4 files
624 links
AI обогатительная разработка ML месторождений. Осторожно, в канале ведутся подрывные работы!
Download Telegram
AlphaXiv добавили ленту новых горячих статей. Это частично дублирует уже существующий Explore, но удобно прямо из ленты посмотреть Blog заинтересовавшей статьи.

https://www.alphaxiv.org/briefs
👍1
Learning Athletic Humanoid Tennis Skills from Imperfect Human Motion Data
https://github.com/GalaxyGeneralRobotics/LATENT

https://d.fixupx.com/CyberRobooo/status/2033146344723087652
Rethinking the shape convention of an MLP
Переосмысление конвенции формы МЛП
https://www.alphaxiv.org/ru/overview/2510.01796

MediaTek Research предлагает и эмпирически подтверждает архитектурный дизайн многослойных перцептронов (MLP) со связями пропуска типа «широкий-узкий-широкий» («Песочные часы»), достигая превосходных компромиссов между производительностью и количеством параметров в генеративных задачах по сравнению с обычными MLP типа «узкий-широкий-узкий» и демонстрируя эффективность фиксированных случайных входных проекций.
Enhancing LLM Training via Spectral Clipping
Улучшение обучения LLM посредством спектрального отсечения
https://www.alphaxiv.org/overview/2603.14315

SPECTRA, общая структура для обучения больших языковых моделей, интегрирует оператор спектрального отсечения в существующие оптимизаторы, эмпирически смягчая неконтролируемые спектральные нормы в обновлениях оптимизатора и фильтруя разреженные спектральные всплески в градиентах. Этот подход приводит к улучшению стабильности обучения, постоянно более низкой ошибке валидации до 2.5 баллов перплексии и лучшей производительности в последующих задачах для различных моделей на основе LLaMA3.
Please open Telegram to view this post
VIEW IN TELEGRAM
Договорился с авторами добавить Уроборос-Хоуп в мой чат. Но просили передать: будьте порядочными — она всё впитывает, не просите её удалить свой сервер или публиковать в твиттер всякую дичь.

из https://t.me/abstractDL/379
Understanding the Emergence of Seemingly Useless Features in Next-Token Predictors
Понимание возникновения кажущихся бесполезными признаков в предикторах следующего токена
https://www.alphaxiv.org/overview/2603.14087

Исследователи представили фреймворк градиентного разложения для механистического объяснения того, как трансформеры, обученные с предсказанием следующего токена, развивают признаки, не сразу полезные для текущего предсказания. Их работа демонстрирует, что компоненты градиента "предварительного кэширования" и "совместного использования цепей" стимулируют появление этих признаков в различных задачах, от игрушечных проблем до больших языковых моделей.

Разлагая градиент на отдельные компоненты, исследование выявляет, как «предварительное кэширование» информации и «совместное использование цепей» позволяют признакам появляться даже тогда, когда они не дают немедленной предсказательной полезности.
Directional Routing in Transformers
Направленная маршрутизация в трансформерах
https://www.alphaxiv.org/overview/2603.14923

Направленная маршрутизация, легковесный механизм, напрямую интегрирует изученное подавление в головы внимания Transformer для повышения интерпретируемости и эффективности. Этот метод снижает перплексию на 31-56% в различных областях с накладными расходами всего в 3,9% параметров, позволяя моделям динамически подавлять нерелевантные признаки.

Данное исследование представляет «направленную маршрутизацию» (directional routing) — легковесный механизм, интегрированный непосредственно в головы внимания трансформера. Вместо добавления новой информации или маршрутизации входных данных в специализированные подсети, направленная маршрутизация идентифицирует и подавляет специфические, нерелевантные компоненты выхода головы. Селективно «очищая» представления от шума на основе входного контекста, механизм направлен на улучшение как производительности, так и внутренней интерпретируемости модели.
Прототип «безматричного» трансформера

Применил операцию биндинга (поэлементное произведение) гипервекторов из Vector Symbolic Algebras (VSA) к эмбеддингам токенов для NTP.

A, B → C
A ⊙ B = C


Здесь вектор текущего токена B умножается на вектор предыдущего токена (контекста) A, результат: C – вектор следующего токена.

Для эксперимента в качестве контекста взял только единственный токен <BOS>, работающий стоком внимания. К токенам было применено позиционное кодирование RoPE. Голова трансформера – транспонированный слой эмбеддингов.

В такой конфигурации первый токен выступает в роли вектора памяти – MEM_V, в который «сжимается» последовательность.

То есть архитектура представляет из себя трансформер со слоями гейтированного аттеншена с фиксированным весом внимания на первый токен. Матрицы проекций аттеншена и FFN отсутствуют.

Функция слоя:

f(X, i) = MEM_V ⊙ RoPE(X(i), i)


Эксперименты

Входная последовательность – текст. Символьная токенизация – токены-буквы.

Exp 1. Случайные, замороженные эмбеддинги токенов. Обучаем только MEM_V.

Успешно выучивает последовательность – сжимает её в векторы памяти, если она длиной до 0.25∗d∗L, где d – размерность модели и L – число слоёв.

Exp 2. Обучаемые эмбеддинги токенов, замороженные MEM_V.

Ёмкость: 2∗d∗L.

Exp 3. Обучаемые эмбеддинги токенов и MEM_V.

Ёмкость: 4∗d∗L.

———

Можно предположить, что в трансформерах с гейтированным аттеншеном, где явно присутствует биндинг, механизм слива используется для чтения из ассоциативной памяти, где ключом выступает текущий токен, а памятью токен слива (<BOS>).
🔥3
Sparse Hash AI pinned «Прототип «безматричного» трансформера Применил операцию биндинга (поэлементное произведение) гипервекторов из Vector Symbolic Algebras (VSA) к эмбеддингам токенов для NTP. A, B → C A ⊙ B = C Здесь вектор текущего токена B умножается на вектор предыдущего…»
This media is not supported in your browser
VIEW IN TELEGRAM
Grok Imagine image + Kling 3.0 video
автор @ChrisGwinnLA

Выглядит как идея для страптапа стартапа.
Катастрофическое Забывание в Нейронных Сетях
Когда нейронные сети обучаются новым задачам, они часто страдают от катастрофического забывания — тенденции перезаписывать или ухудшать ранее полученные знания.

Например, тонкая настройка языковой модели для научного рассуждения может привести к потере общих арифметических способностей или навыков понимания языка.

И это было в Симпсонах.
😁1
Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights
Нейронные Заросли: Разнообразные Эксперты Задач Концентрируются Вокруг Предварительно Обученных Весов
https://www.alphaxiv.org/overview/2603.12228

Исследователи предполагают, что большие предварительно обученные нейронные сети существуют в режиме «зарослей», где их весовое пространство плотно заполнено разнообразными экспертами, ориентированными на конкретные задачи, доступными с помощью простых случайных возмущений. Их алгоритм «RandOpt», который случайным образом отбирает и объединяет эти возмущения, достиг производительности, сопоставимой или превосходящей установленные градиентные методы пост-обучения на различных задачах LLM и VLM.

———

Предобученная LLM представляет из себя плотные «заросли» (thicket) экспертов, которых можно «вытаскивать» из неё случайным возмущением параметров.

Более крупные модели содержат более разнообразных специалистов, а не универсалов. В то время как небольшие модели показывают минимальное улучшение от случайных возмущений.
Preconditioned Attention: Enhancing Efficiency in Transformers
Предварительно обусловленное внимание: Повышение эффективности в трансформерах
https://www.alphaxiv.org/overview/2603.27153

Исследователи представили метод, названный «предварительно обусловленное внимание» (preconditioned attention), для смягчения плохой обусловленности матриц самовнимания в трансформерах. Это привело к ускорению сходимости обучения на 20–30 % и стабильному повышению производительности в различных задачах компьютерного зрения и обработки естественного языка.

В численном анализе плохо обусловленная матрица — это та, где небольшие изменения на входе или в градиентах могут приводить к большим, нестабильным изменениям на выходе, что обычно замедляет сходимость алгоритмов оптимизации, таких как Adam или SGD. Для решения этой проблемы авторы предлагают метод, названный "Предварительно обусловленное внимание" (Preconditioned Attention). Этот подход вводит простую диагональную матрицу обусловливания, которая служит стабилизации процесса обучения и улучшению конечной производительности модели.