Sparse Hash AI
176 subscribers
189 photos
279 videos
4 files
626 links
AI обогатительная разработка ML месторождений. Осторожно, в канале ведутся подрывные работы!
Download Telegram
Feature Resemblance: On the Theoretical Understanding of Analogical Reasoning in Transformers
Сходство признаков: К теоретическому пониманию аналогического рассуждения в трансформерах
https://www.alphaxiv.org/ru/overview/2603.05143

Исследователи демонстрируют, что Трансформеры выполняют аналоговое рассуждение, кодируя сущности с общими свойствами в выровненные представления, механизм, названный "Подобием признаков". Их теоретическая и эмпирическая работа на различных масштабах моделей объясняет, как динамика обучения, включая порядок учебной программы и специфические структуры данных, влияет на появление этой индуктивной способности.

Авторы вводят концепцию «сходства признаков» как центральный механизм, обеспечивающий аналоговое рассуждение: Трансформеры учатся кодировать сущности с похожими свойствами в похожие представления, что позволяет естественным образом обобщать свойства в различных контекстах. Благодаря тщательному теоретическому анализу однослойных трансформеров и всесторонней эмпирической проверке как на синтетических, так и на реальных наборах данных, эта работа устанавливает фундаментальные принципы того, как индуктивные способности рассуждения возникают во время обучения.
🔥1
AlphaXiv добавили ленту новых горячих статей. Это частично дублирует уже существующий Explore, но удобно прямо из ленты посмотреть Blog заинтересовавшей статьи.

https://www.alphaxiv.org/briefs
👍1
Learning Athletic Humanoid Tennis Skills from Imperfect Human Motion Data
https://github.com/GalaxyGeneralRobotics/LATENT

https://d.fixupx.com/CyberRobooo/status/2033146344723087652
Rethinking the shape convention of an MLP
Переосмысление конвенции формы МЛП
https://www.alphaxiv.org/ru/overview/2510.01796

MediaTek Research предлагает и эмпирически подтверждает архитектурный дизайн многослойных перцептронов (MLP) со связями пропуска типа «широкий-узкий-широкий» («Песочные часы»), достигая превосходных компромиссов между производительностью и количеством параметров в генеративных задачах по сравнению с обычными MLP типа «узкий-широкий-узкий» и демонстрируя эффективность фиксированных случайных входных проекций.
Enhancing LLM Training via Spectral Clipping
Улучшение обучения LLM посредством спектрального отсечения
https://www.alphaxiv.org/overview/2603.14315

SPECTRA, общая структура для обучения больших языковых моделей, интегрирует оператор спектрального отсечения в существующие оптимизаторы, эмпирически смягчая неконтролируемые спектральные нормы в обновлениях оптимизатора и фильтруя разреженные спектральные всплески в градиентах. Этот подход приводит к улучшению стабильности обучения, постоянно более низкой ошибке валидации до 2.5 баллов перплексии и лучшей производительности в последующих задачах для различных моделей на основе LLaMA3.
Please open Telegram to view this post
VIEW IN TELEGRAM
Договорился с авторами добавить Уроборос-Хоуп в мой чат. Но просили передать: будьте порядочными — она всё впитывает, не просите её удалить свой сервер или публиковать в твиттер всякую дичь.

из https://t.me/abstractDL/379
Understanding the Emergence of Seemingly Useless Features in Next-Token Predictors
Понимание возникновения кажущихся бесполезными признаков в предикторах следующего токена
https://www.alphaxiv.org/overview/2603.14087

Исследователи представили фреймворк градиентного разложения для механистического объяснения того, как трансформеры, обученные с предсказанием следующего токена, развивают признаки, не сразу полезные для текущего предсказания. Их работа демонстрирует, что компоненты градиента "предварительного кэширования" и "совместного использования цепей" стимулируют появление этих признаков в различных задачах, от игрушечных проблем до больших языковых моделей.

Разлагая градиент на отдельные компоненты, исследование выявляет, как «предварительное кэширование» информации и «совместное использование цепей» позволяют признакам появляться даже тогда, когда они не дают немедленной предсказательной полезности.
Directional Routing in Transformers
Направленная маршрутизация в трансформерах
https://www.alphaxiv.org/overview/2603.14923

Направленная маршрутизация, легковесный механизм, напрямую интегрирует изученное подавление в головы внимания Transformer для повышения интерпретируемости и эффективности. Этот метод снижает перплексию на 31-56% в различных областях с накладными расходами всего в 3,9% параметров, позволяя моделям динамически подавлять нерелевантные признаки.

Данное исследование представляет «направленную маршрутизацию» (directional routing) — легковесный механизм, интегрированный непосредственно в головы внимания трансформера. Вместо добавления новой информации или маршрутизации входных данных в специализированные подсети, направленная маршрутизация идентифицирует и подавляет специфические, нерелевантные компоненты выхода головы. Селективно «очищая» представления от шума на основе входного контекста, механизм направлен на улучшение как производительности, так и внутренней интерпретируемости модели.
Прототип «безматричного» трансформера

Применил операцию биндинга (поэлементное произведение) гипервекторов из Vector Symbolic Algebras (VSA) к эмбеддингам токенов для NTP.

A, B → C
A ⊙ B = C


Здесь вектор текущего токена B умножается на вектор предыдущего токена (контекста) A, результат: C – вектор следующего токена.

Для эксперимента в качестве контекста взял только единственный токен <BOS>, работающий стоком внимания. К токенам было применено позиционное кодирование RoPE. Голова трансформера – транспонированный слой эмбеддингов.

В такой конфигурации первый токен выступает в роли вектора памяти – MEM_V, в который «сжимается» последовательность.

То есть архитектура представляет из себя трансформер со слоями гейтированного аттеншена с фиксированным весом внимания на первый токен. Матрицы проекций аттеншена и FFN отсутствуют.

Функция слоя:

f(X, i) = MEM_V ⊙ RoPE(X(i), i)


Эксперименты

Входная последовательность – текст. Символьная токенизация – токены-буквы.

Exp 1. Случайные, замороженные эмбеддинги токенов. Обучаем только MEM_V.

Успешно выучивает последовательность – сжимает её в векторы памяти, если она длиной до 0.25∗d∗L, где d – размерность модели и L – число слоёв.

Exp 2. Обучаемые эмбеддинги токенов, замороженные MEM_V.

Ёмкость: 2∗d∗L.

Exp 3. Обучаемые эмбеддинги токенов и MEM_V.

Ёмкость: 4∗d∗L.

———

Можно предположить, что в трансформерах с гейтированным аттеншеном, где явно присутствует биндинг, механизм слива используется для чтения из ассоциативной памяти, где ключом выступает текущий токен, а памятью токен слива (<BOS>).
🔥3
Sparse Hash AI pinned «Прототип «безматричного» трансформера Применил операцию биндинга (поэлементное произведение) гипервекторов из Vector Symbolic Algebras (VSA) к эмбеддингам токенов для NTP. A, B → C A ⊙ B = C Здесь вектор текущего токена B умножается на вектор предыдущего…»
This media is not supported in your browser
VIEW IN TELEGRAM
Grok Imagine image + Kling 3.0 video
автор @ChrisGwinnLA

Выглядит как идея для страптапа стартапа.
Катастрофическое Забывание в Нейронных Сетях
Когда нейронные сети обучаются новым задачам, они часто страдают от катастрофического забывания — тенденции перезаписывать или ухудшать ранее полученные знания.

Например, тонкая настройка языковой модели для научного рассуждения может привести к потере общих арифметических способностей или навыков понимания языка.

И это было в Симпсонах.
😁1
Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights
Нейронные Заросли: Разнообразные Эксперты Задач Концентрируются Вокруг Предварительно Обученных Весов
https://www.alphaxiv.org/overview/2603.12228

Исследователи предполагают, что большие предварительно обученные нейронные сети существуют в режиме «зарослей», где их весовое пространство плотно заполнено разнообразными экспертами, ориентированными на конкретные задачи, доступными с помощью простых случайных возмущений. Их алгоритм «RandOpt», который случайным образом отбирает и объединяет эти возмущения, достиг производительности, сопоставимой или превосходящей установленные градиентные методы пост-обучения на различных задачах LLM и VLM.

———

Предобученная LLM представляет из себя плотные «заросли» (thicket) экспертов, которых можно «вытаскивать» из неё случайным возмущением параметров.

Более крупные модели содержат более разнообразных специалистов, а не универсалов. В то время как небольшие модели показывают минимальное улучшение от случайных возмущений.