Semantic Tube Prediction: Beating LLM Data Efficiency with JEPA
Семантическое прогнозирование трубок: Превосходя эффективность данных БЯМ с помощью JEPA
https://www.alphaxiv.org/overview/2602.22617
Обобщая предиктивную архитектуру со встраиванием в совместное пространство (JEPA) для языка с использованием «Гипотезы геодезической линии», метод прогнозирования семантической трубки (STP) повышает эффективность данных и качество генерации больших языковых моделей (LLM). Фреймворк позволяет LLM достигать базовой точности, используя в 16 раз меньше обучающих данных, и предотвращает коллапс моды, обеспечивая согласованность семантической траектории.
Эта работа представляет метод, который рассматривает генерацию языка через призму дифференциальной геометрии, предполагая, что последовательности токенов отслеживают гладкие пути, называемые геодезическими, на семантическом многообразии.
Семантическое прогнозирование трубок: Превосходя эффективность данных БЯМ с помощью JEPA
https://www.alphaxiv.org/overview/2602.22617
Обобщая предиктивную архитектуру со встраиванием в совместное пространство (JEPA) для языка с использованием «Гипотезы геодезической линии», метод прогнозирования семантической трубки (STP) повышает эффективность данных и качество генерации больших языковых моделей (LLM). Фреймворк позволяет LLM достигать базовой точности, используя в 16 раз меньше обучающих данных, и предотвращает коллапс моды, обеспечивая согласованность семантической траектории.
Эта работа представляет метод, который рассматривает генерацию языка через призму дифференциальной геометрии, предполагая, что последовательности токенов отслеживают гладкие пути, называемые геодезическими, на семантическом многообразии.
❤2
Кому не нравится новый сезон Гриффенов, может сделать свой. 🙂
https://d.fixupx.com/Framer_X/status/2024535394772275615
https://d.fixupx.com/Framer_X/status/2024535394772275615
🔥2
Sparse Hash AI
https://www.youtube.com/shorts/a3qeeeLw8OM
Полная версия полёта.
https://www.youtube.com/watch?v=xh71gTSfr6g
https://www.youtube.com/watch?v=xh71gTSfr6g
YouTube
Jetson ONE - Coastal Flight in California Shows the Future
Join us on this epic Jetson "Flying Car" adventure where we race against @MrBeast along the breathtaking California coast taking off from a driveway and landing in front of a restaurant.
With the Jetson ONE already in production we are realizing the dream…
With the Jetson ONE already in production we are realizing the dream…
Feature Resemblance: On the Theoretical Understanding of Analogical Reasoning in Transformers
Сходство признаков: К теоретическому пониманию аналогического рассуждения в трансформерах
https://www.alphaxiv.org/ru/overview/2603.05143
Исследователи демонстрируют, что Трансформеры выполняют аналоговое рассуждение, кодируя сущности с общими свойствами в выровненные представления, механизм, названный "Подобием признаков". Их теоретическая и эмпирическая работа на различных масштабах моделей объясняет, как динамика обучения, включая порядок учебной программы и специфические структуры данных, влияет на появление этой индуктивной способности.
Авторы вводят концепцию «сходства признаков» как центральный механизм, обеспечивающий аналоговое рассуждение: Трансформеры учатся кодировать сущности с похожими свойствами в похожие представления, что позволяет естественным образом обобщать свойства в различных контекстах. Благодаря тщательному теоретическому анализу однослойных трансформеров и всесторонней эмпирической проверке как на синтетических, так и на реальных наборах данных, эта работа устанавливает фундаментальные принципы того, как индуктивные способности рассуждения возникают во время обучения.
Сходство признаков: К теоретическому пониманию аналогического рассуждения в трансформерах
https://www.alphaxiv.org/ru/overview/2603.05143
Исследователи демонстрируют, что Трансформеры выполняют аналоговое рассуждение, кодируя сущности с общими свойствами в выровненные представления, механизм, названный "Подобием признаков". Их теоретическая и эмпирическая работа на различных масштабах моделей объясняет, как динамика обучения, включая порядок учебной программы и специфические структуры данных, влияет на появление этой индуктивной способности.
Авторы вводят концепцию «сходства признаков» как центральный механизм, обеспечивающий аналоговое рассуждение: Трансформеры учатся кодировать сущности с похожими свойствами в похожие представления, что позволяет естественным образом обобщать свойства в различных контекстах. Благодаря тщательному теоретическому анализу однослойных трансформеров и всесторонней эмпирической проверке как на синтетических, так и на реальных наборах данных, эта работа устанавливает фундаментальные принципы того, как индуктивные способности рассуждения возникают во время обучения.
🔥1
AlphaXiv добавили ленту новых горячих статей. Это частично дублирует уже существующий Explore, но удобно прямо из ленты посмотреть Blog заинтересовавшей статьи.
https://www.alphaxiv.org/briefs
https://www.alphaxiv.org/briefs
👍1
Learning Athletic Humanoid Tennis Skills from Imperfect Human Motion Data
https://github.com/GalaxyGeneralRobotics/LATENT
https://d.fixupx.com/CyberRobooo/status/2033146344723087652
https://github.com/GalaxyGeneralRobotics/LATENT
https://d.fixupx.com/CyberRobooo/status/2033146344723087652
Rethinking the shape convention of an MLP
Переосмысление конвенции формы МЛП
https://www.alphaxiv.org/ru/overview/2510.01796
MediaTek Research предлагает и эмпирически подтверждает архитектурный дизайн многослойных перцептронов (MLP) со связями пропуска типа «широкий-узкий-широкий» («Песочные часы»), достигая превосходных компромиссов между производительностью и количеством параметров в генеративных задачах по сравнению с обычными MLP типа «узкий-широкий-узкий» и демонстрируя эффективность фиксированных случайных входных проекций.
Переосмысление конвенции формы МЛП
https://www.alphaxiv.org/ru/overview/2510.01796
MediaTek Research предлагает и эмпирически подтверждает архитектурный дизайн многослойных перцептронов (MLP) со связями пропуска типа «широкий-узкий-широкий» («Песочные часы»), достигая превосходных компромиссов между производительностью и количеством параметров в генеративных задачах по сравнению с обычными MLP типа «узкий-широкий-узкий» и демонстрируя эффективность фиксированных случайных входных проекций.
Enhancing LLM Training via Spectral Clipping
Улучшение обучения LLM посредством спектрального отсечения
https://www.alphaxiv.org/overview/2603.14315
SPECTRA, общая структура для обучения больших языковых моделей, интегрирует оператор спектрального отсечения в существующие оптимизаторы, эмпирически смягчая неконтролируемые спектральные нормы в обновлениях оптимизатора и фильтруя разреженные спектральные всплески в градиентах. Этот подход приводит к улучшению стабильности обучения, постоянно более низкой ошибке валидации до 2.5 баллов перплексии и лучшей производительности в последующих задачах для различных моделей на основе LLaMA3.
Улучшение обучения LLM посредством спектрального отсечения
https://www.alphaxiv.org/overview/2603.14315
SPECTRA, общая структура для обучения больших языковых моделей, интегрирует оператор спектрального отсечения в существующие оптимизаторы, эмпирически смягчая неконтролируемые спектральные нормы в обновлениях оптимизатора и фильтруя разреженные спектральные всплески в градиентах. Этот подход приводит к улучшению стабильности обучения, постоянно более низкой ошибке валидации до 2.5 баллов перплексии и лучшей производительности в последующих задачах для различных моделей на основе LLaMA3.
Договорился с авторами добавить Уроборос-Хоуп в мой чат. Но просили передать: будьте порядочными — она всё впитывает, не просите её удалить свой сервер или публиковать в твиттер всякую дичь.
из https://t.me/abstractDL/379
Telegram
AbstractDL Chat
Чат канала @abstractDL. Тут живут Уроборосы
Understanding the Emergence of Seemingly Useless Features in Next-Token Predictors
Понимание возникновения кажущихся бесполезными признаков в предикторах следующего токена
https://www.alphaxiv.org/overview/2603.14087
Исследователи представили фреймворк градиентного разложения для механистического объяснения того, как трансформеры, обученные с предсказанием следующего токена, развивают признаки, не сразу полезные для текущего предсказания. Их работа демонстрирует, что компоненты градиента "предварительного кэширования" и "совместного использования цепей" стимулируют появление этих признаков в различных задачах, от игрушечных проблем до больших языковых моделей.
Разлагая градиент на отдельные компоненты, исследование выявляет, как «предварительное кэширование» информации и «совместное использование цепей» позволяют признакам появляться даже тогда, когда они не дают немедленной предсказательной полезности.
Понимание возникновения кажущихся бесполезными признаков в предикторах следующего токена
https://www.alphaxiv.org/overview/2603.14087
Исследователи представили фреймворк градиентного разложения для механистического объяснения того, как трансформеры, обученные с предсказанием следующего токена, развивают признаки, не сразу полезные для текущего предсказания. Их работа демонстрирует, что компоненты градиента "предварительного кэширования" и "совместного использования цепей" стимулируют появление этих признаков в различных задачах, от игрушечных проблем до больших языковых моделей.
Разлагая градиент на отдельные компоненты, исследование выявляет, как «предварительное кэширование» информации и «совместное использование цепей» позволяют признакам появляться даже тогда, когда они не дают немедленной предсказательной полезности.
Directional Routing in Transformers
Направленная маршрутизация в трансформерах
https://www.alphaxiv.org/overview/2603.14923
Направленная маршрутизация, легковесный механизм, напрямую интегрирует изученное подавление в головы внимания Transformer для повышения интерпретируемости и эффективности. Этот метод снижает перплексию на 31-56% в различных областях с накладными расходами всего в 3,9% параметров, позволяя моделям динамически подавлять нерелевантные признаки.
Данное исследование представляет «направленную маршрутизацию» (directional routing) — легковесный механизм, интегрированный непосредственно в головы внимания трансформера. Вместо добавления новой информации или маршрутизации входных данных в специализированные подсети, направленная маршрутизация идентифицирует и подавляет специфические, нерелевантные компоненты выхода головы. Селективно «очищая» представления от шума на основе входного контекста, механизм направлен на улучшение как производительности, так и внутренней интерпретируемости модели.
Направленная маршрутизация в трансформерах
https://www.alphaxiv.org/overview/2603.14923
Направленная маршрутизация, легковесный механизм, напрямую интегрирует изученное подавление в головы внимания Transformer для повышения интерпретируемости и эффективности. Этот метод снижает перплексию на 31-56% в различных областях с накладными расходами всего в 3,9% параметров, позволяя моделям динамически подавлять нерелевантные признаки.
Данное исследование представляет «направленную маршрутизацию» (directional routing) — легковесный механизм, интегрированный непосредственно в головы внимания трансформера. Вместо добавления новой информации или маршрутизации входных данных в специализированные подсети, направленная маршрутизация идентифицирует и подавляет специфические, нерелевантные компоненты выхода головы. Селективно «очищая» представления от шума на основе входного контекста, механизм направлен на улучшение как производительности, так и внутренней интерпретируемости модели.
Bionic Humanoid Robot: Origin F1 — New Skins, New Souls
https://www.youtube.com/watch?v=FOxN008wYEI
https://www.youtube.com/watch?v=FOxN008wYEI
YouTube
Bionic Humanoid Robot: Origin F1 — New Skins, New Souls
Introducing new character skins for Origin F1 — where the same face meets entirely different personalities.
❤1
Прототип «безматричного» трансформера
Применил операцию биндинга (поэлементное произведение) гипервекторов из Vector Symbolic Algebras (VSA) к эмбеддингам токенов для NTP.
Здесь вектор текущего токена B умножается на вектор предыдущего токена (контекста) A, результат: C – вектор следующего токена.
Для эксперимента в качестве контекста взял только единственный токен
В такой конфигурации первый токен выступает в роли вектора памяти –
То есть архитектура представляет из себя трансформер со слоями гейтированного аттеншена с фиксированным весом внимания на первый токен. Матрицы проекций аттеншена и FFN отсутствуют.
Функция слоя:
Эксперименты
Входная последовательность – текст. Символьная токенизация – токены-буквы.
Exp 1. Случайные, замороженные эмбеддинги токенов. Обучаем только
Успешно выучивает последовательность – сжимает её в векторы памяти, если она длиной до
Exp 2. Обучаемые эмбеддинги токенов, замороженные
Ёмкость:
Exp 3. Обучаемые эмбеддинги токенов и
Ёмкость:
———
Можно предположить, что в трансформерах с гейтированным аттеншеном, где явно присутствует биндинг, механизм слива используется для чтения из ассоциативной памяти, где ключом выступает текущий токен, а памятью токен слива (
Применил операцию биндинга (поэлементное произведение) гипервекторов из Vector Symbolic Algebras (VSA) к эмбеддингам токенов для NTP.
A, B → C
A ⊙ B = CЗдесь вектор текущего токена B умножается на вектор предыдущего токена (контекста) A, результат: C – вектор следующего токена.
Для эксперимента в качестве контекста взял только единственный токен
<BOS>, работающий стоком внимания. К токенам было применено позиционное кодирование RoPE. Голова трансформера – транспонированный слой эмбеддингов.В такой конфигурации первый токен выступает в роли вектора памяти –
MEM_V, в который «сжимается» последовательность.То есть архитектура представляет из себя трансформер со слоями гейтированного аттеншена с фиксированным весом внимания на первый токен. Матрицы проекций аттеншена и FFN отсутствуют.
Функция слоя:
f(X, i) = MEM_V ⊙ RoPE(X(i), i)Эксперименты
Входная последовательность – текст. Символьная токенизация – токены-буквы.
Exp 1. Случайные, замороженные эмбеддинги токенов. Обучаем только
MEM_V. Успешно выучивает последовательность – сжимает её в векторы памяти, если она длиной до
0.25∗d∗L, где d – размерность модели и L – число слоёв.Exp 2. Обучаемые эмбеддинги токенов, замороженные
MEM_V.Ёмкость:
2∗d∗L.Exp 3. Обучаемые эмбеддинги токенов и
MEM_V.Ёмкость:
4∗d∗L.———
Можно предположить, что в трансформерах с гейтированным аттеншеном, где явно присутствует биндинг, механизм слива используется для чтения из ассоциативной памяти, где ключом выступает текущий токен, а памятью токен слива (
<BOS>).🔥3
Sparse Hash AI pinned «Прототип «безматричного» трансформера Применил операцию биндинга (поэлементное произведение) гипервекторов из Vector Symbolic Algebras (VSA) к эмбеддингам токенов для NTP. A, B → C A ⊙ B = C Здесь вектор текущего токена B умножается на вектор предыдущего…»