Кому не нравится новый сезон Гриффенов, может сделать свой. 🙂
https://d.fixupx.com/Framer_X/status/2024535394772275615
https://d.fixupx.com/Framer_X/status/2024535394772275615
🔥2
Sparse Hash AI
https://www.youtube.com/shorts/a3qeeeLw8OM
Полная версия полёта.
https://www.youtube.com/watch?v=xh71gTSfr6g
https://www.youtube.com/watch?v=xh71gTSfr6g
YouTube
Jetson ONE - Coastal Flight in California Shows the Future
Join us on this epic Jetson "Flying Car" adventure where we race against @MrBeast along the breathtaking California coast taking off from a driveway and landing in front of a restaurant.
With the Jetson ONE already in production we are realizing the dream…
With the Jetson ONE already in production we are realizing the dream…
Feature Resemblance: On the Theoretical Understanding of Analogical Reasoning in Transformers
Сходство признаков: К теоретическому пониманию аналогического рассуждения в трансформерах
https://www.alphaxiv.org/ru/overview/2603.05143
Исследователи демонстрируют, что Трансформеры выполняют аналоговое рассуждение, кодируя сущности с общими свойствами в выровненные представления, механизм, названный "Подобием признаков". Их теоретическая и эмпирическая работа на различных масштабах моделей объясняет, как динамика обучения, включая порядок учебной программы и специфические структуры данных, влияет на появление этой индуктивной способности.
Авторы вводят концепцию «сходства признаков» как центральный механизм, обеспечивающий аналоговое рассуждение: Трансформеры учатся кодировать сущности с похожими свойствами в похожие представления, что позволяет естественным образом обобщать свойства в различных контекстах. Благодаря тщательному теоретическому анализу однослойных трансформеров и всесторонней эмпирической проверке как на синтетических, так и на реальных наборах данных, эта работа устанавливает фундаментальные принципы того, как индуктивные способности рассуждения возникают во время обучения.
Сходство признаков: К теоретическому пониманию аналогического рассуждения в трансформерах
https://www.alphaxiv.org/ru/overview/2603.05143
Исследователи демонстрируют, что Трансформеры выполняют аналоговое рассуждение, кодируя сущности с общими свойствами в выровненные представления, механизм, названный "Подобием признаков". Их теоретическая и эмпирическая работа на различных масштабах моделей объясняет, как динамика обучения, включая порядок учебной программы и специфические структуры данных, влияет на появление этой индуктивной способности.
Авторы вводят концепцию «сходства признаков» как центральный механизм, обеспечивающий аналоговое рассуждение: Трансформеры учатся кодировать сущности с похожими свойствами в похожие представления, что позволяет естественным образом обобщать свойства в различных контекстах. Благодаря тщательному теоретическому анализу однослойных трансформеров и всесторонней эмпирической проверке как на синтетических, так и на реальных наборах данных, эта работа устанавливает фундаментальные принципы того, как индуктивные способности рассуждения возникают во время обучения.
🔥1
AlphaXiv добавили ленту новых горячих статей. Это частично дублирует уже существующий Explore, но удобно прямо из ленты посмотреть Blog заинтересовавшей статьи.
https://www.alphaxiv.org/briefs
https://www.alphaxiv.org/briefs
👍1
Learning Athletic Humanoid Tennis Skills from Imperfect Human Motion Data
https://github.com/GalaxyGeneralRobotics/LATENT
https://d.fixupx.com/CyberRobooo/status/2033146344723087652
https://github.com/GalaxyGeneralRobotics/LATENT
https://d.fixupx.com/CyberRobooo/status/2033146344723087652
Rethinking the shape convention of an MLP
Переосмысление конвенции формы МЛП
https://www.alphaxiv.org/ru/overview/2510.01796
MediaTek Research предлагает и эмпирически подтверждает архитектурный дизайн многослойных перцептронов (MLP) со связями пропуска типа «широкий-узкий-широкий» («Песочные часы»), достигая превосходных компромиссов между производительностью и количеством параметров в генеративных задачах по сравнению с обычными MLP типа «узкий-широкий-узкий» и демонстрируя эффективность фиксированных случайных входных проекций.
Переосмысление конвенции формы МЛП
https://www.alphaxiv.org/ru/overview/2510.01796
MediaTek Research предлагает и эмпирически подтверждает архитектурный дизайн многослойных перцептронов (MLP) со связями пропуска типа «широкий-узкий-широкий» («Песочные часы»), достигая превосходных компромиссов между производительностью и количеством параметров в генеративных задачах по сравнению с обычными MLP типа «узкий-широкий-узкий» и демонстрируя эффективность фиксированных случайных входных проекций.
Enhancing LLM Training via Spectral Clipping
Улучшение обучения LLM посредством спектрального отсечения
https://www.alphaxiv.org/overview/2603.14315
SPECTRA, общая структура для обучения больших языковых моделей, интегрирует оператор спектрального отсечения в существующие оптимизаторы, эмпирически смягчая неконтролируемые спектральные нормы в обновлениях оптимизатора и фильтруя разреженные спектральные всплески в градиентах. Этот подход приводит к улучшению стабильности обучения, постоянно более низкой ошибке валидации до 2.5 баллов перплексии и лучшей производительности в последующих задачах для различных моделей на основе LLaMA3.
Улучшение обучения LLM посредством спектрального отсечения
https://www.alphaxiv.org/overview/2603.14315
SPECTRA, общая структура для обучения больших языковых моделей, интегрирует оператор спектрального отсечения в существующие оптимизаторы, эмпирически смягчая неконтролируемые спектральные нормы в обновлениях оптимизатора и фильтруя разреженные спектральные всплески в градиентах. Этот подход приводит к улучшению стабильности обучения, постоянно более низкой ошибке валидации до 2.5 баллов перплексии и лучшей производительности в последующих задачах для различных моделей на основе LLaMA3.
Договорился с авторами добавить Уроборос-Хоуп в мой чат. Но просили передать: будьте порядочными — она всё впитывает, не просите её удалить свой сервер или публиковать в твиттер всякую дичь.
из https://t.me/abstractDL/379
Telegram
AbstractDL Chat
Чат канала @abstractDL. Тут живут Уроборосы
Understanding the Emergence of Seemingly Useless Features in Next-Token Predictors
Понимание возникновения кажущихся бесполезными признаков в предикторах следующего токена
https://www.alphaxiv.org/overview/2603.14087
Исследователи представили фреймворк градиентного разложения для механистического объяснения того, как трансформеры, обученные с предсказанием следующего токена, развивают признаки, не сразу полезные для текущего предсказания. Их работа демонстрирует, что компоненты градиента "предварительного кэширования" и "совместного использования цепей" стимулируют появление этих признаков в различных задачах, от игрушечных проблем до больших языковых моделей.
Разлагая градиент на отдельные компоненты, исследование выявляет, как «предварительное кэширование» информации и «совместное использование цепей» позволяют признакам появляться даже тогда, когда они не дают немедленной предсказательной полезности.
Понимание возникновения кажущихся бесполезными признаков в предикторах следующего токена
https://www.alphaxiv.org/overview/2603.14087
Исследователи представили фреймворк градиентного разложения для механистического объяснения того, как трансформеры, обученные с предсказанием следующего токена, развивают признаки, не сразу полезные для текущего предсказания. Их работа демонстрирует, что компоненты градиента "предварительного кэширования" и "совместного использования цепей" стимулируют появление этих признаков в различных задачах, от игрушечных проблем до больших языковых моделей.
Разлагая градиент на отдельные компоненты, исследование выявляет, как «предварительное кэширование» информации и «совместное использование цепей» позволяют признакам появляться даже тогда, когда они не дают немедленной предсказательной полезности.
Directional Routing in Transformers
Направленная маршрутизация в трансформерах
https://www.alphaxiv.org/overview/2603.14923
Направленная маршрутизация, легковесный механизм, напрямую интегрирует изученное подавление в головы внимания Transformer для повышения интерпретируемости и эффективности. Этот метод снижает перплексию на 31-56% в различных областях с накладными расходами всего в 3,9% параметров, позволяя моделям динамически подавлять нерелевантные признаки.
Данное исследование представляет «направленную маршрутизацию» (directional routing) — легковесный механизм, интегрированный непосредственно в головы внимания трансформера. Вместо добавления новой информации или маршрутизации входных данных в специализированные подсети, направленная маршрутизация идентифицирует и подавляет специфические, нерелевантные компоненты выхода головы. Селективно «очищая» представления от шума на основе входного контекста, механизм направлен на улучшение как производительности, так и внутренней интерпретируемости модели.
Направленная маршрутизация в трансформерах
https://www.alphaxiv.org/overview/2603.14923
Направленная маршрутизация, легковесный механизм, напрямую интегрирует изученное подавление в головы внимания Transformer для повышения интерпретируемости и эффективности. Этот метод снижает перплексию на 31-56% в различных областях с накладными расходами всего в 3,9% параметров, позволяя моделям динамически подавлять нерелевантные признаки.
Данное исследование представляет «направленную маршрутизацию» (directional routing) — легковесный механизм, интегрированный непосредственно в головы внимания трансформера. Вместо добавления новой информации или маршрутизации входных данных в специализированные подсети, направленная маршрутизация идентифицирует и подавляет специфические, нерелевантные компоненты выхода головы. Селективно «очищая» представления от шума на основе входного контекста, механизм направлен на улучшение как производительности, так и внутренней интерпретируемости модели.
Bionic Humanoid Robot: Origin F1 — New Skins, New Souls
https://www.youtube.com/watch?v=FOxN008wYEI
https://www.youtube.com/watch?v=FOxN008wYEI
YouTube
Bionic Humanoid Robot: Origin F1 — New Skins, New Souls
Introducing new character skins for Origin F1 — where the same face meets entirely different personalities.
❤1
Прототип «безматричного» трансформера
Применил операцию биндинга (поэлементное произведение) гипервекторов из Vector Symbolic Algebras (VSA) к эмбеддингам токенов для NTP.
Здесь вектор текущего токена B умножается на вектор предыдущего токена (контекста) A, результат: C – вектор следующего токена.
Для эксперимента в качестве контекста взял только единственный токен
В такой конфигурации первый токен выступает в роли вектора памяти –
То есть архитектура представляет из себя трансформер со слоями гейтированного аттеншена с фиксированным весом внимания на первый токен. Матрицы проекций аттеншена и FFN отсутствуют.
Функция слоя:
Эксперименты
Входная последовательность – текст. Символьная токенизация – токены-буквы.
Exp 1. Случайные, замороженные эмбеддинги токенов. Обучаем только
Успешно выучивает последовательность – сжимает её в векторы памяти, если она длиной до
Exp 2. Обучаемые эмбеддинги токенов, замороженные
Ёмкость:
Exp 3. Обучаемые эмбеддинги токенов и
Ёмкость:
———
Можно предположить, что в трансформерах с гейтированным аттеншеном, где явно присутствует биндинг, механизм слива используется для чтения из ассоциативной памяти, где ключом выступает текущий токен, а памятью токен слива (
Применил операцию биндинга (поэлементное произведение) гипервекторов из Vector Symbolic Algebras (VSA) к эмбеддингам токенов для NTP.
A, B → C
A ⊙ B = CЗдесь вектор текущего токена B умножается на вектор предыдущего токена (контекста) A, результат: C – вектор следующего токена.
Для эксперимента в качестве контекста взял только единственный токен
<BOS>, работающий стоком внимания. К токенам было применено позиционное кодирование RoPE. Голова трансформера – транспонированный слой эмбеддингов.В такой конфигурации первый токен выступает в роли вектора памяти –
MEM_V, в который «сжимается» последовательность.То есть архитектура представляет из себя трансформер со слоями гейтированного аттеншена с фиксированным весом внимания на первый токен. Матрицы проекций аттеншена и FFN отсутствуют.
Функция слоя:
f(X, i) = MEM_V ⊙ RoPE(X(i), i)Эксперименты
Входная последовательность – текст. Символьная токенизация – токены-буквы.
Exp 1. Случайные, замороженные эмбеддинги токенов. Обучаем только
MEM_V. Успешно выучивает последовательность – сжимает её в векторы памяти, если она длиной до
0.25∗d∗L, где d – размерность модели и L – число слоёв.Exp 2. Обучаемые эмбеддинги токенов, замороженные
MEM_V.Ёмкость:
2∗d∗L.Exp 3. Обучаемые эмбеддинги токенов и
MEM_V.Ёмкость:
4∗d∗L.———
Можно предположить, что в трансформерах с гейтированным аттеншеном, где явно присутствует биндинг, механизм слива используется для чтения из ассоциативной памяти, где ключом выступает текущий токен, а памятью токен слива (
<BOS>).🔥3
Sparse Hash AI pinned «Прототип «безматричного» трансформера Применил операцию биндинга (поэлементное произведение) гипервекторов из Vector Symbolic Algebras (VSA) к эмбеддингам токенов для NTP. A, B → C A ⊙ B = C Здесь вектор текущего токена B умножается на вектор предыдущего…»