The Phasor Transformer: Resolving Attention Bottlenecks on the Unit Circle
Фазорный Трансформер: Разрешение Узких Мест Внимания на Единичном Круге
https://www.alphaxiv.org/ru/overview/2603.17433
Трансформер-Фазор (Phasor Transformer) и его глубокий вариант, Модель Большого Фазора (LPM), представляют собой архитектуру моделирования последовательностей с нативной обработкой фазы, которая решает проблему квадратичной сложности самовнимания. Она достигает глобального смешивания токенов со сложностью O(N log N) и значительно меньшим количеством обучаемых параметров, представляя состояния последовательности как фазы на единичной окружности, демонстрируя стабильное авторегрессионное моделирование для осциллирующих временных рядов.
———
Как и в недавней работе CAWN: Continuous Acoustic Wave Networks for Autoregressive Language Modeling здесь сделан переход в частотную область и интерференцию волн в комплексной области. Требуемое число обучаемых параметров (на слой) равно длине контекста ∗ 2.
Фазорный Трансформер: Разрешение Узких Мест Внимания на Единичном Круге
https://www.alphaxiv.org/ru/overview/2603.17433
Трансформер-Фазор (Phasor Transformer) и его глубокий вариант, Модель Большого Фазора (LPM), представляют собой архитектуру моделирования последовательностей с нативной обработкой фазы, которая решает проблему квадратичной сложности самовнимания. Она достигает глобального смешивания токенов со сложностью O(N log N) и значительно меньшим количеством обучаемых параметров, представляя состояния последовательности как фазы на единичной окружности, демонстрируя стабильное авторегрессионное моделирование для осциллирующих временных рядов.
———
Как и в недавней работе CAWN: Continuous Acoustic Wave Networks for Autoregressive Language Modeling здесь сделан переход в частотную область и интерференцию волн в комплексной области. Требуемое число обучаемых параметров (на слой) равно длине контекста ∗ 2.
🔥
All elementary functions from a single binary operator
Все элементарные функции из одной бинарной операции
https://www.alphaxiv.org/overview/2603.21852
Один бинарный оператор,
All elementary functions from a single binary operator
Все элементарные функции из одной бинарной операции
https://www.alphaxiv.org/overview/2603.21852
Один бинарный оператор,
eml(x, y) = exp(x) - ln(y), в сочетании с константой 1, функционально полон для генерации всех стандартных элементарных функций и операций, обычно встречающихся на научном калькуляторе. Это открытие позволяет использовать унифицированное представление математических выражений в виде бинарного дерева и позволяет точно восстанавливать эти функции из числовых данных с использованием символьной регрессии на основе градиента.🔥3
Learning without training: The implicit dynamics of in-context learning
Обучение без тренировки: Неявная динамика внутриконтекстного обучения
https://www.alphaxiv.org/overview/2507.16003
https://github.com/ricardotrevisan/incontext-learning
Это исследование Google Research демонстрирует, что внутриконтекстное обучение (ICL) в больших языковых моделях (LLM) может быть теоретически объяснено как неявное, низкоранговое обновление весов слоя многослойного перцептрона (MLP) в блоке трансформера. Эксперименты подтверждают, что предсказания модели с внутриконтекстной подсказкой идентичны тем, что делаются путем явного применения этих полученных обновлений весов без промпта.
Обучение без тренировки: Неявная динамика внутриконтекстного обучения
https://www.alphaxiv.org/overview/2507.16003
https://github.com/ricardotrevisan/incontext-learning
Это исследование Google Research демонстрирует, что внутриконтекстное обучение (ICL) в больших языковых моделях (LLM) может быть теоретически объяснено как неявное, низкоранговое обновление весов слоя многослойного перцептрона (MLP) в блоке трансформера. Эксперименты подтверждают, что предсказания модели с внутриконтекстной подсказкой идентичны тем, что делаются путем явного применения этих полученных обновлений весов без промпта.
💡
Невнимательный Трансформер
Разбирая Learning without training: The implicit dynamics of in-context learning, докопался с ИИ до превращения трансформера в RNN (TTT) через периодическое обновление весов MLP во время вывода.
Контекст/кэш может быть небольшим – это аналог рабочей памяти (он может вообще отсутствовать при обновлении весов на каждом токене).
При выходе контекста за заданную длину мы фиксируем его в весах MLP (выступает аналогом долговременной памяти) и очищаем кэш – аналог сна, где дневные знания закрепляются в долговременной памяти.
Невнимательный Трансформер
Разбирая Learning without training: The implicit dynamics of in-context learning, докопался с ИИ до превращения трансформера в RNN (TTT) через периодическое обновление весов MLP во время вывода.
Контекст/кэш может быть небольшим – это аналог рабочей памяти (он может вообще отсутствовать при обновлении весов на каждом токене).
При выходе контекста за заданную длину мы фиксируем его в весах MLP (выступает аналогом долговременной памяти) и очищаем кэш – аналог сна, где дневные знания закрепляются в долговременной памяти.
Sparse Hash AI
Learning without training: The implicit dynamics of in-context learning Обучение без тренировки: Неявная динамика внутриконтекстного обучения https://www.alphaxiv.org/overview/2507.16003 https://github.com/ricardotrevisan/incontext-learning Это исследование…
💡
Трансформер неявно обновляет веса во время инференса, следовательно, LLM обучается на собственной выдаче. Этим можно объяснить деградацию контекста (Context Rot): качество ответов начинает падать с ростом контекста, так как обучение моделей на их же выводах приводит к сильному ухудшению качества.
Кроме того, LLM должна демонстрировать предвзятость к своему предыдущему ответу, поскольку он усиливается в её весах, и модель становится более склонной к его повторению.
Трансформер неявно обновляет веса во время инференса, следовательно, LLM обучается на собственной выдаче. Этим можно объяснить деградацию контекста (Context Rot): качество ответов начинает падать с ростом контекста, так как обучение моделей на их же выводах приводит к сильному ухудшению качества.
Кроме того, LLM должна демонстрировать предвзятость к своему предыдущему ответу, поскольку он усиливается в её весах, и модель становится более склонной к его повторению.
❤1
The Illusion of Stochasticity in LLMs
Иллюзия стохастичности в LLM
https://www.alphaxiv.org/overview/2604.06543
Исследователи Google DeepMind эмпирически продемонстрировали, что большие языковые модели (LLM) проявляют «иллюзию стохастичности», постоянно производя смещенные выборки вместо истинных случайных результатов из заданных вероятностных распределений. Исследование показало, что, хотя LLM испытывают трудности с генерацией внутренней случайности, они могут достичь надежной стохастичности, используя внешние генераторы псевдослучайных чисел (PRNG) или детерминированно преобразуя истинно случайный ввод в целевое распределение.
Иллюзия стохастичности в LLM
https://www.alphaxiv.org/overview/2604.06543
Исследователи Google DeepMind эмпирически продемонстрировали, что большие языковые модели (LLM) проявляют «иллюзию стохастичности», постоянно производя смещенные выборки вместо истинных случайных результатов из заданных вероятностных распределений. Исследование показало, что, хотя LLM испытывают трудности с генерацией внутренней случайности, они могут достичь надежной стохастичности, используя внешние генераторы псевдослучайных чисел (PRNG) или детерминированно преобразуя истинно случайный ввод в целевое распределение.
Демонстрация муравьиного алгоритма (Ant Colony Optimization, ACO).
https://d.fixupx.com/Introvert_hu_ji/status/2044299302617620757
https://d.fixupx.com/Introvert_hu_ji/status/2044299302617620757
In-Place Test-Time Training
Обучение на месте во время тестирования
https://www.alphaxiv.org/overview/2604.06169
Встроенное обучение во время тестирования (In-Place TTT) позволяет динамически адаптировать большие языковые модели за счет перепрофилирования существующих блоков MLP для эффективных, поблочных обновлений с целью, согласованной с предсказанием следующего токена. Эта структура демонстрирует последовательное улучшение производительности на бенчмарках с длинным контекстом, таких как RULER, и достигает более низкой перплексии по сравнению с базовыми моделями, при этом вводя незначительные вычислительные накладные расходы.
Обучение на месте во время тестирования
https://www.alphaxiv.org/overview/2604.06169
Встроенное обучение во время тестирования (In-Place TTT) позволяет динамически адаптировать большие языковые модели за счет перепрофилирования существующих блоков MLP для эффективных, поблочных обновлений с целью, согласованной с предсказанием следующего токена. Эта структура демонстрирует последовательное улучшение производительности на бенчмарках с длинным контекстом, таких как RULER, и достигает более низкой перплексии по сравнению с базовыми моделями, при этом вводя незначительные вычислительные накладные расходы.
💡
Частое переключение внимания между разнообразными темами, так называемое клиповое мышление у людей, возможно, требуется для эффективного обучения.
То есть постоянная смена контекста работает как батчинг с
Частое переключение внимания между разнообразными темами, так называемое клиповое мышление у людей, возможно, требуется для эффективного обучения.
То есть постоянная смена контекста работает как батчинг с
shuffle=True в DataLoader, не позволяя мозгу переобучаться.😁3👍1
Робот Toyota CUE7, двухколесный гуманоид, дебютировал во время перерыва на баскетбольном матче в Японии.
https://d.fixupx.com/TheHumanoidHub/status/2044504579480686900
https://d.fixupx.com/TheHumanoidHub/status/2044504579480686900
Vestibular reservoir computing
Вестибулярные резервуарные вычисления
https://www.alphaxiv.org/overview/2604.09943
https://github.com/SMITA1996/Vestibular-reservoir-computing
Биоинспирированная система, названная вестибулярными резервуарными вычислениями, использует несвязанную сетевую архитектуру для прогнозирования временных рядов. Эта система достигает предсказательной производительности для хаотических систем Лоренца и пищевых цепей, сравнимой с традиционно связанными сетями, при этом наблюдаются аналогичные емкости памяти, когда их спектры собственных значений совпадают.
———
Демонстрируется, что резервуар, состоящий из несвязанных, независимых узлов, может работать так же хорошо, как и сложные, связанные сети.
* у «несвязанной» архитектуры узлы/нейроны не взаимодействуют друг с другом (матрица связей/весов – просто диагональная матрица), что означает, что каждый узел обрабатывает вход независимо.
Вестибулярные резервуарные вычисления
https://www.alphaxiv.org/overview/2604.09943
https://github.com/SMITA1996/Vestibular-reservoir-computing
Биоинспирированная система, названная вестибулярными резервуарными вычислениями, использует несвязанную сетевую архитектуру для прогнозирования временных рядов. Эта система достигает предсказательной производительности для хаотических систем Лоренца и пищевых цепей, сравнимой с традиционно связанными сетями, при этом наблюдаются аналогичные емкости памяти, когда их спектры собственных значений совпадают.
———
Демонстрируется, что резервуар, состоящий из несвязанных, независимых узлов, может работать так же хорошо, как и сложные, связанные сети.
* у «несвязанной» архитектуры узлы/нейроны не взаимодействуют друг с другом (матрица связей/весов – просто диагональная матрица), что означает, что каждый узел обрабатывает вход независимо.
Lyra 2.0: Explorable Generative 3D Worlds
https://research.nvidia.com/labs/sil/projects/lyra2/
gaussian splatting
https://research.nvidia.com/labs/sil/projects/lyra2/assets/teaser.mp4
https://research.nvidia.com/labs/sil/projects/lyra2/
gaussian splatting
https://research.nvidia.com/labs/sil/projects/lyra2/assets/teaser.mp4
🔥1
Bonsai 1-bit WebGPU
https://huggingface.co/spaces/webml-community/bonsai-webgpu
Bonsai модели, работающие локально в браузере. Шустрые. Говорят по-русски.
исходники
https://huggingface.co/spaces/webml-community/bonsai-webgpu
Bonsai модели, работающие локально в браузере. Шустрые. Говорят по-русски.
Я могу отвечать на вопросы, объяснять концепции, давать предложения, помогать с написанием и решением задач, а также общаться на естественном языке. Я — 1-bit модель, оптимизированная для низкой задержки и низкого использования памяти.
исходники
❤2
A Mechanistic Analysis of Looped Reasoning Language Models
Механистический анализ языковых моделей с циклическим рассуждением
https://www.alphaxiv.org/overview/2604.11791
Этот механистический анализ исследует, как языковые модели с циклическим рассуждением организуют вычисления, обнаруживая, что отдельные слои сходятся к различным скрытым неподвижным точкам и стабилизируются паттерны внимания. Исследование показывает, что эти модели спонтанно организуются в «стадии вывода», которые зеркально отражают стадии прямых Трансформеров, даже при обучении с нуля, предлагая понимание базовой вычислительной динамики.
———
Зацикленный блок трансформера на каждой итерации "рассуждения" уточняет свой трек, а не прокладывает новый.
Механистический анализ языковых моделей с циклическим рассуждением
https://www.alphaxiv.org/overview/2604.11791
Этот механистический анализ исследует, как языковые модели с циклическим рассуждением организуют вычисления, обнаруживая, что отдельные слои сходятся к различным скрытым неподвижным точкам и стабилизируются паттерны внимания. Исследование показывает, что эти модели спонтанно организуются в «стадии вывода», которые зеркально отражают стадии прямых Трансформеров, даже при обучении с нуля, предлагая понимание базовой вычислительной динамики.
———
Зацикленный блок трансформера на каждой итерации "рассуждения" уточняет свой трек, а не прокладывает новый.
Incremental Learning of Sparse Attention Patterns in Transformers
Инкрементное обучение разреженных паттернов внимания в трансформерах
https://www.alphaxiv.org/overview/2602.19143
https://github.com/ralvarezlucend/IL-SAP-Transformers
Исследование изучает, как трансформеры учатся интегрировать информацию из нескольких прошлых позиций с различной статистической значимостью, выявляя поэтапное формирование разреженных паттернов внимания, обусловленное первоначальной конкурентной фазой между головками, переходящей к кооперативной специализации. Исследование предоставляет теоретические доказательства этой динамики и показывает, как размер набора данных влияет на количество изученных этапов, связывая это с неявной регуляризацией.
Инкрементное обучение разреженных паттернов внимания в трансформерах
https://www.alphaxiv.org/overview/2602.19143
https://github.com/ralvarezlucend/IL-SAP-Transformers
Исследование изучает, как трансформеры учатся интегрировать информацию из нескольких прошлых позиций с различной статистической значимостью, выявляя поэтапное формирование разреженных паттернов внимания, обусловленное первоначальной конкурентной фазой между головками, переходящей к кооперативной специализации. Исследование предоставляет теоретические доказательства этой динамики и показывает, как размер набора данных влияет на количество изученных этапов, связывая это с неявной регуляризацией.
Affine-Scaled Attention: Towards Flexible and Stable Transformer Attention
Аффинно-масштабированное внимание: К гибкому и стабильному вниманию трансформеров
https://www.alphaxiv.org/overview/2602.23057
Исследователи разработали Affine-Scaled Attention, которая применяет аффинное преобразование, зависящее от входных данных, к нормированным softmax весам внимания, повышая стабильность и производительность моделей Transformer. Этот подход уменьшил смещение в сторону первого токена и привел к снижению потерь при обучении, а также к последовательному улучшению точности в задачах рассуждений здравого смысла, таких как повышение точности ARC-Challenge с 38,4% до 41,5% для модели 3B.
———
Авторы борются с нормализацией softmax, которая распределяет одну единицу массы внимания по доступным токенам, даже когда ни один токен не предоставляет действительно релевантной информации. Для этого Affine-Scaled Attention применяет к нормализованным softmax весам внимания зависящие от входных данных масштабный коэффициент и смещение.
Аффинно-масштабированное внимание: К гибкому и стабильному вниманию трансформеров
https://www.alphaxiv.org/overview/2602.23057
Исследователи разработали Affine-Scaled Attention, которая применяет аффинное преобразование, зависящее от входных данных, к нормированным softmax весам внимания, повышая стабильность и производительность моделей Transformer. Этот подход уменьшил смещение в сторону первого токена и привел к снижению потерь при обучении, а также к последовательному улучшению точности в задачах рассуждений здравого смысла, таких как повышение точности ARC-Challenge с 38,4% до 41,5% для модели 3B.
———
Авторы борются с нормализацией softmax, которая распределяет одну единицу массы внимания по доступным токенам, даже когда ни один токен не предоставляет действительно релевантной информации. Для этого Affine-Scaled Attention применяет к нормализованным softmax весам внимания зависящие от входных данных масштабный коэффициент и смещение.
This media is not supported in your browser
VIEW IN TELEGRAM
Настольная голова от NOETIX Robotics.
Когда уходите надолго, не забывайте переставлять горшок с головой на подоконник. Им бывает скучно в пустых комнатах, а за окном хоть какая-то для них движуха. И никогда не оставляйте её наедине с котом.
Когда уходите надолго, не забывайте переставлять горшок с головой на подоконник. Им бывает скучно в пустых комнатах, а за окном хоть какая-то для них движуха. И никогда не оставляйте её наедине с котом.
Fine-Tuning Without Forgetting In-Context Learning: A Theoretical Analysis of Linear Attention Models
Дообучение без забывания контекстного обучения: Теоретический анализ линейных моделей внимания
https://www.alphaxiv.org/overview/2602.23197
Исследователи из Университета Ёнсе и Университета Висконсин-Мэдисон теоретически проанализировали, как дообучение влияет на внутриконтекстное обучение (ICL) в моделях с линейным вниманием, и предложили стратегии для смягчения деградации ICL. Их работа продемонстрировала, что дообучение только матрицы значений может сохранить возможности ICL при одновременном улучшении производительности в режиме zero-shot, что было эмпирически подтверждено как на синтетических задачах, так и на модели Qwen2.5-3B-Instruct.
———
Если не хотите, чтобы модель после fine-tuning'а потеряла способность к ICL, донастраивайте только матрицу значений V.
Дообучение без забывания контекстного обучения: Теоретический анализ линейных моделей внимания
https://www.alphaxiv.org/overview/2602.23197
Исследователи из Университета Ёнсе и Университета Висконсин-Мэдисон теоретически проанализировали, как дообучение влияет на внутриконтекстное обучение (ICL) в моделях с линейным вниманием, и предложили стратегии для смягчения деградации ICL. Их работа продемонстрировала, что дообучение только матрицы значений может сохранить возможности ICL при одновременном улучшении производительности в режиме zero-shot, что было эмпирически подтверждено как на синтетических задачах, так и на модели Qwen2.5-3B-Instruct.
———
Если не хотите, чтобы модель после fine-tuning'а потеряла способность к ICL, донастраивайте только матрицу значений V.