In-Place Test-Time Training
Обучение на месте во время тестирования
https://www.alphaxiv.org/overview/2604.06169
Встроенное обучение во время тестирования (In-Place TTT) позволяет динамически адаптировать большие языковые модели за счет перепрофилирования существующих блоков MLP для эффективных, поблочных обновлений с целью, согласованной с предсказанием следующего токена. Эта структура демонстрирует последовательное улучшение производительности на бенчмарках с длинным контекстом, таких как RULER, и достигает более низкой перплексии по сравнению с базовыми моделями, при этом вводя незначительные вычислительные накладные расходы.
Обучение на месте во время тестирования
https://www.alphaxiv.org/overview/2604.06169
Встроенное обучение во время тестирования (In-Place TTT) позволяет динамически адаптировать большие языковые модели за счет перепрофилирования существующих блоков MLP для эффективных, поблочных обновлений с целью, согласованной с предсказанием следующего токена. Эта структура демонстрирует последовательное улучшение производительности на бенчмарках с длинным контекстом, таких как RULER, и достигает более низкой перплексии по сравнению с базовыми моделями, при этом вводя незначительные вычислительные накладные расходы.
💡
Частое переключение внимания между разнообразными темами, так называемое клиповое мышление у людей, возможно, требуется для эффективного обучения.
То есть постоянная смена контекста работает как батчинг с
Частое переключение внимания между разнообразными темами, так называемое клиповое мышление у людей, возможно, требуется для эффективного обучения.
То есть постоянная смена контекста работает как батчинг с
shuffle=True в DataLoader, не позволяя мозгу переобучаться.😁3👍1
Робот Toyota CUE7, двухколесный гуманоид, дебютировал во время перерыва на баскетбольном матче в Японии.
https://d.fixupx.com/TheHumanoidHub/status/2044504579480686900
https://d.fixupx.com/TheHumanoidHub/status/2044504579480686900
Vestibular reservoir computing
Вестибулярные резервуарные вычисления
https://www.alphaxiv.org/overview/2604.09943
https://github.com/SMITA1996/Vestibular-reservoir-computing
Биоинспирированная система, названная вестибулярными резервуарными вычислениями, использует несвязанную сетевую архитектуру для прогнозирования временных рядов. Эта система достигает предсказательной производительности для хаотических систем Лоренца и пищевых цепей, сравнимой с традиционно связанными сетями, при этом наблюдаются аналогичные емкости памяти, когда их спектры собственных значений совпадают.
———
Демонстрируется, что резервуар, состоящий из несвязанных, независимых узлов, может работать так же хорошо, как и сложные, связанные сети.
* у «несвязанной» архитектуры узлы/нейроны не взаимодействуют друг с другом (матрица связей/весов – просто диагональная матрица), что означает, что каждый узел обрабатывает вход независимо.
Вестибулярные резервуарные вычисления
https://www.alphaxiv.org/overview/2604.09943
https://github.com/SMITA1996/Vestibular-reservoir-computing
Биоинспирированная система, названная вестибулярными резервуарными вычислениями, использует несвязанную сетевую архитектуру для прогнозирования временных рядов. Эта система достигает предсказательной производительности для хаотических систем Лоренца и пищевых цепей, сравнимой с традиционно связанными сетями, при этом наблюдаются аналогичные емкости памяти, когда их спектры собственных значений совпадают.
———
Демонстрируется, что резервуар, состоящий из несвязанных, независимых узлов, может работать так же хорошо, как и сложные, связанные сети.
* у «несвязанной» архитектуры узлы/нейроны не взаимодействуют друг с другом (матрица связей/весов – просто диагональная матрица), что означает, что каждый узел обрабатывает вход независимо.
Lyra 2.0: Explorable Generative 3D Worlds
https://research.nvidia.com/labs/sil/projects/lyra2/
gaussian splatting
https://research.nvidia.com/labs/sil/projects/lyra2/assets/teaser.mp4
https://research.nvidia.com/labs/sil/projects/lyra2/
gaussian splatting
https://research.nvidia.com/labs/sil/projects/lyra2/assets/teaser.mp4
🔥1
Bonsai 1-bit WebGPU
https://huggingface.co/spaces/webml-community/bonsai-webgpu
Bonsai модели, работающие локально в браузере. Шустрые. Говорят по-русски.
исходники
https://huggingface.co/spaces/webml-community/bonsai-webgpu
Bonsai модели, работающие локально в браузере. Шустрые. Говорят по-русски.
Я могу отвечать на вопросы, объяснять концепции, давать предложения, помогать с написанием и решением задач, а также общаться на естественном языке. Я — 1-bit модель, оптимизированная для низкой задержки и низкого использования памяти.
исходники
❤2
A Mechanistic Analysis of Looped Reasoning Language Models
Механистический анализ языковых моделей с циклическим рассуждением
https://www.alphaxiv.org/overview/2604.11791
Этот механистический анализ исследует, как языковые модели с циклическим рассуждением организуют вычисления, обнаруживая, что отдельные слои сходятся к различным скрытым неподвижным точкам и стабилизируются паттерны внимания. Исследование показывает, что эти модели спонтанно организуются в «стадии вывода», которые зеркально отражают стадии прямых Трансформеров, даже при обучении с нуля, предлагая понимание базовой вычислительной динамики.
———
Зацикленный блок трансформера на каждой итерации "рассуждения" уточняет свой трек, а не прокладывает новый.
Механистический анализ языковых моделей с циклическим рассуждением
https://www.alphaxiv.org/overview/2604.11791
Этот механистический анализ исследует, как языковые модели с циклическим рассуждением организуют вычисления, обнаруживая, что отдельные слои сходятся к различным скрытым неподвижным точкам и стабилизируются паттерны внимания. Исследование показывает, что эти модели спонтанно организуются в «стадии вывода», которые зеркально отражают стадии прямых Трансформеров, даже при обучении с нуля, предлагая понимание базовой вычислительной динамики.
———
Зацикленный блок трансформера на каждой итерации "рассуждения" уточняет свой трек, а не прокладывает новый.
Incremental Learning of Sparse Attention Patterns in Transformers
Инкрементное обучение разреженных паттернов внимания в трансформерах
https://www.alphaxiv.org/overview/2602.19143
https://github.com/ralvarezlucend/IL-SAP-Transformers
Исследование изучает, как трансформеры учатся интегрировать информацию из нескольких прошлых позиций с различной статистической значимостью, выявляя поэтапное формирование разреженных паттернов внимания, обусловленное первоначальной конкурентной фазой между головками, переходящей к кооперативной специализации. Исследование предоставляет теоретические доказательства этой динамики и показывает, как размер набора данных влияет на количество изученных этапов, связывая это с неявной регуляризацией.
Инкрементное обучение разреженных паттернов внимания в трансформерах
https://www.alphaxiv.org/overview/2602.19143
https://github.com/ralvarezlucend/IL-SAP-Transformers
Исследование изучает, как трансформеры учатся интегрировать информацию из нескольких прошлых позиций с различной статистической значимостью, выявляя поэтапное формирование разреженных паттернов внимания, обусловленное первоначальной конкурентной фазой между головками, переходящей к кооперативной специализации. Исследование предоставляет теоретические доказательства этой динамики и показывает, как размер набора данных влияет на количество изученных этапов, связывая это с неявной регуляризацией.
Affine-Scaled Attention: Towards Flexible and Stable Transformer Attention
Аффинно-масштабированное внимание: К гибкому и стабильному вниманию трансформеров
https://www.alphaxiv.org/overview/2602.23057
Исследователи разработали Affine-Scaled Attention, которая применяет аффинное преобразование, зависящее от входных данных, к нормированным softmax весам внимания, повышая стабильность и производительность моделей Transformer. Этот подход уменьшил смещение в сторону первого токена и привел к снижению потерь при обучении, а также к последовательному улучшению точности в задачах рассуждений здравого смысла, таких как повышение точности ARC-Challenge с 38,4% до 41,5% для модели 3B.
———
Авторы борются с нормализацией softmax, которая распределяет одну единицу массы внимания по доступным токенам, даже когда ни один токен не предоставляет действительно релевантной информации. Для этого Affine-Scaled Attention применяет к нормализованным softmax весам внимания зависящие от входных данных масштабный коэффициент и смещение.
Аффинно-масштабированное внимание: К гибкому и стабильному вниманию трансформеров
https://www.alphaxiv.org/overview/2602.23057
Исследователи разработали Affine-Scaled Attention, которая применяет аффинное преобразование, зависящее от входных данных, к нормированным softmax весам внимания, повышая стабильность и производительность моделей Transformer. Этот подход уменьшил смещение в сторону первого токена и привел к снижению потерь при обучении, а также к последовательному улучшению точности в задачах рассуждений здравого смысла, таких как повышение точности ARC-Challenge с 38,4% до 41,5% для модели 3B.
———
Авторы борются с нормализацией softmax, которая распределяет одну единицу массы внимания по доступным токенам, даже когда ни один токен не предоставляет действительно релевантной информации. Для этого Affine-Scaled Attention применяет к нормализованным softmax весам внимания зависящие от входных данных масштабный коэффициент и смещение.
This media is not supported in your browser
VIEW IN TELEGRAM
Настольная голова от NOETIX Robotics.
Когда уходите надолго, не забывайте переставлять горшок с головой на подоконник. Им бывает скучно в пустых комнатах, а за окном хоть какая-то для них движуха. И никогда не оставляйте её наедине с котом.
Когда уходите надолго, не забывайте переставлять горшок с головой на подоконник. Им бывает скучно в пустых комнатах, а за окном хоть какая-то для них движуха. И никогда не оставляйте её наедине с котом.
Fine-Tuning Without Forgetting In-Context Learning: A Theoretical Analysis of Linear Attention Models
Дообучение без забывания контекстного обучения: Теоретический анализ линейных моделей внимания
https://www.alphaxiv.org/overview/2602.23197
Исследователи из Университета Ёнсе и Университета Висконсин-Мэдисон теоретически проанализировали, как дообучение влияет на внутриконтекстное обучение (ICL) в моделях с линейным вниманием, и предложили стратегии для смягчения деградации ICL. Их работа продемонстрировала, что дообучение только матрицы значений может сохранить возможности ICL при одновременном улучшении производительности в режиме zero-shot, что было эмпирически подтверждено как на синтетических задачах, так и на модели Qwen2.5-3B-Instruct.
———
Если не хотите, чтобы модель после fine-tuning'а потеряла способность к ICL, донастраивайте только матрицу значений V.
Дообучение без забывания контекстного обучения: Теоретический анализ линейных моделей внимания
https://www.alphaxiv.org/overview/2602.23197
Исследователи из Университета Ёнсе и Университета Висконсин-Мэдисон теоретически проанализировали, как дообучение влияет на внутриконтекстное обучение (ICL) в моделях с линейным вниманием, и предложили стратегии для смягчения деградации ICL. Их работа продемонстрировала, что дообучение только матрицы значений может сохранить возможности ICL при одновременном улучшении производительности в режиме zero-shot, что было эмпирически подтверждено как на синтетических задачах, так и на модели Qwen2.5-3B-Instruct.
———
Если не хотите, чтобы модель после fine-tuning'а потеряла способность к ICL, донастраивайте только матрицу значений V.
Generalization at the Edge of Stability
Обобщение на грани стабильности
https://www.alphaxiv.org/overview/2604.19740
В этом исследовании вводится Sharpness Dimension (SD) как новая мера сложности, выведенная из теории случайных динамических систем, с целью объяснить обобщение в нейронных сетях, работающих на 'грани стабильности'. Исследование устанавливает теоретическую границу обобщения, связанную с SD, и эмпирически демонстрирует ее сильную корреляцию с производительностью обобщения в различных архитектурах, включая MLP и GPT-2, а также предлагает понимание феномена 'грокинга'.
———
Объясняет, почему перепараметризованные модели не переобучаются так сильно, как предсказывала бы классическая теория.
Обобщение на грани стабильности
https://www.alphaxiv.org/overview/2604.19740
В этом исследовании вводится Sharpness Dimension (SD) как новая мера сложности, выведенная из теории случайных динамических систем, с целью объяснить обобщение в нейронных сетях, работающих на 'грани стабильности'. Исследование устанавливает теоретическую границу обобщения, связанную с SD, и эмпирически демонстрирует ее сильную корреляцию с производительностью обобщения в различных архитектурах, включая MLP и GPT-2, а также предлагает понимание феномена 'грокинга'.
———
Объясняет, почему перепараметризованные модели не переобучаются так сильно, как предсказывала бы классическая теория.
"Голова в горшке" – Origin F1
Вангую, что с распространением таких голов, владельцы станут заказывать мейкап для них.
https://d.fixupx.com/Yuhang__Hu/status/2046825104236216403
Вангую, что с распространением таких голов, владельцы станут заказывать мейкап для них.
https://d.fixupx.com/Yuhang__Hu/status/2046825104236216403
Sessa: Selective State Space Attention
Sessa: Избирательное внимание в пространстве состояний
https://www.alphaxiv.org/overview/2604.18580
https://github.com/LibratioAI/sessa
Исследователи разработали Sessa, новую архитектуру моделирования последовательностей, которая устраняет ограничения трансформеров и моделей пространственных состояний в сценариях с длинным контекстом путем интеграции внимания, зависящего от входных данных, в рекуррентный путь обратной связи. Sessa теоретически достигает более медленного, степенного затухания памяти и обеспечивает гибкие профили избирательного извлечения, включая незатухающее или усиливающееся влияние от удаленных токенов, превосходящие базовые модели в синтетических задачах с длинным контекстом.
Sessa: Избирательное внимание в пространстве состояний
https://www.alphaxiv.org/overview/2604.18580
https://github.com/LibratioAI/sessa
Исследователи разработали Sessa, новую архитектуру моделирования последовательностей, которая устраняет ограничения трансформеров и моделей пространственных состояний в сценариях с длинным контекстом путем интеграции внимания, зависящего от входных данных, в рекуррентный путь обратной связи. Sessa теоретически достигает более медленного, степенного затухания памяти и обеспечивает гибкие профили избирательного извлечения, включая незатухающее или усиливающееся влияние от удаленных токенов, превосходящие базовые модели в синтетических задачах с длинным контекстом.
👍1
Прошёл полумарафон дроидов в Пекине. В этом году вдвое улучшили прошлогодний результат.
https://d.fixupx.com/cixliv/status/2046066920995373421
https://d.fixupx.com/cixliv/status/2046066920995373421
Этот пришёл последним, но прошёл 21 км.
https://d.fixupx.com/AlertaMundoNews/status/2046361644737995183
https://d.fixupx.com/AlertaMundoNews/status/2046361644737995183
❤2
KVNN: Learnable Multi-Kernel Volterra Neural Networks
KVNN: Обучаемые многоядерные нейронные сети Вольтерра
https://www.alphaxiv.org/overview/2604.15141
Ядрализованные нейронные сети Вольтерры (kVNN) представляют собой модульный слой для глубокого обучения, который интегрирует нелинейные взаимодействия более высокого порядка через обучаемое мульти-ядерное представление, уменьшая сложность модели при одновременном повышении производительности. Подход демонстрирует улучшенные компромиссы между точностью и эффективностью в таких задачах, как распознавание действий на видео и шумоподавление изображений, часто превосходя существующие методы с меньшим количеством параметров.
KVNN: Обучаемые многоядерные нейронные сети Вольтерра
https://www.alphaxiv.org/overview/2604.15141
Ядрализованные нейронные сети Вольтерры (kVNN) представляют собой модульный слой для глубокого обучения, который интегрирует нелинейные взаимодействия более высокого порядка через обучаемое мульти-ядерное представление, уменьшая сложность модели при одновременном повышении производительности. Подход демонстрирует улучшенные компромиссы между точностью и эффективностью в таких задачах, как распознавание действий на видео и шумоподавление изображений, часто превосходя существующие методы с меньшим количеством параметров.