Sparse Hash AI
176 subscribers
189 photos
279 videos
4 files
626 links
AI обогатительная разработка ML месторождений. Осторожно, в канале ведутся подрывные работы!
Download Telegram
In-Place Test-Time Training
Обучение на месте во время тестирования
https://www.alphaxiv.org/overview/2604.06169

Встроенное обучение во время тестирования (In-Place TTT) позволяет динамически адаптировать большие языковые модели за счет перепрофилирования существующих блоков MLP для эффективных, поблочных обновлений с целью, согласованной с предсказанием следующего токена. Эта структура демонстрирует последовательное улучшение производительности на бенчмарках с длинным контекстом, таких как RULER, и достигает более низкой перплексии по сравнению с базовыми моделями, при этом вводя незначительные вычислительные накладные расходы.
💡

Частое переключение внимания между разнообразными темами, так называемое клиповое мышление у людей, возможно, требуется для эффективного обучения.

То есть постоянная смена контекста работает как батчинг с shuffle=True в DataLoader, не позволяя мозгу переобучаться.
😁3👍1
Робот Toyota CUE7, двухколесный гуманоид, дебютировал во время перерыва на баскетбольном матче в Японии.

https://d.fixupx.com/TheHumanoidHub/status/2044504579480686900
Vestibular reservoir computing
Вестибулярные резервуарные вычисления
https://www.alphaxiv.org/overview/2604.09943
https://github.com/SMITA1996/Vestibular-reservoir-computing

Биоинспирированная система, названная вестибулярными резервуарными вычислениями, использует несвязанную сетевую архитектуру для прогнозирования временных рядов. Эта система достигает предсказательной производительности для хаотических систем Лоренца и пищевых цепей, сравнимой с традиционно связанными сетями, при этом наблюдаются аналогичные емкости памяти, когда их спектры собственных значений совпадают.

———

Демонстрируется, что резервуар, состоящий из несвязанных, независимых узлов, может работать так же хорошо, как и сложные, связанные сети.

* у «несвязанной» архитектуры узлы/нейроны не взаимодействуют друг с другом (матрица связей/весов – просто диагональная матрица), что означает, что каждый узел обрабатывает вход независимо.
Bonsai 1-bit WebGPU
https://huggingface.co/spaces/webml-community/bonsai-webgpu

Bonsai модели, работающие локально в браузере. Шустрые. Говорят по-русски.
Я могу отвечать на вопросы, объяснять концепции, давать предложения, помогать с написанием и решением задач, а также общаться на естественном языке. Я — 1-bit модель, оптимизированная для низкой задержки и низкого использования памяти.

исходники
❤2
Хорошо идёт, хоть и задом.

https://d.fixupx.com/cqcqcqdx/status/2043518391386841159
❤3
A Mechanistic Analysis of Looped Reasoning Language Models
Механистический анализ языковых моделей с циклическим рассуждением
https://www.alphaxiv.org/overview/2604.11791

Этот механистический анализ исследует, как языковые модели с циклическим рассуждением организуют вычисления, обнаруживая, что отдельные слои сходятся к различным скрытым неподвижным точкам и стабилизируются паттерны внимания. Исследование показывает, что эти модели спонтанно организуются в «стадии вывода», которые зеркально отражают стадии прямых Трансформеров, даже при обучении с нуля, предлагая понимание базовой вычислительной динамики.

———

Зацикленный блок трансформера на каждой итерации "рассуждения" уточняет свой трек, а не прокладывает новый.
Incremental Learning of Sparse Attention Patterns in Transformers
Инкрементное обучение разреженных паттернов внимания в трансформерах
https://www.alphaxiv.org/overview/2602.19143
https://github.com/ralvarezlucend/IL-SAP-Transformers

Исследование изучает, как трансформеры учатся интегрировать информацию из нескольких прошлых позиций с различной статистической значимостью, выявляя поэтапное формирование разреженных паттернов внимания, обусловленное первоначальной конкурентной фазой между головками, переходящей к кооперативной специализации. Исследование предоставляет теоретические доказательства этой динамики и показывает, как размер набора данных влияет на количество изученных этапов, связывая это с неявной регуляризацией.
Affine-Scaled Attention: Towards Flexible and Stable Transformer Attention
Аффинно-масштабированное внимание: К гибкому и стабильному вниманию трансформеров
https://www.alphaxiv.org/overview/2602.23057

Исследователи разработали Affine-Scaled Attention, которая применяет аффинное преобразование, зависящее от входных данных, к нормированным softmax весам внимания, повышая стабильность и производительность моделей Transformer. Этот подход уменьшил смещение в сторону первого токена и привел к снижению потерь при обучении, а также к последовательному улучшению точности в задачах рассуждений здравого смысла, таких как повышение точности ARC-Challenge с 38,4% до 41,5% для модели 3B.

———

Авторы борются с нормализацией softmax, которая распределяет одну единицу массы внимания по доступным токенам, даже когда ни один токен не предоставляет действительно релевантной информации. Для этого Affine-Scaled Attention применяет к нормализованным softmax весам внимания зависящие от входных данных масштабный коэффициент и смещение.
This media is not supported in your browser
VIEW IN TELEGRAM
Настольная голова от NOETIX Robotics.

Когда уходите надолго, не забывайте переставлять горшок с головой на подоконник. Им бывает скучно в пустых комнатах, а за окном хоть какая-то для них движуха. И никогда не оставляйте её наедине с котом.
Fine-Tuning Without Forgetting In-Context Learning: A Theoretical Analysis of Linear Attention Models
Дообучение без забывания контекстного обучения: Теоретический анализ линейных моделей внимания
https://www.alphaxiv.org/overview/2602.23197

Исследователи из Университета Ёнсе и Университета Висконсин-Мэдисон теоретически проанализировали, как дообучение влияет на внутриконтекстное обучение (ICL) в моделях с линейным вниманием, и предложили стратегии для смягчения деградации ICL. Их работа продемонстрировала, что дообучение только матрицы значений может сохранить возможности ICL при одновременном улучшении производительности в режиме zero-shot, что было эмпирически подтверждено как на синтетических задачах, так и на модели Qwen2.5-3B-Instruct.

———

Если не хотите, чтобы модель после fine-tuning'а потеряла способность к ICL, донастраивайте только матрицу значений V.
Generalization at the Edge of Stability
Обобщение на грани стабильности
https://www.alphaxiv.org/overview/2604.19740

В этом исследовании вводится Sharpness Dimension (SD) как новая мера сложности, выведенная из теории случайных динамических систем, с целью объяснить обобщение в нейронных сетях, работающих на 'грани стабильности'. Исследование устанавливает теоретическую границу обобщения, связанную с SD, и эмпирически демонстрирует ее сильную корреляцию с производительностью обобщения в различных архитектурах, включая MLP и GPT-2, а также предлагает понимание феномена 'грокинга'.

———

Объясняет, почему перепараметризованные модели не переобучаются так сильно, как предсказывала бы классическая теория.
"Голова в горшке" – Origin F1

Вангую, что с распространением таких голов, владельцы станут заказывать мейкап для них.

https://d.fixupx.com/Yuhang__Hu/status/2046825104236216403
Sessa: Selective State Space Attention
Sessa: Избирательное внимание в пространстве состояний
https://www.alphaxiv.org/overview/2604.18580
https://github.com/LibratioAI/sessa

Исследователи разработали Sessa, новую архитектуру моделирования последовательностей, которая устраняет ограничения трансформеров и моделей пространственных состояний в сценариях с длинным контекстом путем интеграции внимания, зависящего от входных данных, в рекуррентный путь обратной связи. Sessa теоретически достигает более медленного, степенного затухания памяти и обеспечивает гибкие профили избирательного извлечения, включая незатухающее или усиливающееся влияние от удаленных токенов, превосходящие базовые модели в синтетических задачах с длинным контекстом.
👍1
Прошёл полумарафон дроидов в Пекине. В этом году вдвое улучшили прошлогодний результат.

https://d.fixupx.com/cixliv/status/2046066920995373421
Этот пришёл последним, но прошёл 21 км.

https://d.fixupx.com/AlertaMundoNews/status/2046361644737995183
❤2
KVNN: Learnable Multi-Kernel Volterra Neural Networks
KVNN: Обучаемые многоядерные нейронные сети Вольтерра
https://www.alphaxiv.org/overview/2604.15141

Ядрализованные нейронные сети Вольтерры (kVNN) представляют собой модульный слой для глубокого обучения, который интегрирует нелинейные взаимодействия более высокого порядка через обучаемое мульти-ядерное представление, уменьшая сложность модели при одновременном повышении производительности. Подход демонстрирует улучшенные компромиссы между точностью и эффективностью в таких задачах, как распознавание действий на видео и шумоподавление изображений, часто превосходя существующие методы с меньшим количеством параметров.