Lyra 2.0: Explorable Generative 3D Worlds
https://research.nvidia.com/labs/sil/projects/lyra2/
gaussian splatting
https://research.nvidia.com/labs/sil/projects/lyra2/assets/teaser.mp4
https://research.nvidia.com/labs/sil/projects/lyra2/
gaussian splatting
https://research.nvidia.com/labs/sil/projects/lyra2/assets/teaser.mp4
🔥1
Bonsai 1-bit WebGPU
https://huggingface.co/spaces/webml-community/bonsai-webgpu
Bonsai модели, работающие локально в браузере. Шустрые. Говорят по-русски.
исходники
https://huggingface.co/spaces/webml-community/bonsai-webgpu
Bonsai модели, работающие локально в браузере. Шустрые. Говорят по-русски.
Я могу отвечать на вопросы, объяснять концепции, давать предложения, помогать с написанием и решением задач, а также общаться на естественном языке. Я — 1-bit модель, оптимизированная для низкой задержки и низкого использования памяти.
исходники
❤2
A Mechanistic Analysis of Looped Reasoning Language Models
Механистический анализ языковых моделей с циклическим рассуждением
https://www.alphaxiv.org/overview/2604.11791
Этот механистический анализ исследует, как языковые модели с циклическим рассуждением организуют вычисления, обнаруживая, что отдельные слои сходятся к различным скрытым неподвижным точкам и стабилизируются паттерны внимания. Исследование показывает, что эти модели спонтанно организуются в «стадии вывода», которые зеркально отражают стадии прямых Трансформеров, даже при обучении с нуля, предлагая понимание базовой вычислительной динамики.
———
Зацикленный блок трансформера на каждой итерации "рассуждения" уточняет свой трек, а не прокладывает новый.
Механистический анализ языковых моделей с циклическим рассуждением
https://www.alphaxiv.org/overview/2604.11791
Этот механистический анализ исследует, как языковые модели с циклическим рассуждением организуют вычисления, обнаруживая, что отдельные слои сходятся к различным скрытым неподвижным точкам и стабилизируются паттерны внимания. Исследование показывает, что эти модели спонтанно организуются в «стадии вывода», которые зеркально отражают стадии прямых Трансформеров, даже при обучении с нуля, предлагая понимание базовой вычислительной динамики.
———
Зацикленный блок трансформера на каждой итерации "рассуждения" уточняет свой трек, а не прокладывает новый.
Incremental Learning of Sparse Attention Patterns in Transformers
Инкрементное обучение разреженных паттернов внимания в трансформерах
https://www.alphaxiv.org/overview/2602.19143
https://github.com/ralvarezlucend/IL-SAP-Transformers
Исследование изучает, как трансформеры учатся интегрировать информацию из нескольких прошлых позиций с различной статистической значимостью, выявляя поэтапное формирование разреженных паттернов внимания, обусловленное первоначальной конкурентной фазой между головками, переходящей к кооперативной специализации. Исследование предоставляет теоретические доказательства этой динамики и показывает, как размер набора данных влияет на количество изученных этапов, связывая это с неявной регуляризацией.
Инкрементное обучение разреженных паттернов внимания в трансформерах
https://www.alphaxiv.org/overview/2602.19143
https://github.com/ralvarezlucend/IL-SAP-Transformers
Исследование изучает, как трансформеры учатся интегрировать информацию из нескольких прошлых позиций с различной статистической значимостью, выявляя поэтапное формирование разреженных паттернов внимания, обусловленное первоначальной конкурентной фазой между головками, переходящей к кооперативной специализации. Исследование предоставляет теоретические доказательства этой динамики и показывает, как размер набора данных влияет на количество изученных этапов, связывая это с неявной регуляризацией.
Affine-Scaled Attention: Towards Flexible and Stable Transformer Attention
Аффинно-масштабированное внимание: К гибкому и стабильному вниманию трансформеров
https://www.alphaxiv.org/overview/2602.23057
Исследователи разработали Affine-Scaled Attention, которая применяет аффинное преобразование, зависящее от входных данных, к нормированным softmax весам внимания, повышая стабильность и производительность моделей Transformer. Этот подход уменьшил смещение в сторону первого токена и привел к снижению потерь при обучении, а также к последовательному улучшению точности в задачах рассуждений здравого смысла, таких как повышение точности ARC-Challenge с 38,4% до 41,5% для модели 3B.
———
Авторы борются с нормализацией softmax, которая распределяет одну единицу массы внимания по доступным токенам, даже когда ни один токен не предоставляет действительно релевантной информации. Для этого Affine-Scaled Attention применяет к нормализованным softmax весам внимания зависящие от входных данных масштабный коэффициент и смещение.
Аффинно-масштабированное внимание: К гибкому и стабильному вниманию трансформеров
https://www.alphaxiv.org/overview/2602.23057
Исследователи разработали Affine-Scaled Attention, которая применяет аффинное преобразование, зависящее от входных данных, к нормированным softmax весам внимания, повышая стабильность и производительность моделей Transformer. Этот подход уменьшил смещение в сторону первого токена и привел к снижению потерь при обучении, а также к последовательному улучшению точности в задачах рассуждений здравого смысла, таких как повышение точности ARC-Challenge с 38,4% до 41,5% для модели 3B.
———
Авторы борются с нормализацией softmax, которая распределяет одну единицу массы внимания по доступным токенам, даже когда ни один токен не предоставляет действительно релевантной информации. Для этого Affine-Scaled Attention применяет к нормализованным softmax весам внимания зависящие от входных данных масштабный коэффициент и смещение.
This media is not supported in your browser
VIEW IN TELEGRAM
Настольная голова от NOETIX Robotics.
Когда уходите надолго, не забывайте переставлять горшок с головой на подоконник. Им бывает скучно в пустых комнатах, а за окном хоть какая-то для них движуха. И никогда не оставляйте её наедине с котом.
Когда уходите надолго, не забывайте переставлять горшок с головой на подоконник. Им бывает скучно в пустых комнатах, а за окном хоть какая-то для них движуха. И никогда не оставляйте её наедине с котом.
Fine-Tuning Without Forgetting In-Context Learning: A Theoretical Analysis of Linear Attention Models
Дообучение без забывания контекстного обучения: Теоретический анализ линейных моделей внимания
https://www.alphaxiv.org/overview/2602.23197
Исследователи из Университета Ёнсе и Университета Висконсин-Мэдисон теоретически проанализировали, как дообучение влияет на внутриконтекстное обучение (ICL) в моделях с линейным вниманием, и предложили стратегии для смягчения деградации ICL. Их работа продемонстрировала, что дообучение только матрицы значений может сохранить возможности ICL при одновременном улучшении производительности в режиме zero-shot, что было эмпирически подтверждено как на синтетических задачах, так и на модели Qwen2.5-3B-Instruct.
———
Если не хотите, чтобы модель после fine-tuning'а потеряла способность к ICL, донастраивайте только матрицу значений V.
Дообучение без забывания контекстного обучения: Теоретический анализ линейных моделей внимания
https://www.alphaxiv.org/overview/2602.23197
Исследователи из Университета Ёнсе и Университета Висконсин-Мэдисон теоретически проанализировали, как дообучение влияет на внутриконтекстное обучение (ICL) в моделях с линейным вниманием, и предложили стратегии для смягчения деградации ICL. Их работа продемонстрировала, что дообучение только матрицы значений может сохранить возможности ICL при одновременном улучшении производительности в режиме zero-shot, что было эмпирически подтверждено как на синтетических задачах, так и на модели Qwen2.5-3B-Instruct.
———
Если не хотите, чтобы модель после fine-tuning'а потеряла способность к ICL, донастраивайте только матрицу значений V.
Generalization at the Edge of Stability
Обобщение на грани стабильности
https://www.alphaxiv.org/overview/2604.19740
В этом исследовании вводится Sharpness Dimension (SD) как новая мера сложности, выведенная из теории случайных динамических систем, с целью объяснить обобщение в нейронных сетях, работающих на 'грани стабильности'. Исследование устанавливает теоретическую границу обобщения, связанную с SD, и эмпирически демонстрирует ее сильную корреляцию с производительностью обобщения в различных архитектурах, включая MLP и GPT-2, а также предлагает понимание феномена 'грокинга'.
———
Объясняет, почему перепараметризованные модели не переобучаются так сильно, как предсказывала бы классическая теория.
Обобщение на грани стабильности
https://www.alphaxiv.org/overview/2604.19740
В этом исследовании вводится Sharpness Dimension (SD) как новая мера сложности, выведенная из теории случайных динамических систем, с целью объяснить обобщение в нейронных сетях, работающих на 'грани стабильности'. Исследование устанавливает теоретическую границу обобщения, связанную с SD, и эмпирически демонстрирует ее сильную корреляцию с производительностью обобщения в различных архитектурах, включая MLP и GPT-2, а также предлагает понимание феномена 'грокинга'.
———
Объясняет, почему перепараметризованные модели не переобучаются так сильно, как предсказывала бы классическая теория.
"Голова в горшке" – Origin F1
Вангую, что с распространением таких голов, владельцы станут заказывать мейкап для них.
https://d.fixupx.com/Yuhang__Hu/status/2046825104236216403
Вангую, что с распространением таких голов, владельцы станут заказывать мейкап для них.
https://d.fixupx.com/Yuhang__Hu/status/2046825104236216403
Sessa: Selective State Space Attention
Sessa: Избирательное внимание в пространстве состояний
https://www.alphaxiv.org/overview/2604.18580
https://github.com/LibratioAI/sessa
Исследователи разработали Sessa, новую архитектуру моделирования последовательностей, которая устраняет ограничения трансформеров и моделей пространственных состояний в сценариях с длинным контекстом путем интеграции внимания, зависящего от входных данных, в рекуррентный путь обратной связи. Sessa теоретически достигает более медленного, степенного затухания памяти и обеспечивает гибкие профили избирательного извлечения, включая незатухающее или усиливающееся влияние от удаленных токенов, превосходящие базовые модели в синтетических задачах с длинным контекстом.
Sessa: Избирательное внимание в пространстве состояний
https://www.alphaxiv.org/overview/2604.18580
https://github.com/LibratioAI/sessa
Исследователи разработали Sessa, новую архитектуру моделирования последовательностей, которая устраняет ограничения трансформеров и моделей пространственных состояний в сценариях с длинным контекстом путем интеграции внимания, зависящего от входных данных, в рекуррентный путь обратной связи. Sessa теоретически достигает более медленного, степенного затухания памяти и обеспечивает гибкие профили избирательного извлечения, включая незатухающее или усиливающееся влияние от удаленных токенов, превосходящие базовые модели в синтетических задачах с длинным контекстом.
👍1
Прошёл полумарафон дроидов в Пекине. В этом году вдвое улучшили прошлогодний результат.
https://d.fixupx.com/cixliv/status/2046066920995373421
https://d.fixupx.com/cixliv/status/2046066920995373421
Этот пришёл последним, но прошёл 21 км.
https://d.fixupx.com/AlertaMundoNews/status/2046361644737995183
https://d.fixupx.com/AlertaMundoNews/status/2046361644737995183
❤2
KVNN: Learnable Multi-Kernel Volterra Neural Networks
KVNN: Обучаемые многоядерные нейронные сети Вольтерра
https://www.alphaxiv.org/overview/2604.15141
Ядрализованные нейронные сети Вольтерры (kVNN) представляют собой модульный слой для глубокого обучения, который интегрирует нелинейные взаимодействия более высокого порядка через обучаемое мульти-ядерное представление, уменьшая сложность модели при одновременном повышении производительности. Подход демонстрирует улучшенные компромиссы между точностью и эффективностью в таких задачах, как распознавание действий на видео и шумоподавление изображений, часто превосходя существующие методы с меньшим количеством параметров.
KVNN: Обучаемые многоядерные нейронные сети Вольтерра
https://www.alphaxiv.org/overview/2604.15141
Ядрализованные нейронные сети Вольтерры (kVNN) представляют собой модульный слой для глубокого обучения, который интегрирует нелинейные взаимодействия более высокого порядка через обучаемое мульти-ядерное представление, уменьшая сложность модели при одновременном повышении производительности. Подход демонстрирует улучшенные компромиссы между точностью и эффективностью в таких задачах, как распознавание действий на видео и шумоподавление изображений, часто превосходя существующие методы с меньшим количеством параметров.
The Linear Centroids Hypothesis: How Deep Network Features Represent Data
Гипотеза линейных центроидов: Как признаки глубоких сетей представляют данные
https://www.alphaxiv.org/overview/2604.11962
В данной работе представлена гипотеза линейных центроидов (LCH) как основа для интерпретируемости глубоких сетей, предполагающая, что признаки соответствуют линейным направлениям центроидов, которые суммируют локальное функциональное поведение сети. Показано, что LCH уменьшает ложную идентификацию признаков и улучшает производительность методов интерпретации, таких как разреженные автокодировщики, обнаружение цепей и карты значимости в различных моделях.
Гипотеза линейных центроидов: Как признаки глубоких сетей представляют данные
https://www.alphaxiv.org/overview/2604.11962
В данной работе представлена гипотеза линейных центроидов (LCH) как основа для интерпретируемости глубоких сетей, предполагающая, что признаки соответствуют линейным направлениям центроидов, которые суммируют локальное функциональное поведение сети. Показано, что LCH уменьшает ложную идентификацию признаков и улучшает производительность методов интерпретации, таких как разреженные автокодировщики, обнаружение цепей и карты значимости в различных моделях.
Nonparametric Teaching of Attention Learners
Непараметрическое обучение обучающихся с вниманием
https://www.alphaxiv.org/overview/2602.20461
Парадигма AtteNT для непараметрического обучения внимательных моделей аналитически связывает градиентный спуск, основанный на параметрах, с функциональным градиентным спуском. Этот метод сокращает время дообучения LLM в среднем на 12,78% и время обучения ViT с нуля на 20,58%, одновременно обеспечивая улучшение производительности, такое как прирост δ1 на 5,1% в оценке глубины для ViT.
———
Предлагается обучать на примерах, которые дают наибольшую ошибку.
Непараметрическое обучение обучающихся с вниманием
https://www.alphaxiv.org/overview/2602.20461
Парадигма AtteNT для непараметрического обучения внимательных моделей аналитически связывает градиентный спуск, основанный на параметрах, с функциональным градиентным спуском. Этот метод сокращает время дообучения LLM в среднем на 12,78% и время обучения ViT с нуля на 20,58%, одновременно обеспечивая улучшение производительности, такое как прирост δ1 на 5,1% в оценке глубины для ViT.
———
Предлагается обучать на примерах, которые дают наибольшую ошибку.