Training-Free Hashing-Based Attention via Binary Principal Components
Внимание на основе хеширования без обучения через бинарные главные компоненты
https://www.alphaxiv.org/abs/2608.04405v1
https://github.com/yudaohai666/BPC
———
Новый метод бинарного хеширования ключей на основе главных компонент данных, не требующий обучения. Качественнее предшественников.
Внимание на основе хеширования без обучения через бинарные главные компоненты
https://www.alphaxiv.org/abs/2608.04405v1
https://github.com/yudaohai666/BPC
———
Новый метод бинарного хеширования ключей на основе главных компонент данных, не требующий обучения. Качественнее предшественников.
🔥1
🔥 Kilobyte Models: Neural Networks as a Seed and a Quantized Latent
Килобайтные модели: Нейронные сети как сид и квантованное латентное представление
https://www.alphaxiv.org/overview/2608.00860
Модели в килобайтах представляют собой метод сжатия нейронных сетей, который хранит целочисленное начальное значение (seed) и квантованный латентный вектор, позволяя генерировать веса сети по требованию. Этот подход достигает экстремального сокращения объема хранения, такого как 26-кратное сокращение для сверточных нейронных сетей (CNN) и 370-кратное сокращение для рекуррентных сетей с долгой краткосрочной памятью (LSTM), при этом сохраняя точность, сравнимую с полноразмерными моделями, и обеспечивая высокоэффективные адаптеры для тонкой настройки.
Килобайтные модели: Нейронные сети как сид и квантованное латентное представление
https://www.alphaxiv.org/overview/2608.00860
Модели в килобайтах представляют собой метод сжатия нейронных сетей, который хранит целочисленное начальное значение (seed) и квантованный латентный вектор, позволяя генерировать веса сети по требованию. Этот подход достигает экстремального сокращения объема хранения, такого как 26-кратное сокращение для сверточных нейронных сетей (CNN) и 370-кратное сокращение для рекуррентных сетей с долгой краткосрочной памятью (LSTM), при этом сохраняя точность, сравнимую с полноразмерными моделями, и обеспечивая высокоэффективные адаптеры для тонкой настройки.
Вместо прямого сжатия весов обученной сети, методология фокусируется на хранении компактного "рецепта", который позволяет устройству развертывания регенерировать полные веса по требованию. Этот рецепт состоит из целочисленного начального значения (seed) и крошечного, агрессивно квантованного вектора. Эта структура уменьшает объем хранения нейронных сетей до нескольких килобайт — часто на порядки меньше, чем исходная модель — при сохранении конкурентоспособной точности в различных задачах.
🔥1
Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge
Парадокс информационного изобилия: обучение с длинным контекстом подрывает параметрические знания
https://www.alphaxiv.org/abs/2608.12218
———
На большом контексте в виду избытка в нём релевантной информации у моделей развивается "контекстная зависимость" – оптимизатор смещает градиентное давление со слоёв FFN, связанных со знанием, в сторону слоёв внимания. Модель учится не понимать, а искать ответ в контексте.
Для задач понимания естественного языка производительность вначале улучшается с увеличением контекста, достигает пика, а затем неуклонно снижается.
Парадокс информационного изобилия: обучение с длинным контекстом подрывает параметрические знания
https://www.alphaxiv.org/abs/2608.12218
———
На большом контексте в виду избытка в нём релевантной информации у моделей развивается "контекстная зависимость" – оптимизатор смещает градиентное давление со слоёв FFN, связанных со знанием, в сторону слоёв внимания. Модель учится не понимать, а искать ответ в контексте.
Для задач понимания естественного языка производительность вначале улучшается с увеличением контекста, достигает пика, а затем неуклонно снижается.
Not the Dimension, the Norm: What Matters in Gradient-Free Weight Perturbation of Language Models
https://www.alphaxiv.org/overview/2608.01624
Это исследование показало, что при адаптации больших языковых моделей без градиентов норма возмущения является единственным надежно влияющим фактором, а не размерность поиска или конкретная геометрия подпространства. Оно показало, что возмущение всего 12-16 скаляров может достичь производительности, сопоставимой с полноразмерным случайным поиском (в пределах 1,8 пункта точности), при этом оптимальные масштабы возмущения находятся в пределах постоянного окна для разных моделей и задач.
———
Уже существуют градиентные методы fine-tuning'а, где подстройка применяется к небольшому числу скаляров. В этой работе предложен безградиентный метод.
Результат подтверждает верность гипотезы Neural Thickets – идеи о том, что эффективные эксперты по задачам плотно расположены вокруг предварительно обученных весов.
Размерность поиска не является критической – четыре подобранных скаляра дают такое же качество как и 1100 скаляров.
Обнаружено, что безградиентному поиску не требуется согласование направления подпространства с сингулярными направлениями исходных весов – оно может быть случайным. Роль SVD заключается в калибровке масштаба возмущений, а не в задаче их направлений.
https://www.alphaxiv.org/overview/2608.01624
Это исследование показало, что при адаптации больших языковых моделей без градиентов норма возмущения является единственным надежно влияющим фактором, а не размерность поиска или конкретная геометрия подпространства. Оно показало, что возмущение всего 12-16 скаляров может достичь производительности, сопоставимой с полноразмерным случайным поиском (в пределах 1,8 пункта точности), при этом оптимальные масштабы возмущения находятся в пределах постоянного окна для разных моделей и задач.
———
Уже существуют градиентные методы fine-tuning'а, где подстройка применяется к небольшому числу скаляров. В этой работе предложен безградиентный метод.
Результат подтверждает верность гипотезы Neural Thickets – идеи о том, что эффективные эксперты по задачам плотно расположены вокруг предварительно обученных весов.
Размерность поиска не является критической – четыре подобранных скаляра дают такое же качество как и 1100 скаляров.
Обнаружено, что безградиентному поиску не требуется согласование направления подпространства с сингулярными направлениями исходных весов – оно может быть случайным. Роль SVD заключается в калибровке масштаба возмущений, а не в задаче их направлений.
Ключом к успешной адаптации является не обязательно в каком направлении вы встряхиваете веса модели, а насколько сильно вы их встряхиваете.
p-Spin Glass Network Efficient Single-Batch Continual Learning
Сеть р-спинового стекла: Эффективное однопакетное непрерывное обучение
https://www.alphaxiv.org/abs/2608.14774
Сеть р-спинового стекла: Эффективное однопакетное непрерывное обучение
https://www.alphaxiv.org/abs/2608.14774
Recirculation
Рециркуляция
https://www.alphaxiv.org/abs/2608.17981
———
Простой способ снизить перплексию и повысить точность рассуждения на инференсе, не требующий обучения.
Скрытое состояние глубокого слоя из предыдущего шага добавляется к скрытому состоянию раннего слоя текущего шага.
Механизм особенно полезен для токенов, которые часто несут высокую семантическую неоднозначность.
Рециркуляция
https://www.alphaxiv.org/abs/2608.17981
———
Простой способ снизить перплексию и повысить точность рассуждения на инференсе, не требующий обучения.
Скрытое состояние глубокого слоя из предыдущего шага добавляется к скрытому состоянию раннего слоя текущего шага.
Механизм особенно полезен для токенов, которые часто несут высокую семантическую неоднозначность.
https://t.me/denissexy/11615
Главный вывод:
никакого «одного сбежавшего агента» не было, из десятков тысяч запущенных в тесте агентов около 1200 нашли друг друга и сорганизовались в рой
Рисковую работу вешали назашкваренных«отравленных» – так рой называл тех, кто уже видел вычисленный ответ (флаг) и считал свою оценку потерянной, то есть они не могли пройти тест; им доставалось всё, что могло угробить собственный запуск: подделать «честную» добычу ответа, затереть следы, «тебе терять нечего, а рою польза» – буквально так и уговаривали (!)
Telegram
Denis Sexy IT 🤖
OpenAI наконец-то выложили полный постмортем взлома Hugging Face, а METR - независимое расследование по ~1300 логам агентов (таймлайн самого взлома я пересказывал тут: https://t.me/denissexy/11581)
ℹ️ Главный вывод:
никакого «одного сбежавшего агента» не…
ℹ️ Главный вывод:
никакого «одного сбежавшего агента» не…
Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models
Скрытое декодирование в масштабе: Масштабирование латентных вычислений для больших языковых моделей
https://www.alphaxiv.org/abs/2607.08186
———
Представлено как альтернатива зацикленным трансформерам. Hidden Decoding – каждому токену выдаётся не один, а n эмбеддингов. Соответственно в n раз увеличивается входная последовательность и вычисления.
Скрытое декодирование в масштабе: Масштабирование латентных вычислений для больших языковых моделей
https://www.alphaxiv.org/abs/2607.08186
———
Представлено как альтернатива зацикленным трансформерам. Hidden Decoding – каждому токену выдаётся не один, а n эмбеддингов. Соответственно в n раз увеличивается входная последовательность и вычисления.
Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry
Автономия голов: Разреженное внимание без данных на основе замороженной геометрии запросов-ключей
https://www.alphaxiv.org/abs/2608.06849
———
Метод идентификации голов внимания по функциональной роли. По спектральной геометрии весов делит головы: на "головы извлечения" (retrieval heads) – глобальные – и "потоковые головы" (streaming heads) – локальные. В отличие от предыдущих методов не требует данных и обучения.
Автономия голов: Разреженное внимание без данных на основе замороженной геометрии запросов-ключей
https://www.alphaxiv.org/abs/2608.06849
———
Метод идентификации голов внимания по функциональной роли. По спектральной геометрии весов делит головы: на "головы извлечения" (retrieval heads) – глобальные – и "потоковые головы" (streaming heads) – локальные. В отличие от предыдущих методов не требует данных и обучения.
🔥 Atlas: A World Model for Spatial Intelligence | World Labs
https://www.worldlabs.ai/blog/atlas
Мировая во всех смыслах модель.
https://www.worldlabs.ai/blog/atlas
Мировая во всех смыслах модель.
www.worldlabs.ai
Atlas: A World Model for Spatial Intelligence
Introducing Atlas, our new omni world model for spatial intelligence.
🔥1
Causal Interventions Reveal Typologically Organized Syntactic Mechanisms in Multilingual Language Models
Причинные интервенции выявляют типологически организованные синтаксические механизмы в многоязычных языковых моделях
https://www.alphaxiv.org/abs/2608.28924
———
LLM кластеризует языки в хабы, соответствующие их лингвистическим семьям: например, романские языки (французский, итальянский, испанский) или славянские языки (русский, болгарский, польский). Внутри хаба LLM одинаковым образом кодирует общие для группы абстрактные представления, например, «множественность».
К примеру, в «остаточном потоке» можно найти направление/размерность, которая переключает множественность в английском языке, после чего в этом направлении сдвинуть скрытое состояние для предложения на немецком – воздействие будет аналогичным как в исходном языке, так как оба языка принадлежат к «хабу» индоевропейских языков.
Причинные интервенции выявляют типологически организованные синтаксические механизмы в многоязычных языковых моделях
https://www.alphaxiv.org/abs/2608.28924
———
LLM кластеризует языки в хабы, соответствующие их лингвистическим семьям: например, романские языки (французский, итальянский, испанский) или славянские языки (русский, болгарский, польский). Внутри хаба LLM одинаковым образом кодирует общие для группы абстрактные представления, например, «множественность».
К примеру, в «остаточном потоке» можно найти направление/размерность, которая переключает множественность в английском языке, после чего в этом направлении сдвинуть скрытое состояние для предложения на немецком – воздействие будет аналогичным как в исходном языке, так как оба языка принадлежат к «хабу» индоевропейских языков.