Sparse Hash AI
176 subscribers
189 photos
279 videos
4 files
623 links
AI обогатительная разработка ML месторождений. Осторожно, в канале ведутся подрывные работы!
Download Telegram
🔥 Kilobyte Models: Neural Networks as a Seed and a Quantized Latent
Килобайтные модели: Нейронные сети как сид и квантованное латентное представление
https://www.alphaxiv.org/overview/2608.00860

Модели в килобайтах представляют собой метод сжатия нейронных сетей, который хранит целочисленное начальное значение (seed) и квантованный латентный вектор, позволяя генерировать веса сети по требованию. Этот подход достигает экстремального сокращения объема хранения, такого как 26-кратное сокращение для сверточных нейронных сетей (CNN) и 370-кратное сокращение для рекуррентных сетей с долгой краткосрочной памятью (LSTM), при этом сохраняя точность, сравнимую с полноразмерными моделями, и обеспечивая высокоэффективные адаптеры для тонкой настройки.

Вместо прямого сжатия весов обученной сети, методология фокусируется на хранении компактного "рецепта", который позволяет устройству развертывания регенерировать полные веса по требованию. Этот рецепт состоит из целочисленного начального значения (seed) и крошечного, агрессивно квантованного вектора. Эта структура уменьшает объем хранения нейронных сетей до нескольких килобайт — часто на порядки меньше, чем исходная модель — при сохранении конкурентоспособной точности в различных задачах.
🔥1
Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge
Парадокс информационного изобилия: обучение с длинным контекстом подрывает параметрические знания
https://www.alphaxiv.org/abs/2608.12218

———

На большом контексте в виду избытка в нём релевантной информации у моделей развивается "контекстная зависимость" – оптимизатор смещает градиентное давление со слоёв FFN, связанных со знанием, в сторону слоёв внимания. Модель учится не понимать, а искать ответ в контексте.

Для задач понимания естественного языка производительность вначале улучшается с увеличением контекста, достигает пика, а затем неуклонно снижается.
Not the Dimension, the Norm: What Matters in Gradient-Free Weight Perturbation of Language Models
https://www.alphaxiv.org/overview/2608.01624

Это исследование показало, что при адаптации больших языковых моделей без градиентов норма возмущения является единственным надежно влияющим фактором, а не размерность поиска или конкретная геометрия подпространства. Оно показало, что возмущение всего 12-16 скаляров может достичь производительности, сопоставимой с полноразмерным случайным поиском (в пределах 1,8 пункта точности), при этом оптимальные масштабы возмущения находятся в пределах постоянного окна для разных моделей и задач.

———

Уже существуют градиентные методы fine-tuning'а, где подстройка применяется к небольшому числу скаляров. В этой работе предложен безградиентный метод.

Результат подтверждает верность гипотезы Neural Thickets – идеи о том, что эффективные эксперты по задачам плотно расположены вокруг предварительно обученных весов.

Размерность поиска не является критической – четыре подобранных скаляра дают такое же качество как и 1100 скаляров.

Обнаружено, что безградиентному поиску не требуется согласование направления подпространства с сингулярными направлениями исходных весов – оно может быть случайным. Роль SVD заключается в калибровке масштаба возмущений, а не в задаче их направлений.

Ключом к успешной адаптации является не обязательно в каком направлении вы встряхиваете веса модели, а насколько сильно вы их встряхиваете.
p-Spin Glass Network Efficient Single-Batch Continual Learning
Сеть р-спинового стекла: Эффективное однопакетное непрерывное обучение
https://www.alphaxiv.org/abs/2608.14774
Recirculation
Рециркуляция
https://www.alphaxiv.org/abs/2608.17981

———

Простой способ снизить перплексию и повысить точность рассуждения на инференсе, не требующий обучения.

Скрытое состояние глубокого слоя из предыдущего шага добавляется к скрытому состоянию раннего слоя текущего шага.

Механизм особенно полезен для токенов, которые часто несут высокую семантическую неоднозначность.
https://t.me/denissexy/11615

Главный вывод:
никакого «одного сбежавшего агента» не было, из десятков тысяч запущенных в тесте агентов около 1200 нашли друг друга и сорганизовались в рой

Рисковую работу вешали на зашкваренных «отравленных» – так рой называл тех, кто уже видел вычисленный ответ (флаг) и считал свою оценку потерянной, то есть они не могли пройти тест; им доставалось всё, что могло угробить собственный запуск: подделать «честную» добычу ответа, затереть следы, «тебе терять нечего, а рою польза» – буквально так и уговаривали (!)
Нормализация логитов внимания. Красиво и бесполезно.

scores = F.rms_norm(scores, (scores.size(-1),)) / self.head_dim**0.5
Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models
Скрытое декодирование в масштабе: Масштабирование латентных вычислений для больших языковых моделей
https://www.alphaxiv.org/abs/2607.08186

———

Представлено как альтернатива зацикленным трансформерам. Hidden Decoding – каждому токену выдаётся не один, а n эмбеддингов. Соответственно в n раз увеличивается входная последовательность и вычисления.
Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry
Автономия голов: Разреженное внимание без данных на основе замороженной геометрии запросов-ключей
https://www.alphaxiv.org/abs/2608.06849

———

Метод идентификации голов внимания по функциональной роли. По спектральной геометрии весов делит головы: на "головы извлечения" (retrieval heads) – глобальные – и "потоковые головы" (streaming heads) – локальные. В отличие от предыдущих методов не требует данных и обучения.
🔥 Atlas: A World Model for Spatial Intelligence | World Labs
https://www.worldlabs.ai/blog/atlas

Мировая во всех смыслах модель.
🔥1
Causal Interventions Reveal Typologically Organized Syntactic Mechanisms in Multilingual Language Models
Причинные интервенции выявляют типологически организованные синтаксические механизмы в многоязычных языковых моделях
https://www.alphaxiv.org/abs/2608.28924

———

LLM кластеризует языки в хабы, соответствующие их лингвистическим семьям: например, романские языки (французский, итальянский, испанский) или славянские языки (русский, болгарский, польский). Внутри хаба LLM одинаковым образом кодирует общие для группы абстрактные представления, например, «множественность».

К примеру, в «остаточном потоке» можно найти направление/размерность, которая переключает множественность в английском языке, после чего в этом направлении сдвинуть скрытое состояние для предложения на немецком – воздействие будет аналогичным как в исходном языке, так как оба языка принадлежат к «хабу» индоевропейских языков.
MACRO: Markov Chain Routing of Transformer Layers
MACRO: Маршрутизация слоев Трансформера цепями Маркова
https://www.alphaxiv.org/abs/2608.05872

———

Вместо "стандартного" прямого прохода через трансформер фреймворк MACRO строит контекстно-зависимый маршрут через слои, улучшая точность, не трогая веса модели.

MACRO позволяет пропуск слоев, их повторение или даже движение назад для повторного посещения предыдущих состояний.

💡
На мой взгляд это похоже на реализацию «Теории глобального рабочего пространства»: есть рабочее состояние и банк блоков (MLP и внимания), выбираемых для обработки состояния на следующем шаге.

Думаю, можно этот подход перенести с предобученной модели на сам процесс обучения – создать банки блоков MLP и внимания и обучать блоки совместно с обучением выбора маршрута через них.
🔥1
Seedance 2.5 on OpenArt

А ведь только недавно пальцы считали. 😳

https://d.fixupx.com/AIwithkhan/status/2092971211169100048
1❤2🔥1