Sparse Hash AI
176 subscribers
189 photos
279 videos
4 files
626 links
AI обогатительная разработка ML месторождений. Осторожно, в канале ведутся подрывные работы!
Download Telegram
Катастрофическое Забывание в Нейронных Сетях
Когда нейронные сети обучаются новым задачам, они часто страдают от катастрофического забывания — тенденции перезаписывать или ухудшать ранее полученные знания.

Например, тонкая настройка языковой модели для научного рассуждения может привести к потере общих арифметических способностей или навыков понимания языка.

И это было в Симпсонах.
😁1
Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights
Нейронные Заросли: Разнообразные Эксперты Задач Концентрируются Вокруг Предварительно Обученных Весов
https://www.alphaxiv.org/overview/2603.12228

Исследователи предполагают, что большие предварительно обученные нейронные сети существуют в режиме «зарослей», где их весовое пространство плотно заполнено разнообразными экспертами, ориентированными на конкретные задачи, доступными с помощью простых случайных возмущений. Их алгоритм «RandOpt», который случайным образом отбирает и объединяет эти возмущения, достиг производительности, сопоставимой или превосходящей установленные градиентные методы пост-обучения на различных задачах LLM и VLM.

———

Предобученная LLM представляет из себя плотные «заросли» (thicket) экспертов, которых можно «вытаскивать» из неё случайным возмущением параметров.

Более крупные модели содержат более разнообразных специалистов, а не универсалов. В то время как небольшие модели показывают минимальное улучшение от случайных возмущений.
Preconditioned Attention: Enhancing Efficiency in Transformers
Предварительно обусловленное внимание: Повышение эффективности в трансформерах
https://www.alphaxiv.org/overview/2603.27153

Исследователи представили метод, названный «предварительно обусловленное внимание» (preconditioned attention), для смягчения плохой обусловленности матриц самовнимания в трансформерах. Это привело к ускорению сходимости обучения на 20–30 % и стабильному повышению производительности в различных задачах компьютерного зрения и обработки естественного языка.

В численном анализе плохо обусловленная матрица — это та, где небольшие изменения на входе или в градиентах могут приводить к большим, нестабильным изменениям на выходе, что обычно замедляет сходимость алгоритмов оптимизации, таких как Adam или SGD. Для решения этой проблемы авторы предлагают метод, названный "Предварительно обусловленное внимание" (Preconditioned Attention). Этот подход вводит простую диагональную матрицу обусловливания, которая служит стабилизации процесса обучения и улучшению конечной производительности модели.
Ouroboros: Dynamic Weight Generation for Recursive Transformers via Input-Conditioned LoRA Modulation
Уроборос: Динамическая генерация весов для рекурсивных трансформеров посредством модуляции LoRA, обусловленной входными данными
https://www.alphaxiv.org/ru/overview/2604.02051
https://github.com/RightNow-AI/ouroboros

Исследователи из RightNow AI разработали OUROBOROS, рекурсивную архитектуру трансформера, которая использует компактную гиперсеть (CompactController) для динамической генерации зависимых от входа модуляций весов для своего рекуррентного блока. Эта система достигла снижения потерь при обучении на внутрираспределенных данных на 43.4% по сравнению с 17-слойным базисом, используя всего 0.6% параметров базовой модели.
Always Skip Attention
https://www.alphaxiv.org/overview/2505.01996

Исследователи из Университета Аделаиды и CSIRO обнаружили, что механизм self-attention в Vision Transformers требует использования skip-связей для предотвращения катастрофического сбоя обучения, связывая это с его внутренне плохой обусловленностью. Они представили Token Graying, метод предварительного кондиционирования, который улучшил точность ViT на ImageNet-1K до 0.3% с минимальными вычислительными затратами.

———

Удаление остаточных соединений из блока self-attention приводит к катастрофическому сбою обучения. Статья дает объяснение того, почему остаточные связи не просто полезны, но абсолютно необходимы для стабильного обучения self-attention. Остаточная связь эффективно регуляризует обусловленность, обеспечивая, чтобы преобразование не слишком сильно отклонялось от тождественной операции.
CAWN: Continuous Acoustic Wave Networks for Autoregressive Language Modeling
CAWN: Непрерывные акустические волновые сети для авторегрессионного языкового моделирования
https://www.alphaxiv.org/overview/2604.04250

Сеть непрерывных акустических волн (CAWN) моделирует язык как конструктивную и деструктивную интерференцию волн в комплексной области, предлагая альтернативу механизму самовнимания Transformer для авторегрессионного языкового моделирования. Эта архитектура обрабатывает последовательности с линейной временной сложностью и постоянным масштабированием памяти для инференции, демонстрируя способность обрабатывать до 2 миллионов токенов, сохраняя при этом постоянную скорость генерации 52 токена/секунду и конкурентоспособные возможности эмерджентного рассуждения.
Only relative ranks matter in weight-clustered large language models
Важны только относительные ранги в весово-кластеризованных больших языковых моделях
https://www.alphaxiv.org/overview/2603.17917

Это исследование демонстрирует, что относительные ранги значений весов являются основным определяющим фактором производительности в больших языковых моделях, а не их точные числовые значения. Посредством систематической кластеризации весов и рандомизации центроидов, исследование показывает, что модификации, сохраняющие ранг, приводят к минимальному увеличению перплексии, в то время как изменения, нарушающие ранг, вызывают значительную деградацию, что указывает на надежные стратегии сжатия моделей.
🔥1
The Phasor Transformer: Resolving Attention Bottlenecks on the Unit Circle
Фазорный Трансформер: Разрешение Узких Мест Внимания на Единичном Круге
https://www.alphaxiv.org/ru/overview/2603.17433

Трансформер-Фазор (Phasor Transformer) и его глубокий вариант, Модель Большого Фазора (LPM), представляют собой архитектуру моделирования последовательностей с нативной обработкой фазы, которая решает проблему квадратичной сложности самовнимания. Она достигает глобального смешивания токенов со сложностью O(N log N) и значительно меньшим количеством обучаемых параметров, представляя состояния последовательности как фазы на единичной окружности, демонстрируя стабильное авторегрессионное моделирование для осциллирующих временных рядов.

———
Как и в недавней работе CAWN: Continuous Acoustic Wave Networks for Autoregressive Language Modeling здесь сделан переход в частотную область и интерференцию волн в комплексной области. Требуемое число обучаемых параметров (на слой) равно длине контекста ∗ 2.
🔥

All elementary functions from a single binary operator
Все элементарные функции из одной бинарной операции
https://www.alphaxiv.org/overview/2603.21852

Один бинарный оператор, eml(x, y) = exp(x) - ln(y), в сочетании с константой 1, функционально полон для генерации всех стандартных элементарных функций и операций, обычно встречающихся на научном калькуляторе. Это открытие позволяет использовать унифицированное представление математических выражений в виде бинарного дерева и позволяет точно восстанавливать эти функции из числовых данных с использованием символьной регрессии на основе градиента.
🔥3
Learning without training: The implicit dynamics of in-context learning
Обучение без тренировки: Неявная динамика внутриконтекстного обучения
https://www.alphaxiv.org/overview/2507.16003
https://github.com/ricardotrevisan/incontext-learning

Это исследование Google Research демонстрирует, что внутриконтекстное обучение (ICL) в больших языковых моделях (LLM) может быть теоретически объяснено как неявное, низкоранговое обновление весов слоя многослойного перцептрона (MLP) в блоке трансформера. Эксперименты подтверждают, что предсказания модели с внутриконтекстной подсказкой идентичны тем, что делаются путем явного применения этих полученных обновлений весов без промпта.
💡

Невнимательный
Трансформер


Разбирая Learning without training: The implicit dynamics of in-context learning, докопался с ИИ до превращения трансформера в RNN (TTT) через периодическое обновление весов MLP во время вывода.

Контекст/кэш может быть небольшим – это аналог рабочей памяти (он может вообще отсутствовать при обновлении весов на каждом токене).

При выходе контекста за заданную длину мы фиксируем его в весах MLP (выступает аналогом долговременной памяти) и очищаем кэш – аналог сна, где дневные знания закрепляются в долговременной памяти.
Sparse Hash AI
Learning without training: The implicit dynamics of in-context learning Обучение без тренировки: Неявная динамика внутриконтекстного обучения https://www.alphaxiv.org/overview/2507.16003 https://github.com/ricardotrevisan/incontext-learning Это исследование…
💡

Трансформер неявно обновляет веса во время инференса, следовательно, LLM обучается на собственной выдаче. Этим можно объяснить деградацию контекста (Context Rot): качество ответов начинает падать с ростом контекста, так как обучение моделей на их же выводах приводит к сильному ухудшению качества.

Кроме того, LLM должна демонстрировать предвзятость к своему предыдущему ответу, поскольку он усиливается в её весах, и модель становится более склонной к его повторению.
❤1
The Illusion of Stochasticity in LLMs
Иллюзия стохастичности в LLM
https://www.alphaxiv.org/overview/2604.06543

Исследователи Google DeepMind эмпирически продемонстрировали, что большие языковые модели (LLM) проявляют «иллюзию стохастичности», постоянно производя смещенные выборки вместо истинных случайных результатов из заданных вероятностных распределений. Исследование показало, что, хотя LLM испытывают трудности с генерацией внутренней случайности, они могут достичь надежной стохастичности, используя внешние генераторы псевдослучайных чисел (PRNG) или детерминированно преобразуя истинно случайный ввод в целевое распределение.
In-Place Test-Time Training
Обучение на месте во время тестирования
https://www.alphaxiv.org/overview/2604.06169

Встроенное обучение во время тестирования (In-Place TTT) позволяет динамически адаптировать большие языковые модели за счет перепрофилирования существующих блоков MLP для эффективных, поблочных обновлений с целью, согласованной с предсказанием следующего токена. Эта структура демонстрирует последовательное улучшение производительности на бенчмарках с длинным контекстом, таких как RULER, и достигает более низкой перплексии по сравнению с базовыми моделями, при этом вводя незначительные вычислительные накладные расходы.
💡

Частое переключение внимания между разнообразными темами, так называемое клиповое мышление у людей, возможно, требуется для эффективного обучения.

То есть постоянная смена контекста работает как батчинг с shuffle=True в DataLoader, не позволяя мозгу переобучаться.
😁3👍1