Model collapse (или «инбридинг ИИ») – это эффект, когда нейросети тупеют, если обучаются на данных, созданных другими нейросетями, а не людьми.
Ответ на вопрос: зачем Матрице нужны люди? Без людей она тупеет.
❤1
Emergent Capabilities Arise Randomly from Learning Sparse Attention Patterns
Эмерджентные способности возникают случайно в результате обучения разреженным паттернам внимания
https://www.alphaxiv.org/overview/2606.25010
Эмерджентные способности в трансформерных языковых моделях появляются внезапно и стохастически во время обучения, что соответствует внезапному приобретению разреженных, релевантных задаче паттернов внимания, которые представляют собой критическое узкое место в обучении. Каузальные абляции и синтетические эксперименты показывают, что изучение этих паттернов внимания часто является ограничивающим фактором, при этом архитектурные решения, такие как увеличение количества голов внимания, значительно повышают эффективность.
Эмерджентные способности возникают случайно в результате обучения разреженным паттернам внимания
https://www.alphaxiv.org/overview/2606.25010
Эмерджентные способности в трансформерных языковых моделях появляются внезапно и стохастически во время обучения, что соответствует внезапному приобретению разреженных, релевантных задаче паттернов внимания, которые представляют собой критическое узкое место в обучении. Каузальные абляции и синтетические эксперименты показывают, что изучение этих паттернов внимания часто является ограничивающим фактором, при этом архитектурные решения, такие как увеличение количества голов внимания, значительно повышают эффективность.
👍1
Structure and Redundancy in Large Language Models: A Spectral Study via Random Matrix Theory
Структура и избыточность в больших языковых моделях: Спектральное исследование посредством теории случайных матриц
https://www.alphaxiv.org/overview/2602.22345
Диссертация Давиде Эттори исследует внутреннюю динамику больших языковых и визуально-языковых моделей, используя спектральную геометрию и теорию случайных матриц (ТСМ). Работа представляет EigenTrack для обнаружения галлюцинаций и поведения вне распределения в реальном времени, достигая показателей AUROC до 0,894 для обнаружения галлюцинаций в LLaMa 7B, и RMT-KD для сжатия моделей, уменьшая количество параметров BERT-base на 80% с улучшением точности.
———
Активации слоёв в LLM – это сумма шума и низкорангового сигнала. Сигнал соответствует выбросам собственных значений активаций, превышающим порог основной массы шума. Метод сжатия отделяет сигнал от шума и уменьшает размерность слоя, сохраняя в весах только «причинные направления» сигнала.
Спектральный мониторинг активаций также позволяет уверенно обнаруживать галлюцинации.
Структура и избыточность в больших языковых моделях: Спектральное исследование посредством теории случайных матриц
https://www.alphaxiv.org/overview/2602.22345
Диссертация Давиде Эттори исследует внутреннюю динамику больших языковых и визуально-языковых моделей, используя спектральную геометрию и теорию случайных матриц (ТСМ). Работа представляет EigenTrack для обнаружения галлюцинаций и поведения вне распределения в реальном времени, достигая показателей AUROC до 0,894 для обнаружения галлюцинаций в LLaMa 7B, и RMT-KD для сжатия моделей, уменьшая количество параметров BERT-base на 80% с улучшением точности.
———
Активации слоёв в LLM – это сумма шума и низкорангового сигнала. Сигнал соответствует выбросам собственных значений активаций, превышающим порог основной массы шума. Метод сжатия отделяет сигнал от шума и уменьшает размерность слоя, сохраняя в весах только «причинные направления» сигнала.
Спектральный мониторинг активаций также позволяет уверенно обнаруживать галлюцинации.
Abstract representational geometry supports inference in large language models
Абстрактная геометрия представлений поддерживает вывод в больших языковых моделях
https://www.alphaxiv.org/ru/overview/2606.23345
Большие языковые модели (LLM) развивают абстрактные репрезентативные геометрии, аналогичные тем, что наблюдаются в биологических системах при выполнении сложного рассуждения. Успешный вывод LLM связан с появлением ортогональных, распутанных многообразий в их внутренних состояниях, особенно в средних и более высоких слоях, что может быть вызвано или усилено с помощью конкретных методов обучения.
Абстрактная геометрия представлений поддерживает вывод в больших языковых моделях
https://www.alphaxiv.org/ru/overview/2606.23345
Большие языковые модели (LLM) развивают абстрактные репрезентативные геометрии, аналогичные тем, что наблюдаются в биологических системах при выполнении сложного рассуждения. Успешный вывод LLM связан с появлением ортогональных, распутанных многообразий в их внутренних состояниях, особенно в средних и более высоких слоях, что может быть вызвано или усилено с помощью конкретных методов обучения.
Две недавние работы*, которые мне попались, говорят об одном: гиппокамп человека и новый метод сжатия моделей отделяют полезный сигнал от шума через проекцию на факторизованные структуры.
В гиппокампе эти структуры в нейронных состояниях называются «когнитивные карты» – абстрактные низкоразмерные, полуортогональные геометрии. А в работе по сжатию найдено как эти самые низкоразмерные геометрии получить из «причинных» направлений (PCA) в скрытых высокоразмерных активациях.
Structure and Redundancy in Large Language Models: A Spectral Study via Random Matrix Theory
Структура и избыточность в больших языковых моделях: Спектральное исследование посредством теории случайных матриц
https://t.me/SparseHashAI/825
Abstract representational geometry supports inference in large language models
Абстрактная геометрия представлений поддерживает вывод в больших языковых моделях
https://t.me/SparseHashAI/826
* интересное совпадение в их номерах: 2602.22345 и 2606.23345
В гиппокампе эти структуры в нейронных состояниях называются «когнитивные карты» – абстрактные низкоразмерные, полуортогональные геометрии. А в работе по сжатию найдено как эти самые низкоразмерные геометрии получить из «причинных» направлений (PCA) в скрытых высокоразмерных активациях.
Structure and Redundancy in Large Language Models: A Spectral Study via Random Matrix Theory
Структура и избыточность в больших языковых моделях: Спектральное исследование посредством теории случайных матриц
https://t.me/SparseHashAI/825
Abstract representational geometry supports inference in large language models
Абстрактная геометрия представлений поддерживает вывод в больших языковых моделях
https://t.me/SparseHashAI/826
* интересное совпадение в их номерах: 2602.22345 и 2606.23345
Structure Before Collapse: Transient semantic geometry in next-token prediction
Структура перед коллапсом: Переходная семантическая геометрия в предсказании следующего токена
https://www.alphaxiv.org/overview/2606.26749
Нейронные сети, обученные для предсказания следующего токена с использованием one-hot надзора, демонстрируют переходную фазу, когда представления выравниваются со скрытыми семантическими структурами, прежде чем сойтись к геометрии, управляемой метками и коллапсирующей, предсказанной теорией нейронного коллапса. Эта динамика последовательно наблюдается в синтетических языках и усиливается с увеличением мощности модели, предлагая примирение между теоретическими предсказаниями и возможностями семантического обучения больших языковых моделей.
———
Выходной слой LLM специализирован для задачи классификации. Теория нейронного коллапса говорит, что внутренние представления классификатора в итоге должны «коллапсировать» в геометрию, ориентированную только на метки, что стирает семантическую информацию.
В экспериментах на небольших моделях обнаружено, что они проходят через «семантическую» фазу представлений, а затем коллапсируют.
Коллапс произошёл бы и с LLM, но из-за своих размеров они сильно недообучены и поэтому их средние слои застревают в «семантической» фазе и сохраняют больше семантической структуры, чем финальный слой. LLM «работают», потому что они функционируют в этом переходном семантическом режиме, а не на абсолютном пределе оптимизации.
Структура перед коллапсом: Переходная семантическая геометрия в предсказании следующего токена
https://www.alphaxiv.org/overview/2606.26749
Нейронные сети, обученные для предсказания следующего токена с использованием one-hot надзора, демонстрируют переходную фазу, когда представления выравниваются со скрытыми семантическими структурами, прежде чем сойтись к геометрии, управляемой метками и коллапсирующей, предсказанной теорией нейронного коллапса. Эта динамика последовательно наблюдается в синтетических языках и усиливается с увеличением мощности модели, предлагая примирение между теоретическими предсказаниями и возможностями семантического обучения больших языковых моделей.
———
Выходной слой LLM специализирован для задачи классификации. Теория нейронного коллапса говорит, что внутренние представления классификатора в итоге должны «коллапсировать» в геометрию, ориентированную только на метки, что стирает семантическую информацию.
В экспериментах на небольших моделях обнаружено, что они проходят через «семантическую» фазу представлений, а затем коллапсируют.
Коллапс произошёл бы и с LLM, но из-за своих размеров они сильно недообучены и поэтому их средние слои застревают в «семантической» фазе и сохраняют больше семантической структуры, чем финальный слой. LLM «работают», потому что они функционируют в этом переходном семантическом режиме, а не на абсолютном пределе оптимизации.
Learning In-context n-grams with Transformers: Sub-n-grams Are Near-stationary Points
Обучение внутриконтекстных n-грамм с трансформерами: под-n-граммы — почти стационарные точки
https://www.alphaxiv.org/overview/2508.12837
Исследователи продемонстрировали, что оценщики под-n-грамм соответствуют почти стационарным точкам в ландшафте потерь перекрестной энтропии популяции упрощенных моделей трансформеров. Это теоретическое открытие объясняет эмпирически наблюдаемую поэтапную динамику обучения и продолжительные плато во время предсказания n-грамм в контексте, где модели переходят от более простых (k-грамм) к более сложным (n-грамм) прогностическим способностям.
———
Трансформер в n-граммой задаче сначала открывает для себя униграммы, затем биграммы, потом триграммы и т.д. Каждый раз после очередного открытия он попадает на плато потерь ("времени трейна") и застревает в его болоте, потому что там околонулевой градиент (стационарные точки в оптимизации), оптимизатор безбенза градиента не едет и встаёт.
С плато на плато, как с кочки на кочку, трансформер перескакивает через фазовые переходы. Это происходит, когда одна из голов внимания вдруг "отрывается" от коллективного мнения и начинает смотреть дальше n-граммного носа – тогда начинается движ: градиент растёт, лосс падает, модель шустро изучает n-грамму большей длины и... оптимизатор снова застревает на новом плато до очередной головы с иным видением ситуации.
Кстати, результаты этой работы, вижу, напрямую соответствуют другой недавней работе Emergent Capabilities Arise Randomly from Learning Sparse Attention Patterns, где внезапность и стохастичность появления эмерджентных способностей у моделей связывают с обучением головами правильных паттернов внимания. Неопределённость времени нахождения на плато даёт стохастичность, внезапность – это фазовый переход. А новый паттерн внимания находит та самая оторвавшаяся голова.
Обучение внутриконтекстных n-грамм с трансформерами: под-n-граммы — почти стационарные точки
https://www.alphaxiv.org/overview/2508.12837
Исследователи продемонстрировали, что оценщики под-n-грамм соответствуют почти стационарным точкам в ландшафте потерь перекрестной энтропии популяции упрощенных моделей трансформеров. Это теоретическое открытие объясняет эмпирически наблюдаемую поэтапную динамику обучения и продолжительные плато во время предсказания n-грамм в контексте, где модели переходят от более простых (k-грамм) к более сложным (n-грамм) прогностическим способностям.
———
Трансформер в n-граммой задаче сначала открывает для себя униграммы, затем биграммы, потом триграммы и т.д. Каждый раз после очередного открытия он попадает на плато потерь ("времени трейна") и застревает в его болоте, потому что там околонулевой градиент (стационарные точки в оптимизации), оптимизатор без
С плато на плато, как с кочки на кочку, трансформер перескакивает через фазовые переходы. Это происходит, когда одна из голов внимания вдруг "отрывается" от коллективного мнения и начинает смотреть дальше n-граммного носа – тогда начинается движ: градиент растёт, лосс падает, модель шустро изучает n-грамму большей длины и... оптимизатор снова застревает на новом плато до очередной головы с иным видением ситуации.
Кстати, результаты этой работы, вижу, напрямую соответствуют другой недавней работе Emergent Capabilities Arise Randomly from Learning Sparse Attention Patterns, где внезапность и стохастичность появления эмерджентных способностей у моделей связывают с обучением головами правильных паттернов внимания. Неопределённость времени нахождения на плато даёт стохастичность, внезапность – это фазовый переход. А новый паттерн внимания находит та самая оторвавшаяся голова.
Revisiting the Volume Hypothesis
Пересмотр гипотезы объема
https://www.alphaxiv.org/overview/2606.31282
https://github.com/liorKreimer/Revisiting-the-Volume-Hypothesis
Исследователи изучают, почему глубокие нейронные сети обобщают, количественно оценивая «объем» хорошо обобщающих решений с помощью алгоритма Replica Exchange Wang-Landau. Их анализ показывает, что преимущество обобщения, получаемое при оптимизации на основе градиента по сравнению со случайной выборкой, уменьшается по мере увеличения размера обучающих данных, что примиряет ранее противоречивые выводы в теории глубокого обучения.
———
Когда данных мало, SGD находит более качественные решения, чем случайный поиск. А когда данных много, случайный поиск приближается к производительности SGD.
Большие наборы данных действуют как мощный фильтр, отсеивая подавляющее большинство «беспорядочных» функций и оставляя концентрированный набор параметров, которые ведут себя аналогично на тестовом наборе.
Пересмотр гипотезы объема
https://www.alphaxiv.org/overview/2606.31282
https://github.com/liorKreimer/Revisiting-the-Volume-Hypothesis
Исследователи изучают, почему глубокие нейронные сети обобщают, количественно оценивая «объем» хорошо обобщающих решений с помощью алгоритма Replica Exchange Wang-Landau. Их анализ показывает, что преимущество обобщения, получаемое при оптимизации на основе градиента по сравнению со случайной выборкой, уменьшается по мере увеличения размера обучающих данных, что примиряет ранее противоречивые выводы в теории глубокого обучения.
———
Когда данных мало, SGD находит более качественные решения, чем случайный поиск. А когда данных много, случайный поиск приближается к производительности SGD.
Большие наборы данных действуют как мощный фильтр, отсеивая подавляющее большинство «беспорядочных» функций и оставляя концентрированный набор параметров, которые ведут себя аналогично на тестовом наборе.
На ранних стадиях обучения или в условиях недостатка данных неявное смещение оптимизатора помогает модели найти "иголку в стоге сена". По мере роста данных сам "стог сена" начинает все больше и больше походить на "иголку".
По мере перехода к режимам "больших данных" внутренние свойства архитектур нейронных сетей (гипотеза объема) становятся основными движущими силами успеха, фактически "выполняя работу", которую мы ранее приписывали исключительно динамике градиентного спуска.
Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training
Достаточно ли одного слоя? Обучение одного слоя трансформера может сравниться с полнопараметрическим обучением с подкреплением.
https://www.alphaxiv.org/overview/2607.01232
Исследование адаптации больших языковых моделей с помощью обучения с подкреплением показывает, что прирост производительности в основном сосредоточен в стабильном подмножестве средних слоев трансформера, при этом однослойное обучение иногда восстанавливает более 100% улучшений полного обучения параметров и обеспечивает более эффективные стратегии обучения.
———
Достаточно дообучать только один средний слой.
Достаточно ли одного слоя? Обучение одного слоя трансформера может сравниться с полнопараметрическим обучением с подкреплением.
https://www.alphaxiv.org/overview/2607.01232
Исследование адаптации больших языковых моделей с помощью обучения с подкреплением показывает, что прирост производительности в основном сосредоточен в стабильном подмножестве средних слоев трансформера, при этом однослойное обучение иногда восстанавливает более 100% улучшений полного обучения параметров и обеспечивает более эффективные стратегии обучения.
———
Достаточно дообучать только один средний слой.
Token Geometry
Геометрия токенов
https://www.alphaxiv.org/overview/2607.01455
В статье представлен Ember, легковесный оптимизатор, специально разработанный для таблиц встраивания (embedding tables) и LM-головы (LM-head) в моделях Transformer. Ember значительно сокращает потребление VRAM для состояний оптимизатора с O(VD) до O(V+D), при этом соответствуя или превосходя производительность в задачах тонкой настройки, предварительного обучения и обучения с подкреплением, а также выявляя удивительно гладкие, низкоразмерные траектории оптимизации для отдельных токенов.
———
Представлен упрошённый оптимизатор для эмбеддингов с меньшим потреблением памяти O(V + D), чем O(2VD) у AdamW, где V – размер словаря, а D – скрытая размерность.
Исследование также изучает путь, который проходят отдельные эмбеддинги токенов во время обучения. Отимизацию токенов можно моделировать как плавное продвижение вдоль одномерного луча.
Геометрия токенов
https://www.alphaxiv.org/overview/2607.01455
В статье представлен Ember, легковесный оптимизатор, специально разработанный для таблиц встраивания (embedding tables) и LM-головы (LM-head) в моделях Transformer. Ember значительно сокращает потребление VRAM для состояний оптимизатора с O(VD) до O(V+D), при этом соответствуя или превосходя производительность в задачах тонкой настройки, предварительного обучения и обучения с подкреплением, а также выявляя удивительно гладкие, низкоразмерные траектории оптимизации для отдельных токенов.
———
Представлен упрошённый оптимизатор для эмбеддингов с меньшим потреблением памяти O(V + D), чем O(2VD) у AdamW, где V – размер словаря, а D – скрытая размерность.
Исследование также изучает путь, который проходят отдельные эмбеддинги токенов во время обучения. Отимизацию токенов можно моделировать как плавное продвижение вдоль одномерного луча.
Convergence of Continual Learning in Homogeneous Deep Networks
Сходимость непрерывного обучения в однородных глубоких сетях
https://www.alphaxiv.org/overview/2606.30559
Это исследование анализирует непрерывное обучение в однородных глубоких нейронных сетях, демонстрируя эквивалентность последовательным проекциям на специфичные для задач, часто невыпуклые, достижимые множества. Оно выявляет, что невыпуклость этих множеств является фундаментальной геометрической причиной катастрофического забывания, а также предоставляет локальные гарантии линейной сходимости, когда модели инициализируются близко к совместно достижимому решению.
———
Сходимость непрерывного обучения в однородных глубоких сетях
https://www.alphaxiv.org/overview/2606.30559
Это исследование анализирует непрерывное обучение в однородных глубоких нейронных сетях, демонстрируя эквивалентность последовательным проекциям на специфичные для задач, часто невыпуклые, достижимые множества. Оно выявляет, что невыпуклость этих множеств является фундаментальной геометрической причиной катастрофического забывания, а также предоставляет локальные гарантии линейной сходимости, когда модели инициализируются близко к совместно достижимому решению.
———
катастрофическое забывание является не просто проблемой многомерных данных или плохой оптимизации, а фундаментальным геометрическим следствием невыпуклости, присущей глубоким архитектурам.
DiscoLoop: Looping Discrete Embeddings and Continuous Hidden States for Multi-hop Reasoning
DiscoLoop: Зацикливание дискретных эмбеддингов и непрерывных скрытых состояний для многошагового рассуждения
https://www.alphaxiv.org/overview/2607.00341
Исследователи разработали DiscoLoop, архитектуру большой языковой модели, которая улучшает неявное многошаговое рассуждение путем комбинирования непрерывных скрытых состояний с дискретными векторами, выровненными по встраиванию, в повторяющихся циклах. Эта конструкция устраняет узкое место, связанное с несоответствием представлений, в существующих циклических трансформерах, что приводит к почти идеальной композиционной генерализации в задачах с символами и естественным языком, а также улучшает производительность без предварительного обучения (zero-shot) на стандартных тестах языкового моделирования.
———
В зацикленный трансформер было проведено простое вмешательство без обучения. Скрытое состояние смешивалось с «чистым» эмбеддингом декодированного из этого состояния токена. В задаче многошагового рассуждения точность достигала почти 100% как в сценариях ID, так и в сценариях OOD.
DiscoLoop: Зацикливание дискретных эмбеддингов и непрерывных скрытых состояний для многошагового рассуждения
https://www.alphaxiv.org/overview/2607.00341
Исследователи разработали DiscoLoop, архитектуру большой языковой модели, которая улучшает неявное многошаговое рассуждение путем комбинирования непрерывных скрытых состояний с дискретными векторами, выровненными по встраиванию, в повторяющихся циклах. Эта конструкция устраняет узкое место, связанное с несоответствием представлений, в существующих циклических трансформерах, что приводит к почти идеальной композиционной генерализации в задачах с символами и естественным языком, а также улучшает производительность без предварительного обучения (zero-shot) на стандартных тестах языкового моделирования.
———
В зацикленный трансформер было проведено простое вмешательство без обучения. Скрытое состояние смешивалось с «чистым» эмбеддингом декодированного из этого состояния токена. В задаче многошагового рассуждения точность достигала почти 100% как в сценариях ID, так и в сценариях OOD.
💡
J-space (global workspace), недавно открытое Anthropic, без которого в LLM не работает многошаговое рассуждение, на мой взгляд может быть связано с DiscoLoop: Looping Discrete Embeddings and Continuous Hidden States for Multi-hop Reasoning, где токены, о которых думает модель, как и в J-space, но находящиеся не в пространстве эмбеддингов (а в J-пространстве), в «чистом» виде подмешивались к скрытому состоянию.
Это похоже на перенос токена из J-пространства скрытых мыслей в обычное эмбеддинговое, с которым умеет работать LLM.
То есть, скрытое состояние содержит сумму двух каналов токенов: токены, которые LLM озвучивает, лежат в пространстве выходной головы трансформера и токены скрытых мыслей из отдельного подпространства, которые используются для цепочки рассуждений.
Это отдельное пространство для удержания мыслей – J-space – может быть просто найденным моделью решением одной выявленной проблемы стандартных трансформеров – «проблема локального хранения данных по глубине».
см. Hopping Too Late: Exploring the Limitations of Large Language Models on Multi-Hop Queries
Grokked Transformers are Implicit Reasoners: A Mechanistic Journey to the Edge of Generalization.
J-space выглядит как карман в пространстве, в который нижние слои складывают промежуточную «служебную» информацию, которая может потребоваться верхним слоям, и естественно, не должна попадать в вывод – не должна декодироваться головой.
J-space (global workspace), недавно открытое Anthropic, без которого в LLM не работает многошаговое рассуждение, на мой взгляд может быть связано с DiscoLoop: Looping Discrete Embeddings and Continuous Hidden States for Multi-hop Reasoning, где токены, о которых думает модель, как и в J-space, но находящиеся не в пространстве эмбеддингов (а в J-пространстве), в «чистом» виде подмешивались к скрытому состоянию.
Это похоже на перенос токена из J-пространства скрытых мыслей в обычное эмбеддинговое, с которым умеет работать LLM.
То есть, скрытое состояние содержит сумму двух каналов токенов: токены, которые LLM озвучивает, лежат в пространстве выходной головы трансформера и токены скрытых мыслей из отдельного подпространства, которые используются для цепочки рассуждений.
Это отдельное пространство для удержания мыслей – J-space – может быть просто найденным моделью решением одной выявленной проблемы стандартных трансформеров – «проблема локального хранения данных по глубине».
см. Hopping Too Late: Exploring the Limitations of Large Language Models on Multi-Hop Queries
Grokked Transformers are Implicit Reasoners: A Mechanistic Journey to the Edge of Generalization.
J-space выглядит как карман в пространстве, в который нижние слои складывают промежуточную «служебную» информацию, которая может потребоваться верхним слоям, и естественно, не должна попадать в вывод – не должна декодироваться головой.
Muon as a Residual Connection
Мюон как остаточная связь
https://www.alphaxiv.org/overview/2607.01124
Исследователи предполагают, что оптимизатор Muon функционирует как неявная остаточная связь во время обучения нейронных сетей. Эта интерпретация позволяет предположить, что Muon балансирует немедленное локальное снижение потерь с сохранением пригодных промежуточных представлений, что приводит к более быстрой общей сквозной оптимизации за счет создания лучше обусловленных последующих задач.
———
Работа интерпретирует Muon как неявное остаточное соединение. Основная причина, по которой Muon помогает нижележащим слоям, связана с числом обусловленности матриц весов. Muon естественным образом способствует «спектральной плоскостности» — он держит сингулярные значения весов близко друг к другу.
Мюон как остаточная связь
https://www.alphaxiv.org/overview/2607.01124
Исследователи предполагают, что оптимизатор Muon функционирует как неявная остаточная связь во время обучения нейронных сетей. Эта интерпретация позволяет предположить, что Muon балансирует немедленное локальное снижение потерь с сохранением пригодных промежуточных представлений, что приводит к более быстрой общей сквозной оптимизации за счет создания лучше обусловленных последующих задач.
———
Работа интерпретирует Muon как неявное остаточное соединение. Основная причина, по которой Muon помогает нижележащим слоям, связана с числом обусловленности матриц весов. Muon естественным образом способствует «спектральной плоскостности» — он держит сингулярные значения весов близко друг к другу.
Когда Muon ортогонализует градиент, он неизбежно отклоняется от направления наискорейшего спуска локального слоя. Это означает, что он жертвует некоторой "точностью градиента" — локальные потери могут уменьшаться не так быстро, как при использовании SGD. Однако результирующая матрица весов, как правило, имеет более плоский спектр сингулярных значений (лучшую обусловленность). Это "сохранение представления", и оно окупается позже, потому что последующие слои сталкиваются с гораздо более простой задачей оптимизации.
Если известно, что выход
Заморозим входные токены
Сойдётся? Да, выход будет очень точно соответствовать таргету – на первой картинке результирующая ошибка e-7, но результат при этом совершенно бесполезен.
Есть несчётное число паттернов внимания для этой последовательности токенов, которые дадут выходные вектора близкие к целевому. MSE вытаскивает первый попавшийся, но нам (мне) нужен именно тот паттерн, из которого был сделан таргет. Тупичок. (
Но... мне в итоге удалось (не с первого подхода) заставить оптимизатор восстанавливать единственный правильный паттерн. Вдаваться как это сделано пока не буду, просто хочу показать скрин – насколько чистым можно восстановить исходный паттерн – вторая картинка.
——
С некоторым небольшим шумом эта схема работает и с проекциями матрицы
А это значит, что если есть доступ только к входным активациям
A головы внимания есть сумма, например, пары токенов из входной последовательности x, то можно ли только по выходу и входу найти эти токены – паттерн внимания?
att_weights = softmax(Q K.T)
A = att_weights xЗаморозим входные токены
x, возьмём оценки схожести ключей-запросов как оптимизируемые параметры, а не вычислимые. Таргетом будет сумма двух входных токенов (первого и последнего), для лосса выберем функцию MSE.Сойдётся? Да, выход будет очень точно соответствовать таргету – на первой картинке результирующая ошибка e-7, но результат при этом совершенно бесполезен.
Есть несчётное число паттернов внимания для этой последовательности токенов, которые дадут выходные вектора близкие к целевому. MSE вытаскивает первый попавшийся, но нам (мне) нужен именно тот паттерн, из которого был сделан таргет. Тупичок. (
Но... мне в итоге удалось (не с первого подхода) заставить оптимизатор восстанавливать единственный правильный паттерн. Вдаваться как это сделано пока не буду, просто хочу показать скрин – насколько чистым можно восстановить исходный паттерн – вторая картинка.
——
С некоторым небольшим шумом эта схема работает и с проекциями матрицы
Wv.
A = att_weights x WvА это значит, что если есть доступ только к входным активациям
x слоя внимания и выходам его голов A, то можно вначале восстановить паттерны внимания, а затем по ним обучить/прошить свои проекционные матрицы ключей-запросов, тем самым получив (утащив) копию слоя внимания. ) * но нужен доступ к WvBeyond Backpropagation: Monte Carlo Method Can Train Deep Neural Networks
За пределами обратного распространения: Метод Монте-Карло может обучать глубокие нейронные сети
https://www.alphaxiv.org/overview/2607.08406
Хун Чжао демонстрирует, что метод выбора на основе мутации–оптимизации Монте-Карло может практически обучать глубокие нейронные сети, включая архитектуры Transformer, без использования градиентных вычислений. Этот безградиентный подход достиг конкурентной точности в классификации изображений и языковом моделировании на уровне символов, заметно обеспечив эффективное использование функций активации Гаусса.
———
Кроме демонстрации обучения разнообразных архитектур на упрощенной версии MCA на GPU, представлен метод прунинга, который вытаскивает из сети «лотерейный билет» (размером, например, всего 0,33% от исходных параметров).
За пределами обратного распространения: Метод Монте-Карло может обучать глубокие нейронные сети
https://www.alphaxiv.org/overview/2607.08406
Хун Чжао демонстрирует, что метод выбора на основе мутации–оптимизации Монте-Карло может практически обучать глубокие нейронные сети, включая архитектуры Transformer, без использования градиентных вычислений. Этот безградиентный подход достиг конкурентной точности в классификации изображений и языковом моделировании на уровне символов, заметно обеспечив эффективное использование функций активации Гаусса.
———
Кроме демонстрации обучения разнообразных архитектур на упрощенной версии MCA на GPU, представлен метод прунинга, который вытаскивает из сети «лотерейный билет» (размером, например, всего 0,33% от исходных параметров).
Эта работа демонстрирует, что упрощенная версия MCA, реализованная на современном GPU-оборудовании, может эффективно обучать широкий спектр архитектур — включая глубокие многослойные перцептроны, чрезвычайно широкие сети и даже Трансформеры — без какого-либо вычисления градиента.
В статье представлено pure pruning как механизм обучения. В этом подходе, вместо того чтобы возмущать веса на небольшую величину, алгоритм пытается установить вес равным нулю.
The Map Behind the Flow: Finite-Step Gradient Descent as a Dynamical System
Отображение за потоком: Конечношаговый градиентный спуск как динамическая система
https://www.alphaxiv.org/overview/2607.04993
Работа "Карта за потоком: Конечношаговый градиентный спуск как динамическая система" исследует градиентный спуск с фиксированным шагом как дискретную динамическую систему, объясняя сложные явления оптимизации, такие как "край стабильности". Она демонстрирует, что за пределами локальных пределов стабильности градиентный спуск проявляет структурированную динамику, включая циклы периода два, каскады удвоения периода и активное балансирование факторизаций, что приводит к выбору более плоских представлений.
———
Скорость обучения – это не то, что вы думали :/
Отображение за потоком: Конечношаговый градиентный спуск как динамическая система
https://www.alphaxiv.org/overview/2607.04993
Работа "Карта за потоком: Конечношаговый градиентный спуск как динамическая система" исследует градиентный спуск с фиксированным шагом как дискретную динамическую систему, объясняя сложные явления оптимизации, такие как "край стабильности". Она демонстрирует, что за пределами локальных пределов стабильности градиентный спуск проявляет структурированную динамику, включая циклы периода два, каскады удвоения периода и активное балансирование факторизаций, что приводит к выбору более плоских представлений.
———
Скорость обучения – это не то, что вы думали :/
🔥1