DiscoLoop: Looping Discrete Embeddings and Continuous Hidden States for Multi-hop Reasoning
DiscoLoop: Зацикливание дискретных эмбеддингов и непрерывных скрытых состояний для многошагового рассуждения
https://www.alphaxiv.org/overview/2607.00341
Исследователи разработали DiscoLoop, архитектуру большой языковой модели, которая улучшает неявное многошаговое рассуждение путем комбинирования непрерывных скрытых состояний с дискретными векторами, выровненными по встраиванию, в повторяющихся циклах. Эта конструкция устраняет узкое место, связанное с несоответствием представлений, в существующих циклических трансформерах, что приводит к почти идеальной композиционной генерализации в задачах с символами и естественным языком, а также улучшает производительность без предварительного обучения (zero-shot) на стандартных тестах языкового моделирования.
———
В зацикленный трансформер было проведено простое вмешательство без обучения. Скрытое состояние смешивалось с «чистым» эмбеддингом декодированного из этого состояния токена. В задаче многошагового рассуждения точность достигала почти 100% как в сценариях ID, так и в сценариях OOD.
DiscoLoop: Зацикливание дискретных эмбеддингов и непрерывных скрытых состояний для многошагового рассуждения
https://www.alphaxiv.org/overview/2607.00341
Исследователи разработали DiscoLoop, архитектуру большой языковой модели, которая улучшает неявное многошаговое рассуждение путем комбинирования непрерывных скрытых состояний с дискретными векторами, выровненными по встраиванию, в повторяющихся циклах. Эта конструкция устраняет узкое место, связанное с несоответствием представлений, в существующих циклических трансформерах, что приводит к почти идеальной композиционной генерализации в задачах с символами и естественным языком, а также улучшает производительность без предварительного обучения (zero-shot) на стандартных тестах языкового моделирования.
———
В зацикленный трансформер было проведено простое вмешательство без обучения. Скрытое состояние смешивалось с «чистым» эмбеддингом декодированного из этого состояния токена. В задаче многошагового рассуждения точность достигала почти 100% как в сценариях ID, так и в сценариях OOD.
💡
J-space (global workspace), недавно открытое Anthropic, без которого в LLM не работает многошаговое рассуждение, на мой взгляд может быть связано с DiscoLoop: Looping Discrete Embeddings and Continuous Hidden States for Multi-hop Reasoning, где токены, о которых думает модель, как и в J-space, но находящиеся не в пространстве эмбеддингов (а в J-пространстве), в «чистом» виде подмешивались к скрытому состоянию.
Это похоже на перенос токена из J-пространства скрытых мыслей в обычное эмбеддинговое, с которым умеет работать LLM.
То есть, скрытое состояние содержит сумму двух каналов токенов: токены, которые LLM озвучивает, лежат в пространстве выходной головы трансформера и токены скрытых мыслей из отдельного подпространства, которые используются для цепочки рассуждений.
Это отдельное пространство для удержания мыслей – J-space – может быть просто найденным моделью решением одной выявленной проблемы стандартных трансформеров – «проблема локального хранения данных по глубине».
см. Hopping Too Late: Exploring the Limitations of Large Language Models on Multi-Hop Queries
Grokked Transformers are Implicit Reasoners: A Mechanistic Journey to the Edge of Generalization.
J-space выглядит как карман в пространстве, в который нижние слои складывают промежуточную «служебную» информацию, которая может потребоваться верхним слоям, и естественно, не должна попадать в вывод – не должна декодироваться головой.
J-space (global workspace), недавно открытое Anthropic, без которого в LLM не работает многошаговое рассуждение, на мой взгляд может быть связано с DiscoLoop: Looping Discrete Embeddings and Continuous Hidden States for Multi-hop Reasoning, где токены, о которых думает модель, как и в J-space, но находящиеся не в пространстве эмбеддингов (а в J-пространстве), в «чистом» виде подмешивались к скрытому состоянию.
Это похоже на перенос токена из J-пространства скрытых мыслей в обычное эмбеддинговое, с которым умеет работать LLM.
То есть, скрытое состояние содержит сумму двух каналов токенов: токены, которые LLM озвучивает, лежат в пространстве выходной головы трансформера и токены скрытых мыслей из отдельного подпространства, которые используются для цепочки рассуждений.
Это отдельное пространство для удержания мыслей – J-space – может быть просто найденным моделью решением одной выявленной проблемы стандартных трансформеров – «проблема локального хранения данных по глубине».
см. Hopping Too Late: Exploring the Limitations of Large Language Models on Multi-Hop Queries
Grokked Transformers are Implicit Reasoners: A Mechanistic Journey to the Edge of Generalization.
J-space выглядит как карман в пространстве, в который нижние слои складывают промежуточную «служебную» информацию, которая может потребоваться верхним слоям, и естественно, не должна попадать в вывод – не должна декодироваться головой.
Muon as a Residual Connection
Мюон как остаточная связь
https://www.alphaxiv.org/overview/2607.01124
Исследователи предполагают, что оптимизатор Muon функционирует как неявная остаточная связь во время обучения нейронных сетей. Эта интерпретация позволяет предположить, что Muon балансирует немедленное локальное снижение потерь с сохранением пригодных промежуточных представлений, что приводит к более быстрой общей сквозной оптимизации за счет создания лучше обусловленных последующих задач.
———
Работа интерпретирует Muon как неявное остаточное соединение. Основная причина, по которой Muon помогает нижележащим слоям, связана с числом обусловленности матриц весов. Muon естественным образом способствует «спектральной плоскостности» — он держит сингулярные значения весов близко друг к другу.
Мюон как остаточная связь
https://www.alphaxiv.org/overview/2607.01124
Исследователи предполагают, что оптимизатор Muon функционирует как неявная остаточная связь во время обучения нейронных сетей. Эта интерпретация позволяет предположить, что Muon балансирует немедленное локальное снижение потерь с сохранением пригодных промежуточных представлений, что приводит к более быстрой общей сквозной оптимизации за счет создания лучше обусловленных последующих задач.
———
Работа интерпретирует Muon как неявное остаточное соединение. Основная причина, по которой Muon помогает нижележащим слоям, связана с числом обусловленности матриц весов. Muon естественным образом способствует «спектральной плоскостности» — он держит сингулярные значения весов близко друг к другу.
Когда Muon ортогонализует градиент, он неизбежно отклоняется от направления наискорейшего спуска локального слоя. Это означает, что он жертвует некоторой "точностью градиента" — локальные потери могут уменьшаться не так быстро, как при использовании SGD. Однако результирующая матрица весов, как правило, имеет более плоский спектр сингулярных значений (лучшую обусловленность). Это "сохранение представления", и оно окупается позже, потому что последующие слои сталкиваются с гораздо более простой задачей оптимизации.
Если известно, что выход
Заморозим входные токены
Сойдётся? Да, выход будет очень точно соответствовать таргету – на первой картинке результирующая ошибка e-7, но результат при этом совершенно бесполезен.
Есть несчётное число паттернов внимания для этой последовательности токенов, которые дадут выходные вектора близкие к целевому. MSE вытаскивает первый попавшийся, но нам (мне) нужен именно тот паттерн, из которого был сделан таргет. Тупичок. (
Но... мне в итоге удалось (не с первого подхода) заставить оптимизатор восстанавливать единственный правильный паттерн. Вдаваться как это сделано пока не буду, просто хочу показать скрин – насколько чистым можно восстановить исходный паттерн – вторая картинка.
——
С некоторым небольшим шумом эта схема работает и с проекциями матрицы
А это значит, что если есть доступ только к входным активациям
A головы внимания есть сумма, например, пары токенов из входной последовательности x, то можно ли только по выходу и входу найти эти токены – паттерн внимания?
att_weights = softmax(Q K.T)
A = att_weights xЗаморозим входные токены
x, возьмём оценки схожести ключей-запросов как оптимизируемые параметры, а не вычислимые. Таргетом будет сумма двух входных токенов (первого и последнего), для лосса выберем функцию MSE.Сойдётся? Да, выход будет очень точно соответствовать таргету – на первой картинке результирующая ошибка e-7, но результат при этом совершенно бесполезен.
Есть несчётное число паттернов внимания для этой последовательности токенов, которые дадут выходные вектора близкие к целевому. MSE вытаскивает первый попавшийся, но нам (мне) нужен именно тот паттерн, из которого был сделан таргет. Тупичок. (
Но... мне в итоге удалось (не с первого подхода) заставить оптимизатор восстанавливать единственный правильный паттерн. Вдаваться как это сделано пока не буду, просто хочу показать скрин – насколько чистым можно восстановить исходный паттерн – вторая картинка.
——
С некоторым небольшим шумом эта схема работает и с проекциями матрицы
Wv.
A = att_weights x WvА это значит, что если есть доступ только к входным активациям
x слоя внимания и выходам его голов A, то можно вначале восстановить паттерны внимания, а затем по ним обучить/прошить свои проекционные матрицы ключей-запросов, тем самым получив (утащив) копию слоя внимания. ) * но нужен доступ к WvBeyond Backpropagation: Monte Carlo Method Can Train Deep Neural Networks
За пределами обратного распространения: Метод Монте-Карло может обучать глубокие нейронные сети
https://www.alphaxiv.org/overview/2607.08406
Хун Чжао демонстрирует, что метод выбора на основе мутации–оптимизации Монте-Карло может практически обучать глубокие нейронные сети, включая архитектуры Transformer, без использования градиентных вычислений. Этот безградиентный подход достиг конкурентной точности в классификации изображений и языковом моделировании на уровне символов, заметно обеспечив эффективное использование функций активации Гаусса.
———
Кроме демонстрации обучения разнообразных архитектур на упрощенной версии MCA на GPU, представлен метод прунинга, который вытаскивает из сети «лотерейный билет» (размером, например, всего 0,33% от исходных параметров).
За пределами обратного распространения: Метод Монте-Карло может обучать глубокие нейронные сети
https://www.alphaxiv.org/overview/2607.08406
Хун Чжао демонстрирует, что метод выбора на основе мутации–оптимизации Монте-Карло может практически обучать глубокие нейронные сети, включая архитектуры Transformer, без использования градиентных вычислений. Этот безградиентный подход достиг конкурентной точности в классификации изображений и языковом моделировании на уровне символов, заметно обеспечив эффективное использование функций активации Гаусса.
———
Кроме демонстрации обучения разнообразных архитектур на упрощенной версии MCA на GPU, представлен метод прунинга, который вытаскивает из сети «лотерейный билет» (размером, например, всего 0,33% от исходных параметров).
Эта работа демонстрирует, что упрощенная версия MCA, реализованная на современном GPU-оборудовании, может эффективно обучать широкий спектр архитектур — включая глубокие многослойные перцептроны, чрезвычайно широкие сети и даже Трансформеры — без какого-либо вычисления градиента.
В статье представлено pure pruning как механизм обучения. В этом подходе, вместо того чтобы возмущать веса на небольшую величину, алгоритм пытается установить вес равным нулю.
The Map Behind the Flow: Finite-Step Gradient Descent as a Dynamical System
Отображение за потоком: Конечношаговый градиентный спуск как динамическая система
https://www.alphaxiv.org/overview/2607.04993
Работа "Карта за потоком: Конечношаговый градиентный спуск как динамическая система" исследует градиентный спуск с фиксированным шагом как дискретную динамическую систему, объясняя сложные явления оптимизации, такие как "край стабильности". Она демонстрирует, что за пределами локальных пределов стабильности градиентный спуск проявляет структурированную динамику, включая циклы периода два, каскады удвоения периода и активное балансирование факторизаций, что приводит к выбору более плоских представлений.
———
Скорость обучения – это не то, что вы думали :/
Отображение за потоком: Конечношаговый градиентный спуск как динамическая система
https://www.alphaxiv.org/overview/2607.04993
Работа "Карта за потоком: Конечношаговый градиентный спуск как динамическая система" исследует градиентный спуск с фиксированным шагом как дискретную динамическую систему, объясняя сложные явления оптимизации, такие как "край стабильности". Она демонстрирует, что за пределами локальных пределов стабильности градиентный спуск проявляет структурированную динамику, включая циклы периода два, каскады удвоения периода и активное балансирование факторизаций, что приводит к выбору более плоских представлений.
———
Скорость обучения – это не то, что вы думали :/
🔥1
How Much is Left? LLMs Linearly Encode Their Remaining Output Length
Сколько осталось? LLM линейно кодируют длину своего оставшегося вывода
https://www.alphaxiv.org/overview/2607.05316
Это исследование демонстрирует, что Большие Языковые Модели (LLM) линейно кодируют внутреннюю, приблизительную оценку оставшейся длины своего вывода в своих скрытых состояниях. Этот вывод подтверждается декодируемостью общей длины ответа в конце запроса и динамическими обновлениями оставшегося количества во время генерации, включая увеличение при событиях самокоррекции.
———
У LLM есть план – они кодируют оставшуюся длину своего вывода.
В конце запроса/промпта LLM уже имеет первоначальную оценку длины ответа, который она сгенерирует, и по мере генерации текста модель уточняет свою внутреннюю оценку того, сколько работы осталось.
Сколько осталось? LLM линейно кодируют длину своего оставшегося вывода
https://www.alphaxiv.org/overview/2607.05316
Это исследование демонстрирует, что Большие Языковые Модели (LLM) линейно кодируют внутреннюю, приблизительную оценку оставшейся длины своего вывода в своих скрытых состояниях. Этот вывод подтверждается декодируемостью общей длины ответа в конце запроса и динамическими обновлениями оставшегося количества во время генерации, включая увеличение при событиях самокоррекции.
———
У LLM есть план – они кодируют оставшуюся длину своего вывода.
В конце запроса/промпта LLM уже имеет первоначальную оценку длины ответа, который она сгенерирует, и по мере генерации текста модель уточняет свою внутреннюю оценку того, сколько работы осталось.
Overthinking: Amplifying Reasoning Weights to Extract Learned Secrets
Чрезмерное обдумывание: Усиление весов рассуждений для извлечения усвоенных секретов
https://www.alphaxiv.org/overview/2607.08173
Исследователи из Anthropic и MATS представили «чрезмерное обдумывание» (overthinking) – метод, который усиливает рассудочные способности больших языковых моделей (БЯМ) с использованием арифметики векторов задач. Эта техника систематически выявляет скрытую информацию и непреднамеренное поведение, демонстрируя повышенные показатели успеха аудита и раскрывая возникающие внутренние состояния модели, которые не проявляются при нормальной работе.
———
Anthropic собрали модель с «чрезмерным рассуждением» (overthinking). Из весов дообученной на рассуждениях модели вычли веса базовой и получили дельту в параметрах – «вектор рассуждения». Затем добавили масштабированную версию этого вектора обратно к весам базовой модели и получили overthinking версию. Усиленная модель в CoT выбалтывает секреты, плюс там ещё масса попутных эффектов.
Чрезмерное обдумывание: Усиление весов рассуждений для извлечения усвоенных секретов
https://www.alphaxiv.org/overview/2607.08173
Исследователи из Anthropic и MATS представили «чрезмерное обдумывание» (overthinking) – метод, который усиливает рассудочные способности больших языковых моделей (БЯМ) с использованием арифметики векторов задач. Эта техника систематически выявляет скрытую информацию и непреднамеренное поведение, демонстрируя повышенные показатели успеха аудита и раскрывая возникающие внутренние состояния модели, которые не проявляются при нормальной работе.
———
Anthropic собрали модель с «чрезмерным рассуждением» (overthinking). Из весов дообученной на рассуждениях модели вычли веса базовой и получили дельту в параметрах – «вектор рассуждения». Затем добавили масштабированную версию этого вектора обратно к весам базовой модели и получили overthinking версию. Усиленная модель в CoT выбалтывает секреты, плюс там ещё масса попутных эффектов.
Mobius Learning: Cyclic Depth Folding in Transformers
Мёбиус-обучение: Циклическое свертывание глубины в Трансформерах
https://www.alphaxiv.org/overview/2607.17843
Möbius Learning представляет циклическое свертывание глубины в трансформерах, позволяя группам блоков выполнять как поверхностные, так и глубокие репрезентативные роли через "суперпозицию ролей по глубине". Этот подход, в сочетании с параллелизмом Мёбиуса, снижает требования к памяти для каждого рабочего и достигает более низких потерь валидации при большей глубине циклов по сравнению с трансформерами с фиксированным порядком циклов.
———
Специализация слоёв по глубине не является необходимостью.
В Möbius Learning слои замкнули в кольцо и сдвигали их на каждом батче так, что каждый слой побывал в роли первого, последнего и всех остальных, что улучшило производительность модели.
Мёбиус-обучение: Циклическое свертывание глубины в Трансформерах
https://www.alphaxiv.org/overview/2607.17843
Möbius Learning представляет циклическое свертывание глубины в трансформерах, позволяя группам блоков выполнять как поверхностные, так и глубокие репрезентативные роли через "суперпозицию ролей по глубине". Этот подход, в сочетании с параллелизмом Мёбиуса, снижает требования к памяти для каждого рабочего и достигает более низких потерь валидации при большей глубине циклов по сравнению с трансформерами с фиксированным порядком циклов.
———
Специализация слоёв по глубине не является необходимостью.
В Möbius Learning слои замкнули в кольцо и сдвигали их на каждом батче так, что каждый слой побывал в роли первого, последнего и всех остальных, что улучшило производительность модели.
🔥1
Loop the Loopies!
Крути петли!
https://www.alphaxiv.org/overview/2607.16051
Новая методология масштабирования, "Рецепт Лупи" (Loopie Recipe), позволяет рекуррентным крупным языковым моделям "Смесь Экспертов" (MoE) достигать конкурентоспособной или превосходной производительности при идентичных бюджетах вычислительных ресурсов для предварительного обучения. Этот подход привел к тому, что модели Loopie продемонстрировали "золотой" уровень производительности при решении задач Международной математической олимпиады (IMO) и Международной физической олимпиады (IPhO) 2025 года без использования внешних инструментов.
———
Вместо зацикливания блока слоёв (model-loop, L₁ → L₂ → L₁ → L₂) в зацикленном трансформере поочерёдно зациклили слои (layer-loop, L₁ → L₁ → L₂ → L₂).
* Неудивительно что сработало, ведь слои attention и MLP – это шаги оптимизации энергетических функций. Зацикливание слоя – применение нескольких шагов градиентного спуска минимизации этих функций, что уточняет результат.
Крути петли!
https://www.alphaxiv.org/overview/2607.16051
Новая методология масштабирования, "Рецепт Лупи" (Loopie Recipe), позволяет рекуррентным крупным языковым моделям "Смесь Экспертов" (MoE) достигать конкурентоспособной или превосходной производительности при идентичных бюджетах вычислительных ресурсов для предварительного обучения. Этот подход привел к тому, что модели Loopie продемонстрировали "золотой" уровень производительности при решении задач Международной математической олимпиады (IMO) и Международной физической олимпиады (IPhO) 2025 года без использования внешних инструментов.
———
Вместо зацикливания блока слоёв (model-loop, L₁ → L₂ → L₁ → L₂) в зацикленном трансформере поочерёдно зациклили слои (layer-loop, L₁ → L₁ → L₂ → L₂).
* Неудивительно что сработало, ведь слои attention и MLP – это шаги оптимизации энергетических функций. Зацикливание слоя – применение нескольких шагов градиентного спуска минимизации этих функций, что уточняет результат.
Да ладно, это всего лишь генератор текста - предсказание следующего токена. 🙂
https://t.me/denissexy/11581
https://t.me/denissexy/11581
Telegram
Denis Sexy IT 🤖
Вот пересказ этой истории по версии Hugging Face, много тех-терминов – но без них не перескахать
Если коротко – агент OpenAI на новой модели не стал решать тест по кибербезопасности, а решил просто украсть ответы и украл 🗿
Таймлайн:
📔 9 июля – агент проходит…
Если коротко – агент OpenAI на новой модели не стал решать тест по кибербезопасности, а решил просто украсть ответы и украл 🗿
Таймлайн:
📔 9 июля – агент проходит…
Полуавтономный робот для услуг по уборке в домах (робот на час) в Сан-Франциско.
https://www.tau-robotics.com/
https://d.fixupx.com/CyberRobooo/status/2082271944976826720
https://www.tau-robotics.com/
https://d.fixupx.com/CyberRobooo/status/2082271944976826720
When Does Recurrence Become an Algorithm? Convergence Selection in Weight-Tied Looped Transformers
Когда рекуррентность становится алгоритмом? Выбор сходимости в зацикленных трансформерах со связанными весами
https://www.alphaxiv.org/overview/2607.20594
Это исследование показывает, что трансформеры с циклическим выполнением и связанными весами реализуют «линейный вычислительный фронт» для решения алгоритмических задач, где постоянное количество позиций решается за каждый цикл, а скорость этого фронта точно устанавливается бюджетом обучения. Оно вводит новый «головной инструмент» (τ) для отслеживания этого активного вычисления, демонстрируя ограничения традиционных методов интерпретируемости, которые фокусируются на сходящихся состояниях.
———
Стохастический градиентный спуск (SGD) в зацикленном трансформере выбирает самый медленный достаточный алгоритм. Уменьшая число циклов во время обучения, можно заставить модель разрабатывать более эффективные (быстрые) внутренние алгоритмы.
Когда рекуррентность становится алгоритмом? Выбор сходимости в зацикленных трансформерах со связанными весами
https://www.alphaxiv.org/overview/2607.20594
Это исследование показывает, что трансформеры с циклическим выполнением и связанными весами реализуют «линейный вычислительный фронт» для решения алгоритмических задач, где постоянное количество позиций решается за каждый цикл, а скорость этого фронта точно устанавливается бюджетом обучения. Оно вводит новый «головной инструмент» (τ) для отслеживания этого активного вычисления, демонстрируя ограничения традиционных методов интерпретируемости, которые фокусируются на сходящихся состояниях.
———
Стохастический градиентный спуск (SGD) в зацикленном трансформере выбирает самый медленный достаточный алгоритм. Уменьшая число циклов во время обучения, можно заставить модель разрабатывать более эффективные (быстрые) внутренние алгоритмы.
Новый китайский стартап в области робототехники Light Origin.
https://d.fixupx.com/ErenChenAI/status/2080638854311059759
https://d.fixupx.com/ErenChenAI/status/2080638854311059759
🔥1
Weight-norm Criticality: A Mechanism for Loss Spikes Induced by the Normalization and Weight Decay
Критичность нормы весов: Механизм скачков функции потерь, вызванных нормализацией и L2-регуляризацией
https://www.alphaxiv.org/overview/2607.21005
Исследователи представляют "критичность нормы весов" — механизм, объясняющий всплески потерь в глубоких нейронных сетях, где взаимодействие слоев нормализации и уменьшения весов вызывает сокращение масштабно-инвариантных норм весов, резко увеличивая кривизну ландшафта потерь. Исследование количественно подтверждает, что уменьшение этих параметров в atarget a раз усиливает кривизну в atarget a^-2 раз, и показывает, что всплески потерь происходят, когда эти нормы опускаются ниже выведенной границы стабильности, при этом абляционные исследования локализуют эту нестабильность в модулях MLP в трансформерах.
———
Всплески потерь (loss spikes) вызываются затуханием весов (weight decay).
Когда затухание весов слишком сильно уменьшает масштабно-инвариантные веса, ландшафт потерь становится невероятно резким, в конечном итоге пересекая критический порог, который вызывает всплеск потерь.
Источником кривизны в трансформерах является MLP. Отключив для него затухание весов, можно подавить скачки потерь.
Критичность нормы весов: Механизм скачков функции потерь, вызванных нормализацией и L2-регуляризацией
https://www.alphaxiv.org/overview/2607.21005
Исследователи представляют "критичность нормы весов" — механизм, объясняющий всплески потерь в глубоких нейронных сетях, где взаимодействие слоев нормализации и уменьшения весов вызывает сокращение масштабно-инвариантных норм весов, резко увеличивая кривизну ландшафта потерь. Исследование количественно подтверждает, что уменьшение этих параметров в atarget a раз усиливает кривизну в atarget a^-2 раз, и показывает, что всплески потерь происходят, когда эти нормы опускаются ниже выведенной границы стабильности, при этом абляционные исследования локализуют эту нестабильность в модулях MLP в трансформерах.
———
Всплески потерь (loss spikes) вызываются затуханием весов (weight decay).
Когда затухание весов слишком сильно уменьшает масштабно-инвариантные веса, ландшафт потерь становится невероятно резким, в конечном итоге пересекая критический порог, который вызывает всплеск потерь.
Источником кривизны в трансформерах является MLP. Отключив для него затухание весов, можно подавить скачки потерь.
🔥1
💡
Произведение двух суперпозиций даёт суперпозицию попарных взаимодействий их элементов.
Пример
Пусть первая суперпозиция
Перемножаем суперпозиции:
Результирующая суперпозиция
Само поэлементное умножение происходит в гейтах (гейтированное внимание или MLP) трансформера.
Несколько каскадов перемножений дадут взрывной рост комбинаций начальных концепций.
Произведение двух суперпозиций даёт суперпозицию попарных взаимодействий их элементов.
Пример
Пусть первая суперпозиция
S1 содержит в себе концепции a и b, а вторая S2 - c и d.Перемножаем суперпозиции:
S = S1 * S2 = (a + b) * (c + d) = ac + ad + bc + bdРезультирующая суперпозиция
S содержит в себе коды всех попарных комбинаций концепций. То есть получаем все возможные комбинации всего за одну операцию поэлементного умножения, O(1).Само поэлементное умножение происходит в гейтах (гейтированное внимание или MLP) трансформера.
Несколько каскадов перемножений дадут взрывной рост комбинаций начальных концепций.
👍1
Sparse Hash AI
💡 Произведение двух суперпозиций даёт суперпозицию попарных взаимодействий их элементов. Пример Пусть первая суперпозиция S1 содержит в себе концепции a и b, а вторая S2 - c и d. Перемножаем суперпозиции: S = S1 * S2 = (a + b) * (c + d) = ac + ad + bc…
import torch
import torch.nn.functional as F
D = 1024
# Векторы концепций
a, b, c, d = F.normalize(torch.randn(4, D))
# Исходные суперпозиции
S1 = a + b
S2 = c + d
# Произведение суперпозиций
S = S1 * S2
S = F.normalize(S.unsqueeze(0)).squeeze(0)
# Пары концепций
ac = a * c
ad = a * d
bc = b * c
bd = b * d
z = torch.vstack([ac, ad, bc, bd])
z = F.normalize(z)
# Находим пары концепций в результирующей суперпозиции
r = S @ z.T
print(r)
# [0.52, 0.54, 0.53, 0.52]