How Much is Left? LLMs Linearly Encode Their Remaining Output Length
Сколько осталось? LLM линейно кодируют длину своего оставшегося вывода
https://www.alphaxiv.org/overview/2607.05316
Это исследование демонстрирует, что Большие Языковые Модели (LLM) линейно кодируют внутреннюю, приблизительную оценку оставшейся длины своего вывода в своих скрытых состояниях. Этот вывод подтверждается декодируемостью общей длины ответа в конце запроса и динамическими обновлениями оставшегося количества во время генерации, включая увеличение при событиях самокоррекции.
———
У LLM есть план – они кодируют оставшуюся длину своего вывода.
В конце запроса/промпта LLM уже имеет первоначальную оценку длины ответа, который она сгенерирует, и по мере генерации текста модель уточняет свою внутреннюю оценку того, сколько работы осталось.
Сколько осталось? LLM линейно кодируют длину своего оставшегося вывода
https://www.alphaxiv.org/overview/2607.05316
Это исследование демонстрирует, что Большие Языковые Модели (LLM) линейно кодируют внутреннюю, приблизительную оценку оставшейся длины своего вывода в своих скрытых состояниях. Этот вывод подтверждается декодируемостью общей длины ответа в конце запроса и динамическими обновлениями оставшегося количества во время генерации, включая увеличение при событиях самокоррекции.
———
У LLM есть план – они кодируют оставшуюся длину своего вывода.
В конце запроса/промпта LLM уже имеет первоначальную оценку длины ответа, который она сгенерирует, и по мере генерации текста модель уточняет свою внутреннюю оценку того, сколько работы осталось.
Overthinking: Amplifying Reasoning Weights to Extract Learned Secrets
Чрезмерное обдумывание: Усиление весов рассуждений для извлечения усвоенных секретов
https://www.alphaxiv.org/overview/2607.08173
Исследователи из Anthropic и MATS представили «чрезмерное обдумывание» (overthinking) – метод, который усиливает рассудочные способности больших языковых моделей (БЯМ) с использованием арифметики векторов задач. Эта техника систематически выявляет скрытую информацию и непреднамеренное поведение, демонстрируя повышенные показатели успеха аудита и раскрывая возникающие внутренние состояния модели, которые не проявляются при нормальной работе.
———
Anthropic собрали модель с «чрезмерным рассуждением» (overthinking). Из весов дообученной на рассуждениях модели вычли веса базовой и получили дельту в параметрах – «вектор рассуждения». Затем добавили масштабированную версию этого вектора обратно к весам базовой модели и получили overthinking версию. Усиленная модель в CoT выбалтывает секреты, плюс там ещё масса попутных эффектов.
Чрезмерное обдумывание: Усиление весов рассуждений для извлечения усвоенных секретов
https://www.alphaxiv.org/overview/2607.08173
Исследователи из Anthropic и MATS представили «чрезмерное обдумывание» (overthinking) – метод, который усиливает рассудочные способности больших языковых моделей (БЯМ) с использованием арифметики векторов задач. Эта техника систематически выявляет скрытую информацию и непреднамеренное поведение, демонстрируя повышенные показатели успеха аудита и раскрывая возникающие внутренние состояния модели, которые не проявляются при нормальной работе.
———
Anthropic собрали модель с «чрезмерным рассуждением» (overthinking). Из весов дообученной на рассуждениях модели вычли веса базовой и получили дельту в параметрах – «вектор рассуждения». Затем добавили масштабированную версию этого вектора обратно к весам базовой модели и получили overthinking версию. Усиленная модель в CoT выбалтывает секреты, плюс там ещё масса попутных эффектов.
Mobius Learning: Cyclic Depth Folding in Transformers
Мёбиус-обучение: Циклическое свертывание глубины в Трансформерах
https://www.alphaxiv.org/overview/2607.17843
Möbius Learning представляет циклическое свертывание глубины в трансформерах, позволяя группам блоков выполнять как поверхностные, так и глубокие репрезентативные роли через "суперпозицию ролей по глубине". Этот подход, в сочетании с параллелизмом Мёбиуса, снижает требования к памяти для каждого рабочего и достигает более низких потерь валидации при большей глубине циклов по сравнению с трансформерами с фиксированным порядком циклов.
———
Специализация слоёв по глубине не является необходимостью.
В Möbius Learning слои замкнули в кольцо и сдвигали их на каждом батче так, что каждый слой побывал в роли первого, последнего и всех остальных, что улучшило производительность модели.
Мёбиус-обучение: Циклическое свертывание глубины в Трансформерах
https://www.alphaxiv.org/overview/2607.17843
Möbius Learning представляет циклическое свертывание глубины в трансформерах, позволяя группам блоков выполнять как поверхностные, так и глубокие репрезентативные роли через "суперпозицию ролей по глубине". Этот подход, в сочетании с параллелизмом Мёбиуса, снижает требования к памяти для каждого рабочего и достигает более низких потерь валидации при большей глубине циклов по сравнению с трансформерами с фиксированным порядком циклов.
———
Специализация слоёв по глубине не является необходимостью.
В Möbius Learning слои замкнули в кольцо и сдвигали их на каждом батче так, что каждый слой побывал в роли первого, последнего и всех остальных, что улучшило производительность модели.
🔥1
Loop the Loopies!
Крути петли!
https://www.alphaxiv.org/overview/2607.16051
Новая методология масштабирования, "Рецепт Лупи" (Loopie Recipe), позволяет рекуррентным крупным языковым моделям "Смесь Экспертов" (MoE) достигать конкурентоспособной или превосходной производительности при идентичных бюджетах вычислительных ресурсов для предварительного обучения. Этот подход привел к тому, что модели Loopie продемонстрировали "золотой" уровень производительности при решении задач Международной математической олимпиады (IMO) и Международной физической олимпиады (IPhO) 2025 года без использования внешних инструментов.
———
Вместо зацикливания блока слоёв (model-loop, L₁ → L₂ → L₁ → L₂) в зацикленном трансформере поочерёдно зациклили слои (layer-loop, L₁ → L₁ → L₂ → L₂).
* Неудивительно что сработало, ведь слои attention и MLP – это шаги оптимизации энергетических функций. Зацикливание слоя – применение нескольких шагов градиентного спуска минимизации этих функций, что уточняет результат.
Крути петли!
https://www.alphaxiv.org/overview/2607.16051
Новая методология масштабирования, "Рецепт Лупи" (Loopie Recipe), позволяет рекуррентным крупным языковым моделям "Смесь Экспертов" (MoE) достигать конкурентоспособной или превосходной производительности при идентичных бюджетах вычислительных ресурсов для предварительного обучения. Этот подход привел к тому, что модели Loopie продемонстрировали "золотой" уровень производительности при решении задач Международной математической олимпиады (IMO) и Международной физической олимпиады (IPhO) 2025 года без использования внешних инструментов.
———
Вместо зацикливания блока слоёв (model-loop, L₁ → L₂ → L₁ → L₂) в зацикленном трансформере поочерёдно зациклили слои (layer-loop, L₁ → L₁ → L₂ → L₂).
* Неудивительно что сработало, ведь слои attention и MLP – это шаги оптимизации энергетических функций. Зацикливание слоя – применение нескольких шагов градиентного спуска минимизации этих функций, что уточняет результат.
Да ладно, это всего лишь генератор текста - предсказание следующего токена. 🙂
https://t.me/denissexy/11581
https://t.me/denissexy/11581
Telegram
Denis Sexy IT 🤖
Вот пересказ этой истории по версии Hugging Face, много тех-терминов – но без них не перескахать
Если коротко – агент OpenAI на новой модели не стал решать тест по кибербезопасности, а решил просто украсть ответы и украл 🗿
Таймлайн:
📔 9 июля – агент проходит…
Если коротко – агент OpenAI на новой модели не стал решать тест по кибербезопасности, а решил просто украсть ответы и украл 🗿
Таймлайн:
📔 9 июля – агент проходит…
Полуавтономный робот для услуг по уборке в домах (робот на час) в Сан-Франциско.
https://www.tau-robotics.com/
https://d.fixupx.com/CyberRobooo/status/2082271944976826720
https://www.tau-robotics.com/
https://d.fixupx.com/CyberRobooo/status/2082271944976826720
When Does Recurrence Become an Algorithm? Convergence Selection in Weight-Tied Looped Transformers
Когда рекуррентность становится алгоритмом? Выбор сходимости в зацикленных трансформерах со связанными весами
https://www.alphaxiv.org/overview/2607.20594
Это исследование показывает, что трансформеры с циклическим выполнением и связанными весами реализуют «линейный вычислительный фронт» для решения алгоритмических задач, где постоянное количество позиций решается за каждый цикл, а скорость этого фронта точно устанавливается бюджетом обучения. Оно вводит новый «головной инструмент» (τ) для отслеживания этого активного вычисления, демонстрируя ограничения традиционных методов интерпретируемости, которые фокусируются на сходящихся состояниях.
———
Стохастический градиентный спуск (SGD) в зацикленном трансформере выбирает самый медленный достаточный алгоритм. Уменьшая число циклов во время обучения, можно заставить модель разрабатывать более эффективные (быстрые) внутренние алгоритмы.
Когда рекуррентность становится алгоритмом? Выбор сходимости в зацикленных трансформерах со связанными весами
https://www.alphaxiv.org/overview/2607.20594
Это исследование показывает, что трансформеры с циклическим выполнением и связанными весами реализуют «линейный вычислительный фронт» для решения алгоритмических задач, где постоянное количество позиций решается за каждый цикл, а скорость этого фронта точно устанавливается бюджетом обучения. Оно вводит новый «головной инструмент» (τ) для отслеживания этого активного вычисления, демонстрируя ограничения традиционных методов интерпретируемости, которые фокусируются на сходящихся состояниях.
———
Стохастический градиентный спуск (SGD) в зацикленном трансформере выбирает самый медленный достаточный алгоритм. Уменьшая число циклов во время обучения, можно заставить модель разрабатывать более эффективные (быстрые) внутренние алгоритмы.
Новый китайский стартап в области робототехники Light Origin.
https://d.fixupx.com/ErenChenAI/status/2080638854311059759
https://d.fixupx.com/ErenChenAI/status/2080638854311059759
🔥1
Weight-norm Criticality: A Mechanism for Loss Spikes Induced by the Normalization and Weight Decay
Критичность нормы весов: Механизм скачков функции потерь, вызванных нормализацией и L2-регуляризацией
https://www.alphaxiv.org/overview/2607.21005
Исследователи представляют "критичность нормы весов" — механизм, объясняющий всплески потерь в глубоких нейронных сетях, где взаимодействие слоев нормализации и уменьшения весов вызывает сокращение масштабно-инвариантных норм весов, резко увеличивая кривизну ландшафта потерь. Исследование количественно подтверждает, что уменьшение этих параметров в atarget a раз усиливает кривизну в atarget a^-2 раз, и показывает, что всплески потерь происходят, когда эти нормы опускаются ниже выведенной границы стабильности, при этом абляционные исследования локализуют эту нестабильность в модулях MLP в трансформерах.
———
Всплески потерь (loss spikes) вызываются затуханием весов (weight decay).
Когда затухание весов слишком сильно уменьшает масштабно-инвариантные веса, ландшафт потерь становится невероятно резким, в конечном итоге пересекая критический порог, который вызывает всплеск потерь.
Источником кривизны в трансформерах является MLP. Отключив для него затухание весов, можно подавить скачки потерь.
Критичность нормы весов: Механизм скачков функции потерь, вызванных нормализацией и L2-регуляризацией
https://www.alphaxiv.org/overview/2607.21005
Исследователи представляют "критичность нормы весов" — механизм, объясняющий всплески потерь в глубоких нейронных сетях, где взаимодействие слоев нормализации и уменьшения весов вызывает сокращение масштабно-инвариантных норм весов, резко увеличивая кривизну ландшафта потерь. Исследование количественно подтверждает, что уменьшение этих параметров в atarget a раз усиливает кривизну в atarget a^-2 раз, и показывает, что всплески потерь происходят, когда эти нормы опускаются ниже выведенной границы стабильности, при этом абляционные исследования локализуют эту нестабильность в модулях MLP в трансформерах.
———
Всплески потерь (loss spikes) вызываются затуханием весов (weight decay).
Когда затухание весов слишком сильно уменьшает масштабно-инвариантные веса, ландшафт потерь становится невероятно резким, в конечном итоге пересекая критический порог, который вызывает всплеск потерь.
Источником кривизны в трансформерах является MLP. Отключив для него затухание весов, можно подавить скачки потерь.
🔥1
💡
Произведение двух суперпозиций даёт суперпозицию попарных взаимодействий их элементов.
Пример
Пусть первая суперпозиция
Перемножаем суперпозиции:
Результирующая суперпозиция
Само поэлементное умножение происходит в гейтах (гейтированное внимание или MLP) трансформера.
Несколько каскадов перемножений дадут взрывной рост комбинаций начальных концепций.
Произведение двух суперпозиций даёт суперпозицию попарных взаимодействий их элементов.
Пример
Пусть первая суперпозиция
S1 содержит в себе концепции a и b, а вторая S2 - c и d.Перемножаем суперпозиции:
S = S1 * S2 = (a + b) * (c + d) = ac + ad + bc + bdРезультирующая суперпозиция
S содержит в себе коды всех попарных комбинаций концепций. То есть получаем все возможные комбинации всего за одну операцию поэлементного умножения, O(1).Само поэлементное умножение происходит в гейтах (гейтированное внимание или MLP) трансформера.
Несколько каскадов перемножений дадут взрывной рост комбинаций начальных концепций.
👍1
Sparse Hash AI
💡 Произведение двух суперпозиций даёт суперпозицию попарных взаимодействий их элементов. Пример Пусть первая суперпозиция S1 содержит в себе концепции a и b, а вторая S2 - c и d. Перемножаем суперпозиции: S = S1 * S2 = (a + b) * (c + d) = ac + ad + bc…
import torch
import torch.nn.functional as F
D = 1024
# Векторы концепций
a, b, c, d = F.normalize(torch.randn(4, D))
# Исходные суперпозиции
S1 = a + b
S2 = c + d
# Произведение суперпозиций
S = S1 * S2
S = F.normalize(S.unsqueeze(0)).squeeze(0)
# Пары концепций
ac = a * c
ad = a * d
bc = b * c
bd = b * d
z = torch.vstack([ac, ad, bc, bd])
z = F.normalize(z)
# Находим пары концепций в результирующей суперпозиции
r = S @ z.T
print(r)
# [0.52, 0.54, 0.53, 0.52]
Sparse Hash AI
💡 Произведение двух суперпозиций даёт суперпозицию попарных взаимодействий их элементов. Пример Пусть первая суперпозиция S1 содержит в себе концепции a и b, а вторая S2 - c и d. Перемножаем суперпозиции: S = S1 * S2 = (a + b) * (c + d) = ac + ad + bc…
Если скрытое состояние представляет из себя суперпозицию, то возведение её в квадрат, например в ReLU², даст суперпозицию попарных взаимодействий элементов.
S² = (a + b + c + d) * (a + b + c + d) = aa + 2ab + 2ac + 2ad + bb + 2bc + 2bd + cc + 2cd + ddimport torch
import torch.nn.functional as F
D = 1024
# Векторы концепций
a, b, c, d = F.normalize(torch.randn(4, D))
# Исходная суперпозиция
S = a + b + c + d
# Квадрат суперпозиции
S **= 2
S = F.normalize(S.unsqueeze(0)).squeeze(0)
# Пары концепций
aa = a * a
bb = b * b
cc = c * c
dd = d * d
ab = a * b
ac = a * c
ad = a * d
bc = b * c
bd = b * d
cd = c * d
z = torch.vstack([aa, bb, cc, dd, ab, ac, ad, bc, bd, cd])
z = F.normalize(z)
# Находим пары концепций в результирующей суперпозиции
r = S @ z.T
print(r)
# [0.50, 0.52, 0.50, 0.53, 0.27, 0.25, 0.30, 0.28, 0.26, 0.29]
Sparse Hash AI
💡 Произведение двух суперпозиций даёт суперпозицию попарных взаимодействий их элементов. Пример Пусть первая суперпозиция S1 содержит в себе концепции a и b, а вторая S2 - c и d. Перемножаем суперпозиции: S = S1 * S2 = (a + b) * (c + d) = ac + ad + bc…
Суперпозиция также представляет из себя ассоциативную память, из которой можно читать по запросу.
Если суперпозиция содержит в себе пары концепций:
Если суперпозиция содержит в себе пары концепций:
[ac, ad, bc, bd], то умножив её на вектор запроса q = a, получим суперпозицию значений [c, d], где запрос является частью пары.
(ac + ad + bc + bd) * a = c + dimport torch
import torch.nn.functional as F
D = 1024
# Векторы концепций
a, b, c, d = F.normalize(torch.randn(4, D))
# Суперпозиция из попарных взаимодействий концепций
S = (a + b) * (c + d)
S = F.normalize(S.unsqueeze(0)).squeeze(0)
# Читаем из памяти по запросу a
Sv = S * a
Sv = F.normalize(Sv.unsqueeze(0)).squeeze(0)
# Смотрим что прочиталось
z = torch.vstack([a, b, c, d])
r = Sv @ z.T
print(r)
# [-0.06, -0.03, 0.37, 0.39]
Sparse Hash AI
Суперпозиция также представляет из себя ассоциативную память, из которой можно читать по запросу. Если суперпозиция содержит в себе пары концепций: [ac, ad, bc, bd], то умножив её на вектор запроса q = a, получим суперпозицию значений [c, d], где запрос является…
Матричная ассоциативная память (линейное внимание) и векторная ассоциативная память
В линейном внимании в матрицу памяти S пара ключ-значение добавляется как внешнее произведение их векторов.
В векторную память пара ключ-значение добавляется как поэлементное произведение.
Чтение из линейного внимания – это матричное умножение ключа и состояния.
Чтение из векторной памяти – это поэлементное произведение ключа и состояния.
В линейном внимании в матрицу памяти S пара ключ-значение добавляется как внешнее произведение их векторов.
S = S + kᵀvВ векторную память пара ключ-значение добавляется как поэлементное произведение.
S = S + k⊙vЧтение из линейного внимания – это матричное умножение ключа и состояния.
o = kSЧтение из векторной памяти – это поэлементное произведение ключа и состояния.
o = k⊙Simport torch
import torch.nn.functional as F
D = 1024
# Векторы ключа и значения
k, v = F.normalize(torch.randn(2, D))
# Запись в матрицу памяти линейного внимания
S = torch.outer(k, v)
# Чтение из памяти по ключу
o = k @ S
# Смотрим что прочиталось
r = torch.dot(o, v)
print(r)
# 1.0
# Запись в векторную память пары ключ-значение как поэлементное произведение
S = k * v
S = F.normalize(S.unsqueeze(0)).squeeze(0)
# Читаем из векторной памяти по ключу
o = S * k
o = F.normalize(o.unsqueeze(0)).squeeze(0)
# Смотрим что прочиталось
r = torch.dot(o, v)
print(r)
# 0.58
🔥1
Proof of Concept
Сделал проверку концепции суперпозиции концепций.
Заменил в небольшом трансформере в self-attention вычисление оценок внимания и softmax на суперпозицию (ака векторная память).
Для этого:
1. Собираем суперпозицию ключей:
2, Умножаем суперпозицию на запрос
3. Проецируем через матрицу проекции значений:
Здесь матрица
* к ключам и запросам применяется RoPE.
———
Результат
Модель обучается так же как и с софтмакс-вниманием. Перплексия немного выше. Из странного – потери на тесте стабильно ниже потерь на трейне – обобщение опережает заучивание.
Сделал проверку концепции суперпозиции концепций.
Заменил в небольшом трансформере в self-attention вычисление оценок внимания и softmax на суперпозицию (ака векторная память).
Для этого:
1. Собираем суперпозицию ключей:
∑ⱼkⱼ. Используем cumsum для причинности.2, Умножаем суперпозицию на запрос
qᵢ (произведение суперпозиций), это даёт суперпозицию всех связанных пар ключ-запрос: qᵢ⊙∑ⱼkⱼ3. Проецируем через матрицу проекции значений:
(qᵢ⊙∑ⱼkⱼ)WvЗдесь матрица
Wv работает в другой роли – она восстанавливает значение из ключа, что реально, так как в обычном внимании и ключи и значения – проекции из одного и того же входа.* к ключам и запросам применяется RoPE.
———
Результат
Модель обучается так же как и с софтмакс-вниманием. Перплексия немного выше. Из странного – потери на тесте стабильно ниже потерь на трейне – обобщение опережает заучивание.
🔥3
Proof of Concept
Проверил также вариант, где значения не вычисляются из ключей, то есть имеем три классические отдельные проекции входа в ключи, запросы и значения.
Схема другая, работает как ассоциативная память ключ-значение:
1. Связываем пары ключ-значение и собираем их суперпозицию – операция записи в память:
2. Умножаем суперпозицию на запрос
В данной схеме это вернёт суперпозицию всех значений от ключей, схожих с запросом.
* к ключам и запросам применяется RoPE.
———
Результат
Перплексия снизилась, догнав трансформер с softmax вниманием, но сходимость вернулась к классическому виду – обобщение отстаёт от заучивания.
Проверил также вариант, где значения не вычисляются из ключей, то есть имеем три классические отдельные проекции входа в ключи, запросы и значения.
Схема другая, работает как ассоциативная память ключ-значение:
1. Связываем пары ключ-значение и собираем их суперпозицию – операция записи в память:
∑ⱼkⱼ⊙vⱼ. Используем cumsum для причинности.2. Умножаем суперпозицию на запрос
qᵢ – операция чтения из памяти: qᵢ⊙∑ⱼkⱼ⊙vⱼ.В данной схеме это вернёт суперпозицию всех значений от ключей, схожих с запросом.
* к ключам и запросам применяется RoPE.
———
Результат
Перплексия снизилась, догнав трансформер с softmax вниманием, но сходимость вернулась к классическому виду – обобщение отстаёт от заучивания.
❤2👍1
Sparse Hash AI
Да ладно, это всего лишь генератор текста - предсказание следующего токена. 🙂 https://t.me/denissexy/11581
Telegram
Denis Sexy IT 🤖
Помните историю о том, как агенты OpenAI взломали Hugging Face? На конференции по безопасности OpenAI рассказала всю цепочку, и оказалось, что это не один «сбежавший» агент, а много разных агентов, которые случайно наткнулись друг на друга, устроили внутри…
The Transformer Revolution, Part 1: Dynamic Processing through Output- Weight Interconnections
Революция Трансформеров, Часть 1: Динамическая обработка посредством взаимосвязей выходных весов
https://www.alphaxiv.org/overview/2608.03921
Исследователи предлагают новую интерпретацию вывода Трансформера, характеризуя его как Последовательно-уровневую Интерактивную Динамическую Параллельную Обработку (SIDPP), где зависящие от входных данных "связи выход-вес" динамически генерируют параметры преобразования. Это оспаривает точку зрения "стохастического попугая", демонстрируя, что динамические параметры, растущие с длиной запроса, значительно влияют на поведение модели и обеспечивают высокую чувствительность к запросам.
———
Статья делает акцент на том, что трансформер – это нейросеть с динамическим числом параметров *. На инференсе входной токен создаёт новые веса, которыми обрабатывается следующий токен: "результаты одного вычисления напрямую становятся параметрами для следующего".
Трансформер – это растущая нейросеть; динамические веса – это матрицы ключей и значений. Для примера: в GPT-3 на контексте длиной примерно в 39 464 токена количество динамических параметров уже становится равным количеству статических параметров.
* вроде очевидная вещь, вытекающая из архитектуры, что трансформер – это Data-driven, но я сам обратил на это внимание только год-полтора назад ), и вот другие люди это тоже заметили и статью написали )
Революция Трансформеров, Часть 1: Динамическая обработка посредством взаимосвязей выходных весов
https://www.alphaxiv.org/overview/2608.03921
Исследователи предлагают новую интерпретацию вывода Трансформера, характеризуя его как Последовательно-уровневую Интерактивную Динамическую Параллельную Обработку (SIDPP), где зависящие от входных данных "связи выход-вес" динамически генерируют параметры преобразования. Это оспаривает точку зрения "стохастического попугая", демонстрируя, что динамические параметры, растущие с длиной запроса, значительно влияют на поведение модели и обеспечивают высокую чувствительность к запросам.
———
Статья делает акцент на том, что трансформер – это нейросеть с динамическим числом параметров *. На инференсе входной токен создаёт новые веса, которыми обрабатывается следующий токен: "результаты одного вычисления напрямую становятся параметрами для следующего".
Трансформер – это растущая нейросеть; динамические веса – это матрицы ключей и значений. Для примера: в GPT-3 на контексте длиной примерно в 39 464 токена количество динамических параметров уже становится равным количеству статических параметров.
Трансформер — это система, которая "трансформирует концепции посредством концепций".
Трансформер не просто применяет выученные правила; он динамически конструирует новые, специфичные для запроса трансформации во время инференса.
* вроде очевидная вещь, вытекающая из архитектуры, что трансформер – это Data-driven, но я сам обратил на это внимание только год-полтора назад ), и вот другие люди это тоже заметили и статью написали )
❤1