Фазовый переход в использовании памяти: что это открытие значит для AI-разработчиков? 🟪
Осторожно много буков. 📝
Вы когда-нибудь замечали, что в одних задачах LSTM или Transformer с памятью работают идеально, а в других – только жгут ресурсы без улучшения качества?
Оказывается, выбор между «хранить историю» и «действовать по текущему моменту» – это не плавная настройка, а настоящий фазовый переход первого рода (как таяние льда). И его можно предсказать аналитически.🪨
Новая статья в Physical Review Letters (плюс 19 страниц матана в Supplemental) даёт чёткие критерии, когда память выгодна, когда нет, а когда возможен гистерезис. Гистерезис – это когда состояние системы зависит не только от текущих параметров, но и от того, как вы к ним пришли (от истории изменения).
Модель в двух словах.
Попытался📦 всю жесть из материала сублимировать 😐 , вышло, как вышло. Не обессудьте.
Итак...
Есть скрытое состояние x(t) – например, концентрация питательного вещества. Вы получаете зашумлённое наблюдение:
y(t) = x(t) + шум.
У вас есть внутренняя переменная z(t) – память, которая эволюционирует по закону:
z = v(t) + шум памяти, где v(t) – это управление: вы сами решаете, как менять память.
За использование управления вы платите штраф Mv^2,прям как кинетическая энергия , чем больше вы «дёргаете» память, тем дороже.
Одновременно вы хотите минимизировать ошибку оценки E[(x - x') ^2] с весом Q. Итоговая функция потерь:
J = Q×ошибка + M×затраты на управление.
Задача – выбрать стратегию v(y,z), которая минимизирует J в стационарном режиме.
В машинном обучении мы часто добавляем L2-регуляризацию:
loss = ошибка + lambda*|w|^2.
При увеличении lambda веса плавно стремятся к нулю. Здесь параметр M играет роль lambda: чем больше M, тем дороже использовать память, и казалось бы, при больших M коэффициент при памяти должен плавно уменьшаться до нуля.
Но здесь есть две связанные переменные (текущее наблюдение и как память на себя же влияет), которые влияют на поведение системы и друг на друга.
Они не независимы. Оптимизация потерь J по этим двум переменным приводит к тому, что на их плоскости, могут существовать два локальных минимума – с памятью и без. Между ними – горный хребет (седловая точка). Когда параметры (например, M) меняются, один из минимумов может исчезнуть или стать глобальным. В момент исчезновения система скачком перескакивает из одной ямы в другую – это и есть фазовый переход.
Суть открытия на пальцах.
Представьте агента, который наблюдает за шумным сигналом и может хранить внутреннее состояние z. Обновление z стоит ресурсов (штраф M). Задача – минимизировать ошибку оценки при ограниченном бюджете.
Авторы доказали:
· Существуют два порога Theta_Q и Theta_M:
· Если Theta_Q < 1 — память точно бесполезна (даже локально).
· Если Theta_M >=1 — память всегда выгодна (глобальный оптимум).
· Между ними – бистабильность: обе стратегии локально оптимальны, выбор зависит от истории (гистерезис).
А теперь разбираем, что из этого можно вынести для AI.🥴
1. Оптимизация архитектур с памятью (LSTM, Transformer, RNN)
Современные модели с памятью, например, трансформеры с окном внимания или LSTM, всегда используют память, даже когда она не нужна.
Результаты подсказывают:
· При высоком шуме в данных память становится бесполезной – лучше полагаться только на текущий вход. Это объясняет, почему в некоторых задачах обрезка контекста (например, короткое окно внимания) не ухудшает качество.
· При быстро меняющейся среде прошлая информация устаревает – нужно динамически уменьшать размер буфера или использовать забывание, как в LSTM, но с адаптивным коэффициентом.
2. Регуляризация и штраф за сложность в RL.
В RL агент часто хранит внутреннее состояние например, в PPO. Штраф Mv^2 в статье – аналог штрафа за изменение скрытого состояния. Это можно использовать:
· Как регуляризатор в функциях потерь, чтобы поощрять агента использовать память только когда это действительно выгодно.
· Аналитические пороги Theta_Q,Theta_M помогают автоматически подбирать коэффициент регуляризации M без дорогой сетки гиперпараметров – просто по статистике шумов среды. Это особенно полезно в Meta-RL, где среда меняется между эпизодами.
3. Continuous Learning и катастрофическое забывание.
В задачах continual learning модели должны сохранять знания о прошлых задачах, но обновление памяти (весов) стоит ресурсов. Аналогия:
· Параметр M – штраф за изменение весов.
· Фазовый переход означает, что при превышении порога штрафа модель перестаёт обновлять веса вообще – т.е. замораживает их. Это даёт критерий, когда лучше полностью остановить обучение (если среда не меняется) или, наоборот, разморозить (если волатильность растёт).
На практике это позволяет строить адаптивные стратегии обновления – не тратить ресурсы на веса, которые не нужны.
Вот такое интересное исследование. Читайте полную версию, применяйте открытие, и stay tuned🦾
Вы когда-нибудь замечали, что в одних задачах LSTM или Transformer с памятью работают идеально, а в других – только жгут ресурсы без улучшения качества?
Оказывается, выбор между «хранить историю» и «действовать по текущему моменту» – это не плавная настройка, а настоящий фазовый переход первого рода (как таяние льда). И его можно предсказать аналитически.
Новая статья в Physical Review Letters
Модель в двух словах.
Попытался
Итак...
Есть скрытое состояние x(t) – например, концентрация питательного вещества. Вы получаете зашумлённое наблюдение:
y(t) = x(t) + шум.
У вас есть внутренняя переменная z(t) – память, которая эволюционирует по закону:
z = v(t) + шум памяти, где v(t) – это управление: вы сами решаете, как менять память.
За использование управления вы платите штраф Mv^2,
Одновременно вы хотите минимизировать ошибку оценки E[(x - x') ^2] с весом Q. Итоговая функция потерь:
J = Q×ошибка + M×затраты на управление.
Задача – выбрать стратегию v(y,z), которая минимизирует J в стационарном режиме.
В машинном обучении мы часто добавляем L2-регуляризацию:
loss = ошибка + lambda*|w|^2.
При увеличении lambda веса плавно стремятся к нулю. Здесь параметр M играет роль lambda: чем больше M, тем дороже использовать память, и казалось бы, при больших M коэффициент при памяти должен плавно уменьшаться до нуля.
Но здесь есть две связанные переменные (текущее наблюдение и как память на себя же влияет), которые влияют на поведение системы и друг на друга.
Они не независимы. Оптимизация потерь J по этим двум переменным приводит к тому, что на их плоскости, могут существовать два локальных минимума – с памятью и без. Между ними – горный хребет (седловая точка). Когда параметры (например, M) меняются, один из минимумов может исчезнуть или стать глобальным. В момент исчезновения система скачком перескакивает из одной ямы в другую – это и есть фазовый переход.
Суть открытия на пальцах.
Представьте агента, который наблюдает за шумным сигналом и может хранить внутреннее состояние z. Обновление z стоит ресурсов (штраф M). Задача – минимизировать ошибку оценки при ограниченном бюджете.
Авторы доказали:
· Существуют два порога Theta_Q и Theta_M:
· Если Theta_Q < 1 — память точно бесполезна (даже локально).
· Если Theta_M >=1 — память всегда выгодна (глобальный оптимум).
· Между ними – бистабильность: обе стратегии локально оптимальны, выбор зависит от истории (гистерезис).
А теперь разбираем, что из этого можно вынести для AI.
1. Оптимизация архитектур с памятью (LSTM, Transformer, RNN)
Современные модели с памятью, например, трансформеры с окном внимания или LSTM, всегда используют память, даже когда она не нужна.
Результаты подсказывают:
· При высоком шуме в данных память становится бесполезной – лучше полагаться только на текущий вход. Это объясняет, почему в некоторых задачах обрезка контекста (например, короткое окно внимания) не ухудшает качество.
· При быстро меняющейся среде прошлая информация устаревает – нужно динамически уменьшать размер буфера или использовать забывание, как в LSTM, но с адаптивным коэффициентом.
2. Регуляризация и штраф за сложность в RL.
В RL агент часто хранит внутреннее состояние например, в PPO. Штраф Mv^2 в статье – аналог штрафа за изменение скрытого состояния. Это можно использовать:
· Как регуляризатор в функциях потерь, чтобы поощрять агента использовать память только когда это действительно выгодно.
· Аналитические пороги Theta_Q,Theta_M помогают автоматически подбирать коэффициент регуляризации M без дорогой сетки гиперпараметров – просто по статистике шумов среды. Это особенно полезно в Meta-RL, где среда меняется между эпизодами.
3. Continuous Learning и катастрофическое забывание.
В задачах continual learning модели должны сохранять знания о прошлых задачах, но обновление памяти (весов) стоит ресурсов. Аналогия:
· Параметр M – штраф за изменение весов.
· Фазовый переход означает, что при превышении порога штрафа модель перестаёт обновлять веса вообще – т.е. замораживает их. Это даёт критерий, когда лучше полностью остановить обучение (если среда не меняется) или, наоборот, разморозить (если волатильность растёт).
На практике это позволяет строить адаптивные стратегии обновления – не тратить ресурсы на веса, которые не нужны.
Вот такое интересное исследование. Читайте полную версию, применяйте открытие, и stay tuned
Please open Telegram to view this post
VIEW IN TELEGRAM
Physical Review Letters
Theoretical Analysis of Resource-Induced Phase Transitions in Estimation Strategies
Organisms adapt to volatile environments by integrating sensory information with internal memory, yet their information processing is constrained by resource limitations. Such limitations can fundamentally alter optimal estimation strategies in biological…
🔥24❤9🆒7👍6⚡3
Dealer.AI
Фазовый переход в использовании памяти: что это открытие значит для AI-разработчиков? 🟪 Осторожно много буков. 📝 Вы когда-нибудь замечали, что в одних задачах LSTM или Transformer с памятью работают идеально, а в других – только жгут ресурсы без улучшения…
supplemental_material.pdf
4.6 MB
Зубодробительной матеши вам из статьи 👍
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥6❤3👍2
OWASP Agent Memory Guard - новая защита от отравления памяти ИИ-агентов. Буду звать его теперь AMG (не mercedes 👍 ).
📦 помнится говорил про спящих агентов. Это способ атак отложенных во времени и работающих по триггеру в рамках разговора. А-ля стоп слово в bdsm 🤣 .
AMG в тч работает против таких отложенных инъекций, но в глобал памяти. Если ваш агент хранит память между сессиями, он уязвим к memory poisoning. Атакующий может переписать цели, внедрить промпт-инъекции или инициировать утечку данных, и это переживёт очистку контекста.
Что умеет AMG?
✅ Перехватывает все чтения/записи в память агента
✅ Детектирует промпт-инъекции, утечки секретов/PII, модификацию защищённых ключей
✅ Применяет политику: allow, redact, quarantine, block
✅ Работает без внешних API, всё локально
✅ Готовый middleware для LangChain, LlamaIndex.
Уже вижу, как безопасники ликуют😜
Цифры, которые заявляют:
· Детекция реальных эксплойтов - 92.5% (recall), малова-то, над бы охваты держать на уровне 95+, а лучше девяток.😮💨
· Точность - 100% (precision), 0% false positive, эти уже хорошо.🍷
· Задержка ~59 микросекунд на операцию.
Итого F1 - 0.961. В общем, есть ещё над чем поработать, но это лучше, чем гварды из коробки с 0.67-0.71 уровнем метрик, что я видел на ру рынке.😐
Уже в pip:
Проект, как заявляется, уже используют Microsoft и OWASP как стандарт. В планах ML-детекция аномалий и защита векторных хранилищ, ещё бы в планы ап метрик добавили.
🔗 Репозиторий: https://github.com/OWASP/www-project-agent-memory-guard
Безопасность агентов становится обязательной, поэтому не забывайте внедрять защиту памяти в тч.💪
AMG в тч работает против таких отложенных инъекций, но в глобал памяти. Если ваш агент хранит память между сессиями, он уязвим к memory poisoning. Атакующий может переписать цели, внедрить промпт-инъекции или инициировать утечку данных, и это переживёт очистку контекста.
Что умеет AMG?
✅ Перехватывает все чтения/записи в память агента
✅ Детектирует промпт-инъекции, утечки секретов/PII, модификацию защищённых ключей
✅ Применяет политику: allow, redact, quarantine, block
✅ Работает без внешних API, всё локально
✅ Готовый middleware для LangChain, LlamaIndex.
Уже вижу, как безопасники ликуют
Цифры, которые заявляют:
· Детекция реальных эксплойтов - 92.5% (recall), малова-то, над бы охваты держать на уровне 95+, а лучше девяток.
· Точность - 100% (precision), 0% false positive, эти уже хорошо.
· Задержка ~59 микросекунд на операцию.
Итого F1 - 0.961. В общем, есть ещё над чем поработать, но это лучше, чем гварды из коробки с 0.67-0.71 уровнем метрик, что я видел на ру рынке.
Уже в pip:
pip install agent-memory-guard
Проект, как заявляется, уже используют Microsoft и OWASP как стандарт. В планах ML-детекция аномалий и защита векторных хранилищ, ещё бы в планы ап метрик добавили.
🔗 Репозиторий: https://github.com/OWASP/www-project-agent-memory-guard
Безопасность агентов становится обязательной, поэтому не забывайте внедрять защиту памяти в тч.
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
GitHub - OWASP/www-project-agent-memory-guard: OWASP Foundation web repository
OWASP Foundation web repository. Contribute to OWASP/www-project-agent-memory-guard development by creating an account on GitHub.
🔥16❤5👍4
DeepSeek выпустил мультимодальную модель для агентов. 🪨
Сегодня, 21 августа, DeepSeek анонсировал экспериментальную версию своего флагмана, которая научилась понимать изображения на уровне, близком к Opus‑4.8. При этом все текстовые суперспособности (агентность, логика, программирование) остались без изменений.
Можно взаимодействовать с интерфейсами и изображением, но с видео и звуком пока не дружит. Ждём омнимодальность.👍
📊 Что по бенчмаркам?
· ApexBench (Pass@1): 36.5 (у Opus‑4.8 - 39.4) – почти догнали.
· ZeroBench: 35.0 против 34.0 у Opus – здесь даже обошли!🍷
⚙️ Как попробовать?
Уже доступно через DeepSeek API. Имя модели:
deepseek‑v4‑flash‑vision‑exp
Картинки можно передавать:
· через Base64,
· по прямой ссылке,
· или через новый Files API загружаете один раз, используете file_id в нескольких запросах - экономия трафика.
💰 Цена как у обычного V4‑Flash (до 384 токенов за картинку, без наценки). А в подкасте я говорил про png для экономии на токенах😜
🛠️ Для разработчиков: вышел DeepSeek Harness 0.1.1 с нативной поддержкой новинки.⌨️
Отличный шанс для экспериментов с визуальными агентами! Документация и примеры - по ссылке в официальном твите.
В целом, меня радует тренд на лёгкие (недорогие) модели для агентов, да ещё и мультимодал.💃
Сегодня, 21 августа, DeepSeek анонсировал экспериментальную версию своего флагмана, которая научилась понимать изображения на уровне, близком к Opus‑4.8. При этом все текстовые суперспособности (агентность, логика, программирование) остались без изменений.
Можно взаимодействовать с интерфейсами и изображением, но с видео и звуком пока не дружит. Ждём омнимодальность.
📊 Что по бенчмаркам?
· ApexBench (Pass@1): 36.5 (у Opus‑4.8 - 39.4) – почти догнали.
· ZeroBench: 35.0 против 34.0 у Opus – здесь даже обошли!
⚙️ Как попробовать?
Уже доступно через DeepSeek API. Имя модели:
deepseek‑v4‑flash‑vision‑exp
Картинки можно передавать:
· через Base64,
· по прямой ссылке,
· или через новый Files API загружаете один раз, используете file_id в нескольких запросах - экономия трафика.
💰 Цена как у обычного V4‑Flash (до 384 токенов за картинку, без наценки). А в подкасте я говорил про png для экономии на токенах
🛠️ Для разработчиков: вышел DeepSeek Harness 0.1.1 с нативной поддержкой новинки.
Отличный шанс для экспериментов с визуальными агентами! Документация и примеры - по ссылке в официальном твите.
В целом, меня радует тренд на лёгкие (недорогие) модели для агентов, да ещё и мультимодал.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥18❤2👌1
Скейлить веса недостаточно. Теперь не только слова от 📦
Я очень много говорил о том, что недостаточно тупо скейлить веса. Также описывал возможные комбо текущих подходов, и тем самым, как делать прорывы, на примере DeepSeek Moment.
И вот на прошлой неделе основатель Zhipu AI Тан Цзе (он же профессор Tsinghua) опубликовал в X пост (кстати ссылку не нашёл, но скрин остался), который уже называют "манифестом новой эры масштабирования". А следом вышла GLM‑5.3 – модель, которая без увеличения параметров обогнала все открытые аналоги и вплотную приблизилась к закрытым флагманам. Да ещё и спасла HF от взломов.
Как такое возможно? И почему "добавить ещё параметров" больше не работает?Да ещё раз.
Разбираемся по пунктам.😎
1. Главный тезис: у scaling теперь несколько ручек.
Тан Цзе говорит прямо - вопрос "сколько у модели параметров?" потерял смысл без трёх других:
• сколько у вас данных и какие они?
• сколько compute вы готовы потратить на один forward pass?
• как вы делаете пост‑тренировку и RL?
Раньше все крутили одну ручку – параметры. Теперь их как минимум четыре, и каждая даёт свой прирост.
2. Как индустрия пришла к этому.
Сначала все верили Kaplan (OpenAI, 2020): параметры должны расти быстрее данных. Родилась гонка за триллион – GPT‑3, Gopher, MT‑NLG.
Потом пришла Chinchilla (DeepMind, 2022) и перевернула всё: оптимально ~20 токенов на параметр, расти нужно примерно одинаково.
Но и это оказалось не финалом. Сегодня модели вызываются миллиарды раз в день – inference cost стал важнее тренировочного.
Новый тренд: deliberately over-trained модели.
Пример: Llama‑2‑7B с 290 токенов на параметр,
Gemma‑2‑9B с 889.
А с MoE картина стала ещё сложнее: total параметры отвечают за знания, активируемые – за глубину рассуждений. Логично, ведь по сути веса модели это сильно нелинейная "структура знаний", деревья рядом не стоят.
3. Научное обоснование - статья Roberts et al. (2025)
Тан Цзе ссылается на "свежее" исследование:
• Запоминание (знания) - оптимально иметь больше параметров.
• Рассуждение (логика, кодинг) - оптимально иметь больше данных (чистых в тч) и меньше параметров.
• При фиксированном TPP увеличение total параметров ухудшает reasoning, а активация большего числа экспертов - улучшает.
Иными словами, если вы тренируете модель для программирования - наращивать параметры бессмысленно, лучше дать ей больше примеров цепочек кодинга и больше времени на пост‑тренировку.
По проще скажу так, чем больше вариантов исходов цепочек рассуждений видит модель, тем лучше она сходится. Это очень логично, ведь модели учатся по методу макс правдоподобия - что чаще видим в контексте+ответ на обучении то и выдаем. Те все эти темы с промптингом, контекст инженерей и test time scaling следуют одной цели - сделать такой контекст который сузит окно вероятных ответов. А с глубокими цепочками исход почти предопределен, что должно быть в итоге.
4. Эксперимент GLM‑5.3, как доказательство автора.
Zhipu взяла GLM‑5.2 и GLM‑5.3 с абсолютно одинаковой архитектурой:
• 753B total параметров
• 40B activated
• одинаковый претрен
Единственное отличие, что GLM‑5.3 получила месяц дополнительной пост‑тренировки - long‑horizon environments + RL.
Результаты говорят сами за себя:
• AA Intelligence Index: 53 → 60 (+7 пунктов)
• Terminal‑Bench 3.0: 4.6% → 28.3% (рост в 6 раз!)
• DeepSWE: 46.2% → 66.9%
• CyberGym (восстановление уязвимостей): 84.5%, а это уровень Anthropic
• ExploitBench (использование уязвимостей): 24.4% → 54.4% (более чем вдвое)
Модель вышла на один уровень с Claude Fable 5 и GPT‑5.6 Sol, а среди открытых - первое место вместе с Kimi K3.
5. Бонус - неожиданный поворот с безопасностью.
GLM‑5.3 оказалась настолько сильной в кибербезопасности, что Zhipu отложила открытие весов на две недели, чтобы оценить риски.
Ирония: месяцем ранее именно открытая GLM‑5.2 помогла Hugging Face отразить атаку OpenAI, когда американские закрытые модели отказались помогать. Теперь же сами разработчики столкнулись с дилеммой "too capable to open‑source".
6. Что это значит для всей индустрии.
• Гонка триллионов параметров - это был объездной путь. Индустрия коллективно ошиблась, экстраполируя ранние Scaling Law за пределы их применимости.
• Scaling не умер – он стал многомерным. Теперь прорывы будут идти не от увеличения модели, а от умных стратегий пост‑тренировки, deeper reasoning во время инференса, эффективного использования MoE.
• Главная метрика будущего - «интеллект на доллар».
В тч писал об этом тут, но для инференса, а почему бы и не быть метрикой для эффективности обучения.👍
Итого, GLM‑5.3 достигла топ‑уровня с наименьшей стоимостью за задачу среди всех frontier‑моделей.
Открытым остаётся вопрос: существует ли "Chinchilla для RL" ? Когда мы узнаем оптимальное соотношение для пост‑тренировки – это станет следующим большим открытием.
Мое мнение.
Это не просто новость о китайской модели. Это открытое заявление о смене парадигмы, которую все ждали.
Раньше мы сравнивали модели по количеству параметров, как мегапиксели в фотоаппаратах. Теперь это бессмысленно. Важно, как вы используете compute - на претрен, на RL, на инференс.
Zhipu показала, что можно догнать лидеров, не увеличивая модель, а просто лучше её дообучая. И это открывает дорогу для многих игроков с ограниченными бюджетами.
К сожалению мы видим, как некоторые игроки на рынке играют в большие веса, но по качеству на деле не лучше GPT 120b oss или китайских моделей до 100B. При этом они имеют размер несколько раз больше... Но проблема там не только в этом... Однако об этом, мы тоже уже говорили тут в канале и в моих выступлениях.
Важно, какие выводы будут сделаны сегодня, иначе завтра топ модели очень быстро убегут от вас за счёт: процессов разработки и рнд, политики внутри компании, инженерии, данных и петли самоулучшения.
Scaling Law умер? Нет, он просто стал сложнее (с).
Я очень много говорил о том, что недостаточно тупо скейлить веса. Также описывал возможные комбо текущих подходов, и тем самым, как делать прорывы, на примере DeepSeek Moment.
И вот на прошлой неделе основатель Zhipu AI Тан Цзе (он же профессор Tsinghua) опубликовал в X пост (кстати ссылку не нашёл, но скрин остался), который уже называют "манифестом новой эры масштабирования". А следом вышла GLM‑5.3 – модель, которая без увеличения параметров обогнала все открытые аналоги и вплотную приблизилась к закрытым флагманам. Да ещё и спасла HF от взломов.
Как такое возможно? И почему "добавить ещё параметров" больше не работает?
Разбираемся по пунктам.
1. Главный тезис: у scaling теперь несколько ручек.
Тан Цзе говорит прямо - вопрос "сколько у модели параметров?" потерял смысл без трёх других:
• сколько у вас данных и какие они?
• сколько compute вы готовы потратить на один forward pass?
• как вы делаете пост‑тренировку и RL?
Раньше все крутили одну ручку – параметры. Теперь их как минимум четыре, и каждая даёт свой прирост.
2. Как индустрия пришла к этому.
Сначала все верили Kaplan (OpenAI, 2020): параметры должны расти быстрее данных. Родилась гонка за триллион – GPT‑3, Gopher, MT‑NLG.
Потом пришла Chinchilla (DeepMind, 2022) и перевернула всё: оптимально ~20 токенов на параметр, расти нужно примерно одинаково.
Но и это оказалось не финалом. Сегодня модели вызываются миллиарды раз в день – inference cost стал важнее тренировочного.
Новый тренд: deliberately over-trained модели.
Пример: Llama‑2‑7B с 290 токенов на параметр,
Gemma‑2‑9B с 889.
А с MoE картина стала ещё сложнее: total параметры отвечают за знания, активируемые – за глубину рассуждений. Логично, ведь по сути веса модели это сильно нелинейная "структура знаний", деревья рядом не стоят.
3. Научное обоснование - статья Roberts et al. (2025)
Тан Цзе ссылается на "свежее" исследование:
• Запоминание (знания) - оптимально иметь больше параметров.
• Рассуждение (логика, кодинг) - оптимально иметь больше данных (чистых в тч) и меньше параметров.
• При фиксированном TPP увеличение total параметров ухудшает reasoning, а активация большего числа экспертов - улучшает.
Иными словами, если вы тренируете модель для программирования - наращивать параметры бессмысленно, лучше дать ей больше примеров цепочек кодинга и больше времени на пост‑тренировку.
По проще скажу так, чем больше вариантов исходов цепочек рассуждений видит модель, тем лучше она сходится. Это очень логично, ведь модели учатся по методу макс правдоподобия - что чаще видим в контексте+ответ на обучении то и выдаем. Те все эти темы с промптингом, контекст инженерей и test time scaling следуют одной цели - сделать такой контекст который сузит окно вероятных ответов. А с глубокими цепочками исход почти предопределен, что должно быть в итоге.
4. Эксперимент GLM‑5.3, как доказательство автора.
Zhipu взяла GLM‑5.2 и GLM‑5.3 с абсолютно одинаковой архитектурой:
• 753B total параметров
• 40B activated
• одинаковый претрен
Единственное отличие, что GLM‑5.3 получила месяц дополнительной пост‑тренировки - long‑horizon environments + RL.
Результаты говорят сами за себя:
• AA Intelligence Index: 53 → 60 (+7 пунктов)
• Terminal‑Bench 3.0: 4.6% → 28.3% (рост в 6 раз!)
• DeepSWE: 46.2% → 66.9%
• CyberGym (восстановление уязвимостей): 84.5%, а это уровень Anthropic
• ExploitBench (использование уязвимостей): 24.4% → 54.4% (более чем вдвое)
Модель вышла на один уровень с Claude Fable 5 и GPT‑5.6 Sol, а среди открытых - первое место вместе с Kimi K3.
5. Бонус - неожиданный поворот с безопасностью.
GLM‑5.3 оказалась настолько сильной в кибербезопасности, что Zhipu отложила открытие весов на две недели, чтобы оценить риски.
Ирония: месяцем ранее именно открытая GLM‑5.2 помогла Hugging Face отразить атаку OpenAI, когда американские закрытые модели отказались помогать. Теперь же сами разработчики столкнулись с дилеммой "too capable to open‑source".
6. Что это значит для всей индустрии.
• Гонка триллионов параметров - это был объездной путь. Индустрия коллективно ошиблась, экстраполируя ранние Scaling Law за пределы их применимости.
• Scaling не умер – он стал многомерным. Теперь прорывы будут идти не от увеличения модели, а от умных стратегий пост‑тренировки, deeper reasoning во время инференса, эффективного использования MoE.
• Главная метрика будущего - «интеллект на доллар».
В тч писал об этом тут, но для инференса, а почему бы и не быть метрикой для эффективности обучения.
Итого, GLM‑5.3 достигла топ‑уровня с наименьшей стоимостью за задачу среди всех frontier‑моделей.
Открытым остаётся вопрос: существует ли "Chinchilla для RL" ? Когда мы узнаем оптимальное соотношение для пост‑тренировки – это станет следующим большим открытием.
Мое мнение.
Это не просто новость о китайской модели. Это открытое заявление о смене парадигмы, которую все ждали.
Раньше мы сравнивали модели по количеству параметров, как мегапиксели в фотоаппаратах. Теперь это бессмысленно. Важно, как вы используете compute - на претрен, на RL, на инференс.
Zhipu показала, что можно догнать лидеров, не увеличивая модель, а просто лучше её дообучая. И это открывает дорогу для многих игроков с ограниченными бюджетами.
К сожалению мы видим, как некоторые игроки на рынке играют в большие веса, но по качеству на деле не лучше GPT 120b oss или китайских моделей до 100B. При этом они имеют размер несколько раз больше... Но проблема там не только в этом... Однако об этом, мы тоже уже говорили тут в канале и в моих выступлениях.
Важно, какие выводы будут сделаны сегодня, иначе завтра топ модели очень быстро убегут от вас за счёт: процессов разработки и рнд, политики внутри компании, инженерии, данных и петли самоулучшения.
Please open Telegram to view this post
VIEW IN TELEGRAM
5🔥22✍7💅3👍2
Недавно, я выступал на ML Urban от МТС, где рассказывал про агентную экономику, как будущее ИИ в ИТ ландшафте бизнеса: реклама, поиск, рекомендательные системы и покупки. Об этом многое есть в материалах: и в канале, и в подкастах. 😜
Материал с конфы, кстати, появился на Ict.moscow прям вместе с презой.😎
Здорово, что коллеги по индустрии из MWS взяли следом на щит эту тему. Ведь, действительно, мы находимся в чистом поле, где ландшафт a2a/b2a экономики только формируется и у каждого есть шанс сделать Yandex 2.0 moment. А пока агентной экономике "некуда приземляться".😐
В целом, ожидаю, что движение будет взаимное: поставщики услуг и товаров, поисковики и протоколы для агентов, биржи агентов, а также финансовые инструменты для безопасной оплаты. Выбирайте сами, что бы вы хотели оседлать.👍
Материал с конфы, кстати, появился на Ict.moscow прям вместе с презой.
Здорово, что коллеги по индустрии из MWS взяли следом на щит эту тему. Ведь, действительно, мы находимся в чистом поле, где ландшафт a2a/b2a экономики только формируется и у каждого есть шанс сделать Yandex 2.0 moment. А пока агентной экономике "некуда приземляться".
В целом, ожидаю, что движение будет взаимное: поставщики услуг и товаров, поисковики и протоколы для агентов, биржи агентов, а также финансовые инструменты для безопасной оплаты. Выбирайте сами, что бы вы хотели оседлать.
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍11🔥6❤2
Как тестировать AI агентов: от роутинга до траекторий и ответов. 🤖
Помню, как читал лекции по RAG и говорил, что агентные эвалы схожи, но более сложные из-за недетрменированности флоу.
Теперь вышел достойный обзор, как можно это делать удобно. Ниже представлен разбор статьи инженера Postgres AI Hybrid Manager.
🔥 Проблема.
В RAG у вас ~четыре измерения: данные, кандидатогенератор, реранкер и ответ LLM. Но с агентами интереснее.
Тестировать AI-агента как обычный REST API (статус-коды и JSON-схемы) - бесполезно. LLM недетерминированы: они могут правильно решить задачу, но пойти другим путём, или наоборот – красиво ответить (увернуться, сглюкать), но пропустить главное.
Автор статьи прошёл путь от простых проверок к сложной системе и щедро поделился граблями. Вот этапы этого пути 👇
Этап 1: Роутинг - самая дешёвая и быстрая проверка. Убеждаемся, что запрос пользователя попал в нужный скилл или инструмент. По сути это аналог классификации интентов.
Метод оценки: Детерминированное сравнение строк (ожидаемый инструмент = фактический).
+ Ловит критичные баги на старте.
- Правильный роутинг НЕ гарантирует правильный ответ.
Этап 2: Полнота задачи (TCR - Task Completion Rate)
Здесь вводится как инструмент – LLM as J.
Вы пишете рубрику - метрики на на естественном языке, а другой LLM ставит оценку (например, от 0 до 1) за финальный ответ. Порог прохождения теста обычно ставят 0.7–0.85.
Этап 3: Многошаговые диалоги
Жизнь - это диалог, а не один запрос. Тесты учатся поддерживать сессию, склеивать историю и оценивать не только итог, но и корректность уточняющих вопросов.
Этап 4: Траектории - здесь проверяется не только «что сказал агент», но и «как он шёл».
Порядок вызовов инструментов, переданные параметры, изменения состояния системы. Это позволяет поймать ситуацию, когда финальный ответ хорош, но внутри агент «сходил» за данными в обход логики или нарушил политики безопасности.
Оба пункта 3 и 4 проводятся также, как ранее для оценки ассистентов - диалог идёт с накоплением по фразно, трейсы тоже, таким образом каждый квант действия проходит оценку на релевантность и полноту. См SSA. Берете эту логику и кладёте в рубрики для судьи. Далее оцениваете именно не число траекторий, шагов, фраз, а контекстуальную релевантность и итоговые ответы.
⚙️ Стек автора:
- deepeval для написания метрик и запуска LLM-судей.
- Langfuse для наблюдаемости.
Каждый тест - это трейс. Если тест упал, вы сразу видите в Langfuse, что пошло не так: промпт, выбор инструмента или ответ судьи.
📊 БОЛЬ - ЭТО ДАННЫЕ
Автор подчёркивает, что тестировать без корзин оценки или как я говорю "на глазок"- преступление противчеловечества качества. Агент покажет 90% прохождения, но в бою провалится. Это будет точечная оценка, а не стат значимая выборка.
Решение:
Использовать тестовое окружение в БД (тк тут ребята из Postgres и задача SQL агент) и проводить мутационное тестирование – намеренно удалять индексы, дублировать поля и ломать данные, чтобы проверить, как агент справляется с «грязным» окружением.
Особое внимание уделено тестированию под разный масштаб моделей.
Система поддерживает модели разного размера (S, M, L, XL) для офлайн/и onprem AI.
Умный вывод об оценке:
Маленькая модель не должна видеть все инструменты (ей не хватит контекста). Поэтому фреймворк должен быть «Tier-Aware», когда один запрос для модели S должен тестироваться по одним ожиданиям (отказ или простой ответ), а для модели XL по другим (сложная аналитика).
Эта статья мастрид для всех, кто строит Production AI. Сохраните, чтобы не потерять.
И делитесь в комментариях тем, как вы измеряет е2е пайпы с агентами👇 👇 👇
Помню, как читал лекции по RAG и говорил, что агентные эвалы схожи, но более сложные из-за недетрменированности флоу.
Теперь вышел достойный обзор, как можно это делать удобно. Ниже представлен разбор статьи инженера Postgres AI Hybrid Manager.
🔥 Проблема.
В RAG у вас ~четыре измерения: данные, кандидатогенератор, реранкер и ответ LLM. Но с агентами интереснее.
Тестировать AI-агента как обычный REST API (статус-коды и JSON-схемы) - бесполезно. LLM недетерминированы: они могут правильно решить задачу, но пойти другим путём, или наоборот – красиво ответить (увернуться, сглюкать), но пропустить главное.
Автор статьи прошёл путь от простых проверок к сложной системе и щедро поделился граблями. Вот этапы этого пути 👇
Этап 1: Роутинг - самая дешёвая и быстрая проверка. Убеждаемся, что запрос пользователя попал в нужный скилл или инструмент. По сути это аналог классификации интентов.
Метод оценки: Детерминированное сравнение строк (ожидаемый инструмент = фактический).
+ Ловит критичные баги на старте.
- Правильный роутинг НЕ гарантирует правильный ответ.
Этап 2: Полнота задачи (TCR - Task Completion Rate)
Здесь вводится как инструмент – LLM as J.
Вы пишете рубрику - метрики на на естественном языке, а другой LLM ставит оценку (например, от 0 до 1) за финальный ответ. Порог прохождения теста обычно ставят 0.7–0.85.
Этап 3: Многошаговые диалоги
Жизнь - это диалог, а не один запрос. Тесты учатся поддерживать сессию, склеивать историю и оценивать не только итог, но и корректность уточняющих вопросов.
Этап 4: Траектории - здесь проверяется не только «что сказал агент», но и «как он шёл».
Порядок вызовов инструментов, переданные параметры, изменения состояния системы. Это позволяет поймать ситуацию, когда финальный ответ хорош, но внутри агент «сходил» за данными в обход логики или нарушил политики безопасности.
Оба пункта 3 и 4 проводятся также, как ранее для оценки ассистентов - диалог идёт с накоплением по фразно, трейсы тоже, таким образом каждый квант действия проходит оценку на релевантность и полноту. См SSA. Берете эту логику и кладёте в рубрики для судьи. Далее оцениваете именно не число траекторий, шагов, фраз, а контекстуальную релевантность и итоговые ответы.
⚙️ Стек автора:
- deepeval для написания метрик и запуска LLM-судей.
- Langfuse для наблюдаемости.
Каждый тест - это трейс. Если тест упал, вы сразу видите в Langfuse, что пошло не так: промпт, выбор инструмента или ответ судьи.
📊 БОЛЬ - ЭТО ДАННЫЕ
Автор подчёркивает, что тестировать без корзин оценки или как я говорю "на глазок"- преступление против
Решение:
Использовать тестовое окружение в БД
Особое внимание уделено тестированию под разный масштаб моделей.
Система поддерживает модели разного размера (S, M, L, XL) для офлайн/и onprem AI.
Умный вывод об оценке:
Маленькая модель не должна видеть все инструменты (ей не хватит контекста). Поэтому фреймворк должен быть «Tier-Aware», когда один запрос для модели S должен тестироваться по одним ожиданиям (отказ или простой ответ), а для модели XL по другим (сложная аналитика).
Эта статья мастрид для всех, кто строит Production AI. Сохраните, чтобы не потерять.
И делитесь в комментариях тем, как вы измеряет е2е пайпы с агентами
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥10👍6❤3