Dealer.AI
16.5K subscribers
744 photos
52 videos
22 files
826 links
Жоский ИИ Дядя
Твой личный поставщик AI 🦾🤖
Канал о мире интересного AI: теория, приклад и meme👾

Head of AI, AI-евангелист, AI-энтузиаст

Для связи @dealer_ai
(реклама и консультации по AI для бизнеса).

РКН: 6348592885
Download Telegram
Фазовый переход в использовании памяти: что это открытие значит для AI-разработчиков? 🟪

Осторожно много буков. 📝

Вы когда-нибудь замечали, что в одних задачах LSTM или Transformer с памятью работают идеально, а в других – только жгут ресурсы без улучшения качества?

Оказывается, выбор между «хранить историю» и «действовать по текущему моменту» – это не плавная настройка, а настоящий фазовый переход первого рода (как таяние льда). И его можно предсказать аналитически. 🪨

Новая статья в Physical Review Letters (плюс 19 страниц матана в Supplemental) даёт чёткие критерии, когда память выгодна, когда нет, а когда возможен гистерезис. Гистерезис – это когда состояние системы зависит не только от текущих параметров, но и от того, как вы к ним пришли (от истории изменения).

Модель в двух словах.

Попытался 📦 всю жесть из материала сублимировать 😐, вышло, как вышло. Не обессудьте.

Итак...

Есть скрытое состояние x(t) – например, концентрация питательного вещества. Вы получаете зашумлённое наблюдение:
y(t) = x(t) + шум.

У вас есть внутренняя переменная z(t) – память, которая эволюционирует по закону:

z = v(t) + шум памяти, где v(t) – это управление: вы сами решаете, как менять память.

За использование управления вы платите штраф Mv^2, прям как кинетическая энергия, чем больше вы «дёргаете» память, тем дороже.

Одновременно вы хотите минимизировать ошибку оценки E[(x - x') ^2] с весом Q. Итоговая функция потерь:

J = Q×ошибка + M×затраты на управление.

Задача – выбрать стратегию v(y,z), которая минимизирует J в стационарном режиме.

В машинном обучении мы часто добавляем L2-регуляризацию:
loss = ошибка + lambda*|w|^2.
При увеличении lambda веса плавно стремятся к нулю. Здесь параметр M играет роль lambda: чем больше M, тем дороже использовать память, и казалось бы, при больших M коэффициент при памяти должен плавно уменьшаться до нуля.

Но здесь есть две связанные переменные (текущее наблюдение и как память на себя же влияет), которые влияют на поведение системы и друг на друга.

Они не независимы. Оптимизация потерь J по этим двум переменным приводит к тому, что на их плоскости, могут существовать два локальных минимума – с памятью и без. Между ними – горный хребет (седловая точка). Когда параметры (например, M) меняются, один из минимумов может исчезнуть или стать глобальным. В момент исчезновения система скачком перескакивает из одной ямы в другую – это и есть фазовый переход.

Суть открытия на пальцах.

Представьте агента, который наблюдает за шумным сигналом и может хранить внутреннее состояние z. Обновление z стоит ресурсов (штраф M). Задача – минимизировать ошибку оценки при ограниченном бюджете.

Авторы доказали:
· Существуют два порога Theta_Q и Theta_M:
· Если Theta_Q < 1 — память точно бесполезна (даже локально).
· Если Theta_M >=1 — память всегда выгодна (глобальный оптимум).
· Между ними – бистабильность: обе стратегии локально оптимальны, выбор зависит от истории (гистерезис).

А теперь разбираем, что из этого можно вынести для AI. 🥴

1. Оптимизация архитектур с памятью (LSTM, Transformer, RNN)

Современные модели с памятью, например, трансформеры с окном внимания или LSTM, всегда используют память, даже когда она не нужна.

Результаты подсказывают:
· При высоком шуме в данных память становится бесполезной – лучше полагаться только на текущий вход. Это объясняет, почему в некоторых задачах обрезка контекста (например, короткое окно внимания) не ухудшает качество.
· При быстро меняющейся среде прошлая информация устаревает – нужно динамически уменьшать размер буфера или использовать забывание, как в LSTM, но с адаптивным коэффициентом.

2. Регуляризация и штраф за сложность в RL.

В RL агент часто хранит внутреннее состояние например, в PPO. Штраф Mv^2 в статье – аналог штрафа за изменение скрытого состояния. Это можно использовать:

· Как регуляризатор в функциях потерь, чтобы поощрять агента использовать память только когда это действительно выгодно.
· Аналитические пороги Theta_Q,Theta_M помогают автоматически подбирать коэффициент регуляризации M без дорогой сетки гиперпараметров – просто по статистике шумов среды. Это особенно полезно в Meta-RL, где среда меняется между эпизодами.

3. Continuous Learning и катастрофическое забывание.

В задачах continual learning модели должны сохранять знания о прошлых задачах, но обновление памяти (весов) стоит ресурсов. Аналогия:

· Параметр M – штраф за изменение весов.
· Фазовый переход означает, что при превышении порога штрафа модель перестаёт обновлять веса вообще – т.е. замораживает их. Это даёт критерий, когда лучше полностью остановить обучение (если среда не меняется) или, наоборот, разморозить (если волатильность растёт).

На практике это позволяет строить адаптивные стратегии обновления – не тратить ресурсы на веса, которые не нужны.

Вот такое интересное исследование. Читайте полную версию, применяйте открытие, и stay tuned 🦾
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥249🆒7👍63
Dealer.AI pinned a video
OWASP Agent Memory Guard - новая защита от отравления памяти ИИ-агентов. Буду звать его теперь AMG (не mercedes 👍).

📦 помнится говорил про спящих агентов. Это способ атак отложенных во времени и работающих по триггеру в рамках разговора. А-ля стоп слово в bdsm 🤣.

AMG в тч работает против таких отложенных инъекций, но в глобал памяти. Если ваш агент хранит память между сессиями, он уязвим к memory poisoning. Атакующий может переписать цели, внедрить промпт-инъекции или инициировать утечку данных, и это переживёт очистку контекста.

Что умеет AMG?

Перехватывает все чтения/записи в память агента
Детектирует промпт-инъекции, утечки секретов/PII, модификацию защищённых ключей
Применяет политику: allow, redact, quarantine, block
Работает без внешних API, всё локально
Готовый middleware для LangChain, LlamaIndex.

Уже вижу, как безопасники ликуют 😜

Цифры, которые заявляют:

· Детекция реальных эксплойтов - 92.5% (recall), малова-то, над бы охваты держать на уровне 95+, а лучше девяток. 😮‍💨
· Точность - 100% (precision), 0% false positive, эти уже хорошо. 🍷
· Задержка ~59 микросекунд на операцию.
Итого F1 - 0.961. В общем, есть ещё над чем поработать, но это лучше, чем гварды из коробки с 0.67-0.71 уровнем метрик, что я видел на ру рынке. 😐

Уже в pip:
pip install agent-memory-guard

Проект, как заявляется, уже используют Microsoft и OWASP как стандарт. В планах ML-детекция аномалий и защита векторных хранилищ, ещё бы в планы ап метрик добавили.

🔗 Репозиторий: https://github.com/OWASP/www-project-agent-memory-guard

Безопасность агентов становится обязательной, поэтому не забывайте внедрять защиту памяти в тч. 💪
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥165👍4
Dealer.AI pinned «Фазовый переход в использовании памяти: что это открытие значит для AI-разработчиков? 🟪 Осторожно много буков. 📝 Вы когда-нибудь замечали, что в одних задачах LSTM или Transformer с памятью работают идеально, а в других – только жгут ресурсы без улучшения…»
DeepSeek выпустил мультимодальную модель для агентов. 🪨

Сегодня, 21 августа, DeepSeek анонсировал экспериментальную версию своего флагмана, которая научилась понимать изображения на уровне, близком к Opus‑4.8. При этом все текстовые суперспособности (агентность, логика, программирование) остались без изменений.

Можно взаимодействовать с интерфейсами и изображением, но с видео и звуком пока не дружит. Ждём омнимодальность. 👍

📊 Что по бенчмаркам?

· ApexBench (Pass@1): 36.5 (у Opus‑4.8 - 39.4) – почти догнали.
· ZeroBench: 35.0 против 34.0 у Opus – здесь даже обошли! 🍷

⚙️ Как попробовать?

Уже доступно через DeepSeek API. Имя модели:
deepseek‑v4‑flash‑vision‑exp

Картинки можно передавать:
· через Base64,
· по прямой ссылке,
· или через новый Files API загружаете один раз, используете file_id в нескольких запросах - экономия трафика.

💰 Цена как у обычного V4‑Flash (до 384 токенов за картинку, без наценки). А в подкасте я говорил про png для экономии на токенах 😜

🛠️ Для разработчиков: вышел DeepSeek Harness 0.1.1 с нативной поддержкой новинки. ⌨️

Отличный шанс для экспериментов с визуальными агентами! Документация и примеры - по ссылке в официальном твите.

В целом, меня радует тренд на лёгкие (недорогие) модели для агентов, да ещё и мультимодал. 💃
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥182👌1
Скейлить веса недостаточно. Теперь не только слова от 📦

Scaling Law умер? Нет, он просто стал сложнее (с).


Я очень много говорил о том, что недостаточно тупо скейлить веса. Также описывал возможные комбо текущих подходов, и тем самым, как делать прорывы, на примере DeepSeek Moment.

И вот на прошлой неделе основатель Zhipu AI Тан Цзе (он же профессор Tsinghua) опубликовал в X пост (кстати ссылку не нашёл, но скрин остался), который уже называют "манифестом новой эры масштабирования". А следом вышла GLM‑5.3 – модель, которая без увеличения параметров обогнала все открытые аналоги и вплотную приблизилась к закрытым флагманам. Да ещё и спасла HF от взломов.

Как такое возможно? И почему "добавить ещё параметров" больше не работает? Да ещё раз.

Разбираемся по пунктам. 😎

1. Главный тезис: у scaling теперь несколько ручек.

Тан Цзе говорит прямо - вопрос "сколько у модели параметров?" потерял смысл без трёх других:

• сколько у вас данных и какие они?
• сколько compute вы готовы потратить на один forward pass?
• как вы делаете пост‑тренировку и RL?

Раньше все крутили одну ручку – параметры. Теперь их как минимум четыре, и каждая даёт свой прирост.

2. Как индустрия пришла к этому.

Сначала все верили Kaplan (OpenAI, 2020): параметры должны расти быстрее данных. Родилась гонка за триллион – GPT‑3, Gopher, MT‑NLG.

Потом пришла Chinchilla (DeepMind, 2022) и перевернула всё: оптимально ~20 токенов на параметр, расти нужно примерно одинаково.

Но и это оказалось не финалом. Сегодня модели вызываются миллиарды раз в день – inference cost стал важнее тренировочного.
Новый тренд: deliberately over-trained модели.
Пример: Llama‑2‑7B  с 290 токенов на параметр,
Gemma‑2‑9B с  889.

А с MoE картина стала ещё сложнее: total параметры отвечают за знания, активируемые – за глубину рассуждений. Логично, ведь по сути веса модели это сильно нелинейная  "структура знаний", деревья рядом не стоят.

3. Научное обоснование - статья Roberts et al. (2025)
Тан Цзе ссылается на "свежее" исследование:
• Запоминание (знания) - оптимально иметь больше параметров.
• Рассуждение (логика, кодинг) - оптимально иметь больше данных (чистых в тч) и меньше параметров.
• При фиксированном TPP увеличение total параметров ухудшает reasoning, а активация большего числа экспертов - улучшает.
Иными словами, если вы тренируете модель для программирования - наращивать параметры бессмысленно, лучше дать ей больше примеров цепочек кодинга и больше времени на пост‑тренировку.

По проще скажу так, чем больше вариантов исходов цепочек рассуждений видит модель, тем лучше она сходится. Это очень логично, ведь модели учатся по методу макс правдоподобия - что чаще видим в контексте+ответ на обучении то и выдаем. Те все эти темы с промптингом, контекст инженерей и test time scaling следуют одной цели - сделать такой контекст который сузит окно вероятных ответов. А с глубокими цепочками исход почти предопределен, что должно быть в итоге.

4. Эксперимент GLM‑5.3, как доказательство автора.

Zhipu взяла GLM‑5.2 и GLM‑5.3 с абсолютно одинаковой архитектурой:
• 753B total параметров
• 40B activated
• одинаковый претрен

Единственное отличие, что GLM‑5.3 получила месяц дополнительной пост‑тренировки - long‑horizon environments + RL.

Результаты говорят сами за себя:

• AA Intelligence Index: 53 → 60 (+7 пунктов)
• Terminal‑Bench 3.0: 4.6% → 28.3% (рост в 6 раз!)
• DeepSWE: 46.2% → 66.9%
• CyberGym (восстановление уязвимостей): 84.5%, а это уровень Anthropic
• ExploitBench (использование уязвимостей): 24.4% → 54.4% (более чем вдвое)

Модель вышла на один уровень с Claude Fable 5 и GPT‑5.6 Sol, а среди открытых - первое место вместе с Kimi K3.

5. Бонус - неожиданный поворот с безопасностью.

GLM‑5.3 оказалась настолько сильной в кибербезопасности, что Zhipu отложила открытие весов на две недели, чтобы оценить риски.

Ирония: месяцем ранее именно открытая GLM‑5.2 помогла Hugging Face отразить атаку OpenAI, когда американские закрытые модели отказались помогать. Теперь же сами разработчики столкнулись с дилеммой "too capable to open‑source".

6. Что это значит для всей индустрии.

• Гонка триллионов параметров - это был объездной путь. Индустрия коллективно ошиблась, экстраполируя ранние Scaling Law за пределы их применимости.
• Scaling не умер – он стал многомерным. Теперь прорывы будут идти не от увеличения модели, а от умных стратегий пост‑тренировки, deeper reasoning во время инференса, эффективного использования MoE.
• Главная метрика будущего - «интеллект на доллар».
В тч писал об этом тут, но для инференса, а почему бы и не быть метрикой для эффективности обучения. 👍

Итого, GLM‑5.3 достигла топ‑уровня с наименьшей стоимостью за задачу среди всех frontier‑моделей.

Открытым остаётся вопрос: существует ли "Chinchilla для RL" ? Когда мы узнаем оптимальное соотношение для пост‑тренировки – это станет следующим большим открытием.

Мое мнение.
Это не просто новость о китайской модели. Это открытое заявление о смене парадигмы, которую все ждали.

Раньше мы сравнивали модели по количеству параметров, как мегапиксели в фотоаппаратах. Теперь это бессмысленно. Важно, как вы используете compute - на претрен, на RL, на инференс.
Zhipu показала, что можно догнать лидеров, не увеличивая модель, а просто лучше её дообучая. И это открывает дорогу для многих игроков с ограниченными бюджетами.

К сожалению мы видим, как некоторые игроки на рынке играют в большие веса, но по качеству на деле не лучше GPT 120b oss или китайских моделей до 100B. При этом они имеют размер несколько раз больше... Но проблема там не только в этом... Однако об этом, мы тоже уже говорили тут в канале и в моих выступлениях.

Важно, какие выводы будут сделаны сегодня, иначе завтра топ модели очень быстро убегут от вас за счёт: процессов разработки и рнд, политики внутри компании, инженерии, данных и петли самоулучшения.
Please open Telegram to view this post
VIEW IN TELEGRAM
5🔥227💅3👍2
Dealer.AI pinned «Про культурный код моделей и соответствие каким-то ценностям LLM. Мне много стали присылать в лс такую новость. 😬 Тлдр. Модели AI будут проверять на соответствие культурным ценностям, для получения звания национальных или суверенных. 😐 Я очень много писал…»
Недавно, я выступал на ML Urban от МТС, где рассказывал про агентную экономику, как будущее ИИ в ИТ ландшафте бизнеса: реклама, поиск, рекомендательные системы и покупки. Об этом многое есть в материалах: и в канале, и в подкастах. 😜

Материал с конфы, кстати, появился на Ict.moscow прям вместе с презой. 😎

Здорово, что коллеги по индустрии из MWS взяли следом на щит эту тему. Ведь, действительно, мы находимся в чистом поле, где ландшафт a2a/b2a экономики только формируется и у каждого есть шанс сделать Yandex 2.0 moment. А пока агентной экономике "некуда приземляться". 😐

В целом, ожидаю, что движение будет взаимное: поставщики услуг и товаров, поисковики и протоколы для агентов, биржи агентов, а также финансовые инструменты для безопасной оплаты. Выбирайте сами, что бы вы хотели оседлать. 👍
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍11🔥62
Как тестировать AI агентов: от роутинга до траекторий и ответов. 🤖

Помню, как читал лекции по RAG и говорил, что агентные эвалы схожи, но более сложные из-за недетрменированности флоу.
Теперь вышел достойный обзор, как можно это делать удобно. Ниже представлен разбор статьи инженера Postgres AI Hybrid Manager.

🔥 Проблема.
В RAG у вас ~четыре измерения: данные, кандидатогенератор, реранкер и ответ LLM. Но с агентами интереснее.
Тестировать AI-агента как обычный REST API (статус-коды и JSON-схемы) - бесполезно. LLM недетерминированы: они могут правильно решить задачу, но пойти другим путём, или наоборот – красиво ответить (увернуться, сглюкать), но пропустить главное.

Автор статьи прошёл путь от простых проверок к сложной системе и щедро поделился граблями. Вот этапы этого пути 👇

Этап 1: Роутинг - самая дешёвая и быстрая проверка. Убеждаемся, что запрос пользователя попал в нужный скилл или инструмент. По сути это аналог классификации интентов.

Метод оценки: Детерминированное сравнение строк (ожидаемый инструмент = фактический).
+ Ловит критичные баги на старте.
- Правильный роутинг НЕ гарантирует правильный ответ.

Этап 2: Полнота задачи (TCR - Task Completion Rate)
Здесь вводится как инструмент – LLM as J.
Вы пишете рубрику - метрики на на естественном языке, а другой LLM ставит оценку (например, от 0 до 1) за финальный ответ. Порог прохождения теста обычно ставят 0.7–0.85.

Этап 3: Многошаговые диалоги
Жизнь - это диалог, а не один запрос. Тесты учатся поддерживать сессию, склеивать историю и оценивать не только итог, но и корректность уточняющих вопросов.

Этап 4: Траектории - здесь проверяется не только «что сказал агент», но и «как он шёл».
Порядок вызовов инструментов, переданные параметры, изменения состояния системы. Это позволяет поймать ситуацию, когда финальный ответ хорош, но внутри агент «сходил» за данными в обход логики или нарушил политики безопасности.

Оба пункта 3 и 4 проводятся также, как ранее для оценки ассистентов - диалог идёт с накоплением по фразно, трейсы тоже, таким образом каждый квант действия проходит оценку на релевантность и полноту. См SSA. Берете эту логику и кладёте в рубрики для судьи. Далее оцениваете именно не число траекторий, шагов, фраз, а контекстуальную релевантность и итоговые ответы.

⚙️ Стек автора:
- deepeval для написания метрик и запуска LLM-судей.
- Langfuse для наблюдаемости.

Каждый тест - это трейс. Если тест упал, вы сразу видите в Langfuse, что пошло не так: промпт, выбор инструмента или ответ судьи.

📊 БОЛЬ - ЭТО ДАННЫЕ
Автор подчёркивает, что тестировать без корзин оценки или как я говорю "на глазок"- преступление против человечества качества. Агент покажет 90% прохождения, но в бою провалится. Это будет точечная оценка, а не стат значимая выборка.

Решение:
Использовать тестовое окружение в БД (тк тут ребята из Postgres и задача SQL агент) и проводить мутационное тестирование – намеренно удалять индексы, дублировать поля и ломать данные, чтобы проверить, как агент справляется с «грязным» окружением.

Особое внимание уделено тестированию под разный масштаб моделей.
Система поддерживает модели разного размера (S, M, L, XL) для офлайн/и onprem AI.
Умный вывод об оценке:
Маленькая модель не должна видеть все инструменты (ей не хватит контекста). Поэтому фреймворк должен быть «Tier-Aware», когда один запрос для модели S должен тестироваться по одним ожиданиям (отказ или простой ответ), а для модели XL по другим (сложная аналитика).

Эта статья мастрид для всех, кто строит Production AI. Сохраните, чтобы не потерять.

И делитесь в комментариях тем, как вы измеряет е2е пайпы с агентами 👇👇👇
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥10👍63
Dealer.AI pinned «Скейлить веса недостаточно. Теперь не только слова от 📦 Scaling Law умер? Нет, он просто стал сложнее (с). Я очень много говорил о том, что недостаточно тупо скейлить веса. Также описывал возможные комбо текущих подходов, и тем самым, как делать прорывы…»