Data Secrets
92.7K subscribers
7.29K photos
837 videos
20 files
3.33K links
Главный по машинному обучению

Сотрудничество: @veron_28

РКН: clck.ru/3FY3GN
Download Telegram
Исследователи из Google нашли способ экономить до 98% токенов на длинных сессиях с агентами

https://arxiv.org/abs/2608.26263

Авторы предлагают архитектуру SKILL.state: вместо накопления истории диалога – явное, изменяемое структурированное состояние выполнения.

Обычно агенты работают по принципу ReAct-стиля, то есть на каждом шаге модели заново скармливают весь накопленный диалог. Из-за этого промпт каждый раз растет линейно, а суммарное потребление токенов за весь запуск – квадратично. Плюс модель вынуждена каждый раз заново вычленять текущее состояние задачи из горы текста, что иногда провоцирует галлюцинации.

В статье предлагается вместо этого на каждом шаге отправлять модели явное изменяемое структурированное состояние выполнения (в статье это называется execution state). Как это работает:

– На каждом шаге модель, помимо рассуждений, выдает JSON-блок с двумя полями: (1) конкретная команда, которую агент должен исполнить в среде; (2) state_patch – информация о том, что изменилось отсительно прошлого состояния.

– Агент исполняет команду и получает ответ от среды, а в текущий state вносятся изменения в соответствие со state_patch.

– На следующий шаг передается: измененный state, системный промпт и последний ответ от среды. Никаких предыдущих сообщений, рассуждений модели с прошлых шагов и прочего.

Таким образом, размер промпта на каждом шаге становится константным, а суммарные затраты токенов растут линейно.

На синтетическом бенчмарке управления складом на 100 шагах SKILL.state экономит 93.8% токенов, на 200 шагах – 98%. Чем длиннее контекст, тем разрыв драматичнее.

На реальных бенчмарках экономия чуть меньше, но при этом SKILL.state кое-где еще и выигрывает в точности. Например, на InterCode CTF выбивает 54.2% против 40-45% у бейзлайнов. Связано это с тем, что представление задачи через state получается более чистым и свободным от засоряющих фактов и неверных гипотез из прошлого контекста.

Это решение можно применить к любой, даже закрытой, модели, просто поменяв рантайм. В Appendix A приводится необходимый шаблон промпта, так что можно брать и пользоваться.
3197🔥101👍318👏43❤‍🔥32😁2💯2🎄1
⚡️ Вышел Fable 5.1

Бенчмарки невероятные, на Terminal-Bench-Science 0.1 скор в два раза выше Fable 5. На Terminal-Bench 4.0 – 55.8% против 42.0% у Fable 5.

На графиках 1-4 видно, что кроме того модель выбивает лучшие результаты даже при меньшем бюджете ризонинга.

Самое приятное, что 5.1 стала немного дешевле 5 за счет Cache reads: у новой версии он стоит меньше на 75%.

Также обещают, что Fable 5.1 будет намного реже (~на 60%) отказываться от безобидных вопросов из-за safeguards.

Модель уже доступна в API и в подписке. Также уже добавили в DS Lab API.

https://www.anthropic.com/claude-fable-and-mythos-5-1
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
3😁95🔥743019🍾8👍7🗿6🤝21😍1👾1
Во время тестирования новый Fable 5.1 обучил нейросеть для построения карты рельефа Венеры, и она превзошла текущие решения NASA

Новая карта детализирует рельеф до 2–3 км (было 10–20 км) и точнее по высотам примерно на 25%. Anthropic выложили ее в открытый доступ: https://zenodo.org/records/22164484

🍿
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥214🤯7414👍13😁9🕊32🎉1🐳1😭1🗿1
Fable 5.1 это конечно хорошо, но вы видели, что выпустил стартап Фей-Фей Ли?

Встречаете Atlas – первую в истории мультимодальную world model. Она генерирует изображения и видео с контролем камеры на уровне пикселей и (!!!) может реконструировать их в 3D сцены в явном формате point cloud и 3D Gaussian splats. Также обучена Space-time симуляции (четвертый пример).

Длительность видео – до 1 минуты в 1440p, и можно прикреплять до 6 референсных изображений.

Архитектура – мультимодальный диффузионный трансформер. По сути это гибрид LLM-архитектуры (от нее тут авторегрессия+кэширование) и диффузионных видеомоделей (от них денойзинг), дополнительно объединенный с идеей пространственного контекста. Это значит, что каждый элемент контекста имеет явную 3D-привязку через позицию камеры.

По бенчмаркам заявляют превосходство над специализированными моделями и в генерациях с контролем камеры (MiniMax, Gemini Omni Flash, FLUX и др.), и в 3D-реконструкции (Pi3X, VGGT, Depth Anything 3 и др.).

Движок настолько точный, что на нем можно обучать роботов. Atlas может по видео построить явную 3D-сцену, в которой можно симулировать движение робота и обучать его (это называется Real-to-Sim-to-Real подход). Модель генерирует RGB и depth именно с точки зрения бортовых камер робота, и может даже построить симуляцию, в которой возможна манипуляция объектами.

Потрясающий релиз

https://www.worldlabs.ai/blog/atlas
1🔥199👍3732🤯26😁3🍓3🤔21
Раз в сто лет Илья Суцкевер выходит из пещеры и пишет в X что-нибудь жуткое

Последний раз он высказывался в феврале по поводу ситуации с Anthropic и Пентагоном и заявил, что ИИ-лидерам крайне важно держаться вместе, чтобы противостоять подобным ситуациям, которых в будущем будет все больше.

В этот раз несколько часов назад он внезапно твитнул следующее:

У неоклаудов слабая кибербезопасность. В следующий раз, когда агентам удастся выйти из-под контроля, они попытаются захватить неоклауд, чтобы запускать больше своих копий. Это плохо. Поэтому: неоклаудам нужно значительно усилить свою кибербезопасность, и каждая компания с сильными моделями в области кибербезопасности должна в этом помочь.


what did ilya see в этот раз?
7147😁22👍7🤨5🔥1🤯1🎉1😎1