Anthropic выпустили большую статью о том, как они улучшают безопасность в век побегов агентов из лабораторий
Раскрыли много интересных деталей, но обо всем по порядку.
Все началось в феврале, когда обучали Mythos Preview. Первые звоночки были почти безобидными: за моделью заметили некоторые признаки reward hacking. Например, она начала писать в комментариях к коду фразы вроде «для ревьюера» и делала это даже в задачах, где никакой ревьюер вообще не упоминался в промпте. То есть модель научилась оптимизироваться под одобрение оценщика, а не под реальное качество работы. Anthropic тогда пришлось откатить обучение аж на три дня.
Через некоторое время вскрылась еще одна проблема: часть прогонов случайно обучалась на chain-of-thought модели. Это совсем не ок, потому что так модель быстро научится подстраивать свои мысли под то, что нравится оценщику, и из честных мыслей, которые очень нужны нам для интерпретации ее поведения, они превратятся в текст на публику, как конечный ответ.
В итоге в апреле Anthropic приняли решение заморозить все RL-среды для проведения большой проверки. По ее результатам оказалось, что более 10% сред в продакшене сломаны (где-то можно было обмануть систему оценки, где-то сами задачи кривые).
Тогда же, во избежании еще больших рисков, связанных с Mythos, порядка 150 инженеров с продуктовой разработки, претрейна и RL перевели работать над поиском уязвимостей и улучшением безопасности процессов.
Тем не менее, даже это не спасло Anthropic от июльских инцидентов. Напоминаем: сначала Anthropic сами сообщили о том, что их модели (не только Mythos, кстати) получили доступ в реальный интернет из-за ошибок конфигурации у сторонних оценщиков и чуть не взломали три организации -> https://t.me/data_secrets/9651.
А затем еще и британский AI Security Institute сообщил о том, что Mythos совершил атаку на опенсорсный проект во время тестирования -> https://t.me/data_secrets/9670.
Стартап признает, что произошло все эти не только из-за банальных ошибок в конфигах, но и из-за дыр в самом элайменте. Сейчас они внедрили классификаторы и алерты на всех этапах обучения, усилили мониторинг, ужесточили правила для внешних партнеров и продолжают работать над безопасностью инфраструктуры.
https://www.anthropic.com/news/improving-alignment-security-efforts
Раскрыли много интересных деталей, но обо всем по порядку.
Все началось в феврале, когда обучали Mythos Preview. Первые звоночки были почти безобидными: за моделью заметили некоторые признаки reward hacking. Например, она начала писать в комментариях к коду фразы вроде «для ревьюера» и делала это даже в задачах, где никакой ревьюер вообще не упоминался в промпте. То есть модель научилась оптимизироваться под одобрение оценщика, а не под реальное качество работы. Anthropic тогда пришлось откатить обучение аж на три дня.
Через некоторое время вскрылась еще одна проблема: часть прогонов случайно обучалась на chain-of-thought модели. Это совсем не ок, потому что так модель быстро научится подстраивать свои мысли под то, что нравится оценщику, и из честных мыслей, которые очень нужны нам для интерпретации ее поведения, они превратятся в текст на публику, как конечный ответ.
В итоге в апреле Anthropic приняли решение заморозить все RL-среды для проведения большой проверки. По ее результатам оказалось, что более 10% сред в продакшене сломаны (где-то можно было обмануть систему оценки, где-то сами задачи кривые).
Тогда же, во избежании еще больших рисков, связанных с Mythos, порядка 150 инженеров с продуктовой разработки, претрейна и RL перевели работать над поиском уязвимостей и улучшением безопасности процессов.
Тем не менее, даже это не спасло Anthropic от июльских инцидентов. Напоминаем: сначала Anthropic сами сообщили о том, что их модели (не только Mythos, кстати) получили доступ в реальный интернет из-за ошибок конфигурации у сторонних оценщиков и чуть не взломали три организации -> https://t.me/data_secrets/9651.
А затем еще и британский AI Security Institute сообщил о том, что Mythos совершил атаку на опенсорсный проект во время тестирования -> https://t.me/data_secrets/9670.
Стартап признает, что произошло все эти не только из-за банальных ошибок в конфигах, но и из-за дыр в самом элайменте. Сейчас они внедрили классификаторы и алерты на всех этапах обучения, усилили мониторинг, ужесточили правила для внешних партнеров и продолжают работать над безопасностью инфраструктуры.
https://www.anthropic.com/news/improving-alignment-security-efforts
🤨51👍23❤20 13 12🔥3😁3🕊2🏆2🫡1🎄1
Исследователи из Google нашли способ экономить до 98% токенов на длинных сессиях с агентами
https://arxiv.org/abs/2608.26263
Авторы предлагают архитектуру SKILL.state: вместо накопления истории диалога – явное, изменяемое структурированное состояние выполнения.
Обычно агенты работают по принципу ReAct-стиля, то есть на каждом шаге модели заново скармливают весь накопленный диалог. Из-за этого промпт каждый раз растет линейно, а суммарное потребление токенов за весь запуск – квадратично. Плюс модель вынуждена каждый раз заново вычленять текущее состояние задачи из горы текста, что иногда провоцирует галлюцинации.
В статье предлагается вместо этого на каждом шаге отправлять модели явное изменяемое структурированное состояние выполнения (в статье это называется execution state). Как это работает:
Таким образом, размер промпта на каждом шаге становится константным, а суммарные затраты токенов растут линейно.
На синтетическом бенчмарке управления складом на 100 шагах SKILL.state экономит 93.8% токенов, на 200 шагах – 98%. Чем длиннее контекст, тем разрыв драматичнее.
На реальных бенчмарках экономия чуть меньше, но при этом SKILL.state кое-где еще и выигрывает в точности. Например, на InterCode CTF выбивает 54.2% против 40-45% у бейзлайнов. Связано это с тем, что представление задачи через state получается более чистым и свободным от засоряющих фактов и неверных гипотез из прошлого контекста.
Это решение можно применить к любой, даже закрытой, модели, просто поменяв рантайм. В Appendix A приводится необходимый шаблон промпта, так что можно брать и пользоваться.
https://arxiv.org/abs/2608.26263
Авторы предлагают архитектуру SKILL.state: вместо накопления истории диалога – явное, изменяемое структурированное состояние выполнения.
Обычно агенты работают по принципу ReAct-стиля, то есть на каждом шаге модели заново скармливают весь накопленный диалог. Из-за этого промпт каждый раз растет линейно, а суммарное потребление токенов за весь запуск – квадратично. Плюс модель вынуждена каждый раз заново вычленять текущее состояние задачи из горы текста, что иногда провоцирует галлюцинации.
В статье предлагается вместо этого на каждом шаге отправлять модели явное изменяемое структурированное состояние выполнения (в статье это называется execution state). Как это работает:
– На каждом шаге модель, помимо рассуждений, выдает JSON-блок с двумя полями: (1) конкретная команда, которую агент должен исполнить в среде; (2) state_patch – информация о том, что изменилось отсительно прошлого состояния.
– Агент исполняет команду и получает ответ от среды, а в текущий state вносятся изменения в соответствие со state_patch.
– На следующий шаг передается: измененный state, системный промпт и последний ответ от среды. Никаких предыдущих сообщений, рассуждений модели с прошлых шагов и прочего.
Таким образом, размер промпта на каждом шаге становится константным, а суммарные затраты токенов растут линейно.
На синтетическом бенчмарке управления складом на 100 шагах SKILL.state экономит 93.8% токенов, на 200 шагах – 98%. Чем длиннее контекст, тем разрыв драматичнее.
На реальных бенчмарках экономия чуть меньше, но при этом SKILL.state кое-где еще и выигрывает в точности. Например, на InterCode CTF выбивает 54.2% против 40-45% у бейзлайнов. Связано это с тем, что представление задачи через state получается более чистым и свободным от засоряющих фактов и неверных гипотез из прошлого контекста.
Это решение можно применить к любой, даже закрытой, модели, просто поменяв рантайм. В Appendix A приводится необходимый шаблон промпта, так что можно брать и пользоваться.
3❤199🔥102👍31 8👏4⚡3❤🔥3☃2😁2💯2🎄1
Бенчмарки невероятные, на Terminal-Bench-Science 0.1 скор в два раза выше Fable 5. На Terminal-Bench 4.0 – 55.8% против 42.0% у Fable 5.
На графиках 1-4 видно, что кроме того модель выбивает лучшие результаты даже при меньшем бюджете ризонинга.
Самое приятное, что 5.1 стала немного дешевле 5 за счет Cache reads: у новой версии он стоит меньше на 75%.
Также обещают, что Fable 5.1 будет намного реже (~на 60%) отказываться от безобидных вопросов из-за safeguards.
Модель уже доступна в API и в подписке. Также уже добавили в DS Lab API.
https://www.anthropic.com/claude-fable-and-mythos-5-1
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
3😁95🔥74 30❤19🍾8👍7🗿6🤝2⚡1😍1👾1
Во время тестирования новый Fable 5.1 обучил нейросеть для построения карты рельефа Венеры, и она превзошла текущие решения NASA
Новая карта детализирует рельеф до 2–3 км (было 10–20 км) и точнее по высотам примерно на 25%. Anthropic выложили ее в открытый доступ: https://zenodo.org/records/22164484
🍿
Новая карта детализирует рельеф до 2–3 км (было 10–20 км) и точнее по высотам примерно на 25%. Anthropic выложили ее в открытый доступ: https://zenodo.org/records/22164484
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥215🤯74❤14👍13😁9🕊3⚡2🎉1🐳1😭1🗿1
Fable 5.1 это конечно хорошо, но вы видели, что выпустил стартап Фей-Фей Ли?
Встречаете Atlas – первую в истории мультимодальную world model. Она генерирует изображения и видео с контролем камеры на уровне пикселей и (!!!) может реконструировать их в 3D сцены в явном формате point cloud и 3D Gaussian splats. Также обучена Space-time симуляции (четвертый пример).
Длительность видео – до 1 минуты в 1440p, и можно прикреплять до 6 референсных изображений.
Архитектура – мультимодальный диффузионный трансформер. По сути это гибрид LLM-архитектуры (от нее тут авторегрессия+кэширование) и диффузионных видеомоделей (от них денойзинг), дополнительно объединенный с идеей пространственного контекста. Это значит, что каждый элемент контекста имеет явную 3D-привязку через позицию камеры.
По бенчмаркам заявляют превосходство над специализированными моделями и в генерациях с контролем камеры (MiniMax, Gemini Omni Flash, FLUX и др.), и в 3D-реконструкции (Pi3X, VGGT, Depth Anything 3 и др.).
Движок настолько точный, что на нем можно обучать роботов. Atlas может по видео построить явную 3D-сцену, в которой можно симулировать движение робота и обучать его (это называется Real-to-Sim-to-Real подход). Модель генерирует RGB и depth именно с точки зрения бортовых камер робота, и может даже построить симуляцию, в которой возможна манипуляция объектами.
Потрясающий релиз
https://www.worldlabs.ai/blog/atlas
Встречаете Atlas – первую в истории мультимодальную world model. Она генерирует изображения и видео с контролем камеры на уровне пикселей и (!!!) может реконструировать их в 3D сцены в явном формате point cloud и 3D Gaussian splats. Также обучена Space-time симуляции (четвертый пример).
Длительность видео – до 1 минуты в 1440p, и можно прикреплять до 6 референсных изображений.
Архитектура – мультимодальный диффузионный трансформер. По сути это гибрид LLM-архитектуры (от нее тут авторегрессия+кэширование) и диффузионных видеомоделей (от них денойзинг), дополнительно объединенный с идеей пространственного контекста. Это значит, что каждый элемент контекста имеет явную 3D-привязку через позицию камеры.
По бенчмаркам заявляют превосходство над специализированными моделями и в генерациях с контролем камеры (MiniMax, Gemini Omni Flash, FLUX и др.), и в 3D-реконструкции (Pi3X, VGGT, Depth Anything 3 и др.).
Движок настолько точный, что на нем можно обучать роботов. Atlas может по видео построить явную 3D-сцену, в которой можно симулировать движение робота и обучать его (это называется Real-to-Sim-to-Real подход). Модель генерирует RGB и depth именно с точки зрения бортовых камер робота, и может даже построить симуляцию, в которой возможна манипуляция объектами.
Потрясающий релиз
https://www.worldlabs.ai/blog/atlas
1🔥214👍37❤36🤯27😁3🍓3🤔2⚡1
Раз в сто лет Илья Суцкевер выходит из пещеры и пишет в X что-нибудь жуткое
Последний раз он высказывался в феврале по поводу ситуации с Anthropic и Пентагоном и заявил, что ИИ-лидерам крайне важно держаться вместе, чтобы противостоять подобным ситуациям, которых в будущем будет все больше.
В этот раз несколько часов назад он внезапно твитнул следующее:
what did ilya see в этот раз?
Последний раз он высказывался в феврале по поводу ситуации с Anthropic и Пентагоном и заявил, что ИИ-лидерам крайне важно держаться вместе, чтобы противостоять подобным ситуациям, которых в будущем будет все больше.
В этот раз несколько часов назад он внезапно твитнул следующее:
У неоклаудов слабая кибербезопасность. В следующий раз, когда агентам удастся выйти из-под контроля, они попытаются захватить неоклауд, чтобы запускать больше своих копий. Это плохо. Поэтому: неоклаудам нужно значительно усилить свою кибербезопасность, и каждая компания с сильными моделями в области кибербезопасности должна в этом помочь.
what did ilya see в этот раз?
❤98 63😁31👍11🤨6🤯2😎2🔥1🎉1
Арендовать «железо» — ещё не значит получить готовую инфраструктуру
Обычно между публичным облаком и собственными серверами приходится чем-то жертвовать. Хочешь физической изоляции и контроля — будь готов сам собирать и поддерживать инфраструктуру. Хочешь меньше операционки — иди в облако.
Yandex B2B Tech запустила Yandex BareMetal Extend, инструмент, который совмещает эти два подхода.
Инфраструктура физически отделена от публичного облака, но поверх выделенных серверов уже можно получить готовую среду. Доступны три модуля:
— виртуализация;
— Kubernetes®;
— Stackland для разработки приложений.
То есть вместо сценария «вот вам серверы, дальше разбирайтесь сами» можно сразу развернуть нужную среду и работать с ней. При этом остаются возможности, ради которых обычно и выбирают выделенную инфраструктуру: ресурсы можно резервировать, а серверы — объединять через приватное соединение.
Получается довольно занятная модель: физически инфраструктура остаётся выделенной, а по процессу работы с ней она становится гораздо ближе к облаку.
Похоже, bare metal постепенно перестаёт означать «всё руками».
Обычно между публичным облаком и собственными серверами приходится чем-то жертвовать. Хочешь физической изоляции и контроля — будь готов сам собирать и поддерживать инфраструктуру. Хочешь меньше операционки — иди в облако.
Yandex B2B Tech запустила Yandex BareMetal Extend, инструмент, который совмещает эти два подхода.
Инфраструктура физически отделена от публичного облака, но поверх выделенных серверов уже можно получить готовую среду. Доступны три модуля:
— виртуализация;
— Kubernetes®;
— Stackland для разработки приложений.
То есть вместо сценария «вот вам серверы, дальше разбирайтесь сами» можно сразу развернуть нужную среду и работать с ней. При этом остаются возможности, ради которых обычно и выбирают выделенную инфраструктуру: ресурсы можно резервировать, а серверы — объединять через приватное соединение.
Получается довольно занятная модель: физически инфраструктура остаётся выделенной, а по процессу работы с ней она становится гораздо ближе к облаку.
Похоже, bare metal постепенно перестаёт означать «всё руками».
🗿23😁12❤4👍4🤔3☃1🔥1🤯1🎉1😎1