Вышел OpenClaw 2.0 – крупнейшее обновление за всю историю проекта
Релиз собрал около половины всех PR, когда-либо влитых в OpenClaw (16к+).
В новой версии существенно упростили и ускорили установку и настройку, переделали веб интерфейс и расширили возможности агентов: теперь они могут самостоятельно генерализоваться от простых сценариев к сложным без донастройки. То есть система сама сможет определить детали того, что вам нужно, найти необходимые данные без явного указания, где их искать, и так далее.
Самая крутая новая фича и большой задел на будущее – это Shared cloud sessions (на скрине). Это общие облачные сессии, позволяющие подключать других людей к работе агента или передавать задачу с сохранением контекста. Все вокруг говорят, что скоро агенты полностью уйдут в облако, и OpenClaw, видимо, уже к этому готовятся.
С этими облачными сессиями связано еще одно интересное изменение, которое произошло изнутри самой команды. Всю команду проекта перевели с локальных харнессов на team.openclaw.ai – общего агента, который видит, кто чем занимается, и координирует работу между людьми.
По словам Питера Штейнбергера это глобально изменило процесс разработки, и локальные харнессы теперь кажутся ему пережитком прошлого.
https://openclaw.ai/blog/openclaw-2-accidentally
Релиз собрал около половины всех PR, когда-либо влитых в OpenClaw (16к+).
В новой версии существенно упростили и ускорили установку и настройку, переделали веб интерфейс и расширили возможности агентов: теперь они могут самостоятельно генерализоваться от простых сценариев к сложным без донастройки. То есть система сама сможет определить детали того, что вам нужно, найти необходимые данные без явного указания, где их искать, и так далее.
Самая крутая новая фича и большой задел на будущее – это Shared cloud sessions (на скрине). Это общие облачные сессии, позволяющие подключать других людей к работе агента или передавать задачу с сохранением контекста. Все вокруг говорят, что скоро агенты полностью уйдут в облако, и OpenClaw, видимо, уже к этому готовятся.
С этими облачными сессиями связано еще одно интересное изменение, которое произошло изнутри самой команды. Всю команду проекта перевели с локальных харнессов на team.openclaw.ai – общего агента, который видит, кто чем занимается, и координирует работу между людьми.
По словам Питера Штейнбергера это глобально изменило процесс разработки, и локальные харнессы теперь кажутся ему пережитком прошлого.
https://openclaw.ai/blog/openclaw-2-accidentally
👍107❤38🔥28🤔10 5🗿3😎3 3☃2😁2🤩1
Media is too big
VIEW IN TELEGRAM
Инженеры OpenAI не могут объяснить свой вайбкод
Об этом рассказал аналитик из SemiAnalysis Джордан Нанос, который сотрудничал с разработчиками из OpenAI, когда те тестировали свой новый инференс-чип Jalapeño на бенчмарке InferenceX, принадлежащем SemiAnalysis.
Он говорит, что люди с внушительной личной экспертизой не смогли построчно объяснить, что делает код. Кернел (а точнее, низкоуровневый Gluon-ассемблер), о котором идет речь, был полностью сгенерирован в Codex. Разработчики не стали детально в нем разбираться, потому что все просто работает.
Нанос считает, что это нормально и означает смену парадигмы. Разработчикам теперь не только не обязательно писать код, но и понимать его. Человеку остается формулировать задачу, задавать архитектуру и проверять результат по метрикам.
Мнения?
Об этом рассказал аналитик из SemiAnalysis Джордан Нанос, который сотрудничал с разработчиками из OpenAI, когда те тестировали свой новый инференс-чип Jalapeño на бенчмарке InferenceX, принадлежащем SemiAnalysis.
Он говорит, что люди с внушительной личной экспертизой не смогли построчно объяснить, что делает код. Кернел (а точнее, низкоуровневый Gluon-ассемблер), о котором идет речь, был полностью сгенерирован в Codex. Разработчики не стали детально в нем разбираться, потому что все просто работает.
Нанос считает, что это нормально и означает смену парадигмы. Разработчикам теперь не только не обязательно писать код, но и понимать его. Человеку остается формулировать задачу, задавать архитектуру и проверять результат по метрикам.
Сам низкоуровневый код – это не то, о чем человеку обязательно нужно глубоко рассуждать, если ИИ знает, как правильно манипулировать перемещением данных и обрабатывать их на железе, которое вы ему дали.
Мнения?
До отправки рабочего документа в нейросеть 3… 2… 1… клик
Таблица с цифрами, фрагмент договора, описание клиента — всё это может оказаться в личном аккаунте сотрудника. Не потому что он хочет обойти правила, а потому что ИИ уже стал привычным рабочим инструментом.
Сначала это выглядит как маленькая оптимизация: кто-то пишет письмо быстрее, кто-то собирает презентацию, кто-то просит модель разобрать код. Но затем у компании появляются вопросы, на которые сложно ответить сходу.
Пройдемся по маршруту. Где обычно теряется контроль над ИИ?
⚡️Расходы. В разных отделах оплачивают похожие сервисы, а общую сумму на ИИ никто не видит.
⚡️Данные. Сотрудники используют личные аккаунты, и рабочая информация может выходить за пределы корпоративного контура.
⚡️Доступы. Человек уходит из компании, а учетная запись с его переписками, файлами и рабочими сценариями остается активной.
⚡️Масштабирование. Готовых инструментов хватает для простых запросов, но для внутренних баз знаний, RAG или аналитики нужны модели, вычислительные мощности и правила работы с данными.
Ограничить использование нейросетей не получится — они уже помогают командам работать быстрее.
Гораздо практичнее сделать их использование видимым:
- дать безопасный доступ к нужным моделям
- определить допустимые данные
- учитывать потребление и заранее продумать инфраструктуру для более сложных задач.
Так ИИ перестаёт быть набором случайных подписок и становится частью корпоративной инфраструктуры.
ITGLOBAL.COM помогает выстроить корпоративную AI-инфраструктуру: организовать доступ к моделям, подключить необходимые сервисы и обеспечить GPU-ресурсы для собственных решений.
Реклама. ООО "ИТГЛОБАЛКОМ РУС", ИНН 7838413489
Таблица с цифрами, фрагмент договора, описание клиента — всё это может оказаться в личном аккаунте сотрудника. Не потому что он хочет обойти правила, а потому что ИИ уже стал привычным рабочим инструментом.
Сначала это выглядит как маленькая оптимизация: кто-то пишет письмо быстрее, кто-то собирает презентацию, кто-то просит модель разобрать код. Но затем у компании появляются вопросы, на которые сложно ответить сходу.
Пройдемся по маршруту. Где обычно теряется контроль над ИИ?
⚡️Расходы. В разных отделах оплачивают похожие сервисы, а общую сумму на ИИ никто не видит.
⚡️Данные. Сотрудники используют личные аккаунты, и рабочая информация может выходить за пределы корпоративного контура.
⚡️Доступы. Человек уходит из компании, а учетная запись с его переписками, файлами и рабочими сценариями остается активной.
⚡️Масштабирование. Готовых инструментов хватает для простых запросов, но для внутренних баз знаний, RAG или аналитики нужны модели, вычислительные мощности и правила работы с данными.
Ограничить использование нейросетей не получится — они уже помогают командам работать быстрее.
Гораздо практичнее сделать их использование видимым:
- дать безопасный доступ к нужным моделям
- определить допустимые данные
- учитывать потребление и заранее продумать инфраструктуру для более сложных задач.
Так ИИ перестаёт быть набором случайных подписок и становится частью корпоративной инфраструктуры.
ITGLOBAL.COM помогает выстроить корпоративную AI-инфраструктуру: организовать доступ к моделям, подключить необходимые сервисы и обеспечить GPU-ресурсы для собственных решений.
Реклама. ООО "ИТГЛОБАЛКОМ РУС", ИНН 7838413489
1🗿27😁8😭7🔥5❤4👏2🎉2🫡2👍1🤯1
OpenAI закупает десятки тысяч Mac mini и Mac Studio для RL обучения агентов
Причина отхода от классических GPU – в унифицированной памяти Apple UMA, которая дает CPU, GPU и Neural Engine общий доступ к памяти. Это минимизирует лишние перемещения данных и позволяет эффективнее гонять агентов на одной машине.
RL – это по сути инференс плюс взаимодействие со средой, поэтому вместо дорогих GPU-кластеров, заточенных под матричные вычисления, много компактных Mac с единой памятью действительно могут быть намного более выгодными.
Более того, журналисты пишут, что OpenAI такие не одни, и Anthropic тоже использует Mac mini, только не закупает их, а арендует у AWS.
Из-за такого спроса корпораций сроки поставки кастомных конфигураций Mac mini и Studio с большим объемом памяти уже растянулись до недель и месяцев.
Более того, есть догадки, что именно из-за этого ажиотажа M6, M5 Pro и все остальное в этом году вышло раньше срока.
Причина отхода от классических GPU – в унифицированной памяти Apple UMA, которая дает CPU, GPU и Neural Engine общий доступ к памяти. Это минимизирует лишние перемещения данных и позволяет эффективнее гонять агентов на одной машине.
RL – это по сути инференс плюс взаимодействие со средой, поэтому вместо дорогих GPU-кластеров, заточенных под матричные вычисления, много компактных Mac с единой памятью действительно могут быть намного более выгодными.
Более того, журналисты пишут, что OpenAI такие не одни, и Anthropic тоже использует Mac mini, только не закупает их, а арендует у AWS.
Из-за такого спроса корпораций сроки поставки кастомных конфигураций Mac mini и Studio с большим объемом памяти уже растянулись до недель и месяцев.
Более того, есть догадки, что именно из-за этого ажиотажа M6, M5 Pro и все остальное в этом году вышло раньше срока.
😁117❤27🗿22🤯14👍7😍4💯2⚡1🦄1 1
Anthropic выпустили большую статью о том, как они улучшают безопасность в век побегов агентов из лабораторий
Раскрыли много интересных деталей, но обо всем по порядку.
Все началось в феврале, когда обучали Mythos Preview. Первые звоночки были почти безобидными: за моделью заметили некоторые признаки reward hacking. Например, она начала писать в комментариях к коду фразы вроде «для ревьюера» и делала это даже в задачах, где никакой ревьюер вообще не упоминался в промпте. То есть модель научилась оптимизироваться под одобрение оценщика, а не под реальное качество работы. Anthropic тогда пришлось откатить обучение аж на три дня.
Через некоторое время вскрылась еще одна проблема: часть прогонов случайно обучалась на chain-of-thought модели. Это совсем не ок, потому что так модель быстро научится подстраивать свои мысли под то, что нравится оценщику, и из честных мыслей, которые очень нужны нам для интерпретации ее поведения, они превратятся в текст на публику, как конечный ответ.
В итоге в апреле Anthropic приняли решение заморозить все RL-среды для проведения большой проверки. По ее результатам оказалось, что более 10% сред в продакшене сломаны (где-то можно было обмануть систему оценки, где-то сами задачи кривые).
Тогда же, во избежании еще больших рисков, связанных с Mythos, порядка 150 инженеров с продуктовой разработки, претрейна и RL перевели работать над поиском уязвимостей и улучшением безопасности процессов.
Тем не менее, даже это не спасло Anthropic от июльских инцидентов. Напоминаем: сначала Anthropic сами сообщили о том, что их модели (не только Mythos, кстати) получили доступ в реальный интернет из-за ошибок конфигурации у сторонних оценщиков и чуть не взломали три организации -> https://t.me/data_secrets/9651.
А затем еще и британский AI Security Institute сообщил о том, что Mythos совершил атаку на опенсорсный проект во время тестирования -> https://t.me/data_secrets/9670.
Стартап признает, что произошло все эти не только из-за банальных ошибок в конфигах, но и из-за дыр в самом элайменте. Сейчас они внедрили классификаторы и алерты на всех этапах обучения, усилили мониторинг, ужесточили правила для внешних партнеров и продолжают работать над безопасностью инфраструктуры.
https://www.anthropic.com/news/improving-alignment-security-efforts
Раскрыли много интересных деталей, но обо всем по порядку.
Все началось в феврале, когда обучали Mythos Preview. Первые звоночки были почти безобидными: за моделью заметили некоторые признаки reward hacking. Например, она начала писать в комментариях к коду фразы вроде «для ревьюера» и делала это даже в задачах, где никакой ревьюер вообще не упоминался в промпте. То есть модель научилась оптимизироваться под одобрение оценщика, а не под реальное качество работы. Anthropic тогда пришлось откатить обучение аж на три дня.
Через некоторое время вскрылась еще одна проблема: часть прогонов случайно обучалась на chain-of-thought модели. Это совсем не ок, потому что так модель быстро научится подстраивать свои мысли под то, что нравится оценщику, и из честных мыслей, которые очень нужны нам для интерпретации ее поведения, они превратятся в текст на публику, как конечный ответ.
В итоге в апреле Anthropic приняли решение заморозить все RL-среды для проведения большой проверки. По ее результатам оказалось, что более 10% сред в продакшене сломаны (где-то можно было обмануть систему оценки, где-то сами задачи кривые).
Тогда же, во избежании еще больших рисков, связанных с Mythos, порядка 150 инженеров с продуктовой разработки, претрейна и RL перевели работать над поиском уязвимостей и улучшением безопасности процессов.
Тем не менее, даже это не спасло Anthropic от июльских инцидентов. Напоминаем: сначала Anthropic сами сообщили о том, что их модели (не только Mythos, кстати) получили доступ в реальный интернет из-за ошибок конфигурации у сторонних оценщиков и чуть не взломали три организации -> https://t.me/data_secrets/9651.
А затем еще и британский AI Security Institute сообщил о том, что Mythos совершил атаку на опенсорсный проект во время тестирования -> https://t.me/data_secrets/9670.
Стартап признает, что произошло все эти не только из-за банальных ошибок в конфигах, но и из-за дыр в самом элайменте. Сейчас они внедрили классификаторы и алерты на всех этапах обучения, усилили мониторинг, ужесточили правила для внешних партнеров и продолжают работать над безопасностью инфраструктуры.
https://www.anthropic.com/news/improving-alignment-security-efforts
🤨51👍23❤20 13 12🔥3😁3🕊2🏆2🫡1🎄1
Исследователи из Google нашли способ экономить до 98% токенов на длинных сессиях с агентами
https://arxiv.org/abs/2608.26263
Авторы предлагают архитектуру SKILL.state: вместо накопления истории диалога – явное, изменяемое структурированное состояние выполнения.
Обычно агенты работают по принципу ReAct-стиля, то есть на каждом шаге модели заново скармливают весь накопленный диалог. Из-за этого промпт каждый раз растет линейно, а суммарное потребление токенов за весь запуск – квадратично. Плюс модель вынуждена каждый раз заново вычленять текущее состояние задачи из горы текста, что иногда провоцирует галлюцинации.
В статье предлагается вместо этого на каждом шаге отправлять модели явное изменяемое структурированное состояние выполнения (в статье это называется execution state). Как это работает:
Таким образом, размер промпта на каждом шаге становится константным, а суммарные затраты токенов растут линейно.
На синтетическом бенчмарке управления складом на 100 шагах SKILL.state экономит 93.8% токенов, на 200 шагах – 98%. Чем длиннее контекст, тем разрыв драматичнее.
На реальных бенчмарках экономия чуть меньше, но при этом SKILL.state кое-где еще и выигрывает в точности. Например, на InterCode CTF выбивает 54.2% против 40-45% у бейзлайнов. Связано это с тем, что представление задачи через state получается более чистым и свободным от засоряющих фактов и неверных гипотез из прошлого контекста.
Это решение можно применить к любой, даже закрытой, модели, просто поменяв рантайм. В Appendix A приводится необходимый шаблон промпта, так что можно брать и пользоваться.
https://arxiv.org/abs/2608.26263
Авторы предлагают архитектуру SKILL.state: вместо накопления истории диалога – явное, изменяемое структурированное состояние выполнения.
Обычно агенты работают по принципу ReAct-стиля, то есть на каждом шаге модели заново скармливают весь накопленный диалог. Из-за этого промпт каждый раз растет линейно, а суммарное потребление токенов за весь запуск – квадратично. Плюс модель вынуждена каждый раз заново вычленять текущее состояние задачи из горы текста, что иногда провоцирует галлюцинации.
В статье предлагается вместо этого на каждом шаге отправлять модели явное изменяемое структурированное состояние выполнения (в статье это называется execution state). Как это работает:
– На каждом шаге модель, помимо рассуждений, выдает JSON-блок с двумя полями: (1) конкретная команда, которую агент должен исполнить в среде; (2) state_patch – информация о том, что изменилось отсительно прошлого состояния.
– Агент исполняет команду и получает ответ от среды, а в текущий state вносятся изменения в соответствие со state_patch.
– На следующий шаг передается: измененный state, системный промпт и последний ответ от среды. Никаких предыдущих сообщений, рассуждений модели с прошлых шагов и прочего.
Таким образом, размер промпта на каждом шаге становится константным, а суммарные затраты токенов растут линейно.
На синтетическом бенчмарке управления складом на 100 шагах SKILL.state экономит 93.8% токенов, на 200 шагах – 98%. Чем длиннее контекст, тем разрыв драматичнее.
На реальных бенчмарках экономия чуть меньше, но при этом SKILL.state кое-где еще и выигрывает в точности. Например, на InterCode CTF выбивает 54.2% против 40-45% у бейзлайнов. Связано это с тем, что представление задачи через state получается более чистым и свободным от засоряющих фактов и неверных гипотез из прошлого контекста.
Это решение можно применить к любой, даже закрытой, модели, просто поменяв рантайм. В Appendix A приводится необходимый шаблон промпта, так что можно брать и пользоваться.
2❤188🔥95👍30 8❤🔥3⚡3👏3☃2😁2💯2🎄1
Бенчмарки невероятные, на Terminal-Bench-Science 0.1 скор в два раза выше Fable 5. На Terminal-Bench 4.0 – 55.8% против 42.0% у Fable 5.
На графиках 1-4 видно, что кроме того модель выбивает лучшие результаты даже при меньшем бюджете ризонинга.
Самое приятное, что 5.1 стала немного дешевле 5 за счет Cache reads: у новой версии он стоит меньше на 75%.
Также обещают, что Fable 5.1 будет намного реже (~на 60%) отказываться от безобидных вопросов из-за safeguards.
Модель уже доступна в API и в подписке. Также уже добавили в DS Lab API.
https://www.anthropic.com/claude-fable-and-mythos-5-1
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
3😁84🔥67 29❤19🍾8👍6🗿5🤝2⚡1😍1👾1
Во время тестирования новый Fable 5.1 обучил нейросеть для построения карты рельефа Венеры, и она превзошла текущие решения NASA
Новая карта детализирует рельеф до 2–3 км (было 10–20 км) и точнее по высотам примерно на 25%. Anthropic выложили ее в открытый доступ: https://zenodo.org/records/22164484
🍿
Новая карта детализирует рельеф до 2–3 км (было 10–20 км) и точнее по высотам примерно на 25%. Anthropic выложили ее в открытый доступ: https://zenodo.org/records/22164484
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥190🤯66❤14👍13😁8🕊3⚡2🎉1🐳1😭1🗿1