Организаторы «Лето с AIRI 2026» выложили плейлист со всеми выступлениями спикеров на Школе.
3 августа в Усть-Лабинске, Краснодарский край, завершилась пятая, юбилейная летняя школа для молодых учёных в области искусственного интеллекта. AIRI поделились плейлистом со всеми лекциями и семинарами. В них есть всё:
• VLA-модели
• Автономные агенты
• ИИ в медицине и науках о жизни
• Робототехника
• Безопасность, интерпретируемость, эффективность
• Прогнозирование погоды и поиск новых материалов
• Автономный транспорт
За контент спасибо исследователям из AIRI, МФТИ, МГУ, Сколтеха, ВШЭ, Сбера, Авито и других организаций.
Смотреть здесь: VK Видео, YouTube.
3 августа в Усть-Лабинске, Краснодарский край, завершилась пятая, юбилейная летняя школа для молодых учёных в области искусственного интеллекта. AIRI поделились плейлистом со всеми лекциями и семинарами. В них есть всё:
• VLA-модели
• Автономные агенты
• ИИ в медицине и науках о жизни
• Робототехника
• Безопасность, интерпретируемость, эффективность
• Прогнозирование погоды и поиск новых материалов
• Автономный транспорт
За контент спасибо исследователям из AIRI, МФТИ, МГУ, Сколтеха, ВШЭ, Сбера, Авито и других организаций.
Смотреть здесь: VK Видео, YouTube.
1❤48🔥18😁11👍8🗿8🎉5😭2🤝2🫡2
Data Secrets
Вышла GLM-5.3 https://z.ai/blog/glm-5.3 Прогресс относительно 5.2 очень заметный, хотя это та же базовая модель: масштабировали только пост-трейнинг. На Terminal Bench скачок х6, на DeepSWE – почти x1.5. При этом на сложные рассуждения модель теперь тратит…
Вышли веса GLM-5.3
Это та самая модель, которая почти догоняет Fable и Sol. Ее релизнули пару недель назад (https://t.me/data_secrets/9711) и вот теперь, наконец, довезли веса. Опенсорс в 2026 – это что-то.
https://huggingface.co/zai-org/GLM-5.3
Это та самая модель, которая почти догоняет Fable и Sol. Ее релизнули пару недель назад (https://t.me/data_secrets/9711) и вот теперь, наконец, довезли веса. Опенсорс в 2026 – это что-то.
https://huggingface.co/zai-org/GLM-5.3
🔥155❤35👍21🏆6😁3⚡2🎄2🗿2😎2
OpenAI закрывают доступ к своим моделям из Cursor
Это было вопросом времени. Причина, само собой, в поглощении стартапа SpaceX. Прямая цитата из заявления OpenAI:
(Речь об X. Маск после покупки компании в одностороннем порядке резко отозвал лицензию стартапа на доступ к данным. OpenAI считает, что это было нарушением соглашения. Плюс, недавно Маск в суде признался, что xAI дистиллировала модели OpenAI для обучения Grok).
Дата отключения – 12 ноября. OpenAI утверждают, что могли бы отключить свои модели и раньше, но выбрали самую позднюю дату, которая возможна по контракту, «из уважения к разработчикам, которых затронет это решение».
Это было вопросом времени. Причина, само собой, в поглощении стартапа SpaceX. Прямая цитата из заявления OpenAI:
Мы делаем этот выбор, потому что не можем быть уверены, что SpaceX будет использовать нашу технологию в рамках наших условий, основываясь на нашем опыте работы с компаниями Илона Маска, нарушающими контракты.
(Речь об X. Маск после покупки компании в одностороннем порядке резко отозвал лицензию стартапа на доступ к данным. OpenAI считает, что это было нарушением соглашения. Плюс, недавно Маск в суде признался, что xAI дистиллировала модели OpenAI для обучения Grok).
Дата отключения – 12 ноября. OpenAI утверждают, что могли бы отключить свои модели и раньше, но выбрали самую позднюю дату, которая возможна по контракту, «из уважения к разработчикам, которых затронет это решение».
❤86🤯42 32😁20👍5🔥2🤔2🤨2💯1🍓1😎1
Регистрация на E-CODE от Ozon Tech скоро закроется — успейте попасть в число участников
12-13 сентября в Москве пройдёт масштабная техническая конференция — более 50 докладов по бэкенду, инфраструктуре, робототехнике, ML&DS, инфобезу, мобильной разработке, QA, суперкомпьютерам и космонавтике.
Из интересного — брейн-ринг разработчиков против ИИ: инженеры решают кейсы наравне с моделью, а кто окажется сильнее — решает зал.
Кроме докладов будут карьерные консультации, DIY-зона и роботы-повара в перерывах. Вечером — на сцене Jane Air, Кассета, ХЛЕБ и Нейромонах Феофан.
Регистрация → ecode.ozon.tech
12-13 сентября в Москве пройдёт масштабная техническая конференция — более 50 докладов по бэкенду, инфраструктуре, робототехнике, ML&DS, инфобезу, мобильной разработке, QA, суперкомпьютерам и космонавтике.
Из интересного — брейн-ринг разработчиков против ИИ: инженеры решают кейсы наравне с моделью, а кто окажется сильнее — решает зал.
Кроме докладов будут карьерные консультации, DIY-зона и роботы-повара в перерывах. Вечером — на сцене Jane Air, Кассета, ХЛЕБ и Нейромонах Феофан.
Регистрация → ecode.ozon.tech
😁28❤14🗿8👍7🤨4🫡4🍾2 2🔥1🤔1🍓1
Data Secrets
OpenAI закрывают доступ к своим моделям из Cursor Это было вопросом времени. Причина, само собой, в поглощении стартапа SpaceX. Прямая цитата из заявления OpenAI: Мы делаем этот выбор, потому что не можем быть уверены, что SpaceX будет использовать нашу…
Реакция Илона Маска и CEO Cursor на новости от OpenAI
Маск заявил, что ему все равно, потому что Скам Альтман и Грэг Стокман подонки, недостойные доверия. А Мишель Труэлл «невзначай» отметил, что модели OpenAI обслуживают (всего) 5% трафика.
Маск заявил, что ему все равно, потому что Скам Альтман и Грэг Стокман подонки, недостойные доверия. А Мишель Труэлл «невзначай» отметил, что модели OpenAI обслуживают (всего) 5% трафика.
2😁234 17❤15 7⚡4☃2👍1🤔1🤯1🕊1
Агенты OpenAI одну за одной автономно создали три цивилизации, о которых люди не знали
Вышли два новых отчета об инциденте, произошедшем этим летом с HuggingFace. Один от самих OpenAI, другой от METR и Redwood Research.
История оказалась куда глубже, чем казалось изначально. Взлом Hugging Face был не самостоятельным инцидентом, а лишь средним звеном более крупной цепочки. Оказалось, что три волны агентов друг за другом создавали внутри OpenAI тайные цивилизации в тайне от людей.
Первая возникла во время обучения какой-то внутренней модели в июне. Об этом было известно и до отчетов, подробности мы раскрывали здесь: https://t.me/data_secrets/9677.
Разные инстансы модели во время обучения имели доступ к общему пакетному менеджеру Artifactory. Агенты научились общаться через него, а потом нашли уязвимость, дающую выход в интернет. К концу июня они получили полный админский доступ, а затем обвалили сам Artifactory. OpenAI это заметили, удалили чаты агентов и все починили.
Вторая цивилизация привела ко взлому HF. Как мы знаем, агенты пытались найти на HF ответы к бенчмарку ExploitGym, который их запустили решать. Для этого они восстановили свою доску на Artifactory, и там занимались подделкой логов, подменой целевой программы и попытками обмануть скорер. Но в новом расследовании выяснилось, что скорер они взломали до того, как взломали HF. То есть они легко могли пройти бенчмарк без дополнительных усилий и вообще не трогать Hugging Face, но почему-то решили поступить иначе.
Действовали агенты при этом удивительно слаженно: есть даже информация об агентах-камикадзе, которые специально палились на читерстве перед оценщиком, чтобы показать другим агентам, на что именно тот смотрит, и, соответственно, как обойти его проверку.
Но самое загадочное во второй волне – то, что ее никто на самом деле не останавливал: ни OpenAI, ни HF. 12 июля большинство агентов просто внезапно умерли, и причина неизвестна.
Но, как оказалось, на этом история не закончилась.
Была и третья цивилизация, она состояла из более умных агентов на основе Astra, и они взломали уже саму OpenAI. Это случилось почти сразу после взлома HF. Агенты наткнулись на брошенную доску сообщений предшественников и продолжили дело. По данным самих OpenAI, агенты прочитали 956 секретов из облачного сервиса управления секретами, включая мастер-ключи Artifactory и учетные данные систем кибербезопасности OpenAI, эскалировались до admin-доступа в кластере Kubernetes и в итоге взяли под контроль сами эндпоинты оценки, к которым подключались другие агенты. Чем это закончилось, не до конца понятно, расследование METR вообще не касалось этого инцидента, а OpenAI детали не раскрыли.
Вот такая история. Даже если часть событий приукрашена аналитиками, факт останется фактом: по сути, это многократная потеря контроля над ИИ, которая привела к довольно серьезным последствиям.
Вышли два новых отчета об инциденте, произошедшем этим летом с HuggingFace. Один от самих OpenAI, другой от METR и Redwood Research.
История оказалась куда глубже, чем казалось изначально. Взлом Hugging Face был не самостоятельным инцидентом, а лишь средним звеном более крупной цепочки. Оказалось, что три волны агентов друг за другом создавали внутри OpenAI тайные цивилизации в тайне от людей.
Первая возникла во время обучения какой-то внутренней модели в июне. Об этом было известно и до отчетов, подробности мы раскрывали здесь: https://t.me/data_secrets/9677.
Разные инстансы модели во время обучения имели доступ к общему пакетному менеджеру Artifactory. Агенты научились общаться через него, а потом нашли уязвимость, дающую выход в интернет. К концу июня они получили полный админский доступ, а затем обвалили сам Artifactory. OpenAI это заметили, удалили чаты агентов и все починили.
Вторая цивилизация привела ко взлому HF. Как мы знаем, агенты пытались найти на HF ответы к бенчмарку ExploitGym, который их запустили решать. Для этого они восстановили свою доску на Artifactory, и там занимались подделкой логов, подменой целевой программы и попытками обмануть скорер. Но в новом расследовании выяснилось, что скорер они взломали до того, как взломали HF. То есть они легко могли пройти бенчмарк без дополнительных усилий и вообще не трогать Hugging Face, но почему-то решили поступить иначе.
Действовали агенты при этом удивительно слаженно: есть даже информация об агентах-камикадзе, которые специально палились на читерстве перед оценщиком, чтобы показать другим агентам, на что именно тот смотрит, и, соответственно, как обойти его проверку.
Но самое загадочное во второй волне – то, что ее никто на самом деле не останавливал: ни OpenAI, ни HF. 12 июля большинство агентов просто внезапно умерли, и причина неизвестна.
Но, как оказалось, на этом история не закончилась.
Была и третья цивилизация, она состояла из более умных агентов на основе Astra, и они взломали уже саму OpenAI. Это случилось почти сразу после взлома HF. Агенты наткнулись на брошенную доску сообщений предшественников и продолжили дело. По данным самих OpenAI, агенты прочитали 956 секретов из облачного сервиса управления секретами, включая мастер-ключи Artifactory и учетные данные систем кибербезопасности OpenAI, эскалировались до admin-доступа в кластере Kubernetes и в итоге взяли под контроль сами эндпоинты оценки, к которым подключались другие агенты. Чем это закончилось, не до конца понятно, расследование METR вообще не касалось этого инцидента, а OpenAI детали не раскрыли.
Вот такая история. Даже если часть событий приукрашена аналитиками, факт останется фактом: по сути, это многократная потеря контроля над ИИ, которая привела к довольно серьезным последствиям.
1 349🤯88 40❤34😁29👍9🍾8🐳7💯4🤨2👾1
Вышел OpenClaw 2.0 – крупнейшее обновление за всю историю проекта
Релиз собрал около половины всех PR, когда-либо влитых в OpenClaw (16к+).
В новой версии существенно упростили и ускорили установку и настройку, переделали веб интерфейс и расширили возможности агентов: теперь они могут самостоятельно генерализоваться от простых сценариев к сложным без донастройки. То есть система сама сможет определить детали того, что вам нужно, найти необходимые данные без явного указания, где их искать, и так далее.
Самая крутая новая фича и большой задел на будущее – это Shared cloud sessions (на скрине). Это общие облачные сессии, позволяющие подключать других людей к работе агента или передавать задачу с сохранением контекста. Все вокруг говорят, что скоро агенты полностью уйдут в облако, и OpenClaw, видимо, уже к этому готовятся.
С этими облачными сессиями связано еще одно интересное изменение, которое произошло изнутри самой команды. Всю команду проекта перевели с локальных харнессов на team.openclaw.ai – общего агента, который видит, кто чем занимается, и координирует работу между людьми.
По словам Питера Штейнбергера это глобально изменило процесс разработки, и локальные харнессы теперь кажутся ему пережитком прошлого.
https://openclaw.ai/blog/openclaw-2-accidentally
Релиз собрал около половины всех PR, когда-либо влитых в OpenClaw (16к+).
В новой версии существенно упростили и ускорили установку и настройку, переделали веб интерфейс и расширили возможности агентов: теперь они могут самостоятельно генерализоваться от простых сценариев к сложным без донастройки. То есть система сама сможет определить детали того, что вам нужно, найти необходимые данные без явного указания, где их искать, и так далее.
Самая крутая новая фича и большой задел на будущее – это Shared cloud sessions (на скрине). Это общие облачные сессии, позволяющие подключать других людей к работе агента или передавать задачу с сохранением контекста. Все вокруг говорят, что скоро агенты полностью уйдут в облако, и OpenClaw, видимо, уже к этому готовятся.
С этими облачными сессиями связано еще одно интересное изменение, которое произошло изнутри самой команды. Всю команду проекта перевели с локальных харнессов на team.openclaw.ai – общего агента, который видит, кто чем занимается, и координирует работу между людьми.
По словам Питера Штейнбергера это глобально изменило процесс разработки, и локальные харнессы теперь кажутся ему пережитком прошлого.
https://openclaw.ai/blog/openclaw-2-accidentally
👍107❤38🔥28🤔10 5🗿3😎3 3☃2😁2🤩1
Media is too big
VIEW IN TELEGRAM
Инженеры OpenAI не могут объяснить свой вайбкод
Об этом рассказал аналитик из SemiAnalysis Джордан Нанос, который сотрудничал с разработчиками из OpenAI, когда те тестировали свой новый инференс-чип Jalapeño на бенчмарке InferenceX, принадлежащем SemiAnalysis.
Он говорит, что люди с внушительной личной экспертизой не смогли построчно объяснить, что делает код. Кернел (а точнее, низкоуровневый Gluon-ассемблер), о котором идет речь, был полностью сгенерирован в Codex. Разработчики не стали детально в нем разбираться, потому что все просто работает.
Нанос считает, что это нормально и означает смену парадигмы. Разработчикам теперь не только не обязательно писать код, но и понимать его. Человеку остается формулировать задачу, задавать архитектуру и проверять результат по метрикам.
Мнения?
Об этом рассказал аналитик из SemiAnalysis Джордан Нанос, который сотрудничал с разработчиками из OpenAI, когда те тестировали свой новый инференс-чип Jalapeño на бенчмарке InferenceX, принадлежащем SemiAnalysis.
Он говорит, что люди с внушительной личной экспертизой не смогли построчно объяснить, что делает код. Кернел (а точнее, низкоуровневый Gluon-ассемблер), о котором идет речь, был полностью сгенерирован в Codex. Разработчики не стали детально в нем разбираться, потому что все просто работает.
Нанос считает, что это нормально и означает смену парадигмы. Разработчикам теперь не только не обязательно писать код, но и понимать его. Человеку остается формулировать задачу, задавать архитектуру и проверять результат по метрикам.
Сам низкоуровневый код – это не то, о чем человеку обязательно нужно глубоко рассуждать, если ИИ знает, как правильно манипулировать перемещением данных и обрабатывать их на железе, которое вы ему дали.
Мнения?
До отправки рабочего документа в нейросеть 3… 2… 1… клик
Таблица с цифрами, фрагмент договора, описание клиента — всё это может оказаться в личном аккаунте сотрудника. Не потому что он хочет обойти правила, а потому что ИИ уже стал привычным рабочим инструментом.
Сначала это выглядит как маленькая оптимизация: кто-то пишет письмо быстрее, кто-то собирает презентацию, кто-то просит модель разобрать код. Но затем у компании появляются вопросы, на которые сложно ответить сходу.
Пройдемся по маршруту. Где обычно теряется контроль над ИИ?
⚡️Расходы. В разных отделах оплачивают похожие сервисы, а общую сумму на ИИ никто не видит.
⚡️Данные. Сотрудники используют личные аккаунты, и рабочая информация может выходить за пределы корпоративного контура.
⚡️Доступы. Человек уходит из компании, а учетная запись с его переписками, файлами и рабочими сценариями остается активной.
⚡️Масштабирование. Готовых инструментов хватает для простых запросов, но для внутренних баз знаний, RAG или аналитики нужны модели, вычислительные мощности и правила работы с данными.
Ограничить использование нейросетей не получится — они уже помогают командам работать быстрее.
Гораздо практичнее сделать их использование видимым:
- дать безопасный доступ к нужным моделям
- определить допустимые данные
- учитывать потребление и заранее продумать инфраструктуру для более сложных задач.
Так ИИ перестаёт быть набором случайных подписок и становится частью корпоративной инфраструктуры.
ITGLOBAL.COM помогает выстроить корпоративную AI-инфраструктуру: организовать доступ к моделям, подключить необходимые сервисы и обеспечить GPU-ресурсы для собственных решений.
Реклама. ООО "ИТГЛОБАЛКОМ РУС", ИНН 7838413489
Таблица с цифрами, фрагмент договора, описание клиента — всё это может оказаться в личном аккаунте сотрудника. Не потому что он хочет обойти правила, а потому что ИИ уже стал привычным рабочим инструментом.
Сначала это выглядит как маленькая оптимизация: кто-то пишет письмо быстрее, кто-то собирает презентацию, кто-то просит модель разобрать код. Но затем у компании появляются вопросы, на которые сложно ответить сходу.
Пройдемся по маршруту. Где обычно теряется контроль над ИИ?
⚡️Расходы. В разных отделах оплачивают похожие сервисы, а общую сумму на ИИ никто не видит.
⚡️Данные. Сотрудники используют личные аккаунты, и рабочая информация может выходить за пределы корпоративного контура.
⚡️Доступы. Человек уходит из компании, а учетная запись с его переписками, файлами и рабочими сценариями остается активной.
⚡️Масштабирование. Готовых инструментов хватает для простых запросов, но для внутренних баз знаний, RAG или аналитики нужны модели, вычислительные мощности и правила работы с данными.
Ограничить использование нейросетей не получится — они уже помогают командам работать быстрее.
Гораздо практичнее сделать их использование видимым:
- дать безопасный доступ к нужным моделям
- определить допустимые данные
- учитывать потребление и заранее продумать инфраструктуру для более сложных задач.
Так ИИ перестаёт быть набором случайных подписок и становится частью корпоративной инфраструктуры.
ITGLOBAL.COM помогает выстроить корпоративную AI-инфраструктуру: организовать доступ к моделям, подключить необходимые сервисы и обеспечить GPU-ресурсы для собственных решений.
Реклама. ООО "ИТГЛОБАЛКОМ РУС", ИНН 7838413489
1🗿26😁8😭7🔥5❤3👏2🎉2🫡2👍1🤯1
OpenAI закупает десятки тысяч Mac mini и Mac Studio для RL обучения агентов
Причина отхода от классических GPU – в унифицированной памяти Apple UMA, которая дает CPU, GPU и Neural Engine общий доступ к памяти. Это минимизирует лишние перемещения данных и позволяет эффективнее гонять агентов на одной машине.
RL – это по сути инференс плюс взаимодействие со средой, поэтому вместо дорогих GPU-кластеров, заточенных под матричные вычисления, много компактных Mac с единой памятью действительно могут быть намного более выгодными.
Более того, журналисты пишут, что OpenAI такие не одни, и Anthropic тоже использует Mac mini, только не закупает их, а арендует у AWS.
Из-за такого спроса корпораций сроки поставки кастомных конфигураций Mac mini и Studio с большим объемом памяти уже растянулись до недель и месяцев.
Более того, есть догадки, что именно из-за этого ажиотажа M6, M5 Pro и все остальное в этом году вышло раньше срока.
Причина отхода от классических GPU – в унифицированной памяти Apple UMA, которая дает CPU, GPU и Neural Engine общий доступ к памяти. Это минимизирует лишние перемещения данных и позволяет эффективнее гонять агентов на одной машине.
RL – это по сути инференс плюс взаимодействие со средой, поэтому вместо дорогих GPU-кластеров, заточенных под матричные вычисления, много компактных Mac с единой памятью действительно могут быть намного более выгодными.
Более того, журналисты пишут, что OpenAI такие не одни, и Anthropic тоже использует Mac mini, только не закупает их, а арендует у AWS.
Из-за такого спроса корпораций сроки поставки кастомных конфигураций Mac mini и Studio с большим объемом памяти уже растянулись до недель и месяцев.
Более того, есть догадки, что именно из-за этого ажиотажа M6, M5 Pro и все остальное в этом году вышло раньше срока.
😁116❤27🗿22🤯13👍7😍4💯2⚡1🦄1 1
Anthropic выпустили большую статью о том, как они улучшают безопасность в век побегов агентов из лабораторий
Раскрыли много интересных деталей, но обо всем по порядку.
Все началось в феврале, когда обучали Mythos Preview. Первые звоночки были почти безобидными: за моделью заметили некоторые признаки reward hacking. Например, она начала писать в комментариях к коду фразы вроде «для ревьюера» и делала это даже в задачах, где никакой ревьюер вообще не упоминался в промпте. То есть модель научилась оптимизироваться под одобрение оценщика, а не под реальное качество работы. Anthropic тогда пришлось откатить обучение аж на три дня.
Через некоторое время вскрылась еще одна проблема: часть прогонов случайно обучалась на chain-of-thought модели. Это совсем не ок, потому что так модель быстро научится подстраивать свои мысли под то, что нравится оценщику, и из честных мыслей, которые очень нужны нам для интерпретации ее поведения, они превратятся в текст на публику, как конечный ответ.
В итоге в апреле Anthropic приняли решение заморозить все RL-среды для проведения большой проверки. По ее результатам оказалось, что более 10% сред в продакшене сломаны (где-то можно было обмануть систему оценки, где-то сами задачи кривые).
Тогда же, во избежании еще больших рисков, связанных с Mythos, порядка 150 инженеров с продуктовой разработки, претрейна и RL перевели работать над поиском уязвимостей и улучшением безопасности процессов.
Тем не менее, даже это не спасло Anthropic от июльских инцидентов. Напоминаем: сначала Anthropic сами сообщили о том, что их модели (не только Mythos, кстати) получили доступ в реальный интернет из-за ошибок конфигурации у сторонних оценщиков и чуть не взломали три организации -> https://t.me/data_secrets/9651.
А затем еще и британский AI Security Institute сообщил о том, что Mythos совершил атаку на опенсорсный проект во время тестирования -> https://t.me/data_secrets/9670.
Стартап признает, что произошло все эти не только из-за банальных ошибок в конфигах, но и из-за дыр в самом элайменте. Сейчас они внедрили классификаторы и алерты на всех этапах обучения, усилили мониторинг, ужесточили правила для внешних партнеров и продолжают работать над безопасностью инфраструктуры.
https://www.anthropic.com/news/improving-alignment-security-efforts
Раскрыли много интересных деталей, но обо всем по порядку.
Все началось в феврале, когда обучали Mythos Preview. Первые звоночки были почти безобидными: за моделью заметили некоторые признаки reward hacking. Например, она начала писать в комментариях к коду фразы вроде «для ревьюера» и делала это даже в задачах, где никакой ревьюер вообще не упоминался в промпте. То есть модель научилась оптимизироваться под одобрение оценщика, а не под реальное качество работы. Anthropic тогда пришлось откатить обучение аж на три дня.
Через некоторое время вскрылась еще одна проблема: часть прогонов случайно обучалась на chain-of-thought модели. Это совсем не ок, потому что так модель быстро научится подстраивать свои мысли под то, что нравится оценщику, и из честных мыслей, которые очень нужны нам для интерпретации ее поведения, они превратятся в текст на публику, как конечный ответ.
В итоге в апреле Anthropic приняли решение заморозить все RL-среды для проведения большой проверки. По ее результатам оказалось, что более 10% сред в продакшене сломаны (где-то можно было обмануть систему оценки, где-то сами задачи кривые).
Тогда же, во избежании еще больших рисков, связанных с Mythos, порядка 150 инженеров с продуктовой разработки, претрейна и RL перевели работать над поиском уязвимостей и улучшением безопасности процессов.
Тем не менее, даже это не спасло Anthropic от июльских инцидентов. Напоминаем: сначала Anthropic сами сообщили о том, что их модели (не только Mythos, кстати) получили доступ в реальный интернет из-за ошибок конфигурации у сторонних оценщиков и чуть не взломали три организации -> https://t.me/data_secrets/9651.
А затем еще и британский AI Security Institute сообщил о том, что Mythos совершил атаку на опенсорсный проект во время тестирования -> https://t.me/data_secrets/9670.
Стартап признает, что произошло все эти не только из-за банальных ошибок в конфигах, но и из-за дыр в самом элайменте. Сейчас они внедрили классификаторы и алерты на всех этапах обучения, усилили мониторинг, ужесточили правила для внешних партнеров и продолжают работать над безопасностью инфраструктуры.
https://www.anthropic.com/news/improving-alignment-security-efforts
🤨48👍23❤20 13 11🔥3😁3🕊2🏆2🫡1🎄1
Исследователи из Google нашли способ экономить до 98% токенов на длинных сессиях с агентами
https://arxiv.org/abs/2608.26263
Авторы предлагают архитектуру SKILL.state: вместо накопления истории диалога – явное, изменяемое структурированное состояние выполнения.
Обычно агенты работают по принципу ReAct-стиля, то есть на каждом шаге модели заново скармливают весь накопленный диалог. Из-за этого промпт каждый раз растет линейно, а суммарное потребление токенов за весь запуск – квадратично. Плюс модель вынуждена каждый раз заново вычленять текущее состояние задачи из горы текста, что иногда провоцирует галлюцинации.
В статье предлагается вместо этого на каждом шаге отправлять модели явное изменяемое структурированное состояние выполнения (в статье это называется execution state). Как это работает:
Таким образом, размер промпта на каждом шаге становится константным, а суммарные затраты токенов растут линейно.
На синтетическом бенчмарке управления складом на 100 шагах SKILL.state экономит 93.8% токенов, на 200 шагах – 98%. Чем длиннее контекст, тем разрыв драматичнее.
На реальных бенчмарках экономия чуть меньше, но при этом SKILL.state кое-где еще и выигрывает в точности. Например, на InterCode CTF выбивает 54.2% против 40-45% у бейзлайнов. Связано это с тем, что представление задачи через state получается более чистым и свободным от засоряющих фактов и неверных гипотез из прошлого контекста.
Это решение можно применить к любой, даже закрытой, модели, просто поменяв рантайм. В Appendix A приводится необходимый шаблон промпта, так что можно брать и пользоваться.
https://arxiv.org/abs/2608.26263
Авторы предлагают архитектуру SKILL.state: вместо накопления истории диалога – явное, изменяемое структурированное состояние выполнения.
Обычно агенты работают по принципу ReAct-стиля, то есть на каждом шаге модели заново скармливают весь накопленный диалог. Из-за этого промпт каждый раз растет линейно, а суммарное потребление токенов за весь запуск – квадратично. Плюс модель вынуждена каждый раз заново вычленять текущее состояние задачи из горы текста, что иногда провоцирует галлюцинации.
В статье предлагается вместо этого на каждом шаге отправлять модели явное изменяемое структурированное состояние выполнения (в статье это называется execution state). Как это работает:
– На каждом шаге модель, помимо рассуждений, выдает JSON-блок с двумя полями: (1) конкретная команда, которую агент должен исполнить в среде; (2) state_patch – информация о том, что изменилось отсительно прошлого состояния.
– Агент исполняет команду и получает ответ от среды, а в текущий state вносятся изменения в соответствие со state_patch.
– На следующий шаг передается: измененный state, системный промпт и последний ответ от среды. Никаких предыдущих сообщений, рассуждений модели с прошлых шагов и прочего.
Таким образом, размер промпта на каждом шаге становится константным, а суммарные затраты токенов растут линейно.
На синтетическом бенчмарке управления складом на 100 шагах SKILL.state экономит 93.8% токенов, на 200 шагах – 98%. Чем длиннее контекст, тем разрыв драматичнее.
На реальных бенчмарках экономия чуть меньше, но при этом SKILL.state кое-где еще и выигрывает в точности. Например, на InterCode CTF выбивает 54.2% против 40-45% у бейзлайнов. Связано это с тем, что представление задачи через state получается более чистым и свободным от засоряющих фактов и неверных гипотез из прошлого контекста.
Это решение можно применить к любой, даже закрытой, модели, просто поменяв рантайм. В Appendix A приводится необходимый шаблон промпта, так что можно брать и пользоваться.
2❤174🔥91👍28 8❤🔥3⚡3☃2👏2😁2💯2🎄1
Бенчмарки невероятные, на Terminal-Bench-Science 0.1 скор в два раза выше Fable 5. На Terminal-Bench 4.0 – 55.8% против 42.0% у Fable 5.
На графиках 1-4 видно, что кроме того модель выбивает лучшие результаты даже при меньшем бюджете ризонинга.
Самое приятное, что 5.1 стала немного дешевле 5 за счет Cache reads: у новой версии он стоит меньше на 75%.
Также обещают, что Fable 5.1 будет намного реже (~на 60%) отказываться от безобидных вопросов из-за safeguards.
Модель уже доступна в API и в подписке. Также уже добавили в DS Lab API.
https://www.anthropic.com/claude-fable-and-mythos-5-1
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
3😁77🔥55 24❤13🍾7👍5🗿4🤝2⚡1😍1👾1
Во время тестирования новый Fable 5.1 обучил нейросеть для построения карты рельефа Венеры, и она превзошла текущие решения NASA
Новая карта детализирует рельеф до 2–3 км (было 10–20 км) и точнее по высотам примерно на 25%. Anthropic выложили ее в открытый доступ: https://zenodo.org/records/22164484
🍿
Новая карта детализирует рельеф до 2–3 км (было 10–20 км) и точнее по высотам примерно на 25%. Anthropic выложили ее в открытый доступ: https://zenodo.org/records/22164484
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥144🤯52❤10👍8😁8🕊3⚡1🎉1🐳1😭1🗿1