Anthropic наконец-то высказались на тему открытого письма и опенсорса
https://www.anthropic.com/news/position-open-weights-models
Они объяснили, что они, якобы, никогда не выступали за запрет открытых моделей, и что безопасные открытые модели приносят реальную пользу.
Но при этом они согласны с тезисами открытого письма Nvidia только частично. По мнению Амодеи, открытые модели не обязательно облегчают разработку защитных мер против злоумышленного использования ИИ, а даже наоборот. Именно поэтому Anthropic не подписывает документ.
Вопрос безопасности, по официальному мнению Anthropic, должен решаться строгим риск-тестированием моделей перед запуском, и касаться эти меры должны всех и вся, в том числе Китай и их открытые модели.
Кроме того, Амодеи в очередной раз написал, что китайцам нельзя продавать мощные чипы, и надо жесче бороться с контрабандой и промышленной дистилляцией. По его мнению, именно дистилляция позволяет Китаю строить модели, приближающиеся по качеству к американским.
https://www.anthropic.com/news/position-open-weights-models
Они объяснили, что они, якобы, никогда не выступали за запрет открытых моделей, и что безопасные открытые модели приносят реальную пользу.
Но при этом они согласны с тезисами открытого письма Nvidia только частично. По мнению Амодеи, открытые модели не обязательно облегчают разработку защитных мер против злоумышленного использования ИИ, а даже наоборот. Именно поэтому Anthropic не подписывает документ.
Вопрос безопасности, по официальному мнению Anthropic, должен решаться строгим риск-тестированием моделей перед запуском, и касаться эти меры должны всех и вся, в том числе Китай и их открытые модели.
Кроме того, Амодеи в очередной раз написал, что китайцам нельзя продавать мощные чипы, и надо жесче бороться с контрабандой и промышленной дистилляцией. По его мнению, именно дистилляция позволяет Китаю строить модели, приближающиеся по качеству к американским.
😁172 44☃23👍14🗿10❤8 6🦄5🤓4
This media is not supported in your browser
VIEW IN TELEGRAM
Ничего необычного, просто разработчик с просторов HuggingFace создал вот это на злобу дня
Поиграть можно по ссылке: https://huggingface.co/spaces/burtenshaw/open-weights-breakout
Буквально коротко о происходящем
Поиграть можно по ссылке: https://huggingface.co/spaces/burtenshaw/open-weights-breakout
Буквально коротко о происходящем
😁258🔥20❤16👍9🤯2💯2😎2👨💻1
Мировую олимпиаду по ИИ впервые проведут на российской платформе
Со 2 по 8 августа в Астане пройдёт Международная олимпиада школьников по ИИ (IOAI) — 478 участников из 103 стран, включая сборную России. Тестирующей системой соревнования впервые выбран Яндекс Контест, который для проведения Олимпиады компания предоставила бесплатно.
Соревнования по машинному обучению требуют нестандартных подходов к проверке решений. Главная особенность Яндекс Контеста в том, что платформа может принимать от участников не только финальные ответы, но и весь ход работы: исходный программный код, файлы с промежуточными вычислениями и веса обученных моделей. Это принципиально для проведения турниров такого формата.
Оценка решений будет идти в два этапа. Во время тура — на открытом валидационном датасете: участники олимпиады сразу увидят, как работает их модель, и успеют доработать подходы. После тура лучшие попытки тестируются на закрытом расширенном наборе данных, поэтому выиграет решение, которое обобщает, а не подогнано под известные данные.
За 2025 год Яндекс Контест проверил 26,5 млн решений для 80 тысяч задач, в том числе на этапах ВсОШ по ИИ.
Со 2 по 8 августа в Астане пройдёт Международная олимпиада школьников по ИИ (IOAI) — 478 участников из 103 стран, включая сборную России. Тестирующей системой соревнования впервые выбран Яндекс Контест, который для проведения Олимпиады компания предоставила бесплатно.
Соревнования по машинному обучению требуют нестандартных подходов к проверке решений. Главная особенность Яндекс Контеста в том, что платформа может принимать от участников не только финальные ответы, но и весь ход работы: исходный программный код, файлы с промежуточными вычислениями и веса обученных моделей. Это принципиально для проведения турниров такого формата.
Оценка решений будет идти в два этапа. Во время тура — на открытом валидационном датасете: участники олимпиады сразу увидят, как работает их модель, и успеют доработать подходы. После тура лучшие попытки тестируются на закрытом расширенном наборе данных, поэтому выиграет решение, которое обобщает, а не подогнано под известные данные.
За 2025 год Яндекс Контест проверил 26,5 млн решений для 80 тысяч задач, в том числе на этапах ВсОШ по ИИ.
👨💻70👍53😁27🔥21🗿14❤12 5👏2🤯2🤔1
Маск сообщил, что Grok 4.6 выходит уже через неделю
Запуск запланирован на 7 августа. В модели будет 1.5T параметров. Cразу следом за 4.6 спустя несколько недель выйдет Grok 4.7 – еще более крупная модель на 2.1T параметров.
Практически одновременно с объявлением Маска пошел слух о скором запуске нового Composer 3 (напоминаем, что SpaceX купили Cursor, и эта модель обучалась с нуля на кластере Colossus 2). Обещают качество на уровне Opus 5 и GPT-5.6 Sol, а цену – в несколько раз ниже.
Снова переключаемся в режим ожидания
Запуск запланирован на 7 августа. В модели будет 1.5T параметров. Cразу следом за 4.6 спустя несколько недель выйдет Grok 4.7 – еще более крупная модель на 2.1T параметров.
Практически одновременно с объявлением Маска пошел слух о скором запуске нового Composer 3 (напоминаем, что SpaceX купили Cursor, и эта модель обучалась с нуля на кластере Colossus 2). Обещают качество на уровне Opus 5 и GPT-5.6 Sol, а цену – в несколько раз ниже.
Снова переключаемся в режим ожидания
Сотрудники ведущих ИИ-лаб массово подписывают новую петицию о создании инструментов замедления ИИ
https://www.pacingthefrontier.com/
«Pacing the Frontier» требует от правительства разработать международно скоординированные технические и политические механизмы, которые позволили бы всему полю ИИ-разработки сознательно замедлить темпы, если это потребуется.
Письмо предупреждает, что ИИ очень скоро может дойти до точки, когда начнет самоулучшаться, и тогда прогресс может ускориться настолько, что общество и регуляторы не успеют вовремя отреагировать. Поэтому заниматься разработкой стоп-кранов надо уже сейчас, на всякий случай😅
На данный момент письмо подписали уже более 1100 сотрудников фронтиров, включая Дарио Амодеи и сооснователей Anthropic Джареда Каплана и Джека Кларка, главного научного сотрудника OpenAI Джакуба Пахоцки, главного научного сотрудника Meta* Шэньцзя Чжао и главу направления AI safety в Google Анку Драгана, а еще Яна Лейке, Марка Чена, Джона Шульмана и других.
https://www.pacingthefrontier.com/
«Pacing the Frontier» требует от правительства разработать международно скоординированные технические и политические механизмы, которые позволили бы всему полю ИИ-разработки сознательно замедлить темпы, если это потребуется.
Письмо предупреждает, что ИИ очень скоро может дойти до точки, когда начнет самоулучшаться, и тогда прогресс может ускориться настолько, что общество и регуляторы не успеют вовремя отреагировать. Поэтому заниматься разработкой стоп-кранов надо уже сейчас, на всякий случай
На данный момент письмо подписали уже более 1100 сотрудников фронтиров, включая Дарио Амодеи и сооснователей Anthropic Джареда Каплана и Джека Кларка, главного научного сотрудника OpenAI Джакуба Пахоцки, главного научного сотрудника Meta* Шэньцзя Чжао и главу направления AI safety в Google Анку Драгана, а еще Яна Лейке, Марка Чена, Джона Шульмана и других.
Please open Telegram to view this post
VIEW IN TELEGRAM
1 148😁72❤18 18👍10🗿5🤯4🏆3💯2🔥1🦄1
Data Secrets
ICML 2026 — почти все. На воркшопах начинают объявлять лучшие статьи, и одна из наград — Best Paper Award — досталась работе GraphPFN: A Prior-Data Fitted Graph Foundation Model команды исследователей графовых нейронных сетей Yandex Research. Статья победила…
ICML 2026 — все. Мы много про нее писали, но рассказать обо всем было нереально.
Если хотите узнать больше подробностей, приходите на ML Global Recap — митап Яндекса с разбором главных ML-трендов с ICML и не только.
Можно будет офлайн пообщаться с теми, кто был на конференции, и послушать доклады:
• Tabular DL — Артём Бабенко, руководитель Yandex Research;
• тренды и вызовы в ризонинге — Дмитрий Мокеев, руководитель группы качества претрейна Alice AI в Яндекс Поиске;
• новые подходы и стандарты в оценке качества моделей — Иван Дёгтев, руководитель аналитики Alice AI LLM в Яндекс R&D;
• оптимизация LLM-инференса — Андрей Бежин, руководитель службы ML-инфраструктуры в Яндекс R&D.
Встреча пройдёт 13 августа в Москве или онлайн.
Регистрация уже доступна на сайте.
Если хотите узнать больше подробностей, приходите на ML Global Recap — митап Яндекса с разбором главных ML-трендов с ICML и не только.
Можно будет офлайн пообщаться с теми, кто был на конференции, и послушать доклады:
• Tabular DL — Артём Бабенко, руководитель Yandex Research;
• тренды и вызовы в ризонинге — Дмитрий Мокеев, руководитель группы качества претрейна Alice AI в Яндекс Поиске;
• новые подходы и стандарты в оценке качества моделей — Иван Дёгтев, руководитель аналитики Alice AI LLM в Яндекс R&D;
• оптимизация LLM-инференса — Андрей Бежин, руководитель службы ML-инфраструктуры в Яндекс R&D.
Встреча пройдёт 13 августа в Москве или онлайн.
Регистрация уже доступна на сайте.
🐳18⚡11❤10🤝6🗿6😁5👍2🤯2🤨2💘2🎄1
Anthropic значимо обновили MCP
Апдейт назвали крупнейшим с момента запуска. Сейчас расскажем, что изменилось.
Раньше MCP работал как двусторонняя связь с сохранением состояния сессии. То есть при подключении сервер открывал долгоживущее соединение, и весь контекст между запросами жил в оперативке одного запущенного процесса. Это требовало, чтобы был постоянно работающий инстанс, который висит и ждет, существуя все время, пока идет сессия.
В новой версии MCP стал stateless, то есть теперь каждый запрос самодостаточный. Клиент сам присылает весь нужный контекст в запросе (ну или он лежит во внешнем хранилище), а сервер просто получил запрос, обработал, отдал ответ и все забыл.
Все Serverless-платформы (AWS Lambda, Cloudflare Workers и тд) работают именно так. До этой версии MCP нельзя было нормально запустить на такой инфраструктуре, а теперь можно: сервер разработчика может состоять просто из функции, которая просыпается на запрос и засыпает.
В двух словах: MCP только что стали намного дешевле + их стало гораздо легче масштабировать. Практически это значит, что порог входа для создания MCP-сервера резко упал, и мы можем ожидать взрывного роста числа коннекторов для самых разных приложений, даже самых небольших.
https://claude.com/blog/bringing-mcp-2026-07-28-to-claude
Апдейт назвали крупнейшим с момента запуска. Сейчас расскажем, что изменилось.
Раньше MCP работал как двусторонняя связь с сохранением состояния сессии. То есть при подключении сервер открывал долгоживущее соединение, и весь контекст между запросами жил в оперативке одного запущенного процесса. Это требовало, чтобы был постоянно работающий инстанс, который висит и ждет, существуя все время, пока идет сессия.
В новой версии MCP стал stateless, то есть теперь каждый запрос самодостаточный. Клиент сам присылает весь нужный контекст в запросе (ну или он лежит во внешнем хранилище), а сервер просто получил запрос, обработал, отдал ответ и все забыл.
Все Serverless-платформы (AWS Lambda, Cloudflare Workers и тд) работают именно так. До этой версии MCP нельзя было нормально запустить на такой инфраструктуре, а теперь можно: сервер разработчика может состоять просто из функции, которая просыпается на запрос и засыпает.
В двух словах: MCP только что стали намного дешевле + их стало гораздо легче масштабировать. Практически это значит, что порог входа для создания MCP-сервера резко упал, и мы можем ожидать взрывного роста числа коннекторов для самых разных приложений, даже самых небольших.
https://claude.com/blog/bringing-mcp-2026-07-28-to-claude
❤116👍45😁36🔥7🗿5😎5⚡2☃2🤔1
Яндекс анонсировал метрики, которые к концу 2026 года должны стать новой нормой для инженерных команд: 75% разработчиков регулярно используют ИИ, на уровне всей компании не менее 75% изменений готовятся с участием нейросетей, и в каждом таком изменении ИИ генерирует не менее 75% кода.
Яндекс не просто говорит об ускорении разработки, а формулирует конкретные измеримые цели. Это превращает AI‑native из абстрактной концепции во внутренний KPI.
Сейчас 73% разработчиков внутри компании уже работают с генеративными моделями, и больше половины нового кода пишется с помощью ИИ. При этом наибольшей эффективности достигают команды, где ИИ встроен в повседневный процесс разработки и используется при подготовке не менее 75% изменений в коде. Так работают 17,2% разработчиков — за последний месяц их доля выросла более чем вдвое по сравнению с прошлым кварталом. Именно этот опыт теперь собираются масштабировать на всю компанию.
Команда Яндекс Еды за два месяца с помощью ИИ собрала агента, который помогает отвечать на звонки и делать брони в ресторанах, ускорив разработку более чем вдвое. В Лавке силами одного сотрудника за три недели собрали прототип кабинета для франчайзи, а скорость разработки в отдельных спринтах выросла в 3,3 раза.
Для внешних разработчиков и компаний Яндекс также предлагает собственные платформы для создания ИИ-агентов и оптимизации работы. Например, SourceCraft, где предусмотрен ИИ режим для работы с кодом и Yandex AI Studio для создания ИИ‑агентов и приложений.
Яндекс не просто говорит об ускорении разработки, а формулирует конкретные измеримые цели. Это превращает AI‑native из абстрактной концепции во внутренний KPI.
Сейчас 73% разработчиков внутри компании уже работают с генеративными моделями, и больше половины нового кода пишется с помощью ИИ. При этом наибольшей эффективности достигают команды, где ИИ встроен в повседневный процесс разработки и используется при подготовке не менее 75% изменений в коде. Так работают 17,2% разработчиков — за последний месяц их доля выросла более чем вдвое по сравнению с прошлым кварталом. Именно этот опыт теперь собираются масштабировать на всю компанию.
Команда Яндекс Еды за два месяца с помощью ИИ собрала агента, который помогает отвечать на звонки и делать брони в ресторанах, ускорив разработку более чем вдвое. В Лавке силами одного сотрудника за три недели собрали прототип кабинета для франчайзи, а скорость разработки в отдельных спринтах выросла в 3,3 раза.
Для внешних разработчиков и компаний Яндекс также предлагает собственные платформы для создания ИИ-агентов и оптимизации работы. Например, SourceCraft, где предусмотрен ИИ режим для работы с кодом и Yandex AI Studio для создания ИИ‑агентов и приложений.
3😁119 45🗿21❤15🫡14👍6🤨6 4🤔3⚡2😎1
Data Secrets
Проклятье всех ИИ-лаб постигает теперь и Thinking Machines Миры Мурати: от нее ушли почти все партнеры Лилиан Вен, соосновательница стартапа, сегодня объявила об уходе. После этого в TM осталось всего 2 сооснователя из 6, и это включая саму Миру. Лилиан…
Представляете, какая ирония
Лилиан Вен после ухода из Thinking Machines возвращается в… OpenAI. Она будет возглавлять команду, работающую над рекурсивным самоусовершенствованием ИИ.
Напоминаем, что при уходе от Миры Мурати Лилиан заявила, что «не выдерживает стартаповских темпов»
Лилиан Вен после ухода из Thinking Machines возвращается в… OpenAI. Она будет возглавлять команду, работающую над рекурсивным самоусовершенствованием ИИ.
Напоминаем, что при уходе от Миры Мурати Лилиан заявила, что «не выдерживает стартаповских темпов»
😁246 30👏9❤6☃2🤯2🏆2👍1🤔1😭1
Google DeepMind распустила нобеленосную команду AlphaFold
Сотрудников перераспределяют в более широкие проекты, связанные с Gemini и scientific AI.
По слухам, это связано с новой стратегией компании: они начинают понемногу отказываться от узких команд под одно конкретное направление и идут all in в Gemini и в универсальных агентов. Идея в том, что одна мощная модель и инфраструктура вокруг нее должны обслуживать множество научных задач.
Так что, возможно, мы больше не увидим моделей линейки Alpha. Ушла эпоха😢
Некоторые исследователи команды в связи с реструктуризацией покинули компанию или перешли в Isomorphic Labs (это дочерняя структура Alphabet для AI-дискавери в фарме).
Сотрудников перераспределяют в более широкие проекты, связанные с Gemini и scientific AI.
По слухам, это связано с новой стратегией компании: они начинают понемногу отказываться от узких команд под одно конкретное направление и идут all in в Gemini и в универсальных агентов. Идея в том, что одна мощная модель и инфраструктура вокруг нее должны обслуживать множество научных задач.
Так что, возможно, мы больше не увидим моделей линейки Alpha. Ушла эпоха
Некоторые исследователи команды в связи с реструктуризацией покинули компанию или перешли в Isomorphic Labs (это дочерняя структура Alphabet для AI-дискавери в фарме).
Please open Telegram to view this post
VIEW IN TELEGRAM
😭131❤40🕊22😁8😢4🤨4🫡4👍2🎉2😍2🎄2
Yandex B2B Tech представила универсального ИИ-агента для бизнеса, который сможет автоматизировать до 30–50% рутинных задач офисных сотрудников. Запустить его планируют до конца сентября.
В отличие от специализированных ИИ-инструментов, агент сможет выполнять самые разные задачи: от подготовки конспектов встреч и пересказа документов до сравнения коммерческих предложений, оформления закупок и работы с договорами.
Работать с ним можно будет через единый чат, подключив корпоративные сервисы. Агент умеет ходить в них от имени пользователя, чтобы самостоятельно получать нужные данные. Он также сможет выполнять поручения в фоновом режиме, работать по расписанию и использовать готовые или пользовательские навыки для разных бизнес-сценариев — без необходимости писать код. При этом все важные действия останутся под контролем пользователя.
Интересно, когда агент сможет отвечать: «коллеги, вернусь с ответом после отпуска»
В отличие от специализированных ИИ-инструментов, агент сможет выполнять самые разные задачи: от подготовки конспектов встреч и пересказа документов до сравнения коммерческих предложений, оформления закупок и работы с договорами.
Работать с ним можно будет через единый чат, подключив корпоративные сервисы. Агент умеет ходить в них от имени пользователя, чтобы самостоятельно получать нужные данные. Он также сможет выполнять поручения в фоновом режиме, работать по расписанию и использовать готовые или пользовательские навыки для разных бизнес-сценариев — без необходимости писать код. При этом все важные действия останутся под контролем пользователя.
Интересно, когда агент сможет отвечать: «коллеги, вернусь с ответом после отпуска»
😁93❤23👍13🗿7🔥5🤨3⚡2🤯1🕊1😍1
This media is not supported in your browser
VIEW IN TELEGRAM
451 токен по Фаренгейту: правда ли, что ИИ-компании уничтожают книги
Помните громкий суд Anthropic по делу нарушения авторских прав? Мы напомним: чуть меньше года назад антропики проходили по коллективному иску авторов, на чьих работах они обучали модели. В итоге стартапу пришлось платить громадные штрафы за пиратские копии, но в то же время компанию оправдали за обучение ИИ на купленных бумажных экземплярах. Попался прогрессивный судья, который постановил, что это «добросовестное использование» бумажных копий.
Больше подробностей было здесь: https://t.me/data_secrets/7780
Так вот тем самым Anthropic создали серьезный прецедент и, как оказалось, дали начало большому тренду на массовую закупку и оцифровку бумажных книг для обучения ИИ. Раз это «добросовестное использование», почему бы и всем остальным лабам этим не воспользоваться?
Так что да, теперь ИИ-компании массово скупают подержанные бумажные книги, изданные до 2022 года (чтобы текст точно был человеческий), разрезают их гидравлическим прессом, отделяя страницы от переплета, и таким образом сканируют для датасетов. Сама книга как физический объект при этом, понятно, уничтожается.
Если тираж массовый, то потеря невелика. Но букинисты фиксируют аномальные оптовые закупки и в сегменте редких, давно не переиздававшихся книг (то есть экземпляров, которых в мире осталось немного).
К сожалению, прямых доказательств, что это именно ИИ-компании охотятся за раритетами, нет, потому что работа идет через посредников. Например, сервис ISBNdb принципиально не раскрывают личности покупателей, но при этом известно, что они открыто предлагают ИИ-лабам оптовые партии книг на заказ.
Расследование: https://www.404media.co/ai-companies-are-buying-tons-of-old-books-because-theyre-free-of-ai-slop/
Помните громкий суд Anthropic по делу нарушения авторских прав? Мы напомним: чуть меньше года назад антропики проходили по коллективному иску авторов, на чьих работах они обучали модели. В итоге стартапу пришлось платить громадные штрафы за пиратские копии, но в то же время компанию оправдали за обучение ИИ на купленных бумажных экземплярах. Попался прогрессивный судья, который постановил, что это «добросовестное использование» бумажных копий.
Больше подробностей было здесь: https://t.me/data_secrets/7780
Так вот тем самым Anthropic создали серьезный прецедент и, как оказалось, дали начало большому тренду на массовую закупку и оцифровку бумажных книг для обучения ИИ. Раз это «добросовестное использование», почему бы и всем остальным лабам этим не воспользоваться?
Так что да, теперь ИИ-компании массово скупают подержанные бумажные книги, изданные до 2022 года (чтобы текст точно был человеческий), разрезают их гидравлическим прессом, отделяя страницы от переплета, и таким образом сканируют для датасетов. Сама книга как физический объект при этом, понятно, уничтожается.
Если тираж массовый, то потеря невелика. Но букинисты фиксируют аномальные оптовые закупки и в сегменте редких, давно не переиздававшихся книг (то есть экземпляров, которых в мире осталось немного).
К сожалению, прямых доказательств, что это именно ИИ-компании охотятся за раритетами, нет, потому что работа идет через посредников. Например, сервис ISBNdb принципиально не раскрывают личности покупателей, но при этом известно, что они открыто предлагают ИИ-лабам оптовые партии книг на заказ.
Расследование: https://www.404media.co/ai-companies-are-buying-tons-of-old-books-because-theyre-free-of-ai-slop/
Как две галочки в API утроили результат GPT-5.6 на ARC-AGI-3
Очень занятное исследование выпустили сегодня OpenAI. В двух словах: иногда важнее как мы тестируем, а не что мы тестируем. Но обо всем по порядку.
Когда вышла GPT-5.6 Sol, результаты на ARC-AGI-3 для такой сильной модели оказались подозрительно слабыми – всего 7.8%. И это при том, что Sol хорошо прошла Pokémon FireRed и решила, например, гипотезу о двойном покрытии циклов. В общем, команда решила разобраться, в чем дело.
Напоминаем, что ARC-AGI-3 – это бенчмарк для агентов. Соответственно, модели для взаимодействия со средой нужна какая-то обвязка – харнесс – которая определяет, что модель видит на каждом шаге, как вызываются инструменты, что происходит с контекстом и тд. Ожидаемо, среда ARC-AGI-3 использует максимально простой универсальный харнесс, чтобы честно сравнивать модели между собой. Но для OpenAI именно в этой универсальности и оказалась зарыта собака.
Во-первых, после каждого действия в игре весь приватный ризонинг модели просто удалялся, так что Sol не видел собственных планов и рассуждений с прошлых шагов. Во-вторых, из-за использования скользящего окна по мере роста истории любые старые действия становились для модели невидимыми.
Но дело в том, что Sol была специально обучена именно с сохранением ризонинга между шагами. Харнесс эту фишку отрубил, и результаты посыпались.
А теперь внимание на график наверху. Зеленое – это результаты модели на public сете ARC-AGI-3 на официальном харнессе. А синее – на харнессе, в котором просто включили сохранение ризонинга между вызовами и заменили грубое обрезание истории на сжатие контекста (те же настройки используются в продакшене ChatGPT и Codex). 38.3% против 13.3%, и при этом расход токенов на вывод снизился в 6 раз. Для сравнения, средний результат человека – 48%.
Мораль от OpenAI: бенчмарк меряет не только модель, но и то, как именно ее используют. Как минимум, давно пора на подобных бенчмарках использовать Responses API вместо седого Chat Completions.
Очень занятное исследование выпустили сегодня OpenAI. В двух словах: иногда важнее как мы тестируем, а не что мы тестируем. Но обо всем по порядку.
Когда вышла GPT-5.6 Sol, результаты на ARC-AGI-3 для такой сильной модели оказались подозрительно слабыми – всего 7.8%. И это при том, что Sol хорошо прошла Pokémon FireRed и решила, например, гипотезу о двойном покрытии циклов. В общем, команда решила разобраться, в чем дело.
Напоминаем, что ARC-AGI-3 – это бенчмарк для агентов. Соответственно, модели для взаимодействия со средой нужна какая-то обвязка – харнесс – которая определяет, что модель видит на каждом шаге, как вызываются инструменты, что происходит с контекстом и тд. Ожидаемо, среда ARC-AGI-3 использует максимально простой универсальный харнесс, чтобы честно сравнивать модели между собой. Но для OpenAI именно в этой универсальности и оказалась зарыта собака.
Во-первых, после каждого действия в игре весь приватный ризонинг модели просто удалялся, так что Sol не видел собственных планов и рассуждений с прошлых шагов. Во-вторых, из-за использования скользящего окна по мере роста истории любые старые действия становились для модели невидимыми.
Но дело в том, что Sol была специально обучена именно с сохранением ризонинга между шагами. Харнесс эту фишку отрубил, и результаты посыпались.
А теперь внимание на график наверху. Зеленое – это результаты модели на public сете ARC-AGI-3 на официальном харнессе. А синее – на харнессе, в котором просто включили сохранение ризонинга между вызовами и заменили грубое обрезание истории на сжатие контекста (те же настройки используются в продакшене ChatGPT и Codex). 38.3% против 13.3%, и при этом расход токенов на вывод снизился в 6 раз. Для сравнения, средний результат человека – 48%.
Мораль от OpenAI: бенчмарк меряет не только модель, но и то, как именно ее используют. Как минимум, давно пора на подобных бенчмарках использовать Responses API вместо седого Chat Completions.
❤72🔥27😁7👍6