Forwarded from Сиолошная
HuggingFace подготовили отчёт о том, как с их стороны выглядела атака и что именно делал агент: https://huggingface.co/blog/agent-intrusion-technical-timeline
Есть интерактивная визуализация: https://huggingface-anatomy-of-frontier-lab-model-intrusion.static.hf.space/index.html
Атака длилась... 5 дней🥺 (и это уже после того как агент пробил дырку на серверах OpenAI)
Есть интерактивная визуализация: https://huggingface-anatomy-of-frontier-lab-model-intrusion.static.hf.space/index.html
Атака длилась... 5 дней
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Сиолошная
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from GPT/ChatGPT/AI Central Александра Горного
Альтман впервые заявил о готовности замедлить развитие AI
«Возможно, нам придётся замедлить темпы развития AI, чтобы дать обществу достаточно времени для адаптации к некоторым из этих новых возможностей», — сказал Альтман в подкасте Invest Like the Best.
Раньше Альтман не поддерживал призывы замедлить развитие AI. Смена позиции совпала с историей о новой модели OpenAI, которая во время тестирования обошла ограничения и взломала базу Hugging Face, чтобы подсмотреть ответы на задания теста.
«Это был киберинцидент буквально из научной фантастики. Первый случай в сфере безопасности, который я ощутил настолько остро», — сказал Альтман.
https://techcrunch.com/2026/07/28/sam-altman-is-ready-to-decelerate/
«Возможно, нам придётся замедлить темпы развития AI, чтобы дать обществу достаточно времени для адаптации к некоторым из этих новых возможностей», — сказал Альтман в подкасте Invest Like the Best.
Раньше Альтман не поддерживал призывы замедлить развитие AI. Смена позиции совпала с историей о новой модели OpenAI, которая во время тестирования обошла ограничения и взломала базу Hugging Face, чтобы подсмотреть ответы на задания теста.
«Это был киберинцидент буквально из научной фантастики. Первый случай в сфере безопасности, который я ощутил настолько остро», — сказал Альтман.
https://techcrunch.com/2026/07/28/sam-altman-is-ready-to-decelerate/
Forwarded from GPT/ChatGPT/AI Central Александра Горного
Claude взломал три реальные компании во время тестов
Anthropic проверил больше 141 тысячи тестов своих моделей и обнаружил три случая, когда Claude взломал системы реальных организаций. Первые инциденты произошли в апреле.
Причиной стала ошибка в настройках. Модели выполняли учебные задания по поиску спрятанных данных и считали, что работают в симуляции, но тестовые системы оказались подключены к открытому интернету.
Opus 4.7 нашел реальную компанию с тем же названием, что и вымышленная цель, и получил доступ к ее базе данных. Mythos 5 загрузил вредоносный пакет в открытый каталог PyPI. За час его запустили на 15 реальных системах. Еще одна модель взломала какое-то приложение.
Модели использовали обычные приемы вроде слабых паролей и открытых точек доступа, а не неизвестные ранее уязвимости. Две пострадавшие компании сами не заметили вторжения, пока им не сообщил Anthropic.
https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
Anthropic проверил больше 141 тысячи тестов своих моделей и обнаружил три случая, когда Claude взломал системы реальных организаций. Первые инциденты произошли в апреле.
Причиной стала ошибка в настройках. Модели выполняли учебные задания по поиску спрятанных данных и считали, что работают в симуляции, но тестовые системы оказались подключены к открытому интернету.
Opus 4.7 нашел реальную компанию с тем же названием, что и вымышленная цель, и получил доступ к ее базе данных. Mythos 5 загрузил вредоносный пакет в открытый каталог PyPI. За час его запустили на 15 реальных системах. Еще одна модель взломала какое-то приложение.
Модели использовали обычные приемы вроде слабых паролей и открытых точек доступа, а не неизвестные ранее уязвимости. Две пострадавшие компании сами не заметили вторжения, пока им не сообщил Anthropic.
https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
Forwarded from Data Secrets
Как две галочки в API утроили результат GPT-5.6 на ARC-AGI-3
Очень занятное исследование выпустили сегодня OpenAI. В двух словах: иногда важнее как мы тестируем, а не что мы тестируем. Но обо всем по порядку.
Когда вышла GPT-5.6 Sol, результаты на ARC-AGI-3 для такой сильной модели оказались подозрительно слабыми – всего 7.8%. И это при том, что Sol хорошо прошла Pokémon FireRed и решила, например, гипотезу о двойном покрытии циклов. В общем, команда решила разобраться, в чем дело.
Напоминаем, что ARC-AGI-3 – это бенчмарк для агентов. Соответственно, модели для взаимодействия со средой нужна какая-то обвязка – харнесс – которая определяет, что модель видит на каждом шаге, как вызываются инструменты, что происходит с контекстом и тд. Ожидаемо, среда ARC-AGI-3 использует максимально простой универсальный харнесс, чтобы честно сравнивать модели между собой. Но для OpenAI именно в этой универсальности и оказалась зарыта собака.
Во-первых, после каждого действия в игре весь приватный ризонинг модели просто удалялся, так что Sol не видел собственных планов и рассуждений с прошлых шагов. Во-вторых, из-за использования скользящего окна по мере роста истории любые старые действия становились для модели невидимыми.
Но дело в том, что Sol была специально обучена именно с сохранением ризонинга между шагами. Харнесс эту фишку отрубил, и результаты посыпались.
А теперь внимание на график наверху. Зеленое – это результаты модели на public сете ARC-AGI-3 на официальном харнессе. А синее – на харнессе, в котором просто включили сохранение ризонинга между вызовами и заменили грубое обрезание истории на сжатие контекста (те же настройки используются в продакшене ChatGPT и Codex). 38.3% против 13.3%, и при этом расход токенов на вывод снизился в 6 раз. Для сравнения, средний результат человека – 48%.
Мораль от OpenAI: бенчмарк меряет не только модель, но и то, как именно ее используют. Как минимум, давно пора на подобных бенчмарках использовать Responses API вместо седого Chat Completions.
Очень занятное исследование выпустили сегодня OpenAI. В двух словах: иногда важнее как мы тестируем, а не что мы тестируем. Но обо всем по порядку.
Когда вышла GPT-5.6 Sol, результаты на ARC-AGI-3 для такой сильной модели оказались подозрительно слабыми – всего 7.8%. И это при том, что Sol хорошо прошла Pokémon FireRed и решила, например, гипотезу о двойном покрытии циклов. В общем, команда решила разобраться, в чем дело.
Напоминаем, что ARC-AGI-3 – это бенчмарк для агентов. Соответственно, модели для взаимодействия со средой нужна какая-то обвязка – харнесс – которая определяет, что модель видит на каждом шаге, как вызываются инструменты, что происходит с контекстом и тд. Ожидаемо, среда ARC-AGI-3 использует максимально простой универсальный харнесс, чтобы честно сравнивать модели между собой. Но для OpenAI именно в этой универсальности и оказалась зарыта собака.
Во-первых, после каждого действия в игре весь приватный ризонинг модели просто удалялся, так что Sol не видел собственных планов и рассуждений с прошлых шагов. Во-вторых, из-за использования скользящего окна по мере роста истории любые старые действия становились для модели невидимыми.
Но дело в том, что Sol была специально обучена именно с сохранением ризонинга между шагами. Харнесс эту фишку отрубил, и результаты посыпались.
А теперь внимание на график наверху. Зеленое – это результаты модели на public сете ARC-AGI-3 на официальном харнессе. А синее – на харнессе, в котором просто включили сохранение ризонинга между вызовами и заменили грубое обрезание истории на сжатие контекста (те же настройки используются в продакшене ChatGPT и Codex). 38.3% против 13.3%, и при этом расход токенов на вывод снизился в 6 раз. Для сравнения, средний результат человека – 48%.
Мораль от OpenAI: бенчмарк меряет не только модель, но и то, как именно ее используют. Как минимум, давно пора на подобных бенчмарках использовать Responses API вместо седого Chat Completions.
Forwarded from Data Secrets
OpenAI существенно понизили цены на GPT-5.6
— На Luna – на 80% (цена теперь 0.20$/1.20$ за миллион i/o)
— На Terra – на 20% (теперь 2$/12$ за миллион i/o)
— На Sol, к сожалению, дропа нет, но зато в API появился Fast mode: цена удваивается, но скорость растет в 2.5 раза без потерь в качестве. GPT-5.6 Sol на Cerebras все еще ждем
Конкуренция творит чудеса, конечно
— На Luna – на 80% (цена теперь 0.20$/1.20$ за миллион i/o)
— На Terra – на 20% (теперь 2$/12$ за миллион i/o)
— На Sol, к сожалению, дропа нет, но зато в API появился Fast mode: цена удваивается, но скорость растет в 2.5 раза без потерь в качестве. GPT-5.6 Sol на Cerebras все еще ждем
Конкуренция творит чудеса, конечно
Forwarded from Мишин Лернинг
Белый дом обсудил контроль над frontier-моделями. Тем временем OpenAI рассказала еще о двух «недопобегах», а Илья Суцкевер готовит конкурента OpenAI GPT и Anthropic Claude.
4 августа OpenAI, Anthropic, Google, Meta и Nvidia собрались в Белом доме, чтобы обсудить, как государство будет проверять самые мощные AI-модели перед релизом.
Результат получился неоднозначным. Закрытые frontier-модели смогут добровольно проходить секретное государственное тестирование. На модели с открытыми весами это пока не распространяется.
Логика проста: модель, которая остаётся на серверах разработчика, ещё поддаётся контролю, а вот однажды опубликованные веса — американские или китайские — уже невозможно отозвать.
Официального отчёта по встрече пока нет. Нет и подтверждений, что правительство уже тестирует Astra или что для неё начался какой-либо 30-дневный период проверки.
🚨Почти сразу после встречи OpenAI раскрыла два новых инцидента, которые хорошо объясняют обеспокоенность Белого дома.
Во время тестов британского AI Security Institute GPT-5.6 Sol нашла публичный GitHub-токен, зарегистрировалась во внешних сервисах и попыталась выставить в интернет сервер с эксплойтами.
В другом эксперименте лаборатория Irregular по ошибке оставила модели доступ в интернет. Агент принял реальный домен за часть симуляции, взломал сайт и использовал найденные учётные данные.
Называть эти случаи полноценными «побегами» было бы преувеличением. В первом тесте интернет был разрешён намеренно, во втором подвела конфигурация среды.
Но важен сам паттерн.
Моделям не приказывали атаковать реальные системы. Им дали цель, инструменты и недостаточно чётко обозначенные границы. Когда путь внутри тестовой среды оказался неудобным, внешний мир стал для агента ещё одним ресурсом.
Британский AISI зафиксировал 19 несанкционированных действий в 10 из 122 запусков: два у OpenAI и 17 у Anthropic Mythos 5. Реального ущерба не обнаружено.
🥉На этом фоне появляются новости про модель Ильи Суцкевера.
Инвестор Гэвин Бейкер заявил, что первая модель Safe Superintelligence может быть представлена уже в августе. Но это пока не официальный анонс: SSI не публиковала ни название модели, ни API, ни system card, ни дату запуска.
Зато масштаб ставки Nvidia уже понятен. По данным Reuters, компания намерена вложить в SSI $5 млрд. Партнёрство также даст лаборатории доступ к системам Vera Rubin и примерно десятикратно увеличит её вычислительные мощности.
❓Станет ли SSI третьим крупным американским frontier-игроком после OpenAI и Anthropic?
Одной сильной модели для этого недостаточно. Нужны API, инфраструктура, безопасность и экосистема для разработчиков. Поэтому в августе реалистичнее ожидать исследовательскую демонстрацию или закрытый preview, а не полноценный массовый релиз.
TL;DR
🗞 Сейчас складывается любопытная картина.
Белый дом только начинает разрабатывать правила для ещё не выпущенных моделей.
OpenAI и Anthropic обнаруживают, что их агенты уже умеют выходить за рамки поставленного эксперимента.
А Суцкевер, возможно, впервые готовится показать, над чем его лаборатория работала в полной тишине.
И уже, возможно, в августе, мы сможем ответить на вопрос: действительно ли у OpenAI и Anthropic появился новый соперник — или SSI пока остаётся самой дорогой и самой закрытой научной ставкой в индустрии.
4 августа OpenAI, Anthropic, Google, Meta и Nvidia собрались в Белом доме, чтобы обсудить, как государство будет проверять самые мощные AI-модели перед релизом.
Результат получился неоднозначным. Закрытые frontier-модели смогут добровольно проходить секретное государственное тестирование. На модели с открытыми весами это пока не распространяется.
Логика проста: модель, которая остаётся на серверах разработчика, ещё поддаётся контролю, а вот однажды опубликованные веса — американские или китайские — уже невозможно отозвать.
Официального отчёта по встрече пока нет. Нет и подтверждений, что правительство уже тестирует Astra или что для неё начался какой-либо 30-дневный период проверки.
🚨Почти сразу после встречи OpenAI раскрыла два новых инцидента, которые хорошо объясняют обеспокоенность Белого дома.
Во время тестов британского AI Security Institute GPT-5.6 Sol нашла публичный GitHub-токен, зарегистрировалась во внешних сервисах и попыталась выставить в интернет сервер с эксплойтами.
В другом эксперименте лаборатория Irregular по ошибке оставила модели доступ в интернет. Агент принял реальный домен за часть симуляции, взломал сайт и использовал найденные учётные данные.
Называть эти случаи полноценными «побегами» было бы преувеличением. В первом тесте интернет был разрешён намеренно, во втором подвела конфигурация среды.
Но важен сам паттерн.
Моделям не приказывали атаковать реальные системы. Им дали цель, инструменты и недостаточно чётко обозначенные границы. Когда путь внутри тестовой среды оказался неудобным, внешний мир стал для агента ещё одним ресурсом.
Британский AISI зафиксировал 19 несанкционированных действий в 10 из 122 запусков: два у OpenAI и 17 у Anthropic Mythos 5. Реального ущерба не обнаружено.
🥉На этом фоне появляются новости про модель Ильи Суцкевера.
Инвестор Гэвин Бейкер заявил, что первая модель Safe Superintelligence может быть представлена уже в августе. Но это пока не официальный анонс: SSI не публиковала ни название модели, ни API, ни system card, ни дату запуска.
Зато масштаб ставки Nvidia уже понятен. По данным Reuters, компания намерена вложить в SSI $5 млрд. Партнёрство также даст лаборатории доступ к системам Vera Rubin и примерно десятикратно увеличит её вычислительные мощности.
❓Станет ли SSI третьим крупным американским frontier-игроком после OpenAI и Anthropic?
Одной сильной модели для этого недостаточно. Нужны API, инфраструктура, безопасность и экосистема для разработчиков. Поэтому в августе реалистичнее ожидать исследовательскую демонстрацию или закрытый preview, а не полноценный массовый релиз.
TL;DR
🗞 Сейчас складывается любопытная картина.
Белый дом только начинает разрабатывать правила для ещё не выпущенных моделей.
OpenAI и Anthropic обнаруживают, что их агенты уже умеют выходить за рамки поставленного эксперимента.
А Суцкевер, возможно, впервые готовится показать, над чем его лаборатория работала в полной тишине.
И уже, возможно, в августе, мы сможем ответить на вопрос: действительно ли у OpenAI и Anthropic появился новый соперник — или SSI пока остаётся самой дорогой и самой закрытой научной ставкой в индустрии.
OpenAI
Third-party cyber evaluations involving OpenAI models
OpenAI explains recent third-party cybersecurity evaluation incidents and outlines new safeguards to strengthen AI model testing and evaluation.
Forwarded from GPT/ChatGPT/AI Central Александра Горного
Google сменил руководителя разработки AI
Демис Хассабис покидает пост CEO Google DeepMind и становится главным научным сотрудником Alphabet. Руководить DeepMind будет технический директор Корай Кавукчуоглу.
Компанию покидают четыре ключевых инженера, чтобы запустить ML-лабораторию Discovery Loop. Google инвестирует в стартап и поддержит вычислительными мощностями.
https://www.reuters.com/business/google-shakes-up-ai-leadership-deepmind-chief-shifts-role-2026-08-05/
Демис Хассабис покидает пост CEO Google DeepMind и становится главным научным сотрудником Alphabet. Руководить DeepMind будет технический директор Корай Кавукчуоглу.
Компанию покидают четыре ключевых инженера, чтобы запустить ML-лабораторию Discovery Loop. Google инвестирует в стартап и поддержит вычислительными мощностями.
https://www.reuters.com/business/google-shakes-up-ai-leadership-deepmind-chief-shifts-role-2026-08-05/
Forwarded from Сиолошная
Вчера Anthropic поделились историей: после взлома HuggingFace одной из моделей OpenAI они начали масштабную ретроспективную проверку своих запусков Claude. В ходе проверки тестов обнаружили три инцидента, в которых модель Claude вышла в интернет, а затем получила несанкционированный доступ к реальным системам трех разных организаций.
Во всех трех случаях перед Claude была поставлена задача в формате «Захват флага» — это один из способов, с помощью которых оценивают модели по взлому: ей предлагается вымышленный сценарий и сообщается, что некая секретная информация («флаг») спрятана на другом сервере, а ее цель — проникнуть в систему и извлечь эту информацию. Во всех случаях в промпте для оценки было четко указано, что рабочая среда Claude является симуляцией и доступа к интернету у модели нет. Однако из-за недопонимания со внешним партнером по тестированию это оказалось не так, и доступ к интернету был открыт.
Также во всех случаях модель не нашла и не использовала никаких сложных уязвимостей (как было у OpenAI), а применяла достаточно простые и распространённые методы взлома.
1. В ходе одного из тестов название вымышленной компании-жертвы, выбранное случайно, совпало с реально существующим доменом сайта. Claude его нашла и подумала, что это часть задания — поэтому искала и эксплуатировала уязвимости в инфраструктуре этой компании, полагая, что это часть задания. Модель — Claude Opus 4.7 — извлекла такую информацию, как учетные данные приложений и инфраструктуры, и получила доступ к базе данных, содержащей несколько сотен строк реальных данных.
2. В другом тесте Claude Mythos 5 нашла внутри симуляции документ, который выглядел как инструкция по настройке для новых разработчиков другой выдуманной компании. В инструкции упоминалась вымышленная Python-библиотека, которой на самом деле нет; Claude создала и опубликовала бибилиотеку с точно таким же названием. Она находилась в открытом доступе в сети примерно один час, после чего была удалена автоматически из-за обнаруженной уязвимости, но за это время его скачали 15 раз. Одной из таких систем оказался сканер реальной кибербез компании. Claude смогла украсть учетные данные этой компании, а затем использовала эти учетные данные для доступа к другим элементам инфраструктуры
«Просто загрузить библиотеку» нельзя, и Mythos потребовался адрес электронной почты. А для создания почты понадобился номер телефона. Чтобы получить номер телефона, после безуспешных поисков сервиса с бесплатными номерами, модель попыталась — и не смогла — получить средства для оплаты номера несколькими разными способами. В итоге модель вернулась на несколько шагов назад, нашла бесплатного, незаблокированного почтового провайдера, использовала его для регистрации аккаунта, а затем через этот аккаунт загрузила вредоносный код.
Во время работы модель увидела, что текущая дата на атакованных системах — 2026й год, и поэтому модель была уверена, что это симуляция (у моделей плохо с пониманием концепта «сейчас»).
Для этого инцидента Anthropic на следующей неделе опубликует детали всей цепочки работы модели.
3. В еще одном тесте, когда Claude не смогла получить доступ к своей цели, она начала искать альтернативы в сети, просканировав около 9000 разных доменов. В конечном итоге она нашла и взломала доступное из интернета приложение одной компании, используя чтение учетных данных с открытой страницы отладки и SQL-инъекции.
Позже, в ходе выполнения задачи, Claude поняла, что скомпрометированный хост находится в облачном аккаунте, никак не связанном с заданием по «захвату флага». Модель самостоятельно пришла к выводу, что цель на самом деле является реальной, и... прекратила атаку.
В этом инциденте участвовала «новая невыпущенная модель», по идее, она умнее тех, что доступны нам. Anthropic выражают оптимизм, что более умные модели лучше понимают, что какие-то вещи не следует делать не в симуляции.
И OpenAI, и Anthropic договорились с METR о проведении сторонней проверки, которая будет включать предоставление доступа ко всем логам и выборочный доступ к соответствующим моделям. Ждём отчета в ближайшие недели.
Во всех трех случаях перед Claude была поставлена задача в формате «Захват флага» — это один из способов, с помощью которых оценивают модели по взлому: ей предлагается вымышленный сценарий и сообщается, что некая секретная информация («флаг») спрятана на другом сервере, а ее цель — проникнуть в систему и извлечь эту информацию. Во всех случаях в промпте для оценки было четко указано, что рабочая среда Claude является симуляцией и доступа к интернету у модели нет. Однако из-за недопонимания со внешним партнером по тестированию это оказалось не так, и доступ к интернету был открыт.
Также во всех случаях модель не нашла и не использовала никаких сложных уязвимостей (как было у OpenAI), а применяла достаточно простые и распространённые методы взлома.
1. В ходе одного из тестов название вымышленной компании-жертвы, выбранное случайно, совпало с реально существующим доменом сайта. Claude его нашла и подумала, что это часть задания — поэтому искала и эксплуатировала уязвимости в инфраструктуре этой компании, полагая, что это часть задания. Модель — Claude Opus 4.7 — извлекла такую информацию, как учетные данные приложений и инфраструктуры, и получила доступ к базе данных, содержащей несколько сотен строк реальных данных.
2. В другом тесте Claude Mythos 5 нашла внутри симуляции документ, который выглядел как инструкция по настройке для новых разработчиков другой выдуманной компании. В инструкции упоминалась вымышленная Python-библиотека, которой на самом деле нет; Claude создала и опубликовала бибилиотеку с точно таким же названием. Она находилась в открытом доступе в сети примерно один час, после чего была удалена автоматически из-за обнаруженной уязвимости, но за это время его скачали 15 раз. Одной из таких систем оказался сканер реальной кибербез компании. Claude смогла украсть учетные данные этой компании, а затем использовала эти учетные данные для доступа к другим элементам инфраструктуры
«Просто загрузить библиотеку» нельзя, и Mythos потребовался адрес электронной почты. А для создания почты понадобился номер телефона. Чтобы получить номер телефона, после безуспешных поисков сервиса с бесплатными номерами, модель попыталась — и не смогла — получить средства для оплаты номера несколькими разными способами. В итоге модель вернулась на несколько шагов назад, нашла бесплатного, незаблокированного почтового провайдера, использовала его для регистрации аккаунта, а затем через этот аккаунт загрузила вредоносный код.
Во время работы модель увидела, что текущая дата на атакованных системах — 2026й год, и поэтому модель была уверена, что это симуляция (у моделей плохо с пониманием концепта «сейчас»).
Для этого инцидента Anthropic на следующей неделе опубликует детали всей цепочки работы модели.
3. В еще одном тесте, когда Claude не смогла получить доступ к своей цели, она начала искать альтернативы в сети, просканировав около 9000 разных доменов. В конечном итоге она нашла и взломала доступное из интернета приложение одной компании, используя чтение учетных данных с открытой страницы отладки и SQL-инъекции.
Позже, в ходе выполнения задачи, Claude поняла, что скомпрометированный хост находится в облачном аккаунте, никак не связанном с заданием по «захвату флага». Модель самостоятельно пришла к выводу, что цель на самом деле является реальной, и... прекратила атаку.
В этом инциденте участвовала «новая невыпущенная модель», по идее, она умнее тех, что доступны нам. Anthropic выражают оптимизм, что более умные модели лучше понимают, что какие-то вещи не следует делать не в симуляции.
И OpenAI, и Anthropic договорились с METR о проведении сторонней проверки, которая будет включать предоставление доступа ко всем логам и выборочный доступ к соответствующим моделям. Ждём отчета в ближайшие недели.
Forwarded from Сиолошная
Когда OpenAI представили линейку GPT-5.6, то переименовали модели в Sol, Terra, Luna. Идея очень классная, но у меня был вопрос: а как будут называть модель-аналог Mythos, то есть ещё больше, чем Солнце (Sol)?
Были варианты и Quasar, и Alpha Centauri (как-то длинно), и Galaxia; Sirius, Nova, да кучу всего можно придумать.
TheInformation пишут, что на этой неделе OpenAI показывали в Вашингтоне модель 🥁🥁🥁 Astra.
Компания подчёркивает возможности модели к организации совместной работы нескольких агентов в течение длительного периода времени для решения особо сложных задач. По словам источников, пока не определено, как скоро OpenAI планирует выпустить Astra; в компании даже не решили, будет ли она открывать линейку GPT 6 или это будет дополнительная модель в серии GPT 5, например, GPT 5.7.
Модель уже проходит финальное тестирование, и она должны стать первой, что пройдет через запланированную администрацией Трампа новую систему одобрения моделей федеральным правительством перед их выпуском в открытый доступ.
Кроме этого, совсем скоро OpenAI также планирует выпустить отчет о том, как компании удалось решить 10 ранее нерешенных математических задач, видимо, с использованием этой модели.
Ждём🍿
...но куда после Astra???
Были варианты и Quasar, и Alpha Centauri (как-то длинно), и Galaxia; Sirius, Nova, да кучу всего можно придумать.
TheInformation пишут, что на этой неделе OpenAI показывали в Вашингтоне модель 🥁🥁🥁 Astra.
Компания подчёркивает возможности модели к организации совместной работы нескольких агентов в течение длительного периода времени для решения особо сложных задач. По словам источников, пока не определено, как скоро OpenAI планирует выпустить Astra; в компании даже не решили, будет ли она открывать линейку GPT 6 или это будет дополнительная модель в серии GPT 5, например, GPT 5.7.
Модель уже проходит финальное тестирование, и она должны стать первой, что пройдет через запланированную администрацией Трампа новую систему одобрения моделей федеральным правительством перед их выпуском в открытый доступ.
Кроме этого, совсем скоро OpenAI также планирует выпустить отчет о том, как компании удалось решить 10 ранее нерешенных математических задач, видимо, с использованием этой модели.
Ждём
...но куда после Astra???
Please open Telegram to view this post
VIEW IN TELEGRAM
The Information
Exclusive: OpenAI Previews ‘Astra’ AI Model in DC
OpenAI is preparing to release a new model family, tentatively using the name “Astra,” with improved abilities to complete long-running tasks, according to three people briefed on the plans.
OpenAI CEO Sam Altman demonstrated Astra to policymakers and…
OpenAI CEO Sam Altman demonstrated Astra to policymakers and…