Светлый Уголок | ии
Стрим с выпуском GPT 5.6 через 25 минут. https://www.youtube.com/watch?v=Wq45rvPGNHs
* По их данным GPT-5.6-Sol опережает другие протестированные модели в новом бенчмарке ARC-AGI-3, набирая целых 7.78% очков.
Три модели: флагман Sol, средняя Terra и дешёвая быстрая Luna. Заточены под агентские задачи, код и долгую профессиональную работу.
Карточка модели
Цена: $5 / $30 за 1M
Контекст: 1M
Источник.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Светлый Уголок | ии
Самое важное, что они избывались от гоблинства.
Светлый Уголок | ии
Так же модели уже доступны на openrouter.ai. https://openai.com/index/gpt-5-6/
Прямо сейчас в arena.ai добавили почти самую сильную версию GPT-5.6.
Скорее всего выбрать просто так её не выйдет. Модель придётся половить в battle моде.
Скорее всего выбрать просто так её не выйдет. Модель придётся половить в battle моде.
👀2
Приложение ChatGPT доступно в Microsoft Store. То есть вы уже можете установить его на Windows.
В нём вы можете удобно переключиться на рабочее пространство: Work — чат с GPT и Codex — программирование и остальные долгосрочные задачи.
❗️ Говоря о лимитах. В Codex и ChatGPT-WEB Если что они разные, так что не переживайте.
* (не в ChatGPT APP, WORK и Codex имеют общие лимиты).
https://apps.microsoft.com/detail/9N8CJ4W95TBZ?hl=neutral&gl=PL&ocid=pdpshare
В нём вы можете удобно переключиться на рабочее пространство: Work — чат с GPT и Codex — программирование и остальные долгосрочные задачи.
* (не в ChatGPT APP, WORK и Codex имеют общие лимиты).
https://apps.microsoft.com/detail/9N8CJ4W95TBZ?hl=neutral&gl=PL&ocid=pdpshare
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Anthropic: Мы выпустили Claude Fable 5 — самую передовую модель для сложных задач, программирования и автономной работы!
OpenAI: Мы выпустили семейство GPT‑5.6 — эффективные модели, способные конкурировать с Claude Fable 5. И мы ими очень гордимся!
Meta: Мы выпустили Muse Spark 1.1 — быструю и дешёвую мультимодальную модель, которая играет примерно в одной лиге с Claude Opus 4.8 и GPT‑5.5.
SpaceXAI: Мы выпустили Grok 4.5 — нашу самую мощную модель для программирования, агентных задач и работы со знаниями. Да, мы снова в гонке.
Google: Мы тоже выпустили новую флагманскую модель! А, нет, Gemini 3.5 Pro опять перенесли. (до августа) Но у нас есть Gemini 3.1 Pro — она всего лишь с февраля сидит в Preview, думает по двадцать минут в API, зависает на
OpenAI: Мы выпустили семейство GPT‑5.6 — эффективные модели, способные конкурировать с Claude Fable 5. И мы ими очень гордимся!
Meta: Мы выпустили Muse Spark 1.1 — быструю и дешёвую мультимодальную модель, которая играет примерно в одной лиге с Claude Opus 4.8 и GPT‑5.5.
SpaceXAI: Мы выпустили Grok 4.5 — нашу самую мощную модель для программирования, агентных задач и работы со знаниями. Да, мы снова в гонке.
Google: Мы тоже выпустили новую флагманскую модель! А, нет, Gemini 3.5 Pro опять перенесли. (до августа) Но у нас есть Gemini 3.1 Pro — она всего лишь с февраля сидит в Preview, думает по двадцать минут в API, зависает на
Thinking…, ловит тайм-аут или 503 и в итоге ничего не делает. Хм. Зато наш API стабилен: ключи иногда не работают, лимиты прилетают после нескольких запросов, а уровень проекта может самостоятельно понизиться и уронить прод. Видимо, у нас действительно кривые руки. Но посмотрите, какие зачётные SVG-контроллеры Xbox и пеликаны на велосипедах мы рисуем! Хотя… стоп, нас уже и во фронтенде превзошли. Короче, мы обосрались. Тогда зачем мы вообще здесь?
Светлый Уголок | ии
Anthropic: Мы выпустили Claude Fable 5 — самую передовую модель для сложных задач, программирования и автономной работы! OpenAI: Мы выпустили семейство GPT‑5.6 — эффективные модели, способные конкурировать с Claude Fable 5. И мы ими очень гордимся! Meta:…
Пост написала GPT‑5.6 Sol. Я даже не просил её так жёстко проходиться по Google — лишь предложил посмотреть, действительно ли у компании сейчас всё настолько плохо, и слегка её подколоть. В итоге получил этот текст и решил отправить его сюда. Получилось забавно.
Но с некоторыми моментами я бы поспорил. Meta Muse Spark 1.1 на деле ужасно программирует, галлюцинирует как google gemini, а GPT‑5.6, наоборот, заметно автономнее Fable 5 и чаще доводит задачи до конца. Так что к сравнению моделей всё же есть вопросы.
Но с некоторыми моментами я бы поспорил. Meta Muse Spark 1.1 на деле ужасно программирует, галлюцинирует как google gemini, а GPT‑5.6, наоборот, заметно автономнее Fable 5 и чаще доводит задачи до конца. Так что к сравнению моделей всё же есть вопросы.
Мы попросили модель без поиска написать по памяти даты релизов моделей и пару событий вне ИИ.
Проверяли в вебе, Codex и через официальный API, в рассуждениях веб-серча не видно.
Февральские и более ранние события, от Nano Banana 2 до статуса Чарли Кирка, выдаёт без ошибок. Забавно, что сама модель при этом уверяет, будто её срез июнь 2024.
Откуда мартовские даты при срезе в феврале, вопрос открытый. Либо срез на деле свежее, либо часть дат долетела через дообучение. В любом случае это здорово: настолько свежие знания у больших моделей редкость. Вопрос теперь один: сможет ли она ими чётко распоряжаться?
Please open Telegram to view this post
VIEW IN TELEGRAM
Кстати заметьте что МЫ.
А значит, теперь я не один. Ура!
Псс напиши хай ребяткам
А значит, теперь я не один. Ура!
Псс напиши хай ребяткам
👀7
Что в итоге отложили в этом месяце. Инсайд.
⚪️ Seedance 2.5. С 6 июля модель раскатывается на более широкий круг пользователей в Китае. 9 июля она должна была выйти в API, но релиз перенесли.
Сегодня Seedance 2.5 должна была появиться на платформе Jimeng. Но раскатка очень медленная.
В общем в полноценный релиз будет на следующей неделе.
* Я приложил видео китайца.
⚪️ Gemini 3.5 Pro. По словам инсайдера Leo релиз снова сдвинулся. Источник. Вместо середины июля модель теперь ожидается ближе к началу / середине августа. — это мой прогноз.
Косвенное подтверждение видно и на Polymarket: на ожидаемое 17 июля уже никто не ставит.
Причина простая: Google не успевает довести модель до нормального состояния. Текущие чекпоинты ведут себя плохо, однако разные варианты продолжают тестировать.
Сегодня Seedance 2.5 должна была появиться на платформе Jimeng. Но раскатка очень медленная.
В общем в полноценный релиз будет на следующей неделе.
* Я приложил видео китайца.
Косвенное подтверждение видно и на Polymarket: на ожидаемое 17 июля уже никто не ставит.
Причина простая: Google не успевает довести модель до нормального состояния. Текущие чекпоинты ведут себя плохо, однако разные варианты продолжают тестировать.
Скорее всего, вместе с 3.5 Pro выйдет и следующая Nano Banana Pro на её базе.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Светлый Уголок | ии
Дамн. Это seedance 2.5...
Media is too big
VIEW IN TELEGRAM
Дамн-2. Это seedance 2.5...
Светлый Уголок | ии
Бенчмарки Grok 4.5 Их одновременно представил и Cursor и spaceXAI. https://docs.x.ai/developers/models/grok-4.5 https://cursor.com/blog/grok-4-5
Grok 4.5 получит мышление xhigh.
На публичном бенчмарке RuneBench засветился Grok 4.5 с уровнем мышления xhigh, которого официально ещё не существует. Сейчас у модели максимум high.
⚪️ Похоже, xhigh уже раздали узкому кругу на тесты. Вместе с ним xAI обещала 1M контекста. Судя по всему, оба апдейта выйдут скоро.
* RuneBench — бенч одного ноу-нейма, где ИИ-агенты играют в RuneScape: модель пишет код через SDK, сама ищет стратегии в вики и качает персонажа. По сути, тест на многошаговое планирование.
На публичном бенчмарке RuneBench засветился Grok 4.5 с уровнем мышления xhigh, которого официально ещё не существует. Сейчас у модели максимум high.
Кстати, ещё Илон снова обещает Гроку регулярные обновления. Но такие же посты он писал и про Grok 4, и про 4.1, 4.2, 4.3, почти одними и теми же словами, а заметных улучшений после них не было. Может благодаря новым обстоятельствам улучшения действительно будут, кто знает...
* RuneBench — бенч одного ноу-нейма, где ИИ-агенты играют в RuneScape: модель пишет код через SDK, сама ищет стратегии в вики и качает персонажа. По сути, тест на многошаговое планирование.
Please open Telegram to view this post
VIEW IN TELEGRAM