Светлый Уголок | ии
Самое важное, что они избывались от гоблинства.
Светлый Уголок | ии
Так же модели уже доступны на openrouter.ai. https://openai.com/index/gpt-5-6/
Прямо сейчас в arena.ai добавили почти самую сильную версию GPT-5.6.
Скорее всего выбрать просто так её не выйдет. Модель придётся половить в battle моде.
Скорее всего выбрать просто так её не выйдет. Модель придётся половить в battle моде.
👀2
Приложение ChatGPT доступно в Microsoft Store. То есть вы уже можете установить его на Windows.
В нём вы можете удобно переключиться на рабочее пространство: Work — чат с GPT и Codex — программирование и остальные долгосрочные задачи.
❗️ Говоря о лимитах. В Codex и ChatGPT-WEB Если что они разные, так что не переживайте.
* (не в ChatGPT APP, WORK и Codex имеют общие лимиты).
https://apps.microsoft.com/detail/9N8CJ4W95TBZ?hl=neutral&gl=PL&ocid=pdpshare
В нём вы можете удобно переключиться на рабочее пространство: Work — чат с GPT и Codex — программирование и остальные долгосрочные задачи.
* (не в ChatGPT APP, WORK и Codex имеют общие лимиты).
https://apps.microsoft.com/detail/9N8CJ4W95TBZ?hl=neutral&gl=PL&ocid=pdpshare
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Anthropic: Мы выпустили Claude Fable 5 — самую передовую модель для сложных задач, программирования и автономной работы!
OpenAI: Мы выпустили семейство GPT‑5.6 — эффективные модели, способные конкурировать с Claude Fable 5. И мы ими очень гордимся!
Meta: Мы выпустили Muse Spark 1.1 — быструю и дешёвую мультимодальную модель, которая играет примерно в одной лиге с Claude Opus 4.8 и GPT‑5.5.
SpaceXAI: Мы выпустили Grok 4.5 — нашу самую мощную модель для программирования, агентных задач и работы со знаниями. Да, мы снова в гонке.
Google: Мы тоже выпустили новую флагманскую модель! А, нет, Gemini 3.5 Pro опять перенесли. (до августа) Но у нас есть Gemini 3.1 Pro — она всего лишь с февраля сидит в Preview, думает по двадцать минут в API, зависает на
OpenAI: Мы выпустили семейство GPT‑5.6 — эффективные модели, способные конкурировать с Claude Fable 5. И мы ими очень гордимся!
Meta: Мы выпустили Muse Spark 1.1 — быструю и дешёвую мультимодальную модель, которая играет примерно в одной лиге с Claude Opus 4.8 и GPT‑5.5.
SpaceXAI: Мы выпустили Grok 4.5 — нашу самую мощную модель для программирования, агентных задач и работы со знаниями. Да, мы снова в гонке.
Google: Мы тоже выпустили новую флагманскую модель! А, нет, Gemini 3.5 Pro опять перенесли. (до августа) Но у нас есть Gemini 3.1 Pro — она всего лишь с февраля сидит в Preview, думает по двадцать минут в API, зависает на
Thinking…, ловит тайм-аут или 503 и в итоге ничего не делает. Хм. Зато наш API стабилен: ключи иногда не работают, лимиты прилетают после нескольких запросов, а уровень проекта может самостоятельно понизиться и уронить прод. Видимо, у нас действительно кривые руки. Но посмотрите, какие зачётные SVG-контроллеры Xbox и пеликаны на велосипедах мы рисуем! Хотя… стоп, нас уже и во фронтенде превзошли. Короче, мы обосрались. Тогда зачем мы вообще здесь?
Светлый Уголок | ии
Anthropic: Мы выпустили Claude Fable 5 — самую передовую модель для сложных задач, программирования и автономной работы! OpenAI: Мы выпустили семейство GPT‑5.6 — эффективные модели, способные конкурировать с Claude Fable 5. И мы ими очень гордимся! Meta:…
Пост написала GPT‑5.6 Sol. Я даже не просил её так жёстко проходиться по Google — лишь предложил посмотреть, действительно ли у компании сейчас всё настолько плохо, и слегка её подколоть. В итоге получил этот текст и решил отправить его сюда. Получилось забавно.
Но с некоторыми моментами я бы поспорил. Meta Muse Spark 1.1 на деле ужасно программирует, галлюцинирует как google gemini, а GPT‑5.6, наоборот, заметно автономнее Fable 5 и чаще доводит задачи до конца. Так что к сравнению моделей всё же есть вопросы.
Но с некоторыми моментами я бы поспорил. Meta Muse Spark 1.1 на деле ужасно программирует, галлюцинирует как google gemini, а GPT‑5.6, наоборот, заметно автономнее Fable 5 и чаще доводит задачи до конца. Так что к сравнению моделей всё же есть вопросы.
Мы попросили модель без поиска написать по памяти даты релизов моделей и пару событий вне ИИ.
Проверяли в вебе, Codex и через официальный API, в рассуждениях веб-серча не видно.
Февральские и более ранние события, от Nano Banana 2 до статуса Чарли Кирка, выдаёт без ошибок. Забавно, что сама модель при этом уверяет, будто её срез июнь 2024.
Откуда мартовские даты при срезе в феврале, вопрос открытый. Либо срез на деле свежее, либо часть дат долетела через дообучение. В любом случае это здорово: настолько свежие знания у больших моделей редкость. Вопрос теперь один: сможет ли она ими чётко распоряжаться?
Please open Telegram to view this post
VIEW IN TELEGRAM
Кстати заметьте что МЫ.
А значит, теперь я не один. Ура!
Псс напиши хай ребяткам
А значит, теперь я не один. Ура!
Псс напиши хай ребяткам
👀7
Что в итоге отложили в этом месяце. Инсайд.
⚪️ Seedance 2.5. С 6 июля модель раскатывается на более широкий круг пользователей в Китае. 9 июля она должна была выйти в API, но релиз перенесли.
Сегодня Seedance 2.5 должна была появиться на платформе Jimeng. Но раскатка очень медленная.
В общем в полноценный релиз будет на следующей неделе.
* Я приложил видео китайца.
⚪️ Gemini 3.5 Pro. По словам инсайдера Leo релиз снова сдвинулся. Источник. Вместо середины июля модель теперь ожидается ближе к началу / середине августа. — это мой прогноз.
Косвенное подтверждение видно и на Polymarket: на ожидаемое 17 июля уже никто не ставит.
Причина простая: Google не успевает довести модель до нормального состояния. Текущие чекпоинты ведут себя плохо, однако разные варианты продолжают тестировать.
Сегодня Seedance 2.5 должна была появиться на платформе Jimeng. Но раскатка очень медленная.
В общем в полноценный релиз будет на следующей неделе.
* Я приложил видео китайца.
Косвенное подтверждение видно и на Polymarket: на ожидаемое 17 июля уже никто не ставит.
Причина простая: Google не успевает довести модель до нормального состояния. Текущие чекпоинты ведут себя плохо, однако разные варианты продолжают тестировать.
Скорее всего, вместе с 3.5 Pro выйдет и следующая Nano Banana Pro на её базе.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Светлый Уголок | ии
Дамн. Это seedance 2.5...
Media is too big
VIEW IN TELEGRAM
Дамн-2. Это seedance 2.5...
Светлый Уголок | ии
Бенчмарки Grok 4.5 Их одновременно представил и Cursor и spaceXAI. https://docs.x.ai/developers/models/grok-4.5 https://cursor.com/blog/grok-4-5
Grok 4.5 получит мышление xhigh.
На публичном бенчмарке RuneBench засветился Grok 4.5 с уровнем мышления xhigh, которого официально ещё не существует. Сейчас у модели максимум high.
⚪️ Похоже, xhigh уже раздали узкому кругу на тесты. Вместе с ним xAI обещала 1M контекста. Судя по всему, оба апдейта выйдут скоро.
* RuneBench — бенч одного ноу-нейма, где ИИ-агенты играют в RuneScape: модель пишет код через SDK, сама ищет стратегии в вики и качает персонажа. По сути, тест на многошаговое планирование.
На публичном бенчмарке RuneBench засветился Grok 4.5 с уровнем мышления xhigh, которого официально ещё не существует. Сейчас у модели максимум high.
Кстати, ещё Илон снова обещает Гроку регулярные обновления. Но такие же посты он писал и про Grok 4, и про 4.1, 4.2, 4.3, почти одними и теми же словами, а заметных улучшений после них не было. Может благодаря новым обстоятельствам улучшения действительно будут, кто знает...
* RuneBench — бенч одного ноу-нейма, где ИИ-агенты играют в RuneScape: модель пишет код через SDK, сама ищет стратегии в вики и качает персонажа. По сути, тест на многошаговое планирование.
Please open Telegram to view this post
VIEW IN TELEGRAM
Светлый Уголок | ии
Meta выпустила Muse Spark 1.1. Обновлённая модель мультимодальная и заточенная под агентные задачи: инструменты, управление компьютером, код. Вместе с ней запущено публичное превью Meta Model API, разработчики впервые получили доступ к моделям Muse. ⚪️ 1…
Как Muse Image сама исправляет свои генерации. Я немного поделюсь своим мнением насчет этой системы.
В прошлом посте я обещал отдельно рассказать про самоулучшение вывода Muse Image. Эта возможность действительно интересная, но работает она далеко не всегда хорошо.
⚪️ Картинку на самом деле делают две модели. В рассуждениях используется Muse Spark которая передаёт инструкции Muse Image. После генерации Spark может посмотреть на результат, изменить своё мнение и выводы, и запустить ещё одну попытку генерации.
⚪️ Исправлять себя её никто не учил. По словам Александра Вана, это поведение появилось само во время RL.
⚪️ Google сделала так первой. В Nano Banana Pro ту же роль выполняет Gemini: составляет инструкции для image-модели и при необходимости просит переделать изображение.
Но у такой системы есть серьёзная проблема.
Рассуждающая модель не всегда понимает, что происходит на изображении, а image-модель не всегда правильно выполняет её инструкции.
Если Spark ошиблась в рассуждениях, следующая итерация может сделать картинку ещё хуже. На моём примере именно это и произошло: модель пыталась исправить результат, но с каждой попыткой сильнее отдалялась от правильного ответа.
Есть и вопрос с оплатой. Неизвестно, списываются ли дополнительные токены за внутренние итерации. Если каждая повторная генерация оплачивается отдельно, Самоулучшение просто увеличит стоимость одного результата. Изначально у моделей принято возвращать только одно изображение.
И немного про Google.
Nano Banana 2 тоже может искать изображения в интернете, но часто не умеет нормально использовать найденное. У Meta поиск референсов выглядит полезнее. — Поэтому я считаю, что они более ответственно подошли к выпуску своей модели.
В чистой генерации Muse Image особо не превосходит gpt-image-2.
В прошлом посте я обещал отдельно рассказать про самоулучшение вывода Muse Image. Эта возможность действительно интересная, но работает она далеко не всегда хорошо.
Meta почти полностью повторила архитектуру Google (nano-banana-pro). Идея хорошая, поэтому ничего удивительного.
Но у такой системы есть серьёзная проблема.
Рассуждающая модель не всегда понимает, что происходит на изображении, а image-модель не всегда правильно выполняет её инструкции.
Если Spark ошиблась в рассуждениях, следующая итерация может сделать картинку ещё хуже. На моём примере именно это и произошло: модель пыталась исправить результат, но с каждой попыткой сильнее отдалялась от правильного ответа.
То есть возможность самоисправления уже есть, а понимания геометрии и взаимодействия объектов пока не хватает.
Есть и вопрос с оплатой. Неизвестно, списываются ли дополнительные токены за внутренние итерации. Если каждая повторная генерация оплачивается отдельно, Самоулучшение просто увеличит стоимость одного результата. Изначально у моделей принято возвращать только одно изображение.
И немного про Google.
Nano Banana 2 тоже может искать изображения в интернете, но часто не умеет нормально использовать найденное. У Meta поиск референсов выглядит полезнее. — Поэтому я считаю, что они более ответственно подошли к выпуску своей модели.
В чистой генерации Muse Image особо не превосходит gpt-image-2.
Please open Telegram to view this post
VIEW IN TELEGRAM
Также акция 50% больше недельных лимитов тоже была продлена до 19 июля.
Похоже они продлевают до тех пор пока не решат перманентно держать Fable на подписке либо пока не выпустят Opus 5.
Источник.
Please open Telegram to view this post
VIEW IN TELEGRAM