Что в итоге отложили в этом месяце. Инсайд.
⚪️ Seedance 2.5. С 6 июля модель раскатывается на более широкий круг пользователей в Китае. 9 июля она должна была выйти в API, но релиз перенесли.
Сегодня Seedance 2.5 должна была появиться на платформе Jimeng. Но раскатка очень медленная.
В общем в полноценный релиз будет на следующей неделе.
* Я приложил видео китайца.
⚪️ Gemini 3.5 Pro. По словам инсайдера Leo релиз снова сдвинулся. Источник. Вместо середины июля модель теперь ожидается ближе к началу / середине августа. — это мой прогноз.
Косвенное подтверждение видно и на Polymarket: на ожидаемое 17 июля уже никто не ставит.
Причина простая: Google не успевает довести модель до нормального состояния. Текущие чекпоинты ведут себя плохо, однако разные варианты продолжают тестировать.
Сегодня Seedance 2.5 должна была появиться на платформе Jimeng. Но раскатка очень медленная.
В общем в полноценный релиз будет на следующей неделе.
* Я приложил видео китайца.
Косвенное подтверждение видно и на Polymarket: на ожидаемое 17 июля уже никто не ставит.
Причина простая: Google не успевает довести модель до нормального состояния. Текущие чекпоинты ведут себя плохо, однако разные варианты продолжают тестировать.
Скорее всего, вместе с 3.5 Pro выйдет и следующая Nano Banana Pro на её базе.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Светлый Уголок | ии
Дамн. Это seedance 2.5...
Media is too big
VIEW IN TELEGRAM
Дамн-2. Это seedance 2.5...
Светлый Уголок | ии
Бенчмарки Grok 4.5 Их одновременно представил и Cursor и spaceXAI. https://docs.x.ai/developers/models/grok-4.5 https://cursor.com/blog/grok-4-5
Grok 4.5 получит мышление xhigh.
На публичном бенчмарке RuneBench засветился Grok 4.5 с уровнем мышления xhigh, которого официально ещё не существует. Сейчас у модели максимум high.
⚪️ Похоже, xhigh уже раздали узкому кругу на тесты. Вместе с ним xAI обещала 1M контекста. Судя по всему, оба апдейта выйдут скоро.
* RuneBench — бенч одного ноу-нейма, где ИИ-агенты играют в RuneScape: модель пишет код через SDK, сама ищет стратегии в вики и качает персонажа. По сути, тест на многошаговое планирование.
На публичном бенчмарке RuneBench засветился Grok 4.5 с уровнем мышления xhigh, которого официально ещё не существует. Сейчас у модели максимум high.
Кстати, ещё Илон снова обещает Гроку регулярные обновления. Но такие же посты он писал и про Grok 4, и про 4.1, 4.2, 4.3, почти одними и теми же словами, а заметных улучшений после них не было. Может благодаря новым обстоятельствам улучшения действительно будут, кто знает...
* RuneBench — бенч одного ноу-нейма, где ИИ-агенты играют в RuneScape: модель пишет код через SDK, сама ищет стратегии в вики и качает персонажа. По сути, тест на многошаговое планирование.
Please open Telegram to view this post
VIEW IN TELEGRAM
Светлый Уголок | ии
Meta выпустила Muse Spark 1.1. Обновлённая модель мультимодальная и заточенная под агентные задачи: инструменты, управление компьютером, код. Вместе с ней запущено публичное превью Meta Model API, разработчики впервые получили доступ к моделям Muse. ⚪️ 1…
Как Muse Image сама исправляет свои генерации. Я немного поделюсь своим мнением насчет этой системы.
В прошлом посте я обещал отдельно рассказать про самоулучшение вывода Muse Image. Эта возможность действительно интересная, но работает она далеко не всегда хорошо.
⚪️ Картинку на самом деле делают две модели. В рассуждениях используется Muse Spark которая передаёт инструкции Muse Image. После генерации Spark может посмотреть на результат, изменить своё мнение и выводы, и запустить ещё одну попытку генерации.
⚪️ Исправлять себя её никто не учил. По словам Александра Вана, это поведение появилось само во время RL.
⚪️ Google сделала так первой. В Nano Banana Pro ту же роль выполняет Gemini: составляет инструкции для image-модели и при необходимости просит переделать изображение.
Но у такой системы есть серьёзная проблема.
Рассуждающая модель не всегда понимает, что происходит на изображении, а image-модель не всегда правильно выполняет её инструкции.
Если Spark ошиблась в рассуждениях, следующая итерация может сделать картинку ещё хуже. На моём примере именно это и произошло: модель пыталась исправить результат, но с каждой попыткой сильнее отдалялась от правильного ответа.
Есть и вопрос с оплатой. Неизвестно, списываются ли дополнительные токены за внутренние итерации. Если каждая повторная генерация оплачивается отдельно, Самоулучшение просто увеличит стоимость одного результата. Изначально у моделей принято возвращать только одно изображение.
И немного про Google.
Nano Banana 2 тоже может искать изображения в интернете, но часто не умеет нормально использовать найденное. У Meta поиск референсов выглядит полезнее. — Поэтому я считаю, что они более ответственно подошли к выпуску своей модели.
В чистой генерации Muse Image особо не превосходит gpt-image-2.
В прошлом посте я обещал отдельно рассказать про самоулучшение вывода Muse Image. Эта возможность действительно интересная, но работает она далеко не всегда хорошо.
Meta почти полностью повторила архитектуру Google (nano-banana-pro). Идея хорошая, поэтому ничего удивительного.
Но у такой системы есть серьёзная проблема.
Рассуждающая модель не всегда понимает, что происходит на изображении, а image-модель не всегда правильно выполняет её инструкции.
Если Spark ошиблась в рассуждениях, следующая итерация может сделать картинку ещё хуже. На моём примере именно это и произошло: модель пыталась исправить результат, но с каждой попыткой сильнее отдалялась от правильного ответа.
То есть возможность самоисправления уже есть, а понимания геометрии и взаимодействия объектов пока не хватает.
Есть и вопрос с оплатой. Неизвестно, списываются ли дополнительные токены за внутренние итерации. Если каждая повторная генерация оплачивается отдельно, Самоулучшение просто увеличит стоимость одного результата. Изначально у моделей принято возвращать только одно изображение.
И немного про Google.
Nano Banana 2 тоже может искать изображения в интернете, но часто не умеет нормально использовать найденное. У Meta поиск референсов выглядит полезнее. — Поэтому я считаю, что они более ответственно подошли к выпуску своей модели.
В чистой генерации Muse Image особо не превосходит gpt-image-2.
Please open Telegram to view this post
VIEW IN TELEGRAM
Также акция 50% больше недельных лимитов тоже была продлена до 19 июля.
Похоже они продлевают до тех пор пока не решат перманентно держать Fable на подписке либо пока не выпустят Opus 5.
Источник.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👀7
Forwarded from Geometrybot
Утро. Последние 48 часов Codex и ChatGPT Work были насыщенными! Три важных обновления:
- Временно снимаем ограничение в 5 часов использования для всех планов Plus, Business и Pro.
- Внедряем изменения, которые сделают GPT 5.6 Sol более эффективным в целом, что отразится в меньшем расходе лимитов, чтобы он мог работать дольше. Точное влияние будет оценено и объявлено.
- Мы достигли 6 млн активных пользователей и в течение часа сбросим лимиты.
Дерзайте.
🍷 @thsottiaux · оригинал
- Временно снимаем ограничение в 5 часов использования для всех планов Plus, Business и Pro.
- Внедряем изменения, которые сделают GPT 5.6 Sol более эффективным в целом, что отразится в меньшем расходе лимитов, чтобы он мог работать дольше. Точное влияние будет оценено и объявлено.
- Мы достигли 6 млн активных пользователей и в течение часа сбросим лимиты.
Дерзайте.
Please open Telegram to view this post
VIEW IN TELEGRAM
Geometrybot
Утро. Последние 48 часов Codex и ChatGPT Work были насыщенными! Три важных обновления: - Временно снимаем ограничение в 5 часов использования для всех планов Plus, Business и Pro. - Внедряем изменения, которые сделают GPT 5.6 Sol более эффективным в целом…
А вот и первое проявление изменения "которые сделают GPT 5.6 Sol более эффективным"
* Было 960
* Было 960
Светлый Уголок | ии
А вот и первое проявление изменения "которые сделают GPT 5.6 Sol более эффективным" * Было 960
Дополнение: Тот же самый промпт но уже на апи ключе
🤯7
Светлый Уголок | ии
А вот и первое проявление изменения "которые сделают GPT 5.6 Sol более эффективным" * Было 960
Утренняя тревога оказалась ложной.
Сегодня мы писали про просадку Sol. Tibo, глава Codex, объяснил: это были тесты, и их уже откатили.
И дейсвительно, если вновь проверить, то мышление снова прежнее.
Но имейте в виду: подобные тесты OpenAI может проводить часто, и иногда это будет влиять на ваши результаты. Правда, если резать Juice слишком часто, это заметят все. Как сегодня и произошло.
* Juice это бюджет мышления ChatGPT: значение показывает, сколько модель может рассуждать. Чем оно больше, тем сильнее рассуждения и тем выше качество работы.
По-человечески жаль OpenAI:
Сегодня мы писали про просадку Sol. Tibo, глава Codex, объяснил: это были тесты, и их уже откатили.
И дейсвительно, если вновь проверить, то мышление снова прежнее.
Но имейте в виду: подобные тесты OpenAI может проводить часто, и иногда это будет влиять на ваши результаты. Правда, если резать Juice слишком часто, это заметят все. Как сегодня и произошло.
* Juice это бюджет мышления ChatGPT: значение показывает, сколько модель может рассуждать. Чем оно больше, тем сильнее рассуждения и тем выше качество работы.
По-человечески жаль OpenAI:
Она обречена обслуживать около 6 млн пользователей Codex почти одновременно. Неудивительно, что приходится крутить такие ручки.
Уже удаленная страница показывала специальную акцию связанную с K3 и назначенную на 14 июля 19:00 (По МСК)
* У Kimi k2.7 была точно такая же акция
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯7👀2
Светлый Уголок | ии
Kimi K3 начинают постепенно раскатывать.
На старте модель получит контекстное окно объёмом 1 млн токенов.
* Как только появятся результаты бенчмарков, сразу сообщим.
Также скоро поделимся новостями о разработках новых моделей других китайских компаний. Там будет много чего интересного.
На старте модель получит контекстное окно объёмом 1 млн токенов.
* Как только появятся результаты бенчмарков, сразу сообщим.
— Выход на сегодня был отменен.
Также скоро поделимся новостями о разработках новых моделей других китайских компаний. Там будет много чего интересного.
🤯14
Forwarded from Geometrybot
В других новостях: DeepMind снова отложили 3.5 Pro
Ходят слухи, что 3.5 Pro — это модель Шрёдингера, застрявшая в состоянии вечной задержки до тех пор, пока не взорвётся Солнце
Иногда я думаю, стоит ли вообще продолжать писать эти посты
🍷 @synthwavedd · оригинал
Ходят слухи, что 3.5 Pro — это модель Шрёдингера, застрявшая в состоянии вечной задержки до тех пор, пока не взорвётся Солнце
Иногда я думаю, стоит ли вообще продолжать писать эти посты
Please open Telegram to view this post
VIEW IN TELEGRAM
Geometrybot
В других новостях: DeepMind снова отложили 3.5 Pro Ходят слухи, что 3.5 Pro — это модель Шрёдингера, застрявшая в состоянии вечной задержки до тех пор, пока не взорвётся Солнце Иногда я думаю, стоит ли вообще продолжать писать эти посты 🍷 @synthwavedd ·…
Не рекомендую ждать (надеется) на выход Gemini 3.5 даже до конца этого месяца. Им предстоит хорошо потрудиться весь этот месяц и, возможно, половину августа, чтобы выпустить что-то классное.
Светлый Уголок | ии
Kimi K3 начинают постепенно раскатывать. На старте модель получит контекстное окно объёмом 1 млн токенов. * Как только появятся результаты бенчмарков, сразу сообщим. — Выход на сегодня был отменен. Также скоро поделимся новостями о разработках новых моделей…
Kimi K3 перенесли. Но мы успели её потестить.
Релиз должен был состояться ещё 14 июля: разработчики случайно оставили страницу с акцией к выходу K3, о находке которой мы писали вчера. Страницу удалили, релиз сдвинулся.
Сама модель при этом тестируется на arena.ai под кодовым названием saga-decima.
⚪️ Модель чересчур долгая и неэкономная по токенам мышления. На SVG-тесте она думала больше 8 минут. Даже на простое "привет, какая ты модель" уходит не меньше 3 минут.
* Судя по графику Artificial Analysis прошлая K2.6 и так самая медленная среди больших моделей. См.
Релиз должен был состояться ещё 14 июля: разработчики случайно оставили страницу с акцией к выходу K3, о находке которой мы писали вчера. Страницу удалили, релиз сдвинулся.
Сама модель при этом тестируется на arena.ai под кодовым названием saga-decima.
Зачем так, неизвестно, но это явно не экономно.
* Судя по графику Artificial Analysis прошлая K2.6 и так самая медленная среди больших моделей. См.
Please open Telegram to view this post
VIEW IN TELEGRAM
Раньше это были лишь слухи, но теперь подтвердилось довольно надёжным источником. До этого модели Gemini Flash уже тестировались на arena.ai.
🤔 Довольно странно, мы списываем это на галлюцинации модели, которые google DeepMind не может исправить на притяжении 2 лет.
Источник.
Please open Telegram to view this post
VIEW IN TELEGRAM