🫆 Светлый Уголок | ии
503 subscribers
873 photos
168 videos
10 files
502 links
Тут сначала замечают, потом обсуждают.
AI-инсайды, свежие сигналы, честные мнения и свои инструменты.
Светлый уголок — авторский канал про ИИ без скуки.
Download Telegram
🫆 Светлый Уголок | ии
Anthropic: Мы выпустили Claude Fable 5 — самую передовую модель для сложных задач, программирования и автономной работы! OpenAI: Мы выпустили семейство GPT‑5.6 — эффективные модели, способные конкурировать с Claude Fable 5. И мы ими очень гордимся! Meta:…
Пост написала GPT‑5.6 Sol. Я даже не просил её так жёстко проходиться по Google — лишь предложил посмотреть, действительно ли у компании сейчас всё настолько плохо, и слегка её подколоть. В итоге получил этот текст и решил отправить его сюда. Получилось забавно.

Но с некоторыми моментами я бы поспорил. Meta Muse Spark 1.1 на деле ужасно программирует, галлюцинирует как google gemini, а GPT‑5.6, наоборот, заметно автономнее Fable 5 и чаще доводит задачи до конца. Так что к сравнению моделей всё же есть вопросы.
7👀211
👀 GPT-5.6 помнит события до марта 2026. При официальном срезе знаний февраль 2026.

Мы попросили модель без поиска написать по памяти даты релизов моделей и пару событий вне ИИ.

Проверяли в вебе, Codex и через официальный API, в рассуждениях веб-серча не видно.

⚪️ Модель называет точные даты позже своего среза.
☀️ GPT-5.4 (5 марта 2026);
☀️ GPT-5.3 Instant (3 марта 2026);
Февральские и более ранние события, от Nano Banana 2 до статуса Чарли Кирка, выдаёт без ошибок. Забавно, что сама модель при этом уверяет, будто её срез июнь 2024.

⚪️ Sol выдаёт полный список даже на medium мышлении. Terra и Luna часто ошибаются, но на xhigh отвечают правильно почти так же, как Sol.

⚪️ Но граница всё-таки видна. О Claude Fable 5 она не знает вообще, а про чекпоинты галлюцинирует: выдала, что Kingfall был чекпоинтом Gemini 3, и придумала некий Sovereign.

Откуда мартовские даты при срезе в феврале, вопрос открытый. Либо срез на деле свежее, либо часть дат долетела через дообучение. В любом случае это здорово: настолько свежие знания у больших моделей редкость. Вопрос теперь один: сможет ли она ими чётко распоряжаться?
Please open Telegram to view this post
VIEW IN TELEGRAM
7🤯1
Кстати заметьте что МЫ.
А значит, теперь я не один. Ура!

Псс напиши хай ребяткам
👀7
Всем привет👋
Please open Telegram to view this post
VIEW IN TELEGRAM
721
Что в итоге отложили в этом месяце. Инсайд.

⚪️ Seedance 2.5. С 6 июля модель раскатывается на более широкий круг пользователей в Китае. 9 июля она должна была выйти в API, но релиз перенесли.

Сегодня Seedance 2.5 должна была появиться на платформе Jimeng. Но раскатка очень медленная.
В общем в полноценный релиз будет на следующей неделе.

* Я приложил видео китайца.

⚪️ Gemini 3.5 Pro. По словам инсайдера Leo релиз снова сдвинулся. Источник. Вместо середины июля модель теперь ожидается ближе к началу / середине августа. — это мой прогноз.

Косвенное подтверждение видно и на Polymarket: на ожидаемое 17 июля уже никто не ставит.

Причина простая: Google не успевает довести модель до нормального состояния. Текущие чекпоинты ведут себя плохо, однако разные варианты продолжают тестировать.

Скорее всего, вместе с 3.5 Pro выйдет и следующая Nano Banana Pro на её базе.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
6
🫆 Светлый Уголок | ии
Бенчмарки Grok 4.5 Их одновременно представил и Cursor и spaceXAI. https://docs.x.ai/developers/models/grok-4.5 https://cursor.com/blog/grok-4-5
Grok 4.5 получит мышление xhigh.

На публичном бенчмарке RuneBench засветился Grok 4.5 с уровнем мышления xhigh, которого официально ещё не существует. Сейчас у модели максимум high.

⚪️ Похоже, xhigh уже раздали узкому кругу на тесты. Вместе с ним xAI обещала 1M контекста. Судя по всему, оба апдейта выйдут скоро.

Кстати, ещё Илон снова обещает Гроку регулярные обновления. Но такие же посты он писал и про Grok 4, и про 4.1, 4.2, 4.3, почти одними и теми же словами, а заметных улучшений после них не было. Может благодаря новым обстоятельствам улучшения действительно будут, кто знает...


* RuneBench — бенч одного ноу-нейма, где ИИ-агенты играют в RuneScape: модель пишет код через SDK, сама ищет стратегии в вики и качает персонажа. По сути, тест на многошаговое планирование.
Please open Telegram to view this post
VIEW IN TELEGRAM
6
🫆 Светлый Уголок | ии
Meta выпустила Muse Spark 1.1. Обновлённая модель мультимодальная и заточенная под агентные задачи: инструменты, управление компьютером, код. Вместе с ней запущено публичное превью Meta Model API, разработчики впервые получили доступ к моделям Muse. ⚪️ 1…
Как Muse Image сама исправляет свои генерации. Я немного поделюсь своим мнением насчет этой системы.

В прошлом посте я обещал отдельно рассказать про самоулучшение вывода Muse Image. Эта возможность действительно интересная, но работает она далеко не всегда хорошо.

⚪️ Картинку на самом деле делают две модели. В рассуждениях используется Muse Spark которая передаёт инструкции Muse Image. После генерации Spark может посмотреть на результат, изменить своё мнение и выводы, и запустить ещё одну попытку генерации.

⚪️ Исправлять себя её никто не учил. По словам Александра Вана, это поведение появилось само во время RL.

⚪️ Google сделала так первой. В Nano Banana Pro ту же роль выполняет Gemini: составляет инструкции для image-модели и при необходимости просит переделать изображение.

Meta почти полностью повторила архитектуру Google (nano-banana-pro). Идея хорошая, поэтому ничего удивительного.


Но у такой системы есть серьёзная проблема.

Рассуждающая модель не всегда понимает, что происходит на изображении, а image-модель не всегда правильно выполняет её инструкции.

Если Spark ошиблась в рассуждениях, следующая итерация может сделать картинку ещё хуже. На моём примере именно это и произошло: модель пыталась исправить результат, но с каждой попыткой сильнее отдалялась от правильного ответа.
То есть возможность самоисправления уже есть, а понимания геометрии и взаимодействия объектов пока не хватает.


Есть и вопрос с оплатой. Неизвестно, списываются ли дополнительные токены за внутренние итерации. Если каждая повторная генерация оплачивается отдельно, Самоулучшение просто увеличит стоимость одного результата. Изначально у моделей принято возвращать только одно изображение.

И немного про Google.
Nano Banana 2 тоже может искать изображения в интернете, но часто не умеет нормально использовать найденное. У Meta поиск референсов выглядит полезнее. — Поэтому я считаю, что они более ответственно подошли к выпуску своей модели.

В чистой генерации Muse Image особо не превосходит gpt-image-2.
Please open Telegram to view this post
VIEW IN TELEGRAM
7
❗️ Anthropic опять продлили Fable 5 на подписках до 19 Июля.
Также акция 50% больше недельных лимитов тоже была продлена до 19 июля.
Похоже они продлевают до тех пор пока не решат перманентно держать Fable на подписке либо пока не выпустят Opus 5.

Источник.
Please open Telegram to view this post
VIEW IN TELEGRAM
3👌2
👀Сравнение фронтенда Claude Honeycomb(предположительно Opus 5 или Fable 5.1) и Fable 5.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👀7
Forwarded from Geometrybot
Утро. Последние 48 часов Codex и ChatGPT Work были насыщенными! Три важных обновления:

- Временно снимаем ограничение в 5 часов использования для всех планов Plus, Business и Pro.
- Внедряем изменения, которые сделают GPT 5.6 Sol более эффективным в целом, что отразится в меньшем расходе лимитов, чтобы он мог работать дольше. Точное влияние будет оценено и объявлено.
- Мы достигли 6 млн активных пользователей и в течение часа сбросим лимиты.

Дерзайте.

🍷 @thsottiaux · оригинал
Please open Telegram to view this post
VIEW IN TELEGRAM
6
🫆 Светлый Уголок | ии
А вот и первое проявление изменения "которые сделают GPT 5.6 Sol более эффективным" * Было 960
Утренняя тревога оказалась ложной.

Сегодня мы писали про просадку Sol. Tibo, глава Codex, объяснил: это были тесты, и их уже откатили.

И дейсвительно, если вновь проверить, то мышление снова прежнее.

Но имейте в виду: подобные тесты OpenAI может проводить часто, и иногда это будет влиять на ваши результаты. Правда, если резать Juice слишком часто, это заметят все. Как сегодня и произошло.

* Juice это бюджет мышления ChatGPT: значение показывает, сколько модель может рассуждать. Чем оно больше, тем сильнее рассуждения и тем выше качество работы.

По-человечески жаль OpenAI:
Она обречена обслуживать около 6 млн пользователей Codex почти одновременно. Неудивительно, что приходится крутить такие ручки.
6
👀 Kimi K3 возможно выйдет уже очень скоро

Уже удаленная страница показывала специальную акцию связанную с K3 и назначенную на 14 июля 19:00 (По МСК)

* У Kimi k2.7 была точно такая же акция
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯7👀2
🫆 Светлый Уголок | ии
👀 Kimi K3 возможно выйдет уже очень скоро Уже удаленная страница показывала специальную акцию связанную с K3 и назначенную на 14 июля 19:00 (По МСК) * У Kimi k2.7 была точно такая же акция
Kimi K3 начинают постепенно раскатывать.

На старте модель получит контекстное окно объёмом 1 млн токенов.

* Как только появятся результаты бенчмарков, сразу сообщим
.
— Выход на сегодня был отменен.


Также скоро поделимся новостями о разработках новых моделей других китайских компаний. Там будет много чего интересного.
🤯14