🫆 Светлый Уголок | ии
502 subscribers
874 photos
177 videos
10 files
504 links
Тут сначала замечают, потом обсуждают.
AI-инсайды, свежие сигналы, честные мнения и свои инструменты.
Светлый уголок — авторский канал про ИИ без скуки.
Download Telegram
🫆 Светлый Уголок | ии
Стрим с выпуском GPT 5.6 через 25 минут. https://www.youtube.com/watch?v=Wq45rvPGNHs
💬 OpenAI выпустила семейство GPT-5.6.

* По их данным GPT-5.6-Sol опережает другие протестированные модели в новом бенчмарке ARC-AGI-3, набирая целых 7.78% очков.

Три модели: флагман Sol, средняя Terra и дешёвая быстрая Luna. Заточены под агентские задачи, код и долгую профессиональную работу.

⚪️ Новый режим ultra запускает четырёх параллельных субагентов. Модель разбивает тяжёлую задачу на параллельные потоки и сама собирает результат. Токенов уходит больше, зато ответ приходит быстрее и точнее. Появился и режим max: ещё больше времени на размышления, чем у прежнего максимального уровня.

⚪️ Рекорд на Agents' Last Exam: 53,6. Это тест на долгие рабочие процессы в 55 профессиях. Отрыв от Claude Fable 5 составляет 13,1 балла. Младшие Terra и Luna тоже обходят Fable 5, стоя при этом примерно в 16 раз дешевле.

⚪️ 80 баллов на Artificial Analysis Coding Agent Index. Лучший результат среди всех моделей, на 2,8 балла выше Claude Fable 5. При этом Sol тратит меньше половины токенов и обходится примерно на треть дешевле.

⚪️ Сама проверяет результат на экране. Модель смотрит на готовый интерфейс или документ, находит визуальные и функциональные ошибки и правит их до сдачи работы. На OSWorld 2.0 у Sol 62,6%, на BrowseComp 92,2%.

Карточка модели
Цена: $5 / $30 за 1M
Контекст: 1M

❗️ Примечание: доступ включают по всему миру постепенно, полная доступность в течение суток. Режим ultra в ChatGPT Work только для Pro и Enterprise, в Codex с плана Plus. Полные кибервозможности выдают после верификации в программе Trusted Access.

Источник.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Настал день релиза SuperAPP, которую в итоге назвали ChatGPT APP.

Прямо сейчас можно обновиться на macOS. На других платформах обновление пока не пришло.
🤯4
🫆 Светлый Уголок | ии
Так же модели уже доступны на openrouter.ai. https://openai.com/index/gpt-5-6/
Прямо сейчас в arena.ai добавили почти самую сильную версию GPT-5.6.

Скорее всего выбрать просто так её не выйдет. Модель придётся половить в battle моде.
👀2
Forwarded from Geometrybot
Мы сбросили 5-часовые и недельные лимиты запросов для всех пользователей.

🍷 @ClaudeDevs · оригинал
Please open Telegram to view this post
VIEW IN TELEGRAM
5
Приложение ChatGPT доступно в Microsoft Store. То есть вы уже можете установить его на Windows.

В нём вы можете удобно переключиться на рабочее пространство: Work — чат с GPT и Codex — программирование и остальные долгосрочные задачи.

❗️ Говоря о лимитах. В Codex и ChatGPT-WEB Если что они разные, так что не переживайте.

* (не в ChatGPT APP, WORK и Codex имеют общие лимиты).

https://apps.microsoft.com/detail/9N8CJ4W95TBZ?hl=neutral&gl=PL&ocid=pdpshare
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
1
Anthropic: Мы выпустили Claude Fable 5 — самую передовую модель для сложных задач, программирования и автономной работы!

OpenAI: Мы выпустили семейство GPT‑5.6 — эффективные модели, способные конкурировать с Claude Fable 5. И мы ими очень гордимся!

Meta: Мы выпустили Muse Spark 1.1 — быструю и дешёвую мультимодальную модель, которая играет примерно в одной лиге с Claude Opus 4.8 и GPT‑5.5.

SpaceXAI: Мы выпустили Grok 4.5 — нашу самую мощную модель для программирования, агентных задач и работы со знаниями. Да, мы снова в гонке.

Google: Мы тоже выпустили новую флагманскую модель! А, нет, Gemini 3.5 Pro опять перенесли. (до августа) Но у нас есть Gemini 3.1 Pro — она всего лишь с февраля сидит в Preview, думает по двадцать минут в API, зависает на Thinking…, ловит тайм-аут или 503 и в итоге ничего не делает. Хм. Зато наш API стабилен: ключи иногда не работают, лимиты прилетают после нескольких запросов, а уровень проекта может самостоятельно понизиться и уронить прод. Видимо, у нас действительно кривые руки. Но посмотрите, какие зачётные SVG-контроллеры Xbox и пеликаны на велосипедах мы рисуем! Хотя… стоп, нас уже и во фронтенде превзошли. Короче, мы обосрались. Тогда зачем мы вообще здесь?
18
🫆 Светлый Уголок | ии
Anthropic: Мы выпустили Claude Fable 5 — самую передовую модель для сложных задач, программирования и автономной работы! OpenAI: Мы выпустили семейство GPT‑5.6 — эффективные модели, способные конкурировать с Claude Fable 5. И мы ими очень гордимся! Meta:…
Пост написала GPT‑5.6 Sol. Я даже не просил её так жёстко проходиться по Google — лишь предложил посмотреть, действительно ли у компании сейчас всё настолько плохо, и слегка её подколоть. В итоге получил этот текст и решил отправить его сюда. Получилось забавно.

Но с некоторыми моментами я бы поспорил. Meta Muse Spark 1.1 на деле ужасно программирует, галлюцинирует как google gemini, а GPT‑5.6, наоборот, заметно автономнее Fable 5 и чаще доводит задачи до конца. Так что к сравнению моделей всё же есть вопросы.
7👀211
👀 GPT-5.6 помнит события до марта 2026. При официальном срезе знаний февраль 2026.

Мы попросили модель без поиска написать по памяти даты релизов моделей и пару событий вне ИИ.

Проверяли в вебе, Codex и через официальный API, в рассуждениях веб-серча не видно.

⚪️ Модель называет точные даты позже своего среза.
☀️ GPT-5.4 (5 марта 2026);
☀️ GPT-5.3 Instant (3 марта 2026);
Февральские и более ранние события, от Nano Banana 2 до статуса Чарли Кирка, выдаёт без ошибок. Забавно, что сама модель при этом уверяет, будто её срез июнь 2024.

⚪️ Sol выдаёт полный список даже на medium мышлении. Terra и Luna часто ошибаются, но на xhigh отвечают правильно почти так же, как Sol.

⚪️ Но граница всё-таки видна. О Claude Fable 5 она не знает вообще, а про чекпоинты галлюцинирует: выдала, что Kingfall был чекпоинтом Gemini 3, и придумала некий Sovereign.

Откуда мартовские даты при срезе в феврале, вопрос открытый. Либо срез на деле свежее, либо часть дат долетела через дообучение. В любом случае это здорово: настолько свежие знания у больших моделей редкость. Вопрос теперь один: сможет ли она ими чётко распоряжаться?
Please open Telegram to view this post
VIEW IN TELEGRAM
7🤯1
Кстати заметьте что МЫ.
А значит, теперь я не один. Ура!

Псс напиши хай ребяткам
👀7
Всем привет👋
Please open Telegram to view this post
VIEW IN TELEGRAM
721
Что в итоге отложили в этом месяце. Инсайд.

⚪️ Seedance 2.5. С 6 июля модель раскатывается на более широкий круг пользователей в Китае. 9 июля она должна была выйти в API, но релиз перенесли.

Сегодня Seedance 2.5 должна была появиться на платформе Jimeng. Но раскатка очень медленная.
В общем в полноценный релиз будет на следующей неделе.

* Я приложил видео китайца.

⚪️ Gemini 3.5 Pro. По словам инсайдера Leo релиз снова сдвинулся. Источник. Вместо середины июля модель теперь ожидается ближе к началу / середине августа. — это мой прогноз.

Косвенное подтверждение видно и на Polymarket: на ожидаемое 17 июля уже никто не ставит.

Причина простая: Google не успевает довести модель до нормального состояния. Текущие чекпоинты ведут себя плохо, однако разные варианты продолжают тестировать.

Скорее всего, вместе с 3.5 Pro выйдет и следующая Nano Banana Pro на её базе.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
6
🫆 Светлый Уголок | ии
Бенчмарки Grok 4.5 Их одновременно представил и Cursor и spaceXAI. https://docs.x.ai/developers/models/grok-4.5 https://cursor.com/blog/grok-4-5
Grok 4.5 получит мышление xhigh.

На публичном бенчмарке RuneBench засветился Grok 4.5 с уровнем мышления xhigh, которого официально ещё не существует. Сейчас у модели максимум high.

⚪️ Похоже, xhigh уже раздали узкому кругу на тесты. Вместе с ним xAI обещала 1M контекста. Судя по всему, оба апдейта выйдут скоро.

Кстати, ещё Илон снова обещает Гроку регулярные обновления. Но такие же посты он писал и про Grok 4, и про 4.1, 4.2, 4.3, почти одними и теми же словами, а заметных улучшений после них не было. Может благодаря новым обстоятельствам улучшения действительно будут, кто знает...


* RuneBench — бенч одного ноу-нейма, где ИИ-агенты играют в RuneScape: модель пишет код через SDK, сама ищет стратегии в вики и качает персонажа. По сути, тест на многошаговое планирование.
Please open Telegram to view this post
VIEW IN TELEGRAM
6