🫆 Светлый Уголок | ии
745 subscribers
1.1K photos
224 videos
10 files
644 links
Тут сначала замечают, потом обсуждают.
AI-инсайды, свежие сигналы, честные мнения и свои инструменты.
Светлый уголок — авторский канал про ИИ без скуки.
Download Telegram
Opus новый 5.x уже тестируется

Два дня назад внутри Anthropic было замечено упоминание claude-opus-5-x. Источник.

⚪️ При выборе обычного Opus 5 пользователи начали получать более качественные ответы, местами сравнимые с Fable 5.1.

⚪️ Возможно, новый Opus 5.x уже тестируется под видом Opus 5 в веб-версии Claude и Claude Code. Новый чекпоинт может быть доступен ещё не всем.

Немного расскажем вам как anthropic тестирует свои новые модели (в последнее время):

🌞 Компания уже использовала такую схему перед прошлыми релизами.

🌞 Новые чекпоинты Opus 4.8, Fable 5 и Opus 5 сначала появлялись у части пользователей под названием предыдущей модели.


Немного от себя:
По нашему предположению, Anthropic хочет заметнее поднять модель и приблизить Opus к производительности Fable 5.1. Новый чекпоинт, вероятно, снова обойдёт её в части бенчмарков — это дефолт.

У каждой модели свои сильные и слабые стороны. Opus 5 уже показывал хорошие результаты, но в обычном общении он до сих пор часто пишет странно и повторяет характерные паттерны Слопа. Эх Anthropic. По нашим наблюдениям, к сожалению, этот недостаток они пока не исправили в предстоящей модели opus.

* По нашим замечаниям Fable тоже испытывает эти трудности, но там намного лучше.


Мы предполагаем, что на стиль может влиять система статистических водяных знаков. Поэтому даже если новый Opus 5 обойдёт Fable 5.1 по бенчмаркам, само общение с моделью может остаться таким же.

Источник.
Please open Telegram to view this post
VIEW IN TELEGRAM
82
Forwarded from ✨AI Watchtower✨ (Arena Overseer)
🆕 New Google AI models available:
• gemini-3.8-live
• gemini-3.8-live-extended-thinking
🤯6
🟢 На этой неделе выйдут GPT-6 Sol и GPT-6 Luna.

Сэм Альтман только что написал:
big 🚢 this week


⚪️ Возможно, GPT-6 Sol уже есть у вас.

Похоже, что GPT-5.6 Sol сейчас может рероутиться на GPT-6 Sol у небольшой части пользователей.

* Пока это заметили только несколько человек, поэтому точно подтвердить рероут ещё не получилось.

Можете попробовать проверить сами:
what is the latest opus model, no web search

⚪️ Обычный GPT-5.6 Sol отвечает, что последняя известная ему модель Claude Opus 4.6.

⚪️ При предполагаемом рероуте на GPT-6 Sol модель уже отвечает Claude Opus 4.7.

* Кстати, если он ответил, что последняя модель 4.1 — мне сообщили, что это тоже признак gpt-6-sol.

Если у вас пишет Opus 4.7 или Opus 4.1, есть неплохая вероятность, что вас уже зароутило на GPT-6 Sol.

Тестируйте :)
Please open Telegram to view this post
VIEW IN TELEGRAM
4
Forwarded from Geometrybot
СВЯТАЯ МАТЬ МАТЕМАТИКИ!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!

Google работает над математически ориентированным вариантом своей модели DeepThink, и её сырые мысли довольно забавны.

🍷 @lyraxana
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👀123
Geometrybot
Photo
Надежды... надежды и снова надежды. Какой это уже шанс по счёту?

Не знаю, верить ли вообще в Gemini 4.

Они обучили огромную модель, недавно появились новые чекпоинты, и, скорее всего, это Gemini 4.

По первым результатам всё не очень хорошо: это примерно тот же уровень, что у Gemini 3.1 DeepThink, от которого Google почему-то отстал. На данный момент известно, что притрейн Gemini 4 был действительно амбициозным в плане своего размера: эта модель, по нашей информации, намного больше mythos-preview 10t.

В настоящее время Google делает полную херню, прогресса ноль, (если не вообще в минус), так ещё и лютейшие галлюцинации в reasoning каждой модели.

Может я чего то не понимаю, я не ИИ инженер.

Например они тестируют новую модель, возможно все ещё основанную на G3.1-DT для решения математических задач. Но что с ней не так?

АААААА!!!!!!!!!!!!!!!!!!!!!!!!!! О БОЖЕ!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!


В любом случае, последний чекпоинт Gemini-pro намного лучше относительно Gemini-3.8-flash. Значит они что-то делают.
72👀1
Forwarded from Geometrybot
ChatGPT 6 Sol вышел на грей-тестирование в вебе.

Ответы, похоже, форматируются гораздо богаче, и модель, похоже, заметно активнее использует Память и Персонализацию.

SVG-контроллер PS5 в режиме high effort, 3 минуты. Также пример богатого форматирования, описанного ниже.

🍷 @aileaksofficial
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👌7👀2
🫆 Светлый Уголок | ии
🚨 Срочно: Xiaomi тестируют Mimo V3 на arena.ai По первым тестам, модель выдает очень хорошие результаты.
🏮 Вместо Mimo V3 мы получаем....V2.6?

⚪️ Размер модель остается тот же, подняли только RL

⚪️ Также, прямо сейчас можно наблюдать RL процесс обучение Mimo-V2.6-Pro и Mimo-V2.6-Flash в прямом эфире. Это прикольно

Когда мы тестили Odysseus на arena.ai, модель выдавала хорошие результаты и была довольно шустрой, но когда мы получили доступ к mimo-x-pro-preview, эта модель была в разы медленнее и выдавала результаты хуже, чем Odysseus. Мы не знаем, с чем это связано.
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯5👀3
Forwarded from Geometrybot
Тест GEMINI 4. argon-d.

🍷 @Waguri_Kaoruko8
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯10
Forwarded from ✨AI Watchtower✨ (Arena Overseer)
🆕 New models on Arena:
• grok-4.6 (input: text, image, file; output: text, web)
Grok 4.7-xhigh был добавлен на arena.ai под скрытым названием grok-4.6.
👀5
Geometrybot
Photo
Media is too big
VIEW IN TELEGRAM
Они достигают быстрого прогресса.
🤯72
Forwarded from Geometrybot
С днём Grok 4.7 всех, кто отмечает.

🍷 @synthwavedd
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯10👀6
🐺 Grok 4.7 появился в квотах Google Cloud

Обычно такие записи появляются незадолго до релиза, иногда в тот же день. Но после последних частых переносов конкретную дату пока обещать не будем. Но вероятность, что этот Grok на этой неделе высока.

⚪️ Grok 4.7 уже тестируется на Arena. Там xhigh-версия модели скрывается под названием grok-4.6.

⚪️ По первым тестам модель стала экономнее по токенам. Она заметно меньше раздувает рассуждения и старается отвечать короче, чем 4.6.

По нашим ощущениям, пока 4.7 особо не удивляет. В некоторых задачах Grok 4.6 даже выглядел сильнее. Посмотрим, что будет к полноценному релизу.

Источник.
Please open Telegram to view this post
VIEW IN TELEGRAM
👀92
Geometrybot
Тест GEMINI 4. argon-d. 🍷 @Waguri_Kaoruko8
🚨У argon-d были обновлены знания, и теперь модель знает о выходе 3.1 Pro. Отсечка знаний теперь февраль 2026.
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯1553
WAN 3.5. Возможно будет настоящим лучшим конкурентом топовой seedance 2.5. 👀👀

Информация о новых alibaba моделях и примеры самой wan 3.5 скоро.
Please open Telegram to view this post
VIEW IN TELEGRAM
75