Светлая комната — архив
18 subscribers
91 photos
17 videos
1 file
43 links
Архивные остатки фотонов света. Перенос электромагнитного взаимодействия.
Download Telegram
Какой вариант лучше?
См. 2 поста выше.
Anonymous Poll
56%
№1
44%
№2
This media is not supported in your browser
VIEW IN TELEGRAM
🧠 Google обновили Gemini 3 Deep Think. — Не актуально на сегодня, но важно.

Важно из этого вам:
• Humanity's Last Exam: 48.4% — новый рекорд, без внешних инструментов!
• ARC-AGI-2: 84.6%
• Золото на олимпиадах 2025 по математике, физике, химии.
На базе неё уже работает Aletheia — ИИ-математик, который сам решил 4 задачи из списка нерешённых.

Доступ пока через Google AI Ultra подписку, API (ВНИМАНИЕ! API) — по заявкам (пока что).

Если что модель на базе Gemini 3.1 Pro, поэтому не накручивайте себе, что Gemini 3.1 DeepThink выйдет после 3.1 Pro. Нет, этого не будет.
— Официальный релиз

#Новости
🌌 Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
This media is not supported in your browser
VIEW IN TELEGRAM
🧠 Google обновили Gemini 3 Deep Think. Сейчас это самая сильная публично доступная модель.

Что важно для нас:
• Humanity's Last Exam: 48.4%, рекорд без инструментов.
• Codeforces: 3455 El.o
• Золото на олимпиадах 2025 по математике, физике, химии.
• Нашла ошибку в научной статье, которую люди пропустили.

Заточена под грязные данные и задачи без единственного ответа. На базе неё работает Aletheia — решил 4 нерешённые задачи автономно. Писал про это здесь (link).

Забавный момент: по инсайдам скоро будет Gemini 3.1, а Deep Think уже обновили — но назвали 3. Гугл спалился в документах, там мелькнуло 3.1 Deep Think.

Забыли переименовать. 🫡

Ребята реально пашут над продуктами. Каждое обновление ощутимо лучше предыдущего. Доступ пока через Google AI Ultra подписку, API — по заявкам.

Источники:
— Официальный релиз
— Инсайд про 3.1
— Разбор Aletheia

Кто уже потрогал? Пишите в комменты.

(А КАК ИМЕННО ПОЛУЧИТЬ ЭТУ ВЕРСИЮ НА PRO АККАУНТЕ Я НАПИШУ ПОЗЖЕ)

#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1👎1
Какой вариант лучше?
См. 2 выше
Anonymous Poll
88%
№1
13%
№2
This media is not supported in your browser
VIEW IN TELEGRAM
🚨 OpenAI выкатили GPT-5.3-Codex-Spark

Помните, я писал про сделку OpenAI с Cerebras на 750 МВт? Вот первый результат. Codex-Spark — урезанная версия GPT-5.3-Codex, заточенная чисто под скорость.

Внимание! 1000+ токенов в секунду.

Что у нас тут по делу:
• SWE-Bench Pro: 58.4% (у полного Codex — 77.3%)
• Контекст: 128k токенов
• Задержки порезали серьёзн
о

Многие скажут — слабая. Но это только рядом с полным Codex. На Terminal Bench 2.0 Spark набирает примерно столько же, сколько Opus 4.5 — а его все юзали для кодинга и не жаловались в первое время, пока не увидели gpt 5.2. 🥲

Мне нравится что OpenAI делают. Остальным компаниям на скорость генерации было пофиг, а пользователям — нет, как отмечает Kirill. Я сам писал, что 70–90 tps у GPT 5.2 Pro — это невыносимо. И вот они берут и решают проблему. Cerebras начинает отрабатывать, ах, да.

Доступ пока только ChatGPT Pro, research preview.

Источники:
Релиз тут
Cerebras рад

Кто на Pro — как ощущения? Пишите в комменты.

#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
This media is not supported in your browser
VIEW IN TELEGRAM
👀 GPT-5.3-Codex-Spark — Cerebras заработал

Писал про сделку OpenAI × Cerebras — вот первый результат. Быстрая версия Codex. 1000+ tps.

Что у нас тут по делу:
• SWE-Bench Pro: 58.4% (полный Codex — 77.3%)
• Контекст: 128k

Слабая? Только рядом с полным Codex. На Terminal Bench 2.0 — там уровень Opus 4.5.

OpenAI решают то, на что остальные забивали — скорость. И делают первыми.

Доступ: ChatGPT Pro, research preview.

Источники:
Релиз
Cerebras рады

Кто тестил? Пишите в комменты.

#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2👎1
Какой вариант лучше?
См. 2 поста выше
Anonymous Poll
54%
№1
46%
№2
🚨 Gemini 3.1 Pro вышла в ai.studio.

Идите проверяйте, пробуйте, разрабатывайте!

#Стрим
Автор — @Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Бенчмарки Gemini 3.1 pro

Обратите внимание на:
— Прошла hle на 44.4%
— ARC-AGI-2 77.1% – это большой отрыв
— SWE-Bench 80.6%, что хуже чем у последней Opus на 0.2%
— LiveCodeBench Pro — 2887

#Стрим
Автор — @Geometry90
👍1
В рейтинге Artificial Analysis новая Gemini 3.1 Pro Preview набрала 57 баллов и заняла первое место.

Отрыв от конкурентов небольшой,
но уверенный.

#Стрим
Автор — @Geometry90
👍1
Судя по графику (Omniscience Hallucination Rate), уровень галлюцинаций у новой модели заметно снизился.

Отличный результат!

#Стрим
Автор — @Geometry90
👍1
А вот на Chatbot Arena в категории работы с текстом (Text Arena) Gemini 3.1 Pro Preview пока стартует только с 3-го места.

#Стрим
Автор — @Geometry90
👍1
В категории кодинга (Code Arena / Agentic Webdev) она вообще оказалась на 6-м месте. Получается, новая Gemini доминирует далеко не везде.

Как так-то? 😱

#Стрим
Автор — @Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Зато бенчмарк ARC-AGI-1 новая Gemini 3.1 Pro порвала!

Тест пройден практически полностью. (96%)

Там модель бьётся в потолок, выжимать из этого бенчмарка буквально больше нечего. Пока-пока arc agi 1.

#Стрим
Автор — @Geometry90
👍1
Gemini 3.1 Pro стала менее эмоциональной и креативной, чем 3.0 Pro.

В некоторых случаях даже хуже 2.5 pro.

Этому поспособствовало снижение количества галлюцинаций.
Некоторые пользователи отмечают, что текст стал ужасным и однообразным.

#Новости
Автор — @Geometry90
👎1
Gemini 3.1 стала хуже в математике.

Буквально:
У меня уже возникла проблема, когда я попросил модель решить задачку уровня 7-го класса — она не смогла решить её правильно.

Вдобавок:
Если попросить модель сложить
9+10, то в некоторых случаях она будет выдавать ТОЛЬКО 21. Дожили.
Это единичный случай, видимо, проблема в том, что она считает, что ты спрашиваешь про какой-то там мем «21».

А вчера она выдала мне 2 + 2 = 5 спустя 3–4 запроса. Я обсуждал с ней другой новый мем и решил уточнить, сколько будет 2 + 2, на что она ответила: «5». Когда я спросил «почему?», она заявила, что просто "подыгрывала", "ну мы же ведь шутили".

AGI, не иначе!
👎1
🤖 Grok 4.20 (BETA 2 x V7) выходит на этой неделе!

Сам илон Маск об этом сегодня заявил.

Если проанализировать планы xAI, становится ясно: они хотят сделать реальный качественный скачок, сравнимый с переходом Gemini на 3.1 или GPT на 5.2. Эту версию нам обещают уже месяцев семь, и задержка явно не случайна.

🤖 xAI хочет дать мощную модель, но ждёт, пока OpenAI выпустят свою GPT 5.3 — а те всё тянут. Это хорошая возможность дообучить Grok 4.20.

Илон выкатил ранний чекпоинт V6 и теперь специально хочет увидеть, что выпустит OpenAI, и после этого зарядить (v7) Beta 2. И это даже не самая сильная версия — если 4.20 Beta 2 не обойдёт GPT 5.3, он будет качать grok 4.20 дальше.

Не забываем, что xAI параллельно обучают и GROK 5.

🤖 Также Маск обещал исправить самые слабые стороны модели.

Интересный факт по поводу текущей версии: выяснилось, что иногда роутер перекидывает запросы на старую 4.1. Заметить это легко: если модель вообще не "думает", а выдает ответ моментально — перед вами 4.1.

🤖 При этом нам моем опыте Grok 4.20 beta 1 (v6) уже показывает приличные результаты:

— Модель получила формат мышления с агентами, что дало буст к логике. Не буду расписывать механику, но по факту модель там одна, просто система заставляет ее симулировать общение с несколькими агентами.

— Стало в разы меньше воды, если вы сами не просили расписывать подробно.

— Заметно подтянули грамотность на русском языке.

— Уровень объяснений дотягивает до GPT-5, хотя иногда все еще может придумывать факты и собирать сплетни.

— Модель научилась спорить с пользователем в спорных моментах.

— Отлично держит контекст, разбирается в деталях и учитывает пожелания из промптов.

После релиза Grok 4.20 beta 2 сделаю полный обзор с окончательным вердиктом. А следующий пост хочу посвятить самому Илону Маску — есть вопросы к его поведению в последнее время, которое мне не нравится.

— Принцип роутера
— Источник Leaks от Илона Маска

Снова ждем Grok 4.20.

#Новости / #Мысли
🌌 Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
🤖 GPT 5.4 выйдет на этой неделе?

Как я понимаю, нас действительно ждет GPT 5.4, а не просто 5.3.

Сегодня 25-е число, с момента того твита прошла ровно неделя, и кажется, что почти никто не выкупил тонкий намек от главного разработчика Codex из OpenAI (Tibo). Судя по его цепочке, скоро нас ждет версия 5.4 и серьезные улучшения!

Моя теория такая: разраб намекает, что 5.3 будет чисто версией для Codex. А вот 5.4 выйдет уже как полная линейка — с моделями Pro, Thinking и остальными плюшками. Codex же обновится до 5.4 чуть позже. Ну и допом, такие вот мувы от разработчиков в codex.

Короче, ждем четверга, он уже завтра!
— Тот самый пост с намёком

#Новости
🌌 Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
🤟 Ъуъ Вот вам бесплатный доступ к Seedance 2.0.

Урвать его сейчас трудно. Видимо, конкретно этим способом пользуются уже многие, поэтому будьте готовы ждать генерацию одного ролика от 30 до 120 минут. Разработчики самой модели ввели строгие ограничения (вайтлисты).

Переходите по реферальной ссылке и регистрируйтесь. Вход доступен через Google или любую другую удобную вам почту.
🌌 Приглашение

Можно выбрать длительность до 15 секунд, использовать референсы в виде изображений и так далее.

Присылайте свои результаты в комментарии!

#Новости
🌌 Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1