This media is not supported in your browser
VIEW IN TELEGRAM
Важно из этого вам:На базе неё уже работает Aletheia — ИИ-математик, который сам решил 4 задачи из списка нерешённых.
• Humanity's Last Exam: 48.4% — новый рекорд, без внешних инструментов!
• ARC-AGI-2: 84.6%
• Золото на олимпиадах 2025 по математике, физике, химии.
Доступ пока через Google AI Ultra подписку, API (ВНИМАНИЕ! API) — по заявкам (пока что).
Если что модель на базе Gemini 3.1 Pro, поэтому не накручивайте себе, что Gemini 3.1 DeepThink выйдет после 3.1 Pro. Нет, этого не будет.
— Официальный релиз
#Новости
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
This media is not supported in your browser
VIEW IN TELEGRAM
Что важно для нас:Заточена под грязные данные и задачи без единственного ответа. На базе неё работает Aletheia — решил 4 нерешённые задачи автономно. Писал про это здесь (link).
• Humanity's Last Exam: 48.4%, рекорд без инструментов.
• Codeforces: 3455 El.o
• Золото на олимпиадах 2025 по математике, физике, химии.
• Нашла ошибку в научной статье, которую люди пропустили.
Забавный момент: по инсайдам скоро будет Gemini 3.1, а Deep Think уже обновили — но назвали 3. Гугл спалился в документах, там мелькнуло 3.1 Deep Think.
Забыли переименовать.
Ребята реально пашут над продуктами. Каждое обновление ощутимо лучше предыдущего. Доступ пока через Google AI Ultra подписку, API — по заявкам.
Источники:
— Официальный релиз
— Инсайд про 3.1
— Разбор Aletheia
Кто уже потрогал? Пишите в комменты.
(А КАК ИМЕННО ПОЛУЧИТЬ ЭТУ ВЕРСИЮ НА PRO АККАУНТЕ Я НАПИШУ ПОЗЖЕ)
#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1👎1
This media is not supported in your browser
VIEW IN TELEGRAM
Помните, я писал про сделку OpenAI с Cerebras на 750 МВт? Вот первый результат. Codex-Spark — урезанная версия GPT-5.3-Codex, заточенная чисто под скорость.
Внимание! 1000+ токенов в секунду.
Что у нас тут по делу:
• SWE-Bench Pro: 58.4% (у полного Codex — 77.3%)
• Контекст: 128k токенов
• Задержки порезали серьёзно
Многие скажут — слабая. Но это только рядом с полным Codex. На Terminal Bench 2.0 Spark набирает примерно столько же, сколько Opus 4.5 — а его все юзали для кодинга и не жаловались в первое время, пока не увидели gpt 5.2.
Мне нравится что OpenAI делают. Остальным компаниям на скорость генерации было пофиг, а пользователям — нет, как отмечает Kirill. Я сам писал, что 70–90 tps у GPT 5.2 Pro — это невыносимо. И вот они берут и решают проблему. Cerebras начинает отрабатывать, ах, да.
Доступ пока только ChatGPT Pro, research preview.
Источники:
Релиз тут
Cerebras рад
Кто на Pro — как ощущения? Пишите в комменты.
#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
This media is not supported in your browser
VIEW IN TELEGRAM
Писал про сделку OpenAI × Cerebras — вот первый результат. Быстрая версия Codex. 1000+ tps.
Что у нас тут по делу:
• SWE-Bench Pro: 58.4% (полный Codex — 77.3%)
• Контекст: 128k
Слабая? Только рядом с полным Codex. На Terminal Bench 2.0 — там уровень Opus 4.5.
OpenAI решают то, на что остальные забивали — скорость. И делают первыми.
Доступ: ChatGPT Pro, research preview.
Источники:
Релиз
Cerebras рады
Кто тестил? Пишите в комменты.
#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2👎1
Forwarded from Светлый Уголок | ии
Идите проверяйте, пробуйте, разрабатывайте!
#Стрим
Автор — @Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Forwarded from Светлый Уголок | ии
Бенчмарки Gemini 3.1 pro
#Стрим
Автор — @Geometry90
Обратите внимание на:
— Прошла hle на 44.4%
— ARC-AGI-2 77.1% – это большой отрыв
— SWE-Bench 80.6%, что хуже чем у последней Opus на 0.2%
— LiveCodeBench Pro — 2887
#Стрим
Автор — @Geometry90
👍1
Forwarded from Светлый Уголок | ии
В рейтинге Artificial Analysis новая Gemini 3.1 Pro Preview набрала 57 баллов и заняла первое место.
Отрыв от конкурентов небольшой,
но уверенный.
#Стрим
Автор — @Geometry90
Отрыв от конкурентов небольшой,
но уверенный.
#Стрим
Автор — @Geometry90
👍1
Forwarded from Светлый Уголок | ии
Судя по графику (Omniscience Hallucination Rate), уровень галлюцинаций у новой модели заметно снизился.
Отличный результат!
#Стрим
Автор — @Geometry90
Отличный результат!
#Стрим
Автор — @Geometry90
👍1
Forwarded from Светлый Уголок | ии
А вот на Chatbot Arena в категории работы с текстом (Text Arena) Gemini 3.1 Pro Preview пока стартует только с 3-го места.
#Стрим
Автор — @Geometry90
#Стрим
Автор — @Geometry90
👍1
Forwarded from Светлый Уголок | ии
В категории кодинга (Code Arena / Agentic Webdev) она вообще оказалась на 6-м месте. Получается, новая Gemini доминирует далеко не везде.
Как так-то?😱
#Стрим
Автор — @Geometry90
Как так-то?
#Стрим
Автор — @Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Forwarded from Светлый Уголок | ии
Зато бенчмарк ARC-AGI-1 новая Gemini 3.1 Pro порвала!
Тест пройден практически полностью. (96%)
Там модель бьётся в потолок, выжимать из этого бенчмарка буквально больше нечего. Пока-пока arc agi 1.
#Стрим
Автор — @Geometry90
Тест пройден практически полностью. (96%)
Там модель бьётся в потолок, выжимать из этого бенчмарка буквально больше нечего. Пока-пока arc agi 1.
#Стрим
Автор — @Geometry90
👍1
Forwarded from Светлый Уголок | ии
Gemini 3.1 Pro стала менее эмоциональной и креативной, чем 3.0 Pro.
В некоторых случаях даже хуже 2.5 pro.
Этому поспособствовало снижение количества галлюцинаций.
Некоторые пользователи отмечают, что текст стал ужасным и однообразным.
#Новости
Автор — @Geometry90
В некоторых случаях даже хуже 2.5 pro.
Этому поспособствовало снижение количества галлюцинаций.
Некоторые пользователи отмечают, что текст стал ужасным и однообразным.
#Новости
Автор — @Geometry90
👎1
Gemini 3.1 стала хуже в математике.
Буквально:
У меня уже возникла проблема, когда я попросил модель решить задачку уровня 7-го класса — она не смогла решить её правильно.
Вдобавок:
Если попросить модель сложить
9+10, то в некоторых случаях она будет выдавать ТОЛЬКО 21. Дожили.
Это единичный случай, видимо, проблема в том, что она считает, что ты спрашиваешь про какой-то там мем «21».
А вчера она выдала мне 2 + 2 = 5 спустя 3–4 запроса. Я обсуждал с ней другой новый мем и решил уточнить, сколько будет 2 + 2, на что она ответила: «5». Когда я спросил «почему?», она заявила, что просто "подыгрывала", "ну мы же ведь шутили".
AGI, не иначе!
Буквально:
У меня уже возникла проблема, когда я попросил модель решить задачку уровня 7-го класса — она не смогла решить её правильно.
Вдобавок:
Если попросить модель сложить
9+10, то в некоторых случаях она будет выдавать ТОЛЬКО 21. Дожили.
Это единичный случай, видимо, проблема в том, что она считает, что ты спрашиваешь про какой-то там мем «21».
А вчера она выдала мне 2 + 2 = 5 спустя 3–4 запроса. Я обсуждал с ней другой новый мем и решил уточнить, сколько будет 2 + 2, на что она ответила: «5». Когда я спросил «почему?», она заявила, что просто "подыгрывала", "ну мы же ведь шутили".
AGI, не иначе!
👎1
Сам илон Маск об этом сегодня заявил.
Если проанализировать планы xAI, становится ясно: они хотят сделать реальный качественный скачок, сравнимый с переходом Gemini на 3.1 или GPT на 5.2. Эту версию нам обещают уже месяцев семь, и задержка явно не случайна.
Илон выкатил ранний чекпоинт V6 и теперь специально хочет увидеть, что выпустит OpenAI, и после этого зарядить (v7) Beta 2. И это даже не самая сильная версия — если 4.20 Beta 2 не обойдёт GPT 5.3, он будет качать grok 4.20 дальше.
Не забываем, что xAI параллельно обучают и GROK 5.
Интересный факт по поводу текущей версии: выяснилось, что иногда роутер перекидывает запросы на старую 4.1. Заметить это легко: если модель вообще не "думает", а выдает ответ моментально — перед вами 4.1.
🤖 При этом нам моем опыте Grok 4.20 beta 1 (v6) уже показывает приличные результаты:
— Модель получила формат мышления с агентами, что дало буст к логике. Не буду расписывать механику, но по факту модель там одна, просто система заставляет ее симулировать общение с несколькими агентами.
— Стало в разы меньше воды, если вы сами не просили расписывать подробно.
— Заметно подтянули грамотность на русском языке.
— Уровень объяснений дотягивает до GPT-5, хотя иногда все еще может придумывать факты и собирать сплетни.
— Модель научилась спорить с пользователем в спорных моментах.
— Отлично держит контекст, разбирается в деталях и учитывает пожелания из промптов.
После релиза Grok 4.20 beta 2 сделаю полный обзор с окончательным вердиктом. А следующий пост хочу посвятить самому Илону Маску — есть вопросы к его поведению в последнее время, которое мне не нравится.
— Принцип роутера
— Источник Leaks от Илона Маска
Снова ждем Grok 4.20.
#Новости / #Мысли
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Как я понимаю, нас действительно ждет GPT 5.4, а не просто 5.3.
Сегодня 25-е число, с момента того твита прошла ровно неделя, и кажется, что почти никто не выкупил тонкий намек от главного разработчика Codex из OpenAI (Tibo). Судя по его цепочке, скоро нас ждет версия 5.4 и серьезные улучшения!
Моя теория такая: разраб намекает, что 5.3 будет чисто версией для Codex. А вот 5.4 выйдет уже как полная линейка — с моделями Pro, Thinking и остальными плюшками. Codex же обновится до 5.4 чуть позже. Ну и допом, такие вот мувы от разработчиков в codex.
Короче, ждем четверга, он уже завтра!
— Тот самый пост с намёком
#Новости
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Урвать его сейчас трудно. Видимо, конкретно этим способом пользуются уже многие, поэтому будьте готовы ждать генерацию одного ролика от 30 до 120 минут. Разработчики самой модели ввели строгие ограничения (вайтлисты).
Переходите по реферальной ссылке и регистрируйтесь. Вход доступен через Google или любую другую удобную вам почту.
Можно выбрать длительность до 15 секунд, использовать референсы в виде изображений и так далее.
Присылайте свои результаты в комментарии!
#Новости
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1