Важная иформация о модели:
• Скорость: 50–100 tps
• SWE-Bench Verified: 80.2
• Фронтенд: отлично / Бэкенд: удовлетворительно
• Заточена под агенты, кодинг, поиск, tool use.
Честно:
По бенчмаркам она обходит кучу топовых моделей. На бумаге — уровень Claude 4.5 Opus. Но на практике уступает, и это нормально, потому что бенчмарки и реальные задачи это две разные вещи. Зато дешевле в 10–20 раз. А для многих задач этого хватает с головой!!!
Источники:
— Юзать официально.
— Официальный релиз: пост от @MiniMax_AI.
— Первый спот: где её заметили до анонса.
— Мини критика и сравнение с GLM-5
Моё мнение по китайским моделям в целом: Догоняют, местами обгоняют, и темп у них бешеный. Но пока не хватает стабильности на длинных задачах и репутации. Большие компании всё ещё боятся ставить на них в проде, и их можно понять.
Но если так пойдёт дальше — через полгода разговор будет уже другой.
Кто пробовал через их агент? Как ощущения на реальных задачах? Пишите в комменты.
#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4
Важная иформация о модели:
• Скорость: 50–100 tps
• SWE-Bench Verified: 80.2
• Фронтенд: отлично / Бэкенд: удовлетворительно
• Заточена под агенты, кодинг, поиск, tool use.
На бумаге — уровень Claude 4.5 Opus. На деле слабее, но дешевле в 10–20 раз.
Китайцы догоняют и темп бешеный. Стабильности и репутации пока не хватает.
Источники:
— Юзать
— Релиз: пост от @MiniMax_AI
— Сравнение с GLM-5 и разбор.
— Первый спот: где её заметили до анонса.
Кто тестил? Пишите в комменты.
#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
Помните, я писал про «истину» и папку в репозитории? Теперь всё официально — они представили Aletheia.
Цифры и механика (для вашей осведомленности):
• 91.9% на IMO-ProofBench Advanced — новый рекорд. Один из самых жёстких тестов на доказательства в стиле Межнара по математике.
• Движок — Gemini Deep Think. Решение строится в три этапа: генерация → верификация → корректировка.
• При этом работает лучше и дешевле, чем сама Gemini Deep Think Advanced в чистом виде. Агентная обвязка тут реально даёт выигрыш, а не просто обёртка.
Что уже сделала помимо бенчмарков:
— Решила 4 открытых задачи из списка Эрдеша (Эпштейна). Одна из них вообще не была закрыта ни в какой литературе до этого.
— Автономно написала статью с правильными математическими результатами.
— Помогала реальным математикам в написании не-игрушечных научных работ.
Моё мнение:
Google подчёркивают, что Aletheia — пруф того, что законы масштабирования всё ещё работают. Даже на доказательной математике качество растёт не за счёт тупого наращивания параметров, а за счёт архитектуры рассуждений. Умнее агент — лучше результат за меньшие деньги.
Помните папку Aletheia в репозитории superhuman? Я писал, что ждём мощный анонс. Ну вот он.
P.s — Позже сегодня на том же движке вышла обновлённая Gemini 3 Deep Think — набрала 84.6% на ARC-AGI-2, лучший результат на данный момент.
Источники:
— Официальный релиз DeepMind
— Мой пост с инсайдом про superhuman
Кто верил, что задачи Эрдеша закроют настолько быстро? Пишите в комменты.
#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
По фактам:
• 91.9% на IMO-ProofBench Advanced — рекорд. Один из самых жёстких тестов на доказательства.
• Движок: Gemini Deep Think. Три этапа: генерация → верификация → корректировка.
• Работает лучше и дешевле, чем Gemini Deep Think Advanced.
Помимо бенчмарков:
— 4 задачи из списка Эрдеша решены автономно. Одна вообще не была закрыта в литературе до этого.
— Сама написала научную статью с правильными результатами.
— Помогала реальным математикам в написании работ.
По сути — Google показали, что агентная обвязка поверх сильной модели даёт предсказуемый рост даже в доказательной математике. Больше качества за меньшие деньги. Короче, название «истина» себя оправдало. Прикольно.
P.s — Кстати, позже сегодня на этом же движке обновили Gemini 3 Deep Think — 84.6% на ARC-AGI-2, топ на данный момент.
Источники:
— Официальный релиз DeepMind
— Мой пост с инсайдом
Кто следил за Aletheia до анонса? Пишите в комменты.
#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Важно из этого вам:На базе неё уже работает Aletheia — ИИ-математик, который сам решил 4 задачи из списка нерешённых.
• Humanity's Last Exam: 48.4% — новый рекорд, без внешних инструментов!
• ARC-AGI-2: 84.6%
• Золото на олимпиадах 2025 по математике, физике, химии.
Доступ пока через Google AI Ultra подписку, API (ВНИМАНИЕ! API) — по заявкам (пока что).
Если что модель на базе Gemini 3.1 Pro, поэтому не накручивайте себе, что Gemini 3.1 DeepThink выйдет после 3.1 Pro. Нет, этого не будет.
— Официальный релиз
#Новости
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
This media is not supported in your browser
VIEW IN TELEGRAM
Что важно для нас:Заточена под грязные данные и задачи без единственного ответа. На базе неё работает Aletheia — решил 4 нерешённые задачи автономно. Писал про это здесь (link).
• Humanity's Last Exam: 48.4%, рекорд без инструментов.
• Codeforces: 3455 El.o
• Золото на олимпиадах 2025 по математике, физике, химии.
• Нашла ошибку в научной статье, которую люди пропустили.
Забавный момент: по инсайдам скоро будет Gemini 3.1, а Deep Think уже обновили — но назвали 3. Гугл спалился в документах, там мелькнуло 3.1 Deep Think.
Забыли переименовать.
Ребята реально пашут над продуктами. Каждое обновление ощутимо лучше предыдущего. Доступ пока через Google AI Ultra подписку, API — по заявкам.
Источники:
— Официальный релиз
— Инсайд про 3.1
— Разбор Aletheia
Кто уже потрогал? Пишите в комменты.
(А КАК ИМЕННО ПОЛУЧИТЬ ЭТУ ВЕРСИЮ НА PRO АККАУНТЕ Я НАПИШУ ПОЗЖЕ)
#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1👎1
This media is not supported in your browser
VIEW IN TELEGRAM
Помните, я писал про сделку OpenAI с Cerebras на 750 МВт? Вот первый результат. Codex-Spark — урезанная версия GPT-5.3-Codex, заточенная чисто под скорость.
Внимание! 1000+ токенов в секунду.
Что у нас тут по делу:
• SWE-Bench Pro: 58.4% (у полного Codex — 77.3%)
• Контекст: 128k токенов
• Задержки порезали серьёзно
Многие скажут — слабая. Но это только рядом с полным Codex. На Terminal Bench 2.0 Spark набирает примерно столько же, сколько Opus 4.5 — а его все юзали для кодинга и не жаловались в первое время, пока не увидели gpt 5.2.
Мне нравится что OpenAI делают. Остальным компаниям на скорость генерации было пофиг, а пользователям — нет, как отмечает Kirill. Я сам писал, что 70–90 tps у GPT 5.2 Pro — это невыносимо. И вот они берут и решают проблему. Cerebras начинает отрабатывать, ах, да.
Доступ пока только ChatGPT Pro, research preview.
Источники:
Релиз тут
Cerebras рад
Кто на Pro — как ощущения? Пишите в комменты.
#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2