Светлая комната — архив
18 subscribers
91 photos
17 videos
1 file
43 links
Архивные остатки фотонов света. Перенос электромагнитного взаимодействия.
Download Telegram
🎉 MiniMax M2.5 официально вышел. Веса пока не выложили, но модель уже можно потрогать. Бенчмарки на картинке.

Важная иформация о модели:
• Скорость: 50–100 tps
• SWE-Bench Verified: 80.2
• Фронтенд: отлично / Бэкенд: удовлетворительно
• Заточена под агенты, кодинг, поиск, tool use.


Честно:
По бенчмаркам она обходит кучу топовых моделей. На бумаге — уровень Claude 4.5 Opus. Но на практике уступает, и это нормально, потому что бенчмарки и реальные задачи это две разные вещи. Зато дешевле в 10–20 раз. А для многих задач этого хватает с головой!!!

Источники:
Юзать официально.
Официальный релиз: пост от @MiniMax_AI.
Первый спот: где её заметили до анонса.
Мини критика и сравнение с GLM-5

Моё мнение по китайским моделям в целом: Догоняют, местами обгоняют, и темп у них бешеный. Но пока не хватает стабильности на длинных задачах и репутации. Большие компании всё ещё боятся ставить на них в проде, и их можно понять.

Но если так пойдёт дальше — через полгода разговор будет уже другой.

Кто пробовал через их агент? Как ощущения на реальных задачах? Пишите в комменты.

#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4
🎉 MiniMax M2.5 вышел. Веса закрыты, но потрогать можно. Бенчмарки на фото.

Важная иформация о модели:
• Скорость: 50–100 tps
• SWE-Bench Verified: 80.2
• Фронтенд: отлично / Бэкенд: удовлетворительно
• Заточена под агенты, кодинг, поиск, tool use.

На бумаге — уровень Claude 4.5 Opus. На деле слабее, но дешевле в 10–20 раз.

Китайцы догоняют и темп бешеный. Стабильности и репутации пока не хватает.

Источники:
Юзать
Релиз: пост от @MiniMax_AI
Сравнение с GLM-5 и разбор.
Первый спот: где её заметили до анонса.

Кто тестил? Пишите в комменты.

#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
Какой вариант лучше?
См. 2 поста выше.
Anonymous Poll
75%
№1
25%
№2
🔍 Google DeepMind подтвердили инсайд про Aletheia и репозиторий superhuman.

Помните, я писал про «истину» и папку в репозитории? Теперь всё официально — они представили Aletheia.

Цифры и механика (для вашей осведомленности):
• 91.9% на IMO-ProofBench Advanced — новый рекорд. Один из самых жёстких тестов на доказательства в стиле Межнара по математике.
• Движок — Gemini Deep Think. Решение строится в три этапа: генерация → верификация → корректировка.
• При этом работает лучше и дешевле, чем сама Gemini Deep Think Advanced в чистом виде. Агентная обвязка тут реально даёт выигрыш, а не просто обёртка.


Что уже сделала помимо бенчмарков:
— Решила 4 открытых задачи из списка Эрдеша (Эпштейна). Одна из них вообще не была закрыта ни в какой литературе до этого.
— Автономно написала статью с правильными математическими результатами.
— Помогала реальным математикам в написании не-игрушечных научных работ.

Моё мнение:
Google подчёркивают, что Aletheia — пруф того, что законы масштабирования всё ещё работают. Даже на доказательной математике качество растёт не за счёт тупого наращивания параметров, а за счёт архитектуры рассуждений. Умнее агент — лучше результат за меньшие деньги.

Помните папку Aletheia в репозитории superhuman? Я писал, что ждём мощный анонс. Ну вот он.

P.s — Позже сегодня на том же движке вышла обновлённая Gemini 3 Deep Think — набрала 84.6% на ARC-AGI-2, лучший результат на данный момент.

Источники:
— Официальный релиз DeepMind
— Мой пост с инсайдом про superhuman

Кто верил, что задачи Эрдеша закроют настолько быстро? Пишите в комменты.

#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
🧠 DeepMind подтвердили инсайд про Aletheia. Помните пост про репозиторий superhuman и папку «истина»? Теперь официально.

По фактам:
• 91.9% на IMO-ProofBench Advanced — рекорд. Один из самых жёстких тестов на доказательства.
• Движок: Gemini Deep Think. Три этапа: генерация → верификация → корректировка.
• Работает лучше и дешевле, чем Gemini Deep Think Advanced.

Помимо бенчмарков:
— 4 задачи из списка Эрдеша решены автономно. Одна вообще не была закрыта в литературе до этого.
— Сама написала научную статью с правильными результатами.
— Помогала реальным математикам в написании работ.

По сути — Google показали, что агентная обвязка поверх сильной модели даёт предсказуемый рост даже в доказательной математике. Больше качества за меньшие деньги. Короче, название «истина» себя оправдало. Прикольно.

P.s — Кстати, позже сегодня на этом же движке обновили Gemini 3 Deep Think — 84.6% на ARC-AGI-2, топ на данный момент.

Источники:
— Официальный релиз DeepMind
— Мой пост с инсайдом

Кто следил за Aletheia до анонса? Пишите в комменты.

#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
Какой вариант лучше?
См. 2 поста выше.
Anonymous Poll
56%
№1
44%
№2
This media is not supported in your browser
VIEW IN TELEGRAM
🧠 Google обновили Gemini 3 Deep Think. — Не актуально на сегодня, но важно.

Важно из этого вам:
• Humanity's Last Exam: 48.4% — новый рекорд, без внешних инструментов!
• ARC-AGI-2: 84.6%
• Золото на олимпиадах 2025 по математике, физике, химии.
На базе неё уже работает Aletheia — ИИ-математик, который сам решил 4 задачи из списка нерешённых.

Доступ пока через Google AI Ultra подписку, API (ВНИМАНИЕ! API) — по заявкам (пока что).

Если что модель на базе Gemini 3.1 Pro, поэтому не накручивайте себе, что Gemini 3.1 DeepThink выйдет после 3.1 Pro. Нет, этого не будет.
— Официальный релиз

#Новости
🌌 Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
This media is not supported in your browser
VIEW IN TELEGRAM
🧠 Google обновили Gemini 3 Deep Think. Сейчас это самая сильная публично доступная модель.

Что важно для нас:
• Humanity's Last Exam: 48.4%, рекорд без инструментов.
• Codeforces: 3455 El.o
• Золото на олимпиадах 2025 по математике, физике, химии.
• Нашла ошибку в научной статье, которую люди пропустили.

Заточена под грязные данные и задачи без единственного ответа. На базе неё работает Aletheia — решил 4 нерешённые задачи автономно. Писал про это здесь (link).

Забавный момент: по инсайдам скоро будет Gemini 3.1, а Deep Think уже обновили — но назвали 3. Гугл спалился в документах, там мелькнуло 3.1 Deep Think.

Забыли переименовать. 🫡

Ребята реально пашут над продуктами. Каждое обновление ощутимо лучше предыдущего. Доступ пока через Google AI Ultra подписку, API — по заявкам.

Источники:
— Официальный релиз
— Инсайд про 3.1
— Разбор Aletheia

Кто уже потрогал? Пишите в комменты.

(А КАК ИМЕННО ПОЛУЧИТЬ ЭТУ ВЕРСИЮ НА PRO АККАУНТЕ Я НАПИШУ ПОЗЖЕ)

#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1👎1
Какой вариант лучше?
См. 2 выше
Anonymous Poll
88%
№1
13%
№2
This media is not supported in your browser
VIEW IN TELEGRAM
🚨 OpenAI выкатили GPT-5.3-Codex-Spark

Помните, я писал про сделку OpenAI с Cerebras на 750 МВт? Вот первый результат. Codex-Spark — урезанная версия GPT-5.3-Codex, заточенная чисто под скорость.

Внимание! 1000+ токенов в секунду.

Что у нас тут по делу:
• SWE-Bench Pro: 58.4% (у полного Codex — 77.3%)
• Контекст: 128k токенов
• Задержки порезали серьёзн
о

Многие скажут — слабая. Но это только рядом с полным Codex. На Terminal Bench 2.0 Spark набирает примерно столько же, сколько Opus 4.5 — а его все юзали для кодинга и не жаловались в первое время, пока не увидели gpt 5.2. 🥲

Мне нравится что OpenAI делают. Остальным компаниям на скорость генерации было пофиг, а пользователям — нет, как отмечает Kirill. Я сам писал, что 70–90 tps у GPT 5.2 Pro — это невыносимо. И вот они берут и решают проблему. Cerebras начинает отрабатывать, ах, да.

Доступ пока только ChatGPT Pro, research preview.

Источники:
Релиз тут
Cerebras рад

Кто на Pro — как ощущения? Пишите в комменты.

#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2