Светлая комната — архив
18 subscribers
91 photos
17 videos
1 file
43 links
Архивные остатки фотонов света. Перенос электромагнитного взаимодействия.
Download Telegram
🎉 MiniMax M2.5 официально вышел. Веса пока не выложили, но модель уже можно потрогать. Бенчмарки на картинке.

Важная иформация о модели:
• Скорость: 50–100 tps
• SWE-Bench Verified: 80.2
• Фронтенд: отлично / Бэкенд: удовлетворительно
• Заточена под агенты, кодинг, поиск, tool use.


Честно:
По бенчмаркам она обходит кучу топовых моделей. На бумаге — уровень Claude 4.5 Opus. Но на практике уступает, и это нормально, потому что бенчмарки и реальные задачи это две разные вещи. Зато дешевле в 10–20 раз. А для многих задач этого хватает с головой!!!

Источники:
Юзать официально.
Официальный релиз: пост от @MiniMax_AI.
Первый спот: где её заметили до анонса.
Мини критика и сравнение с GLM-5

Моё мнение по китайским моделям в целом: Догоняют, местами обгоняют, и темп у них бешеный. Но пока не хватает стабильности на длинных задачах и репутации. Большие компании всё ещё боятся ставить на них в проде, и их можно понять.

Но если так пойдёт дальше — через полгода разговор будет уже другой.

Кто пробовал через их агент? Как ощущения на реальных задачах? Пишите в комменты.

#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4
🎉 MiniMax M2.5 вышел. Веса закрыты, но потрогать можно. Бенчмарки на фото.

Важная иформация о модели:
• Скорость: 50–100 tps
• SWE-Bench Verified: 80.2
• Фронтенд: отлично / Бэкенд: удовлетворительно
• Заточена под агенты, кодинг, поиск, tool use.

На бумаге — уровень Claude 4.5 Opus. На деле слабее, но дешевле в 10–20 раз.

Китайцы догоняют и темп бешеный. Стабильности и репутации пока не хватает.

Источники:
Юзать
Релиз: пост от @MiniMax_AI
Сравнение с GLM-5 и разбор.
Первый спот: где её заметили до анонса.

Кто тестил? Пишите в комменты.

#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
Какой вариант лучше?
См. 2 поста выше.
Anonymous Poll
75%
№1
25%
№2
🔍 Google DeepMind подтвердили инсайд про Aletheia и репозиторий superhuman.

Помните, я писал про «истину» и папку в репозитории? Теперь всё официально — они представили Aletheia.

Цифры и механика (для вашей осведомленности):
• 91.9% на IMO-ProofBench Advanced — новый рекорд. Один из самых жёстких тестов на доказательства в стиле Межнара по математике.
• Движок — Gemini Deep Think. Решение строится в три этапа: генерация → верификация → корректировка.
• При этом работает лучше и дешевле, чем сама Gemini Deep Think Advanced в чистом виде. Агентная обвязка тут реально даёт выигрыш, а не просто обёртка.


Что уже сделала помимо бенчмарков:
— Решила 4 открытых задачи из списка Эрдеша (Эпштейна). Одна из них вообще не была закрыта ни в какой литературе до этого.
— Автономно написала статью с правильными математическими результатами.
— Помогала реальным математикам в написании не-игрушечных научных работ.

Моё мнение:
Google подчёркивают, что Aletheia — пруф того, что законы масштабирования всё ещё работают. Даже на доказательной математике качество растёт не за счёт тупого наращивания параметров, а за счёт архитектуры рассуждений. Умнее агент — лучше результат за меньшие деньги.

Помните папку Aletheia в репозитории superhuman? Я писал, что ждём мощный анонс. Ну вот он.

P.s — Позже сегодня на том же движке вышла обновлённая Gemini 3 Deep Think — набрала 84.6% на ARC-AGI-2, лучший результат на данный момент.

Источники:
— Официальный релиз DeepMind
— Мой пост с инсайдом про superhuman

Кто верил, что задачи Эрдеша закроют настолько быстро? Пишите в комменты.

#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
🧠 DeepMind подтвердили инсайд про Aletheia. Помните пост про репозиторий superhuman и папку «истина»? Теперь официально.

По фактам:
• 91.9% на IMO-ProofBench Advanced — рекорд. Один из самых жёстких тестов на доказательства.
• Движок: Gemini Deep Think. Три этапа: генерация → верификация → корректировка.
• Работает лучше и дешевле, чем Gemini Deep Think Advanced.

Помимо бенчмарков:
— 4 задачи из списка Эрдеша решены автономно. Одна вообще не была закрыта в литературе до этого.
— Сама написала научную статью с правильными результатами.
— Помогала реальным математикам в написании работ.

По сути — Google показали, что агентная обвязка поверх сильной модели даёт предсказуемый рост даже в доказательной математике. Больше качества за меньшие деньги. Короче, название «истина» себя оправдало. Прикольно.

P.s — Кстати, позже сегодня на этом же движке обновили Gemini 3 Deep Think — 84.6% на ARC-AGI-2, топ на данный момент.

Источники:
— Официальный релиз DeepMind
— Мой пост с инсайдом

Кто следил за Aletheia до анонса? Пишите в комменты.

#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
Какой вариант лучше?
См. 2 поста выше.
Anonymous Poll
56%
№1
44%
№2
This media is not supported in your browser
VIEW IN TELEGRAM
🧠 Google обновили Gemini 3 Deep Think. — Не актуально на сегодня, но важно.

Важно из этого вам:
• Humanity's Last Exam: 48.4% — новый рекорд, без внешних инструментов!
• ARC-AGI-2: 84.6%
• Золото на олимпиадах 2025 по математике, физике, химии.
На базе неё уже работает Aletheia — ИИ-математик, который сам решил 4 задачи из списка нерешённых.

Доступ пока через Google AI Ultra подписку, API (ВНИМАНИЕ! API) — по заявкам (пока что).

Если что модель на базе Gemini 3.1 Pro, поэтому не накручивайте себе, что Gemini 3.1 DeepThink выйдет после 3.1 Pro. Нет, этого не будет.
— Официальный релиз

#Новости
🌌 Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
This media is not supported in your browser
VIEW IN TELEGRAM
🧠 Google обновили Gemini 3 Deep Think. Сейчас это самая сильная публично доступная модель.

Что важно для нас:
• Humanity's Last Exam: 48.4%, рекорд без инструментов.
• Codeforces: 3455 El.o
• Золото на олимпиадах 2025 по математике, физике, химии.
• Нашла ошибку в научной статье, которую люди пропустили.

Заточена под грязные данные и задачи без единственного ответа. На базе неё работает Aletheia — решил 4 нерешённые задачи автономно. Писал про это здесь (link).

Забавный момент: по инсайдам скоро будет Gemini 3.1, а Deep Think уже обновили — но назвали 3. Гугл спалился в документах, там мелькнуло 3.1 Deep Think.

Забыли переименовать. 🫡

Ребята реально пашут над продуктами. Каждое обновление ощутимо лучше предыдущего. Доступ пока через Google AI Ultra подписку, API — по заявкам.

Источники:
— Официальный релиз
— Инсайд про 3.1
— Разбор Aletheia

Кто уже потрогал? Пишите в комменты.

(А КАК ИМЕННО ПОЛУЧИТЬ ЭТУ ВЕРСИЮ НА PRO АККАУНТЕ Я НАПИШУ ПОЗЖЕ)

#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1👎1
Какой вариант лучше?
См. 2 выше
Anonymous Poll
88%
№1
13%
№2
This media is not supported in your browser
VIEW IN TELEGRAM
🚨 OpenAI выкатили GPT-5.3-Codex-Spark

Помните, я писал про сделку OpenAI с Cerebras на 750 МВт? Вот первый результат. Codex-Spark — урезанная версия GPT-5.3-Codex, заточенная чисто под скорость.

Внимание! 1000+ токенов в секунду.

Что у нас тут по делу:
• SWE-Bench Pro: 58.4% (у полного Codex — 77.3%)
• Контекст: 128k токенов
• Задержки порезали серьёзн
о

Многие скажут — слабая. Но это только рядом с полным Codex. На Terminal Bench 2.0 Spark набирает примерно столько же, сколько Opus 4.5 — а его все юзали для кодинга и не жаловались в первое время, пока не увидели gpt 5.2. 🥲

Мне нравится что OpenAI делают. Остальным компаниям на скорость генерации было пофиг, а пользователям — нет, как отмечает Kirill. Я сам писал, что 70–90 tps у GPT 5.2 Pro — это невыносимо. И вот они берут и решают проблему. Cerebras начинает отрабатывать, ах, да.

Доступ пока только ChatGPT Pro, research preview.

Источники:
Релиз тут
Cerebras рад

Кто на Pro — как ощущения? Пишите в комменты.

#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
This media is not supported in your browser
VIEW IN TELEGRAM
👀 GPT-5.3-Codex-Spark — Cerebras заработал

Писал про сделку OpenAI × Cerebras — вот первый результат. Быстрая версия Codex. 1000+ tps.

Что у нас тут по делу:
• SWE-Bench Pro: 58.4% (полный Codex — 77.3%)
• Контекст: 128k

Слабая? Только рядом с полным Codex. На Terminal Bench 2.0 — там уровень Opus 4.5.

OpenAI решают то, на что остальные забивали — скорость. И делают первыми.

Доступ: ChatGPT Pro, research preview.

Источники:
Релиз
Cerebras рады

Кто тестил? Пишите в комменты.

#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2👎1
Какой вариант лучше?
См. 2 поста выше
Anonymous Poll
54%
№1
46%
№2
🚨 Gemini 3.1 Pro вышла в ai.studio.

Идите проверяйте, пробуйте, разрабатывайте!

#Стрим
Автор — @Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Бенчмарки Gemini 3.1 pro

Обратите внимание на:
— Прошла hle на 44.4%
— ARC-AGI-2 77.1% – это большой отрыв
— SWE-Bench 80.6%, что хуже чем у последней Opus на 0.2%
— LiveCodeBench Pro — 2887

#Стрим
Автор — @Geometry90
👍1
В рейтинге Artificial Analysis новая Gemini 3.1 Pro Preview набрала 57 баллов и заняла первое место.

Отрыв от конкурентов небольшой,
но уверенный.

#Стрим
Автор — @Geometry90
👍1
Судя по графику (Omniscience Hallucination Rate), уровень галлюцинаций у новой модели заметно снизился.

Отличный результат!

#Стрим
Автор — @Geometry90
👍1
А вот на Chatbot Arena в категории работы с текстом (Text Arena) Gemini 3.1 Pro Preview пока стартует только с 3-го места.

#Стрим
Автор — @Geometry90
👍1
В категории кодинга (Code Arena / Agentic Webdev) она вообще оказалась на 6-м месте. Получается, новая Gemini доминирует далеко не везде.

Как так-то? 😱

#Стрим
Автор — @Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Зато бенчмарк ARC-AGI-1 новая Gemini 3.1 Pro порвала!

Тест пройден практически полностью. (96%)

Там модель бьётся в потолок, выжимать из этого бенчмарка буквально больше нечего. Пока-пока arc agi 1.

#Стрим
Автор — @Geometry90
👍1