На сайте Artificial Analysis засветилось упоминание Gemini 3.1 Preview.
Хм.
Это реально первый раз, когда Google выкатывает промежуточную «x.1» в таком формате. Раньше такого не было. Выглядит как попытка закрыть дыры в репутации после того, как 3 Pro так и не вышла из превью нормально.
И тут есть мысль. Gemini 3 Pro в последнее время стала работать заметно слабее. Совпадение? Возможно нет. Ослабили старую, чтобы новая 3.1 выглядела как серьёзный апгрейд. Вопросы есть.
Источник
#Новости / #Инсайд
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥3
А если быть честным, то модель уже замечена в продуктах Google.
Это будет быстрое внедрение. Если не сегодня, то завтра, но это случится уже на этой неделе.
Источник
Также OpenAI тоже должна выпустить свой продукт — это либо GPT-5.3, либо музыкальная модель. Но Google тоже припасла свою собственную модель, про которую все забыли — Lyria 2/3.
#Новости
Подписаться: t.me/Geometry90
Это будет быстрое внедрение. Если не сегодня, то завтра, но это случится уже на этой неделе.
Источник
Также OpenAI тоже должна выпустить свой продукт — это либо GPT-5.3, либо музыкальная модель. Но Google тоже припасла свою собственную модель, про которую все забыли — Lyria 2/3.
#Новости
Подписаться: t.me/Geometry90
Извините, я не много не успеваю, поэтому заново опубликую некоторые посты сегодня, что бы улучшить качество поставки новостей.
👌3
https://t.me/Geometry903/3
Создал временную группу.
https://t.me/Geometry903
https://t.me/Geometry903
https://t.me/Geometry903
Там выложу свежие посты, которые ещё нигде не публиковались — у каждого два варианта. Надо выбрать, какой заходит лучше.
Зачем? — Адаптация.
Хочу понять, как вам удобнее читать — развёрнуто с моими мыслями или коротко по фактам. Ваши голоса реально повлияют на формат ЭТОГО канала.
Как это работает:
Вы оцениваете так, как вам хочется. Ну, думаю вы поймёте в чем суть этих 2 постов.
После этого все посты выйдут здесь в основном канале. Но один важный пост выложу сегодня сюда отдельно — не пропустите.
#Щитпост
Please open Telegram to view this post
VIEW IN TELEGRAM
Telegram
Черный уголёк — временный канал.
Проголосуйте какой вариант лучше в опроснике, опросы анонимные.
Поставьте оценку этому посту с помощью 2 доступных всем реакций:
👍 Ок 👎 Не ок
Спасибо за оценку!
Поставьте оценку этому посту с помощью 2 доступных всем реакций:
👍 Ок 👎 Не ок
Спасибо за оценку!
👍2
IMO-ProofBench Advanced — самый жёсткий тест.
Я всегда говорил — у Google есть модели помощнее. Они либо экономили, либо делали кое-что другое. Пока OpenAI выкатывали версию за версией и набирали по 7%... 28%... 35%... — DeepMind тихо собирали агентную систему, которая выдала 92% и попутно решила несколько открытых задач Эрдёша. Задач, которые люди не могли закрыть годами.
Три месяца между GPT-5.1 (7%) и Aletheia (92%). Это не конкуренция — это демонстрация того, что Google просто ждали момента. И дождались.
Источники:
— Официальный релиз DeepMind
— Мой пост с тем инсайдом
Источник
#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥3
Важная иформация о модели:
• Скорость: 50–100 tps
• SWE-Bench Verified: 80.2
• Фронтенд: отлично / Бэкенд: удовлетворительно
• Заточена под агенты, кодинг, поиск, tool use.
Честно:
По бенчмаркам она обходит кучу топовых моделей. На бумаге — уровень Claude 4.5 Opus. Но на практике уступает, и это нормально, потому что бенчмарки и реальные задачи это две разные вещи. Зато дешевле в 10–20 раз. А для многих задач этого хватает с головой!!!
Источники:
— Юзать официально.
— Официальный релиз: пост от @MiniMax_AI.
— Первый спот: где её заметили до анонса.
— Мини критика и сравнение с GLM-5
Моё мнение по китайским моделям в целом: Догоняют, местами обгоняют, и темп у них бешеный. Но пока не хватает стабильности на длинных задачах и репутации. Большие компании всё ещё боятся ставить на них в проде, и их можно понять.
Но если так пойдёт дальше — через полгода разговор будет уже другой.
Кто пробовал через их агент? Как ощущения на реальных задачах? Пишите в комменты.
#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥1 1 1 1
Помните, я писал про «истину» и папку в репозитории? Теперь всё официально — они представили Aletheia.
Цифры и механика (для вашей осведомленности):
• 91.9% на IMO-ProofBench Advanced — новый рекорд. Один из самых жёстких тестов на доказательства в стиле Межнара по математике.
• Движок — Gemini Deep Think. Решение строится в три этапа: генерация → верификация → корректировка.
• При этом работает лучше и дешевле, чем сама Gemini Deep Think Advanced в чистом виде. Агентная обвязка тут реально даёт выигрыш, а не просто обёртка.
Что уже сделала помимо бенчмарков:
— Решила 4 открытых задачи из списка Эрдеша (Эпштейна). Одна из них вообще не была закрыта ни в какой литературе до этого.
— Автономно написала статью с правильными математическими результатами.
— Помогала реальным математикам в написании не-игрушечных научных работ.
Моё мнение:
Google подчёркивают, что Aletheia — пруф того, что законы масштабирования всё ещё работают. Даже на доказательной математике качество растёт не за счёт тупого наращивания параметров, а за счёт архитектуры рассуждений. Умнее агент — лучше результат за меньшие деньги.
Помните папку Aletheia в репозитории superhuman? Я писал, что ждём мощный анонс. Ну вот он.
P.s — Позже сегодня на том же движке вышла обновлённая Gemini 3 Deep Think — набрала 84.6% на ARC-AGI-2, лучший результат на данный момент.
Источники:
— Официальный релиз DeepMind
— Мой пост с инсайдом про superhuman
Кто верил, что задачи Эрдеша закроют настолько быстро? Пишите в комменты.
#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2 2 2 2
Forwarded from Нейронавт | Нейросети в творчестве
Итак, тест ARC-AGI-2 пройден Gemini 3 Deep Think
Франсуа Шолле, создатель тестов ARC-AGI, говорит, что уже работает над версией 4. Всего будет около 7 версий.
ARC-AGI-3 выйдет в марте.
ARC-AGI-4 будет связан с играми.
ARC-AGI-5 уже в планах.
ARC-AGI-6 и 7, вероятно, последние версии
Человеки: создают тест на AGI
ИИ: проходит тест
Человеки: создают новый более сложный тест
ИИ: проходит тест
Человеки: да когда же уже AGI?!
#news
Франсуа Шолле, создатель тестов ARC-AGI, говорит, что уже работает над версией 4. Всего будет около 7 версий.
ARC-AGI-3 выйдет в марте.
ARC-AGI-4 будет связан с играми.
ARC-AGI-5 уже в планах.
ARC-AGI-6 и 7, вероятно, последние версии
Человеки: создают тест на AGI
ИИ: проходит тест
Человеки: создают новый более сложный тест
ИИ: проходит тест
Человеки: да когда же уже AGI?!
#news
❤🔥1
Нейронавт | Нейросети в творчестве
Итак, тест ARC-AGI-2 пройден Gemini 3 Deep Think Франсуа Шолле, создатель тестов ARC-AGI, говорит, что уже работает над версией 4. Всего будет около 7 версий. ARC-AGI-3 выйдет в марте. ARC-AGI-4 будет связан с играми. ARC-AGI-5 уже в планах. ARC-AGI…
Шолле планирует 7 версий ARC-AGI.
По сути, человек публично признаёт: чтобы доказать отсутствие AGI, ему нужно ещё минимум 5 попыток. Темп, с которым модели ломают эти бенчмарки, растёт быстрее, чем темп их создания. Математика тут не на стороне скептиков.
Кстати, настоящий ARC-AGI-3 можно попробовать здесь.
Только представьте, что ближе к Марту модели уже смогут проходить его на 20-30% при старте.
Хроники AGI:
ИИ: проходит невозможный тест
Люди: срочно придумывают тест еще сложнее.
Также люди: «Ну тупы-ы-ые!»
А что думаете вы?
#Новости
Подписаться: t.me/Geometry90
По сути, человек публично признаёт: чтобы доказать отсутствие AGI, ему нужно ещё минимум 5 попыток. Темп, с которым модели ломают эти бенчмарки, растёт быстрее, чем темп их создания. Математика тут не на стороне скептиков.
Кстати, настоящий ARC-AGI-3 можно попробовать здесь.
Только представьте, что ближе к Марту модели уже смогут проходить его на 20-30% при старте.
Хроники AGI:
ИИ: проходит невозможный тест
Люди: срочно придумывают тест еще сложнее.
Также люди: «Ну тупы-ы-ые!»
А что думаете вы?
#Новости
Подписаться: t.me/Geometry90
Я просто в шоке от Gemini 3.1 DeepThink и того что она творит 😱
Посмотрите на ASCII арты. Не одна модель не справляется с этим, эта же, просто прекрасно понимает как это делать.
Посмотрите на ASCII арты. Не одна модель не справляется с этим, эта же, просто прекрасно понимает как это делать.
❤🔥5 3
Возможно, они вносят последние корректировки, ожидается, что и Gemini 3.1, и ChatGPT5.3 выйдут на следующей неделе.
А что вы больше всего ждёте?
#Инсайд
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥5 2 1
Сейчас существуют:
• Seed 2 Pro — Для всех задач
• Seed 2 Code — Быстрая, agentic для кода.
• Seed 2 Lite — Упрощённая версия
• Seed 2 Mini — Самая лёгкая версия.
Pro поддерживает глубокое рассуждение (deep reasoning). Модели линейки Seed 2 получили качественную мультимодальность, обработку данных и точный вывод
Даже так, теперь эти модели дешевле ВСЕХ ближайших конкурентов.
#Новости
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Источник
Судя по всему, DeepSeek V4 выкатят уже на следующей неделе. И походу это первый раз, когда open-source модель реально встаёт вровень с закрытыми Сотами.
Короче, что я хочу сказать.
Я наблюдаю за этим и пока наблюдал у меня сформировалось мнение на этот счёт:
Китайцы не просто догоняют. Они придумывают новые архитектуры, а не тупо заливают всё вычислительной мощностью. DeepSeek — это про умные инженерные решения: модель будет весить сравнительно мало, а контекст держать на уровне 1М токенов. Мы с вами уже смотрели на предполагаемый DeepSeek V4 Lite — даже на неофициальном графике было видно, как он хорошо контекст тянет.
Но. С момента выхода Gemini 3 Pro и Opus 4.5 прошло уже 2–3 месяца. И только щас китайцы подтягиваются к этому уровню.
Gemini 3.0 сама по себе спорная для реальных задач, но разрыв есть — стабильные 2–3 месяца отставания. Сокращают его умными решениями, не скейлингом, но всё равно отстают.
Теперь про главную проблему, о которой мало говорят.
У китайцев нет данных — у Google бесконечный интернет, поиск, ютуб, вся экосистема. У OpenAI партнёрства с кучей издательств. В Китае полтора миллиарда людей и свой интернет, ок, но по объёму и разнообразию это не то же самое что весь западный веб.
И отсюда растёт то, что скоро станет главной войной — юридической. Потому что тот же GLM-5, (Minimax M2.2, Kimi k2.5) — кринж. Модель обучалась на дистиллированных ответах Opus 4.5. Она иногда отвечает что она Claude, а не GLM. Это не слух, это видели кучу людей.
Да, это нечестно. Да, это нарушение условий. Но а что им делать? Данных меньше, доступ к железу порезан санкциями, гонку сливать нельзя. Дистилляция чужих моделей — по сути единственный быстрый способ закрыть разрыв.
Стоит сделать вывод: либо западные компании начнут судиться и закручивать API, либо просто смирятся. Модели в открытом доступе и веса нахуй утекают, этот процесс уже не остановить.
Следующая неделя покажет, на что способен DeepSeek. МНЕ Будет интересно. Вам то самим будет интересно?...
#Новости / #Мысли
Подписаться: t.me/Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥5