Gemini 3.1 Pro — обзор спустя 2 недели. Всё не так как хотелось бы. — Это моё мнение. Я не строю из себя эксперта!
Я хотел написать этот обзор через 3 дня после релиза. Тогда впечатления были совсем другие. Но решил подождать, потестить плотнее, и правильно сделал. За эти 2 недели многое выяснилось и многое разочаровывает.
Мышление переработали.
Систему мышления улучшили. Модель по-другому подходит к задачам, пытается глубже разбирать проблемы. DeepMind целенаправленно тренируют её понимать мир, мультимодальность, пространственное мышление. Направление правильное, я считаю.
Но по факту одно подтянули, другое уронили. Тексты стали однообразнее и суше чем у 3.0 Pro, креативность просела, некоторые говорят что даже хуже 2.5 Pro. Математика отдельная история. Это не улучшение, это перебалансировка которая привела к таким потерям. Ну я так думаю.
Контекст стал сильнее и по инструментам тоже подтянули. Но она всё равно как слепая, не слушается вообще. Говоришь ей одно, она делает по-своему. Это пипец честно.
Кстати, детальные промты ещё что-то делают.
С детального, прям расписанного промта модель может выдать ваншот-имбу. ИНОГДА. Это правда. Простых промтов ей недостаточно. Но нестабильность никуда не делась, может выдать что то совершенное, а может дать полную дичь. Эта модель в первую очередь верит себе а не вам, она просто делает то, что ей вдумается. Я уже об этом писал и от этого не отступаю.
До релиза, когда я тестил 3.1 Pro, фронтенд был лучше вообще всего что я видел. Серьёзно. А что сейчас? Сейчас она выдаёт полный бред. Хуже чем 3.0 Pro. Не в качестве SVG, она не учитывает банальные вещи, такие как, например, освещение в проекции 3д комнаты и так далее. Даёт сырой результат, хотя промт вроде нормальный и другие модели щёлкают такие задачи. Модель тупо отупела, по-другому не скажешь. Тот же промт, те же условия, а результат в разы слабее чем на старте. Бляяя... Я постоянно гоняю один и тот же SVG промт чтобы быстро проверять состояние модели, и разница между релизом и сейчас прям видна. Что за фигня?
Ладно. Что же произошло после релиза?
Через 2-3 дня качество начало падать. Скорость мышления упала с 90 до 50 токенов в секунду. Лимиты ВТИХУЮ порезали даже для Ultra. Вот например Deep Think у меня с Ultra подпиской постоянно выдает «Something went wrong». БРЕД.
И по API модели тоже кастрируют. Для продакшена это вообще ненормально, люди на этом строят реальные продукты, а тут стабильности ноль.
Есть человек в конторе lyra который давал доступ к ранним версиям 3.1 Pro. И он прямо говорит в ДС: они в итоге выбрали самую «сбалансированную» версию. Ну не знаю, регресс на глазах. Я в это верю. Самое лучшее время для Gemini это когда её можно потестить до релиза. Там она выдаёт такое, что другие модели месяцами будут догонять, хотя опять же, это просто типа получше чем сейчас, но все проблемы остаются. Потом выходит в релиз и начинается деградация условно во всех аспектах.
Это не самовнушение и никому не кажется. Вы видели чтобы GPT или Claude настолько тупели после релиза что их невозможно юзать? С ними качество стабильное, как на релизе было хорошо так и потом хорошо. А с Gemini это повторяется каждый раз начиная с конца 2025-го.
Тем временем GPT 5.4 вышел с миллионом контекста. (Кстати тоже много шума — это совсем не идеальная модель для коддинга, опус все ещё король по моему опыту, так что... openAI вроде и куда надо потянуло, но вроде и не туда) Opus 4.6 во фронтенде лучше тупой Gemini 3.1 Pro. ПРАВДА. Я снова не про SVG, я писал выше, почему так, просто почитайте этот текст снова. Конкуренция не ждёт пока Google со своими серверами разберётся, ну я верю что они нагонять, но это какая-то фигня уже.
#Щитпост / #Мысли
🌌 Geometry90
Я хотел написать этот обзор через 3 дня после релиза. Тогда впечатления были совсем другие. Но решил подождать, потестить плотнее, и правильно сделал. За эти 2 недели многое выяснилось и многое разочаровывает.
Мышление переработали.
Систему мышления улучшили. Модель по-другому подходит к задачам, пытается глубже разбирать проблемы. DeepMind целенаправленно тренируют её понимать мир, мультимодальность, пространственное мышление. Направление правильное, я считаю.
Но по факту одно подтянули, другое уронили. Тексты стали однообразнее и суше чем у 3.0 Pro, креативность просела, некоторые говорят что даже хуже 2.5 Pro. Математика отдельная история. Это не улучшение, это перебалансировка которая привела к таким потерям. Ну я так думаю.
Контекст стал сильнее и по инструментам тоже подтянули. Но она всё равно как слепая, не слушается вообще. Говоришь ей одно, она делает по-своему. Это пипец честно.
Кстати, детальные промты ещё что-то делают.
С детального, прям расписанного промта модель может выдать ваншот-имбу. ИНОГДА. Это правда. Простых промтов ей недостаточно. Но нестабильность никуда не делась, может выдать что то совершенное, а может дать полную дичь. Эта модель в первую очередь верит себе а не вам, она просто делает то, что ей вдумается. Я уже об этом писал и от этого не отступаю.
До релиза, когда я тестил 3.1 Pro, фронтенд был лучше вообще всего что я видел. Серьёзно. А что сейчас? Сейчас она выдаёт полный бред. Хуже чем 3.0 Pro. Не в качестве SVG, она не учитывает банальные вещи, такие как, например, освещение в проекции 3д комнаты и так далее. Даёт сырой результат, хотя промт вроде нормальный и другие модели щёлкают такие задачи. Модель тупо отупела, по-другому не скажешь. Тот же промт, те же условия, а результат в разы слабее чем на старте. Бляяя... Я постоянно гоняю один и тот же SVG промт чтобы быстро проверять состояние модели, и разница между релизом и сейчас прям видна. Что за фигня?
Ладно. Что же произошло после релиза?
Через 2-3 дня качество начало падать. Скорость мышления упала с 90 до 50 токенов в секунду. Лимиты ВТИХУЮ порезали даже для Ultra. Вот например Deep Think у меня с Ultra подпиской постоянно выдает «Something went wrong». БРЕД.
И по API модели тоже кастрируют. Для продакшена это вообще ненормально, люди на этом строят реальные продукты, а тут стабильности ноль.
Есть человек в конторе lyra который давал доступ к ранним версиям 3.1 Pro. И он прямо говорит в ДС: они в итоге выбрали самую «сбалансированную» версию. Ну не знаю, регресс на глазах. Я в это верю. Самое лучшее время для Gemini это когда её можно потестить до релиза. Там она выдаёт такое, что другие модели месяцами будут догонять, хотя опять же, это просто типа получше чем сейчас, но все проблемы остаются. Потом выходит в релиз и начинается деградация условно во всех аспектах.
Это не самовнушение и никому не кажется. Вы видели чтобы GPT или Claude настолько тупели после релиза что их невозможно юзать? С ними качество стабильное, как на релизе было хорошо так и потом хорошо. А с Gemini это повторяется каждый раз начиная с конца 2025-го.
Тем временем GPT 5.4 вышел с миллионом контекста. (Кстати тоже много шума — это совсем не идеальная модель для коддинга, опус все ещё король по моему опыту, так что... openAI вроде и куда надо потянуло, но вроде и не туда) Opus 4.6 во фронтенде лучше тупой Gemini 3.1 Pro. ПРАВДА. Я снова не про SVG, я писал выше, почему так, просто почитайте этот текст снова. Конкуренция не ждёт пока Google со своими серверами разберётся, ну я верю что они нагонять, но это какая-то фигня уже.
ЭТО 1 ЧАСТЬ! 2 ЧАСТЬ НИЖЕ
#Щитпост / #Мысли
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔3 2
Мой прогноз. Несмотря на всё, тут интересно ребята, почитайте.
Я разочарован текущим состоянием, но вижу куда они идут. Направление правильное, а вот исполнение качества хромает.
По-моему, SVG это не просто прикольная фича. SVG показывает насколько модель понимает мир, знает как выглядят объекты, места, пропорции. Gemini 3.1 это шаг к Gemini 3.5, без которого не будет максимального прироста в вижене. Текущий вижен у 3.1 при этом не самый мощный, я в январе видел модель с вижном сильнее раза в 4. Какая-то тестовая версия.
Что делали параллельно с фиксами? Улучшили архитектуру мышления. Забалансили, провели RL обучение, (ту технологию что обкатывали на 3.0 Flash). Но крутой вижен из январской версии в 3.1 или 3.5 не вложили. Видимо придержали. Он будет чуть дальше.
Связь с VEO 4
Ну Демис намекал на то, что VEO 4 будет работать как Nano Banana, (Gemini 3.0 pro image). Вероятно выйдет на базе Gemini 3.5. Для этого 3.5 должна очень хорошо понимать мир чтобы генерировать реалистичные кадры. Поэтому мувы с SVG и пониманием мира не зря. Gemini 3.5 будет фундаментом для VEO 4. (Gemini 3.5 pro video?)
Что по итогу? Видимо обзор у меня совсем не получился.
Gemini 3.1 Pro сейчас годится для SVG и разовых запросов с детальными промтами. Для долгой работы нестабильно, для продакшена по API рискованно. Модель уникальна в своих сильных сторонах но как продукт на каждый день, разочарование.
Если к Google I/O не исправят текущие проблемы, тогда уже реально можно засирать без оговорок. Сколько можно давать шансы?
#Щитпост / #Мысли
🌌 Geometry90
Я разочарован текущим состоянием, но вижу куда они идут. Направление правильное, а вот исполнение качества хромает.
По-моему, SVG это не просто прикольная фича. SVG показывает насколько модель понимает мир, знает как выглядят объекты, места, пропорции. Gemini 3.1 это шаг к Gemini 3.5, без которого не будет максимального прироста в вижене. Текущий вижен у 3.1 при этом не самый мощный, я в январе видел модель с вижном сильнее раза в 4. Какая-то тестовая версия.
Что делали параллельно с фиксами? Улучшили архитектуру мышления. Забалансили, провели RL обучение, (ту технологию что обкатывали на 3.0 Flash). Но крутой вижен из январской версии в 3.1 или 3.5 не вложили. Видимо придержали. Он будет чуть дальше.
Связь с VEO 4
Ну Демис намекал на то, что VEO 4 будет работать как Nano Banana, (Gemini 3.0 pro image). Вероятно выйдет на базе Gemini 3.5. Для этого 3.5 должна очень хорошо понимать мир чтобы генерировать реалистичные кадры. Поэтому мувы с SVG и пониманием мира не зря. Gemini 3.5 будет фундаментом для VEO 4. (Gemini 3.5 pro video?)
Что по итогу? Видимо обзор у меня совсем не получился.
Gemini 3.1 Pro сейчас годится для SVG и разовых запросов с детальными промтами. Для долгой работы нестабильно, для продакшена по API рискованно. Модель уникальна в своих сильных сторонах но как продукт на каждый день, разочарование.
Если к Google I/O не исправят текущие проблемы, тогда уже реально можно засирать без оговорок. Сколько можно давать шансы?
#Щитпост / #Мысли
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔2 1
Вам стоит запомнить эти слова.
🤖 Я считаю, что Claude Sonnet 4.6 — это по факту уже Sonnet 5.
И эта модель деградировала в плане стиля письма и самого общения. Я в лоб сравнил её с Sonnet 4.5 и сделал вывод: Opus 5 будет точно таким же — менее эмпатичным, деревянным, и общаться с ним будет тупо сложнее...
#Щитпост / #Мысли
🌌 Geometry90
И эта модель деградировала в плане стиля письма и самого общения. Я в лоб сравнил её с Sonnet 4.5 и сделал вывод: Opus 5 будет точно таким же — менее эмпатичным, деревянным, и общаться с ним будет тупо сложнее...
#Щитпост / #Мысли
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔3 1 1
На это уже довольно прозрачно намекают сотрудники компании в X.
Если догадки подтвердятся, это может стать следующим шагом в развитии мультимодальных возможностей ChatGPT: обработка видео, аудио и другие новые сценарии использования.
Ну а для Google это точно не самый приятный сигнал.
— Источник с подобным намёком.
#Новости / #Инсайд
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Светлый Уголок | ии
Снова мои жалобы. ✴️ Пользоваться Gemini стало безнадёжным делом. Я даже сразу же дам вам свой прогноз: сейчас, вероятно, произошёл максимально крутой отток активных пользователей. Приложение Gemini стало абсолютно невыносимым с технической точки зрения.…
У меня есть хорошие новости, возможно, что Google начинают возвращать свой прайм. (В плане продуктов). Подробностей не могу дать.
Это настоящая утечка от Google — добавление поддержки Gemma 4 в их фреймворк LiteRT-LM через официальный внутренний инструмент Copybara.
Источник.
#Новости / #Инсайд
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥1
Светлый Уголок | ии
Есть человек, который может иметь связи с сотрудниками Google: у него всегда имеется не просто эксклюзивная информация, но даже доступ к скрытым моделям.
На изображении можно увидеть неподтвержденный инсайд о том, что на этот раз максимальный размер модели может составлять около 120 миллиардов параметров, при этом 15 миллиардов — активны. Для сравнения, у прошлых Gemma 3 максимальный размер составлял 27 миллиардов параметров
#Новости / #Инсайд
🌌 Geometry90
На изображении можно увидеть неподтвержденный инсайд о том, что на этот раз максимальный размер модели может составлять около 120 миллиардов параметров, при этом 15 миллиардов — активны. Для сравнения, у прошлых Gemma 3 максимальный размер составлял 27 миллиардов параметров
#Новости / #Инсайд
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥3
Forwarded from ✨AI Watchtower✨ (Arena Overseer)
🆕 New Google AI models available:
• gemini-embedding-2-preview
• gemini-embedding-2-preview
❤🔥1
✨AI Watchtower✨
🆕 New Google AI models available: • gemini-embedding-2-preview
Честно говоря, я знал что у Google есть такие модели. Но не знал, что они будут обновляться... Ладно, ждём новостей.
❤🔥1
Светлый Уголок | ии
Сейчас смотрю видео документального фильма THE THINKING GAME, созданного DeepMind, посвящённому пути основателя компании Демиса Хассабиса и его команды в создании искусственного общего интеллекта (AGI). Честно говоря я фигею, тут есть спойлеры, а так же,…
У того ролика уже 440 млн просмотров!
Ещё раз напомню и настоятельно советую глянуть видео The Thinking Game.
Я всегда буду повторять: DeepMind — это просто топовая, самая мощная исследовательская ИИ-компания.
Но вот что странно: при таком уровне DeepMind, почему Gemini сейчас переживает явно не лучшие времена?
Ещё раз напомню и настоятельно советую глянуть видео The Thinking Game.
Я всегда буду повторять: DeepMind — это просто топовая, самая мощная исследовательская ИИ-компания.
Но вот что странно: при таком уровне DeepMind, почему Gemini сейчас переживает явно не лучшие времена?
🌌 Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
✨AI Watchtower✨
🆕 New Google AI models available: • gemini-embedding-2-preview
Посмотрите на картинки — для неё даже бенчмарки сделали!
Ниже есть ссылка с готовым блогом, там можно почитать подробнее.
— Блог
🌌 Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥1
Один чувак спросил у Логана Киллед патрика из Google, почему забросили планировку с Exp и Preview версиями, ведь по старому шаблону 3.1 уже должна быть в GA, а 3.5 уже на подходе.
Логан ответил прямо — процесс в этом году изменился, большие версии выходят два раза в год примерно в декабре и мае, а между ними теперь идут промежуточные апдейты 3.1 потом 3.2 потом 3.3 вместо старых датированных моделей. По крайней мере я так понял.
Google больше не будет прыгать сразу на 3.5 или 4.0 — они качают каждую версию итерациями и планка для GA высокая поэтому торопиться не будут.
И да, Логан не убивал Патрика, но убил старые preview-версии — покойны Exp модели 2025 года.
🌌 Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
Светлый Уголок | ии
Пообещал, что исправит всякие проблемы с галлюцинациями.
Ну, по крайней мере, они долго молчали. Насчёт того, сдержит слово или нет, — не знаю, но сам факт того, что хоть кто-то ответил на это, уже даёт знак.
Ну, по крайней мере, они долго молчали. Насчёт того, сдержит слово или нет, — не знаю, но сам факт того, что хоть кто-то ответил на это, уже даёт знак.
❤🔥1
xAI открыли доступ к Grok 4.20. Главное нововведение — мультиагентная модель. Галлюцинации снизились с ~12% до ~4% — так заявлено на веб-странице docs.x.ai
Стоит $2/$6 за миллион токенов — это В x10 ДОРОЖЕ если считать от Grok 4.1. Кто потестил, говорят на тяжёлых задачах разница есть. Для простого — проще на 4.1 сидеть.
Я так и не сделал обзора на эту модель. Ну вот вам мини обзор, но учтите что здесь не всё перечислено.
Она разочаровала меня тем, что ошибается в коде и всё ещё мешает воду с английским языком, когда просят на русском отвечать. Но модель стала эмпатичнее, однако отвечает нестабильно и выдумывает больше — я считаю это галлюцинациями, а не снижением.
🌌 Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥1
Светлый Уголок | ии
Ах, да. Ещё Grok 420 получил полноценное обновление вместе с релизом в API, так что нужно будет протестировать.
Значит это v8.
Значит это v8.
🌌 Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥1
Светлый Уголок | ии
Пообещал, что исправит всякие проблемы с галлюцинациями. Ну, по крайней мере, они долго молчали. Насчёт того, сдержит слово или нет, — не знаю, но сам факт того, что хоть кто-то ответил на это, уже даёт знак.
Логан уже намекнул, что в четверг они что-то выпустят.
Возможно, это серия Gemma 4?
🌌 Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM