Forwarded from Светлый Уголок | ии
А вот на Chatbot Arena в категории работы с текстом (Text Arena) Gemini 3.1 Pro Preview пока стартует только с 3-го места.
#Стрим
Автор — @Geometry90
#Стрим
Автор — @Geometry90
👍1
Forwarded from Светлый Уголок | ии
В категории кодинга (Code Arena / Agentic Webdev) она вообще оказалась на 6-м месте. Получается, новая Gemini доминирует далеко не везде.
Как так-то?😱
#Стрим
Автор — @Geometry90
Как так-то?
#Стрим
Автор — @Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Forwarded from Светлый Уголок | ии
Зато бенчмарк ARC-AGI-1 новая Gemini 3.1 Pro порвала!
Тест пройден практически полностью. (96%)
Там модель бьётся в потолок, выжимать из этого бенчмарка буквально больше нечего. Пока-пока arc agi 1.
#Стрим
Автор — @Geometry90
Тест пройден практически полностью. (96%)
Там модель бьётся в потолок, выжимать из этого бенчмарка буквально больше нечего. Пока-пока arc agi 1.
#Стрим
Автор — @Geometry90
👍1
Forwarded from Светлый Уголок | ии
Gemini 3.1 Pro стала менее эмоциональной и креативной, чем 3.0 Pro.
В некоторых случаях даже хуже 2.5 pro.
Этому поспособствовало снижение количества галлюцинаций.
Некоторые пользователи отмечают, что текст стал ужасным и однообразным.
#Новости
Автор — @Geometry90
В некоторых случаях даже хуже 2.5 pro.
Этому поспособствовало снижение количества галлюцинаций.
Некоторые пользователи отмечают, что текст стал ужасным и однообразным.
#Новости
Автор — @Geometry90
👎1
Gemini 3.1 стала хуже в математике.
Буквально:
У меня уже возникла проблема, когда я попросил модель решить задачку уровня 7-го класса — она не смогла решить её правильно.
Вдобавок:
Если попросить модель сложить
9+10, то в некоторых случаях она будет выдавать ТОЛЬКО 21. Дожили.
Это единичный случай, видимо, проблема в том, что она считает, что ты спрашиваешь про какой-то там мем «21».
А вчера она выдала мне 2 + 2 = 5 спустя 3–4 запроса. Я обсуждал с ней другой новый мем и решил уточнить, сколько будет 2 + 2, на что она ответила: «5». Когда я спросил «почему?», она заявила, что просто "подыгрывала", "ну мы же ведь шутили".
AGI, не иначе!
Буквально:
У меня уже возникла проблема, когда я попросил модель решить задачку уровня 7-го класса — она не смогла решить её правильно.
Вдобавок:
Если попросить модель сложить
9+10, то в некоторых случаях она будет выдавать ТОЛЬКО 21. Дожили.
Это единичный случай, видимо, проблема в том, что она считает, что ты спрашиваешь про какой-то там мем «21».
А вчера она выдала мне 2 + 2 = 5 спустя 3–4 запроса. Я обсуждал с ней другой новый мем и решил уточнить, сколько будет 2 + 2, на что она ответила: «5». Когда я спросил «почему?», она заявила, что просто "подыгрывала", "ну мы же ведь шутили".
AGI, не иначе!
👎1
Сам илон Маск об этом сегодня заявил.
Если проанализировать планы xAI, становится ясно: они хотят сделать реальный качественный скачок, сравнимый с переходом Gemini на 3.1 или GPT на 5.2. Эту версию нам обещают уже месяцев семь, и задержка явно не случайна.
Илон выкатил ранний чекпоинт V6 и теперь специально хочет увидеть, что выпустит OpenAI, и после этого зарядить (v7) Beta 2. И это даже не самая сильная версия — если 4.20 Beta 2 не обойдёт GPT 5.3, он будет качать grok 4.20 дальше.
Не забываем, что xAI параллельно обучают и GROK 5.
Интересный факт по поводу текущей версии: выяснилось, что иногда роутер перекидывает запросы на старую 4.1. Заметить это легко: если модель вообще не "думает", а выдает ответ моментально — перед вами 4.1.
🤖 При этом нам моем опыте Grok 4.20 beta 1 (v6) уже показывает приличные результаты:
— Модель получила формат мышления с агентами, что дало буст к логике. Не буду расписывать механику, но по факту модель там одна, просто система заставляет ее симулировать общение с несколькими агентами.
— Стало в разы меньше воды, если вы сами не просили расписывать подробно.
— Заметно подтянули грамотность на русском языке.
— Уровень объяснений дотягивает до GPT-5, хотя иногда все еще может придумывать факты и собирать сплетни.
— Модель научилась спорить с пользователем в спорных моментах.
— Отлично держит контекст, разбирается в деталях и учитывает пожелания из промптов.
После релиза Grok 4.20 beta 2 сделаю полный обзор с окончательным вердиктом. А следующий пост хочу посвятить самому Илону Маску — есть вопросы к его поведению в последнее время, которое мне не нравится.
— Принцип роутера
— Источник Leaks от Илона Маска
Снова ждем Grok 4.20.
#Новости / #Мысли
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Как я понимаю, нас действительно ждет GPT 5.4, а не просто 5.3.
Сегодня 25-е число, с момента того твита прошла ровно неделя, и кажется, что почти никто не выкупил тонкий намек от главного разработчика Codex из OpenAI (Tibo). Судя по его цепочке, скоро нас ждет версия 5.4 и серьезные улучшения!
Моя теория такая: разраб намекает, что 5.3 будет чисто версией для Codex. А вот 5.4 выйдет уже как полная линейка — с моделями Pro, Thinking и остальными плюшками. Codex же обновится до 5.4 чуть позже. Ну и допом, такие вот мувы от разработчиков в codex.
Короче, ждем четверга, он уже завтра!
— Тот самый пост с намёком
#Новости
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Урвать его сейчас трудно. Видимо, конкретно этим способом пользуются уже многие, поэтому будьте готовы ждать генерацию одного ролика от 30 до 120 минут. Разработчики самой модели ввели строгие ограничения (вайтлисты).
Переходите по реферальной ссылке и регистрируйтесь. Вход доступен через Google или любую другую удобную вам почту.
Можно выбрать длительность до 15 секунд, использовать референсы в виде изображений и так далее.
Присылайте свои результаты в комментарии!
#Новости
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Как вы решились на такие радикальные меры? Что вы творите мрази!?
Извините... Но текст получился эмоциональным, так как его автор — фанат Gemini.
Итоги начала года для Google:
Однако спустя 2–3 дня после релиза начался заметный спад производительности. Скорость генерации токенов мышления у Gemini 3.1 упала с 90 до 50 токенов в секунду — ЭТО медленно. А ещё оно урезано. Поэтому так получается.
Снижение лимитов (Antigravity):
– Резкое урезание лимитов даже для подписчиков Ultra.
– Постоянные намеренные ошибки сервера при работе с Gemini 3.1 Pro.
Ограничения затронули AI Studio, Google Gemini и Vertex.
VERTEX...
Была такая вещь как Vertex Studio — УНИЧТОЖЕНО. Даже для paid юзеров там нет доступа – это так из-за бесконечной квоты.
ДАЖЕ ДЛЯ API НЕТ ГАРАНТИЙ СТАБИЛЬНОСТИ: Вижу что у многих постоянные API ошибки 503. Gemini 3, nano banana pro и т.д.
Как это вообще использовать?
И Gemini App:
– Приложение выдаёт ошибки вне зависимости от региона.
– Даже при выборе fast-модели ответ приходит с задержкой, после чего нужно ещё ждать саму генерацию, и текст выдаётся по кусочкам крайне медленно.
Складывается впечатление, что сотрудникам было поручено намеренно ухудшить качество продуктов из-за чрезмерной нагрузки на серверную инфраструктуру Google. Другого объяснения просто нет.
P.S. — в целом через 4 дня после написания этого поста ситуация немного изменилась в лучшую сторону.
#Новости / #Мысли
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
Forwarded from ✨AI Watchtower✨ (Arena Overseer)
🆕 New Google AI models available:
• gemini-3.1-flash-image-preview
• gemini-3.1-flash-image-preview
Forwarded from Светлый Уголок | ии
Подставляют нас что-ли...
Уже какой день люди ждут релиза, а он всё не наступает.
С Gemini 3 pro так же было.
Греют нас.
Уже какой день люди ждут релиза, а он всё не наступает.
С Gemini 3 pro так же было.
Греют нас.
Forwarded from Светлый Уголок | ии
Я тут понял что nano banana pro ленивая, а nano banana flash верятно нет. Тоже + получается?
Nano Banana 2 — заметное улучшение по сравнению с Nano Banana 1.
Главное: многие изображения получаются даже более качественными, чем у Nano Banana Pro.
Причина — обновлённый САМ генератор изображений.
Я сам это заметил, когда тестировал модель в январе.
В Vertex было сказано:
Однако здесь используется не Gemini 3.1 Flash, а Gemini 3.0 Flash. Я уже отмечал это ранее — и, как ни странно, угадал.
САМОЕ КРУТОЕ КСТАТИ ДОБАВИЛИ ПОИСК ИЗОБРАЖЕНИЙ, ЧТО???
ТЕПЕРЬ МОЖЕТ ИСКАТЬ РЕФЕРЕНСЫ, ДА НУУУ!
PNG не добавили? Проверьте тоже!
Модель стала лучше понимать промты, отрисовка заметно улучшилась, изображения действительно стали круче, но по техническому качеству пока не превосходят Nano Banana Pro.
Модель перестала быть ленивой, результаты более насыщенные.
Так что ждём обновления — вероятно, оно получит название Nano Banana 2 Pro. По сравнению с Flash это будет хорошее улучшение.
#Новости
🌌 Geometry90
Главное: многие изображения получаются даже более качественными, чем у Nano Banana Pro.
Причина — обновлённый САМ генератор изображений.
Я сам это заметил, когда тестировал модель в январе.
В Vertex было сказано:
«Gemini 3.1 Flash Image делает наши самые мощные возможности по созданию изображений доступными для широкого круга пользователей. Улучшено качество изображений, визуальное восприятие, отрисовка длинных текстовых фрагментов на многих языках и достоверность информации».Но! Хитрожопые ребята они.
Однако здесь используется не Gemini 3.1 Flash, а Gemini 3.0 Flash. Я уже отмечал это ранее — и, как ни странно, угадал.
САМОЕ КРУТОЕ КСТАТИ ДОБАВИЛИ ПОИСК ИЗОБРАЖЕНИЙ, ЧТО???
ТЕПЕРЬ МОЖЕТ ИСКАТЬ РЕФЕРЕНСЫ, ДА НУУУ!
PNG не добавили? Проверьте тоже!
Модель стала лучше понимать промты, отрисовка заметно улучшилась, изображения действительно стали круче, но по техническому качеству пока не превосходят Nano Banana Pro.
Модель перестала быть ленивой, результаты более насыщенные.
Так что ждём обновления — вероятно, оно получит название Nano Banana 2 Pro. По сравнению с Flash это будет хорошее улучшение.
#Новости
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Версия 4.20 Beta 1 забрала топ-1 в категории поиска на arena.ai, пока её не сверг Claude 4.6 Opus, который тоже обзавелся веб-поиском.
В текстовых задачах тот 4.20 beta 1 занял 4-е место, но Илон заявляет, что это была лишь самая лёгкая модель из линейки 4.20.
Сегодня уже пятница, а по выходным люди обычно спят, а не релизят ИИ.
Хотите сказать, Маск и правда держит разработчиков в подвале?
Либо у Илона просто есть дистанционный пульт для запуска моделей? Может, именно из-за таких условий недавно одним днём сбежала куча сотрудников?.
Что ожидаете вы?
#Новости / #Инсайд
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Светлый Уголок | ии
Хорошее обновление для антигравити)
"Улучшен интерфейс для блокировки пользователей". 😁
"Улучшен интерфейс для блокировки пользователей". 😁
Я понимаю вас, сам жду их новые модели уже давно, но ничего толком не выходило. Но... судя по всему, ожидание того стоило.
Самое интересное, о чём никогда не говорили в слух, но давным-давно я где-то читал о подобном:
FT пишет, что модель будет нативно поддерживать генерацию картинок, видео и текста.
Они серьёзно поработали вместе с Huawei и Cambricon, чтобы модель нормально работала именно на китайских чипах. Это прямо как Google со своими TPU.
Инсайды Financial Times обычно проверенные, поэтому доверять по сути можно.
Хочу поскорее увидеть ту самую генерацию видео и изображений от DeepSeek.
#Новости / #Инсайд
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1