А вот на Chatbot Arena в категории работы с текстом (Text Arena) Gemini 3.1 Pro Preview пока стартует только с 3-го места.
#Стрим
Автор — @Geometry90
#Стрим
Автор — @Geometry90
В категории кодинга (Code Arena / Agentic Webdev) она вообще оказалась на 6-м месте. Получается, новая Gemini доминирует далеко не везде.
Как так-то?😱
#Стрим
Автор — @Geometry90
Как так-то?
#Стрим
Автор — @Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
Зато бенчмарк ARC-AGI-1 новая Gemini 3.1 Pro порвала!
Тест пройден практически полностью. (96%)
Там модель бьётся в потолок, выжимать из этого бенчмарка буквально больше нечего. Пока-пока arc agi 1.
#Стрим
Автор — @Geometry90
Тест пройден практически полностью. (96%)
Там модель бьётся в потолок, выжимать из этого бенчмарка буквально больше нечего. Пока-пока arc agi 1.
#Стрим
Автор — @Geometry90
🍓4🤔1
Gemini 3.1 Pro стала менее эмоциональной и креативной, чем 3.0 Pro.
В некоторых случаях даже хуже 2.5 pro.
Этому поспособствовало снижение количества галлюцинаций.
Некоторые пользователи отмечают, что текст стал ужасным и однообразным.
#Новости
Автор — @Geometry90
В некоторых случаях даже хуже 2.5 pro.
Этому поспособствовало снижение количества галлюцинаций.
Некоторые пользователи отмечают, что текст стал ужасным и однообразным.
#Новости
Автор — @Geometry90
Сегодня выходит тот самый апдейт для Google AI studio + antigravity.
По крайней мере только для ai.dev
Если Logan Kirkpatrick написал это у себя, (а написал он это впервые), то значит, что будет что-то масштабное.
P.s — что-то долго не выходит.
#Новости
Автор — @Geometry90
По крайней мере только для ai.dev
Если Logan Kirkpatrick написал это у себя, (а написал он это впервые), то значит, что будет что-то масштабное.
P.s — что-то долго не выходит.
#Новости
Автор — @Geometry90
❤🔥2
Forwarded from Светлая комната — архив
Gemini 3.1 стала хуже в математике.
Буквально:
У меня уже возникла проблема, когда я попросил модель решить задачку уровня 7-го класса — она не смогла решить её правильно.
Вдобавок:
Если попросить модель сложить
9+10, то в некоторых случаях она будет выдавать ТОЛЬКО 21. Дожили.
Это единичный случай, видимо, проблема в том, что она считает, что ты спрашиваешь про какой-то там мем «21».
А вчера она выдала мне 2 + 2 = 5 спустя 3–4 запроса. Я обсуждал с ней другой новый мем и решил уточнить, сколько будет 2 + 2, на что она ответила: «5». Когда я спросил «почему?», она заявила, что просто "подыгрывала", "ну мы же ведь шутили".
AGI, не иначе!
Буквально:
У меня уже возникла проблема, когда я попросил модель решить задачку уровня 7-го класса — она не смогла решить её правильно.
Вдобавок:
Если попросить модель сложить
9+10, то в некоторых случаях она будет выдавать ТОЛЬКО 21. Дожили.
Это единичный случай, видимо, проблема в том, что она считает, что ты спрашиваешь про какой-то там мем «21».
А вчера она выдала мне 2 + 2 = 5 спустя 3–4 запроса. Я обсуждал с ней другой новый мем и решил уточнить, сколько будет 2 + 2, на что она ответила: «5». Когда я спросил «почему?», она заявила, что просто "подыгрывала", "ну мы же ведь шутили".
AGI, не иначе!
🤔3
Светлая комната — архив
Gemini 3.1 стала хуже в математике. Буквально: У меня уже возникла проблема, когда я попросил модель решить задачку уровня 7-го класса — она не смогла решить её правильно. Вдобавок: Если попросить модель сложить 9+10, то в некоторых случаях она будет выдавать…
Юзайте эту модельку, не бросайте сразу. Найдите ей применение.
Она уникальна и отлично сбалансирована. Лично я ставлю её сразу после Claude 4.6 Opus, тупо потому что она бесплатная и доступна везде, и опять же уникальна в SVG.
Нынешние скачки качества — это плата за стабильность. Реальные улучшения мы увидим со следующим апдейтом (по секрету: уже в этом месяце).
Пока же Google слишком медленно шли к Gemini 3.1 Pro, ииии, прогресс мизерный короче, поэтому это лишь версия «3.1».
Моё мнение: модели Gemini мощные, но концептуально неудачные.
А теперь, когда упёрлись в потолок, им приходится мириться с тем, что их модель вообще нигде не на первом месте. И сотрудников DeepMind это реально бесит, я понял это, когда Logan оправдывался в X.
Но, вероятно, они всё же пилят что-то новое. Вспомните осенний претрейн: аналитики из Artificial Analysis заметили, что Google не просто тюнит старое, а создает новую базу. Возможно, конечно же, там было именно RL-дообучение, (для этого требуется запускать что-то вроде специальных агентов. Это мощно), и сделало ту же Gemini 3 Flash такой сильной.
Google буквально дышит в спину ChatGPT, ещё немного — и могли бы порвать всех. Но конкуренция жестока. А вообще, я знаю в каком направлении идут модели Gemini – это очень сильно продвигает к AGI. Но об этом позже.
Гуглу пора задушить свою бюрократию, начать развивать продукты и нанять нормальных спецов, а не геев идиотов, которые пишут тупые промпты для Gemini App и безнадёжно сливают конкурентам по функционалу. Это просто ужасно.
Я ещё плотно потестирую модель и найду все её "проёбы". И тогда мы решим: стоит ли дальше фанатеть от уникальности Google? Особенно когда Claude 4.6 Opus ВДРУГ уделывает их в математике вместе с GPT-X High, а обновленный Sonnet 4.6 неплох, и уже не уровне gemini 3 во фронтенд-дизайне. Если Гугл не проснётся, вердикт будет таким: их нейронка годится только для разовых запросов. Никаких долгих диалогов и глубокой работы — просто крутая бесплатная игрушка на один раз, и всё.
И это ЛИШЬ половина моих мыслей. Обязательно выкачу полноценный обзор, ведь я всё-таки остаюсь фанатом Gemini.🤫
#Мысли
Автор — @Geometry90
Она уникальна и отлично сбалансирована. Лично я ставлю её сразу после Claude 4.6 Opus, тупо потому что она бесплатная и доступна везде, и опять же уникальна в SVG.
Нынешние скачки качества — это плата за стабильность. Реальные улучшения мы увидим со следующим апдейтом (по секрету: уже в этом месяце).
Пока же Google слишком медленно шли к Gemini 3.1 Pro, ииии, прогресс мизерный короче, поэтому это лишь версия «3.1».
Моё мнение: модели Gemini мощные, но концептуально неудачные.
Кажется, после версии 2.0 они забили на новую архитектуру и просто заливали версии 2.5, 3.0 и 3.1 сырыми вычислительными мощностями.
А теперь, когда упёрлись в потолок, им приходится мириться с тем, что их модель вообще нигде не на первом месте. И сотрудников DeepMind это реально бесит, я понял это, когда Logan оправдывался в X.
Но, вероятно, они всё же пилят что-то новое. Вспомните осенний претрейн: аналитики из Artificial Analysis заметили, что Google не просто тюнит старое, а создает новую базу. Возможно, конечно же, там было именно RL-дообучение, (для этого требуется запускать что-то вроде специальных агентов. Это мощно), и сделало ту же Gemini 3 Flash такой сильной.
Google буквально дышит в спину ChatGPT, ещё немного — и могли бы порвать всех. Но конкуренция жестока. А вообще, я знаю в каком направлении идут модели Gemini – это очень сильно продвигает к AGI. Но об этом позже.
Гуглу пора задушить свою бюрократию, начать развивать продукты и нанять нормальных спецов, а не геев идиотов, которые пишут тупые промпты для Gemini App и безнадёжно сливают конкурентам по функционалу. Это просто ужасно.
Я ещё плотно потестирую модель и найду все её "проёбы". И тогда мы решим: стоит ли дальше фанатеть от уникальности Google? Особенно когда Claude 4.6 Opus ВДРУГ уделывает их в математике вместе с GPT-X High, а обновленный Sonnet 4.6 неплох, и уже не уровне gemini 3 во фронтенд-дизайне. Если Гугл не проснётся, вердикт будет таким: их нейронка годится только для разовых запросов. Никаких долгих диалогов и глубокой работы — просто крутая бесплатная игрушка на один раз, и всё.
И это ЛИШЬ половина моих мыслей. Обязательно выкачу полноценный обзор, ведь я всё-таки остаюсь фанатом Gemini.
#Мысли
Автор — @Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥5 1
Я знаю, что знают те ребята. Так что эти намёки действительно оправданы.
#Новости
Автор — @Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3
Во-первых: Демис Хассабис, когда был в Индии на днях, заявил о скором выпуске новой модели Gemma: «...Мы работаем над собственной моделью с открытым исходным кодом, Gemma, и скоро выпустим новую версию, которая будет очень мощной для периферийных устройств».
Во-вторых, скоро релиз Open-source гиганта — deepseek v4. По-моему, им всегда было пофиг, но не в этот раз.
Хоть какие то намёки хотя бы есть.
Значит скоро. Интересно, после gemini 3 на что вы надеетесь с Gemma 4?
Источник
#Новости / #Инсайд
Автор — @Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥3 2👍1
Светлый Уголок | ии
#Мем
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥1
Ещё одна ситуации с балансом Gemini 3.1 Pro.
Обновленная версия растеряла навыки в медицинских советах, советах безопасности кода и др.
По словам автора, это отражает состояние бэкенда нейросети: в коде и других повседневных задачах версия 3.1 Pro регрессировала в 3 раза и стала даже хуже новой Qwen 3.5.
Кстати, GPT 5.2 здесь нет, так как она слишком мощная — если вставить её в сравнение, она, вероятно, будет вдвое сильнее, чем 3.0 Pro
#Новости
Автор — @Geometry90
Обновленная версия растеряла навыки в медицинских советах, советах безопасности кода и др.
По словам автора, это отражает состояние бэкенда нейросети: в коде и других повседневных задачах версия 3.1 Pro регрессировала в 3 раза и стала даже хуже новой Qwen 3.5.
Кстати, GPT 5.2 здесь нет, так как она слишком мощная — если вставить её в сравнение, она, вероятно, будет вдвое сильнее, чем 3.0 Pro
#Новости
Автор — @Geometry90
Это не баг, а фича! Всё та же обновленная версия и лимиты до 10 обращений к Gemini DT в день.
Я решил не скрывать и сразу поделиться этим с вами. Тем более, сейчас далеко не у каждого остался даже Gemini Pro (у многих доступ отобрали), поэтому можно смело рассекречивать. Для большинства подписчиков канала это будет тот ещё секрет, хах.
Короче, перейдите по ссылке, зайдите с того аккаунта, где есть Pro, и нажмите «Продолжить чат». Не отправляйте новое сообщение, а просто отредактируйте первое.
ССЫЛКА
P.S. — В настоящее время этот мини-AGI может быть зацензурированным, поэтому извинитесь перед google.
#Щитпост / #Новости
Автор — @Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥5 1
Помните ту загадочную модель с контекстом в 1 млн токенов, которая внезапно появилась в приложении DeepSeek? Честно говоря, она даже слабее, чем настоящий v4 Lite. Если эта «облегченная» версия показывает такие результаты, представьте, на что будет способна полноценная четвертая версия.
Авторы этого эксклюзивного слива утверждают, что именно они раскрыли официальный нейминг — и это действительно был DeepSeek v4 Lite.
Лично я почти ничего не знаю о новом deepseek v4 и нормальной инфы о нём у меня нет.
Источник
P.s — не подтверждено
#Инсайд
Автор — @Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
😁7❤🔥3🤔1
Светлый Уголок | ии
Небольшая поправка насчёт генерации SVG в DeepSeek v4.
Эта информация пока остаётся неподтверждённой. Основной фокус инженеров DeepSeek сейчас направлен на разработку более эффективных архитектур для нейросетей, а не на узкую работу с графикой.
Так что в реальности их v4 может оказаться не таким крутым в создании SVG, как на гуляющих в сети примерах. Но, как говорится, кто его знает — посмотрим!
#Новости
😀 Geometry90
Эта информация пока остаётся неподтверждённой. Основной фокус инженеров DeepSeek сейчас направлен на разработку более эффективных архитектур для нейросетей, а не на узкую работу с графикой.
Так что в реальности их v4 может оказаться не таким крутым в создании SVG, как на гуляющих в сети примерах. Но, как говорится, кто его знает — посмотрим!
#Новости
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥2
This media is not supported in your browser
VIEW IN TELEGRAM
Важно из этого вам:На базе неё уже работает Aletheia — ИИ-математик, который сам решил 4 задачи из списка нерешённых.
• Humanity's Last Exam: 48.4% — новый рекорд, без внешних инструментов!
• ARC-AGI-2: 84.6%
• Золото на олимпиадах 2025 по математике, физике, химии.
Доступ пока через Google AI Ultra подписку, API (ВНИМАНИЕ! API) — по заявкам (пока что).
Если что модель на базе Gemini 3.1 Pro, поэтому не накручивайте себе, что Gemini 3.1 DeepThink выйдет после 3.1 Pro. Нет, этого не будет.
— Официальный релиз
— Модель доступна для тех у кого Gemini Pro
#Новости
Please open Telegram to view this post
VIEW IN TELEGRAM
❤🔥1
Светлый Уголок | ии
Похоже, мы получили Grok 4.1 под видом 4.2. Но это бета! Справедливости ради — работает действительно неплохо, SVG рисует заметно лучше чем 4.1.
Это стало очевидно после того, как Grok Heavy получил апдейт до 4.20 (v6), и его результаты кратно возросли. Используется для него 16 агентов.
Please open Telegram to view this post
VIEW IN TELEGRAM
😁5