🫆 Светлый Уголок | ии
525 subscribers
896 photos
190 videos
10 files
516 links
Тут сначала замечают, потом обсуждают.
AI-инсайды, свежие сигналы, честные мнения и свои инструменты.
Светлый уголок — авторский канал про ИИ без скуки.
Download Telegram
+ gemma-4-31b-it ИМЕЕТ ВСТРОЕННЫЙ ПОИСК! Это ещё лучше, интересно как она с ним справляется.
🤔71
Это очень умно
1
Не могу поверить, что Gemma 4 31b (MoE) теперь числится как почти самая лучшая модель среди всех Open-Source нейронок на сегодняшний день. Примечательно, что ребята смогли выпустить не только 2 версии, а оказались ещё несколько, вплоть до 2b моделек.

Давайте посмотрим простые общие бенчмарки именно Gemma 4 31b. Запомните важное: модель имеет 31 миллиард активных параметров, а также она думающая.

Давайте глянем на оригинальный небольшой график, который нам предоставила Google в сравнении с другими моделями. Посмотрите на общий ELO модели на картинке. По сути ELO — это рейтинг, который показывает силу модели на основе её побед и поражений в тестах с другими нейронками.

GPT OSS сразу отлетает. DeepSeek 3.2 thinking с 685 миллиардами параметров на последнем месте. Qwen 397 миллиардов параметров (MoE) с активными 17 миллиардами мог бы обогнать нашу маленькую модель, если бы сделали 30+ активных параметров. Но вот заметьте: у этой модели такие большие веса, и несмотря на маленькие активные параметры, имеет такой себе скор в Elo как и все из этого сравнения.

Дальше идет одна гемма 4, которую мы пропустим, потом идут мощные модели GLM 5 и KIMI K2.5, которые по идее должны соревноваться с Opus 4.5 хотя бы.
Но учтите, в кодинге модель Gemma-4 и рядом не стояла с гигантами как GLM 5, QWEN или KIMI moonshot. Codeforces в 2150 баллов (Gemini 3.1 Pro — 2887 баллов). Это уровень программирования Master, но не очень солидно, таких параметров не хватает для больших кодовых баз. Но как агент, имба.


Посмотрим на текстовую арену. Вообще, их арена меня не всегда цепляет, люди могут по-разному тыкать на ответы из-за своей предвзятости к модели. Но всё равно ТЕКСТ ELO Open-Source Скор: НА 3 МЕСТЕ, уступая только kimi-k2.5-thinking (которая больше на миллиарды параметров) и glm-5 754B. В русском языке вообще ПЕРВОЕ МЕСТО! Но опять же, предвзятость у людей разная, так что как считаются ответы, пока не очень важно.

Если кому-то интересно, что за приписки IT у этих моделей, это Instruction-Tuned (дополнительно обучена следовать инструкциям). То есть модель была очень хорошо обучена, а значит, что то типа RL-обучения у команды Google хотя бы для маленьких моделей работает.


Я уже протестировал модель: 31b умная, хороший русский текст, неплохо понимает некоторые мемы, в стихах хороша (сойдет). Ленивая модель? Ленивая. Да фиг его знает, почему гуглы допускают такое. Но если попросить выводить больше, то следует инструкциям и выводит.
Дальше лучше. По крайней мере, SVG-контроллеры она выводит круто, на уровне примерно той же Gemini 3.0 Flash (НЕ 3.1 LITE!).

Artificial Analysis тестируют модель, и по некоторым данным Gemma 4 31B (Reasoning) является очень крутой и эффективной моделью по GPQA Diamond в использовании токенов.

Gemma 4-31b и Gemma 4-26b-a4b, в отличие от 2b или 4b, не имеют аудиовхода. Не знаю почему, но модель не способна принимать аудио. Картинки же принимать могут все четверки.

Gemma 4-31b и Gemma 4-26b-a4b, на мой взгляд, самый идеальный вариант для старта разработки своей модели. Только вдумайтесь, на старте она выдает такие неплохие результаты, а логические выводы просто топ. Даже GPT 5.4 thinking в вебе не всегда может правильно с первого раза ответить на вопрос «Сколько лап у козла», сказав, что у козла ИМЕННО ЛАПЫ, а не ноги, в отличие от чистой Gemma 4-31b.


Отличная агентная маленькая моделька, умная, ровная, пойдет на ваши телефоны. ЭТО СЕНСАЦИЯ. А если вы будете начинать с нее обучение своих будущих моделей, то, будучи перерожденным в китайца, вы обязательно дистиллируете её на Opus 5 и получите AGI.
🌌 Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
4
GEMMA 4-124B (MoE) Подтверждена.

Jeff Dean, (Главный научный сотрудник Google DeepMind и Google Research), опубликовал пост, который был отредактирован/удален сразу после публикации.

Там он упомянул про Gemma 4 с 124 миллиардами параметров с МоЕ.

Нас ждёт более крупная.💎

🌌 Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
❤‍🔥2
🚨 GPT Image 2.0 тестируется на arena.ai.

На arena.ai тестируются, предположительно, целых три модели GPT Image:

Maskingtape-alpha: gpt imgen 2
Packingtape-alpha: gpt imgen 2 fast
Gaffertape-alpha: gpt imgen 2 mini


(По крайней мере, такое ощущение, что версии вот такие по мощности).

Хочу отметить, что датасет стал ощутимо больше, а текст стал ещё круче, примерно, на уровне Nano Banana Pro.

🌌 Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
1
Maskingtape-alpha: gpt imgen 2.0

У модели прямо хорошенький такой датасетик; она меньше ошибается, чем Nano Banana Pro.

Я заметил, что у неё бывают сильные дефекты в генерации — это вертикальные разрывы кадра.

Да, это целый какой-то V-Sync.

16:9 не завезли.
1
GPT image 2.0 VS Nano Banana pro
1
🫆 Светлый Уголок | ии
🚨 GPT Image 2.0 тестируется на arena.ai. На arena.ai тестируются, предположительно, целых три модели GPT Image: Maskingtape-alpha: gpt imgen 2 Packingtape-alpha: gpt imgen 2 fast Gaffertape-alpha: gpt imgen 2 mini (По крайней мере, такое ощущение, что версии…
🤖 Ребята, GPT Image 2.0 может выйти на следующей неделе. А протестировать её всё ещё возможно!

Всё потому, что в приложении ChatGPT обновили визуал анимации генерации картинок. OpenAI готовятся вот-вот выпустить новую версию.

Модель всем нравится, однако её картинки бывают немного грязными с таким лёгким шумом, но вы этого почти не заметите. Гораздо приятнее осознавать, что картинки получаются насыщенными и правильными, как вы сами того ожидаете.


Но теперь главное. Как же её протестировать? На arena.ai все эти модели убрали. Зато в ChatGPT можно словить шанс ~1/10 на то, что у вас выпадет A/B-тест.

И знайте: вам выпадут две разные модели, пожалуй, не того уровня, что Maskingtape-alpha. Но не всё так плохо!
Самое замечательное в том, что одна из них будет приближена к тем, что были на арене сегодня утром, и это и есть GPT Image 2, но, скорее всего, немного ранняя версия.

Не стоит переживать. Её ещё лучше сделают! Я уверен.

Однако не спамьте в ChatGPT, я заметил, что вас могут кинуть в спамблок, рил.
🌌 Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
2
За эти два месяца будет совершен новый шаг к развитию производительности LLM моделей.
5🤔11
По словам многих пользователей, на сайте DeepSeek появились режимы Instant и Expert. Модели в них ведут себя по-разному.

В Instant используется ускоренная модель, что вполне ожидаемо.

В Expert уже стоит новая модель, ограниченная данными до 2025 года.

Многие успели протестировать её на задачах вроде SVG и логики. В SVG она показывает уровень выше всех текущих китайских моделей, но всё ещё не дотягивает до моделей из американских лабораторий. В логических задачах результат тоже неидеальный, лучше большинства, но уступает США.

В остальном модель выглядит современной и, вероятно, подойдёт для школьников из СНГ. Но в некоторых аспектах заметен регресс по сравнению с тем, что было несколько дней назад. — Это 100%


Ждём полноценный релиз уже на этой неделе.

Пока официальных объявлений не было.


Сайт DeepSeek.
Следить за выходом можно в их официальном X-аккаунте.
🌌 Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔2