🫆 Светлый Уголок | ии
525 subscribers
896 photos
190 videos
10 files
516 links
Тут сначала замечают, потом обсуждают.
AI-инсайды, свежие сигналы, честные мнения и свои инструменты.
Светлый уголок — авторский канал про ИИ без скуки.
Download Telegram
GEMMA 4-124B (MoE) Подтверждена.

Jeff Dean, (Главный научный сотрудник Google DeepMind и Google Research), опубликовал пост, который был отредактирован/удален сразу после публикации.

Там он упомянул про Gemma 4 с 124 миллиардами параметров с МоЕ.

Нас ждёт более крупная.💎

🌌 Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
❤‍🔥2
🚨 GPT Image 2.0 тестируется на arena.ai.

На arena.ai тестируются, предположительно, целых три модели GPT Image:

Maskingtape-alpha: gpt imgen 2
Packingtape-alpha: gpt imgen 2 fast
Gaffertape-alpha: gpt imgen 2 mini


(По крайней мере, такое ощущение, что версии вот такие по мощности).

Хочу отметить, что датасет стал ощутимо больше, а текст стал ещё круче, примерно, на уровне Nano Banana Pro.

🌌 Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
1
Maskingtape-alpha: gpt imgen 2.0

У модели прямо хорошенький такой датасетик; она меньше ошибается, чем Nano Banana Pro.

Я заметил, что у неё бывают сильные дефекты в генерации — это вертикальные разрывы кадра.

Да, это целый какой-то V-Sync.

16:9 не завезли.
1
GPT image 2.0 VS Nano Banana pro
1
🫆 Светлый Уголок | ии
🚨 GPT Image 2.0 тестируется на arena.ai. На arena.ai тестируются, предположительно, целых три модели GPT Image: Maskingtape-alpha: gpt imgen 2 Packingtape-alpha: gpt imgen 2 fast Gaffertape-alpha: gpt imgen 2 mini (По крайней мере, такое ощущение, что версии…
🤖 Ребята, GPT Image 2.0 может выйти на следующей неделе. А протестировать её всё ещё возможно!

Всё потому, что в приложении ChatGPT обновили визуал анимации генерации картинок. OpenAI готовятся вот-вот выпустить новую версию.

Модель всем нравится, однако её картинки бывают немного грязными с таким лёгким шумом, но вы этого почти не заметите. Гораздо приятнее осознавать, что картинки получаются насыщенными и правильными, как вы сами того ожидаете.


Но теперь главное. Как же её протестировать? На arena.ai все эти модели убрали. Зато в ChatGPT можно словить шанс ~1/10 на то, что у вас выпадет A/B-тест.

И знайте: вам выпадут две разные модели, пожалуй, не того уровня, что Maskingtape-alpha. Но не всё так плохо!
Самое замечательное в том, что одна из них будет приближена к тем, что были на арене сегодня утром, и это и есть GPT Image 2, но, скорее всего, немного ранняя версия.

Не стоит переживать. Её ещё лучше сделают! Я уверен.

Однако не спамьте в ChatGPT, я заметил, что вас могут кинуть в спамблок, рил.
🌌 Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
2
За эти два месяца будет совершен новый шаг к развитию производительности LLM моделей.
5🤔11
По словам многих пользователей, на сайте DeepSeek появились режимы Instant и Expert. Модели в них ведут себя по-разному.

В Instant используется ускоренная модель, что вполне ожидаемо.

В Expert уже стоит новая модель, ограниченная данными до 2025 года.

Многие успели протестировать её на задачах вроде SVG и логики. В SVG она показывает уровень выше всех текущих китайских моделей, но всё ещё не дотягивает до моделей из американских лабораторий. В логических задачах результат тоже неидеальный, лучше большинства, но уступает США.

В остальном модель выглядит современной и, вероятно, подойдёт для школьников из СНГ. Но в некоторых аспектах заметен регресс по сравнению с тем, что было несколько дней назад. — Это 100%


Ждём полноценный релиз уже на этой неделе.

Пока официальных объявлений не было.


Сайт DeepSeek.
Следить за выходом можно в их официальном X-аккаунте.
🌌 Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔2
GLM-5.1 только сейчас вышла в open-source, но была доступна ещё полторы недели назад.
Похоже, GLM-5.1 лучше всего раскрывается в коде

Все сразу офигели с SWE-Bench Pro.
По их таблице у модели GLM 5.1 больше всех: 58.4 против 57.7 у GPT-5.4 и 57.3 у Opus 4.6.

Как отмечают другие и по моим наблюдениям в X, модель очень хорошо работает с кодовыми базами.

Так это в целом это не удивляет, потому что у GLM код уже давно одна из главных ставок. И вы это всё знаете.
Такие вещи вполне можно натренировать именно под подобные задачи.

Да и в целом ребята делают вид, что у них модель универсальная, хотя по ряду других бенчей она уступает многим конкурентам. Я не со зла.
Например, в GPQA-Diamond у неё 86.2, когда у Gemini 3.1 Pro — 94.3, а у Opus 4.6 — 91.3.
В HLE у GLM-5.1 вообще 31.0 против 39.8 у GPT-5.4 и 45.0 у Gemini 3.1 Pro.

Вообще Z.ai, видимо, пытаются лезть сразу во всё.
Делают и обычные модели, и кодовые, и даже image gen модели. (Где GLM-5-code?)

Пока всё выглядит так, что GLM-5.1 - это в первую очередь сильная модель под код, а не какая-то лучшая нейросеть на всё подряд.

Open-source обнимающее лицо 🤗
🌌 Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔2
🫆 Светлый Уголок | ии
Помимо Mythos v1, есть ещё и Capybara v2. Capybara (v2) — это продолжение Mythos. Anthropic пошли дальше, продолжили обучать v1, и получилась Capybara. Возможно, её бенчмарки (если они есть) даже выше, чем те, что вы наблюдаете у Mythos на данной картинке.…
Mythos Preview у Anthropic выглядит очень сильно.

На SWE-bench Pro у неё 77.8% / 53.4% у Opus 4.6.
На Terminal-Bench 2.0 вообще 82.0% / 65.4%.
SWE-bench Verified 93.9% / 80.8%.

Anthropic не выкатила Mythos как обычную модель. Вместо этого они запустили «Project Glasswing» и отдали её партнёрам под кибербезопасность. Сами пишут, что модель уже находила тысячи сильных серверных уязвимостей, включая баги в крупных ОС и браузерах. Это мощно.

Claude Mythos Preview будет доступна участникам по $25 / $125 за миллион входных и выходных токенов.
Кстати, это всё ещё дешевле, чем GPT-5.4 Pro.

Это сильный скачок, уверен эта модель работает медленно, но зато очень круто.


Кстати, тот svg — это был mythos. Секрет раскрыт.

А теперь ждем sonnet 5 (или opus 5) в этом месяце. 😁

🌌 Geometry90
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
1