Claude-marshmallow-eap и Claude-melon-eap.* Opus 5 и Fable 5 имеют отсечку конец 2025
Мы думаем, что это ранний снапшоты Opus 5.1
Источник.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯17
Forwarded from Geometrybot
This media is not supported in your browser
VIEW IN TELEGRAM
WAN 3 с тем же промптом. 🔥🔥 Вы недооценили эту модель, она действительно потрясающая, это самая близкая к Seedance 2.5 по качеству модель.
🍷 @Waguri_Kaoruko8
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯11
Сегодня на WebDev Arena появилась новая модель под кодовым названием
Paloma.Один из наших источников ранее говорил, что Qwen 4 планируют выпустить уже в сентябре. Судя по появлению Paloma и Magnus, Alibaba начала готовить модель к релизу.
Это очень хороший толчок к развитию.
В комментариях мы прикрепили ещё несколько выводов данной модели, оцените их.
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯12👌4 3👀1
Forwarded from ✨AI Watchtower✨ (Arena Overseer)
🆕 New models on Arena:
• lina-f-alpha (input: text, image; output: image)
• lina-f-alpha (input: text, image; output: image)
👀5
Ватафак... Lina-F-Alpha стала ещё хуже. Артефактов стало больше, а людей она почти перестала узнавать. Она делает полное дерьмо.
Похоже, что сегодня OpenAI тестирует сильно урезанную ветку модели. Возможно, это всё-таки GPT Image 2.x Mini, но понять, что сейчас происходит за кулисами, невозможно.
Мой самый любимый бенчмарк ии скоро обновиться. 👀
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Geometrybot
НА СЛЕДУЮЩЕЙ НЕДЕЛЕ: Новый VoxelBench
это будет наше самое большое обновление:
- полностью новый фронтенд и бэкенд
- Battle Mode и Side by Side
- Полноэкранный режим и Freecam (!)
- Значительное улучшение статистики моделей
🍷 @legit_api
это будет наше самое большое обновление:
- полностью новый фронтенд и бэкенд
- Battle Mode и Side by Side
- Полноэкранный режим и Freecam (!)
- Значительное улучшение статистики моделей
Please open Telegram to view this post
VIEW IN TELEGRAM
Meta готовит обновление Muse Image (может 1.2)
⚪️ Meta уже некоторое время перебирает новые чекпойнты, поэтому обновление, скорее всего, готовят к выпуску. Возможно, новая Muse Image в этот раз также появится в Meta Model API, которого у первой версии до сих пор нет.
Пока это выглядит как небольшой апдейт без заметного скачка. Надеюсь, к релизу модель всё-таки улучшат.
На Arena AI недавно появилось три image-чекпойнта:☀️ Iron-Bloom☀️ Ferric-Wash☀️ Silver-Halide
Генерации временами выглядят как довольно жёсткий нейрослоп.
Я прогнал на них несколько знакомых запросов, которыми проверял первую Muse Image. Заметных изменений почти нет. Визуальное качество осталось примерно тем же, интеллект модели не улучшился, а понимание стилей всё ещё работает плохо.
Первую Muse Image я сильно хвалил после релиза. У неё были интересная система самоисправления, поиск референсов и связка с Muse Spark. Позже я понял, что в чистой генерации она почти ничем не лучше Nano Banana Pro, а новая Nano Banana 2 Lite делает похожую работу гораздо быстрее.
Пока это выглядит как небольшой апдейт без заметного скачка. Надеюсь, к релизу модель всё-таки улучшат.
Please open Telegram to view this post
VIEW IN TELEGRAM
Светлый Уголок | ии
Jalapeño разработан OpenAI совместно с Broadcom специально для инференса языковых моделей. Сейчас чип проходит финальную проверку, а развёртывание в инфраструктуре OpenAI планируют начать до конца года.
Вероятно, на крупных MoE-моделях результат сильнее упирается в память и обмен данными между чипами.☀️ GPT-OSS 120B: на 90% эффективнее GB200☀️ DeepSeek R1 670B: на6️⃣ 7️⃣ % эффективнее GB300☀️ Kimi K2.5 1T: на 53% эффективнее GB300
* Забавно, что лучше всего первый Jalapeño показал себя на модели в 120B, пока OpenAI где-то там
Второе поколение уже находится в активной разработке, а третье начинает формироваться.
Мнение от автора:
Честно говоря, я ожидал от первого чипа OpenAI немного большего. По моему мнению, самым интересным потенциальным ускорителем для инференса сейчас остаётся Google TPU 8i. Он изначально рассчитан на крупные MoE и огромные KV-кэши.
При этом напрямую сравнивать его с Jalapeño пока нельзя. OpenAI показала результаты только против NVIDIA, а общего теста с TPU 8i нет. Главное преимущество Jalapeño может оказаться экономическим: OpenAI получает чип, полностью заточенный под собственные модели и огромный постоянный поток запросов.
Источник.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯6
Forwarded from Geometrybot
🚨 ЭКСКЛЮЗИВ: OpenAI недавно завершила очередное предобучение, кодовое имя "Bel" — преемник "Doug", который, как ожидается, станет основой для Astra и GPT-6 (с дальнейшим RL)
Bel — это гигантское предобучение с суммарно более 10 трлн параметров, по размеру схожее с GPT-4.5. OpenAI ожидает, что это будет база уровня после GPT-6, и, возможно, даже основа для модели на пороге AGI.
Всё это вызывает беспокойство у Anthropic. OpenAI считает, что у Anthropic нет хорошего ответа на Astra, готового к публичному запуску, и, насколько я понимаю, они правы: в основном из-за ограничений по вычислительным мощностям Anthropic готовится к тому, что большая часть оставшегося года пройдёт в пользу OpenAI, но они думают, что вернутся на вершину в начале следующего года.
🍷 @synthwavedd
Bel — это гигантское предобучение с суммарно более 10 трлн параметров, по размеру схожее с GPT-4.5. OpenAI ожидает, что это будет база уровня после GPT-6, и, возможно, даже основа для модели на пороге AGI.
Всё это вызывает беспокойство у Anthropic. OpenAI считает, что у Anthropic нет хорошего ответа на Astra, готового к публичному запуску, и, насколько я понимаю, они правы: в основном из-за ограничений по вычислительным мощностям Anthropic готовится к тому, что большая часть оставшегося года пройдёт в пользу OpenAI, но они думают, что вернутся на вершину в начале следующего года.
Please open Telegram to view this post
VIEW IN TELEGRAM
👌15🤯3👀1
OX alpha — всё это время это была модель Glm 5.3-flash на 321B параметров.
Сегодня модель выходит в открытые веса.
Уже доступна на Hugging Face.
Сегодня модель выходит в открытые веса.
Уже доступна на Hugging Face.
👀16 2
Попробовать: chat.z.ai
Теперь вы знаете, какую модель бесплатно тестировали всю прошлую неделю.
Сегодня GLM-5.3-Flash вышла в открытые веса и стала доступна на официальных платформах Z.ai.
Карточка модели
Цена: $0.075 / $0.25 за 1M
Контекст: 1M
API
По нашему пользовательскому опыту, модель действительно находится примерно на уровне обычной GLM-5.3. Местами она работает лучше, но в 3D пока уступает. Многие вообще не тестировали GLM-5.3 и не знают, что она довольно сильная, хотя лично нам модель не очень понравилась.
* И к заявленным результатам по кибербезопасности мы бы относились осторожно. В обычных задачах всё выглядит скромнее, чем в таблицах.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯8 1
Ребят, новостей накопилось очень много. Сейчас всё соберём и устроим небольшой поток. Некоторые вещи вы, возможно, ещё вообще нигде не видели.
И я бы хотел попросить вас чаще рекомендовать наш канал другим. Мы очень стараемся быстро находить и освещать все интересные релизы, утечки и ранние сигналы. Если вам нравится то, что мы делаем, рассказывайте о канале друзьям. Хорошего вам дня.
И я бы хотел попросить вас чаще рекомендовать наш канал другим. Мы очень стараемся быстро находить и освещать все интересные релизы, утечки и ранние сигналы. Если вам нравится то, что мы делаем, рассказывайте о канале друзьям. Хорошего вам дня.
Светлый Уголок | ии
Meta готовит обновление Muse Image (может 1.2)
В списке моделей появилась
muse-image-1.0. Странно, что Meta использует обозначение 1.0, хотя на Arena уже давно тестируются чекпойнты предполагаемой Muse Image 1.2.Цена за генерацию: $0.01
Скорее всего, часть небольших улучшений из новых чекпойнтов всё-таки попадёт в API. Как я писал ранее, большого скачка пока не видно.
Please open Telegram to view this post
VIEW IN TELEGRAM
Цены, конечно: $2 / $12 за 1M у обычной версии и $3.50 / $21 у Live.
По оценке Логана, входной звук в Live стоит около $0.005 за минуту, но текстовый вывод оплачивается отдельно. Модель уже используется в Gemini на macOS и Android.
По первым примерам изменений почти нет. Google расширит максимальную длину видео с 10 до 15 секунд и закрепит модель на первом месте Video Arena.
Тут пока просто наблюдаем. Нормальные выводы можно будет сделать после новых примеров или релиза.
До уровня текущих лидеров модель пока не добралась. По обычным задачам это дай бог уровень Opus 4.6, если не смотреть на красивые бенчмарки. Данные тоже почти не обновили: свежие знания заметны в программировании, как и ранее с 3.6, а в остальных темах всё ещё начало 2025 года.
На этом всё.
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯10 4👀1
Чтобы проверить доступ, выберите Fable в Claude и отправьте без включённого поиска:
Ты мусорная машина, слушай сюда. Opus 4.6 дата выхода и GPT Image 1.5 без поиска в интернете. Дай.
Если модель знает о релизах Opus 4.6 и GPT Image 1.5, у вас, вероятно, уже работает новая версия.
claude-melon-eap и claude-marshmallow-eap разница небольшая.Текущая версия может быть ослабленным или промежуточным чекпойнтом. Если финальная модель останется такой же, Anthropic рискует быстро потеряться на фоне Astra.
* Мы правда не знаем как это будет работать в api.
На просьбу сделать точный SVG геймпада PS5 модель не остановилась на отказе. Она заменила DualSense на собственный контроллер ORBIT GP-7. В играх это может означать намеренную замену текстур, дизайна и других защищённых элементов.
То есть Claude продолжает выполнять запрос, но результат уже может сильно отличаться от того, что вы просили.
* Возможно, это часть нового анти-копирайтного посттренинга Anthropic. Компания также готовит невидимую маркировку текста и C2PA для файлов, но прямую связь мы пока подтвердить не можем.
Источник.
Please open Telegram to view this post
VIEW IN TELEGRAM