На Arena AI появилась возможная Kimi K3.1
На Arena AI тестируется новая анонимная модель под кодовым названием
⚪️ В рассуждениях мы нашли грязный токен семейства Kimi. Похожая строка уже встречалась в ранних версиях моделей Moonshot.
⚪️ Сама модель постоянно называет себя Claude. Поэтому её происхождение всё ещё вызывает сомнения и не позволяет уверенно связать adamant-ananke с Kimi.
⚪️ Cuttof знаний, похоже, остался прежним. Модель знает события середины 2025 года, но не узнаёт более свежие релизы.
Пишем об этом сейчас, чтобы держать вас в курсе. После выхода Kimi K3 прошло уже достаточно времени, поэтому появление следующего чекпойнта Moonshot вполне ожидаемо.
❗️ Примечание: принадлежность adamant-ananke к Moonshot официально не подтверждена. Это может быть Kimi K3.1, промежуточная версия или модель другой лаборатории.
На Arena AI тестируется новая анонимная модель под кодовым названием
adamant-ananke. Мы предполагаем, что это следующая модель Kimi, возможно K3.1.Заметного скачка пока не видно. По нашему пользовательскому опыту, модель ведёт себя примерно как K3.
И кстати полноценно проверить её пока не получается: ответы периодически зависают или завершаются ошибкой.
Пишем об этом сейчас, чтобы держать вас в курсе. После выхода Kimi K3 прошло уже достаточно времени, поэтому появление следующего чекпойнта Moonshot вполне ожидаемо.
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯9
Forwarded from Geometrybot
This media is not supported in your browser
VIEW IN TELEGRAM
Прозрачные фоны теперь доступны в предпросмотре для GPT-Image-2 в API.
Создавайте переиспользуемые ассеты, которые можно размещать на любом фоне: для изображений продуктов, графического дизайна, макетов сайтов и маркетинговых кампаний.
🍷 @OpenAIDevs
Создавайте переиспользуемые ассеты, которые можно размещать на любом фоне: для изображений продуктов, графического дизайна, макетов сайтов и маркетинговых кампаний.
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯9
Forwarded from Geometrybot
Сканирование безопасности Claude теперь работает на Claude Mythos 5, доступное сегодня в публичной бете для всех клиентов Claude Enterprise.
Задействуйте нашу самую мощную модель безопасности для вашей кодовой базы, без необходимости отдельного доступа к модели.
🍷 @claudeai
Задействуйте нашу самую мощную модель безопасности для вашей кодовой базы, без необходимости отдельного доступа к модели.
Please open Telegram to view this post
VIEW IN TELEGRAM
👀11
Forwarded from Geometrybot
This media is not supported in your browser
VIEW IN TELEGRAM
Google готовится выпустить обновлённую версию Omni Flash (models/gemini-omni-1.1-flash)
Идентификатор базовой модели — "omni-1p2", что указывает на то, что Google использует чекпоинт Omni Flash 1.2 для версии 1.1
Прикреплённое видео — это результат её работы, сгенерированный за 43 секунды. Хотелось бы, чтобы они вообще не выпускали её на этом этапе...
🍷 @Lentils80
Идентификатор базовой модели — "omni-1p2", что указывает на то, что Google использует чекпоинт Omni Flash 1.2 для версии 1.1
Прикреплённое видео — это результат её работы, сгенерированный за 43 секунды. Хотелось бы, чтобы они вообще не выпускали её на этом этапе...
Please open Telegram to view this post
VIEW IN TELEGRAM
Geometrybot
Google готовится выпустить обновлённую версию Omni Flash (models/gemini-omni-1.1-flash) Идентификатор базовой модели — "omni-1p2", что указывает на то, что Google использует чекпоинт Omni Flash 1.2 для версии 1.1 Прикреплённое видео — это результат её работы…
Вот несколько генераций omni trash 1.2.
Если честно — продвижения ноль. Тоже самое было с veo 3.1, относительно veo 3.0.
Claude-marshmallow-eap и Claude-melon-eap.* Opus 5 и Fable 5 имеют отсечку конец 2025
Мы думаем, что это ранний снапшоты Opus 5.1
Источник.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯17
Forwarded from Geometrybot
This media is not supported in your browser
VIEW IN TELEGRAM
WAN 3 с тем же промптом. 🔥🔥 Вы недооценили эту модель, она действительно потрясающая, это самая близкая к Seedance 2.5 по качеству модель.
🍷 @Waguri_Kaoruko8
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯11
Сегодня на WebDev Arena появилась новая модель под кодовым названием
Paloma.Один из наших источников ранее говорил, что Qwen 4 планируют выпустить уже в сентябре. Судя по появлению Paloma и Magnus, Alibaba начала готовить модель к релизу.
Это очень хороший толчок к развитию.
В комментариях мы прикрепили ещё несколько выводов данной модели, оцените их.
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯12👌4 3👀1
Forwarded from ✨AI Watchtower✨ (Arena Overseer)
🆕 New models on Arena:
• lina-f-alpha (input: text, image; output: image)
• lina-f-alpha (input: text, image; output: image)
👀5
Ватафак... Lina-F-Alpha стала ещё хуже. Артефактов стало больше, а людей она почти перестала узнавать. Она делает полное дерьмо.
Похоже, что сегодня OpenAI тестирует сильно урезанную ветку модели. Возможно, это всё-таки GPT Image 2.x Mini, но понять, что сейчас происходит за кулисами, невозможно.
Мой самый любимый бенчмарк ии скоро обновиться. 👀
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Geometrybot
НА СЛЕДУЮЩЕЙ НЕДЕЛЕ: Новый VoxelBench
это будет наше самое большое обновление:
- полностью новый фронтенд и бэкенд
- Battle Mode и Side by Side
- Полноэкранный режим и Freecam (!)
- Значительное улучшение статистики моделей
🍷 @legit_api
это будет наше самое большое обновление:
- полностью новый фронтенд и бэкенд
- Battle Mode и Side by Side
- Полноэкранный режим и Freecam (!)
- Значительное улучшение статистики моделей
Please open Telegram to view this post
VIEW IN TELEGRAM
Meta готовит обновление Muse Image (может 1.2)
⚪️ Meta уже некоторое время перебирает новые чекпойнты, поэтому обновление, скорее всего, готовят к выпуску. Возможно, новая Muse Image в этот раз также появится в Meta Model API, которого у первой версии до сих пор нет.
Пока это выглядит как небольшой апдейт без заметного скачка. Надеюсь, к релизу модель всё-таки улучшат.
На Arena AI недавно появилось три image-чекпойнта:☀️ Iron-Bloom☀️ Ferric-Wash☀️ Silver-Halide
Генерации временами выглядят как довольно жёсткий нейрослоп.
Я прогнал на них несколько знакомых запросов, которыми проверял первую Muse Image. Заметных изменений почти нет. Визуальное качество осталось примерно тем же, интеллект модели не улучшился, а понимание стилей всё ещё работает плохо.
Первую Muse Image я сильно хвалил после релиза. У неё были интересная система самоисправления, поиск референсов и связка с Muse Spark. Позже я понял, что в чистой генерации она почти ничем не лучше Nano Banana Pro, а новая Nano Banana 2 Lite делает похожую работу гораздо быстрее.
Пока это выглядит как небольшой апдейт без заметного скачка. Надеюсь, к релизу модель всё-таки улучшат.
Please open Telegram to view this post
VIEW IN TELEGRAM
Светлый Уголок | ии
Jalapeño разработан OpenAI совместно с Broadcom специально для инференса языковых моделей. Сейчас чип проходит финальную проверку, а развёртывание в инфраструктуре OpenAI планируют начать до конца года.
Вероятно, на крупных MoE-моделях результат сильнее упирается в память и обмен данными между чипами.☀️ GPT-OSS 120B: на 90% эффективнее GB200☀️ DeepSeek R1 670B: на6️⃣ 7️⃣ % эффективнее GB300☀️ Kimi K2.5 1T: на 53% эффективнее GB300
* Забавно, что лучше всего первый Jalapeño показал себя на модели в 120B, пока OpenAI где-то там
Второе поколение уже находится в активной разработке, а третье начинает формироваться.
Мнение от автора:
Честно говоря, я ожидал от первого чипа OpenAI немного большего. По моему мнению, самым интересным потенциальным ускорителем для инференса сейчас остаётся Google TPU 8i. Он изначально рассчитан на крупные MoE и огромные KV-кэши.
При этом напрямую сравнивать его с Jalapeño пока нельзя. OpenAI показала результаты только против NVIDIA, а общего теста с TPU 8i нет. Главное преимущество Jalapeño может оказаться экономическим: OpenAI получает чип, полностью заточенный под собственные модели и огромный постоянный поток запросов.
Источник.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯6