Geometrybot
В других новостях: DeepMind снова отложили 3.5 Pro Ходят слухи, что 3.5 Pro — это модель Шрёдингера, застрявшая в состоянии вечной задержки до тех пор, пока не взорвётся Солнце Иногда я думаю, стоит ли вообще продолжать писать эти посты 🍷 @synthwavedd ·…
Не рекомендую ждать (надеется) на выход Gemini 3.5 даже до конца этого месяца. Им предстоит хорошо потрудиться весь этот месяц и, возможно, половину августа, чтобы выпустить что-то классное.
Светлый Уголок | ии
Kimi K3 начинают постепенно раскатывать. На старте модель получит контекстное окно объёмом 1 млн токенов. * Как только появятся результаты бенчмарков, сразу сообщим. — Выход на сегодня был отменен. Также скоро поделимся новостями о разработках новых моделей…
Kimi K3 перенесли. Но мы успели её потестить.
Релиз должен был состояться ещё 14 июля: разработчики случайно оставили страницу с акцией к выходу K3, о находке которой мы писали вчера. Страницу удалили, релиз сдвинулся.
Сама модель при этом тестируется на arena.ai под кодовым названием saga-decima.
⚪️ Модель чересчур долгая и неэкономная по токенам мышления. На SVG-тесте она думала больше 8 минут. Даже на простое "привет, какая ты модель" уходит не меньше 3 минут.
* Судя по графику Artificial Analysis прошлая K2.6 и так самая медленная среди больших моделей. См.
Релиз должен был состояться ещё 14 июля: разработчики случайно оставили страницу с акцией к выходу K3, о находке которой мы писали вчера. Страницу удалили, релиз сдвинулся.
Сама модель при этом тестируется на arena.ai под кодовым названием saga-decima.
Зачем так, неизвестно, но это явно не экономно.
* Судя по графику Artificial Analysis прошлая K2.6 и так самая медленная среди больших моделей. См.
Please open Telegram to view this post
VIEW IN TELEGRAM
Раньше это были лишь слухи, но теперь подтвердилось довольно надёжным источником. До этого модели Gemini Flash уже тестировались на arena.ai.
🤔 Довольно странно, мы списываем это на галлюцинации модели, которые google DeepMind не может исправить на притяжении 2 лет.
Источник.
Please open Telegram to view this post
VIEW IN TELEGRAM
* На изображении показаны результаты Kimi k3
kivine. Вероятно, превосходит GLM 5.2 везде, включая 3D. Пока это предположение, проверяем, результаты покажем чуть позже. В комментариях приложим примеры её выводов.Но вы офигеете: уже по некоторым тестам она mogs все китайские модели.
На этом всё. Ждите подробностей насчет Kimi k3 :)
Please open Telegram to view this post
VIEW IN TELEGRAM
Срочно: Google начал работу над своей моделью Gemini live bidi (voice2voice), готовя её к ответу на gpt-live-1.
Источник.
Источник.
🤯9👌4 2
Мы протестировали эту модель, и пришли к выводу что она обходит не только GPT-5.6 Sol но и Fable 5 low в разработке игр, дизайне, и 3д.
Нам кажется что эта модель и вправду очень большая, по слухам она в районе ~3T.
Минус прежний: долгая и неэкономная по токенам мышления. Одного аутпута приходится ждать 15-30 минут.
В комментариях скинули ссылки на все аутпуты данной модели, многие из них были сделаны one-shot.
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯12
Модель уже начала появляться у некоторых пользователей из Китая в селекторе приложения. Источник.
Для китайцев это огромная победа.
Когда вы начнёте делать на Kimi K3 свои one-shot игры, сами поймёте, почему мы так её хвалили. По ощущениям это почти mini Fable от китайцев.
Но полностью ставить её выше Opus 4.8 я бы пока не стал.
По моему опыту, Kimi K3 делает ошибки в 2 раза чаще, чем opus и исправить с 1 раза она не может. В 3D, дизайне и разработке игр она действительно способна оказаться сильнее, но по надёжности рассуждений Opus пока выглядит лучше.
Теперь Kimi K3 задаёт новый стандарт для китайских моделей. Остальным придётся уже не догонять американцев, а сначала обойти её. И это только первая версия. Даже небольшие обновления вроде K3.1 могут заметно сократить оставшийся разрыв.
Представьте, насколько близко они уже подобрались.
Редактор 1.
Please open Telegram to view this post
VIEW IN TELEGRAM
Светлый Уголок | ии
Kimi K3 насчитывает 2.8 триллиона параметров.
Появился более точный показатель: 2.8T.
Это почти втрое больше Kimi K2 и заметно больше DeepSeek V4 Pro с её 1.6T.
Kimi K3 стала крупнейшей китайской моделью по общему числу параметров.
Источник.
Появился более точный показатель: 2.8T.
Это почти втрое больше Kimi K2 и заметно больше DeepSeek V4 Pro с её 1.6T.
Kimi K3 стала крупнейшей китайской моделью по общему числу параметров.
Источник.
Светлый Уголок | ии
Kimi K3 насчитывает 2.8 триллиона параметров. Появился более точный показатель: 2.8T. Это почти втрое больше Kimi K2 и заметно больше DeepSeek V4 Pro с её 1.6T. Kimi K3 стала крупнейшей китайской моделью по общему числу параметров. Источник.
По цене модель Kimi k3 дороже Claude Sonnet 5.
А ещё она тратит много токенов на мышление.
Карточка модели
Цена: $3 / $15 за 1M
Контекст: 1М токенов
Знания: Январь 2025
❗️ Примечание: входные токены из кеша стоят $0,30 за 1M. API уже доступен, полные веса модели и технический отчёт опубликуют позднее.
А ещё она тратит много токенов на мышление.
Карточка модели
Цена: $3 / $15 за 1M
Контекст: 1М токенов
Знания: Январь 2025
Please open Telegram to view this post
VIEW IN TELEGRAM
Светлый Уголок | ии
Кими K3 отстаёт только от GPT-5.6 Sol и Fable-5 в оценках бенчмарков — источник карточка модели.
* Веса будут выпущены в ближайшие дни
* Веса будут выпущены в ближайшие дни
Бенчмарки Kimi k3. Не полные.
По ним уже можно увидеть, что модель превосходит всех (и возможно вообще во всем), кроме GPT-5.6, Sol и Fable-5.
Источник.
По ним уже можно увидеть, что модель превосходит всех (и возможно вообще во всем), кроме GPT-5.6, Sol и Fable-5.
Источник.
🤯8
Forwarded from Geometrybot
Большая новость: Kimi-K3 от @Kimi_Moonshot теперь #1 в Frontend Code Arena с 1679 баллами, обогнав Claude Fable 5.
Это прыжок на 17 позиций с Kimi-k2.6 (#18 -> #1).
Во Frontend Kimi-K3 занял #1 в 6 из 7 доменов: Brand & Marketing, Reference-Based Design, Data & Analytics, Consumer Product, Simulations и Content Creation Tools, оказавшись #2 только в Gaming, уступив Fable 5.
Полные веса модели будут выпущены до 27 июля.
Поздравляем команду @Kimi_Moonshot с этим важным достижением!
🍷 @arena · оригинал
Это прыжок на 17 позиций с Kimi-k2.6 (#18 -> #1).
Во Frontend Kimi-K3 занял #1 в 6 из 7 доменов: Brand & Marketing, Reference-Based Design, Data & Analytics, Consumer Product, Simulations и Content Creation Tools, оказавшись #2 только в Gaming, уступив Fable 5.
Полные веса модели будут выпущены до 27 июля.
Поздравляем команду @Kimi_Moonshot с этим важным достижением!
Please open Telegram to view this post
VIEW IN TELEGRAM