ДругОпенсурса Aka. Новости нейросетей
642 subscribers
512 photos
138 videos
409 links
Download Telegram
🔥 Kimi k3 вышла!

Уровень опуса 4.8, по некоторым бенчам почти фейбл!

Цена 3$/15$ за вход/выход 1m токенов

Люди пишет ооочень хорошие отзывы, говорят что ChatGPT sol 5.6 уделывает

Буду тестить

🚀 umaai.site/computer
👾 Друг Опенсурса
🔥8🤯3
🔥 Alibaba показала Qwen 3.8.

Если коротко: это новый флагман на 2,4 трлн параметров. Пока модель уже доступна через API по сниженной цене, а открытые веса обещают выложить совсем скоро.

Честно, меня тут больше цепляют не бенчмарки. Интереснее посмотреть, как она покажет себя в кодинге и агентных сценариях. Судя по первым отзывам, именно там Qwen 3.8 ощущается сильнее всего — люди пишут, что проекты с AI-агентами стали выполняться заметно быстрее.

Ну и отдельный плюс — это open-weight модель. Как только веса выложат, начнется самое интересное: нормальные независимые тесты.

Буду тестить. Посмотрим.

🚀 umaai.site/computer
👾 Друг Опенсурса
5👍1
⚡️ Google показала сразу три новые Gemini: 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber.

3.6 Flash стала лучше в кодинге, рассуждениях и работе с инструментами. При этом она дешевле прошлой версии — $1.50 / $7.50 за миллион входных и выходных токенов. Плюс Google заявляет, что модель тратит заметно меньше output-токенов. Если это подтвердится, экономия будет приятной.

3.5 Flash-Lite теперь самая дешевая модель в линейке — $0.30 / $2.50 за миллион токенов. Для простых задач выглядит неплохо. А 3.5 Flash Cyber пока доступна только партнерам и заточена под поиск и исправление уязвимостей в коде.

Но если честно, я вообще ждал не этого.

OpenAI, Anthropic, Alibaba, xAI, Mistral, Moonshot - все дропнули по несколько(!) поколений моделей. Даже Meta, отсталая мета, на которой я, признаюсь, поставил крест, как на ai labe выложила muse 1.1, тоже фронтир

А гугл где? По моему мнению главный игрок в индустрии. Стыд и позор, искренни обидно (раньше модельки в аи студии появлялись чуть ли не каждый день)

umaai.site
4
⚡️ Poolside выкатили Laguna S 2.1.

И вот это уже реально интересно.

118B MoE (активно всего 8B на токен), контекст до 1 млн токенов, открытые веса уже лежат на Hugging Face. Есть BF16, FP8, INT4, GGUF, MLX — короче, релиз сразу (не как у муншотов с кими к3)

Самое интересное — это размер. По словам Poolside, Laguna S 2.1 на Terminal-Bench 2.1 идет рядом с моделями, которые в 5–25 раз больше, а местами вообще их обгоняет. Если это подтвердится независимыми тестами, получится очень сильная open-weight модель именно для кодинга.

Еще понравилось, что они прямо написали про минусы. Модель иногда начинает слишком долго думать на сложной математике, а промежуточного режима между thinking и no-thinking пока нет. Обычно компании про такое молчат.

🚀 umaai.site/computer
👾 Друг Опенсурса
👌5👍2
⚡️ Чем больше читаю про Kimi K3, тем меньше понимаю, почему все называют ее "дешевой".

Да, по прайсу вроде не катастрофа — $3 за миллион input-токенов и $15 за миллион output. Но есть нюанс.

По факту модель во время рассуждений жрет просто какое-то безумное количество токенов. Видел сравнение с Sonnet 5 — Kimi тратит почти в три раза больше. И проблема даже не в цене за миллион токенов, а в том, сколько их реально уходит на одну задачу.

По ощущениям, она просто перебирает варианты. Иногда буквально забывает, о чем сама же писала несколько шагов назад, начинает заходить на новый круг... и в итоге за счет огромного количества итераций все-таки приходит к правильному ответу. Работает? Да. Но какой ценой.

Для сравнения, тот же Muse Spark 1.1 стоит около $2 за миллион input и $4–6 за output. И в итоге многие задачи обходятся банально дешевле.

Но я бы пока не хоронил Kimi.

27 числа обещают открыть веса. Почти уверен, что довольно быстро появятся первые файнтюны. Возможно, кто-то сможет хотя бы немного уменьшить этот дикий расход токенов. Плюс появятся неофициальные провайдеры, которые начнут гонять модель на своем железе и сильно собьют цену. Не удивлюсь, если NVIDIA тоже добавит бесплатный inference с лимитами.

А вот разговоры в духе "ну запустим локально" меня забавляют. Там почти 3 триллиона параметров. Да, это MoE. Но это все еще модель совсем не для домашнего ПК. Если у вас не стоит небольшой дата-центр в гараже, про локальный запуск можно особо не мечтать.

🚀 umaai.site/computer
👾 Друг Опенсурса
👌41
⚡️ Alibaba представила Qwen-Image 3.0.

Главная идея новой версии — сделать генерацию изображений не просто красивой, а реально полезной для работы.

Промпты теперь могут быть до 4500 токенов. Модель умеет за один проход собирать сложные макеты: сториборды, газеты, экзаменационные листы, инфографику, интерфейсы. Плюс заявлена поддержка более 100 художественных стилей, 12 языков и генерация с учетом знаний о мире.

Еще один большой упор сделали на текст. Alibaba говорит, что модель умеет рисовать читаемый текст вплоть до 10 px, генерировать полноценные LaTeX-документы, лучше передавать мелкие детали вроде кожи и волос.

Я уже немного потыкал. С текстом реально стало лучше, причем даже с русским. Но на совсем мелких надписях все еще начинает сыпаться (см 3 картинку). До гпт имг 2 пока далеко

В целом выглядит интересно.

🚀 umaai.site/computer
👾 Друг Опенсурса
👍6🔥1
ДругОпенсурса Aka. Новости нейросетей
⚡️ Google показала сразу три новые Gemini: 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber. 3.6 Flash стала лучше в кодинге, рассуждениях и работе с инструментами. При этом она дешевле прошлой версии — $1.50 / $7.50 за миллион входных и выходных токенов. Плюс…
Прочитал пост Логана из Google DeepMind. Он написал, что они начали тренировать Gemini 4.

И тут возникает вопрос: а Gemini 3.5 Pro вообще существовала? Потому что складывается ощущение, что на нее просто забили. Либо ее действительно никто не обучал, либо релиз все-таки будет позже.

Но, если честно, даже если она выйдет в ближайшее время, у меня большие сомнения, что в кодинге она догонит конкурентов.

Я еще год назад говорил, что сравнивать модели по большей части уже имеет смысл только в кодинге и агентных задачах. Они все давно научились нормально писать текст. Уже нет такого, как во времена GPT-3.5, когда одна модель знала заметно больше другой.

Сейчас важны программирование, агентные сценарии, математика, понимание 3D. Вот там и видно реальный уровень модели.

А мультимодальность, на которую Google делает такой упор… ну камон. В 2026 году это уже базовый минимум, а не киллер-фича.
5
Звучит бредово, но в вопросе выхода моделек полимаркет пока не давал ошибок (сколько слежу- попадают)
🤯5
🔥Ура опус 5

Он пости во всем кстати круче фейбла! Но дешевле в два раза

🚀 umaai.site/computer
👾 Друг Опенсурса
4🔥1
#нашкейс

Пришёл вопрос от пользователя, от которого у меня похолодело:
«Почему один запрос стоил 38 кредитов? Я посмотрел цены на OpenRouter — по факту должно быть втрое меньше».
Полез проверять. Он оказался прав.
Открываю биллинг того хода:
вход:   119 208 токенов

выход:    1 018 токенов

99% — вход. Модель не писала простыню, она её читала. Сто двадцать тысяч токенов на один ход.
Дальше расскажу, как искал причину. И почему первая версия, самая очевидная, оказалась неверной — я почти начал «оптимизировать» то, что в этом случае вообще ни при чём.

🚀 umaai.site/computer
👾 Друг Опенсурса
5
ДругОпенсурса Aka. Новости нейросетей
#нашкейс Пришёл вопрос от пользователя, от которого у меня похолодело: «Почему один запрос стоил 38 кредитов? Я посмотрел цены на OpenRouter — по факту должно быть втрое меньше». Полез проверять. Он оказался прав. Открываю биллинг того хода: вход: 119 208…
Продолжаю про 120 тысяч токенов за один ход.
Первое, что приходит в голову — раздутая история диалога. Классика: отправляем модели последние 30 сообщений, среди них оказался транскрипт часового видео, и вот тебе счёт.
И код это подтверждал. Там буквально было slice(-30) — последние 30 сообщений, без всякого ограничения по объёму. Одно большое сообщение, и стоимость всех следующих ходов растёт.
Я уже собрался это чинить. А потом открыл тот самый диалог.
В нём было два сообщения. 530 символов.
История была ни при чём. Если бы не проверил конкретный случай, я бы «успешно оптимизировал» и отчитался — не сдвинув счёт ни на копейку.
Мораль, которая мне дорого досталась: сначала смотри на конкретный кейс, потом чини. Правдоподобная гипотеза и есть причина — это разные вещи.
4