ДругОпенсурса Aka. Новости нейросетей
642 subscribers
512 photos
138 videos
409 links
Download Telegram
Claude Sonnet 5 вышел

А еще сегодня всем вернут доступ к Fable 5, судя по всему уже без паспорта (ура!). Еще по подписку какое то время, а потом будет апишная цена после 7 числа


Вот вот выкатят gpt 5.6, которая по идее обходит даже оригинальный митоз, что очень очень круто, но зная опенаи цена по апи будет больше чем на фейбл, однако в подписке usage по идее должен быть больше чем у claude code

Пока что ждем. Не хочу чтобы дюди забывали про гемини: я уверен, что инженеры дипмайд там щас просто летают, чтобы гемини 3.5 про догнала всех ваших митозов

🚀 umaai.site/computer
👾 Друг Опенсурса
👍21🔥1👌1
🔥Немного конспирологии

Я часто делаю предположения, когда выйдут те или иные модельки и всегда угадываю (почти).

И полагаясь на всякие намеки от гугл, на то что сейчас на арене под видом старой гемини 3.1 про сейчас работает какая тт лютая модель, на уровне fable, думаю что в течении этой недели выйдет гемини 3.5 про.

Сейчас гуглу критически важно показать новую модель, которая хотя бы сравняется с фейблом, иначе они начнут сильно проигрывать. Опенаи уже показали gpt 5.6 sol. Да и 3.1 про уже правда устаревшая модель, по крайней мере в сфере кодинга, в остальном тт различий сейчас уже не увидишь.

🚀 umaai.site/computer
👾 Друг Опенсурса
👍3
Gpt 5.6 вышла!

Я уже протестировал, очень радует, что цена дешевле чем 5.5, она экономичнее при этом фейбл левел

Ниже буду кидать интересные юз кейсы, если скажете в коммах - выложу способ получить подписку на гпт бесплатно, чтобы самим в кодексе потестить

🚀 umaai.site/computer
👾 Друг Опенсурса
👍5🔥2
Kimi k3 завтра

Слух. Но процентов 80, чтт это так я даю

Подождем

Upd: в следующем посте расскажу про свой сетап, как просили в коммах
7
🔥 Kimi k3 вышла!

Уровень опуса 4.8, по некоторым бенчам почти фейбл!

Цена 3$/15$ за вход/выход 1m токенов

Люди пишет ооочень хорошие отзывы, говорят что ChatGPT sol 5.6 уделывает

Буду тестить

🚀 umaai.site/computer
👾 Друг Опенсурса
🔥8🤯3
🔥 Alibaba показала Qwen 3.8.

Если коротко: это новый флагман на 2,4 трлн параметров. Пока модель уже доступна через API по сниженной цене, а открытые веса обещают выложить совсем скоро.

Честно, меня тут больше цепляют не бенчмарки. Интереснее посмотреть, как она покажет себя в кодинге и агентных сценариях. Судя по первым отзывам, именно там Qwen 3.8 ощущается сильнее всего — люди пишут, что проекты с AI-агентами стали выполняться заметно быстрее.

Ну и отдельный плюс — это open-weight модель. Как только веса выложат, начнется самое интересное: нормальные независимые тесты.

Буду тестить. Посмотрим.

🚀 umaai.site/computer
👾 Друг Опенсурса
5👍1
⚡️ Google показала сразу три новые Gemini: 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber.

3.6 Flash стала лучше в кодинге, рассуждениях и работе с инструментами. При этом она дешевле прошлой версии — $1.50 / $7.50 за миллион входных и выходных токенов. Плюс Google заявляет, что модель тратит заметно меньше output-токенов. Если это подтвердится, экономия будет приятной.

3.5 Flash-Lite теперь самая дешевая модель в линейке — $0.30 / $2.50 за миллион токенов. Для простых задач выглядит неплохо. А 3.5 Flash Cyber пока доступна только партнерам и заточена под поиск и исправление уязвимостей в коде.

Но если честно, я вообще ждал не этого.

OpenAI, Anthropic, Alibaba, xAI, Mistral, Moonshot - все дропнули по несколько(!) поколений моделей. Даже Meta, отсталая мета, на которой я, признаюсь, поставил крест, как на ai labe выложила muse 1.1, тоже фронтир

А гугл где? По моему мнению главный игрок в индустрии. Стыд и позор, искренни обидно (раньше модельки в аи студии появлялись чуть ли не каждый день)

umaai.site
4
⚡️ Poolside выкатили Laguna S 2.1.

И вот это уже реально интересно.

118B MoE (активно всего 8B на токен), контекст до 1 млн токенов, открытые веса уже лежат на Hugging Face. Есть BF16, FP8, INT4, GGUF, MLX — короче, релиз сразу (не как у муншотов с кими к3)

Самое интересное — это размер. По словам Poolside, Laguna S 2.1 на Terminal-Bench 2.1 идет рядом с моделями, которые в 5–25 раз больше, а местами вообще их обгоняет. Если это подтвердится независимыми тестами, получится очень сильная open-weight модель именно для кодинга.

Еще понравилось, что они прямо написали про минусы. Модель иногда начинает слишком долго думать на сложной математике, а промежуточного режима между thinking и no-thinking пока нет. Обычно компании про такое молчат.

🚀 umaai.site/computer
👾 Друг Опенсурса
👌5👍2
⚡️ Чем больше читаю про Kimi K3, тем меньше понимаю, почему все называют ее "дешевой".

Да, по прайсу вроде не катастрофа — $3 за миллион input-токенов и $15 за миллион output. Но есть нюанс.

По факту модель во время рассуждений жрет просто какое-то безумное количество токенов. Видел сравнение с Sonnet 5 — Kimi тратит почти в три раза больше. И проблема даже не в цене за миллион токенов, а в том, сколько их реально уходит на одну задачу.

По ощущениям, она просто перебирает варианты. Иногда буквально забывает, о чем сама же писала несколько шагов назад, начинает заходить на новый круг... и в итоге за счет огромного количества итераций все-таки приходит к правильному ответу. Работает? Да. Но какой ценой.

Для сравнения, тот же Muse Spark 1.1 стоит около $2 за миллион input и $4–6 за output. И в итоге многие задачи обходятся банально дешевле.

Но я бы пока не хоронил Kimi.

27 числа обещают открыть веса. Почти уверен, что довольно быстро появятся первые файнтюны. Возможно, кто-то сможет хотя бы немного уменьшить этот дикий расход токенов. Плюс появятся неофициальные провайдеры, которые начнут гонять модель на своем железе и сильно собьют цену. Не удивлюсь, если NVIDIA тоже добавит бесплатный inference с лимитами.

А вот разговоры в духе "ну запустим локально" меня забавляют. Там почти 3 триллиона параметров. Да, это MoE. Но это все еще модель совсем не для домашнего ПК. Если у вас не стоит небольшой дата-центр в гараже, про локальный запуск можно особо не мечтать.

🚀 umaai.site/computer
👾 Друг Опенсурса
👌41
⚡️ Alibaba представила Qwen-Image 3.0.

Главная идея новой версии — сделать генерацию изображений не просто красивой, а реально полезной для работы.

Промпты теперь могут быть до 4500 токенов. Модель умеет за один проход собирать сложные макеты: сториборды, газеты, экзаменационные листы, инфографику, интерфейсы. Плюс заявлена поддержка более 100 художественных стилей, 12 языков и генерация с учетом знаний о мире.

Еще один большой упор сделали на текст. Alibaba говорит, что модель умеет рисовать читаемый текст вплоть до 10 px, генерировать полноценные LaTeX-документы, лучше передавать мелкие детали вроде кожи и волос.

Я уже немного потыкал. С текстом реально стало лучше, причем даже с русским. Но на совсем мелких надписях все еще начинает сыпаться (см 3 картинку). До гпт имг 2 пока далеко

В целом выглядит интересно.

🚀 umaai.site/computer
👾 Друг Опенсурса
👍6🔥1
ДругОпенсурса Aka. Новости нейросетей
⚡️ Google показала сразу три новые Gemini: 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber. 3.6 Flash стала лучше в кодинге, рассуждениях и работе с инструментами. При этом она дешевле прошлой версии — $1.50 / $7.50 за миллион входных и выходных токенов. Плюс…
Прочитал пост Логана из Google DeepMind. Он написал, что они начали тренировать Gemini 4.

И тут возникает вопрос: а Gemini 3.5 Pro вообще существовала? Потому что складывается ощущение, что на нее просто забили. Либо ее действительно никто не обучал, либо релиз все-таки будет позже.

Но, если честно, даже если она выйдет в ближайшее время, у меня большие сомнения, что в кодинге она догонит конкурентов.

Я еще год назад говорил, что сравнивать модели по большей части уже имеет смысл только в кодинге и агентных задачах. Они все давно научились нормально писать текст. Уже нет такого, как во времена GPT-3.5, когда одна модель знала заметно больше другой.

Сейчас важны программирование, агентные сценарии, математика, понимание 3D. Вот там и видно реальный уровень модели.

А мультимодальность, на которую Google делает такой упор… ну камон. В 2026 году это уже базовый минимум, а не киллер-фича.
5
Звучит бредово, но в вопросе выхода моделек полимаркет пока не давал ошибок (сколько слежу- попадают)
🤯5