⚡️ Alibaba представила Qwen-Image 3.0.
Главная идея новой версии — сделать генерацию изображений не просто красивой, а реально полезной для работы.
Промпты теперь могут быть до 4500 токенов. Модель умеет за один проход собирать сложные макеты: сториборды, газеты, экзаменационные листы, инфографику, интерфейсы. Плюс заявлена поддержка более 100 художественных стилей, 12 языков и генерация с учетом знаний о мире.
Еще один большой упор сделали на текст. Alibaba говорит, что модель умеет рисовать читаемый текст вплоть до 10 px, генерировать полноценные LaTeX-документы, лучше передавать мелкие детали вроде кожи и волос.
Я уже немного потыкал. С текстом реально стало лучше, причем даже с русским. Но на совсем мелких надписях все еще начинает сыпаться (см 3 картинку). До гпт имг 2 пока далеко
В целом выглядит интересно.
🚀 umaai.site/computer
👾 Друг Опенсурса
Главная идея новой версии — сделать генерацию изображений не просто красивой, а реально полезной для работы.
Промпты теперь могут быть до 4500 токенов. Модель умеет за один проход собирать сложные макеты: сториборды, газеты, экзаменационные листы, инфографику, интерфейсы. Плюс заявлена поддержка более 100 художественных стилей, 12 языков и генерация с учетом знаний о мире.
Еще один большой упор сделали на текст. Alibaba говорит, что модель умеет рисовать читаемый текст вплоть до 10 px, генерировать полноценные LaTeX-документы, лучше передавать мелкие детали вроде кожи и волос.
Я уже немного потыкал. С текстом реально стало лучше, причем даже с русским. Но на совсем мелких надписях все еще начинает сыпаться (см 3 картинку). До гпт имг 2 пока далеко
В целом выглядит интересно.
🚀 umaai.site/computer
👾 Друг Опенсурса
👍6🔥1
ДругОпенсурса Aka. Новости нейросетей
⚡️ Google показала сразу три новые Gemini: 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber. 3.6 Flash стала лучше в кодинге, рассуждениях и работе с инструментами. При этом она дешевле прошлой версии — $1.50 / $7.50 за миллион входных и выходных токенов. Плюс…
Прочитал пост Логана из Google DeepMind. Он написал, что они начали тренировать Gemini 4.
И тут возникает вопрос: а Gemini 3.5 Pro вообще существовала? Потому что складывается ощущение, что на нее просто забили. Либо ее действительно никто не обучал, либо релиз все-таки будет позже.
Но, если честно, даже если она выйдет в ближайшее время, у меня большие сомнения, что в кодинге она догонит конкурентов.
Я еще год назад говорил, что сравнивать модели по большей части уже имеет смысл только в кодинге и агентных задачах. Они все давно научились нормально писать текст. Уже нет такого, как во времена GPT-3.5, когда одна модель знала заметно больше другой.
Сейчас важны программирование, агентные сценарии, математика, понимание 3D. Вот там и видно реальный уровень модели.
А мультимодальность, на которую Google делает такой упор… ну камон. В 2026 году это уже базовый минимум, а не киллер-фича.
И тут возникает вопрос: а Gemini 3.5 Pro вообще существовала? Потому что складывается ощущение, что на нее просто забили. Либо ее действительно никто не обучал, либо релиз все-таки будет позже.
Но, если честно, даже если она выйдет в ближайшее время, у меня большие сомнения, что в кодинге она догонит конкурентов.
Я еще год назад говорил, что сравнивать модели по большей части уже имеет смысл только в кодинге и агентных задачах. Они все давно научились нормально писать текст. Уже нет такого, как во времена GPT-3.5, когда одна модель знала заметно больше другой.
Сейчас важны программирование, агентные сценарии, математика, понимание 3D. Вот там и видно реальный уровень модели.
А мультимодальность, на которую Google делает такой упор… ну камон. В 2026 году это уже базовый минимум, а не киллер-фича.
❤5
🔥Ура опус 5
Он пости во всем кстати круче фейбла! Но дешевле в два раза
🚀 umaai.site/computer
👾 Друг Опенсурса
Он пости во всем кстати круче фейбла! Но дешевле в два раза
🚀 umaai.site/computer
👾 Друг Опенсурса
❤4🔥1
#нашкейс
Пришёл вопрос от пользователя, от которого у меня похолодело:
«Почему один запрос стоил 38 кредитов? Я посмотрел цены на OpenRouter — по факту должно быть втрое меньше».
Полез проверять. Он оказался прав.
Открываю биллинг того хода:
99% — вход. Модель не писала простыню, она её читала. Сто двадцать тысяч токенов на один ход.
Дальше расскажу, как искал причину. И почему первая версия, самая очевидная, оказалась неверной — я почти начал «оптимизировать» то, что в этом случае вообще ни при чём.
🚀 umaai.site/computer
👾 Друг Опенсурса
Пришёл вопрос от пользователя, от которого у меня похолодело:
«Почему один запрос стоил 38 кредитов? Я посмотрел цены на OpenRouter — по факту должно быть втрое меньше».
Полез проверять. Он оказался прав.
Открываю биллинг того хода:
вход: 119 208 токенов
выход: 1 018 токенов
99% — вход. Модель не писала простыню, она её читала. Сто двадцать тысяч токенов на один ход.
Дальше расскажу, как искал причину. И почему первая версия, самая очевидная, оказалась неверной — я почти начал «оптимизировать» то, что в этом случае вообще ни при чём.
🚀 umaai.site/computer
👾 Друг Опенсурса
Uma AI
Uma AI — студия ИИ-контента
Изображения, видео, музыка и агенты — в одной нейросети.
❤5
ДругОпенсурса Aka. Новости нейросетей
#нашкейс Пришёл вопрос от пользователя, от которого у меня похолодело: «Почему один запрос стоил 38 кредитов? Я посмотрел цены на OpenRouter — по факту должно быть втрое меньше». Полез проверять. Он оказался прав. Открываю биллинг того хода: вход: 119 208…
Продолжаю про 120 тысяч токенов за один ход.
Первое, что приходит в голову — раздутая история диалога. Классика: отправляем модели последние 30 сообщений, среди них оказался транскрипт часового видео, и вот тебе счёт.
И код это подтверждал. Там буквально было
Я уже собрался это чинить. А потом открыл тот самый диалог.
В нём было два сообщения. 530 символов.
История была ни при чём. Если бы не проверил конкретный случай, я бы «успешно оптимизировал» и отчитался — не сдвинув счёт ни на копейку.
Мораль, которая мне дорого досталась: сначала смотри на конкретный кейс, потом чини. Правдоподобная гипотеза и есть причина — это разные вещи.
Первое, что приходит в голову — раздутая история диалога. Классика: отправляем модели последние 30 сообщений, среди них оказался транскрипт часового видео, и вот тебе счёт.
И код это подтверждал. Там буквально было
slice(-30) — последние 30 сообщений, без всякого ограничения по объёму. Одно большое сообщение, и стоимость всех следующих ходов растёт.Я уже собрался это чинить. А потом открыл тот самый диалог.
В нём было два сообщения. 530 символов.
История была ни при чём. Если бы не проверил конкретный случай, я бы «успешно оптимизировал» и отчитался — не сдвинув счёт ни на копейку.
Мораль, которая мне дорого досталась: сначала смотри на конкретный кейс, потом чини. Правдоподобная гипотеза и есть причина — это разные вещи.
❤4
ДругОпенсурса Aka. Новости нейросетей
Продолжаю про 120 тысяч токенов за один ход. Первое, что приходит в голову — раздутая история диалога. Классика: отправляем модели последние 30 сообщений, среди них оказался транскрипт часового видео, и вот тебе счёт. И код это подтверждал. Там буквально было slice(…
Итак, где были те 120 тысяч токенов.
Замерил всё, что уходит в промпт, по частям:
схемы инструментов (36 шт) 18 919 симв. 45%
профиль пользователя 12 000 симв. 29%
долговременная память 8 000 симв. 19%
системная инструкция 2 862 симв. 7%
──────────────────────────────────────────────
итого 41 781 симв. ≈ 13 900 токенов
Теперь главное. Ход агента — это НЕ один запрос к модели. Это цикл: подумал → вызвал инструмент → получил результат → подумал снова. Каждая итерация — отдельный вызов LLM. И на каждом заново уходит весь контекст.
120 226 / 13 900 ≈ 8,6 шагов.
Вот и ответ. Дело было не в размере контекста, а в том, сколько раз он повторяется.
И вывод, который мне не нравится, но он верный: чем автономнее агент, тем дороже он обходится. Просто потому, что делает больше шагов. То самое свойство, за которое агентов и берут, работает против кошелька.
❤5
Как мы это починили — и почему не «просто обрезали контекст».
Главный принцип: нельзя молча прятать контекст от модели.
Если выкинуть половину истории, агент об этом не узнает. Он будет уверен, что видит всё, и начнёт уверенно делать выводы на неполных данных. Сэкономленные токены заплатишь дважды — неверными действиями и повторными запросами.
Что сделали:
Убрали из предзагрузки то, что агент может взять сам. Профиль пользователя — 12 тысяч символов на каждом шаге. При этом у агента УЖЕ был инструмент, который эти данные читает. Мы платили за предзагрузку того, что доступно по требованию. Теперь, если задача явно не про эти данные, вместо дампа уходит строка «данные есть, вот инструмент». Возможности не потеряли — изменился момент оплаты.
Перешли на бюджет в символах, а не в сообщениях. Потому что «ок» на 40 символов и транскрипт на 60 000 — это не одно и то же, а
slice(-30)считал их равными.
Каждую обрезку помечаем явно. «обрезано N символов». Это и есть разница между экономией и деградацией: видимый маркер даёт агенту повод уточнить, а молчаливое сокращение — повод для уверенной ошибки.
Плюс последние сообщения всегда идут дословно (там текущая задача), а первое сообщение остаётся якорем цели — чтобы на длинной задаче агент не забыл, о чём его вообще просили.
Uma Computer → https://umaai.site/r/habr?to=/computer Платите за расход, а не за подписку. После этой правки — ощутимо меньше.
Uma AI
Uma AI — студия ИИ-контента
Изображения, видео, музыка и агенты — в одной нейросети.
❤5
ДругОпенсурса Aka. Новости нейросетей
Как мы это починили — и почему не «просто обрезали контекст». Главный принцип: нельзя молча прятать контекст от модели. Если выкинуть половину истории, агент об этом не узнает. Он будет уверен, что видит всё, и начнёт уверенно делать выводы на неполных данных.…
Побочный баг из той же истории, на который стоит посмотреть, если пользуетесь платными API.
Ошибка:
Выглядит абсурдно: деньги на счету есть, а запрос не проходит.
Разгадка: провайдер резервирует стоимость худшего случая ДО генерации — вход плюс максимально возможный выход. У нас стоял лимит 8192 токена на ответ. Со входом, раздутым до 120k, резерв получался огромным, и на дорогой модели баланса на него не хватало. Хотя фактически ответ был бы 1000 токенов.
То есть распухший контекст не просто дорого стоит. Он ещё и блокирует запросы, которые ты в состоянии оплатить.
Почему пишу: если у вас агент на платном API и вы ловите 402 при непустом балансе — смотрите не на баланс, а на размер входа и на лимит max_tokens.
Ошибка:
HTTP 402: You requested up to 8192 tokens,
but can only afford 875.
Выглядит абсурдно: деньги на счету есть, а запрос не проходит.
Разгадка: провайдер резервирует стоимость худшего случая ДО генерации — вход плюс максимально возможный выход. У нас стоял лимит 8192 токена на ответ. Со входом, раздутым до 120k, резерв получался огромным, и на дорогой модели баланса на него не хватало. Хотя фактически ответ был бы 1000 токенов.
То есть распухший контекст не просто дорого стоит. Он ещё и блокирует запросы, которые ты в состоянии оплатить.
Почему пишу: если у вас агент на платном API и вы ловите 402 при непустом балансе — смотрите не на баланс, а на размер входа и на лимит max_tokens.
❤6
ДругОпенсурса Aka. Новости нейросетей
Побочный баг из той же истории, на который стоит посмотреть, если пользуетесь платными API. Ошибка: HTTP 402: You requested up to 8192 tokens, but can only afford 875. Выглядит абсурдно: деньги на счету есть, а запрос не проходит. Разгадка: провайдер резервирует…
Закрываю серию про стоимость агента. Чек-лист, если строите своего:
1. Умножьте размер промпта на число шагов цикла. Это и есть реальная цена хода, а не то, что видно в одном запросе. Большинство удивляется именно здесь.
2. Посчитайте схемы инструментов отдельно. У нас это 45% накладных. Каждый новый инструмент — налог на каждый шаг каждого хода, навсегда. Инструменты не бесплатны, даже когда не вызываются.
3. Проверьте, не предзагружаете ли то, что доступно инструментом. Самая безболезненная экономия из существующих.
4. Не измеряйте историю в сообщениях. Измеряйте в объёме.
5. Помечайте любую обрезку явно.
6. Проверяйте гипотезу на конкретном случае, прежде чем чинить.
Всё это мы прошли на своём агенте, поэтому цифры не из воздуха. Кому интересно посмотреть на живых задачах — https://umaai.site/r/habr?to=/computer
Дальше будет история про то, как мы изолируем агентов друг от друга (контейнер на пользователя) и три бага, которые объединяет одно: сервис при них выглядел работающим. Один healthcheck падал 19 808 раз подряд, и никто не замечал.
Вот такая история
соре за спам постами
🚀 umaai.site/computer
👾 Друг Опенсурса
1. Умножьте размер промпта на число шагов цикла. Это и есть реальная цена хода, а не то, что видно в одном запросе. Большинство удивляется именно здесь.
2. Посчитайте схемы инструментов отдельно. У нас это 45% накладных. Каждый новый инструмент — налог на каждый шаг каждого хода, навсегда. Инструменты не бесплатны, даже когда не вызываются.
3. Проверьте, не предзагружаете ли то, что доступно инструментом. Самая безболезненная экономия из существующих.
4. Не измеряйте историю в сообщениях. Измеряйте в объёме.
5. Помечайте любую обрезку явно.
6. Проверяйте гипотезу на конкретном случае, прежде чем чинить.
Всё это мы прошли на своём агенте, поэтому цифры не из воздуха. Кому интересно посмотреть на живых задачах — https://umaai.site/r/habr?to=/computer
Дальше будет история про то, как мы изолируем агентов друг от друга (контейнер на пользователя) и три бага, которые объединяет одно: сервис при них выглядел работающим. Один healthcheck падал 19 808 раз подряд, и никто не замечал.
Вот такая история
соре за спам постами
🚀 umaai.site/computer
👾 Друг Опенсурса
Uma AI
Uma AI — студия ИИ-контента
Изображения, видео, музыка и агенты — в одной нейросети.
❤4👍3
⚡️ Что произошло в AI за сутки:
• Moonshot открыла веса Kimi K3. Это крупнейшая open-weight модель в истории — 2.8 трлн параметров, контекст 1 млн токенов. Уже появляются первые inference-провайдеры и скоро начнут выходить файнтюны.
• MCP получил крупнейшее обновление с момента запуска. Протокол стал stateless, теперь AI-агентов можно масштабировать почти как обычные веб-сервисы. Для всех, кто строит агентные системы, это очень важный апдейт.
• Anthropic показала, как Claude Mythos помогает искать новые атаки на криптографические алгоритмы. Один из примеров — снижение сложности атаки на HAWK-256 с 2⁶⁴ до 2³⁸. До взлома AES далеко, но выглядит впечатляюще.
• Microsoft представила собственную AI-модель для кибербезопасности и multi-agent систему, которая умеет искать, проверять и предлагать исправления для уязвимостей.
🚀 umaai.site/computer
👾 Друг Опенсурса
• Moonshot открыла веса Kimi K3. Это крупнейшая open-weight модель в истории — 2.8 трлн параметров, контекст 1 млн токенов. Уже появляются первые inference-провайдеры и скоро начнут выходить файнтюны.
• MCP получил крупнейшее обновление с момента запуска. Протокол стал stateless, теперь AI-агентов можно масштабировать почти как обычные веб-сервисы. Для всех, кто строит агентные системы, это очень важный апдейт.
• Anthropic показала, как Claude Mythos помогает искать новые атаки на криптографические алгоритмы. Один из примеров — снижение сложности атаки на HAWK-256 с 2⁶⁴ до 2³⁸. До взлома AES далеко, но выглядит впечатляюще.
• Microsoft представила собственную AI-модель для кибербезопасности и multi-agent систему, которая умеет искать, проверять и предлагать исправления для уязвимостей.
🚀 umaai.site/computer
👾 Друг Опенсурса
👍6❤1
Официальный ответ дурова на обвинение в терроризме
Ладно, шутки шутками
Давно хотел написать про свой сетап, сделаем это еще немного попозже (он очень быстро меняется, извините))) ). Но как по мне, важная халява: в cline (самом старом агенте для кода, который за последнее время сильно улучшился) сделали бесплатной GLM 5.2
Пользуемся так: скачиваете расширение для вс кода, там заходите в настройки, выбираете провайдера кляйн и жмякайте на глм
🚀 umaai.site/computer
👾 Друг Опенсурса
Ладно, шутки шутками
Давно хотел написать про свой сетап, сделаем это еще немного попозже (он очень быстро меняется, извините))) ). Но как по мне, важная халява: в cline (самом старом агенте для кода, который за последнее время сильно улучшился) сделали бесплатной GLM 5.2
Пользуемся так: скачиваете расширение для вс кода, там заходите в настройки, выбираете провайдера кляйн и жмякайте на глм
🚀 umaai.site/computer
👾 Друг Опенсурса
❤5🔥3
Media is too big
VIEW IN TELEGRAM
Seedance 2.5: послезавтра на Uma Ai
Все написали, а чем мы хуже? у нас же нет подписок, только pay as you go
🚀 umaai.site/computer
👾 Друг Опенсурса
Все написали, а чем мы хуже? у нас же нет подписок, только pay as you go
🚀 umaai.site/computer
👾 Друг Опенсурса
🔥8
This media is not supported in your browser
VIEW IN TELEGRAM
🔥Minimax H3
Проснулись китайцы, ждем сиденс, ван3 и новый минимакс, все в ближайшие недели и все будет на Uma
🚀 umaai.site/computer
👾 Друг Опенсурса
Проснулись китайцы, ждем сиденс, ван3 и новый минимакс, все в ближайшие недели и все будет на Uma
🚀 umaai.site/computer
👾 Друг Опенсурса
❤1🔥1
⚡️OpenAi обвалили (впервые в истории помоему) цены на модели ChatGPT 5.6
Особенно Луна: 0.2/$1.2 за миллион токенов, против $1/$6 первоначально. Земля в цене стала дешевле на 20%, Солнышко не потерпело изменений))
Это круто, потому что луна сейчас чуть ли не самая экономичная модель вообще, но очень производительная в агентных и кодинг тасках
Мы используем ее в Uma Computer, теперь агент получается стал в 5 раз дешевле с Luna
🚀 umaai.site/computer
👾 Друг Опенсурса
Особенно Луна: 0.2/$1.2 за миллион токенов, против $1/$6 первоначально. Земля в цене стала дешевле на 20%, Солнышко не потерпело изменений))
Это круто, потому что луна сейчас чуть ли не самая экономичная модель вообще, но очень производительная в агентных и кодинг тасках
Мы используем ее в Uma Computer, теперь агент получается стал в 5 раз дешевле с Luna
🚀 umaai.site/computer
👾 Друг Опенсурса
❤4
ДругОпенсурса Aka. Новости нейросетей
Minimax H3 вышла! Уже доступна на Uma Ai 🚀 umaai.site/computer 👾 Друг Опенсурса
Скоро откроют веса, со дня на день
Модель очень крута для опенсурса и ходят слухи, что ее удастся запустить на 3060 (12гб) в 480пи и генерация 5 секунд займет всего 10 минут!
если так - очень круто, посмотрим что скажет на это ван3
Так же, вероятно во вторник выйдет гемини 3.5 про, сигналы те же, что перед выходами новых моделей от гугл обычно. Должна быть фронтир модель, уровня опуса 5 и, наверное, очень щедрые лимиты в антигравити ждут нас
Модель очень крута для опенсурса и ходят слухи, что ее удастся запустить на 3060 (12гб) в 480пи и генерация 5 секунд займет всего 10 минут!
если так - очень круто, посмотрим что скажет на это ван3
Так же, вероятно во вторник выйдет гемини 3.5 про, сигналы те же, что перед выходами новых моделей от гугл обычно. Должна быть фронтир модель, уровня опуса 5 и, наверное, очень щедрые лимиты в антигравити ждут нас
👍5