Как мы это починили — и почему не «просто обрезали контекст».
Главный принцип: нельзя молча прятать контекст от модели.
Если выкинуть половину истории, агент об этом не узнает. Он будет уверен, что видит всё, и начнёт уверенно делать выводы на неполных данных. Сэкономленные токены заплатишь дважды — неверными действиями и повторными запросами.
Что сделали:
Убрали из предзагрузки то, что агент может взять сам. Профиль пользователя — 12 тысяч символов на каждом шаге. При этом у агента УЖЕ был инструмент, который эти данные читает. Мы платили за предзагрузку того, что доступно по требованию. Теперь, если задача явно не про эти данные, вместо дампа уходит строка «данные есть, вот инструмент». Возможности не потеряли — изменился момент оплаты.
Перешли на бюджет в символах, а не в сообщениях. Потому что «ок» на 40 символов и транскрипт на 60 000 — это не одно и то же, а
slice(-30)считал их равными.
Каждую обрезку помечаем явно. «обрезано N символов». Это и есть разница между экономией и деградацией: видимый маркер даёт агенту повод уточнить, а молчаливое сокращение — повод для уверенной ошибки.
Плюс последние сообщения всегда идут дословно (там текущая задача), а первое сообщение остаётся якорем цели — чтобы на длинной задаче агент не забыл, о чём его вообще просили.
Uma Computer → https://umaai.site/r/habr?to=/computer Платите за расход, а не за подписку. После этой правки — ощутимо меньше.
Uma AI
Uma AI — студия ИИ-контента
Изображения, видео, музыка и агенты — в одной нейросети.
❤5
ДругОпенсурса Aka. Новости нейросетей
Как мы это починили — и почему не «просто обрезали контекст». Главный принцип: нельзя молча прятать контекст от модели. Если выкинуть половину истории, агент об этом не узнает. Он будет уверен, что видит всё, и начнёт уверенно делать выводы на неполных данных.…
Побочный баг из той же истории, на который стоит посмотреть, если пользуетесь платными API.
Ошибка:
Выглядит абсурдно: деньги на счету есть, а запрос не проходит.
Разгадка: провайдер резервирует стоимость худшего случая ДО генерации — вход плюс максимально возможный выход. У нас стоял лимит 8192 токена на ответ. Со входом, раздутым до 120k, резерв получался огромным, и на дорогой модели баланса на него не хватало. Хотя фактически ответ был бы 1000 токенов.
То есть распухший контекст не просто дорого стоит. Он ещё и блокирует запросы, которые ты в состоянии оплатить.
Почему пишу: если у вас агент на платном API и вы ловите 402 при непустом балансе — смотрите не на баланс, а на размер входа и на лимит max_tokens.
Ошибка:
HTTP 402: You requested up to 8192 tokens,
but can only afford 875.
Выглядит абсурдно: деньги на счету есть, а запрос не проходит.
Разгадка: провайдер резервирует стоимость худшего случая ДО генерации — вход плюс максимально возможный выход. У нас стоял лимит 8192 токена на ответ. Со входом, раздутым до 120k, резерв получался огромным, и на дорогой модели баланса на него не хватало. Хотя фактически ответ был бы 1000 токенов.
То есть распухший контекст не просто дорого стоит. Он ещё и блокирует запросы, которые ты в состоянии оплатить.
Почему пишу: если у вас агент на платном API и вы ловите 402 при непустом балансе — смотрите не на баланс, а на размер входа и на лимит max_tokens.
❤6
ДругОпенсурса Aka. Новости нейросетей
Побочный баг из той же истории, на который стоит посмотреть, если пользуетесь платными API. Ошибка: HTTP 402: You requested up to 8192 tokens, but can only afford 875. Выглядит абсурдно: деньги на счету есть, а запрос не проходит. Разгадка: провайдер резервирует…
Закрываю серию про стоимость агента. Чек-лист, если строите своего:
1. Умножьте размер промпта на число шагов цикла. Это и есть реальная цена хода, а не то, что видно в одном запросе. Большинство удивляется именно здесь.
2. Посчитайте схемы инструментов отдельно. У нас это 45% накладных. Каждый новый инструмент — налог на каждый шаг каждого хода, навсегда. Инструменты не бесплатны, даже когда не вызываются.
3. Проверьте, не предзагружаете ли то, что доступно инструментом. Самая безболезненная экономия из существующих.
4. Не измеряйте историю в сообщениях. Измеряйте в объёме.
5. Помечайте любую обрезку явно.
6. Проверяйте гипотезу на конкретном случае, прежде чем чинить.
Всё это мы прошли на своём агенте, поэтому цифры не из воздуха. Кому интересно посмотреть на живых задачах — https://umaai.site/r/habr?to=/computer
Дальше будет история про то, как мы изолируем агентов друг от друга (контейнер на пользователя) и три бага, которые объединяет одно: сервис при них выглядел работающим. Один healthcheck падал 19 808 раз подряд, и никто не замечал.
Вот такая история
соре за спам постами
🚀 umaai.site/computer
👾 Друг Опенсурса
1. Умножьте размер промпта на число шагов цикла. Это и есть реальная цена хода, а не то, что видно в одном запросе. Большинство удивляется именно здесь.
2. Посчитайте схемы инструментов отдельно. У нас это 45% накладных. Каждый новый инструмент — налог на каждый шаг каждого хода, навсегда. Инструменты не бесплатны, даже когда не вызываются.
3. Проверьте, не предзагружаете ли то, что доступно инструментом. Самая безболезненная экономия из существующих.
4. Не измеряйте историю в сообщениях. Измеряйте в объёме.
5. Помечайте любую обрезку явно.
6. Проверяйте гипотезу на конкретном случае, прежде чем чинить.
Всё это мы прошли на своём агенте, поэтому цифры не из воздуха. Кому интересно посмотреть на живых задачах — https://umaai.site/r/habr?to=/computer
Дальше будет история про то, как мы изолируем агентов друг от друга (контейнер на пользователя) и три бага, которые объединяет одно: сервис при них выглядел работающим. Один healthcheck падал 19 808 раз подряд, и никто не замечал.
Вот такая история
соре за спам постами
🚀 umaai.site/computer
👾 Друг Опенсурса
Uma AI
Uma AI — студия ИИ-контента
Изображения, видео, музыка и агенты — в одной нейросети.
❤4👍3
⚡️ Что произошло в AI за сутки:
• Moonshot открыла веса Kimi K3. Это крупнейшая open-weight модель в истории — 2.8 трлн параметров, контекст 1 млн токенов. Уже появляются первые inference-провайдеры и скоро начнут выходить файнтюны.
• MCP получил крупнейшее обновление с момента запуска. Протокол стал stateless, теперь AI-агентов можно масштабировать почти как обычные веб-сервисы. Для всех, кто строит агентные системы, это очень важный апдейт.
• Anthropic показала, как Claude Mythos помогает искать новые атаки на криптографические алгоритмы. Один из примеров — снижение сложности атаки на HAWK-256 с 2⁶⁴ до 2³⁸. До взлома AES далеко, но выглядит впечатляюще.
• Microsoft представила собственную AI-модель для кибербезопасности и multi-agent систему, которая умеет искать, проверять и предлагать исправления для уязвимостей.
🚀 umaai.site/computer
👾 Друг Опенсурса
• Moonshot открыла веса Kimi K3. Это крупнейшая open-weight модель в истории — 2.8 трлн параметров, контекст 1 млн токенов. Уже появляются первые inference-провайдеры и скоро начнут выходить файнтюны.
• MCP получил крупнейшее обновление с момента запуска. Протокол стал stateless, теперь AI-агентов можно масштабировать почти как обычные веб-сервисы. Для всех, кто строит агентные системы, это очень важный апдейт.
• Anthropic показала, как Claude Mythos помогает искать новые атаки на криптографические алгоритмы. Один из примеров — снижение сложности атаки на HAWK-256 с 2⁶⁴ до 2³⁸. До взлома AES далеко, но выглядит впечатляюще.
• Microsoft представила собственную AI-модель для кибербезопасности и multi-agent систему, которая умеет искать, проверять и предлагать исправления для уязвимостей.
🚀 umaai.site/computer
👾 Друг Опенсурса
👍6❤1
Официальный ответ дурова на обвинение в терроризме
Ладно, шутки шутками
Давно хотел написать про свой сетап, сделаем это еще немного попозже (он очень быстро меняется, извините))) ). Но как по мне, важная халява: в cline (самом старом агенте для кода, который за последнее время сильно улучшился) сделали бесплатной GLM 5.2
Пользуемся так: скачиваете расширение для вс кода, там заходите в настройки, выбираете провайдера кляйн и жмякайте на глм
🚀 umaai.site/computer
👾 Друг Опенсурса
Ладно, шутки шутками
Давно хотел написать про свой сетап, сделаем это еще немного попозже (он очень быстро меняется, извините))) ). Но как по мне, важная халява: в cline (самом старом агенте для кода, который за последнее время сильно улучшился) сделали бесплатной GLM 5.2
Пользуемся так: скачиваете расширение для вс кода, там заходите в настройки, выбираете провайдера кляйн и жмякайте на глм
🚀 umaai.site/computer
👾 Друг Опенсурса
❤5🔥3
Media is too big
VIEW IN TELEGRAM
Seedance 2.5: послезавтра на Uma Ai
Все написали, а чем мы хуже? у нас же нет подписок, только pay as you go
🚀 umaai.site/computer
👾 Друг Опенсурса
Все написали, а чем мы хуже? у нас же нет подписок, только pay as you go
🚀 umaai.site/computer
👾 Друг Опенсурса
🔥8
This media is not supported in your browser
VIEW IN TELEGRAM
🔥Minimax H3
Проснулись китайцы, ждем сиденс, ван3 и новый минимакс, все в ближайшие недели и все будет на Uma
🚀 umaai.site/computer
👾 Друг Опенсурса
Проснулись китайцы, ждем сиденс, ван3 и новый минимакс, все в ближайшие недели и все будет на Uma
🚀 umaai.site/computer
👾 Друг Опенсурса
❤1🔥1
⚡️OpenAi обвалили (впервые в истории помоему) цены на модели ChatGPT 5.6
Особенно Луна: 0.2/$1.2 за миллион токенов, против $1/$6 первоначально. Земля в цене стала дешевле на 20%, Солнышко не потерпело изменений))
Это круто, потому что луна сейчас чуть ли не самая экономичная модель вообще, но очень производительная в агентных и кодинг тасках
Мы используем ее в Uma Computer, теперь агент получается стал в 5 раз дешевле с Luna
🚀 umaai.site/computer
👾 Друг Опенсурса
Особенно Луна: 0.2/$1.2 за миллион токенов, против $1/$6 первоначально. Земля в цене стала дешевле на 20%, Солнышко не потерпело изменений))
Это круто, потому что луна сейчас чуть ли не самая экономичная модель вообще, но очень производительная в агентных и кодинг тасках
Мы используем ее в Uma Computer, теперь агент получается стал в 5 раз дешевле с Luna
🚀 umaai.site/computer
👾 Друг Опенсурса
❤4
ДругОпенсурса Aka. Новости нейросетей
Minimax H3 вышла! Уже доступна на Uma Ai 🚀 umaai.site/computer 👾 Друг Опенсурса
Скоро откроют веса, со дня на день
Модель очень крута для опенсурса и ходят слухи, что ее удастся запустить на 3060 (12гб) в 480пи и генерация 5 секунд займет всего 10 минут!
если так - очень круто, посмотрим что скажет на это ван3
Так же, вероятно во вторник выйдет гемини 3.5 про, сигналы те же, что перед выходами новых моделей от гугл обычно. Должна быть фронтир модель, уровня опуса 5 и, наверное, очень щедрые лимиты в антигравити ждут нас
Модель очень крута для опенсурса и ходят слухи, что ее удастся запустить на 3060 (12гб) в 480пи и генерация 5 секунд займет всего 10 минут!
если так - очень круто, посмотрим что скажет на это ван3
Так же, вероятно во вторник выйдет гемини 3.5 про, сигналы те же, что перед выходами новых моделей от гугл обычно. Должна быть фронтир модель, уровня опуса 5 и, наверное, очень щедрые лимиты в антигравити ждут нас
👍5
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Flux 3 вышел!
Все хорошо, кроме цены, ну правда, что минимакс, что сиденсе и флюк стоят каких то лютых денег за секунду.
Твиттерские посчитали, что если запускать в гугл колаб минимакс аш3 сразу пачку видосов, то цена за 15 секундый видос выйдет примерно 26 рублей (0.28$), вот эта цена конечно гораздо приятнее
сейчас занимаемся тем, чтобы на Uma Ai реализовать максимально дешевую цену на Minimax h3, буду держать в курсе, флюкс 3 с сегодняшнего вечера будет со скидкой неделю
👾 Друг Опенсурса
Все хорошо, кроме цены, ну правда, что минимакс, что сиденсе и флюк стоят каких то лютых денег за секунду.
Твиттерские посчитали, что если запускать в гугл колаб минимакс аш3 сразу пачку видосов, то цена за 15 секундый видос выйдет примерно 26 рублей (0.28$), вот эта цена конечно гораздо приятнее
сейчас занимаемся тем, чтобы на Uma Ai реализовать максимально дешевую цену на Minimax h3, буду держать в курсе, флюкс 3 с сегодняшнего вечера будет со скидкой неделю
👾 Друг Опенсурса
👍3
ДругОпенсурса Aka. Новости нейросетей
⚡️ Flux 3 вышел! Все хорошо, кроме цены, ну правда, что минимакс, что сиденсе и флюк стоят каких то лютых денег за секунду. Твиттерские посчитали, что если запускать в гугл колаб минимакс аш3 сразу пачку видосов, то цена за 15 секундый видос выйдет примерно…
почвился на Uma Ai
(кстати в режиме черновика цену за 20 секунд видоса в 720пи - 360 кредитов)
(кстати в режиме черновика цену за 20 секунд видоса в 720пи - 360 кредитов)
🔥1
ДругОпенсурса Aka. Новости нейросетей
УРА wan3 в публичной бете))) 30 секунд нативно
🔗wan.video
🔗 Alibaba Cloud Model Studio: modelstudio.console.alibabacloud.com/
🔗 Qwen Cloud: qwencloud.com/models/
🔗 Alibaba Cloud Model Studio: modelstudio.console.alibabacloud.com/
🔗 Qwen Cloud: qwencloud.com/models/
Qwencloud
Model Marketplace- Text, Image, Video & Audio - Qwen Cloud
Access AI models on Qwen Cloud for text, image, video, and audio generation. Includes Qwen3.6 and Wan video generation models. API-ready with free tier and pay-as-you-go pricing.
👍2
⚡️ Про Qwen3.8 и слово «открытые»
Половина заголовков: «Алибаба выложила открытые веса». Пошёл проверять — не выложила.
Официальный твит от 3 августа обещает веса Max и 27B «на следующей неделе», то есть примерно сейчас. В орге Qwen на HuggingFace их нет, страницы Qwen3.8-27B и Max отдают 401.
При этом кванты от энтузиастов уже висят: FP8 и NVFP4, в карточке ссылка на Qwen/Qwen3.8-27B и лицензия apache-2.0. Где-то веса уже ходят.
Что из этого реально доедет до вашего компа: Max с его 2.4 трлн параметров — никогда, даже в кванте. А вот 27B — да, по прикидкам 14–16 ГБ в 4 битах, анслот обещает ~17 ГБ. Это 24-гиговая карта.
Только Алибаба до сих пор не дала по 27B ни архитектуры, ни контекста, ни бенчей, ни лицензии. Ноль цифр по модели, которую уже все называют открытой.
Пока веса не лежат в доступе с внятной лицензией — это анонс, а не релиз. Выложат — сам скачаю и отпишусь.
🚀 umaai.site/computer
👾 Друг Опенсурса
Половина заголовков: «Алибаба выложила открытые веса». Пошёл проверять — не выложила.
Официальный твит от 3 августа обещает веса Max и 27B «на следующей неделе», то есть примерно сейчас. В орге Qwen на HuggingFace их нет, страницы Qwen3.8-27B и Max отдают 401.
При этом кванты от энтузиастов уже висят: FP8 и NVFP4, в карточке ссылка на Qwen/Qwen3.8-27B и лицензия apache-2.0. Где-то веса уже ходят.
Что из этого реально доедет до вашего компа: Max с его 2.4 трлн параметров — никогда, даже в кванте. А вот 27B — да, по прикидкам 14–16 ГБ в 4 битах, анслот обещает ~17 ГБ. Это 24-гиговая карта.
Только Алибаба до сих пор не дала по 27B ни архитектуры, ни контекста, ни бенчей, ни лицензии. Ноль цифр по модели, которую уже все называют открытой.
Пока веса не лежат в доступе с внятной лицензией — это анонс, а не релиз. Выложат — сам скачаю и отпишусь.
🚀 umaai.site/computer
👾 Друг Опенсурса
👍2
🔥Muse Spark 1.2
Мета выкатили свою новую модель, уровень опус 5 +-
но я тут сказать больше не могу, потому что еще не тестил, но до конца года(!!) она будет полностью бесплатна
🚀 umaai.site/computer
👾 Друг Опенсурса
Мета выкатили свою новую модель, уровень опус 5 +-
но я тут сказать больше не могу, потому что еще не тестил, но до конца года(!!) она будет полностью бесплатна
🚀 umaai.site/computer
👾 Друг Опенсурса
🔥4
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5