ДругОпенсурса Aka. Новости нейросетей
643 subscribers
512 photos
138 videos
409 links
Download Telegram
Звучит бредово, но в вопросе выхода моделек полимаркет пока не давал ошибок (сколько слежу- попадают)
🤯5
🔥Ура опус 5

Он пости во всем кстати круче фейбла! Но дешевле в два раза

🚀 umaai.site/computer
👾 Друг Опенсурса
4🔥1
#нашкейс

Пришёл вопрос от пользователя, от которого у меня похолодело:
«Почему один запрос стоил 38 кредитов? Я посмотрел цены на OpenRouter — по факту должно быть втрое меньше».
Полез проверять. Он оказался прав.
Открываю биллинг того хода:
вход:   119 208 токенов

выход:    1 018 токенов

99% — вход. Модель не писала простыню, она её читала. Сто двадцать тысяч токенов на один ход.
Дальше расскажу, как искал причину. И почему первая версия, самая очевидная, оказалась неверной — я почти начал «оптимизировать» то, что в этом случае вообще ни при чём.

🚀 umaai.site/computer
👾 Друг Опенсурса
5
ДругОпенсурса Aka. Новости нейросетей
#нашкейс Пришёл вопрос от пользователя, от которого у меня похолодело: «Почему один запрос стоил 38 кредитов? Я посмотрел цены на OpenRouter — по факту должно быть втрое меньше». Полез проверять. Он оказался прав. Открываю биллинг того хода: вход: 119 208…
Продолжаю про 120 тысяч токенов за один ход.
Первое, что приходит в голову — раздутая история диалога. Классика: отправляем модели последние 30 сообщений, среди них оказался транскрипт часового видео, и вот тебе счёт.
И код это подтверждал. Там буквально было slice(-30) — последние 30 сообщений, без всякого ограничения по объёму. Одно большое сообщение, и стоимость всех следующих ходов растёт.
Я уже собрался это чинить. А потом открыл тот самый диалог.
В нём было два сообщения. 530 символов.
История была ни при чём. Если бы не проверил конкретный случай, я бы «успешно оптимизировал» и отчитался — не сдвинув счёт ни на копейку.
Мораль, которая мне дорого досталась: сначала смотри на конкретный кейс, потом чини. Правдоподобная гипотеза и есть причина — это разные вещи.
4
ДругОпенсурса Aka. Новости нейросетей
Продолжаю про 120 тысяч токенов за один ход. Первое, что приходит в голову — раздутая история диалога. Классика: отправляем модели последние 30 сообщений, среди них оказался транскрипт часового видео, и вот тебе счёт. И код это подтверждал. Там буквально было slice(…
Итак, где были те 120 тысяч токенов.

Замерил всё, что уходит в промпт, по частям:

схемы инструментов (36 шт)  18 919 симв.  45%

профиль пользователя        12 000 симв.  29%

долговременная память        8 000 симв.  19%

системная инструкция         2 862 симв.   7%

──────────────────────────────────────────────

итого                       41 781 симв. ≈ 13 900 токенов

Теперь главное. Ход агента — это НЕ один запрос к модели. Это цикл: подумал → вызвал инструмент → получил результат → подумал снова. Каждая итерация — отдельный вызов LLM. И на каждом заново уходит весь контекст.

120 226 / 13 900 ≈ 8,6 шагов.

Вот и ответ. Дело было не в размере контекста, а в том, сколько раз он повторяется.

И вывод, который мне не нравится, но он верный: чем автономнее агент, тем дороже он обходится. Просто потому, что делает больше шагов. То самое свойство, за которое агентов и берут, работает против кошелька.
5
Как мы это починили — и почему не «просто обрезали контекст».

Главный принцип: нельзя молча прятать контекст от модели.

Если выкинуть половину истории, агент об этом не узнает. Он будет уверен, что видит всё, и начнёт уверенно делать выводы на неполных данных. Сэкономленные токены заплатишь дважды — неверными действиями и повторными запросами.

Что сделали:

Убрали из предзагрузки то, что агент может взять сам. Профиль пользователя — 12 тысяч символов на каждом шаге. При этом у агента УЖЕ был инструмент, который эти данные читает. Мы платили за предзагрузку того, что доступно по требованию. Теперь, если задача явно не про эти данные, вместо дампа уходит строка «данные есть, вот инструмент». Возможности не потеряли — изменился момент оплаты.

Перешли на бюджет в символах, а не в сообщениях. Потому что «ок» на 40 символов и транскрипт на 60 000 — это не одно и то же, а 

slice(-30)
 считал их равными.

Каждую обрезку помечаем явно. «обрезано N символов». Это и есть разница между экономией и деградацией: видимый маркер даёт агенту повод уточнить, а молчаливое сокращение — повод для уверенной ошибки.

Плюс последние сообщения всегда идут дословно (там текущая задача), а первое сообщение остаётся якорем цели — чтобы на длинной задаче агент не забыл, о чём его вообще просили.

Uma Computer → https://umaai.site/r/habr?to=/computer Платите за расход, а не за подписку. После этой правки — ощутимо меньше.
5
ДругОпенсурса Aka. Новости нейросетей
Как мы это починили — и почему не «просто обрезали контекст». Главный принцип: нельзя молча прятать контекст от модели. Если выкинуть половину истории, агент об этом не узнает. Он будет уверен, что видит всё, и начнёт уверенно делать выводы на неполных данных.…
Побочный баг из той же истории, на который стоит посмотреть, если пользуетесь платными API.
Ошибка:
HTTP 402: You requested up to 8192 tokens,

but can only afford 875.

Выглядит абсурдно: деньги на счету есть, а запрос не проходит.
Разгадка: провайдер резервирует стоимость худшего случая ДО генерации — вход плюс максимально возможный выход. У нас стоял лимит 8192 токена на ответ. Со входом, раздутым до 120k, резерв получался огромным, и на дорогой модели баланса на него не хватало. Хотя фактически ответ был бы 1000 токенов.
То есть распухший контекст не просто дорого стоит. Он ещё и блокирует запросы, которые ты в состоянии оплатить.
Почему пишу: если у вас агент на платном API и вы ловите 402 при непустом балансе — смотрите не на баланс, а на размер входа и на лимит max_tokens.
6
ДругОпенсурса Aka. Новости нейросетей
Побочный баг из той же истории, на который стоит посмотреть, если пользуетесь платными API. Ошибка: HTTP 402: You requested up to 8192 tokens, but can only afford 875. Выглядит абсурдно: деньги на счету есть, а запрос не проходит. Разгадка: провайдер резервирует…
Закрываю серию про стоимость агента. Чек-лист, если строите своего:
1. Умножьте размер промпта на число шагов цикла. Это и есть реальная цена хода, а не то, что видно в одном запросе. Большинство удивляется именно здесь.
2. Посчитайте схемы инструментов отдельно. У нас это 45% накладных. Каждый новый инструмент — налог на каждый шаг каждого хода, навсегда. Инструменты не бесплатны, даже когда не вызываются.
3. Проверьте, не предзагружаете ли то, что доступно инструментом. Самая безболезненная экономия из существующих.
4. Не измеряйте историю в сообщениях. Измеряйте в объёме.
5. Помечайте любую обрезку явно.
6. Проверяйте гипотезу на конкретном случае, прежде чем чинить.
Всё это мы прошли на своём агенте, поэтому цифры не из воздуха. Кому интересно посмотреть на живых задачах — https://umaai.site/r/habr?to=/computer
Дальше будет история про то, как мы изолируем агентов друг от друга (контейнер на пользователя) и три бага, которые объединяет одно: сервис при них выглядел работающим. Один healthcheck падал 19 808 раз подряд, и никто не замечал.

Вот такая история

соре за спам постами

🚀 umaai.site/computer
👾 Друг Опенсурса
4👍3
⚡️ Что произошло в AI за сутки:

• Moonshot открыла веса Kimi K3. Это крупнейшая open-weight модель в истории — 2.8 трлн параметров, контекст 1 млн токенов. Уже появляются первые inference-провайдеры и скоро начнут выходить файнтюны.

• MCP получил крупнейшее обновление с момента запуска. Протокол стал stateless, теперь AI-агентов можно масштабировать почти как обычные веб-сервисы. Для всех, кто строит агентные системы, это очень важный апдейт.

• Anthropic показала, как Claude Mythos помогает искать новые атаки на криптографические алгоритмы. Один из примеров — снижение сложности атаки на HAWK-256 с 2⁶⁴ до 2³⁸. До взлома AES далеко, но выглядит впечатляюще.

• Microsoft представила собственную AI-модель для кибербезопасности и multi-agent систему, которая умеет искать, проверять и предлагать исправления для уязвимостей.

🚀 umaai.site/computer
👾 Друг Опенсурса
👍61
Официальный ответ дурова на обвинение в терроризме

Ладно, шутки шутками

Давно хотел написать про свой сетап, сделаем это еще немного попозже (он очень быстро меняется, извините))) ). Но как по мне, важная халява: в cline (самом старом агенте для кода, который за последнее время сильно улучшился) сделали бесплатной GLM 5.2

Пользуемся так: скачиваете расширение для вс кода, там заходите в настройки, выбираете провайдера кляйн и жмякайте на глм

🚀 umaai.site/computer
👾 Друг Опенсурса
5🔥3
Media is too big
VIEW IN TELEGRAM
Seedance 2.5: послезавтра на Uma Ai

Все написали, а чем мы хуже? у нас же нет подписок, только pay as you go

🚀 umaai.site/computer
👾 Друг Опенсурса
🔥8
This media is not supported in your browser
VIEW IN TELEGRAM
🔥Minimax H3

Проснулись китайцы, ждем сиденс, ван3 и новый минимакс, все в ближайшие недели и все будет на Uma

🚀 umaai.site/computer
👾 Друг Опенсурса
1🔥1
⚡️OpenAi обвалили (впервые в истории помоему) цены на модели ChatGPT 5.6

Особенно Луна: 0.2/$1.2 за миллион токенов, против $1/$6 первоначально. Земля в цене стала дешевле на 20%, Солнышко не потерпело изменений))

Это круто, потому что луна сейчас чуть ли не самая экономичная модель вообще, но очень производительная в агентных и кодинг тасках

Мы используем ее в Uma Computer, теперь агент получается стал в 5 раз дешевле с Luna

🚀 umaai.site/computer
👾 Друг Опенсурса
4
ДругОпенсурса Aka. Новости нейросетей
Minimax H3 вышла! Уже доступна на Uma Ai 🚀 umaai.site/computer 👾 Друг Опенсурса
Скоро откроют веса, со дня на день

Модель очень крута для опенсурса и ходят слухи, что ее удастся запустить на 3060 (12гб) в 480пи и генерация 5 секунд займет всего 10 минут!

если так - очень круто, посмотрим что скажет на это ван3

Так же, вероятно во вторник выйдет гемини 3.5 про, сигналы те же, что перед выходами новых моделей от гугл обычно. Должна быть фронтир модель, уровня опуса 5 и, наверное, очень щедрые лимиты в антигравити ждут нас
👍5
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Flux 3 вышел!

Все хорошо, кроме цены, ну правда, что минимакс, что сиденсе и флюк стоят каких то лютых денег за секунду.

Твиттерские посчитали, что если запускать в гугл колаб минимакс аш3 сразу пачку видосов, то цена за 15 секундый видос выйдет примерно 26 рублей (0.28$), вот эта цена конечно гораздо приятнее

сейчас занимаемся тем, чтобы на Uma Ai реализовать максимально дешевую цену на Minimax h3, буду держать в курсе, флюкс 3 с сегодняшнего вечера будет со скидкой неделю

👾 Друг Опенсурса
👍3
УРА wan3 в публичной бете)))

30 секунд нативно
🔥3