ДругОпенсурса Aka. Новости нейросетей
643 subscribers
512 photos
138 videos
409 links
Download Telegram
⚡️ Google показала сразу три новые Gemini: 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber.

3.6 Flash стала лучше в кодинге, рассуждениях и работе с инструментами. При этом она дешевле прошлой версии — $1.50 / $7.50 за миллион входных и выходных токенов. Плюс Google заявляет, что модель тратит заметно меньше output-токенов. Если это подтвердится, экономия будет приятной.

3.5 Flash-Lite теперь самая дешевая модель в линейке — $0.30 / $2.50 за миллион токенов. Для простых задач выглядит неплохо. А 3.5 Flash Cyber пока доступна только партнерам и заточена под поиск и исправление уязвимостей в коде.

Но если честно, я вообще ждал не этого.

OpenAI, Anthropic, Alibaba, xAI, Mistral, Moonshot - все дропнули по несколько(!) поколений моделей. Даже Meta, отсталая мета, на которой я, признаюсь, поставил крест, как на ai labe выложила muse 1.1, тоже фронтир

А гугл где? По моему мнению главный игрок в индустрии. Стыд и позор, искренни обидно (раньше модельки в аи студии появлялись чуть ли не каждый день)

umaai.site
4
⚡️ Poolside выкатили Laguna S 2.1.

И вот это уже реально интересно.

118B MoE (активно всего 8B на токен), контекст до 1 млн токенов, открытые веса уже лежат на Hugging Face. Есть BF16, FP8, INT4, GGUF, MLX — короче, релиз сразу (не как у муншотов с кими к3)

Самое интересное — это размер. По словам Poolside, Laguna S 2.1 на Terminal-Bench 2.1 идет рядом с моделями, которые в 5–25 раз больше, а местами вообще их обгоняет. Если это подтвердится независимыми тестами, получится очень сильная open-weight модель именно для кодинга.

Еще понравилось, что они прямо написали про минусы. Модель иногда начинает слишком долго думать на сложной математике, а промежуточного режима между thinking и no-thinking пока нет. Обычно компании про такое молчат.

🚀 umaai.site/computer
👾 Друг Опенсурса
👌5👍2
⚡️ Чем больше читаю про Kimi K3, тем меньше понимаю, почему все называют ее "дешевой".

Да, по прайсу вроде не катастрофа — $3 за миллион input-токенов и $15 за миллион output. Но есть нюанс.

По факту модель во время рассуждений жрет просто какое-то безумное количество токенов. Видел сравнение с Sonnet 5 — Kimi тратит почти в три раза больше. И проблема даже не в цене за миллион токенов, а в том, сколько их реально уходит на одну задачу.

По ощущениям, она просто перебирает варианты. Иногда буквально забывает, о чем сама же писала несколько шагов назад, начинает заходить на новый круг... и в итоге за счет огромного количества итераций все-таки приходит к правильному ответу. Работает? Да. Но какой ценой.

Для сравнения, тот же Muse Spark 1.1 стоит около $2 за миллион input и $4–6 за output. И в итоге многие задачи обходятся банально дешевле.

Но я бы пока не хоронил Kimi.

27 числа обещают открыть веса. Почти уверен, что довольно быстро появятся первые файнтюны. Возможно, кто-то сможет хотя бы немного уменьшить этот дикий расход токенов. Плюс появятся неофициальные провайдеры, которые начнут гонять модель на своем железе и сильно собьют цену. Не удивлюсь, если NVIDIA тоже добавит бесплатный inference с лимитами.

А вот разговоры в духе "ну запустим локально" меня забавляют. Там почти 3 триллиона параметров. Да, это MoE. Но это все еще модель совсем не для домашнего ПК. Если у вас не стоит небольшой дата-центр в гараже, про локальный запуск можно особо не мечтать.

🚀 umaai.site/computer
👾 Друг Опенсурса
👌41
⚡️ Alibaba представила Qwen-Image 3.0.

Главная идея новой версии — сделать генерацию изображений не просто красивой, а реально полезной для работы.

Промпты теперь могут быть до 4500 токенов. Модель умеет за один проход собирать сложные макеты: сториборды, газеты, экзаменационные листы, инфографику, интерфейсы. Плюс заявлена поддержка более 100 художественных стилей, 12 языков и генерация с учетом знаний о мире.

Еще один большой упор сделали на текст. Alibaba говорит, что модель умеет рисовать читаемый текст вплоть до 10 px, генерировать полноценные LaTeX-документы, лучше передавать мелкие детали вроде кожи и волос.

Я уже немного потыкал. С текстом реально стало лучше, причем даже с русским. Но на совсем мелких надписях все еще начинает сыпаться (см 3 картинку). До гпт имг 2 пока далеко

В целом выглядит интересно.

🚀 umaai.site/computer
👾 Друг Опенсурса
👍6🔥1
ДругОпенсурса Aka. Новости нейросетей
⚡️ Google показала сразу три новые Gemini: 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber. 3.6 Flash стала лучше в кодинге, рассуждениях и работе с инструментами. При этом она дешевле прошлой версии — $1.50 / $7.50 за миллион входных и выходных токенов. Плюс…
Прочитал пост Логана из Google DeepMind. Он написал, что они начали тренировать Gemini 4.

И тут возникает вопрос: а Gemini 3.5 Pro вообще существовала? Потому что складывается ощущение, что на нее просто забили. Либо ее действительно никто не обучал, либо релиз все-таки будет позже.

Но, если честно, даже если она выйдет в ближайшее время, у меня большие сомнения, что в кодинге она догонит конкурентов.

Я еще год назад говорил, что сравнивать модели по большей части уже имеет смысл только в кодинге и агентных задачах. Они все давно научились нормально писать текст. Уже нет такого, как во времена GPT-3.5, когда одна модель знала заметно больше другой.

Сейчас важны программирование, агентные сценарии, математика, понимание 3D. Вот там и видно реальный уровень модели.

А мультимодальность, на которую Google делает такой упор… ну камон. В 2026 году это уже базовый минимум, а не киллер-фича.
5
Звучит бредово, но в вопросе выхода моделек полимаркет пока не давал ошибок (сколько слежу- попадают)
🤯5
🔥Ура опус 5

Он пости во всем кстати круче фейбла! Но дешевле в два раза

🚀 umaai.site/computer
👾 Друг Опенсурса
4🔥1
#нашкейс

Пришёл вопрос от пользователя, от которого у меня похолодело:
«Почему один запрос стоил 38 кредитов? Я посмотрел цены на OpenRouter — по факту должно быть втрое меньше».
Полез проверять. Он оказался прав.
Открываю биллинг того хода:
вход:   119 208 токенов

выход:    1 018 токенов

99% — вход. Модель не писала простыню, она её читала. Сто двадцать тысяч токенов на один ход.
Дальше расскажу, как искал причину. И почему первая версия, самая очевидная, оказалась неверной — я почти начал «оптимизировать» то, что в этом случае вообще ни при чём.

🚀 umaai.site/computer
👾 Друг Опенсурса
5
ДругОпенсурса Aka. Новости нейросетей
#нашкейс Пришёл вопрос от пользователя, от которого у меня похолодело: «Почему один запрос стоил 38 кредитов? Я посмотрел цены на OpenRouter — по факту должно быть втрое меньше». Полез проверять. Он оказался прав. Открываю биллинг того хода: вход: 119 208…
Продолжаю про 120 тысяч токенов за один ход.
Первое, что приходит в голову — раздутая история диалога. Классика: отправляем модели последние 30 сообщений, среди них оказался транскрипт часового видео, и вот тебе счёт.
И код это подтверждал. Там буквально было slice(-30) — последние 30 сообщений, без всякого ограничения по объёму. Одно большое сообщение, и стоимость всех следующих ходов растёт.
Я уже собрался это чинить. А потом открыл тот самый диалог.
В нём было два сообщения. 530 символов.
История была ни при чём. Если бы не проверил конкретный случай, я бы «успешно оптимизировал» и отчитался — не сдвинув счёт ни на копейку.
Мораль, которая мне дорого досталась: сначала смотри на конкретный кейс, потом чини. Правдоподобная гипотеза и есть причина — это разные вещи.
4
ДругОпенсурса Aka. Новости нейросетей
Продолжаю про 120 тысяч токенов за один ход. Первое, что приходит в голову — раздутая история диалога. Классика: отправляем модели последние 30 сообщений, среди них оказался транскрипт часового видео, и вот тебе счёт. И код это подтверждал. Там буквально было slice(…
Итак, где были те 120 тысяч токенов.

Замерил всё, что уходит в промпт, по частям:

схемы инструментов (36 шт)  18 919 симв.  45%

профиль пользователя        12 000 симв.  29%

долговременная память        8 000 симв.  19%

системная инструкция         2 862 симв.   7%

──────────────────────────────────────────────

итого                       41 781 симв. ≈ 13 900 токенов

Теперь главное. Ход агента — это НЕ один запрос к модели. Это цикл: подумал → вызвал инструмент → получил результат → подумал снова. Каждая итерация — отдельный вызов LLM. И на каждом заново уходит весь контекст.

120 226 / 13 900 ≈ 8,6 шагов.

Вот и ответ. Дело было не в размере контекста, а в том, сколько раз он повторяется.

И вывод, который мне не нравится, но он верный: чем автономнее агент, тем дороже он обходится. Просто потому, что делает больше шагов. То самое свойство, за которое агентов и берут, работает против кошелька.
5
Как мы это починили — и почему не «просто обрезали контекст».

Главный принцип: нельзя молча прятать контекст от модели.

Если выкинуть половину истории, агент об этом не узнает. Он будет уверен, что видит всё, и начнёт уверенно делать выводы на неполных данных. Сэкономленные токены заплатишь дважды — неверными действиями и повторными запросами.

Что сделали:

Убрали из предзагрузки то, что агент может взять сам. Профиль пользователя — 12 тысяч символов на каждом шаге. При этом у агента УЖЕ был инструмент, который эти данные читает. Мы платили за предзагрузку того, что доступно по требованию. Теперь, если задача явно не про эти данные, вместо дампа уходит строка «данные есть, вот инструмент». Возможности не потеряли — изменился момент оплаты.

Перешли на бюджет в символах, а не в сообщениях. Потому что «ок» на 40 символов и транскрипт на 60 000 — это не одно и то же, а 

slice(-30)
 считал их равными.

Каждую обрезку помечаем явно. «обрезано N символов». Это и есть разница между экономией и деградацией: видимый маркер даёт агенту повод уточнить, а молчаливое сокращение — повод для уверенной ошибки.

Плюс последние сообщения всегда идут дословно (там текущая задача), а первое сообщение остаётся якорем цели — чтобы на длинной задаче агент не забыл, о чём его вообще просили.

Uma Computer → https://umaai.site/r/habr?to=/computer Платите за расход, а не за подписку. После этой правки — ощутимо меньше.
5
ДругОпенсурса Aka. Новости нейросетей
Как мы это починили — и почему не «просто обрезали контекст». Главный принцип: нельзя молча прятать контекст от модели. Если выкинуть половину истории, агент об этом не узнает. Он будет уверен, что видит всё, и начнёт уверенно делать выводы на неполных данных.…
Побочный баг из той же истории, на который стоит посмотреть, если пользуетесь платными API.
Ошибка:
HTTP 402: You requested up to 8192 tokens,

but can only afford 875.

Выглядит абсурдно: деньги на счету есть, а запрос не проходит.
Разгадка: провайдер резервирует стоимость худшего случая ДО генерации — вход плюс максимально возможный выход. У нас стоял лимит 8192 токена на ответ. Со входом, раздутым до 120k, резерв получался огромным, и на дорогой модели баланса на него не хватало. Хотя фактически ответ был бы 1000 токенов.
То есть распухший контекст не просто дорого стоит. Он ещё и блокирует запросы, которые ты в состоянии оплатить.
Почему пишу: если у вас агент на платном API и вы ловите 402 при непустом балансе — смотрите не на баланс, а на размер входа и на лимит max_tokens.
6
ДругОпенсурса Aka. Новости нейросетей
Побочный баг из той же истории, на который стоит посмотреть, если пользуетесь платными API. Ошибка: HTTP 402: You requested up to 8192 tokens, but can only afford 875. Выглядит абсурдно: деньги на счету есть, а запрос не проходит. Разгадка: провайдер резервирует…
Закрываю серию про стоимость агента. Чек-лист, если строите своего:
1. Умножьте размер промпта на число шагов цикла. Это и есть реальная цена хода, а не то, что видно в одном запросе. Большинство удивляется именно здесь.
2. Посчитайте схемы инструментов отдельно. У нас это 45% накладных. Каждый новый инструмент — налог на каждый шаг каждого хода, навсегда. Инструменты не бесплатны, даже когда не вызываются.
3. Проверьте, не предзагружаете ли то, что доступно инструментом. Самая безболезненная экономия из существующих.
4. Не измеряйте историю в сообщениях. Измеряйте в объёме.
5. Помечайте любую обрезку явно.
6. Проверяйте гипотезу на конкретном случае, прежде чем чинить.
Всё это мы прошли на своём агенте, поэтому цифры не из воздуха. Кому интересно посмотреть на живых задачах — https://umaai.site/r/habr?to=/computer
Дальше будет история про то, как мы изолируем агентов друг от друга (контейнер на пользователя) и три бага, которые объединяет одно: сервис при них выглядел работающим. Один healthcheck падал 19 808 раз подряд, и никто не замечал.

Вот такая история

соре за спам постами

🚀 umaai.site/computer
👾 Друг Опенсурса
4👍3
⚡️ Что произошло в AI за сутки:

• Moonshot открыла веса Kimi K3. Это крупнейшая open-weight модель в истории — 2.8 трлн параметров, контекст 1 млн токенов. Уже появляются первые inference-провайдеры и скоро начнут выходить файнтюны.

• MCP получил крупнейшее обновление с момента запуска. Протокол стал stateless, теперь AI-агентов можно масштабировать почти как обычные веб-сервисы. Для всех, кто строит агентные системы, это очень важный апдейт.

• Anthropic показала, как Claude Mythos помогает искать новые атаки на криптографические алгоритмы. Один из примеров — снижение сложности атаки на HAWK-256 с 2⁶⁴ до 2³⁸. До взлома AES далеко, но выглядит впечатляюще.

• Microsoft представила собственную AI-модель для кибербезопасности и multi-agent систему, которая умеет искать, проверять и предлагать исправления для уязвимостей.

🚀 umaai.site/computer
👾 Друг Опенсурса
👍61
Официальный ответ дурова на обвинение в терроризме

Ладно, шутки шутками

Давно хотел написать про свой сетап, сделаем это еще немного попозже (он очень быстро меняется, извините))) ). Но как по мне, важная халява: в cline (самом старом агенте для кода, который за последнее время сильно улучшился) сделали бесплатной GLM 5.2

Пользуемся так: скачиваете расширение для вс кода, там заходите в настройки, выбираете провайдера кляйн и жмякайте на глм

🚀 umaai.site/computer
👾 Друг Опенсурса
5🔥3
Media is too big
VIEW IN TELEGRAM
Seedance 2.5: послезавтра на Uma Ai

Все написали, а чем мы хуже? у нас же нет подписок, только pay as you go

🚀 umaai.site/computer
👾 Друг Опенсурса
🔥8