Mat Intellect 😎
88 subscribers
92 photos
5 videos
1 file
79 links
Канал Mat про ИИ
Подписывайся 👇
https://www.instagram.com/matintellect
https://www.youtube.com/@Matintel
Download Telegram
#AI: ЗП токенами? 💰

⚡️ Внутри Meta был leaderboard "Claudeonomics" - инженеры гонялись за титулом "Token Legend" и сожгли 73,7 триллиона токенов за месяц. $2,65 млрд/год по прайсу. Leaderboard закрыли. А глава Instagram Адам Моссери объяснил почему это только начало

Что именно сказал Моссери о будущем токен-бюджетов:
Через 1-2 года у сильного инженера темп сжигания токенов сравняется со стоимостью его найма. Тогда компании введут персональные лимиты - пропорциональные тому, насколько они доверяют ROI от конкретного человека. Leaderboard заменяют на "ИИ Gateway" с реальным мониторингом по командам. Это уже не "расходы на ПО" - это персональный ресурс который распределяют как бюджет

Кто уже перешел к токен-лимитам на персонал:
📌 Uber - $1 500/мес на один ИИ-инструмент. Годовой бюджет сгорел в апреле, за 4 месяца. До лимита - до $2 000/мес на инженера. 95% инженеров используют ИИ ежемесячно, ~10% кода от агентов
📌 Tesla - $200/неделю с 6 июля. Инженеры жгли "тысячи долларов в неделю". xAI-продукты (Grok, Composer) через "Bottle Rocket" в лимит не идут - Маск умеет договариваться с самим собой
📌 Microsoft - закрыл Claude Code лицензии для Experiences+Devices к 30 июня. Перевел на GitHub Copilot CLI. Сами модели Claude (Sonnet, Opus, Haiku) остались внутри Copilot

Математика не дает соврать: два инструмента по лимиту Uber = $36 000/год на инженера. Это 11% от типичного пакета $330 000. Сравни с джуниором на пол-ставки - один к одному. CFO уже проводят именно эту аналогию

Куда ведет эта логика дальше:
💡 Токен-лимит как новый грейд - у сеньора ИИ-бюджет больше. Ровно как зарплата. Компании уже думают именно так
💡 ROI виден на уровне человека - сколько потратил, сколько принес. Впервые в истории это считается автоматически
💡 Token-based billing убивает flat-fee подписки - каждый цент привязан к конкретному сотруднику, а не тонет в строчке "облако"
💡 AWS уже добавляет cloud credits в стартап-оффер - токены идут туда же, это только вопрос времени

Uber, Tesla, Meta, Amazon, Walmart движутся синхронно. Когда ресурс стоит как зарплата - его начинают выдавать как зарплату

🎯 Опционы в 1980-х казались нишевым инструментом стартапов. Сегодня это стандарт в каждом офере. Облачные кредиты - следующими. Токены после них. ЗП начнут выдавать токенами - вопрос не "если", а "когда"

Instagram | YouTube | Threads
Видео-голосовой ассистент🎙

Моя попытка переосмыслить голосового ассистента привела меня к созданию многофункционального инструмента, который управляется голосом - то есть это не просто Siri или Алиса, у которой ты спрашиваешь что-то простое или просишь выполнить какую-то простейшую функцию

Это полнейший дирижер в твоей системе, который может управлять другими агентами, выполнять активные действия, планировать, быть полностью твоим вторым пилотом - подключенным к общей памяти всей твоей системы, знающим все, что происходит в ней, и готовым в любой момент, в любом месте, с любого девайса продолжить работу над теми проектами, над которыми ты сейчас трудишься

В моем случае голосовой ассистент подключен напрямую к Hermes - агенту на подписке ChatGPT

Но кроме этого, голосовой ассистент имеет зрение. Я ему могу показать что-то в камеру или отправить изображение картинкой. То же самое могу сделать с телефона 👁️

И приятный бонус - живое лицо с живой мимикой, которая создает ощущение работы с живым человеком

Как вам?

Посмотрите на видео, что получилось - жду комментарии и вопросы 👇

Instagram | YouTube | Threads
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
🔥1
Быстрый голосовой ассистент

После публикации последнего поста в соцсетях мне прилетела от аудитории предъява, что мой голосовой ассистент работает медленно. Последние сутки занялся именно этой задачей - подключил ему дополнительный быстрый мозг, теперь он работает в двух состояниях по переключению по кнопке

Первое - это быстрый мод: быстро отвечает, быстро работает, но включена промежуточная быстрая модель для мозга ⚡. Это для общения и для повседневных дел

Если же нужно включить более думающую модель - он подключается напрямую к мозгу Hermes и работает сразу с ним напрямую 🧠. Ответы чуть медленнее, но нет промежуточного мозга, который бы просто передавал задачи Hermes. Это удобно, когда работаешь статично за компьютером или за планшетом и одновременно ведешь какую-то разработку, и голосом дирижируешь остальными агентами

В общем, теперь есть два вида работы: быстрый и умный. Можете посмотреть, как это сейчас работает, на видео ниже. Жду ваших вопросов и комментариев 👇

Instagram | YouTube | Threads
Проблема вайбкодинга - ВЫГОРАНИЕ🔥

Расскажу как было у меня. Я прошел этапы:

• ОТ большого количества разноплановых задач/проектов, которые приводят к выгоранию (было до 6 проектов одновременно)
• ДО оптимального количества, над которыми я могу одновременно работать, быть в потоке и не выгорать (стало 1-2 проекта одновременно)

Принял для себя решение не стремиться сделать много и быстро, а стремиться сделать максимально хорошо от начала до конца один проект (максимум два) и потом брать следующий. Так ушло выгорание и позволяет постоянно находиться в потоке

Сейчас работа в основном делится на этапы:

Архитектура - 70-80%

1. Идея - вообще без экрана, голое рассуждение в голове, как это должно быть реализовано в финальном варианте в моем воображении
2. Максимально глубокий ресерч - запуск роя агентов по вопросам: как решить эту задачу, есть ли конкуренты, есть ли уже готовые решения, какие есть готовые инструменты и связки, что нужно создать с нуля
3. Прототипирование и проработка идеи - что будет являться удачным MVP, а что готовым продуктом
4. Планирование реализации, безопасности и тестирования - как все будет сделано
5. Аудит - у меня автоматизирован процесс из 8 ревьюеров с независимой проверкой, где внутри 3 модели: Claude + Codex + GLM
6. Слабые места - скрупулезная отработка всех найденных косяков через аудит

Разработка - 20-30%

7. Разработка - через GSD: повторное исследование, ответы на вопросы исследователей, планирование и так далее по процессу GSD
8. Тестирование - после каждого этапа и сразу правка багов
9. Боевой режим - живая работа проекта со встроенной аналитикой на ключевых узлах
10. Дебагинг + эволюция - совершенствование продукта, разработка новых фич

Итого - в 95% случаев получается с первого раза делать готовый продукт и не выгорать 🎯

При работе в GSD освобождается больше свободного времени, чтобы сделать что-то параллельно, но я все равно посматриваю в экран и иногда на лету вылавливаю баги, если разработка заходит не туда. Полностью все в авто-режим не оставляю никогда - очень высока цена ошибки и жалко убитого времени ⏳

Instagram | YouTube | Threads
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2
😔 Если честно в последний месяц очень устал от Claude. Желание уйти на пол года и подождать когда модели действительно станут пригодны для разработки. Сейчас это чаще приводит к выгоранию чем к результату 🤮

А у вас как? Всё получается?
Please open Telegram to view this post
VIEW IN TELEGRAM
😁2
Media is too big
VIEW IN TELEGRAM
#AI: Opus 5.5 - СУПЕР ❗️

🔥 22 сентября Anthropic тихо выкатили Opus 5.5 - и я сразу засел работать. Сутки спустя могу сказать честно: это первый раз с Opus 4 и Opus 5 когда чувствуется что модель думает по-другому. Не быстрее. По-другому

Что именно изменилось в Opus 5.5:
Главная фишка не в цифрах - в том как модель ведет себя внутри задачи. Сама решает когда позвать сабагента, сама проверяет результат нетривиальными способами, не ждет что ты ее за ручку поведешь. Я давал задачи и просто уходил работать дальше. Возвращался - готово, без косяков которые надо переделывать. Это ощущение "ок, разберется сама" - которого не было ни в Opus 4, ни в Opus 5

Модель нативно управляет инструментами: запускает тесты, читает логи, редактирует файлы, дергает внешние API - и все это в рамках одного задания без твоего участия. Не просто выполняет шаги, а мониторит процесс и сама корректирует маршрут если что-то пошло не так. Официальный кейс от Anthropic: миграция кодовой базы в 680 000 строк завершена меньше чем за сутки. Я до такого масштаба не добрался, но ощущение автономии - точно узнаю

Бенчмарки Terminal-Bench 4.0 - agentic coding:
🟢 Opus 5.5 - 66.4% - первое место среди всех публичных моделей
🟢 GPT-6 Astra - 57.9% - ближайший конкурент
🟢 Opus 5 - 52.3% - предыдущая версия, для понимания разрыва

OSWorld 2.0 (computer use): 81.8% - тоже лидер. GDPval-AA v2.1 (knowledge work): 1 846 Elo. Решает терминальные задачи примерно на 40% меньшим количеством шагов чем Opus 5 - это ощущается в реальной работе: меньше интервенций, больше автономии

Цена и скорость - тоже подтянули:
💡 Input/Output: $4/$20 за MTok - было $5/$25, минус 20%
💡 Cache reads: $0.20/MTok - было $0.50, минус 60%
💡 Скорость генерации: +30% к Opus 5
💡 Лимиты на Pro/Max/Team/Enterprise повышены - для тех кто гоняет агентов часами, это важно

Доступна на AWS, Google Cloud, Azure. В ближайшие недели обещают Sonnet 5.5 и Haiku 5.5 с теми же ключевыми улучшениями

Важный контекст релиза: накануне выпуска Дарио Амодеи опубликовал открытое письмо с призывом к индустрии замедлить темп разработки ведущих ИИ-систем. Opus 5.5 - именно такой продукт: не радикальный прыжок с воем маркетинга, а тихая глубокая итерация. По внутреннему поведенческому аудиту Anthropic - самый высокий alignment-результат среди всех протестированных моделей компании. Перед выпуском независимую верификацию провели Frontier Design и METR

💻 Alignment-аудит: лучший результат среди всех моделей Anthropic

💭 С Opus 4 я чувствовал мощь. С Opus 5 - скорость. С Opus 5.5 первый раз в истории этих моделей я чувствую что модель думает, а не просто выполняет команды. Поставил задачу, ушел - пришел, сделано. Это разница которую не опишешь скором на бенчмарке, но которую сутки реальной работы передают точно

Instagram | YouTube | Threads
Media is too big
VIEW IN TELEGRAM
УЛЕТАЮТ ТОКЕНЫ⁉️

Нашел прикольную штуку для тех, кто много работает в Codex, Claude Code, Gemini и других ИИшках

Называется CodeBurn

Он показывает,

Можно посмотреть:

- какая модель жрет больше всего
- какой проект оказался самым прожорливым
- сколько токенов ушло на разные типы задач
- какие сессии получились самыми дорогими
- сколько потратил сегодня / за неделю / месяц

Самое удобное: CodeBurn берет данные из локальной истории твоих ИИ-инструментов. Не надо подключать API-ключи и чет сложное делать

То есть установил - запустил - и он уже может разобрать прошлые сессии

🧩КАК ПОПРОБОВАТЬ

Репозиторий: https://github.com/getagentseal/codeburn

Можешь вообще не разбираться с установкой руками

Открываешь Codex/Claude и отправляешь:

Изучи README репозитория GitHub ttps://github.com/getagentseal/codeburn

Проверь требования и способ установки из актуальной инструкции автора

Установи CodeBurn безопасным способом и запусти его веб-интерфейс

Ничего в моем текущем проекте не меняй

После запуска объясни мне простыми словами:
- где посмотреть расход токенов;
- какие проекты и модели расходуют больше всего;
- на какие типы задач уходят токены;
- где видны самые дорогие сессии;
- что в моем использовании выглядит неэффективно

Если для установки или запуска чего-то не хватает на компьютере, сначала объясни, что именно нужно, и только потом установи



После этого у тебя откроется панель со статистикой, и можно спокойно изучать, куда уходит расход

Кстати, полезная штука после нашего [материала про лимиты]: тут уже можно посмотреть на СВОИХ данных, где именно ты их сжигаешь

⚠️ Маленький нюанс: если Codex или Claude у тебя работают по подписке, цифра в долларах которую ты видишь, это примерный эквивалент по стоимости API, а не реальное списание твоих бабок, поэтому не пугайся)) Зато можешь прикинь сколько ты тратишь за подписку и сколько бы тебе это стоило если бы ты платил за API

Протестируйте. Мне кажется, штука прям суперполезная и позволяет тебе понимать, куда уходят лимиты

А как оптимизировать? Да просто спросите, она даст точечные рекомендации

Instagram | YouTube | Threads
This media is not supported in your browser
VIEW IN TELEGRAM
РАСХОД ТОКЕНОВ 🥵 Что съедает лимит сильнее всего?

Я думал, что токены уходят на ответы модели. На самом деле почти все уходит в другое место

Вчера провел глубокий анализ и выделил пять главных факторов, от самого сильного к самому слабому:

1. Длинная переписка в одном окне
Модель не помнит разговор между шагами. На каждом твоем сообщении и на каждом своем действии она заново перечитывает всю переписку с самого начала. Чем длиннее окно, тем дороже каждый следующий шаг. Сжатие переписки по умолчанию включается только тогда, когда окно почти переполнено. До этого сотни шагов идут на огромном окне

👉 Сжимай переписку раньше (/compact) или начинай новую беседу, когда закончил этап
💡 Я сократил рабочее окно в настройках с 1 млн. до 500к токенов

2. Суб-агенты
Когда Claude/Codex запускает помощников для исследований, проверок и исполнения задач, у каждого свое окно, и каждое тоже расходует токены. Несколько помощников сразу могут съесть больше, чем основной разговор

👉 Запускай суб-агентов только для действительно важных задач
💡 После выхода Opus 5.5 эта проблема вообще ушла и модель реально вызывает суб-агентов только там, где нужно

3. Перерывы дольше часа
Anthropic/OpenAI держит твою переписку в быстрой памяти около часа. После долгой паузы все окно загружается заново целиком, и чем оно больше, тем дороже это обходится

👉 Перед ночью или долгим перерывом сожми переписку через команду (/compact)
💡 Для меня это вообще было открытием 😳 Теперь не оставляю процессы висеть без ответа более 1 часа вообще

4. Стартовый вес беседы
Еще до первого слова беседа уже что-то весит: твои правила, список навыков, подключенные дополнения, память. Все это едет с каждым шагом

👉 Отключи дополнения, которыми не пользуешься, и держи файл правил коротким
💡 Провел ревизию всего, что загружается в контекст, и вычистил 25% мусора - Claude.md/Agents.md, Memory.md, MCP и так далее

Мой пример. Я разобрал свой расход за месяц:

• 97% всех токенов ушло на перечитывание старой переписки, а сами ответы модели заняли меньше 1% 🤯
• окно разрасталось почти до миллиона токенов, и каждый шаг в среднем перечитывал около 520 тысяч
• помощники за неделю съели больше половины расхода, 57%
• новая беседа еще до первого слова весила около 80 тысяч токенов

Главный вывод: платишь не за ответы, а за то, сколько раз модель перечитывает все, что было до них 😉

Instagram | YouTube | Threads
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Media is too big
VIEW IN TELEGRAM
Писать книгу с ИИ 📖⁉️

Я пишу не первую книгу и каждый раз сталкиваюсь с тем, что это очень трудоемкий процесс, который занимает много времени

И сразу скажу: я против книг, которые написаны ИИ ⛔️
Я за использование ИИ в качестве помощника, корректора, редактора

В итоге построил вот такую автоматизацию:

1. Каждое утро в 7:00 мне приходит уведомление о том, что мне нужно написать следующую главу, и тема

2. Я записываю голосовое сообщение длиной 10-30 минут

3. ИИ транскрибирует голос в текст, проставляет пунктуацию и разносит текст на абзацы

4. Далее присылает разбор написанной главы: что получилось хорошо, а что можно усилить, и рекомендации к следующей главе

5. Все сохраняется в отдельный документ на сервере

Далее в планах обработать каждую главу этого черновика: корректура, усиление, структурирование
И в финале озвучить и опубликовать 🎙

Как считаете, я тру-писатель или читерю? 🤔

Instagram | YouTube | Threads
Please open Telegram to view this post
VIEW IN TELEGRAM
#AI: Gemini 4 Argon сильнее Claude и ChatGPT? 🥊

👀 После месяцев задержек Google наконец выкатила флагман поколения Gemini 4 - модель Argon. По собственной таблице компании она обходит Opus 5.5, GPT-6 Astra и Fable 5.1. Только есть нюанс: потрогать ее пока почти никто не может

Что показали в анонсе Argon:
Пост 30 сентября написал Корай Кавукчуоглу, SVP Google DeepMind и главный архитектор ИИ в компании. Argon заточена под длинные сложные задачи: реальная разработка, финансы, юридическая работа и кибербезопасность. Из 19 бенчмарков в таблице Google модель первая в 13. Звучит как разгром, но я полез в цифры подробнее

Где Argon реально впереди:
🟢 DeepSWE v1.1 - 77,9% против 74,2% у Opus 5.5 и 74,1% у Astra. Длинные многошаговые задачи по разработке, самый громкий результат релиза
🟢 Vals Index - 68,9% против 67,0% у Opus 5.5. Финансы, право, налоги и код в одном зачете
🟢 GraphWalks на 1M токенов - 84,2% против 71,8% у Astra. Работа с огромным контекстом
🟢 AutomationBench - 51,3%, первое место

А где проигрывает - и это интереснее:
🟠 Terminal-Bench 4.0 - 57,4% против 66,4% у Opus 5.5. Почти 9 пунктов разницы, и это ровно тот тест, который про агентную работу в терминале
🟠 FrontierSWE v2 - 55,0% против 65,5% у Astra и 62,3% у Opus 5.5

Картина получается странная: в одном кодинг-бенчмарке Argon лидер, в двух других заметно отстает. Все цифры от самой Google, независимой проверки пока нет. Насколько эти проценты переедут в реальную работу, станет понятно только когда модель попадет в руки разработчикам

Фишка, о которой говорят меньше всего: Argon выдает до 1 млн токенов в одном ответе. Раньше потолок был 64K. Это не про "написать длинное эссе", а про возможность сгенерировать целый модуль или миграцию за один заход, без нарезки на куски

Доступ сейчас есть только у проверенных специалистов по кибербезопасности через программу Fairwind и у внутренних команд Google. Для них модель работает без кибер-ограничений: сама находит, проверяет и закрывает уязвимости. Google прямо говорит, что придержала релиз, чтобы Argon не попала к хакерам. Публичного ID нет, в Vertex ИИ, Gemini CLI, Cursor и Copilot ее тоже пока нет

💎 Цена: $2/$10 за 1M токенов на старте, потом $4/$20

Стартовая цена вдвое ниже, чем у Opus 5.5, плюс скидка 95% на кэшированный вход. Первыми модель получат подписчики Google AI Ultra и платный API. Дат нет, сколько продлится промо-цена - тоже не сказано

⭐️ Корай Кавукчуоглу, SVP Google DeepMind:

"Argon в корне меняет то, как мы работаем и строим продукты в Google"


🤷 Забавная математика: после промо Argon будет стоить ровно как Opus 5.5. То есть Google демпингует ровно на тот период, пока все мерятся бенчмарками. Я пока сижу на Opus и в терминале менять его смысла не вижу - там Argon проигрывает 9 пунктов. Но если DeepSWE не врет на длинных задачах, первый же месяц открытого API все расставит по местам

Instagram | YouTube | Threads
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1