#AI: ЗП токенами? 💰
⚡️ Внутри Meta был leaderboard "Claudeonomics" - инженеры гонялись за титулом "Token Legend" и сожгли 73,7 триллиона токенов за месяц. $2,65 млрд/год по прайсу. Leaderboard закрыли. А глава Instagram Адам Моссери объяснил почему это только начало
Что именно сказал Моссери о будущем токен-бюджетов:
Через 1-2 года у сильного инженера темп сжигания токенов сравняется со стоимостью его найма. Тогда компании введут персональные лимиты - пропорциональные тому, насколько они доверяют ROI от конкретного человека. Leaderboard заменяют на "ИИ Gateway" с реальным мониторингом по командам. Это уже не "расходы на ПО" - это персональный ресурс который распределяют как бюджет
Кто уже перешел к токен-лимитам на персонал:
📌 Uber - $1 500/мес на один ИИ-инструмент. Годовой бюджет сгорел в апреле, за 4 месяца. До лимита - до $2 000/мес на инженера. 95% инженеров используют ИИ ежемесячно, ~10% кода от агентов
📌 Tesla - $200/неделю с 6 июля. Инженеры жгли "тысячи долларов в неделю". xAI-продукты (Grok, Composer) через "Bottle Rocket" в лимит не идут - Маск умеет договариваться с самим собой
📌 Microsoft - закрыл Claude Code лицензии для Experiences+Devices к 30 июня. Перевел на GitHub Copilot CLI. Сами модели Claude (Sonnet, Opus, Haiku) остались внутри Copilot
Математика не дает соврать: два инструмента по лимиту Uber = $36 000/год на инженера. Это 11% от типичного пакета $330 000. Сравни с джуниором на пол-ставки - один к одному. CFO уже проводят именно эту аналогию
Куда ведет эта логика дальше:
💡 Токен-лимит как новый грейд - у сеньора ИИ-бюджет больше. Ровно как зарплата. Компании уже думают именно так
💡 ROI виден на уровне человека - сколько потратил, сколько принес. Впервые в истории это считается автоматически
💡 Token-based billing убивает flat-fee подписки - каждый цент привязан к конкретному сотруднику, а не тонет в строчке "облако"
💡 AWS уже добавляет cloud credits в стартап-оффер - токены идут туда же, это только вопрос времени
Uber, Tesla, Meta, Amazon, Walmart движутся синхронно. Когда ресурс стоит как зарплата - его начинают выдавать как зарплату
🎯 Опционы в 1980-х казались нишевым инструментом стартапов. Сегодня это стандарт в каждом офере. Облачные кредиты - следующими. Токены после них. ЗП начнут выдавать токенами - вопрос не "если", а "когда"
Instagram | YouTube | Threads
⚡️ Внутри Meta был leaderboard "Claudeonomics" - инженеры гонялись за титулом "Token Legend" и сожгли 73,7 триллиона токенов за месяц. $2,65 млрд/год по прайсу. Leaderboard закрыли. А глава Instagram Адам Моссери объяснил почему это только начало
Что именно сказал Моссери о будущем токен-бюджетов:
Через 1-2 года у сильного инженера темп сжигания токенов сравняется со стоимостью его найма. Тогда компании введут персональные лимиты - пропорциональные тому, насколько они доверяют ROI от конкретного человека. Leaderboard заменяют на "ИИ Gateway" с реальным мониторингом по командам. Это уже не "расходы на ПО" - это персональный ресурс который распределяют как бюджет
Кто уже перешел к токен-лимитам на персонал:
📌 Uber - $1 500/мес на один ИИ-инструмент. Годовой бюджет сгорел в апреле, за 4 месяца. До лимита - до $2 000/мес на инженера. 95% инженеров используют ИИ ежемесячно, ~10% кода от агентов
📌 Tesla - $200/неделю с 6 июля. Инженеры жгли "тысячи долларов в неделю". xAI-продукты (Grok, Composer) через "Bottle Rocket" в лимит не идут - Маск умеет договариваться с самим собой
📌 Microsoft - закрыл Claude Code лицензии для Experiences+Devices к 30 июня. Перевел на GitHub Copilot CLI. Сами модели Claude (Sonnet, Opus, Haiku) остались внутри Copilot
Математика не дает соврать: два инструмента по лимиту Uber = $36 000/год на инженера. Это 11% от типичного пакета $330 000. Сравни с джуниором на пол-ставки - один к одному. CFO уже проводят именно эту аналогию
Куда ведет эта логика дальше:
💡 Токен-лимит как новый грейд - у сеньора ИИ-бюджет больше. Ровно как зарплата. Компании уже думают именно так
💡 ROI виден на уровне человека - сколько потратил, сколько принес. Впервые в истории это считается автоматически
💡 Token-based billing убивает flat-fee подписки - каждый цент привязан к конкретному сотруднику, а не тонет в строчке "облако"
💡 AWS уже добавляет cloud credits в стартап-оффер - токены идут туда же, это только вопрос времени
Uber, Tesla, Meta, Amazon, Walmart движутся синхронно. Когда ресурс стоит как зарплата - его начинают выдавать как зарплату
🎯 Опционы в 1980-х казались нишевым инструментом стартапов. Сегодня это стандарт в каждом офере. Облачные кредиты - следующими. Токены после них. ЗП начнут выдавать токенами - вопрос не "если", а "когда"
Instagram | YouTube | Threads
Видео-голосовой ассистент🎙
Моя попытка переосмыслить голосового ассистента привела меня к созданию многофункционального инструмента, который управляется голосом - то есть это не просто Siri или Алиса, у которой ты спрашиваешь что-то простое или просишь выполнить какую-то простейшую функцию
Это полнейший дирижер в твоей системе, который может управлять другими агентами, выполнять активные действия, планировать, быть полностью твоим вторым пилотом - подключенным к общей памяти всей твоей системы, знающим все, что происходит в ней, и готовым в любой момент, в любом месте, с любого девайса продолжить работу над теми проектами, над которыми ты сейчас трудишься
В моем случае голосовой ассистент подключен напрямую к Hermes - агенту на подписке ChatGPT
Но кроме этого, голосовой ассистент имеет зрение. Я ему могу показать что-то в камеру или отправить изображение картинкой. То же самое могу сделать с телефона👁️
И приятный бонус - живое лицо с живой мимикой, которая создает ощущение работы с живым человеком
Как вам?
Посмотрите на видео, что получилось - жду комментарии и вопросы👇
Instagram | YouTube | Threads
Моя попытка переосмыслить голосового ассистента привела меня к созданию многофункционального инструмента, который управляется голосом - то есть это не просто Siri или Алиса, у которой ты спрашиваешь что-то простое или просишь выполнить какую-то простейшую функцию
Это полнейший дирижер в твоей системе, который может управлять другими агентами, выполнять активные действия, планировать, быть полностью твоим вторым пилотом - подключенным к общей памяти всей твоей системы, знающим все, что происходит в ней, и готовым в любой момент, в любом месте, с любого девайса продолжить работу над теми проектами, над которыми ты сейчас трудишься
В моем случае голосовой ассистент подключен напрямую к Hermes - агенту на подписке ChatGPT
Но кроме этого, голосовой ассистент имеет зрение. Я ему могу показать что-то в камеру или отправить изображение картинкой. То же самое могу сделать с телефона
И приятный бонус - живое лицо с живой мимикой, которая создает ощущение работы с живым человеком
Как вам?
Посмотрите на видео, что получилось - жду комментарии и вопросы
Instagram | YouTube | Threads
Please open Telegram to view this post
VIEW IN TELEGRAM
Быстрый голосовой ассистент
После публикации последнего поста в соцсетях мне прилетела от аудитории предъява, что мой голосовой ассистент работает медленно. Последние сутки занялся именно этой задачей - подключил ему дополнительный быстрый мозг, теперь он работает в двух состояниях по переключению по кнопке
Первое - это быстрый мод: быстро отвечает, быстро работает, но включена промежуточная быстрая модель для мозга ⚡. Это для общения и для повседневных дел
Если же нужно включить более думающую модель - он подключается напрямую к мозгу Hermes и работает сразу с ним напрямую 🧠. Ответы чуть медленнее, но нет промежуточного мозга, который бы просто передавал задачи Hermes. Это удобно, когда работаешь статично за компьютером или за планшетом и одновременно ведешь какую-то разработку, и голосом дирижируешь остальными агентами
В общем, теперь есть два вида работы: быстрый и умный. Можете посмотреть, как это сейчас работает, на видео ниже. Жду ваших вопросов и комментариев 👇
Instagram | YouTube | Threads
После публикации последнего поста в соцсетях мне прилетела от аудитории предъява, что мой голосовой ассистент работает медленно. Последние сутки занялся именно этой задачей - подключил ему дополнительный быстрый мозг, теперь он работает в двух состояниях по переключению по кнопке
Первое - это быстрый мод: быстро отвечает, быстро работает, но включена промежуточная быстрая модель для мозга ⚡. Это для общения и для повседневных дел
Если же нужно включить более думающую модель - он подключается напрямую к мозгу Hermes и работает сразу с ним напрямую 🧠. Ответы чуть медленнее, но нет промежуточного мозга, который бы просто передавал задачи Hermes. Это удобно, когда работаешь статично за компьютером или за планшетом и одновременно ведешь какую-то разработку, и голосом дирижируешь остальными агентами
В общем, теперь есть два вида работы: быстрый и умный. Можете посмотреть, как это сейчас работает, на видео ниже. Жду ваших вопросов и комментариев 👇
Instagram | YouTube | Threads
Проблема вайбкодинга - ВЫГОРАНИЕ🔥
Расскажу как было у меня. Я прошел этапы:
• ОТ большого количества разноплановых задач/проектов, которые приводят к выгоранию (было до 6 проектов одновременно)
• ДО оптимального количества, над которыми я могу одновременно работать, быть в потоке и не выгорать (стало 1-2 проекта одновременно)
Принял для себя решение не стремиться сделать много и быстро, а стремиться сделать максимально хорошо от начала до конца один проект (максимум два) и потом брать следующий. Так ушло выгорание и позволяет постоянно находиться в потоке
Сейчас работа в основном делится на этапы:
Архитектура - 70-80%
1. Идея - вообще без экрана, голое рассуждение в голове, как это должно быть реализовано в финальном варианте в моем воображении
2. Максимально глубокий ресерч - запуск роя агентов по вопросам: как решить эту задачу, есть ли конкуренты, есть ли уже готовые решения, какие есть готовые инструменты и связки, что нужно создать с нуля
3. Прототипирование и проработка идеи - что будет являться удачным MVP, а что готовым продуктом
4. Планирование реализации, безопасности и тестирования - как все будет сделано
5. Аудит - у меня автоматизирован процесс из 8 ревьюеров с независимой проверкой, где внутри 3 модели: Claude + Codex + GLM
6. Слабые места - скрупулезная отработка всех найденных косяков через аудит
Разработка - 20-30%
7. Разработка - через GSD: повторное исследование, ответы на вопросы исследователей, планирование и так далее по процессу GSD
8. Тестирование - после каждого этапа и сразу правка багов
9. Боевой режим - живая работа проекта со встроенной аналитикой на ключевых узлах
10. Дебагинг + эволюция - совершенствование продукта, разработка новых фич
Итого - в 95% случаев получается с первого раза делать готовый продукт и не выгорать 🎯
При работе в GSD освобождается больше свободного времени, чтобы сделать что-то параллельно, но я все равно посматриваю в экран и иногда на лету вылавливаю баги, если разработка заходит не туда. Полностью все в авто-режим не оставляю никогда - очень высока цена ошибки и жалко убитого времени ⏳
Instagram | YouTube | Threads
Расскажу как было у меня. Я прошел этапы:
• ОТ большого количества разноплановых задач/проектов, которые приводят к выгоранию (было до 6 проектов одновременно)
• ДО оптимального количества, над которыми я могу одновременно работать, быть в потоке и не выгорать (стало 1-2 проекта одновременно)
Принял для себя решение не стремиться сделать много и быстро, а стремиться сделать максимально хорошо от начала до конца один проект (максимум два) и потом брать следующий. Так ушло выгорание и позволяет постоянно находиться в потоке
Сейчас работа в основном делится на этапы:
Архитектура - 70-80%
1. Идея - вообще без экрана, голое рассуждение в голове, как это должно быть реализовано в финальном варианте в моем воображении
2. Максимально глубокий ресерч - запуск роя агентов по вопросам: как решить эту задачу, есть ли конкуренты, есть ли уже готовые решения, какие есть готовые инструменты и связки, что нужно создать с нуля
3. Прототипирование и проработка идеи - что будет являться удачным MVP, а что готовым продуктом
4. Планирование реализации, безопасности и тестирования - как все будет сделано
5. Аудит - у меня автоматизирован процесс из 8 ревьюеров с независимой проверкой, где внутри 3 модели: Claude + Codex + GLM
6. Слабые места - скрупулезная отработка всех найденных косяков через аудит
Разработка - 20-30%
7. Разработка - через GSD: повторное исследование, ответы на вопросы исследователей, планирование и так далее по процессу GSD
8. Тестирование - после каждого этапа и сразу правка багов
9. Боевой режим - живая работа проекта со встроенной аналитикой на ключевых узлах
10. Дебагинг + эволюция - совершенствование продукта, разработка новых фич
Итого - в 95% случаев получается с первого раза делать готовый продукт и не выгорать 🎯
При работе в GSD освобождается больше свободного времени, чтобы сделать что-то параллельно, но я все равно посматриваю в экран и иногда на лету вылавливаю баги, если разработка заходит не туда. Полностью все в авто-режим не оставляю никогда - очень высока цена ошибки и жалко убитого времени ⏳
Instagram | YouTube | Threads
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2
А у вас как? Всё получается?
Please open Telegram to view this post
VIEW IN TELEGRAM
😁2
Media is too big
VIEW IN TELEGRAM
#AI: Opus 5.5 - СУПЕР ❗️
🔥 22 сентября Anthropic тихо выкатили Opus 5.5 - и я сразу засел работать. Сутки спустя могу сказать честно: это первый раз с Opus 4 и Opus 5 когда чувствуется что модель думает по-другому. Не быстрее. По-другому
Что именно изменилось в Opus 5.5:
Главная фишка не в цифрах - в том как модель ведет себя внутри задачи. Сама решает когда позвать сабагента, сама проверяет результат нетривиальными способами, не ждет что ты ее за ручку поведешь. Я давал задачи и просто уходил работать дальше. Возвращался - готово, без косяков которые надо переделывать. Это ощущение "ок, разберется сама" - которого не было ни в Opus 4, ни в Opus 5
Модель нативно управляет инструментами: запускает тесты, читает логи, редактирует файлы, дергает внешние API - и все это в рамках одного задания без твоего участия. Не просто выполняет шаги, а мониторит процесс и сама корректирует маршрут если что-то пошло не так. Официальный кейс от Anthropic: миграция кодовой базы в 680 000 строк завершена меньше чем за сутки. Я до такого масштаба не добрался, но ощущение автономии - точно узнаю
Бенчмарки Terminal-Bench 4.0 - agentic coding:
🟢 Opus 5.5 - 66.4% - первое место среди всех публичных моделей
🟢 GPT-6 Astra - 57.9% - ближайший конкурент
🟢 Opus 5 - 52.3% - предыдущая версия, для понимания разрыва
OSWorld 2.0 (computer use): 81.8% - тоже лидер. GDPval-AA v2.1 (knowledge work): 1 846 Elo. Решает терминальные задачи примерно на 40% меньшим количеством шагов чем Opus 5 - это ощущается в реальной работе: меньше интервенций, больше автономии
Цена и скорость - тоже подтянули:
💡 Input/Output: $4/$20 за MTok - было $5/$25, минус 20%
💡 Cache reads: $0.20/MTok - было $0.50, минус 60%
💡 Скорость генерации: +30% к Opus 5
💡 Лимиты на Pro/Max/Team/Enterprise повышены - для тех кто гоняет агентов часами, это важно
Доступна на AWS, Google Cloud, Azure. В ближайшие недели обещают Sonnet 5.5 и Haiku 5.5 с теми же ключевыми улучшениями
Важный контекст релиза: накануне выпуска Дарио Амодеи опубликовал открытое письмо с призывом к индустрии замедлить темп разработки ведущих ИИ-систем. Opus 5.5 - именно такой продукт: не радикальный прыжок с воем маркетинга, а тихая глубокая итерация. По внутреннему поведенческому аудиту Anthropic - самый высокий alignment-результат среди всех протестированных моделей компании. Перед выпуском независимую верификацию провели Frontier Design и METR
💻 Alignment-аудит: лучший результат среди всех моделей Anthropic
💭 С Opus 4 я чувствовал мощь. С Opus 5 - скорость. С Opus 5.5 первый раз в истории этих моделей я чувствую что модель думает, а не просто выполняет команды. Поставил задачу, ушел - пришел, сделано. Это разница которую не опишешь скором на бенчмарке, но которую сутки реальной работы передают точно
Instagram | YouTube | Threads
🔥 22 сентября Anthropic тихо выкатили Opus 5.5 - и я сразу засел работать. Сутки спустя могу сказать честно: это первый раз с Opus 4 и Opus 5 когда чувствуется что модель думает по-другому. Не быстрее. По-другому
Что именно изменилось в Opus 5.5:
Главная фишка не в цифрах - в том как модель ведет себя внутри задачи. Сама решает когда позвать сабагента, сама проверяет результат нетривиальными способами, не ждет что ты ее за ручку поведешь. Я давал задачи и просто уходил работать дальше. Возвращался - готово, без косяков которые надо переделывать. Это ощущение "ок, разберется сама" - которого не было ни в Opus 4, ни в Opus 5
Модель нативно управляет инструментами: запускает тесты, читает логи, редактирует файлы, дергает внешние API - и все это в рамках одного задания без твоего участия. Не просто выполняет шаги, а мониторит процесс и сама корректирует маршрут если что-то пошло не так. Официальный кейс от Anthropic: миграция кодовой базы в 680 000 строк завершена меньше чем за сутки. Я до такого масштаба не добрался, но ощущение автономии - точно узнаю
Бенчмарки Terminal-Bench 4.0 - agentic coding:
🟢 Opus 5.5 - 66.4% - первое место среди всех публичных моделей
🟢 GPT-6 Astra - 57.9% - ближайший конкурент
🟢 Opus 5 - 52.3% - предыдущая версия, для понимания разрыва
OSWorld 2.0 (computer use): 81.8% - тоже лидер. GDPval-AA v2.1 (knowledge work): 1 846 Elo. Решает терминальные задачи примерно на 40% меньшим количеством шагов чем Opus 5 - это ощущается в реальной работе: меньше интервенций, больше автономии
Цена и скорость - тоже подтянули:
💡 Input/Output: $4/$20 за MTok - было $5/$25, минус 20%
💡 Cache reads: $0.20/MTok - было $0.50, минус 60%
💡 Скорость генерации: +30% к Opus 5
💡 Лимиты на Pro/Max/Team/Enterprise повышены - для тех кто гоняет агентов часами, это важно
Доступна на AWS, Google Cloud, Azure. В ближайшие недели обещают Sonnet 5.5 и Haiku 5.5 с теми же ключевыми улучшениями
Важный контекст релиза: накануне выпуска Дарио Амодеи опубликовал открытое письмо с призывом к индустрии замедлить темп разработки ведущих ИИ-систем. Opus 5.5 - именно такой продукт: не радикальный прыжок с воем маркетинга, а тихая глубокая итерация. По внутреннему поведенческому аудиту Anthropic - самый высокий alignment-результат среди всех протестированных моделей компании. Перед выпуском независимую верификацию провели Frontier Design и METR
💻 Alignment-аудит: лучший результат среди всех моделей Anthropic
💭 С Opus 4 я чувствовал мощь. С Opus 5 - скорость. С Opus 5.5 первый раз в истории этих моделей я чувствую что модель думает, а не просто выполняет команды. Поставил задачу, ушел - пришел, сделано. Это разница которую не опишешь скором на бенчмарке, но которую сутки реальной работы передают точно
Instagram | YouTube | Threads
Media is too big
VIEW IN TELEGRAM
УЛЕТАЮТ ТОКЕНЫ⁉️
Нашел прикольную штуку для тех, кто много работает в Codex, Claude Code, Gemini и других ИИшках
Называется CodeBurn
Он показывает,
Можно посмотреть:
- какая модель жрет больше всего
- какой проект оказался самым прожорливым
- сколько токенов ушло на разные типы задач
- какие сессии получились самыми дорогими
- сколько потратил сегодня / за неделю / месяц
Самое удобное: CodeBurn берет данные из локальной истории твоих ИИ-инструментов. Не надо подключать API-ключи и чет сложное делать
То есть установил - запустил - и он уже может разобрать прошлые сессии
🧩КАК ПОПРОБОВАТЬ
Репозиторий: https://github.com/getagentseal/codeburn
Можешь вообще не разбираться с установкой руками
Открываешь Codex/Claude и отправляешь:
После этого у тебя откроется панель со статистикой, и можно спокойно изучать, куда уходит расход
Кстати, полезная штука после нашего [материала про лимиты]: тут уже можно посмотреть на СВОИХ данных, где именно ты их сжигаешь
⚠️ Маленький нюанс: если Codex или Claude у тебя работают по подписке, цифра в долларах которую ты видишь, это примерный эквивалент по стоимости API, а не реальное списание твоих бабок, поэтому не пугайся)) Зато можешь прикинь сколько ты тратишь за подписку и сколько бы тебе это стоило если бы ты платил за API
Протестируйте. Мне кажется, штука прям суперполезная и позволяет тебе понимать, куда уходят лимиты
А как оптимизировать? Да просто спросите, она даст точечные рекомендации
Instagram | YouTube | Threads
Нашел прикольную штуку для тех, кто много работает в Codex, Claude Code, Gemini и других ИИшках
Называется CodeBurn
Он показывает,
Можно посмотреть:
- какая модель жрет больше всего
- какой проект оказался самым прожорливым
- сколько токенов ушло на разные типы задач
- какие сессии получились самыми дорогими
- сколько потратил сегодня / за неделю / месяц
Самое удобное: CodeBurn берет данные из локальной истории твоих ИИ-инструментов. Не надо подключать API-ключи и чет сложное делать
То есть установил - запустил - и он уже может разобрать прошлые сессии
🧩КАК ПОПРОБОВАТЬ
Репозиторий: https://github.com/getagentseal/codeburn
Можешь вообще не разбираться с установкой руками
Открываешь Codex/Claude и отправляешь:
Изучи README репозитория GitHub ttps://github.com/getagentseal/codeburn
Проверь требования и способ установки из актуальной инструкции автора
Установи CodeBurn безопасным способом и запусти его веб-интерфейс
Ничего в моем текущем проекте не меняй
После запуска объясни мне простыми словами:
- где посмотреть расход токенов;
- какие проекты и модели расходуют больше всего;
- на какие типы задач уходят токены;
- где видны самые дорогие сессии;
- что в моем использовании выглядит неэффективно
Если для установки или запуска чего-то не хватает на компьютере, сначала объясни, что именно нужно, и только потом установи
После этого у тебя откроется панель со статистикой, и можно спокойно изучать, куда уходит расход
Кстати, полезная штука после нашего [материала про лимиты]: тут уже можно посмотреть на СВОИХ данных, где именно ты их сжигаешь
⚠️ Маленький нюанс: если Codex или Claude у тебя работают по подписке, цифра в долларах которую ты видишь, это примерный эквивалент по стоимости API, а не реальное списание твоих бабок, поэтому не пугайся)) Зато можешь прикинь сколько ты тратишь за подписку и сколько бы тебе это стоило если бы ты платил за API
Протестируйте. Мне кажется, штука прям суперполезная и позволяет тебе понимать, куда уходят лимиты
А как оптимизировать? Да просто спросите, она даст точечные рекомендации
Instagram | YouTube | Threads
This media is not supported in your browser
VIEW IN TELEGRAM
РАСХОД ТОКЕНОВ 🥵 Что съедает лимит сильнее всего?
Я думал, что токены уходят на ответы модели. На самом деле почти все уходит в другое место
Вчера провел глубокий анализ и выделил пять главных факторов, от самого сильного к самому слабому:
1. Длинная переписка в одном окне
Модель не помнит разговор между шагами. На каждом твоем сообщении и на каждом своем действии она заново перечитывает всю переписку с самого начала. Чем длиннее окно, тем дороже каждый следующий шаг. Сжатие переписки по умолчанию включается только тогда, когда окно почти переполнено. До этого сотни шагов идут на огромном окне
👉 Сжимай переписку раньше (/compact) или начинай новую беседу, когда закончил этап
💡 Я сократил рабочее окно в настройках с 1 млн. до 500к токенов
2. Суб-агенты
Когда Claude/Codex запускает помощников для исследований, проверок и исполнения задач, у каждого свое окно, и каждое тоже расходует токены. Несколько помощников сразу могут съесть больше, чем основной разговор
👉 Запускай суб-агентов только для действительно важных задач
💡 После выхода Opus 5.5 эта проблема вообще ушла и модель реально вызывает суб-агентов только там, где нужно
3. Перерывы дольше часа
Anthropic/OpenAI держит твою переписку в быстрой памяти около часа. После долгой паузы все окно загружается заново целиком, и чем оно больше, тем дороже это обходится
👉 Перед ночью или долгим перерывом сожми переписку через команду (/compact)
💡 Для меня это вообще было открытием😳 Теперь не оставляю процессы висеть без ответа более 1 часа вообще
4. Стартовый вес беседы
Еще до первого слова беседа уже что-то весит: твои правила, список навыков, подключенные дополнения, память. Все это едет с каждым шагом
👉 Отключи дополнения, которыми не пользуешься, и держи файл правил коротким
💡 Провел ревизию всего, что загружается в контекст, и вычистил 25% мусора - Claude.md/Agents.md, Memory.md, MCP и так далее
Мой пример. Я разобрал свой расход за месяц:
• 97% всех токенов ушло на перечитывание старой переписки, а сами ответы модели заняли меньше 1% 🤯
• окно разрасталось почти до миллиона токенов, и каждый шаг в среднем перечитывал около 520 тысяч
• помощники за неделю съели больше половины расхода, 57%
• новая беседа еще до первого слова весила около 80 тысяч токенов
Главный вывод: платишь не за ответы, а за то, сколько раз модель перечитывает все, что было до них 😉
Instagram | YouTube | Threads
Я думал, что токены уходят на ответы модели. На самом деле почти все уходит в другое место
Вчера провел глубокий анализ и выделил пять главных факторов, от самого сильного к самому слабому:
1. Длинная переписка в одном окне
Модель не помнит разговор между шагами. На каждом твоем сообщении и на каждом своем действии она заново перечитывает всю переписку с самого начала. Чем длиннее окно, тем дороже каждый следующий шаг. Сжатие переписки по умолчанию включается только тогда, когда окно почти переполнено. До этого сотни шагов идут на огромном окне
👉 Сжимай переписку раньше (/compact) или начинай новую беседу, когда закончил этап
💡 Я сократил рабочее окно в настройках с 1 млн. до 500к токенов
2. Суб-агенты
Когда Claude/Codex запускает помощников для исследований, проверок и исполнения задач, у каждого свое окно, и каждое тоже расходует токены. Несколько помощников сразу могут съесть больше, чем основной разговор
👉 Запускай суб-агентов только для действительно важных задач
💡 После выхода Opus 5.5 эта проблема вообще ушла и модель реально вызывает суб-агентов только там, где нужно
3. Перерывы дольше часа
Anthropic/OpenAI держит твою переписку в быстрой памяти около часа. После долгой паузы все окно загружается заново целиком, и чем оно больше, тем дороже это обходится
👉 Перед ночью или долгим перерывом сожми переписку через команду (/compact)
💡 Для меня это вообще было открытием
4. Стартовый вес беседы
Еще до первого слова беседа уже что-то весит: твои правила, список навыков, подключенные дополнения, память. Все это едет с каждым шагом
👉 Отключи дополнения, которыми не пользуешься, и держи файл правил коротким
💡 Провел ревизию всего, что загружается в контекст, и вычистил 25% мусора - Claude.md/Agents.md, Memory.md, MCP и так далее
Мой пример. Я разобрал свой расход за месяц:
• 97% всех токенов ушло на перечитывание старой переписки, а сами ответы модели заняли меньше 1% 🤯
• окно разрасталось почти до миллиона токенов, и каждый шаг в среднем перечитывал около 520 тысяч
• помощники за неделю съели больше половины расхода, 57%
• новая беседа еще до первого слова весила около 80 тысяч токенов
Главный вывод: платишь не за ответы, а за то, сколько раз модель перечитывает все, что было до них 😉
Instagram | YouTube | Threads
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Media is too big
VIEW IN TELEGRAM
Писать книгу с ИИ 📖 ⁉️
Я пишу не первую книгу и каждый раз сталкиваюсь с тем, что это очень трудоемкий процесс, который занимает много времени
И сразу скажу: я против книг, которые написаны ИИ⛔️
Я за использование ИИ в качестве помощника, корректора, редактора
В итоге построил вот такую автоматизацию:
1. Каждое утро в 7:00 мне приходит уведомление о том, что мне нужно написать следующую главу, и тема
2. Я записываю голосовое сообщение длиной 10-30 минут
3. ИИ транскрибирует голос в текст, проставляет пунктуацию и разносит текст на абзацы
4. Далее присылает разбор написанной главы: что получилось хорошо, а что можно усилить, и рекомендации к следующей главе
5. Все сохраняется в отдельный документ на сервере
Далее в планах обработать каждую главу этого черновика: корректура, усиление, структурирование
И в финале озвучить и опубликовать🎙
Как считаете, я тру-писатель или читерю?🤔
Instagram | YouTube | Threads
Я пишу не первую книгу и каждый раз сталкиваюсь с тем, что это очень трудоемкий процесс, который занимает много времени
И сразу скажу: я против книг, которые написаны ИИ
Я за использование ИИ в качестве помощника, корректора, редактора
В итоге построил вот такую автоматизацию:
1. Каждое утро в 7:00 мне приходит уведомление о том, что мне нужно написать следующую главу, и тема
2. Я записываю голосовое сообщение длиной 10-30 минут
3. ИИ транскрибирует голос в текст, проставляет пунктуацию и разносит текст на абзацы
4. Далее присылает разбор написанной главы: что получилось хорошо, а что можно усилить, и рекомендации к следующей главе
5. Все сохраняется в отдельный документ на сервере
Далее в планах обработать каждую главу этого черновика: корректура, усиление, структурирование
И в финале озвучить и опубликовать
Как считаете, я тру-писатель или читерю?
Instagram | YouTube | Threads
Please open Telegram to view this post
VIEW IN TELEGRAM
#AI: Gemini 4 Argon сильнее Claude и ChatGPT? 🥊
👀 После месяцев задержек Google наконец выкатила флагман поколения Gemini 4 - модель Argon. По собственной таблице компании она обходит Opus 5.5, GPT-6 Astra и Fable 5.1. Только есть нюанс: потрогать ее пока почти никто не может
Что показали в анонсе Argon:
Пост 30 сентября написал Корай Кавукчуоглу, SVP Google DeepMind и главный архитектор ИИ в компании. Argon заточена под длинные сложные задачи: реальная разработка, финансы, юридическая работа и кибербезопасность. Из 19 бенчмарков в таблице Google модель первая в 13. Звучит как разгром, но я полез в цифры подробнее
Где Argon реально впереди:
🟢 DeepSWE v1.1 - 77,9% против 74,2% у Opus 5.5 и 74,1% у Astra. Длинные многошаговые задачи по разработке, самый громкий результат релиза
🟢 Vals Index - 68,9% против 67,0% у Opus 5.5. Финансы, право, налоги и код в одном зачете
🟢 GraphWalks на 1M токенов - 84,2% против 71,8% у Astra. Работа с огромным контекстом
🟢 AutomationBench - 51,3%, первое место
А где проигрывает - и это интереснее:
🟠 Terminal-Bench 4.0 - 57,4% против 66,4% у Opus 5.5. Почти 9 пунктов разницы, и это ровно тот тест, который про агентную работу в терминале
🟠 FrontierSWE v2 - 55,0% против 65,5% у Astra и 62,3% у Opus 5.5
Картина получается странная: в одном кодинг-бенчмарке Argon лидер, в двух других заметно отстает. Все цифры от самой Google, независимой проверки пока нет. Насколько эти проценты переедут в реальную работу, станет понятно только когда модель попадет в руки разработчикам
Фишка, о которой говорят меньше всего: Argon выдает до 1 млн токенов в одном ответе. Раньше потолок был 64K. Это не про "написать длинное эссе", а про возможность сгенерировать целый модуль или миграцию за один заход, без нарезки на куски
Доступ сейчас есть только у проверенных специалистов по кибербезопасности через программу Fairwind и у внутренних команд Google. Для них модель работает без кибер-ограничений: сама находит, проверяет и закрывает уязвимости. Google прямо говорит, что придержала релиз, чтобы Argon не попала к хакерам. Публичного ID нет, в Vertex ИИ, Gemini CLI, Cursor и Copilot ее тоже пока нет
💎 Цена: $2/$10 за 1M токенов на старте, потом $4/$20
Стартовая цена вдвое ниже, чем у Opus 5.5, плюс скидка 95% на кэшированный вход. Первыми модель получат подписчики Google AI Ultra и платный API. Дат нет, сколько продлится промо-цена - тоже не сказано
⭐️ Корай Кавукчуоглу, SVP Google DeepMind:
🤷 Забавная математика: после промо Argon будет стоить ровно как Opus 5.5. То есть Google демпингует ровно на тот период, пока все мерятся бенчмарками. Я пока сижу на Opus и в терминале менять его смысла не вижу - там Argon проигрывает 9 пунктов. Но если DeepSWE не врет на длинных задачах, первый же месяц открытого API все расставит по местам
Instagram | YouTube | Threads
👀 После месяцев задержек Google наконец выкатила флагман поколения Gemini 4 - модель Argon. По собственной таблице компании она обходит Opus 5.5, GPT-6 Astra и Fable 5.1. Только есть нюанс: потрогать ее пока почти никто не может
Что показали в анонсе Argon:
Пост 30 сентября написал Корай Кавукчуоглу, SVP Google DeepMind и главный архитектор ИИ в компании. Argon заточена под длинные сложные задачи: реальная разработка, финансы, юридическая работа и кибербезопасность. Из 19 бенчмарков в таблице Google модель первая в 13. Звучит как разгром, но я полез в цифры подробнее
Где Argon реально впереди:
🟢 DeepSWE v1.1 - 77,9% против 74,2% у Opus 5.5 и 74,1% у Astra. Длинные многошаговые задачи по разработке, самый громкий результат релиза
🟢 Vals Index - 68,9% против 67,0% у Opus 5.5. Финансы, право, налоги и код в одном зачете
🟢 GraphWalks на 1M токенов - 84,2% против 71,8% у Astra. Работа с огромным контекстом
🟢 AutomationBench - 51,3%, первое место
А где проигрывает - и это интереснее:
🟠 Terminal-Bench 4.0 - 57,4% против 66,4% у Opus 5.5. Почти 9 пунктов разницы, и это ровно тот тест, который про агентную работу в терминале
🟠 FrontierSWE v2 - 55,0% против 65,5% у Astra и 62,3% у Opus 5.5
Картина получается странная: в одном кодинг-бенчмарке Argon лидер, в двух других заметно отстает. Все цифры от самой Google, независимой проверки пока нет. Насколько эти проценты переедут в реальную работу, станет понятно только когда модель попадет в руки разработчикам
Фишка, о которой говорят меньше всего: Argon выдает до 1 млн токенов в одном ответе. Раньше потолок был 64K. Это не про "написать длинное эссе", а про возможность сгенерировать целый модуль или миграцию за один заход, без нарезки на куски
Доступ сейчас есть только у проверенных специалистов по кибербезопасности через программу Fairwind и у внутренних команд Google. Для них модель работает без кибер-ограничений: сама находит, проверяет и закрывает уязвимости. Google прямо говорит, что придержала релиз, чтобы Argon не попала к хакерам. Публичного ID нет, в Vertex ИИ, Gemini CLI, Cursor и Copilot ее тоже пока нет
💎 Цена: $2/$10 за 1M токенов на старте, потом $4/$20
Стартовая цена вдвое ниже, чем у Opus 5.5, плюс скидка 95% на кэшированный вход. Первыми модель получат подписчики Google AI Ultra и платный API. Дат нет, сколько продлится промо-цена - тоже не сказано
⭐️ Корай Кавукчуоглу, SVP Google DeepMind:
"Argon в корне меняет то, как мы работаем и строим продукты в Google"
🤷 Забавная математика: после промо Argon будет стоить ровно как Opus 5.5. То есть Google демпингует ровно на тот период, пока все мерятся бенчмарками. Я пока сижу на Opus и в терминале менять его смысла не вижу - там Argon проигрывает 9 пунктов. Но если DeepSWE не врет на длинных задачах, первый же месяц открытого API все расставит по местам
Instagram | YouTube | Threads
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1