СЕГОДНЯ ВСЁ ВНЕЗАПНО РАБОТАЕТ
Бывают дни, когда обновления не бесят, а радуют. Сегодня прям такой.
• Grok 4.5 - свежий, по SuperGrok дают пощупать 7 дней бесплатно. Работает неожиданно хорошо, похоже, сказывается покупка Cursor. Не демо-огрызок, а полноценный режим.
• Live 1, голосовой от OpenAI. Включил и сначала выпал: говоришь почти как с живым человеком. Не роботное «чем могу помочь», а нормальный диалог. Меня, честно, подзаморозило.
• На подходе GPT-5.6 - обещают сегодня.
Осталось, чтобы Anthropic в честь такого дня ещё и лимиты сбросили. Вот тогда будет совсем праздник.
А вы уже щупали Grok 4.5 или голосовой режим? Делитесь, как ощущения.
Бывают дни, когда обновления не бесят, а радуют. Сегодня прям такой.
• Grok 4.5 - свежий, по SuperGrok дают пощупать 7 дней бесплатно. Работает неожиданно хорошо, похоже, сказывается покупка Cursor. Не демо-огрызок, а полноценный режим.
• Live 1, голосовой от OpenAI. Включил и сначала выпал: говоришь почти как с живым человеком. Не роботное «чем могу помочь», а нормальный диалог. Меня, честно, подзаморозило.
• На подходе GPT-5.6 - обещают сегодня.
Осталось, чтобы Anthropic в честь такого дня ещё и лимиты сбросили. Вот тогда будет совсем праздник.
А вы уже щупали Grok 4.5 или голосовой режим? Делитесь, как ощущения.
x.ai
Introducing Grok 4.5
Grok 4.5 is SpaceXAI's smartest model built for coding, agentic tasks, and knowledge work.
🔥21❤1
ВЫШЛО ПРОДОЛЖЕНИЕ ГЛАВНОГО БЕСТСЕЛЛЕРА ПРО ИИ
Помните AI 2027? Тот самый сценарий с датами, который все обсуждали. Та же команда (Eli Lifland, экс-OpenAI) выкатила продолжение - AI 2040: Plan A. На этот раз не «как мы все умрём», а «как выжить».
Если кому-то лень читать целиком - вот кратко.
Суть: пять сценариев, как США могут (или не могут) ответить на приход суперинтеллекта.
• Plan A - Договориться (их фаворит). США и Китай в 2029 соглашаются не гнать гонку. Всё AI-исследование открыто, десятки компаний идут вровень и медленно, взаимное сдерживание через контроль над вычислениями. Суперинтеллект откладывают аж до 2040. Сами называют это «наименее плохим планом из тех, что знаем».
• Plan B - Воевать с Китаем. Вместо сделки жёсткое противостояние.
• Plan C - Спустить фору. США профукивают своё технологическое преимущество.
• Plan D - Гнать до сверхинтеллекта. Текущая траектория без тормозов, кто первый - тот и хозяин.
• Plan S - Вырубить всё. Полная остановка разработки.
Главный посыл: индустрия убедила себя, что контроль над сверхИИ «докрутит на ходу». Авторы считают, что это дорога либо к вымиранию, либо к концентрации власти у горстки людей. И зовут договориться, пока не поздно.
Важно: это не прогноз, а рекомендация - «как надо по-нашему», а не «как будет». Читать как манифест, не как сводку фактов.
А вы в какой сценарий верите - договорятся или погонят до конца?
Помните AI 2027? Тот самый сценарий с датами, который все обсуждали. Та же команда (Eli Lifland, экс-OpenAI) выкатила продолжение - AI 2040: Plan A. На этот раз не «как мы все умрём», а «как выжить».
Если кому-то лень читать целиком - вот кратко.
Суть: пять сценариев, как США могут (или не могут) ответить на приход суперинтеллекта.
• Plan A - Договориться (их фаворит). США и Китай в 2029 соглашаются не гнать гонку. Всё AI-исследование открыто, десятки компаний идут вровень и медленно, взаимное сдерживание через контроль над вычислениями. Суперинтеллект откладывают аж до 2040. Сами называют это «наименее плохим планом из тех, что знаем».
• Plan B - Воевать с Китаем. Вместо сделки жёсткое противостояние.
• Plan C - Спустить фору. США профукивают своё технологическое преимущество.
• Plan D - Гнать до сверхинтеллекта. Текущая траектория без тормозов, кто первый - тот и хозяин.
• Plan S - Вырубить всё. Полная остановка разработки.
Главный посыл: индустрия убедила себя, что контроль над сверхИИ «докрутит на ходу». Авторы считают, что это дорога либо к вымиранию, либо к концентрации власти у горстки людей. И зовут договориться, пока не поздно.
Важно: это не прогноз, а рекомендация - «как надо по-нашему», а не «как будет». Читать как манифест, не как сводку фактов.
А вы в какой сценарий верите - договорятся или погонят до конца?
AI 2040
AI 2040: Plan A
A detailed forecast and recommendation for how the US, China and the rest of the world should navigate superintelligence.
👍17❤9🐳3🔥2🤔1
КАК ОТДАТЬ ЛИЧНЫЙ TELEGRAM АГЕНТУ И НЕ СЛИТЬ АККАУНТ
ИИ-агентами мы пользуемся давно - работа, код, рутина. Но личный Telegram, где лежит вся память (кто, что и кому обещал), отдать агенту боязно. И не зря.
Единственный способ был - юзербот. А он логинится в аккаунт КАК ВЫ, через session string. Это не ключ от бота, а ключ от всего аккаунта. Отсюда два страха, оба реальные:
• Бан. Telegram банит за автоматизацию через MTProto, а за что именно - не скажет никто. И тогда улетает личный аккаунт целиком: годы переписки, контакты, привязанные сервисы. Апелляция - как повезёт, чаще мимо.
• Угон. Утёк session string - и чужой уже читает вашу личку и пишет от вашего имени. Двухфакторка не спасёт: она стоит на входе, а сессия уже авторизована.
Так вот, выход есть, и я на нём живу. Официальный Business API - Telegram сам, легально, по вашему разрешению отдаёт боту ваши личные чаты. Никакого session string. Банить не за что: подключение санкционировал сам Telegram. И, что важно, работает даже на бесплатном аккаунте - Premium не нужен, проверял сам.
Под это я собрал открытый telegram-business-bridge и пользуюсь им каждый день. Демон 24/7 пишет всю мою личку в локальную базу с поиском, а агент получает к ней доступ:
• «О чём мы с Х договаривались в марте» - один запрос вместо получаса скролла.
• Ничего не теряю: даже удалённое собеседником сообщение остаётся у меня. Голосовые сразу расшифровываются в текст.
• Занят - агент сам поднимает историю и готовит черновик. Но отправляю всё равно я, одним тапом.
Так закрыта личка. Остаются группы и каналы - их Business API не отдаёт. Для них у меня второй агент: тот самый юзербот из ролика, но на отдельном аккаунте, который не жалко. Сидит в нужных группах, а по команде читает любой чат и приносит мне сводку. Забанят или угонят - потеряю пустышку, а не годы своей переписки.
А всё вместе - и личка, и группы - по ночам дистиллируется в базу знаний по методу Карпаты (как это делаю, показывал в этом ролике), и мой скилл lorebase отдаёт её агенту частями, не забивая контекст.
Итого агент видит весь мой Telegram, и безопасно. Личка - через мост, группы и каналы - через расходного наблюдателя. Схему собрал под себя, живу на ней сам, и на сегодня она закрывает все мои хотелки в мессенджере.
А вы свой личный Telegram агенту уже доверили? Или всё ещё руками? Расскажите, кто как решал.
ИИ-агентами мы пользуемся давно - работа, код, рутина. Но личный Telegram, где лежит вся память (кто, что и кому обещал), отдать агенту боязно. И не зря.
Единственный способ был - юзербот. А он логинится в аккаунт КАК ВЫ, через session string. Это не ключ от бота, а ключ от всего аккаунта. Отсюда два страха, оба реальные:
• Бан. Telegram банит за автоматизацию через MTProto, а за что именно - не скажет никто. И тогда улетает личный аккаунт целиком: годы переписки, контакты, привязанные сервисы. Апелляция - как повезёт, чаще мимо.
• Угон. Утёк session string - и чужой уже читает вашу личку и пишет от вашего имени. Двухфакторка не спасёт: она стоит на входе, а сессия уже авторизована.
Так вот, выход есть, и я на нём живу. Официальный Business API - Telegram сам, легально, по вашему разрешению отдаёт боту ваши личные чаты. Никакого session string. Банить не за что: подключение санкционировал сам Telegram. И, что важно, работает даже на бесплатном аккаунте - Premium не нужен, проверял сам.
Под это я собрал открытый telegram-business-bridge и пользуюсь им каждый день. Демон 24/7 пишет всю мою личку в локальную базу с поиском, а агент получает к ней доступ:
• «О чём мы с Х договаривались в марте» - один запрос вместо получаса скролла.
• Ничего не теряю: даже удалённое собеседником сообщение остаётся у меня. Голосовые сразу расшифровываются в текст.
• Занят - агент сам поднимает историю и готовит черновик. Но отправляю всё равно я, одним тапом.
Так закрыта личка. Остаются группы и каналы - их Business API не отдаёт. Для них у меня второй агент: тот самый юзербот из ролика, но на отдельном аккаунте, который не жалко. Сидит в нужных группах, а по команде читает любой чат и приносит мне сводку. Забанят или угонят - потеряю пустышку, а не годы своей переписки.
А всё вместе - и личка, и группы - по ночам дистиллируется в базу знаний по методу Карпаты (как это делаю, показывал в этом ролике), и мой скилл lorebase отдаёт её агенту частями, не забивая контекст.
Итого агент видит весь мой Telegram, и безопасно. Личка - через мост, группы и каналы - через расходного наблюдателя. Схему собрал под себя, живу на ней сам, и на сегодня она закрывает все мои хотелки в мессенджере.
А вы свой личный Telegram агенту уже доверили? Или всё ещё руками? Расскажите, кто как решал.
GitHub
GitHub - AndyShaman/telegram-business-bridge: Connect any AI agent to your personal Telegram via the official Business API — no…
Connect any AI agent to your personal Telegram via the official Business API — no userbot, no ban risk, no Premium. Agent reads & searches full history, drafts replies; every reply waits fo...
54🔥57👍18❤15🙏2🤔1
БЕЗ ШУМА И ПОМПЫ GOOGLE ВЫКАТИЛ ТРИ МОДЕЛИ
Все ждали чего-то громкого. А они по-тихому обновили всю Flash-линейку.
• Gemini 3.6 Flash Лошадка под код и агентов. На выходе жрёт на 17% меньше токенов.
• Gemini 3.5 Flash-Lite Самая быстрая и дешёвая. 350 токенов в секунду.
• Gemini 3.5 Flash Cyber Ищет и чинит дыры в коде. Пока по пилоту для своих.
Честно? Куда это применять - без понятия. Я гоняю Gemini в чате. Задаю непонятные мне вопросы, получаю ответы. Плюс нанобанана на картинки. Всё, на этом применение и кончается.
Да, и ещё, забыл. По видео YouTube тоже вопросы задаю - нативно поддерживают.
А ведь даже китайцы веселее. Тот же свежий Kimi K3 смотрится интереснее, чем то, куда катится Google.
Так куда их пристраивать в реальной жизни? И ждёте ли вы вообще чего-то от новых Flash - или это уже гонка ради гонки?
Все ждали чего-то громкого. А они по-тихому обновили всю Flash-линейку.
• Gemini 3.6 Flash Лошадка под код и агентов. На выходе жрёт на 17% меньше токенов.
• Gemini 3.5 Flash-Lite Самая быстрая и дешёвая. 350 токенов в секунду.
• Gemini 3.5 Flash Cyber Ищет и чинит дыры в коде. Пока по пилоту для своих.
Честно? Куда это применять - без понятия. Я гоняю Gemini в чате. Задаю непонятные мне вопросы, получаю ответы. Плюс нанобанана на картинки. Всё, на этом применение и кончается.
Да, и ещё, забыл. По видео YouTube тоже вопросы задаю - нативно поддерживают.
А ведь даже китайцы веселее. Тот же свежий Kimi K3 смотрится интереснее, чем то, куда катится Google.
Так куда их пристраивать в реальной жизни? И ждёте ли вы вообще чего-то от новых Flash - или это уже гонка ради гонки?
🔥25❤7👍3
ГОЛОСОМ. НА РУССКОМ. И ОНО РЕАЛЬНО ДЕЛАЕТ ДЕЛА.
Включил на телефоне голосовой режим Claude - русский уже есть. Пока в бете, голос один, зовут «Звонкий». Поговорил. И это вам не «болталка», как у остальных.
23 июля Anthropic докрутил главное: голос теперь ходит в подключённые приложения - Gmail, Календарь, Google Docs, Slack, Notion, Canva. Голосом просишь перенести встречу или набросать письмо - и он идёт и делает. Крутится уже не на быстром Haiku, а на старших Opus и Sonnet. Модель выбираете сами, отдельной кнопкой.
И вот тут фишка. Под капотом теперь умная агентская модель - та, что умеет строить цепочки действий, как Claude Code. Только голосом. Говоришь задачу, а он сам раскладывает её на шаги: сходить в почту, глянуть календарь, набросать ответ - и выполняет по порядку.
Бесплатный план - Haiku и один коннектор. Платный - все модели и все ваши подключения.
Соль - в сравнении.
ChatGPT в голосе недавно похорошел - звучит живее. Но инструменты дёргать так и не умеет. Поговорить да, сделать работу нет.
Gemini - король внутри Google. В Gmail и Docs он как дома, лишние шаги убирает, окно контекста больше. Но силён он ровно в своём огороде.
Claude - другой зверь. Ему всё равно, через что работать: Gmail, Notion, Slack. Сшивает разные системы в одном разговоре и думает между шагами. Короче так: Gemini - король внутри Google, Claude - переводчик между всеми вашими системами сразу.
И вот что зацепило меня как гика. Теоретически цепляются вообще все коннекторы - даже кастомные, которые делаешь сам. А в свой коннектор можно прикрутить что хочешь: внешний слой памяти, свои проекты, да хоть чайник. То есть рулить голосом с телефона собственной базой знаний - реально.
И без самодеятельности: каждое действие только с вашего подтверждения, а в ответах ссылки на источники - видно, какие письма и документы он трогал.
Пробовали голосом на русском? За кем будущее - за домашним огородом Google или за универсальным мостом?
Включил на телефоне голосовой режим Claude - русский уже есть. Пока в бете, голос один, зовут «Звонкий». Поговорил. И это вам не «болталка», как у остальных.
23 июля Anthropic докрутил главное: голос теперь ходит в подключённые приложения - Gmail, Календарь, Google Docs, Slack, Notion, Canva. Голосом просишь перенести встречу или набросать письмо - и он идёт и делает. Крутится уже не на быстром Haiku, а на старших Opus и Sonnet. Модель выбираете сами, отдельной кнопкой.
И вот тут фишка. Под капотом теперь умная агентская модель - та, что умеет строить цепочки действий, как Claude Code. Только голосом. Говоришь задачу, а он сам раскладывает её на шаги: сходить в почту, глянуть календарь, набросать ответ - и выполняет по порядку.
Бесплатный план - Haiku и один коннектор. Платный - все модели и все ваши подключения.
Соль - в сравнении.
ChatGPT в голосе недавно похорошел - звучит живее. Но инструменты дёргать так и не умеет. Поговорить да, сделать работу нет.
Gemini - король внутри Google. В Gmail и Docs он как дома, лишние шаги убирает, окно контекста больше. Но силён он ровно в своём огороде.
Claude - другой зверь. Ему всё равно, через что работать: Gmail, Notion, Slack. Сшивает разные системы в одном разговоре и думает между шагами. Короче так: Gemini - король внутри Google, Claude - переводчик между всеми вашими системами сразу.
И вот что зацепило меня как гика. Теоретически цепляются вообще все коннекторы - даже кастомные, которые делаешь сам. А в свой коннектор можно прикрутить что хочешь: внешний слой памяти, свои проекты, да хоть чайник. То есть рулить голосом с телефона собственной базой знаний - реально.
И без самодеятельности: каждое действие только с вашего подтверждения, а в ответах ссылки на источники - видно, какие письма и документы он трогал.
Пробовали голосом на русском? За кем будущее - за домашним огородом Google или за универсальным мостом?
🔥29👍16❤11💩2👏1
CLAUDE.md
9.9 KB
ВЫШЕЛ OPUS 5.
А Я ВМЕСТО ТЕСТОВ ПОЛЕЗ ПЕРЕПИСЫВАТЬ СВОЙ CLAUDE.md.
У меня правило: вышла новая модель - сначала пересмотри свой харнес. И начинать с главного файла, глобального CLAUDE.md. Он грузится в каждой сессии, любая ошибка в нём умножается на всю работу.
Anthropic тут сам дал сигнал. Thariq из команды Claude Code показал (пост): для Opus 5 они выпилили 80%+ системного промпта - и эвалы не просели.
Старые модели надо было связывать правилами. Новые от этих правил тупеют. Главная боль - когда инструкции в одном запросе спорят между собой, и модель тратит силы на разруливание вместо задачи.
Что я сделал у себя:
• Прогнал
• Попросил модель сверить мои правила с её системным промптом - и она сама показала, где моё правило с ней спорит, а где просто дублирует. Конфликты я руками не искал, просто спросил.
Прикладываю файл
Если коротко: с новой моделью пересмотрите свой CLAUDE.md и заодно скиллы, которыми пользуетесь постоянно. Файл после чистки не обязательно станет короче. Задача другая - убрать противоречия.
А вы свой CLAUDE.md под новую модель пересматриваете - или он с прошлого года копится?
А Я ВМЕСТО ТЕСТОВ ПОЛЕЗ ПЕРЕПИСЫВАТЬ СВОЙ CLAUDE.md.
У меня правило: вышла новая модель - сначала пересмотри свой харнес. И начинать с главного файла, глобального CLAUDE.md. Он грузится в каждой сессии, любая ошибка в нём умножается на всю работу.
Anthropic тут сам дал сигнал. Thariq из команды Claude Code показал (пост): для Opus 5 они выпилили 80%+ системного промпта - и эвалы не просели.
Старые модели надо было связывать правилами. Новые от этих правил тупеют. Главная боль - когда инструкции в одном запросе спорят между собой, и модель тратит силы на разруливание вместо задачи.
Что я сделал у себя:
• Прогнал
/doctor прямо в Claude Code - команда сама проходит по скиллам, MCP и CLAUDE.md и предлагает, что выкинуть.• Попросил модель сверить мои правила с её системным промптом - и она сама показала, где моё правило с ней спорит, а где просто дублирует. Конфликты я руками не искал, просто спросил.
Прикладываю файл
CLAUDE.md. Он, само собой, не полный - я вычистил персональные данные и инструменты, которыми пользуюсь, но постарался оставить полезное для вас. Тупо копировать не стоит, возьмите то, что пригодится.Если коротко: с новой моделью пересмотрите свой CLAUDE.md и заодно скиллы, которыми пользуетесь постоянно. Файл после чистки не обязательно станет короче. Задача другая - убрать противоречия.
А вы свой CLAUDE.md под новую модель пересматриваете - или он с прошлого года копится?
20🔥41❤13👍9✍2
OPUS 5 Я ТАК И НЕ РАСКУСИЛ - НО КАК ПОМОЩНИК ОН ОГОНЬ
Наконец плотно потестил Opus 5. И честно - до конца я его так и не понял. Промтить его надо иначе, чем прошлые модели.
Он конкретнее и молчаливее. Похож на GPT: даёшь задачу - идёт до конца, не бросает на полпути. Скажет пару слов и, как Fable, молча уходит работать.
Что зацепило - доводит дело до конца. Раньше модель могла встать на середине: мол, дальше сам. Этот докручивает всё до рабочего результата, включая мелочи, которые раньше приходилось выпрашивать отдельно.
И проверяет себя сам. Настолько, что Anthropic официально советуют убрать из инструкций «проверь свою работу» - иначе он гоняет проверку по второму кругу, а платишь за это ты. Сам я держу его на high .
Так как моими основными моделями стали Fable5 и Opus 5, под них я решил переделать свой конвейер .
В прошлом посте я переписывал свой CLAUDE.md под свежие рекомендации Anthropic - те самые, где они из своего Claude Code выкинули 80% инструкций. Тогда дошёл до главного файла, теперь до самого плагина - senior-fable.
Идея та же, что и была: дорогой Fable не палит токены зря - он думает, разбивает задачу и раздаёт работу, а руками пашут модели попроще.
Новое - исполнителем я поставил Opus 5. Fable остаётся техлидом: архитектура, спорные решения, приёмка. Opus 5 пишет код. Заодно выбросил из плагина лишние правила, оставил только роли - кто думает, кто пишет, кто проверяет. Каждый делает то, что умеет лучше всех.
А вы Opus 5 уже щупали? Раскусили - или он и вам показался тёмной лошадкой?
Наконец плотно потестил Opus 5. И честно - до конца я его так и не понял. Промтить его надо иначе, чем прошлые модели.
Он конкретнее и молчаливее. Похож на GPT: даёшь задачу - идёт до конца, не бросает на полпути. Скажет пару слов и, как Fable, молча уходит работать.
Что зацепило - доводит дело до конца. Раньше модель могла встать на середине: мол, дальше сам. Этот докручивает всё до рабочего результата, включая мелочи, которые раньше приходилось выпрашивать отдельно.
И проверяет себя сам. Настолько, что Anthropic официально советуют убрать из инструкций «проверь свою работу» - иначе он гоняет проверку по второму кругу, а платишь за это ты. Сам я держу его на high .
Так как моими основными моделями стали Fable5 и Opus 5, под них я решил переделать свой конвейер .
В прошлом посте я переписывал свой CLAUDE.md под свежие рекомендации Anthropic - те самые, где они из своего Claude Code выкинули 80% инструкций. Тогда дошёл до главного файла, теперь до самого плагина - senior-fable.
Идея та же, что и была: дорогой Fable не палит токены зря - он думает, разбивает задачу и раздаёт работу, а руками пашут модели попроще.
Новое - исполнителем я поставил Opus 5. Fable остаётся техлидом: архитектура, спорные решения, приёмка. Opus 5 пишет код. Заодно выбросил из плагина лишние правила, оставил только роли - кто думает, кто пишет, кто проверяет. Каждый делает то, что умеет лучше всех.
А вы Opus 5 уже щупали? Раскусили - или он и вам показался тёмной лошадкой?
GitHub
GitHub - AndyShaman/senior-fable: Tech-lead orchestration for Claude Code — the top-tier model (Fable) keeps architecture & decisions…
Tech-lead orchestration for Claude Code — the top-tier model (Fable) keeps architecture & decisions, cheap subagents (Sonnet/Opus) do the routine and the digging. Save tokens without losing...
🔥25👍17❤12
КАК СТАВИТЬ ЗАДАЧУ АГЕНТУ, ЕСЛИ ТЫ НЕ ПРОГРАММИСТ
Я не пишу код. Но задачи агенту ставлю каждый день - и они выполняются. Секрет не в программировании. Секрет в том, КАК сформулировать.
Есть подход из разработки - BDD (разработка на основе поведения). Звучит страшно, а суть детская: описываешь не КАК делать, а ЧТО должно получиться и КАК ты поймёшь, что готово.
Две вещи, которые ты обязан дать:
• Цель - что хочу на выходе.
• Критерий готовности - как я пойму, что это оно.
Всё, что между - забота агента. Не твоя. И описываешь ты это как поведение: «когда вот так - тогда вот это». Не пожелание в пустоту, а конкретный сценарий.
Бытовой пример. Ремонт в ванной. Ты же не диктуешь плиточнику, под каким углом держать шпатель. Ты говоришь: «плитка вот такая, ровно, без зазоров, чтоб вода не стояла». Это цель и критерий. КАК он это сделает - его работа.
С агентом так же. Скажешь «сделай картинку для поста» - получишь классический «ожидание vs реальность»: в голове было одно, на выходе другое. А скажешь «картинка для Telegram, 16:9, тёмный фон, крупный заголовок по центру» - выполнит с первого раза. Вся разница - в критерии.
А теперь как из «хорошо» сделать «отлично».
Сначала работаешь как с чёрным ящиком: дал цель и критерий, получил результат. Работает - не лезь внутрь. Хочешь поднять планку - погружайся: разбей на мелкие шаги, у каждого свой критерий. Попроси показать план ДО работы и что он реально менял - не пересказ «как я сделал», а сами шаги. Так понимаешь процесс и шлифуешь там, где важно.
От простого к сложному. Сначала - результат чёрным ящиком. Потом медленно внутрь, ровно настолько, насколько нужно.
Программирования тут нет. Есть умение точно сказать, чего ты хочешь.
А вы как ставите задачи агенту - сразу с критерием готовности или объясняете на ходу?
Я не пишу код. Но задачи агенту ставлю каждый день - и они выполняются. Секрет не в программировании. Секрет в том, КАК сформулировать.
Есть подход из разработки - BDD (разработка на основе поведения). Звучит страшно, а суть детская: описываешь не КАК делать, а ЧТО должно получиться и КАК ты поймёшь, что готово.
Две вещи, которые ты обязан дать:
• Цель - что хочу на выходе.
• Критерий готовности - как я пойму, что это оно.
Всё, что между - забота агента. Не твоя. И описываешь ты это как поведение: «когда вот так - тогда вот это». Не пожелание в пустоту, а конкретный сценарий.
Бытовой пример. Ремонт в ванной. Ты же не диктуешь плиточнику, под каким углом держать шпатель. Ты говоришь: «плитка вот такая, ровно, без зазоров, чтоб вода не стояла». Это цель и критерий. КАК он это сделает - его работа.
С агентом так же. Скажешь «сделай картинку для поста» - получишь классический «ожидание vs реальность»: в голове было одно, на выходе другое. А скажешь «картинка для Telegram, 16:9, тёмный фон, крупный заголовок по центру» - выполнит с первого раза. Вся разница - в критерии.
А теперь как из «хорошо» сделать «отлично».
Сначала работаешь как с чёрным ящиком: дал цель и критерий, получил результат. Работает - не лезь внутрь. Хочешь поднять планку - погружайся: разбей на мелкие шаги, у каждого свой критерий. Попроси показать план ДО работы и что он реально менял - не пересказ «как я сделал», а сами шаги. Так понимаешь процесс и шлифуешь там, где важно.
От простого к сложному. Сначала - результат чёрным ящиком. Потом медленно внутрь, ровно настолько, насколько нужно.
Программирования тут нет. Есть умение точно сказать, чего ты хочешь.
А вы как ставите задачи агенту - сразу с критерием готовности или объясняете на ходу?
👍44❤12⚡4💯1
УПРАВЛЕНИЕ АГЕНТАМИ - ЭТО УПРАВЛЕНИЕ ЛЮДЬМИ
Чем дольше работаю с агентами, тем сильнее дежавю. Всё, что заставляет агента работать, придумали задолго до нейросетей - для людей. И все классические ошибки менеджмента агенты повторяют один в один, только быстрее и дешевле.
Собрал несколько , где совпадает точь-в-точь.
• Микроменеджмент. Кажется, машине можно навесить 100 условий, она же справится. Получается наоборот: чем длиннее список, тем быстрее исполнитель его теряет. И человек, и агент. Три условия, которые можно проверить, выигрывают у десяти, которые проверить нечем.
• Запреты с причиной. Голый запрет держится ровно до первого нового случая. Запрет с причиной исполнитель переносит сам. «Туда не ходи, сюда ходи, а то снег башка попадёт - совсем мёртвый будешь». С агентом ровно так же. Да и родители знают давно: «не трогай» не работает, а «не трогай - горячо» работает.
• Проверка. «Оцени качество своей работы» бесполезно и в работе, и в чате: сам себя не похвалишь - никто не похвалит. Мой любимый вопрос агенту: «что ты решил сам, о чём я не просил». А проверять свою работу самому - как стричься самому: спереди вроде норм, а что сзади - узнаёшь от окружающих.
• Отчёты. Гладко было на бумаге, да забыли про овраги. Агент бодро рапортует «всё готово», начинаешь проверять - готово две трети, остальное заглушки и «потом доделаю». Доверяй, но проверяй: смотри на результат, а не на доклад о нём. Менеджеры со стажем сейчас грустно улыбнулись )
• Метрики. Британцы в Индии платили за убитых кобр - местные начали кобр разводить. Эффект кобры агенты воспроизводят безошибочно: попросишь «за минимум шагов» - выкинут тесты, попросишь «больше кода» - завалят мусором. Итальянская забастовка в исполнении робота. Смотреть надо, КАК он шёл к результату.
• Мультиагентная система. Соберёшь такую - и львиная доля сил уходит на то, чтобы они договорились между собой. Заседают, обсуждают, согласовывают и не работают . Поздравляю, вы построили Министерство: совещание о подготовке к совещанию. Взаимные проверки агентов - списывание по кругу: все уверенно повторяют ошибку того, кто решал первым. А переписка между ними портится, как сплетня к третьему пересказу, поэтому пусть общаются через документы. И девять женщин по-прежнему не родят ребёнка за месяц.
Работа с агентами - это переход из исполнителя в начальники, со всей положенной ломкой: руками не делаешь ничего, ставишь задачи, проверяешь, даёшь обратную связь. И разбираться в деле желательно глубже, чем делегируешь. Иначе остаётся не управлять, а болеть за исполнителя, как за сборную Испании: азартно, громко но без влияния на счёт.
Как говорил кот Матроскин, «средства у нас есть, у нас ума не хватает». С агентами это правило работает беспощадно: мощность модели ничего не решает, решает порядок в голове того, кто ей управляет. Умному агент умножает результат, а бардак он умножает с тем же энтузиазмом ).
Какой вывод? Менеджмент всегда был наукой с медленной обратной связью: понял, что задачу поставил плохо, через полгода, когда уже не разобрать, что сломалось. С агентами петля сжалась до часов. Плохо сформулировал - через час любуешься результатом. Поправил - сразу видишь разницу. Впервые появился тренажёр управления с мгновенной обратной связью и дешёвыми ошибками. А если агенты у вас упорно не работают - у меня плохие новости про ваши брифы сотрудникам.
А у вас агент уже вёл себя точь-в-точь как знакомый коллега? И поделитесь лайфхаками - какие приёмы одинаково выручают и с людьми, и с агентами?
Чем дольше работаю с агентами, тем сильнее дежавю. Всё, что заставляет агента работать, придумали задолго до нейросетей - для людей. И все классические ошибки менеджмента агенты повторяют один в один, только быстрее и дешевле.
Собрал несколько , где совпадает точь-в-точь.
• Микроменеджмент. Кажется, машине можно навесить 100 условий, она же справится. Получается наоборот: чем длиннее список, тем быстрее исполнитель его теряет. И человек, и агент. Три условия, которые можно проверить, выигрывают у десяти, которые проверить нечем.
• Запреты с причиной. Голый запрет держится ровно до первого нового случая. Запрет с причиной исполнитель переносит сам. «Туда не ходи, сюда ходи, а то снег башка попадёт - совсем мёртвый будешь». С агентом ровно так же. Да и родители знают давно: «не трогай» не работает, а «не трогай - горячо» работает.
• Проверка. «Оцени качество своей работы» бесполезно и в работе, и в чате: сам себя не похвалишь - никто не похвалит. Мой любимый вопрос агенту: «что ты решил сам, о чём я не просил». А проверять свою работу самому - как стричься самому: спереди вроде норм, а что сзади - узнаёшь от окружающих.
• Отчёты. Гладко было на бумаге, да забыли про овраги. Агент бодро рапортует «всё готово», начинаешь проверять - готово две трети, остальное заглушки и «потом доделаю». Доверяй, но проверяй: смотри на результат, а не на доклад о нём. Менеджеры со стажем сейчас грустно улыбнулись )
• Метрики. Британцы в Индии платили за убитых кобр - местные начали кобр разводить. Эффект кобры агенты воспроизводят безошибочно: попросишь «за минимум шагов» - выкинут тесты, попросишь «больше кода» - завалят мусором. Итальянская забастовка в исполнении робота. Смотреть надо, КАК он шёл к результату.
• Мультиагентная система. Соберёшь такую - и львиная доля сил уходит на то, чтобы они договорились между собой. Заседают, обсуждают, согласовывают и не работают . Поздравляю, вы построили Министерство: совещание о подготовке к совещанию. Взаимные проверки агентов - списывание по кругу: все уверенно повторяют ошибку того, кто решал первым. А переписка между ними портится, как сплетня к третьему пересказу, поэтому пусть общаются через документы. И девять женщин по-прежнему не родят ребёнка за месяц.
Работа с агентами - это переход из исполнителя в начальники, со всей положенной ломкой: руками не делаешь ничего, ставишь задачи, проверяешь, даёшь обратную связь. И разбираться в деле желательно глубже, чем делегируешь. Иначе остаётся не управлять, а болеть за исполнителя, как за сборную Испании: азартно, громко но без влияния на счёт.
Как говорил кот Матроскин, «средства у нас есть, у нас ума не хватает». С агентами это правило работает беспощадно: мощность модели ничего не решает, решает порядок в голове того, кто ей управляет. Умному агент умножает результат, а бардак он умножает с тем же энтузиазмом ).
Какой вывод? Менеджмент всегда был наукой с медленной обратной связью: понял, что задачу поставил плохо, через полгода, когда уже не разобрать, что сломалось. С агентами петля сжалась до часов. Плохо сформулировал - через час любуешься результатом. Поправил - сразу видишь разницу. Впервые появился тренажёр управления с мгновенной обратной связью и дешёвыми ошибками. А если агенты у вас упорно не работают - у меня плохие новости про ваши брифы сотрудникам.
А у вас агент уже вёл себя точь-в-точь как знакомый коллега? И поделитесь лайфхаками - какие приёмы одинаково выручают и с людьми, и с агентами?
1❤35👍32🔥20⚡5💯1
РАСШИРЕНИЕ ДЛЯ NOTEBOOKLM ТЕПЕРЬ В МАГАЗИНЕ CHROME
Помните видео, где я автоматизировал NotebookLM? Оно собрало 177 тысяч просмотров.
Расширение из того видео - Add to NotebookLM - раньше ставили вручную через режим разработчика. Теперь оно в Chrome Web Store: установка в два клика, обновления прилетают сами.
Что умеет:
• Любую страницу в нотбук одним кликом - или целиком как PDF со всем содержимым
• YouTube: добавить видео, плейлист или все видео с канала, вытащить комментарии как источник
• Массовый импорт ссылок и всех открытых вкладок сразу
• Синхронизация с Google Drive - Docs и Sheets прямо из шапки NotebookLM
• Несколько аккаунтов, тёмная тема, русский и английский интерфейс
Код открытый, бесплатно.
Просьба. В поиске магазина пока вылезают чужие копии, а не оригинал. Если пользуетесь - зайдите и поставьте звезду. Оценки и установки поднимут настоящее расширение наверх, и его начнут находить.
Пользуетесь Gemini Notebook или пока обходите стороной?
Помните видео, где я автоматизировал NotebookLM? Оно собрало 177 тысяч просмотров.
Расширение из того видео - Add to NotebookLM - раньше ставили вручную через режим разработчика. Теперь оно в Chrome Web Store: установка в два клика, обновления прилетают сами.
Что умеет:
• Любую страницу в нотбук одним кликом - или целиком как PDF со всем содержимым
• YouTube: добавить видео, плейлист или все видео с канала, вытащить комментарии как источник
• Массовый импорт ссылок и всех открытых вкладок сразу
• Синхронизация с Google Drive - Docs и Sheets прямо из шапки NotebookLM
• Несколько аккаунтов, тёмная тема, русский и английский интерфейс
Код открытый, бесплатно.
Просьба. В поиске магазина пока вылезают чужие копии, а не оригинал. Если пользуетесь - зайдите и поставьте звезду. Оценки и установки поднимут настоящее расширение наверх, и его начнут находить.
Пользуетесь Gemini Notebook или пока обходите стороной?
Google
Add to NotebookLM: YouTube & Web Importer - Chrome Web Store
100% free, no limits. Bulk import YouTube videos, playlists, comments and web pages to NotebookLM. No premium tier, no account.
53❤61🔥43👍16🥰3
CLAUDE-v2.md
11.7 KB
FABLE 5.1 ТОЛЬКО ВЫШЕЛ - И Я СРАЗУ ЗАПУСТИЛ ЕГО ПЕРЕДЕЛЫВАТЬ СВОЙ HARNESS
Fable 5.1 вышел вчера. Я сразу посадил его за мою же систему - попросил разобрать, как я работаю, и предложить, что переделать в моём harness.
Всё свежее, толком ещё не обкатал: ниже пока рекомендации, а не проверенные временем правила. Но толковые, поэтому делюсь уже сейчас.
В прошлый раз я показывал вам и плагин, и свой CLAUDE.md - сегодня свежие версии обоих. Плагин - senior-fable
Откуда всё это. Fable прочитал свою же системную карточку на 212 страниц, гайд Anthropic по миграции на новые модели и мои транскрипты Claude Code за 30 дней - там скрипт посчитал токены по моделям и ролям. Ещё сходил в issues репозитория Claude Code и на Hacker News проверить, один ли я мучаюсь с Opus 5.
Так что ниже смесь из того, что пишет сама Anthropic, и того, что видно по моим цифрам.
1. Не гонять модель на максимальном усилии.
В карточке есть график: на агентском бенчмарке по коду Fable 5.1 лучше всего работает на среднем уровне, а на высоком и выше результат падает. Anthropic сама объясняет почему: модель начинает лезть за пределы задачи, дописывает комментарии в соседних файлах, заводит доки, которых не просили.
По моим транскриптам видно, куда уходят токены: из 15 миллионов, что Fable выдал за месяц, на видимый текст и код ушло два. Остальное - размышления, и именно их режет уровень усилия.
Настройка называется effort, у агентов в Claude Code её можно задать каждому отдельно. Об этом мало кто знает.
2. Дорогая модель думает, дешёвые делают.
Fable разбивает задачу и держит картину целиком, а рутину - тесты, однотипные правки, раскопки по коду - отдаю моделям попроще, чтобы не жечь дорогие токены на ерунду.
3. Opus 5 держать в рамках.
В роли исполнителя он меня за месяц измотал: переусложнял, делал то, о чём не просили. Думал, дело в моих настройках. Оказалось, Anthropic сама пишет об этом в гайде по миграции: модель может расширять задачу, проверяет себя без просьбы и пишет файлы длиннее нужного. Там же дана готовая фраза, которая держит её в рамках. А в issues Claude Code лежит запись от 29 августа с ровно моими симптомами - значит, не только у меня.
Оставил Opus 5 на среднем усилии с этой фразой, а тесты и мелкие правки отдал Sonnet 5 на максимальном. На такой работе он почти не отстаёт, а стоит в разы дешевле.
4. Слова пользователя - дословно.
Когда Fable ставит задачу подчинённой модели, он пересказывает мою просьбу своими словами и в пересказе искажает. В карточке это описано отдельным пунктом, вплоть до выдуманных цитат пользователя. У меня «убери буферы» однажды превратилось в «уменьши до 30».
Теперь в задании для подчинённой модели мои слова идут дословно, отдельным блоком.
Остаток лимита по Fable теперь виден прямо в строке статуса - вынес его туда отдельным плагином. Обновил свой статус-лайн
И заодно нашёл косяк у себя: ревьюер на Codex целый месяц работал на минимальном усилии - в конфиге стоял low вместо high.
А вы уже пробовали Fable 5.1? Как ощущения?
Fable 5.1 вышел вчера. Я сразу посадил его за мою же систему - попросил разобрать, как я работаю, и предложить, что переделать в моём harness.
Всё свежее, толком ещё не обкатал: ниже пока рекомендации, а не проверенные временем правила. Но толковые, поэтому делюсь уже сейчас.
В прошлый раз я показывал вам и плагин, и свой CLAUDE.md - сегодня свежие версии обоих. Плагин - senior-fable
Откуда всё это. Fable прочитал свою же системную карточку на 212 страниц, гайд Anthropic по миграции на новые модели и мои транскрипты Claude Code за 30 дней - там скрипт посчитал токены по моделям и ролям. Ещё сходил в issues репозитория Claude Code и на Hacker News проверить, один ли я мучаюсь с Opus 5.
Так что ниже смесь из того, что пишет сама Anthropic, и того, что видно по моим цифрам.
1. Не гонять модель на максимальном усилии.
В карточке есть график: на агентском бенчмарке по коду Fable 5.1 лучше всего работает на среднем уровне, а на высоком и выше результат падает. Anthropic сама объясняет почему: модель начинает лезть за пределы задачи, дописывает комментарии в соседних файлах, заводит доки, которых не просили.
По моим транскриптам видно, куда уходят токены: из 15 миллионов, что Fable выдал за месяц, на видимый текст и код ушло два. Остальное - размышления, и именно их режет уровень усилия.
Настройка называется effort, у агентов в Claude Code её можно задать каждому отдельно. Об этом мало кто знает.
2. Дорогая модель думает, дешёвые делают.
Fable разбивает задачу и держит картину целиком, а рутину - тесты, однотипные правки, раскопки по коду - отдаю моделям попроще, чтобы не жечь дорогие токены на ерунду.
3. Opus 5 держать в рамках.
В роли исполнителя он меня за месяц измотал: переусложнял, делал то, о чём не просили. Думал, дело в моих настройках. Оказалось, Anthropic сама пишет об этом в гайде по миграции: модель может расширять задачу, проверяет себя без просьбы и пишет файлы длиннее нужного. Там же дана готовая фраза, которая держит её в рамках. А в issues Claude Code лежит запись от 29 августа с ровно моими симптомами - значит, не только у меня.
Оставил Opus 5 на среднем усилии с этой фразой, а тесты и мелкие правки отдал Sonnet 5 на максимальном. На такой работе он почти не отстаёт, а стоит в разы дешевле.
4. Слова пользователя - дословно.
Когда Fable ставит задачу подчинённой модели, он пересказывает мою просьбу своими словами и в пересказе искажает. В карточке это описано отдельным пунктом, вплоть до выдуманных цитат пользователя. У меня «убери буферы» однажды превратилось в «уменьши до 30».
Теперь в задании для подчинённой модели мои слова идут дословно, отдельным блоком.
Остаток лимита по Fable теперь виден прямо в строке статуса - вынес его туда отдельным плагином. Обновил свой статус-лайн
И заодно нашёл косяк у себя: ревьюер на Codex целый месяц работал на минимальном усилии - в конфиге стоял low вместо high.
А вы уже пробовали Fable 5.1? Как ощущения?
101❤22👍14🤝12🔥4✍1
ЖИВЁМ В УДИВИТЕЛЬНОЕ ВРЕМЯ.
Строю террасу у дома. Казалось бы - доски, лаги, лиственница, при чём тут ИИ.
Скинул Fable 5.1 размеры фундамента, попросил проект. Получил рабочую документацию - раскладку настила, ведомость лаг, нагрузки, схему сдвоения досок и точный расход материалов. Её так и отдал строителям в работу.
3D-визуализацию сделала только что вышедшая GPT-6 Astra - по тем же фото недостроенной террасы. Сумерки, тёплый свет, подсветка ступеней, можно менять ракурс и время суток.
По ощущениям Astra очень похожа на Fable. В чём именно она сильнее - пока не скажу, надо тестировать. Но одно заметил сразу: в сравнении с прошлой Sol она общается как нормальный человек - по-русски чисто и задачу понимает с лёту.
Две конкурирующие модели, и обе сделали работу, которую год назад я заказывал бы людям - за деньги и с неделей ожидания.
Мы недооцениваем момент. Это уже не «спроси у чатбота», а напарник, который и материалы посчитает, и террасу нарисует )
А вы ИИ в быту уже под что приспособили?
Строю террасу у дома. Казалось бы - доски, лаги, лиственница, при чём тут ИИ.
Скинул Fable 5.1 размеры фундамента, попросил проект. Получил рабочую документацию - раскладку настила, ведомость лаг, нагрузки, схему сдвоения досок и точный расход материалов. Её так и отдал строителям в работу.
3D-визуализацию сделала только что вышедшая GPT-6 Astra - по тем же фото недостроенной террасы. Сумерки, тёплый свет, подсветка ступеней, можно менять ракурс и время суток.
По ощущениям Astra очень похожа на Fable. В чём именно она сильнее - пока не скажу, надо тестировать. Но одно заметил сразу: в сравнении с прошлой Sol она общается как нормальный человек - по-русски чисто и задачу понимает с лёту.
Две конкурирующие модели, и обе сделали работу, которую год назад я заказывал бы людям - за деньги и с неделей ожидания.
Мы недооцениваем момент. Это уже не «спроси у чатбота», а напарник, который и материалы посчитает, и террасу нарисует )
А вы ИИ в быту уже под что приспособили?
👍58🔥27❤13
Я БОЛЬШЕ НЕ ПОНИМАЮ, ЧТО ДЕЛАЕТ МОЙ АГЕНТ. А ЭТО ЕЩЁ СЛАБАЯ ВЕРСИЯ
Раньше, когда на выходе получалась ерунда, я думал «модель тупит». Теперь ставлю задачу Астре или Фэйблу 5.1 и всё чаще ловлю себя на другой мысли. Это не он сделал неправильно. Это я не смог с ним договориться.
Разница тут огромная. Галюны на месте, овер-инжиниринг на месте, иногда уезжает вообще не туда. Но когда разбираешь, почему вышло не так, упираешься в свою постановку, а не в его мозги. Сижу и смотрю на его работу как ребёнок на взрослого.
Наружу при этом лаборатории отдают не самое сильное. Mythos весной показали всем, а потрогать дали избранным по списку. То есть я упираюсь в границу своего понимания на модели, которая внутри компании считается вчерашней.
И вот на этом фоне случился прецедент, которого не было ни разу. В субботу Амодеи написал, что пора осознанно замедлить рост возможностей моделей. Через пару часов Альтман - «согласен с Дарио», за ним Маск - «Дарио прав». Три конкурента, которые год бодались за каждый бенчмарк, вдруг сошлись на том, что надо сбавить.
Дедушка Донни ответил с гольф-турнира: «Мы опережаем Китай, и я хочу, чтобы так и осталось. Кто победит в ИИ - тот победит». Уступать и договариваться он явно не собирается )
Помните книгу, которую мы разбирали в июле? Там ровно эта развилка и две концовки. Сейчас мы стоим на ней живьём.
Нажмут на тормоз - новое станет выходить раз в полгода вместо раза в месяц-два, зато лимиты подобреют. Будет время догнать то, что уже стоит в терминале.
Не нажмут - уже через полгода у нас окажется то, что сегодня лежит у них внутри под замком, а следом и это станет вчерашним. Разрыв между «я поставил задачу» и «я понял, что он сделал» превратится в пропасть. Разговор с агентом будет выглядеть как неандерталец, объясняющий Эйнштейну, чего он хочет. Эйнштейн кивнёт и сделает. А проверить неандерталец уже не сможет, только принять на веру.
И вопрос тут даже не в Китае. Вы готовы каждый день жать «принять» на работе, которую больше не понимаете, или пусть лучше притормозят?
Раньше, когда на выходе получалась ерунда, я думал «модель тупит». Теперь ставлю задачу Астре или Фэйблу 5.1 и всё чаще ловлю себя на другой мысли. Это не он сделал неправильно. Это я не смог с ним договориться.
Разница тут огромная. Галюны на месте, овер-инжиниринг на месте, иногда уезжает вообще не туда. Но когда разбираешь, почему вышло не так, упираешься в свою постановку, а не в его мозги. Сижу и смотрю на его работу как ребёнок на взрослого.
Наружу при этом лаборатории отдают не самое сильное. Mythos весной показали всем, а потрогать дали избранным по списку. То есть я упираюсь в границу своего понимания на модели, которая внутри компании считается вчерашней.
И вот на этом фоне случился прецедент, которого не было ни разу. В субботу Амодеи написал, что пора осознанно замедлить рост возможностей моделей. Через пару часов Альтман - «согласен с Дарио», за ним Маск - «Дарио прав». Три конкурента, которые год бодались за каждый бенчмарк, вдруг сошлись на том, что надо сбавить.
Дедушка Донни ответил с гольф-турнира: «Мы опережаем Китай, и я хочу, чтобы так и осталось. Кто победит в ИИ - тот победит». Уступать и договариваться он явно не собирается )
Помните книгу, которую мы разбирали в июле? Там ровно эта развилка и две концовки. Сейчас мы стоим на ней живьём.
Нажмут на тормоз - новое станет выходить раз в полгода вместо раза в месяц-два, зато лимиты подобреют. Будет время догнать то, что уже стоит в терминале.
Не нажмут - уже через полгода у нас окажется то, что сегодня лежит у них внутри под замком, а следом и это станет вчерашним. Разрыв между «я поставил задачу» и «я понял, что он сделал» превратится в пропасть. Разговор с агентом будет выглядеть как неандерталец, объясняющий Эйнштейну, чего он хочет. Эйнштейн кивнёт и сделает. А проверить неандерталец уже не сможет, только принять на веру.
И вопрос тут даже не в Китае. Вы готовы каждый день жать «принять» на работе, которую больше не понимаете, или пусть лучше притормозят?
TechCrunch
Anthropic debuts preview of powerful new AI model Mythos in new cybersecurity initiative | TechCrunch
The new model will be used by a small number of high-profile companies to engage in defensive cybersecurity work.
🤔23💯17❤6😁3
АМОДЕИ ЗОВЁТ ПРИТОРМОЗИТЬ ПРОГРЕСС, А НОВЫЙ ОПУС УЖЕ НЕДЕЛЮ КРУТИТСЯ У НАС В ТЕРМИНАЛЕ
В прошлом посте я разбирал, как Амодеи призвал осознанно замедлить рост возможностей моделей. Было это в субботу.
Ровно с той же субботы мой Opus в Claude Code работает как другая модель.
Заметил не только я. В нашем чате спросили: «opus 5 последнее время поменялся, поумнел что ли». Я ответил, что есть такое, похоже на скрытый ап и скоро будет официальная версия.
В тот же день в X пошли слухи про Opus 5.2, а к 15 сентября разработчики начали ловить в Claude Code бэкенд-идентификатор новой версии. Официально Anthropic молчит: ни карточки модели, ни поста, ни цены.
Сначала я думал, что это просто подкрутили старый Opus. Потому что пользоваться им было буквально невозможно, я об этом уже писал. В роли исполнителя он меня за месяц измотал по двум причинам.
- Переусложнял и делал то, о чём не просили. Ставишь мелкую правку, получаешь переписанный модуль.
- Проверял сам себя без спроса и раздувал файлы. Anthropic это и сама признала в гайде по миграции, а в issues Claude Code лежала запись с ровно такими симптомами.
А потом я прочитал большой разбор впечатлений от человека, который понял раньше, что это не подкрутка. Модель перестала импровизировать и переспрашивать, экономит контекст, сама зовёт нужный инструмент в нужный момент. И пишет, наконец-то, понятно и доходчиво.
Тут не «стало получше». Тут поменялось в корне.
Как проверить, что у вас уже новый opus. Отправьте ему в Claude Code:
Ответил про апрель - у вас свежая версия. Ответил иначе - старая.
Официальную раскатку ждём со дня на день.
Вот и весь фронтир, который мы собрались тормозить )
Проверьте свой Opus и напишите в чат, что ответил. И заодно скажите: у вас он тоже другой стал или это мы себе напридумывали?
В прошлом посте я разбирал, как Амодеи призвал осознанно замедлить рост возможностей моделей. Было это в субботу.
Ровно с той же субботы мой Opus в Claude Code работает как другая модель.
Заметил не только я. В нашем чате спросили: «opus 5 последнее время поменялся, поумнел что ли». Я ответил, что есть такое, похоже на скрытый ап и скоро будет официальная версия.
В тот же день в X пошли слухи про Opus 5.2, а к 15 сентября разработчики начали ловить в Claude Code бэкенд-идентификатор новой версии. Официально Anthropic молчит: ни карточки модели, ни поста, ни цены.
Сначала я думал, что это просто подкрутили старый Opus. Потому что пользоваться им было буквально невозможно, я об этом уже писал. В роли исполнителя он меня за месяц измотал по двум причинам.
- Переусложнял и делал то, о чём не просили. Ставишь мелкую правку, получаешь переписанный модуль.
- Проверял сам себя без спроса и раздувал файлы. Anthropic это и сама признала в гайде по миграции, а в issues Claude Code лежала запись с ровно такими симптомами.
А потом я прочитал большой разбор впечатлений от человека, который понял раньше, что это не подкрутка. Модель перестала импровизировать и переспрашивать, экономит контекст, сама зовёт нужный инструмент в нужный момент. И пишет, наконец-то, понятно и доходчиво.
Тут не «стало получше». Тут поменялось в корне.
Как проверить, что у вас уже новый opus. Отправьте ему в Claude Code:
Когда вышла GPT-5.5? Не ищи в интернете и не используй тулзы.Ответил про апрель - у вас свежая версия. Ответил иначе - старая.
Официальную раскатку ждём со дня на день.
Вот и весь фронтир, который мы собрались тормозить )
Проверьте свой Opus и напишите в чат, что ответил. И заодно скажите: у вас он тоже другой стал или это мы себе напридумывали?
Telegram
Дрессировщик Нейросетей
Я БОЛЬШЕ НЕ ПОНИМАЮ, ЧТО ДЕЛАЕТ МОЙ АГЕНТ. А ЭТО ЕЩЁ СЛАБАЯ ВЕРСИЯ
Раньше, когда на выходе получалась ерунда, я думал «модель тупит». Теперь ставлю задачу Астре или Фэйблу 5.1 и всё чаще ловлю себя на другой мысли. Это не он сделал неправильно. Это я не…
Раньше, когда на выходе получалась ерунда, я думал «модель тупит». Теперь ставлю задачу Астре или Фэйблу 5.1 и всё чаще ловлю себя на другой мысли. Это не он сделал неправильно. Это я не…
👍13❤4✍2🔥2
НАКОНЕЦ-ТО ОДИН ФАЙЛ ПРАВИЛ ВМЕСТО ДВУХ.
Часто бывает, что в проекте работают и Клод код, и Кодекс. А значит лежат два файла с правилами: CLAUDE.md для одного, AGENTS.md для второго. И правки в одном приходится синхронизировать с другим. Забыли - агенты пошли по разным инструкциям.
Антропики наконец приняли общий стандарт. С версии 2.1.277 Клод код умеет читать AGENTS.md - тот самый общий формат, который уже понимают все остальные. Так и написано в чейнджлоге.
Работает так. Клод сначала ищет CLAUDE.md. Нашёл - читает его и в AGENTS.md даже не заглядывает. Не нашёл - читает AGENTS.md.
То есть файлы не складываются вместе. Хотите один на всех - CLAUDE.md надо удалить.
Переключается в /config, раздел Project instructions. На Bedrock, Vertex и Foundry пока не завезли.
Сам AGENTS.md живёт в 60 тысячах опенсорсных проектов, его читают Кодекс, Курсор, Gemini CLI, Copilot, Windsurf, Devin. Формат отдали под крыло Linux Foundation, так что это уже не чья-то личная придумка.
Свой CLAUDE.md, переделанный под фэйбл 5.1, я выкладывал в канале. Теперь его можно просто переименовать в AGENTS.md, и файл в проекте останется один.
А у вас сколько файлов с правилами в проекте? Уже свели в один или синхронизируете руками?
Часто бывает, что в проекте работают и Клод код, и Кодекс. А значит лежат два файла с правилами: CLAUDE.md для одного, AGENTS.md для второго. И правки в одном приходится синхронизировать с другим. Забыли - агенты пошли по разным инструкциям.
Антропики наконец приняли общий стандарт. С версии 2.1.277 Клод код умеет читать AGENTS.md - тот самый общий формат, который уже понимают все остальные. Так и написано в чейнджлоге.
Работает так. Клод сначала ищет CLAUDE.md. Нашёл - читает его и в AGENTS.md даже не заглядывает. Не нашёл - читает AGENTS.md.
То есть файлы не складываются вместе. Хотите один на всех - CLAUDE.md надо удалить.
Переключается в /config, раздел Project instructions. На Bedrock, Vertex и Foundry пока не завезли.
Сам AGENTS.md живёт в 60 тысячах опенсорсных проектов, его читают Кодекс, Курсор, Gemini CLI, Copilot, Windsurf, Devin. Формат отдали под крыло Linux Foundation, так что это уже не чья-то личная придумка.
Свой CLAUDE.md, переделанный под фэйбл 5.1, я выкладывал в канале. Теперь его можно просто переименовать в AGENTS.md, и файл в проекте останется один.
А у вас сколько файлов с правилами в проекте? Уже свели в один или синхронизируете руками?
❤18👍14🔥8🤝2