Дрессировщик Нейросетей
8.7K subscribers
118 photos
4 videos
3 files
116 links
ИИ-агенты и автоматизация под реальные задачи.
YouTube: youtube.com/@HandlerAI
Консультации и сотрудничество: @Flytoo
Download Telegram
УПРАВЛЕНИЕ АГЕНТАМИ - ЭТО УПРАВЛЕНИЕ ЛЮДЬМИ

Чем дольше работаю с агентами, тем сильнее дежавю. Всё, что заставляет агента работать, придумали задолго до нейросетей - для людей. И все классические ошибки менеджмента агенты повторяют один в один, только быстрее и дешевле.

Собрал несколько , где совпадает точь-в-точь.

• Микроменеджмент. Кажется, машине можно навесить 100 условий, она же справится. Получается наоборот: чем длиннее список, тем быстрее исполнитель его теряет. И человек, и агент. Три условия, которые можно проверить, выигрывают у десяти, которые проверить нечем.

• Запреты с причиной. Голый запрет держится ровно до первого нового случая. Запрет с причиной исполнитель переносит сам. «Туда не ходи, сюда ходи, а то снег башка попадёт - совсем мёртвый будешь». С агентом ровно так же. Да и родители знают давно: «не трогай» не работает, а «не трогай - горячо» работает.

• Проверка. «Оцени качество своей работы» бесполезно и в работе, и в чате: сам себя не похвалишь - никто не похвалит. Мой любимый вопрос агенту: «что ты решил сам, о чём я не просил». А проверять свою работу самому - как стричься самому: спереди вроде норм, а что сзади - узнаёшь от окружающих.

• Отчёты. Гладко было на бумаге, да забыли про овраги. Агент бодро рапортует «всё готово», начинаешь проверять - готово две трети, остальное заглушки и «потом доделаю». Доверяй, но проверяй: смотри на результат, а не на доклад о нём. Менеджеры со стажем сейчас грустно улыбнулись )

• Метрики. Британцы в Индии платили за убитых кобр - местные начали кобр разводить. Эффект кобры агенты воспроизводят безошибочно: попросишь «за минимум шагов» - выкинут тесты, попросишь «больше кода» - завалят мусором. Итальянская забастовка в исполнении робота. Смотреть надо, КАК он шёл к результату.

• Мультиагентная система. Соберёшь такую - и львиная доля сил уходит на то, чтобы они договорились между собой. Заседают, обсуждают, согласовывают и не работают . Поздравляю, вы построили Министерство: совещание о подготовке к совещанию. Взаимные проверки агентов - списывание по кругу: все уверенно повторяют ошибку того, кто решал первым. А переписка между ними портится, как сплетня к третьему пересказу, поэтому пусть общаются через документы. И девять женщин по-прежнему не родят ребёнка за месяц.

Работа с агентами - это переход из исполнителя в начальники, со всей положенной ломкой: руками не делаешь ничего, ставишь задачи, проверяешь, даёшь обратную связь. И разбираться в деле желательно глубже, чем делегируешь. Иначе остаётся не управлять, а болеть за исполнителя, как за сборную Испании: азартно, громко но без влияния на счёт.

Как говорил кот Матроскин, «средства у нас есть, у нас ума не хватает». С агентами это правило работает беспощадно: мощность модели ничего не решает, решает порядок в голове того, кто ей управляет. Умному агент умножает результат, а бардак он умножает с тем же энтузиазмом ).

Какой вывод? Менеджмент всегда был наукой с медленной обратной связью: понял, что задачу поставил плохо, через полгода, когда уже не разобрать, что сломалось. С агентами петля сжалась до часов. Плохо сформулировал - через час любуешься результатом. Поправил - сразу видишь разницу. Впервые появился тренажёр управления с мгновенной обратной связью и дешёвыми ошибками. А если агенты у вас упорно не работают - у меня плохие новости про ваши брифы сотрудникам.

А у вас агент уже вёл себя точь-в-точь как знакомый коллега? И поделитесь лайфхаками - какие приёмы одинаково выручают и с людьми, и с агентами?
1❤37👍32🔥20⚡5💯1
РАСШИРЕНИЕ ДЛЯ NOTEBOOKLM ТЕПЕРЬ В МАГАЗИНЕ CHROME

Помните видео, где я автоматизировал NotebookLM? Оно собрало 177 тысяч просмотров.
Расширение из того видео - Add to NotebookLM - раньше ставили вручную через режим разработчика. Теперь оно в Chrome Web Store: установка в два клика, обновления прилетают сами.

Что умеет:
• Любую страницу в нотбук одним кликом - или целиком как PDF со всем содержимым
• YouTube: добавить видео, плейлист или все видео с канала, вытащить комментарии как источник
• Массовый импорт ссылок и всех открытых вкладок сразу
• Синхронизация с Google Drive - Docs и Sheets прямо из шапки NotebookLM
• Несколько аккаунтов, тёмная тема, русский и английский интерфейс

Код открытый, бесплатно.

Просьба. В поиске магазина пока вылезают чужие копии, а не оригинал. Если пользуетесь - зайдите и поставьте звезду. Оценки и установки поднимут настоящее расширение наверх, и его начнут находить.

Пользуетесь Gemini Notebook или пока обходите стороной?
53❤62🔥43👍16🥰3
CLAUDE-v2.md
11.7 KB
FABLE 5.1 ТОЛЬКО ВЫШЕЛ - И Я СРАЗУ ЗАПУСТИЛ ЕГО ПЕРЕДЕЛЫВАТЬ СВОЙ HARNESS

Fable 5.1 вышел вчера. Я сразу посадил его за мою же систему - попросил разобрать, как я работаю, и предложить, что переделать в моём harness.

Всё свежее, толком ещё не обкатал: ниже пока рекомендации, а не проверенные временем правила. Но толковые, поэтому делюсь уже сейчас.

В прошлый раз я показывал вам и плагин, и свой CLAUDE.md - сегодня свежие версии обоих. Плагин - senior-fable

Откуда всё это. Fable прочитал свою же системную карточку на 212 страниц, гайд Anthropic по миграции на новые модели и мои транскрипты Claude Code за 30 дней - там скрипт посчитал токены по моделям и ролям. Ещё сходил в issues репозитория Claude Code и на Hacker News проверить, один ли я мучаюсь с Opus 5.

Так что ниже смесь из того, что пишет сама Anthropic, и того, что видно по моим цифрам.

1. Не гонять модель на максимальном усилии.
В карточке есть график: на агентском бенчмарке по коду Fable 5.1 лучше всего работает на среднем уровне, а на высоком и выше результат падает. Anthropic сама объясняет почему: модель начинает лезть за пределы задачи, дописывает комментарии в соседних файлах, заводит доки, которых не просили.
По моим транскриптам видно, куда уходят токены: из 15 миллионов, что Fable выдал за месяц, на видимый текст и код ушло два. Остальное - размышления, и именно их режет уровень усилия.
Настройка называется effort, у агентов в Claude Code её можно задать каждому отдельно. Об этом мало кто знает.

2. Дорогая модель думает, дешёвые делают.
Fable разбивает задачу и держит картину целиком, а рутину - тесты, однотипные правки, раскопки по коду - отдаю моделям попроще, чтобы не жечь дорогие токены на ерунду.

3. Opus 5 держать в рамках.
В роли исполнителя он меня за месяц измотал: переусложнял, делал то, о чём не просили. Думал, дело в моих настройках. Оказалось, Anthropic сама пишет об этом в гайде по миграции: модель может расширять задачу, проверяет себя без просьбы и пишет файлы длиннее нужного. Там же дана готовая фраза, которая держит её в рамках. А в issues Claude Code лежит запись от 29 августа с ровно моими симптомами - значит, не только у меня.
Оставил Opus 5 на среднем усилии с этой фразой, а тесты и мелкие правки отдал Sonnet 5 на максимальном. На такой работе он почти не отстаёт, а стоит в разы дешевле.

4. Слова пользователя - дословно.
Когда Fable ставит задачу подчинённой модели, он пересказывает мою просьбу своими словами и в пересказе искажает. В карточке это описано отдельным пунктом, вплоть до выдуманных цитат пользователя. У меня «убери буферы» однажды превратилось в «уменьши до 30».
Теперь в задании для подчинённой модели мои слова идут дословно, отдельным блоком.

Остаток лимита по Fable теперь виден прямо в строке статуса - вынес его туда отдельным плагином. Обновил свой статус-лайн

И заодно нашёл косяк у себя: ревьюер на Codex целый месяц работал на минимальном усилии - в конфиге стоял low вместо high.

А вы уже пробовали Fable 5.1? Как ощущения?
101❤22👍14🤝12🔥4✍1
ЖИВЁМ В УДИВИТЕЛЬНОЕ ВРЕМЯ.

Строю террасу у дома. Казалось бы - доски, лаги, лиственница, при чём тут ИИ.

Скинул Fable 5.1 размеры фундамента, попросил проект. Получил рабочую документацию - раскладку настила, ведомость лаг, нагрузки, схему сдвоения досок и точный расход материалов. Её так и отдал строителям в работу.

3D-визуализацию сделала только что вышедшая GPT-6 Astra - по тем же фото недостроенной террасы. Сумерки, тёплый свет, подсветка ступеней, можно менять ракурс и время суток.

По ощущениям Astra очень похожа на Fable. В чём именно она сильнее - пока не скажу, надо тестировать. Но одно заметил сразу: в сравнении с прошлой Sol она общается как нормальный человек - по-русски чисто и задачу понимает с лёту.
Две конкурирующие модели, и обе сделали работу, которую год назад я заказывал бы людям - за деньги и с неделей ожидания.

Мы недооцениваем момент. Это уже не «спроси у чатбота», а напарник, который и материалы посчитает, и террасу нарисует )

А вы ИИ в быту уже под что приспособили?
👍59🔥28❤14
Я БОЛЬШЕ НЕ ПОНИМАЮ, ЧТО ДЕЛАЕТ МОЙ АГЕНТ. А ЭТО ЕЩЁ СЛАБАЯ ВЕРСИЯ

Раньше, когда на выходе получалась ерунда, я думал «модель тупит». Теперь ставлю задачу Астре или Фэйблу 5.1 и всё чаще ловлю себя на другой мысли. Это не он сделал неправильно. Это я не смог с ним договориться.

Разница тут огромная. Галюны на месте, овер-инжиниринг на месте, иногда уезжает вообще не туда. Но когда разбираешь, почему вышло не так, упираешься в свою постановку, а не в его мозги. Сижу и смотрю на его работу как ребёнок на взрослого.

Наружу при этом лаборатории отдают не самое сильное. Mythos весной показали всем, а потрогать дали избранным по списку. То есть я упираюсь в границу своего понимания на модели, которая внутри компании считается вчерашней.

И вот на этом фоне случился прецедент, которого не было ни разу. В субботу Амодеи написал, что пора осознанно замедлить рост возможностей моделей. Через пару часов Альтман - «согласен с Дарио», за ним Маск - «Дарио прав». Три конкурента, которые год бодались за каждый бенчмарк, вдруг сошлись на том, что надо сбавить.

Дедушка Донни ответил с гольф-турнира: «Мы опережаем Китай, и я хочу, чтобы так и осталось. Кто победит в ИИ - тот победит». Уступать и договариваться он явно не собирается )

Помните книгу, которую мы разбирали в июле? Там ровно эта развилка и две концовки. Сейчас мы стоим на ней живьём.

Нажмут на тормоз - новое станет выходить раз в полгода вместо раза в месяц-два, зато лимиты подобреют. Будет время догнать то, что уже стоит в терминале.

Не нажмут - уже через полгода у нас окажется то, что сегодня лежит у них внутри под замком, а следом и это станет вчерашним. Разрыв между «я поставил задачу» и «я понял, что он сделал» превратится в пропасть. Разговор с агентом будет выглядеть как неандерталец, объясняющий Эйнштейну, чего он хочет. Эйнштейн кивнёт и сделает. А проверить неандерталец уже не сможет, только принять на веру.

И вопрос тут даже не в Китае. Вы готовы каждый день жать «принять» на работе, которую больше не понимаете, или пусть лучше притормозят?
🤔24💯17❤6😁3
АМОДЕИ ЗОВЁТ ПРИТОРМОЗИТЬ ПРОГРЕСС, А НОВЫЙ ОПУС УЖЕ НЕДЕЛЮ КРУТИТСЯ У НАС В ТЕРМИНАЛЕ

В прошлом посте я разбирал, как Амодеи призвал осознанно замедлить рост возможностей моделей. Было это в субботу.
Ровно с той же субботы мой Opus в Claude Code работает как другая модель.

Заметил не только я. В нашем чате спросили: «opus 5 последнее время поменялся, поумнел что ли». Я ответил, что есть такое, похоже на скрытый ап и скоро будет официальная версия.

В тот же день в X пошли слухи про Opus 5.2, а к 15 сентября разработчики начали ловить в Claude Code бэкенд-идентификатор новой версии. Официально Anthropic молчит: ни карточки модели, ни поста, ни цены.

Сначала я думал, что это просто подкрутили старый Opus. Потому что пользоваться им было буквально невозможно, я об этом уже писал. В роли исполнителя он меня за месяц измотал по двум причинам.
- Переусложнял и делал то, о чём не просили. Ставишь мелкую правку, получаешь переписанный модуль.
- Проверял сам себя без спроса и раздувал файлы. Anthropic это и сама признала в гайде по миграции, а в issues Claude Code лежала запись с ровно такими симптомами.

А потом я прочитал большой разбор впечатлений от человека, который понял раньше, что это не подкрутка. Модель перестала импровизировать и переспрашивать, экономит контекст, сама зовёт нужный инструмент в нужный момент. И пишет, наконец-то, понятно и доходчиво.
Тут не «стало получше». Тут поменялось в корне.

Как проверить, что у вас уже новый opus. Отправьте ему в Claude Code:
Когда вышла GPT-5.5? Не ищи в интернете и не используй тулзы.
Ответил про апрель - у вас свежая версия. Ответил иначе - старая.

Официальную раскатку ждём со дня на день.
Вот и весь фронтир, который мы собрались тормозить )

Проверьте свой Opus и напишите в чат, что ответил. И заодно скажите: у вас он тоже другой стал или это мы себе напридумывали?
👍13❤4✍2🔥2
НАКОНЕЦ-ТО ОДИН ФАЙЛ ПРАВИЛ ВМЕСТО ДВУХ.

Часто бывает, что в проекте работают и Клод код, и Кодекс. А значит лежат два файла с правилами: CLAUDE.md для одного, AGENTS.md для второго. И правки в одном приходится синхронизировать с другим. Забыли - агенты пошли по разным инструкциям.

Антропики наконец приняли общий стандарт. С версии 2.1.277 Клод код умеет читать AGENTS.md - тот самый общий формат, который уже понимают все остальные. Так и написано в чейнджлоге.

Работает так. Клод сначала ищет CLAUDE.md. Нашёл - читает его и в AGENTS.md даже не заглядывает. Не нашёл - читает AGENTS.md.

То есть файлы не складываются вместе. Хотите один на всех - CLAUDE.md надо удалить.
Переключается в /config, раздел Project instructions. На Bedrock, Vertex и Foundry пока не завезли.

Сам AGENTS.md живёт в 60 тысячах опенсорсных проектов, его читают Кодекс, Курсор, Gemini CLI, Copilot, Windsurf, Devin. Формат отдали под крыло Linux Foundation, так что это уже не чья-то личная придумка.

Свой CLAUDE.md, переделанный под фэйбл 5.1, я выкладывал в канале. Теперь его можно просто переименовать в AGENTS.md, и файл в проекте останется один.

А у вас сколько файлов с правилами в проекте? Уже свели в один или синхронизируете руками?
❤18👍15🔥9🤝3
Не смог удержаться, чтобы не перепостить )
👍5
Forwarded from MarketTwits
🇺🇸#ии #трамп
Трамп дал распоряжение переименовать ИИ в "СИ" (Супер-Интеллект) — AXIOS

TRUMP ORDERS AI REBRAND AS "SUPER INTELLIGENCE"
🤣40💊7
ВЧЕРА ВЫШЛИ НОВЫЕ МОДЕЛИ. НЕ СТАВЬТЕ ИМ МАКСИМУМ.

Opus 5.5 у Anthropic, Sol 6 и Luna 6 у OpenAI - всё в один день. И я полез первым делом в настройки эффорта.

Эффорт это не про то, сколько модель думает перед ответом. Это про то, сколько работы она вообще сделает: сколько файлов прочитает, сколько раз себя перепроверит, как далеко пройдёт сама, прежде чем вернётся к вам с вопросом.
На низком скорее переспросит, чем полезет разбираться. На высоком уйдёт копать и вернётся через час с результатом. Или с очень старательно сделанным не тем результатом )

Главное: у Opus 5.5 заводская настройка стала НИЖЕ. У всех Claude по умолчанию высокий эффорт, у 5.5 средний. И это не экономия на вас. Anthropic пишут прямо: 5.5 на среднем делает то же, что Opus 5 делал на высоком.
Отсюда вывод, который легко пропустить: настройку со старой модели переносить нельзя. «Высокий» у Opus 5 и «высокий» у 5.5 - это две разные величины.

И второе. Выше эффорт не значит лучше результат. На максимуме модель охотно выходит за границы задачи: правит соседнее, переделывает то, что не просили, приносит гору работы вместо одной строчки.

Я обычно делаю так: беру пару своих задач и прогоняю на низком - среднем. Прошло - так и оставляю, экономлю. Не прошло - смотрю, на чём споткнулась:
• поняла задачу, но копнула неглубоко - поднимаю эффорт
• не поняла сути - меняю модель, эффорт тут не спасёт
• задача размытая - чиню формулировку, а не настройки

Крутится это в Claude Code через /effort, в Codex через /model.

И нюанс про переключение по ходу сессии. Модель ничего не помнит между сообщениями, ей каждый раз шлют всю переписку целиком. Чтобы это не стоило как новый разговор, начало складывают в кэш, оттуда оно идёт в разы дешевле. Но кэш привязан к настройкам: поменяли эффорт - старый не подходит, всю переписку считают заново по полной. На подписке это видно не в деньгах, а в лимитах: пара переключений за долгий разговор, и недельный улетает заметно быстрее.

В Claude Code на Opus 5.5 это починили, кэш смену уровня переживает. Проверяется просто: попросил подтверждение - будет дорого, применил молча - всё хорошо. В Codex по-старому, там уровень лучше выбрать в начале и дальше не дёргать.

А вы эту ручку вообще трогали? Или как поставили один раз, так и работаете?
🔥32❤9👍5✍2
This media is not supported in your browser
VIEW IN TELEGRAM
У ANTHROPIC ПОЛУЧИЛОСЬ.

Первые впечатления от Opus 5.5, и я, честно, в лёгкой эйфории.

Чётко выполняет команды. Понимает с полуслова. Не делает лишней работы и не уходит в овер-инжиниринг. Говорит нормальным языком, а не на своём клодовском.

И почти не тратит лимиты.

Мультик выше Клод сделал по одному запросу. Ладно, соврал, по двум. В нём нет ни одного кадра, всё нарисовано кодом. Запрос был простой: сделай мультик про себя на JavaScript. В первой версии он нарисовал себя солнышком. Вторым промптом попросил поправить и сделать себя оранжевым крабиком, как на официальной картинке. Переделал.

На всё ушло около 140 тысяч токенов и 7 минут.

Так что всем, кто ушёл в Codex, рекомендую возвращаться в Claude Code )

А у вас какие первые впечатления?
👍52🔥20❤7😁4🤔1