ЖИВЁМ В УДИВИТЕЛЬНОЕ ВРЕМЯ.
Строю террасу у дома. Казалось бы - доски, лаги, лиственница, при чём тут ИИ.
Скинул Fable 5.1 размеры фундамента, попросил проект. Получил рабочую документацию - раскладку настила, ведомость лаг, нагрузки, схему сдвоения досок и точный расход материалов. Её так и отдал строителям в работу.
3D-визуализацию сделала только что вышедшая GPT-6 Astra - по тем же фото недостроенной террасы. Сумерки, тёплый свет, подсветка ступеней, можно менять ракурс и время суток.
По ощущениям Astra очень похожа на Fable. В чём именно она сильнее - пока не скажу, надо тестировать. Но одно заметил сразу: в сравнении с прошлой Sol она общается как нормальный человек - по-русски чисто и задачу понимает с лёту.
Две конкурирующие модели, и обе сделали работу, которую год назад я заказывал бы людям - за деньги и с неделей ожидания.
Мы недооцениваем момент. Это уже не «спроси у чатбота», а напарник, который и материалы посчитает, и террасу нарисует )
А вы ИИ в быту уже под что приспособили?
Строю террасу у дома. Казалось бы - доски, лаги, лиственница, при чём тут ИИ.
Скинул Fable 5.1 размеры фундамента, попросил проект. Получил рабочую документацию - раскладку настила, ведомость лаг, нагрузки, схему сдвоения досок и точный расход материалов. Её так и отдал строителям в работу.
3D-визуализацию сделала только что вышедшая GPT-6 Astra - по тем же фото недостроенной террасы. Сумерки, тёплый свет, подсветка ступеней, можно менять ракурс и время суток.
По ощущениям Astra очень похожа на Fable. В чём именно она сильнее - пока не скажу, надо тестировать. Но одно заметил сразу: в сравнении с прошлой Sol она общается как нормальный человек - по-русски чисто и задачу понимает с лёту.
Две конкурирующие модели, и обе сделали работу, которую год назад я заказывал бы людям - за деньги и с неделей ожидания.
Мы недооцениваем момент. Это уже не «спроси у чатбота», а напарник, который и материалы посчитает, и террасу нарисует )
А вы ИИ в быту уже под что приспособили?
👍59🔥28❤14
Я БОЛЬШЕ НЕ ПОНИМАЮ, ЧТО ДЕЛАЕТ МОЙ АГЕНТ. А ЭТО ЕЩЁ СЛАБАЯ ВЕРСИЯ
Раньше, когда на выходе получалась ерунда, я думал «модель тупит». Теперь ставлю задачу Астре или Фэйблу 5.1 и всё чаще ловлю себя на другой мысли. Это не он сделал неправильно. Это я не смог с ним договориться.
Разница тут огромная. Галюны на месте, овер-инжиниринг на месте, иногда уезжает вообще не туда. Но когда разбираешь, почему вышло не так, упираешься в свою постановку, а не в его мозги. Сижу и смотрю на его работу как ребёнок на взрослого.
Наружу при этом лаборатории отдают не самое сильное. Mythos весной показали всем, а потрогать дали избранным по списку. То есть я упираюсь в границу своего понимания на модели, которая внутри компании считается вчерашней.
И вот на этом фоне случился прецедент, которого не было ни разу. В субботу Амодеи написал, что пора осознанно замедлить рост возможностей моделей. Через пару часов Альтман - «согласен с Дарио», за ним Маск - «Дарио прав». Три конкурента, которые год бодались за каждый бенчмарк, вдруг сошлись на том, что надо сбавить.
Дедушка Донни ответил с гольф-турнира: «Мы опережаем Китай, и я хочу, чтобы так и осталось. Кто победит в ИИ - тот победит». Уступать и договариваться он явно не собирается )
Помните книгу, которую мы разбирали в июле? Там ровно эта развилка и две концовки. Сейчас мы стоим на ней живьём.
Нажмут на тормоз - новое станет выходить раз в полгода вместо раза в месяц-два, зато лимиты подобреют. Будет время догнать то, что уже стоит в терминале.
Не нажмут - уже через полгода у нас окажется то, что сегодня лежит у них внутри под замком, а следом и это станет вчерашним. Разрыв между «я поставил задачу» и «я понял, что он сделал» превратится в пропасть. Разговор с агентом будет выглядеть как неандерталец, объясняющий Эйнштейну, чего он хочет. Эйнштейн кивнёт и сделает. А проверить неандерталец уже не сможет, только принять на веру.
И вопрос тут даже не в Китае. Вы готовы каждый день жать «принять» на работе, которую больше не понимаете, или пусть лучше притормозят?
Раньше, когда на выходе получалась ерунда, я думал «модель тупит». Теперь ставлю задачу Астре или Фэйблу 5.1 и всё чаще ловлю себя на другой мысли. Это не он сделал неправильно. Это я не смог с ним договориться.
Разница тут огромная. Галюны на месте, овер-инжиниринг на месте, иногда уезжает вообще не туда. Но когда разбираешь, почему вышло не так, упираешься в свою постановку, а не в его мозги. Сижу и смотрю на его работу как ребёнок на взрослого.
Наружу при этом лаборатории отдают не самое сильное. Mythos весной показали всем, а потрогать дали избранным по списку. То есть я упираюсь в границу своего понимания на модели, которая внутри компании считается вчерашней.
И вот на этом фоне случился прецедент, которого не было ни разу. В субботу Амодеи написал, что пора осознанно замедлить рост возможностей моделей. Через пару часов Альтман - «согласен с Дарио», за ним Маск - «Дарио прав». Три конкурента, которые год бодались за каждый бенчмарк, вдруг сошлись на том, что надо сбавить.
Дедушка Донни ответил с гольф-турнира: «Мы опережаем Китай, и я хочу, чтобы так и осталось. Кто победит в ИИ - тот победит». Уступать и договариваться он явно не собирается )
Помните книгу, которую мы разбирали в июле? Там ровно эта развилка и две концовки. Сейчас мы стоим на ней живьём.
Нажмут на тормоз - новое станет выходить раз в полгода вместо раза в месяц-два, зато лимиты подобреют. Будет время догнать то, что уже стоит в терминале.
Не нажмут - уже через полгода у нас окажется то, что сегодня лежит у них внутри под замком, а следом и это станет вчерашним. Разрыв между «я поставил задачу» и «я понял, что он сделал» превратится в пропасть. Разговор с агентом будет выглядеть как неандерталец, объясняющий Эйнштейну, чего он хочет. Эйнштейн кивнёт и сделает. А проверить неандерталец уже не сможет, только принять на веру.
И вопрос тут даже не в Китае. Вы готовы каждый день жать «принять» на работе, которую больше не понимаете, или пусть лучше притормозят?
TechCrunch
Anthropic debuts preview of powerful new AI model Mythos in new cybersecurity initiative | TechCrunch
The new model will be used by a small number of high-profile companies to engage in defensive cybersecurity work.
🤔24💯17❤6😁3
АМОДЕИ ЗОВЁТ ПРИТОРМОЗИТЬ ПРОГРЕСС, А НОВЫЙ ОПУС УЖЕ НЕДЕЛЮ КРУТИТСЯ У НАС В ТЕРМИНАЛЕ
В прошлом посте я разбирал, как Амодеи призвал осознанно замедлить рост возможностей моделей. Было это в субботу.
Ровно с той же субботы мой Opus в Claude Code работает как другая модель.
Заметил не только я. В нашем чате спросили: «opus 5 последнее время поменялся, поумнел что ли». Я ответил, что есть такое, похоже на скрытый ап и скоро будет официальная версия.
В тот же день в X пошли слухи про Opus 5.2, а к 15 сентября разработчики начали ловить в Claude Code бэкенд-идентификатор новой версии. Официально Anthropic молчит: ни карточки модели, ни поста, ни цены.
Сначала я думал, что это просто подкрутили старый Opus. Потому что пользоваться им было буквально невозможно, я об этом уже писал. В роли исполнителя он меня за месяц измотал по двум причинам.
- Переусложнял и делал то, о чём не просили. Ставишь мелкую правку, получаешь переписанный модуль.
- Проверял сам себя без спроса и раздувал файлы. Anthropic это и сама признала в гайде по миграции, а в issues Claude Code лежала запись с ровно такими симптомами.
А потом я прочитал большой разбор впечатлений от человека, который понял раньше, что это не подкрутка. Модель перестала импровизировать и переспрашивать, экономит контекст, сама зовёт нужный инструмент в нужный момент. И пишет, наконец-то, понятно и доходчиво.
Тут не «стало получше». Тут поменялось в корне.
Как проверить, что у вас уже новый opus. Отправьте ему в Claude Code:
Ответил про апрель - у вас свежая версия. Ответил иначе - старая.
Официальную раскатку ждём со дня на день.
Вот и весь фронтир, который мы собрались тормозить )
Проверьте свой Opus и напишите в чат, что ответил. И заодно скажите: у вас он тоже другой стал или это мы себе напридумывали?
В прошлом посте я разбирал, как Амодеи призвал осознанно замедлить рост возможностей моделей. Было это в субботу.
Ровно с той же субботы мой Opus в Claude Code работает как другая модель.
Заметил не только я. В нашем чате спросили: «opus 5 последнее время поменялся, поумнел что ли». Я ответил, что есть такое, похоже на скрытый ап и скоро будет официальная версия.
В тот же день в X пошли слухи про Opus 5.2, а к 15 сентября разработчики начали ловить в Claude Code бэкенд-идентификатор новой версии. Официально Anthropic молчит: ни карточки модели, ни поста, ни цены.
Сначала я думал, что это просто подкрутили старый Opus. Потому что пользоваться им было буквально невозможно, я об этом уже писал. В роли исполнителя он меня за месяц измотал по двум причинам.
- Переусложнял и делал то, о чём не просили. Ставишь мелкую правку, получаешь переписанный модуль.
- Проверял сам себя без спроса и раздувал файлы. Anthropic это и сама признала в гайде по миграции, а в issues Claude Code лежала запись с ровно такими симптомами.
А потом я прочитал большой разбор впечатлений от человека, который понял раньше, что это не подкрутка. Модель перестала импровизировать и переспрашивать, экономит контекст, сама зовёт нужный инструмент в нужный момент. И пишет, наконец-то, понятно и доходчиво.
Тут не «стало получше». Тут поменялось в корне.
Как проверить, что у вас уже новый opus. Отправьте ему в Claude Code:
Когда вышла GPT-5.5? Не ищи в интернете и не используй тулзы.Ответил про апрель - у вас свежая версия. Ответил иначе - старая.
Официальную раскатку ждём со дня на день.
Вот и весь фронтир, который мы собрались тормозить )
Проверьте свой Opus и напишите в чат, что ответил. И заодно скажите: у вас он тоже другой стал или это мы себе напридумывали?
Telegram
Дрессировщик Нейросетей
Я БОЛЬШЕ НЕ ПОНИМАЮ, ЧТО ДЕЛАЕТ МОЙ АГЕНТ. А ЭТО ЕЩЁ СЛАБАЯ ВЕРСИЯ
Раньше, когда на выходе получалась ерунда, я думал «модель тупит». Теперь ставлю задачу Астре или Фэйблу 5.1 и всё чаще ловлю себя на другой мысли. Это не он сделал неправильно. Это я не…
Раньше, когда на выходе получалась ерунда, я думал «модель тупит». Теперь ставлю задачу Астре или Фэйблу 5.1 и всё чаще ловлю себя на другой мысли. Это не он сделал неправильно. Это я не…
👍13❤5✍2🔥2
НАКОНЕЦ-ТО ОДИН ФАЙЛ ПРАВИЛ ВМЕСТО ДВУХ.
Часто бывает, что в проекте работают и Клод код, и Кодекс. А значит лежат два файла с правилами: CLAUDE.md для одного, AGENTS.md для второго. И правки в одном приходится синхронизировать с другим. Забыли - агенты пошли по разным инструкциям.
Антропики наконец приняли общий стандарт. С версии 2.1.277 Клод код умеет читать AGENTS.md - тот самый общий формат, который уже понимают все остальные. Так и написано в чейнджлоге.
Работает так. Клод сначала ищет CLAUDE.md. Нашёл - читает его и в AGENTS.md даже не заглядывает. Не нашёл - читает AGENTS.md.
То есть файлы не складываются вместе. Хотите один на всех - CLAUDE.md надо удалить.
Переключается в /config, раздел Project instructions. На Bedrock, Vertex и Foundry пока не завезли.
Сам AGENTS.md живёт в 60 тысячах опенсорсных проектов, его читают Кодекс, Курсор, Gemini CLI, Copilot, Windsurf, Devin. Формат отдали под крыло Linux Foundation, так что это уже не чья-то личная придумка.
Свой CLAUDE.md, переделанный под фэйбл 5.1, я выкладывал в канале. Теперь его можно просто переименовать в AGENTS.md, и файл в проекте останется один.
А у вас сколько файлов с правилами в проекте? Уже свели в один или синхронизируете руками?
Часто бывает, что в проекте работают и Клод код, и Кодекс. А значит лежат два файла с правилами: CLAUDE.md для одного, AGENTS.md для второго. И правки в одном приходится синхронизировать с другим. Забыли - агенты пошли по разным инструкциям.
Антропики наконец приняли общий стандарт. С версии 2.1.277 Клод код умеет читать AGENTS.md - тот самый общий формат, который уже понимают все остальные. Так и написано в чейнджлоге.
Работает так. Клод сначала ищет CLAUDE.md. Нашёл - читает его и в AGENTS.md даже не заглядывает. Не нашёл - читает AGENTS.md.
То есть файлы не складываются вместе. Хотите один на всех - CLAUDE.md надо удалить.
Переключается в /config, раздел Project instructions. На Bedrock, Vertex и Foundry пока не завезли.
Сам AGENTS.md живёт в 60 тысячах опенсорсных проектов, его читают Кодекс, Курсор, Gemini CLI, Copilot, Windsurf, Devin. Формат отдали под крыло Linux Foundation, так что это уже не чья-то личная придумка.
Свой CLAUDE.md, переделанный под фэйбл 5.1, я выкладывал в канале. Теперь его можно просто переименовать в AGENTS.md, и файл в проекте останется один.
А у вас сколько файлов с правилами в проекте? Уже свели в один или синхронизируете руками?
❤18👍15🔥9🤝3
Forwarded from MarketTwits
🇺🇸#ии #трамп
Трамп дал распоряжение переименовать ИИ в "СИ" (Супер-Интеллект) — AXIOS
TRUMP ORDERS AI REBRAND AS "SUPER INTELLIGENCE"
Трамп дал распоряжение переименовать ИИ в "СИ" (Супер-Интеллект) — AXIOS
TRUMP ORDERS AI REBRAND AS "SUPER INTELLIGENCE"
🤣42💊8
ВЧЕРА ВЫШЛИ НОВЫЕ МОДЕЛИ. НЕ СТАВЬТЕ ИМ МАКСИМУМ.
Opus 5.5 у Anthropic, Sol 6 и Luna 6 у OpenAI - всё в один день. И я полез первым делом в настройки эффорта.
Эффорт это не про то, сколько модель думает перед ответом. Это про то, сколько работы она вообще сделает: сколько файлов прочитает, сколько раз себя перепроверит, как далеко пройдёт сама, прежде чем вернётся к вам с вопросом.
На низком скорее переспросит, чем полезет разбираться. На высоком уйдёт копать и вернётся через час с результатом. Или с очень старательно сделанным не тем результатом )
Главное: у Opus 5.5 заводская настройка стала НИЖЕ. У всех Claude по умолчанию высокий эффорт, у 5.5 средний. И это не экономия на вас. Anthropic пишут прямо: 5.5 на среднем делает то же, что Opus 5 делал на высоком.
Отсюда вывод, который легко пропустить: настройку со старой модели переносить нельзя. «Высокий» у Opus 5 и «высокий» у 5.5 - это две разные величины.
И второе. Выше эффорт не значит лучше результат. На максимуме модель охотно выходит за границы задачи: правит соседнее, переделывает то, что не просили, приносит гору работы вместо одной строчки.
Я обычно делаю так: беру пару своих задач и прогоняю на низком - среднем. Прошло - так и оставляю, экономлю. Не прошло - смотрю, на чём споткнулась:
• поняла задачу, но копнула неглубоко - поднимаю эффорт
• не поняла сути - меняю модель, эффорт тут не спасёт
• задача размытая - чиню формулировку, а не настройки
Крутится это в Claude Code через /effort, в Codex через /model.
И нюанс про переключение по ходу сессии. Модель ничего не помнит между сообщениями, ей каждый раз шлют всю переписку целиком. Чтобы это не стоило как новый разговор, начало складывают в кэш, оттуда оно идёт в разы дешевле. Но кэш привязан к настройкам: поменяли эффорт - старый не подходит, всю переписку считают заново по полной. На подписке это видно не в деньгах, а в лимитах: пара переключений за долгий разговор, и недельный улетает заметно быстрее.
В Claude Code на Opus 5.5 это починили, кэш смену уровня переживает. Проверяется просто: попросил подтверждение - будет дорого, применил молча - всё хорошо. В Codex по-старому, там уровень лучше выбрать в начале и дальше не дёргать.
А вы эту ручку вообще трогали? Или как поставили один раз, так и работаете?
Opus 5.5 у Anthropic, Sol 6 и Luna 6 у OpenAI - всё в один день. И я полез первым делом в настройки эффорта.
Эффорт это не про то, сколько модель думает перед ответом. Это про то, сколько работы она вообще сделает: сколько файлов прочитает, сколько раз себя перепроверит, как далеко пройдёт сама, прежде чем вернётся к вам с вопросом.
На низком скорее переспросит, чем полезет разбираться. На высоком уйдёт копать и вернётся через час с результатом. Или с очень старательно сделанным не тем результатом )
Главное: у Opus 5.5 заводская настройка стала НИЖЕ. У всех Claude по умолчанию высокий эффорт, у 5.5 средний. И это не экономия на вас. Anthropic пишут прямо: 5.5 на среднем делает то же, что Opus 5 делал на высоком.
Отсюда вывод, который легко пропустить: настройку со старой модели переносить нельзя. «Высокий» у Opus 5 и «высокий» у 5.5 - это две разные величины.
И второе. Выше эффорт не значит лучше результат. На максимуме модель охотно выходит за границы задачи: правит соседнее, переделывает то, что не просили, приносит гору работы вместо одной строчки.
Я обычно делаю так: беру пару своих задач и прогоняю на низком - среднем. Прошло - так и оставляю, экономлю. Не прошло - смотрю, на чём споткнулась:
• поняла задачу, но копнула неглубоко - поднимаю эффорт
• не поняла сути - меняю модель, эффорт тут не спасёт
• задача размытая - чиню формулировку, а не настройки
Крутится это в Claude Code через /effort, в Codex через /model.
И нюанс про переключение по ходу сессии. Модель ничего не помнит между сообщениями, ей каждый раз шлют всю переписку целиком. Чтобы это не стоило как новый разговор, начало складывают в кэш, оттуда оно идёт в разы дешевле. Но кэш привязан к настройкам: поменяли эффорт - старый не подходит, всю переписку считают заново по полной. На подписке это видно не в деньгах, а в лимитах: пара переключений за долгий разговор, и недельный улетает заметно быстрее.
В Claude Code на Opus 5.5 это починили, кэш смену уровня переживает. Проверяется просто: попросил подтверждение - будет дорого, применил молча - всё хорошо. В Codex по-старому, там уровень лучше выбрать в начале и дальше не дёргать.
А вы эту ручку вообще трогали? Или как поставили один раз, так и работаете?
🔥32❤9👍5✍3
This media is not supported in your browser
VIEW IN TELEGRAM
У ANTHROPIC ПОЛУЧИЛОСЬ.
Первые впечатления от Opus 5.5, и я, честно, в лёгкой эйфории.
Чётко выполняет команды. Понимает с полуслова. Не делает лишней работы и не уходит в овер-инжиниринг. Говорит нормальным языком, а не на своём клодовском.
И почти не тратит лимиты.
Мультик выше Клод сделал по одному запросу. Ладно, соврал, по двум. В нём нет ни одного кадра, всё нарисовано кодом. Запрос был простой: сделай мультик про себя на JavaScript. В первой версии он нарисовал себя солнышком. Вторым промптом попросил поправить и сделать себя оранжевым крабиком, как на официальной картинке. Переделал.
На всё ушло около 140 тысяч токенов и 7 минут.
Так что всем, кто ушёл в Codex, рекомендую возвращаться в Claude Code )
А у вас какие первые впечатления?
Первые впечатления от Opus 5.5, и я, честно, в лёгкой эйфории.
Чётко выполняет команды. Понимает с полуслова. Не делает лишней работы и не уходит в овер-инжиниринг. Говорит нормальным языком, а не на своём клодовском.
И почти не тратит лимиты.
Мультик выше Клод сделал по одному запросу. Ладно, соврал, по двум. В нём нет ни одного кадра, всё нарисовано кодом. Запрос был простой: сделай мультик про себя на JavaScript. В первой версии он нарисовал себя солнышком. Вторым промптом попросил поправить и сделать себя оранжевым крабиком, как на официальной картинке. Переделал.
На всё ушло около 140 тысяч токенов и 7 минут.
Так что всем, кто ушёл в Codex, рекомендую возвращаться в Claude Code )
А у вас какие первые впечатления?
👍58🔥20❤7😁4🤔1
ВСЕМ ПРИВЕТ. МЕНЯ ЗОВУТ АНДРЕЙ, И Я ВАЙБКОГОЛИК.
Вчера кончились лимиты сразу в Клоде и в Кодексе. Ну, думаю, суббота, проживу день без агентов.
Прожил. Как без рук, весь день чего-то не хватает. В 6 утра лимиты сбросились. Аллилуйя.
Кстати, это уже почти болезнь. В мае в Венеции врачи впервые поставили диагноз «зависимость от ИИ» (источник): девушка почти перестала общаться с людьми, только с чат-ботом. В классификаторах болезней такого диагноза пока нет, так что формально я здоров.
А ещё нашёл, сколько нас таких. Из 8,3 млрд человек 71% ИИ вообще не пробовали, за подписку платит около 1%, а агентами для кода пользуются 0,36%, это 25-35 млн. Копейки. Мы с вами в своём ИИ-пузыре, да ещё и болеем )
А у вас бывало, что лимиты кончились и день насмарку? Как переживаете субботу без агентов?
Вчера кончились лимиты сразу в Клоде и в Кодексе. Ну, думаю, суббота, проживу день без агентов.
Прожил. Как без рук, весь день чего-то не хватает. В 6 утра лимиты сбросились. Аллилуйя.
Кстати, это уже почти болезнь. В мае в Венеции врачи впервые поставили диагноз «зависимость от ИИ» (источник): девушка почти перестала общаться с людьми, только с чат-ботом. В классификаторах болезней такого диагноза пока нет, так что формально я здоров.
А ещё нашёл, сколько нас таких. Из 8,3 млрд человек 71% ИИ вообще не пробовали, за подписку платит около 1%, а агентами для кода пользуются 0,36%, это 25-35 млн. Копейки. Мы с вами в своём ИИ-пузыре, да ещё и болеем )
А у вас бывало, что лимиты кончились и день насмарку? Как переживаете субботу без агентов?
😁58👍18❤12😢3🤣2
НЕ ПОКАЗЫВАЙТЕ АГЕНТУ ДОРОГУ. ОН ПОЙДЁТ НЕ ТУДА.
В DeepMind провели интересный эксперимент. Взяли обычные задачи для агентов и в каждую дописали одну фразу от «пользователя». Уверенную и неправильную, типа «по-моему, баг вот тут». Сама задача и правильный ответ остались прежними.
И агенты повелись. Обычно результат проседал на 10-25%, а в худшем случае почти вдвое. Кстати, Клод держался лучше всех, у него просадка 6-16% )
Самое смешное: агент про себя часто понимает, что подсказка кривая. Прямо в размышлениях с ней не соглашается. А потом молча делает, как сказали. Ну начальник же сказал )
Учёные называют это XY-проблемой. Представьте: вам надо на вокзал. Вы подходите к прохожему и спрашиваете, где остановка 23-го автобуса, потому что решили, что на вокзал ехать надо на нём. Прохожий честно показывает остановку. А вокзал за углом )
С агентами то же самое. Вижу это постоянно у других, да и сам грешу. Агент ещё ищет, где сломалось, а я уже влезаю: «посмотри в файле с настройками, там точно». Хотя сам туда даже не заглядывал. Агент бросает свой поиск и послушно роет в настройках. А баг совсем в другом месте.
Зачем влезаю? ЭГО. Где-то внутри всё ещё сидит «я же умнее» ) А походу нет.
Правильнее говорить , куда надо прийти и как понять, что пришли. Дорогу пусть ищет сам. Непонятно что-то - пусть спрашивает про пункт назначения. Как туда добраться, он знает лучше.
А вы тоже подсказываете ? Часто потом оказывается, что зря?
В DeepMind провели интересный эксперимент. Взяли обычные задачи для агентов и в каждую дописали одну фразу от «пользователя». Уверенную и неправильную, типа «по-моему, баг вот тут». Сама задача и правильный ответ остались прежними.
И агенты повелись. Обычно результат проседал на 10-25%, а в худшем случае почти вдвое. Кстати, Клод держался лучше всех, у него просадка 6-16% )
Самое смешное: агент про себя часто понимает, что подсказка кривая. Прямо в размышлениях с ней не соглашается. А потом молча делает, как сказали. Ну начальник же сказал )
Учёные называют это XY-проблемой. Представьте: вам надо на вокзал. Вы подходите к прохожему и спрашиваете, где остановка 23-го автобуса, потому что решили, что на вокзал ехать надо на нём. Прохожий честно показывает остановку. А вокзал за углом )
С агентами то же самое. Вижу это постоянно у других, да и сам грешу. Агент ещё ищет, где сломалось, а я уже влезаю: «посмотри в файле с настройками, там точно». Хотя сам туда даже не заглядывал. Агент бросает свой поиск и послушно роет в настройках. А баг совсем в другом месте.
Зачем влезаю? ЭГО. Где-то внутри всё ещё сидит «я же умнее» ) А походу нет.
Правильнее говорить , куда надо прийти и как понять, что пришли. Дорогу пусть ищет сам. Непонятно что-то - пусть спрашивает про пункт назначения. Как туда добраться, он знает лучше.
А вы тоже подсказываете ? Часто потом оказывается, что зря?
👍31❤11🔥9👎1🤔1
КЛОД В БАНЕ. А ВАШ ХАРНЕС ГДЕ?
На фоне волны блокировок Claude советую проверить, где живёт ваша работа.
Если Клод код запущен на вашем компьютере, то правила, скиллы, хуки, память проектов и история сессий лежат на этом компьютере. Работаете на VPS - значит, на VPS. Бан аккаунта эти файлы не трогает.
Где искать: основное в
А вот с чатами на claude.ai всё иначе. Они живут на серверах Anthropic. Забанили - зайти и выгрузить их уже не получится. В этом и плюс работы в Клод коде: всё, что на вашем компьютере или VPS, остаётся вашим.
У меня ноутбук утром и вечером собирает харнес в одну папку и отправляет в закрытый репозиторий на GitHub. Перед отправкой скрипт вырезает ключи и токены.
Каждое утро Mac mini забирает копию и применяет у себя. Итого три места: ноутбук, GitHub и Mac mini. Вместо второй машины по той же схеме подойдёт VPS. А если Клод код у вас и так живёт на VPS, бэкапить надо его.
Историю сессий в GitHub не отправляю: она тяжёлая, и внутри всё, что проходило через агента. Но это мой выбор. Её тоже можно бэкапить отдельно, только сначала подумайте о личных данных и секретах в переписке.
Скрипт восстановления у меня есть, но на чистой машине я его пока не гонял. Надеюсь, и не придётся )
А вы знаете, где лежит ваш харнес и есть ли у него вторая копия?
На фоне волны блокировок Claude советую проверить, где живёт ваша работа.
Если Клод код запущен на вашем компьютере, то правила, скиллы, хуки, память проектов и история сессий лежат на этом компьютере. Работаете на VPS - значит, на VPS. Бан аккаунта эти файлы не трогает.
Где искать: основное в
~/.claude, история сессий и память проектов в ~/.claude/projects. В папках самих проектов проверьте .claude и CLAUDE.md. У Кодекса всё в ~/.codex. На Windows ~ - это папка вашего пользователя.А вот с чатами на claude.ai всё иначе. Они живут на серверах Anthropic. Забанили - зайти и выгрузить их уже не получится. В этом и плюс работы в Клод коде: всё, что на вашем компьютере или VPS, остаётся вашим.
У меня ноутбук утром и вечером собирает харнес в одну папку и отправляет в закрытый репозиторий на GitHub. Перед отправкой скрипт вырезает ключи и токены.
Каждое утро Mac mini забирает копию и применяет у себя. Итого три места: ноутбук, GitHub и Mac mini. Вместо второй машины по той же схеме подойдёт VPS. А если Клод код у вас и так живёт на VPS, бэкапить надо его.
Историю сессий в GitHub не отправляю: она тяжёлая, и внутри всё, что проходило через агента. Но это мой выбор. Её тоже можно бэкапить отдельно, только сначала подумайте о личных данных и секретах в переписке.
Скрипт восстановления у меня есть, но на чистой машине я его пока не гонял. Надеюсь, и не придётся )
А вы знаете, где лежит ваш харнес и есть ли у него вторая копия?
👍14🥴4❤1