ИИ-АГЕНТ КОСЯЧИТ. И НЕ ВСЕГДА ПОТОМУ, ЧТО ОН ТУПОЙ 😁
Сначала версия для тех, у кого чтение заканчивается после третьего абзаца:
Скачайте прикреплённую PDF.
Загрузите её в Claude Code, Codex или другой ИИ, с которым разрабатываете проект.
Попросите его проверить вашего агента по 41 причине сбоев из документа.
Всё. Можете идти дальше листать рилсы 😂
А теперь версия для тех, кто всё-таки умеет читать больше одного экрана.
Ребята из Scale AI разобрали 41 причину, почему ИИ-агенты косячат.
И главная мысль очень простая:
Проблема далеко не всегда в самой модели.
Агент - это не только Claude, GPT или Gemini.
Это ещё:
• ваши инструкции;
• память агента;
• подключённые инструменты;
• внешние сервисы;
• другие агенты;
• логика проверки результата;
• вся система вокруг модели.
Например, внешний сервис сообщил:
«Сообщение отправлено, но один человек его не получил».
Система обрезала вторую часть ответа и передала модели только:
«Сообщение отправлено».
Модель сказала пользователю, что всё готово.
Выглядит так, будто ИИ соврал.
Но он не соврал. Ему самому передали неправильную информацию.
Можно хоть десять раз поменять Claude на GPT, GPT на Gemini, а потом обратно.
Криво работающая система продолжит обманывать любую модель с одинаково уверенным лицом 😁
Я создал уже больше 100 разных автономных агентов и понимаю, о чём говорю.
Очень часто проблема не в том, что модель слабая.
Проблема в том, что ей:
• не дали нужные инструкции;
• не показали полную информацию;
• не объяснили, как проверять саму себя;
• не дали критерии, по которым результат считается готовым;
• не дали возможность восстановиться после ошибки.
Поэтому эту PDF не обязательно просто читать глазами.
Пусть её изучит ваш ИИ.
Положите документ в проект, добавьте файлы агента и последние логи, а затем дайте такую задачу:
И вот тогда исследование превращается не просто в умную PDF-ку, которую все сохранили и никто никогда не открыл.
Она превращается в рабочий инструмент.
ИИ сможет сам подсказать:
• где слабое место в вашем проекте;
• почему агент зацикливается;
• почему забывает инструкции;
• почему неправильно использует инструменты;
• почему говорит «готово», когда ничего не готово;
• что именно нужно усилить.
Но есть важный момент.
ИИ не начнёт волшебным образом понимать самого себя, если вы не дадите ему информацию и правила для анализа.
Хотите, чтобы он проверял себя - дайте ему критерии.
Хотите, чтобы он находил свои ошибки - дайте ему логи.
Хотите, чтобы он усиливал ваш проект - дайте ему подобные исследования и инструкции.
Моя рабочая формула простая:
Узнал у ИИ - проверил - исправил - снова запустил.
Не верьте слепо. Делайте, тестируйте и проверяйте результат.
PDF прикрепил.
Забирайте и сразу скармливайте своему агенту. Пусть хоть немного займётся самокопанием вместо того, чтобы снова уверенно докладывать: «Всё готово» 😂
Сначала версия для тех, у кого чтение заканчивается после третьего абзаца:
Скачайте прикреплённую PDF.
Загрузите её в Claude Code, Codex или другой ИИ, с которым разрабатываете проект.
Попросите его проверить вашего агента по 41 причине сбоев из документа.
Всё. Можете идти дальше листать рилсы 😂
А теперь версия для тех, кто всё-таки умеет читать больше одного экрана.
Ребята из Scale AI разобрали 41 причину, почему ИИ-агенты косячат.
И главная мысль очень простая:
Проблема далеко не всегда в самой модели.
Агент - это не только Claude, GPT или Gemini.
Это ещё:
• ваши инструкции;
• память агента;
• подключённые инструменты;
• внешние сервисы;
• другие агенты;
• логика проверки результата;
• вся система вокруг модели.
Например, внешний сервис сообщил:
«Сообщение отправлено, но один человек его не получил».
Система обрезала вторую часть ответа и передала модели только:
«Сообщение отправлено».
Модель сказала пользователю, что всё готово.
Выглядит так, будто ИИ соврал.
Но он не соврал. Ему самому передали неправильную информацию.
Можно хоть десять раз поменять Claude на GPT, GPT на Gemini, а потом обратно.
Криво работающая система продолжит обманывать любую модель с одинаково уверенным лицом 😁
Я создал уже больше 100 разных автономных агентов и понимаю, о чём говорю.
Очень часто проблема не в том, что модель слабая.
Проблема в том, что ей:
• не дали нужные инструкции;
• не показали полную информацию;
• не объяснили, как проверять саму себя;
• не дали критерии, по которым результат считается готовым;
• не дали возможность восстановиться после ошибки.
Поэтому эту PDF не обязательно просто читать глазами.
Пусть её изучит ваш ИИ.
Положите документ в проект, добавьте файлы агента и последние логи, а затем дайте такую задачу:
Изучи приложенную PDF и используй её как систему диагностики.
Проанализируй архитектуру моего агента, его инструкции, память, инструменты и последние логи работы.
Найди первый сбой, после которого агент уже не смог нормально восстановиться.
Объясни простыми словами:
1. Что именно сломалось.
2. Где находится настоящая причина.
3. Что нужно изменить.
4. Как проверить исправление.
5. Какой тест добавить, чтобы ошибка больше не повторялась.
Не придумывай факты. Если информации недостаточно, запроси конкретные файлы или логи.
И вот тогда исследование превращается не просто в умную PDF-ку, которую все сохранили и никто никогда не открыл.
Она превращается в рабочий инструмент.
ИИ сможет сам подсказать:
• где слабое место в вашем проекте;
• почему агент зацикливается;
• почему забывает инструкции;
• почему неправильно использует инструменты;
• почему говорит «готово», когда ничего не готово;
• что именно нужно усилить.
Но есть важный момент.
ИИ не начнёт волшебным образом понимать самого себя, если вы не дадите ему информацию и правила для анализа.
Хотите, чтобы он проверял себя - дайте ему критерии.
Хотите, чтобы он находил свои ошибки - дайте ему логи.
Хотите, чтобы он усиливал ваш проект - дайте ему подобные исследования и инструкции.
Моя рабочая формула простая:
Узнал у ИИ - проверил - исправил - снова запустил.
Не верьте слепо. Делайте, тестируйте и проверяйте результат.
PDF прикрепил.
Забирайте и сразу скармливайте своему агенту. Пусть хоть немного займётся самокопанием вместо того, чтобы снова уверенно докладывать: «Всё готово» 😂
🔥2👌1
This media is not supported in your browser
VIEW IN TELEGRAM
👍2❤1
Короче, ребят, кажется, я конкретно попал.
Причём ровно в ту ловушку, от которой сам много лет всех предостерегал.
У меня накопилось до хрена идей, проектов, механик и продуктов.
Что-то уже работает.
Что-то можно раскатать в большой бизнес.
А что-то, я почти уверен, рынок скопирует через две недели после того, как увидит.
И знаете, что я сделал?
Правильно.
Спрятал всё нахрен.
Сижу, блядь, как Кощей над златом.
Одной рукой проекты к груди прижал.
Второй ящик Пандоры держу, чтобы не дай бог оттуда наружу ничего полезного не вылезло.
Логика, конечно, железная😂
Никто не украдёт твою идею, если никто вообще не знает, что она существует.
В том числе клиенты.
И вот тут мне стало одновременно смешно и немного стыдно.
Потому что идея в сейфе не дорожает.
Она просто превращается в очередную страницу в Notion под названием:
СуперПуперИдея N 27
Я ведь сам всегда говорил:
Идея стоит ноль.
Стоит скорость.!!! ( о боже сколько раз я это всем говорил 😂)
Стоит реализация.
Стоит умение показать, продать и занять рынок.
А сам в какой-то момент начал вести себя так, будто моя главная задача не заработать на идеях, а сохранить их девственность.
Хотя рынок вообще не платит за самый умный секрет.
Он платит тому, кто вышел, сделал, продал и занял место.
Скопируют?
Конечно скопируют.
Если идея нормальная, её обязательно скопируют.
Но пусть к этому моменту они копируют уже мою прошлую версию.
Пока у меня есть аудитория, данные, команда, деньги и следующий продукт.
Короче, сейф открываю.
Не весь сразу. Я ещё не настолько просветлился 😁
Но чахнуть над золотом и охранять свои идеи от собственных клиентов больше не хочу.
Пора выпускать их наружу.
Пусть работают.
Пусть продаются.
Пусть растут.
И пусть немного бесят конкурентов.
А я пока пойду отцеплюсь от ящика Пандоры…
Причём ровно в ту ловушку, от которой сам много лет всех предостерегал.
У меня накопилось до хрена идей, проектов, механик и продуктов.
Что-то уже работает.
Что-то можно раскатать в большой бизнес.
А что-то, я почти уверен, рынок скопирует через две недели после того, как увидит.
И знаете, что я сделал?
Правильно.
Спрятал всё нахрен.
Сижу, блядь, как Кощей над златом.
Одной рукой проекты к груди прижал.
Второй ящик Пандоры держу, чтобы не дай бог оттуда наружу ничего полезного не вылезло.
Логика, конечно, железная😂
Никто не украдёт твою идею, если никто вообще не знает, что она существует.
В том числе клиенты.
И вот тут мне стало одновременно смешно и немного стыдно.
Потому что идея в сейфе не дорожает.
Она просто превращается в очередную страницу в Notion под названием:
СуперПуперИдея N 27
Я ведь сам всегда говорил:
Идея стоит ноль.
Стоит скорость.!!! ( о боже сколько раз я это всем говорил 😂)
Стоит реализация.
Стоит умение показать, продать и занять рынок.
А сам в какой-то момент начал вести себя так, будто моя главная задача не заработать на идеях, а сохранить их девственность.
Хотя рынок вообще не платит за самый умный секрет.
Он платит тому, кто вышел, сделал, продал и занял место.
Скопируют?
Конечно скопируют.
Если идея нормальная, её обязательно скопируют.
Но пусть к этому моменту они копируют уже мою прошлую версию.
Пока у меня есть аудитория, данные, команда, деньги и следующий продукт.
Короче, сейф открываю.
Не весь сразу. Я ещё не настолько просветлился 😁
Но чахнуть над золотом и охранять свои идеи от собственных клиентов больше не хочу.
Пора выпускать их наружу.
Пусть работают.
Пусть продаются.
Пусть растут.
И пусть немного бесят конкурентов.
А я пока пойду отцеплюсь от ящика Пандоры…
❤🔥10❤5👍4🤩4
Я сейчас нахожусь в очень непривычном для себя процессе.
В МЕНЯ вкладываются.
И, если честно, для меня это почти какой-то новый вид реальности 😅
Потому что я привык наоборот.
Привык сам быть тем, кто отдаёт.
Время.
Энергию.
Знания.
Идеи.
Связи.
Внимание.
Кому-то помочь.
Кого-то протащить.
Кому-то подсказать.
Кого-то собрать, поддержать, докрутить.
Я привык раздавать себя людям.
И я даже не замечал, насколько для меня это стало нормой.
А сейчас на ММ Артура Шамалова я вдруг оказался в позиции, где люди смотрят на меня.
Где мне дают обратную связь.
Где меня разбирают.
Где мне показывают мои слепые зоны.
Где в мой рост вкладывают своё внимание, опыт и энергию.
И первая внутренняя реакция:
БЛЯТЬ. А ТАК МОЖНО БЫЛО? 😂
И куча страхов и сопротивлений..
Не быть постоянно полезным.
Не доказывать свою ценность тем, сколько ты можешь отдать.
Не пытаться быть человеком, который всегда всех спасёт, усилит и куда-то дотащит, ииии сдохет.
А просто оказаться среди сильных людей и позволить им что-то дать тебе.
Для меня это, походу, отдельный навык.
И, возможно, мой следующий уровень вообще не в том, чтобы научиться отдавать ещё больше.
Я это и так умею.
А в том, чтобы перестать раздавать себя до нуля
и наконец позволить миру вкладываться в меня тоже.
Очень непривычное ощущение.
Но, сука, кажется, очень правильное.🎓
В МЕНЯ вкладываются.
И, если честно, для меня это почти какой-то новый вид реальности 😅
Потому что я привык наоборот.
Привык сам быть тем, кто отдаёт.
Время.
Энергию.
Знания.
Идеи.
Связи.
Внимание.
Кому-то помочь.
Кого-то протащить.
Кому-то подсказать.
Кого-то собрать, поддержать, докрутить.
Я привык раздавать себя людям.
И я даже не замечал, насколько для меня это стало нормой.
А сейчас на ММ Артура Шамалова я вдруг оказался в позиции, где люди смотрят на меня.
Где мне дают обратную связь.
Где меня разбирают.
Где мне показывают мои слепые зоны.
Где в мой рост вкладывают своё внимание, опыт и энергию.
И первая внутренняя реакция:
БЛЯТЬ. А ТАК МОЖНО БЫЛО? 😂
И куча страхов и сопротивлений..
Не быть постоянно полезным.
Не доказывать свою ценность тем, сколько ты можешь отдать.
Не пытаться быть человеком, который всегда всех спасёт, усилит и куда-то дотащит, ииии сдохет.
А просто оказаться среди сильных людей и позволить им что-то дать тебе.
Для меня это, походу, отдельный навык.
Не только отдавать.
Но и принимать.
И, возможно, мой следующий уровень вообще не в том, чтобы научиться отдавать ещё больше.
Я это и так умею.
А в том, чтобы перестать раздавать себя до нуля
и наконец позволить миру вкладываться в меня тоже.
Очень непривычное ощущение.
Но, сука, кажется, очень правильное.🎓
👍6🔥2❤1🙏1
Я спросил у Codex, сколько задач мы автоматизировали. Он посчитал по всем моим перепискам и ответил: 202.
Я сам не ожидал такой цифры.
Записал 15 минут аудио без подготовки — просто рассказал, что реально крутится у меня каждый день. Без теории и «нейросети изменят мир».
Внутри:
— ассистент в Телеграме по имени Skynet, который помнит за меня всё
— агент, который читает мои чаты и по запросу говорит, что я забыл сделать
— финмодель, P&L и ДДС за 15 минут вместо недели
— свой Perplexity на собственном сервере
— и кейс, где автономный агент заменил трёх менеджеров в переписке. Минус 150 000 ₽ расходов в месяц. Только начали.
Самое неприятное: пока вы думаете, конкуренты уже режут расходы и за счёт этого опускают цены ниже ваших. Это не «скоро будет», это происходит сейчас.
Слушайте с любого таймкода - блоки независимые.
Кто дослушал, поставьте реакцию, мне это правда важно. А если хотите, чтобы я разобрал именно ваш проект и сказал, что автоматизировать первым - плюс в комментарии или вашу идею!
Я сам не ожидал такой цифры.
Записал 15 минут аудио без подготовки — просто рассказал, что реально крутится у меня каждый день. Без теории и «нейросети изменят мир».
Внутри:
— ассистент в Телеграме по имени Skynet, который помнит за меня всё
— агент, который читает мои чаты и по запросу говорит, что я забыл сделать
— финмодель, P&L и ДДС за 15 минут вместо недели
— свой Perplexity на собственном сервере
— и кейс, где автономный агент заменил трёх менеджеров в переписке. Минус 150 000 ₽ расходов в месяц. Только начали.
Самое неприятное: пока вы думаете, конкуренты уже режут расходы и за счёт этого опускают цены ниже ваших. Это не «скоро будет», это происходит сейчас.
00:00 — Skynet: мой ассистент в Телеграме, который помнит всё за меня
01:20 — Zoom-встречи через агента: готовое summary после каждого созвона
02:50 — Мини-апп и контент-завод на Codex
04:10 — P&L, ДДС и финмодель за 15 минут
05:00 — Codex vs Claude Code: на чём я остался
06:30 — API Инстаграма: своя сквозная аналитика в одном дашборде
08:30 — Те самые 202 задачи. Разбираю, какие именно
09:50 — Свой Perplexity на собственном сервере
11:20 — Агент вместо трёх менеджеров: минус 150 000 ₽ в месяц
13:20 — Транскрибатор: часовое видео в текст почти бесплатно
13:50 — Для селлеров: агент ведёт кабинет, ФБС, рекламу и склады
14:10 — Разбор вашего проекта и обучение по четвергам
Слушайте с любого таймкода - блоки независимые.
Кто дослушал, поставьте реакцию, мне это правда важно. А если хотите, чтобы я разобрал именно ваш проект и сказал, что автоматизировать первым - плюс в комментарии или вашу идею!
👍6🔥4🤩2