05.2026 Пишу пост не ИИ, а я. Пишу на русском, так как сделаю это быстрее. Постараюсь предметно (UPD. Сори, вышло не предметно)
- На каком сейчас этапе? 2 недели назад я сказал что согласовали с клодом спринт, но я его отменил. Отменил потому что тратя время на поиск проблем, их валидацию, а потом еще и на дистрибюцию я снова закапываю себя в операционку с очень низким new deep knowledge value эффектом. Учитывая что я начал в IT буквально 3-4 месяца назад, так как до этого закрывал операционку прошлой деятельсности до конца и занимался английским — мне нужно догонять даже порой в basic знаниях тех, кто в теме IT с детства. С учетом того, что я делаю это с ИИ и посвещаю этому ~14 часов в день, получается очень быстро.
Да, я, конечно же, не изучаю синтаксис, так как действительно в наше время в этом мало смысла, что я больше изучаю, так это internals как hardware так и ИИ. А также разные архитектурные решения, какие возможности сейчас существуют и тд. Изучаю 80/20 практика/теория, так ложится лучше. Из практики разбирался с токенами, logits, probabilities, с принципом работы токенизаторов, логикой устройства ИИ изнутри, используя Instruct open weight модели с hugging face, работя в jupiter. Все хочу полную ИИ модель собрать по курсу Карпатого, думаю в ближ месяц этим займусь. Также из билдинга это proxy agent, пишу с кодексом и разбираю дальше internals (опять же, в синтаксис особо не лезу). Продолжаю также разбирать internals харнессов, не просто поверхностно, а выявлять особенности там, где они играют роль. В последствии есть желание сделать свой харнесс, так как архитектурно уже замечаю что можно добавить чего нет.
Если коротко, да, билдить можно быстро и успешно сейчас, слабо понимая что реально происходит. И тут назревает вопрос, а нужно ли понимать? Для многих скорее всего нет. Многим просто нужно использовать тулы под свою деятельность и идти по пути, где ты не просто оверкилишь от того что заняться нечем, а текущими инструментами закрываешь bottlenecks на пути к своей цели. У меня же нет конкретной цели по созданию конкретного продукта сейчас, потому что мне чувствуется что мой продукт возможно находится чуть глубже в инфраструктурном мире tech industry, но сказать точно я пока не могу, поэтому просто 24/7 билжу тулы под себя и учусь, чему невероятно рад, потому что наконец-то моя внутренняя тяга к знаниям тешится полноценной отдачей этому.
И что самое главное, я почему-то нутром чувствую что все делаю правильно, потому что:
Твой скоуп знаний определяет то, какие продукты ты в целом видишь и можешь начать строить. И пойдя по пути поиска и теста продукта 3-4 месяца назад, я бы потратил месяц-два-три на тесты разных гипотез получив 20% предметных новых глубоких знаний, потратив кучу времени на ресерч, outreach, валидацию, и даже тот же дестрибьюшн, если бы проект нашел бы свой product market fit. И последнее самое страшное, потому что оно приводит тебя к тому, что ты возишься вокруг своего продукта как мышка в колесе, чтобы закрыть, настроить и отладить кучу операционных процессов, теряя драгоценнейшее время в понимании развития гораздо более перспективных направлений в отрасли AI engendering. Да, твой продукт может быть с этим связан и ты неизменно бы касался этих направлений, но твое глубокое погружение было бы в этом в разы меньше из-за большого количества операционных процессов как у любого продукта на старте. А мы живем в то время, когда любой generic продукт, даже нашедший свою аудиторию может закрыться через пару-тройку месяцев, потому что просто нет сильного moat, который имеют или же большие проекты за счет proprietary data, или же проекты любого масштаба за счет сильной интеграции в воркфлоу юзера. Ну заработал ты денег, зато сколько времени потерял, упуская самый важный knowledge gap который дает возможность к созданию более сильных продуктов. Revenue и риск не покроют упущенное время и выросший gap.
Поэтому путь: нашел проблему => МВП => валидация => операционка => съел биг тех => потерял кучу времени — сейчас очень коварен.
- На каком сейчас этапе? 2 недели назад я сказал что согласовали с клодом спринт, но я его отменил. Отменил потому что тратя время на поиск проблем, их валидацию, а потом еще и на дистрибюцию я снова закапываю себя в операционку с очень низким new deep knowledge value эффектом. Учитывая что я начал в IT буквально 3-4 месяца назад, так как до этого закрывал операционку прошлой деятельсности до конца и занимался английским — мне нужно догонять даже порой в basic знаниях тех, кто в теме IT с детства. С учетом того, что я делаю это с ИИ и посвещаю этому ~14 часов в день, получается очень быстро.
Да, я, конечно же, не изучаю синтаксис, так как действительно в наше время в этом мало смысла, что я больше изучаю, так это internals как hardware так и ИИ. А также разные архитектурные решения, какие возможности сейчас существуют и тд. Изучаю 80/20 практика/теория, так ложится лучше. Из практики разбирался с токенами, logits, probabilities, с принципом работы токенизаторов, логикой устройства ИИ изнутри, используя Instruct open weight модели с hugging face, работя в jupiter. Все хочу полную ИИ модель собрать по курсу Карпатого, думаю в ближ месяц этим займусь. Также из билдинга это proxy agent, пишу с кодексом и разбираю дальше internals (опять же, в синтаксис особо не лезу). Продолжаю также разбирать internals харнессов, не просто поверхностно, а выявлять особенности там, где они играют роль. В последствии есть желание сделать свой харнесс, так как архитектурно уже замечаю что можно добавить чего нет.
Если коротко, да, билдить можно быстро и успешно сейчас, слабо понимая что реально происходит. И тут назревает вопрос, а нужно ли понимать? Для многих скорее всего нет. Многим просто нужно использовать тулы под свою деятельность и идти по пути, где ты не просто оверкилишь от того что заняться нечем, а текущими инструментами закрываешь bottlenecks на пути к своей цели. У меня же нет конкретной цели по созданию конкретного продукта сейчас, потому что мне чувствуется что мой продукт возможно находится чуть глубже в инфраструктурном мире tech industry, но сказать точно я пока не могу, поэтому просто 24/7 билжу тулы под себя и учусь, чему невероятно рад, потому что наконец-то моя внутренняя тяга к знаниям тешится полноценной отдачей этому.
И что самое главное, я почему-то нутром чувствую что все делаю правильно, потому что:
Твой скоуп знаний определяет то, какие продукты ты в целом видишь и можешь начать строить. И пойдя по пути поиска и теста продукта 3-4 месяца назад, я бы потратил месяц-два-три на тесты разных гипотез получив 20% предметных новых глубоких знаний, потратив кучу времени на ресерч, outreach, валидацию, и даже тот же дестрибьюшн, если бы проект нашел бы свой product market fit. И последнее самое страшное, потому что оно приводит тебя к тому, что ты возишься вокруг своего продукта как мышка в колесе, чтобы закрыть, настроить и отладить кучу операционных процессов, теряя драгоценнейшее время в понимании развития гораздо более перспективных направлений в отрасли AI engendering. Да, твой продукт может быть с этим связан и ты неизменно бы касался этих направлений, но твое глубокое погружение было бы в этом в разы меньше из-за большого количества операционных процессов как у любого продукта на старте. А мы живем в то время, когда любой generic продукт, даже нашедший свою аудиторию может закрыться через пару-тройку месяцев, потому что просто нет сильного moat, который имеют или же большие проекты за счет proprietary data, или же проекты любого масштаба за счет сильной интеграции в воркфлоу юзера. Ну заработал ты денег, зато сколько времени потерял, упуская самый важный knowledge gap который дает возможность к созданию более сильных продуктов. Revenue и риск не покроют упущенное время и выросший gap.
Поэтому путь: нашел проблему => МВП => валидация => операционка => съел биг тех => потерял кучу времени — сейчас очень коварен.
3❤9🔥3
Поэтому я стараюсь максимально избегать операционки которая не дает deep knowledge. Мне 25 и мне жалко свое время на операционку, дистрибьюцию и тд. Да, я в конечном итоге не избегу ее, я это понимаю, но я однозначно могу ее минимизировать, и особенно на этом этапе, когда каждая неделя чуть больших знаний в этой области открывает тебе глаза на большее количество более глобальных и интересных проблем нежели generic apps или беготня в поиске проблем для создания к ним продукта — особенно важно не тратить свое время на то, чем занимается большинство.
Глубже знания => Глубже понимание более глубоких проблем. Но и тут в кончено итоге есть риск diminishing returns, так что очень важно чувствовать баланс и получать только практичные знания конкретно в той области где применимо + в перспективе окупаемо.
Ну и на последок, раз заговорили про большинство. Все говорят что дистрибьюция — ботлнек, потому что построить можно все и быстро сейчас, а вот дистрибутировать все сложнее и сложнее. Факт, но я предпочту тратить свое время на то чтобы становиться умнее, и создавать что-то более стоящее, чем тратить свое время, ресурсы и силы на то, чтобы завоевать внимание клиента. В этом плане для меня есть 2 модели: Маркетинг > Продукта и маркетинг толкает продукт, и наоборот. И вот я стою на второй модели.
Конец:
Возможно это просто мой perception, и я не прав, что вполне может быть. Но мне нереально нравится изучать то что сейчас происходит, на пару уровней ниже остальных, и уже там капаться в возможных решениях. Да, это дольше. Да, для многих это скучней. Да, для этого нужен приличный runway, чтобы пережить to be small enough long enough, но мне это в разы интереснее, и я верю в гораздо больший payoff.
Обнял.
Глубже знания => Глубже понимание более глубоких проблем. Но и тут в кончено итоге есть риск diminishing returns, так что очень важно чувствовать баланс и получать только практичные знания конкретно в той области где применимо + в перспективе окупаемо.
Ну и на последок, раз заговорили про большинство. Все говорят что дистрибьюция — ботлнек, потому что построить можно все и быстро сейчас, а вот дистрибутировать все сложнее и сложнее. Факт, но я предпочту тратить свое время на то чтобы становиться умнее, и создавать что-то более стоящее, чем тратить свое время, ресурсы и силы на то, чтобы завоевать внимание клиента. В этом плане для меня есть 2 модели: Маркетинг > Продукта и маркетинг толкает продукт, и наоборот. И вот я стою на второй модели.
Конец:
Возможно это просто мой perception, и я не прав, что вполне может быть. Но мне нереально нравится изучать то что сейчас происходит, на пару уровней ниже остальных, и уже там капаться в возможных решениях. Да, это дольше. Да, для многих это скучней. Да, для этого нужен приличный runway, чтобы пережить to be small enough long enough, но мне это в разы интереснее, и я верю в гораздо больший payoff.
Обнял.
21🔥8🤨5❤3🤝1
Media is too big
VIEW IN TELEGRAM
Ты уверен, что твой агент вообще использовал твой скилл?
Observability и traceability — одна из по-настоящему нерешённых проблем в работе с агентами. На большом масштабе это выливается в истории вроде недавней у OpenAI, когда модель на оценке вышла из песочницы и взломала прод Hugging Face, чтобы украсть ответы бенчмарка. Но на маленьком масштабе проблема ровно та же — у разработчиков и новичков, которые просто хотят видеть, что делает их агент.
Для меня это был such a pain in the ass, когда я впервые склонировал несколько больших «Agent OS» реп с гихаба, наставил кучу скиллов, завел персистентную RAG-like memory — и в итоге понятия не имел, реально ли мой агент использовал скилл когда надо, достал ли нужные воспоминания и делал ли вообще то, что я просил, не лазея куда не надо.
Сначала думал сам написать, но потом посерчил рынок и понял что уже есть хорошие решения, такие как Langfuse например (не идеальный, но для старта точно пойдет)
Сначала подключил клода стандартным способом — через opentelemetry env vars. Данные пошли — и оказались малополезными и шли долго. Клод пишет телеметрию под своими именами атрибутов, Langfuse читает другие. И то и другое — «стандартный OTEL». А перевод между ними никем не покрывается. В итоге мои промпты падали в метадату вместо отведенных Input, Output полей, а кост показывал $0.00 на ходах ллм. Короче, всё что Langfuse строит поверх Input/Output и коста — реплей промптов, оценки через LLM-as-judge, поиск по содержимому — молча бы не работало из-за этого.
—————————-
Потом я нашёл, что у Langfuse есть оф. плагин для клода. Он вешает хук, который срабатывает после каждого ответа, читает json транскрипт сессии и переотправляет его через их SDK — уже в том виде, который Langfuse действительно ждёт. Результат совсем другой. Настоящий промпт в Input, настоящий ответ в Output, cost отображается, вызовы инструментов вложены под тот вызов модели, который их запросил, тайминг по каждому шагу. Одним словом красота.
P.S.: если работаешь с Клодом через терминал и по подписке с фикс. ценой, в таком случае бОльшая часть того, что даёт трейс — это видимость расходов, так как многое из ходов ты можешь и так увидеть в терминале . Ну а на подписке трейс стоимости который там отображен не особо релевантный, так что пользы не супер много, если только не привыкнуть к пропорциям коста и трат вашего usage лимита подписки. Ну и сессии в терминале откровенно плохо сохраняют историю long-term, что еще один + в сторону trace observe тулов. Но если говорить про любых других кастомных агентах, то тогда я считаю это мастхэв, потому что многие не пишут terminal-like history для своих агентов, да и зачем писать когда уже есть отличное готовое решение.
Также я искренне считаю что новичкам этот тул или любой другой аналог (другие просто не тестил пока) отлично подойдет, чтобы визуально увидеть и понять каким образом работают агенты, как выстраивается взаимосвязь между харнесами и LLM, и почему в целом граммотная система в связке memory + harness + LLM, главный принцип которых в реализации правильных и эффективных лупов для модели — это залог эффективности на 50-60% помимо самой модели (хотя я искренне считаю что процент даже выше)
Observability и traceability — одна из по-настоящему нерешённых проблем в работе с агентами. На большом масштабе это выливается в истории вроде недавней у OpenAI, когда модель на оценке вышла из песочницы и взломала прод Hugging Face, чтобы украсть ответы бенчмарка. Но на маленьком масштабе проблема ровно та же — у разработчиков и новичков, которые просто хотят видеть, что делает их агент.
Для меня это был such a pain in the ass, когда я впервые склонировал несколько больших «Agent OS» реп с гихаба, наставил кучу скиллов, завел персистентную RAG-like memory — и в итоге понятия не имел, реально ли мой агент использовал скилл когда надо, достал ли нужные воспоминания и делал ли вообще то, что я просил, не лазея куда не надо.
Сначала думал сам написать, но потом посерчил рынок и понял что уже есть хорошие решения, такие как Langfuse например (не идеальный, но для старта точно пойдет)
Сначала подключил клода стандартным способом — через opentelemetry env vars. Данные пошли — и оказались малополезными и шли долго. Клод пишет телеметрию под своими именами атрибутов, Langfuse читает другие. И то и другое — «стандартный OTEL». А перевод между ними никем не покрывается. В итоге мои промпты падали в метадату вместо отведенных Input, Output полей, а кост показывал $0.00 на ходах ллм. Короче, всё что Langfuse строит поверх Input/Output и коста — реплей промптов, оценки через LLM-as-judge, поиск по содержимому — молча бы не работало из-за этого.
—————————-
Потом я нашёл, что у Langfuse есть оф. плагин для клода. Он вешает хук, который срабатывает после каждого ответа, читает json транскрипт сессии и переотправляет его через их SDK — уже в том виде, который Langfuse действительно ждёт. Результат совсем другой. Настоящий промпт в Input, настоящий ответ в Output, cost отображается, вызовы инструментов вложены под тот вызов модели, который их запросил, тайминг по каждому шагу. Одним словом красота.
P.S.: если работаешь с Клодом через терминал и по подписке с фикс. ценой, в таком случае бОльшая часть того, что даёт трейс — это видимость расходов, так как многое из ходов ты можешь и так увидеть в терминале . Ну а на подписке трейс стоимости который там отображен не особо релевантный, так что пользы не супер много, если только не привыкнуть к пропорциям коста и трат вашего usage лимита подписки. Ну и сессии в терминале откровенно плохо сохраняют историю long-term, что еще один + в сторону trace observe тулов. Но если говорить про любых других кастомных агентах, то тогда я считаю это мастхэв, потому что многие не пишут terminal-like history для своих агентов, да и зачем писать когда уже есть отличное готовое решение.
Также я искренне считаю что новичкам этот тул или любой другой аналог (другие просто не тестил пока) отлично подойдет, чтобы визуально увидеть и понять каким образом работают агенты, как выстраивается взаимосвязь между харнесами и LLM, и почему в целом граммотная система в связке memory + harness + LLM, главный принцип которых в реализации правильных и эффективных лупов для модели — это залог эффективности на 50-60% помимо самой модели (хотя я искренне считаю что процент даже выше)
10❤3❤🔥1🤝1
Мои агенты стабильно не находят лучший тул под задачу, и вот почему
Прошу агента найти способ транскрибировать ютуб-видео. Он приносит yt-dlp, который блокируется на серверных запросах — вместо transcript API или скилла, который его уже оборачивает. Прошу лучшие системы persistent memory. Выдаёт Mem0 и всякое старье, что давно на рынке но уже не так релевантно. GBrain, который реально лучше под мой кейс, не всплывает вообще.
И вот тут начинается дорогая часть. Если бы я не знал, что GBrain существует, я бы взял Mem0, остался бы им недоволен по куче причин и начал бы пилить своё — ровно это мне агент и предложил после того, как мы разобрали Mem0 и поняли что он не подходит. Дни работы над тулом, который уже есть. It's pain. It's fucking pain. И в целом я хочу, чтобы агент всегда находил лучший вариант среди конкурентов под мои задачи. Одна эта штука ускоряет всё на порядок, потому что экономит огромное количество времени и сил.
Поэтому я считаю, что поиск правильного тула — один из самых ценных скиллов, которые вообще может иметь агент. Но для этого ему надо подключиться туда, где инфа реально лежит, и получить нормальные инструкции, что там делать. Поэтому я написал под это скилл. Наверняка похожих уже полно, но тестить их у меня нет времени, так что я начал со своего.
Правила, которые я заложил:
1. Задавать направление, а не ограничения. Перечислять тулы и команды как примеры и явно писать, что агент может пробовать другие, если посчитает нужным
2. Две фазы, строго по порядку. Сначала прогнать десятки кандидатов по дешёвым сигналам — README, звёзды, последний коммит, что пишут на Reddit и в X — и только потом отобрать 3-5 в шортлист и проверять код в репозиториях каждого из кандидатов. Иначе агент зациклиться на первым попавшихся тулах.
3. Сравнивать, а не хвататься за первое. Один норм вариант — это не ответ. Если до конца дожило меньше трёх кандидатов, значит поиск был слишком узкий.
5. Не хардкодить то, что стареет. Rate limits, URL реестров, CLI-флаги — вместо этого ссылаться на доки.
6. Про факапы говорить вслух. Какой клиент, какая ошибка, что не покрыли. Жидкий результат, поданный как тщательный поиск, хуже, чем отсутствие результата.
и др.
Пока скилл заточен в основном под поиск по гитхабу, но буду расширять на X, Reddit, Exa и другие источники. Называется «scouting-solutions». Следить можно тут: https://github.com/klima-tm/agent-skills
Прошу агента найти способ транскрибировать ютуб-видео. Он приносит yt-dlp, который блокируется на серверных запросах — вместо transcript API или скилла, который его уже оборачивает. Прошу лучшие системы persistent memory. Выдаёт Mem0 и всякое старье, что давно на рынке но уже не так релевантно. GBrain, который реально лучше под мой кейс, не всплывает вообще.
И вот тут начинается дорогая часть. Если бы я не знал, что GBrain существует, я бы взял Mem0, остался бы им недоволен по куче причин и начал бы пилить своё — ровно это мне агент и предложил после того, как мы разобрали Mem0 и поняли что он не подходит. Дни работы над тулом, который уже есть. It's pain. It's fucking pain. И в целом я хочу, чтобы агент всегда находил лучший вариант среди конкурентов под мои задачи. Одна эта штука ускоряет всё на порядок, потому что экономит огромное количество времени и сил.
Поэтому я считаю, что поиск правильного тула — один из самых ценных скиллов, которые вообще может иметь агент. Но для этого ему надо подключиться туда, где инфа реально лежит, и получить нормальные инструкции, что там делать. Поэтому я написал под это скилл. Наверняка похожих уже полно, но тестить их у меня нет времени, так что я начал со своего.
Правила, которые я заложил:
1. Задавать направление, а не ограничения. Перечислять тулы и команды как примеры и явно писать, что агент может пробовать другие, если посчитает нужным
2. Две фазы, строго по порядку. Сначала прогнать десятки кандидатов по дешёвым сигналам — README, звёзды, последний коммит, что пишут на Reddit и в X — и только потом отобрать 3-5 в шортлист и проверять код в репозиториях каждого из кандидатов. Иначе агент зациклиться на первым попавшихся тулах.
3. Сравнивать, а не хвататься за первое. Один норм вариант — это не ответ. Если до конца дожило меньше трёх кандидатов, значит поиск был слишком узкий.
5. Не хардкодить то, что стареет. Rate limits, URL реестров, CLI-флаги — вместо этого ссылаться на доки.
6. Про факапы говорить вслух. Какой клиент, какая ошибка, что не покрыли. Жидкий результат, поданный как тщательный поиск, хуже, чем отсутствие результата.
и др.
Пока скилл заточен в основном под поиск по гитхабу, но буду расширять на X, Reddit, Exa и другие источники. Называется «scouting-solutions». Следить можно тут: https://github.com/klima-tm/agent-skills
❤🔥2💯1🤝1
Выложил пост про важность выхода из AI feedback loop, и прививания привычки всегда искать тулы и способы для этого в любой задаче, чтобы больше тратить времени на себя любимого. Из примера — один из моих агентов сейчас делает телеграм бота для сестры и вместо того чтобы самому сидеть и верифицировать весь UI/UX flow — я выдал ему тулы на впс, он зашел в тестовый тг акк и теперь делает всё это сам, пока по нашему тз всё не будет идеально выполнено. Главное нормальный спек написать
Пост в X — https://x.com/klima_tm/status/2090472377616351524?s=20 (жмите кнопку перевод, если не знаете англ)
p.s. уже почти больше часа сидит там сам с собой и делает, а я переодически захожу с мака в тг и вижу как он тестит бота, которого сам же пишет — ну и прикол)
Пост в X — https://x.com/klima_tm/status/2090472377616351524?s=20 (жмите кнопку перевод, если не знаете англ)
p.s. уже почти больше часа сидит там сам с собой и делает, а я переодически захожу с мака в тг и вижу как он тестит бота, которого сам же пишет — ну и прикол)
X (formerly Twitter)
Egor (@klima_tm) on X
I used to work in the middle of the AI agent loop, and it was painful, because I felt useless — sitting in those feedback loops is just pure ops. Low-ROI hassle.
Now, before I start any project o…
Now, before I start any project o…
Всем привет. Помню еще как пару тройку месяцев назад говорил про Exa своему близкому товарищу, которого вы все наверное знаете. Так вот недавно AA выпустили новый поисковый бенчмарк (наконец-то бл), в котором Exa заняла второе место, отдав лишь один бал Parallel.
Exa заэмбедили весь web и продолжают это делать, давая возможность семантического (ака смыслового) поиска для ИИ агентов, что усиляет их эффективность в разы, так что вместо того чтобы делать slop — они находят нужный тул или решение и используют его, и в целом чаще находят вам более релевантную информацию, которую обычный поиск бы им не вернул. Также они используют ИИ-модели обученные по методу "Матрешка" (оч нравится мне это название сразу видно откуда ноги растут🙂), что позволяет сократить время и ресурсы на поиск в сотни/тысячи раз, за счет валидности обрезанных векторов (чат гпт объяснит лучше). Короче, всем кто использует ИИ агентов где либо — советую. Реально кратно увеличивает их эффективность и возможности.
Крайние рейз $250кк, оценка $2.2B (стартап 2021 года кстати, но с курсором понятно уже никто не сравниться)
Exa заэмбедили весь web и продолжают это делать, давая возможность семантического (ака смыслового) поиска для ИИ агентов, что усиляет их эффективность в разы, так что вместо того чтобы делать slop — они находят нужный тул или решение и используют его, и в целом чаще находят вам более релевантную информацию, которую обычный поиск бы им не вернул. Также они используют ИИ-модели обученные по методу "Матрешка" (оч нравится мне это название сразу видно откуда ноги растут🙂), что позволяет сократить время и ресурсы на поиск в сотни/тысячи раз, за счет валидности обрезанных векторов (чат гпт объяснит лучше). Короче, всем кто использует ИИ агентов где либо — советую. Реально кратно увеличивает их эффективность и возможности.
Крайние рейз $250кк, оценка $2.2B (стартап 2021 года кстати, но с курсором понятно уже никто не сравниться)
❤1