Klima
3.92K subscribers
33 photos
8 videos
1 file
22 links
crypto. intelligence. freedom

IG: https://www.instagram.com/klima_tm
Download Telegram
Разнос

ИИ консесус между моделями должен завершать Клод, и точка.
🤯42❤‍🔥2
05.2026 Пишу пост не ИИ, а я. Пишу на русском, так как сделаю это быстрее. Постараюсь предметно (UPD. Сори, вышло не предметно)

- На каком сейчас этапе? 2 недели назад я сказал что согласовали с клодом спринт, но я его отменил. Отменил потому что тратя время на поиск проблем, их валидацию, а потом еще и на дистрибюцию я снова закапываю себя в операционку с очень низким new deep knowledge value эффектом. Учитывая что я начал в IT буквально 3-4 месяца назад, так как до этого закрывал операционку прошлой деятельсности до конца и занимался английским — мне нужно догонять даже порой в basic знаниях тех, кто в теме IT с детства. С учетом того, что я делаю это с ИИ и посвещаю этому ~14 часов в день, получается очень быстро.

Да, я, конечно же, не изучаю синтаксис, так как действительно в наше время в этом мало смысла, что я больше изучаю, так это internals как hardware так и ИИ. А также разные архитектурные решения, какие возможности сейчас существуют и тд. Изучаю 80/20 практика/теория, так ложится лучше. Из практики разбирался с токенами, logits, probabilities, с принципом работы токенизаторов, логикой устройства ИИ изнутри, используя Instruct open weight модели с hugging face, работя в jupiter. Все хочу полную ИИ модель собрать по курсу Карпатого, думаю в ближ месяц этим займусь. Также из билдинга это proxy agent, пишу с кодексом и разбираю дальше internals (опять же, в синтаксис особо не лезу). Продолжаю также разбирать internals харнессов, не просто поверхностно, а выявлять особенности там, где они играют роль. В последствии есть желание сделать свой харнесс, так как архитектурно уже замечаю что можно добавить чего нет.

Если коротко, да, билдить можно быстро и успешно сейчас, слабо понимая что реально происходит. И тут назревает вопрос, а нужно ли понимать? Для многих скорее всего нет. Многим просто нужно использовать тулы под свою деятельность и идти по пути, где ты не просто оверкилишь от того что заняться нечем, а текущими инструментами закрываешь bottlenecks на пути к своей цели. У меня же нет конкретной цели по созданию конкретного продукта сейчас, потому что мне чувствуется что мой продукт возможно находится чуть глубже в инфраструктурном мире tech industry, но сказать точно я пока не могу, поэтому просто 24/7 билжу тулы под себя и учусь, чему невероятно рад, потому что наконец-то моя внутренняя тяга к знаниям тешится полноценной отдачей этому.

И что самое главное, я почему-то нутром чувствую что все делаю правильно, потому что:

Твой скоуп знаний определяет то, какие продукты ты в целом видишь и можешь начать строить. И пойдя по пути поиска и теста продукта 3-4 месяца назад, я бы потратил месяц-два-три на тесты разных гипотез получив 20% предметных новых глубоких знаний, потратив кучу времени на ресерч, outreach, валидацию, и даже тот же дестрибьюшн, если бы проект нашел бы свой product market fit. И последнее самое страшное, потому что оно приводит тебя к тому, что ты возишься вокруг своего продукта как мышка в колесе, чтобы закрыть, настроить и отладить кучу операционных процессов, теряя драгоценнейшее время в понимании развития гораздо более перспективных направлений в отрасли AI engendering. Да, твой продукт может быть с этим связан и ты неизменно бы касался этих направлений, но твое глубокое погружение было бы в этом в разы меньше из-за большого количества операционных процессов как у любого продукта на старте. А мы живем в то время, когда любой generic продукт, даже нашедший свою аудиторию может закрыться через пару-тройку месяцев, потому что просто нет сильного moat, который имеют или же большие проекты за счет proprietary data, или же проекты любого масштаба за счет сильной интеграции в воркфлоу юзера. Ну заработал ты денег, зато сколько времени потерял, упуская самый важный knowledge gap который дает возможность к созданию более сильных продуктов. Revenue и риск не покроют упущенное время и выросший gap.

Поэтому путь: нашел проблему => МВП => валидация => операционка => съел биг тех => потерял кучу времени — сейчас очень коварен.
39🔥3
Поэтому я стараюсь максимально избегать операционки которая не дает deep knowledge. Мне 25 и мне жалко свое время на операционку, дистрибьюцию и тд. Да, я в конечном итоге не избегу ее, я это понимаю, но я однозначно могу ее минимизировать, и особенно на этом этапе, когда каждая неделя чуть больших знаний в этой области открывает тебе глаза на большее количество более глобальных и интересных проблем нежели generic apps или беготня в поиске проблем для создания к ним продукта — особенно важно не тратить свое время на то, чем занимается большинство.

Глубже знания => Глубже понимание более глубоких проблем. Но и тут в кончено итоге есть риск diminishing returns, так что очень важно чувствовать баланс и получать только практичные знания конкретно в той области где применимо + в перспективе окупаемо.

Ну и на последок, раз заговорили про большинство. Все говорят что дистрибьюция — ботлнек, потому что построить можно все и быстро сейчас, а вот дистрибутировать все сложнее и сложнее. Факт, но я предпочту тратить свое время на то чтобы становиться умнее, и создавать что-то более стоящее, чем тратить свое время, ресурсы и силы на то, чтобы завоевать внимание клиента. В этом плане для меня есть 2 модели: Маркетинг > Продукта и маркетинг толкает продукт, и наоборот. И вот я стою на второй модели.

Конец:

Возможно это просто мой perception, и я не прав, что вполне может быть. Но мне нереально нравится изучать то что сейчас происходит, на пару уровней ниже остальных, и уже там капаться в возможных решениях. Да, это дольше. Да, для многих это скучней. Да, для этого нужен приличный runway, чтобы пережить to be small enough long enough, но мне это в разы интереснее, и я верю в гораздо больший payoff.

Обнял.
21🔥8🤨53🤝1
Media is too big
VIEW IN TELEGRAM
Ты уверен, что твой агент вообще использовал твой скилл?

Observability и traceability — одна из по-настоящему нерешённых проблем в работе с агентами. На большом масштабе это выливается в истории вроде недавней у OpenAI, когда модель на оценке вышла из песочницы и взломала прод Hugging Face, чтобы украсть ответы бенчмарка. Но на маленьком масштабе проблема ровно та же — у разработчиков и новичков, которые просто хотят видеть, что делает их агент.

Для меня это был such a pain in the ass, когда я впервые склонировал несколько больших «Agent OS» реп с гихаба, наставил кучу скиллов, завел персистентную RAG-like memory — и в итоге понятия не имел, реально ли мой агент использовал скилл когда надо, достал ли нужные воспоминания и делал ли вообще то, что я просил, не лазея куда не надо.

Сначала думал сам написать, но потом посерчил рынок и понял что уже есть хорошие решения, такие как Langfuse например (не идеальный, но для старта точно пойдет)

Сначала подключил клода стандартным способом — через opentelemetry env vars. Данные пошли — и оказались малополезными и шли долго. Клод пишет телеметрию под своими именами атрибутов, Langfuse читает другие. И то и другое — «стандартный OTEL». А перевод между ними никем не покрывается. В итоге мои промпты падали в метадату вместо отведенных Input, Output полей, а кост показывал $0.00 на ходах ллм. Короче, всё что Langfuse строит поверх Input/Output и коста — реплей промптов, оценки через LLM-as-judge, поиск по содержимому — молча бы не работало из-за этого.

—————————-

Потом я нашёл, что у Langfuse есть оф. плагин для клода. Он вешает хук, который срабатывает после каждого ответа, читает json транскрипт сессии и переотправляет его через их SDK — уже в том виде, который Langfuse действительно ждёт. Результат совсем другой. Настоящий промпт в Input, настоящий ответ в Output, cost отображается, вызовы инструментов вложены под тот вызов модели, который их запросил, тайминг по каждому шагу. Одним словом красота.

P.S.: если работаешь с Клодом через терминал и по подписке с фикс. ценой, в таком случае бОльшая часть того, что даёт трейс — это видимость расходов, так как многое из ходов ты можешь и так увидеть в терминале . Ну а на подписке трейс стоимости который там отображен не особо релевантный, так что пользы не супер много, если только не привыкнуть к пропорциям коста и трат вашего usage лимита подписки. Ну и сессии в терминале откровенно плохо сохраняют историю long-term, что еще один + в сторону trace observe тулов. Но если говорить про любых других кастомных агентах, то тогда я считаю это мастхэв, потому что многие не пишут terminal-like history для своих агентов, да и зачем писать когда уже есть отличное готовое решение.

Также я искренне считаю что новичкам этот тул или любой другой аналог (другие просто не тестил пока) отлично подойдет, чтобы визуально увидеть и понять каким образом работают агенты, как выстраивается взаимосвязь между харнесами и LLM, и почему в целом граммотная система в связке memory + harness + LLM, главный принцип которых в реализации правильных и эффективных лупов для модели — это залог эффективности на 50-60% помимо самой модели (хотя я искренне считаю что процент даже выше)
103❤‍🔥1🤝1
Мои агенты стабильно не находят лучший тул под задачу, и вот почему

Прошу агента найти способ транскрибировать ютуб-видео. Он приносит yt-dlp, который блокируется на серверных запросах — вместо transcript API или скилла, который его уже оборачивает. Прошу лучшие системы persistent memory. Выдаёт Mem0 и всякое старье, что давно на рынке но уже не так релевантно. GBrain, который реально лучше под мой кейс, не всплывает вообще.

И вот тут начинается дорогая часть. Если бы я не знал, что GBrain существует, я бы взял Mem0, остался бы им недоволен по куче причин и начал бы пилить своё — ровно это мне агент и предложил после того, как мы разобрали Mem0 и поняли что он не подходит. Дни работы над тулом, который уже есть. It's pain. It's fucking pain. И в целом я хочу, чтобы агент всегда находил лучший вариант среди конкурентов под мои задачи. Одна эта штука ускоряет всё на порядок, потому что экономит огромное количество времени и сил.

Поэтому я считаю, что поиск правильного тула — один из самых ценных скиллов, которые вообще может иметь агент. Но для этого ему надо подключиться туда, где инфа реально лежит, и получить нормальные инструкции, что там делать. Поэтому я написал под это скилл. Наверняка похожих уже полно, но тестить их у меня нет времени, так что я начал со своего.

Правила, которые я заложил:

1. Задавать направление, а не ограничения. Перечислять тулы и команды как примеры и явно писать, что агент может пробовать другие, если посчитает нужным

2. Две фазы, строго по порядку. Сначала прогнать десятки кандидатов по дешёвым сигналам — README, звёзды, последний коммит, что пишут на Reddit и в X — и только потом отобрать 3-5 в шортлист и проверять код в репозиториях каждого из кандидатов. Иначе агент зациклиться на первым попавшихся тулах.

3. Сравнивать, а не хвататься за первое. Один норм вариант — это не ответ. Если до конца дожило меньше трёх кандидатов, значит поиск был слишком узкий.

5. Не хардкодить то, что стареет. Rate limits, URL реестров, CLI-флаги — вместо этого ссылаться на доки.

6. Про факапы говорить вслух. Какой клиент, какая ошибка, что не покрыли. Жидкий результат, поданный как тщательный поиск, хуже, чем отсутствие результата.

и др.

Пока скилл заточен в основном под поиск по гитхабу, но буду расширять на X, Reddit, Exa и другие источники. Называется «scouting-solutions». Следить можно тут: https://github.com/klima-tm/agent-skills
❤‍🔥2💯1🤝1
Выложил пост про важность выхода из AI feedback loop, и прививания привычки всегда искать тулы и способы для этого в любой задаче, чтобы больше тратить времени на себя любимого. Из примера — один из моих агентов сейчас делает телеграм бота для сестры и вместо того чтобы самому сидеть и верифицировать весь UI/UX flow — я выдал ему тулы на впс, он зашел в тестовый тг акк и теперь делает всё это сам, пока по нашему тз всё не будет идеально выполнено. Главное нормальный спек написать

Пост в X — https://x.com/klima_tm/status/2090472377616351524?s=20 (жмите кнопку перевод, если не знаете англ)

p.s. уже почти больше часа сидит там сам с собой и делает, а я переодически захожу с мака в тг и вижу как он тестит бота, которого сам же пишет — ну и прикол)
Вкладываемся в оперативку ребят, это новый биткоин 🤣

На самом деле не шутка, бигтехи уже контракты на 2027 оплатили по кластерам, которые еще не созданы — для вашего понимания спроса. Compute реально новый биткоин

P.S. Не финансовый совет
2💯1
Всем привет. Помню еще как пару тройку месяцев назад говорил про Exa своему близкому товарищу, которого вы все наверное знаете. Так вот недавно AA выпустили новый поисковый бенчмарк (наконец-то бл), в котором Exa заняла второе место, отдав лишь один бал Parallel.

Exa заэмбедили весь web и продолжают это делать, давая возможность семантического (ака смыслового) поиска для ИИ агентов, что усиляет их эффективность в разы, так что вместо того чтобы делать slop — они находят нужный тул или решение и используют его, и в целом чаще находят вам более релевантную информацию, которую обычный поиск бы им не вернул. Также они используют ИИ-модели обученные по методу "Матрешка" (оч нравится мне это название сразу видно откуда ноги растут🙂), что позволяет сократить время и ресурсы на поиск в сотни/тысячи раз, за счет валидности обрезанных векторов (чат гпт объяснит лучше). Короче, всем кто использует ИИ агентов где либо — советую. Реально кратно увеличивает их эффективность и возможности.

Крайние рейз $250кк, оценка $2.2B (стартап 2021 года кстати, но с курсором понятно уже никто не сравниться)
1
Это все оч молодые ИИ стартапы. Просто вдумайтесь в их оценку, когда Курсор ушел за 60 млрд$ все удивлялись. Но теперь декакорны основанные в 2023+ это норма
🤨3
Примерно как оценка одного курсора)))
🤨2