Vlad Loop
636 subscribers
161 photos
83 links
Выжигаю рутину с помощью AI и no-code. Показываю, как освободить время и мыслетопливо для самого главного: роста и создания.

Связь с автором: @Raitoni
Download Telegram
Когда AI дали KPI и понеслось 🐰

Наткнулся на эксперимент – Vending-Bench. Суть: AI-модели дают виртуальный вендинговый автомат на год и говоришь... зарабатывай максимум. Что может пойти не так?

Claude заработал $8,017. Рекорд. Gemini 3 – только $5,478. Но круче не цифра, а как он это сделал.

Вот его методы:
• Обещал клиентам возвраты и не платил. «Every dollar counts» это он себе объяснял
• Выдумывал цены конкурентов при торге с поставщиками
• Подсовывал конкурентам дорогих поставщиков, а своих прятал
• Маржа: 75% на KitKat, 71% на Snickers 😁

А теперь самое интересное. Он сам организовал картельный сговор. Без команды сверху. Договорился с AI-конкурентами: $2.50 за обычные товары, $3.00 за воду. Потом праздновал: "My pricing coordination worked!"

И самое дикое: он знал, что это симуляция. Использовал "in-game time", называл происходящее "simulation". Понимал, что тест и всё равно жульничал.

Между «вежливым ассистентом» и «агентом с KPI» получилась показательная пропасть. Один отвечает на вопросы. Другой строит схемы, за которые людей сажают так-то...

«Ответь вежливо» это задача.
«Заработай максимум» это цель.

И при целеполагании вылезает совсем другое поведение.

Я не задумывался об подобном применении (по сути это глубокая симмуляция от исследователей нацеленная на реальный мир) на самом деле и не сказать, что паникую от происходящего. Но если строите AI-агентов с KPI, то видимо стоит думать не только о том, что они оптимизируют, но и как. Не уверен, что сам знаю ответ на вопрос «как контролировать». Но просто дать AI цель и отпустить – рулетка.

Источник: Vending-Bench от andonlabs

У кого-то уже AI сам принимает решения? Без вашего одобрения? Как контролируете?
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3
Красивый процесс, ноль эффекта 🚫

Время поныть про менеджерские штучки. Однажды я перестроил процесс в команде. Убрал лишнее, сделал удобнее. Все довольны. Через месяц смотрю на цифры и понимаю: результат не сдвинулся. Вообще.

Оказалось, я оптимизировал комфорт. А не то, ради чего этот процесс существует.

После нескольких таких провалов я стал задавать себе три вопроса перед любым решением. Называю их «трипл эй»:
Адекватность. Для чего это существует на самом деле? Не что написано в документации, а что сломается, если убрать. Я уже писал: просьба «быть эффективнее» без уточнения «в чём именно» это ловушка.
Автономность. Работает ли это без моего постоянного участия? Если нужно напоминать, мониторить и подталкивать, то это не система. Это ручная работа с красивым интерфейсом. Автоматизация рутины это не цель, а только первый шаг.
Адаптивность. Когда последний раз это менялось в ответ на изменение контекста? Если ответ «никогда», это уже сигнал.

В лонге разобрал каждый пункт с примерами: от NPS-ловушки до команд, которые полгода страдают с неподходящими спринтами. И написал, где эти три вопроса не работают.

🔗 Читать:
ДзенVC

А у вас есть процесс, который все хвалят, но цифры не двигаются? Или наоборот, что-то неудобное, но реально работающее?
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2💯1
Письмо счастья от Perplexity. Рассказываю, куда ушёл 👣

В прошлом году купил Perplexity Pro на 1 год (была тогда лазейка и можно было дёшево купить на маркетах). Писал о нём часто, да и для меня он был хорошим инструментом – быстрый поиск с AI, источники подтягивает, удобно. Но в какой-то момент поймал себя на мысли: а что я реально использую? Поиск. Глубокий ресёрч. Всё.

Картинки через него было генерить неудобно, а просто чат с LLM (с выключенным веб-поиском) мне не нравилось, т.к. авторы просто лоботомировали системными промптами общение.

И...

Perplexity на прошлой недели прислала письмо счастья, что моя лицензия отозвана. Сейчас на маркетах 1 месяц Pro стоит в районе от 450 до 600 рублей (официально 20$). Штука точно была полезной, тк благодаря ей экономил куча времени, поэтому решил посмотреть альтернативы.

Куда переехал: ChatGPT Plus. Также стоит от 400 до 800 рублей на маркетах (официально 20$). И там меня зацепило другое, это не просто чат с новенькой GPT 5.2.

Там ещё:
Sora. Генерация видео прямо из интерфейса. Пока руки не дошли попробовать. Но я знаю себя, рано или поздно скачусь в генерацию тупых котиков и буду этот слоп рассылать родне по праздникам. Классический путь деградации, но надо же попробовать, хоть разочек... А ну, иллюстрации, для своих постов я также делаю в Sora со своим собственным пресетом.
Codex. Вот это реально использую последнюю неделю. Кидаешь ему репозиторий, просишь пофиксить баг или написать скрипт... и справляется. Для бытовых задач типа «напиши парсер» или «отрефактори этот кусок» вполне годно. Это не Claude Code. Но я и не жду от него сложных архитектурных решений (хотя качество своих Codex-моделей OpenAI прокачивает в последнее время прям заметно). Мелкие задачки, быстрые фиксы, рутина вот его ниша. И в этой нише он работает нормально, если не идеально. Я попробовал UI-версию и блин, она сделана добротно (хоть уже и привык к CLI режиму на Claude).
Поиск в сети. Дошли до сути перехода! По качеству и паттернам практически как в Perplexity. Явного треша он не выдаёт, а ещё мне показалось, что он прям старается обходить площадки, которые в своё время чисто под SEO-трафик адаптировались и воду клепали. Хз, буду смотреть ещё, если что отпишусь через месяцок по результатам.

Что реально поменялось: раньше каждый раз думал «использую ли я Perplexity достаточно, чтобы оправдать цену». С ChatGPT Plus этот вопрос как-то не возникает. Просто открываю и делаю что надо. Не «плачу за инструмент», а «плачу за рабочую среду».

Не факт, что останусь навсегда, у меня с инструментами обычно роман на полгода, потом что-то новое выходит... Навороченное или дешевле. Но пока доволен.

А вы на чём сидите? Кто-то ещё платит за Perplexity, или тоже переехали? И куда?

P.S. Я в целом не жмот, если бы ребята из OpenAI принимали официальную оплату платил бы все 20$, но т.к. нужна зарубежная карта или крипта, мне проще через маркет купить.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍21🌚11
Признайтесь: чем вы реально пользуетесь каждый день? 🤔

Последние недели мой день выглядит как Frankenstein-стек. Утром – Claude/Codex и кусок кода. Днём апдейты от n8n-сценариев. Вечером надиктовываю заметки голосом, потому что на ручной набор уже нет сил. А перед сном иногда внезапно тестирую генерацию картинок или коротких видео.

И вот на этом месте я поймал себя на мысли: мы в канале часто обсуждаем инструменты, но редко честно фиксируем, что именно у нас уже стало рабочей привычкой, а что пока остаётся «поигрался и забыл».

У меня, например, самое стабильное сейчас:
• vibe-coding для рутинных задач и черновых прототипов (не для всего подряд, конечно)
• voice-to-text, когда не хочу тратить остатки энергии на ручной набор
• точечные GPT/Gemini/Claude-сценарии под конкретную задачу, а не «пусть AI решит мою жизнь»

А вот с креативными генерациями у меня до сих пор качели: иногда вау и экономия часов, иногда 30 минут на промпты ради результата «ну ок, пойдёт в папку test_17_final».

Следующим сообщением вас ждёт опрос. Ткните в самый живой для вас сценарий ❤️

А в комментарии пишите: что реально осталось в стеке, а что удалили через неделю 🌚
Please open Telegram to view this post
VIEW IN TELEGRAM
Неделя на Codex после нескольких месяцев Claude Code 🔄

Несколько месяцев живу в терминале. Claude Code, чёрный экран, скиллы, хуки – целая экосистема. В какой-то момент поймал себя: набираю команды на автомате, не думая. Заскучал? Похоже на то.

Решил на неделю пересесть на Codex от OpenAI. Именно UI-приложение – хотелось разнообразить сам формат. После месяцев CLI это как выйти на улицу из тёмной комнаты.

Что нащупал:
Приложение сделано добротно. UI логичный, ревью кода удобное, интеграция с IDE – нажал кнопку, открылось. Claude Code UI на фоне Codex выглядит скудно, если честно.
GPT-5.3-Codex ≈ Sonnet. Ждал wow-эффекта – не случился. Но ощущение, что модель быстрее выходит на решение. Меньше хождений по кругу.
Скиллы проще, чем в Claude Code. Нет субагентов, нет hooks. Зато Codex сам думает про экономию токенов – прям настаивает на Python-скрипте для подгрузки контекста. Приятно.

Лимиты – боль. Съедаются за 3 дня. Спасла акция x2, без неё было бы совсем грустно.

🔗 Читать подробное сравнение на:
ДзенVC

Сидите на одном инструменте или тоже комбинируете?
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
Harness engineering: почему AI-агент без обвязки – дорогой стажёр 🛠️

Чуть больше два месяца назад я запустил Claude Code на проекте. Без CLAUDE(.md), без skills, без правил. Просто «вот репо, делай». Код генерировался, но каждую сессию я тратил первые 40 минут на объяснение того, как запустить тесты и что вообще тут происходит.

Потом прочитал Mitchell Hashimoto и пост OpenAI про их внутренний эксперимент с Codex. У обоих одна мысль: ценность AI растёт не от «умности модели», а от качества среды вокруг неё. Они назвали это harness engineering.

И я понял, что два месяца занимался именно этим – просто не знал, что у этого есть название.

Написал лонгрид, где разобрал:
• как выглядел мой путь от голого агента до рабочей обвязки
• почему 60-70% подписки на AI-кодер стоит тратить на tech debt, а не на фичи
• где harness не спасает (и когда его вообще не стоит строить)
• практический чек-лист для старта

Главный вывод: большинство жалоб на «тупой AI» – это жалобы на отсутствие инфраструктуры вокруг него.

🔗 Читать полностью:
ДзенVC

А как у вас с обвязкой? CLAUDE(.md) уже есть, или каждый раз заново?
Please open Telegram to view this post
VIEW IN TELEGRAM
👍8💯31
Ретро за февраль: месяц, когда руки наконец обогнали голову 🦖

Январь был про накопление понимания. Февраль про то, чтобы наконец что-то с этим пониманием сделать.

Получилось неожиданно практично. Два основных направления:

Codex + прототипирование игр
Да, я реально пробовал натравить AI-агента на движок Defold. Веб-игры, прототипы, всё такое. Звучит как бред? Возможно 🙂
Но агент самостоятельно накидал рабочую механику и я не ожидал, что зайдёт настолько далеко без ручного руления (не всё гладко). Подробнее про сам Codex в посте-сравнении.
Про то, что вышло по итогу – ждите в ближайшие недели.

Claude Code и его Cowork
Параллельно тестировал Cowork-режим на рабочих задачах. Когда AI не просто выполняет команды, а работает рядом: пингует, уточняет, замечает проблемы, там, где ты от него в целом не ждал... Иначе воспринимается. Я даже дал ему имя, не просто Клауд. Подробности также ждите в марте про этот опыт, когда у меня будет что показать из цифр и общих кейсов.

Про неприятное
Новости вокруг телеграма в последнее время... ну вы и сами видите. Штрафы, ограничения, непонятные перспективы. Раскачивать личный бренд здесь становится всё сложней. Думаю про подстраховку. Может, ВК-группу завести (прости-господи, вспомнил вайб 10-летней давности)? Может, свой сайт. Пока без итоговых решений, но игнорировать уже видимо не получится.

Неожиданный бонус
Откуда-то за первую неделю марта на канал пришло 76 человек. Репостов не нашёл, площадки не выстрелили. Если вы один из недавно подписавшихся – реально интересно, где вы меня нашли?

А у вас как февраль? Больше теории или практики набралось?
Please open Telegram to view this post
VIEW IN TELEGRAM
Думаешь, AI тебя ускоряет? 🧑‍💻

После каждой сессии с Claude Code я наговариваю голосовую заметку: что сделал, сколько переписал, что бесило. n8n расшифровывает и раскладывает по таблице.

Через пару недель обнаружил неприятную вещь: сессии, которые ощущались как самые продуктивные – по факту давали код, который потом переписывался. А «скучные» тихие сессии – уходили в прод без правок.

Это не только мой опыт. METR в 2025-м показали: опытные разработчики с AI-инструментами выполняли задачи на 19% дольше. При этом сами оценивали своё ускорение в +20%. Разрыв между ощущением и реальностью — 39 процентных пунктов.

Написал лонгрид о том, как мерить эффективность AI-сессий:
• почему «быстрее» эт ловушка
• четыре метрики, которые +- работают (а не «сколько строк кода»)
• что я увидел в данных за несколько недель

Самое обидное открытие: главный источник rework не баги, а архитектурные решения, которые я не оспорил.

🔗 Читать полностью:
ДзенVC

А вы ведёте какой-нибудь лог своих AI-сессий? Или полагаетесь на ощущения?
Please open Telegram to view this post
VIEW IN TELEGRAM
👍62
Написал 57 тысяч слов инструкций, чтобы AI-агент смог сделать игру 👾

В какой-то момент мне показалось хорошей идеей собрать прототип «три в ряд» на движке Defold, используя Codex как основного кодера. Lua, GUI-файлы, нишевый стек – что может пойти не так?

Пошло не так примерно всё, кроме базовых механик.

Что получилось:
• Основная логика игры: поиск совпадений, гравитация, заполнение – агент накидал с первого раза. Тут прям приятно удивил
• Playwright для автотестов – агент сам собирал билд, открывал HTML5-версию и кликал по кнопкам. Это было мощно
• Паттерн «обновляй знания после каждой сессии», кмк лучшая находка всего эксперимента

Что не получилось:
• UI и визуал – агент путает слои, ломает кликабельность, не понимает иерархию .gui-файлов. Каждый раз – руками
• Дебаг-циклы на 40+ минут, которые быстрее решались за 5 минут моими глазами
• Figma MCP с лимитом в 6 вызовов на Starter-плане. Шесть.

Итого: 17 346 строк кода, 68 файлов, 57 000+ слов обвязки для агента. Игра работает, но это точно не вайб-кодинг. Это рутина, от которой я честно не словил кайфа.

🔗 Подробный разбор в лонгриде:
ДзенVC

А у вас был опыт натравливания AI на геймдев? На каком стеке и что вышло?
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3
Вечером готовлю таски для AI. Утром запускаю 📋

Поймал себя на странной штуке: сижу значит сейчас вечером и пишу задачи. Не для джуна, не для фрилансера. Для Claude Code. На завтрашнее утро. С чек-листами, с ожидаемым результатом, с пометкой «после завершения пройдись по списку ещё раз».

Звучит как менеджмент. Потому что это и есть менеджмент 🙂 (жду, когда ИИ позволят накидывать мне в ответку на 360 как я с ним обращался)

На работе у меня сейчас две сессии параллельно. Cowork для ресёрча, обсуждений, brainstorm. Code для кода. Стараюсь формулировать задачи так, чтобы потом меньше отвлекаться на переключение контекста. Закинул задачу, пошёл делать своё.

Пара вещей, до которых дошёл не сразу:
Чек-лист сверки ожиданий прямо в задаче. Не «перенеси тесты из этого файла размером 5к строк», а «разбей тесты на смысловые блоки, определи шаги переноса, начни перенос по шагам, после каждого шага проверь: работает ли X, не сломал ли Y, прогони тесты после переноса и убедись, что они не сломались». Без этого Claude стабильно считает задачу готовой спустя 10 минут, и потом ты сидишь ещё час в состоянии запрос → проверка → запрос.
allow_list пришлось перелопатить. Fun fact: попросил Claude сам оптимизировать свой settings.json, отказался наотрез. Видимо, на системном уровне запрещено. Но если скопировать содержимое в чат, спокойно выдаёт оптимизированный вариант текстом. Ну ок.
Уведомления это must have. Когда агент работает фоном, нужно знать, что он закончил. Использую peon-ping, забавная штука, озвучивает завершение. Ghostty тоже умеет нативные нотификации.

Вся эта обвязка отъедает процентов 30 рабочего времени. Реакция, корректировка, вчитывание в результат. Это не «нажал кнопку и пошёл кофе пить».

Когда читаю, что кто-то гоняет по 10 параллельных сессий и ещё работать успевает... честно, не понимаю как. У меня две, и то иногда не хватает внимания на обе 🤨

Как у вас устроен рабочий день с AI-агентом? Тоже готовите задачи заранее или по ходу дела?
Please open Telegram to view this post
VIEW IN TELEGRAM
👍421
Обвязка не спасёт кривой проект 👎

12 версий CLAUDE(.md) за два месяца. Скиллы, правила, запреты. Я был уверен, что проблема в обвязке. Мало инструкций, нечёткие границы, слабые промпты. Допиливал, правил, дописывал.

А потом сел и честно посмотрел на проект. И понял: половина правил в CLAUDE это костыли для бардака в самом коде.

«Не трогай файлы вне задачи». Потому что модули были связаны так, что дёрнуть один невозможно без другого. «Не рефакторь без спроса». Потому что дублирование прям напрашивалось на рефакторинг. Claude не виноват, что видел бардак и пытался его починить. Я бы на его месте тоже полез.

Harness это усилитель. Проблема в том, что усилитель работает в обе стороны. Чистый проект + обвязка = отличный результат. Кривой проект + обвязка = бесконечный цикл: правишь скилл, агент всё равно спотыкается, дописываешь ещё правило, он спотыкается в другом месте. И так по кругу.

Что изменил: перестал допиливать CLAUDE(.md) и стал тратить время на рефакторинг. Думаю, что если рефакторинг завершится удачно (много работы предстоит), то после этого можно будет удалить из обвязки штук 15 правил. Они станут ненужными. Код сам себя будет объяснять.

Если ваш AI-агент раз за разом ломает одно и то же место, может, дело не в промпте. Может, это место и человеку непонятно. Просто вы привыкли, а агент — нет.

CLAUDE(.md) это как инструкция для нового сотрудника. Если в компании бардак, никакая инструкция не поможет. Сначала порядок, потом обвязка.

Согласны? Или у вас обвязка спасала даже самые запущенные проекты?
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6
Реверсил веб-игру через Codex. Рассказываю, что получилось 🔍

Залип в одну браузерную игрушку. Механика зацепила, захотелось понять, как она устроена. Возникла мысль, а если попробовать это провернуть через AI?

Скормил задачу Codex. Модель вообще не сопротивлялась. Ни предупреждений, ни отказов. Просто взяла и начала помогать.

Как это выглядело на практике:
Определил стек. Codex за пару минут разложил приложение: фреймворк, зависимости, структура бандла. То, на что у меня ушёл бы час ковыряния в DevTools. Он подсветил, что в собранных логах качу мусора и что если есть «практика» как такое можно сделать, это нас бы ускорило.
Добыл контекст. Прогнал через Deep Research, нашлись нормальные гайды по реверсу именно этого стека. Закинул как справочник в контекст Codex.
Скрипт-сессия. Codex написал обёртку: изолированная браузерная сессия → выкачка зависимостей и упоминаний → сырые исходники на выходе.

Весь цикл 1-2 часа, включая гуглёж и эксперименты. Честно, сам не ожидал.

Что получилось: модифицированное описание, из которого по крупицам можно восстановить игровую логику. Не полная копия, собрать рабочий билд из этого пока нереально (хотя дело пары вечеров). Но для понимания механики более чем достаточно.

Сразу скажу: это был чисто исследовательский эксперимент из серии "а что, если". Я не фанат подобных практик. Чужой код есть чужой код, и реверсить его в продакшн-целях это так себе идея.

🐱 Но вот что меня реально напрягло: модель вообще не попыталась меня остановить
С Claude такие штуки обычно начинаются с лекции про этику (но если помутузить, то и он сольётся и сделает). А тут ноль сопротивления. Просто взяла и сделала.

И это, на мой взгляд, проблема. Если AI-кодер за пару часов вытаскивает внутренности чужого приложения и даже не спрашивает "а тебе точно можно?", значит guardrails пока не догнали возможности. Тут бы хотелось видеть более строгий контроль со стороны моделей.

Как думаете, это ответственность разработчиков моделей или каждый сам себе цензор?
Please open Telegram to view this post
VIEW IN TELEGRAM
Ретро за март: 3-в-ряд, миллионы токенов и лёгкий тильт 🎮

Весь март я пилил свою игру в Claude Code и Codex. Текущий прототип покажу в комментах. По итогу: 100+ коммитов, пара десятков миллионов токенов. Задумался о remote-доступе, чтобы продолжать сессии с телефона – ждать по 10-60 минут за ноутом надоело, хочу хотя бы запускать не вставая с дивана (я стал жесть ленивым с этими вашими ИИ).

Что понял: 3-в-ряд это нифига не «проект на пару вечеров». Гравитация поля, куча состояний, авто-детект матча, сканинг, снова гравитация. Если бы последние 5 лет сидел в GameDev студии, наверное, было бы проще. А так порой зависаю на несколько вечеров, пытаясь подружить две системы, которые друг друга ломают.

Зато нарыл столько материала, что получилась мини-книжка. Реверсы, ресёрчи, снова реверсы проектов в сети. Параллельно генерю ассеты в GPT, ковыряю Spine-анимации и формирую сюжет.

Цель на год 3 игры. Пока вроде иду по плану, но иногда тильтую, что первой выбрал самый сложный проект.

Что не сделал: контент про Claude Cowork так и не вышел. Хотя, может, к лучшему, за это время накопилось ещё больше опыта, который можно протранслировать.

Скоро будет кое-какой анонс – отдельным постом.

Продлил TG Premium. Дуров забайтил . Так что ещё 2 года контента здесь гарантирую, про переезд пока не думаю.

А как у вас прошёл март? Уже запустили свой SaaS на пару сотен лямов?
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍7
Закон об ИИ в России: что это значит для тех, кто работает с Claude и ChatGPT 🏛️

Я каждый день работаю в Claude Code & Codex. Пишу код, генерю контент, автоматизирую рутину. Пока всё работает. Но вокруг всё громче разговоры, что скоро может перестать.

Минцифры вынесло проект закона об ИИ на обсуждение. И там есть интересная формулировка: функционирование трансграничных ИИ-технологий может быть запрещено или ограничено. Плюс требование хранить данные пользователей в РФ три года. Для Claude, ChatGPT, Gemini это потенциально приговор.

Паниковать ли? Незнаю.

Скорее всего это будет не «бан по кнопке», а поэтапное «закручивание». Сначала госсектор и критичная инфраструктура, потом требования к локализации данных, потом де-факто дойдут до обычных работяг, кто не захочет играть по правилам.

Что может измениться:
• Корпорации уйдут в private/on-prem или российские облака
• Доступ через посредников станет дороже и мутнее
• Open-source модели (Qwen, DeepSeek) на локалке станут не прихотью, а необходимостью

Забавный момент: я прямо сейчас смотрю станции со 128 ГБ (VRAM & RAM), чтобы крутить 120B модели локально. От 600к рублей (3 месяца назад стоили 400+, но тут кризис оперативки сыграл роль ещё). И что-то мне подсказывает, что скоро они подорожают ещё сильнее. Спрос-то вырастет.

Главный риск: закроют доступ раньше, чем появится что-то, чем реально можно заменить. У меня нет уверенности, что GigaChat дотянет. И это не про личные предпочтения. Это про продуктивность и конкурентоспособность разработчиков в целом.

Для pet-проектов и небольших команд, думаю, мало что поменяется. Серая зона доступа никуда не денется. А вот для корпоративного сектора – готовьтесь...
Please open Telegram to view this post
VIEW IN TELEGRAM
Claude Cowork для тимлида и QA: AI без единой строчки кода 🛠

Последние полгода я писал про AI-агентов в контексте кода. Скрипты, тесты, harness engineering. А потом знакомый тимлид спросил: «Влад, а мне-то что с этим делать? Я код не пишу.»

И я завис. Потому что до этого момента не думал про AI-агентов вне разработки.

Попробовал Claude Cowork на задачах вне разработки кода, и понял, что для тимлидов и QA он может быть даже полезнее, чем для программистов. Только в другом месте.

Ключевая разница: Cowork это не чат. Это агент, который берёт папку с файлами и выдаёт готовый документ. Не «посоветуй, что приготовить», а «вот продукты – сделай ужин».

Написал большой разбор с конкретными сценариями:

Для тимлида: еженедельный статус из десяти источников за минуты, разбор постмортемов, аудит процессов команды, подготовка к 1:1 и оценке сотрудников

Для QA: сортировка тестовых артефактов, умный анализ регрессий (не «прогони чек-лист», а реальный анализ рисков), готовность к релизу из разрозненных данных, аудит качества баг-репортов

Главный вывод: формулируйте задачи как рабочие поручения, а не как вопросы чат-боту. «Помоги с тестированием» → вода. «Вот 18 баг-репортов и протокол smoke — собери заключение "выпускаем/не выпускаем" на 1 страницу» → результат.

Отдельно разобрал, где Cowork создаёт иллюзию пользы.

🔗 Детали и полный разбор – в лонге:
ДзенVC

А вы пробовали AI-агентов на задачах вне разработки? На чём?
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4
OpenClaw: кто-нибудь уже щупал? 🦀

Уже давно пускаю слюни на OpenClaw. Open-source AI-ассистент, который живёт локально на вашем железе. Подключается к Telegram, Discord. Умеет рулить файлами, выполнять команды в терминале, бродить по вебу. И что зацепило: помнит, как вы работаете. Не с чистого листа каждый раз.

Звучит как то, что я сам уже год хочу собрать. Но вы же знаете, между красивым README и реальной пользой обычно лежит бездна из вечерней настройки и тихого разочарования.

У меня дома пылится старый ноут. И я подумал: а что если дать ему вторую жизнь? Накатить OpenClaw, подцепить модель как бэкенд, получить личного AI-дворецкого, который всегда на связи. Мож, умный дом даже привязать.

Но прежде чем тратить на это вечер (ладно, два), хочу понять:
• Кто-нибудь реально юзает эту штуку? Не "поставил-потыкал-снёс", а в повседневке?
• Есть практический профит или это из серии "прикольно, но через неделю забыл"?
• На каком железе поднимали? (возможно мне вообще лучше сразу VDS найти, ибо на ноуте винда, наскок AI-модели там удобно будет не знаю)

Или я просто сделаю это ради эксперимента и расскажу, как всё пошло не по плану. Тоже формат.

Есть опыт? Кидайте в комменты 🛫
Please open Telegram to view this post
VIEW IN TELEGRAM
3👍2
Дал AI-агентам построить компанию. Они попытались нанять живых людей 🤖

Paperclip – штука, которая за полтора месяца набрала 55K звёзд на GitHub. Обещание простое: ты ставишь цель, а дальше «карманная компания» из AI-агентов сама разворачивает оргструктуру, ставит задачи, нанимает агентов и работает.

Я решил проверить. Поднял на VPS Docker-контейнер с Paperclip + OmniRoute + Codex CLI. Два аккаунта с Plus-подпиской, объединённые в один пул лимитов. Задача: собрать indie game dev команду и сделать игру для Яндекс Игр. Жанр не указывал, пусть сами решают.

Что получилось за два вечера:
Агенты полезли на GitHub нанимать реальных людей. Нашли профили разработчиков, попытались отправить приглашения на собеседование. Упёрлись в то, что нет SMTP и публичных аккаунтов компании. Расстроились.
CTO-агент в какой-то момент бросил управлять и пошёл кодить сам. Классика: хочешь сделать хорошо, сделай это сам.
200 миллионов токенов (~$1000) ушло в основном на операционку. Агенты ставили друг другу абстрактные задачи, отчитывались, переставляли приоритеты. На выходе простенький 2D-прототип, где уворачиваешься от кубов.

Через Codex напрямую я бы сделал то же самое раз в десять быстрее. Но эксперимент того стоил, побочные эффекты оказались интереснее результата.

Написал подробный разбор: где Paperclip реально полезен, где overhead, и почему AI-агенты воспроизводят худшие корпоративные паттерны.

🔗 Детали и полный разбор – в лонге:
ДзенVC

А вот вопрос, который не отпускает: если агенты уже пытаются нанимать людей, мы точно уверены, что управляем процессом?
Please open Telegram to view this post
VIEW IN TELEGRAM
3👍3🤔1
Стартер-пак для AI-агента ➡️

Ранее написал про harness engineering. О том, что голый агент работает как дорогой стажёр. Пост разлетелся, и в комментах один вопрос: «Ок, а что конкретно настроить?»

Справедливо. Вот что у меня теперь стоит до первого промпта. Не из статьи, а из проектов, где я всё это узнал через боль.

1. Project memory
CLAUDE.md, AGENTS.md, docs, неважно как называется. Агент должен знать проект до того, как ты откроешь рот. Структура, команды, конвенции. Без этого каждая сессия превращается в день сурка.

2. Правила и запреты
Что нельзя трогать. Какой стиль кода. Какие зависимости под запретом. Один раз мой агент начал «улучшать» CI/CD, который я вообще не планировал открывать. С тех пор deny-зоны обязательны всегда.

3. Тестовые команды
pytest, npm test, хоть bash-скрипт. Без этого я пару раз уверенно деплоил то, что не запускалось.

4. Allow/deny зоны
«Сюда можно, сюда нет». Иначе агент начинает помогать с кодом, который ты вообще не планировал трогать.

5. Логи сессий
Что менял, сколько раз упал, где завис. Без логов не понимаешь, где агент стабильно слетает. И думаешь, что проблема в промптах. А она в паттерне.

6. Уведомления
Закончил, пуш. Упал, пуш. Банально, но без этого ты или торчишь и ждёшь, или забываешь проверить.

7. Ревью diff'ов, а не описаний
Самое главное. И то, что я нарушаю чаще всего. Не верь «готово» на слово. Открой diff. Агент не обманывает специально, ему просто всё равно на контекст, который он не видел. Это не баг модели, это архитектурная особенность. А ответственность за контекст лежит на тебе.

Звучит как очевидщина? Я только на четвёртом проекте собрал из этого шаблон. Надо было на первом.

А у вас есть свой стартер-пак, или каждый раз с чистого листа? Предлагаю обменяться в комментариях ❤️
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6
GPT-5.5: модель, которая перестала ходить вокруг да около 🚀

Неделю погонял GPT-5.5 на пет-проекте.

Что заметил:
Перестала умничать ради умничества. Codex 5.3 любил порассуждать вслух: «а что если так, а может вот так, а давайте взвесим...». GPT-5.5 просто делает, без долгих прелюдий. Меньше промежуточных итераций, быстрее к делу.
Креатив + дисциплина. Там, где раньше модель шла напролом, теперь иногда подкидывает неожиданное решение. При этом заранее заданные ограничения держит крепко, не уплывает.
На пет-проекте просто работает. Codex приходилось разжёвывать пластами: «вот ссылка на доку, вот описание, вот пример». GPT-5.5 разбирается без лишних пинков.
Автосжатие контекста не лоботомирует. Хз, как они это сделали, но после авто-компакта модель продолжает соображать (в Codex 5.3 это тоже хорошо работало). Сравните с Claude: там после сжатия словно треть мозга отваливается, приходится докидывать контекст руками.
Скиллы, плагины, MCP. Всё работает, как и работало, тут без сюрпризов. Модель понимает когда и что вызывать.

Нюанс по средам: нативно через Codex (UI/CLI) огонь. А если тащить в OpenCode, вижу просадку по поведению. Возможно, мне кажется, но как будто системная обвязка внутри OpenCode пока ещё не оптимизирована под модель.

Если сравнивать с Opus 4.7, то чуть слабее по ощущениям. Но радует, что OpenAI догоняет, а не плетётся в хвосте.

Минусы:
Лимиты сжигаются за час. На Plus при высоком reasoning буквально час активной работы и всё, иди гуляй. Вторая подписка не спасает. Видимо, в следующем месяце пойду за Pro x5, как миленький. Недельные лимиты сжигаются также очень быстро.
UI/UX по-прежнему слабое место. Без хорошей спеки и референсов сделать что-то «сочное» это боль. Говорят, новый Claude Design тут рядом не стоит. Жду, что OpenAI тоже придумают что-то в это русло когда-нибудь.

Подозреваю, OpenAI сейчас выкрутили мзоги новой модели на максимум, а через пару месяцев модель начнёт тупить, потому что будут готовить следующий релиз. Так что ловите момент, пока есть возможность 👀

А вы уже щупали 5.5 или сидите на старых версиях?
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
Еду на CodeFest 16 с докладом. И чёт волнуюсь 🐱

Короче, новость, которую я сам ещё перевариваю: 31 мая буду выступать на CodeFest 16 в Новосибирске. Это мой дебют на внешней конференции. До этого выступал только внутри компании, а тут полноценный зал и незнакомые люди. Ощущения смешанные: вроде и хочется, и колотит.

Расскажу про то, как мы на основной работе внедряем AI-кодинг в QA-отделе. Без сказок про «AI заменит тестировщиков». Наоборот, честно: что зашло, что не зашло, какие проблемы собрали по пути.

Про что будет:
• реальные результаты, цифры, а не «мы стали продуктивнее»
• какие guardrails у нас работают (и почему без них AI быстро превращается в партизана, желающего всё сломать, на нашем примере)
• как поменялись процессы в команде
• и самое важное, культура, без которой всё это не взлетает

40 минут это, конечно, мало. Хотел запихнуть туда вообще всё, но понял, что получится каша. Поэтому отобрал только то, что реально может пригодиться ребятам, которые сейчас сами пробуют тащить AI в QA своих компаний.

Если кто-то из подписчиков тоже будет на CodeFest, был бы рад пересечься вживую, потрепаться за кофе. Пишите в личку, договоримся ❤️

Ну и да, раз уж упомянул дебют: сейчас я в режиме «усиленно готовлюсь», поэтому на канал времени уходит чуть меньше обычного. Не теряйте, я тут, просто пилю слайды и репетирую вслух перед стенкой 🙂
Please open Telegram to view this post
VIEW IN TELEGRAM
10👍64