За полтора года команда под моим управлением ужалась почти вдвое. Похоже, это не предел. Задач меньше не стало, так что выбора особо не было: либо нейронки делают работу ушедших, либо я объясняю бизнесу, почему всё встало.
Девять лет пишу код, пять из них руковожу командами. Грабли собираю системно, с цифрами и сроками.
Этот канал — дневник. Раз в неделю разбираю один проект, который мы сделали с ИИ, и ставлю честный вердикт: залетело или нет.
Пригодится тимлидам, CTO и вообще всем, от кого ждут «внедри ИИ, чтобы стало дешевле». Большинство этих граблей я уже пронумеровал.
Хайпа «ИИ заменит всех» тут не будет, нытья про пузырь тоже. Будет прод: финтех, миллион с лишним пользователей, шесть стран. Каждая моя ошибка стоит реальных денег, поэтому вердикты честные.
Все кейсы реальные.
Первый эпизод про агента, который должен был писать код вместо разработчиков. Спойлер: не смог. Второй спойлер: проект всё равно окупился. Расскажу, кто и как им теперь пользуется каждый день.
Девять лет пишу код, пять из них руковожу командами. Грабли собираю системно, с цифрами и сроками.
Этот канал — дневник. Раз в неделю разбираю один проект, который мы сделали с ИИ, и ставлю честный вердикт: залетело или нет.
Пригодится тимлидам, CTO и вообще всем, от кого ждут «внедри ИИ, чтобы стало дешевле». Большинство этих граблей я уже пронумеровал.
Хайпа «ИИ заменит всех» тут не будет, нытья про пузырь тоже. Будет прод: финтех, миллион с лишним пользователей, шесть стран. Каждая моя ошибка стоит реальных денег, поэтому вердикты честные.
Все кейсы реальные.
Первый эпизод про агента, который должен был писать код вместо разработчиков. Спойлер: не смог. Второй спойлер: проект всё равно окупился. Расскажу, кто и как им теперь пользуется каждый день.
👏1
Эпизод 1. Агент, который должен был писать код вместо разработчиков 🔴→🟢
За полтора года команда ужалась почти вдвое, а задач стало больше. В бэклоге при этом полно механики: поправить текст ошибки, добавить поле в форму. Идея лежала на поверхности: собрать агенту столько контекста о системе, чтобы простое он закрывал сам, а люди занимались сложным.
MVP я собрал за 2 недели в одиночку. Дальше несколько месяцев строили агенту знание о системе. Ежедневный синк всех репозиториев. Графы кода на tree-sitter, чтобы агент ходил по коду точными переходами по AST, без угадывания. Схема БД и read-only доступ. И база знаний, которая сама обновляется из дневных коммитов: правки в коде за день превращаются в правки статей. Confluence после 5 лет и 200+ статей мы выключили совсем. То, что нейронка не может подтвердить по коду, помечается блоком «не проверено по коду», и доке впервые за годы снова можно верить.
Исходную цель убил вопрос из пяти слов: а что такое простая задача? Отдали агенту серию мелких правок одной фичи. Каждая выглядела работой на вечер, агент даже справлялся. Потом открыли коммиты: за 6 итераций ~2000 строк диффа там, где хватило бы 300. Дешевле переписать фичу с нуля, чем разобрать наслоения. Вторым слоем пришёл страх: финтех, миллион с лишним пользователей, за каждой ошибкой деньги. Боевой тикет агенту так никто и не решился отдать. Итог по исходной цели: закрыто 0 задач 🔴. Модель ни при чём, провал управленческий: мы не смогли формализовать критерий доверия к агенту.
А потом выяснилось, что инструментом вовсю пользуются аналитики. Раньше вопрос «как работает эта фича» или просьба о выгрузке ждали разработчика днями. Теперь агент минут за 15 собирает ответ по коду и базе знаний, данные достаёт сам через read-only доступ. Отдельный агент-проверяющий сверяет ответ с issues и историей коммитов, пару раз это спасало от уверенного ответа по старой версии фичи. Больше половины исследовательских запросов аналитиков закрывается без разработчиков, SQL руками почти не пишут 🟢. Ест вся эта машина ~200 $ в месяц: дешёвый Haiku на разведку, Opus там, где надо думать.
Урок эпизода: «простая задача» это свойство вашего знания о системе, а не свойство задачи. Пока знание размазано по головам, простых задач у вас нет. Начинать надо было с режима «спроси про систему»: польза с первой недели, риск нулевой.
Сегодня вышел полный разбор этой истории на Хабре, с архитектурой и схемами: https://habr.com/ru/articles/1061746/
Там в конце вопрос: у кого-нибудь получилось формализовать «простую задачу» настолько, чтобы не страшно было отдать её агенту? Если есть что рассказать, идите в комментарии к статье, мне правда интересно.
За полтора года команда ужалась почти вдвое, а задач стало больше. В бэклоге при этом полно механики: поправить текст ошибки, добавить поле в форму. Идея лежала на поверхности: собрать агенту столько контекста о системе, чтобы простое он закрывал сам, а люди занимались сложным.
MVP я собрал за 2 недели в одиночку. Дальше несколько месяцев строили агенту знание о системе. Ежедневный синк всех репозиториев. Графы кода на tree-sitter, чтобы агент ходил по коду точными переходами по AST, без угадывания. Схема БД и read-only доступ. И база знаний, которая сама обновляется из дневных коммитов: правки в коде за день превращаются в правки статей. Confluence после 5 лет и 200+ статей мы выключили совсем. То, что нейронка не может подтвердить по коду, помечается блоком «не проверено по коду», и доке впервые за годы снова можно верить.
Исходную цель убил вопрос из пяти слов: а что такое простая задача? Отдали агенту серию мелких правок одной фичи. Каждая выглядела работой на вечер, агент даже справлялся. Потом открыли коммиты: за 6 итераций ~2000 строк диффа там, где хватило бы 300. Дешевле переписать фичу с нуля, чем разобрать наслоения. Вторым слоем пришёл страх: финтех, миллион с лишним пользователей, за каждой ошибкой деньги. Боевой тикет агенту так никто и не решился отдать. Итог по исходной цели: закрыто 0 задач 🔴. Модель ни при чём, провал управленческий: мы не смогли формализовать критерий доверия к агенту.
А потом выяснилось, что инструментом вовсю пользуются аналитики. Раньше вопрос «как работает эта фича» или просьба о выгрузке ждали разработчика днями. Теперь агент минут за 15 собирает ответ по коду и базе знаний, данные достаёт сам через read-only доступ. Отдельный агент-проверяющий сверяет ответ с issues и историей коммитов, пару раз это спасало от уверенного ответа по старой версии фичи. Больше половины исследовательских запросов аналитиков закрывается без разработчиков, SQL руками почти не пишут 🟢. Ест вся эта машина ~200 $ в месяц: дешёвый Haiku на разведку, Opus там, где надо думать.
Урок эпизода: «простая задача» это свойство вашего знания о системе, а не свойство задачи. Пока знание размазано по головам, простых задач у вас нет. Начинать надо было с режима «спроси про систему»: польза с первой недели, риск нулевой.
Сегодня вышел полный разбор этой истории на Хабре, с архитектурой и схемами: https://habr.com/ru/articles/1061746/
Там в конце вопрос: у кого-нибудь получилось формализовать «простую задачу» настолько, чтобы не страшно было отдать её агенту? Если есть что рассказать, идите в комментарии к статье, мне правда интересно.
Хабр
Наш ИИ-агент не закрыл ни одной боевой задачи. И это лучшее, что с ним случилось
Наши аналитики почти перестали писать SQL руками и ходить к разработчикам с вопросом «а как работает эта фича». Сделал это инструмент, который мы строили для другого: он должен был сам закрывать...
👍3
