AI-Driven Development. Родион Мостовой
5.31K subscribers
122 photos
4 videos
1 file
142 links
Увлекательно рассказываю про AI в разработке, про построение продуктов с LLM под капотом и иногда про .NET.
Связь: @rodion_m_tg
Чат: @ai_driven_chat
Download Telegram
Все лимиты и ресеты для Codex 200$ закончились. Рекорд - расход 2 недельных подписки за сутки (работа над RepoContextBench v2 ведется полным ходом). А Claude медленный, да еще и с лимитированным фейблом. В итоге, взял Грока за 300$ 100$ - говорят, там лимиты почти бесконечные и все очень быстро. Грок за 30$ мне понравился как по качеству, так и по скорости.
Грока я использую в качестве исполнителя внутри OpenCode (возможно, перееду теперь на его нативный харнесс Grok Build) через свой скилл agents-consilium, его вызывает Codex App или Claude как субагента, поэтому получается очень удобно.

Итого, сетап теперь такой:
Планирует Fable или GPT-5.6 Sol high/xhigh, а что вместе. Иногда GPT 5.6 Sol Pro.
Выполняет Grok 4.5 high
Ревьят: Opus 4.8, GPT 5.6 Sol, GLM 5.2 и по итогу Fable. Позже добавлю Kimi K3 в ревьюеры и посмотрим еще на возможности релизной DeepSeek V4 Pro и Qwen 3.8.
Итого 4 подписки: Codex 200$, Claude 100$ (для Fable и ревью), OpenCode 10$ для ревью через китайцев (для работы практически бессмысленная, только нечастые ревью разве что).

Есть еще темная лошадка SWE 1.7 от ребят из Devin - супер быстрый (на Cerebras чипах) и, судя по Frontier Code, с классными результатами. Если кто пробовал - отпишитесь.

Еще, мне регулярно перестает хватать мощностей моего мака на комфортную разработку, поэтому планирую арендовать VMку и делегировать тяжелые задачи агента туда.

Ах да, напоследок - лайфхак. Поскольку ручной сброс кодекс лимитов просто стартует новую неделю - получается, что выгоднее сразу после органического сброса как можно быстрее выжать лимиты, затем сделать ручной сброс, тогда вы за один и тот же помежуток времени сделаете больше работы нагенерите больше кода и, условно, в месячной подписке станет почти 6 полных недельных квот вместо 5-ти (без учета общих сбросах). Почему-то об этом никто не пишет.

@ai_driven
319👍9
Opus 5

Похоже, все-таки придется снова брать Claude 200$...

Для гурманов: Opus 5 System Card. (193 страницы paper!)
🤯8👍4
Аномалии Opus 5 и оптимальный reasoning effort

Если вы используете агентов так активно, что даже 200$ лимитов вам не хватает, ну или просто хотите получать адекватный результат быстрее (иногда в разы), то надо озаботиться выбором оптимального уровня размышления модели. Так вот, из официального анонса это неочевидно, а вот из системной карточки вполне.

И там видно, что в Opus 5 medium effort часто оказывается даже эффективнее, чем Fable high. При цене почти в 3 раза меньше. Видимо, теперь medium будет дефолтным выбором для пятого опуса. А во Frontier Code Opus 5 medium и вовсе показывает результаты существенно лучше, чем xhigh версия (что, конечно, подозрительно, но ОК).

Еще, в системной карточки появились мультиагентные бенчи, и один из них ProgramBench - так вот, там команда из 5-ти агентов достигает того же результат в 2.2 раза быстрее, чем одиночный агент. Привет всем любителям мультиагентных систем.
Похоже, что секцию 8.11 Multi-Agent в принципе есть смысл прочитать вдумчиво.

И любопытный факт - новенький FrontierBench v0.1 (уже третий "фронтир" све бенчмарк) они прогоняли не в родном харнессе, а в mini-SWE-agent. Результатов прогона medium effort нам почему-то в отчете не дают, только xhigh и high.

@ai_driven
👍127
Kimi K3 и ревью моделями разных семейств

Ну как вам новая Kimi K3? Медленно? Если использовать ее не как основную модель, а как еще одно мнение - вполне норм, тем более, что она действительно находит интересное в дополнение к Опусу. Сейчас как раз работаю над очень сложной задачкой по улучшению комплексного и длительного воркфлоу, он должен быть устойчивым к разным сбоям, там всякие outbox'ы, умные фолбеки и другие нетривиальные штуки, в которых нейронки часто ошибаются. Предыдущие агенты полноценно не могли осисить эту задачу - постоянно что-то где-то вылетало. План делали уже по традиции Sol, Fable, Opus и даже Kimi K3 - в комплексных (или исследовательских) задачах, когда много unknown unknowns чем больше хороших и разнообразных моделей - тем лучше. Но даже самый сильный план не всегда гарантия идеального кода, поэтому в таких случаях есть смысл еще и итоговую реализацию дополнительно ревьюить (тем более, что исполнителям иногда свойственно срезать углы). Так вот, конкретно в этом кейсе ревью я прогнал через Opus 5 (medium) и Kimi K3 (max) (на DeepSWE, кстати, у обоих 69%). Результаты на скрине.
Собсна, чье ревью сильнее даже не так важно в данном случае, важнее - кол-во уникальных (не пересекающихся) находок, а их 4 у Kimi и 5 у Opus - т. е. кими дополнила ревью опуса аж 4-мя находками и главное все они оказались релевантны. Однозначно беру в коллекцию ревьюеров. Будем наблюдать дальше.

Кстати, в самых тяжелых случаях все еще можно отправить архив релевантных файлов на ревью в GPT 5.6 Pro. Но тут сразу важный нюанс - если у вас такая задача, что самые мощные модели 2+ раза подряд находят реальные проблемы, то это хороший повод задуматься о том, что, скорее всего, все-таки есть переусложнение, и, вероятно, на нее уже есть готовое и хорошо протестированное решение - возможно, будет дешевле поискать их получше. Ну, либо задача слишком большая и стоило бить ее на меньшие сабтаски.

Про Опус 5: хоть ее все равно все еще приходится направлять и подсказывать (а вы что хотели?), мне моделька нравится - весьма понимающая и не соглашается на все в подряд. А слог ее так вообще шикарен. GPT семейство по традиции общается довольно сухо, у Opus'а же наоборот частенько проскакивают нотки гуманитария, речь богаче и живее - это приятно.

Что касается практической части, то напомню, что ревью я запускаю через скилл agents-consilium - он теперь наблюдаемый и умеет стримить прогресс вызывающей стороне - стало сильно удобнее. А еще, там появилось два совершенно новых режима explore и delegate, про которые я расскажу отдельно.

Итого, текущий джентельменский набор вайб-кодера agentic инженера: Опус/Фейбл/Sol/Kimi K3 - план и интервью, Grok 4.5 (ну или Terra/Luna) - исследование контекста и реализация, и все те же Опус, Фейбл, Sol, K3 код-ревью. Стадию плана лучше дополнять парочкой очень важных скиллов для борьбы со сложностью (FPF, code-that-fits-in-your-head).

Kimi K3 я использую внутри OpenCode через подписку OpenCode Go за 10$/мес (моя рефка с бонусом) и еще держу резерв на Synthetic за 30$ (моя рефка тоже с бонусом).

@ai_driven
2👍144
Мой тест на AGI
🤯15😁6
Агентам не нужен TDD

Дядя Боб говорит, что TDD вообще-то для людей и агентам совсем не обязателен, ведь у агента дела с краткосрочной памятью обстоят куда лучше, чем у людей.
А что нужно агентам по его мнению? Юнит тест, CRAP метрика и мутационное тестирование... Кто-то считает CRAP и делает мутационные тесты? Если первое ещё иногда интересно, то второе довольно спорная техника - если практикуете расскажите.

TDD != тесты
А по поводу TDD (его щас прям любят вайб кодеры тиражировать), то давно понятно, что классический TDD цикл (красный тест > код > зелёный тест > рефакторинг, причем мелкими итерациями) с агентами больше похож на прожигание токенов, чем на что-то полезное. Смысл имеет скорее разнообразные тест кейсы перед реализацией продумывать с агентом (включая интересные техники типа pairwise testing), сохранить их в маркдаун или (по BDD или нет - не принципиально).
Ну и, конечно, одних лишь юнитов недостаточно совсем, они в принципе часто мало чего хорошего дадут проверить просто by design - идеально использовать умную связку из разных видов тестов - по пирамиде тестирования или лучше даже по трофею (статические проверки), ну или на худой конец хотя бы e2e или browser use/computer use.
А когда вайб кодеры говорят про важность TDD часто просто имеют в виду, что нужно тестировать и верифицировать результат - что, конечно, бесспорно. Но Кент Бэк TDD это же не про это, это именно про красный тест > код > зелёный тест. Вот так начинают путаться классические термины с этими нашими вайб кодингами... В общем, если вы ещё используете TDD с агентами - скорее всего, он вам им не нужен.

@ai_driven
1👍24👎10🤔72🎉2
AI-Driven Development. Родион Мостовой
Агентам не нужен TDD Дядя Боб говорит, что TDD вообще-то для людей и агентам совсем не обязателен, ведь у агента дела с краткосрочной памятью обстоят куда лучше, чем у людей. А что нужно агентам по его мнению? Юнит тест, CRAP метрика и мутационное тестирование...…
Какой-то баг с реациями в ТГ случился (навайбкодили опять) и были доступны только дизлайки и сомнения, поэтому мы с дядей Бобом собрали рекордное кол-во дизайков под постом, я еще начал думать, что никто уже не читает такие "длинные" посты до конца. Короче, если вы хотели отреагировать как-то иначе - теперь можно. А еще лучше - подключайтесь к дискусси, тк дебаты разгорелись нехилые в комментариях...
😁16🎉2🤔1🤯1