AI-Driven Development. Родион Мостовой
5.31K subscribers
122 photos
4 videos
1 file
142 links
Увлекательно рассказываю про AI в разработке, про построение продуктов с LLM под капотом и иногда про .NET.
Связь: @rodion_m_tg
Чат: @ai_driven_chat
Download Telegram
Хорошие замечания от Паши
Forwarded from Pavel Zloi
Хорошо, что я решил не спешить с перетестом GigaChat 3.5 432B, а дождался разбора (от Родиона @ai_driven) поддержки агентности этой модели, если кратенько, то я в целом чего-то подобного и ожидал, модель оказалась слабее GPT-OSS-120B.

Моё предложение для спецов из Сбера как собрать датасет чтобы сделать модель лучше:
1. обновить уже наконец линейку сберовских моделей доступных по API, а то GigaChat 2 морально устарела во всём, плюс не только ваши модели, добавьте все какие хотите дистилить, ту же gpt-oss-120b и скажем kimi k2.7
2. добавить специальный ДЕШЁВЫЙ тариф для агентов работающих через API
3. запустить рекламу про домашнего агента, скажем на примере OpenClaw, ну или скажем моего Coddy Agent ;)
4. поощрять юзеров которые пользуются агентом через ваше API плюшками, скидками на услуги, повышенной ставкой по вкладу и так далее, вы это всё умеете
5. собирать логи работы с апишкой
6. обучить уже наконец крутую агентную модель и зарелизить её в OpenSource

UPD.
7. сменить релизную политику, к моменту AI Journey в сентябре конкуренты выпустят десяток новых моделей и ваша "четвёрка" опять окажется слабее аналогов.

UPD2.
8. СРАЗУ добавлять новые модели на своё API после релиза, веса это конечно хорошо, но что толку от них если большинство не сможет попробовать модель без железа?
👍19👎1
Начали доклады на AI митапе в Береке банке - присоединяйтесь!
Чуть позже появится запись.

Ссылка в комменте
👍18👎1
This media is not supported in your browser
VIEW IN TELEGRAM
Мне нужен такой робот)) Кто знает где взять?)
😁443
Forwarded from .NET epeshk blog
Claude Fable 5 написал GC для .NET на C#

Если точнее, модель довела до ума проект по написанию managed GC от Kevin Gosse. На некоторых бенчмарках, AI сгенерированный нейронкой GC не уступает в производительности оригинальному

neuecc с помощью Fable 5 ускорил WriteInt в MessagePack. Вместо того, чтобы просить AI ускорить код и make no mistakes применили итеративный подход. В промпт загружались C# исходник и его disassembly после JIT-компиляции + результаты бенчмарков. Модель анализировала ассемблерные инструкции и шаг за шагом подгоняла исходный C# код. Результат — ускорение в 4 раза

Anthropic купили bun — Javascript рантайм, на котором работает Claude Code. Сразу после покупки Fable 5 переписал bun с Zig на Rust за 11 дней, потратив на это $165K токенов

====

Нейронки эволюционировали и теперь успешно пишут не только веб на реакте, но и низкоуровневый код. Масштабные проекты и сложные переписывания архитектуры теперь реализуемы за пару недель. Единственное ограничение — бюджет на токены.

Языку Zig не повезло. ИИ просто исключил его из цепочки, отдав предпочтение более надежному Rust. Похожая участь досталась C# NativeAOT, когда порт компилятора TypeScript сделали на Go.

Можно считать, что ценность стека технологий == ценности проектов, которые на нём написаны. И теперь технологии без прочной экосистемы популярных продуктов будут быстро вытесняться нейросетями в пользу мейнстрима

@epeshkblog
😁5🤔5
Стрим: улучшение агентов через DSPy

Ну что, возобновляем сезон стримов.
Есть такая чудесная штука DSPy - инструмент этот позволяет агентов улучшать и LLM-пайплайны в автоматизированном режиме. А качество мелких LLMок с его помощью и вовсе можно улучшить в разы.

На недавнем митапе я познакомился с Николаем Сениным, который не просто активно пользуется DSPy, но и получает великолепные результаты с его помощью.
У Николая уже была готовая теоритическая преза, но поскольку инструмент непростой быстро стало ясно, что нагляднее всего будет показать его на примере реального кейса. В кач-ве кейса выбрали проект Николая - умный суммаризатор-разметчик для материалов (YouTube, книги и др), который умеет здорово размечать действительно нетривиальные и полезные идеи из текста, сервис называется Knowlume. Главное, что будет возможность заглянуть под капот сервиса - и код посмотреть и понять как там вообще все работает.

Время: вторник 21 июля 13:00 МСК (15:00 по Алматы).
Регистрация по ссылке.

А еще, открыта предварительная запись на стрим про CodeAlive и контекстные движки в четверг в 11:00 МСК (13:00 по Алматы). Полноценный анонс будет чуть позже.

@ai_driven
👍177
Please open Telegram to view this post
VIEW IN TELEGRAM
11👍7
Ну, это так для сравнения (DeepSWE 1.1).
Юзает ли кто-нибудь Gemini нынче? Кажется, совсем у них дела плохи. Раньше хоть дешевые мелкие модели были (мы в CodeAlive вовсю их гоняли при индексации), а сейчас вообще юзкейсы непонятны.
Я, кстати, в добавку к Codex и Claude взял еще на Grok подписку и использую в кач-ве ревьюера - действительно находит много интересного, я доволен.
А Fable использую как эксперта-консультанта, вызываю просто из Codex через свой скилл agents-consilium.
Еще молва пошла, что квен 3.8 якобы дюже силен. Но бенчмарков нету вообще, что подозрительно. Успел уже попробовать кто-нибудь новый квен? У меня уже хобби команду ревьюеров из сильных моделей собирать: обычно 5.6 Sol medium/high делает, затем зовет Grok 4.5/GLM 5.2/Opus 4.8 ревьюить, затем когда у простых работяг вопросов не остается, передает работу Fable на ревью. Видимо, команда моя скоро пополнится новой кими и квеном.

@ai_driven
5👍4
Вырубал комментарии временно, защищаясь от наплыва ботов. Сейчас вернул - пишите!
Все лимиты и ресеты для Codex 200$ закончились. Рекорд - расход 2 недельных подписки за сутки (работа над RepoContextBench v2 ведется полным ходом). А Claude медленный, да еще и с лимитированным фейблом. В итоге, взял Грока за 300$ 100$ - говорят, там лимиты почти бесконечные и все очень быстро. Грок за 30$ мне понравился как по качеству, так и по скорости.
Грока я использую в качестве исполнителя внутри OpenCode (возможно, перееду теперь на его нативный харнесс Grok Build) через свой скилл agents-consilium, его вызывает Codex App или Claude как субагента, поэтому получается очень удобно.

Итого, сетап теперь такой:
Планирует Fable или GPT-5.6 Sol high/xhigh, а что вместе. Иногда GPT 5.6 Sol Pro.
Выполняет Grok 4.5 high
Ревьят: Opus 4.8, GPT 5.6 Sol, GLM 5.2 и по итогу Fable. Позже добавлю Kimi K3 в ревьюеры и посмотрим еще на возможности релизной DeepSeek V4 Pro и Qwen 3.8.
Итого 4 подписки: Codex 200$, Claude 100$ (для Fable и ревью), OpenCode 10$ для ревью через китайцев (для работы практически бессмысленная, только нечастые ревью разве что).

Есть еще темная лошадка SWE 1.7 от ребят из Devin - супер быстрый (на Cerebras чипах) и, судя по Frontier Code, с классными результатами. Если кто пробовал - отпишитесь.

Еще, мне регулярно перестает хватать мощностей моего мака на комфортную разработку, поэтому планирую арендовать VMку и делегировать тяжелые задачи агента туда.

Ах да, напоследок - лайфхак. Поскольку ручной сброс кодекс лимитов просто стартует новую неделю - получается, что выгоднее сразу после органического сброса как можно быстрее выжать лимиты, затем сделать ручной сброс, тогда вы за один и тот же помежуток времени сделаете больше работы нагенерите больше кода и, условно, в месячной подписке станет почти 6 полных недельных квот вместо 5-ти (без учета общих сбросах). Почему-то об этом никто не пишет.

@ai_driven
319👍9
Opus 5

Похоже, все-таки придется снова брать Claude 200$...

Для гурманов: Opus 5 System Card. (193 страницы paper!)
🤯8👍4
Аномалии Opus 5 и оптимальный reasoning effort

Если вы используете агентов так активно, что даже 200$ лимитов вам не хватает, ну или просто хотите получать адекватный результат быстрее (иногда в разы), то надо озаботиться выбором оптимального уровня размышления модели. Так вот, из официального анонса это неочевидно, а вот из системной карточки вполне.

И там видно, что в Opus 5 medium effort часто оказывается даже эффективнее, чем Fable high. При цене почти в 3 раза меньше. Видимо, теперь medium будет дефолтным выбором для пятого опуса. А во Frontier Code Opus 5 medium и вовсе показывает результаты существенно лучше, чем xhigh версия (что, конечно, подозрительно, но ОК).

Еще, в системной карточки появились мультиагентные бенчи, и один из них ProgramBench - так вот, там команда из 5-ти агентов достигает того же результат в 2.2 раза быстрее, чем одиночный агент. Привет всем любителям мультиагентных систем.
Похоже, что секцию 8.11 Multi-Agent в принципе есть смысл прочитать вдумчиво.

И любопытный факт - новенький FrontierBench v0.1 (уже третий "фронтир" све бенчмарк) они прогоняли не в родном харнессе, а в mini-SWE-agent. Результатов прогона medium effort нам почему-то в отчете не дают, только xhigh и high.

@ai_driven
👍127
Kimi K3 и ревью моделями разных семейств

Ну как вам новая Kimi K3? Медленно? Если использовать ее не как основную модель, а как еще одно мнение - вполне норм, тем более, что она действительно находит интересное в дополнение к Опусу. Сейчас как раз работаю над очень сложной задачкой по улучшению комплексного и длительного воркфлоу, он должен быть устойчивым к разным сбоям, там всякие outbox'ы, умные фолбеки и другие нетривиальные штуки, в которых нейронки часто ошибаются. Предыдущие агенты полноценно не могли осисить эту задачу - постоянно что-то где-то вылетало. План делали уже по традиции Sol, Fable, Opus и даже Kimi K3 - в комплексных (или исследовательских) задачах, когда много unknown unknowns чем больше хороших и разнообразных моделей - тем лучше. Но даже самый сильный план не всегда гарантия идеального кода, поэтому в таких случаях есть смысл еще и итоговую реализацию дополнительно ревьюить (тем более, что исполнителям иногда свойственно срезать углы). Так вот, конкретно в этом кейсе ревью я прогнал через Opus 5 (medium) и Kimi K3 (max) (на DeepSWE, кстати, у обоих 69%). Результаты на скрине.
Собсна, чье ревью сильнее даже не так важно в данном случае, важнее - кол-во уникальных (не пересекающихся) находок, а их 4 у Kimi и 5 у Opus - т. е. кими дополнила ревью опуса аж 4-мя находками и главное все они оказались релевантны. Однозначно беру в коллекцию ревьюеров. Будем наблюдать дальше.

Кстати, в самых тяжелых случаях все еще можно отправить архив релевантных файлов на ревью в GPT 5.6 Pro. Но тут сразу важный нюанс - если у вас такая задача, что самые мощные модели 2+ раза подряд находят реальные проблемы, то это хороший повод задуматься о том, что, скорее всего, все-таки есть переусложнение, и, вероятно, на нее уже есть готовое и хорошо протестированное решение - возможно, будет дешевле поискать их получше. Ну, либо задача слишком большая и стоило бить ее на меньшие сабтаски.

Про Опус 5: хоть ее все равно все еще приходится направлять и подсказывать (а вы что хотели?), мне моделька нравится - весьма понимающая и не соглашается на все в подряд. А слог ее так вообще шикарен. GPT семейство по традиции общается довольно сухо, у Opus'а же наоборот частенько проскакивают нотки гуманитария, речь богаче и живее - это приятно.

Что касается практической части, то напомню, что ревью я запускаю через скилл agents-consilium - он теперь наблюдаемый и умеет стримить прогресс вызывающей стороне - стало сильно удобнее. А еще, там появилось два совершенно новых режима explore и delegate, про которые я расскажу отдельно.

Итого, текущий джентельменский набор вайб-кодера agentic инженера: Опус/Фейбл/Sol/Kimi K3 - план и интервью, Grok 4.5 (ну или Terra/Luna) - исследование контекста и реализация, и все те же Опус, Фейбл, Sol, K3 код-ревью. Стадию плана лучше дополнять парочкой очень важных скиллов для борьбы со сложностью (FPF, code-that-fits-in-your-head).

Kimi K3 я использую внутри OpenCode через подписку OpenCode Go за 10$/мес (моя рефка с бонусом) и еще держу резерв на Synthetic за 30$ (моя рефка тоже с бонусом).

@ai_driven
2👍144
Мой тест на AGI
🤯15😁6
Агентам не нужен TDD

Дядя Боб говорит, что TDD вообще-то для людей и агентам совсем не обязателен, ведь у агента дела с краткосрочной памятью обстоят куда лучше, чем у людей.
А что нужно агентам по его мнению? Юнит тест, CRAP метрика и мутационное тестирование... Кто-то считает CRAP и делает мутационные тесты? Если первое ещё иногда интересно, то второе довольно спорная техника - если практикуете расскажите.

TDD != тесты
А по поводу TDD (его щас прям любят вайб кодеры тиражировать), то давно понятно, что классический TDD цикл (красный тест > код > зелёный тест > рефакторинг, причем мелкими итерациями) с агентами больше похож на прожигание токенов, чем на что-то полезное. Смысл имеет скорее разнообразные тест кейсы перед реализацией продумывать с агентом (включая интересные техники типа pairwise testing), сохранить их в маркдаун или (по BDD или нет - не принципиально).
Ну и, конечно, одних лишь юнитов недостаточно совсем, они в принципе часто мало чего хорошего дадут проверить просто by design - идеально использовать умную связку из разных видов тестов - по пирамиде тестирования или лучше даже по трофею (статические проверки), ну или на худой конец хотя бы e2e или browser use/computer use.
А когда вайб кодеры говорят про важность TDD часто просто имеют в виду, что нужно тестировать и верифицировать результат - что, конечно, бесспорно. Но Кент Бэк TDD это же не про это, это именно про красный тест > код > зелёный тест. Вот так начинают путаться классические термины с этими нашими вайб кодингами... В общем, если вы ещё используете TDD с агентами - скорее всего, он вам им не нужен.

@ai_driven
1👍24👎10🤔72🎉2
AI-Driven Development. Родион Мостовой
Агентам не нужен TDD Дядя Боб говорит, что TDD вообще-то для людей и агентам совсем не обязателен, ведь у агента дела с краткосрочной памятью обстоят куда лучше, чем у людей. А что нужно агентам по его мнению? Юнит тест, CRAP метрика и мутационное тестирование...…
Какой-то баг с реациями в ТГ случился (навайбкодили опять) и были доступны только дизлайки и сомнения, поэтому мы с дядей Бобом собрали рекордное кол-во дизайков под постом, я еще начал думать, что никто уже не читает такие "длинные" посты до конца. Короче, если вы хотели отреагировать как-то иначе - теперь можно. А еще лучше - подключайтесь к дискусси, тк дебаты разгорелись нехилые в комментариях...
😁16🎉2🤔1🤯1