14 моделей рисуют BPMN. Кто рабочая лошадь, а кто заставит зайца ждать?
Взял историю про Петра и зайца, подключил модели к MCP Stormbpmn и устроил 42 запуска: одинаковый промпт, по три попытки, новые сессии, без ручных подсказок. Прогон занял 1 час 54 минуты.
Внутри обнаружилась интересная инженерная деталь. Модели передают Storm эскиз на Mermaid с метками BPMN: где параллельный шлюз, где таймер, где ожидание события. Сервис превращает его в BPMN, а дальше модель может редактировать элементы и запрашивать автоматическую раскладку.
Знакомый язык для модели, специальные значения для сервиса. Даже конструкция
Все диаграммы прошли техническую проверку. Но по условию Пётр ждёт зайца до восьми часов. Некоторые модели поставили таймер на восемь часов, а уже после него проверку: «Заяц пришёл?» Заяц может стоять рядом, Пётр всё равно ждёт.
Ещё ловушка: Пётр каждый час ищет перец, Зинаида со временем замечает повторения и помогает. Если сделать её помощь обязательной перед следующей проверкой, независимый цикл исчезает.
Astra — победитель строгой проверки: оба сценария и завершение поддержаны в 3/3 попыток. Медианное время — 224 секунды. Дорого богато и правильно.
Sonnet 5 — мой кандидат в рабочие лошади для черновиков: 58 секунд, правильное ожидание зайца в 3/3. Но Зинаиду упрощает во всех трёх. Этот участок придётся исправлять.
DeepSeek 4.1 Flash: 53 секунды, ожидание верно в 2/3. У GLM Flash тоже 2/3, у Haiku — 0/3. Sol — 3/3, но 245 секунд: медленнее Astra и с упрощением Зинаиды. Terra и Luna стабильного результата по ожиданию не дали.
Входных токенов за сеанс у Sonnet — медиана 153 тыс., у Astra — 709 тыс., у Sol — 1,54 млн. Сюда входит повторное чтение контекста из кэша. Без чтения кэша — 38,6 / 60,7 / 99,5 тыс. Разница уже скромнее. Это не прямая цена и не расход лимита подписки.
Пока выбираю Sonnet для черновика с ревью, Astra — когда нужна строгая логика этого кейса. Стоимость ручных правок ещё не измерена.
Один кейс, три повтора. Логику проверял ИИ, человеческая оценка впереди. Сравниваем модели вместе с их клиентами и интерфейсом Storm; способность самостоятельно генерировать BPMN XML здесь не проверяли.
А как справятся ещё более мелкие модели или — (крестимся) — российские модели?
🔥 И я пробую нарисовать тот же кейс через Гигачат и Алису
@analyst_exe
Взял историю про Петра и зайца, подключил модели к MCP Stormbpmn и устроил 42 запуска: одинаковый промпт, по три попытки, новые сессии, без ручных подсказок. Прогон занял 1 час 54 минуты.
Внутри обнаружилась интересная инженерная деталь. Модели передают Storm эскиз на Mermaid с метками BPMN: где параллельный шлюз, где таймер, где ожидание события. Сервис превращает его в BPMN, а дальше модель может редактировать элементы и запрашивать автоматическую раскладку.
Знакомый язык для модели, специальные значения для сервиса. Даже конструкция
:::класс уже есть в Mermaid — Storm использует её для обозначения BPMN-типов. Модели остаётся выбрать логику; писать весь BPMN XML и рассчитывать координаты ей не приходится. Так работали все 42 запуска.Все диаграммы прошли техническую проверку. Но по условию Пётр ждёт зайца до восьми часов. Некоторые модели поставили таймер на восемь часов, а уже после него проверку: «Заяц пришёл?» Заяц может стоять рядом, Пётр всё равно ждёт.
Ещё ловушка: Пётр каждый час ищет перец, Зинаида со временем замечает повторения и помогает. Если сделать её помощь обязательной перед следующей проверкой, независимый цикл исчезает.
Astra — победитель строгой проверки: оба сценария и завершение поддержаны в 3/3 попыток. Медианное время — 224 секунды. Дорого богато и правильно.
Sonnet 5 — мой кандидат в рабочие лошади для черновиков: 58 секунд, правильное ожидание зайца в 3/3. Но Зинаиду упрощает во всех трёх. Этот участок придётся исправлять.
DeepSeek 4.1 Flash: 53 секунды, ожидание верно в 2/3. У GLM Flash тоже 2/3, у Haiku — 0/3. Sol — 3/3, но 245 секунд: медленнее Astra и с упрощением Зинаиды. Terra и Luna стабильного результата по ожиданию не дали.
Входных токенов за сеанс у Sonnet — медиана 153 тыс., у Astra — 709 тыс., у Sol — 1,54 млн. Сюда входит повторное чтение контекста из кэша. Без чтения кэша — 38,6 / 60,7 / 99,5 тыс. Разница уже скромнее. Это не прямая цена и не расход лимита подписки.
Пока выбираю Sonnet для черновика с ревью, Astra — когда нужна строгая логика этого кейса. Стоимость ручных правок ещё не измерена.
Один кейс, три повтора. Логику проверял ИИ, человеческая оценка впереди. Сравниваем модели вместе с их клиентами и интерфейсом Storm; способность самостоятельно генерировать BPMN XML здесь не проверяли.
А как справятся ещё более мелкие модели или — (крестимся) — российские модели?
🔥 И я пробую нарисовать тот же кейс через Гигачат и Алису
@analyst_exe
🔥10❤2
Уволил себя #1. С должности рисовальщика диаграмм)
Тут ИИ меня реально заменил. Теперь я цензор картинок. Трудовую прикладываю)
Картинок насобирать теперь не проблема, хоть сто. Но! Подвох — теперь это всё вычитывать надо, по стрелочке. На схеме под постом кусок того самого первого прогона ИИ: сократил для телефона, две правки пометил красным. Ещё косяки там есть. Что найдёте?)
Нейронка рисует мне сиквенсы, ER, C4 и другие типовые диаграммы на PlantUML и Mermaid: классы, состояния, активности, блок-схемы. А я сижу такой: это убери, это добавь, ещё это докинь.
Словами объяснить схему быстрее, чем самому отлаживать синтаксис PlantUML. Делаю так: кидаю агенту 2–3 старые диаграммы, документ с названиями систем и говорю, что нарисовать. Если агент видит код проекта, часть вызовов сам найдёт. Но участников и связи всё равно проверяю глазами.
Вот конвенция, которую я собрал уже после первого прогона. Часть оформления утащил из рабочего шаблона; вы хоть своё с нуля придумайте:
Синтаксис PlantUML теперь можно не запоминать. Хочешь подсветить новые сервисы, разложить системы по контурам и получить таблицу вызовов — пишешь это словами. Агент собирает
Если нужна строгая BPMN под импорт или своя редкая нотация — лучше профильный редактор или руками. А типовые схемы для доки ИИ уже рисует отлично.
Скиньте коллеге, который тоже устал гуглить синтаксис PlantUML)
@analyst_exe
Тут ИИ меня реально заменил. Теперь я цензор картинок. Трудовую прикладываю)
Картинок насобирать теперь не проблема, хоть сто. Но! Подвох — теперь это всё вычитывать надо, по стрелочке. На схеме под постом кусок того самого первого прогона ИИ: сократил для телефона, две правки пометил красным. Ещё косяки там есть. Что найдёте?)
Нейронка рисует мне сиквенсы, ER, C4 и другие типовые диаграммы на PlantUML и Mermaid: классы, состояния, активности, блок-схемы. А я сижу такой: это убери, это добавь, ещё это докинь.
Словами объяснить схему быстрее, чем самому отлаживать синтаксис PlantUML. Делаю так: кидаю агенту 2–3 старые диаграммы, документ с названиями систем и говорю, что нарисовать. Если агент видит код проекта, часть вызовов сам найдёт. Но участников и связи всё равно проверяю глазами.
Вот конвенция, которую я собрал уже после первого прогона. Часть оформления утащил из рабочего шаблона; вы хоть своё с нуля придумайте:
Вот мои .puml/скрины и документ с именами систем.
Нарисуй [сценарий] в PlantUML.
- Имена систем бери дословно из документа; неизвестное пометь ?.
- Группируй участников через box ... end box.
- Возьми skinparam из образцов. Новые системы пометь <<new>>:
skinparam sequenceParticipantBackgroundColor<<new>> #FFE1D6
- Запрос: метод и путь. Ответ: статус и результат.
- Верни .puml, таблицу вызовов и вопросы по допущениям.
- Отрендери схему и проверь синтаксис.
Синтаксис PlantUML теперь можно не запоминать. Хочешь подсветить новые сервисы, разложить системы по контурам и получить таблицу вызовов — пишешь это словами. Агент собирает
.puml и картинку. Руками тоже можно. А зачем)Если нужна строгая BPMN под импорт или своя редкая нотация — лучше профильный редактор или руками. А типовые схемы для доки ИИ уже рисует отлично.
Скиньте коллеге, который тоже устал гуглить синтаксис PlantUML)
@analyst_exe
🔥10
В ТЗ написано: «Всё работает как обычно». У нас уже 17 уточняющих вопросов к слову «обычно».
Если тоже не можете пройти мимо — 🔥 за профессиональную отбитость. Посчитаем стаю!
@analyst_exe
Если тоже не можете пройти мимо — 🔥 за профессиональную отбитость. Посчитаем стаю!
@analyst_exe
🔥14
Уволил себя #2. С позиции разработчика.
Раньше звал Диму на час объяснять чужой код. Теперь это делает агент. И я наконец могу собирать свои прикладные штуки, ради которых семь раз пытался учиться разработке)
Садились, проходили по сервисам, рисовали связи. Теперь открываю проект с агентом и задаю тот же вопрос: «Как работает вот эта херня?» Он сам проходит по коду, строит схему и приносит текущую реализацию на блюдечке: кто кого вызывает и что происходит по шагам. Кайфекс.
Так сейчас делает каждый аналитик у нас в команде. На онбординг уходит меньше времени, разработчиков дёргаем реже.
А ещё я всегда хотел делать что-то своё и полезное. Каждый заход начинался с «сначала выучи язык». Усидчивости на этот путь у меня не хватало. Сейчас начинаю с задачи: какую пользу сервис должен дать и как он должен себя вести. Агент пишет код, я смотрю на результат и разбираюсь в механизме.
Так с агентом собрал сайт analystexe.ru и «Резюмешку» — сервис, который помогает адаптировать резюме под вакансию. Нейросеть буквально дала мне руки, которые я сам так и не наработал.
Мне интересны механизмы и бизнес-ценность. А на синтаксис и детали реализации мне теперь просто плевать.
А что вы откладываете до «сначала научусь», хотя можно попробовать уже сейчас?
@analyst_exe
Раньше звал Диму на час объяснять чужой код. Теперь это делает агент. И я наконец могу собирать свои прикладные штуки, ради которых семь раз пытался учиться разработке)
Садились, проходили по сервисам, рисовали связи. Теперь открываю проект с агентом и задаю тот же вопрос: «Как работает вот эта херня?» Он сам проходит по коду, строит схему и приносит текущую реализацию на блюдечке: кто кого вызывает и что происходит по шагам. Кайфекс.
Так сейчас делает каждый аналитик у нас в команде. На онбординг уходит меньше времени, разработчиков дёргаем реже.
А ещё я всегда хотел делать что-то своё и полезное. Каждый заход начинался с «сначала выучи язык». Усидчивости на этот путь у меня не хватало. Сейчас начинаю с задачи: какую пользу сервис должен дать и как он должен себя вести. Агент пишет код, я смотрю на результат и разбираюсь в механизме.
Так с агентом собрал сайт analystexe.ru и «Резюмешку» — сервис, который помогает адаптировать резюме под вакансию. Нейросеть буквально дала мне руки, которые я сам так и не наработал.
Мне интересны механизмы и бизнес-ценность. А на синтаксис и детали реализации мне теперь просто плевать.
А что вы откладываете до «сначала научусь», хотя можно попробовать уже сейчас?
@analyst_exe
🔥5👍1🤩1
Вышла хайповая нейросеть Jev. Я полез читать, что это за зверь: текст она вообще не пишет. Даёшь ей историю и вопросы — получаешь «да», «нет», «не имеет значения» и вероятности. И я подумал: блин, это же готовый ведущий для данеток)
Сделали игру на сайте по приколу. Но тут ещё и расчёт был: гонять обычную текстовую модель на каждое «а был ли там кот?» — платить за каждый ход. У Jev один ответ стоит тысячные доли цента. Если основную массу вопросов отдавать ей, игра для посетителя остаётся бесплатной, а меня не пугает счёт за каждое «да».
На бумаге всё красиво. Потом я в своей версии разгадки написал, что груз не тонул. Jev дала ей 90% вероятности победы. А по разгадке груз как раз тонул — мешки соли тянули ящики на дно, потом растворялись и ящики всплывали. Одно «не» сломало ключевой факт, но ведущая объявила победу.
Я полез крутить пороги и формулировки. Выяснилось: Jev может ошибаться очень уверенно. Поэтому пришлось добавить второго судью — GPT-6 Luna. Обычные вопросы по-прежнему ведёт Jev; GPT подключается к сомнительным ответам и версиям, похожим на разгадку, включая такие уверенные «победы».
Прогнал 116 русских вариантов разгадки по всем 30 историям. На них же потом чинил промпты, так что красивый процент точности из этого не продаю. Одну слишком общую версию игра всё ещё засчитывает. Теперь нужны вопросы, до которых я сам не додумался.
Попробуйте сыграть и сломать ведущего. В игре есть кнопка «Как это работает»: видно, какие ответы и вероятности возвращает Jev. Поймаете ерунду — напишите в комментарии историю и свой вопрос. Разгадку спрячьте под спойлер. У кого первым получится найти дыру — у вас или у друга?)
Сюжеты взяли с yesnogame.net; короткие условия переписали, чтобы было понятно, что именно надо объяснить.
@analyst_exe
Сделали игру на сайте по приколу. Но тут ещё и расчёт был: гонять обычную текстовую модель на каждое «а был ли там кот?» — платить за каждый ход. У Jev один ответ стоит тысячные доли цента. Если основную массу вопросов отдавать ей, игра для посетителя остаётся бесплатной, а меня не пугает счёт за каждое «да».
На бумаге всё красиво. Потом я в своей версии разгадки написал, что груз не тонул. Jev дала ей 90% вероятности победы. А по разгадке груз как раз тонул — мешки соли тянули ящики на дно, потом растворялись и ящики всплывали. Одно «не» сломало ключевой факт, но ведущая объявила победу.
Я полез крутить пороги и формулировки. Выяснилось: Jev может ошибаться очень уверенно. Поэтому пришлось добавить второго судью — GPT-6 Luna. Обычные вопросы по-прежнему ведёт Jev; GPT подключается к сомнительным ответам и версиям, похожим на разгадку, включая такие уверенные «победы».
Прогнал 116 русских вариантов разгадки по всем 30 историям. На них же потом чинил промпты, так что красивый процент точности из этого не продаю. Одну слишком общую версию игра всё ещё засчитывает. Теперь нужны вопросы, до которых я сам не додумался.
Попробуйте сыграть и сломать ведущего. В игре есть кнопка «Как это работает»: видно, какие ответы и вероятности возвращает Jev. Поймаете ерунду — напишите в комментарии историю и свой вопрос. Разгадку спрячьте под спойлер. У кого первым получится найти дыру — у вас или у друга?)
Сюжеты взяли с yesnogame.net; короткие условия переписали, чтобы было понятно, что именно надо объяснить.
@analyst_exe
❤3👍1