Forwarded from Андрей
При агентной разработке типичная ситуация: агент переходит к коду сразу, без спецификации и плана. План существует только в истории чата, теряется между сессиями, контекст расходуется на промежуточные артефакты, а факт выполнения подтверждает сам исполнитель. В итоге результат сложно проверить и воспроизвести.
Agent Lifecycle Kit — опенсорсный плагин, который выстраивает работу агента по полному циклу:
Что входит (5 skills):
Архитектурные решения:
Кому полезен: командам и соло-разработчикам, которым важен воспроизводимый и проверяемый результат агентной разработки.
Ссылка: https://github.com/avksp/agent-lifecycle-kit Лицензия Apache 2.0, установка занимает около минуты.
Обратная связь и звёзды в issues — приветствуются.
#AIагенты #agentic #ClaudeCode #Codex #Cursor #OpenCode #Hermes #LLM #agentlifecycle #опенсорс #разработка #opensource
Agent Lifecycle Kit — опенсорсный плагин, который выстраивает работу агента по полному циклу:
запрос → спецификация → независимый аудит плана → заморозка → исполнение → аудит каждой задачи → доказательство готовности.Что входит (5 skills):
agent-first-planning — превращает запрос в agent-ready план с ownership, бюджетом и контрактом на evidence.audit-agent-plan — независимая проверка плана до заморозки, без самоодобрения.agent-plan-to-workers — компилирует замороженный план в детерминированные task-пакеты.audit-plan-implementation — аудит реализации относительно плана: ownership, evidence, acceptance.agent-workflow-orchestrator — ведёт весь lifecycle и хранит состояние в durable-файлах, а не в чате.Архитектурные решения:
Состояние ≠ чат. Authority хранится в run.state.json, переживает рестарт и смену сессии.Freeze-gate. Реализация стартует только от хеш-проверенного замороженного плана.Fail-closed. Если контекст не помещается или receipt FAIL — агент возвращает ошибку, а не обрезает промпт молча.Host-neutral. Один и тот же workflow работает в Codex, Claude Code, Cursor, Hermes и OpenCode.Контроль контекста. Профили вплоть до 4k-strict — переполнение обрабатывается явно.Кому полезен: командам и соло-разработчикам, которым важен воспроизводимый и проверяемый результат агентной разработки.
Ссылка: https://github.com/avksp/agent-lifecycle-kit Лицензия Apache 2.0, установка занимает около минуты.
Обратная связь и звёзды в issues — приветствуются.
#AIагенты #agentic #ClaudeCode #Codex #Cursor #OpenCode #Hermes #LLM #agentlifecycle #опенсорс #разработка #opensource
👍15🤔5❤🔥1🔥1
⚪️ Снижаем расход токенов в gpt поколения 5.6
Тут на реддите тред интересный
🔗 Тред: https://www.reddit.com/r/codex/comments/1v4vcnr/possible_gpt56_sol_usage_workaround_explicit_tool/
Суть: до поколения 5.6 модели звали тулы пачками. В 5.6 сменился подход, они сейчас используют Code Mode, но инструкции для этого не оптимизированы, получается медленно и менее экономно
По ссылке инструкции дают более четкие указания.
Вот текст:
Я добавил в .codex/config.toml (и во все кастомные конфиги) в параметр developer_instructions
▶️ Делимся наблюдениями! Автор треда говорит об экономии в десятки процентов
👉 Грац за находку по праву принадлежит @wndr_lv, спасибо!
@deksden_notes
Тут на реддите тред интересный
🔗 Тред: https://www.reddit.com/r/codex/comments/1v4vcnr/possible_gpt56_sol_usage_workaround_explicit_tool/
Суть: до поколения 5.6 модели звали тулы пачками. В 5.6 сменился подход, они сейчас используют Code Mode, но инструкции для этого не оптимизированы, получается медленно и менее экономно
По ссылке инструкции дают более четкие указания.
Вот текст:
In Code Mode, within each bounded stage, run independent, functions.exec-available tool calls concurrently in one functions.exec call. Use await Promise.allSettled([...]) when partial results are useful, and inspect every result; use await Promise.all([...]) only when any failure should abort the batch. Keep dependencies, waits/resumes, approvals, conflicting or interdependent mutations, and adaptive investigations where each result may change the next step sequential. Do not split otherwise batchable inspections across outer tool calls.
Я добавил в .codex/config.toml (и во все кастомные конфиги) в параметр developer_instructions
▶️ Делимся наблюдениями! Автор треда говорит об экономии в десятки процентов
👉 Грац за находку по праву принадлежит @wndr_lv, спасибо!
@deksden_notes
👍18❤7🤔3❤🔥1
Forwarded from Циничный AI (Anton Goncharenko)
SKILL.md
13 KB
Одно из лучших улучшений моих workflow - это добавление в них
technical-premortemДалее можно ничего не читать, воткнуть к себе этот скилл и вызывать его на планировании.
—-
С осени 2025 года я разрабатывал такой подход, чтобы в solo тащить проекты, где я являюсь единственным фаундером и вообще единственным живым человеком.
К апрелю 2026 у меня уже полностью сформировался ai-firendly подход к разработке проектов.
Однако уже в мае я добавил в него
technical-premortem skill.Чем он помогаети почему он так хорош?
Если посмотреть на мой процесс работы верхнеуровнево, то ядро разработки состоит из двух крупных блоков/циклов: планирования и реализации. Внутри каждого есть этапы разработки и проверки.
Да, review планов выходят дешевле, чем review на реализации.
Да, review необходимо делать другой моделью, отличной от той, которая писала план.
Написали план -> кросс-ревью.
Внесли изменения в проект/написали код -> кросс-ревью.
Это если на пальцах.
Но и у этого подхода есть проблемы.
Мы знаем, что модель склонна защищать свои решения. При этом написанные современными моделями планы всегда выглядит убедительно. Кросс-ревью другой моделью снимает часть проблем, но не убирает главную порблему - модель делает слабую задачу в неправильной рамке.
Слабая задача - проверь/оцени
Неправильная рамка - а вдруг тут что-то не так
Из трёх проблем:
- кто проверяет,
- что проверяет,
- как проверяет,
при использовании другой модели мы решили только первую.
И тут на помощь приходит классика когнитивной психологии.
Представь, что событие уже произошло и претерпело провал - это повышает способность как человека так и модели назвать причины негативного исхода и сбивает необоснованную уверенность в плане намного эффективнее, чем обычная проверка.
Для агента это работает даже лучше, чем для людей, потому что меняется как сам тип задачи, так и рамка.
Вместо "найди ошибки в плане", мы переводим модель в режим рассуждений, где план уже реализован и провалился.
Мы требуем от модели объяснить, что сломалось, т.е. сгенерировать причинно-следственные объяснения по свершившемуся факту.
А генерировать правдоподобные объяснения - это то, что современные модели делают лучше всего.
Способность к коррекциям планов у моделей есть, но эту способность нужно активировать снаружи.
technical-premortem skill и есть такой внешний активаторЧто делает мой technical-premortem skill?
Перед реализацией любого изменения агент принимает установку о том, что изменение уже смёржено, задеплоено и провалилось и работает в обратную сторону:
👁 восстанавливает blast radius: что меняется → что от этого зависит → что разделяется;
👁 прогоняет таксономию из 13 категорий сбоев — от необратимых миграций до отдельной обязательной категории «ошибка самого агента-исполнителя»;
👁 сортирует риски:
👁 выдаёт план отката, pre-flight чек-лист и вердикт Go / No-Go.
Ключевое - смена роли. Модель больше не защищает план, а
расследует уже случившуюся катастрофу.Туннельное зрение и слепые пятна убираются комбинацией другой модели, другой задачи и другой рамкой
P.S. Не смотря на то, что у меня за месяц до внедрения этого skill были решены основные проблемы разработки на ии-агентах, этот skill дал значительный буст в скорости разработки.
P.P.S. Skill написан и доработан с помощью codex и claude code на основе имеющейся в открытом доступе информации специально для технического премортем. Использую уже более 2-х месяцев. Можно брать и допиливать под себя. Представлена русскоязычная версия для лучшего восприятия, можно перевести на english и use it.
P.P.P.S. Можно использовать в рамках одной модели, но лучше на более высоком effort level и в другой сессии с чистым контекстом.
#skills #opensource
Please open Telegram to view this post
VIEW IN TELEGRAM
👍24🔥16❤4❤🔥1
Opus 5
Да, вот так вот - в пятницу вечером!) Совсем на гиков рассчитывают что ли?! «Мадам, это к вам не относится, но, мальчик …»
А вот модель как раз выглядит по бенчам бодро! Практически уровень Фубли за цену Опуса. Супер!
Оч сильная агентность. Очевидно что модель тренировали как агента-оркестратора. Линейка так и выстраивается: фубля на оракула тянет, опус оркестрирует сварм соннетов, хайку на подхвате по мелким поручениям.
Бенчи это конечно хорошо, но тут надо тестить.
(Ц) фронтир двигается, господа!
@deksden_notes
Да, вот так вот - в пятницу вечером!) Совсем на гиков рассчитывают что ли?! «Мадам, это к вам не относится, но, мальчик …»
А вот модель как раз выглядит по бенчам бодро! Практически уровень Фубли за цену Опуса. Супер!
Оч сильная агентность. Очевидно что модель тренировали как агента-оркестратора. Линейка так и выстраивается: фубля на оракула тянет, опус оркестрирует сварм соннетов, хайку на подхвате по мелким поручениям.
Бенчи это конечно хорошо, но тут надо тестить.
(Ц) фронтир двигается, господа!
@deksden_notes
🔥17👍2❤1🤡1
Forwarded from bishx devlog
Пару недель назад я делал пост о том, что не всегда оптимально использовать сложные пайплайны для работы с нейросетями
Недавно была задача взять одну систему за основу и усовершенствовать её – кое-что выпилить, кое-что допилить, что-то оставить
Был выбор:
1. Использовать сложный пайплайн (публичный вариант) с трехчасовым планированием, 20+ часами исполнением плана, декомпозицией задач в YouTrack и ветками в системе контроля версий. Жесть, в общем
2. Использовать обычный чатик с ручными итерациями "перепиши и проверь"
3. Взять что-то между п.1 и п.2: адаптивный полуавтономный пайплайн под среднебытовую задачу с приоритизацией общения в чатике
По сложному названию и ссылке на гит можно догадаться, что я выбрал третий вариант. Мои два промпта кодексу звучали так:
1. "$bx-dev"
2. "/goal возьми из репы Х все python исходники. Перепиши весь проект на go в более сопровождаемый вид. В каждой итерации используй нужные скиллы из skill-library. Следуй протоколу $bx-dev. Критерий завершения – система полностью перенесена на go и проверена на отсутствие потерь бизнес-логики при миграции"
Отличный промпт? Да! Сейчас разберём
Написав $bx-dev, мы задали рабочий контур: исследование перед изменениями, реализация, проверки, ревью и DDD классификация там, где она действительно нужна
А написав "/goal ..." – мы зафиксировали задачу, критерий завершения и требования к процессу. Агенту сложнее закончить раньше времени: при попытке остановиться его возвращает к цели, проверкам и требованиям из $bx-dev и напоминанию использовать skill-library (буст +16 п.п. к эффективности)
Получается, что у нейронки нет нормального выхода из цикла, пока она не сверится с критерием завершения: полностью перенести систему и не потерять бизнес-логику. При каждой попытке останова её пинают и говорят следовать промпту из /goal, который отлично напоминает про задачу и требования к её исполнению
Отправили всё в кодекс и ушли заниматься своими делами, – спустя 8 часов имеем ваншотом полностью перенесенный проект на другой яп. Запустили, проверили – есть пара мелких недочетов, но фиксятся они за 5-10 минут
Суть в том, что $bx-dev сам по себе вполне автономен и хорошо справляется с большинством задач. А в связке с /goal мы это дополнительно усилили, исключив потерю контекста с течением времени
Теперь самое интересное... Я решил в паблик выложить свой bx-dev skill и встроенную skill-library с механизмом ленивой загрузки 105 скиллов, которые использую в повседневных задачах
В репе описал, как устроен скилл и как с ним работать в разных сценариях
Скилл самодостаточен и готов к работе из коробки, нужны лишь утилиты gh (для git репы проекта) и jq (для записи состояний)
☁️ Исходный код: GitHub
#opensource
Недавно была задача взять одну систему за основу и усовершенствовать её – кое-что выпилить, кое-что допилить, что-то оставить
Был выбор:
1. Использовать сложный пайплайн (публичный вариант) с трехчасовым планированием, 20+ часами исполнением плана, декомпозицией задач в YouTrack и ветками в системе контроля версий. Жесть, в общем
2. Использовать обычный чатик с ручными итерациями "перепиши и проверь"
3. Взять что-то между п.1 и п.2: адаптивный полуавтономный пайплайн под среднебытовую задачу с приоритизацией общения в чатике
По сложному названию и ссылке на гит можно догадаться, что я выбрал третий вариант. Мои два промпта кодексу звучали так:
1. "$bx-dev"
2. "/goal возьми из репы Х все python исходники. Перепиши весь проект на go в более сопровождаемый вид. В каждой итерации используй нужные скиллы из skill-library. Следуй протоколу $bx-dev. Критерий завершения – система полностью перенесена на go и проверена на отсутствие потерь бизнес-логики при миграции"
Отличный промпт? Да! Сейчас разберём
Написав $bx-dev, мы задали рабочий контур: исследование перед изменениями, реализация, проверки, ревью и DDD классификация там, где она действительно нужна
А написав "/goal ..." – мы зафиксировали задачу, критерий завершения и требования к процессу. Агенту сложнее закончить раньше времени: при попытке остановиться его возвращает к цели, проверкам и требованиям из $bx-dev и напоминанию использовать skill-library (буст +16 п.п. к эффективности)
Получается, что у нейронки нет нормального выхода из цикла, пока она не сверится с критерием завершения: полностью перенести систему и не потерять бизнес-логику. При каждой попытке останова её пинают и говорят следовать промпту из /goal, который отлично напоминает про задачу и требования к её исполнению
Отправили всё в кодекс и ушли заниматься своими делами, – спустя 8 часов имеем ваншотом полностью перенесенный проект на другой яп. Запустили, проверили – есть пара мелких недочетов, но фиксятся они за 5-10 минут
Суть в том, что $bx-dev сам по себе вполне автономен и хорошо справляется с большинством задач. А в связке с /goal мы это дополнительно усилили, исключив потерю контекста с течением времени
Теперь самое интересное... Я решил в паблик выложить свой bx-dev skill и встроенную skill-library с механизмом ленивой загрузки 105 скиллов, которые использую в повседневных задачах
В репе описал, как устроен скилл и как с ним работать в разных сценариях
Скилл самодостаточен и готов к работе из коробки, нужны лишь утилиты gh (для git репы проекта) и jq (для записи состояний)
#opensource
Please open Telegram to view this post
VIEW IN TELEGRAM
👍17🔥9❤6
Forwarded from Циничный AI (Anton Goncharenko)
https://t.me/deksden_notes/1027
Продолжение к вчерашнему посту про skill
Я решил его строго проверить. Взял реальные планы (включая те, что уже были ранее без проблем реализованы), прогнал через разные версии скиллов (от 600 до 50 строк) на моделях Sol и Opus.
⚠️ В том числе сравнивал с моделями, которые делали проверки вообще без skill.
Привлёк независимых судей-верификаторов Sol и Fable. Сравнил количество подтверждённых находок, мусор, вердикты и затраты токенов.
Главный вывод: скилл не делает модели умнее – они и так всё умеют.
Никакой когнитивной активации с помощью premortem техники не происходит, никаких дополнительных возможностей модель не получает.
Но skill всё равно работет, он убирает панические блокировки, режет мусор и дисциплинирует формулировки.
Краткий разбор в 4-х постах + сам skill + сравнение и различие в поведении Sol vs Opus/Fable
https://t.me/cinicai/116
https://t.me/cinicai/117
https://t.me/cinicai/118
https://t.me/cinicai/119
#opensource
Продолжение к вчерашнему посту про skill
technical-premortemЯ решил его строго проверить. Взял реальные планы (включая те, что уже были ранее без проблем реализованы), прогнал через разные версии скиллов (от 600 до 50 строк) на моделях Sol и Opus.
⚠️ В том числе сравнивал с моделями, которые делали проверки вообще без skill.
Привлёк независимых судей-верификаторов Sol и Fable. Сравнил количество подтверждённых находок, мусор, вердикты и затраты токенов.
Главный вывод: скилл не делает модели умнее – они и так всё умеют.
Никакой когнитивной активации с помощью premortem техники не происходит, никаких дополнительных возможностей модель не получает.
Но skill всё равно работет, он убирает панические блокировки, режет мусор и дисциплинирует формулировки.
Краткий разбор в 4-х постах + сам skill + сравнение и различие в поведении Sol vs Opus/Fable
https://t.me/cinicai/116
https://t.me/cinicai/117
https://t.me/cinicai/118
https://t.me/cinicai/119
#opensource
🔥8👍4
⚪️ Codex reset (!!!)
Несмотря на завершение "фестиваля миллионов" - кто помнит, мы таки достигли 10м пользователей, и дальше клозеды не обещали ресетов за каждый миллион, но зато сегодня был сбой - и у нас снова ресет!
Ура) Вовремя
Но надо думать чего делать с флоу/аккаунтами - категорически нехватает квот
@deksden_notes
Несмотря на завершение "фестиваля миллионов" - кто помнит, мы таки достигли 10м пользователей, и дальше клозеды не обещали ресетов за каждый миллион, но зато сегодня был сбой - и у нас снова ресет!
Ура) Вовремя
Но надо думать чего делать с флоу/аккаунтами - категорически нехватает квот
@deksden_notes
1👍15💯8🔥5👻2
⚪️ Статья - почему Software factories не работают
Тут нужно прочитать статью, аж в двух частях:
🔗 Начало: https://x.com/dexhorthy/status/2080697380379427275?s=46
🔗 часть 2: https://x.com/dexhorthy/status/2081058573556306030?s=46
Чел пишет про то, в чем сейчас лажают модели в кодинг. Аргументированно, правда СИЛЬНО развернуто.
Но тема поднята сильная. Надо будет обсудить!
Если много народа ниосилят, буду писать пересказ - но мне кажется тут и агент растолкует если что.
Прочитайте! Обсудим
❓ Ну и кто чего думает? В комменты ⬇️
@deksden_notes
Тут нужно прочитать статью, аж в двух частях:
🔗 Начало: https://x.com/dexhorthy/status/2080697380379427275?s=46
🔗 часть 2: https://x.com/dexhorthy/status/2081058573556306030?s=46
Чел пишет про то, в чем сейчас лажают модели в кодинг. Аргументированно, правда СИЛЬНО развернуто.
Но тема поднята сильная. Надо будет обсудить!
Если много народа ниосилят, буду писать пересказ - но мне кажется тут и агент растолкует если что.
Прочитайте! Обсудим
❓ Ну и кто чего думает? В комменты ⬇️
@deksden_notes
👍11🔥11❤🔥2
Forwarded from ProTraffic | Арбитраж трафика
Пока все продают курсы по AI, Иванов просто каждый день что-то вайб кодит.
За последние месяцы он навайбкодил десятки проектов: автозалив в Fb, Telegram-сетку на 3000+ каналов, парсеры абсолютно всего и они работают, AI-агентов и автоматизацию для спайки.
Без инфоцыганства и мотивации. Только процесс, ошибки, промпты, удачные решения и мысли человека, который каждый день живёт внутри арбитражного рынка и AI.
Если интересно не смотреть, а реально строить - вам сюда:
👉 @CPACoder
За последние месяцы он навайбкодил десятки проектов: автозалив в Fb, Telegram-сетку на 3000+ каналов, парсеры абсолютно всего и они работают, AI-агентов и автоматизацию для спайки.
Без инфоцыганства и мотивации. Только процесс, ошибки, промпты, удачные решения и мысли человека, который каждый день живёт внутри арбитражного рынка и AI.
Если интересно не смотреть, а реально строить - вам сюда:
👉 @CPACoder
👎11😁5👍4🔥2👀2
Forwarded from Владимир П.
Привет! Написал ru-marketplace-mcp — опенсорсные коннекторы для российских маркетплейсов: Wildberries, Ozon, Яндекс Маркет и Детский мир.
Если коротко - это глаза для Claude, Opencode и любого другого AI-клиента. Подключаешь, и агент сам отвечает на «где этот увлажнитель дешевле», «что пишут в отзывах» и «кто вообще этот продавец».
Внутри 22 инструмента. Из любимого:
— реквизиты продавца на WB: юрлицо, ИНН, ОГРН. Сразу видно, официальный это магазин или перекуп с похожим названием
— вопросы покупателей и ответы продавца: там часто единственный ответ на «а кабель в комплекте?»
— разбивка оценок по звёздам на Маркете: честная там 4.8 или за ней прячется пачка единиц
— наличие в офлайн-магазинах Детского мира по городам
— сравнение цен по всем площадкам одним вызовом
Регистрация не нужна: только публичные эндпоинты, только чтение. Ozon с серверных IP упрямится - для него есть режим через ваш собственный Chrome.
Активно пилю дальше, в планах Авито, Taobao и другие площадки Китая.
https://github.com/Vladimir-Human/ru-marketplace-mcp
Зацените! Нужен фидбек, идеи и звёзды :)
#opensource
Если коротко - это глаза для Claude, Opencode и любого другого AI-клиента. Подключаешь, и агент сам отвечает на «где этот увлажнитель дешевле», «что пишут в отзывах» и «кто вообще этот продавец».
Внутри 22 инструмента. Из любимого:
— реквизиты продавца на WB: юрлицо, ИНН, ОГРН. Сразу видно, официальный это магазин или перекуп с похожим названием
— вопросы покупателей и ответы продавца: там часто единственный ответ на «а кабель в комплекте?»
— разбивка оценок по звёздам на Маркете: честная там 4.8 или за ней прячется пачка единиц
— наличие в офлайн-магазинах Детского мира по городам
— сравнение цен по всем площадкам одним вызовом
Регистрация не нужна: только публичные эндпоинты, только чтение. Ozon с серверных IP упрямится - для него есть режим через ваш собственный Chrome.
Активно пилю дальше, в планах Авито, Taobao и другие площадки Китая.
https://github.com/Vladimir-Human/ru-marketplace-mcp
Зацените! Нужен фидбек, идеи и звёзды :)
#opensource
GitHub
GitHub - Vladimir-Human/ru-marketplace-mcp: MCP-серверы для российских маркетплейсов: Wildberries, Ozon, Яндекс Маркет, Детский…
MCP-серверы для российских маркетплейсов: Wildberries, Ozon, Яндекс Маркет, Детский мир и сравнение цен по всем сразу. Только чтение, ключи не нужны. - Vladimir-Human/ru-marketplace-mcp
👍31🔥21❤🔥5❤2