Дешевые токены и оркестрация
В последнее время замечаю тенденцию повышения аппетитов на токены - проектов и фич кодится все больше и их масштабы только растут. Если раньше я мог заваншотить агенту задачу на несколько тысяч строк кода (по спеке обычно), то теперь задачи на десятки тысяч LoC, а иногда и на сотню тысяч становятся нормой (дни или недели работы). И я заметил, что с появлением Астры этот аппетит только вырос - она позволяет делать довольно мощные планы, которые позволяют быстро получать результат, соответствующий ожиданиям. Так вот, к чему это я? К тому, что потребность в дешевых, но стабильных и быстрых моделях-исполнителях растет. Такие модели - это просто воркеры, от которых зачастую требуется просто тщательно выполнить план без отсебятины.
Так вот, я уже рассказывал про очень щедрые лимиты на Grok 4.5 из подписки Grok Heavy, которую ранее можно было купить за 100$ на 3 месяца, но, похоже, что эта акция закончилась, да и грок сам по итогу меня слегка разочаровал - слишком много отсебятины делал*.
В общем, китайцы сделали весьма полезный сервис для сравнения лимитов на модели в разных подписках: https://real-api-pricing.vercel.app/ (вкладка Monthly Allowance).
И этот сервис как раз прекрасно подходит для поиска таких вот дешевых моделей-исполнителей.
Главные инсайты оттуда:
1. 200$ подписка на Codex дает 145 миллиардов токенов в неделю на Luna - поэтому, если луна вас устраивает как исполнитель, то выбор очевиден в принципе. Я лично редко пускаю луну код писать, зато в кач-ве исследователя использую ее регулярно (иногда в десятки потоков).
2. 200$ подписка на Claude Code дает 40 миллиардов Sonnet 5 токенов. Признаюсь, соннет я вообще забыл как модель - уж очень она слаба в бенчмарках, да и на токены прожирлива. Но выглядит так, что если у вам доступна только подписка на Claude Code, то Sonnet medium/high - неплохой исполнитель с весьма большим лимитом.
3. Но, пожалуй, главная серая лошадка - это моделька Muse Spark 1.3 (Contributor) внутри OpenCode Go 10$ подписки. Это обновленная модель от Марка, которая на фоне более громких релизов осталась практически незамеченной, хотя результаты на бенчах она выбивает не хуже Опуса / Sol. Они пишут, что в OpenCode Go на нее сейчас недельный лимит 12.5 миллиардов токенов. А сами OpenCode указывают на ~45300 запросов в 5 ч. - в общем, выглядит очень жирно и вкусно. И работает она очень шустро. Единственный минус Contributor версии в том, что данные, которые вы отправляете в модель Марк потом сможет использовать для обучения новых моделей.
Моя рефка на OpenCode Go, если все-таки захотите попробовать.
А вот про Grok 4.5 на Grok Heavy там, кстати, явно брехня - между грок 4.5 и грок 4.6 разница в потреблении точно x10+.
И из моего опыта интересное открытие - Opus 5 low (особенно на 200$ подписке) лимитов хватает на довольно большой объем работы, сильно больше, чем Sol, например. Понятное дело, что она очень хороший исполнитель.
* Кстати, когда просите архитектора-оркестратора делегировать задачи мелким моделям, лучше сразу так и писать ему:
А еще, за эти полторы недели работы с Opus 5 / Fable 5.1 / Astra я несколько раз оказался свидетелем глупости Opus, которую очень здорово разруливали Fable / Astra, поэтому несмотря на бенчи, в которых Opus 5 в среднем идет почти в ровень с фейбл и астрой, в реальности на сложных задачах разница действительно ощущается.
Напомню, что для делегирования работы другим моделям/harnesses я использую скилл agents-consilium - он теперь поддерживает как muse spark, так и новую дипсик, и даже умеет перебивать исполнителя когда нужно (steer).
А какие модели вы используете для оркестрации?
@ai_driven
В последнее время замечаю тенденцию повышения аппетитов на токены - проектов и фич кодится все больше и их масштабы только растут. Если раньше я мог заваншотить агенту задачу на несколько тысяч строк кода (по спеке обычно), то теперь задачи на десятки тысяч LoC, а иногда и на сотню тысяч становятся нормой (дни или недели работы). И я заметил, что с появлением Астры этот аппетит только вырос - она позволяет делать довольно мощные планы, которые позволяют быстро получать результат, соответствующий ожиданиям. Так вот, к чему это я? К тому, что потребность в дешевых, но стабильных и быстрых моделях-исполнителях растет. Такие модели - это просто воркеры, от которых зачастую требуется просто тщательно выполнить план без отсебятины.
Так вот, я уже рассказывал про очень щедрые лимиты на Grok 4.5 из подписки Grok Heavy, которую ранее можно было купить за 100$ на 3 месяца, но, похоже, что эта акция закончилась, да и грок сам по итогу меня слегка разочаровал - слишком много отсебятины делал*.
В общем, китайцы сделали весьма полезный сервис для сравнения лимитов на модели в разных подписках: https://real-api-pricing.vercel.app/ (вкладка Monthly Allowance).
И этот сервис как раз прекрасно подходит для поиска таких вот дешевых моделей-исполнителей.
Главные инсайты оттуда:
1. 200$ подписка на Codex дает 145 миллиардов токенов в неделю на Luna - поэтому, если луна вас устраивает как исполнитель, то выбор очевиден в принципе. Я лично редко пускаю луну код писать, зато в кач-ве исследователя использую ее регулярно (иногда в десятки потоков).
2. 200$ подписка на Claude Code дает 40 миллиардов Sonnet 5 токенов. Признаюсь, соннет я вообще забыл как модель - уж очень она слаба в бенчмарках, да и на токены прожирлива. Но выглядит так, что если у вам доступна только подписка на Claude Code, то Sonnet medium/high - неплохой исполнитель с весьма большим лимитом.
3. Но, пожалуй, главная серая лошадка - это моделька Muse Spark 1.3 (Contributor) внутри OpenCode Go 10$ подписки. Это обновленная модель от Марка, которая на фоне более громких релизов осталась практически незамеченной, хотя результаты на бенчах она выбивает не хуже Опуса / Sol. Они пишут, что в OpenCode Go на нее сейчас недельный лимит 12.5 миллиардов токенов. А сами OpenCode указывают на ~45300 запросов в 5 ч. - в общем, выглядит очень жирно и вкусно. И работает она очень шустро. Единственный минус Contributor версии в том, что данные, которые вы отправляете в модель Марк потом сможет использовать для обучения новых моделей.
Моя рефка на OpenCode Go, если все-таки захотите попробовать.
И из моего опыта интересное открытие - Opus 5 low (особенно на 200$ подписке) лимитов хватает на довольно большой объем работы, сильно больше, чем Sol, например. Понятное дело, что она очень хороший исполнитель.
* Кстати, когда просите архитектора-оркестратора делегировать задачи мелким моделям, лучше сразу так и писать ему:
Имей в виду, что эта модель глуповата и может как упускать детали, так и делать лишнюю отсебятину, поэтому ставь ей задачу предельно точно и по итогам работы проверяй ее код сам. А также продумывай заранее потенциальные грабли, на которые модель может наступить при выполнении этой задачи и расписывай их сразу в описании задачи.
А еще, за эти полторы недели работы с Opus 5 / Fable 5.1 / Astra я несколько раз оказался свидетелем глупости Opus, которую очень здорово разруливали Fable / Astra, поэтому несмотря на бенчи, в которых Opus 5 в среднем идет почти в ровень с фейбл и астрой, в реальности на сложных задачах разница действительно ощущается.
Напомню, что для делегирования работы другим моделям/harnesses я использую скилл agents-consilium - он теперь поддерживает как muse spark, так и новую дипсик, и даже умеет перебивать исполнителя когда нужно (steer).
А какие модели вы используете для оркестрации?
@ai_driven
2👍25❤7
DS 4.1 Flash и галлюцинации
Там новый дипсик впечатляющие результаты показывает на бенчах и вообще выглядит как новый победитель по Парето-фронт (наиболее оптимальная модель по соотношению цены и качества). Но есть один нюанс, о котором мало кто говорит - это показатель модели в бенчмарке AA-Omniscience. И из топовых моделей довольно слабый результат: -5 в общем забеге (AA-Omniscience Index) и 95% в рейтинге галлюцинаций, и это прям антирекорд. Для сравнения у GLM-5.3-Flash 7 в AA-Omniscience Index и 28% показатель галлюцинаций.
Понятно, что AA-Omniscience измеряет родные знания моделей, без внешних tools - тем не менее, если ваш RAG агент все-таки не найдет релевантное, дипсик с большей вероятностью выдумает ответ.
Ну и конечно, напомню, что всегда следует проверять новые модельки на ваших evals, измеряющих возможности модели в ваших конкретных задачах - сейчас наличие таких бенчмарков особенно важно, т. к. новые модели выходят практически каждый месяц и потенциально могут уменьшить расходы компании на LLM в разы, не теряя при этом в качестве. Поэтому когда я на консультациях узнаю, что у команда до сих пор нет автоматизированных evals, это удивляет - ведь без них компания теряет как в деньгах, так и в качестве и вообще приходится двигаться практически вслепую. Гибкость, кстати, тоже уменьшается, т. к. с ручными проверками эксперименты становятся слишком трудозатратными, да и попросту необъективными.
А возвращаясь к ds flash - предыдущая версия на наших бенчмарках работала очень медленно нестабильно, и от коллег тоже слышал подобные отзывы. Поэтому конкретно дипсики еще более важно тщательно тестировать.
А как вам DeepSeek 4.1 Flash? Особенно интересно как она себя показала на ваших бенчмарках.
@ai_driven
Там новый дипсик впечатляющие результаты показывает на бенчах и вообще выглядит как новый победитель по Парето-фронт (наиболее оптимальная модель по соотношению цены и качества). Но есть один нюанс, о котором мало кто говорит - это показатель модели в бенчмарке AA-Omniscience. И из топовых моделей довольно слабый результат: -5 в общем забеге (AA-Omniscience Index) и 95% в рейтинге галлюцинаций, и это прям антирекорд. Для сравнения у GLM-5.3-Flash 7 в AA-Omniscience Index и 28% показатель галлюцинаций.
Понятно, что AA-Omniscience измеряет родные знания моделей, без внешних tools - тем не менее, если ваш RAG агент все-таки не найдет релевантное, дипсик с большей вероятностью выдумает ответ.
Ну и конечно, напомню, что всегда следует проверять новые модельки на ваших evals, измеряющих возможности модели в ваших конкретных задачах - сейчас наличие таких бенчмарков особенно важно, т. к. новые модели выходят практически каждый месяц и потенциально могут уменьшить расходы компании на LLM в разы, не теряя при этом в качестве. Поэтому когда я на консультациях узнаю, что у команда до сих пор нет автоматизированных evals, это удивляет - ведь без них компания теряет как в деньгах, так и в качестве и вообще приходится двигаться практически вслепую. Гибкость, кстати, тоже уменьшается, т. к. с ручными проверками эксперименты становятся слишком трудозатратными, да и попросту необъективными.
А возвращаясь к ds flash - предыдущая версия на наших бенчмарках работала очень медленно нестабильно, и от коллег тоже слышал подобные отзывы. Поэтому конкретно дипсики еще более важно тщательно тестировать.
А как вам DeepSeek 4.1 Flash? Особенно интересно как она себя показала на ваших бенчмарках.
@ai_driven
👍11❤5
Нелепости агентов
Агентная разработка - веселая штука конечно. Вот планируешь и кодишь несколько дней с Астрой, Фейблом и Опусом, а потом на e2e вот такое вот выясняется (см. скрин и пояснения в конце). И это прям системная история - 99% получается хорошо и правдоподобно, а в каком-то неожиданном месте
Но справедливости ради - это был сложный и огромный кусок работы на десятки тысяч строк кода, хоть и делался в лучших традициях SDD с хорошим планом.
Выводы?
1. Делайте e2e тесты - причем как классические через условный Playwright / XCUIAutomation и тд, так и агентные "JIT" тесты - когда агент сам запускает вашу систему в около продовых условиях и ведет себя как Manual QA.
2. Рефлексируйте - если все-таки что-то вылезло несмотря на все ваши пятьсон уровней гардрейлов, обязательно ищите источник проблемы - то есть, в какой момент вашейдаркфактори агентного пайплайна вылеза ошибка и как она вообще дошла до live e2e.
* Контекст: я разрабатываю агентный интерфейс к одному из своих проектов (в данном случае - это MCP + skill) и вот там оказалось, что ответ в во всех MCP инструментах просто дублируется (структурированный + обычный текст) - абсолютно комичный дефект, который добрался аж до финальной стадии верификации. Live e2e же там устроен так, что сильный агент тестирует другого агента на предмет того, как тот справляется с задачами из юз кейсов - и то, как быстро он справляется, и сколько токенов у него на задачу уходит. Это, кстати, правильный подход и к evals скиллов тоже.
Если тоже сталкивались с подобными нелепостями агентов - расскажите в комментариях что это было и как боролись.
@ai_driven
Агентная разработка - веселая штука конечно. Вот планируешь и кодишь несколько дней с Астрой, Фейблом и Опусом, а потом на e2e вот такое вот выясняется (см. скрин и пояснения в конце). И это прям системная история - 99% получается хорошо и правдоподобно, а в каком-то неожиданном месте
Но справедливости ради - это был сложный и огромный кусок работы на десятки тысяч строк кода, хоть и делался в лучших традициях SDD с хорошим планом.
Выводы?
1. Делайте e2e тесты - причем как классические через условный Playwright / XCUIAutomation и тд, так и агентные "JIT" тесты - когда агент сам запускает вашу систему в около продовых условиях и ведет себя как Manual QA.
2. Рефлексируйте - если все-таки что-то вылезло несмотря на все ваши пятьсон уровней гардрейлов, обязательно ищите источник проблемы - то есть, в какой момент вашей
* Контекст: я разрабатываю агентный интерфейс к одному из своих проектов (в данном случае - это MCP + skill) и вот там оказалось, что ответ в во всех MCP инструментах просто дублируется (структурированный + обычный текст) - абсолютно комичный дефект, который добрался аж до финальной стадии верификации. Live e2e же там устроен так, что сильный агент тестирует другого агента на предмет того, как тот справляется с задачами из юз кейсов - и то, как быстро он справляется, и сколько токенов у него на задачу уходит. Это, кстати, правильный подход и к evals скиллов тоже.
Если тоже сталкивались с подобными нелепостями агентов - расскажите в комментариях что это было и как боролись.
@ai_driven
👍13❤4🎉1
Юзкейсы Jev: улучшение RAG, Browser Use, ...
Вы, наверное, уже видели, что появилась новая интереснаяLLMка Jev - суть ее в том, что она умеет, прежде всего, выбирать правильный вариант ответа (Choice), ну или бинарно отвечать на запрос (Noul) и показывать вероятности каждого варианта. В принципе, современные LLM тоже такое умеют через structured output, но ключевая фишка Jev в том, что делает она это очень быстро и дешево (генерируя ответ в параллель, а не последовательно).
В целом, для агентостроителей это дает возможность ускорить и удешить разные участки своих агентов / пайплайнов.
Я уже успел провести эксперименты с Jev в одном из своих продуктов:
1. Внутри RAG пайплайна в качестве реранкера: в целом, реранкинг через Choice получился качественнее, быстрее и дешевле, чем реранкинг через Voyage rerank-2.5, Qwen3-Reranker-8B, Cohere rerank-v4-pro (см. скрин). Вообще, для RAGов это прям крутая возможность быстро выцепить релевантные ТОП 10 результатов и отдать их агенту как есть без лишних шагов на progressive disclosure.
2. Внутри чатбота в качестве модератора: против gpt-oss-120b (быстрой версии) получилось примерно в 5 раз быстрее и в 5 раз дешевле при том же качестве.
Что я понял пока ее настраивал? То, что ее надо настраивать, промптить. Вот так с ходу трудно сразу получить хороший результат. Например, в моем кейсе с реранкингом лучше всего себя показал вариант с Choice на каждый результат (запросы отлично параллеляться) + отточенный промпт.
Причем эксперименты, надо сказать, проходят очень быстро, в отличие от стандартных LLM.
Что еще интересного делают с Jev? Browser Use уже запили скилл для очень быстрых оптимизаций в браузере - супер полезная штука для всех вайб кодеров и агентных инженеров: ускорение feedback loop на финальном этапе это отлично.
Классный кейс Jev - применение в около real-time сценариях, когда нужна реакция на какое-либо событие: например, на встречах AI-помощник с live транскрибацией, которая каждую секунду отправляется в Jev и тот определяет какой tool call сделать. Т. е. это кейс с продвинутыми голосовыми агентами, которые просто слушают и как-то реагируют когда сочтут нужным (Jev ответит
За сущие копейки можно делать сервисы типа trigify.io, которые отслеживают определенные события/сообщения в чатах и сообщают вам если появилось что-то релевантное.
Еще, у нас в чатике канала обсуждали кейс с выбором оптимальной модели для оркестрации - в целом, если достаточно подробно формализовать критерии, то должно неплохо работать.
Если вы уже попробовали Jev - расскажите про свои кейсы и результаты. Кстати, Jev уже появился в Vercel AI Gateway - что очень удобно.
Upd: Моделька появилась в OpenRouter - https://openrouter.ai/typesafe/jev-1.13
@ai_driven
Вы, наверное, уже видели, что появилась новая интересная
В целом, для агентостроителей это дает возможность ускорить и удешить разные участки своих агентов / пайплайнов.
Я уже успел провести эксперименты с Jev в одном из своих продуктов:
1. Внутри RAG пайплайна в качестве реранкера: в целом, реранкинг через Choice получился качественнее, быстрее и дешевле, чем реранкинг через Voyage rerank-2.5, Qwen3-Reranker-8B, Cohere rerank-v4-pro (см. скрин). Вообще, для RAGов это прям крутая возможность быстро выцепить релевантные ТОП 10 результатов и отдать их агенту как есть без лишних шагов на progressive disclosure.
2. Внутри чатбота в качестве модератора: против gpt-oss-120b (быстрой версии) получилось примерно в 5 раз быстрее и в 5 раз дешевле при том же качестве.
Что я понял пока ее настраивал? То, что ее надо настраивать, промптить. Вот так с ходу трудно сразу получить хороший результат. Например, в моем кейсе с реранкингом лучше всего себя показал вариант с Choice на каждый результат (запросы отлично параллеляться) + отточенный промпт.
Причем эксперименты, надо сказать, проходят очень быстро, в отличие от стандартных LLM.
Что еще интересного делают с Jev? Browser Use уже запили скилл для очень быстрых оптимизаций в браузере - супер полезная штука для всех вайб кодеров и агентных инженеров: ускорение feedback loop на финальном этапе это отлично.
Классный кейс Jev - применение в около real-time сценариях, когда нужна реакция на какое-либо событие: например, на встречах AI-помощник с live транскрибацией, которая каждую секунду отправляется в Jev и тот определяет какой tool call сделать. Т. е. это кейс с продвинутыми голосовыми агентами, которые просто слушают и как-то реагируют когда сочтут нужным (Jev ответит
true). То есть, можно надежно и дешево собирать что-то типа ElevenLabs Agent.За сущие копейки можно делать сервисы типа trigify.io, которые отслеживают определенные события/сообщения в чатах и сообщают вам если появилось что-то релевантное.
Еще, у нас в чатике канала обсуждали кейс с выбором оптимальной модели для оркестрации - в целом, если достаточно подробно формализовать критерии, то должно неплохо работать.
Если вы уже попробовали Jev - расскажите про свои кейсы и результаты. Кстати, Jev уже появился в Vercel AI Gateway - что очень удобно.
Upd: Моделька появилась в OpenRouter - https://openrouter.ai/typesafe/jev-1.13
@ai_driven
1👍21❤10👎1
AI-Driven Development. Родион Мостовой
Юзкейсы Jev: улучшение RAG, Browser Use, ... Вы, наверное, уже видели, что появилась новая интересная LLMка Jev - суть ее в том, что она умеет, прежде всего, выбирать правильный вариант ответа (Choice), ну или бинарно отвечать на запрос (Noul) и показывать…
Вижу, что кейс с модерацией через Jev актуален, поэтому публикую пример реализации такого Jev-модератора для для Mastra фреймворка. Реализовано в виде кастомного InputProcessor (по аналогии с обычным LLMным ModerationProcessor): https://github.com/CodeAlive-AI/mastra-jev-moderation
И мнение Рефата про Jev тоже рекомендую к прочтению: https://t.me/nobilix/303
Кстати, моделька уже появилась на OpenRouter: https://openrouter.ai/typesafe/jev-1.13
@ai_driven
И мнение Рефата про Jev тоже рекомендую к прочтению: https://t.me/nobilix/303
Кстати, моделька уже появилась на OpenRouter: https://openrouter.ai/typesafe/jev-1.13
@ai_driven
GitHub
GitHub - CodeAlive-AI/mastra-jev-moderation: Input moderation for Mastra agents on TypeSafe Jev — one file
Input moderation for Mastra agents on TypeSafe Jev — one file - CodeAlive-AI/mastra-jev-moderation
❤6👍5
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍31❤14🤔4🦄3🎉1
AI-Driven Development. Родион Мостовой
Ребят, на всякий случай уточню для тех, кто не вчитался - по 20$ подписке до 10 октября Девин дают практически бесконечную квоту на свою новую фронтир модель SWE 2.0 - это тюн и без того очень удачной модели Kimi K3. И это пока лучшая модель-исполнитель из тех, что мне встречались - я думаю, на уровне с Sol. У К3, кстати, изначально очень хорошо с удержанием контекста на длинных дистанциях.
Я напомню, что Devin недавно купили Windsurf и объедини усилия, а кор команда у них - это лютые олимпиадники - у них отличный CLI с ACP (который полностью поддерживается моим оркестратором) и довольно удобное Desktop приложение для тех, кто хочет юзать его стэндэлон - а вкладка с редактором так вообще киллер фича особенно для любителей посмотреть код.
Я в основном использую девина из оркестрации из Codex или Claude Code. Так и пишу:
Дальше уже скилл оркестрации все, что нужно делает - правильно запускает и инструктирует как оркестратора, так и Девина (подробнее в следующем посте).
В бенчах SWE 2.0 идет на уровне самых топовых фронтиров. А лимит там 10 параллельных сессий.
В Desktop я его обычно запускаю на Max reasoning, а в CLI на High. Ощущение доступа к бесконечной фронтир модели сильное.
Подписку на грока я отменил.
ЗЫ: Отдыхайте на выходных :))
@ai_driven
Я напомню, что Devin недавно купили Windsurf и объедини усилия, а кор команда у них - это лютые олимпиадники - у них отличный CLI с ACP (который полностью поддерживается моим оркестратором) и довольно удобное Desktop приложение для тех, кто хочет юзать его стэндэлон - а вкладка с редактором так вообще киллер фича особенно для любителей посмотреть код.
Я в основном использую девина из оркестрации из Codex или Claude Code. Так и пишу:
Максимально делегируй работу Девину, на тебе только мышление, оркестрация и проверка. Где уместно - параллель выполнение.
Дальше уже скилл оркестрации все, что нужно делает - правильно запускает и инструктирует как оркестратора, так и Девина (подробнее в следующем посте).
В бенчах SWE 2.0 идет на уровне самых топовых фронтиров. А лимит там 10 параллельных сессий.
В Desktop я его обычно запускаю на Max reasoning, а в CLI на High. Ощущение доступа к бесконечной фронтир модели сильное.
Подписку на грока я отменил.
ЗЫ: Отдыхайте на выходных :))
@ai_driven
Cognition
Introducing SWE-2: Pushing the Pareto Frontier
Today we’re introducing SWE-2, our most advanced coding model yet. SWE-2 delivers highly competitive agentic coding performance across multiple effort…
3👍30🎉7❤2
Вот за что люблю очередь сообщений в Codex. Накидываешь задачи на ночь одну за другой и со спокойной душой идешь спать. Спека дошлифовывается, а Девин субагенты потом идут ее выполнять под контролем Астры.
Вообще, тщательное разжевывание сложных и неочевидных мест прямо в плане сильной моделью - важнейшая штука в SDD, особенно когда сама работа делегируется агенту подешевле.
А планеров в данном случае двое - Астра основная и Fable советник(ца).
@ai_driven
Вообще, тщательное разжевывание сложных и неочевидных мест прямо в плане сильной моделью - важнейшая штука в SDD, особенно когда сама работа делегируется агенту подешевле.
А планеров в данном случае двое - Астра основная и Fable советник(ца).
@ai_driven
1👍22🤯1🦄1
AI-Driven Development. Родион Мостовой
Чем мой оркестратор отличается от
Помимо полезных инструкций, вправляющих мозги как координатору, так и воркерам, важнейшая фишка конкретно моего pragmatic-orchestration в том, что он умеет перенаправлять воркера прямо во время работы (в Codex эта фича называется Steer). То есть, если агент-координатор во время очередной проверки видит, что условный Devin пошел не туда или что-то не учел, ну или просто вы отправили какое-то уточнение координатору, он сможет перенаправить воркера (или воркеров) прямо во время выполнения, не прерывая их работу. И это поддерживается практически для всех harnesses - где-то через ACP, где-то встроенными средствами.
@ai_driven
claude -p и т. п.?Помимо полезных инструкций, вправляющих мозги как координатору, так и воркерам, важнейшая фишка конкретно моего pragmatic-orchestration в том, что он умеет перенаправлять воркера прямо во время работы (в Codex эта фича называется Steer). То есть, если агент-координатор во время очередной проверки видит, что условный Devin пошел не туда или что-то не учел, ну или просто вы отправили какое-то уточнение координатору, он сможет перенаправить воркера (или воркеров) прямо во время выполнения, не прерывая их работу. И это поддерживается практически для всех harnesses - где-то через ACP, где-то встроенными средствами.
@ai_driven
❤13🤔3👍1
Forwarded from Константин Доронин
Выступление за выступлением.
Примерно так проходит для меня сентябрь. Много знакомств, интересных историй и опыта о том, что работает, а что нет.
Вот вам ещё немного анонсов выступлений на грядущую неделю.
Во вторник, 22 сентября, в 18:00 (GMT+3) на буткемпе от NAITION расскажу про feedback-loop в работе с агентами.
Как правильно настроенные циклы обратной связи помогают достичь более качественного результата от работы AI-агентов. И о том, как feedback-loop помогают измерить качество процессов.
А в среду, 23 сентября, также в 18:00 (GMT+3), выступят мои товарищи по авторским AI-блогам – Родион Мостовой и Максим Ключников (вы могли их видеть у меня на эфирах про код с AI-агентами и про экономию токенов). Они выступят с очень амбициозной темой: "Конвертируем Enterprise-проект в Dark Factory". Расскажут про то, какой путь надо преодолеть компании на пути к этому состоянию.
Даты и время: 22 и 23 сентября, в 18:00 (GMT+3).
Доступ на эфиры бесплатный, после регистрации.
Регистрация в боте: @ai_meetups_bot
Примерно так проходит для меня сентябрь. Много знакомств, интересных историй и опыта о том, что работает, а что нет.
Вот вам ещё немного анонсов выступлений на грядущую неделю.
Во вторник, 22 сентября, в 18:00 (GMT+3) на буткемпе от NAITION расскажу про feedback-loop в работе с агентами.
Как правильно настроенные циклы обратной связи помогают достичь более качественного результата от работы AI-агентов. И о том, как feedback-loop помогают измерить качество процессов.
А в среду, 23 сентября, также в 18:00 (GMT+3), выступят мои товарищи по авторским AI-блогам – Родион Мостовой и Максим Ключников (вы могли их видеть у меня на эфирах про код с AI-агентами и про экономию токенов). Они выступят с очень амбициозной темой: "Конвертируем Enterprise-проект в Dark Factory". Расскажут про то, какой путь надо преодолеть компании на пути к этому состоянию.
Даты и время: 22 и 23 сентября, в 18:00 (GMT+3).
Доступ на эфиры бесплатный, после регистрации.
Регистрация в боте: @ai_meetups_bot
👍6❤5