⚪️ Промптинг - отрицательные инструкции
Нынче развлекаюсь тестами более тупых моделей чем фронтир на обычных агентных флоу. Я давно работал с агентными флоу только на фронтире (конечно, простые модели были в апи в софте, но там другая специфика).
А тут в связи с практически "бесплатностью" луны для лимитов, возникла необходимость посмотреть какие стадии флоу нормально делаются моделями попроще.
▶️ Столкнулся с таким эффектом: отрицательные иснтрукции работают крайне плохо. Столкнулся с этим на теме роутинга задачи на выполнение с той или иной детальностью. Агенты на слабых моделях упорно игнорируют инструкции по теме "не запускай субагентов в случае простых задач".
Как бороться? Делаем реверс логики. Вместо "не запускай" переписываем этот блок так: по-умолчанию никаких субагентов. Запускать субагентов разрешается в таких случаях: чек-лист.
То есть мы перевели отрицательную инструкцию "не запускай, если ..." в положительное правило - "запускай, если ...". Такое работает хорошо даже на простых моделях.
Реверс логики не всегда естественный для человека - люди все таки воспринимают отрицательные инструкции получше.
Нет, такой подход не решает проблему следования инструкциям - он просто снижает вероятность НЕ следования инструкциям, сформирвоанным "негативно".
Пряник и тут эффективнее - особенно если им бить))
❓ Кто то замечал подобный эффект? как боролись?
@deksden_notes
Нынче развлекаюсь тестами более тупых моделей чем фронтир на обычных агентных флоу. Я давно работал с агентными флоу только на фронтире (конечно, простые модели были в апи в софте, но там другая специфика).
А тут в связи с практически "бесплатностью" луны для лимитов, возникла необходимость посмотреть какие стадии флоу нормально делаются моделями попроще.
▶️ Столкнулся с таким эффектом: отрицательные иснтрукции работают крайне плохо. Столкнулся с этим на теме роутинга задачи на выполнение с той или иной детальностью. Агенты на слабых моделях упорно игнорируют инструкции по теме "не запускай субагентов в случае простых задач".
Как бороться? Делаем реверс логики. Вместо "не запускай" переписываем этот блок так: по-умолчанию никаких субагентов. Запускать субагентов разрешается в таких случаях: чек-лист.
То есть мы перевели отрицательную инструкцию "не запускай, если ..." в положительное правило - "запускай, если ...". Такое работает хорошо даже на простых моделях.
Реверс логики не всегда естественный для человека - люди все таки воспринимают отрицательные инструкции получше.
Нет, такой подход не решает проблему следования инструкциям - он просто снижает вероятность НЕ следования инструкциям, сформирвоанным "негативно".
Пряник и тут эффективнее - особенно если им бить))
❓ Кто то замечал подобный эффект? как боролись?
@deksden_notes
👍17🔥9
This media is not supported in your browser
VIEW IN TELEGRAM
- Chat GPT Plus/Pro
- Gemini Pro - от 1$ | Есть опт
- Claude Pro/Max | Claude API
Please open Telegram to view this post
VIEW IN TELEGRAM
🥴8👍3🔥3❤1
Forwarded from Max Syabro and a Slop Driven Development
This media is not supported in your browser
VIEW IN TELEGRAM
Rejudge — независимая проверка для ИИ-агентов.
https://rejudge.syabro.com/ru/
https://github.com/syabro/rejudge
Выкатываю еще один свой инструмент в паблик
Код, который написал агент, можно проверить четырьмя способами, где каждый следующий способ ловит больше предыдущего:
I. Та же сессия, та же модель.
Агент перечитывает свой код. Он уже решил, что код правильный, и повторное чтение это решение не меняет.
II. Новая сессия, та же модель.
Контекст чистый, модель прежняя. У неё то же обучение и те же привычки, поэтому она пропускает ошибки, которые написала бы сама.
III. Другая модель.
Другая модель действительно находит настоящие ошибки. Но теперь у вас два мнения, и когда они расходятся, решать, кто прав, приходится вам.
Я сделал дальше:
IV. Rejudge: три модели и судья.
Все три модели получают один и тот же вопрос одновременно. Каждая работает в изолированном контексте и сама вызывает инструменты, поэтому ни одна не видит, что делают другие. Судья читает все три отчёта, задаёт уточняющие вопросы там, где они расходятся, и пишет один ответ.
Плюс агент может отправить дозапрос по
Внутри pi-sdk с поддержкой все провайдеров которые поддерживает Pi.
У меня rejudge работает на OpenCode Go (линк реферальный, $5 вам, $5 мне) за $10. Но честно перестало хватать, ибо стал юзать на любой чих, докупил еще один акк. Если есть альтернатива интереснее подскажите в комментах.
В комплекте
•
•
• Pi-extension с
В комментах отвечу на вопросы.
В планах
• Прогнать на DeepSWE, посмотреть что получится
• Допинать /rejudge-dx-review skill
• Интегрировать мой
Установка тут:
https://rejudge.syabro.com/ru/#install
Как обычно с вас лайк, шер, репост, подписка, поглатить ближайшего котика, вот это все.
Ваш, @syabro_notes
#opensource #mit
https://rejudge.syabro.com/ru/
https://github.com/syabro/rejudge
Выкатываю еще один свой инструмент в паблик
Код, который написал агент, можно проверить четырьмя способами, где каждый следующий способ ловит больше предыдущего:
I. Та же сессия, та же модель.
Агент перечитывает свой код. Он уже решил, что код правильный, и повторное чтение это решение не меняет.
II. Новая сессия, та же модель.
Контекст чистый, модель прежняя. У неё то же обучение и те же привычки, поэтому она пропускает ошибки, которые написала бы сама.
III. Другая модель.
Другая модель действительно находит настоящие ошибки. Но теперь у вас два мнения, и когда они расходятся, решать, кто прав, приходится вам.
Я сделал дальше:
IV. Rejudge: три модели и судья.
Все три модели получают один и тот же вопрос одновременно. Каждая работает в изолированном контексте и сама вызывает инструменты, поэтому ни одна не видит, что делают другие. Судья читает все три отчёта, задаёт уточняющие вопросы там, где они расходятся, и пишет один ответ.
Плюс агент может отправить дозапрос по
session-id в Rejudge если есть что-то что не понравилось.Внутри pi-sdk с поддержкой все провайдеров которые поддерживает Pi.
У меня rejudge работает на OpenCode Go (линк реферальный, $5 вам, $5 мне) за $10. Но честно перестало хватать, ибо стал юзать на любой чих, докупил еще один акк. Если есть альтернатива интереснее подскажите в комментах.
{
"reviewers": [
"opencode-go/deepseek-v4-pro@xhigh",
"opencode-go/minimax-m3@xhigh",
"opencode-go/mimo-v2.5-pro@xhigh"
],
"judge": "opencode-go/glm-5.2@medium"
}
В комплекте
•
rejudge CLI тулза для всех агентов•
/rejudge и /rejudge-diff скиллы для работы с Rejudge в целом и проверки диффов, например перед коммитом или на PR• Pi-extension с
rejudge tool для красивого UI и более кошерной коммуникации агенту.В комментах отвечу на вопросы.
В планах
• Прогнать на DeepSWE, посмотреть что получится
• Допинать /rejudge-dx-review skill
• Интегрировать мой
websearchУстановка тут:
https://rejudge.syabro.com/ru/#install
Как обычно с вас лайк, шер, репост, подписка, поглатить ближайшего котика, вот это все.
Ваш, @syabro_notes
#opensource #mit
🔥14❤8👍3❤🔥1👻1
⚪️ Claude Sonnet 5 остается дешевкой
По мнению антропиков - они решили сохранить на постоянку акцию со снижением цен на Sonnet, которую объявили при запуске модели. Вместо "стандартной" цены в $3/$15 у нас остаётся $2/$10
Это, конечно, хорошо
Но воркер на луне стоит $0.2/$1.2 - это почти х10 дешевле.
Дорогая терра стоит на уровне $2/$12. Видимо дороже её не хочет остаться антропик.
Но у антропика "выше" по иерархии ещё 2 модели..
В общем, посмотрим на ценовые манёвры фронтира
@deksden_notes
По мнению антропиков - они решили сохранить на постоянку акцию со снижением цен на Sonnet, которую объявили при запуске модели. Вместо "стандартной" цены в $3/$15 у нас остаётся $2/$10
Это, конечно, хорошо
Но воркер на луне стоит $0.2/$1.2 - это почти х10 дешевле.
Дорогая терра стоит на уровне $2/$12. Видимо дороже её не хочет остаться антропик.
Но у антропика "выше" по иерархии ещё 2 модели..
В общем, посмотрим на ценовые манёвры фронтира
@deksden_notes
💯5🤣5🔥3😁1
⚪️ Muse Glimmer бенчмарки
Интересно, что выше Gemma 4! Неплохо Марк вернулся к опенсорсу (в своём классе, конечно).
Почти уровень кими 2.5, но размер то сильно меньше.
Qwen3.6 27B всё равно получется поумнее - что лишний раз говорит о крутости квена в сегменте услоно мелких моделек.
🔗 Анонс бенча: https://x.com/ArtificialAnlys/status/2086916150278111551
🔗 Бенч на оффсайте: https://artificialanalysis.ai/models/muse-glimmer
@deksden_notes
Интересно, что выше Gemma 4! Неплохо Марк вернулся к опенсорсу (в своём классе, конечно).
Почти уровень кими 2.5, но размер то сильно меньше.
Qwen3.6 27B всё равно получется поумнее - что лишний раз говорит о крутости квена в сегменте услоно мелких моделек.
🔗 Анонс бенча: https://x.com/ArtificialAnlys/status/2086916150278111551
🔗 Бенч на оффсайте: https://artificialanalysis.ai/models/muse-glimmer
@deksden_notes
👍3🤔2🔥1
Forwarded from Андрей
Agent Lifecycle Kit: управляемая работа с ИИ-инструментами для разработки
Кодовый агент — это инструмент с моделью ИИ, который по текстовой задаче может изучить проект, изменить файлы и запустить проверки. К таким инструментам относятся Codex, Claude Code, Cursor, OpenCode, Qwen Code и другие.
На простой задаче достаточно получить готовое изменение. Но при работе над архитектурой, безопасностью или большой функцией важно также понимать:
- какая цель была поставлена;
- что именно разрешено менять;
- какие этапы нужно пройти;
- какие проверки обязательны;
- почему результат можно считать принятым.
Agent Lifecycle Kit (ALK) организует этот процесс от постановки задачи до подтверждённого завершения.
ALK помогает:
- принять задачу из текста, Markdown-файла или внешнего документа;
- провести исследование и подготовить план;
- зафиксировать требования, критерии приёмки и границы изменений;
- разделить работу на последовательные этапы;
- сохранить состояние задачи и продолжить её позже;
- проверить результат относительно утверждённого плана;
- собрать подтверждения проверок;
- принять результат или зафиксировать причину блокировки.
Главное отличие ALK от кодовых агентов в разделении ответственности:
- кодовый агент анализирует проект, пишет код и выполняет проверки;
- ALK управляет процессом, границами, состоянием, подтверждениями и приёмкой результата.
ALK не привязан к одной модели или одному инструменту. Подключения к Codex, Claude Code, Cursor, OpenCode, Qwen Code, Goose, Gemini CLI и другим инструментам выполняются через адаптеры. При этом правила жизненного цикла остаются едиными.
Для задач разного уровня используется соразмерный контроль. Небольшая механическая задача проходит короткий путь. Архитектурная, связанная с безопасностью или несколькими исполнителями, получает более строгие проверки.
Дополнительная проверка несколькими моделями включается по необходимости. Можно использовать любые доступные сочетания инструментов и моделей: например, один инструмент готовит план, а другие проверяют исследование, архитектуру или реализацию. Если доступна только одна модель, дополнительная проверка не требуется.
ALK работает с большими, малыми и локальными моделями. Компактные задания, ограничения ресурсов и повторяемые проверки помогают экономить контекст, сохраняя требования к качеству.
Подробнее:
Быстрый старт (https://github.com/avksp/agent-lifecycle-kit/blob/main/docs/ru/quickstart.md)
Архитектура системы (https://github.com/avksp/agent-lifecycle-kit/blob/main/docs/ru/architecture/system-architecture.md)
Как ALK работает с разными задачами (https://github.com/avksp/agent-lifecycle-kit/blob/main/docs/ru/guides/how-alk-works.md)
Сравнение с похожими инструментами (https://github.com/avksp/agent-lifecycle-kit/blob/main/docs/ru/reference/project-comparison.md)
Репозиторий проекта (https://github.com/avksp/agent-lifecycle-kit)
#opensource #опенсорс
Кодовый агент — это инструмент с моделью ИИ, который по текстовой задаче может изучить проект, изменить файлы и запустить проверки. К таким инструментам относятся Codex, Claude Code, Cursor, OpenCode, Qwen Code и другие.
На простой задаче достаточно получить готовое изменение. Но при работе над архитектурой, безопасностью или большой функцией важно также понимать:
- какая цель была поставлена;
- что именно разрешено менять;
- какие этапы нужно пройти;
- какие проверки обязательны;
- почему результат можно считать принятым.
Agent Lifecycle Kit (ALK) организует этот процесс от постановки задачи до подтверждённого завершения.
ALK помогает:
- принять задачу из текста, Markdown-файла или внешнего документа;
- провести исследование и подготовить план;
- зафиксировать требования, критерии приёмки и границы изменений;
- разделить работу на последовательные этапы;
- сохранить состояние задачи и продолжить её позже;
- проверить результат относительно утверждённого плана;
- собрать подтверждения проверок;
- принять результат или зафиксировать причину блокировки.
Главное отличие ALK от кодовых агентов в разделении ответственности:
- кодовый агент анализирует проект, пишет код и выполняет проверки;
- ALK управляет процессом, границами, состоянием, подтверждениями и приёмкой результата.
ALK не привязан к одной модели или одному инструменту. Подключения к Codex, Claude Code, Cursor, OpenCode, Qwen Code, Goose, Gemini CLI и другим инструментам выполняются через адаптеры. При этом правила жизненного цикла остаются едиными.
Для задач разного уровня используется соразмерный контроль. Небольшая механическая задача проходит короткий путь. Архитектурная, связанная с безопасностью или несколькими исполнителями, получает более строгие проверки.
Дополнительная проверка несколькими моделями включается по необходимости. Можно использовать любые доступные сочетания инструментов и моделей: например, один инструмент готовит план, а другие проверяют исследование, архитектуру или реализацию. Если доступна только одна модель, дополнительная проверка не требуется.
ALK работает с большими, малыми и локальными моделями. Компактные задания, ограничения ресурсов и повторяемые проверки помогают экономить контекст, сохраняя требования к качеству.
Подробнее:
Быстрый старт (https://github.com/avksp/agent-lifecycle-kit/blob/main/docs/ru/quickstart.md)
Архитектура системы (https://github.com/avksp/agent-lifecycle-kit/blob/main/docs/ru/architecture/system-architecture.md)
Как ALK работает с разными задачами (https://github.com/avksp/agent-lifecycle-kit/blob/main/docs/ru/guides/how-alk-works.md)
Сравнение с похожими инструментами (https://github.com/avksp/agent-lifecycle-kit/blob/main/docs/ru/reference/project-comparison.md)
Репозиторий проекта (https://github.com/avksp/agent-lifecycle-kit)
#opensource #опенсорс
🔥5❤2🤔1
⚪️ Взлом ризонинга фронтира
Тут люди взломали ризонинг у антропиков, клозедов, гугла. Те самые шифрованные мысли моделей! omfg
Почитайте сами чего и как:
🔗 Почитайте тред: https://x.com/kotekjedi_ml/status/2087147042888114428
Из проблем: даже если в трейсах агентов у вас нету данных, то в мыслях моделей они вполне могут встретиться
Ну и праздник у китайских вендоров: то, что тщательно шифровали буржуи, легко ломается. Шило - как водится, не удержали.
@deksden_notes
Тут люди взломали ризонинг у антропиков, клозедов, гугла. Те самые шифрованные мысли моделей! omfg
Почитайте сами чего и как:
🔗 Почитайте тред: https://x.com/kotekjedi_ml/status/2087147042888114428
Из проблем: даже если в трейсах агентов у вас нету данных, то в мыслях моделей они вполне могут встретиться
Ну и праздник у китайских вендоров: то, что тщательно шифровали буржуи, легко ломается. Шило - как водится, не удержали.
@deksden_notes
🔥9😱8👍3❤1
⚪️ Grok Bot
Маск выпускает Grok Bot. Продукт совместный с Курсором - на ios разработчиком числится Anysphere, подписки работают Курсоровские в том числе.
Это такой cowork, но подключённый к облачной vm, которая выделяется пользователю (не боту, на всех ботов пользователя - одна эта машина, и они работу могут передавать друг другу).
Управялем им с приложений macos/win/ios, android будет позже. Так как агент в облаке на vm, работает даже когда твой комп выключен.
‼️ В общем, интересно, конечно, НО есть одно большое НО - работает только на максимальных подписках - Курсор ультра и Грок СУПЕР Хеви.
Получилось как ChatGPT Work который совмещён между облачным режимом (где и у chatgpt есть под капотом немаленькая vm, кто не знает - спросите у него сами про доступный комп) и локальным агентом в приложении.
Мне по описанию показалось что у Маска сделано логичнее чем у chatgpt.
🔗 Промо - посмотрите, первая картинка интерактивная, можно тыкать: https://x.ai/bot
🔗 Блог : https://x.ai/news/introducing-grok-bot
——
Upd 1️⃣ : SuperGrok Heavy теперь работает как Cursor Ultra план. Можно логинится в курсор своим X аккаунтом
@deksden_notes
Маск выпускает Grok Bot. Продукт совместный с Курсором - на ios разработчиком числится Anysphere, подписки работают Курсоровские в том числе.
Это такой cowork, но подключённый к облачной vm, которая выделяется пользователю (не боту, на всех ботов пользователя - одна эта машина, и они работу могут передавать друг другу).
Управялем им с приложений macos/win/ios, android будет позже. Так как агент в облаке на vm, работает даже когда твой комп выключен.
‼️ В общем, интересно, конечно, НО есть одно большое НО - работает только на максимальных подписках - Курсор ультра и Грок СУПЕР Хеви.
Получилось как ChatGPT Work который совмещён между облачным режимом (где и у chatgpt есть под капотом немаленькая vm, кто не знает - спросите у него сами про доступный комп) и локальным агентом в приложении.
Мне по описанию показалось что у Маска сделано логичнее чем у chatgpt.
🔗 Промо - посмотрите, первая картинка интерактивная, можно тыкать: https://x.ai/bot
🔗 Блог : https://x.ai/news/introducing-grok-bot
——
Upd 1️⃣ : SuperGrok Heavy теперь работает как Cursor Ultra план. Можно логинится в курсор своим X аккаунтом
@deksden_notes
❤5👍2
⚪️ Codex app теперь под Linux (preview)
Не прошло и несколько лет, как построенный на мультиплатформенном электроне Кодекс апп наконец то смогли запустить на линухах! Ура
Конечно, можно и ранее было юзать неофициальные репаки - но сейчас можно юзать официальные.
Поддерживаются:
• Ubuntu 24.04 LTS and 26.04 LTS
• Debian 13
• Fedora 43 and 44
@deksden_notes
Не прошло и несколько лет, как построенный на мультиплатформенном электроне Кодекс апп наконец то смогли запустить на линухах! Ура
Конечно, можно и ранее было юзать неофициальные репаки - но сейчас можно юзать официальные.
Поддерживаются:
• Ubuntu 24.04 LTS and 26.04 LTS
• Debian 13
• Fedora 43 and 44
@deksden_notes
🔥16👍8🎉7🐳3😱2❤1
⚪️ Grok 4.6 и Bot на SuperGrok
Тут Илон пояснил за сабж
1) Grok 4.6 "позже на этой неделе"
2) Grok Bot будет расширен на другие тиры как пофиксят начальные проблемки - но сроков нету
@deksden_notes
Тут Илон пояснил за сабж
1) Grok 4.6 "позже на этой неделе"
2) Grok Bot будет расширен на другие тиры как пофиксят начальные проблемки - но сроков нету
@deksden_notes
🔥5👍4😁2❤1
⚪️ Codex Reset завтра?
Вот как такое понимать? Если завтра, то включаем fast. Если нет - попадаем на 4 скучных дня))
Вот и гадаем. Я склоняюсь что нас ждёт ресет. Но уже немного утомляет неопределённость. Начните их продавать, наконец!
@deksden_notes
Вот как такое понимать? Если завтра, то включаем fast. Если нет - попадаем на 4 скучных дня))
Вот и гадаем. Я склоняюсь что нас ждёт ресет. Но уже немного утомляет неопределённость. Начните их продавать, наконец!
@deksden_notes
🙏11👍4❤3😁2👻1
Forwarded from Junior AI PM
#иное
Комьюнити-эфир 12 августа. Живая дискуссия про AI coding
Без докладов и презентаций -> просто собираемся и обсуждаем, как сейчас реально работаем с AI-разработкой
🎙 Максим Ключников -> техлид и автор канала Этихлид, много экспериментирует с AI в разработке и инженерных процессах
https://t.me/etechlead
🎙 Денис Киселёв -> AI SOLO founder, автор канала про AI-разработку, агентов и инженерные инструменты
https://t.me/deksden_notes
🎙 Артем Летюшев -> Tech PM в Twinby и гильдмастер AI Engineers Guild
https://t.me/junior_pm
Поговорим про свежие модели и tokens per task, спеки, архитектуру, ADR и AI SDLC. Дальше как пойдёт
Ссылка на событие https://luma.com/lwm1coqr
📍 Google Meet: https://meet.google.com/bzz-aeoo-vio
🗓 12 августа, среда
🕖 19:00–20:00 мск
Комьюнити-эфир 12 августа. Живая дискуссия про AI coding
Без докладов и презентаций -> просто собираемся и обсуждаем, как сейчас реально работаем с AI-разработкой
🎙 Максим Ключников -> техлид и автор канала Этихлид, много экспериментирует с AI в разработке и инженерных процессах
https://t.me/etechlead
🎙 Денис Киселёв -> AI SOLO founder, автор канала про AI-разработку, агентов и инженерные инструменты
https://t.me/deksden_notes
🎙 Артем Летюшев -> Tech PM в Twinby и гильдмастер AI Engineers Guild
https://t.me/junior_pm
Поговорим про свежие модели и tokens per task, спеки, архитектуру, ADR и AI SDLC. Дальше как пойдёт
Ссылка на событие https://luma.com/lwm1coqr
📍 Google Meet: https://meet.google.com/bzz-aeoo-vio
🗓 12 августа, среда
🕖 19:00–20:00 мск
👍5🔥3❤🔥1