DEKSDEN notes
2.92K subscribers
590 photos
10 videos
3 files
649 links
Мои заметки на разные темы, уровень - "для продолжающих")
Vibe Coding -> AI SWE, AI Coding Tools, Agents: Claude Code, Codex, news, links
Чат (!!!): https://t.me/+B1fB3sZbaVthMDhi

(с) 2025-2026, @deksden
Download Telegram
⚪️ Промптинг - отрицательные инструкции


Нынче развлекаюсь тестами более тупых моделей чем фронтир на обычных агентных флоу. Я давно работал с агентными флоу только на фронтире (конечно, простые модели были в апи в софте, но там другая специфика).

А тут в связи с практически "бесплатностью" луны для лимитов, возникла необходимость посмотреть какие стадии флоу нормально делаются моделями попроще.

▶️ Столкнулся с таким эффектом: отрицательные иснтрукции работают крайне плохо. Столкнулся с этим на теме роутинга задачи на выполнение с той или иной детальностью. Агенты на слабых моделях упорно игнорируют инструкции по теме "не запускай субагентов в случае простых задач".

Как бороться? Делаем реверс логики. Вместо "не запускай" переписываем этот блок так: по-умолчанию никаких субагентов. Запускать субагентов разрешается в таких случаях: чек-лист.

То есть мы перевели отрицательную инструкцию "не запускай, если ..." в положительное правило - "запускай, если ...". Такое работает хорошо даже на простых моделях.

Реверс логики не всегда естественный для человека - люди все таки воспринимают отрицательные инструкции получше.

Нет, такой подход не решает проблему следования инструкциям - он просто снижает вероятность НЕ следования инструкциям, сформирвоанным "негативно".

Пряник и тут эффективнее - особенно если им бить))

Кто то замечал подобный эффект? как боролись?

@deksden_notes
👍17🔥9
This media is not supported in your browser
VIEW IN TELEGRAM
🤖 ChatGPT, Claude, Cursor, Gemini - всё в одном месте, не ищи по разным сайтам!

🏃‍♂️ Просто пиши - выдам быстро | @dobrovskiys

⚠️ САМОЕ ВАЖНОЕ! ЦЕНЫ!
- Chat GPT Plus/Pro
- Gemini Pro - от 1$ | Есть опт
- Claude Pro/Max | Claude API
🔝Может ты искал Higgsfield, Kiro, Manus, HeyGen, GROK, Kling, OpenWonder, ElevenLabs, Notion, Loveable, Adobe, Canva, Gamma, n8n, Figma, Factory и многие другие подписки? Они у нас есть!


💵Dobrovski’s Market - Твой проводник в мир подписок!

✈️ Купить ChatGPT | Gemini
Please open Telegram to view this post
VIEW IN TELEGRAM
🥴8👍3🔥31
This media is not supported in your browser
VIEW IN TELEGRAM
Rejudge — независимая проверка для ИИ-агентов.

https://rejudge.syabro.com/ru/
https://github.com/syabro/rejudge

Выкатываю еще один свой инструмент в паблик

Код, который написал агент, можно проверить четырьмя способами, где каждый следующий способ ловит больше предыдущего:

I. Та же сессия, та же модель.
Агент перечитывает свой код. Он уже решил, что код правильный, и повторное чтение это решение не меняет.

II. Новая сессия, та же модель.
Контекст чистый, модель прежняя. У неё то же обучение и те же привычки, поэтому она пропускает ошибки, которые написала бы сама.

III. Другая модель.
Другая модель действительно находит настоящие ошибки. Но теперь у вас два мнения, и когда они расходятся, решать, кто прав, приходится вам.

Я сделал дальше:

IV. Rejudge: три модели и судья.
Все три модели получают один и тот же вопрос одновременно. Каждая работает в изолированном контексте и сама вызывает инструменты, поэтому ни одна не видит, что делают другие. Судья читает все три отчёта, задаёт уточняющие вопросы там, где они расходятся, и пишет один ответ.

Плюс агент может отправить дозапрос по session-id в Rejudge если есть что-то что не понравилось.

Внутри pi-sdk с поддержкой все провайдеров которые поддерживает Pi.

У меня rejudge работает на OpenCode Go (линк реферальный, $5 вам, $5 мне) за $10. Но честно перестало хватать, ибо стал юзать на любой чих, докупил еще один акк. Если есть альтернатива интереснее подскажите в комментах.


{
"reviewers": [
"opencode-go/deepseek-v4-pro@xhigh",
"opencode-go/minimax-m3@xhigh",
"opencode-go/mimo-v2.5-pro@xhigh"
],
"judge": "opencode-go/glm-5.2@medium"
}


В комплекте
rejudge CLI тулза для всех агентов
/rejudge и /rejudge-diff скиллы для работы с Rejudge в целом и проверки диффов, например перед коммитом или на PR
• Pi-extension с rejudge tool для красивого UI и более кошерной коммуникации агенту.

В комментах отвечу на вопросы.

В планах
• Прогнать на DeepSWE, посмотреть что получится
• Допинать /rejudge-dx-review skill
• Интегрировать мой websearch

Установка тут:
https://rejudge.syabro.com/ru/#install

Как обычно с вас лайк, шер, репост, подписка, поглатить ближайшего котика, вот это все.

Ваш, @syabro_notes

#opensource #mit
🔥148👍3❤‍🔥1👻1
⚪️ Claude Sonnet 5 остается дешевкой


По мнению антропиков - они решили сохранить на постоянку акцию со снижением цен на Sonnet, которую объявили при запуске модели. Вместо "стандартной" цены в $3/$15 у нас остаётся $2/$10

Это, конечно, хорошо

Но воркер на луне стоит $0.2/$1.2 - это почти х10 дешевле.
Дорогая терра стоит на уровне $2/$12. Видимо дороже её не хочет остаться антропик.

Но у антропика "выше" по иерархии ещё 2 модели..

В общем, посмотрим на ценовые манёвры фронтира


@deksden_notes
💯5🤣5🔥3😁1
⚪️ Muse Glimmer бенчмарки

Интересно, что выше Gemma 4! Неплохо Марк вернулся к опенсорсу (в своём классе, конечно).

Почти уровень кими 2.5, но размер то сильно меньше.

Qwen3.6 27B всё равно получется поумнее - что лишний раз говорит о крутости квена в сегменте услоно мелких моделек.


🔗 Анонс бенча: https://x.com/ArtificialAnlys/status/2086916150278111551
🔗 Бенч на оффсайте: https://artificialanalysis.ai/models/muse-glimmer


@deksden_notes
👍3🤔2🔥1
⚪️ Codex Reset


Тибо сказал - тибо сделал


@deksden_notes
🫡24🔥2
Forwarded from Андрей
Agent Lifecycle Kit: управляемая работа с ИИ-инструментами для разработки

Кодовый агент — это инструмент с моделью ИИ, который по текстовой задаче может изучить проект, изменить файлы и запустить проверки. К таким инструментам относятся Codex, Claude Code, Cursor, OpenCode, Qwen Code и другие.

На простой задаче достаточно получить готовое изменение. Но при работе над архитектурой, безопасностью или большой функцией важно также понимать:

  - какая цель была поставлена;
  - что именно разрешено менять;
  - какие этапы нужно пройти;
  - какие проверки обязательны;
  - почему результат можно считать принятым.

Agent Lifecycle Kit (ALK) организует этот процесс от постановки задачи до подтверждённого завершения.

ALK помогает:

  - принять задачу из текста, Markdown-файла или внешнего документа;
  - провести исследование и подготовить план;
  - зафиксировать требования, критерии приёмки и границы изменений;
  - разделить работу на последовательные этапы;
  - сохранить состояние задачи и продолжить её позже;
  - проверить результат относительно утверждённого плана;
  - собрать подтверждения проверок;
  - принять результат или зафиксировать причину блокировки.

Главное отличие ALK от кодовых агентов в разделении ответственности:

  - кодовый агент анализирует проект, пишет код и выполняет проверки;
  - ALK управляет процессом, границами, состоянием, подтверждениями и приёмкой результата.

ALK не привязан к одной модели или одному инструменту. Подключения к Codex, Claude Code, Cursor, OpenCode, Qwen Code, Goose, Gemini CLI и другим инструментам выполняются через адаптеры. При этом правила жизненного цикла остаются едиными.

Для задач разного уровня используется соразмерный контроль. Небольшая механическая задача проходит короткий путь. Архитектурная, связанная с безопасностью или несколькими исполнителями, получает более строгие проверки.

Дополнительная проверка несколькими моделями включается по необходимости. Можно использовать любые доступные сочетания инструментов и моделей: например, один инструмент готовит план, а другие проверяют исследование, архитектуру или  реализацию. Если доступна только одна модель, дополнительная проверка не требуется.

ALK работает с большими, малыми и локальными моделями. Компактные задания, ограничения ресурсов и повторяемые проверки помогают экономить контекст, сохраняя требования к качеству.

Подробнее:

Быстрый старт (https://github.com/avksp/agent-lifecycle-kit/blob/main/docs/ru/quickstart.md)

Архитектура системы (https://github.com/avksp/agent-lifecycle-kit/blob/main/docs/ru/architecture/system-architecture.md)

Как ALK работает с разными задачами (https://github.com/avksp/agent-lifecycle-kit/blob/main/docs/ru/guides/how-alk-works.md)

Сравнение с похожими инструментами (https://github.com/avksp/agent-lifecycle-kit/blob/main/docs/ru/reference/project-comparison.md)

Репозиторий проекта (https://github.com/avksp/agent-lifecycle-kit)

#opensource #опенсорс
🔥52🤔1
⚪️ Взлом ризонинга фронтира


Тут люди взломали ризонинг у антропиков, клозедов, гугла. Те самые шифрованные мысли моделей! omfg

Почитайте сами чего и как:

🔗 Почитайте тред: https://x.com/kotekjedi_ml/status/2087147042888114428

Из проблем: даже если в трейсах агентов у вас нету данных, то в мыслях моделей они вполне могут встретиться

Ну и праздник у китайских вендоров: то, что тщательно шифровали буржуи, легко ломается. Шило - как водится, не удержали.

@deksden_notes
🔥9😱8👍31
⚪️ Grok Bot


Маск выпускает Grok Bot. Продукт совместный с Курсором - на ios разработчиком числится Anysphere, подписки работают Курсоровские в том числе.

Это такой cowork, но подключённый к облачной vm, которая выделяется пользователю (не боту, на всех ботов пользователя - одна эта машина, и они работу могут передавать друг другу).

Управялем им с приложений macos/win/ios, android будет позже. Так как агент в облаке на vm, работает даже когда твой комп выключен.

‼️ В общем, интересно, конечно, НО есть одно большое НО - работает только на максимальных подписках - Курсор ультра и Грок СУПЕР Хеви.

Получилось как ChatGPT Work который совмещён между облачным режимом (где и у chatgpt есть под капотом немаленькая vm, кто не знает - спросите у него сами про доступный комп) и локальным агентом в приложении.

Мне по описанию показалось что у Маска сделано логичнее чем у chatgpt.

🔗 Промо - посмотрите, первая картинка интерактивная, можно тыкать: https://x.ai/bot
🔗 Блог : https://x.ai/news/introducing-grok-bot

——

Upd 1️⃣ : SuperGrok Heavy теперь работает как Cursor Ultra план. Можно логинится в курсор своим X аккаунтом

@deksden_notes
5👍2
⚪️ Codex app теперь под Linux (preview)


Не прошло и несколько лет, как построенный на мультиплатформенном электроне Кодекс апп наконец то смогли запустить на линухах! Ура

Конечно, можно и ранее было юзать неофициальные репаки - но сейчас можно юзать официальные.

Поддерживаются:

• Ubuntu 24.04 LTS and 26.04 LTS
• Debian 13
• Fedora 43 and 44

@deksden_notes
🔥16👍8🎉7🐳3😱21
⚪️ Grok 4.6 и Bot на SuperGrok


Тут Илон пояснил за сабж

1) Grok 4.6 "позже на этой неделе"
2) Grok Bot будет расширен на другие тиры как пофиксят начальные проблемки - но сроков нету


@deksden_notes
🔥5👍4😁21
⚪️ Codex Reset завтра?


Вот как такое понимать? Если завтра, то включаем fast. Если нет - попадаем на 4 скучных дня))

Вот и гадаем. Я склоняюсь что нас ждёт ресет. Но уже немного утомляет неопределённость. Начните их продавать, наконец!

@deksden_notes
🙏11👍43😁2👻1
Forwarded from Junior AI PM
#иное
Комьюнити-эфир 12 августа. Живая дискуссия про AI coding

Без докладов и презентаций -> просто собираемся и обсуждаем, как сейчас реально работаем с AI-разработкой

🎙 Максим Ключников -> техлид и автор канала Этихлид, много экспериментирует с AI в разработке и инженерных процессах
https://t.me/etechlead

🎙 Денис Киселёв -> AI SOLO founder, автор канала про AI-разработку, агентов и инженерные инструменты
https://t.me/deksden_notes

🎙 Артем Летюшев -> Tech PM в Twinby и гильдмастер AI Engineers Guild
https://t.me/junior_pm

Поговорим про свежие модели и tokens per task, спеки, архитектуру, ADR и AI SDLC. Дальше как пойдёт

Ссылка на событие https://luma.com/lwm1coqr

📍 Google Meet: https://meet.google.com/bzz-aeoo-vio
🗓 12 августа, среда
🕖 19:00–20:00 мск
👍5🔥3❤‍🔥1