pickyouragent.dev
97 subscribers
14 photos
15 links
updates for pickyouragent.dev
Download Telegram
Привет. Тут я буду сгружать все обновления по сайту https://pickyouragent.dev

Репозиторий: https://github.com/XaveScor/pickyouragent-dev
🔥1👏1
https://github.com/XaveScor/pickyouragent-dev/tree/master/snapshots

Так как накопилось достаточное количество фичей, то я сделал на гитхабе автоматическую таску, которая на каждое обновление сайта делает снепшот текущих фич.

Из снепшотов планирую сделать историческую визуализацию развития агентов и то насколько агент далёк по фичам от конкурентов.

Основная проблема - тяжело понять вес каждой фичи, но думаю, что для первой версии достаточно просто дать всем одинаковый вес и просто посмотреть что получится в будущем
👏1
Короч, есть такой тест для моделей как "поиск иголки в стоге сена". Он показывает насколько модель "забывает" данные из контекста.

Моя основная модель сейчас GLM 4.7, у которой эффективный контекст около 100к-120к токенов. Всё что дальше имеет куда хуже качество.
Но провайдер предоставляет контекстное окно около 200к токенов. И вот ни один агент не предоставляет возможность ограничить контекстное окно или же запускать автокомпакт раньше лимита провайдера.

И вот этой фичи нет ни у кого из тестируемых агентов. Такое чувство, что люди не особо используют модели, отличные от моделей антропика, гугла или опенаи.
👍3🤔1
Возможно вы слышали как вчера antropic начала ограничивать свою подписку внутри сторонних клиентов(не claude code).
И это привело к тому, что OpenAI согласилось на добавление ОФИЦИАЛЬНОЙ подписки в opencode(а следовательно и в другие клиенты).

В связи с этим я решил начать мониторить поддержку разных подписок в рамказ pickyouragent.dev

Пока что набросал на скорую руку, но планирую активно поддерживать и этот список

@pickyouragent
👍6
Чатик, подскажите, пылызы. Есть ли агенты на рынке, которые могут работать как тонкий клиент на удалённой МОЕЙ машине? Т.е. не в облаке у провайдера, а у меня.

Агенты в облаках, по типу кодекса, слишком ограничены по фичам. Но у меня есть кейсы, когда у меня плохой коннект к провайдеру моделей, а работать надо
Сейчас пробую antigravity. Очень крутой редактор. Как минимум советую, потому что они пошли на шаг вперёд с планом: позволяют оставлять комментарии к каждому сегменту в плане. Это очень упрощает работу.

Но есть минусы: до комментариев додумались, а вот до "запустить выполнение" - нет. Надо как дебил писать "Implement" и переключаться в другой режим.

Ещё из плюсов: бесплатный доступ к моделям антропика и гугла.
P.S. этот же доступ работает и в опенкоде https://github.com/NoeFabris/opencode-antigravity-auth
причём мне понравился способ установки: просто в опенкоде написать

Install the opencode-antigravity-auth plugin and add the Antigravity model definitions to ~/.config/opencode/opencode.json by following: https://raw.githubusercontent.com/NoeFabris/opencode-antigravity-auth/dev/README.md
👍6❤1
Мде
https://ampcode.com/news/todos-are-done

Просто хочется показать фейспалм.

amp - это такой агент, который разрешает использовать только opus 4.5.

Вот мне интеерсно, почему ограничить модель можно, а вот включить обязательное создание тудушек в любом пайплайне - нельзя?
👍1
Сейчас заполняю отчёт по antigravity и возник такой вопрос:


У меня сложилось впечатление, что почти всем агентам не хватает такой фичи: форкнуть текущую беседу, реализовать какую-нибудь мелкую фичу и переписать весь план относительно уже нового состояния репозитория.

У вас бывают такие кейсы?
Из примеров: AGENTS.md криво написан или какие-то служебные либы кривоваты


Во всех агентах, в которых я работал для подобных вещей надо было прямо сурово так подзадолбаться, чтобы сделать промежуточную фичу только, а потом её втянуть в основное флоу
Апдейты на pickyouragent.dev:
• курсор поддерживает dual-mode(plan-mode/dual-model): вы можете подготовить план одной моделью, а выполнять его другой
• kilo code научился в иерархичные AGENTS.md(documentation/tree): теперь вы можете раскидывать свою документацию ближе к коду, а не хранить их только в корне
• opencode же научился в подписку копайлота. Причём она сделана не в обход провайдера, как это сделано с антропиком, а она официальна в сотрудничестве с MS

@pickyouragent
👍6
Чат, долгое время антропик позволял использовать свою подписку в opencode.

Подскажите, кто продолжает использовать эту подписку в опенкоде и когда вы сделали первый платёж за подписку?
Есть суровая гипотеза, благодаря твиттеру, что сейчас банят только новых пользователей, а старым так уж и быть - позволили продолжать сидеть через подписку
Апдейты:
• kilo code научился в подписку openai.

Вообще, в процессе отслеживания очень помогает такая технология древних как RSS и то, что на гитхабе они вормируются автоматически из релизов.
Но немного жалко то, что почти всё в современных агентах, судя по ченжлогам - это
а) багфиксы в tui интерфейсах
б) подключение новых провайдеров

Реальной работы над фичами не заметно(
👍2
Ещё апдейты по фичам за эту ночь:
• курсор: научились в сабагенты и расширили задавание вопросов на все режимы. Минорный апдейт
https://cursor.com/changelog/2-4
• Claude code придумали новую фигню, которая пересекается с текущими: tasks. Как это планируется применять на практике - решительно непонятно.
https://x.com/trq212/status/2014480496013803643

https://code.claude.com/docs/en/skills
Так же обнаружил, что claude code депрекейтит команды, позволяя вызывать скиллы и ставя на них флаг disable-model-invocation: true
Я всё ещё слежу за фичами агентов, но проект пока поставлен на паузу в наполнении контентом, так как я перевайбкодил и теперь просто не могу добавлять фичи(

https://t.me/xavescor_code/353

После рефакторинга закину все новые фичи на сайт
Ну, рефакторинг завершился немного раньше чем я ожидал.

Ничего не изменилось на страницах. Но это позволило мне сделать нормальную страницу по поводу существующих подписок

https://pickyouragent.dev/features/subscriptions/

После этого заполняю инфу по claude code и antigravity. И продолжаем исследовать агенты.

Так же из идей:
1. сделать rss ленту
2. выкладывать апдейты в twitter и прочие соц.сети
3. померять агенты в попугаях, так как люди любят графики и мерялки
👍3🔥3❤1💩1🤡1
Рефакторинг продолжается. Я решил, что надо заполнять не только поддержку, но и то как пользоваться каждой из фичей.

Новая структура будет выглядеть как-то так:
—-
зачем нужна фича и почему без неё жить невозможно
—-
Список агентов и как её использовать внутри неё.
Пока будет выглядеть как-то так
https://pickyouragent.dev/features/planmode/

Теперь можно и заполнять данные по остальным агентам
👍4🤡1
https://pickyouragent.dev
Обещанно прошёлся по клод коду. Изменения такие:

Plan Mode:
- ✅ Plan editing — Ctrl+G открывает редактор
- 🟡 Questions — работает, но ответы неинтерактивные (нет @-автокомплита)
- 🟡 Todos — поддерживается, но агент не создаёт их автоматически — нужно просить явно
- ❌ Orchestrator mode — нет
- ❌ Dual model — нет
Documentation:
- ✅ Skills — через SKILL.md файлы
Tools:
- ❌ Browser — Anthropic анонсировал бету, но настроить не удалось
- ❌ Linters — LSP заявлен, но непонятно как использовать
CLI Calling:
- ✅ Infinite tasks timeout — есть флаг run_in_background для девсерверов
- 🟡 Processes explorer — фоновые задачи видно, но управлять без модели нельзя
Specialized Modes:
- ❌ Ask mode — нет
- ❌ Debug mode — нет

Также переименовал "Agent Mode" → "Specialized Modes" и убрал фичу auto-merge.

Из планов:
за время рефакторинга утекло много воды и надо обновить инфу по всем остальным агентам. К примеру, в codex прилетел plan mode, что сильно меняет опыт использования агента.

А так же время добавлять фичи, которые не отражены в таблице:
• сабагенты
• mcp
• всякие рои от антропика и прочую фигню, которая не понятно как полезна и полезна ли в жизни
👍2👎1🔥1💩1
https://pickyouragent.dev
Основная задача - это понять какой агент лучше.

Я разметил фичи по баллам(как я чувствую) и теперь столбцы отсортированы в зависимости от количества баллов.

Да, может быть неидеально раскидано, но пока я так вижу.

Главное уточнение, я считаю что opencode должен быть на уверенном втором-третьем месте. Основная проблема - я описал ещё не все фичи.

Но пока живём так.
❤4👍2💩1
pickyouragent.dev

Небольшое обновление по агентам:
claude code подрос с 57.5 до 61 балла, так как мне подсказали, что оказывается можно управлять процессами из агента. За это отвечает команда /tasks или /bashes.
👍5💩2
pickyouragent.dev

Codex наконец-то добавил plan mode. И он вполне неплох. Пользоваться можно им через shift+tab или /plan.

В итоге рост по баллам: 28 -> 46. Но позиция в общем рейтинге не изменилась

Основные изменения по фичам:

Plan Mode:
- ✅ Questions — тут всё круто: можно задавать несколько вопросов подряд, смотреть их все до ответа, добавлять заметки(в отличии от остальных агентов)
- ❌ Plan editing — в доках написано Ctrl+G для редактора, но открывается пустой файл. Не работает.
- ❌ Dual model — нет
- ❌ Orchestrator mode — нет
- ❌ Todos — нет
Tools:
- ✅ Fetch data — работает! Codex спокойно ходит по URL и читает контент
CLI Calling:
- ❌ Infinite tasks timeout — девсервер не запустишь, Codex сам его прибивает через пару секунд
- ❌ Processes explorer — управлять фоновыми процессами нельзя
Model Management:
- ❌ Filtering — нет
- ❌ Region tuning — нет
Specialized Modes:
- ❌ Ask mode — нет
- ❌ Debug mode — нет
👍2💩1