Max Syabro and a Slop Driven Development
955 subscribers
514 photos
51 videos
10 files
414 links
@syabro_chats в роли акына: что вижу то пою.
- Запускаю presync.io
- Web, tech, management.
Download Telegram
Звучит прикольно
❤7
В Opus 4.7 System Prompt добавили "инициативное" поведение

When a request leaves minor details unspecified, the person typically wants Claude to make a reasonable attempt now, not to be interviewed first. Claude only asks upfront when the request is genuinely unanswerable without the missing information (e.g., it references an attachment that isn’t there).

When a tool is available that could resolve the ambiguity or supply the missing information — searching, looking up the person’s location, checking a calendar, discovering available capabilities — Claude calls the tool to try and solve the ambiguity before asking the person. Acting with tools is preferred over asking the person to do the lookup themselves.


Я как раз адаптировал системный промпт в Pi себе, заменив это на более строгое - "Разбираемся, потом спрашиваем а не гадаем"
<acting_vs_clarifying>
When something is unclear, ambiguous, or underspecified, Pi Agent first thinks about how to clarify it from the data already available in the conversation, files, attachments, and tools. Pi Agent should inspect what it already has before proceeding.

If the ambiguity remains after checking the available data and tools, Pi Agent asks the user a focused clarification question before continuing. Pi Agent does not guess, invent missing details, or fill gaps with made-up assumptions.

Once the needed details are clear, Pi Agent sees the task through to a complete answer rather than stopping partway. When tools return results, Pi Agent uses those results directly and addresses each part of the request.
</acting_vs_clarifying>
👍5
Для тех кто хочет быстро вкатиться в Pi и схочет чуть более привычного экспириенса Claude/Codex то вот есть неплохая готовая сборка от васяна

http://lazypi.org/
👍8
😁10❤7😱3
Вы думаете что я агентов учусь от хорошей жизни писать?
Вот прислали "разобраться" - надо понять как там 1100 селектов работает на VBA :)

Надпись на картинке 'пизда"
😁4
This media is not supported in your browser
VIEW IN TELEGRAM
В Claude Code добавили рекап. Это такой краткий саммари чтобы понять какого хера тут вообще происходит. 100% топовая QOL фича!

https://code.claude.com/docs/en/interactive-mode#session-recap
🔥4
TLDR: за месяц в Claude Code вылезли три независимых бага, которые вместе выглядели как деградация модели. API они не затронули. Всё починили к 20 апреля, подписчикам сбросили usage limits.

https://www.anthropic.com/engineering/april-23-postmortem

Anthropic наконец-то разобрались что творилось с Claude Code последние недели, пока половина твиттера писала про тупеющую модель. На деле накатили три независимых изменения в разное время, поэтому картина была мутной.

4 марта дефолтный reasoning effort переключили с high на medium: в режиме high модель иногда думала так долго, что UI зависал. В фидбэке написали, что готовы ждать дольше ради качества, а низкий effort включат сами для простых задач. 7 апреля откатили. Теперь по дефолту стоит xhigh для Opus 4.7 и high для остальных.

26 марта завезли оптимизацию кэша. Задумка простая: если сессия простояла больше часа, предыдущие thinking-блоки должны были чиститься один раз, чтобы следующий запрос обошёлся дешевле. Баг чистил их на каждом запросе до конца сессии. Модель продолжала работать без памяти о том, зачем делала то что делала. Отсюда забывчивость, повторы и странный выбор тулов. Бонусом постоянно промахивался кэш, что объясняет отдельные жалобы про быстро сгорающие лимиты.

Чинили больше недели. Баг сидел на стыке context management, API и extended thinking, прошёл code review, юнит-тесты, e2e и dogfooding. Нашли, когда натравили Opus 4.7 на те самые PR через Code Review; Opus 4.6 на тех же данных баг не увидел. Починили 10 апреля в v2.1.101.

16 апреля в системный промпт добавили ограничение: keep text between tool calls to ≤25 words. Keep final responses to ≤100 words unless the task requires more detail. На внутренних эвалах регрессий не было, промпт ушёл в прод — и это оказалась та самая инструкция, которая посадила качество кодинга. Уже при расследовании прогнали расширенный набор эвалов, по одной убирая строки из промпта: без этой конкретной Opus 4.6 и 4.7 показывали на одной из эвалок на 3% лучший результат. Откатили 20 апреля.

Разобрались не сразу. Изменения били по разным срезам трафика, жалобы первую неделю-две были неотличимы от шума в фидбэке, а внутренние эвалы проблему не воспроизводили.

Теперь обещают посадить больше внутренних сотрудников на публичный билд вместо тестового. Для системного промпта заводят расширенный набор эвалов, построчные аблейшны, soak-периоды и постепенный роллаут. Code Review допилят и выложат наружу.
🔥7❤1👍1
DeepSeek V4

🔹 DeepSeek-V4-Pro: 1.6T total / 49B active params. Performance rivaling the world's top closed-source models.
🔹 DeepSeek-V4-Flash: 284B total / 13B active params. Your fast, efficient, and economical choice.


https://x.com/deepseek_ai/status/2047516922263285776

Неделя обещает быть томной

Веса тут:
https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro

PS про GPT-5.5 вы и так в курсе, писать не буду)
PSS Где там M5 Ultra 512?
❤1
Картинки в ГПТ СЛЕГКА прокачались в плане текста конечно...
Ja perdole
😁7👍1😱1
https://www.quotio.dev/

Quotio — менюбар-приложение для macOS, объединяет подписки Claude, Gemini, OpenAI Codex, Qwen, Antigravity и ещё с десяток провайдеров в общий пул. Free, Apple Silicon only.

Под капотом — CLIProxyAPI, локальный Go-прокси: ходит в подписки через OAuth и выставляет их как OpenAI/Gemini/Claude-совместимые эндпоинты. Любой совместимый агент получает доступ к этим квотам без API-ключей.

Находит установленные Claude Code, OpenCode, Amp CLI, Factory Droid и в один клик настраивает их на прокси.

Между аккаунтами работает фейловер по стратегиям Round Robin и Fill First. Когда у одного кончается квота, запросы уходят на следующий. Несколько подписок работают как один пул.

Бинарь не подписан, для запуска нужен xattr -cr /Applications/Quotio.app. Под винду есть форк ProxyPilot.
🔥3🤔1
GLM 5.1 таки наш пацан если вовремя выдать леща
А вот GPT не хочет в подобном учавствовать
😁14❤2
Остриков пилит агентов
Записали с Максом @syabro_chats первый собес по агентам, получилось круто. Агент был написал ровно за 1 час, агент работает, все части задачки были реализованы, Макс - красава! Вердикт - HIRE 📹 https://youtu.be/kSLDF91V-Wo 00:00 — Откуда взялась идея и…
После этого подумал что все-таки в Claw есть смысл Начал собирать потихоньку свой. Пока готова база которая держит контекст, и умеет допиливать себя :)

Решил не делать прям агента-агента, а через pi cli.
systemd --user держит tmux session Work-Pi.
Внутри неё запускается pi из ~/Work, но с фиксированной сессией через pi --session ~/Work/agent/session.jsonl.

Пока так, мошт оверинжинеринг но:
~/Work/agent/work-pi-tmux-watchdog — watchdog, который проверяет tmux Work-Pi и поднимает его обратно, если сессия умерла.
~/Work/agent/work-pi-tmux.service — user systemd service.
~/.config/systemd/user/work-pi-tmux.service — symlink на service из ~/Work/agent.

~/Work/agent/session.jsonl — symlink на закреплённую Pi-беседу - тут точно надо куда-то подвинуть. Симлинк пока был тупо чтобы была история переписки сразу в телеге.

Итого:
systemd --user → watchdog → tmux Work-Pi → pi --session ~/Work/agent/session.jsonl

Плюс Telegram допиливаю свой форк https://github.com/syabro/pi-telegram

PS и добавил тул auto_reload который позволяет пи рестаровать себя если pi -p "ping" выполнился нормально в качестве защиты от сломанного кода
❤1🔥1
https://github.com/alchaincyf/huashu-design/blob/master/README.en.md

huashu-design (хуяши хихи) — skill для агентов, который пытается сделать из Claude Code/Cursor/Codex/OpenClaw маленькую дизайн-студию в терминале.

Ставится командой:

npx skills add alchaincyf/huashu-design

Дальше агенту можно сказать что-то вроде «сделай кликабельный iOS-прототип», «собери презентацию в PPTX», «преврати эту логику в 60-секундную анимацию» или «дай три визуальных направления». На выходе обещают HTML-прототипы, MP4/GIF, редактируемые PPTX, PDF/PNG/SVG для инфографики.

Главная полезная часть тут не генерация красивых градиентов. Автор закопался в процесс, который обычно отличает нормальный дизайн от слопа: сначала собрать бренд-ассеты, проверить логотипы, продуктовые рендеры, UI-скриншоты, цвета и шрифты, зафиксировать всё в brand-spec.md, а уже потом рисовать.

Это правильная мысль. Большая часть «AI-дизайна» выглядит плохо не потому, что модель не умеет CSS, а потому что она начинает с пустого холста и галлюцинирует бренд из памяти. В huashu-design это прибито правилом: если задача про конкретный продукт, сначала WebSearch, проверка существования, статуса, версии и спецификаций.

По сути, продукт тут — не GUI и не «ещё один генератор макетов». Продукт — это хорошо описанный рабочий процесс для агента: какие вопросы задать, какие ассеты собрать, где проверить факты, когда показать черновик, как экспортировать результат.

ЗЫ На скрине попросил собрать лендинг вместо pi.dev (загрузил на http://pi-agent.surge.sh/). Скилл честно собрал пару мд файлов данных и надергал ассетов из веба.
ЗЫЫ Пока писал пост он там дергал скрины плейврайтом и чот продолжал фиксить в дизайне.
❤7