Два свежих репозитория про то, как LLM становятся лучше
slime (7к⭐ ) - фреймворк для дообучения моделей на реальных задачах. Если агент пишет код, вызывает инструменты или решает задачу в несколько шагов, slime помогает собирать такие попытки, оценивать результат и улучшать модель.
DeepSpec (1к⭐ ) - проект DeepSeek для ускорения ответов. Идея простая: маленькая модель быстро набрасывает продолжение, большая модель проверяет сразу несколько токенов, и генерация идет быстрее.
Отдельно разобрал, как работает обучение агентов на попытках и ошибках через ART (10.2к⭐ ), GRPO и RULER:
📎 Как дообучать LLM
чат
slime (7к
DeepSpec (1к
Отдельно разобрал, как работает обучение агентов на попытках и ошибках через ART (10.2к
чат
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2❤1
Компания из одного человека обычно ломается не из-за нехватки идей. Чаще - из-за памяти и повторяемости.
Когда решения, клиентский контекст, заметки и черновики живут в разных местах, владелец быстро становится главным хранилищем, исполнителем и напоминалкой для самого себя.
В статье разобран рабочий контур для соло-предпринимателя: Obsidian как память, Claude Code как обработчик знаний, Claude Cowork как исполнитель для файлов, Hermes Agent как фоновый оператор в Telegram с навыками и расписаниями.
📎 Компания из одного человека: рабочая система на Obsidian, Claude и Hermes
чат
Когда решения, клиентский контекст, заметки и черновики живут в разных местах, владелец быстро становится главным хранилищем, исполнителем и напоминалкой для самого себя.
В статье разобран рабочий контур для соло-предпринимателя: Obsidian как память, Claude Code как обработчик знаний, Claude Cowork как исполнитель для файлов, Hermes Agent как фоновый оператор в Telegram с навыками и расписаниями.
чат
Please open Telegram to view this post
VIEW IN TELEGRAM
Telegraph
Компания из одного человека: рабочая система на Obsidian, Claude и Hermes
Компанию из одного человека редко ломает нехватка идей. Чаще она ломается на памяти, производстве и повторяемости. В голове лежат решения, в заметках - куски исследований, в чатах - обещания клиентам, в файлах - черновики, которые никто больше не видит целиком.…
👍5
Deepsec 4к ⭐ - сканер уязвимостей (агент) от Vercel Labs
Он сначала быстро проходит репозиторий правилами на регулярных выражениях и отмечает подозрительные места. Потом агент для кода читает файлы, контекст проекта из
🔵 автоматически использует как фолбек
🔵 работает по стадиям:
🔵 хранит состояние в
🔵 для PR есть
🔵 свои правила поиска можно писать под фреймворк, авторизацию, RPC или внутренний SDK
Старт:
Честно предупреждают про стоимость: полный прогон большой кодовой базы может стоить тысячи долларов. Нормальный вход - начать с
чат
Он сначала быстро проходит репозиторий правилами на регулярных выражениях и отмечает подозрительные места. Потом агент для кода читает файлы, контекст проекта из
INFO.md и решает, есть ли реальная уязвимость.claude/codex подписку, либо настраиваете Vercel AI APIscan → process → revalidate → enrich → export.deepsec/data, поэтому упавший запуск можно повторить, уже обработанные файлы он пропуститprocess --diff: проверяет только измененные файлы и готовит комментарий в MarkdownСтарт:
npx deepsec init cd .deepsec && pnpm install pnpm deepsec scan pnpm deepsec process pnpm deepsec revalidateЧестно предупреждают про стоимость: полный прогон большой кодовой базы может стоить тысячи долларов. Нормальный вход - начать с
--limit 50, заполнить короткий INFO.md, прогнать HIGH через revalidate, а потом добавить правила под свои реальные точки входа.чат
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3
Karpathy недавно дал хорошую рамку для агентной разработки: агентов уже мало просто запустить. Их нужно проектировать через спецификации, evals, ревью, безопасность, наблюдаемость и понятный путь до production.
В📎 статье показано, как Google Agents CLI пытается собрать это в один процесс: установка skills для coding agent, сборка RAG-агента, локальные проверки, eval suite, развертывание в Agent Runtime и публикация в Gemini Enterprise.
Если делаете внутренних ассистентов, RAG или агентов на ADK, это хороший пример того, как довести прототип до сервиса для команды.
чат
В
Если делаете внутренних ассистентов, RAG или агентов на ADK, это хороший пример того, как довести прототип до сервиса для команды.
чат
Please open Telegram to view this post
VIEW IN TELEGRAM
Telegraph
Agentic Engineering с нормальными инструментами: Google Agents CLI на практике
Karpathy назвал Agentic Engineering дисциплиной для работы с агентами в боевых системах. В ней разработчик отвечает за спецификацию, eval loops, ревью изменений, безопасность и качество результата. Проблема в том, что реальный цикл разработки агента обычно…
👍1
Hermes Agent получил апдейт для больших multi-agent запусков🔱
Главное -
Для нас это означает меньше зависаний, когда параллельно живут сессии, сигналы активности и Kanban-задачи.
Второй апдейт -
чат
Главное -
AsyncSessionDB: обращения к SQLite в gateway вынесли с event loop в рабочий поток. Для нас это означает меньше зависаний, когда параллельно живут сессии, сигналы активности и Kanban-задачи.
Второй апдейт -
/usage. Теперь в чате видно, куда уходит контекст: системный промпт, инструменты, правила, skills, MCP, subagents, memory и сам диалог.чат
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥6
Вышла Claude Sonnet 5 💬
Лучше предшественника, слабее опуса. Обновление рабочей лошадки.
Чат | CloseRouter
Лучше предшественника, слабее опуса. Обновление рабочей лошадки.
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2👎1
Media is too big
VIEW IN TELEGRAM
Claude Fable 5 вернут в течении суток 🎉
Ужесточили гарды, классификатор для модели. Еще чаще будет фолбекать на Opus 4.8 на запрещенных темах.
Доступна по подписке до 7 июля и только до 50% лимитов можно потратить.
Hermes Agent работает с web до 60 раз быстрее и в 49 раз дешевле🔱
🔵 Если страница до
🔵 Если больше - берут head+tail окно примерно 75/25
🔵 Полный текст сохраняют в
🔵 В ответ добавляют footer с путем к файлу и подсказкой для
🔵 Inline base64-картинки заменяют на
Главный инсайт из PR:
Мы платили LLM round-trip за сжатие markdown, который backend уже вернул чистым.
Ускорили не сам скрапинг, а post-processing после него. Убрали генерацию, чанкинг, синтез и ожидание auxiliary-модели. Сохранили доступ к полному тексту через файл, поэтому качество восстановления ответа осталось тем же.
Чат | CloseRouter
Ужесточили гарды, классификатор для модели. Еще чаще будет фолбекать на Opus 4.8 на запрещенных темах.
Доступна по подписке до 7 июля и только до 50% лимитов можно потратить.
Hermes Agent работает с web до 60 раз быстрее и в 49 раз дешевле
Web_extract перестал прогонять каждую большую страницу через LLM-саммаризатор.15000 символов - возвращают целикомcache/web/<slug>-<hash>.mdread_file[IMAGE: alt], чтобы не забивать контекстГлавный инсайт из PR:
Мы платили LLM round-trip за сжатие markdown, который backend уже вернул чистым.
Ускорили не сам скрапинг, а post-processing после него. Убрали генерацию, чанкинг, синтез и ожидание auxiliary-модели. Сохранили доступ к полному тексту через файл, поэтому качество восстановления ответа осталось тем же.
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6👎1
supermemory 28к ⭐ - память и контекст для AI-агентов, теперь полностью локально
Запуск:
На машине поднимается весь стек: graph engine, локальные embeddings, извлечение фактов, user profiles и Memory API. Модель выбираете сами: OpenAI, Anthropic, Gemini, Groq или офлайн через Ollama.
Хорошо ложится с Claude Code, Cursor, Codex, Hermes, LangChain, Vercel AI SDK. Агент может помнить проект, предпочтения, прошлые решения и доставать нужный контекст между сессиями.
Чат | CloseRouter
Запуск:
npx supermemory local supermemory-serverНа машине поднимается весь стек: graph engine, локальные embeddings, извлечение фактов, user profiles и Memory API. Модель выбираете сами: OpenAI, Anthropic, Gemini, Groq или офлайн через Ollama.
Хорошо ложится с Claude Code, Cursor, Codex, Hermes, LangChain, Vercel AI SDK. Агент может помнить проект, предпочтения, прошлые решения и доставать нужный контекст между сессиями.
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4🔥3❤2
Hermes Agent v0.18.0 - Judgment Release 🔱
Большой релиз про надежность длинных агентных задач. За окно закрыли около 1 950 issues/PR, полностью зачистили P0/P1 и зафиксировали ноль открытых критичных задач.
Что самое интересное, помимо MoA, /learn и /usage:
🔵
🔵 Появился журнал проверок для coding-задач: агент запоминает каноничные проверки проекта, запускает их и показывает статус через gateway.
🔵
🔵
🔵 Desktop стал ближе к coding cockpit: Projects, worktrees, review pane, multi-terminal и инструменты проекта для агента.
Hermes двигают к агенту, которому можно доверить длинную работу с понятным контрактом готовности и проверяемым результатом.
Чат | CloseRouter
Большой релиз про надежность длинных агентных задач. За окно закрыли около 1 950 issues/PR, полностью зачистили P0/P1 и зафиксировали ноль открытых критичных задач.
Что самое интересное, помимо MoA, /learn и /usage:
/goal получил контракты готовности. Теперь можно заранее описать, какой результат считается готовым, а Hermes сверяет работу с проверками, логами и данными.delegate_task теперь умеет запускать несколько субагентов в фоне. Отправили параллельно исследовать конкурентов, проверить модули или собрать данные - и продолжили чат. В конце приходит одна сводка./journey показывает, чему Hermes научился: memories и skills в виде таймлайна, с возможностью править и удалять. В desktop добавили memory graph.Hermes двигают к агенту, которому можно доверить длинную работу с понятным контрактом готовности и проверяемым результатом.
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍17
OpenWiki 945 ⭐ - CLI от LangChain, который пишет wiki для репозитория под кодовых агентов.
Запуск:
🔵 генерирует страницы про архитектуру, CLI, операции, source map и правила работы с кодом
🔵 обновляет wiki через
🔵 хранит метаданные последнего запуска в
🔵 умеет ежедневный GitHub Action, который открывает PR с обновлением документации
🔵 работает через OpenRouter, Fireworks, Baseten, OpenAI и Anthropic, плюс опционально трассирует запуск в LangSmith
Авто-wiki может закрепить ошибку агента. Поэтому безопасный режим - обновлять документацию через PR и ревьюить ее как код.
Чат | CloseRouter
AGENTS.md и CLAUDE.md быстро раздуваются, если складывать туда весь контекст проекта. OpenWiki выносит подробности в папку openwiki/, а в агентные инструкции добавляет короткую ссылку.Запуск:
npm install -g openwiki openwiki --initopenwiki --update, читая git status, git log и git diffopenwiki/.last-update.jsonАвто-wiki может закрепить ошибку агента. Поэтому безопасный режим - обновлять документацию через PR и ревьюить ее как код.
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7
Про простую вещь, которая часто дает больше скорости, чем апгрейд модели: нормальная карта рабочей области.
INDEX.md, канонические файлы, отдельный архив и понятные точки входа помогают агенту меньше искать и быстрее начинать работу.Идея Agent OS - вынести координацию в отдельный слой. Одна модель планирует, другая делает, третья проверяет. Самое важное здесь - роли, критерии готовности, логи маршрутизации и доказательства результата.
Loop engineering превращает агентную работу в повторяемый цикл: цель, состояние, проверка, стоп-условие. В статье разобран Karpathy Loop и следующий слой - loop, который улучшает саму стратегию поиска.
Полезная шкала для тех, кто запускает подагентов, worktrees, фоновые сессии и manager-agents. Автономность стоит повышать там, где есть sandbox, откат, проверки и evidence trail.
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5😱1
Разобрал около 100 ответов под опросом про Hermes. Получился хороший снимок того, как люди реально живут с агентами каждый день.
Главный паттерн - Hermes почти у всех уходит из терминала в рабочую среду:
- 55% используют Telegram, Discord, iMessage или другие мессенджеры
- 30% сидят в Desktop/браузере
- 30% все еще активно используют TUI/CLI
По моделям лидируют GPT/Codex - 35%. Дальше DeepSeek и локальные модели - по 25%, MoA/роутеры - около 20%. То есть схема уже не “одна лучшая модель”, а набор: сильная модель для сложных задач, дешевые или локальные воркеры для рутины.
Самое интересное - память. Obsidian, vault и markdown всплывают у 35%, встроенная память Hermes - у 20%, Honcho - у 10%. Люди явно хотят память, которую можно читать, синкать, коммитить и чинить руками.
По оркестрации: delegate_task и subagents - 25%, kanban и cron - примерно по 20%. А кто то всегда ведет разработку, отдавая кодинг задачи Claude/Codex CLI в отдельный tmux.
Skills упоминают чаще, чем MCP: 35% против 10%.
Хороший практический пример - статья Matthew Gunnin про память для двух агентов: OpenClaw и Hermes. У него память разделена на 4 слоя: markdown-файлы с identity и memory index, локальное сохранение фактов через Hindsight 17.9к⭐ , общий Obsidian/Nexus-лог для синхронизации агентов и gbrain 24.9к⭐ как поисковый слой поверх всего vault.
Самая полезная мысль оттуда: память агента - это не просто засунуть больше в контекст. Рабочая схема больше похожа на инфраструктуру: факты проходят от сессии к сессии, решения пишутся в проверяемые файлы, несколько агентов читают один общий state, а старые знания можно найти без загрузки всего архива в контекст.
Чат | CloseRouter
Главный паттерн - Hermes почти у всех уходит из терминала в рабочую среду:
- 55% используют Telegram, Discord, iMessage или другие мессенджеры
- 30% сидят в Desktop/браузере
- 30% все еще активно используют TUI/CLI
По моделям лидируют GPT/Codex - 35%. Дальше DeepSeek и локальные модели - по 25%, MoA/роутеры - около 20%. То есть схема уже не “одна лучшая модель”, а набор: сильная модель для сложных задач, дешевые или локальные воркеры для рутины.
Самое интересное - память. Obsidian, vault и markdown всплывают у 35%, встроенная память Hermes - у 20%, Honcho - у 10%. Люди явно хотят память, которую можно читать, синкать, коммитить и чинить руками.
По оркестрации: delegate_task и subagents - 25%, kanban и cron - примерно по 20%. А кто то всегда ведет разработку, отдавая кодинг задачи Claude/Codex CLI в отдельный tmux.
Skills упоминают чаще, чем MCP: 35% против 10%.
Хороший практический пример - статья Matthew Gunnin про память для двух агентов: OpenClaw и Hermes. У него память разделена на 4 слоя: markdown-файлы с identity и memory index, локальное сохранение фактов через Hindsight 17.9к
Самая полезная мысль оттуда: память агента - это не просто засунуть больше в контекст. Рабочая схема больше похожа на инфраструктуру: факты проходят от сессии к сессии, решения пишутся в проверяемые файлы, несколько агентов читают один общий state, а старые знания можно найти без загрузки всего архива в контекст.
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4❤1
Eсть способ снизить затраты в Fable 5 примерно на 70% - pxpipe 800⭐
Просто преобразуйте контекст Claude Code в изображение и настройте Fable (и не только) на распознавание текста😂
Чат | CloseRouter
Просто преобразуйте контекст Claude Code в изображение и настройте Fable (и не только) на распознавание текста
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯10😁2👍1
showcase-video.webm
5.2 MB
Вечерний набор на выходные: два репо для маленькой фабрики кодовых агентов
Parallel Code 811⭐ - desktop-интерфейс для mac и linux, где Claude Code, Codex, Gemini, Copilot и другие CLI работают параллельно, каждый в своем
repowise 2.9к⭐ - слой понимания репозитория для агента. Индексирует код, git-историю, архитектурные решения, health/risk и документацию, потом отдает это через MCP в Claude Code, Codex, Cursor и других клиентов.
Для Codex:
Хорошая связка для эксперимента: Parallel Code гоняет несколько агентов, repowise дает агентам карту проекта и помогает проверять изменения по риску и контексту.
Чат | CloseRouter
Parallel Code 811
git worktree. Создали несколько задач, агенты разошлись по веткам, дальше смотрите diff, CI, комментарии и мерджите удачные варианты.repowise 2.9к
Для Codex:
pip install repowise
repowise init --codex --provider codex_cli --yesХорошая связка для эксперимента: Parallel Code гоняет несколько агентов, repowise дает агентам карту проекта и помогает проверять изменения по риску и контексту.
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
Loop engineering для solo-разработчика начинается с вопроса: откуда агенту брать задачи?
Если проект делает один человек, backlog часто живет в голове. Поэтому первый loop должен не писать код, а превращать цель проекта в маленькие проверяемые задачи.
А потом только идем к реализации:
Hermes в такой схеме может работать как оркестратор: читает цель, метрики и диагностику, выбирает один узкий участок, пишет план и проверяет результат. Codex CLI работает как исполнитель: берет одну задачу, делает diff, запускает проверки и останавливается, если нужен продуктовый выбор.
Начинать стоит с файла вроде
📎 Как собрать автономный loop
Чат | CloseRouter
Если проект делает один человек, backlog часто живет в голове. Поэтому первый loop должен не писать код, а превращать цель проекта в маленькие проверяемые задачи.
цель → метрика → воронка → провал → маленький PRА потом только идем к реализации:
диагностика → узкое место → план → diff от Codex → тесты → деплой → отчетHermes в такой схеме может работать как оркестратор: читает цель, метрики и диагностику, выбирает один узкий участок, пишет план и проверяет результат. Codex CLI работает как исполнитель: берет одну задачу, делает diff, запускает проверки и останавливается, если нужен продуктовый выбор.
Начинать стоит с файла вроде
docs/product-loop.md: цель, метрика, границы поведения агента, воронка и правила выбора следующей задачи.Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
Telegraph
Loop engineering: как собрать автономный loop без пожара
Запрос к модели запускает человек. Автономный loop запускает следующий шаг сам: находит работу, вызывает агента, проверяет результат, чинит ошибку и повторяет проход до машинного стоп-сигнала. Главная цель loop engineering - построить систему, которая сходится…
👍8
David Ondrej выложил свои Agent Skills в open source
David Ondrej - основатель DeepAPI, OpenDataset и Vectal. Вчера он открыл репозиторий davidondrej/skills 450⭐ - личный набор скиллов, который, по его словам, собран из сотен часов проб и ошибок.
Внутри 30 скиллов по 5 категориям:
🔵
🔵
🔵
🔵
🔵
Самое полезное здесь - структура: каждый
Часть skills завязана на стеке David, но как библиотека паттернов для своих скиллов - очень годно.
Чат | CloseRouter
David Ondrej - основатель DeepAPI, OpenDataset и Vectal. Вчера он открыл репозиторий davidondrej/skills 450
Внутри 30 скиллов по 5 категориям:
agent-orchestration - запуск loops, Codex /goal, delegation, handoff, cmux, DeepSWEskill-authoring - как писать, улучшать, публиковать и раскатывать skills между агентамиresearch-and-web - browser harness, deep research, YouTube transcripts, web-поиск для Pithinking-and-docs - превращение идей в docs, ADRs, interview-style planning, “прожарь меня”ops-and-setup - VPS, setup, cyber audit, anti-sleep для macOS, кастомные модели в PiСамое полезное здесь - структура: каждый
SKILL.md превращает повторяемый агентный сценарий в маленькую инструкцию, которую можно подключать к Claude Code, Codex, Hermes или своим агентам.Часть skills завязана на стеке David, но как библиотека паттернов для своих скиллов - очень годно.
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
GitHub - davidondrej/skills: access to david ondrej's personal agent skills
access to david ondrej's personal agent skills. Contribute to davidondrej/skills development by creating an account on GitHub.
👍4❤2
4X DGX Spark для локальной MoA-сетки агентов
Парень из X собрал стек на Hermes: Qwen закрывает легкие задачи, Nemotron берет мультимодальный ввод, Two-Tower работает с длинными повторяемыми генерациями, DeepSeek-V4-Flash маршрутизирует, а Claude/Codex/Grok остаются редким облачным учителями.
Автор целится в около 90% AI-работы локально. Каждый сложный запрос, который ушел в облако, сохраняется в лог: задача, выбранный агент, ответ и исправление. Потом эти пары идут в LoRA-тренировку Gemma-4-12B, чтобы похожие задачи дальше закрывались на локальном стеке.
Главная ценность здесь - loop обучения из собственных логов:
Репозиторий пока выглядит как журнал сборки и каркас. Routing hooks, miner, LoRA harness и бенчи есть, но eval-gate и hot-swap еще описаны как ручной шаг.
Чат | CloseRouter
Парень из X собрал стек на Hermes: Qwen закрывает легкие задачи, Nemotron берет мультимодальный ввод, Two-Tower работает с длинными повторяемыми генерациями, DeepSeek-V4-Flash маршрутизирует, а Claude/Codex/Grok остаются редким облачным учителями.
Автор целится в около 90% AI-работы локально. Каждый сложный запрос, который ушел в облако, сохраняется в лог: задача, выбранный агент, ответ и исправление. Потом эти пары идут в LoRA-тренировку Gemma-4-12B, чтобы похожие задачи дальше закрывались на локальном стеке.
Главная ценность здесь - loop обучения из собственных логов:
Репозиторий пока выглядит как журнал сборки и каркас. Routing hooks, miner, LoRA harness и бенчи есть, но eval-gate и hot-swap еще описаны как ручной шаг.
Чат | CloseRouter
🔥7👍4
Если модель вроде Fable 5 уходит из подписки, последние часы стоит тратить на извлечение ее экспертизы в артефакты:
Короткий плейбук из 5 сценариев с готовыми промтами:
📎 Сделайте это в свой последний день работы с Fable
Чат | CloseRouter
CLAUDE.md, skills, критерии качества, дорожные карты, заметки и проверяемые цели.Короткий плейбук из 5 сценариев с готовыми промтами:
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
Telegraph
Когда сильная модель уходит из подписки: что забрать заранее
Сценарий: Fable 5 или другая сильная модель скоро выходит из обычной подписки и становится дорогой в токенах. Последние часы такого доступа лучше использовать для извлечения экспертизы. Цель - оставить после модели артефакты, которыми завтра смогут пользоваться…
😁3❤2🔥1
Свежая статья от Anthropic
📎 С чего начать loops в Claude Code
Раз уж мы говорим о Claude Code, есть полезный репозиторий, который позволяет клоду общаться с Codex.
Codex MCP Server 540⭐ - Используйте GPT в клоде как советника или оставьте на Claude только планирование, а всю реализацию отдавайте в Codex.
Чат | CloseRouter
Раз уж мы говорим о Claude Code, есть полезный репозиторий, который позволяет клоду общаться с Codex.
Codex MCP Server 540
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Собрал две статьи про harness для AI-агентов - слой, который превращает модель в рабочий процесс: контекст, loop, инструменты, проверки, права, память и подагенты.
📎 Как получать сильный результат от любой модели
Практический каркас: когда хватит одного промпта, а когда пора собирать систему вокруг агента. Там про
📎 Harness engineering для самоулучшающихся AI-систем
Более глубокий слой: как сама обвязка становится объектом оптимизации. Агентные системы начинают улучшать контекст, процесс, код harness, evals и механизмы поиска.
Чат | CloseRouter
Практический каркас: когда хватит одного промпта, а когда пора собирать систему вокруг агента. Там про
CLAUDE.md, объективные проверки, независимого verifier, hooks, permissions, skills, memory и MCP.Более глубокий слой: как сама обвязка становится объектом оптимизации. Агентные системы начинают улучшать контекст, процесс, код harness, evals и механизмы поиска.
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7
Media is too big
VIEW IN TELEGRAM
Shepherd 1.1к ⭐ - Git-like trace для AI-агентов
Идея простая: если кодовый агент сделал странную правку, обычного лога мало. Хочется вернуться ровно в момент перед ошибкой, посмотреть, что он собирался сделать, ответвить запуск и дать другому агенту попробовать другой путь.
Shepherd строит вокруг агента такую историю запуска:
🔵 каждый model call, tool call и изменение файлов становится событием в trace
🔵 управляющий агент может наблюдать за рабочими агентами и вмешиваться до конфликта
🔵 результат работы хранится сбоку как предложение: его можно принять, отклонить или выпустить отдельно
🔵 права задаются прямо в Python-сигнатуре: этому repo можно только читать, этому можно писать
🔵 в статье fork/revert для контейнерных задач занимал примерно 134-147 мс, плюс около 95% переиспользования prompt cache при ответе
Самый сильный пример - пара кодовых агентов в одном репозитории. Без supervisor они проходят CooperBench на 28.8%. С meta-agent, который смотрит их trace и вовремя делает inject/handoff/discard, результат вырос до 54.7%.
Реальная замена git? Нет. Git все еще остается для истории кода, PR и командной разработки. Shepherd работает уровнем выше: он хранит историю поведения агента и окружения, чтобы агентный запуск можно было откатить, разветвить и проверить.
Важная оговорка: публичный репозиторий сейчас alpha/dev preview. В пакете уже есть workspace, retained runs, changesets, trace и permissions, но самая красивая схема из arxiv про полноценные meta-agents поверх чужих запусков еще выглядит как исследовательская цель.
Для продакшна рано. Как направление для инфраструктуры для агентов - очень сильный сигнал: следующие агенты будут нуждаться не только в git, но и в версионировании собственных действий.
Чат | CloseRouter
Идея простая: если кодовый агент сделал странную правку, обычного лога мало. Хочется вернуться ровно в момент перед ошибкой, посмотреть, что он собирался сделать, ответвить запуск и дать другому агенту попробовать другой путь.
Shepherd строит вокруг агента такую историю запуска:
Самый сильный пример - пара кодовых агентов в одном репозитории. Без supervisor они проходят CooperBench на 28.8%. С meta-agent, который смотрит их trace и вовремя делает inject/handoff/discard, результат вырос до 54.7%.
Реальная замена git? Нет. Git все еще остается для истории кода, PR и командной разработки. Shepherd работает уровнем выше: он хранит историю поведения агента и окружения, чтобы агентный запуск можно было откатить, разветвить и проверить.
Важная оговорка: публичный репозиторий сейчас alpha/dev preview. В пакете уже есть workspace, retained runs, changesets, trace и permissions, но самая красивая схема из arxiv про полноценные meta-agents поверх чужих запусков еще выглядит как исследовательская цель.
Для продакшна рано. Как направление для инфраструктуры для агентов - очень сильный сигнал: следующие агенты будут нуждаться не только в git, но и в версионировании собственных действий.
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3