Agents Lab
959 subscribers
88 photos
45 videos
1 file
226 links
Обсуждаем AI агентов

Наш чатик https://t.me/openclaw_lab_community
Download Telegram
Hermes Agent получил апдейт для больших multi-agent запусков🔱

Главное - AsyncSessionDB: обращения к SQLite в gateway вынесли с event loop в рабочий поток.

Для нас это означает меньше зависаний, когда параллельно живут сессии, сигналы активности и Kanban-задачи.

Второй апдейт - /usage. Теперь в чате видно, куда уходит контекст: системный промпт, инструменты, правила, skills, MCP, subagents, memory и сам диалог.

чат
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥6
Вышла Claude Sonnet 5 💬

Лучше предшественника, слабее опуса. Обновление рабочей лошадки.

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2👎1
Media is too big
VIEW IN TELEGRAM
Claude Fable 5 вернут в течении суток 🎉

Ужесточили гарды, классификатор для модели. Еще чаще будет фолбекать на Opus 4.8 на запрещенных темах.

Доступна по подписке до 7 июля и только до 50% лимитов можно потратить.


Hermes Agent работает с web до 60 раз быстрее и в 49 раз дешевле 🔱

Web_extract перестал прогонять каждую большую страницу через LLM-саммаризатор.

🔵Если страница до 15000 символов - возвращают целиком
🔵Если больше - берут head+tail окно примерно 75/25
🔵Полный текст сохраняют в cache/web/<slug>-<hash>.md
🔵В ответ добавляют footer с путем к файлу и подсказкой для read_file
🔵Inline base64-картинки заменяют на [IMAGE: alt], чтобы не забивать контекст

Главный инсайт из PR:
Мы платили LLM round-trip за сжатие markdown, который backend уже вернул чистым.

Ускорили не сам скрапинг, а post-processing после него. Убрали генерацию, чанкинг, синтез и ожидание auxiliary-модели. Сохранили доступ к полному тексту через файл, поэтому качество восстановления ответа осталось тем же.

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6👎1
supermemory 28к - память и контекст для AI-агентов, теперь полностью локально

Запуск:
npx supermemory local
supermemory-server

На машине поднимается весь стек: graph engine, локальные embeddings, извлечение фактов, user profiles и Memory API. Модель выбираете сами: OpenAI, Anthropic, Gemini, Groq или офлайн через Ollama.

Хорошо ложится с Claude Code, Cursor, Codex, Hermes, LangChain, Vercel AI SDK. Агент может помнить проект, предпочтения, прошлые решения и доставать нужный контекст между сессиями.

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4🔥32
Hermes Agent v0.18.0 - Judgment Release 🔱

Большой релиз про надежность длинных агентных задач. За окно закрыли около 1 950 issues/PR, полностью зачистили P0/P1 и зафиксировали ноль открытых критичных задач.

Что самое интересное, помимо MoA, /learn и /usage:

🔵 /goal получил контракты готовности. Теперь можно заранее описать, какой результат считается готовым, а Hermes сверяет работу с проверками, логами и данными.

🔵 Появился журнал проверок для coding-задач: агент запоминает каноничные проверки проекта, запускает их и показывает статус через gateway.

🔵 delegate_task теперь умеет запускать несколько субагентов в фоне. Отправили параллельно исследовать конкурентов, проверить модули или собрать данные - и продолжили чат. В конце приходит одна сводка.

🔵 /journey показывает, чему Hermes научился: memories и skills в виде таймлайна, с возможностью править и удалять. В desktop добавили memory graph.

🔵 Desktop стал ближе к coding cockpit: Projects, worktrees, review pane, multi-terminal и инструменты проекта для агента.

Hermes двигают к агенту, которому можно доверить длинную работу с понятным контрактом готовности и проверяемым результатом.

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍17
OpenWiki 945 - CLI от LangChain, который пишет wiki для репозитория под кодовых агентов.

AGENTS.md и CLAUDE.md быстро раздуваются, если складывать туда весь контекст проекта. OpenWiki выносит подробности в папку openwiki/, а в агентные инструкции добавляет короткую ссылку.

Запуск:
npm install -g openwiki
openwiki --init

🔵 генерирует страницы про архитектуру, CLI, операции, source map и правила работы с кодом
🔵 обновляет wiki через openwiki --update, читая git status, git log и git diff
🔵 хранит метаданные последнего запуска в openwiki/.last-update.json
🔵 умеет ежедневный GitHub Action, который открывает PR с обновлением документации
🔵 работает через OpenRouter, Fireworks, Baseten, OpenAI и Anthropic, плюс опционально трассирует запуск в LangSmith

Авто-wiki может закрепить ошибку агента. Поэтому безопасный режим - обновлять документацию через PR и ревьюить ее как код.

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7
📎 Как ускорить Hermes Agent без смены модели

Про простую вещь, которая часто дает больше скорости, чем апгрейд модели: нормальная карта рабочей области. INDEX.md, канонические файлы, отдельный архив и понятные точки входа помогают агенту меньше искать и быстрее начинать работу.

📎Как создать Frontier Agent OS

Идея Agent OS - вынести координацию в отдельный слой. Одна модель планирует, другая делает, третья проверяет. Самое важное здесь - роли, критерии готовности, логи маршрутизации и доказательства результата.

📎 Loop engineering: метод Karpathy и следующий слой

Loop engineering превращает агентную работу в повторяемый цикл: цель, состояние, проверка, стоп-условие. В статье разобран Karpathy Loop и следующий слой - loop, который улучшает саму стратегию поиска.

📎 Уровни автономности AI-агентов

Полезная шкала для тех, кто запускает подагентов, worktrees, фоновые сессии и manager-agents. Автономность стоит повышать там, где есть sandbox, откат, проверки и evidence trail.

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5😱1
Разобрал около 100 ответов под опросом про Hermes. Получился хороший снимок того, как люди реально живут с агентами каждый день.

Главный паттерн - Hermes почти у всех уходит из терминала в рабочую среду:

- 55% используют Telegram, Discord, iMessage или другие мессенджеры
- 30% сидят в Desktop/браузере
- 30% все еще активно используют TUI/CLI

По моделям лидируют GPT/Codex - 35%. Дальше DeepSeek и локальные модели - по 25%, MoA/роутеры - около 20%. То есть схема уже не “одна лучшая модель”, а набор: сильная модель для сложных задач, дешевые или локальные воркеры для рутины.

Самое интересное - память. Obsidian, vault и markdown всплывают у 35%, встроенная память Hermes - у 20%, Honcho - у 10%. Люди явно хотят память, которую можно читать, синкать, коммитить и чинить руками.

По оркестрации: delegate_task и subagents - 25%, kanban и cron - примерно по 20%. А кто то всегда ведет разработку, отдавая кодинг задачи Claude/Codex CLI в отдельный tmux.
Skills упоминают чаще, чем MCP: 35% против 10%.

Хороший практический пример - статья Matthew Gunnin про память для двух агентов: OpenClaw и Hermes. У него память разделена на 4 слоя: markdown-файлы с identity и memory index, локальное сохранение фактов через Hindsight 17.9к, общий Obsidian/Nexus-лог для синхронизации агентов и gbrain 24.9к как поисковый слой поверх всего vault.

Самая полезная мысль оттуда: память агента - это не просто засунуть больше в контекст. Рабочая схема больше похожа на инфраструктуру: факты проходят от сессии к сессии, решения пишутся в проверяемые файлы, несколько агентов читают один общий state, а старые знания можно найти без загрузки всего архива в контекст.

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍41
Eсть способ снизить затраты в Fable 5 примерно на 70% - pxpipe 800

Просто преобразуйте контекст Claude Code в изображение и настройте Fable (и не только) на распознавание текста 😂

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯10😁2👍1
showcase-video.webm
5.2 MB
Вечерний набор на выходные: два репо для маленькой фабрики кодовых агентов

Parallel Code 811 - desktop-интерфейс для mac и linux, где Claude Code, Codex, Gemini, Copilot и другие CLI работают параллельно, каждый в своем git worktree. Создали несколько задач, агенты разошлись по веткам, дальше смотрите diff, CI, комментарии и мерджите удачные варианты.

repowise 2.9к - слой понимания репозитория для агента. Индексирует код, git-историю, архитектурные решения, health/risk и документацию, потом отдает это через MCP в Claude Code, Codex, Cursor и других клиентов.

Для Codex: pip install repowise
repowise init --codex --provider codex_cli --yes


Хорошая связка для эксперимента: Parallel Code гоняет несколько агентов, repowise дает агентам карту проекта и помогает проверять изменения по риску и контексту.

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
Loop engineering для solo-разработчика начинается с вопроса: откуда агенту брать задачи?

Если проект делает один человек, backlog часто живет в голове. Поэтому первый loop должен не писать код, а превращать цель проекта в маленькие проверяемые задачи.

цель → метрика → воронка → провал → маленький PR

А потом только идем к реализации:

диагностика → узкое место → план → diff от Codex → тесты → деплой → отчет

Hermes в такой схеме может работать как оркестратор: читает цель, метрики и диагностику, выбирает один узкий участок, пишет план и проверяет результат. Codex CLI работает как исполнитель: берет одну задачу, делает diff, запускает проверки и останавливается, если нужен продуктовый выбор.

Начинать стоит с файла вроде docs/product-loop.md: цель, метрика, границы поведения агента, воронка и правила выбора следующей задачи.

📎 Как собрать автономный loop

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍8
David Ondrej выложил свои Agent Skills в open source

David Ondrej - основатель DeepAPI, OpenDataset и Vectal. Вчера он открыл репозиторий davidondrej/skills 450 - личный набор скиллов, который, по его словам, собран из сотен часов проб и ошибок.

Внутри 30 скиллов по 5 категориям:

🔵 agent-orchestration - запуск loops, Codex /goal, delegation, handoff, cmux, DeepSWE

🔵 skill-authoring - как писать, улучшать, публиковать и раскатывать skills между агентами

🔵 research-and-web - browser harness, deep research, YouTube transcripts, web-поиск для Pi

🔵 thinking-and-docs - превращение идей в docs, ADRs, interview-style planning, “прожарь меня”

🔵 ops-and-setup - VPS, setup, cyber audit, anti-sleep для macOS, кастомные модели в Pi

Самое полезное здесь - структура: каждый SKILL.md превращает повторяемый агентный сценарий в маленькую инструкцию, которую можно подключать к Claude Code, Codex, Hermes или своим агентам.

Часть skills завязана на стеке David, но как библиотека паттернов для своих скиллов - очень годно.

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍42
4X DGX Spark для локальной MoA-сетки агентов

Парень из X собрал стек на Hermes: Qwen закрывает легкие задачи, Nemotron берет мультимодальный ввод, Two-Tower работает с длинными повторяемыми генерациями, DeepSeek-V4-Flash маршрутизирует, а Claude/Codex/Grok остаются редким облачным учителями.

Автор целится в около 90% AI-работы локально. Каждый сложный запрос, который ушел в облако, сохраняется в лог: задача, выбранный агент, ответ и исправление. Потом эти пары идут в LoRA-тренировку Gemma-4-12B, чтобы похожие задачи дальше закрывались на локальном стеке.

Главная ценность здесь - loop обучения из собственных логов:

Репозиторий пока выглядит как журнал сборки и каркас. Routing hooks, miner, LoRA harness и бенчи есть, но eval-gate и hot-swap еще описаны как ручной шаг.

Чат | CloseRouter
🔥7👍4
Если модель вроде Fable 5 уходит из подписки, последние часы стоит тратить на извлечение ее экспертизы в артефакты: CLAUDE.md, skills, критерии качества, дорожные карты, заметки и проверяемые цели.

Короткий плейбук из 5 сценариев с готовыми промтами:
📎 Сделайте это в свой последний день работы с Fable

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
😁32🔥1
Свежая статья от Anthropic
📎 С чего начать loops в Claude Code

Раз уж мы говорим о Claude Code, есть полезный репозиторий, который позволяет клоду общаться с Codex.

Codex MCP Server
540 - Используйте GPT в клоде как советника или оставьте на Claude только планирование, а всю реализацию отдавайте в Codex.

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
1
Собрал две статьи про harness для AI-агентов - слой, который превращает модель в рабочий процесс: контекст, loop, инструменты, проверки, права, память и подагенты.

📎 Как получать сильный результат от любой модели

Практический каркас: когда хватит одного промпта, а когда пора собирать систему вокруг агента. Там про CLAUDE.md, объективные проверки, независимого verifier, hooks, permissions, skills, memory и MCP.

📎 Harness engineering для самоулучшающихся AI-систем

Более глубокий слой: как сама обвязка становится объектом оптимизации. Агентные системы начинают улучшать контекст, процесс, код harness, evals и механизмы поиска.

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7
Media is too big
VIEW IN TELEGRAM
Shepherd 1.1к - Git-like trace для AI-агентов

Идея простая: если кодовый агент сделал странную правку, обычного лога мало. Хочется вернуться ровно в момент перед ошибкой, посмотреть, что он собирался сделать, ответвить запуск и дать другому агенту попробовать другой путь.

Shepherd строит вокруг агента такую историю запуска:

🔵 каждый model call, tool call и изменение файлов становится событием в trace
🔵 управляющий агент может наблюдать за рабочими агентами и вмешиваться до конфликта
🔵 результат работы хранится сбоку как предложение: его можно принять, отклонить или выпустить отдельно
🔵 права задаются прямо в Python-сигнатуре: этому repo можно только читать, этому можно писать
🔵 в статье fork/revert для контейнерных задач занимал примерно 134-147 мс, плюс около 95% переиспользования prompt cache при ответе

Самый сильный пример - пара кодовых агентов в одном репозитории. Без supervisor они проходят CooperBench на 28.8%. С meta-agent, который смотрит их trace и вовремя делает inject/handoff/discard, результат вырос до 54.7%.

Реальная замена git? Нет. Git все еще остается для истории кода, PR и командной разработки. Shepherd работает уровнем выше: он хранит историю поведения агента и окружения, чтобы агентный запуск можно было откатить, разветвить и проверить.

Важная оговорка: публичный репозиторий сейчас alpha/dev preview. В пакете уже есть workspace, retained runs, changesets, trace и permissions, но самая красивая схема из arxiv про полноценные meta-agents поверх чужих запусков еще выглядит как исследовательская цель.

Для продакшна рано. Как направление для инфраструктуры для агентов - очень сильный сигнал: следующие агенты будут нуждаться не только в git, но и в версионировании собственных действий.

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3
Agent Skills for Context Engineering 17к - библиотека SKILL.md для тех, кто собирает AI-агентов вокруг контекста, памяти, инструментов, evals и loops.

Главная польза репо - готовые инженерные плейбуки. Каждый skill объясняет, когда его подключать, какие ошибки он ловит и как превратить идею в рабочий агентный процесс.

🔵 context-degradation - как понять, что агент начал ломаться из-за контекста. Lost-in-middle, старые факты, лишние документы, конфликтующие версии API, отравленная история после галлюцинации или плохого tool output

🔵 context-compression и context-optimization - как ужимать длинную сессию без потери решений, файлов, рисков и следующих шагов. Там же про masking, caching, partitioning и выбор того, что вообще стоит держать в окне

🔵 memory-systems и filesystem-context - как вынести память из промпта: файлы, scratchpads, JSONL-логи, графы, долговременные факты, handoff между агентами

🔵 multi-agent-patterns - когда реально нужны несколько агентов, как делить работу между supervisor, worker и verifier, и как не смешивать их контексты

🔵 tool-design - как писать инструменты для агентов: понятные имена, схемы, ошибки, форматы ответа, MCP naming и сокращение лишних tools, чтобы агент меньше путался

🔵 evaluation и advanced-evaluation - как проверять агентные системы: deterministic checks, regression suites, rubrics, LLM-as-judge, pairwise comparison и защита от bias

🔵 harness-engineering - обвязка вокруг автономного агента: что можно редактировать, что locked, где вести логи, как делать rollback, novelty gate и human approval

🔵 self-improvement-loops - самый интересный skill. Он про loops, где агент улучшает уже не ответ, а собственный workflow, prompt, skill, harness или механизм контекста. Важный принцип: evaluator, права, бюджеты и sandbox должны быть вне зоны, которую loop может менять. Иначе агент быстро начнет оптимизировать метрику вместо задачи

И это не все, что есть в репозитории 😏

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5👍4
This media is not supported in your browser
VIEW IN TELEGRAM
Вышел Grok 4.5 😐

Модель отдельно тренировали под кодинг и агентные задачи. В официальном треде акцент на инженерную работу: большие репозитории, долгие loops с инструментами, несколько репо, skills и агентные сценарии.

По цифрам модель выглядит как быстрый рабочий исполнитель:

🔵 500k контекста, reasoning low/medium/high
🔵 $2 за 1M входных и $6 за 1M выходных токенов, cached input $0.50
🔵 около 80 TPS и 15.9k output tokens на SWE Bench Pro против 67k у Opus 4.8 в замере xAI
🔵 доступна в Grok Build, Cursor, API и Office add-ins, EU пока ждет.

Важная деталь: бенчи неровные. Grok 4.5 силен в Terminal Bench и SWE Marathon, но на DeepSWE 1.1 и SWE Bench Pro уступает Fable/Opus. Сам Маск в ответах написал, что Fable сильнее, просто большинству задач такой уровень не нужен.

Для агентных процессов это интересный слот: быстрый и заметно дешевле топовых моделей, этакий opus по цене sonnet, по словам пробовавших.

Мне понравился такой формат работы с новым Grok:
fable-advisor 190 - Claude Code сессия работает на Fable 5 как архитектор, пишет требования, декомпозирует задачу и проверяет результат, а реализацию отправляет в Grok 4.5 через Grok CLI или в GPT-5.5 через Codex CLI.

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
Media is too big
VIEW IN TELEGRAM
OpenAI и Meta в один день выпустили модели 🔥

GPT-5.6 вышел семейством Sol - флагман, Terra - баланс, Luna - быстрые дешевые задачи. Еще апдейт - ChatGPT Work: Codex и ChatGPT собирают в одно desktop-приложение.

И у GPT-5.6 появился режим ultra: несколько агентов параллельно работают над сложной задачей.

В X Цукерберг вернулся после 3 лет молчания с анонсом Muse Spark. Модель от Meta Superintelligence Labs для кодинга, tool use, computer use и мультимодальных агентных задач. Внутри 1M контекста, работа с desktop/mobile/browser, MCP, custom skills и делегирование в параллельных субагентов.

Самый агрессивный ход - public preview для US developers, совместимость с OpenAI SDK, $20 кредитов бесплатно. Цена: $1.25 input и $4.25 output за 1M токенов. По сравнению с GPT-5.6 Sol это примерно в 4 раза дешевле на входе и в 7 раз дешевле на выходе.

Есть кто уже попробовал новые модельки? Про Grok 4.5 не забываем.

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
This media is not supported in your browser
VIEW IN TELEGRAM
Все очень активно обсуждают новые модели, снова на хайпе тема с оркестрацией

Парень с помощью одной команды GPT-5.6 Sol построил весь pipeline и обучил модель с нуля на основе истории сообщений iMessage. Локально на Mac.
Теперь локальная модель генерирует ответы в стиле создателя.

А кто-то использует GPT-5.6 как оператора, Fable 5 как советника, а Gemini 3.5 Flash - как исполнителя.
Skill Advisor Orchestrator Worker 117к - здесь в целом собрано очень много полезного для агентов.

Кто-то сделал более простую версию, но с поддержкой Codex, Claude Code, Copilot, Grok, Pi - Orchestrator 44

Всё это объединяет простой механизм вызова разных CLI-агентов. Задача - только выбрать вашего любимого агента, а дальше можно прокачивать его через делегирование.

Насколько это нужно, когда GPT-5.6 Sol может делегировать задания 5.6 Luna? В каких-то кейсах, наверное, это может улучшить результат просто из-за более разных точек зрения и другого восприятия контекста.

Например, в X благодаря нескольким хитростям, таким как переформулирование академических, образовательных и безопасных аспектов и постепенное наращивание нагрузки, смогли получить от модели Grok 4.5 инфу о том, как синтезировать мет*мфетамин, создать взр*вчатые устройства, протокол экстракции рицина и скрипт трояна удалённого доступа. Ссылку, пожалуй, не буду оставлять: скрины с частями ответов модели прямо в твите на 1 млн просмотров висят 😦

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5