Agents Lab
960 subscribers
88 photos
45 videos
1 file
226 links
Обсуждаем AI агентов

Наш чатик https://t.me/openclaw_lab_community
Download Telegram
Репозиторий loop-engineering - набор шаблонов для AI-агентов, которые работают по циклу

Агент запускается по расписанию, читает память проекта, делает задачу, проверяет результат отдельным агентом и записывает, что произошло.

В репозитории собраны шаблоны для таких сценариев: ежедневная проверка проекта, сопровождение изменений в коде, реакция на упавшие тесты, обновление зависимостей, журнал запусков и лимиты расходов.

И есть статья, которая разбирает эту идею на более рискованном примере - автоматической торговой системе. Там цикл выглядит так: собрать рыночные данные, найти торговый сигнал, проверить его на исторических данных, исполнить сделку и следить за риском.

📎 Loop engineering: как собрать самоулучшающуюся торговую систему

чат
Please open Telegram to view this post
VIEW IN TELEGRAM
1❤‍🔥1👍1🔥1
MoA в Hermes Agent - новый режим, где несколько моделей работают как один агент 🔱

Внутри есть модели-советники и главная модель.

Модели-советники читают задачу и дают приватные заметки: как подойти к решению, где могут быть ошибки, что стоит проверить. Пользователь их не видит, инструменты они не вызывают.

Главная модель получает эти заметки, собирает финальный ответ и уже сама работает как обычный Hermes: вызывает tools, продолжает /goal, пишет результат в чат.

На HermesBench связка Claude Opus 4.8 + GPT-5.5 дала результат выше, чем каждая модель отдельно: примерно +8% к Opus 4.8 и +11% к GPT-5.5.

Цена тоже растет: один шаг агента превращается в несколько вызовов моделей. Поэтому MoA больше подходит для сложных задач: архитектура, ревью, планирование, длинные исследования.

Начинается игра: кто лучше замиксует модели 💃

чат
Please open Telegram to view this post
VIEW IN TELEGRAM
👍54🔥1
Два свежих репозитория про то, как LLM становятся лучше

slime (7к) - фреймворк для дообучения моделей на реальных задачах. Если агент пишет код, вызывает инструменты или решает задачу в несколько шагов, slime помогает собирать такие попытки, оценивать результат и улучшать модель.

DeepSpec (1к) - проект DeepSeek для ускорения ответов. Идея простая: маленькая модель быстро набрасывает продолжение, большая модель проверяет сразу несколько токенов, и генерация идет быстрее.

Отдельно разобрал, как работает обучение агентов на попытках и ошибках через ART (10.2к), GRPO и RULER:
📎 Как дообучать LLM

чат
Please open Telegram to view this post
VIEW IN TELEGRAM
👍21
Компания из одного человека обычно ломается не из-за нехватки идей. Чаще - из-за памяти и повторяемости.

Когда решения, клиентский контекст, заметки и черновики живут в разных местах, владелец быстро становится главным хранилищем, исполнителем и напоминалкой для самого себя.

В статье разобран рабочий контур для соло-предпринимателя: Obsidian как память, Claude Code как обработчик знаний, Claude Cowork как исполнитель для файлов, Hermes Agent как фоновый оператор в Telegram с навыками и расписаниями.

📎 Компания из одного человека: рабочая система на Obsidian, Claude и Hermes

чат
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5
Deepsec - сканер уязвимостей (агент) от Vercel Labs

Он сначала быстро проходит репозиторий правилами на регулярных выражениях и отмечает подозрительные места. Потом агент для кода читает файлы, контекст проекта из INFO.md и решает, есть ли реальная уязвимость.

🔵 автоматически использует как фолбек claude/codex подписку, либо настраиваете Vercel AI API
🔵 работает по стадиям: scan → process → revalidate → enrich → export
🔵 хранит состояние в .deepsec/data, поэтому упавший запуск можно повторить, уже обработанные файлы он пропустит
🔵 для PR есть process --diff: проверяет только измененные файлы и готовит комментарий в Markdown
🔵 свои правила поиска можно писать под фреймворк, авторизацию, RPC или внутренний SDK

Старт:
npx deepsec init
cd .deepsec && pnpm install
pnpm deepsec scan
pnpm deepsec process
pnpm deepsec revalidate

Честно предупреждают про стоимость: полный прогон большой кодовой базы может стоить тысячи долларов. Нормальный вход - начать с --limit 50, заполнить короткий INFO.md, прогнать HIGH через revalidate, а потом добавить правила под свои реальные точки входа.

чат
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3
Karpathy недавно дал хорошую рамку для агентной разработки: агентов уже мало просто запустить. Их нужно проектировать через спецификации, evals, ревью, безопасность, наблюдаемость и понятный путь до production.

В 📎статье показано, как Google Agents CLI пытается собрать это в один процесс: установка skills для coding agent, сборка RAG-агента, локальные проверки, eval suite, развертывание в Agent Runtime и публикация в Gemini Enterprise.

Если делаете внутренних ассистентов, RAG или агентов на ADK, это хороший пример того, как довести прототип до сервиса для команды.

чат
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
Hermes Agent получил апдейт для больших multi-agent запусков🔱

Главное - AsyncSessionDB: обращения к SQLite в gateway вынесли с event loop в рабочий поток.

Для нас это означает меньше зависаний, когда параллельно живут сессии, сигналы активности и Kanban-задачи.

Второй апдейт - /usage. Теперь в чате видно, куда уходит контекст: системный промпт, инструменты, правила, skills, MCP, subagents, memory и сам диалог.

чат
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥6
Вышла Claude Sonnet 5 💬

Лучше предшественника, слабее опуса. Обновление рабочей лошадки.

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2👎1
Media is too big
VIEW IN TELEGRAM
Claude Fable 5 вернут в течении суток 🎉

Ужесточили гарды, классификатор для модели. Еще чаще будет фолбекать на Opus 4.8 на запрещенных темах.

Доступна по подписке до 7 июля и только до 50% лимитов можно потратить.


Hermes Agent работает с web до 60 раз быстрее и в 49 раз дешевле 🔱

Web_extract перестал прогонять каждую большую страницу через LLM-саммаризатор.

🔵Если страница до 15000 символов - возвращают целиком
🔵Если больше - берут head+tail окно примерно 75/25
🔵Полный текст сохраняют в cache/web/<slug>-<hash>.md
🔵В ответ добавляют footer с путем к файлу и подсказкой для read_file
🔵Inline base64-картинки заменяют на [IMAGE: alt], чтобы не забивать контекст

Главный инсайт из PR:
Мы платили LLM round-trip за сжатие markdown, который backend уже вернул чистым.

Ускорили не сам скрапинг, а post-processing после него. Убрали генерацию, чанкинг, синтез и ожидание auxiliary-модели. Сохранили доступ к полному тексту через файл, поэтому качество восстановления ответа осталось тем же.

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6👎1
supermemory 28к - память и контекст для AI-агентов, теперь полностью локально

Запуск:
npx supermemory local
supermemory-server

На машине поднимается весь стек: graph engine, локальные embeddings, извлечение фактов, user profiles и Memory API. Модель выбираете сами: OpenAI, Anthropic, Gemini, Groq или офлайн через Ollama.

Хорошо ложится с Claude Code, Cursor, Codex, Hermes, LangChain, Vercel AI SDK. Агент может помнить проект, предпочтения, прошлые решения и доставать нужный контекст между сессиями.

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4🔥32
Hermes Agent v0.18.0 - Judgment Release 🔱

Большой релиз про надежность длинных агентных задач. За окно закрыли около 1 950 issues/PR, полностью зачистили P0/P1 и зафиксировали ноль открытых критичных задач.

Что самое интересное, помимо MoA, /learn и /usage:

🔵 /goal получил контракты готовности. Теперь можно заранее описать, какой результат считается готовым, а Hermes сверяет работу с проверками, логами и данными.

🔵 Появился журнал проверок для coding-задач: агент запоминает каноничные проверки проекта, запускает их и показывает статус через gateway.

🔵 delegate_task теперь умеет запускать несколько субагентов в фоне. Отправили параллельно исследовать конкурентов, проверить модули или собрать данные - и продолжили чат. В конце приходит одна сводка.

🔵 /journey показывает, чему Hermes научился: memories и skills в виде таймлайна, с возможностью править и удалять. В desktop добавили memory graph.

🔵 Desktop стал ближе к coding cockpit: Projects, worktrees, review pane, multi-terminal и инструменты проекта для агента.

Hermes двигают к агенту, которому можно доверить длинную работу с понятным контрактом готовности и проверяемым результатом.

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍17
OpenWiki 945 - CLI от LangChain, который пишет wiki для репозитория под кодовых агентов.

AGENTS.md и CLAUDE.md быстро раздуваются, если складывать туда весь контекст проекта. OpenWiki выносит подробности в папку openwiki/, а в агентные инструкции добавляет короткую ссылку.

Запуск:
npm install -g openwiki
openwiki --init

🔵 генерирует страницы про архитектуру, CLI, операции, source map и правила работы с кодом
🔵 обновляет wiki через openwiki --update, читая git status, git log и git diff
🔵 хранит метаданные последнего запуска в openwiki/.last-update.json
🔵 умеет ежедневный GitHub Action, который открывает PR с обновлением документации
🔵 работает через OpenRouter, Fireworks, Baseten, OpenAI и Anthropic, плюс опционально трассирует запуск в LangSmith

Авто-wiki может закрепить ошибку агента. Поэтому безопасный режим - обновлять документацию через PR и ревьюить ее как код.

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7
📎 Как ускорить Hermes Agent без смены модели

Про простую вещь, которая часто дает больше скорости, чем апгрейд модели: нормальная карта рабочей области. INDEX.md, канонические файлы, отдельный архив и понятные точки входа помогают агенту меньше искать и быстрее начинать работу.

📎Как создать Frontier Agent OS

Идея Agent OS - вынести координацию в отдельный слой. Одна модель планирует, другая делает, третья проверяет. Самое важное здесь - роли, критерии готовности, логи маршрутизации и доказательства результата.

📎 Loop engineering: метод Karpathy и следующий слой

Loop engineering превращает агентную работу в повторяемый цикл: цель, состояние, проверка, стоп-условие. В статье разобран Karpathy Loop и следующий слой - loop, который улучшает саму стратегию поиска.

📎 Уровни автономности AI-агентов

Полезная шкала для тех, кто запускает подагентов, worktrees, фоновые сессии и manager-agents. Автономность стоит повышать там, где есть sandbox, откат, проверки и evidence trail.

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5😱1
Разобрал около 100 ответов под опросом про Hermes. Получился хороший снимок того, как люди реально живут с агентами каждый день.

Главный паттерн - Hermes почти у всех уходит из терминала в рабочую среду:

- 55% используют Telegram, Discord, iMessage или другие мессенджеры
- 30% сидят в Desktop/браузере
- 30% все еще активно используют TUI/CLI

По моделям лидируют GPT/Codex - 35%. Дальше DeepSeek и локальные модели - по 25%, MoA/роутеры - около 20%. То есть схема уже не “одна лучшая модель”, а набор: сильная модель для сложных задач, дешевые или локальные воркеры для рутины.

Самое интересное - память. Obsidian, vault и markdown всплывают у 35%, встроенная память Hermes - у 20%, Honcho - у 10%. Люди явно хотят память, которую можно читать, синкать, коммитить и чинить руками.

По оркестрации: delegate_task и subagents - 25%, kanban и cron - примерно по 20%. А кто то всегда ведет разработку, отдавая кодинг задачи Claude/Codex CLI в отдельный tmux.
Skills упоминают чаще, чем MCP: 35% против 10%.

Хороший практический пример - статья Matthew Gunnin про память для двух агентов: OpenClaw и Hermes. У него память разделена на 4 слоя: markdown-файлы с identity и memory index, локальное сохранение фактов через Hindsight 17.9к, общий Obsidian/Nexus-лог для синхронизации агентов и gbrain 24.9к как поисковый слой поверх всего vault.

Самая полезная мысль оттуда: память агента - это не просто засунуть больше в контекст. Рабочая схема больше похожа на инфраструктуру: факты проходят от сессии к сессии, решения пишутся в проверяемые файлы, несколько агентов читают один общий state, а старые знания можно найти без загрузки всего архива в контекст.

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍41
Eсть способ снизить затраты в Fable 5 примерно на 70% - pxpipe 800

Просто преобразуйте контекст Claude Code в изображение и настройте Fable (и не только) на распознавание текста 😂

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯10😁2👍1
showcase-video.webm
5.2 MB
Вечерний набор на выходные: два репо для маленькой фабрики кодовых агентов

Parallel Code 811 - desktop-интерфейс для mac и linux, где Claude Code, Codex, Gemini, Copilot и другие CLI работают параллельно, каждый в своем git worktree. Создали несколько задач, агенты разошлись по веткам, дальше смотрите diff, CI, комментарии и мерджите удачные варианты.

repowise 2.9к - слой понимания репозитория для агента. Индексирует код, git-историю, архитектурные решения, health/risk и документацию, потом отдает это через MCP в Claude Code, Codex, Cursor и других клиентов.

Для Codex: pip install repowise
repowise init --codex --provider codex_cli --yes


Хорошая связка для эксперимента: Parallel Code гоняет несколько агентов, repowise дает агентам карту проекта и помогает проверять изменения по риску и контексту.

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
Loop engineering для solo-разработчика начинается с вопроса: откуда агенту брать задачи?

Если проект делает один человек, backlog часто живет в голове. Поэтому первый loop должен не писать код, а превращать цель проекта в маленькие проверяемые задачи.

цель → метрика → воронка → провал → маленький PR

А потом только идем к реализации:

диагностика → узкое место → план → diff от Codex → тесты → деплой → отчет

Hermes в такой схеме может работать как оркестратор: читает цель, метрики и диагностику, выбирает один узкий участок, пишет план и проверяет результат. Codex CLI работает как исполнитель: берет одну задачу, делает diff, запускает проверки и останавливается, если нужен продуктовый выбор.

Начинать стоит с файла вроде docs/product-loop.md: цель, метрика, границы поведения агента, воронка и правила выбора следующей задачи.

📎 Как собрать автономный loop

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍8
David Ondrej выложил свои Agent Skills в open source

David Ondrej - основатель DeepAPI, OpenDataset и Vectal. Вчера он открыл репозиторий davidondrej/skills 450 - личный набор скиллов, который, по его словам, собран из сотен часов проб и ошибок.

Внутри 30 скиллов по 5 категориям:

🔵 agent-orchestration - запуск loops, Codex /goal, delegation, handoff, cmux, DeepSWE

🔵 skill-authoring - как писать, улучшать, публиковать и раскатывать skills между агентами

🔵 research-and-web - browser harness, deep research, YouTube transcripts, web-поиск для Pi

🔵 thinking-and-docs - превращение идей в docs, ADRs, interview-style planning, “прожарь меня”

🔵 ops-and-setup - VPS, setup, cyber audit, anti-sleep для macOS, кастомные модели в Pi

Самое полезное здесь - структура: каждый SKILL.md превращает повторяемый агентный сценарий в маленькую инструкцию, которую можно подключать к Claude Code, Codex, Hermes или своим агентам.

Часть skills завязана на стеке David, но как библиотека паттернов для своих скиллов - очень годно.

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍42
4X DGX Spark для локальной MoA-сетки агентов

Парень из X собрал стек на Hermes: Qwen закрывает легкие задачи, Nemotron берет мультимодальный ввод, Two-Tower работает с длинными повторяемыми генерациями, DeepSeek-V4-Flash маршрутизирует, а Claude/Codex/Grok остаются редким облачным учителями.

Автор целится в около 90% AI-работы локально. Каждый сложный запрос, который ушел в облако, сохраняется в лог: задача, выбранный агент, ответ и исправление. Потом эти пары идут в LoRA-тренировку Gemma-4-12B, чтобы похожие задачи дальше закрывались на локальном стеке.

Главная ценность здесь - loop обучения из собственных логов:

Репозиторий пока выглядит как журнал сборки и каркас. Routing hooks, miner, LoRA harness и бенчи есть, но eval-gate и hot-swap еще описаны как ручной шаг.

Чат | CloseRouter
🔥7👍4
Если модель вроде Fable 5 уходит из подписки, последние часы стоит тратить на извлечение ее экспертизы в артефакты: CLAUDE.md, skills, критерии качества, дорожные карты, заметки и проверяемые цели.

Короткий плейбук из 5 сценариев с готовыми промтами:
📎 Сделайте это в свой последний день работы с Fable

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
😁32🔥1
Свежая статья от Anthropic
📎 С чего начать loops в Claude Code

Раз уж мы говорим о Claude Code, есть полезный репозиторий, который позволяет клоду общаться с Codex.

Codex MCP Server
540 - Используйте GPT в клоде как советника или оставьте на Claude только планирование, а всю реализацию отдавайте в Codex.

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
1