Agents Lab
960 subscribers
88 photos
45 videos
1 file
226 links
Обсуждаем AI агентов

Наш чатик https://t.me/openclaw_lab_community
Download Telegram
Media is too big
VIEW IN TELEGRAM
Shepherd 1.1к - Git-like trace для AI-агентов

Идея простая: если кодовый агент сделал странную правку, обычного лога мало. Хочется вернуться ровно в момент перед ошибкой, посмотреть, что он собирался сделать, ответвить запуск и дать другому агенту попробовать другой путь.

Shepherd строит вокруг агента такую историю запуска:

🔵 каждый model call, tool call и изменение файлов становится событием в trace
🔵 управляющий агент может наблюдать за рабочими агентами и вмешиваться до конфликта
🔵 результат работы хранится сбоку как предложение: его можно принять, отклонить или выпустить отдельно
🔵 права задаются прямо в Python-сигнатуре: этому repo можно только читать, этому можно писать
🔵 в статье fork/revert для контейнерных задач занимал примерно 134-147 мс, плюс около 95% переиспользования prompt cache при ответе

Самый сильный пример - пара кодовых агентов в одном репозитории. Без supervisor они проходят CooperBench на 28.8%. С meta-agent, который смотрит их trace и вовремя делает inject/handoff/discard, результат вырос до 54.7%.

Реальная замена git? Нет. Git все еще остается для истории кода, PR и командной разработки. Shepherd работает уровнем выше: он хранит историю поведения агента и окружения, чтобы агентный запуск можно было откатить, разветвить и проверить.

Важная оговорка: публичный репозиторий сейчас alpha/dev preview. В пакете уже есть workspace, retained runs, changesets, trace и permissions, но самая красивая схема из arxiv про полноценные meta-agents поверх чужих запусков еще выглядит как исследовательская цель.

Для продакшна рано. Как направление для инфраструктуры для агентов - очень сильный сигнал: следующие агенты будут нуждаться не только в git, но и в версионировании собственных действий.

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3
Agent Skills for Context Engineering 17к - библиотека SKILL.md для тех, кто собирает AI-агентов вокруг контекста, памяти, инструментов, evals и loops.

Главная польза репо - готовые инженерные плейбуки. Каждый skill объясняет, когда его подключать, какие ошибки он ловит и как превратить идею в рабочий агентный процесс.

🔵 context-degradation - как понять, что агент начал ломаться из-за контекста. Lost-in-middle, старые факты, лишние документы, конфликтующие версии API, отравленная история после галлюцинации или плохого tool output

🔵 context-compression и context-optimization - как ужимать длинную сессию без потери решений, файлов, рисков и следующих шагов. Там же про masking, caching, partitioning и выбор того, что вообще стоит держать в окне

🔵 memory-systems и filesystem-context - как вынести память из промпта: файлы, scratchpads, JSONL-логи, графы, долговременные факты, handoff между агентами

🔵 multi-agent-patterns - когда реально нужны несколько агентов, как делить работу между supervisor, worker и verifier, и как не смешивать их контексты

🔵 tool-design - как писать инструменты для агентов: понятные имена, схемы, ошибки, форматы ответа, MCP naming и сокращение лишних tools, чтобы агент меньше путался

🔵 evaluation и advanced-evaluation - как проверять агентные системы: deterministic checks, regression suites, rubrics, LLM-as-judge, pairwise comparison и защита от bias

🔵 harness-engineering - обвязка вокруг автономного агента: что можно редактировать, что locked, где вести логи, как делать rollback, novelty gate и human approval

🔵 self-improvement-loops - самый интересный skill. Он про loops, где агент улучшает уже не ответ, а собственный workflow, prompt, skill, harness или механизм контекста. Важный принцип: evaluator, права, бюджеты и sandbox должны быть вне зоны, которую loop может менять. Иначе агент быстро начнет оптимизировать метрику вместо задачи

И это не все, что есть в репозитории 😏

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5👍4
This media is not supported in your browser
VIEW IN TELEGRAM
Вышел Grok 4.5 😐

Модель отдельно тренировали под кодинг и агентные задачи. В официальном треде акцент на инженерную работу: большие репозитории, долгие loops с инструментами, несколько репо, skills и агентные сценарии.

По цифрам модель выглядит как быстрый рабочий исполнитель:

🔵 500k контекста, reasoning low/medium/high
🔵 $2 за 1M входных и $6 за 1M выходных токенов, cached input $0.50
🔵 около 80 TPS и 15.9k output tokens на SWE Bench Pro против 67k у Opus 4.8 в замере xAI
🔵 доступна в Grok Build, Cursor, API и Office add-ins, EU пока ждет.

Важная деталь: бенчи неровные. Grok 4.5 силен в Terminal Bench и SWE Marathon, но на DeepSWE 1.1 и SWE Bench Pro уступает Fable/Opus. Сам Маск в ответах написал, что Fable сильнее, просто большинству задач такой уровень не нужен.

Для агентных процессов это интересный слот: быстрый и заметно дешевле топовых моделей, этакий opus по цене sonnet, по словам пробовавших.

Мне понравился такой формат работы с новым Grok:
fable-advisor 190 - Claude Code сессия работает на Fable 5 как архитектор, пишет требования, декомпозирует задачу и проверяет результат, а реализацию отправляет в Grok 4.5 через Grok CLI или в GPT-5.5 через Codex CLI.

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
Media is too big
VIEW IN TELEGRAM
OpenAI и Meta в один день выпустили модели 🔥

GPT-5.6 вышел семейством Sol - флагман, Terra - баланс, Luna - быстрые дешевые задачи. Еще апдейт - ChatGPT Work: Codex и ChatGPT собирают в одно desktop-приложение.

И у GPT-5.6 появился режим ultra: несколько агентов параллельно работают над сложной задачей.

В X Цукерберг вернулся после 3 лет молчания с анонсом Muse Spark. Модель от Meta Superintelligence Labs для кодинга, tool use, computer use и мультимодальных агентных задач. Внутри 1M контекста, работа с desktop/mobile/browser, MCP, custom skills и делегирование в параллельных субагентов.

Самый агрессивный ход - public preview для US developers, совместимость с OpenAI SDK, $20 кредитов бесплатно. Цена: $1.25 input и $4.25 output за 1M токенов. По сравнению с GPT-5.6 Sol это примерно в 4 раза дешевле на входе и в 7 раз дешевле на выходе.

Есть кто уже попробовал новые модельки? Про Grok 4.5 не забываем.

Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
This media is not supported in your browser
VIEW IN TELEGRAM
Все очень активно обсуждают новые модели, снова на хайпе тема с оркестрацией

Парень с помощью одной команды GPT-5.6 Sol построил весь pipeline и обучил модель с нуля на основе истории сообщений iMessage. Локально на Mac.
Теперь локальная модель генерирует ответы в стиле создателя.

А кто-то использует GPT-5.6 как оператора, Fable 5 как советника, а Gemini 3.5 Flash - как исполнителя.
Skill Advisor Orchestrator Worker 117к - здесь в целом собрано очень много полезного для агентов.

Кто-то сделал более простую версию, но с поддержкой Codex, Claude Code, Copilot, Grok, Pi - Orchestrator 44

Всё это объединяет простой механизм вызова разных CLI-агентов. Задача - только выбрать вашего любимого агента, а дальше можно прокачивать его через делегирование.

Насколько это нужно, когда GPT-5.6 Sol может делегировать задания 5.6 Luna? В каких-то кейсах, наверное, это может улучшить результат просто из-за более разных точек зрения и другого восприятия контекста.

Например, в X благодаря нескольким хитростям, таким как переформулирование академических, образовательных и безопасных аспектов и постепенное наращивание нагрузки, смогли получить от модели Grok 4.5 инфу о том, как синтезировать мет*мфетамин, создать взр*вчатые устройства, протокол экстракции рицина и скрипт трояна удалённого доступа. Ссылку, пожалуй, не буду оставлять: скрины с частями ответов модели прямо в твите на 1 млн просмотров висят 😦

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5
Вот что можно сказать о новых GPT моделях

🔵 Если вам не нужна производительность уровня Terra Ultra, всегда лучше использовать модель Luna с более высокими настройками сложности (та же или лучшая производительность, но дешевле).

🔵 Забудьте обо всем, что ниже Sol High, используйте Luna с более высокими настройками сложности.

🔵 Забудьте о Sol Extra High, используйте Terra Ultra.

🔵 Дополнительные затраты на Sol Ultra, вероятно, не оправдывают себя по сравнению с Max.

Просто использовать постоянно GPT 5.6 Sol Ultra не получится даже на подписке за 200$, лимиты будут улетать. Теперь нужно правильно выбирать инструмент.

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍71
11 skills, из которых складывается персональная Agent OS разработчика

Разраб из PostHog хранит в своих dotfiles навыки для Claude Code. Вместе они образуют процесс работы с PR, систему инженерных решений и память прошлых расследований.

Самые интересные:

🔵 pr-shepherd связывает qa-swarm, review-triage, simplify и ci-shepherd. Система делает от двух до четырех проходов ревью, исправления и упрощения кода, останавливаясь, когда новый проход становится чистым. qa-swarm запускает четыре независимых взгляда, review-triage разбирает комментарии, а CI-агент обновляет ветку и сообщает состояние проверок, не превращая CI в стоп-сигнал. Сильные модели заняты ревью, более дешевые - механической работой.

🔵 takeover-stale-pr оживляет заброшенный PR: подтягивает свежую базу, разбирает старые замечания, запускает затронутые тесты и передает готовую ветку в pr-shepherd.

🔵 paul-pair срабатывает перед вопросом человеку и перед словом «готово». Три режима: сделать самому, сделать и предложить альтернативу, остановиться и спросить. Рядом лежат paul-reviewer с акцентом на связанность, наблюдаемость и безопасный выкат и xp-reviewer с YAGNI, простым дизайном и правилом «немного дублирования лучше неправильной абстракции».

🔵 investigate-library-upgrade читает changelog, находит реально используемые API пакета и связывает несовместимые изменения с конкретными файлами. Выдает радиус работ и план выката, но не обновляет зависимость без отдельного разрешения.

🔵 hunt-memory-leaks - полноценный исполняемый плейбук по утечкам памяти браузера. Он различает JS heap и память процесса рендеринга, требует тесты с несколькими вкладками в браузере с интерфейсом и несколько повторов, использует CDP, снимки JS heap, сетевые события и трассировки аллокаторов. В references/ записаны уже исправленные причины, открытые гипотезы и тупики, которые не нужно проходить заново.

🔵 manage-claude-memory переносит память проектов из локального хранилища Claude в хранимые в git dotfiles через символические ссылки. Перед записью проверяет содержимое на ключи, персональные данные и закрытую продуктовую информацию.

Сильная часть репозитория - накопленное инженерное состояние. Каждый skill знает последовательность действий, границы автономности, условия остановки и уже проверенные гипотезы. Так личный опыт разработчика постепенно становится исполняемой системой для агента.

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2
prose - маленький STYLE.md, который учит Codex отвечать спокойнее, как Claude

Он заставляет агента общаться связанной технической прозой, не дробить мысль на десятки заголовков и списков и убирать всё, что не меняет следующий шаг.

Автор кладёт правила прямо в AGENTS.md, потому что skills в разных агентных обвязках могут загружаться выборочно.

Вы можете скопировать промт здесь или просто использовать одну из команд на сайте:
curl -fsSL prose.ami.rip/STYLE.md >> ~/.codex/AGENTS.md

Многие уже собирали такие правила вручную. Prose меняет подачу, но не точность ответа, поэтому логи тестов и вывод инструментов лучше оставлять без улучшений.

Чат | Токены дешево
👍41
Разработчики Codex поддержали CLIProxyAPI: GPT-5.6 Sol можно запускать прямо в Claude Code

Theo показал Claude Code, где вместо Claude работает GPT-5.6 Sol. Tibo из команды OpenAI попросил выложить рецепт: «мы не дискриминируем обвязки», а затем сам опубликовал настройку через CLIProxyAPI с 40.7к .

Получается Claudex: интерфейс, инструменты, permissions и субагенты Claude Code, а модель и лимиты приходят через Codex OAuth.

Шаг 1: Установите CLIProxyAPI
Шаг 2: Подключитесь
Шаг 3: Определите следующий alias и наслаждайтесь Claudex:
alias claudex='CLAUDE_CODE_SUBAGENT_MODEL=gpt-5.6-sol \
CLAUDE_CODE_ALWAYS_ENABLE_EFFORT=1 \
CLAUDE_CODE_MAX_TOOL_USE_CONCURRENCY=3 \
ENABLE_TOOL_SEARCH=false \
claude --model gpt-5.6-sol'


У этой схемы есть практический смысл. Сейчас в Codex подагенты Sol наследуют уровень effort родителя: запустили основного агента на ultra - все дочерние агенты тоже начинают жечь лимиты на ultra. Проблема все еще открыта, а разработчик Codex DX ответил, что команда уже работает над исправлением. Theo пока советует полностью избегать ultra.

В Claude Code основной Sol можно оставить на xhigh, а подагентам давать medium. В одном небольшом тесте на трех задачах Sol medium в Claude Code оказался примерно на 46% быстрее и использовал на 23% меньше выходных токенов, чем в Codex, при сопоставимом результате. Выборка маленькая, но влияние обвязки на одну и ту же модель видно хорошо.

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4🔥2
Один большой дизайн skill уже не даёт лучший результат: сравнение пяти популярных skills показывает, что UI лучше собирать отдельными проходами. Taste Skill и DESIGN.md мы уже обсуждали, поэтому вот продолжение стека.

По установкам через skills.sh сейчас впереди frontend-design 161к от Anthropic с 657к, web-design-guidelines от Vercel с 459к, UI UX Pro Max с 263к, Impeccable с 192к и основной skill Эмиля Ковальски со 133к. Но популярность не означает, что один из них стоит держать включённым на всех этапах.

🔵 Impeccable 46к добавляет 23 точечные команды: /audit, /critique, /polish, /typeset и другие. Внутри есть 46 детерминированных проверок, поэтому его лучше запускать как отдельный проход после первого варианта.

🔵 web-design-guidelines 29к не придумывает стиль, а проверяет готовую страницу: доступность, формы, состояния фокуса, семантику, адаптивность и анимации. В сравнении пяти skills этот набор оказался сильнее остальных именно по веб-нормам и доступности.

🔵 Emil Kowalski Skills 11к закрывает движение. /review-animations и /improve-animations исправляют кривые ускорения, появление элементов, жесты и анимации компоновки. Иот же тест поставил этот набор первым по анимациям.

🔵 UI UX Pro Max 105к полезен на этапе выбора системы: 67 стилей, 161 палитра и 57 пар шрифтов. Большая база правил может ограничивать модель и усреднять результат, поэтому лучше использовать её для направления, а финальную проверку отдать более узким skills.

🔵 shadcn/improve связывает эти этапы: находит 3-5 самых заметных проблем в кодовой базе и строит план улучшений.

Рабочий цикл:
референс или DESIGN.md → Taste либо Impeccable → /improve → Vercel audit → Emil animations → проверка скриншотом в браузере

Не подключайте все skills для дизайна одновременно. Запускайте их отдельными проходами, тогда правила не спорят друг с другом и видно, какой слой реально улучшил результат.

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👌2
Сатья Наделла, CEO Microsoft, сформулировал тревожный парадокс корпоративного ИИ: компании платят моделям деньгами, а затем передают им свои самые ценные знания через запросы.
Он объясняет, почему собственные данные, память, проверки и loop обучения скоро станут одним из главных активов бизнеса.

📎 Обратный информационный парадокс: кому принадлежит обучение компании

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍21
AI coding loop для Hermes 🔱

Он убирает постоянное сопровождение агента и оставляет человеку две задачи: описать идею и проверить готовый результат.

Работает так:

1. Создаём три skills: /spec, /build и /review.

2. Запускаем /spec "идея". Hermes задаёт уточняющие вопросы, а затем сохраняет подробное задание в Markdown-файл: что сделать, какие есть ограничения и как проверить результат.

3. Cron-задача /build регулярно проверяет папку со спецификациями. Находит новую задачу, пишет код, запускает тесты и меняет статус в том же файле на review.

4. Другая cron-задача запускает /review в свежей сессии. Она проверяет код, безопасность, производительность и тесты. Если находит проблемы, записывает замечания в Markdown и возвращает статус fix.

5. /build подхватывает замечания, исправляет код и снова отправляет его на проверку. Цикл build - review продолжается, пока все проверки не пройдены.

6. После успешной проверки Hermes присылает в Telegram краткое описание изменений, результаты тестов и ссылку на PR. Остаётся проверить результат и ответить merge.

Вся память цикла хранится в обычных Markdown-файлах, а фоновые запуски выполняют cron-задачи Hermes.

Утром присылаете несколько идей, днём агент самостоятельно прогоняет разработку и проверки, вечером вы просматриваете готовые изменения. (В идеальном мире)

Собственно можете прислать этот пост своему агенту и попросить выстроить loop.

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6
У бизнеса с маржой 3% экономия менее 1% выручки может увеличить прибыль примерно на 27%

Главный резерв часто скрыт в «работе вокруг работы»: маршрутах, согласованиях, документах, счетах и разборе исключений. Именно сюда стоит встраивать ИИ-агентов - в существующие ERP, почту и таблицы, с понятными границами и передачей спорных случаев человеку.

📎 Почему бизнес с низкой маржой может выиграть от ИИ больше всех

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
This media is not supported in your browser
VIEW IN TELEGRAM
Pi как оркестратор для Claude Code и Codex

Ben Davis показал свою сборку Pi 453 . Основная сессия Pi запускает Pi, Claude Code и Codex как полноценных субагентов через единый набор инструментов с отдельными сессиями и общим интерфейсом.

Его рабочий loop:

Claude Code/Fable: исследование и дизайн API → Codex: реализация → свежий Claude Code/Fable: ревью и упрощение

Одновременно могут работать до четырёх подагентов. /subagents показывает модель, заполнение контекста, время, активные инструменты и статус. Можно открыть полный лог, отправить уточнение, остановить запуск или перехватить управление. Готовый результат автоматически возвращается в основную сессию. Свежий контекст ревьюера помогает не унаследовать ошибочное предположение из плана и реализации.

В репозитории также есть JavaScript-workflow с фазами, параллельным запуском и результатами по JSON Schema, фоновые терминалы с /ps, инструменты Firecrawl, ask_user, Git/PR-информация и панель с моделью, контекстом, стоимостью и скоростью генерации.

Слепо копировать не стоит. Claude-подагенты запускаются с bypassPermissions, Codex - с approvalPolicy: never и danger-full-access. Текущий SETUP.md также не ставит зависимости вложенных extensions. После их отдельной установки type-check и все 105 тестов проходят.

Многие говорят, что Pi агент очень хорош, если у нас те кто хочет поделится своим сетапом?

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
От issue до PR: облачная фабрика разработки 🔥

Cloud Factory Demo 79 собирает цепочку: триаж новых задач → PRODUCT.md и TECH.md для сложных изменений → реализация → проверка PR → внешний loop, который учится на реакции команды.

Шаблон использует Oz Warp, GitHub Actions и скиллы. Каждый этап оставляет проверяемый артефакт, изменения проходят через PR, а среду запуска можно заменить. Верификация и мониторинг пока в плане.

📎 Автоматический триаж задач
📎 Спецификации для сложных задач
📎 Самоулучшающийся агент проверки кода

Автор Зак Ллойд - основатель и CEO Warp, ранее Principal Engineer в Google Docs и CTO Time. Статьи показывают, как команда строит систему, которая ведет работу от issue до проверенного PR.

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
Вышла новая модель Inkling от Thinking Machines Lab - стартапа Миры Мурати, бывшего технического директора OpenAI.
Модель достаточно средненькая по всем параметрам, но пускай будет.

Кроме того, SpaceXAI открыла исходный код агента Grok Build. Из интересного: CLI не собирает телеметрию и не отправляет ваши данные, за исключением самих промтов.

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3
Что происходит, когда AI-агенты получают доступ к мессенджеру, коду, данным и рабочим процессам всей компании?

В разборе Cerebras Исаак Тай, Дэниел Ким и Майк Гао, команда создателей внутренней базы знаний, показывают систему с 15 000 запросов в день: гибридный поиск, реранжирование, MCP и контроль доступа.

В истории Replit основатель и CEO Амджад Масад вместе со Скоттом Кеннеди описывают «компанию на автопилоте»: loops с субагентами проверяют PR, расследуют инциденты и помогают аналитикам, продажам и поддержке. И поднимают главный вопрос автономности: как доказать, что работа действительно выполнена правильно.

И также из новостей, вышла Kimi K3, которая стала самой большой открытой моделью, на 2.8 трлн параметров. Теперь это реальный конкурент клоду и гпт, немного недотягивающий по мощности, но при этом и подешевле - $3/$15 за 1кк токенов.

Чат | Токены дешево
👍52
Что не новая модель, то AGI 😱

Есть уже опыт с Kimi?

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
😁9
Конкуренция творит чудеса, Claude Fable 5 останется в подписках на тарифах Max и Team Premium с ограничением 50% 🎉

А Pro и Team Standard сохранят доступ к Fable за счет кредитов на использование в размере 100$ (единоразово).

Anthropic понимает, что вы могли фрустрироваться, поэтому ценим невероятный дар в 50% лимитов и надеемся, что они найдут побольше серверов)

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5
Почему одна и та же LLM может ответить за секунды или потратить минуты на рассуждение?

Статья о том, как модели учатся режимам low, medium и high, почему максимальное усилие быстро становится дорогим и когда меньшая модель может догнать более крупную за счет дополнительного времени на поиск решения.

📎Как управлять глубиной рассуждений в LLM

Сложная, но интересная статья, советую к прочтению 👍

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍41
Два полезных приёма для вайб-кодинга

1. Проверяйте решения, а не тысячи строк кода

После выполнения задачи спросите агента:
Какие решения ты принял и в каких не уверен? Что может сломаться и как это проверить?


Для длинных задач попросите вести DECISIONS.md, иначе часть решений потеряется после сжатия контекста. Такой аудит хорошо ловит патчи, которые устраняют симптом, но не причину ошибки.

2. Браузер для разведки, API для работы

Агент может выполнить действие в браузере, записать запросы в HAR и собрать по ним быстрый CLI или клиент. Повторные операции пойдут напрямую через HTTP, без постоянных кликов.

Напоследок ayghri/i-have-adhd - skill для ответов Claude Code, адаптированных для людей с СДВГ. Он делает ответы короче и понятнее. На работу агента и качество кода skill не влияет, он меняет только подачу ответа.

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4