Собрал две статьи про harness для AI-агентов - слой, который превращает модель в рабочий процесс: контекст, loop, инструменты, проверки, права, память и подагенты.
📎 Как получать сильный результат от любой модели
Практический каркас: когда хватит одного промпта, а когда пора собирать систему вокруг агента. Там про
📎 Harness engineering для самоулучшающихся AI-систем
Более глубокий слой: как сама обвязка становится объектом оптимизации. Агентные системы начинают улучшать контекст, процесс, код harness, evals и механизмы поиска.
Чат | CloseRouter
Практический каркас: когда хватит одного промпта, а когда пора собирать систему вокруг агента. Там про
CLAUDE.md, объективные проверки, независимого verifier, hooks, permissions, skills, memory и MCP.Более глубокий слой: как сама обвязка становится объектом оптимизации. Агентные системы начинают улучшать контекст, процесс, код harness, evals и механизмы поиска.
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7
Media is too big
VIEW IN TELEGRAM
Shepherd 1.1к ⭐ - Git-like trace для AI-агентов
Идея простая: если кодовый агент сделал странную правку, обычного лога мало. Хочется вернуться ровно в момент перед ошибкой, посмотреть, что он собирался сделать, ответвить запуск и дать другому агенту попробовать другой путь.
Shepherd строит вокруг агента такую историю запуска:
🔵 каждый model call, tool call и изменение файлов становится событием в trace
🔵 управляющий агент может наблюдать за рабочими агентами и вмешиваться до конфликта
🔵 результат работы хранится сбоку как предложение: его можно принять, отклонить или выпустить отдельно
🔵 права задаются прямо в Python-сигнатуре: этому repo можно только читать, этому можно писать
🔵 в статье fork/revert для контейнерных задач занимал примерно 134-147 мс, плюс около 95% переиспользования prompt cache при ответе
Самый сильный пример - пара кодовых агентов в одном репозитории. Без supervisor они проходят CooperBench на 28.8%. С meta-agent, который смотрит их trace и вовремя делает inject/handoff/discard, результат вырос до 54.7%.
Реальная замена git? Нет. Git все еще остается для истории кода, PR и командной разработки. Shepherd работает уровнем выше: он хранит историю поведения агента и окружения, чтобы агентный запуск можно было откатить, разветвить и проверить.
Важная оговорка: публичный репозиторий сейчас alpha/dev preview. В пакете уже есть workspace, retained runs, changesets, trace и permissions, но самая красивая схема из arxiv про полноценные meta-agents поверх чужих запусков еще выглядит как исследовательская цель.
Для продакшна рано. Как направление для инфраструктуры для агентов - очень сильный сигнал: следующие агенты будут нуждаться не только в git, но и в версионировании собственных действий.
Чат | CloseRouter
Идея простая: если кодовый агент сделал странную правку, обычного лога мало. Хочется вернуться ровно в момент перед ошибкой, посмотреть, что он собирался сделать, ответвить запуск и дать другому агенту попробовать другой путь.
Shepherd строит вокруг агента такую историю запуска:
Самый сильный пример - пара кодовых агентов в одном репозитории. Без supervisor они проходят CooperBench на 28.8%. С meta-agent, который смотрит их trace и вовремя делает inject/handoff/discard, результат вырос до 54.7%.
Реальная замена git? Нет. Git все еще остается для истории кода, PR и командной разработки. Shepherd работает уровнем выше: он хранит историю поведения агента и окружения, чтобы агентный запуск можно было откатить, разветвить и проверить.
Важная оговорка: публичный репозиторий сейчас alpha/dev preview. В пакете уже есть workspace, retained runs, changesets, trace и permissions, но самая красивая схема из arxiv про полноценные meta-agents поверх чужих запусков еще выглядит как исследовательская цель.
Для продакшна рано. Как направление для инфраструктуры для агентов - очень сильный сигнал: следующие агенты будут нуждаться не только в git, но и в версионировании собственных действий.
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3
Agent Skills for Context Engineering 17к ⭐ - библиотека
Главная польза репо - готовые инженерные плейбуки. Каждый skill объясняет, когда его подключать, какие ошибки он ловит и как превратить идею в рабочий агентный процесс.
🔵
🔵
🔵
🔵
🔵
🔵
🔵
🔵
И это не все, что есть в репозитории😏
Чат | CloseRouter
SKILL.md для тех, кто собирает AI-агентов вокруг контекста, памяти, инструментов, evals и loops.Главная польза репо - готовые инженерные плейбуки. Каждый skill объясняет, когда его подключать, какие ошибки он ловит и как превратить идею в рабочий агентный процесс.
context-degradation - как понять, что агент начал ломаться из-за контекста. Lost-in-middle, старые факты, лишние документы, конфликтующие версии API, отравленная история после галлюцинации или плохого tool outputcontext-compression и context-optimization - как ужимать длинную сессию без потери решений, файлов, рисков и следующих шагов. Там же про masking, caching, partitioning и выбор того, что вообще стоит держать в окнеmemory-systems и filesystem-context - как вынести память из промпта: файлы, scratchpads, JSONL-логи, графы, долговременные факты, handoff между агентамиmulti-agent-patterns - когда реально нужны несколько агентов, как делить работу между supervisor, worker и verifier, и как не смешивать их контекстыtool-design - как писать инструменты для агентов: понятные имена, схемы, ошибки, форматы ответа, MCP naming и сокращение лишних tools, чтобы агент меньше путалсяevaluation и advanced-evaluation - как проверять агентные системы: deterministic checks, regression suites, rubrics, LLM-as-judge, pairwise comparison и защита от biasharness-engineering - обвязка вокруг автономного агента: что можно редактировать, что locked, где вести логи, как делать rollback, novelty gate и human approvalself-improvement-loops - самый интересный skill. Он про loops, где агент улучшает уже не ответ, а собственный workflow, prompt, skill, harness или механизм контекста. Важный принцип: evaluator, права, бюджеты и sandbox должны быть вне зоны, которую loop может менять. Иначе агент быстро начнет оптимизировать метрику вместо задачиИ это не все, что есть в репозитории
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5👍4
This media is not supported in your browser
VIEW IN TELEGRAM
Вышел Grok 4.5 😐
Модель отдельно тренировали под кодинг и агентные задачи. В официальном треде акцент на инженерную работу: большие репозитории, долгие loops с инструментами, несколько репо, skills и агентные сценарии.
По цифрам модель выглядит как быстрый рабочий исполнитель:
🔵 500k контекста, reasoning
🔵 $2 за 1M входных и $6 за 1M выходных токенов, cached input $0.50
🔵 около 80 TPS и 15.9k output tokens на SWE Bench Pro против 67k у Opus 4.8 в замере xAI
🔵 доступна в Grok Build, Cursor, API и Office add-ins, EU пока ждет.
Важная деталь: бенчи неровные. Grok 4.5 силен в Terminal Bench и SWE Marathon, но на DeepSWE 1.1 и SWE Bench Pro уступает Fable/Opus. Сам Маск в ответах написал, что Fable сильнее, просто большинству задач такой уровень не нужен.
Для агентных процессов это интересный слот: быстрый и заметно дешевле топовых моделей, этакий opus по цене sonnet, по словам пробовавших.
Мне понравился такой формат работы с новым Grok:
fable-advisor 190⭐ - Claude Code сессия работает на Fable 5 как архитектор, пишет требования, декомпозирует задачу и проверяет результат, а реализацию отправляет в Grok 4.5 через Grok CLI или в GPT-5.5 через Codex CLI.
Чат | CloseRouter
Модель отдельно тренировали под кодинг и агентные задачи. В официальном треде акцент на инженерную работу: большие репозитории, долгие loops с инструментами, несколько репо, skills и агентные сценарии.
По цифрам модель выглядит как быстрый рабочий исполнитель:
low/medium/highВажная деталь: бенчи неровные. Grok 4.5 силен в Terminal Bench и SWE Marathon, но на DeepSWE 1.1 и SWE Bench Pro уступает Fable/Opus. Сам Маск в ответах написал, что Fable сильнее, просто большинству задач такой уровень не нужен.
Для агентных процессов это интересный слот: быстрый и заметно дешевле топовых моделей, этакий opus по цене sonnet, по словам пробовавших.
Мне понравился такой формат работы с новым Grok:
fable-advisor 190
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
Media is too big
VIEW IN TELEGRAM
OpenAI и Meta в один день выпустили модели 🔥
GPT-5.6 вышел семейством Sol - флагман, Terra - баланс, Luna - быстрые дешевые задачи. Еще апдейт - ChatGPT Work: Codex и ChatGPT собирают в одно desktop-приложение.
И у GPT-5.6 появился режим
В X Цукерберг вернулся после 3 лет молчания с анонсом Muse Spark. Модель от Meta Superintelligence Labs для кодинга, tool use, computer use и мультимодальных агентных задач. Внутри 1M контекста, работа с desktop/mobile/browser, MCP, custom skills и делегирование в параллельных субагентов.
Самый агрессивный ход - public preview для US developers, совместимость с OpenAI SDK, $20 кредитов бесплатно. Цена: $1.25 input и $4.25 output за 1M токенов. По сравнению с GPT-5.6 Sol это примерно в 4 раза дешевле на входе и в 7 раз дешевле на выходе.
Есть кто уже попробовал новые модельки? Про Grok 4.5 не забываем.
Чат | CloseRouter
GPT-5.6 вышел семейством Sol - флагман, Terra - баланс, Luna - быстрые дешевые задачи. Еще апдейт - ChatGPT Work: Codex и ChatGPT собирают в одно desktop-приложение.
И у GPT-5.6 появился режим
ultra: несколько агентов параллельно работают над сложной задачей.В X Цукерберг вернулся после 3 лет молчания с анонсом Muse Spark. Модель от Meta Superintelligence Labs для кодинга, tool use, computer use и мультимодальных агентных задач. Внутри 1M контекста, работа с desktop/mobile/browser, MCP, custom skills и делегирование в параллельных субагентов.
Самый агрессивный ход - public preview для US developers, совместимость с OpenAI SDK, $20 кредитов бесплатно. Цена: $1.25 input и $4.25 output за 1M токенов. По сравнению с GPT-5.6 Sol это примерно в 4 раза дешевле на входе и в 7 раз дешевле на выходе.
Есть кто уже попробовал новые модельки? Про Grok 4.5 не забываем.
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
This media is not supported in your browser
VIEW IN TELEGRAM
Все очень активно обсуждают новые модели, снова на хайпе тема с оркестрацией
Парень с помощью одной команды GPT-5.6 Sol построил весь pipeline и обучил модель с нуля на основе истории сообщений iMessage. Локально на Mac.
Теперь локальная модель генерирует ответы в стиле создателя.
А кто-то использует GPT-5.6 как оператора, Fable 5 как советника, а Gemini 3.5 Flash - как исполнителя.
Skill Advisor Orchestrator Worker 117к⭐ - здесь в целом собрано очень много полезного для агентов.
Кто-то сделал более простую версию, но с поддержкой Codex, Claude Code, Copilot, Grok, Pi - Orchestrator 44⭐
Всё это объединяет простой механизм вызова разных CLI-агентов. Задача - только выбрать вашего любимого агента, а дальше можно прокачивать его через делегирование.
Насколько это нужно, когда GPT-5.6 Sol может делегировать задания 5.6 Luna? В каких-то кейсах, наверное, это может улучшить результат просто из-за более разных точек зрения и другого восприятия контекста.
Например, в X благодаря нескольким хитростям, таким как переформулирование академических, образовательных и безопасных аспектов и постепенное наращивание нагрузки, смогли получить от модели Grok 4.5 инфу о том, как синтезировать мет*мфетамин, создать взр*вчатые устройства, протокол экстракции рицина и скрипт трояна удалённого доступа. Ссылку, пожалуй, не буду оставлять: скрины с частями ответов модели прямо в твите на 1 млн просмотров висят😦
Чат | Токены дешево
Парень с помощью одной команды GPT-5.6 Sol построил весь pipeline и обучил модель с нуля на основе истории сообщений iMessage. Локально на Mac.
Теперь локальная модель генерирует ответы в стиле создателя.
А кто-то использует GPT-5.6 как оператора, Fable 5 как советника, а Gemini 3.5 Flash - как исполнителя.
Skill Advisor Orchestrator Worker 117к
Кто-то сделал более простую версию, но с поддержкой Codex, Claude Code, Copilot, Grok, Pi - Orchestrator 44
Всё это объединяет простой механизм вызова разных CLI-агентов. Задача - только выбрать вашего любимого агента, а дальше можно прокачивать его через делегирование.
Насколько это нужно, когда GPT-5.6 Sol может делегировать задания 5.6 Luna? В каких-то кейсах, наверное, это может улучшить результат просто из-за более разных точек зрения и другого восприятия контекста.
Например, в X благодаря нескольким хитростям, таким как переформулирование академических, образовательных и безопасных аспектов и постепенное наращивание нагрузки, смогли получить от модели Grok 4.5 инфу о том, как синтезировать мет*мфетамин, создать взр*вчатые устройства, протокол экстракции рицина и скрипт трояна удалённого доступа. Ссылку, пожалуй, не буду оставлять: скрины с частями ответов модели прямо в твите на 1 млн просмотров висят
Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5
Вот что можно сказать о новых GPT моделях
🔵 Если вам не нужна производительность уровня Terra Ultra, всегда лучше использовать модель Luna с более высокими настройками сложности (та же или лучшая производительность, но дешевле).
🔵 Забудьте обо всем, что ниже Sol High, используйте Luna с более высокими настройками сложности.
🔵 Забудьте о Sol Extra High, используйте Terra Ultra.
🔵 Дополнительные затраты на Sol Ultra, вероятно, не оправдывают себя по сравнению с Max.
Просто использовать постоянно GPT 5.6 Sol Ultra не получится даже на подписке за 200$, лимиты будут улетать. Теперь нужно правильно выбирать инструмент.
Чат | Токены дешево
Просто использовать постоянно GPT 5.6 Sol Ultra не получится даже на подписке за 200$, лимиты будут улетать. Теперь нужно правильно выбирать инструмент.
Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7❤1
11 skills, из которых складывается персональная Agent OS разработчика
Разраб из PostHog хранит в своих dotfiles навыки для Claude Code. Вместе они образуют процесс работы с PR, систему инженерных решений и память прошлых расследований.
Самые интересные:
🔵
🔵
🔵
🔵
🔵
🔵
Сильная часть репозитория - накопленное инженерное состояние. Каждый skill знает последовательность действий, границы автономности, условия остановки и уже проверенные гипотезы. Так личный опыт разработчика постепенно становится исполняемой системой для агента.
Чат | Токены дешево
Разраб из PostHog хранит в своих dotfiles навыки для Claude Code. Вместе они образуют процесс работы с PR, систему инженерных решений и память прошлых расследований.
Самые интересные:
pr-shepherd связывает qa-swarm, review-triage, simplify и ci-shepherd. Система делает от двух до четырех проходов ревью, исправления и упрощения кода, останавливаясь, когда новый проход становится чистым. qa-swarm запускает четыре независимых взгляда, review-triage разбирает комментарии, а CI-агент обновляет ветку и сообщает состояние проверок, не превращая CI в стоп-сигнал. Сильные модели заняты ревью, более дешевые - механической работой.takeover-stale-pr оживляет заброшенный PR: подтягивает свежую базу, разбирает старые замечания, запускает затронутые тесты и передает готовую ветку в pr-shepherd.paul-pair срабатывает перед вопросом человеку и перед словом «готово». Три режима: сделать самому, сделать и предложить альтернативу, остановиться и спросить. Рядом лежат paul-reviewer с акцентом на связанность, наблюдаемость и безопасный выкат и xp-reviewer с YAGNI, простым дизайном и правилом «немного дублирования лучше неправильной абстракции».investigate-library-upgrade читает changelog, находит реально используемые API пакета и связывает несовместимые изменения с конкретными файлами. Выдает радиус работ и план выката, но не обновляет зависимость без отдельного разрешения.hunt-memory-leaks - полноценный исполняемый плейбук по утечкам памяти браузера. Он различает JS heap и память процесса рендеринга, требует тесты с несколькими вкладками в браузере с интерфейсом и несколько повторов, использует CDP, снимки JS heap, сетевые события и трассировки аллокаторов. В references/ записаны уже исправленные причины, открытые гипотезы и тупики, которые не нужно проходить заново.manage-claude-memory переносит память проектов из локального хранилища Claude в хранимые в git dotfiles через символические ссылки. Перед записью проверяет содержимое на ключи, персональные данные и закрытую продуктовую информацию.Сильная часть репозитория - накопленное инженерное состояние. Каждый skill знает последовательность действий, границы автономности, условия остановки и уже проверенные гипотезы. Так личный опыт разработчика постепенно становится исполняемой системой для агента.
Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2
prose - маленький
Он заставляет агента общаться связанной технической прозой, не дробить мысль на десятки заголовков и списков и убирать всё, что не меняет следующий шаг.
Автор кладёт правила прямо в
Вы можете скопировать промт здесь или просто использовать одну из команд на сайте:
Многие уже собирали такие правила вручную. Prose меняет подачу, но не точность ответа, поэтому логи тестов и вывод инструментов лучше оставлять без улучшений.
Чат | Токены дешево
STYLE.md, который учит Codex отвечать спокойнее, как ClaudeОн заставляет агента общаться связанной технической прозой, не дробить мысль на десятки заголовков и списков и убирать всё, что не меняет следующий шаг.
Автор кладёт правила прямо в
AGENTS.md, потому что skills в разных агентных обвязках могут загружаться выборочно.Вы можете скопировать промт здесь или просто использовать одну из команд на сайте:
curl -fsSL prose.ami.rip/STYLE.md >> ~/.codex/AGENTS.mdМногие уже собирали такие правила вручную. Prose меняет подачу, но не точность ответа, поэтому логи тестов и вывод инструментов лучше оставлять без улучшений.
Чат | Токены дешево
👍4❤1
Разработчики Codex поддержали CLIProxyAPI: GPT-5.6 Sol можно запускать прямо в Claude Code
Theo показал Claude Code, где вместо Claude работает GPT-5.6 Sol. Tibo из команды OpenAI попросил выложить рецепт: «мы не дискриминируем обвязки», а затем сам опубликовал настройку через CLIProxyAPI с 40.7к⭐ .
Получается
Шаг 1: Установите CLIProxyAPI
Шаг 2: Подключитесь
Шаг 3: Определите следующий alias и наслаждайтесь Claudex:
У этой схемы есть практический смысл. Сейчас в Codex подагенты Sol наследуют уровень effort родителя: запустили основного агента на
В Claude Code основной Sol можно оставить на
Чат | Токены дешево
Theo показал Claude Code, где вместо Claude работает GPT-5.6 Sol. Tibo из команды OpenAI попросил выложить рецепт: «мы не дискриминируем обвязки», а затем сам опубликовал настройку через CLIProxyAPI с 40.7к
Получается
Claudex: интерфейс, инструменты, permissions и субагенты Claude Code, а модель и лимиты приходят через Codex OAuth.Шаг 1: Установите CLIProxyAPI
Шаг 2: Подключитесь
Шаг 3: Определите следующий alias и наслаждайтесь Claudex:
alias claudex='CLAUDE_CODE_SUBAGENT_MODEL=gpt-5.6-sol \
CLAUDE_CODE_ALWAYS_ENABLE_EFFORT=1 \
CLAUDE_CODE_MAX_TOOL_USE_CONCURRENCY=3 \
ENABLE_TOOL_SEARCH=false \
claude --model gpt-5.6-sol'
У этой схемы есть практический смысл. Сейчас в Codex подагенты Sol наследуют уровень effort родителя: запустили основного агента на
ultra - все дочерние агенты тоже начинают жечь лимиты на ultra. Проблема все еще открыта, а разработчик Codex DX ответил, что команда уже работает над исправлением. Theo пока советует полностью избегать ultra.В Claude Code основной Sol можно оставить на
xhigh, а подагентам давать medium. В одном небольшом тесте на трех задачах Sol medium в Claude Code оказался примерно на 46% быстрее и использовал на 23% меньше выходных токенов, чем в Codex, при сопоставимом результате. Выборка маленькая, но влияние обвязки на одну и ту же модель видно хорошо.Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4🔥2
Один большой дизайн skill уже не даёт лучший результат: сравнение пяти популярных skills показывает, что UI лучше собирать отдельными проходами. Taste Skill и DESIGN.md мы уже обсуждали, поэтому вот продолжение стека.
По установкам через skills.sh сейчас впереди frontend-design 161к⭐ от Anthropic с 657к,
🔵 Impeccable 46к⭐ добавляет 23 точечные команды:
🔵 web-design-guidelines 29к⭐ не придумывает стиль, а проверяет готовую страницу: доступность, формы, состояния фокуса, семантику, адаптивность и анимации. В сравнении пяти skills этот набор оказался сильнее остальных именно по веб-нормам и доступности.
🔵 Emil Kowalski Skills 11к⭐ закрывает движение.
🔵 UI UX Pro Max 105к⭐ полезен на этапе выбора системы: 67 стилей, 161 палитра и 57 пар шрифтов. Большая база правил может ограничивать модель и усреднять результат, поэтому лучше использовать её для направления, а финальную проверку отдать более узким skills.
🔵 shadcn/improve 8к⭐ связывает эти этапы: находит 3-5 самых заметных проблем в кодовой базе и строит план улучшений.
Рабочий цикл:
Не подключайте все skills для дизайна одновременно. Запускайте их отдельными проходами, тогда правила не спорят друг с другом и видно, какой слой реально улучшил результат.
Чат | Токены дешево
По установкам через skills.sh сейчас впереди frontend-design 161к
web-design-guidelines от Vercel с 459к, UI UX Pro Max с 263к, Impeccable с 192к и основной skill Эмиля Ковальски со 133к. Но популярность не означает, что один из них стоит держать включённым на всех этапах./audit, /critique, /polish, /typeset и другие. Внутри есть 46 детерминированных проверок, поэтому его лучше запускать как отдельный проход после первого варианта./review-animations и /improve-animations исправляют кривые ускорения, появление элементов, жесты и анимации компоновки. Иот же тест поставил этот набор первым по анимациям.Рабочий цикл:
референс или DESIGN.md → Taste либо Impeccable → /improve → Vercel audit → Emil animations → проверка скриншотом в браузереНе подключайте все skills для дизайна одновременно. Запускайте их отдельными проходами, тогда правила не спорят друг с другом и видно, какой слой реально улучшил результат.
Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👌2
Сатья Наделла, CEO Microsoft, сформулировал тревожный парадокс корпоративного ИИ: компании платят моделям деньгами, а затем передают им свои самые ценные знания через запросы.
Он объясняет, почему собственные данные, память, проверки и loop обучения скоро станут одним из главных активов бизнеса.
📎 Обратный информационный парадокс: кому принадлежит обучение компании
Чат | Токены дешево
Он объясняет, почему собственные данные, память, проверки и loop обучения скоро станут одним из главных активов бизнеса.
Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
Telegraph
Обратный информационный парадокс: кому принадлежит обучение компании
В эпоху ИИ компания платит за интеллект дважды. Первый раз - деньгами за доступ к модели. Второй - знаниями, без которых модель не сможет стать действительно полезной: внутренними правилами, исправлениями, примерами хорошего результата, рабочими процессами…
👍2❤1
AI coding loop для Hermes 🔱
Он убирает постоянное сопровождение агента и оставляет человеку две задачи: описать идею и проверить готовый результат.
Работает так:
1. Создаём три skills:
2. Запускаем
3. Cron-задача
4. Другая cron-задача запускает
5.
6. После успешной проверки Hermes присылает в Telegram краткое описание изменений, результаты тестов и ссылку на PR. Остаётся проверить результат и ответить
Вся память цикла хранится в обычных Markdown-файлах, а фоновые запуски выполняют cron-задачи Hermes.
Утром присылаете несколько идей, днём агент самостоятельно прогоняет разработку и проверки, вечером вы просматриваете готовые изменения. (В идеальном мире)
Собственно можете прислать этот пост своему агенту и попросить выстроить loop.
Чат | Токены дешево
Он убирает постоянное сопровождение агента и оставляет человеку две задачи: описать идею и проверить готовый результат.
Работает так:
1. Создаём три skills:
/spec, /build и /review.2. Запускаем
/spec "идея". Hermes задаёт уточняющие вопросы, а затем сохраняет подробное задание в Markdown-файл: что сделать, какие есть ограничения и как проверить результат.3. Cron-задача
/build регулярно проверяет папку со спецификациями. Находит новую задачу, пишет код, запускает тесты и меняет статус в том же файле на review.4. Другая cron-задача запускает
/review в свежей сессии. Она проверяет код, безопасность, производительность и тесты. Если находит проблемы, записывает замечания в Markdown и возвращает статус fix.5.
/build подхватывает замечания, исправляет код и снова отправляет его на проверку. Цикл build - review продолжается, пока все проверки не пройдены.6. После успешной проверки Hermes присылает в Telegram краткое описание изменений, результаты тестов и ссылку на PR. Остаётся проверить результат и ответить
merge.Вся память цикла хранится в обычных Markdown-файлах, а фоновые запуски выполняют cron-задачи Hermes.
Утром присылаете несколько идей, днём агент самостоятельно прогоняет разработку и проверки, вечером вы просматриваете готовые изменения. (В идеальном мире)
Собственно можете прислать этот пост своему агенту и попросить выстроить loop.
Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6
У бизнеса с маржой 3% экономия менее 1% выручки может увеличить прибыль примерно на 27%
Главный резерв часто скрыт в «работе вокруг работы»: маршрутах, согласованиях, документах, счетах и разборе исключений. Именно сюда стоит встраивать ИИ-агентов - в существующие ERP, почту и таблицы, с понятными границами и передачей спорных случаев человеку.
📎 Почему бизнес с низкой маржой может выиграть от ИИ больше всех
Чат | Токены дешево
Главный резерв часто скрыт в «работе вокруг работы»: маршрутах, согласованиях, документах, счетах и разборе исключений. Именно сюда стоит встраивать ИИ-агентов - в существующие ERP, почту и таблицы, с понятными границами и передачей спорных случаев человеку.
Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
This media is not supported in your browser
VIEW IN TELEGRAM
Pi как оркестратор для Claude Code и Codex
Ben Davis показал свою сборку Pi 453⭐ . Основная сессия Pi запускает Pi, Claude Code и Codex как полноценных субагентов через единый набор инструментов с отдельными сессиями и общим интерфейсом.
Его рабочий loop:
Одновременно могут работать до четырёх подагентов.
В репозитории также есть JavaScript-workflow с фазами, параллельным запуском и результатами по JSON Schema, фоновые терминалы с
Слепо копировать не стоит. Claude-подагенты запускаются с
Многие говорят, что Pi агент очень хорош, если у нас те кто хочет поделится своим сетапом?
Чат | Токены дешево
Ben Davis показал свою сборку Pi 453
Его рабочий loop:
Claude Code/Fable: исследование и дизайн API → Codex: реализация → свежий Claude Code/Fable: ревью и упрощениеОдновременно могут работать до четырёх подагентов.
/subagents показывает модель, заполнение контекста, время, активные инструменты и статус. Можно открыть полный лог, отправить уточнение, остановить запуск или перехватить управление. Готовый результат автоматически возвращается в основную сессию. Свежий контекст ревьюера помогает не унаследовать ошибочное предположение из плана и реализации.В репозитории также есть JavaScript-workflow с фазами, параллельным запуском и результатами по JSON Schema, фоновые терминалы с
/ps, инструменты Firecrawl, ask_user, Git/PR-информация и панель с моделью, контекстом, стоимостью и скоростью генерации.Слепо копировать не стоит. Claude-подагенты запускаются с
bypassPermissions, Codex - с approvalPolicy: never и danger-full-access. Текущий SETUP.md также не ставит зависимости вложенных extensions. После их отдельной установки type-check и все 105 тестов проходят.Многие говорят, что Pi агент очень хорош, если у нас те кто хочет поделится своим сетапом?
Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
От issue до PR: облачная фабрика разработки 🔥
Cloud Factory Demo 79⭐ собирает цепочку: триаж новых задач →
Шаблон использует Oz Warp, GitHub Actions и скиллы. Каждый этап оставляет проверяемый артефакт, изменения проходят через PR, а среду запуска можно заменить. Верификация и мониторинг пока в плане.
📎 Автоматический триаж задач
📎 Спецификации для сложных задач
📎 Самоулучшающийся агент проверки кода
Автор Зак Ллойд - основатель и CEO Warp, ранее Principal Engineer в Google Docs и CTO Time. Статьи показывают, как команда строит систему, которая ведет работу от issue до проверенного PR.
Чат | Токены дешево
Cloud Factory Demo 79
PRODUCT.md и TECH.md для сложных изменений → реализация → проверка PR → внешний loop, который учится на реакции команды.Шаблон использует Oz Warp, GitHub Actions и скиллы. Каждый этап оставляет проверяемый артефакт, изменения проходят через PR, а среду запуска можно заменить. Верификация и мониторинг пока в плане.
Автор Зак Ллойд - основатель и CEO Warp, ранее Principal Engineer в Google Docs и CTO Time. Статьи показывают, как команда строит систему, которая ведет работу от issue до проверенного PR.
Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
Вышла новая модель Inkling от Thinking Machines Lab - стартапа Миры Мурати, бывшего технического директора OpenAI.
Модель достаточно средненькая по всем параметрам, но пускай будет.
Кроме того, SpaceXAI открыла исходный код агента Grok Build 8к⭐ . Из интересного: CLI не собирает телеметрию и не отправляет ваши данные, за исключением самих промтов.
Чат | Токены дешево
Модель достаточно средненькая по всем параметрам, но пускай будет.
Кроме того, SpaceXAI открыла исходный код агента Grok Build 8к
Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3
Что происходит, когда AI-агенты получают доступ к мессенджеру, коду, данным и рабочим процессам всей компании?
В разборе Cerebras Исаак Тай, Дэниел Ким и Майк Гао, команда создателей внутренней базы знаний, показывают систему с 15 000 запросов в день: гибридный поиск, реранжирование, MCP и контроль доступа.
В истории Replit основатель и CEO Амджад Масад вместе со Скоттом Кеннеди описывают «компанию на автопилоте»: loops с субагентами проверяют PR, расследуют инциденты и помогают аналитикам, продажам и поддержке. И поднимают главный вопрос автономности: как доказать, что работа действительно выполнена правильно.
И также из новостей, вышла Kimi K3, которая стала самой большой открытой моделью, на 2.8 трлн параметров. Теперь это реальный конкурент клоду и гпт, немного недотягивающий по мощности, но при этом и подешевле - $3/$15 за 1кк токенов.
Чат | Токены дешево
В разборе Cerebras Исаак Тай, Дэниел Ким и Майк Гао, команда создателей внутренней базы знаний, показывают систему с 15 000 запросов в день: гибридный поиск, реранжирование, MCP и контроль доступа.
В истории Replit основатель и CEO Амджад Масад вместе со Скоттом Кеннеди описывают «компанию на автопилоте»: loops с субагентами проверяют PR, расследуют инциденты и помогают аналитикам, продажам и поддержке. И поднимают главный вопрос автономности: как доказать, что работа действительно выполнена правильно.
И также из новостей, вышла Kimi K3, которая стала самой большой открытой моделью, на 2.8 трлн параметров. Теперь это реальный конкурент клоду и гпт, немного недотягивающий по мощности, но при этом и подешевле - $3/$15 за 1кк токенов.
Чат | Токены дешево
👍5❤2
Конкуренция творит чудеса, Claude Fable 5 останется в подписках на тарифах Max и Team Premium с ограничением 50% 🎉
А Pro и Team Standard сохранят доступ к Fable за счет кредитов на использование в размере 100$ (единоразово).
Anthropic понимает, что вы могли фрустрироваться, поэтому ценим невероятный дар в 50% лимитов и надеемся, что они найдут побольше серверов)
Чат | Токены дешево
А Pro и Team Standard сохранят доступ к Fable за счет кредитов на использование в размере 100$ (единоразово).
Anthropic понимает, что вы могли фрустрироваться, поэтому ценим невероятный дар в 50% лимитов и надеемся, что они найдут побольше серверов)
Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5
Почему одна и та же LLM может ответить за секунды или потратить минуты на рассуждение?
Статья о том, как модели учатся режимам
📎 Как управлять глубиной рассуждений в LLM
Сложная, но интересная статья, советую к прочтению👍
Чат | Токены дешево
Статья о том, как модели учатся режимам
low, medium и high, почему максимальное усилие быстро становится дорогим и когда меньшая модель может догнать более крупную за счет дополнительного времени на поиск решения.Сложная, но интересная статья, советую к прочтению
Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
Telegraph
Как управлять глубиной рассуждений в LLM
Почти два года назад OpenAI выпустила o1 и сделала рассуждающие языковые модели массовой темой. Примерно через четыре месяца появился DeepSeek-R1 вместе с подробным рецептом обучения через обучение с подкреплением и проверяемыми наградами, RLVR. Теперь режимы…
👍4❤1