Hermes Agent v0.18.0 - Judgment Release 🔱
Большой релиз про надежность длинных агентных задач. За окно закрыли около 1 950 issues/PR, полностью зачистили P0/P1 и зафиксировали ноль открытых критичных задач.
Что самое интересное, помимо MoA, /learn и /usage:
🔵
🔵 Появился журнал проверок для coding-задач: агент запоминает каноничные проверки проекта, запускает их и показывает статус через gateway.
🔵
🔵
🔵 Desktop стал ближе к coding cockpit: Projects, worktrees, review pane, multi-terminal и инструменты проекта для агента.
Hermes двигают к агенту, которому можно доверить длинную работу с понятным контрактом готовности и проверяемым результатом.
Чат | CloseRouter
Большой релиз про надежность длинных агентных задач. За окно закрыли около 1 950 issues/PR, полностью зачистили P0/P1 и зафиксировали ноль открытых критичных задач.
Что самое интересное, помимо MoA, /learn и /usage:
/goal получил контракты готовности. Теперь можно заранее описать, какой результат считается готовым, а Hermes сверяет работу с проверками, логами и данными.delegate_task теперь умеет запускать несколько субагентов в фоне. Отправили параллельно исследовать конкурентов, проверить модули или собрать данные - и продолжили чат. В конце приходит одна сводка./journey показывает, чему Hermes научился: memories и skills в виде таймлайна, с возможностью править и удалять. В desktop добавили memory graph.Hermes двигают к агенту, которому можно доверить длинную работу с понятным контрактом готовности и проверяемым результатом.
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍17
OpenWiki 945 ⭐ - CLI от LangChain, который пишет wiki для репозитория под кодовых агентов.
Запуск:
🔵 генерирует страницы про архитектуру, CLI, операции, source map и правила работы с кодом
🔵 обновляет wiki через
🔵 хранит метаданные последнего запуска в
🔵 умеет ежедневный GitHub Action, который открывает PR с обновлением документации
🔵 работает через OpenRouter, Fireworks, Baseten, OpenAI и Anthropic, плюс опционально трассирует запуск в LangSmith
Авто-wiki может закрепить ошибку агента. Поэтому безопасный режим - обновлять документацию через PR и ревьюить ее как код.
Чат | CloseRouter
AGENTS.md и CLAUDE.md быстро раздуваются, если складывать туда весь контекст проекта. OpenWiki выносит подробности в папку openwiki/, а в агентные инструкции добавляет короткую ссылку.Запуск:
npm install -g openwiki openwiki --initopenwiki --update, читая git status, git log и git diffopenwiki/.last-update.jsonАвто-wiki может закрепить ошибку агента. Поэтому безопасный режим - обновлять документацию через PR и ревьюить ее как код.
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7
Про простую вещь, которая часто дает больше скорости, чем апгрейд модели: нормальная карта рабочей области.
INDEX.md, канонические файлы, отдельный архив и понятные точки входа помогают агенту меньше искать и быстрее начинать работу.Идея Agent OS - вынести координацию в отдельный слой. Одна модель планирует, другая делает, третья проверяет. Самое важное здесь - роли, критерии готовности, логи маршрутизации и доказательства результата.
Loop engineering превращает агентную работу в повторяемый цикл: цель, состояние, проверка, стоп-условие. В статье разобран Karpathy Loop и следующий слой - loop, который улучшает саму стратегию поиска.
Полезная шкала для тех, кто запускает подагентов, worktrees, фоновые сессии и manager-agents. Автономность стоит повышать там, где есть sandbox, откат, проверки и evidence trail.
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5😱1
Разобрал около 100 ответов под опросом про Hermes. Получился хороший снимок того, как люди реально живут с агентами каждый день.
Главный паттерн - Hermes почти у всех уходит из терминала в рабочую среду:
- 55% используют Telegram, Discord, iMessage или другие мессенджеры
- 30% сидят в Desktop/браузере
- 30% все еще активно используют TUI/CLI
По моделям лидируют GPT/Codex - 35%. Дальше DeepSeek и локальные модели - по 25%, MoA/роутеры - около 20%. То есть схема уже не “одна лучшая модель”, а набор: сильная модель для сложных задач, дешевые или локальные воркеры для рутины.
Самое интересное - память. Obsidian, vault и markdown всплывают у 35%, встроенная память Hermes - у 20%, Honcho - у 10%. Люди явно хотят память, которую можно читать, синкать, коммитить и чинить руками.
По оркестрации: delegate_task и subagents - 25%, kanban и cron - примерно по 20%. А кто то всегда ведет разработку, отдавая кодинг задачи Claude/Codex CLI в отдельный tmux.
Skills упоминают чаще, чем MCP: 35% против 10%.
Хороший практический пример - статья Matthew Gunnin про память для двух агентов: OpenClaw и Hermes. У него память разделена на 4 слоя: markdown-файлы с identity и memory index, локальное сохранение фактов через Hindsight 17.9к⭐ , общий Obsidian/Nexus-лог для синхронизации агентов и gbrain 24.9к⭐ как поисковый слой поверх всего vault.
Самая полезная мысль оттуда: память агента - это не просто засунуть больше в контекст. Рабочая схема больше похожа на инфраструктуру: факты проходят от сессии к сессии, решения пишутся в проверяемые файлы, несколько агентов читают один общий state, а старые знания можно найти без загрузки всего архива в контекст.
Чат | CloseRouter
Главный паттерн - Hermes почти у всех уходит из терминала в рабочую среду:
- 55% используют Telegram, Discord, iMessage или другие мессенджеры
- 30% сидят в Desktop/браузере
- 30% все еще активно используют TUI/CLI
По моделям лидируют GPT/Codex - 35%. Дальше DeepSeek и локальные модели - по 25%, MoA/роутеры - около 20%. То есть схема уже не “одна лучшая модель”, а набор: сильная модель для сложных задач, дешевые или локальные воркеры для рутины.
Самое интересное - память. Obsidian, vault и markdown всплывают у 35%, встроенная память Hermes - у 20%, Honcho - у 10%. Люди явно хотят память, которую можно читать, синкать, коммитить и чинить руками.
По оркестрации: delegate_task и subagents - 25%, kanban и cron - примерно по 20%. А кто то всегда ведет разработку, отдавая кодинг задачи Claude/Codex CLI в отдельный tmux.
Skills упоминают чаще, чем MCP: 35% против 10%.
Хороший практический пример - статья Matthew Gunnin про память для двух агентов: OpenClaw и Hermes. У него память разделена на 4 слоя: markdown-файлы с identity и memory index, локальное сохранение фактов через Hindsight 17.9к
Самая полезная мысль оттуда: память агента - это не просто засунуть больше в контекст. Рабочая схема больше похожа на инфраструктуру: факты проходят от сессии к сессии, решения пишутся в проверяемые файлы, несколько агентов читают один общий state, а старые знания можно найти без загрузки всего архива в контекст.
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4❤1
Eсть способ снизить затраты в Fable 5 примерно на 70% - pxpipe 800⭐
Просто преобразуйте контекст Claude Code в изображение и настройте Fable (и не только) на распознавание текста😂
Чат | CloseRouter
Просто преобразуйте контекст Claude Code в изображение и настройте Fable (и не только) на распознавание текста
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯10😁2👍1
showcase-video.webm
5.2 MB
Вечерний набор на выходные: два репо для маленькой фабрики кодовых агентов
Parallel Code 811⭐ - desktop-интерфейс для mac и linux, где Claude Code, Codex, Gemini, Copilot и другие CLI работают параллельно, каждый в своем
repowise 2.9к⭐ - слой понимания репозитория для агента. Индексирует код, git-историю, архитектурные решения, health/risk и документацию, потом отдает это через MCP в Claude Code, Codex, Cursor и других клиентов.
Для Codex:
Хорошая связка для эксперимента: Parallel Code гоняет несколько агентов, repowise дает агентам карту проекта и помогает проверять изменения по риску и контексту.
Чат | CloseRouter
Parallel Code 811
git worktree. Создали несколько задач, агенты разошлись по веткам, дальше смотрите diff, CI, комментарии и мерджите удачные варианты.repowise 2.9к
Для Codex:
pip install repowise
repowise init --codex --provider codex_cli --yesХорошая связка для эксперимента: Parallel Code гоняет несколько агентов, repowise дает агентам карту проекта и помогает проверять изменения по риску и контексту.
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
Loop engineering для solo-разработчика начинается с вопроса: откуда агенту брать задачи?
Если проект делает один человек, backlog часто живет в голове. Поэтому первый loop должен не писать код, а превращать цель проекта в маленькие проверяемые задачи.
А потом только идем к реализации:
Hermes в такой схеме может работать как оркестратор: читает цель, метрики и диагностику, выбирает один узкий участок, пишет план и проверяет результат. Codex CLI работает как исполнитель: берет одну задачу, делает diff, запускает проверки и останавливается, если нужен продуктовый выбор.
Начинать стоит с файла вроде
📎 Как собрать автономный loop
Чат | CloseRouter
Если проект делает один человек, backlog часто живет в голове. Поэтому первый loop должен не писать код, а превращать цель проекта в маленькие проверяемые задачи.
цель → метрика → воронка → провал → маленький PRА потом только идем к реализации:
диагностика → узкое место → план → diff от Codex → тесты → деплой → отчетHermes в такой схеме может работать как оркестратор: читает цель, метрики и диагностику, выбирает один узкий участок, пишет план и проверяет результат. Codex CLI работает как исполнитель: берет одну задачу, делает diff, запускает проверки и останавливается, если нужен продуктовый выбор.
Начинать стоит с файла вроде
docs/product-loop.md: цель, метрика, границы поведения агента, воронка и правила выбора следующей задачи.Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
Telegraph
Loop engineering: как собрать автономный loop без пожара
Запрос к модели запускает человек. Автономный loop запускает следующий шаг сам: находит работу, вызывает агента, проверяет результат, чинит ошибку и повторяет проход до машинного стоп-сигнала. Главная цель loop engineering - построить систему, которая сходится…
👍8
David Ondrej выложил свои Agent Skills в open source
David Ondrej - основатель DeepAPI, OpenDataset и Vectal. Вчера он открыл репозиторий davidondrej/skills 450⭐ - личный набор скиллов, который, по его словам, собран из сотен часов проб и ошибок.
Внутри 30 скиллов по 5 категориям:
🔵
🔵
🔵
🔵
🔵
Самое полезное здесь - структура: каждый
Часть skills завязана на стеке David, но как библиотека паттернов для своих скиллов - очень годно.
Чат | CloseRouter
David Ondrej - основатель DeepAPI, OpenDataset и Vectal. Вчера он открыл репозиторий davidondrej/skills 450
Внутри 30 скиллов по 5 категориям:
agent-orchestration - запуск loops, Codex /goal, delegation, handoff, cmux, DeepSWEskill-authoring - как писать, улучшать, публиковать и раскатывать skills между агентамиresearch-and-web - browser harness, deep research, YouTube transcripts, web-поиск для Pithinking-and-docs - превращение идей в docs, ADRs, interview-style planning, “прожарь меня”ops-and-setup - VPS, setup, cyber audit, anti-sleep для macOS, кастомные модели в PiСамое полезное здесь - структура: каждый
SKILL.md превращает повторяемый агентный сценарий в маленькую инструкцию, которую можно подключать к Claude Code, Codex, Hermes или своим агентам.Часть skills завязана на стеке David, но как библиотека паттернов для своих скиллов - очень годно.
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
GitHub - davidondrej/skills: access to david ondrej's personal agent skills
access to david ondrej's personal agent skills. Contribute to davidondrej/skills development by creating an account on GitHub.
👍4❤2
4X DGX Spark для локальной MoA-сетки агентов
Парень из X собрал стек на Hermes: Qwen закрывает легкие задачи, Nemotron берет мультимодальный ввод, Two-Tower работает с длинными повторяемыми генерациями, DeepSeek-V4-Flash маршрутизирует, а Claude/Codex/Grok остаются редким облачным учителями.
Автор целится в около 90% AI-работы локально. Каждый сложный запрос, который ушел в облако, сохраняется в лог: задача, выбранный агент, ответ и исправление. Потом эти пары идут в LoRA-тренировку Gemma-4-12B, чтобы похожие задачи дальше закрывались на локальном стеке.
Главная ценность здесь - loop обучения из собственных логов:
Репозиторий пока выглядит как журнал сборки и каркас. Routing hooks, miner, LoRA harness и бенчи есть, но eval-gate и hot-swap еще описаны как ручной шаг.
Чат | CloseRouter
Парень из X собрал стек на Hermes: Qwen закрывает легкие задачи, Nemotron берет мультимодальный ввод, Two-Tower работает с длинными повторяемыми генерациями, DeepSeek-V4-Flash маршрутизирует, а Claude/Codex/Grok остаются редким облачным учителями.
Автор целится в около 90% AI-работы локально. Каждый сложный запрос, который ушел в облако, сохраняется в лог: задача, выбранный агент, ответ и исправление. Потом эти пары идут в LoRA-тренировку Gemma-4-12B, чтобы похожие задачи дальше закрывались на локальном стеке.
Главная ценность здесь - loop обучения из собственных логов:
Репозиторий пока выглядит как журнал сборки и каркас. Routing hooks, miner, LoRA harness и бенчи есть, но eval-gate и hot-swap еще описаны как ручной шаг.
Чат | CloseRouter
🔥7👍4
Если модель вроде Fable 5 уходит из подписки, последние часы стоит тратить на извлечение ее экспертизы в артефакты:
Короткий плейбук из 5 сценариев с готовыми промтами:
📎 Сделайте это в свой последний день работы с Fable
Чат | CloseRouter
CLAUDE.md, skills, критерии качества, дорожные карты, заметки и проверяемые цели.Короткий плейбук из 5 сценариев с готовыми промтами:
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
Telegraph
Когда сильная модель уходит из подписки: что забрать заранее
Сценарий: Fable 5 или другая сильная модель скоро выходит из обычной подписки и становится дорогой в токенах. Последние часы такого доступа лучше использовать для извлечения экспертизы. Цель - оставить после модели артефакты, которыми завтра смогут пользоваться…
😁3❤2🔥1
Свежая статья от Anthropic
📎 С чего начать loops в Claude Code
Раз уж мы говорим о Claude Code, есть полезный репозиторий, который позволяет клоду общаться с Codex.
Codex MCP Server 540⭐ - Используйте GPT в клоде как советника или оставьте на Claude только планирование, а всю реализацию отдавайте в Codex.
Чат | CloseRouter
Раз уж мы говорим о Claude Code, есть полезный репозиторий, который позволяет клоду общаться с Codex.
Codex MCP Server 540
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Собрал две статьи про harness для AI-агентов - слой, который превращает модель в рабочий процесс: контекст, loop, инструменты, проверки, права, память и подагенты.
📎 Как получать сильный результат от любой модели
Практический каркас: когда хватит одного промпта, а когда пора собирать систему вокруг агента. Там про
📎 Harness engineering для самоулучшающихся AI-систем
Более глубокий слой: как сама обвязка становится объектом оптимизации. Агентные системы начинают улучшать контекст, процесс, код harness, evals и механизмы поиска.
Чат | CloseRouter
Практический каркас: когда хватит одного промпта, а когда пора собирать систему вокруг агента. Там про
CLAUDE.md, объективные проверки, независимого verifier, hooks, permissions, skills, memory и MCP.Более глубокий слой: как сама обвязка становится объектом оптимизации. Агентные системы начинают улучшать контекст, процесс, код harness, evals и механизмы поиска.
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7
Media is too big
VIEW IN TELEGRAM
Shepherd 1.1к ⭐ - Git-like trace для AI-агентов
Идея простая: если кодовый агент сделал странную правку, обычного лога мало. Хочется вернуться ровно в момент перед ошибкой, посмотреть, что он собирался сделать, ответвить запуск и дать другому агенту попробовать другой путь.
Shepherd строит вокруг агента такую историю запуска:
🔵 каждый model call, tool call и изменение файлов становится событием в trace
🔵 управляющий агент может наблюдать за рабочими агентами и вмешиваться до конфликта
🔵 результат работы хранится сбоку как предложение: его можно принять, отклонить или выпустить отдельно
🔵 права задаются прямо в Python-сигнатуре: этому repo можно только читать, этому можно писать
🔵 в статье fork/revert для контейнерных задач занимал примерно 134-147 мс, плюс около 95% переиспользования prompt cache при ответе
Самый сильный пример - пара кодовых агентов в одном репозитории. Без supervisor они проходят CooperBench на 28.8%. С meta-agent, который смотрит их trace и вовремя делает inject/handoff/discard, результат вырос до 54.7%.
Реальная замена git? Нет. Git все еще остается для истории кода, PR и командной разработки. Shepherd работает уровнем выше: он хранит историю поведения агента и окружения, чтобы агентный запуск можно было откатить, разветвить и проверить.
Важная оговорка: публичный репозиторий сейчас alpha/dev preview. В пакете уже есть workspace, retained runs, changesets, trace и permissions, но самая красивая схема из arxiv про полноценные meta-agents поверх чужих запусков еще выглядит как исследовательская цель.
Для продакшна рано. Как направление для инфраструктуры для агентов - очень сильный сигнал: следующие агенты будут нуждаться не только в git, но и в версионировании собственных действий.
Чат | CloseRouter
Идея простая: если кодовый агент сделал странную правку, обычного лога мало. Хочется вернуться ровно в момент перед ошибкой, посмотреть, что он собирался сделать, ответвить запуск и дать другому агенту попробовать другой путь.
Shepherd строит вокруг агента такую историю запуска:
Самый сильный пример - пара кодовых агентов в одном репозитории. Без supervisor они проходят CooperBench на 28.8%. С meta-agent, который смотрит их trace и вовремя делает inject/handoff/discard, результат вырос до 54.7%.
Реальная замена git? Нет. Git все еще остается для истории кода, PR и командной разработки. Shepherd работает уровнем выше: он хранит историю поведения агента и окружения, чтобы агентный запуск можно было откатить, разветвить и проверить.
Важная оговорка: публичный репозиторий сейчас alpha/dev preview. В пакете уже есть workspace, retained runs, changesets, trace и permissions, но самая красивая схема из arxiv про полноценные meta-agents поверх чужих запусков еще выглядит как исследовательская цель.
Для продакшна рано. Как направление для инфраструктуры для агентов - очень сильный сигнал: следующие агенты будут нуждаться не только в git, но и в версионировании собственных действий.
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3
Agent Skills for Context Engineering 17к ⭐ - библиотека
Главная польза репо - готовые инженерные плейбуки. Каждый skill объясняет, когда его подключать, какие ошибки он ловит и как превратить идею в рабочий агентный процесс.
🔵
🔵
🔵
🔵
🔵
🔵
🔵
🔵
И это не все, что есть в репозитории😏
Чат | CloseRouter
SKILL.md для тех, кто собирает AI-агентов вокруг контекста, памяти, инструментов, evals и loops.Главная польза репо - готовые инженерные плейбуки. Каждый skill объясняет, когда его подключать, какие ошибки он ловит и как превратить идею в рабочий агентный процесс.
context-degradation - как понять, что агент начал ломаться из-за контекста. Lost-in-middle, старые факты, лишние документы, конфликтующие версии API, отравленная история после галлюцинации или плохого tool outputcontext-compression и context-optimization - как ужимать длинную сессию без потери решений, файлов, рисков и следующих шагов. Там же про masking, caching, partitioning и выбор того, что вообще стоит держать в окнеmemory-systems и filesystem-context - как вынести память из промпта: файлы, scratchpads, JSONL-логи, графы, долговременные факты, handoff между агентамиmulti-agent-patterns - когда реально нужны несколько агентов, как делить работу между supervisor, worker и verifier, и как не смешивать их контекстыtool-design - как писать инструменты для агентов: понятные имена, схемы, ошибки, форматы ответа, MCP naming и сокращение лишних tools, чтобы агент меньше путалсяevaluation и advanced-evaluation - как проверять агентные системы: deterministic checks, regression suites, rubrics, LLM-as-judge, pairwise comparison и защита от biasharness-engineering - обвязка вокруг автономного агента: что можно редактировать, что locked, где вести логи, как делать rollback, novelty gate и human approvalself-improvement-loops - самый интересный skill. Он про loops, где агент улучшает уже не ответ, а собственный workflow, prompt, skill, harness или механизм контекста. Важный принцип: evaluator, права, бюджеты и sandbox должны быть вне зоны, которую loop может менять. Иначе агент быстро начнет оптимизировать метрику вместо задачиИ это не все, что есть в репозитории
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5👍4
This media is not supported in your browser
VIEW IN TELEGRAM
Вышел Grok 4.5 😐
Модель отдельно тренировали под кодинг и агентные задачи. В официальном треде акцент на инженерную работу: большие репозитории, долгие loops с инструментами, несколько репо, skills и агентные сценарии.
По цифрам модель выглядит как быстрый рабочий исполнитель:
🔵 500k контекста, reasoning
🔵 $2 за 1M входных и $6 за 1M выходных токенов, cached input $0.50
🔵 около 80 TPS и 15.9k output tokens на SWE Bench Pro против 67k у Opus 4.8 в замере xAI
🔵 доступна в Grok Build, Cursor, API и Office add-ins, EU пока ждет.
Важная деталь: бенчи неровные. Grok 4.5 силен в Terminal Bench и SWE Marathon, но на DeepSWE 1.1 и SWE Bench Pro уступает Fable/Opus. Сам Маск в ответах написал, что Fable сильнее, просто большинству задач такой уровень не нужен.
Для агентных процессов это интересный слот: быстрый и заметно дешевле топовых моделей, этакий opus по цене sonnet, по словам пробовавших.
Мне понравился такой формат работы с новым Grok:
fable-advisor 190⭐ - Claude Code сессия работает на Fable 5 как архитектор, пишет требования, декомпозирует задачу и проверяет результат, а реализацию отправляет в Grok 4.5 через Grok CLI или в GPT-5.5 через Codex CLI.
Чат | CloseRouter
Модель отдельно тренировали под кодинг и агентные задачи. В официальном треде акцент на инженерную работу: большие репозитории, долгие loops с инструментами, несколько репо, skills и агентные сценарии.
По цифрам модель выглядит как быстрый рабочий исполнитель:
low/medium/highВажная деталь: бенчи неровные. Grok 4.5 силен в Terminal Bench и SWE Marathon, но на DeepSWE 1.1 и SWE Bench Pro уступает Fable/Opus. Сам Маск в ответах написал, что Fable сильнее, просто большинству задач такой уровень не нужен.
Для агентных процессов это интересный слот: быстрый и заметно дешевле топовых моделей, этакий opus по цене sonnet, по словам пробовавших.
Мне понравился такой формат работы с новым Grok:
fable-advisor 190
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
Media is too big
VIEW IN TELEGRAM
OpenAI и Meta в один день выпустили модели 🔥
GPT-5.6 вышел семейством Sol - флагман, Terra - баланс, Luna - быстрые дешевые задачи. Еще апдейт - ChatGPT Work: Codex и ChatGPT собирают в одно desktop-приложение.
И у GPT-5.6 появился режим
В X Цукерберг вернулся после 3 лет молчания с анонсом Muse Spark. Модель от Meta Superintelligence Labs для кодинга, tool use, computer use и мультимодальных агентных задач. Внутри 1M контекста, работа с desktop/mobile/browser, MCP, custom skills и делегирование в параллельных субагентов.
Самый агрессивный ход - public preview для US developers, совместимость с OpenAI SDK, $20 кредитов бесплатно. Цена: $1.25 input и $4.25 output за 1M токенов. По сравнению с GPT-5.6 Sol это примерно в 4 раза дешевле на входе и в 7 раз дешевле на выходе.
Есть кто уже попробовал новые модельки? Про Grok 4.5 не забываем.
Чат | CloseRouter
GPT-5.6 вышел семейством Sol - флагман, Terra - баланс, Luna - быстрые дешевые задачи. Еще апдейт - ChatGPT Work: Codex и ChatGPT собирают в одно desktop-приложение.
И у GPT-5.6 появился режим
ultra: несколько агентов параллельно работают над сложной задачей.В X Цукерберг вернулся после 3 лет молчания с анонсом Muse Spark. Модель от Meta Superintelligence Labs для кодинга, tool use, computer use и мультимодальных агентных задач. Внутри 1M контекста, работа с desktop/mobile/browser, MCP, custom skills и делегирование в параллельных субагентов.
Самый агрессивный ход - public preview для US developers, совместимость с OpenAI SDK, $20 кредитов бесплатно. Цена: $1.25 input и $4.25 output за 1M токенов. По сравнению с GPT-5.6 Sol это примерно в 4 раза дешевле на входе и в 7 раз дешевле на выходе.
Есть кто уже попробовал новые модельки? Про Grok 4.5 не забываем.
Чат | CloseRouter
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
This media is not supported in your browser
VIEW IN TELEGRAM
Все очень активно обсуждают новые модели, снова на хайпе тема с оркестрацией
Парень с помощью одной команды GPT-5.6 Sol построил весь pipeline и обучил модель с нуля на основе истории сообщений iMessage. Локально на Mac.
Теперь локальная модель генерирует ответы в стиле создателя.
А кто-то использует GPT-5.6 как оператора, Fable 5 как советника, а Gemini 3.5 Flash - как исполнителя.
Skill Advisor Orchestrator Worker 117к⭐ - здесь в целом собрано очень много полезного для агентов.
Кто-то сделал более простую версию, но с поддержкой Codex, Claude Code, Copilot, Grok, Pi - Orchestrator 44⭐
Всё это объединяет простой механизм вызова разных CLI-агентов. Задача - только выбрать вашего любимого агента, а дальше можно прокачивать его через делегирование.
Насколько это нужно, когда GPT-5.6 Sol может делегировать задания 5.6 Luna? В каких-то кейсах, наверное, это может улучшить результат просто из-за более разных точек зрения и другого восприятия контекста.
Например, в X благодаря нескольким хитростям, таким как переформулирование академических, образовательных и безопасных аспектов и постепенное наращивание нагрузки, смогли получить от модели Grok 4.5 инфу о том, как синтезировать мет*мфетамин, создать взр*вчатые устройства, протокол экстракции рицина и скрипт трояна удалённого доступа. Ссылку, пожалуй, не буду оставлять: скрины с частями ответов модели прямо в твите на 1 млн просмотров висят😦
Чат | Токены дешево
Парень с помощью одной команды GPT-5.6 Sol построил весь pipeline и обучил модель с нуля на основе истории сообщений iMessage. Локально на Mac.
Теперь локальная модель генерирует ответы в стиле создателя.
А кто-то использует GPT-5.6 как оператора, Fable 5 как советника, а Gemini 3.5 Flash - как исполнителя.
Skill Advisor Orchestrator Worker 117к
Кто-то сделал более простую версию, но с поддержкой Codex, Claude Code, Copilot, Grok, Pi - Orchestrator 44
Всё это объединяет простой механизм вызова разных CLI-агентов. Задача - только выбрать вашего любимого агента, а дальше можно прокачивать его через делегирование.
Насколько это нужно, когда GPT-5.6 Sol может делегировать задания 5.6 Luna? В каких-то кейсах, наверное, это может улучшить результат просто из-за более разных точек зрения и другого восприятия контекста.
Например, в X благодаря нескольким хитростям, таким как переформулирование академических, образовательных и безопасных аспектов и постепенное наращивание нагрузки, смогли получить от модели Grok 4.5 инфу о том, как синтезировать мет*мфетамин, создать взр*вчатые устройства, протокол экстракции рицина и скрипт трояна удалённого доступа. Ссылку, пожалуй, не буду оставлять: скрины с частями ответов модели прямо в твите на 1 млн просмотров висят
Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5
Вот что можно сказать о новых GPT моделях
🔵 Если вам не нужна производительность уровня Terra Ultra, всегда лучше использовать модель Luna с более высокими настройками сложности (та же или лучшая производительность, но дешевле).
🔵 Забудьте обо всем, что ниже Sol High, используйте Luna с более высокими настройками сложности.
🔵 Забудьте о Sol Extra High, используйте Terra Ultra.
🔵 Дополнительные затраты на Sol Ultra, вероятно, не оправдывают себя по сравнению с Max.
Просто использовать постоянно GPT 5.6 Sol Ultra не получится даже на подписке за 200$, лимиты будут улетать. Теперь нужно правильно выбирать инструмент.
Чат | Токены дешево
Просто использовать постоянно GPT 5.6 Sol Ultra не получится даже на подписке за 200$, лимиты будут улетать. Теперь нужно правильно выбирать инструмент.
Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7❤1
11 skills, из которых складывается персональная Agent OS разработчика
Разраб из PostHog хранит в своих dotfiles навыки для Claude Code. Вместе они образуют процесс работы с PR, систему инженерных решений и память прошлых расследований.
Самые интересные:
🔵
🔵
🔵
🔵
🔵
🔵
Сильная часть репозитория - накопленное инженерное состояние. Каждый skill знает последовательность действий, границы автономности, условия остановки и уже проверенные гипотезы. Так личный опыт разработчика постепенно становится исполняемой системой для агента.
Чат | Токены дешево
Разраб из PostHog хранит в своих dotfiles навыки для Claude Code. Вместе они образуют процесс работы с PR, систему инженерных решений и память прошлых расследований.
Самые интересные:
pr-shepherd связывает qa-swarm, review-triage, simplify и ci-shepherd. Система делает от двух до четырех проходов ревью, исправления и упрощения кода, останавливаясь, когда новый проход становится чистым. qa-swarm запускает четыре независимых взгляда, review-triage разбирает комментарии, а CI-агент обновляет ветку и сообщает состояние проверок, не превращая CI в стоп-сигнал. Сильные модели заняты ревью, более дешевые - механической работой.takeover-stale-pr оживляет заброшенный PR: подтягивает свежую базу, разбирает старые замечания, запускает затронутые тесты и передает готовую ветку в pr-shepherd.paul-pair срабатывает перед вопросом человеку и перед словом «готово». Три режима: сделать самому, сделать и предложить альтернативу, остановиться и спросить. Рядом лежат paul-reviewer с акцентом на связанность, наблюдаемость и безопасный выкат и xp-reviewer с YAGNI, простым дизайном и правилом «немного дублирования лучше неправильной абстракции».investigate-library-upgrade читает changelog, находит реально используемые API пакета и связывает несовместимые изменения с конкретными файлами. Выдает радиус работ и план выката, но не обновляет зависимость без отдельного разрешения.hunt-memory-leaks - полноценный исполняемый плейбук по утечкам памяти браузера. Он различает JS heap и память процесса рендеринга, требует тесты с несколькими вкладками в браузере с интерфейсом и несколько повторов, использует CDP, снимки JS heap, сетевые события и трассировки аллокаторов. В references/ записаны уже исправленные причины, открытые гипотезы и тупики, которые не нужно проходить заново.manage-claude-memory переносит память проектов из локального хранилища Claude в хранимые в git dotfiles через символические ссылки. Перед записью проверяет содержимое на ключи, персональные данные и закрытую продуктовую информацию.Сильная часть репозитория - накопленное инженерное состояние. Каждый skill знает последовательность действий, границы автономности, условия остановки и уже проверенные гипотезы. Так личный опыт разработчика постепенно становится исполняемой системой для агента.
Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2
prose - маленький
Он заставляет агента общаться связанной технической прозой, не дробить мысль на десятки заголовков и списков и убирать всё, что не меняет следующий шаг.
Автор кладёт правила прямо в
Вы можете скопировать промт здесь или просто использовать одну из команд на сайте:
Многие уже собирали такие правила вручную. Prose меняет подачу, но не точность ответа, поэтому логи тестов и вывод инструментов лучше оставлять без улучшений.
Чат | Токены дешево
STYLE.md, который учит Codex отвечать спокойнее, как ClaudeОн заставляет агента общаться связанной технической прозой, не дробить мысль на десятки заголовков и списков и убирать всё, что не меняет следующий шаг.
Автор кладёт правила прямо в
AGENTS.md, потому что skills в разных агентных обвязках могут загружаться выборочно.Вы можете скопировать промт здесь или просто использовать одну из команд на сайте:
curl -fsSL prose.ami.rip/STYLE.md >> ~/.codex/AGENTS.mdМногие уже собирали такие правила вручную. Prose меняет подачу, но не точность ответа, поэтому логи тестов и вывод инструментов лучше оставлять без улучшений.
Чат | Токены дешево
👍4❤1
Разработчики Codex поддержали CLIProxyAPI: GPT-5.6 Sol можно запускать прямо в Claude Code
Theo показал Claude Code, где вместо Claude работает GPT-5.6 Sol. Tibo из команды OpenAI попросил выложить рецепт: «мы не дискриминируем обвязки», а затем сам опубликовал настройку через CLIProxyAPI с 40.7к⭐ .
Получается
Шаг 1: Установите CLIProxyAPI
Шаг 2: Подключитесь
Шаг 3: Определите следующий alias и наслаждайтесь Claudex:
У этой схемы есть практический смысл. Сейчас в Codex подагенты Sol наследуют уровень effort родителя: запустили основного агента на
В Claude Code основной Sol можно оставить на
Чат | Токены дешево
Theo показал Claude Code, где вместо Claude работает GPT-5.6 Sol. Tibo из команды OpenAI попросил выложить рецепт: «мы не дискриминируем обвязки», а затем сам опубликовал настройку через CLIProxyAPI с 40.7к
Получается
Claudex: интерфейс, инструменты, permissions и субагенты Claude Code, а модель и лимиты приходят через Codex OAuth.Шаг 1: Установите CLIProxyAPI
Шаг 2: Подключитесь
Шаг 3: Определите следующий alias и наслаждайтесь Claudex:
alias claudex='CLAUDE_CODE_SUBAGENT_MODEL=gpt-5.6-sol \
CLAUDE_CODE_ALWAYS_ENABLE_EFFORT=1 \
CLAUDE_CODE_MAX_TOOL_USE_CONCURRENCY=3 \
ENABLE_TOOL_SEARCH=false \
claude --model gpt-5.6-sol'
У этой схемы есть практический смысл. Сейчас в Codex подагенты Sol наследуют уровень effort родителя: запустили основного агента на
ultra - все дочерние агенты тоже начинают жечь лимиты на ultra. Проблема все еще открыта, а разработчик Codex DX ответил, что команда уже работает над исправлением. Theo пока советует полностью избегать ultra.В Claude Code основной Sol можно оставить на
xhigh, а подагентам давать medium. В одном небольшом тесте на трех задачах Sol medium в Claude Code оказался примерно на 46% быстрее и использовал на 23% меньше выходных токенов, чем в Codex, при сопоставимом результате. Выборка маленькая, но влияние обвязки на одну и ту же модель видно хорошо.Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4🔥2