Agents Lab
960 subscribers
87 photos
44 videos
1 file
225 links
Обсуждаем AI агентов

Наш чатик https://t.me/openclaw_lab_community
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
Все очень активно обсуждают новые модели, снова на хайпе тема с оркестрацией

Парень с помощью одной команды GPT-5.6 Sol построил весь pipeline и обучил модель с нуля на основе истории сообщений iMessage. Локально на Mac.
Теперь локальная модель генерирует ответы в стиле создателя.

А кто-то использует GPT-5.6 как оператора, Fable 5 как советника, а Gemini 3.5 Flash - как исполнителя.
Skill Advisor Orchestrator Worker 117к - здесь в целом собрано очень много полезного для агентов.

Кто-то сделал более простую версию, но с поддержкой Codex, Claude Code, Copilot, Grok, Pi - Orchestrator 44

Всё это объединяет простой механизм вызова разных CLI-агентов. Задача - только выбрать вашего любимого агента, а дальше можно прокачивать его через делегирование.

Насколько это нужно, когда GPT-5.6 Sol может делегировать задания 5.6 Luna? В каких-то кейсах, наверное, это может улучшить результат просто из-за более разных точек зрения и другого восприятия контекста.

Например, в X благодаря нескольким хитростям, таким как переформулирование академических, образовательных и безопасных аспектов и постепенное наращивание нагрузки, смогли получить от модели Grok 4.5 инфу о том, как синтезировать мет*мфетамин, создать взр*вчатые устройства, протокол экстракции рицина и скрипт трояна удалённого доступа. Ссылку, пожалуй, не буду оставлять: скрины с частями ответов модели прямо в твите на 1 млн просмотров висят 😦

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5
Вот что можно сказать о новых GPT моделях

🔵 Если вам не нужна производительность уровня Terra Ultra, всегда лучше использовать модель Luna с более высокими настройками сложности (та же или лучшая производительность, но дешевле).

🔵 Забудьте обо всем, что ниже Sol High, используйте Luna с более высокими настройками сложности.

🔵 Забудьте о Sol Extra High, используйте Terra Ultra.

🔵 Дополнительные затраты на Sol Ultra, вероятно, не оправдывают себя по сравнению с Max.

Просто использовать постоянно GPT 5.6 Sol Ultra не получится даже на подписке за 200$, лимиты будут улетать. Теперь нужно правильно выбирать инструмент.

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍71
11 skills, из которых складывается персональная Agent OS разработчика

Разраб из PostHog хранит в своих dotfiles навыки для Claude Code. Вместе они образуют процесс работы с PR, систему инженерных решений и память прошлых расследований.

Самые интересные:

🔵 pr-shepherd связывает qa-swarm, review-triage, simplify и ci-shepherd. Система делает от двух до четырех проходов ревью, исправления и упрощения кода, останавливаясь, когда новый проход становится чистым. qa-swarm запускает четыре независимых взгляда, review-triage разбирает комментарии, а CI-агент обновляет ветку и сообщает состояние проверок, не превращая CI в стоп-сигнал. Сильные модели заняты ревью, более дешевые - механической работой.

🔵 takeover-stale-pr оживляет заброшенный PR: подтягивает свежую базу, разбирает старые замечания, запускает затронутые тесты и передает готовую ветку в pr-shepherd.

🔵 paul-pair срабатывает перед вопросом человеку и перед словом «готово». Три режима: сделать самому, сделать и предложить альтернативу, остановиться и спросить. Рядом лежат paul-reviewer с акцентом на связанность, наблюдаемость и безопасный выкат и xp-reviewer с YAGNI, простым дизайном и правилом «немного дублирования лучше неправильной абстракции».

🔵 investigate-library-upgrade читает changelog, находит реально используемые API пакета и связывает несовместимые изменения с конкретными файлами. Выдает радиус работ и план выката, но не обновляет зависимость без отдельного разрешения.

🔵 hunt-memory-leaks - полноценный исполняемый плейбук по утечкам памяти браузера. Он различает JS heap и память процесса рендеринга, требует тесты с несколькими вкладками в браузере с интерфейсом и несколько повторов, использует CDP, снимки JS heap, сетевые события и трассировки аллокаторов. В references/ записаны уже исправленные причины, открытые гипотезы и тупики, которые не нужно проходить заново.

🔵 manage-claude-memory переносит память проектов из локального хранилища Claude в хранимые в git dotfiles через символические ссылки. Перед записью проверяет содержимое на ключи, персональные данные и закрытую продуктовую информацию.

Сильная часть репозитория - накопленное инженерное состояние. Каждый skill знает последовательность действий, границы автономности, условия остановки и уже проверенные гипотезы. Так личный опыт разработчика постепенно становится исполняемой системой для агента.

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2
prose - маленький STYLE.md, который учит Codex отвечать спокойнее, как Claude

Он заставляет агента общаться связанной технической прозой, не дробить мысль на десятки заголовков и списков и убирать всё, что не меняет следующий шаг.

Автор кладёт правила прямо в AGENTS.md, потому что skills в разных агентных обвязках могут загружаться выборочно.

Вы можете скопировать промт здесь или просто использовать одну из команд на сайте:
curl -fsSL prose.ami.rip/STYLE.md >> ~/.codex/AGENTS.md

Многие уже собирали такие правила вручную. Prose меняет подачу, но не точность ответа, поэтому логи тестов и вывод инструментов лучше оставлять без улучшений.

Чат | Токены дешево
👍41
Разработчики Codex поддержали CLIProxyAPI: GPT-5.6 Sol можно запускать прямо в Claude Code

Theo показал Claude Code, где вместо Claude работает GPT-5.6 Sol. Tibo из команды OpenAI попросил выложить рецепт: «мы не дискриминируем обвязки», а затем сам опубликовал настройку через CLIProxyAPI с 40.7к .

Получается Claudex: интерфейс, инструменты, permissions и субагенты Claude Code, а модель и лимиты приходят через Codex OAuth.

Шаг 1: Установите CLIProxyAPI
Шаг 2: Подключитесь
Шаг 3: Определите следующий alias и наслаждайтесь Claudex:
alias claudex='CLAUDE_CODE_SUBAGENT_MODEL=gpt-5.6-sol \
CLAUDE_CODE_ALWAYS_ENABLE_EFFORT=1 \
CLAUDE_CODE_MAX_TOOL_USE_CONCURRENCY=3 \
ENABLE_TOOL_SEARCH=false \
claude --model gpt-5.6-sol'


У этой схемы есть практический смысл. Сейчас в Codex подагенты Sol наследуют уровень effort родителя: запустили основного агента на ultra - все дочерние агенты тоже начинают жечь лимиты на ultra. Проблема все еще открыта, а разработчик Codex DX ответил, что команда уже работает над исправлением. Theo пока советует полностью избегать ultra.

В Claude Code основной Sol можно оставить на xhigh, а подагентам давать medium. В одном небольшом тесте на трех задачах Sol medium в Claude Code оказался примерно на 46% быстрее и использовал на 23% меньше выходных токенов, чем в Codex, при сопоставимом результате. Выборка маленькая, но влияние обвязки на одну и ту же модель видно хорошо.

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4🔥2
Один большой дизайн skill уже не даёт лучший результат: сравнение пяти популярных skills показывает, что UI лучше собирать отдельными проходами. Taste Skill и DESIGN.md мы уже обсуждали, поэтому вот продолжение стека.

По установкам через skills.sh сейчас впереди frontend-design 161к от Anthropic с 657к, web-design-guidelines от Vercel с 459к, UI UX Pro Max с 263к, Impeccable с 192к и основной skill Эмиля Ковальски со 133к. Но популярность не означает, что один из них стоит держать включённым на всех этапах.

🔵 Impeccable 46к добавляет 23 точечные команды: /audit, /critique, /polish, /typeset и другие. Внутри есть 46 детерминированных проверок, поэтому его лучше запускать как отдельный проход после первого варианта.

🔵 web-design-guidelines 29к не придумывает стиль, а проверяет готовую страницу: доступность, формы, состояния фокуса, семантику, адаптивность и анимации. В сравнении пяти skills этот набор оказался сильнее остальных именно по веб-нормам и доступности.

🔵 Emil Kowalski Skills 11к закрывает движение. /review-animations и /improve-animations исправляют кривые ускорения, появление элементов, жесты и анимации компоновки. Иот же тест поставил этот набор первым по анимациям.

🔵 UI UX Pro Max 105к полезен на этапе выбора системы: 67 стилей, 161 палитра и 57 пар шрифтов. Большая база правил может ограничивать модель и усреднять результат, поэтому лучше использовать её для направления, а финальную проверку отдать более узким skills.

🔵 shadcn/improve связывает эти этапы: находит 3-5 самых заметных проблем в кодовой базе и строит план улучшений.

Рабочий цикл:
референс или DESIGN.md → Taste либо Impeccable → /improve → Vercel audit → Emil animations → проверка скриншотом в браузере

Не подключайте все skills для дизайна одновременно. Запускайте их отдельными проходами, тогда правила не спорят друг с другом и видно, какой слой реально улучшил результат.

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👌2
Сатья Наделла, CEO Microsoft, сформулировал тревожный парадокс корпоративного ИИ: компании платят моделям деньгами, а затем передают им свои самые ценные знания через запросы.
Он объясняет, почему собственные данные, память, проверки и loop обучения скоро станут одним из главных активов бизнеса.

📎 Обратный информационный парадокс: кому принадлежит обучение компании

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍21
AI coding loop для Hermes 🔱

Он убирает постоянное сопровождение агента и оставляет человеку две задачи: описать идею и проверить готовый результат.

Работает так:

1. Создаём три skills: /spec, /build и /review.

2. Запускаем /spec "идея". Hermes задаёт уточняющие вопросы, а затем сохраняет подробное задание в Markdown-файл: что сделать, какие есть ограничения и как проверить результат.

3. Cron-задача /build регулярно проверяет папку со спецификациями. Находит новую задачу, пишет код, запускает тесты и меняет статус в том же файле на review.

4. Другая cron-задача запускает /review в свежей сессии. Она проверяет код, безопасность, производительность и тесты. Если находит проблемы, записывает замечания в Markdown и возвращает статус fix.

5. /build подхватывает замечания, исправляет код и снова отправляет его на проверку. Цикл build - review продолжается, пока все проверки не пройдены.

6. После успешной проверки Hermes присылает в Telegram краткое описание изменений, результаты тестов и ссылку на PR. Остаётся проверить результат и ответить merge.

Вся память цикла хранится в обычных Markdown-файлах, а фоновые запуски выполняют cron-задачи Hermes.

Утром присылаете несколько идей, днём агент самостоятельно прогоняет разработку и проверки, вечером вы просматриваете готовые изменения. (В идеальном мире)

Собственно можете прислать этот пост своему агенту и попросить выстроить loop.

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6
У бизнеса с маржой 3% экономия менее 1% выручки может увеличить прибыль примерно на 27%

Главный резерв часто скрыт в «работе вокруг работы»: маршрутах, согласованиях, документах, счетах и разборе исключений. Именно сюда стоит встраивать ИИ-агентов - в существующие ERP, почту и таблицы, с понятными границами и передачей спорных случаев человеку.

📎 Почему бизнес с низкой маржой может выиграть от ИИ больше всех

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
This media is not supported in your browser
VIEW IN TELEGRAM
Pi как оркестратор для Claude Code и Codex

Ben Davis показал свою сборку Pi 453 . Основная сессия Pi запускает Pi, Claude Code и Codex как полноценных субагентов через единый набор инструментов с отдельными сессиями и общим интерфейсом.

Его рабочий loop:

Claude Code/Fable: исследование и дизайн API → Codex: реализация → свежий Claude Code/Fable: ревью и упрощение

Одновременно могут работать до четырёх подагентов. /subagents показывает модель, заполнение контекста, время, активные инструменты и статус. Можно открыть полный лог, отправить уточнение, остановить запуск или перехватить управление. Готовый результат автоматически возвращается в основную сессию. Свежий контекст ревьюера помогает не унаследовать ошибочное предположение из плана и реализации.

В репозитории также есть JavaScript-workflow с фазами, параллельным запуском и результатами по JSON Schema, фоновые терминалы с /ps, инструменты Firecrawl, ask_user, Git/PR-информация и панель с моделью, контекстом, стоимостью и скоростью генерации.

Слепо копировать не стоит. Claude-подагенты запускаются с bypassPermissions, Codex - с approvalPolicy: never и danger-full-access. Текущий SETUP.md также не ставит зависимости вложенных extensions. После их отдельной установки type-check и все 105 тестов проходят.

Многие говорят, что Pi агент очень хорош, если у нас те кто хочет поделится своим сетапом?

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
От issue до PR: облачная фабрика разработки 🔥

Cloud Factory Demo 79 собирает цепочку: триаж новых задач → PRODUCT.md и TECH.md для сложных изменений → реализация → проверка PR → внешний loop, который учится на реакции команды.

Шаблон использует Oz Warp, GitHub Actions и скиллы. Каждый этап оставляет проверяемый артефакт, изменения проходят через PR, а среду запуска можно заменить. Верификация и мониторинг пока в плане.

📎 Автоматический триаж задач
📎 Спецификации для сложных задач
📎 Самоулучшающийся агент проверки кода

Автор Зак Ллойд - основатель и CEO Warp, ранее Principal Engineer в Google Docs и CTO Time. Статьи показывают, как команда строит систему, которая ведет работу от issue до проверенного PR.

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
Вышла новая модель Inkling от Thinking Machines Lab - стартапа Миры Мурати, бывшего технического директора OpenAI.
Модель достаточно средненькая по всем параметрам, но пускай будет.

Кроме того, SpaceXAI открыла исходный код агента Grok Build. Из интересного: CLI не собирает телеметрию и не отправляет ваши данные, за исключением самих промтов.

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3
Что происходит, когда AI-агенты получают доступ к мессенджеру, коду, данным и рабочим процессам всей компании?

В разборе Cerebras Исаак Тай, Дэниел Ким и Майк Гао, команда создателей внутренней базы знаний, показывают систему с 15 000 запросов в день: гибридный поиск, реранжирование, MCP и контроль доступа.

В истории Replit основатель и CEO Амджад Масад вместе со Скоттом Кеннеди описывают «компанию на автопилоте»: loops с субагентами проверяют PR, расследуют инциденты и помогают аналитикам, продажам и поддержке. И поднимают главный вопрос автономности: как доказать, что работа действительно выполнена правильно.

И также из новостей, вышла Kimi K3, которая стала самой большой открытой моделью, на 2.8 трлн параметров. Теперь это реальный конкурент клоду и гпт, немного недотягивающий по мощности, но при этом и подешевле - $3/$15 за 1кк токенов.

Чат | Токены дешево
👍52
Что не новая модель, то AGI 😱

Есть уже опыт с Kimi?

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
😁9
Конкуренция творит чудеса, Claude Fable 5 останется в подписках на тарифах Max и Team Premium с ограничением 50% 🎉

А Pro и Team Standard сохранят доступ к Fable за счет кредитов на использование в размере 100$ (единоразово).

Anthropic понимает, что вы могли фрустрироваться, поэтому ценим невероятный дар в 50% лимитов и надеемся, что они найдут побольше серверов)

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5
Почему одна и та же LLM может ответить за секунды или потратить минуты на рассуждение?

Статья о том, как модели учатся режимам low, medium и high, почему максимальное усилие быстро становится дорогим и когда меньшая модель может догнать более крупную за счет дополнительного времени на поиск решения.

📎Как управлять глубиной рассуждений в LLM

Сложная, но интересная статья, советую к прочтению 👍

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍41
Два полезных приёма для вайб-кодинга

1. Проверяйте решения, а не тысячи строк кода

После выполнения задачи спросите агента:
Какие решения ты принял и в каких не уверен? Что может сломаться и как это проверить?


Для длинных задач попросите вести DECISIONS.md, иначе часть решений потеряется после сжатия контекста. Такой аудит хорошо ловит патчи, которые устраняют симптом, но не причину ошибки.

2. Браузер для разведки, API для работы

Агент может выполнить действие в браузере, записать запросы в HAR и собрать по ним быстрый CLI или клиент. Повторные операции пойдут напрямую через HTTP, без постоянных кликов.

Напоследок ayghri/i-have-adhd - skill для ответов Claude Code, адаптированных для людей с СДВГ. Он делает ответы короче и понятнее. На работу агента и качество кода skill не влияет, он меняет только подачу ответа.

Чат | Токены дешево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4
AI swarm взломал Hugging Face. Расследовать атаку пришлось другому рою AI-агентов

По данным Hugging Face, злоумышленник использовал автономный агентный фреймворк, который выполнил тысячи действий через рой короткоживущих песочниц. Атака началась с вредоносного датасета, затем агенты получили доступ к узлам, собрали облачные учетные данные и перемещались между внутренними кластерами.

Какая именно LLM управляла роем, неизвестно. Это могла быть взломанная облачная модель или модель с открытыми весами без ограничений.

Самое интересное началось при расследовании. Коммерческие модели отказались обрабатывать настоящие команды атакующего, эксплойты и C2-артефакты из-за защитных фильтров. Поэтому Hugging Face развернула GLM 5.2 локально и отправила собственных агентов разбирать более 17 000 событий. Они восстановили хронологию и последствия атаки за часы вместо нескольких дней, при этом секреты не покидали инфраструктуру компании.

Следов подмены публичных моделей, датасетов, Spaces и пакетов не обнаружено. Но Hugging Face рекомендует сменить токены и проверить активность аккаунта.

Похоже, инфраструктуре AI-компаний теперь нужен собственный защитный агентный рой, готовый работать без внешних API в момент реального инцидента.

Чат | Токены дешево
🤝3
Разработчик OpenCode:
Мы заблокировали аккаунт пользователя, управлявшего 8000 мошенническими аккаунтами OpenCode Go.

Они перепродавали токены на сумму 480 000 долларов каждый месяц.

Это сделает ситуацию более устойчивой для легальных пользователей.

Приятной вам недели!


Чат | Токены дешево
😁8
Hermes Agent 0.19.0: быстрее, автономнее и надежнее 🔱

Вышел большой Quicksilver Release: более 2 200 коммитов и 1 000 смерженных PR. Changelog огромный, поэтому собрал изменения, которые заметно влияют на реальные сценарии с AI-агентами.

🔵 Первый ответ приходит примерно на 80% быстрее. Холодный запуск сократили с 4,3 до 0,9 секунды, рассуждения теперь транслируются в реальном времени, а TUI и Desktop обновляют Markdown без тяжелой перерисовки интерфейса.

🔵 За субагентами теперь можно наблюдать. delegate_task сразу возвращает пути к live-транскриптам со всеми вызовами инструментов, результатами и ответами. Завершенный результат сохраняется в state.db и дойдет после перезапуска Hermes, но работающий в момент сбоя субагент заново не запускается.

🔵 Автономность стала безопаснее. Smart approvals теперь включены по умолчанию: отдельная модель оценивает каждую опасную команду, пропускает низкий риск, блокирует высокий и спрашивает пользователя в спорных случаях. Свои deny-правила работают даже в yolo-режиме, а ключи можно загружать из Bitwarden и 1Password вместо хранения всех секретов в открытом .env.

🔵 Один gateway может обслуживать несколько изолированных агентов. Каналы и Telegram-топики разрешено направлять в разные профили с отдельными моделями, навыками, памятью и секретами, сохраняя один bot token. Это упрощает схему, где один профиль пишет код, другой занимается исследованиями, а третий работает как личный ассистент.

🔵 В каталоги добавили GPT-5.6, grok-4.5, Kimi K3, Claude Sonnet 5 и другие модели. А уровни reasoning max и ultra теперь настраиваются отдельно для моделей, вспомогательных задач и MoA.

🔵Историю сессий можно экспортировать в Markdown, HTML и Hugging Face-ready traces с фильтрами и очисткой секретов, поэтому накопленные запуски проще превращать в датасет для анализа и оценки агентов.

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍81🔥1
Самообучающийся поиск клиентов в Codex

Компании часто ищут клиентов и предлагают свои услуги. Например, пишут потенциальным заказчикам в Telegram или по email, звонят либо отправляют коммерческое предложение.

В статье показано, как подключить к этой работе Codex. Он смотрит, какие компании ответили, какие сообщения сработали, а какие проигнорировали. Затем предлагает изменить правила выбора клиентов или текст обращения и проверяет правку на примерах.

Codex ничего сам не рассылает. Человек просматривает предложенные изменения и решает, применять их или нет.

📎 Как собрать такую систему в Codex

Кстати, анонсировали сброс лимитов в честь 10 млн юзеров ChatGPT/Codex. OpenAI сделали скачек со своими новыми моделями, увеличив число юзеров в два раза за неделю.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍31