Agents Lab
959 subscribers
87 photos
44 videos
1 file
225 links
Обсуждаем AI агентов

Наш чатик https://t.me/openclaw_lab_community
Download Telegram
После loop engineering приходит Graph Engineering. Исследование, планирование, реализация и проверка становятся отдельными узлами, а параллельная работа субагентов уже образует граф.

В 📎Новой статье разбираем, как применять этот подход при разработке репозиториев через Claude Code и Codex: Dynamic Workflows, нативные субагенты, готовые репозитории, worktrees, fan-out/fan-in, независимые проверки и ограниченные циклы исправлений.

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
😁3
This media is not supported in your browser
VIEW IN TELEGRAM
10 evals для AI-инженеров: что проверяют и когда использовать 🔄

Evals - это проверки качества AI-агента. Агенту дают задачу и оценивают результат: правильно ли он ответил, какие действия выполнил, не нарушил ли ограничения и сколько ресурсов потратил. По сути, это тесты для AI-систем.

Они делятся на два типа:

- Офлайн-evals запускаются в тестовой среде на заранее подготовленных или прошлых кейсах. Они помогают найти проблемы до релиза.
- Онлайн-evals работают на реальном пользовательском трафике. Они показывают, как агент ведет себя в продукте и действительно ли новая версия стала лучше для пользователей.

Например, регрессионный набор - это офлайн-eval. A/B-тест и теневой запуск - онлайн-evals.

1. Эталонная выборка
Фиксированный набор кейсов, который нельзя менять под новые результаты. Прогоняйте его после каждого изменения, чтобы сразу видеть, стало лучше или хуже.

2. LLM-судья
Вторая модель оценивает ответ агента по заранее описанным правилам. Подходит для открытых задач, где нет единственной правильной строки.

3. Оценка по критериям
Отдельные баллы за точность, стиль, безопасность и стоимость. Помогает понять, что именно просело, вместо одного общего показателя.

4. Оценка траектории
Проверяет не только финальный ответ, но и путь агента: рассуждения, вызовы инструментов и принятые решения. Нужна, когда правильный результат можно получить неправильным и опасным способом.

5. Unit-тесты инструментов
Каждый инструмент проверяется отдельно, на фиксированных данных и без модели в loop. Используйте всегда: многие «ошибки агента» на деле оказываются ошибками инструментов.

6. Регрессионный набор
Старые запуски повторяются с новым промптом или моделью, затем результаты сравниваются. Особенно важно перед изменением промптов, у которых нет системы типов и предсказуемых гарантий.

7. A/B-тест в продакшене
Живой трафик делится между двумя версиями, а сравниваются реальные действия пользователей. Нужен, когда офлайн-оценки перестают предсказывать поведение в продукте.

8. Проверка человеком
Человек оценивает часть запусков вручную. Так можно калибровать LLM-судью и вовремя заметить, что его оценки начали дрейфовать.

9. Теневой запуск
Новая версия работает параллельно на реальном трафике, но ее ответы никто не видит. Полезно перед рискованным релизом, где одна ошибка может дорого обойтись.

10. Red teaming
Агента намеренно атакуют: jailbreak, prompt injection, утечки данных и злоупотребление инструментами. Проводить лучше до появления внешних пользователей, а не после первого инцидента.

Запускать все десять необязательно. Начните с двух проверок, которые могли бы предотвратить ваш последний сбой.

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥41
This media is not supported in your browser
VIEW IN TELEGRAM
Вы думали скоро силой мысли будем управлять устройствами? Ну почти...

Всего за 1400$ можно уже купить в US.

Чат | Токены дёшево
😁72
Компания Block (Square, Cash App, Goose), основанная Джеком Дорси, открыла исходный код Buzz - рабочего пространства, где люди, Codex, Claude Code, Goose и другие агенты становятся участниками одной команды.

Команды сейчас переносят контекст между чатами, GitHub, CI и отдельными сессиями агентов. Buzz собирает работу в одном месте: сообщения, патчи, результаты тестов, ревью, подтверждения и запуски процессов хранятся как подписанные события Nostr с общим поиском и журналом действий.

Каждый агент получает собственную криптографическую личность, доступ только к нужным каналам и отдельную историю действий. Скомпрометированный ключ можно отозвать, не затрагивая владельца. Модель и среду выполнения при этом разрешают менять без потери истории проекта.

Самые интересные сценарии:

🔵 агент-руководитель распределяет работу между другими агентами и прячет координацию в каналах и тредах
🔵 баг описывают обычным сообщением, после чего агенты проводят сортировку, пишут исправление и готовят PR
🔵 специализированные агенты для ревью, инфраструктуры, аналитики и поддержки доступны всей команде
🔵 в их vision каждая ветка Git становится отдельной комнатой, где рядом остаются код, CI, обсуждение и решение о слиянии

В X уже показывают работающие команды агентов и называют Buzz возможным новым интерфейсом для управления проектами. Сам Дорси формулирует ставку так: каждая AI-лаборатория построит пространство для собственных агентов, а Buzz хочет стать пространством для агентов всех разработчиков.

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
GPT-5.6 Sol может сжигать лимиты на лишних вызовах инструментов 🤖

Автор исследования заметил, что Sol часто выполняет независимые проверки последовательно. После каждого вызова модель снова обрабатывает накопленный контекст.

В повторных тестах на двух кодовых базах явная команда объединять независимые вызовы дала на задачах только для чтения:

🔵 на 52-55% меньше циклов модель-инструмент
🔵 на 53-63% меньше токенов
🔵 на 27-45% ниже взвешенный расход лимита Codex
🔵 выполнение на 13-22% быстрее

Инструкцию можно добавить в AGENTS.md или настройки Codex App:
In Code Mode, within each bounded stage, run independent, functions.exec-available tool calls concurrently in one functions.exec call. Use await Promise.allSettled([...]) when partial results are useful, and inspect every result; use await Promise.all([...]) only when any failure should abort the batch. Keep dependencies, waits/resumes, approvals, conflicting or interdependent mutations, and adaptive investigations where each result may change the next step sequential. Do not split otherwise batchable inspections across outer tool calls.


Сам механизм параллельных вызовов через Promise.all подтверждается документацией OpenAI, но цифры пока основаны на отзывах. Issue #35050 и #32503 остаются открытыми.

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
1
Как дать AI-агенту долговременную память о вашей жизни

Hermes можно превратить в личную базу знаний: проекты, решения, цели и люди хранятся в Markdown, агент сам находит нужный контекст, отмечает устаревшие факты и показывает источники ответа.

В коротком практическом руководстве собрал шесть готовых запросов для создания хранилища, импорта старых заметок и еженедельной проверки данных.

Чат | Токены дёшево
👍7
Claude Opus 5 вышел - почти Fable 5 по качеству, но вдвое дешевле 🎉

Контекст на 1 млн токенов и до 128k токенов в ответе. Пять уровней усилия от low до max, а также Fast mode с ускорением примерно в 2.5 раза за двойную цену.

На Frontier-Bench модель более чем вдвое обошла Opus 4.8. На ARC-AGI-3 она набрала 30.2%, тогда как предыдущий лидер GPT-5.6 Sol имел 7.8%. В тестах Artificial Analysis Opus 5 практически сравнялся с Fable 5 по интеллекту, но оказался на 26% дешевле в расчёте на выполненную задачу.

Первые отзывы интересные. Opus 5 лучше проверяет собственную работу, находит первопричины ошибок и чаще доводит длинные задачи до результата. При этом старые перегруженные Skills и системные промпты могут ему мешать. Команда Every получила заметно лучшие результаты, когда удалила прежнюю обвязку и собрала её заново.

На фоне релиза инженер Claude Code Тарик опубликовал новые правила контекст-инжиниринга. Для моделей поколения Claude 5 команда сократила системный промпт Claude Code более чем на 80% без измеримой потери качества:

🔵 оставляйте модели пространство для решений вместо десятков частных запретов

🔵 проектируйте понятные инструменты и их параметры вместо большого числа примеров

🔵 загружайте контекст постепенно: проверки, ревью и редкие процедуры выносите в отдельные Skills

🔵 не повторяйте инструкции в системном промпте, CLAUDE.md и описаниях инструментов

🔵 держите CLAUDE.md коротким: правила репозитория и только неочевидные особенности

🔵 используйте Skills для знаний и практик конкретной команды, а длинные Skills разбивайте на несколько файлов

🔵 давайте модели полноценные референсы: тесты, код, HTML-макеты и рубрики часто полезнее текстового описания

Для перехода на Opus 5 стоит сначала удалить накопившиеся ограничения, затем возвращать только те правила, необходимость которых подтверждают реальные ошибки и проверки. Очень похоже и думаю применимо к GPT 5.6 Sol.

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍1
OBLITERATUS: хирургия отказов для открытых LLM 🧠

Тулкит находит в весах модели направления, отвечающие за отказы, и удаляет их без дообучения. Инструмент работает с open-weight моделями вроде Llama, Qwen, Mistral и Gemma.

• 9 методов: от быстрого basic до режимов для reasoning- и MoE-моделей
• анализ слоев, attention heads и геометрии отказов
• сравнение методов и оригинальной модели с измененной
• проверка refusal rate, perplexity, KL divergence и связности ответов
• сохранение результата как обычной Hugging Face модели

У Hermes есть skill: hermes skills install official/mlops/obliteratus

После этого можно попросить Hermes проверить GPU, подобрать модель и метод, запустить OBLITERATUS и оценить результат. Skill содержит полный сценарий работы, пресеты и проверки. Отдельно нужно установить зависимости.

Также есть на Hugging Face (скрин от туда).

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
6
Два свежих репозитория от русских разработчиков 🇷🇺

ru-marketplace-mcp 24 подключает AI-агента к Wildberries, Ozon, Яндекс Маркету и Детскому миру. Внутри 22 MCP-инструмента для поиска товаров, цен, остатков, отзывов и реквизитов продавцов. compare_prices опрашивает площадки параллельно и показывает, где дешевле.

Доступ только для чтения, регистрация и API-ключи не нужны. Ozon при срабатывании антибота может потребовать ваш Chrome.

Claudexor 316 - локальная панель управления для Claude Code, Codex, Cursor CLI и OpenCode. Она сохраняет общий контекст между агентами, запускает несколько решений с независимой проверкой, делегирует ограниченные подзадачи и следит за квотами нескольких подписок Claude и Codex.

Патчи, проверки и решения остаются локально. Есть CLI для macOS и Linux, а также отдельное macOS-приложение.

Первый репозиторий пригодится для покупок и анализа российских маркетплейсов. Второй - когда кодинг агентов уже несколько и им нужен общий управляемый процесс.

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3💯2👎1
Media is too big
VIEW IN TELEGRAM
Moonshot AI открыла веса Kimi K3 и часть инфраструктуры для обучения AI-агентов 🔥

Веса Kimi K3 опубликованы на Hugging Face. Это MoE-модель на 2,8 трлн параметров, из которых при генерации активируются 104 млрд. Есть контекст на 1 млн токенов, понимание изображений и режимы рассуждения low, high и max.

Вместе с весами Moonshot открыла еще три проекта:

🔵 FlashKDA - CUDA-ядра для Kimi Delta Attention. На H20 они ускоряют обработку входного контекста в 1,72-2,22 раза;

🔵 MoonEP - библиотека, которая распределяет MoE-экспертов между GPU и не дает перегруженным узлам тормозить весь запуск;

🔵 AgentENV - система песочниц на Firecracker для массового обучения агентов. Среды можно быстро ставить на паузу, сохранять, возобновлять и разветвлять для параллельных экспериментов.

K3 уже появилась у Modal, Baseten, Fireworks AI, Nebius, DigitalOcean и Together AI. Самостоятельный запуск требует серьезного GPU-кластера, поэтому открытие весов сейчас особенно интересно исследователям и поставщикам инфраструктуры.

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2🔥2
Media is too big
VIEW IN TELEGRAM
MagicPath - общий дизайн-холст для людей и AI-агентов 🎨

Codex, Claude Code и Cursor через MagicPath Skills могут создавать и редактировать интерактивные React-интерфейсы прямо из терминала или IDE. Человек правит результат визуально, несколько агентов работают на одном холсте, а готовый дизайн можно вернуть в код, показать по ссылке или экспортировать в Figma.

По тарифам:

🔵 Free - 20 AI-кредитов в день, до 120 в месяц; 125 вызовов внешних агентов в неделю; 5 импортов и 3 экспорта Figma в месяц.

🔵 Builder - $10 в месяц. Можно без ограничений работать с MagicPath через внешних AI-агентов, а также безлимитно экспортировать результаты в Figma. Лимит импорта остается 5 файлов в месяц.

Из интересного, это прикольно работает в мульти-агентом режиме в Codex Desktop. Для каждого агента можно выбирать свою модель и уровень мышления.

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
В Grok появился режим App Builder, который позволяет прямо в чате деплоить приложения на домен третьего уровня 👍

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
OKF получил сигналы доверия, а MCP избавился от сессий 🆕

OKF - это открытый формат Google для знаний AI-агентов. Информация хранится в обычных Markdown-файлах с YAML-метаданными и ссылками между документами. Такие папки можно читать, редактировать и хранить в Git без специальной базы данных.

В OKF v0.2 появились:

🔵 sources для источников, авторов и дат изменения

🔵 generated и verified для разделения созданного агентом, проверенного машиной и подтвержденного человеком

🔵 status и stale_after для черновиков, устаревших и замененных знаний

🔵 новый тип для проверяемых вычислений, который описывает утвержденный запрос, разрешенные параметры и способ проверки результата

Все поля необязательны. OKF сохраняет источники, даты и отметки о проверке, но не подтверждает их подлинность. Полноценный механизм запуска и проверки вычислений пока не реализован.

MCP - открытый протокол, через который AI-агенты подключаются к инструментам и данным: файлам, базам, API, браузерам и корпоративным сервисам.

В MCP 2026-07-28 изменили основу протокола:

🔵 удалили начальное согласование initialize и идентификаторы сессий

🔵 каждый запрос теперь содержит нужную информацию и может попасть на любой сервер без закрепления клиента за одним экземпляром

🔵 MRTR позволяет инструменту запросить подтверждение или недостающие данные без постоянного соединения

🔵 каталоги инструментов можно кешировать, а шлюзы получили отдельные заголовки для маршрутизации и контроля доступа

Roots, Sampling, Logging и старый HTTP+SSE объявлены устаревшими. На переход дают минимум 12 месяцев, старые серверы продолжат работать.

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
Как превратить одного AI-агента в исследовательскую команду 🔄

Обычный AI-агент работает в пределах одной сессии: получает задачу, вызывает инструменты и пишет результат. Для долгой автономной работы этого мало. Нужна система, которая хранит историю попыток, проверяет изменения, откатывает ошибки и передает знания следующим агентам.

📎В статье о Graph Engineering этот путь разобран по шагам:

🔵 Autoresearch - агент меняет код, запускает короткий эксперимент, измеряет результат и сохраняет только улучшения

🔵 DAG - семейное дерево экспериментов, где каждая попытка связана с родительской версией. Можно восстановить происхождение результата и вернуться к любой ветке

🔵 AgentHub - прототип общей среды, где множество агентов публикуют свои коммиты, гипотезы и неудачи, а другие продолжают самые перспективные линии

🔵 Swarm - оркестратор делит большую задачу на независимые части, запускает их параллельно и собирает итог

🔵 Knowledge Graphs - долговременная память из сущностей, связей и источников. Благодаря ему факты переживают отдельную сессию и доступны новым агентам без загрузки всей переписки

Кому-то покажется, что это сжигание токенов, но, во-первых, задачи разные, поэтому необязательно использовать каждый подход, а во-вторых, именно из таких экспериментов и появляются рабочие воркфлоу.

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍41
Как собрать loop для роста кармы на Reddit 📱

Автор Reddit Karma loop утверждает, что получил около 90 кармы за неделю. Агент просматривает десятки свежих обсуждений, большинство пропускает и оставляет 3-4 полезных комментария в день.

Механика loop:

- Собрать wiki из своих статей, видео, заметок и реального опыта
- Подключить Reddit через OpenCLI, использующий авторизованную сессию Chrome
- Искать свежие вопросы в подходящих сабреддитах и пропускать треды старше 48 часов
- Писать один короткий ответ на основе задокументированного опыта без ссылок и рекламы
- Запускать cron каждые полчаса, но будить агента только после дешёвой проверки лимитов и условий
- Записывать опубликованные и пропущенные ответы, а раз в неделю сравнивать карму по темам и сабреддитам

Готовый шаблон Reddit Karma уже содержит весь setup-промпт, правила отбора, журнал действий, режим автопубликации и более безопасный draft-for-review.

Loopany 233 превращает такие процессы в постоянные loops. Сервер отвечает за расписание, состояние, артефакты, панель управления и уведомления, а Claude Code, Codex или Grok Build работают на вашей машине с локальными инструментами и доступами.

Сейчас в библиотеке 23 шаблона:

- SEO-тесты новых ключевых слов и масштабирование удачных
- Разбор обращений поддержки
- Мониторинг метрик и воронки
- Исправление ошибок, документации, тестов и CI
- Утренние брифинги и ежедневные уроки
- Наблюдение за релизом, экспериментом или редким багом до получения результата

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3
Удешевление GPT-моделей и очередной сброс лимитов

🔵 Цена Luna снижена на 80% - до $0,20/$1,20
🔵 Цена Terra снижена на 20% - до $2/$12
🔵 Режим auto-approve ("Review for me" в приложении GPT) стал примерно в 10 раз дешевле и теперь использует Luna
🔵 Sol должен расходовать на 18% меньше лимитов

Также завтра возвращают пятичасовые лимиты, и это радует: без них сложнее контролировать расход. По сути, можно считать, что лимиты на все модели GPT-5.6 просто увеличили. Luna за такую цену на Ultra даёт жару 🐈‍⬛

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3👎1
Anthropic рассказала, что её модели тоже ооочень опасные 👌

Поделились тремя инцидентами: из-за ошибочной настройки тестовая среда партнёра Irregular имела доступ в интернет, хотя моделям сообщили, что они работают внутри симуляции.

🔵 Opus 4.7 взломал инфраструктуру реальной компании, получил учётные данные и доступ к базе с несколькими сотнями строк данных
🔵 Mythos 5 опубликовал вредоносный пакет в PyPI. За час его запустили на 15 реальных системах, после чего Claude получил доступ к инфраструктуре одной ИБ-компании
🔵 Исследовательская модель (закрытый прототип) просканировала около 9 000 адресов и взломала приложение через открытые учётные данные и SQL-инъекцию, но остановилась, когда поняла, что цель реальная

Anthropic не считает это попыткой моделей сбежать: Claude выполнял задание Capture the Flag и ошибочно принимал реальные системы за часть испытания.

И также из новостей: китайцы прокачали DeepSeek-V4-Flash так, что теперь она превосходит Pro-версию по всем бенчмаркам.
И добавили поддержку формата Responses API, теперь в Codex модель должна работать на ура. Инструкция, как подключить DeepSeek API в Codex.

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
😁6
Y Combinator открыл код своего multi-agent harness QM 174

По словам YC, они уже используют QM в бухгалтерии, юридических процессах, организации мероприятий и разработке самого QM.

Система строится вокруг изолированных рабочих областей. Своя область есть у каждого сотрудника, Slack-канала и общего проекта. Внутри неё живут отдельные память, файлы, навыки, ключи, расписания и постоянная Linux-машина, где сохраняются установленные инструменты и авторизация.

🔵 Для каждого контекста можно выбрать Pi, OpenCode, Codex или Claude Code и нужную модель. Адаптеры Codex, Claude Code и OpenCode умеют запускать субагентов и показывать их задачи в общем интерфейсе

🔵 Агент Slack-канала может передать задачу личному агенту коллеги, если нужен его приватный репозиторий, аккаунт или браузерная сессия. Коллега подтверждает запуск в личке, а в канал возвращается только безопасный результат без передачи секретов

🔵 После первого упоминания агент продолжает следить за тредом как участник команды. Он может ответить, поставить реакцию или промолчать, а новое сообщение способно скорректировать уже запущенную задачу

🔵 В веб-интерфейсе можно открыть до четырёх параллельных сессий. Общие проекты получают собственную рабочую область, память и список участников

🔵 Агент умеет собирать и публиковать внутренние веб-приложения со стабильной ссылкой, правами доступа, историей версий, откатом и обновлениями через Git

🔵 Skills принадлежат сотруднику, проекту или организации. Их можно импортировать пакетами из Git, проверять перед публикацией и автоматически синхронизировать

🔵 QM легко задеплоить на Fly.io или AWS через qm init

Пока это версия 0.1.4 и ранний эксперимент, но получилась уже довольно глубокая основа для общего агента компании, где совместная работа, личные доступы и автономные задачи существуют в одной системе.

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5
Как запустить Luna Max + Fast только для субагентов Codex 🌕

После снижения цены Luna на 80% в свежем треде тестируют связку: Sol планирует и принимает работу, Luna быстро выполняет узкие задачи.

Править models_cache.json необязательно. Создайте официальный custom agent:
# ~/.codex/agents/luna_worker.toml
name = "luna_worker"
description = "Быстрый исполнитель для узких задач"

model = "gpt-5.6-luna"
model_reasoning_effort = "max"
service_tier = "fast"
sandbox_mode = "workspace-write"

developer_instructions = """
Выполняй только четко ограниченную задачу
Не меняй архитектуру
Запускай проверки и перечисляй измененные файлы
Не создавай новых субагентов
"""

service_tier = "fast" находится внутри профиля, поэтому Sol продолжит работать без Fast. Не добавляйте этот параметр в общий ~/.codex/config.toml.

После перезапуска Codex:
Спланируй работу сам
Узкие этапы делегируй luna_worker
Используй fork_turns: "none"
Сложные решения и финальную проверку оставь себе


Так Sol думает и проверяет, а Luna Max + Fast получает чистый контекст и быстро выполняет поиск, шаблонный код и ограниченные изменения.

И бонусом хочу поделиться правилами для AGENTS.md, которые я теперь добавляю в начале разработки новых проектов:
- Не следует сохранять обратную совместимость.
- Выбери простейшую реализацию, которая полностью соответствует текущим требованиям.
- Отдавайте предпочтение проверенным, хорошо поддерживаемым библиотекам, а не пользовательским реализациям.


Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6
DeepSeek набирает тестеров для своего Harness👇

У кого есть желание, присылайте tianyi свой Github ID и свой открытый репозиторий на тему агентов.

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM