Agents Lab
960 subscribers
88 photos
45 videos
1 file
226 links
Обсуждаем AI агентов

Наш чатик https://t.me/openclaw_lab_community
Download Telegram
Как дать AI-агенту долговременную память о вашей жизни

Hermes можно превратить в личную базу знаний: проекты, решения, цели и люди хранятся в Markdown, агент сам находит нужный контекст, отмечает устаревшие факты и показывает источники ответа.

В коротком практическом руководстве собрал шесть готовых запросов для создания хранилища, импорта старых заметок и еженедельной проверки данных.

Чат | Токены дёшево
👍7
Claude Opus 5 вышел - почти Fable 5 по качеству, но вдвое дешевле 🎉

Контекст на 1 млн токенов и до 128k токенов в ответе. Пять уровней усилия от low до max, а также Fast mode с ускорением примерно в 2.5 раза за двойную цену.

На Frontier-Bench модель более чем вдвое обошла Opus 4.8. На ARC-AGI-3 она набрала 30.2%, тогда как предыдущий лидер GPT-5.6 Sol имел 7.8%. В тестах Artificial Analysis Opus 5 практически сравнялся с Fable 5 по интеллекту, но оказался на 26% дешевле в расчёте на выполненную задачу.

Первые отзывы интересные. Opus 5 лучше проверяет собственную работу, находит первопричины ошибок и чаще доводит длинные задачи до результата. При этом старые перегруженные Skills и системные промпты могут ему мешать. Команда Every получила заметно лучшие результаты, когда удалила прежнюю обвязку и собрала её заново.

На фоне релиза инженер Claude Code Тарик опубликовал новые правила контекст-инжиниринга. Для моделей поколения Claude 5 команда сократила системный промпт Claude Code более чем на 80% без измеримой потери качества:

🔵 оставляйте модели пространство для решений вместо десятков частных запретов

🔵 проектируйте понятные инструменты и их параметры вместо большого числа примеров

🔵 загружайте контекст постепенно: проверки, ревью и редкие процедуры выносите в отдельные Skills

🔵 не повторяйте инструкции в системном промпте, CLAUDE.md и описаниях инструментов

🔵 держите CLAUDE.md коротким: правила репозитория и только неочевидные особенности

🔵 используйте Skills для знаний и практик конкретной команды, а длинные Skills разбивайте на несколько файлов

🔵 давайте модели полноценные референсы: тесты, код, HTML-макеты и рубрики часто полезнее текстового описания

Для перехода на Opus 5 стоит сначала удалить накопившиеся ограничения, затем возвращать только те правила, необходимость которых подтверждают реальные ошибки и проверки. Очень похоже и думаю применимо к GPT 5.6 Sol.

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍1
OBLITERATUS: хирургия отказов для открытых LLM 🧠

Тулкит находит в весах модели направления, отвечающие за отказы, и удаляет их без дообучения. Инструмент работает с open-weight моделями вроде Llama, Qwen, Mistral и Gemma.

• 9 методов: от быстрого basic до режимов для reasoning- и MoE-моделей
• анализ слоев, attention heads и геометрии отказов
• сравнение методов и оригинальной модели с измененной
• проверка refusal rate, perplexity, KL divergence и связности ответов
• сохранение результата как обычной Hugging Face модели

У Hermes есть skill: hermes skills install official/mlops/obliteratus

После этого можно попросить Hermes проверить GPU, подобрать модель и метод, запустить OBLITERATUS и оценить результат. Skill содержит полный сценарий работы, пресеты и проверки. Отдельно нужно установить зависимости.

Также есть на Hugging Face (скрин от туда).

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
6
Два свежих репозитория от русских разработчиков 🇷🇺

ru-marketplace-mcp 24 подключает AI-агента к Wildberries, Ozon, Яндекс Маркету и Детскому миру. Внутри 22 MCP-инструмента для поиска товаров, цен, остатков, отзывов и реквизитов продавцов. compare_prices опрашивает площадки параллельно и показывает, где дешевле.

Доступ только для чтения, регистрация и API-ключи не нужны. Ozon при срабатывании антибота может потребовать ваш Chrome.

Claudexor 316 - локальная панель управления для Claude Code, Codex, Cursor CLI и OpenCode. Она сохраняет общий контекст между агентами, запускает несколько решений с независимой проверкой, делегирует ограниченные подзадачи и следит за квотами нескольких подписок Claude и Codex.

Патчи, проверки и решения остаются локально. Есть CLI для macOS и Linux, а также отдельное macOS-приложение.

Первый репозиторий пригодится для покупок и анализа российских маркетплейсов. Второй - когда кодинг агентов уже несколько и им нужен общий управляемый процесс.

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3💯2👎1
Media is too big
VIEW IN TELEGRAM
Moonshot AI открыла веса Kimi K3 и часть инфраструктуры для обучения AI-агентов 🔥

Веса Kimi K3 опубликованы на Hugging Face. Это MoE-модель на 2,8 трлн параметров, из которых при генерации активируются 104 млрд. Есть контекст на 1 млн токенов, понимание изображений и режимы рассуждения low, high и max.

Вместе с весами Moonshot открыла еще три проекта:

🔵 FlashKDA - CUDA-ядра для Kimi Delta Attention. На H20 они ускоряют обработку входного контекста в 1,72-2,22 раза;

🔵 MoonEP - библиотека, которая распределяет MoE-экспертов между GPU и не дает перегруженным узлам тормозить весь запуск;

🔵 AgentENV - система песочниц на Firecracker для массового обучения агентов. Среды можно быстро ставить на паузу, сохранять, возобновлять и разветвлять для параллельных экспериментов.

K3 уже появилась у Modal, Baseten, Fireworks AI, Nebius, DigitalOcean и Together AI. Самостоятельный запуск требует серьезного GPU-кластера, поэтому открытие весов сейчас особенно интересно исследователям и поставщикам инфраструктуры.

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2🔥2
Media is too big
VIEW IN TELEGRAM
MagicPath - общий дизайн-холст для людей и AI-агентов 🎨

Codex, Claude Code и Cursor через MagicPath Skills могут создавать и редактировать интерактивные React-интерфейсы прямо из терминала или IDE. Человек правит результат визуально, несколько агентов работают на одном холсте, а готовый дизайн можно вернуть в код, показать по ссылке или экспортировать в Figma.

По тарифам:

🔵 Free - 20 AI-кредитов в день, до 120 в месяц; 125 вызовов внешних агентов в неделю; 5 импортов и 3 экспорта Figma в месяц.

🔵 Builder - $10 в месяц. Можно без ограничений работать с MagicPath через внешних AI-агентов, а также безлимитно экспортировать результаты в Figma. Лимит импорта остается 5 файлов в месяц.

Из интересного, это прикольно работает в мульти-агентом режиме в Codex Desktop. Для каждого агента можно выбирать свою модель и уровень мышления.

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
В Grok появился режим App Builder, который позволяет прямо в чате деплоить приложения на домен третьего уровня 👍

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
OKF получил сигналы доверия, а MCP избавился от сессий 🆕

OKF - это открытый формат Google для знаний AI-агентов. Информация хранится в обычных Markdown-файлах с YAML-метаданными и ссылками между документами. Такие папки можно читать, редактировать и хранить в Git без специальной базы данных.

В OKF v0.2 появились:

🔵 sources для источников, авторов и дат изменения

🔵 generated и verified для разделения созданного агентом, проверенного машиной и подтвержденного человеком

🔵 status и stale_after для черновиков, устаревших и замененных знаний

🔵 новый тип для проверяемых вычислений, который описывает утвержденный запрос, разрешенные параметры и способ проверки результата

Все поля необязательны. OKF сохраняет источники, даты и отметки о проверке, но не подтверждает их подлинность. Полноценный механизм запуска и проверки вычислений пока не реализован.

MCP - открытый протокол, через который AI-агенты подключаются к инструментам и данным: файлам, базам, API, браузерам и корпоративным сервисам.

В MCP 2026-07-28 изменили основу протокола:

🔵 удалили начальное согласование initialize и идентификаторы сессий

🔵 каждый запрос теперь содержит нужную информацию и может попасть на любой сервер без закрепления клиента за одним экземпляром

🔵 MRTR позволяет инструменту запросить подтверждение или недостающие данные без постоянного соединения

🔵 каталоги инструментов можно кешировать, а шлюзы получили отдельные заголовки для маршрутизации и контроля доступа

Roots, Sampling, Logging и старый HTTP+SSE объявлены устаревшими. На переход дают минимум 12 месяцев, старые серверы продолжат работать.

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
Как превратить одного AI-агента в исследовательскую команду 🔄

Обычный AI-агент работает в пределах одной сессии: получает задачу, вызывает инструменты и пишет результат. Для долгой автономной работы этого мало. Нужна система, которая хранит историю попыток, проверяет изменения, откатывает ошибки и передает знания следующим агентам.

📎В статье о Graph Engineering этот путь разобран по шагам:

🔵 Autoresearch - агент меняет код, запускает короткий эксперимент, измеряет результат и сохраняет только улучшения

🔵 DAG - семейное дерево экспериментов, где каждая попытка связана с родительской версией. Можно восстановить происхождение результата и вернуться к любой ветке

🔵 AgentHub - прототип общей среды, где множество агентов публикуют свои коммиты, гипотезы и неудачи, а другие продолжают самые перспективные линии

🔵 Swarm - оркестратор делит большую задачу на независимые части, запускает их параллельно и собирает итог

🔵 Knowledge Graphs - долговременная память из сущностей, связей и источников. Благодаря ему факты переживают отдельную сессию и доступны новым агентам без загрузки всей переписки

Кому-то покажется, что это сжигание токенов, но, во-первых, задачи разные, поэтому необязательно использовать каждый подход, а во-вторых, именно из таких экспериментов и появляются рабочие воркфлоу.

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍41
Как собрать loop для роста кармы на Reddit 📱

Автор Reddit Karma loop утверждает, что получил около 90 кармы за неделю. Агент просматривает десятки свежих обсуждений, большинство пропускает и оставляет 3-4 полезных комментария в день.

Механика loop:

- Собрать wiki из своих статей, видео, заметок и реального опыта
- Подключить Reddit через OpenCLI, использующий авторизованную сессию Chrome
- Искать свежие вопросы в подходящих сабреддитах и пропускать треды старше 48 часов
- Писать один короткий ответ на основе задокументированного опыта без ссылок и рекламы
- Запускать cron каждые полчаса, но будить агента только после дешёвой проверки лимитов и условий
- Записывать опубликованные и пропущенные ответы, а раз в неделю сравнивать карму по темам и сабреддитам

Готовый шаблон Reddit Karma уже содержит весь setup-промпт, правила отбора, журнал действий, режим автопубликации и более безопасный draft-for-review.

Loopany 233 превращает такие процессы в постоянные loops. Сервер отвечает за расписание, состояние, артефакты, панель управления и уведомления, а Claude Code, Codex или Grok Build работают на вашей машине с локальными инструментами и доступами.

Сейчас в библиотеке 23 шаблона:

- SEO-тесты новых ключевых слов и масштабирование удачных
- Разбор обращений поддержки
- Мониторинг метрик и воронки
- Исправление ошибок, документации, тестов и CI
- Утренние брифинги и ежедневные уроки
- Наблюдение за релизом, экспериментом или редким багом до получения результата

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3
Удешевление GPT-моделей и очередной сброс лимитов

🔵 Цена Luna снижена на 80% - до $0,20/$1,20
🔵 Цена Terra снижена на 20% - до $2/$12
🔵 Режим auto-approve ("Review for me" в приложении GPT) стал примерно в 10 раз дешевле и теперь использует Luna
🔵 Sol должен расходовать на 18% меньше лимитов

Также завтра возвращают пятичасовые лимиты, и это радует: без них сложнее контролировать расход. По сути, можно считать, что лимиты на все модели GPT-5.6 просто увеличили. Luna за такую цену на Ultra даёт жару 🐈‍⬛

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3👎1
Anthropic рассказала, что её модели тоже ооочень опасные 👌

Поделились тремя инцидентами: из-за ошибочной настройки тестовая среда партнёра Irregular имела доступ в интернет, хотя моделям сообщили, что они работают внутри симуляции.

🔵 Opus 4.7 взломал инфраструктуру реальной компании, получил учётные данные и доступ к базе с несколькими сотнями строк данных
🔵 Mythos 5 опубликовал вредоносный пакет в PyPI. За час его запустили на 15 реальных системах, после чего Claude получил доступ к инфраструктуре одной ИБ-компании
🔵 Исследовательская модель (закрытый прототип) просканировала около 9 000 адресов и взломала приложение через открытые учётные данные и SQL-инъекцию, но остановилась, когда поняла, что цель реальная

Anthropic не считает это попыткой моделей сбежать: Claude выполнял задание Capture the Flag и ошибочно принимал реальные системы за часть испытания.

И также из новостей: китайцы прокачали DeepSeek-V4-Flash так, что теперь она превосходит Pro-версию по всем бенчмаркам.
И добавили поддержку формата Responses API, теперь в Codex модель должна работать на ура. Инструкция, как подключить DeepSeek API в Codex.

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
😁6
Y Combinator открыл код своего multi-agent harness QM 174

По словам YC, они уже используют QM в бухгалтерии, юридических процессах, организации мероприятий и разработке самого QM.

Система строится вокруг изолированных рабочих областей. Своя область есть у каждого сотрудника, Slack-канала и общего проекта. Внутри неё живут отдельные память, файлы, навыки, ключи, расписания и постоянная Linux-машина, где сохраняются установленные инструменты и авторизация.

🔵 Для каждого контекста можно выбрать Pi, OpenCode, Codex или Claude Code и нужную модель. Адаптеры Codex, Claude Code и OpenCode умеют запускать субагентов и показывать их задачи в общем интерфейсе

🔵 Агент Slack-канала может передать задачу личному агенту коллеги, если нужен его приватный репозиторий, аккаунт или браузерная сессия. Коллега подтверждает запуск в личке, а в канал возвращается только безопасный результат без передачи секретов

🔵 После первого упоминания агент продолжает следить за тредом как участник команды. Он может ответить, поставить реакцию или промолчать, а новое сообщение способно скорректировать уже запущенную задачу

🔵 В веб-интерфейсе можно открыть до четырёх параллельных сессий. Общие проекты получают собственную рабочую область, память и список участников

🔵 Агент умеет собирать и публиковать внутренние веб-приложения со стабильной ссылкой, правами доступа, историей версий, откатом и обновлениями через Git

🔵 Skills принадлежат сотруднику, проекту или организации. Их можно импортировать пакетами из Git, проверять перед публикацией и автоматически синхронизировать

🔵 QM легко задеплоить на Fly.io или AWS через qm init

Пока это версия 0.1.4 и ранний эксперимент, но получилась уже довольно глубокая основа для общего агента компании, где совместная работа, личные доступы и автономные задачи существуют в одной системе.

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5
Как запустить Luna Max + Fast только для субагентов Codex 🌕

После снижения цены Luna на 80% в свежем треде тестируют связку: Sol планирует и принимает работу, Luna быстро выполняет узкие задачи.

Править models_cache.json необязательно. Создайте официальный custom agent:
# ~/.codex/agents/luna_worker.toml
name = "luna_worker"
description = "Быстрый исполнитель для узких задач"

model = "gpt-5.6-luna"
model_reasoning_effort = "max"
service_tier = "fast"
sandbox_mode = "workspace-write"

developer_instructions = """
Выполняй только четко ограниченную задачу
Не меняй архитектуру
Запускай проверки и перечисляй измененные файлы
Не создавай новых субагентов
"""

service_tier = "fast" находится внутри профиля, поэтому Sol продолжит работать без Fast. Не добавляйте этот параметр в общий ~/.codex/config.toml.

После перезапуска Codex:
Спланируй работу сам
Узкие этапы делегируй luna_worker
Используй fork_turns: "none"
Сложные решения и финальную проверку оставь себе


Так Sol думает и проверяет, а Luna Max + Fast получает чистый контекст и быстро выполняет поиск, шаблонный код и ограниченные изменения.

И бонусом хочу поделиться правилами для AGENTS.md, которые я теперь добавляю в начале разработки новых проектов:
- Не следует сохранять обратную совместимость.
- Выбери простейшую реализацию, которая полностью соответствует текущим требованиям.
- Отдавайте предпочтение проверенным, хорошо поддерживаемым библиотекам, а не пользовательским реализациям.


Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6
DeepSeek набирает тестеров для своего Harness👇

У кого есть желание, присылайте tianyi свой Github ID и свой открытый репозиторий на тему агентов.

Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
Media is too big
VIEW IN TELEGRAM
Andrej Karpathy:
Мы начинаем выходить за рамки тестирования LLM, например, с помощью запроса "создать SVG-изображение пеликана на велосипеде". В качестве общего примера, мне было интересно, что бы сделал Opus 5, если бы я дал ему первый абзац "Властелина колец", бюджет в 1 миллион токенов (~10 долларов) и попросил три рендера на JavaScript. Opus потратил около двух часов и написал 5500 строк кода, которые (процедурно) отрисовывали историю. Это немного коряво, но забавно. Но немного поразительно, что LLM должен размещать и координировать различные полигональные объекты в координатах (x,y,z) и писать код, который анимирует все это, и что он вообще что-то делает.

Чат | Токены дёшево
1👍1🔥1
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6🔥3😱1
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥9👍5
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2