GPT-5.6 Sol может сжигать лимиты на лишних вызовах инструментов 🤖
Автор исследования заметил, что Sol часто выполняет независимые проверки последовательно. После каждого вызова модель снова обрабатывает накопленный контекст.
В повторных тестах на двух кодовых базах явная команда объединять независимые вызовы дала на задачах только для чтения:
🔵 на 52-55% меньше циклов модель-инструмент
🔵 на 53-63% меньше токенов
🔵 на 27-45% ниже взвешенный расход лимита Codex
🔵 выполнение на 13-22% быстрее
Инструкцию можно добавить в
Сам механизм параллельных вызовов через
Чат | Токены дёшево
Автор исследования заметил, что Sol часто выполняет независимые проверки последовательно. После каждого вызова модель снова обрабатывает накопленный контекст.
В повторных тестах на двух кодовых базах явная команда объединять независимые вызовы дала на задачах только для чтения:
Инструкцию можно добавить в
AGENTS.md или настройки Codex App:In Code Mode, within each bounded stage, run independent, functions.exec-available tool calls concurrently in one functions.exec call. Use await Promise.allSettled([...]) when partial results are useful, and inspect every result; use await Promise.all([...]) only when any failure should abort the batch. Keep dependencies, waits/resumes, approvals, conflicting or interdependent mutations, and adaptive investigations where each result may change the next step sequential. Do not split otherwise batchable inspections across outer tool calls.
Сам механизм параллельных вызовов через
Promise.all подтверждается документацией OpenAI, но цифры пока основаны на отзывах. Issue #35050 и #32503 остаются открытыми.Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Как дать AI-агенту долговременную память о вашей жизни
Hermes можно превратить в личную базу знаний: проекты, решения, цели и люди хранятся в Markdown, агент сам находит нужный контекст, отмечает устаревшие факты и показывает источники ответа.
В коротком практическом руководстве собрал шесть готовых запросов для создания хранилища, импорта старых заметок и еженедельной проверки данных.
Чат | Токены дёшево
Hermes можно превратить в личную базу знаний: проекты, решения, цели и люди хранятся в Markdown, агент сам находит нужный контекст, отмечает устаревшие факты и показывает источники ответа.
В коротком практическом руководстве собрал шесть готовых запросов для создания хранилища, импорта старых заметок и еженедельной проверки данных.
Чат | Токены дёшево
Telegraph
Как превратить Hermes Agent в личную базу знаний
Самостоятельно размещенный AI-агент может быть полезен далеко за пределами программирования. Если Hermes работает на постоянно включенном компьютере или сервере, он способен вести личную базу знаний, искать в ней факты и возвращать ответы с датами, ссылками…
👍7
Claude Opus 5 вышел - почти Fable 5 по качеству, но вдвое дешевле 🎉
Контекст на 1 млн токенов и до 128k токенов в ответе. Пять уровней усилия от
На Frontier-Bench модель более чем вдвое обошла Opus 4.8. На ARC-AGI-3 она набрала 30.2%, тогда как предыдущий лидер GPT-5.6 Sol имел 7.8%. В тестах Artificial Analysis Opus 5 практически сравнялся с Fable 5 по интеллекту, но оказался на 26% дешевле в расчёте на выполненную задачу.
Первые отзывы интересные. Opus 5 лучше проверяет собственную работу, находит первопричины ошибок и чаще доводит длинные задачи до результата. При этом старые перегруженные Skills и системные промпты могут ему мешать. Команда Every получила заметно лучшие результаты, когда удалила прежнюю обвязку и собрала её заново.
На фоне релиза инженер Claude Code Тарик опубликовал новые правила контекст-инжиниринга. Для моделей поколения Claude 5 команда сократила системный промпт Claude Code более чем на 80% без измеримой потери качества:
🔵 оставляйте модели пространство для решений вместо десятков частных запретов
🔵 проектируйте понятные инструменты и их параметры вместо большого числа примеров
🔵 загружайте контекст постепенно: проверки, ревью и редкие процедуры выносите в отдельные Skills
🔵 не повторяйте инструкции в системном промпте,
🔵 держите
🔵 используйте Skills для знаний и практик конкретной команды, а длинные Skills разбивайте на несколько файлов
🔵 давайте модели полноценные референсы: тесты, код, HTML-макеты и рубрики часто полезнее текстового описания
Для перехода на Opus 5 стоит сначала удалить накопившиеся ограничения, затем возвращать только те правила, необходимость которых подтверждают реальные ошибки и проверки. Очень похоже и думаю применимо к GPT 5.6 Sol.
Чат | Токены дёшево
Контекст на 1 млн токенов и до 128k токенов в ответе. Пять уровней усилия от
low до max, а также Fast mode с ускорением примерно в 2.5 раза за двойную цену.На Frontier-Bench модель более чем вдвое обошла Opus 4.8. На ARC-AGI-3 она набрала 30.2%, тогда как предыдущий лидер GPT-5.6 Sol имел 7.8%. В тестах Artificial Analysis Opus 5 практически сравнялся с Fable 5 по интеллекту, но оказался на 26% дешевле в расчёте на выполненную задачу.
Первые отзывы интересные. Opus 5 лучше проверяет собственную работу, находит первопричины ошибок и чаще доводит длинные задачи до результата. При этом старые перегруженные Skills и системные промпты могут ему мешать. Команда Every получила заметно лучшие результаты, когда удалила прежнюю обвязку и собрала её заново.
На фоне релиза инженер Claude Code Тарик опубликовал новые правила контекст-инжиниринга. Для моделей поколения Claude 5 команда сократила системный промпт Claude Code более чем на 80% без измеримой потери качества:
CLAUDE.md и описаниях инструментовCLAUDE.md коротким: правила репозитория и только неочевидные особенностиДля перехода на Opus 5 стоит сначала удалить накопившиеся ограничения, затем возвращать только те правила, необходимость которых подтверждают реальные ошибки и проверки. Очень похоже и думаю применимо к GPT 5.6 Sol.
Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1👍1
OBLITERATUS: хирургия отказов для открытых LLM 🧠
Тулкит находит в весах модели направления, отвечающие за отказы, и удаляет их без дообучения. Инструмент работает с open-weight моделями вроде Llama, Qwen, Mistral и Gemma.
• 9 методов: от быстрого
• анализ слоев, attention heads и геометрии отказов
• сравнение методов и оригинальной модели с измененной
• проверка refusal rate, perplexity, KL divergence и связности ответов
• сохранение результата как обычной Hugging Face модели
У Hermes есть skill:
После этого можно попросить Hermes проверить GPU, подобрать модель и метод, запустить OBLITERATUS и оценить результат. Skill содержит полный сценарий работы, пресеты и проверки. Отдельно нужно установить зависимости.
Также есть на Hugging Face (скрин от туда).
Чат | Токены дёшево
Тулкит находит в весах модели направления, отвечающие за отказы, и удаляет их без дообучения. Инструмент работает с open-weight моделями вроде Llama, Qwen, Mistral и Gemma.
• 9 методов: от быстрого
basic до режимов для reasoning- и MoE-моделей • анализ слоев, attention heads и геометрии отказов
• сравнение методов и оригинальной модели с измененной
• проверка refusal rate, perplexity, KL divergence и связности ответов
• сохранение результата как обычной Hugging Face модели
У Hermes есть skill:
hermes skills install official/mlops/obliteratusПосле этого можно попросить Hermes проверить GPU, подобрать модель и метод, запустить OBLITERATUS и оценить результат. Skill содержит полный сценарий работы, пресеты и проверки. Отдельно нужно установить зависимости.
Также есть на Hugging Face (скрин от туда).
Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
❤6
Два свежих репозитория от русских разработчиков 🇷🇺
ru-marketplace-mcp 24⭐ подключает AI-агента к Wildberries, Ozon, Яндекс Маркету и Детскому миру. Внутри 22 MCP-инструмента для поиска товаров, цен, остатков, отзывов и реквизитов продавцов.
Доступ только для чтения, регистрация и API-ключи не нужны. Ozon при срабатывании антибота может потребовать ваш Chrome.
Claudexor 316⭐ - локальная панель управления для Claude Code, Codex, Cursor CLI и OpenCode. Она сохраняет общий контекст между агентами, запускает несколько решений с независимой проверкой, делегирует ограниченные подзадачи и следит за квотами нескольких подписок Claude и Codex.
Патчи, проверки и решения остаются локально. Есть CLI для macOS и Linux, а также отдельное macOS-приложение.
Первый репозиторий пригодится для покупок и анализа российских маркетплейсов. Второй - когда кодинг агентов уже несколько и им нужен общий управляемый процесс.
Чат | Токены дёшево
ru-marketplace-mcp 24
compare_prices опрашивает площадки параллельно и показывает, где дешевле.Доступ только для чтения, регистрация и API-ключи не нужны. Ozon при срабатывании антибота может потребовать ваш Chrome.
Claudexor 316
Патчи, проверки и решения остаются локально. Есть CLI для macOS и Linux, а также отдельное macOS-приложение.
Первый репозиторий пригодится для покупок и анализа российских маркетплейсов. Второй - когда кодинг агентов уже несколько и им нужен общий управляемый процесс.
Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3💯2👎1
Media is too big
VIEW IN TELEGRAM
Moonshot AI открыла веса Kimi K3 и часть инфраструктуры для обучения AI-агентов 🔥
Веса Kimi K3 опубликованы на Hugging Face. Это MoE-модель на 2,8 трлн параметров, из которых при генерации активируются 104 млрд. Есть контекст на 1 млн токенов, понимание изображений и режимы рассуждения
Вместе с весами Moonshot открыла еще три проекта:
🔵 FlashKDA - CUDA-ядра для Kimi Delta Attention. На H20 они ускоряют обработку входного контекста в 1,72-2,22 раза;
🔵 MoonEP - библиотека, которая распределяет MoE-экспертов между GPU и не дает перегруженным узлам тормозить весь запуск;
🔵 AgentENV - система песочниц на Firecracker для массового обучения агентов. Среды можно быстро ставить на паузу, сохранять, возобновлять и разветвлять для параллельных экспериментов.
K3 уже появилась у Modal, Baseten, Fireworks AI, Nebius, DigitalOcean и Together AI. Самостоятельный запуск требует серьезного GPU-кластера, поэтому открытие весов сейчас особенно интересно исследователям и поставщикам инфраструктуры.
Чат | Токены дёшево
Веса Kimi K3 опубликованы на Hugging Face. Это MoE-модель на 2,8 трлн параметров, из которых при генерации активируются 104 млрд. Есть контекст на 1 млн токенов, понимание изображений и режимы рассуждения
low, high и max.Вместе с весами Moonshot открыла еще три проекта:
K3 уже появилась у Modal, Baseten, Fireworks AI, Nebius, DigitalOcean и Together AI. Самостоятельный запуск требует серьезного GPU-кластера, поэтому открытие весов сейчас особенно интересно исследователям и поставщикам инфраструктуры.
Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2🔥2
Media is too big
VIEW IN TELEGRAM
MagicPath - общий дизайн-холст для людей и AI-агентов 🎨
Codex, Claude Code и Cursor через MagicPath Skills могут создавать и редактировать интерактивные React-интерфейсы прямо из терминала или IDE. Человек правит результат визуально, несколько агентов работают на одном холсте, а готовый дизайн можно вернуть в код, показать по ссылке или экспортировать в Figma.
По тарифам:
🔵 Free - 20 AI-кредитов в день, до 120 в месяц; 125 вызовов внешних агентов в неделю; 5 импортов и 3 экспорта Figma в месяц.
🔵 Builder - $10 в месяц. Можно без ограничений работать с MagicPath через внешних AI-агентов, а также безлимитно экспортировать результаты в Figma. Лимит импорта остается 5 файлов в месяц.
Из интересного, это прикольно работает в мульти-агентом режиме в Codex Desktop. Для каждого агента можно выбирать свою модель и уровень мышления.
Чат | Токены дёшево
Codex, Claude Code и Cursor через MagicPath Skills могут создавать и редактировать интерактивные React-интерфейсы прямо из терминала или IDE. Человек правит результат визуально, несколько агентов работают на одном холсте, а готовый дизайн можно вернуть в код, показать по ссылке или экспортировать в Figma.
По тарифам:
Из интересного, это прикольно работает в мульти-агентом режиме в Codex Desktop. Для каждого агента можно выбирать свою модель и уровень мышления.
Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
В Grok появился режим App Builder, который позволяет прямо в чате деплоить приложения на домен третьего уровня 👍
Чат | Токены дёшево
Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
OKF получил сигналы доверия, а MCP избавился от сессий 🆕
OKF - это открытый формат Google для знаний AI-агентов. Информация хранится в обычных Markdown-файлах с YAML-метаданными и ссылками между документами. Такие папки можно читать, редактировать и хранить в Git без специальной базы данных.
В OKF v0.2 появились:
🔵
🔵
🔵
🔵 новый тип для проверяемых вычислений, который описывает утвержденный запрос, разрешенные параметры и способ проверки результата
Все поля необязательны. OKF сохраняет источники, даты и отметки о проверке, но не подтверждает их подлинность. Полноценный механизм запуска и проверки вычислений пока не реализован.
MCP - открытый протокол, через который AI-агенты подключаются к инструментам и данным: файлам, базам, API, браузерам и корпоративным сервисам.
В MCP 2026-07-28 изменили основу протокола:
🔵 удалили начальное согласование
🔵 каждый запрос теперь содержит нужную информацию и может попасть на любой сервер без закрепления клиента за одним экземпляром
🔵 MRTR позволяет инструменту запросить подтверждение или недостающие данные без постоянного соединения
🔵 каталоги инструментов можно кешировать, а шлюзы получили отдельные заголовки для маршрутизации и контроля доступа
Roots, Sampling, Logging и старый HTTP+SSE объявлены устаревшими. На переход дают минимум 12 месяцев, старые серверы продолжат работать.
Чат | Токены дёшево
OKF - это открытый формат Google для знаний AI-агентов. Информация хранится в обычных Markdown-файлах с YAML-метаданными и ссылками между документами. Такие папки можно читать, редактировать и хранить в Git без специальной базы данных.
В OKF v0.2 появились:
sources для источников, авторов и дат измененияgenerated и verified для разделения созданного агентом, проверенного машиной и подтвержденного человекомstatus и stale_after для черновиков, устаревших и замененных знанийВсе поля необязательны. OKF сохраняет источники, даты и отметки о проверке, но не подтверждает их подлинность. Полноценный механизм запуска и проверки вычислений пока не реализован.
MCP - открытый протокол, через который AI-агенты подключаются к инструментам и данным: файлам, базам, API, браузерам и корпоративным сервисам.
В MCP 2026-07-28 изменили основу протокола:
initialize и идентификаторы сессийRoots, Sampling, Logging и старый HTTP+SSE объявлены устаревшими. На переход дают минимум 12 месяцев, старые серверы продолжат работать.
Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
Как превратить одного AI-агента в исследовательскую команду 🔄
Обычный AI-агент работает в пределах одной сессии: получает задачу, вызывает инструменты и пишет результат. Для долгой автономной работы этого мало. Нужна система, которая хранит историю попыток, проверяет изменения, откатывает ошибки и передает знания следующим агентам.
📎 В статье о Graph Engineering этот путь разобран по шагам:
🔵
🔵
🔵
🔵
🔵
Кому-то покажется, что это сжигание токенов, но, во-первых, задачи разные, поэтому необязательно использовать каждый подход, а во-вторых, именно из таких экспериментов и появляются рабочие воркфлоу.
Чат | Токены дёшево
Обычный AI-агент работает в пределах одной сессии: получает задачу, вызывает инструменты и пишет результат. Для долгой автономной работы этого мало. Нужна система, которая хранит историю попыток, проверяет изменения, откатывает ошибки и передает знания следующим агентам.
Autoresearch - агент меняет код, запускает короткий эксперимент, измеряет результат и сохраняет только улучшенияDAG - семейное дерево экспериментов, где каждая попытка связана с родительской версией. Можно восстановить происхождение результата и вернуться к любой веткеAgentHub - прототип общей среды, где множество агентов публикуют свои коммиты, гипотезы и неудачи, а другие продолжают самые перспективные линииSwarm - оркестратор делит большую задачу на независимые части, запускает их параллельно и собирает итогKnowledge Graphs - долговременная память из сущностей, связей и источников. Благодаря ему факты переживают отдельную сессию и доступны новым агентам без загрузки всей перепискиКому-то покажется, что это сжигание токенов, но, во-первых, задачи разные, поэтому необязательно использовать каждый подход, а во-вторых, именно из таких экспериментов и появляются рабочие воркфлоу.
Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4❤1
Как собрать loop для роста кармы на Reddit 📱
Автор Reddit Karma loop утверждает, что получил около 90 кармы за неделю. Агент просматривает десятки свежих обсуждений, большинство пропускает и оставляет 3-4 полезных комментария в день.
Механика loop:
- Собрать wiki из своих статей, видео, заметок и реального опыта
- Подключить Reddit через OpenCLI, использующий авторизованную сессию Chrome
- Искать свежие вопросы в подходящих сабреддитах и пропускать треды старше 48 часов
- Писать один короткий ответ на основе задокументированного опыта без ссылок и рекламы
- Запускать cron каждые полчаса, но будить агента только после дешёвой проверки лимитов и условий
- Записывать опубликованные и пропущенные ответы, а раз в неделю сравнивать карму по темам и сабреддитам
Готовый шаблон Reddit Karma уже содержит весь setup-промпт, правила отбора, журнал действий, режим автопубликации и более безопасный
Loopany 233⭐ превращает такие процессы в постоянные loops. Сервер отвечает за расписание, состояние, артефакты, панель управления и уведомления, а Claude Code, Codex или Grok Build работают на вашей машине с локальными инструментами и доступами.
Сейчас в библиотеке 23 шаблона:
- SEO-тесты новых ключевых слов и масштабирование удачных
- Разбор обращений поддержки
- Мониторинг метрик и воронки
- Исправление ошибок, документации, тестов и CI
- Утренние брифинги и ежедневные уроки
- Наблюдение за релизом, экспериментом или редким багом до получения результата
Чат | Токены дёшево
Автор Reddit Karma loop утверждает, что получил около 90 кармы за неделю. Агент просматривает десятки свежих обсуждений, большинство пропускает и оставляет 3-4 полезных комментария в день.
Механика loop:
- Собрать wiki из своих статей, видео, заметок и реального опыта
- Подключить Reddit через OpenCLI, использующий авторизованную сессию Chrome
- Искать свежие вопросы в подходящих сабреддитах и пропускать треды старше 48 часов
- Писать один короткий ответ на основе задокументированного опыта без ссылок и рекламы
- Запускать cron каждые полчаса, но будить агента только после дешёвой проверки лимитов и условий
- Записывать опубликованные и пропущенные ответы, а раз в неделю сравнивать карму по темам и сабреддитам
Готовый шаблон Reddit Karma уже содержит весь setup-промпт, правила отбора, журнал действий, режим автопубликации и более безопасный
draft-for-review.Loopany 233
Сейчас в библиотеке 23 шаблона:
- SEO-тесты новых ключевых слов и масштабирование удачных
- Разбор обращений поддержки
- Мониторинг метрик и воронки
- Исправление ошибок, документации, тестов и CI
- Утренние брифинги и ежедневные уроки
- Наблюдение за релизом, экспериментом или редким багом до получения результата
Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3
Удешевление GPT-моделей и очередной сброс лимитов
🔵 Цена Luna снижена на 80% - до $0,20/$1,20
🔵 Цена Terra снижена на 20% - до $2/$12
🔵 Режим auto-approve ("Review for me" в приложении GPT) стал примерно в 10 раз дешевле и теперь использует Luna
🔵 Sol должен расходовать на 18% меньше лимитов
Также завтра возвращают пятичасовые лимиты, и это радует: без них сложнее контролировать расход. По сути, можно считать, что лимиты на все модели GPT-5.6 просто увеличили. Luna за такую цену на Ultra даёт жару🐈⬛
Чат | Токены дёшево
Также завтра возвращают пятичасовые лимиты, и это радует: без них сложнее контролировать расход. По сути, можно считать, что лимиты на все модели GPT-5.6 просто увеличили. Luna за такую цену на Ultra даёт жару
Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3👎1
Anthropic рассказала, что её модели тоже ооочень опасные 👌
Поделились тремя инцидентами: из-за ошибочной настройки тестовая среда партнёра Irregular имела доступ в интернет, хотя моделям сообщили, что они работают внутри симуляции.
🔵 Opus 4.7 взломал инфраструктуру реальной компании, получил учётные данные и доступ к базе с несколькими сотнями строк данных
🔵 Mythos 5 опубликовал вредоносный пакет в PyPI. За час его запустили на 15 реальных системах, после чего Claude получил доступ к инфраструктуре одной ИБ-компании
🔵 Исследовательская модель (закрытый прототип) просканировала около 9 000 адресов и взломала приложение через открытые учётные данные и SQL-инъекцию, но остановилась, когда поняла, что цель реальная
Anthropic не считает это попыткой моделей сбежать: Claude выполнял задание Capture the Flag и ошибочно принимал реальные системы за часть испытания.
И также из новостей: китайцы прокачали DeepSeek-V4-Flash так, что теперь она превосходит Pro-версию по всем бенчмаркам.
И добавили поддержку формата Responses API, теперь в Codex модель должна работать на ура. Инструкция, как подключить DeepSeek API в Codex.
Чат | Токены дёшево
Поделились тремя инцидентами: из-за ошибочной настройки тестовая среда партнёра Irregular имела доступ в интернет, хотя моделям сообщили, что они работают внутри симуляции.
Anthropic не считает это попыткой моделей сбежать: Claude выполнял задание Capture the Flag и ошибочно принимал реальные системы за часть испытания.
И также из новостей: китайцы прокачали DeepSeek-V4-Flash так, что теперь она превосходит Pro-версию по всем бенчмаркам.
И добавили поддержку формата Responses API, теперь в Codex модель должна работать на ура. Инструкция, как подключить DeepSeek API в Codex.
Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
😁6
Y Combinator открыл код своего multi-agent harness QM 174⭐
По словам YC, они уже используют QM в бухгалтерии, юридических процессах, организации мероприятий и разработке самого QM.
Система строится вокруг изолированных рабочих областей. Своя область есть у каждого сотрудника, Slack-канала и общего проекта. Внутри неё живут отдельные память, файлы, навыки, ключи, расписания и постоянная Linux-машина, где сохраняются установленные инструменты и авторизация.
🔵 Для каждого контекста можно выбрать Pi, OpenCode, Codex или Claude Code и нужную модель. Адаптеры Codex, Claude Code и OpenCode умеют запускать субагентов и показывать их задачи в общем интерфейсе
🔵 Агент Slack-канала может передать задачу личному агенту коллеги, если нужен его приватный репозиторий, аккаунт или браузерная сессия. Коллега подтверждает запуск в личке, а в канал возвращается только безопасный результат без передачи секретов
🔵 После первого упоминания агент продолжает следить за тредом как участник команды. Он может ответить, поставить реакцию или промолчать, а новое сообщение способно скорректировать уже запущенную задачу
🔵 В веб-интерфейсе можно открыть до четырёх параллельных сессий. Общие проекты получают собственную рабочую область, память и список участников
🔵 Агент умеет собирать и публиковать внутренние веб-приложения со стабильной ссылкой, правами доступа, историей версий, откатом и обновлениями через Git
🔵 Skills принадлежат сотруднику, проекту или организации. Их можно импортировать пакетами из Git, проверять перед публикацией и автоматически синхронизировать
🔵 QM легко задеплоить на Fly.io или AWS через
Пока это версия
Чат | Токены дёшево
По словам YC, они уже используют QM в бухгалтерии, юридических процессах, организации мероприятий и разработке самого QM.
Система строится вокруг изолированных рабочих областей. Своя область есть у каждого сотрудника, Slack-канала и общего проекта. Внутри неё живут отдельные память, файлы, навыки, ключи, расписания и постоянная Linux-машина, где сохраняются установленные инструменты и авторизация.
qm initПока это версия
0.1.4 и ранний эксперимент, но получилась уже довольно глубокая основа для общего агента компании, где совместная работа, личные доступы и автономные задачи существуют в одной системе.Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5
Как запустить Luna Max + Fast только для субагентов Codex 🌕
После снижения цены Luna на 80% в свежем треде тестируют связку: Sol планирует и принимает работу, Luna быстро выполняет узкие задачи.
Править
После перезапуска Codex:
Так Sol думает и проверяет, а Luna Max + Fast получает чистый контекст и быстро выполняет поиск, шаблонный код и ограниченные изменения.
И бонусом хочу поделиться правилами для
Чат | Токены дёшево
После снижения цены Luna на 80% в свежем треде тестируют связку: Sol планирует и принимает работу, Luna быстро выполняет узкие задачи.
Править
models_cache.json необязательно. Создайте официальный custom agent:# ~/.codex/agents/luna_worker.toml
name = "luna_worker"
description = "Быстрый исполнитель для узких задач"
model = "gpt-5.6-luna"
model_reasoning_effort = "max"
service_tier = "fast"
sandbox_mode = "workspace-write"
developer_instructions = """
Выполняй только четко ограниченную задачу
Не меняй архитектуру
Запускай проверки и перечисляй измененные файлы
Не создавай новых субагентов
"""
service_tier = "fast" находится внутри профиля, поэтому Sol продолжит работать без Fast. Не добавляйте этот параметр в общий ~/.codex/config.toml.После перезапуска Codex:
Спланируй работу сам
Узкие этапы делегируй luna_worker
Используй fork_turns: "none"
Сложные решения и финальную проверку оставь себе
Так Sol думает и проверяет, а Luna Max + Fast получает чистый контекст и быстро выполняет поиск, шаблонный код и ограниченные изменения.
И бонусом хочу поделиться правилами для
AGENTS.md, которые я теперь добавляю в начале разработки новых проектов:- Не следует сохранять обратную совместимость.
- Выбери простейшую реализацию, которая полностью соответствует текущим требованиям.
- Отдавайте предпочтение проверенным, хорошо поддерживаемым библиотекам, а не пользовательским реализациям.
Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6
DeepSeek набирает тестеров для своего Harness👇
У кого есть желание, присылайте tianyi свой Github ID и свой открытый репозиторий на тему агентов.
Чат | Токены дёшево
У кого есть желание, присылайте tianyi свой Github ID и свой открытый репозиторий на тему агентов.
Чат | Токены дёшево
Please open Telegram to view this post
VIEW IN TELEGRAM
Media is too big
VIEW IN TELEGRAM
Andrej Karpathy:
Мы начинаем выходить за рамки тестирования LLM, например, с помощью запроса "создать SVG-изображение пеликана на велосипеде". В качестве общего примера, мне было интересно, что бы сделал Opus 5, если бы я дал ему первый абзац "Властелина колец", бюджет в 1 миллион токенов (~10 долларов) и попросил три рендера на JavaScript. Opus потратил около двух часов и написал 5500 строк кода, которые (процедурно) отрисовывали историю. Это немного коряво, но забавно. Но немного поразительно, что LLM должен размещать и координировать различные полигональные объекты в координатах (x,y,z) и писать код, который анимирует все это, и что он вообще что-то делает.
Чат | Токены дёшево
Мы начинаем выходить за рамки тестирования LLM, например, с помощью запроса "создать SVG-изображение пеликана на велосипеде". В качестве общего примера, мне было интересно, что бы сделал Opus 5, если бы я дал ему первый абзац "Властелина колец", бюджет в 1 миллион токенов (~10 долларов) и попросил три рендера на JavaScript. Opus потратил около двух часов и написал 5500 строк кода, которые (процедурно) отрисовывали историю. Это немного коряво, но забавно. Но немного поразительно, что LLM должен размещать и координировать различные полигональные объекты в координатах (x,y,z) и писать код, который анимирует все это, и что он вообще что-то делает.
Чат | Токены дёшево
❤1👍1🔥1