AiHub Приручаем ИИ | Вайб-кодинг | Ai-first development
974 subscribers
195 photos
5 videos
5 files
240 links
Объясняем про вайб-кодинг с продуктовым акцентом. Новости из мира ИИ, обзоры инструментов и методы Ai-first разработки. Делимся тем, что проверено и работает.

Лс: @nyxandro
Чат: @AiHubFeedChat

Рекламу не продаём.
Download Telegram
AI-Agents-in-Depth-Bojie-Li-v1.2.pdf
17.3 MB
Глубокое понимание ИИ-агента: принципы проектирования и инженерные практики

Книга посвящена основной формуле Agent = LLM + контекст + инструменты.

Краткий обзор содержания книги (главы 1-10):

1️⃣ Базовые знания об агенте.
Сформулируйте основную формулу: Agent = LLM + Контекст + инструмент и внедрите инженерные разработки - все инженерные возможности, кроме модели, являются реальной конкурентоспособностью.

2️⃣ Разработка контекста.
Контекст определяет верхний предел возможностей агента. Изучите контекстную структуру API для больших моделей, дизайн, удобный для кэширования KV, разработку подсказок, динамические подсказки и навыки агента, метаинформацию в строке состояния и стратегии сжатия контекста.

3️⃣ Пользовательская память и база знаний.
Пусть Агент запоминает пользователей в разных сеансах и получает доступ к внешним знаниям.Она охватывает системы пользовательской памяти, базовые конвейеры RAG, а также организацию знаний и поиск информации (структурированные индексы, карты знаний и т.д.), которые выходят за рамки простого текста.

4️⃣ Инструменты: Инструменты - это руки агента.
Поговорим о классификации инструментов и общих принципах проектирования, протоколе MCP и проблемах выбора инструментов, инструментах восприятия/исполнения/совместной работы и асинхронных агентах, управляемых событиями.

5️⃣ Программист и генерация кода.
Код - это “инструмент, который может создавать новые инструменты” и является мета-способностью обычного агента. Возьмем в качестве примера средство разработки производственного уровня, чтобы продемонстрировать полную реализацию этого самого мощного универсального инструмента.

6️⃣ Оценка агента.
Превратите работу агента в сопоставимый сигнал. От среды оценки, разработки набора данных, системы индексов до статистической значимости, наблюдаемости, отбора на основе оценки, внутренней оценки и моделирования на производственном уровне.

7️⃣ Постмодельное обучение: трехэтапная панорама предварительной подготовки, SFT и RL.
Когда выбирать SFT, когда выбирать RL, RLHF, сравнение алгоритмов, данные и среда, а также передовые исследования, позволяющие моделям научиться вызывать инструменты и повышать эффективность выборки.

8️⃣ Саморазвитие агента.
Вы можете расти, не меняя свой вес. Три парадигмы обучения - от обучения на основе опыта, активного поиска инструментов до “от пользователя инструмента к создателю инструмента“ - позволяют агенту перейти от ”умного“ к ”опытному".

9️⃣ Мультимодальное взаимодействие в режиме реального времени: распространение восприятия и действий с текста на голос, графический интерфейс и физический мир.
Три режима передачи речи (каскадный /сквозной полный режим/полный дуплекс), восприятие и синтез потоковой речи, использование компьютера и управление роботом.

1️⃣0️⃣ Мультиагентное сотрудничество: интеллект группы может быть выше, чем у отдельного человека.
Многоагентная система классификации, когда она действительно лучше, чем один агент, взаимодействие между разделяемыми и не разделяемыми контекстами, закономерности сбоев и появление “сообщества агентов”.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍84🔥4
Маркетплейсы, склады и причем тут вайбкодеры

На этой неделе меня как как и всех каснулась новость про склады маркетплейсов, есть жертвы, множество потрадавших сотрудников, убытки предпринимателей на миллионы рублей.

Ситуация неприятная жалко пострадавших.

Среди моих знакомых есть предприниматели, которые потеряли внушительные суммы в товарах. Они же спрашивают про разработку интернет-магазинов, ищут как диверсифицировать риски.

💌 Предыстория или почему решил написать

Вчера ко мне обратился Алексей, сказал, что пытается реанимировать свой интернет-магазин, которому больше 15 лет.

Открываю: geo-instrument.ru — там жесть.
При Алексее захожу в Вебмастер Яндекса, смотрю предупреждения — всё логично, сайт не адаптирован для мобильных устройств.

🚩 Во времена, когда Алексей делал себе магазин, про адаптивную верстку еще не знали, айфон был атрибутом дворянства и оценивались сайты только для работы с настольных компьютеров. Плюс доисторический движок на php. Короче если искать подрядчика на адаптивную верстку потратишь кучу времени и, вероятно, найдешь его за дорого.


💬 Claude Fable 5 + 187 строчек кода = адаптивная версия готова

Закинул один промпт, 10 минут работы и старый сайт начинает обладать адаптивной версткой. Я не пытаюсь сказать, что это всё прям легко, любая домохозяйка справится и т д — навыки и технические знания нужны. Но это сильно проще, чем искать ребят со знаниями специфический фреймворков вёрстки и договориваться с ними о работе с очередью в пару недель.

К слову, в работе над дизайном сайтов я в минувшем месяце закидывал все задачи сразу и в Fable и в Sol, пока что счет 4:3 в пользу рыжего логотипа.

🎨 Макеты всего магазина за два часа

Я решил на этом не останавливаться, малому бизнесу надо помогать и проверить, сможет ли Claude сделать редизайн интернет магазина на модные современные рельсы и воспользовался Claude Design.

За 2 часа я получил полноценные макеты все страниц сайта, приложил их к посту.
Не знаю чем это всё закончится, но я попробую натянуть полученный дизайн на старый движок.

🚀 Кажется тут помогут вайбкодеры

20 лет в екоме и рекламе, и последние пять из них я вижу, как усыхает предпринимательская онлайн-торговля. Свой склад, своя доставка, свой сайт — долго, дорого и неудобно.

Причина понятная: магазин в классической разработке стоит семизначных сумм и делается месяцами. Самый быстрый выход на рынок — через площадку, даже с её комиссиями и односторонними правками оферты.

Сами интернет-магазины предпринимателям из РФ обходятся в семизначные цены: на самом деле в классических парадигмах вроде ватерфола разработать магазин правда требует много работы и занимает много времени. Вот и получается, что самый быстрый гоу-ту-маркет — это через маркетплейсы.

Но если продавцы обратятся к вайбкодерам — могут получить и хорошие сроки и цену вкуснее, чем у классических веб-студий.

🤝 Давайте сведём людей

Если вы ищете работу, имеете компетенции в дизайне сайтов и готовы брать заказы — отмечайтесь в комментариях. Круто если в описанием опыта и портфолио.

Я закину этот пост паре знакомых владельцев магазинов, может быть кто-то еще поделится им по своим знакомым, — в общем есть шанс, что получится сделать метч.

----

Поляков считает — AI, код и кейсы
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4
Штош, Claude Opus 5 вышел, уже доступен везде, в том числе Cli

Не забудьте обновиться, он появится в версии v2.1.219

claude update
Если вдруг кто забыл.

Цены те же, что и на OPUS 4.8. Ожидания самые положительные, этим летом Claude радует чуть больше, чем GPT в новых версиях.

Один большой минус - после рабочей недели лимиты подошли практически к концу, на выходные развлечься с новой моделькой особо не получится. На ресеты тоже особо не рассчитываю.

Мусолить о том что эта модель чуть лучше предыдущих и судить по бенчам - точно не будем. Недели полторы спустя можно будет делать выводы. Горячим постам кто уже завтра будет кричать о том что он все протестировал и и сделал выводы - не верим.
🔥52👏1
Как промптить под новый Opus 5

Разобрался в свежих гайдах Anthropic, сделал себе выжимку основного, на что стоит обратить внимание. Вооружаемся знаниями, чтобы вкат в новую модельку прошёл максимально комфортно.

Модель заточена под сложные агентные и корпоративные задачи, особенно длинные цепочки действий. Старые промпты под 4.8 в целом работают, но есть моменты, которые стоит подправить.

Ответы стали длиннее.
Параметр (effort) управляет объемом размышлений модели, а не длиной видимого ответа. Хочешь коротко, проси прямо: держи ответы по делу, оговорки короткие, основной объем на суть. На уровне CLAUDE.md один раз строкой вписываем и забываем,

Модель много комментирует свои действия.
Перед вызовом инструмента объясняет что собирается делать, по ходу дает апдейты. Если это не нужно, задавай формат явно: одно предложение перед началом работы, апдейты только когда нашлось что то важное, а в конце сразу результат, без пересказа процесса. Я предпочитаю оставлять пояснения на каждом действии, чтобы лучше понимать ход размышлений моделек и "родниться" с ними.

Документы на выходе тоже длиннее.
Отчеты и файлы в markdown модель пишет объемнее, чем предыдущие версии. (куда еще больше?). Нужно отдельно просить не растягивать: покрывать суть без лишних разделов и повторов.

Сама себя перепроверяет.
ВОТ ТУТ СРАЗУ СТОИТ ОПТИМИЗИРОВАТЬ ПРАВИЛА АГЕНТА.
Если в промпте есть инструкции вроде "добавь финальную проверку" или "проверь через отдельного агента", их можно убирать. В рабочих процессах с GPT моделькой я обычно это называю Self-ревью. Модель и так это делает, а с такими инструкциями просто тратит токены впустую. Заодно любит расширять задачу больше, чем просили. Если нужна узкая задача, прямо пиши: делай ровно то, что попросили, не расширяй и не сужай на свое усмотрение, для рутинных решений не спрашивай, а для развилок уточняй. (опять привет GPT 5.6, видимо на всех новых моделях это будет по дефолту как необходимость).

Охотно делегирует другим агентам.
Это оправдано на действительно объемных независимых кусках работы, но на мелких задачах только все замедляет. Я бы сразу в правилах указывал на конкретные случаи, когда сабагентов можно запускать а когда нет. Напомню, что писать код лучше без сабагентов, а вот ревью делать, тесты, ресерчи - вполне себе можно ими.

Сама себя правит. Ошибки ловит и чинит без напоминаний, поэтому "перепроверь ответ" тоже лишняя инструкция. При этом любит проговаривать сам факт правки, даже по мелочи. Если это не нужно в продукте, проси отмечать только те правки, которые реально что то меняют для пользователя, а по мелочи просто чинить молча.

С отключенными размышлениями бывают глюки.
При выключенных размышлениях иногда вызов инструмента вылезает прямо текстом в ответе, и тогда он просто не срабатывает. Либо в ответе проскакивают служебные теги вроде thinking. Так что мышление не отключаем, иначе моделька превратится в картошку.
4🔥2👏1
Ну что, вайбкодеры, залетаем на мини-курс от Яндекс по построению безопасных агентов (сертификат прилагается, в том числе на английском языке)

Интенсив будет интересен разработчикам, AI‑ и Dev(Sec)Ops‑инженерам, техлидам и архитекторам, студентам технических вузов и тем, кому важно понимать риски и уметь проектировать надёжные агентные системы

Для практических заданий пригодятся навыки вайб‑кодинга: умение формулировать запросы и запускать получившийся код. Полезно также понимать жизненный цикл разработки

- Расскажут, как устроены автономные ИИ‑агенты и чем они отличаются от LLM.
- Узнаем, какие угрозы возникают при работе ИИ‑агентов и как защищать системы от взломов, утечек данных, ошибок конфигурации и других распространённых рисков.
- Покажут реальные кейсы и лучшие практики, как проектировать безопасную архитектуру ИИ‑продуктов.

ТОРОПИТЕСЬ
Завтра (а точнее уже сегодня, до 28 июля) последний день, чтобы успеть пройти вводные задания (их 3 штуки, я их честно говоря проходил с нейронкой на пару, нет времени на них). Далее идут лекции, потом сдача финального задания. На выходе получим сертификат о прохождении.

Кому просто посмотреть лекции надо, и сертификат не нужен - можете не дергаться, всё будет общедоступно в ВК и Ютуб.

В прошлый раз ШАД тоже запускал обучение по агентам, все прошло гладко, сертификат выдали. Так что лишним не будет, торопитесь поучаствовать. Построение агентов, а особенно бизнесовых, а тем более безопасных - одна из востребованных тем уже сейчас.

https://shad.yandex.ru/agentsecurityweek

#free
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7🔥42👏1🏆1
AI разработка web проектов без велосипедов

Делаю AI-агентов и различные веб-проекты, заметил закономерность: модель охотно лепит самописы там, где давно есть готовые популярные решения. Next/React она знает отлично, но как доходит до инфраструктуры вокруг, хочется заругаться (когда ты всё проглядел а оно уже собрано). Прошёлся по стеку своих проектов и собрал список того, что стоит брать сразу, включая пару вещей, которые модели обычно не предлагают сами.

1️⃣ Realtime и стриминг

Socket.IO. Realtime-связь фронта и бекенда: стриминг токенов от LLM, прогресс агента, каналы событий, живые обновления UI. Готовые реконнекты и доставка, не надо писать руками. (даже не пытайтесь в самописы нейронкой, замучаетесь потом ревьюить и править).

Socket.IO-postgres-adapter. Масштабирование Socket.IO между инстансами через Postgres вместо Redis. Если база и так есть, лишний сервис не нужен.

2️⃣ Очереди и фоновые задачи

Pg-boss. Очереди прямо на Postgres: ретраи, cron, dead letter queue, приоритеты. Модели почти никогда сюда не смотрят, рефлекторно предлагают Redis и BullMQ, даже когда база одна и очередь нужна для трёх джобов в сутки.

Inngest / Trigger.dev. Serverless-воркфлоу с шагами и вебхуками для сложных пайплайнов.

Dockerode. Node-обёртка над Docker Remote API: управление контейнерами, образами, стримами прямо из кода вместо шелл-вызовов docker через child_process. Полезно для любых сценариев с программным запуском контейнеров, включая изолированный запуск сгенерированного агентом кода.

3️⃣ Данные и поиск

Prisma ORM. Типобезопасный доступ к БД, миграции, автогенерация типов. Нейронка с ней работает, как боженька. Не приходится лезть в БД а всю схему БД моделька знает из файла схемы, лежащего в проекте, который и является источником истины. Плюс ко всему, призма не даст сломать миграции или как-то криво их применить агенту.

Drizzle. Альтернатива Prisma без отдельного движка, миграции обычным SQL, ближе к базе. Модели реже про неё вспоминают, хотя в проде она встречается не реже. С некоторым допилом поверх можно тоже прийти к единой схеме как и в призме.

Pgvector. Векторы прямо в Postgres. RAG без отдельного сервиса примерно до 10M эмбеддингов. в 90% случаев закрывает все наши векторные хотелки без прибегания к отдельным векторым бд.

Meilisearch / Typesense. Полнотекстовый и векторный поиск с морфологией вместо LIKE и самописных токенизаторов.

4️⃣ Хранилища

Garage вместо MinIO. MinIO больше не безопасный дефолт: в декабре 2025 проект перевели в maintenance mode, в феврале 2026 репозиторий заархивировали с пометкой «no longer maintained». Garage от Deuxfleurs живой, тот же S3-протокол, спроектирован под self-hosted мультинодовый кластер. Модели по инерции всё ещё советуют MinIO, потому что так было в датасетах.

5️⃣ Эмбеддинги

Multilingual-e5-small. Мультиязычные эмбеддинги локально на CPU, компактная модель, не требует GPU. Разумный выбор для недорогого хостинга: BGE-M3 и e5-large точнее на части задач, но для бюджетного CPU-инстанса small-версия достаточна и заметно легче по ресурсам. Без OpenAI и утечек данных. Именно ее во всех проектах и использую.

6️⃣ LLM-инфраструктура

Vercel AI SDK. Стриминг в React/Next из коробки, useChat/useCompletion, 20+ провайдеров через единый интерфейс.

LiteLLM. Единый API к 100+ LLM с фоллбэками и ретраями вместо provider-specific клея на каждый релиз. Важно, что умеет в статистику по токенам и билинг. Перешел на нее с Cli Proxy Api.

Instructor / Outlines. Структурированный вывод по Pydantic/Zod-схемам вместо ручного парсинга JSON через regex.

7️⃣ Агентные фреймворки

Mastra. TS-фреймворк для продакшен-агентов с готовой памятью поверх Postgres. Прямой конкурент LangChain/LangGraph, но нативно на TS, без питонячьей экосистемы.

Eve (пока в бете, но уже интересен) Для личных, семейных, командных агентов. Разделение простое: Mastra под бизнес-задачи, eve под персональные. Не перевариваю всяких гермесов и опен клав, почему, сам не знаю, наверное из за отвращения к перехайпленным решениям.

8️⃣ Авторизация

better-auth. Гибче классического NextAuth, из коробки организации, роли, 2FA.
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥18👍2👏2😁2
OpenAI выпустили Codex Security

CLI и SDK, которые гоняют агента по твоему репозиторию и ищут уязвимости, как security-ревьюер, только автоматический. Уже бегу встраивать в рабочий процесс.

Что и зачем

npx codex-security scan /path/to/repo
и он ранжирует код, разбирает файлы, ищет проблемы и цепочки атак.

Можно повесить git-хуком на коммит - блокирует, если находит критичное.

Можно скормить весь список репозиториев из GitHub разом (bulk-scan).

Результаты сохраняются, сканы можно сравнивать между собой - видно, что пофиксили, что осталось, что новое.

Экспорт в SARIF/CSV/JSON, чтобы утащить в свой пайплайн или таск-трекер.

Есть отдельные команды: не просто найти проблему, а провалидировать её и сразу попросить патч.

По умолчанию работает на gpt-5.6-sol с максимальным reasoning effort. Модель можно поменять.

Из практичного: результаты скана храни вне репозитория. Там куски кода и подробности уязвимостей.

https://github.com/openai/codex-security
👍6🔥3👏1
Салют, вайбкодеры!

Пришлось взять приличную паузу, чтобы переварить все нововведения и не бросаться поспешными выводами ради постов.

Выход GPT 5.6 на пару с Opus 5, несмотря на небольшой отрыв по умениям от своих предшественников, достаточно сильно повлиял (лично у меня, но думаю не только у меня) на процессы разработки с нейросетями и заставили наизнанку вывернуть свой workflow, чтобы результаты работы были как минимум не хуже предыдущих.

Модели внезапно стали пытаться быть умнее и самостоятельнее, чем я от них того ожидал, начали конфликтовать с привычными мне настройками харнесса: правила, скиллы, стиль промптинга, затронуты были даже настройки прав доступа к файлам и папкам.

Первые впечатления были исключительно негативными, лезут, куда их не просят, делают не в том порядке и не с теми приоритетами, что от них требуют правила, полагаются не на те факты, которые стоило бы. А еще спокойно выдумывают несуществующие факты и ленятся проверять первоисточники.

А тут еще и Orca объявилась ( https://www.onorca.dev/ ) которая поспособствовала отказу от разработки сразу двух проектов, собственный харнесс для VDS с разработкой через telegram с мобильного, и диспетчера терминальных агентов. Она пришла и задала новый стиль и формат работы: то, что мне так не хватало, завезли практически разом и облегчили мне жизнь и сэкономили время.

Для кого то, возможно, глобально ничего нового не случилось. Но вот для меня, которого 24/7 гоняет модели в работе (около 15 часов пока бодрствую, и /goal на ночь) все процессы поехали, контроль был потерян, уже устоявшиеся приёмы нуждались в корректировке. Сначала я просто откатился на прошлые модели, с которыми у меня был общий язык, и работал на них. Но вечно это продолжаться не могло, поэтому решил пересилить себя, выделить время и начать разбираться, как с этим работать.

Около недели глобально ничего не трогал, просто смотрел как работает Opus, GPT и делал себе заметки о выявленных нюансах в работе обоих моделек. Спрашивал, почему они выбрали тот или иной путь решения задач, тестировал различные приёмы, как это взять под контроль. Накопил большое количество заметок, выделил рабочий день и конвертировал это в глобальное правило для агентов. Подкинул их в рабочий процесс и спокойно выдохнул, теперь всё опять работает, как я ожидаю.

Возможно многие недооценивают влияние правил агента, качают готовые из популярных репозиториев, или вообще их не заполняют, руководствуясь минималистичным подходом, полностью доверяя процесс моделям. Я же на правила возлагаю огромную роль, они создают некий безопасный коридор для агента, в рамках которого он будет работать и в какой последовательности выполнять поставленные задачи. Буквально это конституция, которая должна безоговорочно выполняться.

Так вот, отработал буквально каждую строчку, обсудил с агентом, учел пересечения и конфликты с системным промптом, подкинул в своих агентов и теперь успокоился, работа вернулась в комфортное русло и я получаю контролируемый (насколько это возможно с нейросетями) результат. Поэтому решил поделиться своей наработкой, может кому-то пригодится. Копировать 1 в 1 конечно же не стоит, я строил в первую очередь для себя. Но уверен, что обязательно что-то полезное подчерпнуть получится, особенно тем у кого с 5.6 GPT и 5 OPUS не сложилось на старте.

🔗 Ссылочка на файл правил

Надеюсь, ближайшие 4-5 месяцев лезть не придётся для исправления.
14👍6👏3❤‍🔥1🔥1🦄1
Парадокс сабагентов, роёв и прочих мультиагентных систем

Пост родился как логическое продолжение предыдущего поста про правила, где я намеренно придушиваю возможность запускать сабагентов.

Откуда это вообще пошло. Всё чаще наблюдаю картинку как люди торопятся подключить как можно больше агентов в свой харнесс, при этом даже в один поток еще работу не наладили. Что они ожидают увидеть в таком случае на выходе? Мне не понятно. Думаю, им тоже. Ощущается, что они заражены какими-то постами блогеров или какими-то хайповыми роликами/статьями, воспринимают это как решение большинства проблем, но предметно объяснить какую проблему они этим подходом решают, не могут.

Давайте откатимся чуть назад, чтобы вспомнить, для чего их вообще придумали.

Впервые щупать сабагентов я начал на Claude моделях, когда было жесткое ограничение в 200 000 токенов контекста, а модели могли выбирать не самый оптимальный путь мышления перед реализацией задачи. Тогда сабагенты выглядели как инженерный приём, который позволяет:
1️⃣ Экономить контекст. Сабагент получил задачу, выполнил ее, передал результат основному агенту.
2️⃣ Сузить фокус агента на конкретной задаче. Сабагент и агент работают внутри своих окон, каждый может иметь свой системный промпт (я про промпт, описывающий работу сабагента/агента, а не про тот случай, когда сейчас GPT или Claude могут сами спавнить в любой момент себе помощников, которых вы заранее не прописывали).

Работало действительно неплохо. Можно было делать ресерч одним сабагентом, код писать основным агентом, а тестирование, ревью и обновление документации поручать другим сабагентам, узко настроенным на свой спектр задач. Тогда можно было спокойно закончить достаточно большую задачу до того, как мы переполним контекст и схватим компакт. А компакты в то время своим качеством не славились и многие придерживались принципа "если компакт произошел, то дальше процесс уже стал неуправляемым и надо срочно финалить задачу и перепроверять, не начудил ли агент".

И напомню, что 200к контекста - не совсем те 200к, которые мы можем взять и использовать в полной мере. На старте, пока не появились скиллы и были только MCP, в легкую могло уходить по 30-40к токенов на содержание MCP в контексте, и буфер для сжатия контекста при компакте в районе 40к контекста. Даже на самых оптимизированных конфигах по факту мы имели на старте не 200к, а примерно 140к свободного для работы контекста. Это теперь кажется диким, ведь сейчас на среднем проекте только сбор информации по проекту перед реализацией какой-либо фичи уже может достичь 100к+ контекста.

Далее вендоры стали добавлять собственных системных сабагентов в наши харнессы, там и модель можно использовать попроще и побыстрее, и промпты заранее нужные заготовлены, и обслуживать это не надо. Все работает из коробки. Например, какой-нибудь explore агент для сбора контекста по проекту и последующей передачи его основному агенту, яркий тому пример. И качество компактов сильно подтянули, можно было спокойно переживать 2-4 компакта и все нужные детали всё еще агент учитывал, можно было сильно не переживать, а нужный контекст после компакта добирался. К тому же, у Claude появился 1 миллион контекста, у GPT тоже (но в какой-то момент они свернули не туда, и жестко его порезали). Но этот миллион контекста не работал так надежно, как хотелось бы, часто после 30-40% заполнения уже начинались явные проблемы в работе и потеря фокуса на задаче (сейчас с этим всё гораздо лучше).

Из этого как бы следует логичный вывод. что да, сабагенты нужны, разгружаем основного агента, а он на своем минимальном узкосфокусированном контексте контролирует процесс. С точки зрения задумки всё красиво. Но на практике картина вырисовывается иная:

1️⃣ Основной агент на старте запроса собирает контекст, даже если он это сделал в минимальном размере и поручил основной сбор сабагенту, сабагент заново читает ВЕСЬ контекст, отдает саммари основному агенту. Основной агент, перед тем как начать выполнять задачу, всё равно пойдет читать связанные файлы чтобы посадить новый код в известное ему место, а не по наводке агента по ресерчу. Итого имеем почти двухкратное чтение контекста, а мы еще даже код писать не начали. Время, кстати, тоже теряем. У GPT 5.6 буквально в системном промпте указано, что он должен спавнить сабагента для сбора контекста при любом запросе. Даже когда вы обсудили с ним большую часть реализации, и в целом он сам уже коснулся всех нужных файлов в достаточной степени, чтобы сделать какой-то вывод и распланировать задачу, он все равно будет спавнить агента который опять всё заново будет читать. Это бред. Так быть не должно. Он сам уже все карты на руках имел. Ах да, еще и не забываем что уходит приличное количество токенов на мышление и генерацию промпта от основного агента -> сабагенту, и после отработки сабагента происходит тоже самое в обратную сторону. Экономия, говорите? Ну, нет. Звучит это всё как какой-то заговор на то, чтобы мы больше токенов сжигали. Оптимизация ради оптимизаций порождает отрицательную эффективность.

Что с этим делать? Брать запуск сабагентов под контроль исходя из вашего воркфлоу, а не из-за пожеланий вендоров в системном промпте. Допускаю, что каких-то кейсах запуск агента по ресерчу будет ценным шагом, особенно на новых фреймворках когда надо перелопатить и код в проекте, и документацию, и внешние источники с документацией библиотек. Это скорее крайние случаи в проектах с непопулярным набором фреймворков и библиотек. Иначе у основного агента мозги от кол-ва информации закипят и контекст действительно забьется мусором. Мои советы релевантны скорее для общей массы веб проектов. Конечно же, крайние случаи надо рассматривать индивидуально.

2️⃣ Потеря важных деталей при передаче задачи сабагенту и возврат отчета обратно агенту. У себя я это выявил в результате достаточного долгосрочных тестов и наблюдений и этот факт уже ничем не перебить. Когда у основного агента есть достаточно жирный промпт с кучей детальных инструкций, он далеко не всегда все эти детали ответственно передает. Из-за чего сабагент начинает работать с самого старта над некорректно поставленной задачей. И вернет отчет тоже с некоторой долей вероятности, тоже с потерей деталей уже с его стороны. Писал об этом тут , в бизнес агентах это даже мешало, что пришлось отключать на уровне конфига возможность спавнить помощников.

Что с этим делать? Отключать на 100%, как мы ранее уже решили, конечно их не будем, но контролировать - обязательно. Для передачи задач и отчетов между агентом и сабагентом нужно заключать в рамки строгого контракта: что, в каком виде и с какой степенью глубины и детальности должно передаваться. Это можно буквально зашить в правилах агента, он будет составлять задачу для сабагента в нужном вам формате и указывать ему формат отчета, по которому он должен будет вернуть результат работы, что значительно повысит качество их взаимодействия и сбережет ваши нервы.

Итого, действительно полезное применение этого я вижу только в некоторых проектах где нужен глубокий ресерч по проекту и документации, и в процессах ревью кода, где чистая изолированная сессия это базовый минимум для честного ревью. Кто и как это реализует это уже другой вопрос, можно и другой модели это отдать, и даже отдать какому-то удаленному ревьюиверу, без проблем. Главное уловить суть, что если мы хотим адекватный расход токенов и быстрое выполнение задач, мы должны взвесить что для нас важно. Как по мне, лучше пережить пару компактов на гпт (на клоде с его миллионом контекста, скорее всего и не придется), но работать в один поток и сабагентов пускать строго под присмотром по установленному контракту, где ожидаете это вы, а не где вздумается модельке.

А что с роями? а я даже это обсуждать не хочу, пока это игрушки для энтузиастов с безлимитным доступом к токенам. Возможно, за пределами вайбкодинга это и применимо, но точно не здесь. Чтобы рой ожил и выполнял свои задачи, при этом не мешая друг другу и не трогая одни и те же файлы, придется плодить пачку worktree, которые еще потом придется как-то сливать в одну ветку и решать кучу конфликтов.

Что думаете? Может я их "готовить" не могу, и у вас сложилось всё куда удачнее и стабильнее с мультиагентами?
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍104🔥3🤔2😍1
Тут внезапно 5.1 Fable завезли, а еще сбросили лимиты на Claude Code

https://platform.claude.com/docs/en/models/fable-5-1/overview

Не забудьте обновиться.
🔥2
Оптимизация потребления оперативной памяти в OpenCode

Может кто-то сталкивался с тем, что OpenCode на очень длинных сессиях, когда пк работает день или больше, начинает жестко класть систему, забирая на себя много оперативной памяти. Долго грешил на сам OpenCode или особенности работы WSL (Windows Subsystem for Linux), но выяснилось вот что.

Когда LSP сервера включены (если не включены, срочно рекомендую включать), они почти без контроля кушают оперативную память, и при этом не возвращают её обратно. Выходит так, что в процессе работы рано или поздно рабочая машина упрется в нехватку памяти и жестко повиснет. Зачем LSP нужен агенту - писал тут, в 10 пункте.

Как лечится: просто ограничением потребления оперативной памяти. Находится по пути ~/.config/opencode/opencode.jsonc.

Вставляем эту конструкцию:
"lsp": {
"typescript": {
"command": [
"/home/nyxandro/.cache/opencode/packages/typescript-language-server/node_modules/.bin/typescript-language-server",
"--stdio"
],
"extensions": [".ts", ".tsx", ".mts", ".cts", ".js", ".jsx", ".mjs", ".cjs"],
"initialization": { "maxTsServerMemory": 2048 }
}
},

Вместо nyxandro ставим название своей папки пользователя.

И в extensions можете добавить нужные вам форматы файлов, которые тоже надо проверять во время работы. У меня весь стек на TS/JS, поэтому набор такой.

Или проще дать этот пост агенту, он сам поймет, что и куда вставить (и обязательно пусть проверит, запустились ли LSP сервера).

По итогу данное ограничение при достижении лимита памяти заставляет сборщика мусора автоматически решать что и как выгружать, нас это уже не касается. Проверено, спустя месяц ни одного зависания.
👍9👏2😱21❤‍🔥1🔥1🆒1
Claude code обленился, или обезопасился?

Вы заметили, что Claude Code в cli даже со всеми выданными правами иногда отказывается выполнять команды в терминале? Даже казалось бы, достаточно безопасные, например, при работе с git или удаленным сервером это случается особенно часто.

Как я понял, встроенный классификатор действий агента помечает эти команды как опасные, и блокирует запуск команд на уровне терминала еще до того, как агент их отправил. Логика понятна, за нас беспокоятся, чтобы их агент не начудил и постов в соцсетях о том, как claude снёс все важные данные на рабочей машине, было меньше. СМИ особо смакуют подобные новости, расшатывая доверие к ИИ, даже когда деструктивное действие нанесло ущерб исключительно из-за халатного отношения к своей работе и данным в рабочем пространстве.

Не совсем уловил момент, когда это стало явным, по ощущениям - неделю назад.

Решение очевиднейшее и пришло в голову сразу, но я должен это озвучить, так как у коллег могут с этим проблемы возникнуть, механику нужно разжевать.

Что делаем? Либо пишем правила, либо просим Claude после неудачной попытке ввода команды не использовать составные или вложенные команды (думаю все заметили, что нейронки круто справляются с терминалом и могут выписывать огромные конструкции, которые я бы руками пол дня вводил по одной). Так вот, если команды вводить в несколько заходов без усложнения, классификатор ругаться перестаёт.

Вроде мелочь, но бесячая, ты дал задачу, отошел от ПК пока Claude работает, а потом выясняется, что из-за этого агент застрял и всё это время работа стояла на месте.
👍1131👏1
This media is not supported in your browser
VIEW IN TELEGRAM
Вышел тизер фильма про OpenAI под названием "Искусственный"

Что известно:
- Сэма Альтмана играет Эндрю Гарфилд
- Илью Суцкевера сыграл Юра Борисов

Премьера 5 октября в ограниченном режиме, в широком прокате с января .

Сюжет: 2003 год, Илья Суцкевер учится у Джеффри Хинтона в Торонто. Спустя десять лет, работая в Google, Суцкевер пересекается с Альтманом - он тогда только начинает путь к основанию OpenAI. Дальше история идет через два десятилетия развития машинного обучения к перевороту в OpenAI ноября 2023 года, когда совет директоров увольняет Альтмана, а спустя пять дней возвращает обратно (кстати, этого факта я и не знал, ну и чудаки, конечно, практиковали ресеты еще в те года).
👍4😁2
Наконец-то Claude стал поддерживать правила агента из файла AGENTS.md

Случайно в одном из проектов заметил, а тут и новости оказывается уже появились на этот счёт. Может скоро и .agents/skills и прочие каталоги начнут поддерживать. А то надоело симлинки/хардлинки делать для всех агентов.
🔥12😁4💯4🤝31👍1🍾1