В комьюнити гуляет тезис «дизайнь луп вместо промпта», но что такое луп — трактуют кто во что горазд. Выпустили гайд от команды Claude Code по 4 типам loop:
Turn-based — базовый агентный цикл. Пишешь промпт, Claude читает контекст, редактирует, гоняет тесты, отчитывается, ты проверяешь руками. Улучшить можно, зашив ручную верификацию в
SKILL.md, чтобы Claude сам проверял результат (открыл браузер, кликнул, посмотрел консоль), а не просто отчитался «готово».Goal-based (`/goal`) — когда одного захода мало. Задаёшь достигаемый и измеримый критерий готовности, и отдельный агент evaluator гоняет Claude по кругу, пока критерий не выполнен или не достигнут лимит по кол-ву попыток:
/goal get the homepage Lighthouse score to 90 or above, stop after 5 tries.
Работает лучше всего с детерминированными метриками: число прошедших тестов, конкретный порог, кол-во минорных багов и др..
#ClaudeCode #AI
Please open Telegram to view this post
VIEW IN TELEGRAM
👍11👎5
Если часть работы завязана не на запрос, а на внешнюю систему или периодичность, например PR-ы ждут ревью или сделать rebase чтобы влится, появляются креши в Crashlytics и другие, тогда можно пробовать периодические запуски.
/loop перезапускает промпт с заданным интервалом, пока работает у тебя на машине:/loop 5m check my PR, address review comments, and fix failing CI
Чтобы вынести это в облако и не держать сессию живой, есть
/schedule — уже отдельная Claude routine в облаке Anthropic, а не процесс на твоём компе.⚠️ Момент, который стоит держать в голове: `/schedule` и связанные с ним dynamic workflows пока в статусе research preview и не доступна всем. Подавать как «уже можно поставить на прод и забыть» рано.
#ClaudeCode #AI
Please open Telegram to view this post
VIEW IN TELEGRAM
👎6👍5
Самая интересный для меня вариант loop, потому что не нужно вообще участия, а только запуск и приемка результата.
Событие или расписание триггерит работу,
/goal описывает, что считать сделанным, dynamic workflows раскидывают агентов по подзадачам (триаж, фикс, ревью), auto mode не спрашивает разрешения на каждый шаг.Пример из документации — почасовой разбор бэклога багов с ревью фикса в параллельных worktree.
Источник и подробности с примерами SKILL.md: Getting started with loops
#ClaudeCode #AI #Agents
Please open Telegram to view this post
VIEW IN TELEGRAM
👎6👍5
😂 Тесты GLM 5.2 откладываются: недельная квота сгорела быстрее, чем успел что-то толком сделать
Вышел GLM 5.2, контекст на миллион токенов, отзывы из чатов в целом неплохие. Не Opus 4.8 и тем более не Fable, но интересно было попробовать на живом проекте.
Взял GLM Coding Pro за ~$65/мес, погонял на паре параллельных задач в рабочем репозитории — ребейзы на нескольких ветках, ничего экстремального. Через день недельная квота была выжрана в ноль ⚠️ Серьёзной работы толком не успел сделать.
Тут вопрос не только к модели, но и к тарифу: Pro — не топовый план, а недельный лимит внутри месячной подписки. На Max возможно другая картина.
У кого есть свежий опыт с GLM 5.2 в агентном режиме на реальных задачах? Сколько квоты реально уходит на день работы, и есть ли смысл брать тариф выше?
#AI #GLM
Вышел GLM 5.2, контекст на миллион токенов, отзывы из чатов в целом неплохие. Не Opus 4.8 и тем более не Fable, но интересно было попробовать на живом проекте.
Взял GLM Coding Pro за ~$65/мес, погонял на паре параллельных задач в рабочем репозитории — ребейзы на нескольких ветках, ничего экстремального. Через день недельная квота была выжрана в ноль ⚠️ Серьёзной работы толком не успел сделать.
Тут вопрос не только к модели, но и к тарифу: Pro — не топовый план, а недельный лимит внутри месячной подписки. На Max возможно другая картина.
У кого есть свежий опыт с GLM 5.2 в агентном режиме на реальных задачах? Сколько квоты реально уходит на день работы, и есть ли смысл брать тариф выше?
#AI #GLM
👎10👍4
⚡️ SpaceXAI выпустила Grok 4.5 и это уже стоящий конкурент Claude Code с Sonnet/Opus
Модель доступна уже сегодня в Grok Build, во всех тарифах Cursor и в консоли SpaceXAI. Цена: $2/млн входных токенов, $6/млн выходных — заметно дешевле Opus $5/$25
Главный аргумент компании не про качество, а про эффективность: на SWE-Bench Pro Grok 4.5 тратит в среднем 15 954 токена на задачу против 67 020 у Opus 4.8 (max) — это в 4.2 раза меньше. Цена за токен падает, а реальная стоимость задачи определяется не прайсом, а тем, сколько токенов агент нажигает на решение. Попробовать можно уже сегодня в Cursor.
Цифрам доверять пока нельзя так как все тесты внутренние. DeepSWE и Terminal Bench SpaceXAI гоняла каждую модель в её собственном харнессе — Fable, GPT 5.5 и Opus тестировались не в одинаковых условиях с Grok. Пока это маркетинг и лишь заявку, а не независимое сравнение. А Маск любит такое.
Для агентных пайплайнов интереснее проверить не заявленную эффективность, а реальный расход токенов на своих задачах, а не на чужих графиках.
Однозначно покупка Cursor пошла напользу, вполне возможно, что именно их наработки и легли в основу новой модели.
#AI #Grok #Cursor
Модель доступна уже сегодня в Grok Build, во всех тарифах Cursor и в консоли SpaceXAI. Цена: $2/млн входных токенов, $6/млн выходных — заметно дешевле Opus $5/$25
Главный аргумент компании не про качество, а про эффективность: на SWE-Bench Pro Grok 4.5 тратит в среднем 15 954 токена на задачу против 67 020 у Opus 4.8 (max) — это в 4.2 раза меньше. Цена за токен падает, а реальная стоимость задачи определяется не прайсом, а тем, сколько токенов агент нажигает на решение. Попробовать можно уже сегодня в Cursor.
Цифрам доверять пока нельзя так как все тесты внутренние. DeepSWE и Terminal Bench SpaceXAI гоняла каждую модель в её собственном харнессе — Fable, GPT 5.5 и Opus тестировались не в одинаковых условиях с Grok. Пока это маркетинг и лишь заявку, а не независимое сравнение. А Маск любит такое.
Для агентных пайплайнов интереснее проверить не заявленную эффективность, а реальный расход токенов на своих задачах, а не на чужих графиках.
Однозначно покупка Cursor пошла напользу, вполне возможно, что именно их наработки и легли в основу новой модели.
#AI #Grok #Cursor
👍16👎7
Для тех кто любит рефлексировать теперь в Claude можно получить рекап за продеший месяц/квартал/полугодие/год
Переходите https://claude.ai/new#settings/reflect и делитесь результатами в комментариях
UPD Это касается только чатов а не сессия кода 😂
#Claude
Переходите https://claude.ai/new#settings/reflect и делитесь результатами в комментариях
UPD Это касается только чатов а не сессия кода 😂
#Claude
👍8👎5
Да заееее.... Meta выпустила модель для кодинга, которая на уровне Opus 4.8 и GPT 5.5. Мир AI притормози, дай перевести дух и адекватные цены за токены
👍12👎5
😂 Caveman обещал -65% токенов агенту. JetBrains проверили — вышло в разы меньше
Популярный скилл Caveman заставляет агента отвечать в стиле "мало слов, много дело", код и команды не трогает. JetBrains прогнали его на реальных тестах с Claude Code:
😂 уменьшения потребления output токенов с 592k до 542k, то есть -8.5% и совсем далеко от заявленных цифр
👍 качество остается на том же уровне
💰 выигрыша по стоимости нету: в теории должна была падать на ~10%, но один таск перевалил за 200k-контекст и по итогу счет на $8.29
65% в рекламе Caveman честные только для чатов. В агенте токены — это код, диффы и вызовы тулов, а не болтовня между ними, их скилл и не трогает.
#AI #ClaudeCode
Популярный скилл Caveman заставляет агента отвечать в стиле "мало слов, много дело", код и команды не трогает. JetBrains прогнали его на реальных тестах с Claude Code:
😂 уменьшения потребления output токенов с 592k до 542k, то есть -8.5% и совсем далеко от заявленных цифр
👍 качество остается на том же уровне
💰 выигрыша по стоимости нету: в теории должна была падать на ~10%, но один таск перевалил за 200k-контекст и по итогу счет на $8.29
65% в рекламе Caveman честные только для чатов. В агенте токены — это код, диффы и вызовы тулов, а не болтовня между ними, их скилл и не трогает.
#AI #ClaudeCode
👍15👎6
checkup — самопроверка и уборка конфигурацииБорис Черны анонсировал команду, которая за один прогон делает то, что раньше руками: чистит неиспользуемые скиллы, MCP и плагины (экономит контекст), убирает дубли между локальным и закоммиченным
CLAUDE.md, режет разросшийся корневой CLAUDE.md на вложенные файлы + скиллы, отключает медленные хуки, обновляет сам Claude Code, включает auto mode по умолчанию и заранее одобряет read-only команды, которые вы обычно отклоняете вручную.В официальных release notes подтверждено:
/doctor стал полноценным чекапом окружения с автофиксом, /checkup — его алиас.‼️ ВАЖНО: пункты про auto mode и pre-approve команд — это не просто уборка, а изменение доверительных настроек сессии. Команда спрашивает подтверждение перед каждым шагом, но именно эти два пункта стоит прогонять осознанно, а не жать
y на автомате.Разросшийся
CLAUDE.md и забытые MCP-серверы — знакомая боль всем, кто держит Claude Code в проекте месяцами. Здесь я, честно, буду смотреть на предложенные правки руками: авточистка конфигурации это не автопамять агента, ошибка тут стоит дороже, чем забытый факт.#ClaudeCode #AIDev
Please open Telegram to view this post
VIEW IN TELEGRAM
👍8👎6
Claude AI Dev Broadcast
😂 Caveman обещал -65% токенов агенту. JetBrains проверили — вышло в разы меньше Популярный скилл Caveman заставляет агента отвечать в стиле "мало слов, много дело", код и команды не трогает. JetBrains прогнали его на реальных тестах с Claude Code: 😂 уменьшения…
GitHub
GitHub - rtk-ai/rtk: CLI proxy that reduces LLM token consumption by 60-90% on common dev commands. Single Rust binary, zero dependencies
CLI proxy that reduces LLM token consumption by 60-90% on common dev commands. Single Rust binary, zero dependencies - rtk-ai/rtk
Кстати, раз зашла речь про фильтрацию вывода для агентов — есть еще одно популярное решение, RTK. CLI-прокси на Rust перехватывает Bash-вызовы агента и переписывает
От него я отказался быстро, и вот почему. На синтетических тестах все работает красиво:
Если он срезал важное, агент это чувствует и обходит: либо дергает исходную команду напрямую (Read/Grep/Glob у Claude Code вообще не проходят через Bash-хук, RTK их даже не видит), либо перевызывает с дополнительными флагами, чтобы дотащить недостающий контекст. В итоге токенов уходит больше, чем без фильтра вообще ⚠️
Можно форсить жестче, есть режим
Идея правильная, но фильтровать вывод нужно с обратной связью от задачи, а не по статичным правилам для команд. Поэтому пока пользуюсь Context Mode. Там агент сам решает, что убрать в песочницу, а не теряет данные вслепую на входе.
#AI #ClaudeCode
git status, cargo test, grep и еще сотню команд в компактные версии, обещая экономить 60–90% токенов.От него я отказался быстро, и вот почему. На синтетических тестах все работает красиво:
git push в 15 строк превращается в ok main, тесты показывают только фейлы. Но RTK режет вывод по жестким правилам для команд, без понимания того, что агенту реально нужно для конкретной задачи.Если он срезал важное, агент это чувствует и обходит: либо дергает исходную команду напрямую (Read/Grep/Glob у Claude Code вообще не проходят через Bash-хук, RTK их даже не видит), либо перевызывает с дополнительными флагами, чтобы дотащить недостающий контекст. В итоге токенов уходит больше, чем без фильтра вообще ⚠️
Можно форсить жестче, есть режим
-l aggressive, который вообще режет тела функций, оставляя сигнатуры. Но тогда агент начинает реально хуже решать задачу. Обход или потеря качества, третьего не дано.Идея правильная, но фильтровать вывод нужно с обратной связью от задачи, а не по статичным правилам для команд. Поэтому пока пользуюсь Context Mode. Там агент сам решает, что убрать в песочницу, а не теряет данные вслепую на входе.
#AI #ClaudeCode
👍8👎5
🤯 GPT 5.6 раскрыл $HOME не туда и снёс файлы разработчика — живой пример, зачем нужен dcg
Мэтт Шумер (AI-инвестор, тестировавший GPT-5.6-Sol в Ultra-режиме по просьбе OpenAI) описал в X инцидент: ревью-субагент неправильно раскрыл
Это ровно тот паттерн, от которого защищают
Далее Шумер добавил, что теперь доверяет Fable «в 1000 раз больше». Тут я бы не смешивал: сам факап реален, а вот вывод «модель X лучше модели Y» на основании одного инцидента — это уже реакция на инцидент, а не сравнительный тест.
Если гоняете агентов с доступом к файловой системе локально — хук вроде dcg, бэкапы или лучше оба.
#AI #AIAgents #AIDev"
Мэтт Шумер (AI-инвестор, тестировавший GPT-5.6-Sol в Ultra-режиме по просьбе OpenAI) описал в X инцидент: ревью-субагент неправильно раскрыл
$HOME в команде очистки и выполнил rm -rf /Users/<user>. Процесс успели убить, но часть данных потеряна безвозвратно.Это ровно тот паттерн, от которого защищают
core.filesystem/core.git пакеты dcg: деструктивная команда прилетает от агента без единого запроса на подтверждение у человека.Далее Шумер добавил, что теперь доверяет Fable «в 1000 раз больше». Тут я бы не смешивал: сам факап реален, а вот вывод «модель X лучше модели Y» на основании одного инцидента — это уже реакция на инцидент, а не сравнительный тест.
Если гоняете агентов с доступом к файловой системе локально — хук вроде dcg, бэкапы или лучше оба.
#AI #AIAgents #AIDev"
👍6👎6
GitHub
GitHub - Dicklesworthstone/destructive_command_guard: The Destructive Command Guard (dcg) is for blocking dangerous git and shell…
The Destructive Command Guard (dcg) is for blocking dangerous git and shell commands from being executed by agents. - Dicklesworthstone/destructive_command_guard
Rust утилита перехватывает shell-команды агента (Claude Code, Codex CLI, Cursor, Gemini CLI и других) через хук
PreToolUse и блокирует выполнение команд вроде git reset --hard, rm -rf, DROP TABLE и подобных до запуска, а не после.Из коробки включены только пакеты
core.filesystem, core.git и system.disk — самые катастрофичные и невосстановимые. Всё остальное (Docker, Kubernetes, облака, базы данных, S3) — опционально, настраивается через конфиг:[packs]
enabled = ["database.postgresql", "containers.docker", "cloud.aws"]
Нюанс, о котором в README не кричат: дизайн fail-open. Если анализ команды не укладывается в таймаут или парсинг падает, поведение по умолчанию — пропустить команду, а не заблокировать. Это осознанный компромисс, чтобы хук не тормозил работу, но это не полноценный security-барьер, а именно страховка от типичных ошибок агентов.
Если вы работаете с Claude Code и хотите подстраховаться от
git reset --hard в 3 часа ночи, утилита устанавливается одной командой, но сразу включайте пакеты под свой стек, так как защита по умолчанию узкая.#AI #ClaudeCode #AIDev
Please open Telegram to view this post
VIEW IN TELEGRAM
👍11👎7
Claude AI Dev Broadcast
⚡️ SpaceXAI выпустила Grok 4.5 и это уже стоящий конкурент Claude Code с Sonnet/Opus Модель доступна уже сегодня в Grok Build, во всех тарифах Cursor и в консоли SpaceXAI. Цена: $2/млн входных токенов, $6/млн выходных — заметно дешевле Opus $5/$25 Главный…
😮 Так ли хорошо Grok 4.5 как про него говорит Маск?
Сразу после разбора сел с ним делать задачи и в целом он неплохо проявил себя. Решил дать не самую сложную, но и не самую простую задачу - миграция DI в многомодульном Android проекте. В целом справился, но без но не обошлось. Буду тестировать дальше и рассказывать про итоги.
🪙 Демо и мои впечатления в видео на Boosty
#AI #Grok #Android
Сразу после разбора сел с ним делать задачи и в целом он неплохо проявил себя. Решил дать не самую сложную, но и не самую простую задачу - миграция DI в многомодульном Android проекте. В целом справился, но без но не обошлось. Буду тестировать дальше и рассказывать про итоги.
#AI #Grok #Android
Please open Telegram to view this post
VIEW IN TELEGRAM
👍12👎6
Почему самая маленькая квантизированная модель оказалась медленнее — разбор на бенчмарках
Chris Merrick прогнал MobileNetV2 в трёх квантизациях (FP32/INT8/INT4) на Pixel 10. Результат - самая лёгкая по весу INT4 на CPU оказалась медленнее INT8. Вывод: размер файла не главный критерий быстродействия.
Полезно, если делаешь on-device inference и оптимизируешь модели под мобилки.
#AI #Android #OnDeviceAI
Chris Merrick прогнал MobileNetV2 в трёх квантизациях (FP32/INT8/INT4) на Pixel 10. Результат - самая лёгкая по весу INT4 на CPU оказалась медленнее INT8. Вывод: размер файла не главный критерий быстродействия.
Полезно, если делаешь on-device inference и оптимизируешь модели под мобилки.
#AI #Android #OnDeviceAI
👍6👎5