AI vs DevOps
142 subscribers
212 photos
1 video
120 links
DevOps и системная инженерия в эпоху AI. Новости индустрии. И немного юмора.
Download Telegram
Channel name was changed to «AI Versus..»
Я уже писал про Spec Driven Development и про Cursor commands , а теперь у нас топовый по популярности на сегодня репозиторий на Github - Claude Superpowers с 22к ⭐️. По сути это набор скилов и команд ля Claude Code, который так же нативно интегрируется в OpenCode и Codex.

Брейнштормим дизайн, создаем имплементейшн план, разбиваем на таски, выполняем и тестируем все последовательно (есть нативная поддержка TDD, или обычный execute по таскам).

Со своей стороны попробую интегрировать это в Cursor и потестить, задача не тривиальная, но тк Курсор уже тоже перешел на формат скилов как в Claude Code - может получится. Отпишу через несколько дней по результату :)

В целом радует что Spec Driven Development развивается и становится популярным. Как я и говорил - это одна из лучших методик AI разработки на сегодняшний день.

Забираем здесь:
https://github.com/obra/superpowers
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3
Channel name was changed to «AI vs DevOps»
Продуктивной рабочей недели, коллеги! Поменьше багов и галлюцинаций, пусть решения генерятся в one-shot 😎
❤1
А вот интересная заметка. Vercel эксперементировали со своим внутренним агентом для работы с корпоративными данными. По сути агент ходит в их агрегатор внутренних документов и достает нужные данные через sql>api транслятор. Так вот изначально у них были сложные системные промпты, и все было обмазано тулами и mcp. Иногда это работало, иногда нет. Траблшутинг такой системы конечно был сложным.

Эксперемент был гениален. А давайте вместо пачки модных тулов и плагинов дадим агенту только bash. Да, старый добрый cat, grep, ls 🙂 Итог - среднее время выполнения упало с 4 минут до 1й, на треть меньше потрбеление токенов и точность +20%! У современных моделей достаточно большой контекст и они достаточно умные, чтобы находить данные за несколько итераций самостоятельно. А mcp и объемные тулы и плагины могут только вредить, засчет забивания контекстного окна мусором, и конечно сложнее в поддержке и траблшутинге.

Отсюда вывод: разрабатывая AI workflows начинайте с простого, минимальный промпт, базовые инструменты. Не стоит сразу брать десятки плагинов, которые у всех на хайпе.

PS: кстати Anthropic недавно сами выпустили агент плагин для итеративной разработки, который представляет из себя простой while..true луп 😁 Погуглите "Ralph wiggum plugin". Spec Driven Development под угрозой? 😅

Статья про Vercel:
https://thenewstack.io/the-key-to-agentic-success-let-unix-bash-lead-the-way/
2024 - мы с сомнением загружали куски кода в АИ веб чаты. Плевались от галлюцинаций и удивлялись хорошему результату.

Начало 2025 - пользовались автокомплитом и стыдливо удаляли эмодзи из выдачи Клода, чтобы код был не похож на АИ

Конец 2025 - несколько AI IDE, десятки моделей, MCP и плагинов. AI pr-ы и ревью

2026 - будем специально ставить в код вотермарки каким инструментом и какой моделью (конечно, официально заапрувленой твоей компанией, ведь конфиденциальность данных, все дела..) написан код, потому что любой разработчик без АИ тулов не на 100% эффективен?
❤1
Z-ai сегодня запустили GLM-4.7-Flash. Быстрая 30B модель, отлично показавшая себя в кодинг бенчмарках (выше GPT-OSS 😄). Абсолютно бесплатно по API! 👍 Ну и модель опенсорс, веса доступны на Huggingface для локального инфиренса. Так же доступна версия 4.7-FlashX c приоритетным доступом и ценой в 0.07/0.4 за 1млн токенов. Что очень и очень мало.

Мне нравится большая GLM-4.7 в плане качества кода и текстов, которые она выдает. Реально похожа на модели Claude, и уровень точно не хуже Sonet 4. Но есть проблемы - очень медленно, переодически отваливается в процессе рассуждения и работы с интрументами, при длинной истории чата может начинать путаться. И с flash версией я улучшений не заметил. Может это только у меня в Cursor так? В любом случае - рекомендую вам ее потестить.
Со своей же стороны думаю закинуть на счет z.ai и проверить как обстоят дела со скоростью у FlashX.

Анонс здесь:
https://x.com/Zai_org/status/2013261304060866758
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3
⚰️ Grok в Курсоре - закончился. Уходит, субъективно, лучшая бесплатная модель бывавшая в этой IDE. C 23 января. Скорбим 😢
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1🤔1
Ну вот и все, ну вот и все
🦄3🌚1
Еще один суперпопулярный на сегодняшний день репозиторий. Большая взаимосвязанная подборка всего-всего для Claude Code. Агент рулы, скилы, команды, хуки. Это не community driven curated list, а личный набор инструментов от какого-то известного в узких кругах вайбкодера. Но почти 15к ⭐️, надо же глянуть.

На первый взгляд много вкусовщины, в плане рулов для кодинг стиля, git workflow. Да и в целом все заточено на фулстек жабаскрипт. В кодинг стандартах напихал все подряд что и так модель знает. Команды типа план бессмысленны (просто запрос "спланируй это" справляется не хуже), а сode-review команда из моей статьи гораздо качественнее.

Но есть и интересные штуки!🌡
Забрал для себя команду /learn , когда ты говоришь агенту собрать данные по патерну решения сложной проблемы в этом чате и создать отдельный skill основываясь на этом кейсе. Получается как-бы автоматизированная база знаний по сложным кейсам конкретно в твоем домене/стеке.
Strategic compact хук - мне нравилась эта штука в Kiro, когда она предлагала сохранить и перенести контекст после объемных задач, но в курсоре так не работает. Добавил этот хук себе в Курсор, проверю.
security-review скил тоже неплох, в нем конечно больше секьюрити кода, а не инфраструктуры. Но список уязвимостей и их верификаий не плох, сделаю себе на его основе отдельную ревью команду. 😎

Вобщем смотрите изучайте , может тоже найдете для себя что-то интересное. А если вы работает с JS и используете Claude Code - можете смело загрузить весь комплект сразу 🙂
Please open Telegram to view this post
VIEW IN TELEGRAM
Ура, пятница!)
Хотите попробовать Claude Code, но не любите tmux и прочие терминальные интерфейсы? Оказывается Antropic не так давно выпустила официальный плагин для VSCode, который просто ставится с маркета, так же совместимый и с Cursor.

В плагине есть все базовые фичи, вызов команд через / , добавление в контекст файлов и строк через @, расширенный thinking режим, история чатов итд.
По соседней ссылке кстати есть инфа и про плагины для JetBrains IDE.

Читаем подробности здесь
❤1
Новость - свежак :) С сегодняшнего дня в Claude Code обычные to-do списки трансформируют в таски, заточенные на long running agents.
Хранятся в файловой системе, поддерживают сабтаски, шарятся для всех сабагентов. Шаринг происходит через переменную окружения перед запуском агента
❤2
Мгновенная карма 😂 Писал вот на днях, про потенциальные вотермарки в коде и проверку кода ентерпрайзами на предмет того, что сотрудники используют АИ инструменты.

И вот прямо сейчас Cursor ввел фичу по анализу метаданных в коде. Оказывается, когда ты работаешь с этим IDE, для всего кода уже создаются метки: были ли правки вручную, с автодополнением табом или правки внесены АИ (и какой моделью это делалось). Можно посмотреть и проанализировать кто, что и как на самом деле писал. Конечно пока только для enterprise пользователей.

Явно это не будет использоваться, чтобы сказать "ай-ай-ай, а код то не твой, а АИ написан!" Мы же не в РФ работаем 😄 Все таки компании делают корпоративные подписки на АИ IDE не для того чтобы запрещать пользоваться ими. А вот наоборот - вполне. Сейчас многие SWE компании оседлали волну АИ хайпа и максимально внедряют АИ во все процессы. А тут явные метрики, как сотрудники используют это в своей работе. Раньше просто была статистика, по частоте использования, но там человек мог и пет проекты пилить или на втором фултайме сидеть из этого же Курсора😏. А теперь все будет видно сразу с конкретными кусками кода в вашей код базе.

Ну и хорошее - можно будет самому смотреть какой кусок кода какой моделью сделан, и делать выводы по эффективности той или иной модели для вашего стека и домена. Прям потенциал для b2b-стартапа рисуется 😁

Подробности про фичу читайте здесь
Please open Telegram to view this post
VIEW IN TELEGRAM
Новая элита подоспела, меняем карты желаний 💅😄
❤1
А вот малоизвестная, но очень крутая находка с просторов гитхаба!✨

45 популярных техник для AI разработки.

От простых one-shot, chain-of-thoughts, reasoning=>action, до сложных вещей, как self refine, contextual compression, hybrid search. Примеры построения мультиагентных систем. RAG и reranking. Кеширование и кост оптимизация.
Это все на чистом питоне, без фреймворков поверх, с комментариями по коду. Так что легко можно трансформировать и в ваш ЯП.

И даже если вы прямо сейчас не разрабатываете AI продукт, все равно полезно посмотреть, чтобы понимать как сейчас можно и нужно работать с LLM 😉

Сохраняем в закладки 🤑
❤3
Бесплатная, но хорошая кодинг модель?
Mistral зарелизили свою новую модель Devstral2. 123B и 256к контекст, а так же 24B с тем же контекстом. Модель доступна бесплатно по апи, и уже есть в Cline и Kilo Code 👨‍💻

В рекламном релизе пишут про 72% swe-bench-verified, что вряд ли близко к реальности (ждём когда появится независимый тест на самом swe-bench😅), но есть график по сравнению одного и того же сета кодинг задач между новой моделью от Мистраль и Сонет 4.5. 21% задач лучше и 25% на том же уровне с Сонетом, на остальных 53% Сонет опередил. Ближе к правде 😄. Но все равно очень и очень хорошо.

Я давно обращаю внимание на Mistral. В далёком 2024 это был мой основной LLM чат) Потом они весьма отстали в плане кодинга и их модели обычно не входили в популярные AI IDE. Но все равно я например использую их мобильное приложение для голосового общения с LLM когда нахожусь в СНГ, где не работает Gemini. Для базовых вопросов удобно и быстро) Тем интереснее будет потестить их новую кодинг модель. Пишут результаты стелс тестов были отличные, будет круто если Мистраль займет свою нишу в АИ разработке. А 24B модель вполне может стать хорошим решением для работы в перелётах.

И да, вместе с моделями Мистраль выпустил и свой cli-agent! 🔥 Короче, обязательно к тесту!

Пресс релиз
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔1
Только сейчас заметил, предыдущий пресс релиз месячной давности 😅 Новость чуть стухла 😂 И то что за месяц в публичном пространстве никакого шума вокруг новой Мистраль не было, похоже говорит о том, что и модель и cli тула так себе...🙈 Но ладно, ради интереса все равно протестирую на днях 😎