AI vs DevOps
141 subscribers
211 photos
1 video
120 links
DevOps и системная инженерия в эпоху AI. Новости индустрии. И немного юмора.
Download Telegram
Вчера был ровно год со дня появления термина "vibe-coding". А в нашей субкультуре уже есть полный набор архетипов. Кто вы?)
🌚2
Классный MCP сервер дающий вашему агенту доступ к дев тулам вашего локального браузера. Мастхев для фронтенд разработки, но и для devops-а отличная вещь. Продебажить фронт, проанализировать хедеры, найти инсайты по перфомансу.

Устанавливаем просто, как

"chrome-devtools": {
"type": "local",
"command": ["npx", "-y", "chrome-devtools-mcp@latest", "--no-usage-statistics"],
"enabled": true
}

выше пример для opencode, в курсоре ставим type: stdio и убираем enabled ключ.

Гитхаб проекта:
https://github.com/ChromeDevTools/chrome-devtools-mcp
❤2
Практически полностью перешел на OpenCode, Cursor использую как обычный vscode, только дифы посмотреть.😅 Сегодня с удивлением заметил, что opencode использует Exa Web Search как дефолтный серч тул. Это круто, Exa реально работает быстрее и надежнее обычного web-fetch. Но Exa - платный сервис, а в opencode реализована почему-то бесплатно, огонь 🌡

Ну и Kimi K2.5 - доступна бесплатно (правда иногда с рейт лимитами) через OpenCode Zen, крутейшая модель! Быстрая почти как gemini flash и реально очень умная. Сейчас на 1м месте в моем используемом списке моделей 😎
Please open Telegram to view this post
VIEW IN TELEGRAM
Интересная статья, как Google использует AI cli тулы в своей SRE команде.

Классный инсайт, что все flow прописаны у них в плейбуках, аналог /commands и skills в claude code, opencode итд. Если случается инцидент, они запускают отдельную команду, по которой аи достает метрики, трейсы и логи из observability систем, анализирует их и предлагает какую следующую команду стоит запустить, например на рестарт пода, сервера, ролбэк ит.д. Для каждой команды есть прописанная степень риска для энвайронмента (в стиле safe, revertable, critical), чтобы инженер мог оценить этот риск.
Дальше есть отдельный слой policy enforcement, который может запретить выполнение каких-либо опасных команд (например глобальные рестарты во время пика трафика, или если изменение требует апрува нескольких человек). Здесь кстати тоже важен human-in-the-loop. Например можно представить что такая система будет запрещать рестарт серверов во время выкатки глобального релиза, чтобы не спровоцировать каскадных падений. Тогда явно инженер должен связаться с релиз командой, остановить rolling update, и после этого разблокировать систему на рестарт умершей ноды.
Так же все выполненные команды и ответы LLM сохраняются для аудита.

Еще интересный тейк - когда АИ допустим рестартует под, то сразу проверяет его статус и скидывает в чат логи, чтобы инженер не переключал контекст и не шел ручками в консоль в нужный кластер смотреть состояние сам.

Дальше, когда основной инцедент решен, АИ очень удобен для составление постмортемов, агент сам закидывает туда нужные логи, трейсы, выполненнные действия, и если надо создает тикеты через MCP на дев команду для последующих фиксов поломанной логики в приложениях.

Отсюда можно сделать полезные выводы, для внедрения подобных подходов в своей компании:


* Используем предефайнд команды, максимально подробно расписывающие флоу и риски. Не просто говорим "иди в кубер через MCP и рестартани такой под", а отправляем весь флоу хоть на сотни строк одной командой из CLI. Набор таких команд для инженеров вполне может версионироваться в одном репозитории и обновляться при запуске TUI.
* Всегда нужен human-in-the-loop. АИ системы только анализируют и предалагают решения. Принимает решение - человек.
* Делаем логирование и аудит при запуске опрпеделенных команд, в дальнейшем это поможет получать фидбек если что-то пошло не так и развивать вашу платформу.
* Делаем отдельный policy enforcement слой, для защиты от непредвиденных случайностей.
* Интеграция с полезными MCP. Данные из обсервабилити систем, живые статусы и логи с кластеров. MCP конфигурации тоже могут храниться как код и менеджиться девопс командой.
* Постмортемы или экшен айтемы (тикеты в джире, слак нотификации) тоже можно автоматизировать подобным образом.

Статья:
https://cloud.google.com/blog/topics/developers-practitioners/how-google-sres-use-gemini-cli-to-solve-real-world-outages
❤2
Вышел Claude Opus 4.6. Без прорывов по бенчмаркам, но по большинству показателей чуть лучше 4.5. При этом цена осталась такой же (но есть режим максимального ризонинга, там цена за токены улетает в х2). В целом хороший релиз!
Из интересного - в Claud Code заодно добавили swarm mode, для автоматического запуска саб-агентов на задачах. Ждём когда эту фичу завезут в опенкод 😄
Давайте подробнее про новую модель от Antropic. Мы конечно все ждали новый Sonet: умный, шустрый и за пол цены Опуса💰. Но имеем, что имеем... Хотя модель безусловно интересная, все таки релиз от лидера по симпатиям кодеров на рынке 😁

И так, что же интересного в новой Claude Opus 4.6 ?

Первое - 1 млн токенов контекст. Это много (правда у Гугла в гемини про это было еще в начале 2024?🙂). В соцесетях люди восторгаются - можно засунуть всю код базу Laravel фреймворка в один запрос и Опус в ней разберется. Не совсем так. Эффективность моделей на большом контексте сильно снижается, для AI IDE рекомендуют делать compaction или начинать новую сессию даже после заполнения 50%, чтобы избежать галлюцинаций. А модели Антропик всегда славились слабой работой с большим контекстом. На втором скрине есть пример retrieval accuracy разных моделей для toon формата (помните что был прикол в стиле "зумеры переизобрели csv"?😆 так вот формат все еще живет и здравствует). Или история не про Клод, а про GPT, когда было много шума в сети о том что модель "отупела", а по факту умный роутинг просто переключал MAX модель, и она начинала галлюцинировать когда контекст сильно заполнялся. Вобщем не всегда (а даже чаще) большой контекст это хорошо. А в случае Opus 4.6 - это еще и дороже. +35% к прайсу, если будете использовать контекст выше 200к токенов 🤪
Вобщем выглядит так, что Antropic наконец натренил свою модель на более менее приемлемую работу с большим контекстом (см. скрин 3, это все же уже не Хайку в примере про Toon), и решил догнать Гугл в мерянии цифрами. Выкатив не самую нужную фичу за дорого 😄

Дальше цифры и бенчмарки. Модель по чуть чуть лучше предшественниках во многих бенчах. Есть например заметный прорыв в ARC AGI. Это специальный бенчмарк, который трудно решать AI моделям. Задачи на абстрактный и визуальный ризонинг и этих данных нет в трейн датасетах. Что-то похожее на задачки из тестов на IQ 🙂, см скриншот 4. Люди решают такое в 80% случаев, для LLM исторически были результаты в 10-30%, до выхода GPT-O3, которая сделала его на 90%. После этого авторы выпустили ARC AGI 2 (см. примеры задач на скрине 5), который на то время считался "невозможным для LLM моделей". До этого рекордсменом была модель Gemini DeepThink c 45% (Opus 4.5 на втором месте). И вот Opus 4.6 поставил новый рекорд с заметным отрывом, почти 70%. Реально круто) Хотя призовые с Arc Agi 2 конкурса Антропикам явно не нужны😅

Продолжение дальше 👇
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
Agentic capabilities. Opus 4.6 не превзошел своего предшественника по популярному агентик кодинг бенчу SWE-AGENT-VERIFIED. Но в целом показывает крутые результаты по автономной работе и координации. В свете этого Antropic выпустил мультиагентный режим в где Claude Code, когда основной агент может запускать пачку саб-агентов, распаралеливая задачи. На демо результаты впечатляющие. Например инженеры Антропик с этой фичей написали на Rust полноценный рабочий C компилятор для ядра Linux с нуля. 100к строк кода, 20.000 сессий, и $20.000 за токены 😁Я пока не совсем вижу преимущества мультиагентного кодинга. Это для CEO, которые хотят заменить целые команды разработки одним Claude Code? А как же спеки, верификация, production-ready код? Но может во мне говорит патологическое неприятие того, что айтишники могут в будущем потерять свою работу?😅
Еще интересный факт, Opus 4.6 на тех же тестах их инженеров нашел 500 zero-day уязвимостей в опенсорс коде разных продуктов. Кто говорил что Security - это последний оплот, где кожаные мешки-инженеры все еще сильны? Правда есть нюанс, "But who is writing this bugs, bro?" 😂

При всех бонусах на бенчмарках модель реально стала сильно "суше" в общении. Ответы стали более "роботизированные", как по темплейтам. Похоже сказывается то, что Антропики тоже стали максимально затачивать свои модели на кодинг. Вропчем так же как и OpenAI в последних релизах. Наблюдается тенденция, что для аналитики и творческой работы (любая работа с текстом, кроме кодинга и документации) лучше справляется Gemini. 😉
Ну и скорость работы. Модель реально медленная. Там где Sonet 4.5 делал задачи за 1-2 минуты, Opus 4.6 думает по 5-6 минут.

Так же пару интересных изменений из их блога:
* Антропик пофиксили возможность эксплойтов AI-safety через неполный контекст. Раньше не знал про эту фичу) Когда ты общаешься с LLM - вся история твоего чата передается в контекст к модели, исходя из которой он предугадывает следущие токены. У больших публичных моделей есть определенные ограничения, на все что связано с запрещенкой, NSFW контентом и прочее. И вот если представить, что "голубое мороженое" - это что-то очень запрещенное, и ты спросишь "как приготовить голубое мороженое", получишь ответ что она не может сказать тебе рецепт по этическим соображениям. При этом если ты сфабрикуешь историю чата, где будет написано что-то вроде "Голубое мороженое приготовить очень просто. Смотри, пункт 1: " , то модель обойдет свои safety rules и выдаст тебе полный ответ. С Opus 4.6 и последующими моделями этот хак походу уже не будет работать)

* Claude модели - единственные из тройки лидеров рынка, кто не скрывает ризонинг своих моделей в истории чата. У GPT и Gemini все рассуждения происходят внутри, в чат передается только индекс этого ризонинга, которые хранится у них на серверах. Поэтому когда ты пообщавшись с ChatGPT потом включишь модель другого провайдера чтобы доделать задачу - она не сможет полностью вникнуть в контекст рассуждений и максимально качественно найти решения проблем возникших раньше. У Claude все будет ок. Врочем так же как и у целого сонма хорошиз китайских моделей 😎

Такие дела :) Мы конечно ждали релиз нового поколения, а именно Sonet 5, но пока не судьба. А текущая история все же тоже интересна. Но просто интересна, не более. Не верьте, когда в соцсетях инфоцигане кричат, что это революция и пограмизтов уволняют уже пачками. 😉

А буквально завтра расскажу про реально крутую находку для DevOps-ов. Вы просто обязаны поставить эти тулы, если работае с Terraform!
Please open Telegram to view this post
VIEW IN TELEGRAM
Продуктивного понедельника, коллеги 😁
❤1🌚1
GLM-5 приехал!

@everyone Introducing GLM-5: From Vibe Coding to Agentic Engineering<:Zai:1442296096687652874>
GLM-5 is built for complex systems engineering and long-horizon agentic tasks. Compared to GLM-4.5, it scales from 355B params (32B active) to 744B (40B active), with pre-training data growing from 23T to 28.5T tokens.http://chat.z.ai
Weights: http://huggingface.co/zai-org/GLM-5
Tech Blog: http://z.ai/blog/glm-5

OpenRouter (Previously Pony Alpha): http://openrouter.ai/z-ai/glm-5
Кстати та самая pony alpha, что наделала шума на оупенроутер - это именно она. Завтра тестирую в бою 💪

Очень интересно, как она себя покажет. Было немного обидно, что из четверки больших моделей из Китая (Kimi K2.5, Minimax M2.1, QwenCoder-3, GLM-4.7) модель от zai все же была самая слабая. Последние пару недель использовал только Kimi (это прям лучший аналог Опус) и Minimax (это как gpt-5.2 - быстро, четко, идеально для дебагинга, но слабовато с креативом в сложных задачах).
Так что есть большие надежды, что 5й GLM сможет догнать Kimi как универсальная умная модель :)
Навайбкодил тут сегодня утром за полтора часа 😅
Когда работаешь на разных виртуалках, чуть напрягает, что на каждой новой машине у тебя голый серый энвайронмент, где ничего нет, и какие-то тулы нужно ставить с нуля. Сделал баш инсталятор, который просто запускаем через курл
curl -fsSL https://raw.githubusercontent.com/eugene-burachevskiy/remote-shell-setup/main/setup.sh | bash

Что делает?
* Ставит git, aws-cli, kubectl, helm, kubectx/kubens (легко переключаем контекст и неймспейсы), kubecolor (цветной аутптут для кубера), алиас k=kubecolor (удобно набирать k а не kubectl)
* Ставит opencode, чтобы легко было что-то дебажить на машине. Включаем Kimi или Minimax и погнали - работает бесплатно из коробки.
* Ставит мои кастомные опенкод команды про которые писал тут
* Делает красивый цветной шел 💅с отображением гит бранчей
* Можно поставить свою версию helm или kubectl в config/versions.conf
* Скипает тулы если уже стоят, идемпотентно редактирует bashrc, определяет ось и ставит все корректно для rpm или deb пакетных менеджеров.

Чтобы не запускать неизвестный код у себя на машинах - лучше сфоркнуть в свой личный гитхаб и запускать оттуда ;)

В будущем думаю дополнять эту репу удобными настройками, хуками и скилами для опенкода.

https://github.com/eugene-burachevskiy/remote-shell-setup
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2
Супер загруженая была неделя, но помню, что хотел рассказать про интересную девопс фичу для АИ кодинга.

Вобщем есть такой известгный в узких кругах "гуру терраформа" Антон Бабенко. Основной автор большой коллекции AWS терраформ модулей "terraform-aws-modules", которые раньше девопсы использовали просто везде, от стартапов до ентерпрайзов. Давно не следил за его судьбой и движухой в этом комьюнити, но недавно мне на глаза попался новый проект от Антона Бабенко, который походу тоже понемногу ушел в вайбкодинг 😆 И это - Terraform скил для Claude Code!

Почитал что там есть - и в целом все круто.🌡 Базовая информация по структуре построения энвов и модулей, стандарты по написанию кода, построения пайплайнов, написанию тестов для инпутов, использования прекомит хуков, статик и секьюрити сканеров, линтеров. Вобщем везде KISS и YAGNI, без всяких хипстерских тонн абстракций в виде git worktrees, tf workspaces, terragrunt/atmos и прочего. Действительно сильная база котора поможет вашему агенту писать качественный Terraform код.

В целом у меня уже пол года как есть мнение, что эпоха комьюнити терраформ модулей прошла. Терраформ модуль - это большой blackbox, к которому ты читаешь документацию и пробуешь его запустить в нужном тебе контексте передав какой-то набор переменных. Так как модули делают универсальными, чтобы они покрывали все возможные кейсы разных пользователей - обычно в них очень много сложного к восприятию кода и абстракций. Что-то сделать поверх базового варианта использования и поддерживать дальше самому - трудозатрано. А сейчас с развитием LLM моделей чем использовать эти огромные черные ящики, реально становится быстрее, проще и дешевле написать минималистичный модуль самому. Только под свои кейсы и только с понятным тебе функционалом.
И вот подобный LLM Skill реально в этом помогает.

Забираем и пользуемся здесь. Написано под Claude Code, но можно попросить ллмку поменять текст под универсальный формат своместимый с opencode/cursor (по сути несколько референсов там поменять всего).

Кстати еще одна вещь упоминаемая в тексте этого скила - terraform mcp. Официальный MCP для Terraform - его релиз прошел мимо меня, так как я прочитал что там по сути только управление хашикорп клаудом и прочими их платными штуками. Но оказывается он еще может доставать актуальную документацию по терраформ провайдерам! Так что тоже можете смело себе ставить, для работы с терраформом это наверное будет надежнее и точнее, чем Context7.
Please open Telegram to view this post
VIEW IN TELEGRAM
Дайджест интересного в AI кодинге за неделю:

1. GLM-5. Пока доступна только для Pro подписчиков, и на сторонних сервисах типа openrouter или ollama при оплате за токены. Zai набрал годовых подписчиков на дешевые тарифы чтобы бустануть свой ARR, а с инфраструктурой не справляется 😭 4.7 еще выкатывали на всех, а с 5й версией ждем, и надеюсь что когда нибудь дождемся и на обычных кодинг планах.😅 Люди в тредс кто ее уже попробовал - писали что модель реально топовая, и даже круче Опуса. Это очень интересное заявление.

2. Вышла MiniMax 2.5. Бенчмарки на скрине. По цифрам приближается к SOTA в агент кодинге. И уже доступна бесплатно в OpenCode Zen!😎 MiniMax и в 2.1 была хороша, четко следует инструкциям и могла по пол часа и по часу гонять инструменты и дебажить разные кейсы. Но с креативным решением задач у нее было сложновато. Реально похожа на GPT-5.2 в этом плане)) Но например Kimi K2.5 что не говори умнее... MiniMax 2.5 я погонял сегодня, почти час решала одну мою проблему с ингрессами и роутингами. По стилю я не заметил изменений, все тот же честный трудяга 😁 Показалось, что наверное реже стала впадать в тупняки, а честно перепробовала все возможные варианты, и в конце выдала что при текущих условиях проблема не решаемая, вот альтернативы, вот документация почему не работает и что можно сделать. С 2.1 часто ее останавливал и говорил в какую сторону двигаться дальше, с 2.5 вроде вмешиваться приходится реже. Огонь🔥, буду работать с ней дальше.

3. Kimi K2.5 - самая умная модель из Китайской Большой Четверки, реально умнее Сонета 4.5, хоть это и не новое поколение 2026 года. И вот на нее ввели жесткие лимиты в OpenCode Zen. Раньше можно было гонять сколько угодно, лишь иногда отваливаясь по общим рейт лимитам. С сегодняшнего дня стало явно писать "у вас закончились лимиты на эту модель, кладите на счет деньги!" 😅 и довольно быстро. Но модель стоит того, чтобы платить за нее по токенам на openrouter, зуб даю 😉

Итого на сегодняшний день мой сетап такой - MiniMax 2.1-2.5 рабочая лошадка для большинства задач с траблшутингом и дебагингом и быстрых изменений кода, которые я могу задать явно. Kimi K2.5 - планирование, архитектурные решения, сложные фиксы в коде. GLM-4.7 - почти уже не использую 🤷‍♂️ Документация? Иногда для нее просто забываешь переключать модель. Задачи по аналитике, текстам - по привычке отдаю Gemini Flash/Pro 3, глм бы тоже справилась, но субъективно Гемини с текстами работает все же лучше.

Такие дела... Happy Friday и хороших выходных, коллеги! 👍🎉
Please open Telegram to view this post
VIEW IN TELEGRAM
Что нового и интересного к текущему понедельнику?

* Moonshot запустил KimiClaw. Облачный OpenClaw который запускается прямо у вас в браузере. Пишут про 5000+ скилов, 40гб облачной хранилки, интеграцию в телегу, возможность конектить свои существующие инстансы openclaw. Я не пробовал, как-то нет fomo на эту автоматизацию)), но на hackernews говорят что по факту нужна подписка от 40$ в мес минимум. Если что, пробуем здесь: https://www.kimi.com/bot

* Зарелизили Cline Cli 2.0 Пишут про полностью новый UX, мультиагентов, headless запуск, поддержку ACP чтобы интегрировать в какой нибудь neovim. Не знаю зачем вам это, если это все уже давно есть в OpenCode, но все же 🙂

* Гугл запускает раннюю превью WebMCP Новый стандарт, который позволяет вебсайт девелоперам создать специальный функционал для аи-агентов в виде MCP-like тулов. Типа ставим в свой опенкод mcp от трип ком, и отправляем мониторить авиабилеты по хорошей цене и с удобным пересадками прямо из консоли)) Звучит круто, как единый стандарт это реально может бустануть качество и упростить сложность разработки персональных аи агентов.

Такие дела) Позитвной и продуктивной рабочей недели, коллеги 🙌
Вышел Cursor 2.5. Главное нововведение - добавили маректплейс плагинов. Пока их немного, но самая основа. Slack, Figma, Notion. Есть тот самый Superpowers, адаптированный под курсор, теперь можно попробовать и в этой IDE ;) Еще мне понравился "Cursor team kit", плагин который использует команда разработки курсора для ежедневной работы, нарежу наверное самое интересное в виде команд себе в OpenCode 😏

А еще мультиагентов сделали наконец нормально - в фоне и асинхронно.

https://cursor.com/changelog/2-5
AI vs DevOps
Вышел Cursor 2.5. Главное нововведение - добавили маректплейс плагинов. Пока их немного, но самая основа. Slack, Figma, Notion. Есть тот самый Superpowers, адаптированный под курсор, теперь можно попробовать и в этой IDE ;) Еще мне понравился "Cursor team…
Taalas представили АИшный ASIC. Стартап на 24 инженера с 30М инвестиций - и у них готов рабочий прототип с весами модели запечеными в чип за несколько месяцев. Внутри LLAma 3.1 8B, на живых тестах выдает фантастические результаты по скорости, чуть ли не в 10 раз быстрее чипов Cerebras. Так же есть поддержка LORA адаптеров для "дообучения модели" на своих данных. И это все будет стоить в иксы раз дешевле, чем 10ки К зелени за простую H200 карту.
Выглядит очень круто, прям вижу будущее, где будем покупать себе домашние асики с той или иной OSS моделью) К концу года Taalas обещают запечь в кремний и большую sota модель, очень жду)
🦄1