AI vs DevOps
138 subscribers
206 photos
1 video
119 links
DevOps и системная инженерия в эпоху AI. Новости индустрии. И немного юмора.
Download Telegram
Дизайним cli, хорошо совместимые с ai-агентами. Вкратце:

* опции без интерактивного ввода (—no-input, —force, —yes итд)
* структурированный вывод (—json)
* error аутпут понятный для агента (какого аргумента не хватало, что делать) и подробный —help
* безопасные ретраи, идемпотентность, —dry-run, опасные изменения с отдельным confirm флагом
и т.д.

Читаем здесь
Продуктивного понедельника, коллеги 🙂
🦄3
На днях вышла GLM-5.1 oт Z-ai. По их внутреннему бенчу (решение кодинг задач внутри компании) почти догоняет последний Opus.

Но с GLM как всегда стоит упомянуть нюансы. GLM-5 реально хорошая модель. Но только у внешних провайдеров 😆 Я использую ее иногда на OpenRouter и OpenCode Go, для ревью кода или когда нужно свежее мнение для решения сложных задач (с которыми она реально справляется, правда для обычного использования для кодинга я все еще с Kimi K2.5, мне нравится ее скорость и стиль работы). Но именно на Z.ai coding plan GLM-5 вообще unsusable.🤷‍♂️ Во-первых тормоза (ждешь по минуте когда начнется вывод, как будто все запросы висят в queue прежде чем попасть на инфиренс), во-вторых на их кодинг плане она реально работает по другому. Один и тот же запрос в GLM-5 на openrouter и в zai coding plan выдавал упрощенные и иногда просто лоботомические ответы во втором случае. И проблему потверждали многие в дискорде, см скриншоты. Кто-то писал что треш наинчается после 100к контекста, кто-то что проблема с кешем, но факт остается фактом.

Но сейчас с выходом последней модели админы говорят что починили все проблемы со старыми (последний скрин). Детально я еще не проверял, но сегодня потестил GLM-5.1 для генерации вопросов для тех собесов. Пока впечатления хорошие, в тестовом ассесменте сгенеренным моим обычным Kimi и GLM-5.1, вторая уверенно сделала лучше. Будем тестить дальше 😎

В то что Zai решит все свои проблемы с инфрой я не верю 😅 но модель реально вырисовывается хорошая. И когда она появится у других провайдеров (к десятым числам апреля) - максимально рекомендую ее потестить 👍
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Update по GLM-5.1 - Глючное неюзабельное 💩 , когда контекст превышает 100к токенов. Не знаю, может это именно опенкод? в других ide не тестил. В opencode неюзабельно для реальной работы с крупными фичами. Продолжаю работать с Kimi и GLM5 от других провайдеров. Такие дела 😕

Кстати в этом месяце обещают файнтюн Kimi K2.6, а так же Moonshot сейчас активно работает над 3й моделью, которая по размеру должна догнать GPT и Opus. Очень жду, LLM от Муншотов реально зе бест оф опенсорс.
Please open Telegram to view this post
VIEW IN TELEGRAM
4 дня ничего не писал в канал, потому что переезжал с семьей в Дананг, центральный Вьетнам. В этот раз решили обосноваться на долго, и все эти дни ушли на ежедневный максимально напряженный поиск жилья🤯. Поделюсь результатом, тогда что-ли 🎉

Симпатичный уютный garden house, 15 минут до центра Дананга. Умный дом, камеры, сантехника с датчиками, солнечные панели, гигабитный инетрнет просто летает. Цена - $850 в месяц, это 🔥🔥🔥
В целом в этой ценовой категории много жилья, но дома обычно в городе, вплотную к соседям со всех сторон, без видов за окном и темные внутри. Чтобы было много света, вид на природу, и все умные 📲штучки - это просто классная находка, я очень доволен 😎

Теперь буду переходить в привычный ритм жизни и чаще сюда писать интересные для вас штуки, на связи! 🌡
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤9
Если вы еще только начинаете работать с AI агентами и AI-IDE - вот хорошая статья как работать стоит, а каких ошибок надо избегать. Все кратко и по делу, рекомендую. 👍
PS: Там в конце реклама Mistral Vibe - не ведитесь, этот продукт ну сильно посредственный 😂

https://x.com/akshay_pachaar/status/2039326670797369346
Хорошая подборочка популярных АИ тулкитов. Агент фреймворки, MCP, скилы, автоматизация. Подборка качественная, есть как то что у всех на слуху, так и hidden gems, может что-то найдете интересное для себя 😉

Что еще нового?
* Qwen-3.6 недавно добавили бесплатно в OpenCode Zen. И сегодня уже убрали 😅 Не велика потеря, по отзывам модель не впечталяющая, GLM-5 выдает более качественные результаты.
* GLM-5.1 вышла в опенсорс на HuggingFace, и уже появилась в OpenCode Go подписке! Крутая обнова, тестируем, пользуемся 😎У других провадеров должна уже быть доступна тоже, максимально рекомендую 👍 (модель очень крута, но только не на подписке у ее создателей - Zai))
* Meta грозится скоро запустить большую модель Muse Spark. Конечно же в синтетических тестах максимально опережает и Opus 4.6 и GPT-5.4. Конечно же ничего удивительного, надо же показать куда ушли ярды денег на "супер команду АИ суперменов", которых переманил Цук. 😉Ождимаем красивые цифры на графиках. Реальных прорывов не ожидаем 😄Вот так скептично, да...
* Антропики везде пиарят Mythos. САМАЯ большая модель, САМАЯ опасная модель! Модель НЕ ДЛЯ ВСЕХ! Skynet на максималках, не подходи, убьет! От Антропиков уже такое скучно слушать, заезженая пластинка... 🙉 Шутки ради, был же когда и такой тейк:
OpenAI says its new model GPT-2 is too dangerous to release (2019)

😂😂
Но вообще Mythos конечно ждем, и рады, но не от всего сердца 😅
* Anysphere выпустили Cursor 3.0 Долой IDE, работаем только в чатике, слева вкладки с чатами, по ссылкам все таки можно открыть файлы с кодом для проверки (ну хоть на этом спасибо)). Я до 3й версии не обновляюсь, буду сидеть на 2.6 😄
* Яндекс GPT вошла в ТОП LLM arenа... Шучу блин, конечно же никуда и никогда они не вошли лол. Глупая шутка 🤣

На сегодня все, доброго вечерочка, коллеги 🍻
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2
AI vs DevOps
Update по GLM-5.1 - Глючное неюзабельное 💩 , когда контекст превышает 100к токенов. Не знаю, может это именно опенкод? в других ide не тестил. В opencode неюзабельно для реальной работы с крупными фичами. Продолжаю работать с Kimi и GLM5 от других провайдеров.…
Update по GLM-5.1 🤗

Езаю ее сейчас на OpenCode Go, и это реально крутая модель для сложных кодинг-тасков, технического анализа, ревью. Работает просто идеально.

Конечно, подороже, токены расходятся по подписке очень быстро, но модель реально крутая. Кстати, только сегодня прочитал, что по SWE Bench Pro она взяла цифры выше Opus 4.6 и GPT 5.4, но это Bench и просто цифры — мы все понимаем.. ))
🦄1
У нас в компании будет хакатон. Как же мне блять повезло попасть в команду с двумя пм-ами, один из которых ебать вайбкодер 😖
Побрейнштормили идеи. Решили делать корпоративного слак помошника, который собирает все файло с гуглдрайва проекта и может рассказывать людям про спринты, календарь, митинги, прочие доки. С моей стороны так же интеграция с гитлабом, для поста истории разработки за неделю, новые мердж реквесты итд.

Один пассажир просто молчит всю дорогу, но ладно. Сегодня пишу:
Давайте обсуждать архитектуру, вот мой пропоузал - микросервисы, separation of concerns, апка с ботом, апка thin api для вопросов/ответов, llm backend для обработки, redis между ними, и sync сервис для файлов с гугла. Будем использовать новую модную идею Андрюхи Карпатого с LLM Wiki. Синк сервис загружает все с драйва, бекенд в отдельном ране c помощью LLM переводит все в маркдаун текст, викифицурет, добавляет в индекс и оперейшнс лог. Дальше поиск по данным идет за миллисекунды, и без всякого RAG.

Тот который вайбкодер - да зачем архитектура? Я уже все написал вечером в прошлую пятницу 🤪
- ???? 🗿🗿🗿
- ну вот, смотри в слаке, бот общается отвечает на сообщения, я просто pydantic-ai заюзал и все, вот репо
- слушай, а как твой бот читает файлы хотя бы, вообще не вижу в коде
- ну он пока не может, но я сделаю
- говорю слушай, по архитектуре нам нужен готовый агент фреймворк, чтобы все тулы работали из коробки, чтобы нам не надо было писать с нуля и дебажить все тул взаимодействия. чтобы легко добавлять mcp, скилы...
Вот как скил добавить у тебя?
- Эм, добавить нельзя, надо кодить. Но ты можешь сказать боту "создай скил" и он сам создаст
- Ебать 🗿🗿 Слушай, скил для чтения пдф официальный от комьюнти, там туева хуча питон скриптов, он проверенный и протестированный. В моем случае мы используем верифицированные рабочие скилы...
- Да ладно, можно просто попросить создать все, прямо в чате.
- Блять 🗿🗿 у тебя там монолит. в одной апе и слак бот, и ллм запросы, и работа с гуглом. И supabase... Как это скейлится вообще?? Зачем база вообще??
- Ты не понимаешь, supabase офигенная тема, все используют. Вот опус мне говорит что на 5-10 чатов нормально скейлится, по 3 секунды на запрос к гуглу. ну 50 чатов уже сложнее будет. Но мне кажется охуенный вариант, уже все готово, зачем что-то писать теперь с нуля? Давай составим список за-против чем мое решение хорошее или плохое? И вообще зачем LLM Wiki, я штуку как у Карпатого придумал за месяц до него, вот смотри, json индекс файл называется

- Бляяяяяяя...... 🤦‍♂️🤦‍♂️🤦‍♂️

=======================
Короче охуел я знатно. Решили что каждый разработает свое решение и проведем A/B тесты... Пожелайте удачи 🥹

...А третий пассажир так и молчит 🫥
❤4🗿4🌚1
Хочу порекомендовать классную тулу для OpenCode: Dynamic Context Pruning.
Автоматическое сжатие контекста сессий для опенкода, выполненное как плагин. Подобные проекты часто реализуются как прокси между IDE и LLM провайдером, что требует более сложной настройки как самого прокси так и своих IDE, чтобы отправлять через них трафик. Здесь же это просто плагин, который добавляется в опенкод одной командой, и мы получаем скил который агент использует самостоятельно, каждый раз когда видит что контекстное окно начинает забиваться.
Принцип действия - суммаризация аутпута моделей в менее важной истории диалога. Похоже на обычный /compaction, но не всего диалога, а только тех учасков которые модель выбирает сама. Так же есть дедупликация вывода тулов для одинаковых кусков аутпута, чистка мусора из сообщений об ошибках (когда оставляется только причина ошибки, но не весь стактрейс).

Использую уже несколько дней, и пока доволен. Моментов чтобы модель начинала тупеть и тупить, потому что пропал какой-то важный кусок контекста пока не замечено. Сжимает данные реально хорошо, за проход из скажем 50-60% остается 30. Раньше за день работы над какой-то фичей приходилось раза 3 вручную запускать компакт где-то на 60-70% контекста, и копировать руками саммари в новую сессию, начиная новый чат. Сейчас же все стабильно держится на приемлимых для работы цифрах. Вот пример статсов с одной моей сегодняшней сессии:

╭───────────────────────────────────────────────────────────╮
│ DCP Context Analysis │
╰───────────────────────────────────────────────────────────╯
Session Context Breakdown:
────────────────────────────────────────────────────────────
System 34.2% │██████████ │ 43.5K tokens
User 5.3% │▓▓ │ 6.8K tokens
Assistant 13.0% │▒▒▒▒ │ 16.5K tokens
Tools (132) 47.6% │░░░░░░░░░░░░░░ │ 60.6K tokens
────────────────────────────────────────────────────────────
Summary:
Pruned: 190 tools, 149 messages (~157.2K tokens)
Current context: ~127.4K tokens
Without DCP: ~284.6K tokens


Вобщем если вы OpenCode heavy user - максимально рекомендую 🌡
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4
🌚3
У нас в компании участникам хакатона раздали корпоративные ChatGPT аки без лимитов. Я давно не использовал модели "большой тройки", так что сразу же зарядил аккаунт в OpenCode и пошел тестить GPT 5.4 Xhigh. И... сказать честно разочарован. 🤔
Во-первых на его ризонинг больно смотреть 😂 как он сомневается каждый раз готовя ответ и додумывая а может надо что-то сделать еще?

Во-вторых мне совсем не нравится стилистика его речи в аутпутах: все очень односложно, информация неудобно структурированна для чтения и восприятия. В дизайне фич - склонен оверинжинирить, из разряда а давай вообще перепишим весь апи контракт аи бекенда, добавив туда штук пять новых полей, вместо того чтобы просто передавать запрос с сервиса в промте. В остальном нуу, не предлагает ничего более инновационного чем GLM, GLM даже местами более интересные фичи подсказывал.
Я конечно еще не смотрел на написания кода, но код по спеке любая модель пишет, и Kimi и GLM, да даже минимакс может написать сносно, если спека хорошая и с примерами алгоритмов и сложных моментов.

Так что даже не знаю как там люди с этими sota моделями живут и за что деньги платят.🤷‍♂️ Мне вот гэпэтой как-то даже не хочется пользоваться, даже не смотря на то что халява! 🙈

...На скрине ответ на вопрос по скейлу сервиса, на одном от GLM-5.1 на другом от ChatGPT