AI vs DevOps
138 subscribers
206 photos
1 video
119 links
DevOps и системная инженерия в эпоху AI. Новости индустрии. И немного юмора.
Download Telegram
И вот она! GLM 5.3! Уже в OpenCode Go. Огромнейший прирост по всем бенчмаркам и реальный кандидат на лучшую open source модель. Вот за этот релиз я сегодня даже пивка выпью😅🍺, очень-очень рад 🔥😎🫰

Добавлю - модель на 743B параметров. Считай в 4 раза меньше Kimi 3 и в 10 раз меньше Fable. Но бенчмарки офигенные. Ребята сделали ставку на качественный посттренинг, как и DeepSeek. И результат заслуживает уважения.🔥 Также эта модель максимально заточена на cyber security. Теперь код-ревью реально выйдет на новый уровень 💯
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2
GLM 5.3 Evaluation ⚠️

Конечно же решил начать работать с новой GLM. На Zai подписке модель пока что слабо юзабельна. Задержки перед выполнением, медленно, иногда агент просто виснет и не продолжает работу. Ладно, все же день релиза, да и Lite план запросы явно не в приоритете. Запустил на OpenCode Go. Тут уже все идет без лагов и остановок. Но меня сразу насторожило, что модель на разных даже вроде не сложных промптах уходит в очень и очень длинные рассуждения😟. Совсем не как у 5.2. Что натолкнуло на мысль как о медленной скорости, так и на прожорливость в плане токенов.

Но догадки догадками, надо сделать нормальный эвалюейшн, хотя бы на одной серьезной задаче🌡. Решено сравнить с Grok 4.6. Задача - критическая ишуя найденная на код ревью Sol-ом, связанная с тем, как оркестратор в нашем софте управляет новым жизненным циклом k8s сендбоксов, в которых крутятся наши исполняемые агенты. Если не вдаваться в подробности и описать в одно предложение, то:

The Kubernetes runtime defines outcome labels, retention policies, orphan cleanup, and shutdown draining, but these features are not connected to the production supervisor lifecycle. Failed pods are deleted without retention, while supervisor crashes can leave active orphaned pods indefinitely.


Новая сессия в OpenCode, GLM 5.3 Max. В контексте AGENTS.md проекта и инфраструктуры, дизайн и тасклист спеки текущей фичи, ну и описания ишуи которую нужно пофиксить. После выполнения прогоняю еще раз Sol ревью уже чисто по фиксу, смотрю результат, все ресетаю, и запускаю с нуля с таким же контекстом в Cursor на Grok 4.6 Extra High.

GLM реально ну очень долго пидалит эту ишую. В меня аж закрадываются сомнения, что у модели на релизе есть какие-то проблемы. 🤷‍♂️ Но результат готов, +280/ -60 строк в 22 файлах. Время выполнения 25 минут. 5 миллионов токенов. Sol по этому результату находит 2 критических и 2 medium проблемы. Фикс есть, но не полный, надо дорабатывать. Думаю что все, GLM обосрался😭

Прогоняю все в Grok - и тут меня ждет удивление 🙂Результат получаем вот совсем такой же. Плюс минус те же строки и файлы. 14 минут скорость выполнения. Здесь конечно большое преимущество. 7 миллионов токенов потрачено! И все таки несмотря на долгий и муторный ризонинг у GLM на реальном потреблении токенов он не сильно сказался 🤗 Прогоняю через Sol - находит РОВНО те же самые 2 критикал и 2 медиум 😂 Проверил на отдельной новой сессии насколько эти находки актуальны, может Сол тупит? Но да, актуальны, требуют фикса, и GLM и новый Grok недоработали на одном и том же месте.

Вердикт - каких-то больших проблем у GLM нет. Модель работает, вполне на уровне других современных релизов. Продолжаю работу дальше, будем проверять как GLM 5.3 справляется с архитектурой и код ревью, а на следующей неделе будет большой тест на тему cybersecurity, буду проводить полный аудит нашего проекта. 👍
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4
Вобщем неделю времени и много нервов потратил на подготовку, но сам экзамен оказался не таким страшным) Хотя штук 5-8 вопросов были весьма спорные и трактовать их можно было по разному. Но, ура! Эта ачивка у меня! 👍 820/1000 при проходном 720.

В целом хочу сказать, что во время подготовки узнал много интересных паттернов и техник, которые можно будет использовать в реальной работе 😎
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4
Продуктивной рабочей недели, коллеги!
Никогда не говори никогда 😁 Еще недавно я писал, что OpenCode - это мой домик и я останусь тут жить 😆 А эти выходные я просидел все вечера в Zcode просто кайфуя от процесса. Вы видели вообще этот UX гений? Сайд панель удобно переключаемая между коммитами, дифами и btw чатом. Панель навигации в один клик между чатами и удобным деревом репы, чаты удобно разбиты на проекты. Настройка за пять минут с импортом всех скилов и агентов из opencode. А главное - работа с телефона в один скан qr-а, и вот ты уже продолжаешь проект с дивана. Это что вообще такое-то? 😍

Как вишенка - 150% лимитов на zai coding plan. Я пробовал zcode в бете и мне что-то не зашло, теперь же это просто удобнейший инструмент. Разве что размера моника лаптопа теперь маловато, в консольных тулах пофиг, а тут хочется побольше.
👍1
Я тут охренел. Gitlab MCP - 128 скилов, на минуточку... 🤯 Когда рекомендуемое идеальное количество скилов для агента в мультиагент системе, чтобы не падало качество из-за выбора - это 4-5. И я уже месяцы работал с таким мусорным контекстом, позор 🙈
Поставил последнюю версию glab, запустил glab skills install --global - проблема решена 🤗
Фух, пол недели инвестигейта и неделя работы в соло😎. И главное - оно работает 🤗 Вот такое точно не деплоим в пятницу 😉
Please open Telegram to view this post
VIEW IN TELEGRAM
Пришел доступ на early beta Cursor Origins - их замене гитхаба. Пока не увидел ничего революционного. Просто интеграция из гитхаба в их облако, обычный гит функционал, есть окошко спросить курсор про код, есть кнопочка automations которая интегрирует уже существующий automations workflows с гит ивентами, но мне кажется эта интеграция и так работала с гитхабом. В письме пишут, что аи-нейтив фичи выкатят позже. Ну посмотрим, пока шляпа какая-то 😏
Хотя если корпорат работает с Курсором очень плотно (типа Епама?)), и все на проекте сидят только в этой ide и активно используют automations - может и есть смысл переезжать, хз.🤔
Вот мне тоже кажется, что в построении мультиагентных систем (с лупами, графами, или без них) лично для себя - профита мало. Мое мнение (как голого теоретика 😅) в том, что от этих систем есть смысл если:
- Ты работаешь с большими массивами данных, поэтому на одном агенте есть деградация контекста, и нужны мультиагенты.
- Ты работаешь с реальной прод системой под нагрузкой, где нужна точность. Поэтому у каждого мультиагента своя четкая небольшая роль, свой минимальный набор в 4-5 инструментов, вывод по json схеме в structured output, у координатора правильная обработка transient и validation errors.
- Ты работаешь с реальной прод системой под нагрузкой, где нужна скорость и цена - распаралеливаем задачи на дешевых быстрых агентов работающих одновременно.

Для большинства же личных рабочих задач хватает обычного харнеса в клодкоде/кодексе/опенкоде. Но для опыта мультиагентов собрать конечно интересно: набить руку, набить шишки, понять как подобные системы строятся и тестируются.
Я тут писал давненько про краткий гайд по вебдизайну. Делаю сейчас презентаху, скачал рекомендуемый там скил для вебдизайна Taste. И мне кажется вообще огонь получились слайды, совсем не дизайн слоп (как например в моем блоге с лонгридами😅, вот это реально слоп и давно надо бы переделать..)
Вобщем к чему я? Хороший скил, берите на заметку, там 13 штук их в репе под разные задачи и стили.
🔥1
GLM-5.3 теперь доступна по API. Цена такая же как и на прошлую 5.2 модель.