AI vs DevOps
138 subscribers
206 photos
1 video
119 links
DevOps и системная инженерия в эпоху AI. Новости индустрии. И немного юмора.
Download Telegram
Продуктивной недели, коллеги! 🙂
👍1
Ура, ребят! Наконец-то написал статью по Forward Deployed Engineering!🎉🎉🎉

Я проходил "Cursor FDE Bootcamp" почти месяц назад, в рамках партнерства нашей Exadel с Cursor. Это был почти четырех часовой вебинар с домашним практическим заданием, и это было жестко🤯 Обьем информации на буткемпе был максимально плотным. Я активно делал скрины слайдов, какие-то текстовые пометки, но вышел с вебинара с абсолютно пустой головой и ощущением, что "да, это было круто! но я ничего не запомнил"😅 После этого я расписал с аишкой основные топики и важные мысли по слайдам и моим заметкам, сделал memo на тему этого буткемпа, сделал домашнюю практику и все. Какие-то главные идеи стали понятны, но все доки ушли в ящик, с мыслями "точно пригодится в будущем". И только когда я стал писать саму статью я действительно смог для себя разложить все по полочкам и вынести очень много инсайтов, которые, вот уверен, реально пригодятся в работе.👍

Вобщем количество полезной информации зашкаливает, реально становится понятно, как правильно внедрять AI-native технологии в бизнес и в чем заключается работа FDE. Пока готова первая часть, на тему adoption, maturity, scaffolding. Вторую часть планирую через неделю. Там будет больше информации с воркшопов, с примерами как строится работа уже в реальных компаниях с реальными requirement/constraints.

Читайте статью в моем блоге. Так же там есть кнопочка скачать ее в PDF формате, чтобы сохранить у себя 🌡

Статья написана на RU, но постарался сохранить все важные термины на английском. Оставляйте свое мнение, нормальный ли это формат для понимания сложных технических статей, или все же лучше писать полностью на английском.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
AI vs DevOps pinned «Ура, ребят! Наконец-то написал статью по Forward Deployed Engineering!🎉🎉🎉 Я проходил "Cursor FDE Bootcamp" почти месяц назад, в рамках партнерства нашей Exadel с Cursor. Это был почти четырех часовой вебинар с домашним практическим заданием, и это было жестко🤯…»
В Zcode дали ресет пятичасовых лимитов, активен еще в ближайшие пол часа. Кто успел, тот и съел 🙂 Я сейчас гоняю на GLM-5.3 в 4 чатах все активные задачи какие есть 😁
Аукцион щедрости от Zcode, второй день подряд доступны бесплатные сбросы пятичасовых лимитов. Доступно еще два часа. Время тратить токены ;)
А вот и реальный конфирмейшн ⚠️. 0xAlpha - это все таки GLM. И учитывая то, что они отдают только на этой стелс модели по 100T токенов ежедневно - они явно тестируют новую мощную инфраструктуру.
Please open Telegram to view this post
VIEW IN TELEGRAM
У нас в компании ачивка, уже 100 Claude сертификатов (где-то 2/3 developers и треть на architect).
Классно, когда понимаешь что большинство коллег имеют в голове общий с тобой пласт знаний, и вы можете говорить на одном языке, когда дело касается AI-агентов. Это очень круто!
Тирлист от Theo. Один из челов, чьему опыту я максимально доверяю и с кем согласен. Кроме того, что я бы поставил GLM-5.3 вместе с Sol в группу A 😏
🤔1
Недавно небеизвестный автор "Clean Code" Дядя Боб Мартин давал интервью еще одному очень известному в кругах АИ кодинга инженеру, Matt Pocock.

Где рассказывал как он перешел от одного синхронного агента с чатиком, к своей собственной мультиагент системе для написания и тестирования кода. Суммаризируя:

* Specifier: It takes the plain-English story and turns it into a precise spec: the rules the feature must follow, plus a step-by-step checklist for testing it by hand.

* Coder: Builds the feature and writes the unit tests to go with it.

* Cleaner: Goes back over that code and simplifies the tangled, hard-to-follow parts.

* Hardener: It tries to break the tests on purpose, tweaking the code to confirm the tests would actually catch a real bug.

* QA: This turns the checklist into a script that drives the real app and confirms it behaves the way the story asked.

The power of context. Splitting tasks keeps the prompt short so the agent actually follows the rules. Each agent does its job and then resets. This keeps them laser-focused on one thing from start to finish.
The math checks out. One agent might finish in five minutes, but you can't trust the output. The full hour-long pipeline produces battle-tested code that would've taken a human half a day. While Martin still handles the high-level architecture and module design, the grunt work is now fully automated.


Очень интересный подход, вполне можно взять на вооружение и попробовать реализовать свой фреймворк. Конечно с грамотной hub-and-spoke архитектурой и агентами окрестратором и суммаризатором, детерминированными модулями для работы самого пайплайна вставленного в тулы, грамотным transient error handling, structured outputs, вобщем все по архитектурным бест практикам.

Решение от Дяди Боба моджно посмотреть и попробовать здесь. Я еще не смотрел) Но идея меня воодушевила, возможно я теперь даже знаю, какой мой будет следующий пет проект 😎 Заодно сделаю то что давно хотел, разберу изнанку и детали агента Pi - отличный кандидат для такой системы. 👍
Please open Telegram to view this post
VIEW IN TELEGRAM
Кстати если вы не пользуетесь Cursor (а кто им вообще пользуется в 2026?😅) в OpenCode Go и Zen буквально сейчас добавили Grok 4.6. Отличный вариант попробовать новую SOTA модель, она реально интересная. Мощная, быстрая, адекватно стоит. С такими темпами скоро "Большая тройка" - это будет OpenAI, Anthropic и X-Ai. Google протратил все полимеры 😆
Народ, а вот и официальный релиз подъехал! 0x Alpha это реально GLM-5.3-flash! Всего лишь 380B параметров, новая архитектура attention, независимые тесты для стелс-модели говорили, что била и Опусы и Fable.

Главное - это все крутится чисто на китайских чипах.🤯 Слухи о том, что эту стелс-модель запускали на каких-то новых штатовских дата-центрах и кто-то им помогал, оказались абсолютно противоположными. Вынос мозга просто, насколько Китай продвинулся в железе 😶‍🌫️

При стоимости всего 4 цента за задачу, это точно будет хит для ежедневной работы, подвинет даже DS Flash 💯🧩
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4
Zai офигеть как радуют ресетами в ZCode. Четвертый раз за неделю уже)
Zai опять радует фри токенами на выходные. Заклеймил, в балансе ни в приложении, ни в кабинете пока не вижу, буду смотреть что там как)
Сегодня прилетела новость, что OpenAI закрывает сотрудничество с Cursor. Для конечных пользователей, наверное, разницы никакой. Новый Grok это реально фронтир модель. Я так понимаю, все активные пользователи курсора только на нем сейчас и сидят.
Интересно, в чем причина? У Сама есть подозрение, что Маск использовал древние китайские техники под названием «дистилляция моделей» для тренировки последнего грока?😁
👍1
Tips and tricks дня. Если работаете с GLM - в большой модели ставьте Max, а во Flash - High.
У GLM 5.3 на Макс режиме точность и количество выводимых токенов поднимается равномерно. У Flash вы не получаете вообще никакого прироста в точности. Модель просто тратит гораздо больше токенов на Макс режиме.
👍2
300 лямов фри токенов для GLM 5.3 Flash - надо было придумать что с ними сделать. Какой-то новый пет пилить - что-то пока нет идей и настроя.
Решил по грамотному организовать youtube канал для малого, который много играет в Roblox и недавно решил себе завести канал (ну конечно вся эта ответственность ложится не на него, а на батю 😂)
Вобщем составил план развития канала на два месяца, моделька отлично почитала речь с facecam и скрины геймплея, основываясь на этом поняла что это за игры и сделала заголовки с описаниями и тегами. А так же сделала обложки для видосов, все по красоте - большие яркие шрифты, стилизованные скрины из игр, аватарка канала, все дела.

Ну и основной мой затык был, что эти видосы (facecam с телефона и геймлей screenrecording с планшета) приходилось вручную копировать, сортировать, потом клеить в CapCut. Процесс несложный и повторяемый, но скучный, поэтому всегда говорил "Ай, давай потом смонтируем. Ай, давай завтра". Аж самому все время было стыдно 🤷‍♂️
Вобщем Flash отлично справился с копированием и сортировкой, склейкой видео через ffmpeg (делает интро нужной длины по липсинку, накладывает стикеры с "привет" и "подпишись", выравнивает звук). Ну и дальше описание и cover. Отдельно создает шортсы, чуть всрато 😅, но для детского роблокс геймплея пойдет 😁
Под каждый этап сделал скилы, и сделал орекстратор скил "video-pipeline". Теперь по сути подключаешь телефон и планшет к лаптопу, запускаешь пайплайн с фразой какие видео обработать, на выходе получаешь полностью готовый материал в unpublished папках.
Сделал отдельный паблиш скил, который использует youtube uploader написаный на Rust с Oauth аутинтификацией, тестил сегодня вручную, дальше думаю его поставить в ZCode automations на запуск раз в сутки.

Вобщем получилось огонь, доволен собой 🌡😎 Осталось только придумать домашний NAS с вайфай доступом чтобы не париться с проводами и аплоадить прям с девайсов. Поставить video-pipeline в automations. Подключить к созданию covers и shorts степ с image gen моделькой, чтобы генерило какой нибудь красивый брейнрот 🤣, а не только нарезки из видео. Ну и сбор аналитики, какие-нибудь A/B по опианиям/каверам/частоте и времени паблиша. Получится полноценный детский контент завод)) 🧠😏

На все про все ушло около 100 лямов токенов. GLM 5.3 Flash - отличная модель для работы с графикой и видео, очень ей доволен 👍
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2🔥1
Продуктивного всем понедельника! Даже если он выходной ))
Terminal Bench и DevOps.

Я думаю многие слышали о Terminal Bench бенчмарке. Мне раньше казалось, что да, это наверное полезная характеристика, которая показывает как модель умеет обращаться с баш и питон скриптами в терминале, навигация, логи, поиск ошибок. Оказалось и да и нет. Бенч довольно большой, более 60 задач, и задачи максимально разнообразные. То есть да, это про то как агент умеет работать в консоли, но для решения абсолютно разных задач. И многие из них максимально девопсовые:

- Общий server orchestration
- Конфигурация и дебаг стримов в kafka
- Redis снапшоты и репликация
- Дебаг CICD пайплайнов
- Sandbox изоляция использую инструменты линукс ядра

Но конечено задачи есть и на совсем другие темы, например оптмизация Rust компилятора, или запустить qemu виртуалку и поставить на нее Windows XP 😁

Вобщем для эвалюейшена моделей для нашей работы стоит смотреть на что-то из SWE бенчей и на Terminal Bench. Актуальные версии - 3.0 и 4.0. Четвертая вышла на днях, полностью новых задач там нет, переработаны баги и проблемы прошлого бенча с большего, ну и пошли тестироваться новые модели. Прошлая версия 2.1 - уже наверное есть во всех обучающих датасетах, модели ее делают под 80+%, и уже совсем не показатель, стоит смотреть именно на 3 и 4.

На скрине видно, на сколько круто на новом TB4.0 отработала GLM 5.3, обогнав даже Sol. Прошлая GLM 5.2 версия вообще плелась где-то в хвосте, прирост качества у Zai ну очень крутой. Правда к этому тестированию (результаты появились в сети буквально вчера) есть вопросы. Народ в Твиттере негодует - ну не может Opus обогнать GPT 😂 (в X сейчас какой-то общий консенсунс, что Антропики сдулись, а OpenAI модели на голову выше🤔). И если мы посмотрим прошлый 3.0 - там Sol уверенно выступил по сравнению с моделями Антропик. Ну и странно, что все модели тестировали именно в Claude Code. При этом наверное очевидно, что именно для этого бенча харнес играет роль, так как модели нужно комфортно пользоваться тулами, на которых ее тренировали.🧠

Так что для более объективной оценки по новому бенчу ждем когда его прогонят в Codex для GPT моделей и надеюсь в ZCode для GLM.🌡 Про сам бенч можите почитать здесь.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1