AI vs DevOps
138 subscribers
206 photos
1 video
119 links
DevOps и системная инженерия в эпоху AI. Новости индустрии. И немного юмора.
Download Telegram
Zai опять радует фри токенами на выходные. Заклеймил, в балансе ни в приложении, ни в кабинете пока не вижу, буду смотреть что там как)
Сегодня прилетела новость, что OpenAI закрывает сотрудничество с Cursor. Для конечных пользователей, наверное, разницы никакой. Новый Grok это реально фронтир модель. Я так понимаю, все активные пользователи курсора только на нем сейчас и сидят.
Интересно, в чем причина? У Сама есть подозрение, что Маск использовал древние китайские техники под названием «дистилляция моделей» для тренировки последнего грока?😁
👍1
Tips and tricks дня. Если работаете с GLM - в большой модели ставьте Max, а во Flash - High.
У GLM 5.3 на Макс режиме точность и количество выводимых токенов поднимается равномерно. У Flash вы не получаете вообще никакого прироста в точности. Модель просто тратит гораздо больше токенов на Макс режиме.
👍2
300 лямов фри токенов для GLM 5.3 Flash - надо было придумать что с ними сделать. Какой-то новый пет пилить - что-то пока нет идей и настроя.
Решил по грамотному организовать youtube канал для малого, который много играет в Roblox и недавно решил себе завести канал (ну конечно вся эта ответственность ложится не на него, а на батю 😂)
Вобщем составил план развития канала на два месяца, моделька отлично почитала речь с facecam и скрины геймплея, основываясь на этом поняла что это за игры и сделала заголовки с описаниями и тегами. А так же сделала обложки для видосов, все по красоте - большие яркие шрифты, стилизованные скрины из игр, аватарка канала, все дела.

Ну и основной мой затык был, что эти видосы (facecam с телефона и геймлей screenrecording с планшета) приходилось вручную копировать, сортировать, потом клеить в CapCut. Процесс несложный и повторяемый, но скучный, поэтому всегда говорил "Ай, давай потом смонтируем. Ай, давай завтра". Аж самому все время было стыдно 🤷‍♂️
Вобщем Flash отлично справился с копированием и сортировкой, склейкой видео через ffmpeg (делает интро нужной длины по липсинку, накладывает стикеры с "привет" и "подпишись", выравнивает звук). Ну и дальше описание и cover. Отдельно создает шортсы, чуть всрато 😅, но для детского роблокс геймплея пойдет 😁
Под каждый этап сделал скилы, и сделал орекстратор скил "video-pipeline". Теперь по сути подключаешь телефон и планшет к лаптопу, запускаешь пайплайн с фразой какие видео обработать, на выходе получаешь полностью готовый материал в unpublished папках.
Сделал отдельный паблиш скил, который использует youtube uploader написаный на Rust с Oauth аутинтификацией, тестил сегодня вручную, дальше думаю его поставить в ZCode automations на запуск раз в сутки.

Вобщем получилось огонь, доволен собой 🌡😎 Осталось только придумать домашний NAS с вайфай доступом чтобы не париться с проводами и аплоадить прям с девайсов. Поставить video-pipeline в automations. Подключить к созданию covers и shorts степ с image gen моделькой, чтобы генерило какой нибудь красивый брейнрот 🤣, а не только нарезки из видео. Ну и сбор аналитики, какие-нибудь A/B по опианиям/каверам/частоте и времени паблиша. Получится полноценный детский контент завод)) 🧠😏

На все про все ушло около 100 лямов токенов. GLM 5.3 Flash - отличная модель для работы с графикой и видео, очень ей доволен 👍
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2🔥1
Продуктивного всем понедельника! Даже если он выходной ))
Terminal Bench и DevOps.

Я думаю многие слышали о Terminal Bench бенчмарке. Мне раньше казалось, что да, это наверное полезная характеристика, которая показывает как модель умеет обращаться с баш и питон скриптами в терминале, навигация, логи, поиск ошибок. Оказалось и да и нет. Бенч довольно большой, более 60 задач, и задачи максимально разнообразные. То есть да, это про то как агент умеет работать в консоли, но для решения абсолютно разных задач. И многие из них максимально девопсовые:

- Общий server orchestration
- Конфигурация и дебаг стримов в kafka
- Redis снапшоты и репликация
- Дебаг CICD пайплайнов
- Sandbox изоляция использую инструменты линукс ядра

Но конечено задачи есть и на совсем другие темы, например оптмизация Rust компилятора, или запустить qemu виртуалку и поставить на нее Windows XP 😁

Вобщем для эвалюейшена моделей для нашей работы стоит смотреть на что-то из SWE бенчей и на Terminal Bench. Актуальные версии - 3.0 и 4.0. Четвертая вышла на днях, полностью новых задач там нет, переработаны баги и проблемы прошлого бенча с большего, ну и пошли тестироваться новые модели. Прошлая версия 2.1 - уже наверное есть во всех обучающих датасетах, модели ее делают под 80+%, и уже совсем не показатель, стоит смотреть именно на 3 и 4.

На скрине видно, на сколько круто на новом TB4.0 отработала GLM 5.3, обогнав даже Sol. Прошлая GLM 5.2 версия вообще плелась где-то в хвосте, прирост качества у Zai ну очень крутой. Правда к этому тестированию (результаты появились в сети буквально вчера) есть вопросы. Народ в Твиттере негодует - ну не может Opus обогнать GPT 😂 (в X сейчас какой-то общий консенсунс, что Антропики сдулись, а OpenAI модели на голову выше🤔). И если мы посмотрим прошлый 3.0 - там Sol уверенно выступил по сравнению с моделями Антропик. Ну и странно, что все модели тестировали именно в Claude Code. При этом наверное очевидно, что именно для этого бенча харнес играет роль, так как модели нужно комфортно пользоваться тулами, на которых ее тренировали.🧠

Так что для более объективной оценки по новому бенчу ждем когда его прогонят в Codex для GPT моделей и надеюсь в ZCode для GLM.🌡 Про сам бенч можите почитать здесь.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
У меня рабочая неделя начинается только сегодня, пора включаться 😁

И сразу несколько крутых советов от Google Sr. Staff engineer Lalit Maganti:

* Absorb problems, not requests. Treat daily meetings, chat threads and even conversations with colleagues as raw material. When a complaint overlaps something you own, ask what would actually solve it. Sometimes that means building something new, sometimes just pointing them to a feature they didn't know existed.

* Let problems accumulate. That doesn't mean building the second someone asks. Jumping on every loud request is how you ship features nobody uses. Wait until the same need shows up across teams, then act.

* Find the common shape. Don't just collect requests. Look for the problem hiding underneath. On his team, groups kept asking for pinned tracks, custom views, and zoom settings. Eventually it was clear they all wanted one thing: to personalize the UI around their workflow.

* Pressure-test before building. How far you commit should depend on how sure you are. Safe bets ship now, risky ones get a throwaway prototype to expose the flaws, and big bets earn RFCs and talks before any real work starts.


Не про DevOps и AI, но звучит как внятный фреймворк для многих решений 🙂 Оригинал статьи здесь
👍1
Мне нравится этот темп с ресетами, который задал OpenAI и Codex 😉
Please open Telegram to view this post
VIEW IN TELEGRAM
🦄1
Когда кодом и ресерчем занимается AI, коммуникация и подача информации становится очень важной. Вот небольшой гайд от инженеринг лида из Azure как писать апдейты, ноуты, ресерч саммари. Из важного:

The reframe. Akhmechet’s idea is simple: every update is evidence. Each one either builds or dents the case for whether you can be trusted to run the show. Done right, a status email builds your reputation, one message at a time. Here are the rules worth stealing:

* Headline first. If there’s no headline, there’s no update. You set the next headline before the work starts, then build toward it. 
* The busy genius. The best updates lead with a one-line TL;DR and a quick recap of the goal, assume your audience is sharp, time-poor, and remembers nothing.
* Worries out loud. You should include a section for risks and failures. People value honesty, so flagging problems early is actually a great way to build trust. 
* The radio voice. One calm, steady tone throughout will help you signal a steady hand even when things get messy.
Нашел тут крутой cli. Прикиньте, в 2026 и никакого АИ😁, чисто девопсосвая cli тула, я думал в эти годы аи хайпа такого уже не бывает, ан нет.

Тул реально классный, локальный запуск ваших Gitlab пайплайнов на официальных раннер имейджах, линтер, схемы пайплайнов для разных бранчей и тегов, запуск gitlab pages на локалхосте... Вобщем просто сделайте под эту кли Skill для вашего агента и поставьте для тестов и валидации любых изменений в ваши Gitlab пайплайны 👍
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔1
Вторая часть статьи на тему "Cursor FDE Bootcamp" уже готова🎉 Вас ждут суровые будни FDE инженера.

* Как выбрать правильный таргет для automation
* Работаем с метриками, success criteria, shutdown condition. Как понять что наш engagement успешен, и когда нет?
* Различные скоупы интеграций от обычных SDLC Automations до SDK и Agentic Platform

В этой статье гораздо больше живых примеров из реальных интеграций от инженеров Cursor, в стиле "было"-"стало". Но и стилистически гораздо больше скучной ентерпрайзной информации😅 То есть статья - не совсем занимательное чтиво на вечер. Но может быть реально очень полезной, если вы занимаетесь интеграцией AI систем в Enterpise контексте.

Вобщем откладывайте в закладки, пригодится! 🌡 Как всегда статью так же можете скачать в pdf формате, кнопка справа сверху.

Так же для подписчиков канала, если кому-то интересно - могу выслать в личку полный deck с Cursor тренинга, скрины которого я использовал в обоих статьях.
Please open Telegram to view this post
VIEW IN TELEGRAM
AI vs DevOps pinned «Вторая часть статьи на тему "Cursor FDE Bootcamp" уже готова🎉 Вас ждут суровые будни FDE инженера. * Как выбрать правильный таргет для automation * Работаем с метриками, success criteria, shutdown condition. Как понять что наш engagement успешен, и когда…»
Пока no comments 😳
Короткий recap постов в X на ближайшую неделю
А вот Zhipu дарит unlimited флэш в ZCode до 20 сентября. Хороший подгончик. Для меня, если честно, флэш закрывает сейчас почти всю работу, даже для какого-то планинга или архитектурного ресерча. Иногда забываю переключиться на большую модель и результат все равно хороший.
Попробую реально таким образом потестить Прыму Астру когда раскатят доступ по апи.

give Astra your session and project history across Claude, Codex, Hermes and any other agent you use

ask it to find:

> prompts you repeat across sessions
> manual steps that should become scripts or integrations
> repeatable workflows that should become skills
> corrections that belong in project instructions
> scheduled work that should become cron jobs
> files or steps where sessions repeatedly stop
Забавный момент :) Nvidia купила Huggingface за $12,930,300,000

Если перевести число 129303 в Unicode - то получим смайл логотип хагинфейса 🤗
А в если в Hex - то получим зелёный цвет лого Nvidia ))
🦄3🤔1