Terminal Bench и DevOps.
Я думаю многие слышали о Terminal Bench бенчмарке. Мне раньше казалось, что да, это наверное полезная характеристика, которая показывает как модель умеет обращаться с баш и питон скриптами в терминале, навигация, логи, поиск ошибок. Оказалось и да и нет. Бенч довольно большой, более 60 задач, и задачи максимально разнообразные. То есть да, это про то как агент умеет работать в консоли, но для решения абсолютно разных задач. И многие из них максимально девопсовые:
- Общий server orchestration
- Конфигурация и дебаг стримов в kafka
- Redis снапшоты и репликация
- Дебаг CICD пайплайнов
- Sandbox изоляция использую инструменты линукс ядра
Но конечено задачи есть и на совсем другие темы, например оптмизация Rust компилятора, или запустить qemu виртуалку и поставить на нее Windows XP 😁
Вобщем для эвалюейшена моделей для нашей работы стоит смотреть на что-то из SWE бенчей и на Terminal Bench. Актуальные версии - 3.0 и 4.0. Четвертая вышла на днях, полностью новых задач там нет, переработаны баги и проблемы прошлого бенча с большего, ну и пошли тестироваться новые модели. Прошлая версия 2.1 - уже наверное есть во всех обучающих датасетах, модели ее делают под 80+%, и уже совсем не показатель, стоит смотреть именно на 3 и 4.
На скрине видно, на сколько круто на новом TB4.0 отработала GLM 5.3, обогнав даже Sol. Прошлая GLM 5.2 версия вообще плелась где-то в хвосте, прирост качества у Zai ну очень крутой. Правда к этому тестированию (результаты появились в сети буквально вчера) есть вопросы. Народ в Твиттере негодует - ну не может Opus обогнать GPT 😂 (в X сейчас какой-то общий консенсунс, что Антропики сдулись, а OpenAI модели на голову выше🤔). И если мы посмотрим прошлый 3.0 - там Sol уверенно выступил по сравнению с моделями Антропик. Ну и странно, что все модели тестировали именно в Claude Code. При этом наверное очевидно, что именно для этого бенча харнес играет роль, так как модели нужно комфортно пользоваться тулами, на которых ее тренировали.🧠
Так что для более объективной оценки по новому бенчу ждем когда его прогонят в Codex для GPT моделей и надеюсь в ZCode для GLM.🌡 Про сам бенч можите почитать здесь.
Я думаю многие слышали о Terminal Bench бенчмарке. Мне раньше казалось, что да, это наверное полезная характеристика, которая показывает как модель умеет обращаться с баш и питон скриптами в терминале, навигация, логи, поиск ошибок. Оказалось и да и нет. Бенч довольно большой, более 60 задач, и задачи максимально разнообразные. То есть да, это про то как агент умеет работать в консоли, но для решения абсолютно разных задач. И многие из них максимально девопсовые:
- Общий server orchestration
- Конфигурация и дебаг стримов в kafka
- Redis снапшоты и репликация
- Дебаг CICD пайплайнов
- Sandbox изоляция использую инструменты линукс ядра
Но конечено задачи есть и на совсем другие темы, например оптмизация Rust компилятора, или запустить qemu виртуалку и поставить на нее Windows XP 😁
Вобщем для эвалюейшена моделей для нашей работы стоит смотреть на что-то из SWE бенчей и на Terminal Bench. Актуальные версии - 3.0 и 4.0. Четвертая вышла на днях, полностью новых задач там нет, переработаны баги и проблемы прошлого бенча с большего, ну и пошли тестироваться новые модели. Прошлая версия 2.1 - уже наверное есть во всех обучающих датасетах, модели ее делают под 80+%, и уже совсем не показатель, стоит смотреть именно на 3 и 4.
На скрине видно, на сколько круто на новом TB4.0 отработала GLM 5.3, обогнав даже Sol. Прошлая GLM 5.2 версия вообще плелась где-то в хвосте, прирост качества у Zai ну очень крутой. Правда к этому тестированию (результаты появились в сети буквально вчера) есть вопросы. Народ в Твиттере негодует - ну не может Opus обогнать GPT 😂 (в X сейчас какой-то общий консенсунс, что Антропики сдулись, а OpenAI модели на голову выше🤔). И если мы посмотрим прошлый 3.0 - там Sol уверенно выступил по сравнению с моделями Антропик. Ну и странно, что все модели тестировали именно в Claude Code. При этом наверное очевидно, что именно для этого бенча харнес играет роль, так как модели нужно комфортно пользоваться тулами, на которых ее тренировали.
Так что для более объективной оценки по новому бенчу ждем когда его прогонят в Codex для GPT моделей и надеюсь в ZCode для GLM.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
У меня рабочая неделя начинается только сегодня, пора включаться 😁
И сразу несколько крутых советов от Google Sr. Staff engineer Lalit Maganti:
Не про DevOps и AI, но звучит как внятный фреймворк для многих решений 🙂 Оригинал статьи здесь
И сразу несколько крутых советов от Google Sr. Staff engineer Lalit Maganti:
* Absorb problems, not requests. Treat daily meetings, chat threads and even conversations with colleagues as raw material. When a complaint overlaps something you own, ask what would actually solve it. Sometimes that means building something new, sometimes just pointing them to a feature they didn't know existed.
* Let problems accumulate. That doesn't mean building the second someone asks. Jumping on every loud request is how you ship features nobody uses. Wait until the same need shows up across teams, then act.
* Find the common shape. Don't just collect requests. Look for the problem hiding underneath. On his team, groups kept asking for pinned tracks, custom views, and zoom settings. Eventually it was clear they all wanted one thing: to personalize the UI around their workflow.
* Pressure-test before building. How far you commit should depend on how sure you are. Safe bets ship now, risky ones get a throwaway prototype to expose the flaws, and big bets earn RFCs and talks before any real work starts.
Не про DevOps и AI, но звучит как внятный фреймворк для многих решений 🙂 Оригинал статьи здесь
👍1
Please open Telegram to view this post
VIEW IN TELEGRAM
🦄1
Когда кодом и ресерчем занимается AI, коммуникация и подача информации становится очень важной. Вот небольшой гайд от инженеринг лида из Azure как писать апдейты, ноуты, ресерч саммари. Из важного:
The reframe. Akhmechet’s idea is simple: every update is evidence. Each one either builds or dents the case for whether you can be trusted to run the show. Done right, a status email builds your reputation, one message at a time. Here are the rules worth stealing:
* Headline first. If there’s no headline, there’s no update. You set the next headline before the work starts, then build toward it.
* The busy genius. The best updates lead with a one-line TL;DR and a quick recap of the goal, assume your audience is sharp, time-poor, and remembers nothing.
* Worries out loud. You should include a section for risks and failures. People value honesty, so flagging problems early is actually a great way to build trust.
* The radio voice. One calm, steady tone throughout will help you signal a steady hand even when things get messy.
archive.codenewsletter.ai
Slava Akhmechet (@spakhm) on X
If you work on anything worthwhile, sooner or later ppl will want to know how it's going. You may need to send investor updates, updates to your boss, emails to adjacent teams, etc. Some hard earne…
Нашел тут крутой cli. Прикиньте, в 2026 и никакого АИ😁, чисто девопсосвая cli тула, я думал в эти годы аи хайпа такого уже не бывает, ан нет.
Тул реально классный, локальный запуск ваших Gitlab пайплайнов на официальных раннер имейджах, линтер, схемы пайплайнов для разных бранчей и тегов, запуск gitlab pages на локалхосте... Вобщем просто сделайте под эту кли Skill для вашего агента и поставьте для тестов и валидации любых изменений в ваши Gitlab пайплайны👍
Тул реально классный, локальный запуск ваших Gitlab пайплайнов на официальных раннер имейджах, линтер, схемы пайплайнов для разных бранчей и тегов, запуск gitlab pages на локалхосте... Вобщем просто сделайте под эту кли Skill для вашего агента и поставьте для тестов и валидации любых изменений в ваши Gitlab пайплайны
Please open Telegram to view this post
VIEW IN TELEGRAM
glci
glci — Run GitLab CI/CD pipelines locally.
🤔1
Вторая часть статьи на тему "Cursor FDE Bootcamp" уже готова🎉 Вас ждут суровые будни FDE инженера.
* Как выбрать правильный таргет для automation
* Работаем с метриками, success criteria, shutdown condition. Как понять что наш engagement успешен, и когда нет?
* Различные скоупы интеграций от обычных SDLC Automations до SDK и Agentic Platform
В этой статье гораздо больше живых примеров из реальных интеграций от инженеров Cursor, в стиле "было"-"стало". Но и стилистически гораздо больше скучной ентерпрайзной информации😅 То есть статья - не совсем занимательное чтиво на вечер. Но может быть реально очень полезной, если вы занимаетесь интеграцией AI систем в Enterpise контексте.
Вобщем откладывайте в закладки, пригодится!🌡 Как всегда статью так же можете скачать в pdf формате, кнопка справа сверху.
Так же для подписчиков канала, если кому-то интересно - могу выслать в личку полный deck с Cursor тренинга, скрины которого я использовал в обоих статьях.
* Как выбрать правильный таргет для automation
* Работаем с метриками, success criteria, shutdown condition. Как понять что наш engagement успешен, и когда нет?
* Различные скоупы интеграций от обычных SDLC Automations до SDK и Agentic Platform
В этой статье гораздо больше живых примеров из реальных интеграций от инженеров Cursor, в стиле "было"-"стало". Но и стилистически гораздо больше скучной ентерпрайзной информации😅 То есть статья - не совсем занимательное чтиво на вечер. Но может быть реально очень полезной, если вы занимаетесь интеграцией AI систем в Enterpise контексте.
Вобщем откладывайте в закладки, пригодится!
Так же для подписчиков канала, если кому-то интересно - могу выслать в личку полный deck с Cursor тренинга, скрины которого я использовал в обоих статьях.
Please open Telegram to view this post
VIEW IN TELEGRAM
eugene-burachevskiy.github.io
70% accuracy может быть провалом: как выбрать первую AI automation — Cursor FDE Bootcamp, часть 2
Cursor FDE Bootcamp, часть 2: цена ошибки AI-агента, опасность overall accuracy, shutdown conditions, human-in-the-loop и выбор между Automation, SDK и внутренней платформой.
AI vs DevOps pinned «Вторая часть статьи на тему "Cursor FDE Bootcamp" уже готова🎉 Вас ждут суровые будни FDE инженера. * Как выбрать правильный таргет для automation * Работаем с метриками, success criteria, shutdown condition. Как понять что наш engagement успешен, и когда…»
Попробую реально таким образом потестить Прыму Астру когда раскатят доступ по апи.
give Astra your session and project history across Claude, Codex, Hermes and any other agent you use
ask it to find:
> prompts you repeat across sessions
> manual steps that should become scripts or integrations
> repeatable workflows that should become skills
> corrections that belong in project instructions
> scheduled work that should become cron jobs
> files or steps where sessions repeatedly stop
Забавный момент :) Nvidia купила Huggingface за $12,930,300,000
Если перевести число 129303 в Unicode - то получим смайл логотип хагинфейса 🤗
А в если в Hex - то получим зелёный цвет лого Nvidia ))
Если перевести число 129303 в Unicode - то получим смайл логотип хагинфейса 🤗
А в если в Hex - то получим зелёный цвет лого Nvidia ))
🦄3🤔1
Forwarded from Литания о Фронтенде
Самари интервью DHH https://share.zorya.dev/s/R524434N5D9Qmj_6Dkxh7G9888Z9kVJsXa8E6JRKIS4
Если вы, как и я, не тратили 5 часов своей жизни на интервью DHH у Лекса Фридмана, то вот выше качественная саммари (мне реально качество понравилось, там внутри какой-то пайплайн?), где, думаю, есть всё главное за 15 минут чтения 👍
🔥2
Если вдруг суботним вечером вместо пива тестируете Astra (но лучше конечно совместить 🍻), то для нее лучше ставить medium effort, максимум high.
🔥3