AI vs DevOps
138 subscribers
206 photos
1 video
119 links
DevOps и системная инженерия в эпоху AI. Новости индустрии. И немного юмора.
Download Telegram
^ Ну вот стоимость инфиренса на своем собственном железе OpenAI, считай, в 30 раз дешевле стоимости АПИ. Ладно не в 30, все же они диверсифируют. Когда есть пользователи, которые тратят больше подписки, есть большая когорта пользователей, которые тратят меньше. Денис явно из тех, кто тратит все максимально. Так что считай, что цены на топовые модели в АПИ по сравнению с реальной ценой компьюта это плюс 2 000% прибыли. 🙈
Ramp, крупный штатовский финтех и один из топовых AI адоптеров выпустили собственный бенчмарк - Ramp SWE-bench.
Построен на базе 80 их собственных продуктовых задач. Реальные таски из финтех разработки, от тикета с задачей до готового PR, условия максимально приближены к реальности. И чем крут этот бенч - он закрытый. То есть задачи почти гарантированно не попадают в обучающие данные.

GLM предсказуемо (для меня 😎) оказался крут по качеству, опережая весь опенсорс, кроме Kimi K3. Sol High 83.3% решённых задач, у GLM - 82.1%. И это выше чем Terra High, Opus 4.8 Xhigh, Sonnet 5.

Офигенный результат 🔥 Но при таком качестве модель оказалась сильно дорогой. На уровне 5 Опуса, сильно дороже даже чем Sol. Адский токен кансампшн GLM, про который многие пишут - реальность. Отсюда вывод, GLM, как я и писал не раз, одна из лучших моделей для тех ресерча, планинга, ревью. Но желательно использовать их субсидированные подписки, чем прямую стоимость апи.

Классный результат показал Kimi K2.7, с 80.8% и относительно дешёвой стоимостью.
Qwen 3.7 в глубокой ж. Жаль что нету в бенче новой 3.8
DeepSeek Flash new - легенда 😎 с 79% и 12 центов за задачу, самая дешёвая из эффективных моделей. Но если цена, как обещают, вырастит в 4 раза - дипсик конкретно так проиграет OpenAI.

А модели от Альтмана меня в этом бенче удивили, при дорогой цене за токен у Terra и Sol они показывают очень эффективную стоимость за задачу. Все модели GPT5.6 реально круто конкурирует с опенсорсом даже в вопросе цены, это новость 🫠

Читаем про бенч и смотрим таблички здесь
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3
Позитивной рабочей недели коллеги!
Тут новую технологию подвезли. Прикиньте, можно видеть код до того как он ушел в прод! Срочно распространяйте в вайб-кодинг сообществах! 😅
🔥4
Думаю вы слышали нашумевшую историю про взлом Hugging Face агентами OpenAI. После этого OpenAI сделали доклад на секьюрити конфе в штатах как это происходило. Была подробная статья в Wired, но за пейволом. Сейчас Денис выложил подробности этого доклада, почитайте, интересно!
Тренды в AI enabled DevOps на текущий момент 🧠:

- Runtime shields. Агенты находят новые уязвимости гораздо быстрее, чем работает стандартный on-demand сканинг и патчинг для устранения этих уязвимостей. Процесс сломан. Real-time сканеры на базе eBPF в теории могут защитить системы до полноценного патчинга.

- Automated verification engineer (AVE). Новая роль на стыке QA и DevOps, закрывающая бич нынешнего процесса разработки - ревью сгенерированного кода. Работа на уровне выше, чем автотесты - разработка test-harness. Связь детерминированных тулов и агент ревью, работа с confidence и severity, интеграция с observability метриками. Вот один из примеров готового фреймворка.

- Temporal fakes. Хаос инжинеринг на стероидах. Мокаем внешние системы, которые не просто отдают статические данные, а эмулируют реальный жизненный цикл внешних депенданси. Сейчас с AI агентами подобные test layers стали куда как проще в разработке.

- Durable agent workflows. Естественная эволюция агентных систем, когда они переходят от банальных скриптов к полноценным сервисам и требуют классческого reliability. Durable execution (смотрите Temporal и Golem), progress persistence, resume-after-failure, обсервабилити для tool execution и decision tracking.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Хинт дня 👍 Давно его уже использую, удобно когда работаешь в консоли, чтобы не запускать каждый раз tui.

~/.bashrc
alias oo="opencode run -m opencode/deepseek-v4-flash-free"


Ну и дальше просто oo "ask a question here?"
Говорят девелопер бета уже доступна. Я конечно точно не уйду с опенкод, дело привычки, но посмотреть можно будет.
Ура 🎉 Красивая ачивка для CV 🌡😎

Теперь точно нужно не лениться и написать статью по их курсу подготовки FDE, там реально много полезного было)

https://www.credential.net/0660a1e9-bc5f-48c1-a539-56a84b646791#acc.HoEJdzbF
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4
Доброго утра, коллеги!☕️
X-AI разродился релизами, новая топовая модель Grok 4.6. И если у вас есть подпсика на Курсор, то ближайшую неделю модель отдают с 50% скидкой, нормальный вариант затестить (но блин 256к контекста, ну несерьезно прям😅). А так же мультагентная тула для дженерик офисных задач - Grok Bot, про который возможно напишу позже 👍
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Сегодня уже плотно работаю с новым DeepSeek V4 Pro🐳. Задачи обьемные, делаю PoC для миграции нашего продукта из dind в k8s native агентов. Работает по уже готовым спекам - код пишет хорошо, за задачами следит. На код ревью ГЛМ+Сол потом находят конечно много issues, но подозреваю что связано с довольно сложным кодом. Исправляет все правильно. Пока ощущение - что просто отличная модель для кодинга в OpenCode, по стабильности вот на голову выше прошлого дипсик. 🧠

Дальше посмотрим как будет работать с деплоями, траблшутингом, ну и в систем дизайне/доках как нибудь попробую тоже.👍

PS Ну и к слову, харнес доступен уже тоже
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Неделя топовых релизов 🔥

Потестил Grok 4.6 в Курсоре. Не запускал Cursor агентов уже наверное пару месяцев 😁 Использовал его просто как vsкод, файлы смотреть)) Корпоративная подписка просто простаивала... Но вот вышел новый грок и решил посмотреть как он. Слушайте - неплох. Вполне верю в бенчи, которые показывают что Grok 4.6 теперь SOTA и догоняет Sol и Fable. Запустил финальную фазу своего k8s native PoC - devops wiring: апдейты для хелм темплейтов, вальюсов, скриптов, документации, новые секреты, энв вариаблы, вобщем вся конфигурация k8s native pod генератора вместо старого dind. Ну и отработало отлично. Код ревью с Sol нашло только один критикал и 8 медиум. Что круто, прошлые фазы сделанные новым DeepSeek Pro такой же код ревью находил по 5-7 критикалов и 10-15 медиум.
Вобщем модель крутая🧠. Но вот сам Cursor - тормозящая лагающая гуевина, с которой после консольных харнесов работать, особенно на моем экране ноута, неудобно от слова совсем. Все таки я совсем отвык от GUI агентов. Когда выйдет в фул релиз opencode 2 - попробую их линукс десктоп апп, так как он будет интегрирован с тем же сервером что и консольный клиент. Но чисто как замену vscode смотреть файлы. Агенты продолжу гонять как обычно - куча вкладок в консоли) А если вы любите гуи - попробуйте Zcode. По незаивсимым тестам - крутой харнесс, кеш хит там вообще запредельный👍.

Что еще? Google🔋 выпустила Flash 3.7 Мне кажется они рубят фишку. Что огромные SOTA модели - это больше вопрос престижа. А 80% реальной работы делается моделями поменьше. И новый флеш со своей $0.375/$1.875 за лям токенов выдающий перфоманс уровня Sonet 5 - это огонь модель. По цене в 7 раз дешевле Сонета. Если у вас есть корпоративные ограничения на китайские модели, новый гугловый флеш - отличный выбор, особенно для работы с репортами, тех дигестами, документами и экстракцией итд итп. Я уже перевожу свои рабочие и пет проекты на нее👍, как будет делать код ревью в пайплайнах - тоже посмотрим.

Ну и есть еще одна новость, очень крутая, но которая появилась сегодня очень тихо, без помпы...
Please open Telegram to view this post
VIEW IN TELEGRAM
И вот она! GLM 5.3! Уже в OpenCode Go. Огромнейший прирост по всем бенчмаркам и реальный кандидат на лучшую open source модель. Вот за этот релиз я сегодня даже пивка выпью😅🍺, очень-очень рад 🔥😎🫰

Добавлю - модель на 743B параметров. Считай в 4 раза меньше Kimi 3 и в 10 раз меньше Fable. Но бенчмарки офигенные. Ребята сделали ставку на качественный посттренинг, как и DeepSeek. И результат заслуживает уважения.🔥 Также эта модель максимально заточена на cyber security. Теперь код-ревью реально выйдет на новый уровень 💯
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2
GLM 5.3 Evaluation ⚠️

Конечно же решил начать работать с новой GLM. На Zai подписке модель пока что слабо юзабельна. Задержки перед выполнением, медленно, иногда агент просто виснет и не продолжает работу. Ладно, все же день релиза, да и Lite план запросы явно не в приоритете. Запустил на OpenCode Go. Тут уже все идет без лагов и остановок. Но меня сразу насторожило, что модель на разных даже вроде не сложных промптах уходит в очень и очень длинные рассуждения😟. Совсем не как у 5.2. Что натолкнуло на мысль как о медленной скорости, так и на прожорливость в плане токенов.

Но догадки догадками, надо сделать нормальный эвалюейшн, хотя бы на одной серьезной задаче🌡. Решено сравнить с Grok 4.6. Задача - критическая ишуя найденная на код ревью Sol-ом, связанная с тем, как оркестратор в нашем софте управляет новым жизненным циклом k8s сендбоксов, в которых крутятся наши исполняемые агенты. Если не вдаваться в подробности и описать в одно предложение, то:

The Kubernetes runtime defines outcome labels, retention policies, orphan cleanup, and shutdown draining, but these features are not connected to the production supervisor lifecycle. Failed pods are deleted without retention, while supervisor crashes can leave active orphaned pods indefinitely.


Новая сессия в OpenCode, GLM 5.3 Max. В контексте AGENTS.md проекта и инфраструктуры, дизайн и тасклист спеки текущей фичи, ну и описания ишуи которую нужно пофиксить. После выполнения прогоняю еще раз Sol ревью уже чисто по фиксу, смотрю результат, все ресетаю, и запускаю с нуля с таким же контекстом в Cursor на Grok 4.6 Extra High.

GLM реально ну очень долго пидалит эту ишую. В меня аж закрадываются сомнения, что у модели на релизе есть какие-то проблемы. 🤷‍♂️ Но результат готов, +280/ -60 строк в 22 файлах. Время выполнения 25 минут. 5 миллионов токенов. Sol по этому результату находит 2 критических и 2 medium проблемы. Фикс есть, но не полный, надо дорабатывать. Думаю что все, GLM обосрался😭

Прогоняю все в Grok - и тут меня ждет удивление 🙂Результат получаем вот совсем такой же. Плюс минус те же строки и файлы. 14 минут скорость выполнения. Здесь конечно большое преимущество. 7 миллионов токенов потрачено! И все таки несмотря на долгий и муторный ризонинг у GLM на реальном потреблении токенов он не сильно сказался 🤗 Прогоняю через Sol - находит РОВНО те же самые 2 критикал и 2 медиум 😂 Проверил на отдельной новой сессии насколько эти находки актуальны, может Сол тупит? Но да, актуальны, требуют фикса, и GLM и новый Grok недоработали на одном и том же месте.

Вердикт - каких-то больших проблем у GLM нет. Модель работает, вполне на уровне других современных релизов. Продолжаю работу дальше, будем проверять как GLM 5.3 справляется с архитектурой и код ревью, а на следующей неделе будет большой тест на тему cybersecurity, буду проводить полный аудит нашего проекта. 👍
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4
Вобщем неделю времени и много нервов потратил на подготовку, но сам экзамен оказался не таким страшным) Хотя штук 5-8 вопросов были весьма спорные и трактовать их можно было по разному. Но, ура! Эта ачивка у меня! 👍 820/1000 при проходном 720.

В целом хочу сказать, что во время подготовки узнал много интересных паттернов и техник, которые можно будет использовать в реальной работе 😎
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4
Продуктивной рабочей недели, коллеги!
Никогда не говори никогда 😁 Еще недавно я писал, что OpenCode - это мой домик и я останусь тут жить 😆 А эти выходные я просидел все вечера в Zcode просто кайфуя от процесса. Вы видели вообще этот UX гений? Сайд панель удобно переключаемая между коммитами, дифами и btw чатом. Панель навигации в один клик между чатами и удобным деревом репы, чаты удобно разбиты на проекты. Настройка за пять минут с импортом всех скилов и агентов из opencode. А главное - работа с телефона в один скан qr-а, и вот ты уже продолжаешь проект с дивана. Это что вообще такое-то? 😍

Как вишенка - 150% лимитов на zai coding plan. Я пробовал zcode в бете и мне что-то не зашло, теперь же это просто удобнейший инструмент. Разве что размера моника лаптопа теперь маловато, в консольных тулах пофиг, а тут хочется побольше.
👍1