AI vs DevOps
138 subscribers
206 photos
1 video
119 links
DevOps и системная инженерия в эпоху AI. Новости индустрии. И немного юмора.
Download Telegram
Продуктивного понедельника, коллеги! 👨🏻‍💻
Вот сайтик в закладки, Canvas эффекты для фронтенда. Если собираетесь делать какой-нибудь стильный нестандартный фронт для своих проектов - закиньте своему агенту.👍

https://canvasui.dev/
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Подтверждающее мнение, насчет настоящей инженерной культуры в китайских лабах.👍 Ну и важности девпосовых скилов в наши дни 😉

my spicy theory is that chinese ai labs keep winning because of culture, not talent or resources.

chinese labs still have a deeply hands-on engineering culture. deepseek and kimi are flat organizations where science and engineering are fused: the same people move between algorithms, data, and infra, doing whatever it takes to make the model work.

but sf tech bros have decided that “researcher” is the high-status title while infra is merely support work. every new sf ai startup calls itself a “lab,” every ambitious engineer quietly upgrades their title to “research engineer,” and the infra work is left to whoever failed to escape it.

but at frontier scale, infra determines experiment velocity, and experiment velocity determines research output. at frontier scale, infra **is** research.
Новость прошла мимо меня, а уже во всех пабликах). Реально новый флеш и реально с такими бенчами? Сегодня по-любому буду тестить на сайд-проектах.
В соцсетях сейчас тренд, многие пишут как переходят с GPT 5.6 Sol на Luna в Xhigh/Max эффорте. Якобы на этом уровне эффорта получаем супер качественную модель, выдающие результаты лучше чем какой нибудь Sol Low effort и якобы точно лучше Terra, которая вообще типа не нужна. И это реально частый кейс.

Потестил я Луну, в xhigh, max и luna-pro на этих же эффортах. И чуда не случилось. Модель нифига не быстрая. Дополнительный ризонинг затавляет ее часто делать ненужные для задачи действия. Контекст хоть и лям, но в большом контексте теряется. По итогу задачи делает даже медленнее чем GLM.
Например довольно большой PR на 97 файлов и +3k/-3k, GLM-5.2 (а GLM - эталон для код ревью, really) сделала за 6 минут, нашла 2х P2, 3x P3, 4 грамотных пунктов для рефакторинга. Луна макс педалила 12 минут и нашла один единственный P2 и посоветовала один рефакторинг в виде "можно добавить e2e смок тест". It's pathetic 🙈 В кодинг и дебаггинг тоже надо следить чтобы не наделала косяков, прям вайбы MiniMax-а.

Вобщем нахер нужна такая модель 😄 Оставляю рабочей лошадкой - Terra High. Если вам нужно качественно и недорого - DeepSeek Pro-Preview, новый DS Flash, Kimi K2.7 - все на голову выше Луны. Луна-pro у меня сейчас стоит только в Слак боте по новым пул реквестам и упавшим пайпланам, ну такой небольшой обьем информации она способна разобрать без ошибок и косяков. И то, там стоит не DeepSeek сугубо из за корп комплаенса.

ЗЫ А вот новый DS Flash - это реально чудное чудо, на уровне GLM по качеству, но быстрее и сильно дешевле. Вот только контекст 200к - это блин уже не работает. Когда у тебя все остальные модели на 1кк, и ты обычно держишь чаты на 150-300к токенов контекста, переключаться на модель в 200к проблемно, сразу тупки, попытки сжать через dcp итд, вобщем модель хоть и хорошая, но из рабочего процесса выпадает. Вот когда выйдет новый Prо c 1kk окном и с таким же гениальным пост-тренингом - это будет бомба и явный кандидат на основную рабочую лошадку 👍
Please open Telegram to view this post
VIEW IN TELEGRAM
Как почувствовать себя лошарой-вайбкодером? Все просто, слить 600 баксов не запланированного бюджета 🌡😄

Заливал в прод для текущего проекта свой слак нотификейшн сервис. Когда делал ключ, отписывал что бюджет будет не выше 100$ в месяц, ну в принципе там особо взяться тратам негде, особенно на лайтовых моделях. Первую неделю работает все ок. Апрув на доступ к базе знаний проекта в драйве еще от менеджмента не получил, приложение работало только с нотификацией по мерж реквестам, упавшим пайплайнам, ежедневным engineering digests.
Через неделю мне приходит нотификация от сапорта - ваш бюджет в 100 баксов привышен.🤷‍♂️ Думаю да ладно? Блин, для вопросов-ответов по базе знаний стояла flash модель, а для работы с гитлабом оказывается gemini pro, думаю точно дело в модели, поменяю на флеш.🛠️

Проходит несколько дней, на дворе 2 августа, и мне снова письмо - новый бюджет в $100 уже привышен. 🤯🤯🤯Я в а*уе. Что, уже, за 2 дня? Полезли с сапортом разбираться в биллинг - за пару недель прошлого месяца ушло 550 баксов😭, и сейчас за два дня уже 130. По графикам использования апи видим что запросы в ллм идут все эти дни каждые 15 минут, приехали...

Сначала я подумал, что я настолько лох, что написал работу с гитлабом через ллм. Но нет, в гитлаб мы ходим каждые 5 минут а не 15, и там все детерминистично, через пайтон апи, с ключами дедупликации, в ллм отправляем только реально новые мерж реквесты. 👍
А проблема оказалась в синке базы знаний. Первые дни синк не работал, потом кто-то из менеджеров втихую подтвердил мою заявку на доступ и даже не предупредил. Синк сервис стал молотить файлы из драйва. 800+ файлов, 2000+ файлов создано в вики, но возникла проблема с race condition, из за частого синка прошлый батч не успевал обработаться и как я понял почему-то по новой отправлялся в очередь. Плюс файлы с неподдерживаемыми mime type после ошибки не исключались, а не оставались как новые. Плюс агент в процессе синка создавал свои рабочие питон скрипты и файлы списков прямо в рабочей директории с синканутыми файлами, и с этим тоже косяк. Вот и пожар бюджета, вовремя заметили, извне то все вроде как работало как надо.

Сразу отключил синк на раз в 6 часов вместо 15 минут. Теперь делаю sync hardening, с починкой race condition, exluded folder and mime types (в проекте драйве как оказалось еще и много мусора было, типа логов, траекторий итд), excluding новых mime types автоматом которые модель не смогла обработать, ну и нотификацией в слак на каждый новый синк - что мы синкаем, количество документов, длина очереди итд.✍️


Выводы которые из этого сделал:

1. Ставьте минимум две нотфикации по своим LLM ключам. Одна - базовый лимит, который реально пересечь при нормальном использовании, вторая - большая цифра которая какбы недосигаема, но это страховочный ключ. Допустим мы думаем что лимит 100 баксов в месяц. Поставьте одну нотификацию на 90, а одну на 200. Если бы сапорт поставил вторую нотификацию, я бы не слил эти 6 вечнозеленых листов.😉

2. Лучший вариант - ставить на все свои проекты Langfuse. Он не настолько простой в установке и настройке, компонентов много, но это лучший инструмент для обсервабилити ллм софта. На реальных проектах у нас уже везде (к соажлению не централизованй пока), на моих пет - его нет. Надо себе сделать универсальный установщик (в духе времени - в виде Skills 🧠) и везде его ставить. Потраченые request resources все же окупаются с лихвой за счет понимания как работает с ллм твой софт.

3. Если все же не langfuse - то делай нотификации как твои сервисы работают с ллм. Нет ui - пиши в логи, есть ui - делай дашборды, работаешь со слаком или месенджерами - пиши нотификации в месенджер. Это добавит прозрачности и понимания и позволит избежать таких внезапных косяков.

Удачи вам коллеги в нелегком деле вайбкодинга 🤣 не попадайте в косяки ))
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1🗿1
А еще в процессе этих фиксов и ревью меня окончательно выбесил GPT 5.6, что Terra, что Sol. Делаю хай лвл план с Sol High, делаю имплементацию по плану на Terra, делаю код ревью с GLM - находит два критикала, штук пяток P2, и с десяток незначительных P3. Race condition починен криво, считай не починен, для миграции данных которую мы запланировали (чтобы не делать весь синк с нуля, мигрируем все файлы из вики в новые индексы с новой метадатой) Terra вообще не подготовила ни-хе-ра.
Хоть в описании багов из ревью и написано как их чинить, запускаю Sol, пусть уже починит нормально. Чинит. Делаю ревью конкретно эти двух новых коммитов - опять 8 штук P2 и с десяток P3 конкретно в этой имплементации от Sol. Ну нахер, опять по кругу. И модельки за эту особо не большую имплементацию сьели $40 токенов (деньги не мои, но все равно жалко😅) Свитчнулся на новый DS Flash, допилил эти два коммита, сделал остальные 15 мелких ишуев, провел второй раунд код ревью с GLM - все ок, буквально одна желтая и пару синих issues осталось.

И я не думаю что это когнитивное искажение, мне реально кажется что с тех пор как я перешел на модели OpenAI я реально очень часто стал переделывать фичи, ишуи в код ревью сыпятся как из ведра. Модели слишком самоуверены, они вот реально никогда не спросят "а что ты хотел на самом деле? а как мы будем делать здесь, вот есть такие варианты?", много и долго думают, принимают решения сами, по итогу с очень умным видом пилят какую-то херню.
Ну и бесят сабагаенты, эти новые openai модельки запускают сабагентов на каждый чих, и когда я говорю Sol "разберись как работает этот сервис/модуль", я хочу чтобы именно Сол сам разобрался, а не запустил мелкую модель в фоне и потом просто перепечатал результат.

Не, я уважаю GPT 5.6, реально огромная работа, в отличии от 5.4-5.5 они хоть научились разговаривать и писать доки нормальным техническим человеческим языком, пользуйтесь на здоровье 👍 Но я ухожу на новый DeepSeek Flash 🌡Ну и GLM конечно.

ЗЫ Sol пока оставляю для дебагинга реально сложных обьемных багов (типа моей прошлой проблемы, когда надо проверить код нескольких сервисов, реальные деплои в кубере, собрать статистику что сьело бюджет, когда и как это произошло), в этом плане модель очень дотошная. И наверное все же оставлю для первого написания SDD спек и планов. Дальше обязательно /review-requirements и /review-design только с GLM. Сол в начале может сильно так наоверинжинерить, но при этом покрыть все даже не очевидные кейсы, а с GLM потом в процессе ревью уже можно довести все спеки в человеческий вид.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
А вот огонь фича заезжает в Github - Stacked pull requests. Возможность разбивать большой PR на пачку отдельных бранчей+sub-PR, ревьювать все по отдельности, а мержить все вместе через merge queue. Как я понял от сорс бранча сначала создаешь новый бранч который является bottom нового стака. Дальше от этого стака можно ветвить сколько угодно бранчей, которые все обьединятся в один Stack PR. Никаких мержей/ребейза ориджина, когда тебе надо смержить несколько PR по очереди. Никакого нытья про то, кто будет ревьювать +-10к пул реквест.🤗

И мне кажется что эта фича - просто гениальна в свой простоте и четко вписывается в сценарии агентской разработки 🧠 Вобщем надеюсь будет не только в Enterprise, ну и Gitlab поскорее бы ее скопировал 😁
Please open Telegram to view this post
VIEW IN TELEGRAM
Опять пост "старческого брюзжания" про модели 😅 Отказался от нового DS Flash 😁 Конечно пост тренинг там гениальный, когда такая мелкая и быстрая модель так хорошо гоняет техничские вопросы и так качественно ориентируется в консоли. И я верю бенчам, явно на эти бенчи модель специально натаскивали. Но реальная работа - это не бенчи, и в реальных задач флеш хоть и хорош, но я совсем не вижу разницы по сравнению с прошлой Pro-Preview. Но в одном разница есть, это качество языка аутпутов и структурирование текстов. И в этом Pro как более крупная модель побеждает и это видно невооруженным глазом. Так как, то, как модель тебе пишет ответы и насколько ее ответы понятны - это очень важный пункт для качественной работы, я вернулся на прошлую Pro.

Такие дела. Ждем новую прошку с таким же крутым кодинг пост тренингом 🌡
Please open Telegram to view this post
VIEW IN TELEGRAM
Я тут просто в ах*е от самоуверенности Sol. Решил сделать новую фичу для своего слак ассистента, запустил для Sol Medium /new-requirement команду из AI-Devkit для сбора данных по требованиям, модель задала буквально пару самых простых вопроса, и дальше сидит пидалит доки. И тут рапортует - доки сделала, сама провела все ревью, и /review-requrements и /review-design, все у меня сделано круто, так что можем начинать имплементировать код. 🤯

Первый раз вижу такое, там четко в команде задано, что юзер отдельно проводит ревью, а тут сама написала, сама заревьювила, сама сказала "я молодец, все сделала четко" 🤣
Готовлюсь к Claude Architect сертификации (при всей моей нелюбви к Антропикам серт получить то надо 😅 и для компании и для своего CV). Нарыл в интернете pdf-ки с моком экзамена (Developer и Architect Foundation), загнал в LLM, прошел мок на 95%, показался весьма легким.

А вот нашел еще один сайт, который предлагает бесплатные материалы для подготовки и единый мок экзамен для проверки знаний в целом. Вот он мне показался реально сильно сложнее, сдал на 72%. Ну теперь вижу свои гэпы и понимаю что подтянуть. Вобщем если думаете готовиться тоже, максимально рекомендую этот сайтик 👍

Моки в pdf выложу в коментах
Please open Telegram to view this post
VIEW IN TELEGRAM
Всем привет! Сохраняйте в закладки для саморазвития 🌡

23 основных концепта System Design. Написано подробно, живым языком и увлекательно, с диаграммами, не занудно. Подойдет как для подгтовки к собесам, так и углубить свои знания по некоторым темам.

https://x.com/system_monarch/status/2084233289016238343
Please open Telegram to view this post
VIEW IN TELEGRAM
DeepSeek заявил, что собирается, причем сильно, поднять цены на свой API. Сразу пошли рассказы, про то что инфиренс у них был максимально субсидирован, вплоть до поддержки компартии КНР 🙂 И что халява закаончилась. Но дело не в субсидиях, а тупо в популярности. Создатель опенкод вчера написал, что им удалось выдать цену на DeepSeek такую же как у оригинального провайдера даже на арендованых GPU. То есть стоимость инфиринса сейчас вполне честная. Но в следствии популярности китайцы решили расширять свою инфраструктуру и забить капитальные расходы в стоимость апи. Но есть два тейка:
* Вряд ли цена уйдет в космос до уровня штатов. Все таки есть огромное число независимых GPU и инфиренс провайдеров, которые гоняют у себя открытый код дипсика и им выгодно делать цену ниже, с другой стороны если офф провайдер поднимется все внешние инфиренсы тоже поднимутся, но не сильно и цена где-то сбалансирует по середине. На уровне закрытых моделей она точно не станет.
* Представьте сколько бабла гребут ОпенАИ и Антропик продавая свои продукты в тридорого?😄Ладно Альтман хоть Луну по честной цене стал отдавать, а у Антропиков вообще ничего святого 😁
Please open Telegram to view this post
VIEW IN TELEGRAM
Forwarded from Denis Sexy IT 🤖
Посмотрел свои траты в Codex – почти 40 миллиардов токенов за все время, это почти 40 тысяч долларов трат

Подписка 200$, в моем случае, выгоднее чем API цены в ~30 раз. И это без учета трат на обычный ChatGPT с Pro моделью и тп

Безумные времена 👍
Please open Telegram to view this post
VIEW IN TELEGRAM
^ Ну вот стоимость инфиренса на своем собственном железе OpenAI, считай, в 30 раз дешевле стоимости АПИ. Ладно не в 30, все же они диверсифируют. Когда есть пользователи, которые тратят больше подписки, есть большая когорта пользователей, которые тратят меньше. Денис явно из тех, кто тратит все максимально. Так что считай, что цены на топовые модели в АПИ по сравнению с реальной ценой компьюта это плюс 2 000% прибыли. 🙈
Ramp, крупный штатовский финтех и один из топовых AI адоптеров выпустили собственный бенчмарк - Ramp SWE-bench.
Построен на базе 80 их собственных продуктовых задач. Реальные таски из финтех разработки, от тикета с задачей до готового PR, условия максимально приближены к реальности. И чем крут этот бенч - он закрытый. То есть задачи почти гарантированно не попадают в обучающие данные.

GLM предсказуемо (для меня 😎) оказался крут по качеству, опережая весь опенсорс, кроме Kimi K3. Sol High 83.3% решённых задач, у GLM - 82.1%. И это выше чем Terra High, Opus 4.8 Xhigh, Sonnet 5.

Офигенный результат 🔥 Но при таком качестве модель оказалась сильно дорогой. На уровне 5 Опуса, сильно дороже даже чем Sol. Адский токен кансампшн GLM, про который многие пишут - реальность. Отсюда вывод, GLM, как я и писал не раз, одна из лучших моделей для тех ресерча, планинга, ревью. Но желательно использовать их субсидированные подписки, чем прямую стоимость апи.

Классный результат показал Kimi K2.7, с 80.8% и относительно дешёвой стоимостью.
Qwen 3.7 в глубокой ж. Жаль что нету в бенче новой 3.8
DeepSeek Flash new - легенда 😎 с 79% и 12 центов за задачу, самая дешёвая из эффективных моделей. Но если цена, как обещают, вырастит в 4 раза - дипсик конкретно так проиграет OpenAI.

А модели от Альтмана меня в этом бенче удивили, при дорогой цене за токен у Terra и Sol они показывают очень эффективную стоимость за задачу. Все модели GPT5.6 реально круто конкурирует с опенсорсом даже в вопросе цены, это новость 🫠

Читаем про бенч и смотрим таблички здесь
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3
Позитивной рабочей недели коллеги!
Тут новую технологию подвезли. Прикиньте, можно видеть код до того как он ушел в прод! Срочно распространяйте в вайб-кодинг сообществах! 😅
🔥4
Думаю вы слышали нашумевшую историю про взлом Hugging Face агентами OpenAI. После этого OpenAI сделали доклад на секьюрити конфе в штатах как это происходило. Была подробная статья в Wired, но за пейволом. Сейчас Денис выложил подробности этого доклада, почитайте, интересно!
Тренды в AI enabled DevOps на текущий момент 🧠:

- Runtime shields. Агенты находят новые уязвимости гораздо быстрее, чем работает стандартный on-demand сканинг и патчинг для устранения этих уязвимостей. Процесс сломан. Real-time сканеры на базе eBPF в теории могут защитить системы до полноценного патчинга.

- Automated verification engineer (AVE). Новая роль на стыке QA и DevOps, закрывающая бич нынешнего процесса разработки - ревью сгенерированного кода. Работа на уровне выше, чем автотесты - разработка test-harness. Связь детерминированных тулов и агент ревью, работа с confidence и severity, интеграция с observability метриками. Вот один из примеров готового фреймворка.

- Temporal fakes. Хаос инжинеринг на стероидах. Мокаем внешние системы, которые не просто отдают статические данные, а эмулируют реальный жизненный цикл внешних депенданси. Сейчас с AI агентами подобные test layers стали куда как проще в разработке.

- Durable agent workflows. Естественная эволюция агентных систем, когда они переходят от банальных скриптов к полноценным сервисам и требуют классческого reliability. Durable execution (смотрите Temporal и Golem), progress persistence, resume-after-failure, обсервабилити для tool execution и decision tracking.
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Хинт дня 👍 Давно его уже использую, удобно когда работаешь в консоли, чтобы не запускать каждый раз tui.

~/.bashrc
alias oo="opencode run -m opencode/deepseek-v4-flash-free"


Ну и дальше просто oo "ask a question here?"
Говорят девелопер бета уже доступна. Я конечно точно не уйду с опенкод, дело привычки, но посмотреть можно будет.
Ура 🎉 Красивая ачивка для CV 🌡😎

Теперь точно нужно не лениться и написать статью по их курсу подготовки FDE, там реально много полезного было)

https://www.credential.net/0660a1e9-bc5f-48c1-a539-56a84b646791#acc.HoEJdzbF
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4