AI vs DevOps
138 subscribers
206 photos
1 video
119 links
DevOps и системная инженерия в эпоху AI. Новости индустрии. И немного юмора.
Download Telegram
Продолжаю сегодня тестить GPT-5.6. И эйфория от первого знакомства уже улетучилась... 🤨
Да, Terra как исполнитель - огонь. Но код по спеке и Дипсик нормально в целом напишет. Конечно шансов что ГПТ напишет по спеке без косяков больше, но код ревью и там и там придется прогонять. Вобщем написание по расширенному плану и спецификации - это не то чемм можно гордиться.

А вот саммари пул реквестов, систем дизай, написание самих архитектурных спек. Это уже то что важно. И гпт что-то пока меня не удивляет с этим. Допустим банальное review MR https://git.***.com/r-d/exadel-***/-/merge_requests/566 summarize changes, highlight what is important from DevOps perspective
GPT-5.6 Sol вообще стал подтягивать скилы для код ревью и пошел колбасить полное исследование кода. Говорю что ты делаешь, просто саммари нужен, понять что там в pr разрабы накатали. Сделал. См. первое фото. Второе и третье фото - как по этому же промпту дала ответ GLM-5.2

_*Какие мысли, народ, где лучше?*_ И еще для сравнения, закину скрины в коменты, задал вопрос что надо сделать чтобы текущая сборка имейджей заработала в CICD а не только вручную.
По итогу - ГПТ очень краток. Вроде как все по делу. Но критических деталей может не хватать. GLM четко пишет: _"Вот первый путь решения проблемы, вот второй"_.
ГПТ - говорит в рассуждениях _The key decision is whether to convert it to the supported docker_with_git flow or extend CI to support baked-source docker_image; I’ll make the minimal supported path explicit._ То есть он тоже видит два пути решения, но самостоятельно выбирает более простой путь и пишет дальше только его. 😐 Мне кажется - это довольно критичный косяк, когда модель сознательно уходит от feedback loop там где он реально нужен ⚠️

GLM же реально углубляется в детали, и его фишечки вроде *Suggested review questions* это прям реальный буст quality of life 😎 и он такие детали выдает часто и это круто.

Конечно пример довольно простой и только один, вывод довольно субьективный. Но в ближайшее время попробую сравнить две модели на написании подрообной спецификации для какой нибудь обьемной фичи. Вот там действительно видно и архитектурное видение, и умение писать по делу и понятно, и насколько широко моель смогла погрузиться в детали = насколько хорошо написаные спеки прошли последующее ревью.
👍1
Kimi K3, frontier level модель от Moonshot уже в OpenCode Go. В 6 раз дороже GLM 5.2, и в 10 раз дороже прошлой Kimi K2.7.
Не очень юзабельно, модель скорее для того чтобы показать, что опенсорс может конкурировать с фронтиром.
Но потестить можно. Для ежедневной работы наверное излишне, для любых задач все равно хватает GLM+DeepSeek на любой подписке, или GPT Terra High если юзаете Codex.
🔥1
Запустил Kimi K3 для простейшего ресерча. Девы сделали для проекта e2e тесты, дал путь в репе, сказал сделать репорт что за тесты, как они работают, как конфигурируются, как потом лучше их интегрировать в CICD. 3 минуты работы, 60к токенов (из них половина - сис промпты и заголовки скилов, обычный контекст в начале любого чата), съело 3% месячного лимита 😆Прайсинг реально Опус-стайл 🤷‍♂️
Вывод приятно читается, все хорошо сттруктурированно, но в принципе как и у GLM/Kimi раньше, у них всегда была качественная подача информации. Контекст собирает правильно, смотрит файлы по всей цепочке интеграции и деплоя. Работает конечно медленно, показалось что даже медленнее GLM. Вобщем выглядит качественно - но медленно и дорого.

У нас на проекте анлим ключи на гпт, но раньше я их не использовал вообще, GPT 5.4-5.5 меня совсем не устраивали по своей работе. C выходом Сол и Терра ситуация поменялась, все чаще гоняю Терра как базовую модель и Сол если есть сложный баг и траблшутинг. Но когда нужен вдумчивый ресерч, доки или код ревью - по прежнему запускаю GLM 5.2, внимание к деталям и качественная подача без излишнего у нее все еще зе бест. Так что пока продолжу дальше использовать эту связку, Кими хоть и интересна, но мимо

Вывод: если вы интузиаст по новым моделям или у вас только подписки OpenCode или Ollama - новую Kimi K3 вполне можно иногда запускать, там где нужен интеллект фронтир модели. При цене в 3/15 - она все еще сильно дешевле Опуса и явно лучше. Где-то на уровне Терры при полной оплате за АПИ, но скорее всего лучше Терры.
Если вы максите эффективность сделанной работы к стоимости - новая Kimi выглядит излишней, как и любые фронтир модели. 95% задач можно успешно делать на последних Дипсик и GLM.
Please open Telegram to view this post
VIEW IN TELEGRAM
Вышел Qwen 3.8, еще одна модель Fable-class. Похоже теперь модели уровня фейбл - это базовый уровень как для закрытых так и для oss моделей :) Отставание в месяц уже невелировалось, модели схожего уровня у США и Китая теперь выходят почти одновременно.

Инвесторы твиттят что-все-пропало, предрекая крах штатовскому аи-рынку, так как все пересядут на модели такого же качества но в 5 раз дешевле. Думаю лукавят, все знают что есть комплаенс, и корпораты будут вынуждены (пока) платить в Х раз больше, просто потому что штатовские компании (якобы) обещают не сливать их данные.
Так что у Альтмана с Амодеем кастомеры будут, но триллионные оценки явно под вопросом. Китай теперь настоящий конкурент (и имхо это круто, китайские инженеры реально делают крутые штуки на энтузиазме, как в старые добрые :) )
🔥1
Мистер "оверинженер" вернулся. Простая задача "девелоперы поменяли переменную окружения, поменяй ее в наших девопсовых конфигах и доках" причем с нормальным контекстом, скинул оригинальный запрос от девелоперов. А Гопота (причем Terra, а не Sol) решила переработать вообще все приложение и тесты, где есть какие-либо пересечения с этой переменной.
Пришлось звать на помощь GLM, чтобы он откатил изменения и сделал нормальный скоуп. Ну вот блин, вроде Sol/Terra - умные модели, можно же переспросить пользователя если есть сомнения что менять. Почему с GLM/Kimi/DeepSeek вообще никогда нет проблем что они меняют тебе весь проект не поняв твою задачу? Блин, вот есть желание нафиг выключить OpenAI провайдера после таких косяков и переделок 🤬
🌚1
Хорошая подробная статья как создавать дизайны с помощью АИ. Если вам нужен лендинг, постер или презентация, не обязательно осваивать Claude Design/Open Design. Можно использовать обычный харнесс, но tips&tricks из этой статьи помогут вам не создать очевидный слоп, а сделать что-то со вкусом. Добавляем в закладки 🌡
Please open Telegram to view this post
VIEW IN TELEGRAM
Чуть юмора к концу дня 😄
Первый сезон нерд-воин объявляем открытым. Прям батл-рэп в вязаном свитере и очках какой-то 🤪
Гугл походу поняла, что их Flash нравилась людям за скорость, надежность и дешевый прайс. И делать флеш уровнем прошлого поколения про - странная стратегия. И сейчас они выпустили новый flash 3.6 с более дешевым аутпутом, лучшей токен эффектвиностью и конечно с качеством получше. Можно переводить свои тулы и пет проекты на новую модель😎
Тут YCombinator выложил актуальные идеи для стартапов, в своем Requests-for-Startups. Пункт 4 - Multiplayer AI звучит интересно. Кажется простейшая идея, совсем на поверхности!

* Просто браузерный чат враппер, шарим линку и работаем в одном чате.
* Создатель чата загружает свой токен (openai, claude, gemini, храним секьюрно в браузере и передаем на бекенд), получается инфиренс за счет создателя чата.
* Возможность подгружать скилы/mcp/конфигурации из других своих агентов. Получаем быстрый онбординг своих рабочих инструментов и практик.
* Мультиплеерный чат, голосовое/видео прикрутить. Артифакты от аи доступны всем в чате. Так же все могут шарить свои файлы друг другу для работы.
* В идеале - плагины для codex, cc, opencode, чтобы не только браузер, а и в нативном агенте работать командой.

Профит - в командной работе над фичами. Например вместе с продукт менеджером и дизайнером работаем над SDD спеками. Или аля whiteboard для прохождения тех собесов (сейчас понемногу все переходят к тому, что аи юзать на собесах можно и нужно, а инструментов пока нет).
В целом вообще вырисовывается полноценная замена обычным митингам, интересно..😮

Как вам идея? Стоящая?) 👍Или все говно, и надо целиться не в дженерик инструментарий (такое под силу раскрутить только условному гуглу😄), а в точную аудиторию (аля мультиплеер аи для разработчиков, мультиплеер аи для собесов, мультиплеер аи для музыкантов). Ну и как обычно написать не проблема, а раскрутить и продать - это именно то обо что все всегда спотыкаются?)
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Продуктивного понедельника, коллеги! 👨🏻‍💻
Вот сайтик в закладки, Canvas эффекты для фронтенда. Если собираетесь делать какой-нибудь стильный нестандартный фронт для своих проектов - закиньте своему агенту.👍

https://canvasui.dev/
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1
Подтверждающее мнение, насчет настоящей инженерной культуры в китайских лабах.👍 Ну и важности девпосовых скилов в наши дни 😉

my spicy theory is that chinese ai labs keep winning because of culture, not talent or resources.

chinese labs still have a deeply hands-on engineering culture. deepseek and kimi are flat organizations where science and engineering are fused: the same people move between algorithms, data, and infra, doing whatever it takes to make the model work.

but sf tech bros have decided that “researcher” is the high-status title while infra is merely support work. every new sf ai startup calls itself a “lab,” every ambitious engineer quietly upgrades their title to “research engineer,” and the infra work is left to whoever failed to escape it.

but at frontier scale, infra determines experiment velocity, and experiment velocity determines research output. at frontier scale, infra **is** research.
Новость прошла мимо меня, а уже во всех пабликах). Реально новый флеш и реально с такими бенчами? Сегодня по-любому буду тестить на сайд-проектах.
В соцсетях сейчас тренд, многие пишут как переходят с GPT 5.6 Sol на Luna в Xhigh/Max эффорте. Якобы на этом уровне эффорта получаем супер качественную модель, выдающие результаты лучше чем какой нибудь Sol Low effort и якобы точно лучше Terra, которая вообще типа не нужна. И это реально частый кейс.

Потестил я Луну, в xhigh, max и luna-pro на этих же эффортах. И чуда не случилось. Модель нифига не быстрая. Дополнительный ризонинг затавляет ее часто делать ненужные для задачи действия. Контекст хоть и лям, но в большом контексте теряется. По итогу задачи делает даже медленнее чем GLM.
Например довольно большой PR на 97 файлов и +3k/-3k, GLM-5.2 (а GLM - эталон для код ревью, really) сделала за 6 минут, нашла 2х P2, 3x P3, 4 грамотных пунктов для рефакторинга. Луна макс педалила 12 минут и нашла один единственный P2 и посоветовала один рефакторинг в виде "можно добавить e2e смок тест". It's pathetic 🙈 В кодинг и дебаггинг тоже надо следить чтобы не наделала косяков, прям вайбы MiniMax-а.

Вобщем нахер нужна такая модель 😄 Оставляю рабочей лошадкой - Terra High. Если вам нужно качественно и недорого - DeepSeek Pro-Preview, новый DS Flash, Kimi K2.7 - все на голову выше Луны. Луна-pro у меня сейчас стоит только в Слак боте по новым пул реквестам и упавшим пайпланам, ну такой небольшой обьем информации она способна разобрать без ошибок и косяков. И то, там стоит не DeepSeek сугубо из за корп комплаенса.

ЗЫ А вот новый DS Flash - это реально чудное чудо, на уровне GLM по качеству, но быстрее и сильно дешевле. Вот только контекст 200к - это блин уже не работает. Когда у тебя все остальные модели на 1кк, и ты обычно держишь чаты на 150-300к токенов контекста, переключаться на модель в 200к проблемно, сразу тупки, попытки сжать через dcp итд, вобщем модель хоть и хорошая, но из рабочего процесса выпадает. Вот когда выйдет новый Prо c 1kk окном и с таким же гениальным пост-тренингом - это будет бомба и явный кандидат на основную рабочую лошадку 👍
Please open Telegram to view this post
VIEW IN TELEGRAM
Как почувствовать себя лошарой-вайбкодером? Все просто, слить 600 баксов не запланированного бюджета 🌡😄

Заливал в прод для текущего проекта свой слак нотификейшн сервис. Когда делал ключ, отписывал что бюджет будет не выше 100$ в месяц, ну в принципе там особо взяться тратам негде, особенно на лайтовых моделях. Первую неделю работает все ок. Апрув на доступ к базе знаний проекта в драйве еще от менеджмента не получил, приложение работало только с нотификацией по мерж реквестам, упавшим пайплайнам, ежедневным engineering digests.
Через неделю мне приходит нотификация от сапорта - ваш бюджет в 100 баксов привышен.🤷‍♂️ Думаю да ладно? Блин, для вопросов-ответов по базе знаний стояла flash модель, а для работы с гитлабом оказывается gemini pro, думаю точно дело в модели, поменяю на флеш.🛠️

Проходит несколько дней, на дворе 2 августа, и мне снова письмо - новый бюджет в $100 уже привышен. 🤯🤯🤯Я в а*уе. Что, уже, за 2 дня? Полезли с сапортом разбираться в биллинг - за пару недель прошлого месяца ушло 550 баксов😭, и сейчас за два дня уже 130. По графикам использования апи видим что запросы в ллм идут все эти дни каждые 15 минут, приехали...

Сначала я подумал, что я настолько лох, что написал работу с гитлабом через ллм. Но нет, в гитлаб мы ходим каждые 5 минут а не 15, и там все детерминистично, через пайтон апи, с ключами дедупликации, в ллм отправляем только реально новые мерж реквесты. 👍
А проблема оказалась в синке базы знаний. Первые дни синк не работал, потом кто-то из менеджеров втихую подтвердил мою заявку на доступ и даже не предупредил. Синк сервис стал молотить файлы из драйва. 800+ файлов, 2000+ файлов создано в вики, но возникла проблема с race condition, из за частого синка прошлый батч не успевал обработаться и как я понял почему-то по новой отправлялся в очередь. Плюс файлы с неподдерживаемыми mime type после ошибки не исключались, а не оставались как новые. Плюс агент в процессе синка создавал свои рабочие питон скрипты и файлы списков прямо в рабочей директории с синканутыми файлами, и с этим тоже косяк. Вот и пожар бюджета, вовремя заметили, извне то все вроде как работало как надо.

Сразу отключил синк на раз в 6 часов вместо 15 минут. Теперь делаю sync hardening, с починкой race condition, exluded folder and mime types (в проекте драйве как оказалось еще и много мусора было, типа логов, траекторий итд), excluding новых mime types автоматом которые модель не смогла обработать, ну и нотификацией в слак на каждый новый синк - что мы синкаем, количество документов, длина очереди итд.✍️


Выводы которые из этого сделал:

1. Ставьте минимум две нотфикации по своим LLM ключам. Одна - базовый лимит, который реально пересечь при нормальном использовании, вторая - большая цифра которая какбы недосигаема, но это страховочный ключ. Допустим мы думаем что лимит 100 баксов в месяц. Поставьте одну нотификацию на 90, а одну на 200. Если бы сапорт поставил вторую нотификацию, я бы не слил эти 6 вечнозеленых листов.😉

2. Лучший вариант - ставить на все свои проекты Langfuse. Он не настолько простой в установке и настройке, компонентов много, но это лучший инструмент для обсервабилити ллм софта. На реальных проектах у нас уже везде (к соажлению не централизованй пока), на моих пет - его нет. Надо себе сделать универсальный установщик (в духе времени - в виде Skills 🧠) и везде его ставить. Потраченые request resources все же окупаются с лихвой за счет понимания как работает с ллм твой софт.

3. Если все же не langfuse - то делай нотификации как твои сервисы работают с ллм. Нет ui - пиши в логи, есть ui - делай дашборды, работаешь со слаком или месенджерами - пиши нотификации в месенджер. Это добавит прозрачности и понимания и позволит избежать таких внезапных косяков.

Удачи вам коллеги в нелегком деле вайбкодинга 🤣 не попадайте в косяки ))
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥1🗿1
А еще в процессе этих фиксов и ревью меня окончательно выбесил GPT 5.6, что Terra, что Sol. Делаю хай лвл план с Sol High, делаю имплементацию по плану на Terra, делаю код ревью с GLM - находит два критикала, штук пяток P2, и с десяток незначительных P3. Race condition починен криво, считай не починен, для миграции данных которую мы запланировали (чтобы не делать весь синк с нуля, мигрируем все файлы из вики в новые индексы с новой метадатой) Terra вообще не подготовила ни-хе-ра.
Хоть в описании багов из ревью и написано как их чинить, запускаю Sol, пусть уже починит нормально. Чинит. Делаю ревью конкретно эти двух новых коммитов - опять 8 штук P2 и с десяток P3 конкретно в этой имплементации от Sol. Ну нахер, опять по кругу. И модельки за эту особо не большую имплементацию сьели $40 токенов (деньги не мои, но все равно жалко😅) Свитчнулся на новый DS Flash, допилил эти два коммита, сделал остальные 15 мелких ишуев, провел второй раунд код ревью с GLM - все ок, буквально одна желтая и пару синих issues осталось.

И я не думаю что это когнитивное искажение, мне реально кажется что с тех пор как я перешел на модели OpenAI я реально очень часто стал переделывать фичи, ишуи в код ревью сыпятся как из ведра. Модели слишком самоуверены, они вот реально никогда не спросят "а что ты хотел на самом деле? а как мы будем делать здесь, вот есть такие варианты?", много и долго думают, принимают решения сами, по итогу с очень умным видом пилят какую-то херню.
Ну и бесят сабагаенты, эти новые openai модельки запускают сабагентов на каждый чих, и когда я говорю Sol "разберись как работает этот сервис/модуль", я хочу чтобы именно Сол сам разобрался, а не запустил мелкую модель в фоне и потом просто перепечатал результат.

Не, я уважаю GPT 5.6, реально огромная работа, в отличии от 5.4-5.5 они хоть научились разговаривать и писать доки нормальным техническим человеческим языком, пользуйтесь на здоровье 👍 Но я ухожу на новый DeepSeek Flash 🌡Ну и GLM конечно.

ЗЫ Sol пока оставляю для дебагинга реально сложных обьемных багов (типа моей прошлой проблемы, когда надо проверить код нескольких сервисов, реальные деплои в кубере, собрать статистику что сьело бюджет, когда и как это произошло), в этом плане модель очень дотошная. И наверное все же оставлю для первого написания SDD спек и планов. Дальше обязательно /review-requirements и /review-design только с GLM. Сол в начале может сильно так наоверинжинерить, но при этом покрыть все даже не очевидные кейсы, а с GLM потом в процессе ревью уже можно довести все спеки в человеческий вид.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
А вот огонь фича заезжает в Github - Stacked pull requests. Возможность разбивать большой PR на пачку отдельных бранчей+sub-PR, ревьювать все по отдельности, а мержить все вместе через merge queue. Как я понял от сорс бранча сначала создаешь новый бранч который является bottom нового стака. Дальше от этого стака можно ветвить сколько угодно бранчей, которые все обьединятся в один Stack PR. Никаких мержей/ребейза ориджина, когда тебе надо смержить несколько PR по очереди. Никакого нытья про то, кто будет ревьювать +-10к пул реквест.🤗

И мне кажется что эта фича - просто гениальна в свой простоте и четко вписывается в сценарии агентской разработки 🧠 Вобщем надеюсь будет не только в Enterprise, ну и Gitlab поскорее бы ее скопировал 😁
Please open Telegram to view this post
VIEW IN TELEGRAM
Опять пост "старческого брюзжания" про модели 😅 Отказался от нового DS Flash 😁 Конечно пост тренинг там гениальный, когда такая мелкая и быстрая модель так хорошо гоняет техничские вопросы и так качественно ориентируется в консоли. И я верю бенчам, явно на эти бенчи модель специально натаскивали. Но реальная работа - это не бенчи, и в реальных задач флеш хоть и хорош, но я совсем не вижу разницы по сравнению с прошлой Pro-Preview. Но в одном разница есть, это качество языка аутпутов и структурирование текстов. И в этом Pro как более крупная модель побеждает и это видно невооруженным глазом. Так как, то, как модель тебе пишет ответы и насколько ее ответы понятны - это очень важный пункт для качественной работы, я вернулся на прошлую Pro.

Такие дела. Ждем новую прошку с таким же крутым кодинг пост тренингом 🌡
Please open Telegram to view this post
VIEW IN TELEGRAM
Я тут просто в ах*е от самоуверенности Sol. Решил сделать новую фичу для своего слак ассистента, запустил для Sol Medium /new-requirement команду из AI-Devkit для сбора данных по требованиям, модель задала буквально пару самых простых вопроса, и дальше сидит пидалит доки. И тут рапортует - доки сделала, сама провела все ревью, и /review-requrements и /review-design, все у меня сделано круто, так что можем начинать имплементировать код. 🤯

Первый раз вижу такое, там четко в команде задано, что юзер отдельно проводит ревью, а тут сама написала, сама заревьювила, сама сказала "я молодец, все сделала четко" 🤣
Готовлюсь к Claude Architect сертификации (при всей моей нелюбви к Антропикам серт получить то надо 😅 и для компании и для своего CV). Нарыл в интернете pdf-ки с моком экзамена (Developer и Architect Foundation), загнал в LLM, прошел мок на 95%, показался весьма легким.

А вот нашел еще один сайт, который предлагает бесплатные материалы для подготовки и единый мок экзамен для проверки знаний в целом. Вот он мне показался реально сильно сложнее, сдал на 72%. Ну теперь вижу свои гэпы и понимаю что подтянуть. Вобщем если думаете готовиться тоже, максимально рекомендую этот сайтик 👍

Моки в pdf выложу в коментах
Please open Telegram to view this post
VIEW IN TELEGRAM