🚀🐳 Летит Кит: SRE и не только
200 subscribers
119 photos
2 videos
5 files
109 links
Дмитрий Синявский, SR-иженер и спикер (@r3code)

Заметки о замеченном и замечательном.
SRE, SLI/SLO, логи, наблюдаемость.
Кейсы.

₽: Консультации, аудит SRE практик, организация SRE без SRE, разработка ПО на заказ

Дублирую в MAX https://clck.ru/3Sr7qM
Download Telegram
В первый раз побывал на Summer Merge в Ульяновске. Лекции под соснами на кубиках из сена - это атмосферно.

Я выступал в роли Амбассадора набросков - это мое хобби. За два часа меня нарисовали более 100 раз 😄 Более 20 человек сначала стеснялись, а потом вместе смеялись, когда с 5 и 3 минут мы перешли к рисованию за минуту. Это было классно. Прикреплю несколько работ.

Было под 2000 человек, но это не ощущалось как давка, всем хватало места. 

Это было как маленький отпуск в пионерском лагере 🏕️ Думаю поеду еще.

#summermerge #конференции
❤‍🔥5
Попробовал разные IDE для Kubernetes

Для можно использовать всегда консольную kubectl, но так как я не постоянно там сижу - это забывается. В IDE же встроен и поиск и удобный переход.
Первой такой была Lens - коллега DevOps посоветовал, и действительно классная штука. Быстро работает.

Но в какой-то момент что-то поломалось в обновлении и при загрузке перестало появляться окно в Windows. Потому пошел искать альтернативы.
Первая FreeLens бесплатная и открытый код, повторяет Lens в большинстве функций, но есть баги - подгружает список конфигов только при старте, если добавишь, новые - перезапускай приложение.
Seabird - вообще еле завелось, тормозит ужасно, даешь ему куб конфиг сразу с токеном в теле, а он его не читает и надо руками указать еще раз при добавлении кластера.
HeadLamp - бага, на Windows не загружается полностью, конфликтует внутренний сервер с системными портам.

Короче пока самый надежный оказался консольный k9s.

#kubernetes #ide
🔥1😁1
Forwarded from Мониторим ИТ
vmestimator

Утилита vmestimator отслеживает кардинальность и предоставляет результаты оценки в виде метрик . Это позволяет своевременно оповещать ответственных товарищей о скачках кардинальности и быстро идентифицировать проблему.

Отслеживание кардинальности — наиболее практичный вариант использования, но не единственный. vmestimator также можно использовать для измерения кардинальности по произвольным параметрам меток, что позволяет его применять для анализа использования каждого тенанта, отслеживать долгосрочные тренды и планировать мощности.

Репыч на Гитхаб

📱 Telegram | 📲 MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
👍21
Управление расходами на IT для CTO

Как FinOps помогает увидеть спрятанное, выключить ненужное, сэкономить деньги.

Да мы с вами строим большие и классные системы, которые дают много пользы, но чем больше объектов тем легче они теряются и про них забывают.

Помню как нашли сервер, который 3 года жил потреблял 0.1cpu при выделенных 2 - просто забыли Легаси сервис вывести.

С чего начинать? С инвентаризации, Зиночка! С инвентаризации! Да нам повезло, кажется, больше - не надо лазить и поднимать стулья и лампы, чтобы проверить номер. Но это не означает, что это проще, так как количество объектов растет с глубиной погружения.

Сначала мы начинаем с физических серверов, систем хранения, потом виртуальные машины, ноды kubernetes, сервисы и системы. Все это в итоге дает понимание какой сервис, что использует.

Можно ли это делать вручную, как Зина? Можно, только вам это предстоит делать постоянно, а не раз в год. Потом для ИТ-систем нужен автоматизированный сбор данных, разметка ресурсов в момент их создания и выделения. В итоге вы получите большой граф и понимание сколько у вас вычислительных ресурсов выделено 🤔

И это не все. Дальше вам нужны реальные метрики потребления ресурсов. Зачем?
Как раз для повышения эффективности утилизации. Мы с вами знаем, что разработчики часто любят выделить ресурсы про запас и забыть про это.

FinOps позволяет проводить регулярный аудит и управление ресурсами для сокращения затрат  💰.

Кроме того это позволяет затраты мониторить также и создавать FinOps инциденты с последующим расследованием и постмортемом. Как раз на SaintHighLoad 2026 ребята из Купер рассказывали случай, что отловили аномалию - за облако пришел счет на 20% больше, выяснили что скидки провайдера не применились в последнем месяце!

Подумаем вместе: как собирать данные инвентаризации, их хранить, объединять и анализировать?

Свои идеи и инструменты буду озвучивать в следующих постах.

#sre #FinOps #инциденты #cto
Распределённая трассировка для 1С. ЧТО?

Привет, киты 🐳!

Разбирались с коллегами с распределенной трассировкой, писали как мы видим это у себя, чтобы люди делали одинаково и предсказуемо, а именно просто подключали бы нашу либу/пакет в проект и почти все уже было бы настроено.
Начали с того, что решили договориться. Стандарт по логам и метрикам у нас уже был, а по трассировке нет.

Подключились и коллеги разрабатывающие под 1С с вопросом, а нас сюда как?
Как ожидал, нет тут готовых решений и OTEL SDK 1C.

Что же можно сделать и как?
Нужно
1. отправлять спаны в коллектор из 1С
2. передавать контекст трассировки в вызовах из 1С, например, в HTTP или Kafka
3. извлечение контекста из входящих вызовов и прокидывание его внутри 1С

Как отправлять спаны
В1. Если не критичны задержки, то можно отправлять на HTTP endpoint OTEL Collector. Вызов будет в код синхронным, потому тут нужны короткие таймауты. Также можно, кстати и в PHP приложениях делать. А OTEL Collector лучше поставить сайдкаром прямо рядом с 1С, чтобы задержки были минимальные.
В2. Асинхронно. Через логи. Создаем файл 1с-traces.log (ротацию мы конечно не забыли включить) и в него скидываем готовые JSON со спанами, читает это файл агент типа Vector/FluentBit, готовит и отправляет в OTEL Collector

Как извлечь контекст трассировки
Читайте заранее определенные заголовки или метаданные, параметры фоновых задач (контекст трассировки в них надо явно передавать). Создавайте спан из них.

Как передавать контекст трассировки
В1. Линейный код (в рамках одго вызова). Добавьте доп параметр КонтекстТрассировки во все функции явно и передавайте.
В2. В рамках одного сеанса. Передавать через Параметры Сеанса (глобальное хранилище для текущего пользователя/сеанса HTTP). Работает только в рамках одного потока (сеанса). Если внутри кода вызывается фоновое задание, параметры сеанса туда автоматически не перенесутся.
В3. Передача в Фоновые задания. Самый частый сценарий в 1С: HTTP-сервис быстро принимает запрос, записывает документ и передает задачу фоновому заданию для отправки в Kafka. Передавайте структуру с TraceID и текущим SpanID внутрь массива параметров фонового задания. И доставайте в фоновом задании контекст для отправки спана если надо.
В4. Использование БСП (Библиотеки Стандартных Подсистем). БСП предоставляет готовые механизмы архитектуры, к которым можно «подцепиться», чтобы протащить TraceID от входа к выходу. Используйте ДополнительныеСвойства объектов, куда кладите контекст трассировки.

Интересно в реальности кто-нибудь делал такое у себя, ведь у многих компаний 1С часть бизнес-процессов многих?

#observability #1С #трейсинг #sre #distributed-tracing
Forwarded from Мониторим ИТ
One-command OpenTelemetry setup on Linux hosts

Множество приложений на Java, .NET, Node.js и Python, работающие на Linux-хостах, до сих пор не имели автоматизации. Для их мониторинга приходилось вручную загружать агенты и самостоятельно настраивать переменные окружения. На конференции OTel Unplugged EU в Брюсселе в феврале этого года постоянно звучал один и тот же вопрос: понятные инструкции по упаковке, установке и использованию. Вы просили:

{apt|yum} install opentelemetry

И теперь вы действительно можете это сделать!


Этот пакет устанавливает OpenTelemetry Injector вместе с SDK OpenTelemetry и пакетами автоматической инструментации для Java, .NET, Node.js и Python. Injector подключается к запуску процессов на хосте и активирует соответствующую автоматическую инструментацию для приложений без изменений в коде приложения или скриптах деплоя.

Подробнее в блоге OpenTelemetry

📱 Telegram | 📲 MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
Дважды буду на ПерфКонф #12

Привет, киты 🐳!
Выступаю на ПерфКонф второй год подряд.
Вас жду на доклад - раз, круглый стол по мониторингу - два-с!

Точное время будет в программке на 👉 perfconf.ru - конференция о производительности и отказоустойчивости ИТ-систем

Приходите 9 сентября 2026 офлайн:
📍 Москва, Loft Hall на м. Автозаводская
💻 Можно подключиться онлайн

Доклад будет про SLO - как можно наколоться, делая все вроде бы правильно. Случаи из практики.

В программе - нагрузочное тестирование, оптимизация производительности, DevOps и CI/CD, SRE и Observability, AI и хаос-инжиниринг. Практические кейсы без воды и возможность лично пообщаться со спикерами и коллегами из индустрии.

Буду рад увидеться, обсудить доклад и ответить на ваши вопросы.

» 👉 Регистрируйтесь и приходите: perfconf.ru «

#ПерфКонф #Performance #SRE #DevOps #НагрузочноеТестирование
👍5❤‍🔥1
Извлечение данных из разных документов для AI быстро

Мы в своей работе все больше используем AI и пайплайны автоматизации. Одна из задач доставать тексты из документов, чем быстрее тем лучше.
Потому что например LLM может тот же docx начать разбирать как XML и потратить много токенов и времени на это, или начать ставит по пути доп библиотеки для разбора, что не уменьшает время обработки.

Есть библиотека или тул на Rust для этого. Ставится локально утилитой и конвертирует практически любой документ, содержащий текст, в Markdown с сохранением заголовков и логики. Использовать или скиллом, или упомянуть в правилах (для экономии контекста).

Конвертация 10-100 страниц с текстом на 100-900кб занимает 50-130 мс.
Хорошо справляется с офисными форматами, pandoc не ровня.
Осознанно не умеет: обрабатывать картинки, просто их пропускает. Из pptx с картинками вы получите 500 байт текста на несколько слайдов, то есть только обертку, а из pdf со сканом вообще ничего.
Для агента с возможностью читать картинки - это не проблема, тот же Claude, и GPT умеют читать картинки.

Скачать: https://github.com/firecrawl/anydoc

#ai-tools #ai #markdown #инструменты
🔥3
Метод для выявления работ написанных с применением ИИ

Привет киты! 🐳 Забавная статья попалась по теме проверок работ студентов на написание текстом ИИ https://habr.com/ru/articles/1067420/

Профессор вставил белым шрифтом на белом слово Madagascar в документ-задание по эссе про промышленную революцию. Человек при чтении его не видел, а при копировании и вставке в диалог с LLM оно конечно передавалось, что заставляло модель его использовать в ответах и иногда генерить вообще бессмыслицу.

Результат эксперимента: 32 из 35 работ содержали это слово и бессмысленные предложения с ним! - ну чистый наивный вайбкодинг с полным доверием результату и без его валидации ))

Что это дает нам? То что валидация результатов - это все еще ваша ответственность. Вы тот человек который отвечает за переданную информацию, вы ее добыли и обработали, ссылка на "это ИИ криво написал" не прокатит. Если бы нужна была работа такого качества - вас бы не было в цепочке.

У меня ко всем ответам подозрение, иногда даже в очевидной и знакомой тебе теме может попасть ляп. И даже валидация другой моделью не всегда помогает. Потому глаза и мозг в деле - тратим калории и вкладываемся в результат сами.

История из жизни:
Я так новые инструкции на бумаге давал читать людям. Обычно где-то на 3-5 странице в текст было вставлено название животного или слово явно не из этой темы (как у профессора), которое при прочтении ну явно бросалось в глаза.
В вопросах на проверку были обычные вопросы на понимание, несколько штук. И один на проверку внимания: какое животное упоминалось в тексте? В первый раз 4 из 4 не сдали.

А вы валидируете ответы ИИ сами?

#ai #внимание #методика #проверка
❤‍🔥2
Недавно прошла Agentic Dev Conf 2026

Привет, киты 🐳!

Что, думаете, полезного можно из нее унести?

Во-первых, сможете решить сами по программе тут https://agenticdevconf.ru/schedule

Доступны к скачиванию презентации, и, новинка! - md транскрипты! Можно затащить их к себе на анализ, а понравившееся сразу сохранить в свою память - я конечно про базу знаний личную.

Во-вторых, лично меня интересует многоликий Harness 🥸😎🤓🧐 - доклад "Как собрать свой Agentic Harness и что это такое"
https://agenticdevconf.ru/talks/astapenko_artem. А то это слово обрасло уже слишком многим, чтобы пониматься однозначно.

Из доклада:
Попросите агента чтобы он взял, посмотрел все, что я делаю, и составил некоторую LLM-вики, ну или просто некоторую базу знаний, вообще всех подходов, все, что мне нравится и не нравится. И это очень интересный трюк. Обязательно попробуйте.

🖐 А вас какие темы заинтересовали?
О постановке задач и проклятии знания

Бул-буль,привет, Киты 🐳!

Вы замечали, что часто задача поставленная вами другим делается не так как вы думали? 🤔

Причем нормально ставишь задачу, указываешь подобно, что было, что есть, материалы где читать, критерии готовности - а на выходе почему-то не то и еще пояснять надо.

Общаясь с ИИ-агентами переспрашиваешь уже: как ты понял, есть ли дополнительные вопросы - и корректируешь перед началом.

Блин! Оказывается с людьми также работает!

Вот тут прочитал https://t.me/Malkov_Life/432 - это "проклятие знания". Ты не можешь зная, прикинуться незнающим и корректно взглянуть на ту же задачу "другими глазами", причем оказалось, что подробность описания уменьшает % непонимания, но не сводит на нет.

А делать что?
Проверять понимание. Пересказ задачи, кратко.
Одна задача, и вместо «всё понятно?» просьба рассказать:
1. С чего ты начинаешь?
2. К какому результату придешь?

Это не проверка человека. Это единственный доступный способ увидеть свою задачу без своего знания.

🖐 Попробуйте недельку.
Поделитесь наблюдениями, сколько из того, что вы считали сказанным, вы на самом деле не сказали?


#cto #teamlead #менеджмент #восприятие #искажения #делегирование
Реклама конференции в которой я выступаю. Если вы думали, пойти или нет, а хотели пойти с другом, то это отличный шанс сходит вместе.

🌟 Уникальное предложение для участников ПерфКонф №12! 🌟

🎟 Купите 1 билет на конференцию и получите второй в ПОДАРОК! 🎟

Не упустите шанс погрузиться в мир производительности и оптимизации вместе с ведущими экспертами отрасли. На ПерфКонф №12 вы сможете:

• Узнать опыт, технологии и решения от экспертов ведущих
ИТ-компаний
• Без воды и непроверенных выводов: все доклады проходят модерацию программного комитета
• Готовые ответы и наработки коллег «по цеху», которые можно использовать в своих проектах
• Сообщество профессионалов по интересам: нетворкинг, новые знакомства и общение со спикерами

💡 Спешите! Акция действует до конца августа!

👉 Закажите свои билеты уже сегодня и приходите на ПерфКонф №12 с другом или коллегой! Вместе вы сможете открыть новые горизонты для вашего бизнеса!

🔗 [https://perfconf.ru/#tickets]

Не упустите свой шанс — ждём вас на ПерфКонф №12! 🚀

perfconf.ru
ПерфКонф #12
Не пропустите PerfConf 2026 - ведущую ежегодную конференцию по нагрузочному тестированию. Конференция собирает ведущих экспертов в области нагрузочного тестирования, практик DevOps, аналитики данных и стратегий IT и бизнеса. Расширьте свои знания, наладьте профессиональные связи и откройте новые возможности для роста вашей компании в меняющемся IT-ландшафте. 🌸🌸При возникновении вопросов обращаться к Карине @notmilashka. Промокод: for_friends


#реклама
❤‍🔥2
Важное про безопасность с чужим кодом - еще раз.

Привет, киты 🐳!

TL; DR; на чужих AI-скиллах (например с skills.sh)
1. используй проверку после скачивания через https://github.com/nvidia/skillspector
2. машину проверяй через https://github.com/perplexityai/bumblebee

Сегодня редко кто вспомнит про заражение репозиториев GitHub и пакетов npm вредоносным кодом. Если вспомните были вредоносы безобидные - налили баннерами и надписями на вашем сайте, а были и майнеры и шифровальщики. Благо теперь есть проверки и вы можете спать спокойно .. Или нет¿

Или нет. В эпоху ИИ мы все больше скачиваем тесты готовых скиллов, чтобы делать работу быстрее. Но есть ли антивирусы для текста?
Да да, вредонос можно прописать в текст скилла и он выполнит его на вашей машине как команды, и начнет для кого-то майнить крипту 💰

Яркий пример у Эдгара в блоге https://t.me/zergslaw_channel/521

#ai #безопасность #infosec #ai_skills #tools #инструменты
О важности отдыха

Привет, киты! 🐳

Оказалось я забыл как отдыхать.

Перед отпуском делал задачу по переделке нашего AI-ассистента поддержки для SRE/DevOps и это причинило мне дискомфорт, так как было новое и непонятное. Мозгу потребовалось несколько дней на принятие и осмысление, выяснение краевых случаев. Нужно было время освоиться.

Приехав в отпуск я был удивлён - отдыхать получилось начать только с 4 дня, когда все вводные стали ясны и мозг отдал автоматике контроль ситуации. Смотрю, что получится с вкатыванием в работу.

Ведь в отпуске я был без ноутбука, без рабочих чатов, без чтения по it-темам - полная отключка... Получилась бы 😅 Если бы я не встретил продакт-менеджера 😈
Как блин, еще можно было стоя в плавках на пляже узнать, что Александр Поломодов ушел из Т-Банк и уезжает в Лондон работать 🙈

Тем не менее 3 дня были полноценно отданы отдыху - почувствовал это по возвращению.

А как вам удается отдыхать? Быстро ли удается отключиться от работы?

#work_life_balance #wlb #работа #отдых
🎉2
Toil в работе SRE. Измерять, или "мы и так знаем что работы дофига“?

Привет, киты 🐳. Поразмышляем.

Коротко про базу, чтобы синхронизировать понятия.

Что такое Toil?
По определению Google SRE, toil - это операционная работа, которая:
- ручная и повторяющаяся
- автоматизируемая
- реактивная, а не стратегическая
- не создает долгосрочной ценности
- масштабируется линейно с ростом сервиса

Toil и технический долг - одно и то же? Нет. Технический долг - это компромиссы в архитектуре/коде, которые усложняют будущие изменения. Toil - это операционные затраты на поддержку системы. Часто техдолг генерирует toil, но это разные категории. Погашение долга - engineering work, ручное обслуживание последствий - toil.

Плановые задачи vs задачи дежурства. Что из этого toil?
Не инструмент и не источник задачи определяют суть, а её характер:
- "Раз в неделю вручную чистить логи на 50 нодах" из беклога - toil.
- "Написать оператор для авто-очистки" - engineering.
- "Дайте доступ", "Почему не деплоится", "Перезапустите под" из дежурства - классический toil, особенно если повторяется.

Как понять, что пора автоматизировать?
1. Замерить. Без цифр всё субъективно.
2. Оценить ROI: время на разработку автоматизации vs время, которое она сэкономит.
3. Начать с простого: структурированный запрос -> бот -> подсказка или маршрутизация.
Именно так мы сейчас делаем: бот отвечает на частые вопросы разработчиков и зовет нужного специалиста (DevOps/SRE/DBA) в зависимости от контекста. Это классический первый шаг который предлагает Google.

Целевой toil ratio для SRE-команды по гайдлайнам Google - не более 50%. Остальное инженерная работа - проекты, которые уменьшают будущую рутину и повышают надежность.

🥸 Измеряете toil ratio у себя? Если нет - что мешает начать: отсутствие метрик, времени или просто неочевидна ценность?

#SRE #Toil #Автоматизация #ИнцидентМенеджмент #ЛетитКит #SLO
Споры про искусственный интеллект в SRE изменились.

Мы уже не гадаем, заменит ли агент дежурного инженера. Мы решаем, где именно провести черту его полномочий.

Сейчас тренд такой: агенту разрешают расследовать инцидент, но запрещают его чинить. И это логично, потому что граница проходит по цене ошибки.

Если агент ошибается в анализе, он просто тратит наше время. Если он сам что-то меняет в проде без человека - это катастрофа. Свежие тесты это подтверждают: на сложных задачах точность поиска корневой причины падает до 10 процентов, а в 40 процентах случаев модель просто выдумывает связь, цепляясь за внешний симптом, а не за истинную проблему.

Как выстроить эту границу на практике, чтобы не получить генератор галлюцинаций:
1. Настоящий режим только для чтения. Нужно следить, чтобы простое чтение данных агентом не запускало скрытые действия в базе или не блокировало процессы.
2. Жесткое вето со стороны. Если агент предлагает откатить релиз или добавить ресурсов, проверять это действие должен обычный, предсказуемый скрипт. Это правило должно жить в отдельном месте, куда у агента нет доступа на изменение.
3. Обратимость действий. Автоматизировать стоит только то, у чего есть четкий и быстрый откат. Перезапуск или масштабирование - это временное решение, а не настоящий фикс. Финальное решение и применение изменений в проде всегда остаются за человеком.

Даже самые радикальные сторонники автоматизации дежурств начинают с того, что дают агенту только чтение телеметрии и сравнивают его выводы с человеческими. Без фундамента в виде нормальных SLO и понятных метрик AI-агент не спасет, а просто будет быстрее ошибаться.

На каком этапе вы готовы доверить автомату реальное действие, а не просто анализ?

#sre #oncall #ai #observability #slo #incidentmanagement

Макс писал в деталях тут https://t.me/youngmaxnotes/131