Мониторим ИТ
8.47K subscribers
313 photos
2 files
1.66K links
Канал о наблюдаемости (Observability): логи, трейсы, метрики.

Реклама: @gals_ad_bot
Вопросы: @antoniusfirst

@usr_bin_linux — Linux

@zabbix_ru — Zabbix

@elasticstack_ru — ElasticSearch/OpenSearch
Download Telegram
Collecting Docker Container Logs with OpenTelemetry

Логи в Docker — это иногда поиск причины падения прода в трёх контейнерах, пяти compose-проектах и нескольких гигабайтах JSON.

Из этой статьи вы узнаете про то, как построить observability-пайплайн с OpenTelemetry, пройдете. путь от docker logs -f до централизованного сбора, структурирования и обогащения логов через OTel Collector. Будет полезно тем, кто уже устал от Fluent Bit, Fluentd и зоопарка агентов.

OpenTelemetry постепенно становится не только стандартом для трейсов и метрик, но и вполне зрелой платформой для работы с логами. И чем раньше начать строить пайплайны вокруг OTel, тем меньше придётся заниматься очередной миграцией через пару лет.

📱 Telegram | 📲 MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7🔥3
Разместил запись подкаста Как учиться в IT, когда AI всегда под рукой? с Ильёй Шишковым.

Поговорили про вопросы обучения с AI, обсудили спорные моменты такого обучения, стоит доверять ИИ свое обучение, поможет ли AI вкатиться в IT, есть ли у разработчика обида на снижение порога входа в профессию и про многое другое.

Запись по ссылке

❤️ Лайки и подписки горячо приветствуются.

📱 Telegram | 📲 MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥53👎2🤔1
Создаем автономный анализатор логов на локальных ИИ-моделях

В этой статье рассказывают как анализировать логи при помощи ИИ. Статья написана для рекламы серверов, но там есть интересный практический пример настройки аналитики логов.

📱 Telegram | 📲 MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥3👍2
24 июля в 20:00 мск приглашаю вас на воркшоп:

Эталонная установка Zabbix: строим Production-ready инфраструктуру с нуля

За время воркшопа мы:

Развернём кластер PostgreSQL высокой доступности
Настроим отказоустойчивый Zabbix Server
Поднимем Zabbix Web и HAProxy
Настроим TLS между компонентами
Разберём сертификаты, шифрование и безопасные подключения
Настроим автоматическое переключение при отказах
Проверим работу всей системы на практике

В результате вы получите понимание того, как строится современная отказоустойчивая система мониторинга и какие решения действительно работают в проде.

По ходу вебинара буду отвечать на вопросы и разбирать ваши реальные кейсы.

Регистрация

P.S. На следующей неделе (22-26 июня) у нас стартует тренинг Zabbix сертифицированный специалист, осталась буквально пара мест. Приходите!
👍9🔥52👎1
Как eBPF меняет правила безопасности и наблюдаемости в Kubernetes

Сейчас никого уже не удивишь фразой «мы используем Kubernetes в продуктивной среде». Но, удивляет другое: как многие до сих пор мирятся с сетевым стеком, собранным на коленке из iptables и молитв. Пока вы спите, ваш kube‑proxy методично перебирает цепочки правил, словно архивариус в пыльном подвале. А ведь на дворе — эра eBPF, когда сетевая магия творится прямо в ядре, без лишних телодвижений и копирования данных.


В этой статье разобрано, почему классический подход с iptables рассыпается при первых признаках нагрузки, как eBPF с XDP переписывает правила игры и почему даже в 2026 году не все так однозначно с «бесплатным ускорением».

📱 Telegram | 📲 MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥8👍42
OpenTelemetry Collector: Architecture & How It Works

В этой статье разобрано как работает OpenTelemetry Collector: приемники, обработчики, экспортеры и расширения, как он развертывается в Kubernetes и как запустить его локально.

📱 Telegram | 📲 MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5👍43
Prom++: как сжать разметку метрик Prometheus и снизить расход памяти в 2,5 раза с помощью статистики данных

Миллионы метрик, чистый код, но аллокатор показывает в разы больше памяти, чем должно занимать «полезное» содержимое. Профайлер светит на парсинг, а вы гадаете: куда деваются мегабайты?


Prom++ — это оригинальный Prometheus, переписанный на C++ командой Флант. Оптимизированы потребление RAM (среднем в 7.8 раза меньше), CPU (среднем в 2.2 раза меньше), cобственный оптимизированный WAL, агрессивное сжатие WAL. Ну, и вишенка на торте — практически (отличается в части WAL) полная совместимость с Prometheus.

К сожалению, на стоимость долговременного хранения и передачи данных в S3 Prom++ не сильно повляет.

Читать статью на Хабр

Читать статью о том, как устроен Prom++

Репыч Prom++ на Гитхаб (там же кратко описан механизм миграции с оригинального Prometheus)

📱 Telegram | 📲 MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7🔥52🤔1
Как мы внедряли SLO в платформу, которая отвечает за наблюдаемость в банке

В этой статье Т-Банк делится кейсом внедрения SLO для собственной observability-платформы Sage. Рассказали про глубинные интервью с пользователями, чтобы понять реальные ожидания от платформы и только потом сформировать SLI и SLO.

📱 Telegram | 📲 MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥52👍2
OpenTelemetry Filelog Receiver: A Guide to Ingesting Log Files

На практике один из самых востребованных компонентов OTel Collector — Filelog Receiver, который позволяет превратить обычные текстовые лог-файлы в полноценные OpenTelemetry LogRecords.

В этой статье разбирается, как настроить сбор логов из файлов: от простого чтения JSON-логов до production-конфигураций с обработкой ротации, multiline-сообщений, регулярными выражениями, обогащением атрибутами и сохранением позиции чтения после перезапуска Collector. Отдельно показаны бэст прэктис и типичные ошибки, которые встречаются при работе с Filelog Receiver.

Весьма полезное руководство для всех, кто строит стек наблюдаемости на базе OpenTelemetry и хочет отказаться от привязки к агентам конкретных вендоров.

Читать в блоге dash0

📱 Telegram | 📲 MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5🔥42
Проведу тренинг ElasticSearch 8-10 июля

Освойте Elasticsearch на практике за 3 дня, научитесь уверенно использовать его в промышленной эксплуатации и быстро погрузитесь в тему.

За 3 дня вы:

Разберётесь с архитектурой Elasticsearch и принципами работы кластера.

Научитесь правильно проектировать mappings и выбирать типы данных.

Освоите Query DSL — от простых запросов до сложных агрегаций и полнотекстового поиска.

Поймёте, как работают анализаторы, токенизаторы и скоринг.

Настроите отказоустойчивый кластер, репликацию, резервное копирование и восстановление.

Разберёте ILM, Data Streams, Ingest Pipelines и другие механизмы жизненного цикла данных.

Выполните десятки лабораторных работ на готовой инфраструктуре и получите опыт, максимально приближенный к реальным задачам.

Тренинг уже на следующей неделе! Следующий такой только в октябре.

Программа ElasticSearch 8-10 июля

Вопросы можно задать мне в личку @antoniusfirst или через форму обратной связи на странице с программой тренинга.
🔥4👍31
Вышла Grafana 13.1

В новом релизе команда сделала акцент на концепции Observability as Code, расширила возможности AI-ассистента и упростила работа с дашбордами. Ниже — некоторые из нововведений.

🚀 Git Sync стал еще удобнее

Теперь можно импортировать JSON-дашборды напрямую в папку, синхронизируемую с Git. Во время импорта можно сразу выбрать ветку, путь к файлу, сообщение коммита и workflow — всё автоматически попадет в репозиторий. Кроме того, Git Sync получил поддержку подписанных (Verified) коммитов, отображение README.md в интерфейсе и возможность синхронизации дашбордов в корневую папку Grafana.

🚀 Section-level Variables стали общедоступны

Переменные уровня секций (строк и вкладок), впервые появившиеся в Grafana 13, теперь получили статус General Availability. Они позволяют задавать разные значения переменных для отдельных частей дашборда, делая его более компактным и удобным.

🚀 Улучшенный редактор запросов

Новый Query Editor получил поддержку множественного выбора запросов, массовых операций и режима отображения «stacked view», что упрощает работу со сложными дашбордами. Пока функция доступна в Public Preview.

🚀 Сопоставление одной переменной нескольким значениям

Функция Mapping one variable to multiple values теперь доступна всем пользователям OSS и Enterprise. Она позволяет использовать одну переменную сразу для нескольких свойств и делает шаблонизацию дашбордов более гибкой.

Grafana становится всё интереснее и интереснее. Подробнее в блоге Grafana.

📱 Telegram | 📲 MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥13👍43
vmestimator

Утилита vmestimator отслеживает кардинальность и предоставляет результаты оценки в виде метрик . Это позволяет своевременно оповещать ответственных товарищей о скачках кардинальности и быстро идентифицировать проблему.

Отслеживание кардинальности — наиболее практичный вариант использования, но не единственный. vmestimator также можно использовать для измерения кардинальности по произвольным параметрам меток, что позволяет его применять для анализа использования каждого тенанта, отслеживать долгосрочные тренды и планировать мощности.

Репыч на Гитхаб

📱 Telegram | 📲 MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
👍8🔥63
Прекратите запускать по 5 агентов на каждом сервере — используйте Grafana Alloy

В этой статье разобран практический пример замены Prometheus + Node Exporter + Promtail + MySQL Exporter одним агентом Grafana Alloy.

📱 Telegram | 📲 MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥7👍42
Пошаговое руководство по настройке безопасности конвейеров наблюдаемости с помощью Vector от Datadog (перевод статьи)

Vector — инструмент с открытым исходным кодом для построения конвейеров наблюдаемости. Он настраивается для сбора, преобразования и маршрутизации логов, метрик и трассировок в любую поддерживаемую систему назначения из списка поддерживаемых Datadog получателей.


В этой статье автор показывает, как собирать метрики Prometheus из приложения, работающего в кластере Kubernetes, и передавать их в экземпляр Prometheus, размещённый на виртуальной машине в другом географическом регионе, используя Prometheus Remote Write.

📱 Telegram | 📲 MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥53
Introducing AI dashboard and workflow generation in ClickStack

Сообщают о появлении функции генерации дашбордов с помощью ИИ в ClickStack. Вместо ручного создания дашборда теперь можно описать, что хотите получить, и ClickStack это генерирует.

Фича выглядит интересно, нужно попробовать.

📱 Telegram | 📲 MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥6👍52
OpenTelemetry Filelog Receiver: руководство по приему лог-файлов

Логи можно читать и обрабатывать солидным количеством инструментов: Filebeat, Vector, Fluentbit, vlagent, Grafana Alloy и, наконец, OTel Collector. О нем и пойдет речь в этой статье, которую мы с командой для вас заботливо перевели. А если точнее, то о настройках Filelog receiver, настройки которого позволяют читать лог файлы.

OTel Collector — унифицированный вендоронезависимый инструмент, который можно использовать для полного покрытия задачи сбора данным наблюдаемости: метрик, логов и трейсов.

Для решения задачи логирования я чаще всего в проектах использую Vector, однако, могу назвать OTel Collector восходящей звездой, на которую тоже стоит обратить внимание. С учетом того, что на нем можно построить унифицированный стек наблюдаемости.

📱 Telegram | 📲 MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5🔥52
Что будет, если доверить стандартизацию логов лингвисту

Логирование редко воспринимают как отдельную инженерную задачу. Обычно оно появляется «по пути»: написал сервис, добавил несколько logging.info() и забыл. Но когда сервисов становится десятки, оказывается, что качество логов влияет на разработку не меньше, чем качество кода.

Документация, логи, ошибки — все это тоже язык. И если у языка нет грамматики, словаря и правил, очень быстро он становится непредсказуемым.

Мы довольно быстро стандартизировали код: подключили Ruff, типизацию и тесты. И обнаружили, что следующий источник неоднозначности — логирование. Даже после перехода на structlog одинаковые события продолжали называться по‑разному. Именно тогда мы решили посмотреть на логирование как на язык.


Стандартизация логов — очень полезное мероприятие, которое во многих организациях часто откладывается как не срочная задача, однако, на дистанции она даст значительный буст в части снижения времени локализации проблемы. В этой статье как раз разобран один из подходов.

Если вы планируете заняться этой задачей по-взрослому, обратите внимание на Logs Data Model от OpenTelemetry.

📱 Telegram | 📲 MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
👍8🔥63
Сбор логов Docker-контейнеров с помощью OpenTelemetry

Расскажите в комментариях как вы собираете логи Docker. Решение в лоб — чтение /var/lib/docker/containers/<container-id>/<container-id>-json.log, но как только контейнер удалится, соответствующий лог-файл тоже затрется.Да и не всегда удобно читать лог-файлы прям на том же сервере, где они записываются.

Один из изящных вариантов решения этой задачи — использование драйвера логирования fluentd, который отправляет логи непосредственно на совместимый с Fluentd эндпоинт (спойлер: otel-коллектор). Логи передаются через сокет сразу после их создания, поэтому отсутствует необходимость в чтении файлов, а также не требуется настраивать конвейер операторов для удаления JSON-оболочки, добавляемой Docker.

В этой статье подробно разбирается настройка отправки логов в otel-коллектор и преимущества такого подхода.

📱 Telegram | 📲 MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥6👍31
Как я уведомления мониторинга в мессенджер национальный переносил

Я в первую очередь хочу заострить внимание на той категории пользователей данных сервисов, у которой от оперативности прихода уведомлений о статусе работы поддерживаемых систем напрямую зависит лояльность их клиентов, а соответственно доход и наличие средств к существованию в принципе. Да, речь о нашей админской доле. Потому всем, кто ожидал здесь лучи праведного гнева в адрес всем известных ведомств нашей страны, можно статью дальше не читать и искать за этим другую - их в сети сейчас достаточно.

До весны текущего года пока работал Telegram с его отличнейшим (без сарказма, не побоюсь этого слова) Bot API, данная проблема в принципе не всплывала. Zabbix мониторил сервера, при проблемах кидал уведомления в Бота, Бот их кидал в нужную группу. Из группы брали в работу и спокойно приводили к статусу Resolved. Но в начале весны для RU сегмента все кардинально изменилось. API эндпоинты Telegram заблокировали, соответственно уведомления приходить перестали.


Подробности в статье на Хабре.

P.S. Пользуясь случаем: для тех, кому удобно читать канал в том самом мессенджере, ссылка на него ниже. Посты туда дублируются.

📱 Telegram | 📲 MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
👎21🔥11👍1
Как я подружил self-hosted Supabase с VictoriaMetrics, VictoriaLogs, Grafana и Vector

Я развернул self-hosted Supabase в Docker и собрал для него отдельный observability-контур. Метрики собирает vmagent и хранит VictoriaMetrics, логи собирает Vector и отправляет в VictoriaLogs, а Grafana стала единым интерфейсом. Сначала я прокидывал логи через HTTP-адаптер на Edge Function, но затем перенёс ingestion в Vector: он уже входит в Supabase-стек, читает docker-логи, умеет нормализовать их в VRL и отправляет данные батчами на отдельный сервер мониторинга.


Подробности в статье на Хабре.

📱 Telegram | 📲 MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥81👍1
Кто работает, когда ничего не работает: от алерта до постмортема

Четыре года мы были уверены, что во время инцидента с клиентом должна общаться первая линия поддержки. Потом решили, что это должен делать сам исполнитель тикета. Оба подхода не работали — по разным причинам. Этот текст — о том, к чему мы пришли, и о реальном инциденте, который проверил итоговую схему на прочность.

Когда 20 ноября 2025 года из-за ошибки в конфигурации одного коммутатора отказала дисковая подсистема всей платформы, пятьдесят наших клиентов одновременно открыли тикеты. В этот момент выяснилось главное: техническая проблема была одна, а коммуникационных — десятки. Инцидент в инфраструктуре можно устранить за часы; инцидент доверия, если им не управлять, длится гораздо дольше. Именно поэтому зрелая поддержка — это не инженер за терминалом, а параллельно работающая система: одни чинят, другие в этот момент разговаривают с бизнесом клиента.


Подробнее в статье на Хабре.

📱 Telegram | 📲 MAX
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥52👍2