How to scale Alloy as a central telemetry gateway: capacity planning, load testing, and production lessons
📌 Подробнее: https://grafana.com/blog/how-to-scale-alloy-as-a-central-telemetry-gateway-capacity-planning-load-testing-and-production-lessons/
MemOps🤨
Grafana Alloy вполне себе можно рассматривать полноценный центральный шлюз телеметрии для метрик, логов и трейсов. Если используете или планируете использовать Grafana Stack рассмотрите использование Alloy.
В этой статье в блоге Grafana разбирают кейс: около 17 млн метрик, до 1 ТБ логов в сутки, терабайты трейсов, десятки подов Alloy и отдельная стратегия автоскейлинга. А еще рассказали где всё начинало ломаться во время нагрузочных тестов.
Из полезного: не ставить лимит на CPU, держать высокий MinReplica, использовать GOMEMLIMIT как защиту от OOM, отдельно мониторить сам telemetry gateway и тестировать нагрузку выше ожидаемого пика.
Еще в статье немного коснулись тему автомасштабирования кластера k8s не только по CPU и памяти, но и по заполнению очередей экспортера через KEDA — то есть реагировать на обратное давление ещё до того, как поды начнут себя чувствовать так себе.
MemOps
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5
Синтаксис записи SPF: механизмы, квалификаторы, модификаторы и макросы
📌 Подробнее: https://dmarcguard.io/blog/spf-record-syntax
MemOps🤨
Эта страница представляет собой полный справочник: каждый механизм, каждый квалификатор, оба модификатора, полная таблица макросов, порядок оценки, ограничения поиска в DNS и правила размещения записей — все это описано в разделе RFC 7208, который определяет это.
MemOps
Please open Telegram to view this post
VIEW IN TELEGRAM
DMARCguard
SPF Record Syntax: The Complete Reference (RFC 7208) | DMARCguard
Every SPF record syntax element in one reference: mechanisms, qualifiers, modifiers, macros, and DNS limits — with RFC 7208 section cites and real examples.
KEDA как финансовый гардрейл: scale-to-zero, лимиты реплик и автоскейлинг по событиям в Kubernetes
В этой статье разбирают KEDA как практический инструмент для Kubernetes-workloads с непостоянной нагрузкой: очередями, расписаниями, HTTP-пиками и внешними метриками.
Материал не про «поставили автоскейлер и сразу сэкономили», а про production-подход: где KEDA действительно помогает, какие параметры нужно ограничивать заранее, как проверять экономику пилота и что может пойти не так при раскатке.
📌 Подробнее: https://habr.com/ru/companies/finops_ru/articles/1056066/
MemOps🤨
В этой статье разбирают KEDA как практический инструмент для Kubernetes-workloads с непостоянной нагрузкой: очередями, расписаниями, HTTP-пиками и внешними метриками.
Материал не про «поставили автоскейлер и сразу сэкономили», а про production-подход: где KEDA действительно помогает, какие параметры нужно ограничивать заранее, как проверять экономику пилота и что может пойти не так при раскатке.
MemOps
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3👍2
Kubernetes 1.37 «Garhwal»: Генеральная уборка в кластерах
Ключевые нововведения в стабильной ветке (Stable)
Новые возможности для тяжелых нагрузок (Beta)
📌 Подробнее: https://kubernetes.io/blog/2026/08/26/kubernetes-v1-37-release/
MemOps🤨
Ключевые нововведения в стабильной ветке (Stable)
Защита etcd от перегрузок: При инициализации watch cache API-сервер больше не копит запросы к состоянию кластера в очередь. Лишний трафик сразу отбивается кодом HTTP 429, что резко снижает риск отказа управляющего контура при пиковых нагрузках.
Нативная работа с сертификатами: Механизмы Pod Certificates и ClusterTrustBundles перешли в стабильный статус. Kubernetes теперь автоматически выпускает и обновляет сертификаты X.509, передавая их в поды через подключаемые тома.
Встроенная миграция: Контроллер StorageVersionMigration самостоятельно перезаписывает объекты при смене версии API или обновлении параметров шифрования (ранее администраторам приходилось использовать сторонние скрипты).
Стандартизация: Формат KYAML (строгая версия YAML) и API сбора метрик metrics.k8s.io окончательно признаны стабильными.
Новые возможности для тяжелых нагрузок (Beta)
Масштабирование до нуля: HorizontalPodAutoscaler научился по умолчанию сворачивать количество реплик до нуля при работе с внешними метриками. Это позволяет полностью отключать простаивающие поды пакетных задач, экономя дорогостоящее время GPU.
Групповое планирование (Gang scheduling): Планировщик теперь рассматривает связанную группу подов как единое целое. Запуск откладывается до тех пор, пока в кластере не появится достаточно ресурсов для всей группы разом, что исключает взаимную блокировку ресурсов.
Memory QoS на базе cgroups v2: Внедрен механизм жесткого лимитирования и защиты зарезервированной памяти от вытеснения. Использование cgroups v2 подчеркивает окончательный отказ системы от устаревшей первой версии.
Снижение зависимости от cAdvisor: Расширенный Container Runtime Interface (CRI) позволяет компоненту kubelet запрашивать статистику напрямую от среды выполнения контейнеров.
MemOps
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3❤1🔥1
Please open Telegram to view this post
VIEW IN TELEGRAM
😁19👍4
Создание ИИ—агента, который управляет вашими операциями SRE - Чему я научился, что работает и как Вы тоже можете это сделать
📌 Подробнее: https://blog.stackademic.com/building-an-ai-agent-that-runs-your-sre-operations-what-i-learned-what-works-and-how-you-can-do-8a3801124bdc
MemOps🤨
Не более разумное оповещение. Не лучшая панель мониторинга. Настоящая логическая система, которая читает Splunk, запрашивает AppDynamics, проверяет модули Kubernetes, выполняет поиск в Confluence runbooks, просматривает то, что недавно было развернуто GitLab, и возвращается с диагнозом и предлагаемыми действиями.
MemOps
Please open Telegram to view this post
VIEW IN TELEGRAM
Medium
Building an AI Agent That Runs Your SRE Operations — What I Learned, What Works, and How You Can Do It Too
Every SRE team has the same story. Here is how we change the ending.
etcd — это высокодоступное и строго согласованное key-value хранилище, которое обеспечивает работу Kubernetes, храня в нём всё состояние кластера.
📌 Подробнее: https://labs.iximiuz.com/courses/kubernetes-the-very-hard-way-0cbfd997/control-plane/etcd
MemOps🤨
MemOps
Please open Telegram to view this post
VIEW IN TELEGRAM
iximiuz Labs
etcd | iximiuz Labs
The de facto Kubernetes storage backend
❤2
Агентный CI/CD: Шлюзы развертывания Kubernetes с эластичным MCP-сервером — Elastic Observability Labs
📌 Подробнее: https://www.elastic.co/observability-labs/blog/agentic-cicd-kubernetes-mcp-server
MemOps🤨
MemOps
Please open Telegram to view this post
VIEW IN TELEGRAM
www.elastic.co
Agentic CI/CD: Kubernetes Deployment Gates with Elastic MCP Server
Deploy agentic CI/CD gates with Elastic MCP Server. Integrate AI agents into GitHub Actions to monitor K8s health and improve deployment reliability via Observability (O11y)
❤2
🐳 Docker выпустила Sandboxes - изолированные среды специально для AI coding agents.
📌 Подробнее: https://www.docker.com/products/docker-sandboxes/
MemOps🤨
Идея простая: дать агентам вроде Claude Code, Codex, Gemini CLI, Copilot CLI, OpenCode и Kiro больше свободы, но не давать им свободно ломать хост-систему.
Каждый агент запускается в отдельной microVM и получает только рабочую директорию проекта. Внутри он может:
- устанавливать пакеты;
- менять конфиги;
- запускать сервисы;
- поднимать собственные Docker-контейнеры;
- выполнять долгие задачи без постоянного подтверждения действий.
При этом Docker позволяет отдельно контролировать filesystem, network и credentials, а сам sandbox после работы можно просто удалить.
Это инфраструктурный слой для эпохи автономных coding agents: агенту дают почти полный контроль внутри песочницы, но хост остаётся изолированным.
MemOps
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5
Создание консоли безопасности Kubernetes с открытым исходным кодом с использованием MCP
📌 Подробнее: https://cloudsecburrito.com/building-an-oss-kubernetes-security-console-with-mcp
MemOps🤨
Об этом и идёт речь в данной серии: о создании консоли безопасности Kubernetes с открытым исходным кодом, которая собирает данные о состоянии безопасности, уязвимостях, политиках и работе в реальном времени, по возможности представляет их в виде нативных объектов Kubernetes и подключает эти данные к серверу MCP, чтобы ИИ-агент мог помогать с классификацией инцидентов по всему стеку.
MemOps
Please open Telegram to view this post
VIEW IN TELEGRAM
CloudSecBurrito
Building an OSS Kubernetes Security Console
Use CRDs, MCP, and open source security signals to build a Kubernetes investigation layer for runtime, posture, policy, and vulnerability triage.
❤2
Please open Telegram to view this post
VIEW IN TELEGRAM
😁27❤1
Подборка интерактивных тренажеров для DevOps
▪️ Deadnodes — тренировка в формате production-инцидента: получаем сломанное окружение, ищем root cause и восстанавливаем систему. Есть сценарии по Linux, Kubernetes, networking и базам данных.
▪️ iximiuz Labs — набор hands-on лабораториий с Linux, контейнерами и Kubernetes. Можно самостоятельно разбирать networking, container internals и troubleshooting-сценарии разной сложности.
▪️ Anycast и BGP — меняем маршруты и отключаем PoP, чтобы посмотреть, что происходит с трафиком и TCP-соединениями. Можно разобрать проблемы с long-lived connections и capacity при отказе части инфраструктуры.
▪️ Kubernetes Scheduler Simulator — практика работы с Filter/Score, resource requests, taints и tolerations. Можно посмотреть, почему Pod оказывается Pending, и сравнить стратегии размещения.
MemOps🤨
▪️ Deadnodes — тренировка в формате production-инцидента: получаем сломанное окружение, ищем root cause и восстанавливаем систему. Есть сценарии по Linux, Kubernetes, networking и базам данных.
▪️ iximiuz Labs — набор hands-on лабораториий с Linux, контейнерами и Kubernetes. Можно самостоятельно разбирать networking, container internals и troubleshooting-сценарии разной сложности.
▪️ Anycast и BGP — меняем маршруты и отключаем PoP, чтобы посмотреть, что происходит с трафиком и TCP-соединениями. Можно разобрать проблемы с long-lived connections и capacity при отказе части инфраструктуры.
▪️ Kubernetes Scheduler Simulator — практика работы с Filter/Score, resource requests, taints и tolerations. Можно посмотреть, почему Pod оказывается Pending, и сравнить стратегии размещения.
MemOps
Please open Telegram to view this post
VIEW IN TELEGRAM
Deadnodes
DevOps troubleshooting practice with scenarios
Deadnodes runs real incident labs for teams that want practical DevOps training.
👍5