KazDevOps
6.91K subscribers
1.64K photos
28 videos
21 files
1.55K links
Канал о DevOps во всех проявлениях: K8s, CI/CD, HighLoad, AI/ML, Cloud, Linux
Возьмем на поддержку DevOps: https://core247.kz/
По рекламе @UlKonovalova
Download Telegram
🔥 Новости мира DevOps, которые вы могли пропустить

⚪️ Wave — контроллер для автоматического отслеживания изменений конфигураций в Kubernetes

Инструмент решает вечную проблему с обновлением ConfigMap и Secrets. Wave мониторит монтируемые конфиги для Deployments, StatefulSets и DaemonSets и автоматически запускает Rolling Update подов при изменении данных. Никаких ручных рестартов или костылей с добавлением хешей в аннотации.

⚪️ Sveltos — контроллер для управления аддонами и приложениями на мультикластерных фермах

Проект не конкурирует с ArgoCD или Flux, а расширяет их возможности. Sveltos позволяет раскатывать манифесты и Helm-чарты по множеству кластеров на основе меток (label-based matching). Конфигурации кластерно-независимы: достаточно повесить нужный label на новый кластер, и Sveltos сам доставит туда требуемый стек.

⚪️ Обновление опенсорс-платформы для подготовки к экзаменам по Kubernetes

Бесплатный практический тренажер для подготовки к CKA, CKAD и CKS продолжает активно развиваться. В проект добавили полноценный курс и практические лабораторные работы для подготовки к сертификации Istio Certified Associate (ICA). Отличный вариант, чтобы подтянуть знания по Service Mesh на практике.

⚪️ В Istio появился новый TrafficExtension API для кастомизации Envoy

API объединяет управление расширениями на базе WebAssembly (Wasm) и Lua в едином интерфейсе. Раньше для Lua приходилось использовать сложный и хрупкий EnvoyFilter. Новый декларативный подход одинаково работает с сайдкарами, шлюзами и waypoint-прокси (в Ambient Mode), упрощая миграцию и кастомизацию data plane.

@DevOpsKaz 😛
Please open Telegram to view this post
VIEW IN TELEGRAM
433
⚡️ 10 дней до старта Cloud Native Community Day

Уже 13 августа мы встретимся в Almaty Hub большой компанией, чтобы вместе продвинуться в понимании cloud native, разрешить спорные вопросы и найти подход к проблемам. Подготовили насыщенную программу — и ждем только вас. Торопитесь зарегаться, так как места ограничены.

👈 Зарегистрироваться как участник

А пока напоминаем, какой контент вас ждет.

⚪️ Иван Екимов, SUSE: «Как скрыть control plane k8s и что это дает»
Managed-платформа должна автоматически создавать, масштабировать, обновлять и сопровождать кластеры на протяжении всего жизненного цикла. Для реализации такого подхода наиболее подходит Cluster API — благодаря декларативной модели управления и поддержке различных инфраструктур.


⚪️ Максат Акбанов, Magnum Cash&Carry: «Защита Kubernetes-кластера с помощью Kubescape»
Обзор возможностей DevSecOps-инструмента Kubescape (CNCF) и опыт внедрения в релизные циклы. Узнаете про статический и динамический режимы работы, генерацию отчетов безопасности, интеграцию с ArgoCD, настройку Alertmanager и мониторинг безопасности через Prometheus exporter.


⚪️ Эмиль Аминов, Cloud Tech Lead, Salmon: «За пределами одного кластера: Istio Multi-Cluster между AWS-аккаунтами»
Как построить Istio Multi-Cluster между несколькими AWS-аккаунтами, связать распределённые сервисы и какие архитектурные решения помогают масштабировать облачную платформу.


⚪️ Валерий Окшин, DevOps Team Lead, Freedom Cloud: «Longhorn: когда Ceph слишком тяжёл, а local storage уже не хватает»
Когда Longhorn становится оптимальным выбором для Kubernetes, какие задачи он решает и какие компромиссы стоит учитывать при эксплуатации.


⚪️ Тимур Тукаев, COO из Aenix: «Kubernetes как Linux Kernel: какое будущее ждет самый популярный оркестратор»
Сегодня K8s воспринимается как готовое приложение, иногда даже как «ОС для облаков». Это тупик. Kubernetes должен превратиться в аналог Linux Kernel — низкоуровневый компонент, с которым работает очень ограниченное людей.


👈 Зарегистрироваться как участник

Также мы проведем воркшоп (регистрируйтесь на сам ивент и отдельно на воркшоп), где разберем, как перейти от классической виртуализации к cloud native private cloud: с виртуальными машинами, self-service для команд, managed-сервисами, сетями, хранилищем, мониторингом и API-first подходом.

@DevOpsKaz 😛
Please open Telegram to view this post
VIEW IN TELEGRAM
1433
🔥 Бесплатный локальный эмулятор AWS

Представляем Ministack — сервис с 60+ эмулируемых AWS-сервисов на одном порту: S3, SQS, SNS, DynamoDB, Lambda, Secrets Manager, Step Functions, CloudWatch и другие. Совместим с Terraform.

Он предназначен для локальной разработки, интеграционного тестирования и запуска в CI/CD без необходимости реального обращения к AWS и оплаты ресурсов.

Для ряда сервисов поднимаются честные контейнеры/движки — RDS запускает настоящие Postgres/MySQL, ElastiCache — Redis/Valkey, Athena использует DuckDB, а ECS — Docker API.

Есть встроенные эндпоинты для автоматизации тестов. В отличие от стандартного AWS API, Ministack предоставляет служебные URI для быстрого управления состоянием в автотестах.

Образ занимает всего ~270 MB (против ~1 GB у LocalStack), а потребление RAM в idle — около ~30 MB (против ~500 MB).

Хороший выбор для DevOps-инженеров, которым нужно быстрое, воспроизводимое и легковесное окружение «здесь и сейчас», не перегружающее хостовую систему.


@DevOpsKaz 😛
Please open Telegram to view this post
VIEW IN TELEGRAM
18332
🔥 История о том, как reload ingress-nginx уронил прод

Разбор двухчасового инцидента на продуктивном Kubernetes-кластере, причиной которого стала неочевидная каскадная цепочка из настроек Nginx, cgroups systemd и специфики работы ядра Linux при динамическом изменении RAM виртуалки.

👈 Читать разбор

Если коротко, симптомы и цепочка отказа:

⚪️Симптом: клиенты начали получать 503 Service Unavailable, в логах внешнего proxy (Envoy Gateway) — UF и upstream_reset_before_response_started. В error.log самого ingress-nginx при этом была тишина, но Readiness-проба падала (:10246 connection refused), выбивая под из ротации.

⚪️Лимит процессов (pids.max): в логах ноды (journalctl) обнаружилась ошибка cgroup: fork rejected by pids controller. Контейнер упёрся в лимит pids.max = 975 и не мог создать новые воркеры.

⚪️Накопление потоков в Nginx: из-за долгоживущих WebSocket-соединений старые воркеры не успевали завершиться за время worker-shutdown-timeout (240s). Частые reload'ы конфига привели к сосуществованию ~30 воркеров (3 поколения). Включенный aio thread pool (threads=32) давал по 33 задачи на воркер. Итого: ~990 задач, что превысило лимит 975.

⚪️Первопричина (KVM Hotplug & threads-max): лимит pids.max выставлялся через systemd DefaultTasksMax (15% от kernel.threads-max). Лимит threads-max составлял всего 6501 (в десятки раз ниже нормы), потому что KVM-виртуалка стартовала с минимальной RAM, а затем была расширена до 16 ГБ через ballooning/hotplug. Ядро считало threads-max один раз при загрузке OS и не пересчитало его при увеличении памяти.

При использовании динамического расширения памяти (RAM hotplug/ballooning) на нодах Kubernetes ядро Linux не пересчитывает kernel.threads-max на лету. Это оставляет контейнеры с заниженными лимитами pids.max, что при штатных перезагрузках Nginx и наличии WebSocket/thread-пулов неизбежно приводит к fork rejected и падению ingress-контроллера.

Лимиты нужно проверять и корректировать на нодах вручную.


@DevOpsKaz 😛
Please open Telegram to view this post
VIEW IN TELEGRAM
1422
Please open Telegram to view this post
VIEW IN TELEGRAM
142222
Основы_DevOps_и_Software_Delivery_Евгений_Брикман_2026.pdf
12.4 MB
🔥 Основы DevOps и Software Delivery. Практика развертывания и сопровождения ПО в продакшене (2026)

В большинстве книг о DevOps лишь поверхностно рассматриваются теория и культура. В этом практическом руководстве описываются инструменты, практики и технологии, которые составляют основу software delivery — доставки программного обеспечения.

Автор показывает, как запускать и поддерживать программное обеспечение в продакшене шаг за шагом, на множестве примеров, которые дадут вам возможность поработать с реальными системами и реальным кодом.

Изучите основные концепции и лучшие практики современного DevOps и получите личный опыт и ценные навыки для работы DevOps, SRE и фулстек-разработчика.

Внутри:

⚪️Развертывание приложений и микросервисов в облаке с использованием ВМ (EC2), контейнеров (Kubernetes) и бессерверных технологий (Lambda)

⚪️Управление инфраструктурой как кодом с помощью OpenTofu/Terraform, Packer, Docker и Ansible.

⚪️Автоматизация жизненного цикла доставки ПО (сборки, тесты, развертывания) с использованием CI/CD.

⚪️Настройка сетевого взаимодействия, включая VPCs, VPNs, DNS и сервисные сетки.

⚪️Разделение кодовой базы между несколькими средами, библиотеками и микросервисами.

⚪️Управление секретами и шифрование данных при передаче (TLS) и в покое (AES).

⚪️Хранение данных в реляционных базах данных, NoSQL-базах и файловых хранилищах.

⚪️Настройка мониторинга, включая метрики, логи, события и оповещения.

@DevOpsKaz 😛
Please open Telegram to view this post
VIEW IN TELEGRAM
110633
⚡️ Воркшоп на Cloud Native Community Day Almaty 13 августа

Рассказываем о самой «вкусной части» грядущего митапа — воркшоп проведет Тимур Тукаев, COO Aenix (создатели Cozystack) — вместе вы разберете реальные сценарии миграции и риски, а не теорию со слайдов.

Что воркшоп даст вам:

⚪️ Полную независимость: вы перейдете от вендор-лока к гибкой Cloud Native экосистеме
⚪️ Готовый план миграции: получите карту замены компонентов VMware на стек Kubernetes, KubeVirt, LINSTOR и Cilium
⚪️ Практический опыт: своими руками перенесете виртуальную машину в KubeVirt на примере платформы Cozystack
⚪️ Месяц бесплатной практики: тестовый стенд и закрытый чат поддержки останутся у вас на 30 дней
⚪️ Подтверждение экспертизы: за выполнение лабораторной работы вы получите официальный сертификат

Будет полезно инженерам уровня Middle+ и тимлидам: DevOps, SRE, системным архитекторам и всем, кто прямо сейчас строит private cloud в Казахстане.

👈 Чтобы занять место на воркшопе: зарегистрируйтесь на ивент + заполните заявку на воркшоп

После воркшопа будет основная программа Cloud Native Community Day Almaty — пять докладов от инженеров, которые ежедневно строят и масштабируют инфраструктуру в крупных компаниях.

Большая благодарность Astana Hub за предоставленную площадку и помощь в организации ивента!


@DevOpsKaz 😛
Please open Telegram to view this post
VIEW IN TELEGRAM
14332
🔥 Почему песочницы сторонних API вас предадут: проблема Sandbox Drift и как с ней жить

Разработка интеграций с внешней инфраструктурой (платежки, ID-провайдеры, SMS-шлюзы) всегда упирается в Sandboxes. И слепая вера в песочницу вендора ведет к инцидентам в продакшене и как выстроить надежный процесс тестирования.


⚪️Главный враг: дрейф песочницы

- Тестовые среды вендоров — это симуляции, но не дубликаты продакшена. Вендоры обновляют песочницы по остаточному принципу.

- В продакшене появляется новое поле или меняется структура токена, а в песочнице — часто нет (или не сразу). Логика rate limiting и специфические HTTP 4xx/5xx ошибки в песочнице часто вовсе не имплементированы.

- Как итог успешный деплой и сбой на реальном трафике из-за расхождения среды с продакшеном, возникшего еще пару месяцев назад.

⚪️ Что реально нужно тестировать

- Обработку nullable-полей, опциональных ключей и специфических типов.

- Проверку поведения системы при отваливающемся провайдере (таймауты, специфические коды ответов вроде 402, асинхронные вебхуки невпопад). Песочницы провайдеров чаще всего поддерживают только happy path.

- State Management: побочные эффекты тестирования (записи, аудит-логи) остаются в песочнице провайдера. Внезапные плавающие сбои в CI часто вызваны грязным состоянием тестовой среды вендора.

⚪️Рабочая стратегия: Record & Replay вместо прямой зависимости

Чтобы не зависеть от изменения чужих сред, инженерные команды переходят на локально контролируемый baseline:

- Запись и воспроизведение трафика: перехват реальных HTTP-ответов (через Keploy, Hoverfly, WireMock в режиме записи) и сохранение их в качестве локальных фикстур.

- Версионирование фикстур в Git: обновление фикстур становится осознанным коммитом в репозиторий, а не фоновым изменением на стороне вендора.

- Explicit Fault Injection: явное создание фикстур под таймауты, битые JSON и специфические 5xx-ошибки.

⚪️Почему Contract Testing (Pact) не спасает на 100%

Contract testing проверяет схему (структуру запроса и ответа). Но он не ловит поведенческие изменения под капотом. Схема может оставаться валидной, но провайдер изменил формулу расчета комиссии или сделал синхронный вебхук асинхронным. Схема совпала, логика сломалась.

⚪️ Плата за надежность: Обслуживание фикстур

Главный подводный камень собственного Record & Replay — протухание фикстур. В качестве решения процесс обновления фикстур должен быть явно закреплен за командой (explicit ownership) и входить в техдолг/бэклог при каждом релизе изменений в API провайдера.

Песочница провайдера подходит для первичного exploratory-тестирования и smoke-тестов. Регрессионный пайплайн должен опираться на локально зафиксированные, версионируемые фикстуры реальных ответов.


@DevOpsKaz 😛
Please open Telegram to view this post
VIEW IN TELEGRAM
1222
Разыгрываем 10 ваучеров со скидкой 50% на абсолютно весь каталог от The Linux Foundation и 10 комплект видеокурсов по Kubernetes со скидкой 50% от Slurm.

⚪️ Каталог курсов и сертификации

Ваучеры можно применить к любому:

— онлайн-курсу
— сертификационному экзамену (CKA, CKS, CKAD и другие)
— пакету продуктов (курс + сертификация)
— курс под руководством инструктора с гарантированным стартом

⚪️ Запись на поток Kubernetes: Продвинутый уровень от Slurm.

Условия розыгрыша:

Подпишитесь на KazDevOps и нажмите кнопку "Учавствую!" под оригинальным постом в канале KazDevOps.

❗️ 1 сентября подведем итоги и выберем 10 победителей (каждый получит скидку на предложения Linux Foundation + скидку на курс Slurm). Активировать ваучеры Linux Foundation нужно до 07.01.2027. После этого у вас будет 1 год и 2 попытки, чтобы завершить обучение и сдать экзамен.

Go-go-go, и успехов!

@DevOpsKaz 😛
Please open Telegram to view this post
VIEW IN TELEGRAM
21043222
KazDevOps pinned a photo
🔥 Cloud Native Community Day Almaty — уже завтра

👈 Зарегистрироваться на Cloud Native Community Day

Встречаемся 13 августа в Almaty Hub, чтобы провести целый день в Сloud Native: от практической миграции виртуальных машин до технических докладов, живых обсуждений и after-party. Публикуем программу с таймингом.

10:00 — практический воркшоп

Вместе с Тимуром Тукаевым, COO Aenix и одним из создателей Cozystack, разберём переход от классической виртуализации к cloud native private cloud: перенесём виртуальную машину в KubeVirt и посмотрим, как работают Kubernetes, LINSTOR, Cilium и другие open-source компоненты.

👈 Зарегистрироваться на воркшоп

13:00 — обед

После обеда 5 технических докладов — реальные кейсы и инженерные решения:

⚪️ Иван Екимов, SUSE
14:00 — «Как скрыть control plane k8s и что это дает»

⚪️ Максат Акбанов, Magnum Cash&Carry
14:40 — «Защита Kubernetes-кластера с помощью Kubescape»

⚪️ Эмиль Аминов, Cloud Tech Lead, Salmon
15:20 — «За пределами одного кластера: Istio Multi-Cluster между AWS-аккаунтами»

⚪️ Валерий Окшин, DevOps Team Lead, Freedom Cloud
16:00 — «Longhorn: когда Ceph слишком тяжёл, а local storage уже не хватает»

⚪️Тимур Тукаев, COO Aenix
16:40 — «Kubernetes как Linux Kernel: какое будущее ждет самый популярный оркестратор»

А после — after-party и общение с теми, кто каждый день строит, ломает, масштабирует и чинит инфраструктуру.

Ждем всех в Almaty Hub 13 августа в 10:00. Мероприятие проходит при поддержке команды Astana Hub — благодаря их экосистеме митапы возможны!

@DevOpsKaz 😛
Please open Telegram to view this post
VIEW IN TELEGRAM
17332
🔥 Кейс Juz40: переход техподдержки образовательной платформы от 1 штатного DevOps к полноценному IT-отделу

Мы в Core 24/7 часто рассказываем о модернизации инфраструктуры, миграции и аудите, но основная наша деятельность — это DevOps-поддержка. Мы заходим в проект, соблюдая все юридические тонкости, и берем его на поддержку + развитие. Целая команда из инженеров разного уровня трудится, чтобы у сервисов, которыми пользуются миллионы казахстанцев, все работало как часы.

В новом кейсе рассказали, что конкретно сделали и делаем для образовательной платформы Juz40 — и это лишь малая часть. Многое остается под NDA.

👈 Читать кейс

@DevOpsKaz 😛
Please open Telegram to view this post
VIEW IN TELEGRAM
1722
⚡️ Видео-экскурсия в дата-центр

Пятница — самое время отвлечься от задач и посмотреть, как устроен современный ЦОД изнутри.

👈 Смотреть

Видео проведет вас от машинных залов и сетевой инфраструктуры до самых секретных узлов. Увидите, как работают динамические ИБП, дизель-генераторы, чиллеры и система пожаротушения.

Зайдете в серверную, посмотрите, в каких условиях работает оборудование в стойках. Послушаете о сетевой инфраструктуре ЦОД. Узнаете, как в дата-центр приходит магистральное оптоволокно, что находится внутри оптической муфты и применяются ли в ЦОД: RDMA, RoCE v2, InfiniBand.

Затем послушаете команду, отвечающую за разработку собственной серверной инфраструктуры Selectel. На примере сервера с 16 GPU разберут, как проектируются такие системы, почему выбираются те или иные компоненты и как устроена их внутренняя компоновка. В лаборатории Selectel посмотрите, в каких условиях тестируют серверные материнские платы, BMC на базе OpenBMC и оборудование для работы с PCIe 5.0.

@DevOpsKaz 😛
Please open Telegram to view this post
VIEW IN TELEGRAM
17431
🔥 Безопасный AI-ассистент внутри кластера

Пока все экспериментируют с агентами уровня доступа «всемогующий», мы предлагаем практическое руководство по созданию автономного, предназначенного только для чтения, AI-агента для кластера. Он использует GitHub Actions, Argo CD Image Updater. Работает внутри кластера, использует локальную модель и не передает данные за пределы сети.

Агент не имеет прав на запись/изменение (update, delete), что изолирует кластер от возможных галлюцинаций модели.

И вы можете развернуть его у себя без особого труда. В итоге получите агента с локальным запуском модели (zero-data-egress) + строгие ограничения RBAC (read-only) + полный аудит изменений через GitOps.

@DevOpsKaz 😛
Please open Telegram to view this post
VIEW IN TELEGRAM
14332
⚡️ Онлайн-митап CRISIS MANAGEMENT IN TECH COMPANIES — 18 августа

Это встреча о финансовой и операционной модели, инвестициях, юнит-экономике и решениях о масштабировании или трансформации проекта.

Митап пройдёт на английском языке — хороший повод совместить полезную бизнес-практику с профессиональным английским.

📅 18 августа, 19:00, онлайн и бесплатно

👈 Регистрация

@DevOpsKaz 😛
Please open Telegram to view this post
VIEW IN TELEGRAM
13222
🔥 Harness от DeepSeek

Не успело отгреметь последнее обновление DeepSeek, как на сцену вышло что-то куда более ценное.

Сейчас это самый быстрорастущий репозиторий на GitHub: за 3 дня набрал 130к звёзд — хайп на уровне OpenClaw, который стал первым годным опенсорс-агентом.

Плагином может быть всё, что вы только сможете представить. Модели, сессии, скиллы, песочницы, циклы и даже просто интерфейс. Относите в Harness, а он выдает готового к работе агента.

@DevOpsKaz 😛
Please open Telegram to view this post
VIEW IN TELEGRAM
16532
🔥 Подборка топовых IT-каналов

⚙️ Dev Boost — Самая огромная коллекция платных курсов, которые можно скачать бесплатно

👩‍💻 IT Books — Самая огромная библиотека книг

💻 Hacking & InfoSec Base — Крутой блог белого хакера

🛡 CyberGuard — Всё про ИБ

🤔 ИБ Вакансии — Всё, чтобы найти работу в ИБ

👩‍💻 linux administration — Всё про Линукс

👩‍💻 Программистика — Python, python и ещё раз python

👩‍💻 GameDev Base — Всё про GameDev

😆 //code — Самые топовые мемы по IT

Подпишись, чтобы не потерять!
Please open Telegram to view this post
VIEW IN TELEGRAM
1432
🚀 Как внедрить AI в компании и не застрять на этапе пилота?

27 августа в 12:00 по Астане VK Cloud проведет онлайн-вебинар:
«Как внедрить AI в компании: от первых сценариев к масштабируемой enterprise-архитектуре»

Многие компании уже тестируют AI-инструменты, но при переходе к реальному внедрению появляются вопросы: как подготовить данные, выстроить архитектуру, подключить RAG, AI-агентов, GPU-инфраструктуру и при этом контролировать затраты.

На вебинаре эксперт VK Tech разберет:

— почему одной LLM недостаточно для корпоративного AI;
— как выглядит enterprise AI-архитектура;
— какие ошибки мешают перейти от PoC к production;
— как использовать GPU, Kubernetes и облачную инфраструктуру для AI-нагрузок;
— какие AI-сценарии можно внедрять в бизнес-процессы уже сейчас.

Спикер: Артем Симанов, ведущий менеджер продукта, направление AI-продуктов, VK Tech.

Вебинар будет полезен CTO, CIO, руководителям Data/AI-направлений, архитекторам, DevOps-командам и тем, кто отвечает за внедрение AI в компании.

📅 27 августа, 12:00 по Астане

👈 Участие бесплатное по регистрации

@DevOpsKaz 😛
Please open Telegram to view this post
VIEW IN TELEGRAM
14322
🔥 Постмортем: глобальный сбой сервисов GitHub 17 августа

GitHub на неделе столкнулся с масштабным сбоем, который затронул разработчиков по всему миру и нарушил стандартные рабочие процессы. Ваши тоже, да? Разбираемся по порядку.

Все началось с проблемы с производительностью, которая переросла в глобальную деградацию большинства ключевых сервисов. Команда GitHub обнаружила источник и начала восстановление. Инженеры устраняли точечные проблемы с авторизацией, затрагивавшие Copilot и другие службы. Время сбоя составило почти 8 часов.


⚪️ Характер ошибок

В пиковые моменты сбоя проблемы наблюдались практически по всей экосистеме платформы:

- Веб-интерфейс и API: уровень ошибок (error rate) достиг примерно 20%.
- Скачивание файлов: загрузка архивов и необработанного контента репозиториев (raw repository content) столкнулась с 50% уровнем ошибок.
- Основные сервисы: сбои в работе Webhooks, API Requests, Issues, Pull Requests, а также систем автоматизации и тестирования GitHub Actions.
- AI-инструменты: нарушен доступ к GitHub Copilot.
- затронуты аутентификация SAML и OIDC, а также сервисы SCIM и Team Sync.

⚪️ Контекст и предпосылки

Официальные детали технической причины платформой пока не раскрыты, однако инцидент произошел на фоне следующих факторов:

- Взрывной рост AI-разработки: из-за нагрузки от AI-агентов и средств автонабора кода инфраструктура GitHub испытывает серьезное давление. В апреле CTO GitHub Владимир Федоров отмечал, что если осенью компания планировала 10-кратное расширение мощностей, то к февралю возникла необходимость проектировать масштабирование в 30 раз. Ранее 8 инцидентов с деградацией насчитали в июле, 6 —в июне.

- Переход в облака: Microsoft ускоряет перевод GitHub на Azure, а также использует мультиоблачную стратегию, аренда мощностей у AWS.

- Предположения экспертов: аналитики также указывали на сетевые инциденты на стороне AWS.

@DevOpsKaz 😛
Please open Telegram to view this post
VIEW IN TELEGRAM
1322
А вот и официальная причина инцидента GitHub:


Непосредственной причиной сбоя стало перенасыщение сетевого трафика на балансировщиках нагрузки в регионе Central US из-за нового пика активности.

​Первоисточником проблемы стал pod с sidecar-контейнером Istio: он уперся в лимиты по параллельным запросам и не смог корректно смасштабироваться (auto scale). Это произошло из-за ошибки в конфигурации политики масштабирования, которая отслеживала параметры основного хостового сервиса, но игнорировала лимиты самого sidecar-контейнера.

​Сбой одного компонента вызвал каскадную реакцию, в результате чего четыре узла HAProxy исчерпали свои лимиты по количеству соединений (flow limits). Это привело к деградации шлюза аутентификации и массовым задержкам/ошибкам при входе пользователей.

​Ситуацию усугубила слишком оптимистичная логика повторных запросов (retry logic), которая создала избыточную нагрузку на внутренние балансировщики. Одновременная приостановка работы HAProxy на проблемных узлах сразу же привела к восстановлению системы

.
154
🔥 Новости мира DevOps, которые вы могли пропустить

⚪️ Rancher v2.15.0 — платформа для управления несколькими Kubernetes-кластерами

Общедоступные (GA) провайдеры CAPI-инфраструктуры, наследование правил пространства имён для GlobalRoles, ограничения локальной аутентификации в UI при настройке EAP, новый быстрый интерфейс Workloads Overview и поддержка Kubernetes v1.36.

⚪️ Karpenter v1.14.0 — высокопроизводительный автоскалер узлов Kubernetes

Аллокатор для Dynamic Resource Allocation (DRA), поддержка секционируемых устройств в DRA, стратегия консолидации Balanced, переопределение ресурсов на уровне офферингов и поддержка CapacityBuffer API.

⚪️ Cilium 1.20.0 — сетевой плагин CNI и инструмент безопасности на базе eBPF

Поддержка TCPRoute/UDPRoute в Gateway API, шифрование трафика между шлюзом и сервисами, миграция на multi-pool IPAM, учет топологии (PreferSameZone/PreferSameNode), стабильный MCS API, ClusterNetworkPolicy из апстрима K8s и уменьшенный в 4 раза бинарник cilium-cni.

⚪️ Cozystack v1.6.0 — PaaS-платформа для построения собственных облаков

Переезд воркеров K8s с Ubuntu/kubeadm на Talos Linux, иерархические квоты ресурсов, переход etcd на etcd-operator v1alpha2, новый файрвол SecurityGroup для тенантов и улучшения в Keycloak.

⚪️ KServe v0.20.0 — платформа для инференса и развёртывания AI-моделей

Управляемый DRA для LLMInferenceService, конфиденциальное обслуживание моделей, поддержка AutoGluon, несколько OCI-источников в storageUris, разделение трафика через API и канареечные релизы в режиме RawDeployment.

⚪️ wasmCloud v2.7.0 — среда выполнения WebAssembly-нагрузок в облаке

Параллельные экземпляры в пуле, доверенные приватные CA-корни для OCI-реестров за TLS, включенные по умолчанию maps/implements и единое ограничение соединений.

@DevOpsKaz 😛
Please open Telegram to view this post
VIEW IN TELEGRAM
16322