Все мониторят поды, но почти никто не следит за этим критически важным компонентом
А потом в Kubernetes-кластере что-то ломается – и внезапно etcd становится самым важным компонентом всей инфраструктуры.
Потому что etcd – это мозг Kubernetes.
Каждый Deployment, Secret, ConfigMap и Node хранится в etcd в виде данных.
И вот что многие понимают неправильно:
Только API Server взаимодействует с etcd напрямую.
Поэтому если с etcd возникают проблемы, кластер перестаёт принимать любые новые изменения. Вы не сможете ничего задеплоить, масштабировать или обновить.
Даже сейчас многие инженеры допускают базовые ошибки при работе с etcd.
Не делают регулярные бэкапы. Запускают etcd на том же диске, где находится ОС. Или игнорируют проблемы с latency в распределённых конфигурациях.
В продакшене etcd должен работать на быстрых SSD и быть изолирован от других workloads. Бэкапы должны выполняться автоматически.
В подробном гайде разобрали бэкап и восстановление etcd
Читать: https://devopscube.com/backup-etcd-restore-kubernetes/
👉 DevOps Portal
А потом в Kubernetes-кластере что-то ломается – и внезапно etcd становится самым важным компонентом всей инфраструктуры.
Потому что etcd – это мозг Kubernetes.
Каждый Deployment, Secret, ConfigMap и Node хранится в etcd в виде данных.
И вот что многие понимают неправильно:
Только API Server взаимодействует с etcd напрямую.
Поэтому если с etcd возникают проблемы, кластер перестаёт принимать любые новые изменения. Вы не сможете ничего задеплоить, масштабировать или обновить.
Даже сейчас многие инженеры допускают базовые ошибки при работе с etcd.
Не делают регулярные бэкапы. Запускают etcd на том же диске, где находится ОС. Или игнорируют проблемы с latency в распределённых конфигурациях.
В продакшене etcd должен работать на быстрых SSD и быть изолирован от других workloads. Бэкапы должны выполняться автоматически.
В подробном гайде разобрали бэкап и восстановление etcd
Читать: https://devopscube.com/backup-etcd-restore-kubernetes/
Please open Telegram to view this post
VIEW IN TELEGRAM
❤9👍3🔥1
Друзья!
Осенью этого года в День тестировщика 9 сентября в Москве пройдет очередная ежегодная конференция по обеспечению качества ИТ-систем «Перфоманс Конф 12».
Формат: онлайн и оффлайн
Конференция полезна инженерам по нагрузочному тестированию, руководителям отделов QA, DevOps, SRE-специалистам и всем тем, кто занимается производительностью, надёжностью и нагрузкой.
На мероприятии выступят спикеры из таких компаний, как: VK, Сбер, Т‑Банк, Yandex.Cloud и многих других. Без воды, только практика.
Вся дополнительная информация на сайте https://perfconf.ru и в канале конференции: https://t.me/performanceconf
Осенью этого года в День тестировщика 9 сентября в Москве пройдет очередная ежегодная конференция по обеспечению качества ИТ-систем «Перфоманс Конф 12».
Формат: онлайн и оффлайн
Конференция полезна инженерам по нагрузочному тестированию, руководителям отделов QA, DevOps, SRE-специалистам и всем тем, кто занимается производительностью, надёжностью и нагрузкой.
На мероприятии выступят спикеры из таких компаний, как: VK, Сбер, Т‑Банк, Yandex.Cloud и многих других. Без воды, только практика.
Вся дополнительная информация на сайте https://perfconf.ru и в канале конференции: https://t.me/performanceconf
❤4🔥1🤔1
Разворачиваем Llama 3 с Docker и vLLM
Запуск LLM – это не просто поднять контейнер.
Здесь важны производительность, память и эффективное использование GPU.
В этом гайде разберём:
- Настройку GPU-окружения: Docker + NVIDIA Runtime
- Деплой модели с Llama и vLLM
- Оптимизацию памяти с помощью флага
- Техники квантизации, которые позволяют увеличить throughput более чем в 2 раза — с 1,62 до 3,64 req/s — и вдвое сократить потребление VRAM
- Как работает Continuous Batching
Подробный гайд:
https://devopscube.com/deploying-llama-with-docker-and-vllm/
Следуя экспериментам по оптимизации из гайда, можно получить:
- рост общего throughput в 2,2 раза
- Time to First Token (TTFT) в 3 раза быстрее
- от 5 до 20+ одновременных пользователей на том же железе — NVIDIA RTX 4000
Примечание: этот гайд предназначен для обучения и экспериментов. Используйте его, чтобы разобраться в основных концепциях.
👉 DevOps Portal
Запуск LLM – это не просто поднять контейнер.
Здесь важны производительность, память и эффективное использование GPU.
В этом гайде разберём:
- Настройку GPU-окружения: Docker + NVIDIA Runtime
- Деплой модели с Llama и vLLM
- Оптимизацию памяти с помощью флага
--gpu-memory-utilization, чтобы сбалансировать VRAM между весами модели и KV Cache- Техники квантизации, которые позволяют увеличить throughput более чем в 2 раза — с 1,62 до 3,64 req/s — и вдвое сократить потребление VRAM
- Как работает Continuous Batching
Подробный гайд:
https://devopscube.com/deploying-llama-with-docker-and-vllm/
Следуя экспериментам по оптимизации из гайда, можно получить:
- рост общего throughput в 2,2 раза
- Time to First Token (TTFT) в 3 раза быстрее
- от 5 до 20+ одновременных пользователей на том же железе — NVIDIA RTX 4000
Примечание: этот гайд предназначен для обучения и экспериментов. Используйте его, чтобы разобраться в основных концепциях.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤7
keda-gpu-scaler — это внешний scaler для KEDA, который считывает GPU-метрики через NVML на каждом узле. Благодаря этому deployments с vLLM и Triton масштабируются по реальной нагрузке на GPU, а не по CPU, включая scale-to-zero➜ https://github.com/pmady/keda-gpu-scaler
Please open Telegram to view this post
VIEW IN TELEGRAM
GitHub
GitHub - pmady/keda-gpu-scaler: KEDA External gRPC Scaler for GPU workloads - native NVML metrics via DaemonSet, no Prometheus…
KEDA External gRPC Scaler for GPU workloads - native NVML metrics via DaemonSet, no Prometheus required - pmady/keda-gpu-scaler
❤5👍3🔥1
Что такое Distroless-образ контейнера? 🧐
Go известен своими статически слинкованными бинарниками. Можно взять исполняемый файл Go, положить его в контейнер с
Но у такого подхода есть несколько проблем...
1. В контейнерах
Базовый образ
Из-за этого контейнеризированный процесс в большинстве случаев запускается от
2. В
Из-за этого приложение может работать некорректно — попробуйте, например, создать временный файл и посмотрите, что произойдёт😉
3. В
Нужно обратиться к HTTPS-эндпоинту? Не получится.
Нужно выполнить преобразование времени между часовыми поясами? Тоже не получится.
4. В
Если поддержка статической линковки в вашем языке не настолько хороша, как в Go, либо приложению нужен интерпретатор или runtime-окружение, использовать
Distroless-образы как раз решают эти проблемы, при этом оставаясь максимально близкими к подходу
Хороший пример — проект
-
-
-
Также есть несколько специализированных под конкретные языки, но всё ещё distroless-образов:
-
-
-
Но существуют и другие проекты и продукты.
Подробнее о distroless-образах - в туториале iximiuz Labs:
https://labs.iximiuz.com/tutorials/gcr-distroless-container-images
👉 DevOps Portal
Go известен своими статически слинкованными бинарниками. Можно взять исполняемый файл Go, положить его в контейнер с
FROM scratch - и на этом закончить.Но у такого подхода есть несколько проблем...
1. В контейнерах
FROM scratch нет нормального управления пользователямиБазовый образ
scratch — это буквально пустой образ. Поэтому файлов /etc/passwd и /etc/group там просто нет.Из-за этого контейнеризированный процесс в большинстве случаев запускается от
root.2. В
FROM scratch отсутствуют некоторые важные директории/tmp, /root, /home, /var, /etc — ничего из этого в scratch-контейнере нет, если, конечно, вы не примонтируете нужные директории самостоятельно.Из-за этого приложение может работать некорректно — попробуйте, например, создать временный файл и посмотрите, что произойдёт
3. В
FROM scratch нет CA-сертификатов и данных о часовых поясахНужно обратиться к HTTPS-эндпоинту? Не получится.
Нужно выполнить преобразование времени между часовыми поясами? Тоже не получится.
4. В
FROM scratch нет runtime вашего языкаЕсли поддержка статической линковки в вашем языке не настолько хороша, как в Go, либо приложению нужен интерпретатор или runtime-окружение, использовать
scratch-контейнеры становится практически невозможно.Distroless-образы как раз решают эти проблемы, при этом оставаясь максимально близкими к подходу
FROM scratch.Хороший пример — проект
GoogleContainerTools/distroless. В нём есть следующие базовые образы:-
distroless/static = scratch + структура директорий, похожая на обычный дистрибутив, /etc/{passwd,group}, CA-сертификаты и данные о часовых поясах-
distroless/base = distroless/static + glibc-
distroless/cc = distroless/base + libgccТакже есть несколько специализированных под конкретные языки, но всё ещё distroless-образов:
-
distroless/java — для Java 17, 21 и 25-
distroless/nodejs — для Node.js 22, 24 и 26-
distroless/python3 — соответственно, для Python 3Но существуют и другие проекты и продукты.
Подробнее о distroless-образах - в туториале iximiuz Labs:
https://labs.iximiuz.com/tutorials/gcr-distroless-container-images
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5❤4🔥2
Новый челлендж по Kubernetes на iximiuz Labs:
Получите доступ к приватному Kubernetes-кластеру через SSH SOCKS-прокси 🧙♂️
Попрактикуйтесь в удобном способе подключения к Kubernetes API Server без проброса конкретного порта и без необходимости менять адрес сервера в
https://labs.iximiuz.com/challenges/access-kubernetes-api-through-ssh-socks-proxy
👉 DevOps Portal
Получите доступ к приватному Kubernetes-кластеру через SSH SOCKS-прокси 🧙♂️
Попрактикуйтесь в удобном способе подключения к Kubernetes API Server без проброса конкретного порта и без необходимости менять адрес сервера в
kubeconfig:https://labs.iximiuz.com/challenges/access-kubernetes-api-through-ssh-socks-proxy
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
This media is not supported in your browser
VIEW IN TELEGRAM
Самый красивый сайт, который я сегодня видел:
https://kubernetes3d.com/rack
Он визуализирует кластер Kubernetes в виде серверной стойки, причём всё выполнено в полноценном 3D - выглядит действительно впечатляюще. Есть отдельные виды спереди, сзади и сбоку, и каждый показывает один и тот же кластер с разных ракурсов. Настоящее произведение искусства.
Обратите внимание: все кнопки и сцены здесь интерактивны, поэтому сайт отлично подходит ещё и для изучения концепций. Я уже довольно долго с ним играюсь
👉 DevOps Portal
https://kubernetes3d.com/rack
Он визуализирует кластер Kubernetes в виде серверной стойки, причём всё выполнено в полноценном 3D - выглядит действительно впечатляюще. Есть отдельные виды спереди, сзади и сбоку, и каждый показывает один и тот же кластер с разных ракурсов. Настоящее произведение искусства.
Обратите внимание: все кнопки и сцены здесь интерактивны, поэтому сайт отлично подходит ещё и для изучения концепций. Я уже довольно долго с ним играюсь
Please open Telegram to view this post
VIEW IN TELEGRAM
❤8👍7
Мощнее — не значит дороже
Главные расходы при расширении 1С и баз данных — это не само железо, а лицензии ПО за каждое ядро.
Оптимизировать затраты можно с помощью высокочастотных процессоров. Selectel запустил кластер AMD HiFreq в публичном облаке на базе VMware. Частота процессоров до 4.8 ГГц позволяет получить нужную производительность на меньшем количестве ядер.
Высокая частота процессоров сглаживает разницу в производительности при переходе с Oracle и MS SQL на российские СУБД: Postgres Pro, Tantor и другие. Быстрые диски снимают ограничения при обработке тяжелых нагрузок в 1С и аналитике.
Рассчитайте стоимость в удобном калькуляторе и разверните кластер для ваших задач: https://slc.tl/0r7gf
Реклама. АО "Селектел". erid:2W5zFHFQWR7
Главные расходы при расширении 1С и баз данных — это не само железо, а лицензии ПО за каждое ядро.
Оптимизировать затраты можно с помощью высокочастотных процессоров. Selectel запустил кластер AMD HiFreq в публичном облаке на базе VMware. Частота процессоров до 4.8 ГГц позволяет получить нужную производительность на меньшем количестве ядер.
Высокая частота процессоров сглаживает разницу в производительности при переходе с Oracle и MS SQL на российские СУБД: Postgres Pro, Tantor и другие. Быстрые диски снимают ограничения при обработке тяжелых нагрузок в 1С и аналитике.
Рассчитайте стоимость в удобном калькуляторе и разверните кластер для ваших задач: https://slc.tl/0r7gf
Реклама. АО "Селектел". erid:2W5zFHFQWR7
❤1
GitLab Architecture: A Complete Guide
В этом вводном гайде вы узнаете:
- Основные компоненты GitLab
- Хранилище GitLab
- Высокая доступность и масштабируемость
- Аутентификация и авторизация
- Мониторинг GitLab с помощью Prometheus и Grafana
Подробное руководство: https://devopscube.com/gitlab-architecture/
👉 DevOps Portal
В этом вводном гайде вы узнаете:
- Основные компоненты GitLab
- Хранилище GitLab
- Высокая доступность и масштабируемость
- Аутентификация и авторизация
- Мониторинг GitLab с помощью Prometheus и Grafana
Подробное руководство: https://devopscube.com/gitlab-architecture/
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2❤1
17 сентября Сбер собирает DevOps-инженеров, SRE и платформенные команды на встречу о том, как AI меняет работу с инфраструктурой, релизами и безопасностью.
Обсудим:
Своим опытом поделятся практики из Авито, Сбера, Cloud․ru и Т-Банка.
Встречаемся 17 сентября в 17:00 в Сбер.Среде (Москва, Земляной Вал 9А) или онлайн. Мест всего 150 — успей занять своё по ссылке!
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2❤1
Hermes Agent Operator запускает AI-агентов Hermes в Kubernetes как кастомные ресурсы, поэтому конфигурация, навыки и рабочее пространство каждого агента хранятся в одном манифесте, а не разбросаны по чьему-то ноутбуку.
➜ https://github.com/hermeum/hermes-agent-operator
👉 DevOps Portal
➜ https://github.com/hermeum/hermes-agent-operator
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2
Разберите этот сценарий troubleshooting в Kubernetes
При развёртывании Kubernetes-кластера на базе kubeadm в AWS с Calico CNI можно столкнуться с таймаутами соединения между Pod'ами и CoreDNS.
Авторы столкнулись с этой проблемой и подготовили подробную статью, в которой разобрали:
- почему возникает эта проблема;
- как пошагово её диагностировать;
- реальную первопричину;
- как сетевая инфраструктура AWS взаимодействует с Calico;
- как правильно исправить проблему.
Читать статью:
https://blog.techiescamp.com/docs/fix-dns-timeout-kubeadm-calico-aws/
👉 DevOps Portal
При развёртывании Kubernetes-кластера на базе kubeadm в AWS с Calico CNI можно столкнуться с таймаутами соединения между Pod'ами и CoreDNS.
Авторы столкнулись с этой проблемой и подготовили подробную статью, в которой разобрали:
- почему возникает эта проблема;
- как пошагово её диагностировать;
- реальную первопричину;
- как сетевая инфраструктура AWS взаимодействует с Calico;
- как правильно исправить проблему.
Читать статью:
https://blog.techiescamp.com/docs/fix-dns-timeout-kubeadm-calico-aws/
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Гринатом — ИТ-интегратор Росатома — ищет системного администратора виртуализации в Нижнем Новгороде!💼
Мы ищем специалиста с глубокими знаниями Linux и опытом администрирования высоконагруженных инфраструктур, систем виртуализации и распределённых хранилищ. Важно уверенно работать с LDAP, Kerberos, мониторингом, логами и системными метриками, а также владеть Bash и Python для автоматизации задач.
✅От нас — все возможности для комфортной работы: от ДМС со стоматологией до скидок от партнёров. А ещё в первые месяцы вас ждут обучение, внутренние аттестации и получение сертификатов по продуктам.
Мы ищем специалиста с глубокими знаниями Linux и опытом администрирования высоконагруженных инфраструктур, систем виртуализации и распределённых хранилищ. Важно уверенно работать с LDAP, Kerberos, мониторингом, логами и системными метриками, а также владеть Bash и Python для автоматизации задач.
✅От нас — все возможности для комфортной работы: от ДМС со стоматологией до скидок от партнёров. А ещё в первые месяцы вас ждут обучение, внутренние аттестации и получение сертификатов по продуктам.
hh.ru
Вакансия Системный администратор виртуализации в Нижнем Новгороде, работа в компании Гринатом. ИТ
Зарплата: не указана. Нижний Новгород. Требуемый опыт: 1–3 года. Занятость: полная. Дата публикации: 14.08.2026.
😁2❤1
В iximiuz Labs появился новый сложный челлендж по контейнеризации:
Сможете найти первопричину и исправить сборку?
https://labs.iximiuz.com/challenges/fix-go-container-image-broken-by-recent-change
👉 DevOps Portal
Отладить Go-контейнер, который перестал запускаться после недавнего изменения.
Сможете найти первопричину и исправить сборку?
https://labs.iximiuz.com/challenges/fix-go-container-image-broken-by-recent-change
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
Изучайте Linux-сети на практике
Новый практический челлендж — потренируйтесь разбираться в сетевой конфигурации Linux-хостов: находить имена интерфейсов, IP- и MAC-адреса, шлюз по умолчанию, а также определять, какие маршруты сервер использует для доступа к разным адресам.
https://labs.iximiuz.com/challenges/linux-inspect-network-interfaces-and-routes
👉 DevOps Portal
Новый практический челлендж — потренируйтесь разбираться в сетевой конфигурации Linux-хостов: находить имена интерфейсов, IP- и MAC-адреса, шлюз по умолчанию, а также определять, какие маршруты сервер использует для доступа к разным адресам.
https://labs.iximiuz.com/challenges/linux-inspect-network-interfaces-and-routes
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2❤1