DevOps FM
5.29K subscribers
734 photos
15 videos
10 files
843 links
♾️ Канал для тех, кто живёт слиянием разработки и эксплуатации (DevOps) и сис. администрированием.

Новости, статьи, практики, инструменты и развлекательный контент. Cloud Native, Docker, Kubernetes, БД, мониторинг и пр.

По вопросам — к Ладе @b_vls
Download Telegram
👾Ловим покемонов в кластерах

Пятница, конец рабочей недели и Pokémon в Kubernetes. Разработчик Анубхав Саньял вдохновился играми для Game Boy и любовью к DevOps. Так, на свет появился Project Yellow Olive, TUI-симулятор на языке Python. Подробнее об архитектуре – тут.

Вместо покемонов, вам предстоит анализировать работу покеподов, устранять проблемы K8S в локальном кластере Minikube, продвигаясь по аркам:

Oakwood Meadows с фокусом на подах
Signal Town с практикой работы с сетью и взаимодействием между компонентами (DNS, Ingress)
Gold Rush City и упор на политики безопасности (RBAC)
Sakura Harbour с развертыванием, масштабированием и обновлениями приложений.

Последняя локация появилась недавно, и включает масштабирование реплик, работу с ReplicaSet, сценариями отката (rollback) и отладкой неудачных развёртываний.

Желаем хороших выходных и успешного прохождения!

#DevOps #kubernetes #opensource
Please open Telegram to view this post
VIEW IN TELEGRAM
27🔥5👍3
Как Codex обнаружил регрессию в Kubernetes

👩‍💻 Начинаем рабочую неделю с фотоотчёта DevOps Lab и рабочего кейса портала HeyOnCall.

После обновления Kubernetes до версии 1.36 Майк Роббинс заметил проблему на небольшом тестовом кластере. kubelet постепенно «съедал» всю память. Поды работали нормально, но pprof обнаружил миллион объектов контекста.

Проблема возникла из-за небольшого регресса в коде startPodSync, и при каждом цикле синхронизации создавался новый context.WithCancel(), а старый никогда не освобождался. С Codex Роббинс быстро обнаружил проблемный коммит, подготовил исправление, прошёл ревью и добился включения патча в основную ветку и бэкпорта для релиза 1.36.3.

🔵В статье о том, как найти утечку памяти в kubelet с Go pprof и сократить потребление с 1 ГБ до 110 МБ, почему подобные ошибки сложно поймать на тестировании и какая строка кода может привести к утечке сотен мегабайт памяти на каждой ноде.

➡️А здесь мы оставили фото участников лабы, делимся атмосферой. Отмечайте @DevOps_FM в соц.сетях и расскажите о своих впечатлениях – тут 💙

#kubernetes #devops #kubelet #никсис
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍54🔥4
От надежности CI/CD до задач Kubernetes – на митапе Спортс"

Не успели отойти от встречи на DevOps Lab, как уже Спортс" приглашает инженеров поговорить об инфраструктурной безопасности в эту пятницу.

В программе четыре доклада:

• как защитить GitLab Runner
• в чем особенность CDN и что учесть при миграции инфраструктуры
• опыт внедрения ArgoCD и GitOps
• запуск GPU-задач в Kubernetes на нестандартном железе

📅 10 июля, 18:30
📍 Онлайн

➡️Полная программа и другие подробности — по ссылке. А зарегистрироваться можно – здесь.

#партнёрский_пост
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍74🔥4
Новостной дайджест от DevOps FM!

🔔Выходим в эфир с подборкой новостей и практических разборов.

В блоге Sysdig опубликовали отчёт по безопасности. В июне среди причин инцидентов выделили ошибки конфигурации, свободный доступ к открытым ресурсам в облаке.

Также в отчёте разобрали атаки от 8 июня на Tchap с кражей 13,5 ГБ данных, и от 11 июня с выводом 1,3 ТБ данных. В первом случае в открытый доступ попали email-адреса и сведения об организациях более 73 тыс. из 600 тыс. учетных записей. Детали отчёта – здесь.

В понедельник вышел релиз OpenSSH версии 10.4. Из нового добавили экспериментальную поддержку схемы подписи ML-DSA 44 + Ed25519, включили реализацию на основе NFA и ужесточили требования к протоколу SSH при обмене ключами. Усилили безопасность и устранили уязвимости в ssh(1), sshd(8), scp(1) и sftp(1). Подробнее об улучшениях – тут.

С релизом Docker Desktop 4.81.0 от 6 июля обновили Docker Compose до версии 5.2.0 и Docker Scout CLI v1.22.0. Также внесли исправления для работы с kind-кластерами, улучшили загрузку образов и устранили проблему с остановкой контейнеров. В новой версии Docker Desktop учитывает заданные таймауты вместо принудительного завершения через 1 секунду. Все изменения – здесь.

На портале FreeCodeCamp вышла статья о включении политик нулевого доверия в Kubernetes. Дестини Эрхабор подробно разбирает идентификацию рабочих нагрузок через SPIFFE, SPIRE и Cilium.

На примере Kind-кластера он показывает, почему традиционные политики безопасности, не работают в динамической среде Kubernetes, а также объясняет, как Cilium реализует аутентификацию (mTLS) без Sidecar. Демо – тут.

На Info Q Мэтт Сондерс разобрал архитектуру HubSpot и рассказал, как компания масштабировала платформу семантического поиска до 20 млрд векторов.

Внутренняя платформа Vector as a Service (VaaS) работает поверх Qdrant и обеспечивает контроль доступа, версионирование данных и сбор обратной связи. Сейчас система обслуживает 38+ команд, включает 200+ индексов, 140+ кластеров в пяти регионах и двух окружениях, а пиковая нагрузка достигает 100 тыс. запросов в секунду.

Как HubSpot сократил время запуска кластеров с Kubernetes Operator читайте – здесь.

#новостная_подборка #devops #kubernetes #openssh #zerotrust
Please open Telegram to view this post
VIEW IN TELEGRAM
2👍43🔥3
🚨 Что убивает этот под разбор инцидента

Всем DevOps! В конце недели подготовили для вас кейс прямиком из производственной среды.

После выката нового ML-инференс-сервиса в Kubernetes поды один за другим уходят в CrashLoopBackOff. На первый взгляд кажется, что проблема в приложении. Но все ли так очевидно?


STATUS: CrashLoopBackOff


При этом в событиях Kubernetes видно:


Liveness probe failed:
connect: connection refused


А в логах контейнера:


Starting model server...
Loading model weights...
Loaded shard 1/4
Loaded shard 2/4
<SIGTERM received, shutting down>


И фрагмент Deployment:


livenessProbe:
initialDelaySeconds: 10
periodSeconds: 5
failureThreshold: 3


👨‍💻Что здесь происходит? Почему сервис так и не успевает запуститься и оказывается в бесконечном CrashLoopBackOff?

Голосуйте в опросе ниже ⬇️

#devops #kubernetes #k8s #разборинцидента
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥4👍32
🚨 Что убивает этот под разбор инцидента

Разрешение инцидентов в производственной среде с участием агентов — задача со звёздочкой даже для опытных инженеров. На DevOps Lab мы подробно разобрали сценарии работы ML-сервисов. Показываем, как исправить конфигурацию ⬇️

Добавьте startupProbe с запасом на время загрузки модели:


startupProbe:
httpGet: { path: /health, port: 8080 }
periodSeconds: 5
failureThreshold: 30 # 30 × 5 = 150 секунд на загрузку модели


👀Если хотите глубже разобраться в теме, оставили записи всех выступлений DevOps Lab:

«Запуск приватных LLM в Kubernetes» — Пётр Рукин
😉 Youtube
🥰 Rutube
😄 VK

«AI-агенты как второй DevOps» — Евгений Дехтярёв
😉 Youtube
🥰 Rutube
😄 VK

Желаем хороших выходных, а дежурным – спокойных смен!

#devopslab #ИИ #агенты
Please open Telegram to view this post
VIEW IN TELEGRAM
👍43🔥3
10 ошибок в CI/CD, которые замедляют работу инженеров

🔔В этот солнечный понедельник подготовили для вас подборку ошибок, собранную инженером портала DevOps.

Процессы непрерывной поставки связаны с эффективной работой пайплайнов. По мере роста числа репозиториев и циклов тестирования процессы СI/CD, которые работали на старте проекта, требуют инфраструктурных изменений.

В статье автор собрал 10 типичных ошибок в организации CI/CD. Вы узнаете, почему монолитные пайплайны приводят к росту времени сборок и как неправильная стратегия тестирования зависимостей и окружений влияет на стабильность доставки.

Какие ошибки вы бы добавили в этот список?

#devops #ci_cd #лучшие_практики
Please open Telegram to view this post
VIEW IN TELEGRAM
26👍4🔥3
👨‍💻Как сэкономить время на интеграционном тестировании с 28 до 17.5 с?

Рассказали инженеры CoreInfra ⬇️
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥43👍2
Forwarded from CoreInfra
Некоторое время назад я запустил autoresearch на задаче по ускорению тестов. Неожиданная находка: мы упирались не в сами тесты, а в путь до базы через порт-форвардинг докера. Изменение только этого ускоряет локальный прогон интеграционных тестов на macOS в полтора раза: 17.5 s против 28 s

Мы использовали Docker в Colima, а с Postgres, запущенным напрямую, каждый запрос к базе почти в 4 раза быстрее: ~0.1 мс против ~0.4 мс. Эти 0.3 мс уходят на SSH port-forwarding: host → SSH-туннель → VM → контейнер. А интеграционные тесты — это десятки тысяч последовательных запросов, так что 0.3 мс превращаются в +10 секунд.

Вывод: для локальной разработки лучше нативный Postgres. Если докер обязателен — Docker Desktop заметно лучше Colima: у него порт пробрасывается через vmnet, а не SSH.

Постфактум нашёл, что есть опция заменить ssh на grpc, но это все равно медленнее Docker Desktop 0.28 мс против 0.20 мс
colima start --port-forwarder grpc

@razmser
1🔥43👍2
Новостной дайджест от DevOps FM!

⌨️Делимся свежими новостями, туториалами и разборами инженерных практик.

Microsoft выкатили патч с рекордным числом исправлений.

Вчера, 14 июля, компания представила релиз с 570 фиксами ОС Windows, обнаруженных искусственным интеллектом. Из них устранили 60 критических уязвимостей, включая CVE-2026-56155, ошибку сервисов активной директории, и CVE-2026-56164, уязвимость Microsoft SharePoint.

В блоге Kubernetes вышла пошаговая инструкция по созданию собственного экспортера метрик, когда встроенных показателей CPU и памяти недостаточно. В ней разобрали, для каких задач нужен экспортер и как выбрать между Counter, Gauge и Histogram в зависимости от разных сценариев. В конце автор упомянул, как подготовить метрики для использования в HorizontalPodAutoscaler через Prometheus Adapter.

На Хабре вышло сравнение LLM в производственной среде. На примере использования llama.cpp, Gemma и Qwen в разных сценариях инженеры Wb-Tech решили:

• Перейти с Ollama на llama.cpp, чтобы получить больше контроля над инференсом, настройками, воспроизводимостью и структурированным выводом через GBNF
• Не использовать одну универсальную модель
• Использовать собственные конвееры для стабильных процессов
• Считать веса моделей критической зависимостью и фиксировать версии, хранить копии, не полагаться на внешние репозитории

Больше о бенчмарках и особенностях кейса – в статье.

Причины низкой производительности GitLab CI разобрал инженер компании OTUS. В статье он приводит 6 основных ошибок в работе: в кэшировании, распределении нагрузки между раннерами, выбором Docker-образов, параллелизацией, сборкой контейнеров и автоскейлингом. А также показывает, в чем измерять эффективность без усложнения инфраструктуры.

Брайан Грант, СТО ConfigHub, перечислил инструменты по управлению общими настройками рабочих нагрузок в Kubernetes.

Речь идет об автоматизированных проверках и изменениях в контексте безопасности, пробах, запасе количества упавших подов. В статье Брайн описывает подход Configuration as Data и дает готовые инструменты для анализа состояния кластеров, выявления нарушений. Подробности – на Medium.

#новостная_подборка #devops #kubernetes #llm #gitlab
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥4👍32
Пятничное чтиво на DevOps FM

📚 В эту пятницу собрали для вас подборку гайдов по обеспечению стабильной работы агентов в производственной среде. Автор статьи на Medium разделяет все 12 книг из рекомендации на 3 категории:

Для тех, кто строит автономных агентов
Начните с Designing Multi-Agent Systems, чтобы понять механику систем с нуля
А затем продолжите с Agentic AI Engineering, чтобы научиться делать агентов безопасными и не дать им случайно сломать производственную среду, например базу данных.

Для тех, кто выстраивает RAG-пайплайны
Автор советует Mastering Retrieval-Augmented Generation, чтобы разобраться в сегментации, извлечении и других практиках работы с контекстом.

Для инженерных лидов
Начать стоит с LLMOps для понимания контекста мониторинга, эксплуатации и стоимости ИИ-систем.

Автор не рекомендует читать все книги из подборки, ведь так легко застрять в бесконечном «туториальном аду» в недрах теории. ИИ-технологии быстро меняются, а значит, пора применять навыки на практике как можно скорее.

👀Какие материалы по работе с ИИ помогли вам? Делитесь в комментариях, расширим подборку полезного.

#пятничное_чтиво #подборка_книг #ии
Please open Telegram to view this post
VIEW IN TELEGRAM
2👍3🔥3🤔1