Ключевой процесс — сохранить старые DNS как точки совместимости. В старом namespace временно оставляем
Service типа ExternalName, который перенаправляет запросы на сервис в новом namespace.Такой сценарий используется во время миграции:
Внутренний и внешний трафик нужно рассматривать отдельно: перенос
Service сам по себе не решает проблему Ingress.@DevOpsKaz
Please open Telegram to view this post
VIEW IN TELEGRAM
1 5 2 2
Forwarded from DevOpsDays Almaty 2026
Тамерлан развивает распределённые системы, cloud-native инфраструктуру и observability в BCC-HUB. В его фокусе в том числе — платформа распределённой трассировки на базе OpenTelemetry для инфраструктуры с 1000+ микросервисов.
На конференции Тамерлан выступит с докладом «Распределённая трассировка: как получить целостную картину системы».
Когда в инфраструктуре больше тысячи микросервисов, сложно понять работу системы по отдельным трассировкам. Поэтому данные трассировки можно использовать не только для анализа отдельных запросов, но и для получения общей картины взаимодействия сервисов.
В докладе Тамерлан покажет:
🎟 Покупайте билет на себя или компанию — мощная программа, полезный нетворкинг и буст ваших навыков гарантированы.
@devopsdayskz
Please open Telegram to view this post
VIEW IN TELEGRAM
1 5 4 2
Летом 4SELL переехала в Yandex Cloud — всего за 3 недели и своими силами.
Сооснователь стартапа Роман Белопольский и архитектор Yandex Cloud Иван Кабанов рассказывают, какие потребности были у платформы и как выглядит финальная облачная архитектура, которая сейчас отвечает за обработку 100% транзакций.
Кратко: инфраструктура платформы построена на управляемых сервисах Yandex Cloud. Yandex Managed Service for Kubernetes® и Yandex Compute Cloud используются для запуска бэкенд-сервисов, API-серверов и компонентов обработки аудиопотоков. POS-транзакции, данные сотрудников, бонусы и метрики хранятся в Yandex Managed Service for PostgreSQL, а диалоги и результаты аналитики — в Yandex Object Storage. Аудиофайлы используют только для транскрибации и не хранят после обработки.
Сейчас валовая рентабельность платформы составляет 60%, а LTV/CAC превышает 3,95 и продолжает расти.
Please open Telegram to view this post
VIEW IN TELEGRAM
1 5 3 3
Сохраняйте и делитесь с коллегами подборкой ресурсов, кейсов и инструментов для тех, кто хочет глубже разобраться в практике управления затратами на инфраструктуру.
База и стандарты FinOps
Доклады и реальные кейсы компаний
Инструменты и решения
terraform apply Токеномика
@DevOpsKaz
Please open Telegram to view this post
VIEW IN TELEGRAM
1 3 2 2 2
В авиации есть термин Type Conversion — процесс, когда опытный пилот пересаживается на новый тип самолёта. Он не учится летать заново: физика полёта та же, но кабина и тумблеры другие.
Билл Данкан (SRE-инженер и пилот) отлично перенёс эту концепцию на онбординг в новую DevOps/SRE-команду. Вот 4 правила, которые помогут не упасть в первый месяц:
Аэродинамика одинакова для Cessna и Boeing. Бюджеты ошибок, контроль blast radius и дисциплина быстрых откатов не зависят от компании — вы приносите эти знания с собой в первый день.
Скорость и высота отображаются везде. В прод-системах это Latency, Error Rate, Saturation (методы RED/USE). На новом месте меняется только табло: Datadog, Grafana или забытый дашборд. Задача первой недели — понять, где смотрят метрики и какие из них «врут» под нагрузкой.
Вы умеете катить релизы. Но если прошлый опыт — это GitOps + ArgoCD, а в новой компании — ручной деплой через Jenkins, автопилот сыграет против вас. Ошибки в первый месяц происходят не от недостатка квалификации, а от применения старых привычек к новым рычагам.
В авиации есть V-speeds — специфичные для каждого борта критические скорости. Попытка зайти на посадку на параметрах другого самолёта приведет к катастрофе. В SRE это пороги онколла, целевые SLO, определение SEV1 и цепочки эскалаций. Их нужно выучить назубок из ранбуков и постмортемов еще до первого ночного дежурства.
Не пытайтесь в первые недели лететь «соло». Изучите системы, поспрашивайте опытных пилотов (инженеров) и не делайте выводов о переключателях, пока лично не проверите, за что они отвечают.
@DevOpsKaz
Please open Telegram to view this post
VIEW IN TELEGRAM
1 4 3🗿2 2
Что в программе:
Практическая часть программы включает встречи с ML-специалистами Yandex и других технологических компаний страны. Студенты будут разбирать примеры реальных систем, их архитектуру и логику.
Обучение будет проходить очно на базе alem ai в Астане 2-3 раза в неделю.
@DevOpsKaz
Please open Telegram to view this post
VIEW IN TELEGRAM
Наш общий страх оправдался: в сети все больше новостей, про то как суперсовременные ИИ-модели убивают многочасовой труд инженеров и разработчиков.
Важно помнить, что у агента (какой бы крутой он ни был) нет того контекста, который есть у инженера: он действует в рамках выданных прав и полученной инструкции, а не по интуитивному пониманию, какой ресурс трогать нельзя.
В новой статье разбираем, как ограничить ущерб от автономных ошибок.
@DevOpsKaz
Please open Telegram to view this post
VIEW IN TELEGRAM
🗿4 3 2 2 2
Forwarded from DevOpsDays Almaty 2026
Нэлия руководит платформенной командой, с которой разрабатывает внутренние инфраструктурные сервисы (Kubernetes, PostgreSQL, Kafka, MongoDB, Cassandra, RabbitMQ, Consul, etc.) и процедуры по их эксплуатации (установка, апгрейды, бэкапы, мониторинг, траблшутинг).
Полная автоматизация, обратная совместимость, L3–L4 поддержка и участие в разборе production-инцидентов. Нэлия хорошо знает, что действительно работает, а что нет. Ops-команда разворачивает эти решения на 100+ Kubernetes-кластерах и в десятках production-инсталляций Tier-1 телеком-операторов по всему миру.
На DevOpsDays Нэлия представит доклад From Runbooks to Troubleshooting Skills.
Она расскажет, почему доступ к знаниям ещё не делает агента полезным, чем skill отличается от стандартной документации и как управлять skills в масштабе десятков команд. И, главное, на какие грабли команда уже наступила и что из этого вынесла.
Это не история успеха. Это реальный путь внедрения AI в анализ инцидентов.
🎟 Покупайте билет на себя или компанию — мощная программа, полезный нетворкинг и буст ваших навыков гарантированы.
@devopsdayskz
Please open Telegram to view this post
VIEW IN TELEGRAM
1 5 5 3
Каждый алерт, требующий немедленной реакции человека, должен быть срочным, важным, действенным и реальным. Если он не проходит хотя бы один критерий — это не повод для ночного вызова, а повод переписать сам алерт.
Предлагаем инженерный подход к дизайну алертов по принципам Google SRE от коллег:
В конце — чек-лист, который стоит проходить каждый раз перед добавлением нового триггера.
@DevOpsKaz
Please open Telegram to view this post
VIEW IN TELEGRAM
1 6 3 2 2 1
Forwarded from DevOpsDays Almaty 2026
Александр уже 5 лет погружается сам и погружает других в облачные технологии Yandex.
На конференции он выступит с докладом на тему « GPU в кластере Kubernetes: эффективная утилизация ресурсов для задач ML» и расскажет, как поделить большую GPU на много маленьких задач, а затем поделить большую задачу на много маленьких GPU.
В докладе только самое мясо.
🎟 Покупайте билет на себя или компанию — мощная программа, полезный нетворкинг и буст ваших навыков гарантированы.
@devopsdayskz
Please open Telegram to view this post
VIEW IN TELEGRAM
1 3 2 2