KazDevOps
6.87K subscribers
1.67K photos
28 videos
22 files
1.57K links
Канал о DevOps во всех проявлениях: K8s, CI/CD, HighLoad, AI/ML, Cloud, Linux
Возьмем на поддержку DevOps: https://core247.kz/
По рекламе @UlKonovalova
Download Telegram
⚡️ Как выстроить быстрорастущую AI-инфраструктуру для ритейла в облаке: опыт 4SELL

Летом 4SELL переехала в Yandex Cloud — всего за 3 недели и своими силами.

Сооснователь стартапа Роман Белопольский и архитектор Yandex Cloud Иван Кабанов рассказывают, какие потребности были у платформы и как выглядит финальная облачная архитектура, которая сейчас отвечает за обработку 100% транзакций.

Кратко: инфраструктура платформы построена на управляемых сервисах Yandex Cloud. Yandex Managed Service for Kubernetes® и Yandex Compute Cloud используются для запуска бэкенд-сервисов, API-серверов и компонентов обработки аудиопотоков. POS-транзакции, данные сотрудников, бонусы и метрики хранятся в Yandex Managed Service for PostgreSQL, а диалоги и результаты аналитики — в Yandex Object Storage. Аудиофайлы используют только для транскрибации и не хранят после обработки.

⚪️Отдельные сервисы отвечают за сбор метрик и журналов, изолированную сетевую инфраструктуру и защищённые каналы передачи данных, хранение образов приложений, управление SSL-сертификатами и балансировку нагрузки.

⚪️При этом всё хранится локально — в казахстанском ЦОД.

Сейчас валовая рентабельность платформы составляет 60%, а LTV/CAC превышает 3,95 и продолжает расти.

👈 Подробнее о кейсах клиентов и опыте переезда — в подкасте с Романом и Иваном.
Please open Telegram to view this post
VIEW IN TELEGRAM
1533
⚡️ Полезные материалы по итогам доклада Мираса Байгашева «Правильный FinOps в современных superapp»

Сохраняйте и делитесь с коллегами подборкой ресурсов, кейсов и инструментов для тех, кто хочет глубже разобраться в практике управления затратами на инфраструктуру.

База и стандарты FinOps

⚪️FinOps Foundation — главный мировой хаб и сообщество по FinOps
⚪️FinOps Framework — фундаментальный фреймворк и лучшие практики
⚪️Спецификация FOCUS — открытый стандарт данных для биллинга и учета облачных затрат

Доклады и реальные кейсы компаний

⚪️Making Unit Economics Actionable — как сделать юнит-экономику рабочим инструментом для инженеров
⚪️Hybrid Cost Transparency on PlayStation — кейс Sony по обеспечению прозрачности гибридных затрат
⚪️Engineering Cost per Feature at Canva with OpenTelemetry — как Canva считает стоимость разработки отдельных фич с помощью OpenTelemetry
⚪️Extending FinOps to On-Prem (Target) — как ретейлер Target распространяет FinOps-практики за пределы облака на локальные дата-центры
⚪️Making FOCUS Work in Practice — опыт Elo по внедрению спецификации FOCUS для не-облачной инфраструктуры
⚪️Cloud Budget & Forecast Process (Atlassian) — как в Atlassian устроены процессы бюджетирования и прогнозирования облачных расходов
⚪️Anomaly Detection with Looker on Google Cloud — автоматическое обнаружение аномалий в аномальном росте затрат в GCP

Инструменты и решения

⚪️OpsMan AI — наш продукт для управления и оптимизации инфраструктуры (Документация OpsMan AI)
⚪️Kubecost — мониторинг и оптимизация расходов внутри Kubernetes
⚪️Infracost — оценка изменения стоимости инфраструктуры еще до применения terraform apply
⚪️Kube-green — снижение нагрузки и гашение ресурсов K8s в нерабочее время

Токеномика

⚪️Tokenomics Foundation — портал о проектировании и экономике токенов
⚪️Tokenomics Stack — пятиуровневая модель стека токеномики
⚪️Big-T Notation — формальный язык и нотация для описания токеномических систем

@DevOpsKaz 😛
Please open Telegram to view this post
VIEW IN TELEGRAM
13222
🔥 Как смена SRE-работы похожа на смену самолёта

В авиации есть термин Type Conversion — процесс, когда опытный пилот пересаживается на новый тип самолёта. Он не учится летать заново: физика полёта та же, но кабина и тумблеры другие.

Билл Данкан (SRE-инженер и пилот) отлично перенёс эту концепцию на онбординг в новую DevOps/SRE-команду. Вот 4 правила, которые помогут не упасть в первый месяц:

1️⃣ Принципы не меняются

Аэродинамика одинакова для Cessna и Boeing. Бюджеты ошибок, контроль blast radius и дисциплина быстрых откатов не зависят от компании — вы приносите эти знания с собой в первый день.

2️⃣ Приборы те же, панель — другая

Скорость и высота отображаются везде. В прод-системах это Latency, Error Rate, Saturation (методы RED/USE). На новом месте меняется только табло: Datadog, Grafana или забытый дашборд. Задача первой недели — понять, где смотрят метрики и какие из них «врут» под нагрузкой.

3️⃣ Опасайтесь старой мышечной памяти

Вы умеете катить релизы. Но если прошлый опыт — это GitOps + ArgoCD, а в новой компании — ручной деплой через Jenkins, автопилот сыграет против вас. Ошибки в первый месяц происходят не от недостатка квалификации, а от применения старых привычек к новым рычагам.

4️⃣ Запоминайте критические цифры

В авиации есть V-speeds — специфичные для каждого борта критические скорости. Попытка зайти на посадку на параметрах другого самолёта приведет к катастрофе. В SRE это пороги онколла, целевые SLO, определение SEV1 и цепочки эскалаций. Их нужно выучить назубок из ранбуков и постмортемов еще до первого ночного дежурства.

Не пытайтесь в первые недели лететь «соло». Изучите системы, поспрашивайте опытных пилотов (инженеров) и не делайте выводов о переключателях, пока лично не проверите, за что они отвечают.


@DevOpsKaz 😛
Please open Telegram to view this post
VIEW IN TELEGRAM
143🗿22
🚀 Yandex Qazaqstan, Astana Hub и Alem ai Foundation открыли набор в ML School Kazakhstan на двухгодичную программу по машинному обучению
 
Что в программе:

⚪️ алгоритмы, Python, C++ или Rust, классическое машинное обучение
⚪️ deep learning: нейросети, трансформеры, генеративные модели и современные подходы к обучению
⚪️ специализации: NLP, компьютерное зрение, рекомендательные системы, речевые технологии, RL
⚪️ инженерный трек: CUDA, Go, распределённое обучение и оптимизация инференса
⚪️ проектная и исследовательская практика
 
Практическая часть программы включает встречи с ML-специалистами Yandex и других технологических компаний страны. Студенты будут разбирать примеры реальных систем, их архитектуру и логику.
 
Обучение будет проходить очно на базе alem ai в Астане 2-3 раза в неделю.
 
👈 Подать заявку на отбор можно до 8 октября 2026 года.

❗️ Требуется предварительно зарегистрироваться на платформе.
 
@DevOpsKaz 😛
Please open Telegram to view this post
VIEW IN TELEGRAM
4322
⚡️ ИИ снес деплой: что делать?

Наш общий страх оправдался: в сети все больше новостей, про то как суперсовременные ИИ-модели убивают многочасовой труд инженеров и разработчиков.

Важно помнить, что у агента (какой бы крутой он ни был) нет того контекста, который есть у инженера: он действует в рамках выданных прав и полученной инструкции, а не по интуитивному пониманию, какой ресурс трогать нельзя.

В новой статье разбираем, как ограничить ущерб от автономных ошибок.

👈 Читать статью

@DevOpsKaz 😛
Please open Telegram to view this post
VIEW IN TELEGRAM
🗿43222
Forwarded from DevOpsDays Almaty 2026
🔥 Спикер №11 DevOpsDays Almaty'26 — Нэлия Логинова, Head of Platform Technologies, Netcracker

Нэлия руководит платформенной командой, с которой разрабатывает внутренние инфраструктурные сервисы (Kubernetes, PostgreSQL, Kafka, MongoDB, Cassandra, RabbitMQ, Consul, etc.) и процедуры по их эксплуатации (установка, апгрейды, бэкапы, мониторинг, траблшутинг).

Полная автоматизация, обратная совместимость, L3–L4 поддержка и участие в разборе production-инцидентов. Нэлия хорошо знает, что действительно работает, а что нет. Ops-команда разворачивает эти решения на 100+ Kubernetes-кластерах и в десятках production-инсталляций Tier-1 телеком-операторов по всему миру.

На DevOpsDays Нэлия представит доклад From Runbooks to Troubleshooting Skills.

Она расскажет, почему доступ к знаниям ещё не делает агента полезным, чем skill отличается от стандартной документации и как управлять skills в масштабе десятков команд. И, главное, на какие грабли команда уже наступила и что из этого вынесла.

Это не история успеха. Это реальный путь внедрения AI в анализ инцидентов.

🎟 Покупайте билет на себя или компанию — мощная программа, полезный нетворкинг и буст ваших навыков гарантированы.


@devopsdayskz
Please open Telegram to view this post
VIEW IN TELEGRAM
1553
🔥 Перестаньте будить дежурных из-за CPU > 80%

Каждый алерт, требующий немедленной реакции человека, должен быть срочным, важным, действенным и реальным. Если он не проходит хотя бы один критерий — это не повод для ночного вызова, а повод переписать сам алерт.

Предлагаем инженерный подход к дизайну алертов по принципам Google SRE от коллег:

⚪️ Почему алертить на нагрузку процессора или диск — плохая идея, и как ориентироваться на 4 золотых сигнала (Latency, Traffic, Errors, Saturation)
⚪️ Как отслеживать скорость сгорания SLO вместо наивных порогов
⚪️ Один инцидент — одно уведомление, без спама из 100 сообщений в чате
⚪️ Что реально заслуживает ночного звонка, а что может подождать до утра
⚪️ Почему алерт без инструкции по решению — это не алерт, а бесполезная паника

В конце — чек-лист, который стоит проходить каждый раз перед добавлением нового триггера.

👈 Читать полностью

@DevOpsKaz 😛
Please open Telegram to view this post
VIEW IN TELEGRAM
163221
Please open Telegram to view this post
VIEW IN TELEGRAM
1442
Forwarded from DevOpsDays Almaty 2026
🔥 Спикер №12 DevOpsDays Almaty'26 — Душеин Александр, архитектор облачных решений Yandex Cloud

Александр уже 5 лет погружается сам и погружает других в облачные технологии Yandex.

На конференции он выступит с докладом на тему « GPU в кластере Kubernetes: эффективная утилизация ресурсов для задач ML» и расскажет, как поделить большую GPU на много маленьких задач, а затем поделить большую задачу на много маленьких GPU.

В докладе только самое мясо.

🎟 Покупайте билет на себя или компанию — мощная программа, полезный нетворкинг и буст ваших навыков гарантированы.


@devopsdayskz
Please open Telegram to view this post
VIEW IN TELEGRAM
14221
ResearchReport-2026StateofAIEngineering.pdf
2.7 MB
⚡️ State of AI Engineering 2026

Отчет Datadog «State of AI Engineering 2026» основан на анализе телеметрии вызовов LLM у более чем тысячи клиентов компании.

6 ключевых выводов из отчета:

1️⃣ Доминирование мультимодельной архитектуры. 70% организаций используют 3 и более моделей, а доля компаний, применяющих более 6 моделей, почти удвоилась (41%). Прямые вызовы API провайдеров уступают место паттерну Model Gateway (например, OpenRouter или собственные шлюзы).

2️⃣ Накопление технического долга LLM. Инженерные команды быстро внедряют новые релизы, но крайне медленно выводят из эксплуатации старые модели в production.

3️⃣ Использование агентских фреймворков (LangChain, Pydantic AI, LangGraph, Vercel AI SDK и др.) выросло с 9,1% до 17.5% среди организаций. Разработчикам требуется сквозная трассировка (tracing) и телеметрия, чтобы выявлять неэффективную логику.

4️⃣ 69% всех входных токенов приходится на системные промпты: внутренние инструкции, политики безопасности, описания инструментов и схемы данных. На пользовательские промпты приходится лишь 28%.

5️⃣ Главным приоритетом становится Context Engineering — методы точной выборки (RAG), сжатия, дедупликации, суммаризации и формирования четкой иерархии информации, чтобы модель не теряла критические детали в длинном тексте.

6️⃣ Переход от монолитных агентов к микросервисным/мультиагентным архитектурам требует проброса контекста и трассировки через границы сервисов, а также формирования карт сервисов.

Разработка ИИ-систем превращается в дисциплину классической распределенной инженерии. Успех продуктов зависит не от красоты демо-версий, а от наличия непрерывных петель оценки качества (evals), проработанного инжиниринга контекста, контроля бюджетов/лимитов и сквозного мониторинга производительности и расходов.


@DevOpsKaz 😛
Please open Telegram to view this post
VIEW IN TELEGRAM
1222
🔥 Участвуйте в AWS Innovation Day 2026 — 22 октября, бесплатно

Конференция об искусственном интеллекте, Agentic AI и облачных технологиях AWS пройдет в Астане.

В программе:

⚪️практические кейсы применения генеративного и агентного ИИ
⚪️подходы к созданию AI-агентов
⚪️архитектура безопасной AI-инфраструктуры
⚪️переход от пилотных решений к production
⚪️работа с государственными и корпоративными IT-системами
⚪️вопросы комплаенса и суверенитета данных

Среди спикеров — представители AWS, Министерства искусственного интеллекта и цифрового развития РК, АО НИХ «Байтерек», АО «Самрук-Қазына», «Казахтелекома», MUK Group и qCloudy.

Мероприятие ориентировано на руководителей, отвечающих за цифровую трансформацию, AI, данные и технологическую стратегию в государственном и корпоративном секторе.

📅 22 октября 2026, Астана, Astana Hub
🎟️ Участие бесплатное

👈 Регистрация

@DevOpsKaz 😛
Please open Telegram to view this post
VIEW IN TELEGRAM
144