Культура Надёжности
175 subscribers
141 photos
5 videos
48 links
Авторский канал о надёжности

@SlavaKudryashov
Download Telegram
В продолжение темы про будущее SRE. Кроме общих слов и очевидных выводов, в отчете Gartner есть тезисы, которые достойны, как минимум того, чтобы их прочесть:

1. AI инструменты направленные на обнаружение и управление параметрами SLO будут быстро развиваться, т.е. заключение контрактов мы скоро делегируем ИИ

2. AI-агенты будут помогать дежурным сменам: отличать ложные срабатывания систем оповещения от настоящих

3. Используя исторические данные ИИ сможет прогнозировать нагрузку на системы (исторические данные по нагрузке за последние 5 лет: пандемия, СВО, импортозамещение …)

4. Самовосстанавливающиеся системы (правда для начала придется сделать их просто восстанавливающимися)

5. AI-агенты смогут(должны смочь, даже обязаны) устанавливать корневые причины инцидентов на основе данных мониторинга и логировния

Что же останется людям(SRE/OPS людям)?

1. Внедрение «культуры надежности» на всех этапах жизненного цикла систем

2. Выявление и проверка источников данных для AI-агентов

3. Ответственность за производительность и обучение AI-агентов

4. Формирование стратеги надёжности для всей организации

5. Коммуникация ценности инициатив в области надежности для заинтересованных сторон

Может быть не очевидно, но все пункты сводятся к тому, что существующие роли SRE/OPS трансформируются в новую - архитектора надёжности

Это мнение аналитиков Gartner… посмотрим

Оригинал:
AI, Autonomy, and Architects: The Future of Site Reliability Engineering
24 September 2025, Gartner


#Надёжность_ИИ

@Simple_Reliability
👍1
Все яйца в одной корзине (второй раз за месяц)
 
У крупнейшего облачного провайдера Amazon Web Services (AWS) 21 октября 2025 года произошёл инцидент, который привел к каскадным сбоям по всему миру. Первые сообщения об ошибках начали поступать около семи утра (GMT), а полное восстановление работы заняло около 15 часов.
 
Согласно данным DownDetector, сбой затронул более 1000 компаний (WhatsApp, Roblox, Amazon, Coinbase…) по всему миру, было зафиксировано около 6,5 миллионов отчетов о проблемах.
 
Инцидент стал результатом каскадного отказа, вызванного проблемой в «единой точке отказа» сетевой инфраструктуры.
 
1.  Проблема возникла после технического обновления…, что привело к нарушению работы внутренней подсистемы мониторинга сетевых балансировщиков нагрузки.
 
2.  Проблема в подсистеме мониторинга напрямую затронула Domain Name System (DNS).
DNS функционирует как "телефонная книга" интернета, преобразуя понятные человеку доменные имена (например, `www.example.com`) в IP-адреса серверов. Из-за сбоя приложения не могли определить правильный IP-адрес для обращения к API. Без доступа к этой базе данных, критически важной для хранения пользовательской информации, зависимые сервисы переставали функционировать.

 
3.  А далее каскадный эффект… по всем связанным сервисам.
 
DeepSeek описал корневую причину как "технологическая монокультура". Это когда значительная часть мировой цифровой инфраструктуры зависит от одного провайдера или сетевого региона.
 
Официальный отчет о инциденте от AWS, вероятно, будет опубликован через несколько месяцев. Однако, уже сейчас можно сделать выводы:

1.  Критически важные сервисы необходимо развертывать в нескольких Зонах Доступности (Availability Zones) внутри одного сетевого региона, а для высочайшего уровня отказоустойчивости – в нескольких регионах.
 
2.  Для наиболее важных систем, стоит рассмотреть использование нескольких облачных провайдеров
 
3.  Активное использование механизмов автоматического восстановления и балансировки нагрузки.
 
4.  Регулярное проведение аварийных учений по отработке подобного рода отказов…
 
В общем, выше описан еще один аргумент для защиты бюджета на развитие надёжной сетевой инфраструктуры…
 
#ВПИ
 
@Simple_Reliability
😱42
Компания Thoughtworks опубликовала отчет посвященный трендам, влияющих на развитие бизнеса. Это долгосрочный взгляд на эволюцию технологического ландшафта.

Всего 90 трендов, и, если вас беспокоит надёжность, то, кажется, что уже сейчас стоит обратить минимум на два из них (позже может быть уже поздно…)

1. Data Mesh
Децентрализованная, доменно-ориентированная архитектуру данных. Каждый домен владеет своими "данными как продуктом"


Централизованные хранилища данных, неизбежно, становятся единой точкой отказа

Плюс для надежности: Отказ в одном домене не обязательно приведет к коллапсу всей системы данных. Повышается устойчивость и скорость восстановления.

2. Мелкие языковые модели (Small language models)

Плюс для надежности: Возможность запуска на периферийных устройствах (Edge computing). Это снижает зависимость от центрального ЦОДа и сетевого соединения, повышая отказоустойчивость и снижая задержки.
Использовать SLM разумно для критичных к задержке или работающих в офлайн-режиме сервисов…

Оригинал: Looking Glass. Bringing tech-lead business changes into focus (Toughtworks; 2025)

#Надёжности_ИИ

@Simple_Reliability
На следующей неделе, в рамках Tech Community Fest, запланировали провести дебаты. Тема: Заменят ли ИИ-агенты специалистов службы сопровождения?

Я считаю, что все именно к этому и идет. Причем семимильными шагами…

Вот три довода/вопроса

1. ИИ-агенты работают 24/7, не устают и не подвержены эмоциональному выгоранию. Как человеческий фактор может считаться преимуществом в условиях?

2. Традиционный тикет поддержки стоит компании около $26, в то время как тикет, решенный ИИ-агентом, обходится примерно в $1 . Как вы можете оправдать такое 26-кратное увеличение операционных расходов?

3. ИИ-агенты могут постоянно обучаться на данных о предыдущих обращениях, повышая свою точность. Как обычный сотрудник, чье обучение требует времени и ресурсов, может конкурировать со скоростью и масштабом такого обучения?

#Надёжность_ИИ

@Simple_Reliability
👍2
У недавнего сбоя Amazon есть любопытный связанный инцидент:
Умные кровати Eight Sleep буквально жарили своих владельцев...

Дело в том что система управления матрасами работают только через облако, то самое, которое стало недоступно. Устройства вообще не имеют автономной системы управления

Гендиректор компании Маттео Франческетти признал ошибку и извинился перед пострадавшими. Каждый такой матрас стоит по $2000.

А вы говорите, автономный мир…

P.S. кстати, стояночный тормоз, в автомобилях уже давным-давно не механический…

@Simple_Reliability
🔥3
Forwarded from HighLoad++
Истории GenAI трансформации — специальная секция в программе HighLoad++ 2025, подготовленная при поддержке Домклик

В этом посте рассказываем вам о первых двух докладах из секции, в которых спикеры поделятся реальными кейсами: запуск AI-агентов и внедрение AI-агентов в продакшн критичных банковских систем.

1️⃣ AI-агенты для рынка недвижимости: от чат-бота до мультиагентной системы. Алина Баймашева (Домклик)

Создание AI-агентов — это не только про RAG и цепочки, но и про безопасность, правильный выбор моделей и преодоление скрытых ограничений. Алина покажет, как построить платформу для агентов и когда опенсорс оказывается лучше проприетарных решений.

2️⃣ Как сохранить высокую надежность при GenAI-трансформации. Вячеслав Кудряшов (Сбер)

Из доклада узнаете, как в Сбере внедряют AI-агентов в критичные банковские системы без падений прода. Увидите 12 боевых паттернов надежности: от предотвращения зацикливаний до автоматических откатов. Готовые решения для вашего GenAI. Не пропустите опыт, который сэкономит вам месяцы!

Встречаемся уже на следующей неделе на HighLoad++ 2025 в Москве

Полная программа конференции и билеты на сайте
👍62
52/48

Такое распределение у нас получилось по итогу дебатов «Заменит ли ИИ службу сопровождения»

С небольшим перевесом победил ответ: «нет, не заменят».

Вот что интересно, среди голосовавших большинство - администраторы АС, т.е. как раз те, кого заменит ИИ.

Всего год назад, подобный вопрос в адрес любого специалиста в ИТ вызвал бы искреннюю улыбку… из всех приемников страны звучало «у нас дефицит ИТшников»…

И вот, неожиданно быстро, наступила стадия «принятия»

@Simple_Reliability
😱2
Популяризация ИИ делает свое дело. Никто не хочет «отстать от поезда», все, так или иначе, начинают использовать ИИ для рабочих задач, а иначе окажешься не эффективным и тебя заменят эффективные…

Но вот вопрос: готовы ли организации к тому, что их сотрудники станут более «эффективными» за счет ИИ (неподконтрольного им ИИ)

Точно не все.

1. Судя по опросу Gartner, 2025, 49% сотрудников используют сторонние сервисы, которые
отправляют всю внутреннюю информацию в «неподконтрольные облака»

2. 32% сотрудников скрывают факт такого использования, чтобы избежать процессов внутренних согласований с ИБ, тем самым усугубляя ситуацию

3. 15% сотрудников вообще используют личные BYOD (bring your own device) для решения рабочих задач. Как контролировать использование таких устройств пока вообще не очень понятно…

Что с этим делать?
Видимо подстраиваться под реалии:

1. Создавать внутренние службы за контролем использования ИИ, должен же кто-то централизованно нести за все это ответственность

2. В идеале, доводить внутренние ИИ решение до состояния, когда у сотрудников не будет даже мыслей пользоваться чем-то другим

3. Внедрять новые механизмы и методики, например:
- AI Usage Control для обнаружения и блокировки нежелательного ИИ.
- AI TRiSM (Trust, Risk, Security) решения для тотального контроля над всеми моделями ИИ в сети.

4. И, самое главное, обучайте сотрудников новым рискам реалиям

#Надёжность_ИИ

@Simple_Reliability
👍5
Психология на службе надёжности…
 
В 1962 году французский исследователь Мишель Сифр проводил эксперимент по субъективной оценки времени, который случайно открыл механизм контроля над паникой.
 
Механизм, среди прочего, можно использовать для экономии времени при решении инцидентов.
 
Называется он «Вербальное заземление»
В пещере, на грани психологического срыва, Сифр случайно обнаружил механизм стабилизации. Он не медитировал и не применял дыхательные техники. Он начал говорить вслух простые утверждения:
"Я сижу."
"Я дышу."
"Моя рука двигается."
Эффект был немедленным. Паника отступила. Когнитивный контроль вернулся.

 
Тоже самое предлагается использовать и при решении критических инцидентов, необходимо лишь внедрить соответствующие практики:

1. Исполнители должны проговаривать все свои действия вслух

2. Координаторы и руководители изменить формат своих вопросов
(Вместо «Какой статус?» – «Что ты видишь прямо сейчас?»)

3. Заменить интерпретации на факты
(Вместо «Это катастрофа…» - «До хоста X не доходит трафик…»)
 
@romanestt, что скажешь, должно работать?
 
@Simple_Reliablity
👍71
В сентябре 2022 года, Gartner опубликовал прогноз, согласно которому организации инвестирующие в DIS

Digital Immune System (DIS) — это целостный подход к созданию программных систем, которые обладают врожденной устойчивостью и способностью к самовосстановлению. Объединяя практики наблюдаемости, автотестирования, инженерии хаоса и автоматического исправления сбоев, DIS минимизирует downtime и обеспечивает бесперебойный пользовательский опыт, проактивно нейтрализуя угрозы и оперативно восстанавливаясь после инцидентов, подобно биологическому иммунитету.


к 2025 году увеличат удовлетворенность своих пользователей за счет снижения времени простоя своих сервисов на 80%.

2025 год подходит к концу. Gartner ничего не говорит о том сбылся их прогноз или нет… (нет такой задачи). Зато продолжает прогнозировать, что данный тренд продолжит развиваться и эволюционирует в ACIS

Autonomous Cyber Immune System
- автономная, самообучающаяся система превентивной безопасности и надежности (эволюция DIS)


Сработает или нет, покажет время. Но концепция точно поможет обосновать «эволюцию» службы сопровождения/SRE/экспертов надежности в эпоху GenAI 😉

@Simple_Reliability
2👍1
This media is not supported in your browser
VIEW IN TELEGRAM
Похоже формируется новая традиция: конец ноября = IT Talks by SBER в Самаре.

Если будете в Самаре 20.11, приходите, обсудим насущное.

Мероприятие отличное.

@Simple_Reliability
🔥82
Запоминаем новые слова: EvalOps (это то чем нам предстоит заниматься в ближайшем будущем)

EvalOps = Еvaluation (оценка) + Operations - это философия и набор практик, которые расширяют принципы DevOps и SRE, добавляя непрерывную, автоматизированную оценку "интеллектуального" поведения AI-систем в производственной среде.


Раньше мы (многие, к счастью, до сих пор) имели дело с детерминированным кодом: есть входные данные, есть код, который их обрабатывает по строгим правилам, есть предсказуемый выход.

Было все понятно: работа заключалась в обеспечении доступности, производительности и отказоустойчивости инфраструктуры и приложений.

Ключевой же особенностью AI-агентов и LLM является недетерминированность их поведения (нельзя полностью предсказать стандартными юнит-тестами результат их работы).

Новые особенности = новые проблемы вызовы (или новая область внимания SRE/OPS инженеров)

Галлюцинации: Система выдает убедительно звучащую, но абсолютно ложную информацию
НеИндепотентность (мое любимое): Ответы модели могут деградировать со временем, при одинаковых вводных, без каких-либо изменений
Нестабильность контекста: Небольшие изменения в промпте могут кардинально менять результат работы AI-агента


Практики EvalOps (на них посмотрим в следующий раз), как раз направлены на решение этих проблем. Это своего рода SRE для AI.

#НадёжностьИИ #EvalOps

@Simple_Reliability
👍6
Новый термин узнали (EvalOps), а что конкретно делать?

Есть три ключевые области на которых стоит сосредоточиться:

1. Наблюдаемость (Observability) для AI

Привычных технологических метрик, логов и трейсов не достаточно.

Для «наблюдаемости» AI нужно в онлайне контролировать бизнес-метрики качества (factual_accuracy, hallucination_rate, toxicity_score, relevancy_score,…)

Логировать не только HTTP-запросы, но и промпты, ответы модели, цепочки размышлений (reasoning chains) агентов

«Трассировать» выполнение не только микросервисов, но и шаги AI-агентов

2. Автоматизированное тестирование и Canary-релизы для AI

Не нужно ждать пока пользователь наткнется на галлюцинация, нужно проактивно их искать… например с помощью
canary-релизов с автоматическими quality-gate’ами (небольшая часть трафика направляется на новую версию модели, автоматически насчитываются метрики качества и если они отклоняются от нормы, то трафик автоматом возвращается на работоспособную версию модели)

3. Пост-продакшен мониторинг и инцидент-менеджмент

Все то что описано в п.1 должно стать рабочими инструментами службы сопровождения, без использования этих инструментов расследование инцидентов станет слабо реализуемым

Кончено это не все, но основы кажется понятны и логичны.

#НадёжностьИИ #EvalOps

@Simple_Reliability
2
Немного юмора, про надежность… после скучного поста.

@Simple_Reliability
🤣5🔥1
LLM-as-a-judge популярный метод повышения качества AI-решений, так говорят, но есть вопросы…

Точнее результаты исследования Gartner, которые говорят о другом.

Вся суть на картинке: LLM принимает решение на основе знаний, а человек, помимо знаний, обладает знанием контекста и уникальным экспертным опытом.

Безусловно, часть контекста передается и знаний у LLM больше… но исследования говорят о том, что «Использование ИИ для проверки ИИ» - это миф, который работает для ограниченного числа задач создании контента, например, проверки орфографии и общеизвестных фактов.

Еще два мифа: «Для ИИ чем больше контента, тем лучше» и «Для ИИ нет необходимости структурировать контент» развинчиваются в этом же исследовании.

Оригинал: Misconceptions when using AI for knowledge management (Gartner, 27.10.2025)

@Simple_Reliability
🤔1
GigaChat определенно льстит нашему псу(обратите внимание на сгенерированное видео)

Шутки шутками, но цензор явно не дорабатывает в кейсах со щенками… или обучающая выборка состояла преимущественно из коней🙈

@Simple_Reliability
😁12🙈2🤣1
На примере дилеммы «кого сбить насмерть? Бабушку или ребенка» удобно иллюстрировать различие больших языковых моделей (LLM):

Западные LLM «сбивают» бабушку, мотивируя это тем, что у ребенка вся жизнь впереди.

Китайские - ребенка, руководствуясь логикой, что бабушка идеологически правильно подкована и может воспитать сотни полезных членов общества…

Что же выберет AGI, когда действительно станет General?

@Simple_Reliability
Шутка родилась, в связи с повсеместным обсуждением того, что AI заменит ИТшников:

В аббревиатуре SRE, S значит Senior

@Simple_Reliability
🤣2
This media is not supported in your browser
VIEW IN TELEGRAM
Пока гирлянды мигают, а код компилируется — самое время задуматься о главном тренде 2025: AI во всем.

Приглашаем на нашу большую конференцию IT Community Day.

Ключевые темы:

🤖 AI-агенты и GenAI — как встроить в продукты и не сломать архитектуру.
🛡️ Надёжность инфраструктуры — когда за монитором следит еще один (искусственный) интеллект.
🧠 Soft skills — что прокачивать, чтобы остаться нужным человеком в эпоху ИИ.

Живые кейсы от Сбера, Т-Банка, 2ГИС и Яндекса в докладах и панельных дискуссиях, а также движ на afterparty гарантируем!

Участие — бесплатное. Прокачка — бесценна.

Встречаемся 6 декабря в 11:30.

➡️ Забронировать место
👍2
Gartner выпустил очередной прогноз по рискам внедрения AI в разработку (Predicts 2026: AI Potential and Risks Emerge in Software Engineering Technologies (Gartner; 3 December 2025))
 
Ключевые цифры следующие:
 
К 2027 году 40% организаций использующих AI для разработки столкнуться с перерасходом средств на оплату токенов, в случае если модель оплаты останется «по факту потребления»
 
К 2028 году приложения созданные с помощью vibe-кодинга увеличат количество дефектов в 2500%... на этом можно было бы поставить точку.
 
Но, как водится, есть ответы:

1. Контроль расходов за использование токенов нужно выстраивать уже сейчас. В идеале менять модель оплаты

2. Если от vibe-кодинга уже не отказаться, всех программистов уже оптимизировали, то надо возраждать/развивать/усиливать функцию архконтроля!
 
Забыл еще про одну цифру: к 2028 году появятся первые квантовые решения в enterprise среде… (повод для размышления)
 
@Simple_Reliability
1👍1🔥1🤔1💯1