Культура Надёжности
175 subscribers
141 photos
5 videos
48 links
Авторский канал о надёжности

@SlavaKudryashov
Download Telegram
«Составлено ИИ»

Хотя ИИ может помогать нам в создании контента, его экспертиза в вопросах надежности всё ещё требует развития. Тем не менее, давайте рассмотрим что он предлагает (чтобы сгенерировать это ушло порядка 30 минут, у человека который все это и так знает)

🤖

Методы повышения надёжности информационных систем
1. Геораспределённое резервирование: Дублирование компонентов в разных регионах снижает риски отказов и катастроф.
2. Автоматическое восстановление: Системы, такие как Veeam, обеспечивают быстрое восстановление без вмешательства человека.
3. Тестирование на прочность: Регулярные нагрузочные тесты помогают выявить слабые места системы.
4. Мониторинг: Постоянный мониторинг с помощью Zabbix позволяет оперативно реагировать на проблемы.
5. План аварийного восстановления: Чёткие планы действий уменьшают последствия инцидентов и время простоя.

Эти методы помогут улучшить устойчивость ваших информационных систем и защитить бизнес от угроз!


🤖

Кажется, что пока ИИ не может самостоятельно давать советы в области надёжности без помощи профильных специалистов.

#ЭтоНеНадёжно
Please open Telegram to view this post
VIEW IN TELEGRAM
🙉2
Солидарная ответственность

Важный принцип, который касается каждого из нас, работающего в ИТ — принцип солидарной ответственности

Принцип
При обсуждении надежности системы важно помнить, что ответственность несут не только разработчики или администраторы, но и все участники её жизненного цикла: от архитекторов и проектировщиков до специалистов по сопровождению. Только совместными усилиями можно максимально сократить время влияния негативных событий и избежать повторения ошибок.

Иллюстрация из жизни
Вы заказали такси, сели в машину и полностью доверились водителю. Заплатив, вы думаете, что «делегировали» ответственность... Но что если водитель устал и засыпает за рулём? В лучшем случае, вы не доберётесь до пункта назначения вовремя. В худшем — последствия будут серьёзнее. А если бы вы не отключались полностью и заметили странное поведение водителя, начав с ним разговор, возможно, этого бы не произошло

Как работает в ИТ
В ИТ-сфере ситуация аналогичная. Если разработчик пишет код, администратор настраивает систему, а владелец процесса следит за выполнением задач, но все, при этом считают, что надежность — это зона ответственности кого-то другого, вероятность возникновения инцидентов возрастает кратно. Каждый участник должен осознавать свою ответственность за надежность всего сервиса.

Вывод
Солидарная ответственность (читай одинаковые КПЭ по надёжности/доступности)— это не просто теория, это практический инструмент, который помогает снизить количество инцидентов.

#ПринципыНадёжности
@Simple_Reliability
👌1
«Самая масштабная непонятная авария в мире»

17 августа 2009 года на Саяно-Шушенской ГЭС произошла крупнейшая авария в истории российской энергетики, которая привела к гибели 75 человек и вызвала большой общественный резонанс.

Непосредственная причина аварии
Расследование показало, что основной причиной катастрофы стало усталостное разрушение крепежных элементов крышки турбины второго гидроагрегата из-за постоянной вибрации.

Приговор
После завершения следственных действий в 2012 году семеро сотрудников ГЭС были обвинены в нарушении правил безопасности, что привело к смерти людей и значительным материальным потерям. Следствие установило, что они знали о проблемах с агрегатом, но не приняли необходимых мер для их устранения, включая период проведения планового ремонта в начале 2009 года.

Последствия
Восстановление станции заняло больше пяти лет и потребовало около 41 миллиарда рублей. Ремонтные работы стартовали сразу же после аварии. В рамках модернизации Министерство энергетики распорядилось заменить крепления крышек турбин на ВСЕХ российских ГЭС и установить системы регистрации данных ("черные ящики").

По материалам: ТАСС
#ЭтоНеНадёжно
@Simple_Reliability
😱1
Новогоднее

Большой словарь-справочник русского языка содержит 45 синонимов слова надёжность. Используя только их можно составить шикарное поздравление-тост:

С наступающим Новым годом! Хочется пожелать вам всего самого лучшего, и, конечно, надёжности в каждом начинании. Пусть в вашей жизни всегда будут:

🪅 Верность своим принципам и близким, чтобы отношения были крепкими

🪅 Долговечность
ваших мечт и планов, чтобы они сбывались на протяжении многих лет

🪅 Безопасность в каждом шаге, чтобы ничто не омрачало ваши достижения

🪅 Авторитетность в делах и доказанность
ваших успехов!

🪅Устойчивость к жизненным трудностям и
стойкость в любых ситуациях

🪅 Непоколебимость в своих стремлениях и
несокрушимость духа!

🪅 Крепкость и прочность ваших отношений, которые будут только укрепляться с каждым годом

🪅 Обеспеченность и кредитоспособность, чтобы все ваши финансовые планы осуществлялись без проблем

🪅 Благонадежность в партнерстве и дружбе, чтобы рядом были только верные люди

Пусть этот Новый год принесет вам неопровержимость успеха, фундаментальность
ваших идей и убедительность в каждом слове. Желаю вам сверхнадежности во всем, что вы делаете, а также достоверности информации и событий вокруг вас

🎄🎄🎄🎄🎄


@Simple_Reliability
🍾1
Одним из самых надежных автомобилей всех времен, по версии ведущих профильных изданий, является Toyota Corolla.

Модель впервые была представлена в 1966 году в Токио, с тех времен продано более 50 миллионов экземпляров по всему миру, что делает ее еще и самой продаваемой в истории.

«Секреты» надёжности

1. Многолетняя история усовершенствований. Ключевое конкурентное преимущество модели - десятилетия непрерывных усовершенствований инженерии. 12 поколений, мало кто может таким похвастаться.

2. Контроль качества. Система контроля качества Toyota включает механизм Jidoka который позволяет остановить производство при обнаружении дефекта, что минимизирует брак и повышает качество

3. ❗️Низкие затраты на обслуживание❗️ (средние ежегодные затраты на ремонт составляют около $362) самый понятный для бизнеса критерий оценки уровня надежности

Так же к ключевыми факторами повлиявшими на столь высокие показатели в области надежности стали: проверенные и высококачественные комплектующие, доверие потребителей и глобальная доступность (в т.ч. широкая доступность запчастей)

#ПринцыпыНадёжности
#ЭтоНадёжно

@Simple_Reliability
Please open Telegram to view this post
VIEW IN TELEGRAM
С японского языка термин jidoka (дзидока) дословно переводится как “автономизация”

Это принцип, используемый в производственной системе Toyota, который обеспечивает автоматическое обнаружение и устранение проблем в процессе производства.

Он включает в себя возможность оборудования самостоятельно останавливать работу при выявлении дефектов или неисправностей, что позволяет предотвратить массовое производство бракованных изделий.

Как применить этот принцип в ИТ? Кажется, что в периоды пиковых нагрузок на команды и/или клиентские сервисы, можно прям дословно: останавливать все внедрения, в случае обнаружения критических дефектов.

#ПринцыпыНадёжности

@Simple_Reliability
👍1
Новый Год - новое слово, которое делает этот мир надёжнее

Poka-yoke - это метод, разработанный японским инженером Сигео Синго, направленный на предотвращение человеческих ошибок в производственных процессах. Название происходит от японских слов “poka” (ошибка) и “yokeru” (избегать).

Суть метода основывается на принципе: позволять выполнить операцию только одним правильным способом

Метод широко используется в повседневной жизни:

1. Автоматическое отключение электрочайника при закипании воды

2. Защита от утечки газа на плитах, которая прекращает подачу газа при затухании огня

3. Невозможность неправильной установки SIM-карты благодаря срезанному углу

4. Звуковые сигналы в микроволновых печах и стиральных машинах, предотвращающие их запуск при открытой дверце

Хорошо бы чтобы разработчики пользовательских интерфейсов не забывали об этом методе при выполнении своей работы…

#ПринцыпыНадёжности

@SimpleReliability
Наглядный пример того, почему управление запасом производительности «жизненно» важный процесс для критичной инфраструктуры, в том числе и ИТ.

Одной из причин аварии на Саяно-Шушенской ГЭС 17 августа 2009 года стало возгорание…
на Братской ГЭС, произошедшее за день до этого. Пожар привел к потере всех каналов связи и телеметрии, что заставило перенаправить 100% нагрузки на Саяно-Шушенскую ГЭС. Это вызвало резкое увеличение нагрузки на её второй гидроагрегат, который не выдержал и разрушился.

#НадёжныйКурс

@Simple_Reliability
Массовый, не равно надёжный

Ту-104 совершил около 600,000 рейсов за время своей эксплуатации. Он стал одним из основных авиалайнеров в СССР, перевезя около 100 миллионов пассажиров и налетав около 2 миллионов часов с момента начала регулярных рейсов в 1956 году до завершения эксплуатации в 1981

Всего за это время произошло 37 аварий, в которых погибли 1140 человек.
Проблемы возникли с 18% произведенных лайнеров. Это худший показатель среди всех советских серийных пассажирских самолетов.

7 февраля 1981 года Ту-104 разбился под Ленинградом. В результате катастрофы погибло почти все руководство Тихоокеанского флота. На борту самолета находились командующий флотом адмирал Эмиль Спиридонов, командующий авиацией флота генерал-лейтенант Георгий Павлов, 17 адмиралов и генералов, почти два десятка капитанов первого ранга, занимавших адмиральские должности, и другие пассажиры.

Сам Туполев категорически отрицал вину конструкторов и настаивал на версии ошибки экипажа:
«Это не самолет плохой, это вы на нем летать не умеете!»


#ЭтоНеНадёжно

@Simple_Reliability
ВУРС: пример того, как игнорирование «незначительных» отклонений от требований безопасности и производственного процесса приводит к «широкомасштабным» инцидентам с «неустранимыми» последствиями

Восточно-Уральский радиоактивный след (ВУРС) — это территория, загрязненная радиоактивными веществами в результате Кыштымской аварии на химкомбинате «Маяк», произошедшей 29 сентября 1957 года. В результате в атмосферу было выброшено около 20 миллионов кюри радионуклидов, что привело к образованию загрязненной зоны протяженностью около 300 км и шириной 20-50 км.

ВУРС оказал серьезное воздействие на здоровье населения и экологию региона, вызвав необходимость отселения жителей и создания радиационного заповедника.

Пять «корневых» причин появления ВУРС:

1. Кыштымская авария: Взрыв на комбинате «Маяк» 29 сентября 1957 года из-за нарушения охлаждения ёмкости с радиоактивными отходами
(Нарушение правил производственного процесса)

2. Неправильное управление отходами: Сброс жидких радиоактивных отходов в реку Теча и озеро Карачай
(Нарушение правил производственного процесса)

3. Отсутствие систем безопасности надлежащего уровня: Недостаточная защита от радиационных выбросов и несовершенные системы контроля
(Нарушение правил безопасности)

4. Неисправности оборудования: Поломки приборов контроля температуры и уровня жидкости
(Наличие «дефектов» в промышленном контуре)

5. Нехватка информации о радиации: Неполное понимание последствий радиационного загрязнения среди населения и работников
(Отсутствие «мониторинга» и информирования)

Состояние ВУРС сегодня остаётся критическим. Основным загрязнителем является стронций-90, который всё ещё присутствует в почве и растительности. Уровень загрязнения в некоторых районах достигает 100 кюри на квадратный километр, что делает их небезопасными для постоянного проживания.

Полное восстановление этих территорий ожидается только через 280 лет, когда пройдет десять периодов полураспада стронция-90. В настоящее время на территории ВУРС находятся 16 населённых пунктов с населением около 120 тысяч человек.

#ЭтоНеНадёжно

@Simple_Reliability
Про важность аварийных учений (или почему необходимо быть уверенным в работоспособности механизмов минимизирующих негативные последствия при нештатных ситуациях)

17 февраля 1982 года произошла одна из самых страшных аварий в истории московского метро. На «Авиамоторной» в вечерний час-пик, на одном из эскалаторов на спуск соскочил правый поручень (видимо, из-за недоделок в конструкции). В момент, когда поручень почти остановился, сама лестница, ускоряясь под весом пассажиров, понеслась вниз. Аварийное блокировочное устройство отключило двигатель, но ни рабочий, ни аварийный тормоза не сработали должным образом из-за их неправильной настройки и обслуживания.
(Никто не убеждался в их реальной работоспособности)

Часть пассажиров в панике бросились вверх по ступеням, против движения эскалатора, врезаясь в тех, кто пытался стоя удержаться на ногах. Люди падали, летели вниз, где образовался завал. Началась давка, в которой погибли 8 человек, 30 получили телесные повреждения, некоторые остались инвалидами. Один из пострадавших, чью ногу зажало между выходной площадкой и ступенью, еще 2 часа дожидался, пока найдутся инструменты, чтобы его высвободить, и из-за такой длительной задержки лишился ноги.

#ЭтоНеНадёжно
#НадёжныйКурс

@Simple_Reliability
😱1
Nokia 3310 vs iPhone: Что Надежнее?

Помните старый добрый Nokia 3310? Он был настоящим символом долговечности. Батарея держалась долго, а телефон был почти невозможно сломать. Всё дело в простоте конструкции – чем проще, тем надёжнее.

Но, если сравнить батарею Nokia с современным iPhone, окажется, что у iPhone емкость батареи в 4 раза больше… а соответсвенно, в режиме ожидания, iPhone может работать дольше.

Мир технологий движется вперёд с огромной скоростью. То, что считалось надёжным десять лет назад, сегодня уже практически не используется.

Перед инженерами и разработчиками стоят новые задачи: сделать современные технологии не менее надежными чем старый добрый Nokia3310

Надёжность остаётся важным аспектом, независимо от того, говорим ли мы о старых телефонах или новейших технологиях. При этом с развитием технологий меняются и наши представления о том, что такое надёжность. Сегодня это включает в себя не только долговечность, но и безопасность, устойчивость к сбоям и способность адаптироваться к новым условиям.

#ПринципыНадёжности

@Simple_Reliability
Контроль второй рукой (или в четыре глаза) - принцип надёжности, которым не стоит пренебрегать

8 января 1945 года, ровно 80 лет назад, произошла авиационная катастрофа. Пассажирская летающая лодка Martin M-130 компании Pan American Airways при посадке в гавани Порт-оф-Спейна на острове Тринидад (Британская Вест-Индия) зарылась в воду и разрушилась, при этом погибли 23 человека. Это была потеря первого построенного и последнего эксплуатируемого M-130. По масштабам это крупнейшая авиакатастрофа в истории Тринидада и Тобаго.

Комиссия Совета по гражданской авиации пришла к мнению, что наиболее вероятно катастрофа произошла по вине второго пилота Крамера, который не распознал близость к воде и не исправил положение для нормальной посадки, а также командира самолёта Гойетта, который не осуществлял на необходимом уровне контроль за посадкой, в результате чего непреднамеренно произошёл контакт с водой с опущенным носом и превышением посадочной скорости

#ПринципыНадёжности

@Simple_Reliability
💯2
Система сдержек и противовесов (checks and balances) – ключевой элемент принципа разделения властей. Этот принцип подразумевает, что для обеспечения и защиты интересов граждан все три ветви власти (законодательная, судебная и исполнительная) взаимосвязаны и контролируют друг друга. Идея была разработана Шарлем Луи Монтескьё в XVIII веке, в его трактате "О духе законов". Этот принцип был впервые закреплён в Конституции США 1787 года, а также, в последствии, в основных законах многих других государств.

Если адаптировать этот подход к сфере информационных технологий (где надежность решений стоит на одном из первых мест), то мы получим следующую систему:

Для обеспечения надежности в ИТ-решениях все участники процесса (архитекторы, разработчики и специалисты техподдержки) должны зависеть друг от друга и контролировать работу друг друга.

#ПринципыНадёжности
@Simple_Reliability
👍1🔥1
Обвал с Невадо-Уаскаран: катастрофа и ее причины
10 января 1962 года (ровно 63 года назад) произошел крупнейший в истории обвал снежной лавины на горе Невадо-Уаскаран в Перу. Лавина, состоящая из снега и льда, сошла с высоты более 6 км, уничтожив два города — Ранрахирку и Уараскучо. По оценкам, погибло более 4,000 человек, а объем сошедшей массы составил около 3 миллионов кубических метров, достигая до 10 миллионов кубометров на пути.
 
Причины катастрофы
Считается, что лавина произошла без внешних триггеров, таких как землетрясения или взрывы. Основной причиной стало самопроизвольное разрушение части ледника, вызванное его перегрузкой снегом и воздействием аномально теплой погоды.
 
Можно ли было избежать жертв?
Хотя местные жители знали о рисках лавин и имели определенные меры предосторожности (поиск безопасных возвышенностей), скорость этого события сделала их бесполезными, лавина достигла населенных пунктов всего за 7 минут. Система раннего предупреждения была недостаточно развита для того, чтобы эффективно информировать население о надвигающейся угрозе. Учитывая масштабы катастрофы и отсутствие внешних триггеров, можно утверждать, что предотвратить такое количество жертв было крайне сложно.
 
Заключение
Обвал с Невадо-Уаскаран стал одной из самых трагичных страниц в истории Перу и стал катализатором для разработки новых методов профилактики и управления рисками лавин, включая создание защитных сооружений и улучшение систем мониторинга, а так же, служит напоминанием о необходимости постоянного внимания к природным рискам.

@Simple_Reliability
👍2
Новая рубрика про людей, чьи истории это истории ответственности, уверенности, достоинства… (и др. синонимов «надёжности»)

#НадёжныеЛюди

Терренс (Терри) Гордон Савчук (Terrance Gordon "Terry" Sawchuk) (28.12.1929 - 31.05.1970) — канадский хоккеист, вратарь.
Член зала хоккейной славы.

Знаменит тем, что долгое время играл без защитной маски.

За свою карьеру он получил около 400 шрамов на лице из-за травм, четырежды выигрывал Кубок Стэнли и устанавливал рекорды по количеству «сухих» матчей (которые продержались 40 лет)

Его экспозиция в хоккейном зале славы стала самой популярной с первого дня открытия, а под табличкой с именем разместились почти вечные цифры: 1034 матча, 447 побед, 103 шатаута.

Он полагал, что маска не улучшает игру и не делает вратаря лучше…считал игру без маски примером мужества и профессионализма

@Simple_Reliability
3
Одно из определений слова «культура», согласно словарю С.И.Ожегова – это высокий уровень чего-либо, например, в производстве или искусстве.
 
А что такое культура надёжности в ИТ?
Это подход, который помогает работать эффективнее, минимизировать количество ошибок. Он предполагает общую заинтересованность всех сотрудников в том, чтобы системы и процессы функционировали бесперебойно и были доступны пользователям.
 
Что же характерно для культуры надёжности?

1. Общая ответственность
Все сотрудники, вне зависимости от своей роли, осознают значимость надёжности и активно участвуют в её поддержании

2. Открытость к проблемам
Важно, чтобы сотрудники были готовы сообщать о любых неполадках, даже если те кажутся незначительными. Это позволяет оперативно реагировать на возможные угрозы

3. Использование проверенной информации
При принятии решений необходимо опираться на достоверные данные о работе систем. Это помогает выявить уязвимости и улучшить процессы

4. Командная работа
Вся команда работает совместно ради достижения единой цели – создания надёжного продукта или услуги. Это подразумевает тесное взаимодействие разработчиков, администраторов и других специалистов.

Таким образом, культура надёжности создаёт атмосферу, в которой каждый стремится к совершенствованию и готов действовать на упреждение.
 
@Simple_Reliability
2
Ирвин Гордон — американец, известный как обладатель автомобиля Volvo P1800S с рекордным пробегом более 5 млн. км. Он приобрел этот автомобиль в 1966 году и стал единственным владельцем.

Гордон, бывший школьный учитель из Ист-Патчога, штат Нью-Йорк, активно использовал свою машину, путешествуя по США, Канаде и Европе. На момент его смерти (по дороге в Китай!) в 2018 году пробег автомобиля составлял 3,2 миллиона миль, что сделало его символом долговечности и надежности

Сам Ирвин говорил, что он не делал ничего особенного:
Просто старался ездить плавно, на средних оборотах, менял моторное масло и фильтры через каждые 5000 км, масло в коробке передач и свечи зажигания через каждые 40 000 км.
(и еще сделал два капитальных ремонта двигателя 😉, после каждого млн. миль)


Он всегда обращал внимание на все посторонние звуки, вибрации и запахи в машине и мыл кузов теплой водой после контакта с солеными дорогами.

Начинать эксплуатацию советовал с внимательного чтения руководства, чтобы изучить все особенности техники

P.S. на фото не Ирвин - это Роджер Мур, а модель та самая - Volvo P1800S

#ПринципыНадёжности
#ЭтоНадёжно

@Simple_Reliability
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5
Тренды SRE в 2025 г. (или на что будет направлен фокус внимания специалистов занимающихся надёжностью)
 
Функции профильных специалистов будут достаточно быстро меняться, адаптируясь к технологическим трендам
 
1. Акцент на AI и автоматизацию
Искусственный интеллект становится незаменимым инструментом для автоматизации мониторинга и обнаружения аномалий. Ожидается, что к концу 2025 года около 70% организаций внедрят AI-инструменты для повышения эффективности выявления и устранения технологических проблем
 
2. Облачные вычисления и контейнеризация
Уже сейчас более 80% предприятий используют облачные сервисы. Продолжится рост их популярности. Контейнеризация станет стандартом для 75% организаций.
 
3. Улучшенная наблюдаемость
Растет потребность в инструментах мониторинга, позволяющих получать больше информации о состоянии систем. Ожидается, что в 2025 г. 60% компаний будут над этим работать

4. Безопасность выходит на первый план
Около 65% организаций планируют интегрировать меры кибербезопасности в свои процессы SRE к 2025 году
 
5. Культура экспериментов
Этот подход повышает внедрение инноваций на 30%, благодаря возможности учиться на ошибках
 
6. Фокус на клиентском опыте
Использование SLO в бизнес-процессах позволит повысить уровень удовлетворенности клиентов на 20-30%
 
@Simple_Reliability
Можно ли измерить «надёжность»?

Да, можно.

Даже есть официальный документ, регламентирующий данный процесс: ГОСТ Р 27.010-2019

МАТЕМАТИЧЕСКИЕ ВЫРАЖЕНИЯ ДЛЯ ПОКАЗАТЕЛЕЙ БЕЗОТКАЗНОСТИ, ГОТОВНОСТИ, РЕМОНТОПРИГОДНОСТИ
 
В настоящем стандарте установлены математические выражения для показателей безотказности, готовности и ремонтопригодности, а также для показателей, характеризующих выполнение установленной задачи


@Simple_Reliability
👍1