Культура Надёжности
175 subscribers
141 photos
5 videos
48 links
Авторский канал о надёжности

@SlavaKudryashov
Download Telegram
Forwarded from Сообщество Архитекторов (CommunityManager)
Вячеслав Кудряшов только что выступил с докладом на одной из крупнейших ИТ-конференций страны «ИТ-пикник», организатором которой выступил Т-Банк.

Слава выступил с докладом «Критичные требования надежности» в шатре «Архитектура, надежность и качество».

Поздравляем Вячеслава с успешным выступлением!

А если вы тоже хотите выступать на ключевых технологических мероприятиях - обязательно пишите комьюнити-менеджерам. Мы во всем поможем 🔥
Forwarded from Арина Постникова
Устойчивость в эпоху турбулентности: как сохранить надежность систем в условиях санкций

Вячеслав Кудряшов, исполнительный директор СБЕР, поделится своим опытом и знаниями о том, как адаптироваться к новым вызовам и сохранить надежность систем в условиях нестабильности.

Вячеслав долгое время работал в международной компании, специализирующейся на разработке и внедрении процессинговых систем. За последние 11 лет в СБЕРе он прошел путь от управления инфраструктурными проектами до ключевой роли в развитии экспертизы по надежности. На сегодняшний день Вячеслав отвечает за направление экспертов по надежности в розничном блоке.

Что вас ждет на докладе?
- Как изменились причины возникновения инцидентов из-за санкций.
- Поиск баланса между регуляторными требованиями, санкционными ограничениями, доступностью клиентских сервисов и развитием.
- Критичные требования надежности: что это такое и как ими управлять.

Не пропустите уникальные инсайты от одного из ведущих экспертов нашей секции Backend.
🔥1
Forwarded from Технологии Сбера Самара (Маргарита Георгиева)
📢 Встречайте нашего следующего спикера — Вячеслава Кудряшова, Исполнительного директора ситуационного центра!

🔍 В своем выступлении «Критичные требования надежности» Вячеслав поделится с нами секретами обеспечения высоких стандартов надежности в IT-системах.
В своем докладе я разберу:
• Как управлять надежностью, когда у тебя 1 000+ ИТ-услуг;
• Что такое критичные требования надежности, откуда они берутся и почему их невыполнение снижает доступность клиентских сервисов;
• Как и кто должен контролировать и управлять критичными требованиями;
• Примеры и краткое описание действующих требований;
• Что сделано в банке для того, чтобы система заработала.

Ждём вас на доклад!🤝
1🔥1
«Составлено ИИ»

Хотя ИИ может помогать нам в создании контента, его экспертиза в вопросах надежности всё ещё требует развития. Тем не менее, давайте рассмотрим что он предлагает (чтобы сгенерировать это ушло порядка 30 минут, у человека который все это и так знает)

🤖

Методы повышения надёжности информационных систем
1. Геораспределённое резервирование: Дублирование компонентов в разных регионах снижает риски отказов и катастроф.
2. Автоматическое восстановление: Системы, такие как Veeam, обеспечивают быстрое восстановление без вмешательства человека.
3. Тестирование на прочность: Регулярные нагрузочные тесты помогают выявить слабые места системы.
4. Мониторинг: Постоянный мониторинг с помощью Zabbix позволяет оперативно реагировать на проблемы.
5. План аварийного восстановления: Чёткие планы действий уменьшают последствия инцидентов и время простоя.

Эти методы помогут улучшить устойчивость ваших информационных систем и защитить бизнес от угроз!


🤖

Кажется, что пока ИИ не может самостоятельно давать советы в области надёжности без помощи профильных специалистов.

#ЭтоНеНадёжно
Please open Telegram to view this post
VIEW IN TELEGRAM
🙉2
Солидарная ответственность

Важный принцип, который касается каждого из нас, работающего в ИТ — принцип солидарной ответственности

Принцип
При обсуждении надежности системы важно помнить, что ответственность несут не только разработчики или администраторы, но и все участники её жизненного цикла: от архитекторов и проектировщиков до специалистов по сопровождению. Только совместными усилиями можно максимально сократить время влияния негативных событий и избежать повторения ошибок.

Иллюстрация из жизни
Вы заказали такси, сели в машину и полностью доверились водителю. Заплатив, вы думаете, что «делегировали» ответственность... Но что если водитель устал и засыпает за рулём? В лучшем случае, вы не доберётесь до пункта назначения вовремя. В худшем — последствия будут серьёзнее. А если бы вы не отключались полностью и заметили странное поведение водителя, начав с ним разговор, возможно, этого бы не произошло

Как работает в ИТ
В ИТ-сфере ситуация аналогичная. Если разработчик пишет код, администратор настраивает систему, а владелец процесса следит за выполнением задач, но все, при этом считают, что надежность — это зона ответственности кого-то другого, вероятность возникновения инцидентов возрастает кратно. Каждый участник должен осознавать свою ответственность за надежность всего сервиса.

Вывод
Солидарная ответственность (читай одинаковые КПЭ по надёжности/доступности)— это не просто теория, это практический инструмент, который помогает снизить количество инцидентов.

#ПринципыНадёжности
@Simple_Reliability
👌1
«Самая масштабная непонятная авария в мире»

17 августа 2009 года на Саяно-Шушенской ГЭС произошла крупнейшая авария в истории российской энергетики, которая привела к гибели 75 человек и вызвала большой общественный резонанс.

Непосредственная причина аварии
Расследование показало, что основной причиной катастрофы стало усталостное разрушение крепежных элементов крышки турбины второго гидроагрегата из-за постоянной вибрации.

Приговор
После завершения следственных действий в 2012 году семеро сотрудников ГЭС были обвинены в нарушении правил безопасности, что привело к смерти людей и значительным материальным потерям. Следствие установило, что они знали о проблемах с агрегатом, но не приняли необходимых мер для их устранения, включая период проведения планового ремонта в начале 2009 года.

Последствия
Восстановление станции заняло больше пяти лет и потребовало около 41 миллиарда рублей. Ремонтные работы стартовали сразу же после аварии. В рамках модернизации Министерство энергетики распорядилось заменить крепления крышек турбин на ВСЕХ российских ГЭС и установить системы регистрации данных ("черные ящики").

По материалам: ТАСС
#ЭтоНеНадёжно
@Simple_Reliability
😱1
Новогоднее

Большой словарь-справочник русского языка содержит 45 синонимов слова надёжность. Используя только их можно составить шикарное поздравление-тост:

С наступающим Новым годом! Хочется пожелать вам всего самого лучшего, и, конечно, надёжности в каждом начинании. Пусть в вашей жизни всегда будут:

🪅 Верность своим принципам и близким, чтобы отношения были крепкими

🪅 Долговечность
ваших мечт и планов, чтобы они сбывались на протяжении многих лет

🪅 Безопасность в каждом шаге, чтобы ничто не омрачало ваши достижения

🪅 Авторитетность в делах и доказанность
ваших успехов!

🪅Устойчивость к жизненным трудностям и
стойкость в любых ситуациях

🪅 Непоколебимость в своих стремлениях и
несокрушимость духа!

🪅 Крепкость и прочность ваших отношений, которые будут только укрепляться с каждым годом

🪅 Обеспеченность и кредитоспособность, чтобы все ваши финансовые планы осуществлялись без проблем

🪅 Благонадежность в партнерстве и дружбе, чтобы рядом были только верные люди

Пусть этот Новый год принесет вам неопровержимость успеха, фундаментальность
ваших идей и убедительность в каждом слове. Желаю вам сверхнадежности во всем, что вы делаете, а также достоверности информации и событий вокруг вас

🎄🎄🎄🎄🎄


@Simple_Reliability
🍾1
Одним из самых надежных автомобилей всех времен, по версии ведущих профильных изданий, является Toyota Corolla.

Модель впервые была представлена в 1966 году в Токио, с тех времен продано более 50 миллионов экземпляров по всему миру, что делает ее еще и самой продаваемой в истории.

«Секреты» надёжности

1. Многолетняя история усовершенствований. Ключевое конкурентное преимущество модели - десятилетия непрерывных усовершенствований инженерии. 12 поколений, мало кто может таким похвастаться.

2. Контроль качества. Система контроля качества Toyota включает механизм Jidoka который позволяет остановить производство при обнаружении дефекта, что минимизирует брак и повышает качество

3. ❗️Низкие затраты на обслуживание❗️ (средние ежегодные затраты на ремонт составляют около $362) самый понятный для бизнеса критерий оценки уровня надежности

Так же к ключевыми факторами повлиявшими на столь высокие показатели в области надежности стали: проверенные и высококачественные комплектующие, доверие потребителей и глобальная доступность (в т.ч. широкая доступность запчастей)

#ПринцыпыНадёжности
#ЭтоНадёжно

@Simple_Reliability
Please open Telegram to view this post
VIEW IN TELEGRAM
С японского языка термин jidoka (дзидока) дословно переводится как “автономизация”

Это принцип, используемый в производственной системе Toyota, который обеспечивает автоматическое обнаружение и устранение проблем в процессе производства.

Он включает в себя возможность оборудования самостоятельно останавливать работу при выявлении дефектов или неисправностей, что позволяет предотвратить массовое производство бракованных изделий.

Как применить этот принцип в ИТ? Кажется, что в периоды пиковых нагрузок на команды и/или клиентские сервисы, можно прям дословно: останавливать все внедрения, в случае обнаружения критических дефектов.

#ПринцыпыНадёжности

@Simple_Reliability
👍1
Новый Год - новое слово, которое делает этот мир надёжнее

Poka-yoke - это метод, разработанный японским инженером Сигео Синго, направленный на предотвращение человеческих ошибок в производственных процессах. Название происходит от японских слов “poka” (ошибка) и “yokeru” (избегать).

Суть метода основывается на принципе: позволять выполнить операцию только одним правильным способом

Метод широко используется в повседневной жизни:

1. Автоматическое отключение электрочайника при закипании воды

2. Защита от утечки газа на плитах, которая прекращает подачу газа при затухании огня

3. Невозможность неправильной установки SIM-карты благодаря срезанному углу

4. Звуковые сигналы в микроволновых печах и стиральных машинах, предотвращающие их запуск при открытой дверце

Хорошо бы чтобы разработчики пользовательских интерфейсов не забывали об этом методе при выполнении своей работы…

#ПринцыпыНадёжности

@SimpleReliability
Наглядный пример того, почему управление запасом производительности «жизненно» важный процесс для критичной инфраструктуры, в том числе и ИТ.

Одной из причин аварии на Саяно-Шушенской ГЭС 17 августа 2009 года стало возгорание…
на Братской ГЭС, произошедшее за день до этого. Пожар привел к потере всех каналов связи и телеметрии, что заставило перенаправить 100% нагрузки на Саяно-Шушенскую ГЭС. Это вызвало резкое увеличение нагрузки на её второй гидроагрегат, который не выдержал и разрушился.

#НадёжныйКурс

@Simple_Reliability
Массовый, не равно надёжный

Ту-104 совершил около 600,000 рейсов за время своей эксплуатации. Он стал одним из основных авиалайнеров в СССР, перевезя около 100 миллионов пассажиров и налетав около 2 миллионов часов с момента начала регулярных рейсов в 1956 году до завершения эксплуатации в 1981

Всего за это время произошло 37 аварий, в которых погибли 1140 человек.
Проблемы возникли с 18% произведенных лайнеров. Это худший показатель среди всех советских серийных пассажирских самолетов.

7 февраля 1981 года Ту-104 разбился под Ленинградом. В результате катастрофы погибло почти все руководство Тихоокеанского флота. На борту самолета находились командующий флотом адмирал Эмиль Спиридонов, командующий авиацией флота генерал-лейтенант Георгий Павлов, 17 адмиралов и генералов, почти два десятка капитанов первого ранга, занимавших адмиральские должности, и другие пассажиры.

Сам Туполев категорически отрицал вину конструкторов и настаивал на версии ошибки экипажа:
«Это не самолет плохой, это вы на нем летать не умеете!»


#ЭтоНеНадёжно

@Simple_Reliability
ВУРС: пример того, как игнорирование «незначительных» отклонений от требований безопасности и производственного процесса приводит к «широкомасштабным» инцидентам с «неустранимыми» последствиями

Восточно-Уральский радиоактивный след (ВУРС) — это территория, загрязненная радиоактивными веществами в результате Кыштымской аварии на химкомбинате «Маяк», произошедшей 29 сентября 1957 года. В результате в атмосферу было выброшено около 20 миллионов кюри радионуклидов, что привело к образованию загрязненной зоны протяженностью около 300 км и шириной 20-50 км.

ВУРС оказал серьезное воздействие на здоровье населения и экологию региона, вызвав необходимость отселения жителей и создания радиационного заповедника.

Пять «корневых» причин появления ВУРС:

1. Кыштымская авария: Взрыв на комбинате «Маяк» 29 сентября 1957 года из-за нарушения охлаждения ёмкости с радиоактивными отходами
(Нарушение правил производственного процесса)

2. Неправильное управление отходами: Сброс жидких радиоактивных отходов в реку Теча и озеро Карачай
(Нарушение правил производственного процесса)

3. Отсутствие систем безопасности надлежащего уровня: Недостаточная защита от радиационных выбросов и несовершенные системы контроля
(Нарушение правил безопасности)

4. Неисправности оборудования: Поломки приборов контроля температуры и уровня жидкости
(Наличие «дефектов» в промышленном контуре)

5. Нехватка информации о радиации: Неполное понимание последствий радиационного загрязнения среди населения и работников
(Отсутствие «мониторинга» и информирования)

Состояние ВУРС сегодня остаётся критическим. Основным загрязнителем является стронций-90, который всё ещё присутствует в почве и растительности. Уровень загрязнения в некоторых районах достигает 100 кюри на квадратный километр, что делает их небезопасными для постоянного проживания.

Полное восстановление этих территорий ожидается только через 280 лет, когда пройдет десять периодов полураспада стронция-90. В настоящее время на территории ВУРС находятся 16 населённых пунктов с населением около 120 тысяч человек.

#ЭтоНеНадёжно

@Simple_Reliability
Про важность аварийных учений (или почему необходимо быть уверенным в работоспособности механизмов минимизирующих негативные последствия при нештатных ситуациях)

17 февраля 1982 года произошла одна из самых страшных аварий в истории московского метро. На «Авиамоторной» в вечерний час-пик, на одном из эскалаторов на спуск соскочил правый поручень (видимо, из-за недоделок в конструкции). В момент, когда поручень почти остановился, сама лестница, ускоряясь под весом пассажиров, понеслась вниз. Аварийное блокировочное устройство отключило двигатель, но ни рабочий, ни аварийный тормоза не сработали должным образом из-за их неправильной настройки и обслуживания.
(Никто не убеждался в их реальной работоспособности)

Часть пассажиров в панике бросились вверх по ступеням, против движения эскалатора, врезаясь в тех, кто пытался стоя удержаться на ногах. Люди падали, летели вниз, где образовался завал. Началась давка, в которой погибли 8 человек, 30 получили телесные повреждения, некоторые остались инвалидами. Один из пострадавших, чью ногу зажало между выходной площадкой и ступенью, еще 2 часа дожидался, пока найдутся инструменты, чтобы его высвободить, и из-за такой длительной задержки лишился ноги.

#ЭтоНеНадёжно
#НадёжныйКурс

@Simple_Reliability
😱1
Nokia 3310 vs iPhone: Что Надежнее?

Помните старый добрый Nokia 3310? Он был настоящим символом долговечности. Батарея держалась долго, а телефон был почти невозможно сломать. Всё дело в простоте конструкции – чем проще, тем надёжнее.

Но, если сравнить батарею Nokia с современным iPhone, окажется, что у iPhone емкость батареи в 4 раза больше… а соответсвенно, в режиме ожидания, iPhone может работать дольше.

Мир технологий движется вперёд с огромной скоростью. То, что считалось надёжным десять лет назад, сегодня уже практически не используется.

Перед инженерами и разработчиками стоят новые задачи: сделать современные технологии не менее надежными чем старый добрый Nokia3310

Надёжность остаётся важным аспектом, независимо от того, говорим ли мы о старых телефонах или новейших технологиях. При этом с развитием технологий меняются и наши представления о том, что такое надёжность. Сегодня это включает в себя не только долговечность, но и безопасность, устойчивость к сбоям и способность адаптироваться к новым условиям.

#ПринципыНадёжности

@Simple_Reliability
Контроль второй рукой (или в четыре глаза) - принцип надёжности, которым не стоит пренебрегать

8 января 1945 года, ровно 80 лет назад, произошла авиационная катастрофа. Пассажирская летающая лодка Martin M-130 компании Pan American Airways при посадке в гавани Порт-оф-Спейна на острове Тринидад (Британская Вест-Индия) зарылась в воду и разрушилась, при этом погибли 23 человека. Это была потеря первого построенного и последнего эксплуатируемого M-130. По масштабам это крупнейшая авиакатастрофа в истории Тринидада и Тобаго.

Комиссия Совета по гражданской авиации пришла к мнению, что наиболее вероятно катастрофа произошла по вине второго пилота Крамера, который не распознал близость к воде и не исправил положение для нормальной посадки, а также командира самолёта Гойетта, который не осуществлял на необходимом уровне контроль за посадкой, в результате чего непреднамеренно произошёл контакт с водой с опущенным носом и превышением посадочной скорости

#ПринципыНадёжности

@Simple_Reliability
💯2