Культура Надёжности
175 subscribers
141 photos
5 videos
48 links
Авторский канал о надёжности

@SlavaKudryashov
Download Telegram
Forwarded from Сообщество Архитекторов (CommunityManager)
Вячеслав Кудряшов только что выступил с докладом на одной из крупнейших ИТ-конференций страны «ИТ-пикник», организатором которой выступил Т-Банк.

Слава выступил с докладом «Критичные требования надежности» в шатре «Архитектура, надежность и качество».

Поздравляем Вячеслава с успешным выступлением!

А если вы тоже хотите выступать на ключевых технологических мероприятиях - обязательно пишите комьюнити-менеджерам. Мы во всем поможем 🔥
Forwarded from Арина Постникова
Устойчивость в эпоху турбулентности: как сохранить надежность систем в условиях санкций

Вячеслав Кудряшов, исполнительный директор СБЕР, поделится своим опытом и знаниями о том, как адаптироваться к новым вызовам и сохранить надежность систем в условиях нестабильности.

Вячеслав долгое время работал в международной компании, специализирующейся на разработке и внедрении процессинговых систем. За последние 11 лет в СБЕРе он прошел путь от управления инфраструктурными проектами до ключевой роли в развитии экспертизы по надежности. На сегодняшний день Вячеслав отвечает за направление экспертов по надежности в розничном блоке.

Что вас ждет на докладе?
- Как изменились причины возникновения инцидентов из-за санкций.
- Поиск баланса между регуляторными требованиями, санкционными ограничениями, доступностью клиентских сервисов и развитием.
- Критичные требования надежности: что это такое и как ими управлять.

Не пропустите уникальные инсайты от одного из ведущих экспертов нашей секции Backend.
🔥1
Forwarded from Технологии Сбера Самара (Маргарита Георгиева)
📢 Встречайте нашего следующего спикера — Вячеслава Кудряшова, Исполнительного директора ситуационного центра!

🔍 В своем выступлении «Критичные требования надежности» Вячеслав поделится с нами секретами обеспечения высоких стандартов надежности в IT-системах.
В своем докладе я разберу:
• Как управлять надежностью, когда у тебя 1 000+ ИТ-услуг;
• Что такое критичные требования надежности, откуда они берутся и почему их невыполнение снижает доступность клиентских сервисов;
• Как и кто должен контролировать и управлять критичными требованиями;
• Примеры и краткое описание действующих требований;
• Что сделано в банке для того, чтобы система заработала.

Ждём вас на доклад!🤝
1🔥1
«Составлено ИИ»

Хотя ИИ может помогать нам в создании контента, его экспертиза в вопросах надежности всё ещё требует развития. Тем не менее, давайте рассмотрим что он предлагает (чтобы сгенерировать это ушло порядка 30 минут, у человека который все это и так знает)

🤖

Методы повышения надёжности информационных систем
1. Геораспределённое резервирование: Дублирование компонентов в разных регионах снижает риски отказов и катастроф.
2. Автоматическое восстановление: Системы, такие как Veeam, обеспечивают быстрое восстановление без вмешательства человека.
3. Тестирование на прочность: Регулярные нагрузочные тесты помогают выявить слабые места системы.
4. Мониторинг: Постоянный мониторинг с помощью Zabbix позволяет оперативно реагировать на проблемы.
5. План аварийного восстановления: Чёткие планы действий уменьшают последствия инцидентов и время простоя.

Эти методы помогут улучшить устойчивость ваших информационных систем и защитить бизнес от угроз!


🤖

Кажется, что пока ИИ не может самостоятельно давать советы в области надёжности без помощи профильных специалистов.

#ЭтоНеНадёжно
Please open Telegram to view this post
VIEW IN TELEGRAM
🙉2
Солидарная ответственность

Важный принцип, который касается каждого из нас, работающего в ИТ — принцип солидарной ответственности

Принцип
При обсуждении надежности системы важно помнить, что ответственность несут не только разработчики или администраторы, но и все участники её жизненного цикла: от архитекторов и проектировщиков до специалистов по сопровождению. Только совместными усилиями можно максимально сократить время влияния негативных событий и избежать повторения ошибок.

Иллюстрация из жизни
Вы заказали такси, сели в машину и полностью доверились водителю. Заплатив, вы думаете, что «делегировали» ответственность... Но что если водитель устал и засыпает за рулём? В лучшем случае, вы не доберётесь до пункта назначения вовремя. В худшем — последствия будут серьёзнее. А если бы вы не отключались полностью и заметили странное поведение водителя, начав с ним разговор, возможно, этого бы не произошло

Как работает в ИТ
В ИТ-сфере ситуация аналогичная. Если разработчик пишет код, администратор настраивает систему, а владелец процесса следит за выполнением задач, но все, при этом считают, что надежность — это зона ответственности кого-то другого, вероятность возникновения инцидентов возрастает кратно. Каждый участник должен осознавать свою ответственность за надежность всего сервиса.

Вывод
Солидарная ответственность (читай одинаковые КПЭ по надёжности/доступности)— это не просто теория, это практический инструмент, который помогает снизить количество инцидентов.

#ПринципыНадёжности
@Simple_Reliability
👌1
«Самая масштабная непонятная авария в мире»

17 августа 2009 года на Саяно-Шушенской ГЭС произошла крупнейшая авария в истории российской энергетики, которая привела к гибели 75 человек и вызвала большой общественный резонанс.

Непосредственная причина аварии
Расследование показало, что основной причиной катастрофы стало усталостное разрушение крепежных элементов крышки турбины второго гидроагрегата из-за постоянной вибрации.

Приговор
После завершения следственных действий в 2012 году семеро сотрудников ГЭС были обвинены в нарушении правил безопасности, что привело к смерти людей и значительным материальным потерям. Следствие установило, что они знали о проблемах с агрегатом, но не приняли необходимых мер для их устранения, включая период проведения планового ремонта в начале 2009 года.

Последствия
Восстановление станции заняло больше пяти лет и потребовало около 41 миллиарда рублей. Ремонтные работы стартовали сразу же после аварии. В рамках модернизации Министерство энергетики распорядилось заменить крепления крышек турбин на ВСЕХ российских ГЭС и установить системы регистрации данных ("черные ящики").

По материалам: ТАСС
#ЭтоНеНадёжно
@Simple_Reliability
😱1