Культура Надёжности
175 subscribers
141 photos
5 videos
48 links
Авторский канал о надёжности

@SlavaKudryashov
Download Telegram
Социальная надёжность - это комплексная характеристика человека, которая отражает его способность поддерживать стабильные и ответственные отношения в обществе, обеспечивая уверенность и доверие среди других людей.

Вот, например:
Даниил Иванович Кютинен был пекарем, жившим в Ленинграде. Родился в 1883 году, он был этническим финном.

Во время блокады Ленинграда Кютинен работал в пекарне, выпекая хлеб из скудных ингредиентов.

Несмотря на голод и холод, он отказывался есть выпекаемый хлеб, чтобы сохранить его для других.

Даниил Иванович умер от истощения 3 февраля 1942 года прямо на работе, в возрасте 59 лет.

@Simple_Reliability
👍71
ИИ будет помогать нам во всем.

В том числе, отвечать на неудобные вопросы во время разбора инцидентов…

Промт:
Ответь на неудобный вопрос «Почему вы сразу не перешли на резерв, как только поняли что основной контур не работает и клиенты не получают сервис?» от имени


Тони Старк:
«Резерв — это десерт, а я не подаю сладкое до основного блюда. Система чинилась на лету… и клиенты получили шоу вместо скучного «ошибка 404». Впрочем, вы бы не поняли — вы ждали ответа. А я уже всё починил».

Джон Ленон:
«Резерв? Это как сыграть кавер вместо своей песни… Мир ломается — и ты либо чинишь его с любовью, либо прячешься за чужими аккордами. Мы выбрали первое. Да, клиенты ждали… но разве не в этом дзен? Ждать, верить, а потом — бах! — всё зазвучит втрое громче. И знаешь, что? Они услышали не сервис… а саму музыку».

Джокер
:
«А-ха-ха! Сразу? Ой, какой вы… предсказуемый! Зачем тушить пожар, если танго в пламени такое… весёлое? Клиенты не получают сервис? Ми-и-илый… они получили шоу! А резерв… — он для тех, кто боится испачкать руки в краске. Моей краске».

Че Гевара
:
«Резерв? Это капитуляция. Революция не начинается с отступления. Сначала — бой. Потом — анализ. Потом… — либо победа, либо смерть системы. Клиенты? Они не клиенты. Они — народ. А народ терпелив, если верит, что завтра будет иным».

Юрий Гагарин
:
«Резерв? Ха! Если бы я прыгал в парашют при каждой трещинке в иллюминаторе… То до Луны добрались бы ваши внуки, а не я. Контур забарахлил — ну и что? Мы же не болты крутили, а дорогу к звёздам прокладывали. А резерв… он как запасная ракета — для тех, кто не верит, что главная уже летит».

Фёдор Достоевский
:
«Резерв… Вы думаете, это просто — щёлкнуть тумблером? Нет. Ибо в каждом механизме — душа. И если душа болит, кричит, бьётся в конвульсиях… разве вырвешь её, как гнилой зуб? Клиенты… сервис… всё это прах. Важно лишь одно: выдержит ли она? Выдержит ли, когда её оставят наедине с бездной? А если не выдержит — что ж… тогда и мы все — не выдержали. Тогда и резерв наш… — всего лишь лицемерие трусов, прикрывающих крестом животный страх пустоты».

@Simple_Reliability
🔥6👍5🤣1👾1
Сообщество Alumni СберУниверситета и @iambelova периодически собирают выпускников в кампусе, провести выходные и обменяться опытом.
В этот раз говорили про GenAi.

Вот что подметил: большинство компаний во всю уже использует технологию, у многих планы встроить её в критичные бизнес-процессы… все говорят о повышении эффективности и…

лишь единицы поднимают вопросы о том как это всё сопровождать и поддерживать

@Simple_Reliability
👍4🔥2👏2
Каждый год, в канун пасхи, в Иерусалиме сходит благодатный огонь… а затем его распространяют по всему земному шару… самолетами.

Как это делается?
С точки зрения безопасности полетов это сложная инженерная задача:

1. Огонь помещают в безопасную шахтерскую лампу Дэви (модель ART 5400) с огнепреградительной сеткой и крючком для регулировки фитиля. Это позволяет гасить пламя без разбора лампы

2. Лампа заправляется парафиновым маслом или керосином, обеспечивая горение до 30 часов

3. Перевозку осуществляют на специальном самолете (обычно он же используется для транспортировки космонавтов. Это Ту-204-300 «Сергей Королев», принадлежащий «Роскосмосу»)

4. План перевозки утверждается Росавиацией, не позднее чем за месяц до полета

5. Обязательно должны быть сопровождающие лица, которые обязаны контролировать огонь в течение всего полета

Звучит надежно… а как бывает на самом деле смотрите на фото

@Simple_Reliability
4🔥2👀1
Сегодня, на утренней пробежке, совершенно случайно увидел и тут же понял….

Все же есть базовая специальность для инженеров сопровождения высоконагруженных систем.

Тут точно привьют принципы ответственности за результат любых действий.

@Simple_Reliability
🔥7🤣2
Оставлю здесь, на память о «гастролях» на прошлой неделе

18.04.2025. Ульяновск
Конференция «Стачка»
Ключевые вызовы сопровождения в 2025 году

22.04.2025. Самара
Follow the OPS by SBER
«Требования надёжности к GenAI трансформации»

23.04.2025. Аносино
Стратегическая сессия Технологии и Безопасность
«Надёжность мультиагентных систем»

25.04.2025. Екатеринбург
Конференция «DUMP»
Как компании подготовиться и пережить HighSeason

@Simple_Reliability
🔥10🏆2💯1
На фото капитан Джеймс Касс Мейсон.

По его вине, ровно 160 лет назад, произошла самая смертоносная «корабельная» катастрофа США. (даже хуже, чем гибель Титаника).

На борту колесного парохода «Sultana» на реке Миссисипи, произошел взрыв, после чего оно загорелось и затонуло.

Погибло около 1700 человек, около 600 были спасены.

Причины (опять про надёжность)

- За 2 дня до катастрофы в Мемфисе обнаружили трещину в котле. Вместо замены её залатали металлической заплаткой, снизив прочность.

- Пятикратный перегруз: 376 пассажиров, но на борту было ~2 300 человек. Что создало критическую нагрузку на котлы - давление в них превышало норму примерно на 30%

В комментариях фото того как выглядит пятикратный перегруз

@Simple_Reliability
👍4
Поминутно жалуются, что у нас нет людей практических; что политических людей, например, много, генералов тоже много; разных управляющих, сколько бы ни понадобилось, сейчас можно найти каких угодно — а практических людей нет. По крайней мере все жалуются, что нет. Даже, говорят, прислуги на некоторых железных дорогах порядочной нет;

Так начинается первая часть третьей главы «Идиота» Достоевского. 1867 год

Уже больше 150 лет назад Федор Михайлович обозначил проблему, которую до сих пор у нас в стране никто решить не может… а между тем, «человеческий фактор» остается одной из основных причин возникновения инцидентов , практически во всех сферах…

@Simple_Reliability
2👍1
25 лет назад, 4 мая 2000 года, мир столкнулся с одним из самых разрушительных компьютерных червей — ILOVEYOU (Love Bug). Его ущерб оценили в $5–15 млрд, а скорость распространения до сих пор поражает: за 10 дней он заразил 50 млн компьютеров в 20 странах, включая Пентагон, ЦРУ и Ford Motor Company.

Создатель-студент
Вирус разработал 24-летний филиппинец Онел де Гусман. Изначально он хотел создать троян для кражи паролей, чтобы бесплатно пользоваться интернетом

Правовая лазейка
На Филиппинах тогда не было законов против вредоносного ПО, поэтому де Гусмана не смогли наказать. Позже страна приняла антикиберпреступный закон

Низкий уровень кибер-грамотности
Вложение с вирусом маскировалось под текстовый файл (*.txt*), но на деле было скриптом (*.vbs*). В то время, Windows по умолчанию скрывала расширения…

Мутации
Появилось более 25 вариантов вируса. Некоторые удаляли системные файлы, делая ПК неработоспособными, другие крали пароли или маскировались под «антивирусные патчи».

Судьба создателя
В 2020 году де Гусмана нашли в Маниле — он ремонтировал телефоны. Он признал авторство, но избежал наказания…

Культура
ILOVEUSER вошел в Книгу рекордов Гиннесса как самый разрушительный вирус. Он же стал триггером для глобального ужесточения киберзаконов.

ILOVEYOU показал, что даже простой скрипт может парализовать глобальную инфраструктуру. А главное — напомнил, что надежность систем начинается с осознанности каждого.

@Simple_Reliability
👍2👨‍💻2🔥1
Как смерть Майкла Джексона «положила» интернет: цифры и уроки

25 июня 2009 года мир пережил стресс по случаю смерти кумира и… масштабный стресс-тест интернета

Цифры

Google заблокировал запросы с именем певца на 30 минут, ошибочно приняв их за DDoS-атаку. Пиковая нагрузка достигла «вулканического» уровня, а время ответа сервиса выросло до 9 секунд

Twitter упал на 40 минут: 15% всех постов касались Джексона. В пик активности каждые 6-е сообщение содержали его имя, а за час появилось 66.5 тыс упоминаний

BBC News зафиксировал рост трафика в 1.5 раза, а TMZ — первый источник новости — рухнул на 2 часа, вызвав «эффект домино» у других сайтов

Средняя загрузка новостных сайтов выросла с 4 до 9 секунд, а доступность упала с 100% до 86%

Выводы

Непредсказуемость нагрузки
Ни один сервис не был готов к миллионам одновременных запросов. Сегодня облачные решения (например Kubernetes) позволяют автоматически масштабировать ресурсы
(но к сожалению это не всегда работает)

Ошибки автоматизации
Алгоритмы Google News посчитали ажиотаж атакой. Современные системы используют ИИ для анализа трафика и предотвращения ложных срабатываний
(но это не точно)

Централизация рисков
Падение ключевых платформ (Google, Twitter) парализовало сеть. Сегодня упор делается на распределенные архитектуры и CDN (Cloudflare) для балансировки нагрузки
(но не везде это возможно)

@Simple_Reliability
👍4
Лопата против интернета: Как пенсионерка устроила цифровой апокалипсис

2011 год. Грузия. 75-летняя местная жительница, имя которой так и осталось загадкой (возможно, она до сих пор копает медь где-то в горах Грузии), решила подзаработать — отправилась искать медь на продажу. Вместо клада она нашла подземный оптоволоконный кабель...

Что случилось:
- 90% интернета Армении (3,2 млн человек) ушли в офлайн на 5 часов. Без связи остались банки, госучреждения, сайты и даже мобильные операторы.

- Перебои затронули и соседние страны: в Грузии и Азербайджане пользователи жаловались на замедление трафика.

- Расследование показало: кабель был проложен всего на глубине 30 см

Цифры для драмы:
- По данным The Guardian, ущерб от инцидента оценили в $1.5 млн — суммарные потери бизнеса, банковских операций и восстановительных работ.

- Для сравнения: в 2022 году извержение вулкана на Тонга, повредившее подводные кабели, привело к потере $190 млн за пять недель простоя — это 40% ВВП страны.

- В 2011 году «кабельные войны» между провайдерами оставили без связи целые районы — кабели резали ножницами, словно спагетти.

@Simple_Reliability
🙈5👍2😁1
Кто такой Борис Гнеденко?

Советский математик, академик, один из основателей современной теории надежности. Его работы 1940–60-х годов, включая классическую книгу «Теория надежности» (1965), стали основой для анализа отказов систем и прогнозирования их «жизни»

Вклад в ИТ
Разработал методы оценки надежности на основе теории вероятностей

Изучал распределения времени до отказа, что сегодня применяется в тестировании ПО и проектировании серверов

Его идеи легли в основу стандартов для военных и космических систем, которые позже адаптировали для IT-инфраструктур

Как его теории работают в современных IT?

Прогнозирование сбоев
Методы Гнеденко помогают предсказывать отказы компонентов — от жестких дисков до микросервисов. Например, анализ данных логов с использованием распределения Вейбулла позволяет находить «слабые звенья» системы

Оптимизация ресурсов
Расчет оптимального времени замены оборудования (например, серверов) снижает затраты на обслуживание

Кибербезопасность
Моделирование рисков и оценка устойчивости систем к атакам также опираются на вероятностные подходы

Практические советы от Гнеденко для IT-инженеров

Тестируйте на пределе
Используйте стресс-тесты, чтобы определить «порог надежности» системы

Анализируйте историю отказов
Данные о прошлых сбоях — золотая жила для улучшения архитектуры

Резервируйте
Дублирование критических компонентов снижает риск каскадных отказов

#НадёжныеЛюди

@Simple_Reliability
👍5
Надёжность AI-агентов: разрыв между обещаниями и реальностью
 
Исследование CB Insights (2025) утверждает, что AI-агенты теряют до 50% точности в сложных задачах, например, при анализе юридических документов
 
Почему надёжность страдает?

- Галлюцинации LLM: OpenAI в исследовании (2023) признаёт, что модели вроде GPT-4 могут генерировать ошибки в 15-20% случаев при работе с узкоспециализированными данными

- Ограничения автономии: Harvey (юридический AI) использует «предопределенные сценарии» для снижения рисков. Они прямо говорят об этом в своих пресс-релизах
 
Одно из решений это Human-in-the-loop: внедрение гибридных систем, где 30% решений проверяются экспертами (так уже делают)

Вывод: Надёжность AI-агентов зависит не только от технологий, но и от прозрачности процессов
 
С текущим уровнем зрелости критически важно:
- Тестировать агентов на реальных данных перед внедрением
- Использовать открытые инструменты мониторинга
- Не исключать человека из контура (особенно в юриспруденции, финансах и медицине)

@Simple_Reliability
👍3
Новое исследование показывает, что нейросети пересказывая научные статьи делают почти в пять раз больше серьезных ошибок, чем люди. Причем, заметить эти ошибки сложнее, потому что пересказы кажутся логичными и убедительными. Подробнее

Как сократить количество таких ошибок?

Уменьшайте «творчество» модели
Если есть возможность выставите параметр temperature на 0. Чем он ниже — тем точнее выводы

Не просите «не ошибаться»
Парадокс: фразы вроде «будь точным» повышают риск выдумок. Лучше просто попросить краткий пересказ

Выбирайте «консервативные» модели
- Claude — лидер по точности.
- Старые версии GPT (например, GPT-3.5) надежнее новых

Говорите о науке в прошедшем времени
«Ученые обнаружили» вместо «Исследования показывают». Так ИИ не перенесет прошлые выводы в настоящее. Этот прием уже используют топ-медижурналы

@Simple_Reliability
👍6
В 1968 году, в журнале Harvard Business Review была опубликована идея программиста Мелвина Конвея, которая звучит так:
«Любая организация, которая разрабатывает систему (в широком смысле), вынуждена создавать проекты (читай: проектировать системы), структуры которых являются копией структуры связей организации»


Сейчас эта идея известна как Закон Конвея

Если закон действительно работают, то первое что надо сделать, чтобы повысить надежность систем - это упростить систему связей и коммуникаций внутри компании.

@Simple_Reliability
👍3
Forwarded from ИТ-Пикник
Сделать контролируемый сбой? Почему бы и нет. Построить умный мост? Легко! Совместить SRE и ITIL? Это мы тоже умеем😉

На прошлогоднем ИТ-пикнике в секции «Архитектура, надежность, качество» обсудили все и даже больше: от гарантированной доставки данных до управления надежностью тысячи ИТ-сервисов.

В карточках — описание докладов. Выбирайте, о чем узнать сегодня:

➡️ Гарантии доставки сообщений в YDB Topics
➡️ Куда засунуть код нереального времени в решении реального времени
➡️ SRE vs ITIL
➡️ Надежность через разрушения. Контролируемые сбои на production
➡️ Критичные требования надежности
➡️ Система технологического мониторинга объектов с использованием интернета вещей

#доклады_2024
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
3👍2