Культура Надёжности
175 subscribers
141 photos
5 videos
48 links
Авторский канал о надёжности

@SlavaKudryashov
Download Telegram
На фото капитан Джеймс Касс Мейсон.

По его вине, ровно 160 лет назад, произошла самая смертоносная «корабельная» катастрофа США. (даже хуже, чем гибель Титаника).

На борту колесного парохода «Sultana» на реке Миссисипи, произошел взрыв, после чего оно загорелось и затонуло.

Погибло около 1700 человек, около 600 были спасены.

Причины (опять про надёжность)

- За 2 дня до катастрофы в Мемфисе обнаружили трещину в котле. Вместо замены её залатали металлической заплаткой, снизив прочность.

- Пятикратный перегруз: 376 пассажиров, но на борту было ~2 300 человек. Что создало критическую нагрузку на котлы - давление в них превышало норму примерно на 30%

В комментариях фото того как выглядит пятикратный перегруз

@Simple_Reliability
👍4
Поминутно жалуются, что у нас нет людей практических; что политических людей, например, много, генералов тоже много; разных управляющих, сколько бы ни понадобилось, сейчас можно найти каких угодно — а практических людей нет. По крайней мере все жалуются, что нет. Даже, говорят, прислуги на некоторых железных дорогах порядочной нет;

Так начинается первая часть третьей главы «Идиота» Достоевского. 1867 год

Уже больше 150 лет назад Федор Михайлович обозначил проблему, которую до сих пор у нас в стране никто решить не может… а между тем, «человеческий фактор» остается одной из основных причин возникновения инцидентов , практически во всех сферах…

@Simple_Reliability
2👍1
25 лет назад, 4 мая 2000 года, мир столкнулся с одним из самых разрушительных компьютерных червей — ILOVEYOU (Love Bug). Его ущерб оценили в $5–15 млрд, а скорость распространения до сих пор поражает: за 10 дней он заразил 50 млн компьютеров в 20 странах, включая Пентагон, ЦРУ и Ford Motor Company.

Создатель-студент
Вирус разработал 24-летний филиппинец Онел де Гусман. Изначально он хотел создать троян для кражи паролей, чтобы бесплатно пользоваться интернетом

Правовая лазейка
На Филиппинах тогда не было законов против вредоносного ПО, поэтому де Гусмана не смогли наказать. Позже страна приняла антикиберпреступный закон

Низкий уровень кибер-грамотности
Вложение с вирусом маскировалось под текстовый файл (*.txt*), но на деле было скриптом (*.vbs*). В то время, Windows по умолчанию скрывала расширения…

Мутации
Появилось более 25 вариантов вируса. Некоторые удаляли системные файлы, делая ПК неработоспособными, другие крали пароли или маскировались под «антивирусные патчи».

Судьба создателя
В 2020 году де Гусмана нашли в Маниле — он ремонтировал телефоны. Он признал авторство, но избежал наказания…

Культура
ILOVEUSER вошел в Книгу рекордов Гиннесса как самый разрушительный вирус. Он же стал триггером для глобального ужесточения киберзаконов.

ILOVEYOU показал, что даже простой скрипт может парализовать глобальную инфраструктуру. А главное — напомнил, что надежность систем начинается с осознанности каждого.

@Simple_Reliability
👍2👨‍💻2🔥1
Как смерть Майкла Джексона «положила» интернет: цифры и уроки

25 июня 2009 года мир пережил стресс по случаю смерти кумира и… масштабный стресс-тест интернета

Цифры

Google заблокировал запросы с именем певца на 30 минут, ошибочно приняв их за DDoS-атаку. Пиковая нагрузка достигла «вулканического» уровня, а время ответа сервиса выросло до 9 секунд

Twitter упал на 40 минут: 15% всех постов касались Джексона. В пик активности каждые 6-е сообщение содержали его имя, а за час появилось 66.5 тыс упоминаний

BBC News зафиксировал рост трафика в 1.5 раза, а TMZ — первый источник новости — рухнул на 2 часа, вызвав «эффект домино» у других сайтов

Средняя загрузка новостных сайтов выросла с 4 до 9 секунд, а доступность упала с 100% до 86%

Выводы

Непредсказуемость нагрузки
Ни один сервис не был готов к миллионам одновременных запросов. Сегодня облачные решения (например Kubernetes) позволяют автоматически масштабировать ресурсы
(но к сожалению это не всегда работает)

Ошибки автоматизации
Алгоритмы Google News посчитали ажиотаж атакой. Современные системы используют ИИ для анализа трафика и предотвращения ложных срабатываний
(но это не точно)

Централизация рисков
Падение ключевых платформ (Google, Twitter) парализовало сеть. Сегодня упор делается на распределенные архитектуры и CDN (Cloudflare) для балансировки нагрузки
(но не везде это возможно)

@Simple_Reliability
👍4
Лопата против интернета: Как пенсионерка устроила цифровой апокалипсис

2011 год. Грузия. 75-летняя местная жительница, имя которой так и осталось загадкой (возможно, она до сих пор копает медь где-то в горах Грузии), решила подзаработать — отправилась искать медь на продажу. Вместо клада она нашла подземный оптоволоконный кабель...

Что случилось:
- 90% интернета Армении (3,2 млн человек) ушли в офлайн на 5 часов. Без связи остались банки, госучреждения, сайты и даже мобильные операторы.

- Перебои затронули и соседние страны: в Грузии и Азербайджане пользователи жаловались на замедление трафика.

- Расследование показало: кабель был проложен всего на глубине 30 см

Цифры для драмы:
- По данным The Guardian, ущерб от инцидента оценили в $1.5 млн — суммарные потери бизнеса, банковских операций и восстановительных работ.

- Для сравнения: в 2022 году извержение вулкана на Тонга, повредившее подводные кабели, привело к потере $190 млн за пять недель простоя — это 40% ВВП страны.

- В 2011 году «кабельные войны» между провайдерами оставили без связи целые районы — кабели резали ножницами, словно спагетти.

@Simple_Reliability
🙈5👍2😁1
Кто такой Борис Гнеденко?

Советский математик, академик, один из основателей современной теории надежности. Его работы 1940–60-х годов, включая классическую книгу «Теория надежности» (1965), стали основой для анализа отказов систем и прогнозирования их «жизни»

Вклад в ИТ
Разработал методы оценки надежности на основе теории вероятностей

Изучал распределения времени до отказа, что сегодня применяется в тестировании ПО и проектировании серверов

Его идеи легли в основу стандартов для военных и космических систем, которые позже адаптировали для IT-инфраструктур

Как его теории работают в современных IT?

Прогнозирование сбоев
Методы Гнеденко помогают предсказывать отказы компонентов — от жестких дисков до микросервисов. Например, анализ данных логов с использованием распределения Вейбулла позволяет находить «слабые звенья» системы

Оптимизация ресурсов
Расчет оптимального времени замены оборудования (например, серверов) снижает затраты на обслуживание

Кибербезопасность
Моделирование рисков и оценка устойчивости систем к атакам также опираются на вероятностные подходы

Практические советы от Гнеденко для IT-инженеров

Тестируйте на пределе
Используйте стресс-тесты, чтобы определить «порог надежности» системы

Анализируйте историю отказов
Данные о прошлых сбоях — золотая жила для улучшения архитектуры

Резервируйте
Дублирование критических компонентов снижает риск каскадных отказов

#НадёжныеЛюди

@Simple_Reliability
👍5
Надёжность AI-агентов: разрыв между обещаниями и реальностью
 
Исследование CB Insights (2025) утверждает, что AI-агенты теряют до 50% точности в сложных задачах, например, при анализе юридических документов
 
Почему надёжность страдает?

- Галлюцинации LLM: OpenAI в исследовании (2023) признаёт, что модели вроде GPT-4 могут генерировать ошибки в 15-20% случаев при работе с узкоспециализированными данными

- Ограничения автономии: Harvey (юридический AI) использует «предопределенные сценарии» для снижения рисков. Они прямо говорят об этом в своих пресс-релизах
 
Одно из решений это Human-in-the-loop: внедрение гибридных систем, где 30% решений проверяются экспертами (так уже делают)

Вывод: Надёжность AI-агентов зависит не только от технологий, но и от прозрачности процессов
 
С текущим уровнем зрелости критически важно:
- Тестировать агентов на реальных данных перед внедрением
- Использовать открытые инструменты мониторинга
- Не исключать человека из контура (особенно в юриспруденции, финансах и медицине)

@Simple_Reliability
👍3
Новое исследование показывает, что нейросети пересказывая научные статьи делают почти в пять раз больше серьезных ошибок, чем люди. Причем, заметить эти ошибки сложнее, потому что пересказы кажутся логичными и убедительными. Подробнее

Как сократить количество таких ошибок?

Уменьшайте «творчество» модели
Если есть возможность выставите параметр temperature на 0. Чем он ниже — тем точнее выводы

Не просите «не ошибаться»
Парадокс: фразы вроде «будь точным» повышают риск выдумок. Лучше просто попросить краткий пересказ

Выбирайте «консервативные» модели
- Claude — лидер по точности.
- Старые версии GPT (например, GPT-3.5) надежнее новых

Говорите о науке в прошедшем времени
«Ученые обнаружили» вместо «Исследования показывают». Так ИИ не перенесет прошлые выводы в настоящее. Этот прием уже используют топ-медижурналы

@Simple_Reliability
👍6
В 1968 году, в журнале Harvard Business Review была опубликована идея программиста Мелвина Конвея, которая звучит так:
«Любая организация, которая разрабатывает систему (в широком смысле), вынуждена создавать проекты (читай: проектировать системы), структуры которых являются копией структуры связей организации»


Сейчас эта идея известна как Закон Конвея

Если закон действительно работают, то первое что надо сделать, чтобы повысить надежность систем - это упростить систему связей и коммуникаций внутри компании.

@Simple_Reliability
👍3
Forwarded from ИТ-Пикник
Сделать контролируемый сбой? Почему бы и нет. Построить умный мост? Легко! Совместить SRE и ITIL? Это мы тоже умеем😉

На прошлогоднем ИТ-пикнике в секции «Архитектура, надежность, качество» обсудили все и даже больше: от гарантированной доставки данных до управления надежностью тысячи ИТ-сервисов.

В карточках — описание докладов. Выбирайте, о чем узнать сегодня:

➡️ Гарантии доставки сообщений в YDB Topics
➡️ Куда засунуть код нереального времени в решении реального времени
➡️ SRE vs ITIL
➡️ Надежность через разрушения. Контролируемые сбои на production
➡️ Критичные требования надежности
➡️ Система технологического мониторинга объектов с использованием интернета вещей

#доклады_2024
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
3👍2
Бритва Оккама: Упрощать, но не слишком

«Не умножай сущности без необходимости» — эту максиму XIV века сегодня знают как бритву Оккама. Альберт Эйнштейн дал её современную формулировку:
«Всё следует упрощать до тех пор, пока это возможно, но не более того»


Мы живём в эпоху гипероптимизации:

- Чрезмерное упрощение UI зачастую делает интерфейс неочевидным для пользователей

- Агрессивный рефакторинг кода порой уничтожает его гибкость

- Попытки «упростить» сложные процессы приводят к опасным допущениям

- «Давайте сделаем один монолит вместо микросервисов», а потом система не масштабируется

- В анализе данных: «Корреляция = причинность» → ложные выводы

Принцип актуальный, но применять его нужно правильно:

Простое решение не должно противоречить фактам
Сначала базовые гипотезы, затем — сложные
Если эксперты морщатся — возможно, вы переупростили

@Simple_Reliability
👍2🔥2
12-13 сентября в Оренбурге пройдет Merge + IT Fest Oren. Это два масштабных IT-события на одной площадке.

Буду рассказывать здесь о встраивании GenAI в существующий ИТ-ландшафт без влияния на работающие процессы и лояльных клиентов. Поговорим о возможных сложностях и рисках. Разберем на примере реальных кейсов, что необходимо предусмотреть, чтобы снизить влияние на пользователей, в случае сбоев/галлюцинаций AI-агентов.

Присоединяйтесь! По промокоду KUDRYASHOV действует скидка 20%.

Подробнее о мероприятии на сайте: orenburg2025.mergeconf.ru
🔥14
Коротко про ключевые события в службе сопровождения…

@Simple_Reliability
👍2😁2
🎨 ИИ подтвердил подлинность утерянного Караваджо

Картина «Лютнист» из английского поместья Бадминтон-хаус, десятилетия считавшаяся копией, была признана работой Караваджо благодаря искусственному интеллекту.

📊 Ключевые факты:

· В 2001 году продана как работа «из круга Караваджо» всего за £71 000.

· Анализ ИИ от швейцарской компании Art Recognition: Вероятность авторства Караваджо — 85,7%.

· Эксперты отметили безупречную прорисовку деталей (например, лютни), что характерно для рук мастера.

💡 Почему важен этот кейс?

1. ИИ дал количественную, измеримую оценку (85,7%), которая стала мощным основанием для углубленного экспертного исследования.

2. Алгоритм не заменил искусствоведов, а указал им на объект, заслуживающий перепроверки. Это идеальная модель взаимодействия: технология обрабатывает данные, человек делает финальные выводы.

3. Данный случай — прямое доказательство финансовой окупаемости надежных технологических решений.

💰 Финансовый итог:
Первоначальная стоимость: ~£71 000 → Текущая оценочная стоимость: десятки миллионов фунтов.

Инвестиции в создание и применение точного и надежного инструмента анализа не просто оправдали себя, но и принесли многотысячекратную финансовую отдачу, наглядно демонстрируя ценность технологий, которым можно доверять.

@Simple_Reliability
👍41
2-3 октября я выступлю на Стачке в Санкт-Петербурге с докладом «Зачем в ИТ нужны эксперты по надёжности»

У меня есть один бесплатный билет, если будете в Питере в эти даты и хотите посетить, напишите комментарий к этому посту - передам.


Билеты доступны на сайте
Промокод “Спикер10” даст скидку 10% на билет)


@Simple_Reliability
🔥8👏1