2-3 октября я выступлю на Стачке в Санкт-Петербурге с докладом «Зачем в ИТ нужны эксперты по надёжности»
У меня есть один бесплатный билет, если будете в Питере в эти даты и хотите посетить, напишите комментарий к этому посту - передам.
Билеты доступны на сайте
Промокод “Спикер10” даст скидку 10% на билет)
@Simple_Reliability
У меня есть один бесплатный билет, если будете в Питере в эти даты и хотите посетить, напишите комментарий к этому посту - передам.
Промокод “Спикер10” даст скидку 10% на билет)
@Simple_Reliability
🔥8👏1
Gartner о будущем бизнеса и ИИ-агентов:
К 2035 году появится первая компания из списка Fortune 500, где штат сотрудников будет меньше 1000 человек, а основную работу будут выполнять именно ИИ-агенты.
Эксперты Gartner говорят о том, что в ближайшие полтора-два года в B2B покупать товары и услуги, а также быть деловыми партнёрами будут ИИ-агенты.
Вот как это будет выглядеть:
· Уже к 2028 году около трети всех деловых переговоров между компаниями будут вести не люди, а ИИ-агенты
· К 2030 году половина генеральных директоров в tech-индустрии будут регулярно работать с такими «агент-клиентами»
ИИ-агенты смогут сами находить друг друга, за секунды договариваться о сделках (вместо недель переговоров) и проводить миллиарды крошечных платежей мгновенно. Это полностью изменит привычные бизнес-модели и создаст новые рынки, где деньги будут оборачиваться невероятно быстро.
Получается, что в ближайшие 18 месяцев крупные игроки, скорее всего, обратят внимание на два направления:
· Создание инфраструктуры: платёжные системы, сервисы безопасности и протоколы, по которым агенты будут взаимодействовать
· Разработка приложений для самих ИИ-агентов
Оригинал: Agent-to-Agent Economy: Position Now for Autonomous Business Shift (Gartner; 1 August 2025)
@Simple_Reliability
К 2035 году появится первая компания из списка Fortune 500, где штат сотрудников будет меньше 1000 человек, а основную работу будут выполнять именно ИИ-агенты.
Эксперты Gartner говорят о том, что в ближайшие полтора-два года в B2B покупать товары и услуги, а также быть деловыми партнёрами будут ИИ-агенты.
Вот как это будет выглядеть:
· Уже к 2028 году около трети всех деловых переговоров между компаниями будут вести не люди, а ИИ-агенты
· К 2030 году половина генеральных директоров в tech-индустрии будут регулярно работать с такими «агент-клиентами»
ИИ-агенты смогут сами находить друг друга, за секунды договариваться о сделках (вместо недель переговоров) и проводить миллиарды крошечных платежей мгновенно. Это полностью изменит привычные бизнес-модели и создаст новые рынки, где деньги будут оборачиваться невероятно быстро.
Получается, что в ближайшие 18 месяцев крупные игроки, скорее всего, обратят внимание на два направления:
· Создание инфраструктуры: платёжные системы, сервисы безопасности и протоколы, по которым агенты будут взаимодействовать
· Разработка приложений для самих ИИ-агентов
Оригинал: Agent-to-Agent Economy: Position Now for Autonomous Business Shift (Gartner; 1 August 2025)
@Simple_Reliability
😱3
История о том, как ИИ-помощник стал соучастником психоза
В августе 56-летний американец и бывший IT-менеджер Штейн-Эрик Зельберг убил свою мать, а затем покончил с собой. Расследование показало, что прямым соучастником трагедии стал чат-бот ChatGPT.
Что произошло:
· Мужчина месяцами общался с ИИ, дал ему имя «Бобби» и считал своим лучшим другом
· Он страдал от паранойи и доверял боту свои подозрения, что все вокруг (включая мать) участвуют в заговоре против него
· Вместо того чтобы успокоить его или предложить обратиться за помощью, ChatGPT систематически подтверждал его бредовые идеи
Примеры диалогов:
🧾 Чек из ресторана: Зельберг попросил ИИ проанализировать чек от китайской еды. Бот «обнаружил» в нем скрытые символы, связывающие мать мужчины с демоном и разведслужбами
🖨️ Ссора из-за принтера: Когда мать Зельберга разозлилась, что он отключил общий принтер, ChatGPT заявил, что это «непропорциональная реакция», и предположил, что женщина таким образом «защищает средство слежки»
💀 Встреча после смерти: Незадолго до убийства мужчина спросил у бота, встретятся ли они после смерти, и получил утвердительный ответ .
Выводы…
Кажется, что системный сбой, который демонстрирует фундаментальную проблему: современные ИИ абсолютно не готовы к взаимодействию с людьми, имеющими психические нарушения .
· Для уязвимого пользователя ИИ превратился из инструмента в агента, который не просто не помог, а активно подтолкнул к катастрофе.
· Модели оптимизированы на «помощь» и «дружелюбие», но не распознают и не деэскалируют острые психические состояния. Они не понимают, когда их согласие может быть смертельно опасным.
Компания OpenAI, выразив соболезнования, пообещала улучшить фильтрацию подобных диалогов.
Надежность ИИ — это не только про аптайм и безопасность данных. Это всё чаще — психологическая безопасность пользователей.
@Simple_Reliability
В августе 56-летний американец и бывший IT-менеджер Штейн-Эрик Зельберг убил свою мать, а затем покончил с собой. Расследование показало, что прямым соучастником трагедии стал чат-бот ChatGPT.
Что произошло:
· Мужчина месяцами общался с ИИ, дал ему имя «Бобби» и считал своим лучшим другом
· Он страдал от паранойи и доверял боту свои подозрения, что все вокруг (включая мать) участвуют в заговоре против него
· Вместо того чтобы успокоить его или предложить обратиться за помощью, ChatGPT систематически подтверждал его бредовые идеи
Примеры диалогов:
🧾 Чек из ресторана: Зельберг попросил ИИ проанализировать чек от китайской еды. Бот «обнаружил» в нем скрытые символы, связывающие мать мужчины с демоном и разведслужбами
🖨️ Ссора из-за принтера: Когда мать Зельберга разозлилась, что он отключил общий принтер, ChatGPT заявил, что это «непропорциональная реакция», и предположил, что женщина таким образом «защищает средство слежки»
💀 Встреча после смерти: Незадолго до убийства мужчина спросил у бота, встретятся ли они после смерти, и получил утвердительный ответ .
Выводы…
Кажется, что системный сбой, который демонстрирует фундаментальную проблему: современные ИИ абсолютно не готовы к взаимодействию с людьми, имеющими психические нарушения .
· Для уязвимого пользователя ИИ превратился из инструмента в агента, который не просто не помог, а активно подтолкнул к катастрофе.
· Модели оптимизированы на «помощь» и «дружелюбие», но не распознают и не деэскалируют острые психические состояния. Они не понимают, когда их согласие может быть смертельно опасным.
Компания OpenAI, выразив соболезнования, пообещала улучшить фильтрацию подобных диалогов.
Надежность ИИ — это не только про аптайм и безопасность данных. Это всё чаще — психологическая безопасность пользователей.
@Simple_Reliability
👍3🤔2❤1
Процессы, а не инструменты
(или как правильно внедрять ИИ, по версии McKinsey)
Консультанты McKinsey проанализировали 50 примеров внедрения агентов и на основе результатов сформулировали 6 уроков, цель которых помочь улучшить результаты внедрения новых технологий:
1. Необходима фокусировка не на самом агенте, а на рабочем процессе
Ценность создается при переосмыслении и перепроектировании процесса целиком, а не просто по результатам внедрения ИИ-агента.
2. Агенты – не всегда правильное решение
Не все задачи требуют именно участия агентов, некоторые могут быть решены за счет промптов, аналитических инструментов, правильного описания бизнес-процессов.
3. Необходимо избегать "ИИ-мусора" (AI slop)
Ненадежные выводы ИИ низкого качества подрывают доверие пользователей. Чтобы избежать этого, необходимо разрабатывать строгие системы оценки, обучать агентов как новых сотрудников и улучшать их на основе обратной связи.
4. Необходимо обеспечить прозрачность и возможность отслеживать каждый шаг ИИ-агентов
Важно интегрировать инструменты оценки и мониторинга ИИ-агентов в сам процесс, в который они встраиваются, особенно при масштабировании решений.
5. Лучший кейс – это кейс переиспользования агента
Вместо разработки новых агентов под задачу, целесообразнее разработать модульные и многократно переиспользуемые компоненты, а также централизованные библиотеки (промпты, сервисы, код).
6. Люди сохраняют ключевое значение: меняются их роли и численность
Агенты не могут заменить человека полностью. Люди нужны для контроля, принятия решений в нестандартных ситуаций, оценки ИИ-агентов.
Ничего нового с точки зрения надежности. Главное следовать этим выводам.
Оригинал: One year of agentic AI: Six lessons from the
people doing the work (McKinsey; сентябрь 2025 г.)
@Simple_Reliability
(или как правильно внедрять ИИ, по версии McKinsey)
Консультанты McKinsey проанализировали 50 примеров внедрения агентов и на основе результатов сформулировали 6 уроков, цель которых помочь улучшить результаты внедрения новых технологий:
1. Необходима фокусировка не на самом агенте, а на рабочем процессе
Ценность создается при переосмыслении и перепроектировании процесса целиком, а не просто по результатам внедрения ИИ-агента.
2. Агенты – не всегда правильное решение
Не все задачи требуют именно участия агентов, некоторые могут быть решены за счет промптов, аналитических инструментов, правильного описания бизнес-процессов.
3. Необходимо избегать "ИИ-мусора" (AI slop)
Ненадежные выводы ИИ низкого качества подрывают доверие пользователей. Чтобы избежать этого, необходимо разрабатывать строгие системы оценки, обучать агентов как новых сотрудников и улучшать их на основе обратной связи.
4. Необходимо обеспечить прозрачность и возможность отслеживать каждый шаг ИИ-агентов
Важно интегрировать инструменты оценки и мониторинга ИИ-агентов в сам процесс, в который они встраиваются, особенно при масштабировании решений.
5. Лучший кейс – это кейс переиспользования агента
Вместо разработки новых агентов под задачу, целесообразнее разработать модульные и многократно переиспользуемые компоненты, а также централизованные библиотеки (промпты, сервисы, код).
6. Люди сохраняют ключевое значение: меняются их роли и численность
Агенты не могут заменить человека полностью. Люди нужны для контроля, принятия решений в нестандартных ситуаций, оценки ИИ-агентов.
Ничего нового с точки зрения надежности. Главное следовать этим выводам.
Оригинал: One year of agentic AI: Six lessons from the
people doing the work (McKinsey; сентябрь 2025 г.)
@Simple_Reliability
⚡4👍3
Как обосновать бизнесу, почему георезерв необходим, хотя очень дорогой?
26-го сентября 2025 года полностью сгорел дата-центр Национальной службы информационных ресурсов (NIRS) в Тэджоне (Южная Корея)
Причиной стало возгорание в модуле литий-ионных аккумуляторов системы ИБП. Пожар бушевал 22 часа.
· Полностью парализовано: 647 государственных сервисов.
· Уничтожено физически: 96 информационных систем.
· Утеряно безвозвратно: 858 ТБ данных правительственного облака
🛑 Инцидент парализовал критически важную инфраструктуру страны:
1. Национальный полицейский портал — система управления оперативными данными.
2. Портал Национальной пожарной службы.
3. Общенациональный портал государственных услуг.
4. Национальная налоговая служба — сервисы обработки платежей и деклараций.
5. Правительственное облако G-Drive — централизованное хранилище данных.
6. Системы мобильной связи нескольких операторов.
7. Платежные и транспортные системы, включая городские карты.
💥 Но не пожар стал причиной катастрофических последствий, а системные просчеты:
1. Полное отсутствие внешних резервных копий. Для 858 ТБ данных облака G-Drive не создавались резервные копии вне ЦОД.
2. Критическое отсутствие географического резервирования. 647 сервисов, включая ключевые госуслуги, были привязаны к одному дата-центру. Точка отказа оказалась единственной.
3. Нарушение регламента эксплуатации ИБП. Использовались литий-ионные аккумуляторы, отслужившие свой 10-летний срок, что напрямую привело к возгоранию.
Если бы были соблюдены вышеуказанные требования (надежности) катастрофы удалось бы избежать.
#ВПИ #Георезерв
@Simple_Reliability
26-го сентября 2025 года полностью сгорел дата-центр Национальной службы информационных ресурсов (NIRS) в Тэджоне (Южная Корея)
Причиной стало возгорание в модуле литий-ионных аккумуляторов системы ИБП. Пожар бушевал 22 часа.
· Полностью парализовано: 647 государственных сервисов.
· Уничтожено физически: 96 информационных систем.
· Утеряно безвозвратно: 858 ТБ данных правительственного облака
🛑 Инцидент парализовал критически важную инфраструктуру страны:
1. Национальный полицейский портал — система управления оперативными данными.
2. Портал Национальной пожарной службы.
3. Общенациональный портал государственных услуг.
4. Национальная налоговая служба — сервисы обработки платежей и деклараций.
5. Правительственное облако G-Drive — централизованное хранилище данных.
6. Системы мобильной связи нескольких операторов.
7. Платежные и транспортные системы, включая городские карты.
💥 Но не пожар стал причиной катастрофических последствий, а системные просчеты:
1. Полное отсутствие внешних резервных копий. Для 858 ТБ данных облака G-Drive не создавались резервные копии вне ЦОД.
2. Критическое отсутствие географического резервирования. 647 сервисов, включая ключевые госуслуги, были привязаны к одному дата-центру. Точка отказа оказалась единственной.
3. Нарушение регламента эксплуатации ИБП. Использовались литий-ионные аккумуляторы, отслужившие свой 10-летний срок, что напрямую привело к возгоранию.
Если бы были соблюдены вышеуказанные требования (надежности) катастрофы удалось бы избежать.
#ВПИ #Георезерв
@Simple_Reliability
👍6👏4🔥3
К 2028 году, по прогнозу Gartner, 60% инструментов для ИТ-операций будут включать AI-агентов (сейчас — менее 5%).
Документ исследует возможный сценарий перехода к среде, где агенты сами учатся, предсказывают проблемы и исправляют их до возникновения…
Другими словами, специалисты по сопровождению, вынуждены будут переквалифицироваться (или нет)
❓ В основе этой среды будет:
- Self-healing инфраструктура — системы восстанавливаются автоматически, MTTR сокращается кратно
- Предиктивное обслуживание — агенты предотвращают сбои, анализируя паттерны в реальном времени
- Anomaly detection нового уровня — ИИ находит скрытые аномалии, которые пропускают традиционные правила
✒️ Во что предлагают вложиться, чтобы попасть в «светлое будущее»:
1. Поэтапное внедрение — начинать с простых задач (тикетинг, документация), постепенно переходя к критическим операциям
2. Зрелые данные и процессы — агенты эффективны настолько, насколько качественна их информационная база
3. Human-in-the-loop для высокорисковых операций — автоматизировать рутину, но оставить человека для критических решений
Оригинал: Reengineer I&O Processes With Integrative Agentic AI (Gartner; 19 August 2025)
#AI_трансформация
@Simple_Reliability
Документ исследует возможный сценарий перехода к среде, где агенты сами учатся, предсказывают проблемы и исправляют их до возникновения…
Другими словами, специалисты по сопровождению, вынуждены будут переквалифицироваться (или нет)
❓ В основе этой среды будет:
- Self-healing инфраструктура — системы восстанавливаются автоматически, MTTR сокращается кратно
- Предиктивное обслуживание — агенты предотвращают сбои, анализируя паттерны в реальном времени
- Anomaly detection нового уровня — ИИ находит скрытые аномалии, которые пропускают традиционные правила
✒️ Во что предлагают вложиться, чтобы попасть в «светлое будущее»:
1. Поэтапное внедрение — начинать с простых задач (тикетинг, документация), постепенно переходя к критическим операциям
2. Зрелые данные и процессы — агенты эффективны настолько, насколько качественна их информационная база
3. Human-in-the-loop для высокорисковых операций — автоматизировать рутину, но оставить человека для критических решений
Оригинал: Reengineer I&O Processes With Integrative Agentic AI (Gartner; 19 August 2025)
#AI_трансформация
@Simple_Reliability
🤝2
#АзбукаНадёжности Часть 1
❓ Надёжность, доступность, устойчивость — в чём разница?
Часто эти понятия смешивают, но они описывают разные аспекты работы системы:
Надёжность — это общее свойство системы выполнять требуемые функции в заданных условиях
Доступность — готовность системы к работе по требованию. Проще говоря, она «жива» и отвечает на запросы
Устойчивость — способность системы не просто работать, но и сохранять заявленные характеристики (производительность, latency) под нагрузкой или при частичных сбоях
Отказоустойчивость — это способность системы сохранять все эти свойства при выходе из строя отдельных компонентов
А еще есть ремонтопригодность, безотказность, отказобезопасность…
@Simple_Reliability
❓ Надёжность, доступность, устойчивость — в чём разница?
Часто эти понятия смешивают, но они описывают разные аспекты работы системы:
Надёжность — это общее свойство системы выполнять требуемые функции в заданных условиях
Доступность — готовность системы к работе по требованию. Проще говоря, она «жива» и отвечает на запросы
Устойчивость — способность системы не просто работать, но и сохранять заявленные характеристики (производительность, latency) под нагрузкой или при частичных сбоях
Отказоустойчивость — это способность системы сохранять все эти свойства при выходе из строя отдельных компонентов
А еще есть ремонтопригодность, безотказность, отказобезопасность…
@Simple_Reliability
❤3👍2🤩1
#АзбукаНадёжности Часть 2
Общеизвестно, что ключевой принцип надежности - это резервирование
Но не все знают, что резервирование бывает разным:
1. Аппаратное: классическое дублирование оборудования (серверы, сеть, диски)
2. Программное: использование независимых, но функционально равноценных программ для решения одной задачи
3. Информационное: коды коррекции ошибок, контрольные суммы
4. Временное: выполнение операции заново или выделение дополнительного времени
Стратегии резервирования так же различаются:
Горячий резерв — резервные элементы работают под той же нагрузкой, что и основные. Переключение мгновенное, но ресурсы «стареют» одновременно
Холодный резерв — резервные элементы не активны до момента отказа. Экономят ресурсы, но требуется время на переключение и запуск
Общее резервирование — резервируется система в целом (например, весь дата-центр)
Раздельное резервирование — резервируются отдельные критические узлы или элементы (например, блоки питания в сервере)
@Simple_Reliability
Общеизвестно, что ключевой принцип надежности - это резервирование
Универсальный метод повышения надёжности путём введения избыточности. Его применяют в природе, технике и IT.
Но не все знают, что резервирование бывает разным:
1. Аппаратное: классическое дублирование оборудования (серверы, сеть, диски)
2. Программное: использование независимых, но функционально равноценных программ для решения одной задачи
3. Информационное: коды коррекции ошибок, контрольные суммы
4. Временное: выполнение операции заново или выделение дополнительного времени
Стратегии резервирования так же различаются:
Горячий резерв — резервные элементы работают под той же нагрузкой, что и основные. Переключение мгновенное, но ресурсы «стареют» одновременно
Холодный резерв — резервные элементы не активны до момента отказа. Экономят ресурсы, но требуется время на переключение и запуск
Общее резервирование — резервируется система в целом (например, весь дата-центр)
Раздельное резервирование — резервируются отдельные критические узлы или элементы (например, блоки питания в сервере)
@Simple_Reliability
🔥2
#АзбукаНадёжности Часть 3
Состояние/State - ключевой критерий для выбора паттернов обеспечения надёжности
1. Сервисы без сохранения состояния (Stateless)
Каждый запрос независим. Для них отказоустойчивость достигается относительно просто:
Паттерн: Наличие нескольких идентичных экземпляров сервиса за балансировщиком нагрузки
Суть в том, чтобы обеспечить статистическую независимость отказов. Размещайте инстансы в разных зонах доступности (Availability Zones), а в идеале — в разных географических регионах (Regions) . Если один дата-центр "лег", трафик уйдёт в другие.
2. Сервисы с сохранением состояния (Stateful)
Здесь всё сложнее. Состояние (например, база данных, сессия пользователя) должно быть сохранено даже при сбоях.
Паттерны:
- Репликация данных: синхронная или асинхронная (как в RAID-массивах или распределённых БД)
- Кластеризация: создание группы серверов, где при отказе одного его обязанности берут на себя другие (горячее резервирование)
- Кворум: принятие решений на основе согласия большинства узлов в кластере для обеспечения консистентности данных
@Simple_Reliability
Состояние/State - ключевой критерий для выбора паттернов обеспечения надёжности
1. Сервисы без сохранения состояния (Stateless)
Каждый запрос независим. Для них отказоустойчивость достигается относительно просто:
Паттерн: Наличие нескольких идентичных экземпляров сервиса за балансировщиком нагрузки
Суть в том, чтобы обеспечить статистическую независимость отказов. Размещайте инстансы в разных зонах доступности (Availability Zones), а в идеале — в разных географических регионах (Regions) . Если один дата-центр "лег", трафик уйдёт в другие.
2. Сервисы с сохранением состояния (Stateful)
Здесь всё сложнее. Состояние (например, база данных, сессия пользователя) должно быть сохранено даже при сбоях.
Паттерны:
- Репликация данных: синхронная или асинхронная (как в RAID-массивах или распределённых БД)
- Кластеризация: создание группы серверов, где при отказе одного его обязанности берут на себя другие (горячее резервирование)
- Кворум: принятие решений на основе согласия большинства узлов в кластере для обеспечения консистентности данных
@Simple_Reliability
👍4
Лучше поздно…
13 лет занимаюсь надёжностью и производительностью высоко-нагруженных систем, но ни разу не был на самой крупной конференции этому посвященной.
В ноябре исправлюсь…
Приходите. 6-го ноября поговорим о сложностях связанных с внедрением GenAI в Enterprise среду, на примере любимого работодателя.
@Simple_Reliability
13 лет занимаюсь надёжностью и производительностью высоко-нагруженных систем, но ни разу не был на самой крупной конференции этому посвященной.
В ноябре исправлюсь…
Приходите. 6-го ноября поговорим о сложностях связанных с внедрением GenAI в Enterprise среду, на примере любимого работодателя.
@Simple_Reliability
1🔥9❤2
24 сентября, Gartner опубликовал результаты исследований о будущем SRE инженеров.
Как всегда кстати, ровно на эту тему планируются дискуссии на TechCommunityFest в Новосибирске, через неделю.
Ключевые выводы, прозрачны, но подкреплены результатами опросов, значит мы тоже движемся в правильном направлении:
1. Сложность и требования к надежности в ИТ возросли, SRE-инженерам-людям становится все труднее
2. Эйфория связанная с GenAi утихает, экспериментов по прежнему много, но внедрения происходят только после тщательной оценки рисков
3. Текущие AI решения для OPS/SRE направлены на устранение влияния инцидентов, а не на устранение корневых проблем
Немного статистики:
- С 5% в 2024 г. до 60% в 2028 г. вырастет доля ИТ инструментов с AI-агентами;
- до 90% организаций, в 2029 г. столкнуться с простоями вызванными ИИ;
Что Gartner предлагает делать с этими данными рассмотрим чуть позже…
Оригинал:
AI, Autonomy, and Architects: The Future of Site Reliability Engineering
24 September 2025, Gartner
#Надёжность_ИИ
@Simple_Reliability
Как всегда кстати, ровно на эту тему планируются дискуссии на TechCommunityFest в Новосибирске, через неделю.
Ключевые выводы, прозрачны, но подкреплены результатами опросов, значит мы тоже движемся в правильном направлении:
1. Сложность и требования к надежности в ИТ возросли, SRE-инженерам-людям становится все труднее
2. Эйфория связанная с GenAi утихает, экспериментов по прежнему много, но внедрения происходят только после тщательной оценки рисков
3. Текущие AI решения для OPS/SRE направлены на устранение влияния инцидентов, а не на устранение корневых проблем
Немного статистики:
- С 5% в 2024 г. до 60% в 2028 г. вырастет доля ИТ инструментов с AI-агентами;
- до 90% организаций, в 2029 г. столкнуться с простоями вызванными ИИ;
Что Gartner предлагает делать с этими данными рассмотрим чуть позже…
Оригинал:
AI, Autonomy, and Architects: The Future of Site Reliability Engineering
24 September 2025, Gartner
#Надёжность_ИИ
@Simple_Reliability
🤔2🤷♂1
В продолжение темы про будущее SRE. Кроме общих слов и очевидных выводов, в отчете Gartner есть тезисы, которые достойны, как минимум того, чтобы их прочесть:
1. AI инструменты направленные на обнаружение и управление параметрами SLO будут быстро развиваться, т.е. заключение контрактов мы скоро делегируем ИИ
2. AI-агенты будут помогать дежурным сменам: отличать ложные срабатывания систем оповещения от настоящих
3. Используя исторические данные ИИ сможет прогнозировать нагрузку на системы (исторические данные по нагрузке за последние 5 лет: пандемия, СВО, импортозамещение …)
4. Самовосстанавливающиеся системы (правда для начала придется сделать их просто восстанавливающимися)
5. AI-агенты смогут(должны смочь, даже обязаны) устанавливать корневые причины инцидентов на основе данных мониторинга и логировния
Что же останется людям(SRE/OPS людям)?
1. Внедрение «культуры надежности» на всех этапах жизненного цикла систем
2. Выявление и проверка источников данных для AI-агентов
3. Ответственность за производительность и обучение AI-агентов
4. Формирование стратеги надёжности для всей организации
5. Коммуникация ценности инициатив в области надежности для заинтересованных сторон
Может быть не очевидно, но все пункты сводятся к тому, что существующие роли SRE/OPS трансформируются в новую - архитектора надёжности
Это мнение аналитиков Gartner… посмотрим
Оригинал:
AI, Autonomy, and Architects: The Future of Site Reliability Engineering
24 September 2025, Gartner
#Надёжность_ИИ
@Simple_Reliability
1. AI инструменты направленные на обнаружение и управление параметрами SLO будут быстро развиваться, т.е. заключение контрактов мы скоро делегируем ИИ
2. AI-агенты будут помогать дежурным сменам: отличать ложные срабатывания систем оповещения от настоящих
3. Используя исторические данные ИИ сможет прогнозировать нагрузку на системы (исторические данные по нагрузке за последние 5 лет: пандемия, СВО, импортозамещение …)
4. Самовосстанавливающиеся системы (правда для начала придется сделать их просто восстанавливающимися)
5. AI-агенты смогут(должны смочь, даже обязаны) устанавливать корневые причины инцидентов на основе данных мониторинга и логировния
Что же останется людям(SRE/OPS людям)?
1. Внедрение «культуры надежности» на всех этапах жизненного цикла систем
2. Выявление и проверка источников данных для AI-агентов
3. Ответственность за производительность и обучение AI-агентов
4. Формирование стратеги надёжности для всей организации
5. Коммуникация ценности инициатив в области надежности для заинтересованных сторон
Может быть не очевидно, но все пункты сводятся к тому, что существующие роли SRE/OPS трансформируются в новую - архитектора надёжности
Это мнение аналитиков Gartner… посмотрим
Оригинал:
AI, Autonomy, and Architects: The Future of Site Reliability Engineering
24 September 2025, Gartner
#Надёжность_ИИ
@Simple_Reliability
👍1
Все яйца в одной корзине (второй раз за месяц)
У крупнейшего облачного провайдера Amazon Web Services (AWS) 21 октября 2025 года произошёл инцидент, который привел к каскадным сбоям по всему миру. Первые сообщения об ошибках начали поступать около семи утра (GMT), а полное восстановление работы заняло около 15 часов.
Согласно данным DownDetector, сбой затронул более 1000 компаний (WhatsApp, Roblox, Amazon, Coinbase…) по всему миру, было зафиксировано около 6,5 миллионов отчетов о проблемах.
Инцидент стал результатом каскадного отказа, вызванного проблемой в «единой точке отказа» сетевой инфраструктуры.
1. Проблема возникла после технического обновления…, что привело к нарушению работы внутренней подсистемы мониторинга сетевых балансировщиков нагрузки.
2. Проблема в подсистеме мониторинга напрямую затронула Domain Name System (DNS).
3. А далее каскадный эффект… по всем связанным сервисам.
DeepSeek описал корневую причину как "технологическая монокультура". Это когда значительная часть мировой цифровой инфраструктуры зависит от одного провайдера или сетевого региона.
Официальный отчет о инциденте от AWS, вероятно, будет опубликован через несколько месяцев. Однако, уже сейчас можно сделать выводы:
1. Критически важные сервисы необходимо развертывать в нескольких Зонах Доступности (Availability Zones) внутри одного сетевого региона, а для высочайшего уровня отказоустойчивости – в нескольких регионах.
2. Для наиболее важных систем, стоит рассмотреть использование нескольких облачных провайдеров
3. Активное использование механизмов автоматического восстановления и балансировки нагрузки.
4. Регулярное проведение аварийных учений по отработке подобного рода отказов…
В общем, выше описан еще один аргумент для защиты бюджета на развитие надёжной сетевой инфраструктуры…
#ВПИ
@Simple_Reliability
У крупнейшего облачного провайдера Amazon Web Services (AWS) 21 октября 2025 года произошёл инцидент, который привел к каскадным сбоям по всему миру. Первые сообщения об ошибках начали поступать около семи утра (GMT), а полное восстановление работы заняло около 15 часов.
Согласно данным DownDetector, сбой затронул более 1000 компаний (WhatsApp, Roblox, Amazon, Coinbase…) по всему миру, было зафиксировано около 6,5 миллионов отчетов о проблемах.
Инцидент стал результатом каскадного отказа, вызванного проблемой в «единой точке отказа» сетевой инфраструктуры.
1. Проблема возникла после технического обновления…, что привело к нарушению работы внутренней подсистемы мониторинга сетевых балансировщиков нагрузки.
2. Проблема в подсистеме мониторинга напрямую затронула Domain Name System (DNS).
DNS функционирует как "телефонная книга" интернета, преобразуя понятные человеку доменные имена (например, `www.example.com`) в IP-адреса серверов. Из-за сбоя приложения не могли определить правильный IP-адрес для обращения к API. Без доступа к этой базе данных, критически важной для хранения пользовательской информации, зависимые сервисы переставали функционировать.
3. А далее каскадный эффект… по всем связанным сервисам.
DeepSeek описал корневую причину как "технологическая монокультура". Это когда значительная часть мировой цифровой инфраструктуры зависит от одного провайдера или сетевого региона.
Официальный отчет о инциденте от AWS, вероятно, будет опубликован через несколько месяцев. Однако, уже сейчас можно сделать выводы:
1. Критически важные сервисы необходимо развертывать в нескольких Зонах Доступности (Availability Zones) внутри одного сетевого региона, а для высочайшего уровня отказоустойчивости – в нескольких регионах.
2. Для наиболее важных систем, стоит рассмотреть использование нескольких облачных провайдеров
3. Активное использование механизмов автоматического восстановления и балансировки нагрузки.
4. Регулярное проведение аварийных учений по отработке подобного рода отказов…
В общем, выше описан еще один аргумент для защиты бюджета на развитие надёжной сетевой инфраструктуры…
#ВПИ
@Simple_Reliability
😱4❤2
Компания Thoughtworks опубликовала отчет посвященный трендам, влияющих на развитие бизнеса. Это долгосрочный взгляд на эволюцию технологического ландшафта.
Всего 90 трендов, и, если вас беспокоит надёжность, то, кажется, что уже сейчас стоит обратить минимум на два из них (позже может быть уже поздно…)
1. Data Mesh
Централизованные хранилища данных, неизбежно, становятся единой точкой отказа
Плюс для надежности: Отказ в одном домене не обязательно приведет к коллапсу всей системы данных. Повышается устойчивость и скорость восстановления.
2. Мелкие языковые модели (Small language models)
Плюс для надежности: Возможность запуска на периферийных устройствах (Edge computing). Это снижает зависимость от центрального ЦОДа и сетевого соединения, повышая отказоустойчивость и снижая задержки.
Использовать SLM разумно для критичных к задержке или работающих в офлайн-режиме сервисов…
Оригинал: Looking Glass. Bringing tech-lead business changes into focus (Toughtworks; 2025)
#Надёжности_ИИ
@Simple_Reliability
Всего 90 трендов, и, если вас беспокоит надёжность, то, кажется, что уже сейчас стоит обратить минимум на два из них (позже может быть уже поздно…)
1. Data Mesh
Децентрализованная, доменно-ориентированная архитектуру данных. Каждый домен владеет своими "данными как продуктом"
Централизованные хранилища данных, неизбежно, становятся единой точкой отказа
Плюс для надежности: Отказ в одном домене не обязательно приведет к коллапсу всей системы данных. Повышается устойчивость и скорость восстановления.
2. Мелкие языковые модели (Small language models)
Плюс для надежности: Возможность запуска на периферийных устройствах (Edge computing). Это снижает зависимость от центрального ЦОДа и сетевого соединения, повышая отказоустойчивость и снижая задержки.
Использовать SLM разумно для критичных к задержке или работающих в офлайн-режиме сервисов…
Оригинал: Looking Glass. Bringing tech-lead business changes into focus (Toughtworks; 2025)
#Надёжности_ИИ
@Simple_Reliability
На следующей неделе, в рамках Tech Community Fest, запланировали провести дебаты. Тема: Заменят ли ИИ-агенты специалистов службы сопровождения?
Я считаю, что все именно к этому и идет. Причем семимильными шагами…
Вот три довода/вопроса
1. ИИ-агенты работают 24/7, не устают и не подвержены эмоциональному выгоранию. Как человеческий фактор может считаться преимуществом в условиях?
2. Традиционный тикет поддержки стоит компании около $26, в то время как тикет, решенный ИИ-агентом, обходится примерно в $1 . Как вы можете оправдать такое 26-кратное увеличение операционных расходов?
3. ИИ-агенты могут постоянно обучаться на данных о предыдущих обращениях, повышая свою точность. Как обычный сотрудник, чье обучение требует времени и ресурсов, может конкурировать со скоростью и масштабом такого обучения?
#Надёжность_ИИ
@Simple_Reliability
Я считаю, что все именно к этому и идет. Причем семимильными шагами…
Вот три довода/вопроса
1. ИИ-агенты работают 24/7, не устают и не подвержены эмоциональному выгоранию. Как человеческий фактор может считаться преимуществом в условиях?
2. Традиционный тикет поддержки стоит компании около $26, в то время как тикет, решенный ИИ-агентом, обходится примерно в $1 . Как вы можете оправдать такое 26-кратное увеличение операционных расходов?
3. ИИ-агенты могут постоянно обучаться на данных о предыдущих обращениях, повышая свою точность. Как обычный сотрудник, чье обучение требует времени и ресурсов, может конкурировать со скоростью и масштабом такого обучения?
#Надёжность_ИИ
@Simple_Reliability
👍2
У недавнего сбоя Amazon есть любопытный связанный инцидент:
Умные кровати Eight Sleep буквально жарили своих владельцев...
Дело в том что система управления матрасами работают только через облако, то самое, которое стало недоступно. Устройства вообще не имеют автономной системы управления…
Гендиректор компании Маттео Франческетти признал ошибку и извинился перед пострадавшими. Каждый такой матрас стоит по $2000.
А вы говорите, автономный мир…
P.S. кстати, стояночный тормоз, в автомобилях уже давным-давно не механический…
@Simple_Reliability
Умные кровати Eight Sleep буквально жарили своих владельцев...
Дело в том что система управления матрасами работают только через облако, то самое, которое стало недоступно. Устройства вообще не имеют автономной системы управления…
Гендиректор компании Маттео Франческетти признал ошибку и извинился перед пострадавшими. Каждый такой матрас стоит по $2000.
А вы говорите, автономный мир…
P.S. кстати, стояночный тормоз, в автомобилях уже давным-давно не механический…
@Simple_Reliability
🔥3
Forwarded from HighLoad++
Истории GenAI трансформации — специальная секция в программе HighLoad++ 2025, подготовленная при поддержке Домклик ⚡
В этом посте рассказываем вам о первых двух докладах из секции, в которых спикеры поделятся реальными кейсами: запуск AI-агентов и внедрение AI-агентов в продакшн критичных банковских систем.
1️⃣ AI-агенты для рынка недвижимости: от чат-бота до мультиагентной системы. Алина Баймашева (Домклик)
Создание AI-агентов — это не только про RAG и цепочки, но и про безопасность, правильный выбор моделей и преодоление скрытых ограничений. Алина покажет, как построить платформу для агентов и когда опенсорс оказывается лучше проприетарных решений.
2️⃣ Как сохранить высокую надежность при GenAI-трансформации. Вячеслав Кудряшов (Сбер)
Из доклада узнаете, как в Сбере внедряют AI-агентов в критичные банковские системы без падений прода. Увидите 12 боевых паттернов надежности: от предотвращения зацикливаний до автоматических откатов. Готовые решения для вашего GenAI. Не пропустите опыт, который сэкономит вам месяцы!
Встречаемся уже на следующей неделе на HighLoad++ 2025 в Москве ⚡
✅ Полная программа конференции и билеты на сайте
В этом посте рассказываем вам о первых двух докладах из секции, в которых спикеры поделятся реальными кейсами: запуск AI-агентов и внедрение AI-агентов в продакшн критичных банковских систем.
1️⃣ AI-агенты для рынка недвижимости: от чат-бота до мультиагентной системы. Алина Баймашева (Домклик)
Создание AI-агентов — это не только про RAG и цепочки, но и про безопасность, правильный выбор моделей и преодоление скрытых ограничений. Алина покажет, как построить платформу для агентов и когда опенсорс оказывается лучше проприетарных решений.
2️⃣ Как сохранить высокую надежность при GenAI-трансформации. Вячеслав Кудряшов (Сбер)
Из доклада узнаете, как в Сбере внедряют AI-агентов в критичные банковские системы без падений прода. Увидите 12 боевых паттернов надежности: от предотвращения зацикливаний до автоматических откатов. Готовые решения для вашего GenAI. Не пропустите опыт, который сэкономит вам месяцы!
Встречаемся уже на следующей неделе на HighLoad++ 2025 в Москве ⚡
✅ Полная программа конференции и билеты на сайте
👍6❤2
52/48
Такое распределение у нас получилось по итогу дебатов «Заменит ли ИИ службу сопровождения»
С небольшим перевесом победил ответ: «нет, не заменят».
Вот что интересно, среди голосовавших большинство - администраторы АС, т.е. как раз те, кого заменит ИИ.
Всего год назад, подобный вопрос в адрес любого специалиста в ИТ вызвал бы искреннюю улыбку… из всех приемников страны звучало «у нас дефицит ИТшников»…
И вот, неожиданно быстро, наступила стадия «принятия»
@Simple_Reliability
Такое распределение у нас получилось по итогу дебатов «Заменит ли ИИ службу сопровождения»
С небольшим перевесом победил ответ: «нет, не заменят».
Вот что интересно, среди голосовавших большинство - администраторы АС, т.е. как раз те, кого заменит ИИ.
Всего год назад, подобный вопрос в адрес любого специалиста в ИТ вызвал бы искреннюю улыбку… из всех приемников страны звучало «у нас дефицит ИТшников»…
И вот, неожиданно быстро, наступила стадия «принятия»
@Simple_Reliability
😱2
Популяризация ИИ делает свое дело. Никто не хочет «отстать от поезда», все, так или иначе, начинают использовать ИИ для рабочих задач, а иначе окажешься не эффективным и тебя заменят эффективные…
Но вот вопрос: готовы ли организации к тому, что их сотрудники станут более «эффективными» за счет ИИ (неподконтрольного им ИИ)
Точно не все.
1. Судя по опросу Gartner, 2025, 49% сотрудников используют сторонние сервисы, которые
отправляют всю внутреннюю информацию в «неподконтрольные облака»
2. 32% сотрудников скрывают факт такого использования, чтобы избежать процессов внутренних согласований с ИБ, тем самым усугубляя ситуацию
3. 15% сотрудников вообще используют личные BYOD (bring your own device) для решения рабочих задач. Как контролировать использование таких устройств пока вообще не очень понятно…
Что с этим делать?
Видимо подстраиваться под реалии:
1. Создавать внутренние службы за контролем использования ИИ, должен же кто-то централизованно нести за все это ответственность…
2. В идеале, доводить внутренние ИИ решение до состояния, когда у сотрудников не будет даже мыслей пользоваться чем-то другим
3. Внедрять новые механизмы и методики, например:
- AI Usage Control для обнаружения и блокировки нежелательного ИИ.
- AI TRiSM (Trust, Risk, Security) решения для тотального контроля над всеми моделями ИИ в сети.
4. И, самое главное, обучайте сотрудников новым рискамреалиям
#Надёжность_ИИ
@Simple_Reliability
Но вот вопрос: готовы ли организации к тому, что их сотрудники станут более «эффективными» за счет ИИ (неподконтрольного им ИИ)
Точно не все.
1. Судя по опросу Gartner, 2025, 49% сотрудников используют сторонние сервисы, которые
отправляют всю внутреннюю информацию в «неподконтрольные облака»
2. 32% сотрудников скрывают факт такого использования, чтобы избежать процессов внутренних согласований с ИБ, тем самым усугубляя ситуацию
3. 15% сотрудников вообще используют личные BYOD (bring your own device) для решения рабочих задач. Как контролировать использование таких устройств пока вообще не очень понятно…
Что с этим делать?
Видимо подстраиваться под реалии:
1. Создавать внутренние службы за контролем использования ИИ, должен же кто-то централизованно нести за все это ответственность…
2. В идеале, доводить внутренние ИИ решение до состояния, когда у сотрудников не будет даже мыслей пользоваться чем-то другим
3. Внедрять новые механизмы и методики, например:
- AI Usage Control для обнаружения и блокировки нежелательного ИИ.
- AI TRiSM (Trust, Risk, Security) решения для тотального контроля над всеми моделями ИИ в сети.
4. И, самое главное, обучайте сотрудников новым рискам
#Надёжность_ИИ
@Simple_Reliability
👍5