24 сентября, Gartner опубликовал результаты исследований о будущем SRE инженеров.
Как всегда кстати, ровно на эту тему планируются дискуссии на TechCommunityFest в Новосибирске, через неделю.
Ключевые выводы, прозрачны, но подкреплены результатами опросов, значит мы тоже движемся в правильном направлении:
1. Сложность и требования к надежности в ИТ возросли, SRE-инженерам-людям становится все труднее
2. Эйфория связанная с GenAi утихает, экспериментов по прежнему много, но внедрения происходят только после тщательной оценки рисков
3. Текущие AI решения для OPS/SRE направлены на устранение влияния инцидентов, а не на устранение корневых проблем
Немного статистики:
- С 5% в 2024 г. до 60% в 2028 г. вырастет доля ИТ инструментов с AI-агентами;
- до 90% организаций, в 2029 г. столкнуться с простоями вызванными ИИ;
Что Gartner предлагает делать с этими данными рассмотрим чуть позже…
Оригинал:
AI, Autonomy, and Architects: The Future of Site Reliability Engineering
24 September 2025, Gartner
#Надёжность_ИИ
@Simple_Reliability
Как всегда кстати, ровно на эту тему планируются дискуссии на TechCommunityFest в Новосибирске, через неделю.
Ключевые выводы, прозрачны, но подкреплены результатами опросов, значит мы тоже движемся в правильном направлении:
1. Сложность и требования к надежности в ИТ возросли, SRE-инженерам-людям становится все труднее
2. Эйфория связанная с GenAi утихает, экспериментов по прежнему много, но внедрения происходят только после тщательной оценки рисков
3. Текущие AI решения для OPS/SRE направлены на устранение влияния инцидентов, а не на устранение корневых проблем
Немного статистики:
- С 5% в 2024 г. до 60% в 2028 г. вырастет доля ИТ инструментов с AI-агентами;
- до 90% организаций, в 2029 г. столкнуться с простоями вызванными ИИ;
Что Gartner предлагает делать с этими данными рассмотрим чуть позже…
Оригинал:
AI, Autonomy, and Architects: The Future of Site Reliability Engineering
24 September 2025, Gartner
#Надёжность_ИИ
@Simple_Reliability
🤔2🤷♂1
В продолжение темы про будущее SRE. Кроме общих слов и очевидных выводов, в отчете Gartner есть тезисы, которые достойны, как минимум того, чтобы их прочесть:
1. AI инструменты направленные на обнаружение и управление параметрами SLO будут быстро развиваться, т.е. заключение контрактов мы скоро делегируем ИИ
2. AI-агенты будут помогать дежурным сменам: отличать ложные срабатывания систем оповещения от настоящих
3. Используя исторические данные ИИ сможет прогнозировать нагрузку на системы (исторические данные по нагрузке за последние 5 лет: пандемия, СВО, импортозамещение …)
4. Самовосстанавливающиеся системы (правда для начала придется сделать их просто восстанавливающимися)
5. AI-агенты смогут(должны смочь, даже обязаны) устанавливать корневые причины инцидентов на основе данных мониторинга и логировния
Что же останется людям(SRE/OPS людям)?
1. Внедрение «культуры надежности» на всех этапах жизненного цикла систем
2. Выявление и проверка источников данных для AI-агентов
3. Ответственность за производительность и обучение AI-агентов
4. Формирование стратеги надёжности для всей организации
5. Коммуникация ценности инициатив в области надежности для заинтересованных сторон
Может быть не очевидно, но все пункты сводятся к тому, что существующие роли SRE/OPS трансформируются в новую - архитектора надёжности
Это мнение аналитиков Gartner… посмотрим
Оригинал:
AI, Autonomy, and Architects: The Future of Site Reliability Engineering
24 September 2025, Gartner
#Надёжность_ИИ
@Simple_Reliability
1. AI инструменты направленные на обнаружение и управление параметрами SLO будут быстро развиваться, т.е. заключение контрактов мы скоро делегируем ИИ
2. AI-агенты будут помогать дежурным сменам: отличать ложные срабатывания систем оповещения от настоящих
3. Используя исторические данные ИИ сможет прогнозировать нагрузку на системы (исторические данные по нагрузке за последние 5 лет: пандемия, СВО, импортозамещение …)
4. Самовосстанавливающиеся системы (правда для начала придется сделать их просто восстанавливающимися)
5. AI-агенты смогут(должны смочь, даже обязаны) устанавливать корневые причины инцидентов на основе данных мониторинга и логировния
Что же останется людям(SRE/OPS людям)?
1. Внедрение «культуры надежности» на всех этапах жизненного цикла систем
2. Выявление и проверка источников данных для AI-агентов
3. Ответственность за производительность и обучение AI-агентов
4. Формирование стратеги надёжности для всей организации
5. Коммуникация ценности инициатив в области надежности для заинтересованных сторон
Может быть не очевидно, но все пункты сводятся к тому, что существующие роли SRE/OPS трансформируются в новую - архитектора надёжности
Это мнение аналитиков Gartner… посмотрим
Оригинал:
AI, Autonomy, and Architects: The Future of Site Reliability Engineering
24 September 2025, Gartner
#Надёжность_ИИ
@Simple_Reliability
👍1
Все яйца в одной корзине (второй раз за месяц)
У крупнейшего облачного провайдера Amazon Web Services (AWS) 21 октября 2025 года произошёл инцидент, который привел к каскадным сбоям по всему миру. Первые сообщения об ошибках начали поступать около семи утра (GMT), а полное восстановление работы заняло около 15 часов.
Согласно данным DownDetector, сбой затронул более 1000 компаний (WhatsApp, Roblox, Amazon, Coinbase…) по всему миру, было зафиксировано около 6,5 миллионов отчетов о проблемах.
Инцидент стал результатом каскадного отказа, вызванного проблемой в «единой точке отказа» сетевой инфраструктуры.
1. Проблема возникла после технического обновления…, что привело к нарушению работы внутренней подсистемы мониторинга сетевых балансировщиков нагрузки.
2. Проблема в подсистеме мониторинга напрямую затронула Domain Name System (DNS).
3. А далее каскадный эффект… по всем связанным сервисам.
DeepSeek описал корневую причину как "технологическая монокультура". Это когда значительная часть мировой цифровой инфраструктуры зависит от одного провайдера или сетевого региона.
Официальный отчет о инциденте от AWS, вероятно, будет опубликован через несколько месяцев. Однако, уже сейчас можно сделать выводы:
1. Критически важные сервисы необходимо развертывать в нескольких Зонах Доступности (Availability Zones) внутри одного сетевого региона, а для высочайшего уровня отказоустойчивости – в нескольких регионах.
2. Для наиболее важных систем, стоит рассмотреть использование нескольких облачных провайдеров
3. Активное использование механизмов автоматического восстановления и балансировки нагрузки.
4. Регулярное проведение аварийных учений по отработке подобного рода отказов…
В общем, выше описан еще один аргумент для защиты бюджета на развитие надёжной сетевой инфраструктуры…
#ВПИ
@Simple_Reliability
У крупнейшего облачного провайдера Amazon Web Services (AWS) 21 октября 2025 года произошёл инцидент, который привел к каскадным сбоям по всему миру. Первые сообщения об ошибках начали поступать около семи утра (GMT), а полное восстановление работы заняло около 15 часов.
Согласно данным DownDetector, сбой затронул более 1000 компаний (WhatsApp, Roblox, Amazon, Coinbase…) по всему миру, было зафиксировано около 6,5 миллионов отчетов о проблемах.
Инцидент стал результатом каскадного отказа, вызванного проблемой в «единой точке отказа» сетевой инфраструктуры.
1. Проблема возникла после технического обновления…, что привело к нарушению работы внутренней подсистемы мониторинга сетевых балансировщиков нагрузки.
2. Проблема в подсистеме мониторинга напрямую затронула Domain Name System (DNS).
DNS функционирует как "телефонная книга" интернета, преобразуя понятные человеку доменные имена (например, `www.example.com`) в IP-адреса серверов. Из-за сбоя приложения не могли определить правильный IP-адрес для обращения к API. Без доступа к этой базе данных, критически важной для хранения пользовательской информации, зависимые сервисы переставали функционировать.
3. А далее каскадный эффект… по всем связанным сервисам.
DeepSeek описал корневую причину как "технологическая монокультура". Это когда значительная часть мировой цифровой инфраструктуры зависит от одного провайдера или сетевого региона.
Официальный отчет о инциденте от AWS, вероятно, будет опубликован через несколько месяцев. Однако, уже сейчас можно сделать выводы:
1. Критически важные сервисы необходимо развертывать в нескольких Зонах Доступности (Availability Zones) внутри одного сетевого региона, а для высочайшего уровня отказоустойчивости – в нескольких регионах.
2. Для наиболее важных систем, стоит рассмотреть использование нескольких облачных провайдеров
3. Активное использование механизмов автоматического восстановления и балансировки нагрузки.
4. Регулярное проведение аварийных учений по отработке подобного рода отказов…
В общем, выше описан еще один аргумент для защиты бюджета на развитие надёжной сетевой инфраструктуры…
#ВПИ
@Simple_Reliability
😱4❤2
Компания Thoughtworks опубликовала отчет посвященный трендам, влияющих на развитие бизнеса. Это долгосрочный взгляд на эволюцию технологического ландшафта.
Всего 90 трендов, и, если вас беспокоит надёжность, то, кажется, что уже сейчас стоит обратить минимум на два из них (позже может быть уже поздно…)
1. Data Mesh
Централизованные хранилища данных, неизбежно, становятся единой точкой отказа
Плюс для надежности: Отказ в одном домене не обязательно приведет к коллапсу всей системы данных. Повышается устойчивость и скорость восстановления.
2. Мелкие языковые модели (Small language models)
Плюс для надежности: Возможность запуска на периферийных устройствах (Edge computing). Это снижает зависимость от центрального ЦОДа и сетевого соединения, повышая отказоустойчивость и снижая задержки.
Использовать SLM разумно для критичных к задержке или работающих в офлайн-режиме сервисов…
Оригинал: Looking Glass. Bringing tech-lead business changes into focus (Toughtworks; 2025)
#Надёжности_ИИ
@Simple_Reliability
Всего 90 трендов, и, если вас беспокоит надёжность, то, кажется, что уже сейчас стоит обратить минимум на два из них (позже может быть уже поздно…)
1. Data Mesh
Децентрализованная, доменно-ориентированная архитектуру данных. Каждый домен владеет своими "данными как продуктом"
Централизованные хранилища данных, неизбежно, становятся единой точкой отказа
Плюс для надежности: Отказ в одном домене не обязательно приведет к коллапсу всей системы данных. Повышается устойчивость и скорость восстановления.
2. Мелкие языковые модели (Small language models)
Плюс для надежности: Возможность запуска на периферийных устройствах (Edge computing). Это снижает зависимость от центрального ЦОДа и сетевого соединения, повышая отказоустойчивость и снижая задержки.
Использовать SLM разумно для критичных к задержке или работающих в офлайн-режиме сервисов…
Оригинал: Looking Glass. Bringing tech-lead business changes into focus (Toughtworks; 2025)
#Надёжности_ИИ
@Simple_Reliability
На следующей неделе, в рамках Tech Community Fest, запланировали провести дебаты. Тема: Заменят ли ИИ-агенты специалистов службы сопровождения?
Я считаю, что все именно к этому и идет. Причем семимильными шагами…
Вот три довода/вопроса
1. ИИ-агенты работают 24/7, не устают и не подвержены эмоциональному выгоранию. Как человеческий фактор может считаться преимуществом в условиях?
2. Традиционный тикет поддержки стоит компании около $26, в то время как тикет, решенный ИИ-агентом, обходится примерно в $1 . Как вы можете оправдать такое 26-кратное увеличение операционных расходов?
3. ИИ-агенты могут постоянно обучаться на данных о предыдущих обращениях, повышая свою точность. Как обычный сотрудник, чье обучение требует времени и ресурсов, может конкурировать со скоростью и масштабом такого обучения?
#Надёжность_ИИ
@Simple_Reliability
Я считаю, что все именно к этому и идет. Причем семимильными шагами…
Вот три довода/вопроса
1. ИИ-агенты работают 24/7, не устают и не подвержены эмоциональному выгоранию. Как человеческий фактор может считаться преимуществом в условиях?
2. Традиционный тикет поддержки стоит компании около $26, в то время как тикет, решенный ИИ-агентом, обходится примерно в $1 . Как вы можете оправдать такое 26-кратное увеличение операционных расходов?
3. ИИ-агенты могут постоянно обучаться на данных о предыдущих обращениях, повышая свою точность. Как обычный сотрудник, чье обучение требует времени и ресурсов, может конкурировать со скоростью и масштабом такого обучения?
#Надёжность_ИИ
@Simple_Reliability
👍2
У недавнего сбоя Amazon есть любопытный связанный инцидент:
Умные кровати Eight Sleep буквально жарили своих владельцев...
Дело в том что система управления матрасами работают только через облако, то самое, которое стало недоступно. Устройства вообще не имеют автономной системы управления…
Гендиректор компании Маттео Франческетти признал ошибку и извинился перед пострадавшими. Каждый такой матрас стоит по $2000.
А вы говорите, автономный мир…
P.S. кстати, стояночный тормоз, в автомобилях уже давным-давно не механический…
@Simple_Reliability
Умные кровати Eight Sleep буквально жарили своих владельцев...
Дело в том что система управления матрасами работают только через облако, то самое, которое стало недоступно. Устройства вообще не имеют автономной системы управления…
Гендиректор компании Маттео Франческетти признал ошибку и извинился перед пострадавшими. Каждый такой матрас стоит по $2000.
А вы говорите, автономный мир…
P.S. кстати, стояночный тормоз, в автомобилях уже давным-давно не механический…
@Simple_Reliability
🔥3
Forwarded from HighLoad++
Истории GenAI трансформации — специальная секция в программе HighLoad++ 2025, подготовленная при поддержке Домклик ⚡
В этом посте рассказываем вам о первых двух докладах из секции, в которых спикеры поделятся реальными кейсами: запуск AI-агентов и внедрение AI-агентов в продакшн критичных банковских систем.
1️⃣ AI-агенты для рынка недвижимости: от чат-бота до мультиагентной системы. Алина Баймашева (Домклик)
Создание AI-агентов — это не только про RAG и цепочки, но и про безопасность, правильный выбор моделей и преодоление скрытых ограничений. Алина покажет, как построить платформу для агентов и когда опенсорс оказывается лучше проприетарных решений.
2️⃣ Как сохранить высокую надежность при GenAI-трансформации. Вячеслав Кудряшов (Сбер)
Из доклада узнаете, как в Сбере внедряют AI-агентов в критичные банковские системы без падений прода. Увидите 12 боевых паттернов надежности: от предотвращения зацикливаний до автоматических откатов. Готовые решения для вашего GenAI. Не пропустите опыт, который сэкономит вам месяцы!
Встречаемся уже на следующей неделе на HighLoad++ 2025 в Москве ⚡
✅ Полная программа конференции и билеты на сайте
В этом посте рассказываем вам о первых двух докладах из секции, в которых спикеры поделятся реальными кейсами: запуск AI-агентов и внедрение AI-агентов в продакшн критичных банковских систем.
1️⃣ AI-агенты для рынка недвижимости: от чат-бота до мультиагентной системы. Алина Баймашева (Домклик)
Создание AI-агентов — это не только про RAG и цепочки, но и про безопасность, правильный выбор моделей и преодоление скрытых ограничений. Алина покажет, как построить платформу для агентов и когда опенсорс оказывается лучше проприетарных решений.
2️⃣ Как сохранить высокую надежность при GenAI-трансформации. Вячеслав Кудряшов (Сбер)
Из доклада узнаете, как в Сбере внедряют AI-агентов в критичные банковские системы без падений прода. Увидите 12 боевых паттернов надежности: от предотвращения зацикливаний до автоматических откатов. Готовые решения для вашего GenAI. Не пропустите опыт, который сэкономит вам месяцы!
Встречаемся уже на следующей неделе на HighLoad++ 2025 в Москве ⚡
✅ Полная программа конференции и билеты на сайте
👍6❤2
52/48
Такое распределение у нас получилось по итогу дебатов «Заменит ли ИИ службу сопровождения»
С небольшим перевесом победил ответ: «нет, не заменят».
Вот что интересно, среди голосовавших большинство - администраторы АС, т.е. как раз те, кого заменит ИИ.
Всего год назад, подобный вопрос в адрес любого специалиста в ИТ вызвал бы искреннюю улыбку… из всех приемников страны звучало «у нас дефицит ИТшников»…
И вот, неожиданно быстро, наступила стадия «принятия»
@Simple_Reliability
Такое распределение у нас получилось по итогу дебатов «Заменит ли ИИ службу сопровождения»
С небольшим перевесом победил ответ: «нет, не заменят».
Вот что интересно, среди голосовавших большинство - администраторы АС, т.е. как раз те, кого заменит ИИ.
Всего год назад, подобный вопрос в адрес любого специалиста в ИТ вызвал бы искреннюю улыбку… из всех приемников страны звучало «у нас дефицит ИТшников»…
И вот, неожиданно быстро, наступила стадия «принятия»
@Simple_Reliability
😱2
Популяризация ИИ делает свое дело. Никто не хочет «отстать от поезда», все, так или иначе, начинают использовать ИИ для рабочих задач, а иначе окажешься не эффективным и тебя заменят эффективные…
Но вот вопрос: готовы ли организации к тому, что их сотрудники станут более «эффективными» за счет ИИ (неподконтрольного им ИИ)
Точно не все.
1. Судя по опросу Gartner, 2025, 49% сотрудников используют сторонние сервисы, которые
отправляют всю внутреннюю информацию в «неподконтрольные облака»
2. 32% сотрудников скрывают факт такого использования, чтобы избежать процессов внутренних согласований с ИБ, тем самым усугубляя ситуацию
3. 15% сотрудников вообще используют личные BYOD (bring your own device) для решения рабочих задач. Как контролировать использование таких устройств пока вообще не очень понятно…
Что с этим делать?
Видимо подстраиваться под реалии:
1. Создавать внутренние службы за контролем использования ИИ, должен же кто-то централизованно нести за все это ответственность…
2. В идеале, доводить внутренние ИИ решение до состояния, когда у сотрудников не будет даже мыслей пользоваться чем-то другим
3. Внедрять новые механизмы и методики, например:
- AI Usage Control для обнаружения и блокировки нежелательного ИИ.
- AI TRiSM (Trust, Risk, Security) решения для тотального контроля над всеми моделями ИИ в сети.
4. И, самое главное, обучайте сотрудников новым рискамреалиям
#Надёжность_ИИ
@Simple_Reliability
Но вот вопрос: готовы ли организации к тому, что их сотрудники станут более «эффективными» за счет ИИ (неподконтрольного им ИИ)
Точно не все.
1. Судя по опросу Gartner, 2025, 49% сотрудников используют сторонние сервисы, которые
отправляют всю внутреннюю информацию в «неподконтрольные облака»
2. 32% сотрудников скрывают факт такого использования, чтобы избежать процессов внутренних согласований с ИБ, тем самым усугубляя ситуацию
3. 15% сотрудников вообще используют личные BYOD (bring your own device) для решения рабочих задач. Как контролировать использование таких устройств пока вообще не очень понятно…
Что с этим делать?
Видимо подстраиваться под реалии:
1. Создавать внутренние службы за контролем использования ИИ, должен же кто-то централизованно нести за все это ответственность…
2. В идеале, доводить внутренние ИИ решение до состояния, когда у сотрудников не будет даже мыслей пользоваться чем-то другим
3. Внедрять новые механизмы и методики, например:
- AI Usage Control для обнаружения и блокировки нежелательного ИИ.
- AI TRiSM (Trust, Risk, Security) решения для тотального контроля над всеми моделями ИИ в сети.
4. И, самое главное, обучайте сотрудников новым рискам
#Надёжность_ИИ
@Simple_Reliability
👍5
Психология на службе надёжности…
В 1962 году французский исследователь Мишель Сифр проводил эксперимент по субъективной оценки времени, который случайно открыл механизм контроля над паникой.
Механизм, среди прочего, можно использовать для экономии времени при решении инцидентов.
Называется он «Вербальное заземление»
Тоже самое предлагается использовать и при решении критических инцидентов, необходимо лишь внедрить соответствующие практики:
1. Исполнители должны проговаривать все свои действия вслух
2. Координаторы и руководители изменить формат своих вопросов
(Вместо «Какой статус?» – «Что ты видишь прямо сейчас?»)
3. Заменить интерпретации на факты
(Вместо «Это катастрофа…» - «До хоста X не доходит трафик…»)
@romanestt, что скажешь, должно работать?
@Simple_Reliablity
В 1962 году французский исследователь Мишель Сифр проводил эксперимент по субъективной оценки времени, который случайно открыл механизм контроля над паникой.
Механизм, среди прочего, можно использовать для экономии времени при решении инцидентов.
Называется он «Вербальное заземление»
В пещере, на грани психологического срыва, Сифр случайно обнаружил механизм стабилизации. Он не медитировал и не применял дыхательные техники. Он начал говорить вслух простые утверждения:
"Я сижу."
"Я дышу."
"Моя рука двигается."
Эффект был немедленным. Паника отступила. Когнитивный контроль вернулся.
Тоже самое предлагается использовать и при решении критических инцидентов, необходимо лишь внедрить соответствующие практики:
1. Исполнители должны проговаривать все свои действия вслух
2. Координаторы и руководители изменить формат своих вопросов
(Вместо «Какой статус?» – «Что ты видишь прямо сейчас?»)
3. Заменить интерпретации на факты
(Вместо «Это катастрофа…» - «До хоста X не доходит трафик…»)
@romanestt, что скажешь, должно работать?
@Simple_Reliablity
👍7❤1
В сентябре 2022 года, Gartner опубликовал прогноз, согласно которому организации инвестирующие в DIS
к 2025 году увеличат удовлетворенность своих пользователей за счет снижения времени простоя своих сервисов на 80%.
2025 год подходит к концу. Gartner ничего не говорит о том сбылся их прогноз или нет… (нет такой задачи). Зато продолжает прогнозировать, что данный тренд продолжит развиваться и эволюционирует в ACIS
Сработает или нет, покажет время. Но концепция точно поможет обосновать «эволюцию» службы сопровождения/SRE/экспертов надежности в эпоху GenAI 😉
@Simple_Reliability
Digital Immune System (DIS) — это целостный подход к созданию программных систем, которые обладают врожденной устойчивостью и способностью к самовосстановлению. Объединяя практики наблюдаемости, автотестирования, инженерии хаоса и автоматического исправления сбоев, DIS минимизирует downtime и обеспечивает бесперебойный пользовательский опыт, проактивно нейтрализуя угрозы и оперативно восстанавливаясь после инцидентов, подобно биологическому иммунитету.
к 2025 году увеличат удовлетворенность своих пользователей за счет снижения времени простоя своих сервисов на 80%.
2025 год подходит к концу. Gartner ничего не говорит о том сбылся их прогноз или нет… (нет такой задачи). Зато продолжает прогнозировать, что данный тренд продолжит развиваться и эволюционирует в ACIS
Autonomous Cyber Immune System
- автономная, самообучающаяся система превентивной безопасности и надежности (эволюция DIS)
Сработает или нет, покажет время. Но концепция точно поможет обосновать «эволюцию» службы сопровождения/SRE/экспертов надежности в эпоху GenAI 😉
@Simple_Reliability
❤2👍1
This media is not supported in your browser
VIEW IN TELEGRAM
Похоже формируется новая традиция: конец ноября = IT Talks by SBER в Самаре.
Если будете в Самаре 20.11, приходите, обсудим насущное.
Мероприятие отличное.
@Simple_Reliability
Если будете в Самаре 20.11, приходите, обсудим насущное.
Мероприятие отличное.
@Simple_Reliability
🔥8❤2
Запоминаем новые слова: EvalOps (это то чем нам предстоит заниматься в ближайшем будущем)
Раньше мы (многие, к счастью, до сих пор) имели дело с детерминированным кодом: есть входные данные, есть код, который их обрабатывает по строгим правилам, есть предсказуемый выход.
Было все понятно: работа заключалась в обеспечении доступности, производительности и отказоустойчивости инфраструктуры и приложений.
Ключевой же особенностью AI-агентов и LLM является недетерминированность их поведения (нельзя полностью предсказать стандартными юнит-тестами результат их работы).
Новые особенности = новыепроблемы вызовы (или новая область внимания SRE/OPS инженеров)
Галлюцинации: Система выдает убедительно звучащую, но абсолютно ложную информацию
НеИндепотентность (мое любимое): Ответы модели могут деградировать со временем, при одинаковых вводных, без каких-либо изменений
Нестабильность контекста: Небольшие изменения в промпте могут кардинально менять результат работы AI-агента
…
Практики EvalOps (на них посмотрим в следующий раз), как раз направлены на решение этих проблем. Это своего рода SRE для AI.
#НадёжностьИИ #EvalOps
@Simple_Reliability
EvalOps = Еvaluation (оценка) + Operations - это философия и набор практик, которые расширяют принципы DevOps и SRE, добавляя непрерывную, автоматизированную оценку "интеллектуального" поведения AI-систем в производственной среде.
Раньше мы (многие, к счастью, до сих пор) имели дело с детерминированным кодом: есть входные данные, есть код, который их обрабатывает по строгим правилам, есть предсказуемый выход.
Было все понятно: работа заключалась в обеспечении доступности, производительности и отказоустойчивости инфраструктуры и приложений.
Ключевой же особенностью AI-агентов и LLM является недетерминированность их поведения (нельзя полностью предсказать стандартными юнит-тестами результат их работы).
Новые особенности = новые
Галлюцинации: Система выдает убедительно звучащую, но абсолютно ложную информацию
НеИндепотентность (мое любимое): Ответы модели могут деградировать со временем, при одинаковых вводных, без каких-либо изменений
Нестабильность контекста: Небольшие изменения в промпте могут кардинально менять результат работы AI-агента
…
Практики EvalOps (на них посмотрим в следующий раз), как раз направлены на решение этих проблем. Это своего рода SRE для AI.
#НадёжностьИИ #EvalOps
@Simple_Reliability
👍6
Новый термин узнали (EvalOps), а что конкретно делать?
Есть три ключевые области на которых стоит сосредоточиться:
1. Наблюдаемость (Observability) для AI
Привычных технологических метрик, логов и трейсов не достаточно.
Для «наблюдаемости» AI нужно в онлайне контролировать бизнес-метрики качества (factual_accuracy, hallucination_rate, toxicity_score, relevancy_score,…)
Логировать не только HTTP-запросы, но и промпты, ответы модели, цепочки размышлений (reasoning chains) агентов
«Трассировать» выполнение не только микросервисов, но и шаги AI-агентов
2. Автоматизированное тестирование и Canary-релизы для AI
Не нужно ждать пока пользователь наткнется на галлюцинация, нужно проактивно их искать… например с помощью
canary-релизов с автоматическими quality-gate’ами (небольшая часть трафика направляется на новую версию модели, автоматически насчитываются метрики качества и если они отклоняются от нормы, то трафик автоматом возвращается на работоспособную версию модели)
3. Пост-продакшен мониторинг и инцидент-менеджмент
Все то что описано в п.1 должно стать рабочими инструментами службы сопровождения, без использования этих инструментов расследование инцидентов станет слабо реализуемым
Кончено это не все, но основы кажется понятны и логичны.
#НадёжностьИИ #EvalOps
@Simple_Reliability
Есть три ключевые области на которых стоит сосредоточиться:
1. Наблюдаемость (Observability) для AI
Привычных технологических метрик, логов и трейсов не достаточно.
Для «наблюдаемости» AI нужно в онлайне контролировать бизнес-метрики качества (factual_accuracy, hallucination_rate, toxicity_score, relevancy_score,…)
Логировать не только HTTP-запросы, но и промпты, ответы модели, цепочки размышлений (reasoning chains) агентов
«Трассировать» выполнение не только микросервисов, но и шаги AI-агентов
2. Автоматизированное тестирование и Canary-релизы для AI
Не нужно ждать пока пользователь наткнется на галлюцинация, нужно проактивно их искать… например с помощью
canary-релизов с автоматическими quality-gate’ами (небольшая часть трафика направляется на новую версию модели, автоматически насчитываются метрики качества и если они отклоняются от нормы, то трафик автоматом возвращается на работоспособную версию модели)
3. Пост-продакшен мониторинг и инцидент-менеджмент
Все то что описано в п.1 должно стать рабочими инструментами службы сопровождения, без использования этих инструментов расследование инцидентов станет слабо реализуемым
Кончено это не все, но основы кажется понятны и логичны.
#НадёжностьИИ #EvalOps
@Simple_Reliability
❤2
LLM-as-a-judge популярный метод повышения качества AI-решений, так говорят, но есть вопросы…
Точнее результаты исследования Gartner, которые говорят о другом.
Вся суть на картинке: LLM принимает решение на основе знаний, а человек, помимо знаний, обладает знанием контекста и уникальным экспертным опытом.
Безусловно, часть контекста передается и знаний у LLM больше… но исследования говорят о том, что «Использование ИИ для проверки ИИ» - это миф, который работает для ограниченного числа задач создании контента, например, проверки орфографии и общеизвестных фактов.
Еще два мифа: «Для ИИ чем больше контента, тем лучше» и «Для ИИ нет необходимости структурировать контент» развинчиваются в этом же исследовании.
Оригинал: Misconceptions when using AI for knowledge management (Gartner, 27.10.2025)
@Simple_Reliability
Точнее результаты исследования Gartner, которые говорят о другом.
Вся суть на картинке: LLM принимает решение на основе знаний, а человек, помимо знаний, обладает знанием контекста и уникальным экспертным опытом.
Безусловно, часть контекста передается и знаний у LLM больше… но исследования говорят о том, что «Использование ИИ для проверки ИИ» - это миф, который работает для ограниченного числа задач создании контента, например, проверки орфографии и общеизвестных фактов.
Еще два мифа: «Для ИИ чем больше контента, тем лучше» и «Для ИИ нет необходимости структурировать контент» развинчиваются в этом же исследовании.
Оригинал: Misconceptions when using AI for knowledge management (Gartner, 27.10.2025)
@Simple_Reliability
🤔1
GigaChat определенно льстит нашему псу(обратите внимание на сгенерированное видео)
Шутки шутками, но цензор явно не дорабатывает в кейсах со щенками… или обучающая выборка состояла преимущественно из коней🙈
@Simple_Reliability
Шутки шутками, но цензор явно не дорабатывает в кейсах со щенками… или обучающая выборка состояла преимущественно из коней🙈
@Simple_Reliability
😁12🙈2🤣1
На примере дилеммы «кого сбить насмерть? Бабушку или ребенка» удобно иллюстрировать различие больших языковых моделей (LLM):
Западные LLM «сбивают» бабушку, мотивируя это тем, что у ребенка вся жизнь впереди.
Китайские - ребенка, руководствуясь логикой, что бабушка идеологически правильно подкована и может воспитать сотни полезных членов общества…
Что же выберет AGI, когда действительно станет General?
@Simple_Reliability
Западные LLM «сбивают» бабушку, мотивируя это тем, что у ребенка вся жизнь впереди.
Китайские - ребенка, руководствуясь логикой, что бабушка идеологически правильно подкована и может воспитать сотни полезных членов общества…
Что же выберет AGI, когда действительно станет General?
@Simple_Reliability
Шутка родилась, в связи с повсеместным обсуждением того, что AI заменит ИТшников:
В аббревиатуре SRE, S значит Senior
@Simple_Reliability
В аббревиатуре SRE, S значит Senior
@Simple_Reliability
🤣2
Forwarded from Технохаб Сбера | Екатеринбург
This media is not supported in your browser
VIEW IN TELEGRAM
Пока гирлянды мигают, а код компилируется — самое время задуматься о главном тренде 2025: AI во всем.
Приглашаем на нашу большую конференцию IT Community Day.
Ключевые темы:
🤖 AI-агенты и GenAI — как встроить в продукты и не сломать архитектуру.
🛡️ Надёжность инфраструктуры — когда за монитором следит еще один (искусственный) интеллект.
🧠 Soft skills — что прокачивать, чтобы остаться нужным человеком в эпоху ИИ.
Живые кейсы от Сбера, Т-Банка, 2ГИС и Яндекса в докладах и панельных дискуссиях, а также движ на afterparty гарантируем!
Участие — бесплатное. Прокачка — бесценна.
Встречаемся 6 декабря в 11:30.
➡️ Забронировать место
Приглашаем на нашу большую конференцию IT Community Day.
Ключевые темы:
🤖 AI-агенты и GenAI — как встроить в продукты и не сломать архитектуру.
🛡️ Надёжность инфраструктуры — когда за монитором следит еще один (искусственный) интеллект.
🧠 Soft skills — что прокачивать, чтобы остаться нужным человеком в эпоху ИИ.
Живые кейсы от Сбера, Т-Банка, 2ГИС и Яндекса в докладах и панельных дискуссиях, а также движ на afterparty гарантируем!
Участие — бесплатное. Прокачка — бесценна.
Встречаемся 6 декабря в 11:30.
➡️ Забронировать место
👍2