Условно разобью по актам для удобства чтения.
В 01:44 ночи дежурный мониторинг выкатывает уведомление "Нарушение электропитания в зоне доступности ru-central1-b". Тип инцидента - Unavailable. Следом простыня из трех десятков критических сервисов, от управляемых кластеров Kubernetes и баз данных PostgreSQL до YandexGPT API. И сообщение от саппорта: "Рекомендуем по возможности перенести нагрузку в другие зоны". Любой девопс, пытавшийся в час ночи на коленке мигрировать терабайтные стейтфулсеты и реплики баз данных в соседние зоны, в этот момент 100% нервно заскрежетал зубами... заподозрив неладное
К пяти утра наступило следствие любой облачной эвакуации. Тысячи перепуганных клиентов ломанулись поднимать упавшие виртуалки в зонах
ru-central1-a и ru-central1-c. Итог закономерен... работающие ДЦ захлебнулись. В 04:55 статус-бот признает, что в других зонах начались проблемы с созданием новых инстансов, баз данных и нод k8s. Свободные аллокации железа тупо кончились. Если у кого не было заранее зарезервированных и оплаченных мощностей в другом регионе, то увы... очередь с ошибками.Ближе к обеду бота мониторинга начало лихорадить... посыпались сообщения об исключении сервисов из инцидента. Выглядело это так, будто инженеры в вручную разруливали связность, по живому пересобирая IAM, VPC, DNS и сетевые балансировщики. Но стоило отчитаться о локализации, как в 14:33 легли Cloud Functions и Serverless Containers... бессерверная магия скорчилась под каскадной нагрузкой уже в масштабах всего облака.
Ближе к вечеру уставшая дежурная смена подарила сетевикам отдельный приступ тахикардии. В 16:46 бот внезапно добавил к списку аварийных зон…
ru-central1-d. Ровно через шестьдесят секунд зону убрали обратно. То ли у кого-то дрогнула рука, то ли соседний кластер на секунду захлебнулся от перегруза - хз. Представляю седые волосы админов, которые в эту минуту смотрели на дашборд Понадобилось почти четырнадцать часов сообщений про "перебои с питанием", чтобы в 15:19 назвать вещи своими именами. Формулировка сменилась на реальную:
Причиной инцидента стал пожар в результате атаки БПЛА на дата-центр в Сасово... Работа дата-центра полностью остановлена.
Типичный
Please open Telegram to view this post
VIEW IN TELEGRAM
👍90 70🔥27😱9❤8🫡8😁5🍾2👏1👌1 1
Если кто-то еще питал иллюзии, что к ночи рубильник поднимут и базы в Сасово оживут, увы:
Ситуация с доступностью зоны ru-central1-b пока не изменилась. Наши специалисты продолжают восстановительные работы, однако, по текущим оценкам, возобновить работу зоны в ближайшее время не удастся. Рекомендация остается прежней по возможности задействовать альтернативные планы по восстановлению работы сервисов.
Если чья инфраструктура, БД или единственные копии снапшотов жили исключительно внутри зоны
ru-central1-b - сочувствую. Но урок по Disaster Recovery должен быть усвоен.Что же там внутри ДЦ...
Типичный
Please open Telegram to view this post
VIEW IN TELEGRAM
😁79 42 33😱13🔥10❤7😎5🤔2🤯1
Главный вопрос, от которого сейчас зависит будущее отечественного бигтеха... что там с Червоненкисом и Ляпуновым. Если пожар или тушение добрались до машинных залов этих двух суперПК, то это же две трети вычислительных мозгов Яндекса, на которых обучаются главные нейросети страны, и четверть коммерческого облачного рынка РФ.
Типичный
Please open Telegram to view this post
VIEW IN TELEGRAM
🌎 Доступность зоны ru-central1-b пока не восстановлена. Наша команда продолжает устранять последствия инцидента.
Рекомендуем по возможности использовать альтернативные варианты восстановления сервисов, в том числе выделенные физические серверы Bare Metal.
Cледующую весточку отложили до завтра в 12:00 мск... впереди одиннадцать часов тишины, до утра оживить площадку в Сасово невозможно даже теоретически
З.Ы. Вот она, ирония судьбы: больше десяти лет на всех конфах нам говорят, что будущее за эластичными микросервисами, подами и бессерверными функциями. И вот... облачный провайдер предлагает клиентам юзать выделенные физические серверы.
Получается, что облачный инжиниринг сделал полный оборот и вернулся в благословенный 2005 год... ностальгия в глаз попала
Типичный
Please open Telegram to view this post
VIEW IN TELEGRAM
😁152 49❤9🔥9👏8😱3👍1
Please open Telegram to view this post
VIEW IN TELEGRAM
😁144🌚17💯15 5👍4❤3
Дашборды зеленые. Сервис недоступен
Потребуется время, чтобы найти и устранить ошибку. Но мониторинг может объяснять сам себя.
«Группа Астра» выпустила AMAIA — агентный ИИ-слой над мониторингом. ИИ-агенты объединяют данные из разных систем, сами пишут инструменты для проверок, находят причины ошибок и помогают их устранить. Опыт разборов копится в базе знаний.
Приглашаем на вебинар «ИИ над мониторингом: одна платформа, разные задачи, ваши модели»
📅 16 октября в 14:00 (МСК)
Покажем AMAIA вживую и разберем:
💠 чем ИИ-слой отличается от чат-ботов и систем автоматизации;
💠 как в рознице ИИ-агенты находят застрявшие заявки и следят за ценами конкурентов;
💠 как AMAIA оценивает загрузку ресурсов и помогает планировать размещение проектов;
💠 почему выбор модели решается настройкой;
💠 как начать: один процесс, один доступ, один человек.
🤩 Участникам — специальные условия запуска AMAIA.
Зарегистрироваться
Потребуется время, чтобы найти и устранить ошибку. Но мониторинг может объяснять сам себя.
«Группа Астра» выпустила AMAIA — агентный ИИ-слой над мониторингом. ИИ-агенты объединяют данные из разных систем, сами пишут инструменты для проверок, находят причины ошибок и помогают их устранить. Опыт разборов копится в базе знаний.
Приглашаем на вебинар «ИИ над мониторингом: одна платформа, разные задачи, ваши модели»
📅 16 октября в 14:00 (МСК)
Покажем AMAIA вживую и разберем:
💠 чем ИИ-слой отличается от чат-ботов и систем автоматизации;
💠 как в рознице ИИ-агенты находят застрявшие заявки и следят за ценами конкурентов;
💠 как AMAIA оценивает загрузку ресурсов и помогает планировать размещение проектов;
💠 почему выбор модели решается настройкой;
💠 как начать: один процесс, один доступ, один человек.
Зарегистрироваться
Please open Telegram to view this post
VIEW IN TELEGRAM
😁21✍2💊1
Не прошло и суток как под удар попал крупнейший ДЦ Яндекса в Калуге. Несколько модулей выведены из строя, экстренные службы на месте, сервисы по всей стране снова лихорадит, а масштаб ущерба уточняется.
Оцените всю дьявольскую издевку ситуации
С точки зрения архитектуры распределенных систем это почти фаталити... любой эникей знает, что для нормального кворума в etcd, распределенной YDB или консенсусах на базе Raft и Paxos требуется правило большинства (N/2 + 1). Для этого региональные облака и строят минимум на трех изолированных зонах доступности. Зона
ru-central1-b физически аннигилировала вчера. Сегодня падает калужская зона. Два узла из трех выбыли. Вчерашний совет саппорта про спасаться на дедиках теперь заиграл совсем уж погребальным сарказмом. На каком железе спасаться-то, если его выбивают быстрее, чем админы успевают поправить адреса в куберконфигах? Карточный домик суверенной облачной отказоустойчивости пошатнулся.
З.Ы. В строю осталась последняя площадка во Владимире. Инженерам во Владимирской области сейчас хочется пожелать персонального бронированного купола толщиной с бетонную плиту. Потому что если моргнет и Владимир...
Типичный
Please open Telegram to view this post
VIEW IN TELEGRAM
В 09:27 во всех зонах разом захромал S3 Object Storage... тайминги улетели, операции записи начали повально сыпать ошибками. Стораджисты это понимают... это когда из распределенного кластера физически выпадают площадки, erasure coding и кворум репликации ложатся, то читать старое еще можно, а вот записать новый блоб становится тяжеловато (невозможно).
З.Ы. Как говорится... мем смешной, а ситуация страшная. Кажется, мы только что увидели фактический предел прочности нашего облачного рынка.
Типичный
Please open Telegram to view this post
VIEW IN TELEGRAM
Типичный Сисадмин
А на иностранные перейти нельзя из-за 152фз.
Коллеги уже нервно фантазируют 🏥 .... что если в Москве на подоконнике поставить неттоп на селероне чисто ради галочки. А весь реальный боевой прод, тяжелые базы и бэкапы через три слоя шифрованных туннелей сбрасываются в степи - прямиком в ДЦ Алматы и Астаны.
Да, пинг будет такой, будто пакеты везут на верблюдах. Зато казахские ЦОДы не ловят маслины, а оплату можно проводить через kaspi под шашлычок.
Типичный🤙 Сисадмин
Да, пинг будет такой, будто пакеты везут на верблюдах. Зато казахские ЦОДы не ловят маслины, а оплату можно проводить через kaspi под шашлычок.
Типичный
Please open Telegram to view this post
VIEW IN TELEGRAM
😁132💯14🌚10🔥5 3👏2🍌2❤1🏆1
Гринатом — ИТ-интегратор Росатома — ищет специалистов для работы с ИТ-системами и промышленной автоматизацией в Немане.
🔹 Специалист технической поддержки
Основные задачи — приём и регистрация обращений сотрудников, консультация по работе с информационными системами, решение типовых проблем и передача сложных вопросов профильным специалистам. Ждём кандидата с опытом работы в ИТ-поддержке, уверенным знанием ПК и офисных программ. Английский — на уровне чтения технической документации.
🔹 Старший специалист технической поддержки АСУ ТП
Основные задачи — техническая поддержка АСУ ТП технологических линий, контроль состояния систем, проведение планово-профилактических работ, диагностика и устранение неисправностей аппаратной и программной частей. Также специалист будет участвовать во внедрении и доработке систем, вести техническую документацию и реестр оборудования. Требуются высшее техническое образование и опыт работы с автоматизированным производством от 3 лет, знание промышленных сетей и протоколов, ПЛК и SCADA.
🔹 Специалист по промышленной автоматизации
Основные задачи — поддержка и обслуживание MES и АСУ ТП, диагностика и устранение неисправностей, обновление программного обеспечения, резервное копирование конфигураций и обеспечение взаимодействия MES с производственным оборудованием. Также в задачах — подготовка технической документации и отчётов. Ждём специалиста с опытом разработки на C# (.NET Framework), Java или C++, знанием PostgreSQL и SQL, навыками администрирования Windows и Linux. Английский — на уровне чтения технической документации.
Для всех позиций — официальное трудоустройство, ДМС со стоматологией и возможности профессионального развития.
🔹 Специалист технической поддержки
Основные задачи — приём и регистрация обращений сотрудников, консультация по работе с информационными системами, решение типовых проблем и передача сложных вопросов профильным специалистам. Ждём кандидата с опытом работы в ИТ-поддержке, уверенным знанием ПК и офисных программ. Английский — на уровне чтения технической документации.
🔹 Старший специалист технической поддержки АСУ ТП
Основные задачи — техническая поддержка АСУ ТП технологических линий, контроль состояния систем, проведение планово-профилактических работ, диагностика и устранение неисправностей аппаратной и программной частей. Также специалист будет участвовать во внедрении и доработке систем, вести техническую документацию и реестр оборудования. Требуются высшее техническое образование и опыт работы с автоматизированным производством от 3 лет, знание промышленных сетей и протоколов, ПЛК и SCADA.
🔹 Специалист по промышленной автоматизации
Основные задачи — поддержка и обслуживание MES и АСУ ТП, диагностика и устранение неисправностей, обновление программного обеспечения, резервное копирование конфигураций и обеспечение взаимодействия MES с производственным оборудованием. Также в задачах — подготовка технической документации и отчётов. Ждём специалиста с опытом разработки на C# (.NET Framework), Java или C++, знанием PostgreSQL и SQL, навыками администрирования Windows и Linux. Английский — на уровне чтения технической документации.
Для всех позиций — официальное трудоустройство, ДМС со стоматологией и возможности профессионального развития.
hh.ru
Вакансия Специалист технической поддержки в Немане, работа в компании Гринатом. ИТ
Зарплата: от 70000 до 90000 ₽ за месяц. Неман. Требуемый опыт: 1–3 года. Занятость: полная. Дата публикации: 08.10.2026.
😁31💊14👀5✍1🦄1