Media is too big
VIEW IN TELEGRAM
Еще недавно по сети гулял душевный корпоративный румтур, где местный бородатый инженер Вова в худи весело рассекал на электросамокате между полями серверных залов. А там... собственные серверные стойки четвертого поколения, порты на 400 Гбит/с, толстенные оптические стволы на 864 волокна, спортзал и ламповую сауну, где админы могли попариться
Минувшей ночью сауна расширилась до каких-то... масштабов. Ждём офф отчетов, но как бы небыло всё куда страшнее для индустрии в целом.
Дело в том, что ДЦ в Сасово, помимо веб-серверов и виртуалок. находятся два из трех главных суперкомпьютеров России... это Червоненкис и Ляпунов (третий, Галушкин, базируется во Владимире)
Так вот Червоненкис - самый производительный вычислительный монстр в стране и всей восточной европе, который еще в 2021 году с ноги влетел на 19 место мирового рейтинга TOP500 суперПК. Именно на тысячах прожорливых тензорных ядер Червоненкиса и Ляпунова круглосуточно обсчитывались нейросетевые модели, обучалась YandexЖПТ, допиливался беспилотный транспорт и тренировался суверенный ИИ
ХЗ как обстоят дела в цифрах и тд, но если у вас сгорел кластер с БД заказов или упала нода кубера, то вы морщитесь, достаете бэкапы, перенаправляете балансировщик на Владимир или Калугу и терпите просадку пинга. Это всё лечится.
А что если пострадали стойки с тысячами интерконнектов и топовыми ускорителями A100 или H100... как это восстанавливать?
Посудите сами... на дворе 2026 год. Экспортный контроль закручен до скрипа, вторичные санкции давят серые каналы, а дефицит памяти поднял цены на ии-ускорители. Купить и привезти тысячи высокопроизводительных GPU по параллельному импорту через десятые руки сегодня - это та еще задача по суммам и времени
В итоге каскадный коллапс половины Рунета как бы не стал лишь верхушкой айсберга.
З.Ы. Инженеру Вове и дежурной смене искреннее сочувствие... разгребать всё это.
Типичный
Please open Telegram to view this post
VIEW IN TELEGRAM
🙏151😁41🔥23❤13 12🤯11😱10💯5⚡2🤔2🗿1
Условно разобью по актам для удобства чтения.
В 01:44 ночи дежурный мониторинг выкатывает уведомление "Нарушение электропитания в зоне доступности ru-central1-b". Тип инцидента - Unavailable. Следом простыня из трех десятков критических сервисов, от управляемых кластеров Kubernetes и баз данных PostgreSQL до YandexGPT API. И сообщение от саппорта: "Рекомендуем по возможности перенести нагрузку в другие зоны". Любой девопс, пытавшийся в час ночи на коленке мигрировать терабайтные стейтфулсеты и реплики баз данных в соседние зоны, в этот момент 100% нервно заскрежетал зубами... заподозрив неладное
К пяти утра наступило следствие любой облачной эвакуации. Тысячи перепуганных клиентов ломанулись поднимать упавшие виртуалки в зонах
ru-central1-a и ru-central1-c. Итог закономерен... работающие ДЦ захлебнулись. В 04:55 статус-бот признает, что в других зонах начались проблемы с созданием новых инстансов, баз данных и нод k8s. Свободные аллокации железа тупо кончились. Если у кого не было заранее зарезервированных и оплаченных мощностей в другом регионе, то увы... очередь с ошибками.Ближе к обеду бота мониторинга начало лихорадить... посыпались сообщения об исключении сервисов из инцидента. Выглядело это так, будто инженеры в вручную разруливали связность, по живому пересобирая IAM, VPC, DNS и сетевые балансировщики. Но стоило отчитаться о локализации, как в 14:33 легли Cloud Functions и Serverless Containers... бессерверная магия скорчилась под каскадной нагрузкой уже в масштабах всего облака.
Ближе к вечеру уставшая дежурная смена подарила сетевикам отдельный приступ тахикардии. В 16:46 бот внезапно добавил к списку аварийных зон…
ru-central1-d. Ровно через шестьдесят секунд зону убрали обратно. То ли у кого-то дрогнула рука, то ли соседний кластер на секунду захлебнулся от перегруза - хз. Представляю седые волосы админов, которые в эту минуту смотрели на дашборд Понадобилось почти четырнадцать часов сообщений про "перебои с питанием", чтобы в 15:19 назвать вещи своими именами. Формулировка сменилась на реальную:
Причиной инцидента стал пожар в результате атаки БПЛА на дата-центр в Сасово... Работа дата-центра полностью остановлена.
Типичный
Please open Telegram to view this post
VIEW IN TELEGRAM
👍92 70🔥27😱10❤8🫡8😁5🍾2👏1👌1 1
Если кто-то еще питал иллюзии, что к ночи рубильник поднимут и базы в Сасово оживут, увы:
Ситуация с доступностью зоны ru-central1-b пока не изменилась. Наши специалисты продолжают восстановительные работы, однако, по текущим оценкам, возобновить работу зоны в ближайшее время не удастся. Рекомендация остается прежней по возможности задействовать альтернативные планы по восстановлению работы сервисов.
Если чья инфраструктура, БД или единственные копии снапшотов жили исключительно внутри зоны
ru-central1-b - сочувствую. Но урок по Disaster Recovery должен быть усвоен.Что же там внутри ДЦ...
Типичный
Please open Telegram to view this post
VIEW IN TELEGRAM
😁81 42 33😱14🔥10❤7😎5🤔2🤯1
Главный вопрос, от которого сейчас зависит будущее отечественного бигтеха... что там с Червоненкисом и Ляпуновым. Если пожар или тушение добрались до машинных залов этих двух суперПК, то это же две трети вычислительных мозгов Яндекса, на которых обучаются главные нейросети страны, и четверть коммерческого облачного рынка РФ.
Типичный
Please open Telegram to view this post
VIEW IN TELEGRAM
🌎 Доступность зоны ru-central1-b пока не восстановлена. Наша команда продолжает устранять последствия инцидента.
Рекомендуем по возможности использовать альтернативные варианты восстановления сервисов, в том числе выделенные физические серверы Bare Metal.
Cледующую весточку отложили до завтра в 12:00 мск... впереди одиннадцать часов тишины, до утра оживить площадку в Сасово невозможно даже теоретически
З.Ы. Вот она, ирония судьбы: больше десяти лет на всех конфах нам говорят, что будущее за эластичными микросервисами, подами и бессерверными функциями. И вот... облачный провайдер предлагает клиентам юзать выделенные физические серверы.
Получается, что облачный инжиниринг сделал полный оборот и вернулся в благословенный 2005 год... ностальгия в глаз попала
Типичный
Please open Telegram to view this post
VIEW IN TELEGRAM
😁154 49❤9🔥9👏8😱3👍1
Please open Telegram to view this post
VIEW IN TELEGRAM
😁151🌚17💯16 5👍4❤3
Дашборды зеленые. Сервис недоступен
Потребуется время, чтобы найти и устранить ошибку. Но мониторинг может объяснять сам себя.
«Группа Астра» выпустила AMAIA — агентный ИИ-слой над мониторингом. ИИ-агенты объединяют данные из разных систем, сами пишут инструменты для проверок, находят причины ошибок и помогают их устранить. Опыт разборов копится в базе знаний.
Приглашаем на вебинар «ИИ над мониторингом: одна платформа, разные задачи, ваши модели»
📅 16 октября в 14:00 (МСК)
Покажем AMAIA вживую и разберем:
💠 чем ИИ-слой отличается от чат-ботов и систем автоматизации;
💠 как в рознице ИИ-агенты находят застрявшие заявки и следят за ценами конкурентов;
💠 как AMAIA оценивает загрузку ресурсов и помогает планировать размещение проектов;
💠 почему выбор модели решается настройкой;
💠 как начать: один процесс, один доступ, один человек.
🤩 Участникам — специальные условия запуска AMAIA.
Зарегистрироваться
Потребуется время, чтобы найти и устранить ошибку. Но мониторинг может объяснять сам себя.
«Группа Астра» выпустила AMAIA — агентный ИИ-слой над мониторингом. ИИ-агенты объединяют данные из разных систем, сами пишут инструменты для проверок, находят причины ошибок и помогают их устранить. Опыт разборов копится в базе знаний.
Приглашаем на вебинар «ИИ над мониторингом: одна платформа, разные задачи, ваши модели»
📅 16 октября в 14:00 (МСК)
Покажем AMAIA вживую и разберем:
💠 чем ИИ-слой отличается от чат-ботов и систем автоматизации;
💠 как в рознице ИИ-агенты находят застрявшие заявки и следят за ценами конкурентов;
💠 как AMAIA оценивает загрузку ресурсов и помогает планировать размещение проектов;
💠 почему выбор модели решается настройкой;
💠 как начать: один процесс, один доступ, один человек.
Зарегистрироваться
Please open Telegram to view this post
VIEW IN TELEGRAM
😁22✍2💊2
Не прошло и суток как под удар попал крупнейший ДЦ Яндекса в Калуге. Несколько модулей выведены из строя, экстренные службы на месте, сервисы по всей стране снова лихорадит, а масштаб ущерба уточняется.
Оцените всю дьявольскую издевку ситуации
С точки зрения архитектуры распределенных систем это почти фаталити... любой эникей знает, что для нормального кворума в etcd, распределенной YDB или консенсусах на базе Raft и Paxos требуется правило большинства (N/2 + 1). Для этого региональные облака и строят минимум на трех изолированных зонах доступности. Зона
ru-central1-b физически аннигилировала вчера. Сегодня падает калужская зона. Два узла из трех выбыли. Вчерашний совет саппорта про спасаться на дедиках теперь заиграл совсем уж погребальным сарказмом. На каком железе спасаться-то, если его выбивают быстрее, чем админы успевают поправить адреса в куберконфигах? Карточный домик суверенной облачной отказоустойчивости пошатнулся.
З.Ы. В строю осталась последняя площадка во Владимире. Инженерам во Владимирской области сейчас хочется пожелать персонального бронированного купола толщиной с бетонную плиту. Потому что если моргнет и Владимир...
Типичный
Please open Telegram to view this post
VIEW IN TELEGRAM
В 09:27 во всех зонах разом захромал S3 Object Storage... тайминги улетели, операции записи начали повально сыпать ошибками. Стораджисты это понимают... это когда из распределенного кластера физически выпадают площадки, erasure coding и кворум репликации ложатся, то читать старое еще можно, а вот записать новый блоб становится тяжеловато (невозможно).
З.Ы. Как говорится... мем смешной, а ситуация страшная. Кажется, мы только что увидели фактический предел прочности нашего облачного рынка.
Типичный
Please open Telegram to view this post
VIEW IN TELEGRAM
Типичный Сисадмин
А на иностранные перейти нельзя из-за 152фз.
Коллеги уже нервно фантазируют 🏥 .... что если в Москве на подоконнике поставить неттоп на селероне чисто ради галочки. А весь реальный боевой прод, тяжелые базы и бэкапы через три слоя шифрованных туннелей сбрасываются в степи - прямиком в ДЦ Алматы и Астаны.
Да, пинг будет такой, будто пакеты везут на верблюдах. Зато казахские ЦОДы не ловят маслины, а оплату можно проводить через kaspi под шашлычок.
Типичный🤙 Сисадмин
Да, пинг будет такой, будто пакеты везут на верблюдах. Зато казахские ЦОДы не ловят маслины, а оплату можно проводить через kaspi под шашлычок.
Типичный
Please open Telegram to view this post
VIEW IN TELEGRAM
😁148💯18🌚11🔥6 3❤2👏2🍌2🏆1
Гринатом — ИТ-интегратор Росатома — ищет специалистов для работы с ИТ-системами и промышленной автоматизацией в Немане.
🔹 Специалист технической поддержки
Основные задачи — приём и регистрация обращений сотрудников, консультация по работе с информационными системами, решение типовых проблем и передача сложных вопросов профильным специалистам. Ждём кандидата с опытом работы в ИТ-поддержке, уверенным знанием ПК и офисных программ. Английский — на уровне чтения технической документации.
🔹 Старший специалист технической поддержки АСУ ТП
Основные задачи — техническая поддержка АСУ ТП технологических линий, контроль состояния систем, проведение планово-профилактических работ, диагностика и устранение неисправностей аппаратной и программной частей. Также специалист будет участвовать во внедрении и доработке систем, вести техническую документацию и реестр оборудования. Требуются высшее техническое образование и опыт работы с автоматизированным производством от 3 лет, знание промышленных сетей и протоколов, ПЛК и SCADA.
🔹 Специалист по промышленной автоматизации
Основные задачи — поддержка и обслуживание MES и АСУ ТП, диагностика и устранение неисправностей, обновление программного обеспечения, резервное копирование конфигураций и обеспечение взаимодействия MES с производственным оборудованием. Также в задачах — подготовка технической документации и отчётов. Ждём специалиста с опытом разработки на C# (.NET Framework), Java или C++, знанием PostgreSQL и SQL, навыками администрирования Windows и Linux. Английский — на уровне чтения технической документации.
Для всех позиций — официальное трудоустройство, ДМС со стоматологией и возможности профессионального развития.
🔹 Специалист технической поддержки
Основные задачи — приём и регистрация обращений сотрудников, консультация по работе с информационными системами, решение типовых проблем и передача сложных вопросов профильным специалистам. Ждём кандидата с опытом работы в ИТ-поддержке, уверенным знанием ПК и офисных программ. Английский — на уровне чтения технической документации.
🔹 Старший специалист технической поддержки АСУ ТП
Основные задачи — техническая поддержка АСУ ТП технологических линий, контроль состояния систем, проведение планово-профилактических работ, диагностика и устранение неисправностей аппаратной и программной частей. Также специалист будет участвовать во внедрении и доработке систем, вести техническую документацию и реестр оборудования. Требуются высшее техническое образование и опыт работы с автоматизированным производством от 3 лет, знание промышленных сетей и протоколов, ПЛК и SCADA.
🔹 Специалист по промышленной автоматизации
Основные задачи — поддержка и обслуживание MES и АСУ ТП, диагностика и устранение неисправностей, обновление программного обеспечения, резервное копирование конфигураций и обеспечение взаимодействия MES с производственным оборудованием. Также в задачах — подготовка технической документации и отчётов. Ждём специалиста с опытом разработки на C# (.NET Framework), Java или C++, знанием PostgreSQL и SQL, навыками администрирования Windows и Linux. Английский — на уровне чтения технической документации.
Для всех позиций — официальное трудоустройство, ДМС со стоматологией и возможности профессионального развития.
hh.ru
Вакансия Специалист технической поддержки в Немане, работа в компании Гринатом. ИТ
Зарплата: от 70000 до 90000 ₽ за месяц. Неман. Требуемый опыт: 1–3 года. Занятость: полная. Дата публикации: 08.10.2026.
😁40💊21👀5❤2✍1🦄1
Только к вечеру второго дня в облаке появилась "возможность переносить управляющие компоненты k8s и удалять хосты из зоны ru-central1-b". Всё это время распределенный консенсус etcd и репликации ждали ответа от превратившейся в угли ноды в Сасово, блокируя любые операции по управлению... нельзя было ни сменить конфиг, ни добавить пользователя, ни накатить миграцию.
Яндекс сообщает, что нейросети работают штатно, но добавляет: "сохраняются некоторые особенности работы моделей DeepSeek, связанные с размером контекстного окна". ИМХО, походу кластеры с топовыми ускорителями частично подгорели, видеопамяти под гигантский KV-кэш не хватает, и чтобы сетка не вылетала в аут оф мемори, ей подрезали память на лету. Вчера у тебя была умная модель с длинным контекстом, а сегодня - чуть склеротичный ИИ.
Из позитивного... S3 Object Storage починили и тайминги на запись вернулись в норму. Сторадж перестал задыхаться, а вот разгребать последствия контуженного кворума и общаться с амнезийным дипсиком предстоит еще долго.
Типичный
Please open Telegram to view this post
VIEW IN TELEGRAM
Собираем инженеров сопровождения, SRE и DevOps, чтобы обсудить, что реально происходит с AI в эксплуатации и какие практики у нас есть уже сегодня.
Вместе со спикерами из Сбера, Т-Банка и СберТеха поговорим про:
А еще пообщаемся в непринужденной обстановке после деловой части.
Сбор 19 октября в 18:00 на welcome-кофе
Офис Сбера на Кутузовском 32 + онлайн
Регистрируйся, пока места ещё есть!
Please open Telegram to view this post
VIEW IN TELEGRAM
😁8👀3✍2🦄2🔥1