Forwarded from запуск завтра
Подъехал пост-мортем от Амазона.
С одной стороны, хочется поржать над DNS Enactor, DropletWorkflow Manager (DWFM), Network Manager и прочими — это Galactic от Karzam, только в реальном мире и на очень серьезных щщах.
Если без шуток, то цепочка такая:
Ну а когда у вас не доступны базы данных и виртуальные машины, то все остальное уже валится по цепочке (и список десятков облачных сервисов, которые пострадали).
Раздел «что мы поменяем» удивительно короткий и очень технический: починят рейс кодишен в DNS, ограничат объем серверов, который может выключить лоад-балансер и т. д. Ну и заканчивают «извините, в будущем будем более лучше стараться».
Интересно, что они не делают никаких философских выводов из ситуации. Видимо, считают, что идейно всё верно. Я сам такими огромными системами (и командами) не управлял и поэтому осторожно предположу, что, наверное, технически, можно сделать систему проще, но учитывая, что над ней работают десятки независимых команд — это, наверное, минимальный доступный объем сложности и допустимый объем ошибок. Было бы интересно услышать мнение «настоящих сварщиков».
—
Коллеги советуют замечательную статью на тему безопасности сложных систем. Она не дает ответов, но предостерегает от попытки найти «root cause», «причину аварии» и предлагает посмотреть на безопасность систем по-новому, через другие линзы, чем я привык. Очень рекомендую.
С одной стороны, хочется поржать над DNS Enactor, DropletWorkflow Manager (DWFM), Network Manager и прочими — это Galactic от Karzam, только в реальном мире и на очень серьезных щщах.
Если без шуток, то цепочка такая:
1. сначала сломался доступ к dynamodb из-за рейс-кондишена системы управления DNS — два таска начали писать в DNS одновременно, первый старую версию записей, второй — более новую новую, в результате часть записей в DNS оказалась новая, часть старая, второй процесс запустил cleanup, который удалил все старые записи и из такого разломанного состояния система сама восстановиться не могла. Сломалось в полночью, за 50 минут поняли в чем дело и ещё за 40 минут починили руками.
2. из-за сломанного dynamodb, система управления железом не могла обновить статус физических серверов и начала отмечать их как «недоступные», поэтому не могла запустить новые виртуальные машины; после восстановления dynamodb, по-идее всё должно было встать само, но из-за большого объема железа, стоящего в очереди, обновление статуса занимало дольше, чем таймаут — и очередь не разгребалась, а только росла. Коллапс. Стандартной процедуры восстановления для такого случая прописано не было, через 2 часа попыток что-то разрулить, инженеры ограничили число входящих запросов и начали перезапускать тачки с системой управления; это помогло, теперь можно было создать новые виртуальные машины;
3. но ещё какое-то время эти новые виртуалки не делали никакой полезной работы, потому что из-за взрывной нагрузки не справлялась система управления разлива конфигурации сети и сеть на новые тачки приходила с задержкой;
4. из-за этой задержки появления сети на машинах, моргали статусы серверов в лоад-балансерах, отмечая живые инстансы как мертвые и триггерились дополнительные переключения нагрузки (привет, DNS!) и перегрузилась система проверки здоровья серверов, пришлось её на время выключить.
Ну а когда у вас не доступны базы данных и виртуальные машины, то все остальное уже валится по цепочке (и список десятков облачных сервисов, которые пострадали).
Раздел «что мы поменяем» удивительно короткий и очень технический: починят рейс кодишен в DNS, ограничат объем серверов, который может выключить лоад-балансер и т. д. Ну и заканчивают «извините, в будущем будем более лучше стараться».
Интересно, что они не делают никаких философских выводов из ситуации. Видимо, считают, что идейно всё верно. Я сам такими огромными системами (и командами) не управлял и поэтому осторожно предположу, что, наверное, технически, можно сделать систему проще, но учитывая, что над ней работают десятки независимых команд — это, наверное, минимальный доступный объем сложности и допустимый объем ошибок. Было бы интересно услышать мнение «настоящих сварщиков».
—
Коллеги советуют замечательную статью на тему безопасности сложных систем. Она не дает ответов, но предостерегает от попытки найти «root cause», «причину аварии» и предлагает посмотреть на безопасность систем по-новому, через другие линзы, чем я привык. Очень рекомендую.
YouTube
Microservices
it's because of the way our backend works
// more krazam scenes: https://www.patreon.com/KRAZAM
// merch: https://merch.krazam.tv
// https://www.instagram.com/krazam.tv
// https://twitter.com/krazamtv
// more krazam scenes: https://www.patreon.com/KRAZAM
// merch: https://merch.krazam.tv
// https://www.instagram.com/krazam.tv
// https://twitter.com/krazamtv
Forwarded from Denis Sexy IT 🤖
This media is not supported in your browser
VIEW IN TELEGRAM
Очень мне нравится, как пишут текст диффузионные языковые модели – они в отличие от обычных LLM, синтезируют текст сразу во все стороны; это значит, что они и быстрее и если "случайный текст" немного повреждать, то можно сделать приютную анимацию того, как модель пытается восстановить его
Натренировал нано-диффузионную модельку поверх Одесских Рассказов Бабеля и запустил анимацией от игры "Жизнь" – нравится как эстетически получилось, хоть смысла и мало
Код брал тут
Натренировал нано-диффузионную модельку поверх Одесских Рассказов Бабеля и запустил анимацией от игры "Жизнь" – нравится как эстетически получилось, хоть смысла и мало
Код брал тут
Forwarded from Дизайн-Телега 🔥
This media is not supported in your browser
VIEW IN TELEGRAM
У Jter фавикон показывает прогресс экспорта видео.
Forwarded from PSD | Дизайн-пространство
Forwarded from UI_UX inspiration
Приложение для бронирования
Категория: #приложение
Язык: #en
https://.com/shots/18596043-Apartment-Booking-App
Категория: #приложение
Язык: #en
https://.com/shots/18596043-Apartment-Booking-App
Forwarded from PSD | Дизайн-пространство
Эффективная маркетинговая система: ключевые составляющие
Статья о том, как преобразить маркетинг в эффективный инструмент развития бизнеса через целостную систему. Важность человеческих ресурсов, процессов и метрик
Читать на дизайнерс | #статья
Статья о том, как преобразить маркетинг в эффективный инструмент развития бизнеса через целостную систему. Важность человеческих ресурсов, процессов и метрик
Читать на дизайнерс | #статья
Forwarded from Дизайн-Телега 🔥
Эффективная маркетинговая система: ключевые составляющие
Статья о том, как преобразить маркетинг в эффективный инструмент развития бизнеса через целостную систему. Важность человеческих ресурсов, процессов и метрик
Читать на дизайнерс | #статья
Статья о том, как преобразить маркетинг в эффективный инструмент развития бизнеса через целостную систему. Важность человеческих ресурсов, процессов и метрик
Читать на дизайнерс | #статья
Forwarded from Shock Design
Интенсив для дизайнеров: как мы прокачали насмотренность команды и сделали 40 проектов
Новая волна джунов в Атвинте стимулирует запуск внутреннего интенсива дизайна для повышения профессионализма и укрепления логики в принятии решений
Читать на дизайнерс | #статья
Новая волна джунов в Атвинте стимулирует запуск внутреннего интенсива дизайна для повышения профессионализма и укрепления логики в принятии решений
Читать на дизайнерс | #статья
Forwarded from UI_UX inspiration
Интенсив для дизайнеров: как мы прокачали насмотренность команды и сделали 40 проектов
Новая волна джунов в Атвинте стимулирует запуск внутреннего интенсива дизайна для повышения профессионализма и укрепления логики в принятии решений
Читать на дизайнерс | #статья
Новая волна джунов в Атвинте стимулирует запуск внутреннего интенсива дизайна для повышения профессионализма и укрепления логики в принятии решений
Читать на дизайнерс | #статья