Площадка недоступна, сроков восстановления нет: как спроектировать DR, который переживёт потерю ключевого ЦОДа

В ночь на 8 октября в Yandex Cloud произошел масштабный сбой в зоне доступности ru-central1-b из-за потери электропитания, что привело к остановке работы ключевого дата-центра. Инцидент затронул множество крупных сервисов, включая «Авито», «ЦИАН» и банковские системы. На следующий день проблемы возникли в дата-центре в Калуге. Данная ситуация стала поводом для обсуждения стратегий Disaster Recovery (DR). Автор статьи анализирует сценарии отказов инфраструктуры и предлагает архитектурные решения для обеспечения отказоустойчивости при потере основной площадки. В материале рассматривается модель восстановления на независимом ЦОДе, а также проводится расчет показателей RPO (целевая точка восстановления) и RTO (целевое время восстановления) на примере инфраструктуры из 40 виртуальных машин. Статья призвана помочь инженерам подготовиться к внезапным и длительным простоям облачных провайдеров, обеспечивая непрерывность бизнес-процессов в критических условиях.
This is a summary. Read the full article at the original source:
HabrПохожие
Украинские дроны вывели из строя дата-центр «российского Google»
Удары украинских беспилотников вывели из строя два из пяти дата-центров, принадлежащих российскому технологическому гиганту «Яндекс». Атаки, произошед…
Как смотреть 2-й сезон «Boston Blue» онлайн: руководство по стримингу
Полицейская драма «Boston Blue», спин-офф популярного сериала «Blue Bloods», возвращается со вторым сезоном 9 октября. Новый сезон продолжает драматич…
Amazon и другие компании больше не будут скрывать сделки по строительству дата-центров. Достаточно ли этого для укрепления доверия?
Amazon объявила, что перестанет использовать соглашения о неразглашении (NDA) при обсуждении проектов дата-центров с местными органами власти, следуя…



