Cómo montar un plan de Disaster Recovery en AWS: RTO y RPO en la práctica
Montar un plan de disaster recovery no es solo elegir una herramienta de backup y confiar en que va a funcionar cuando se necesite. Es un proceso estructurado, que comienza entendiendo cuánta indisponibilidad y pérdida de datos puede tolerar la operación, y termina con una arquitectura probada de verdad. Esta guía muestra los pasos principales para montar ese plan en AWS.
El punto de partida: RTO y RPO
Antes de elegir cualquier herramienta, es necesario definir dos números para cada aplicación crítica de la empresa.
El RTO, o Recovery Time Objective, es el tiempo máximo aceptable entre la falla y que la operación vuelva a estar en línea. Si el RTO de un sistema es de cuatro horas, esto significa que la empresa consigue tolerar hasta cuatro horas de indisponibilidad sin impacto grave en el negocio.
El RPO, o Recovery Point Objective, es la cantidad máxima de datos que la empresa puede perder, medida en tiempo. Un RPO de quince minutos significa que, en el peor escenario, la empresa pierde como máximo quince minutos de datos desde el último punto de recuperación.
No toda aplicación necesita el mismo nivel de protección. Un sistema de e-commerce que genera ingresos directos probablemente necesita RTO y RPO bajos, medidos en minutos. Un sistema interno de informes puede tolerar horas de indisponibilidad sin gran perjuicio.
Las cuatro estrategias de DR más usadas en AWS
AWS organiza las estrategias de disaster recovery en cuatro categorías, ordenadas del costo más bajo al más alto, y del RTO más alto al más bajo.
- Backup and restore es la estrategia más simple y barata. Los datos quedan almacenados de forma segura, generalmente con AWS Backup, y la infraestructura solo se recrea cuando ocurre el desastre. El RTO suele ser de horas.
- Pilot light mantiene una versión mínima y esencial de la infraestructura siempre activa en una región secundaria, como la base de datos replicada, mientras el resto de los recursos se provisiona solo cuando es necesario. El RTO cae a decenas de minutos.
- Warm standby mantiene una versión reducida, pero funcional, del entorno completo ejecutándose todo el tiempo en una segunda región. En caso de falla, el entorno se escala rápidamente para soportar el tráfico total. El RTO queda en el orden de los minutos.
- Multi site active active mantiene el entorno completo ejecutándose simultáneamente en dos o más regiones, distribuyendo el tráfico entre ellas todo el tiempo. Es la estrategia con RTO más cercano a cero, y también la más cara de mantener.
Herramientas de AWS para poner el plan en práctica
AWS Backup centraliza y automatiza la política de backup de diversos servicios, como EC2, RDS, EFS y DynamoDB, en un único panel, con reglas de retención y copia entre regiones. AWS Elastic Disaster Recovery, conocido como DRS, replica servidores enteros, incluyendo los que se ejecutan fuera de AWS, a una región de destino, permitiendo failover en minutos sin necesidad de mantener una infraestructura espejada ejecutándose todo el tiempo. Amazon S3 con replicación entre regiones protege los datos almacenados en buckets contra la indisponibilidad de una región entera. Amazon Route 53 con health checks y failover automático redirige el tráfico al entorno de contingencia en cuanto detecta que el entorno principal está fuera de línea.
¿Cómo elegir la estrategia adecuada?
La elección depende de tres factores: cuánto vale la aplicación para el negocio, qué RTO y RPO realmente exige, y qué presupuesto está disponible para mantener esa protección. Las aplicaciones críticas de ingresos suelen justificar warm standby o multi site active active. Los sistemas de soporte interno suelen quedar bien atendidos con backup and restore o pilot light.
El plan solo vale si se prueba
Un plan de disaster recovery que nunca se probó en la práctica es una suposición, no una garantía. Las simulaciones periódicas de failover muestran si el RTO prometido realmente se alcanza, y evitan sorpresas justamente en el momento en que la empresa más necesita que todo funcione.
CloudDog ayuda a las empresas a diseñar, implementar y probar estrategias de disaster recovery en AWS, con RTO y RPO definidos de acuerdo con la criticidad real de cada aplicación. Conoce nuestro servicio de Backup y Disaster Recovery y habla con nuestros arquitectos para descubrir qué estrategia tiene sentido para tu entorno.

