AWS 灾难恢复与可靠性
April 4, 2024About 3 min
AWS 灾难恢复与可靠性
灾难恢复(Disaster Recovery,DR)是应对系统故障、自然灾害、人为错误的业务连续性方案。各种策略本质是在 成本、恢复时间(RTO)、数据丢失(RPO) 之间做权衡——恢复越快、丢得越少,钱花得越多。
衡量 DR 的两个核心指标:
- RTO(恢复时间目标):故障后多久能恢复服务。
- RPO(恢复点目标):能容忍丢多少数据(取决于备份/同步频率)。
DR 策略谱系
下面这张表从冷到热排列,越往下 RTO/RPO 越小、成本越高:
| 策略 | RTO(恢复时间) | RPO(数据丢失) | 成本 | 说明 |
|---|---|---|---|---|
| 冷备份(Cold Backup) | 数小时至数天 | 较大,可能丢大量数据 | 最低 | 只保留数据备份,无业务环境。适合恢复时间要求不高、预算有限。 |
| 冷站(Cold Site) | 数小时以上 | 较大 | 低至中 | 预留备用数据中心基础设施,但无数据和应用,恢复时间长。 |
| 快照恢复(Snapshot) | 取决于快照恢复速度 | 取决于快照频率 | 低 | 用快照恢复数据,简单易实施,恢复时间和完整度看快照频率。 |
| Pilot Light | 十几到数十分钟 | 较短 | 较低 | 备用环境只跑核心基础设施(如数据库),其余按需启动。 |
| 温备份(Warm Standby) | 几分钟到十几分钟 | 短 | 中 | 备用环境部分/全部系统已低容量运行,能快速切换扩容。 |
| 热备份(Hot Backup) | 秒级到分钟级 | 极短,几乎不丢 | 最高 | 主备实时同步、自动故障切换,适合关键业务零数据丢失。 |
| DRaaS | 分钟到小时,依服务等级 | 依服务等级 | 依服务商定价 | 第三方提供完整 DR 服务,降低自建复杂度。 |
| 云灾难恢复(Cloud DR) | 弹性,可短至分钟 | 弹性,看同步配置 | 弹性 | 基于云多区域部署 + 弹性扩展,适合现代应用灵活快速恢复。 |
Pilot Light vs Warm Standby
这两个最容易混,区别在备用环境"跑没跑起来":
| 方面 | Pilot Light | Warm Standby(温备份) |
|---|---|---|
| 环境状态 | 只运行关键核心(如数据库),其余组件未运行/未部署 | 完整或部分应用系统已在低容量下运行 |
| 服务启动 | 灾难后要启动并配置大量服务,时间较长 | 系统大体在跑,主要是扩容和切换,快 |
| 资源准备 | 从"几乎关闭"分步恢复到运行状态 | 资源活跃,能快速拉到全负载 |
| 自动化 | 依赖启动脚本,时间看自动化程度 | 依赖扩容和负载切换,自动化程度通常更高 |
| 实际恢复速度 | 以几十分钟为主,部分场景更长 | 几分钟到十几分钟,明显更快 |
一句话区分:Pilot Light 是"只点着引火灯,用时再点火",Warm Standby 是"小火常燃,用时加大"。要更快恢复、能接受更高成本就选 Warm Standby。