
很多团队已经给华为云 ECS 开启了云备份(CBR),却从未真正恢复过。控制台显示"备份成功",只能证明某次备份任务完成,不能证明数据库一致、应用能启动、DNS 能切换,更不能证明恢复时间满足业务要求。
本文不讨论"有没有备份",而是讲如何把 CBR 变成可验证的恢复能力:先定义 RPO/RTO,再设计存储库与策略,最后通过原机恢复、备份创建镜像和跨区域演练验证结果。
一、先定义 RPO 和 RTO
- RPO(恢复点目标):最多允许丢失多长时间的数据。
- RTO(恢复时间目标):从故障发生到业务恢复,最多允许多久。
例如,RPO 24 小时意味着每天一次备份可能勉强满足;RPO 15 分钟则不能只依赖每天的整机备份,还要为数据库设计日志、增量或原生备份机制。RTO 30 分钟意味着镜像创建、ECS 发放、网络切换和应用检查都必须在时间预算内完成。

先做业务分级:
| 业务 | 可接受 RPO | 可接受 RTO | 备份重点 |
|---|---|---|---|
| 企业展示站 | 小时到天 | 小时级 | ECS 配置、站点文件、数据库 |
| 内容与会员系统 | 分钟到小时 | 小时内 | 数据库、上传文件、应用版本 |
| 核心交易系统 | 接近实时 | 分钟级 | 数据库高可用、日志复制、跨区域预案 |
CBR 是恢复体系的一部分。对写入密集数据库,仍应使用数据库自身的一致性备份、日志和复制能力,不要把所有恢复目标都交给整机备份。
二、理解存储库、资源绑定、策略与备份副本
华为云 CBR 使用存储库存放备份。官方文档说明,创建备份前需要先有对应类型的存储库,并绑定服务器或磁盘;存储库可以绑定自动备份或复制策略,符合条件的服务器备份还可复制到其他区域,用于创建镜像和发放新 ECS。
参考:CBR 存储库概述。
配置时要检查:
- 存储库类型与保护对象是否匹配;
- ECS 的系统盘和关键数据盘是否都被纳入;
- 自动备份策略是否真正绑定到存储库;
- 保留数量与合规周期是否足够;
- 是否需要跨区域复制存储库;
- 新创建的 ECS 是否会被遗漏。
华为云当前还提供一键备份云服务器能力,可扫描同区域内未绑定存储库的云服务器并纳入预设策略,适合实例较多时降低遗漏风险;功能和适用范围以控制台为准。
参考:一键备份云服务器。
三、备份前先保证应用一致性
文件系统级备份不等于应用一致性。对数据库和消息系统,备份发生时仍可能有内存数据、事务日志或未落盘写入。
建议按业务设计备份前后动作:
- 数据库执行原生备份或确认崩溃恢复能力;
- 关键配置进入版本管理;
- 上传文件使用对象存储或有独立校验;
- 记录应用版本、镜像 ID、依赖版本和启动命令;
- 在重大升级前创建手动备份并标记用途。
官方手动备份文档要求资源已绑定可用存储库,并指出服务器、磁盘等需处于支持的状态;业务高峰时段创建备份可能存在延迟,应结合自身业务错峰安排。
参考:创建手动备份。
Linux 主机可在备份前记录关键状态:
bash
date -Is
lsblk -f
df -hT
systemctl --failed
sha256sum /etc/nginx/nginx.conf
不要把密码、私钥或敏感配置输出到公共日志;校验文件时应控制日志访问权限。
四、三种恢复路径怎么选
1. 恢复原服务器
适用于磁盘故障、人为误删除或系统配置损坏,目标是把原 ECS 恢复到已有备份点。华为云官方说明,恢复过程中系统会关闭服务器,完成后可自动或手动启动;正在恢复的任务无法终止,因此必须先确认目标、备份时间和业务窗口。
参考:使用云服务器备份恢复数据。
这条路径恢复直接,但会影响原机,首次演练不建议直接对生产 ECS 操作。
2. 用备份创建镜像,再发放新 ECS
适用于原 ECS 被误删、需要隔离验证或希望保留原机。官方文档说明,云服务器备份可以创建整机镜像,再由镜像发放新服务器;同一备份创建镜像存在配额与唯一性约束,Linux 还应提前完成 Cloud-init 相关准备。
参考:使用云服务器备份创建镜像。
这通常是更安全的演练方式:在隔离子网创建恢复 ECS,不接生产流量,验证完整后再销毁演练资源。
3. 跨区域复制后恢复
适用于区域级灾难恢复目标。流程通常包括复制备份到目标区域、由备份创建镜像、发放 ECS、恢复网络与依赖、切换流量。跨区域恢复是否满足 RTO,必须靠完整演练测量。
五、一次可执行的恢复演练

演练准备
- 选择非生产账号、项目或隔离子网;
- 确认备份状态可用、时间点正确;
- 记录系统盘、数据盘、ECS 规格、可用区和网络配置;
- 准备临时安全组,默认不开放公网业务端口;
- 明确验收脚本和回收负责人;
- 记录开始时间,正式测量 RTO。
创建恢复资源
优先从备份创建镜像,再由镜像发放一台隔离 ECS。规格不必盲目与生产完全相同,但必须足以启动应用并完成验证。若要验证容量,应使用接近生产的规格和 EVS 类型。
系统验证
bash
uname -a
lsblk -f
df -hT
systemctl --failed
journalctl -p err -b --no-pager | tail -n 100
检查挂载点、UUID、网络配置、时区、系统服务和启动日志。不要因为 SSH 能登录就判定恢复成功。
应用验证
bash
sudo nginx -t
curl -fsS http://127.0.0.1/healthz
ss -lntp
再验证登录、查询、写入、上传、定时任务和依赖连接。对数据库至少做表数量、关键记录数和业务抽样校验;必要时与备份前保存的校验结果对比。
网络与切换验证
确认新 ECS 的安全组、路由、DNS、EIP 或 ELB 后端配置。演练阶段不要直接覆盖生产 DNS;可以通过临时域名或本地 hosts 验证。
结束与复盘
记录从"宣布故障"到"业务验收通过"的总时间,拆分为:
- 找到正确备份;
- 创建镜像;
- 发放 ECS;
- 启动与修复配置;
- 验证数据;
- 恢复入口流量。
这组数据决定 RTO 是否真实可达。
六、恢复验证清单
- 备份副本状态为可用,且时间点符合 RPO;
- 系统盘和所有关键数据盘完整;
- 分区、文件系统与挂载点正确;
- 应用和依赖服务能自动启动;
- 数据库能读写,业务抽样一致;
- 安全组没有因演练被过度放通;
- 日志、监控和告警重新接入;
- 临时域名或 ELB 测试正常;
- 实际 RTO 小于目标;
- 演练资源、临时 EIP 和镜像有明确回收计划。
七、常见误区
- 备份成功等于可恢复:只有恢复并通过业务验收才算闭环。
- 只备系统盘:数据库、上传文件或数据盘可能不在恢复范围内。
- 从不测试 Cloud-init 与启动脚本:新 ECS 发放后可能进维护模式或缺少网络配置。
- 恢复时才找账号权限:跨团队审批会直接拖长 RTO。
- 把快照、备份、镜像混为一谈:三者对象、用途和恢复路径不同。
- 演练后忘记回收资源:临时 ECS、EIP、镜像和复制副本会持续产生费用。
- 只在同一可用区验证:区域级目标必须包含跨区域复制与目标区域发放。
八、购买与容量建议
规划华为云 ECS 时,应同时购买与 RPO/RTO 匹配的 CBR 存储库容量、备份策略和必要的跨区域复制能力。存储库容量不能只按当前磁盘已用空间估算,还要考虑保留周期、数据变化率、增长速度和演练副本。
如果恢复后要快速承接生产流量,目标区域还要预留可售 ECS 规格、EVS、EIP、ELB 和配额。对于严格 RTO,仅有跨区域备份可能仍不够,应评估预置网络、温备 ECS、数据库复制或多活架构。
华为云 CBR 的价值不在"控制台里有一条绿色备份记录",而在故障时能否按目标恢复。把每季度或每次重大变更后的恢复演练固定下来,记录 RPO、RTO 和失败点,才能把备份成本真正转化为业务连续性。