阿里云运维手册(通用生产版|云上运维标准化文档)
适用:公有云 VPC 架构、传统业务 ECS 架构;ACK 容器场景可在此基础上扩展;专有云请参考飞天专有云官方运维 PDF。
目录
- 运维总则与账号安全规范
- 网络层(VPC、安全组、CLB/ALB/NLB、EIP)运维
- 计算层 ECS 运维(创建、巡检、备份、扩容、故障排查)
- 存储运维(云盘、OSS、NAS)
- 数据库运维(RDS MySQL/PostgreSQL、Redis)
- 监控告警体系(云监控 CloudMonitor、ARMS)
- 日常巡检清单(日 / 周 / 月)
- 变更管理规范
- 应急故障处理通用流程
- 备份与容灾策略
- 常用工具:云助手、OOS、堡垒机、aliyun CLI
一、运维总则 & 账号安全(最高优先级)
1.1 账号原则
- 禁止日常使用主账号,主账号仅用于充值、实名认证、全局风控;主账号开启 MFA 多因素认证,不创建 AccessKey。
- 所有运维人员使用 RAM 子账号 ,遵循最小权限。
- AccessKey 管控:
- 服务器程序使用 RAM 角色,不在实例内存放 AK;
- 人工使用的 AK 定期轮换,泄露立即禁用;
- 禁止把 AK 提交代码、Git、配置文件。
1.2 RAM 基础权限划分参考
- 运维只读账号:仅查询监控、实例、日志,不能修改配置;
- 资源运维账号:ECS、SLB、云盘启停 / 扩容,无删除高危权限;
- DBA 账号:仅管理 RDS、Redis;
- 自动化账号(OOS / 流水线):限定资源组 + 指定操作。
1.3 运维接入规范
- 生产环境优先使用 堡垒机(BastionHost) 登录 ECS;
- 关闭公网 SSH(22)、RDP(3389)直接暴露;仅内网堡垒机访问;
- 安全组不允许
0.0.0.0/0放行业务端口。
二、网络层运维(VPC 体系)
2.1 VPC 规划规范
- 生产 / 测试环境独立 VPC 隔离,不要混用;
- 网段规划预留扩容空间;
- 跨 VPC 互通使用 云企业网 CEN / 私网连接 PrivateLink,不通过公网中转。
2.2 安全组运维标准
- 分层安全组:
- DMZ 层(SLB):放行 80/443 公网入;
- 应用层:仅允许 DMZ 安全组访问;
- 数据库层:仅允许应用安全组访问,禁止公网开数据库端口。
- 规则定期清理废弃 IP,禁止全端口开放。
2.3 负载均衡 ALB/CLB/NLB 运维要点
- 核心业务选择多可用区实例,避免单 AZ 故障;
- 开启访问日志,投递至 OSS;
- 健康检查配置标准:
- HTTP:/health 接口,超时 2s,间隔 5s,不健康阈值 3 次;
- 故障常见现象:502/504
- 排查顺序:健康检查是否失败 → 后端 ECS 防火墙 / 安全组 → 应用进程是否崩溃 → 连接数打满。
2.4 EIP & 带宽
- 业务突发流量优先使用共享带宽包,避免单实例带宽封顶;
- 闲置 EIP 及时释放,持续计费。
三、ECS 云服务器运维(核心)
3.1 实例选型建议
- Web 业务:通用型 g;计算任务:计算型 c;数据库中间件:内存型 r;
- IO 密集:ESSD 云盘 PL0/PL1;避免使用高效云盘跑数据库。
3.2 生命周期操作规范
- 创建:优先使用自定义镜像统一基线;初始化执行安全加固脚本;
- 扩容云盘 :
- 控制台扩容云盘 → 进入系统扩容分区与文件系统(Linux growpart + resize2fs/xfs_growfs);
- ⚠️ 云盘只支持扩容,不支持缩容,前期容量合理规划;
- 停机 / 重启:业务低峰执行;核心集群滚动重启,禁止一次性全部关机。
3.3 ECS 备份策略
- 系统盘:自动快照策略(每日凌晨,保留 7 天);
- 数据盘:业务数据优先落库 / OSS,快照作为应急;
- 快照≠备份!数据库数据不能只依赖快照,必须开启 RDS 自动备份。
3.4 Linux ECS 常见故障排查清单
- 无法 SSH 登录
- 安全组 22 端口、系统内部防火墙 firewalld/iptables;
- 实例负载过高卡死、磁盘 100% 占用;
- 内核参数 tcp_tw_recycle 导致 NAT 环境连接失败;
- CPU 高:top → 定位进程;突发性能实例查看CPU 积分耗尽;
- IO 负载高:iostat、iotop,云盘 IOPS 打满;
- 磁盘满:
df -h,清理日志、core 文件。
推荐使用阿里云【ECS 实例诊断工具】一键自检网络、磁盘、内核风险。
3.5 自动化运维工具
- 云助手:无需公网端口,批量执行命令、上传脚本;
- OOS 系统运维管理:编排自动化任务(批量重启、快照、定时巡检)。
四、存储运维
4.1 云盘
- 重要数据不要只存单块云盘;
- 定期清理无用快照,快照持续占用存储费用。
4.2 OSS 对象存储
- Bucket 权限:
- 静态资源:公共读;业务上传桶:私有,使用 STS 临时授权;
- 开启生命周期:低频访问、归档,降低成本;
- 防盗链配置 Referer,防止恶意盗刷流量;
- 常见故障:跨域 CORS 报错、签名过期、地域不匹配。
4.3 NAS 文件存储
- 适合多 ECS 共享目录;合理配置权限组;
- 注意并发读写压力,避免大量小文件场景性能衰减。
五、数据库运维(RDS & Redis)
5.1 RDS MySQL
- 实例选型:生产一律高可用版(主备),不要基础版;核心业务多可用区;
- 备份配置:
- 自动备份:业务低峰时段,保留 7~30 天;
- 开启binlog,支持时间点恢复(PITR);
- 运维禁止操作:
- 不要直接公网开放数据库;
- 不使用 root 账号给应用,创建独立业务账号,最小库权限;
- 性能排查:
- 开启 DAS 数据库自治服务,分析慢 SQL;
- 监控指标:连接数使用率、IOPS、TPS、锁等待。
5.2 Redis 云数据库
- 生产:主从版 / 集群版;单机版仅限测试;
- 合理设置内存淘汰策略,避免 OOM;
- 持久化 RDB/AOF 根据业务数据丢失容忍度配置;
- 禁止大 key 长期存在,引发卡顿。
六、监控与告警体系(云监控 CloudMonitor)
6.1 必配置监控指标
ECS
CPU 使用率、内存使用率、磁盘使用率、磁盘 IOPS、网卡出入带宽、TCP 连接数
RDS
连接数使用率、CPU、磁盘空间、IO 延迟、慢查询数量
SLB
健康后端数量、QPS、5xx 错误码、响应延迟
Redis
内存使用率、命中率、客户端连接数
6.2 告警规范
- 分级:
- P0(紧急,电话):业务中断、多实例宕机、数据库不可用;
- P1(重要,企业微信 / 短信):CPU 持续高、磁盘即将占满;
- P2(观察):日常水位预警;
- 抑制告警风暴:设置持续周期(如连续 5 分钟超过阈值才触发);
- 告警接收人值班轮换,告警发生必须登记故障台账。
6.3 应用层监控
复杂业务接入 ARMS 应用监控,追踪接口耗时、异常报错。
七、日常标准化巡检清单
日巡检(自动化告警为主,人工抽查)
- 查看云监控告警,确认所有告警闭环;
- 重点实例磁盘使用率,预警 > 85%;
- RDS/Redis 连接数、内存水位;
- SLB 健康后端服务器数量是否正常。
周巡检
- 安全组、RAM 权限审计,清理闲置账号;
- 快照数量与存储空间成本核查;
- 核查过期证书(SSL 证书服务);
- 慢 SQL 汇总,推动业务优化。
月巡检
- 资源规格评估,闲置实例缩容 / 释放;成本优化;
- 容灾演练验证(数据库恢复测试);
- 云上漏洞扫描(安全中心),修复高危漏洞。
八、变更管理规范(生产强制)
- 所有生产变更执行:变更方案 → 回滚方案 → 低峰窗口执行;
- 高危变更清单(必须评审):
- ECS 重启、规格升级;
- RDS 参数修改、实例升降配;
- SLB 监听、安全组大规模调整;
- 数据库 DDL 语句;
- 变更前后保留监控截图,便于事后复盘。
九、通用应急故障处理 SOP
- 止损优先:先恢复业务,后定位根因;
- 信息收集:
- 时间点、受影响业务、报错信息;
- 云监控指标、SLB 访问日志、应用日志;
- 排查顺序: 网络(SLB / 安全组)→ 计算资源(ECS 负载 / 磁盘满)→ 中间件 / 数据库 → 应用代码;
- 阿里云支持渠道: 控制台提交工单;紧急故障拨打阿里云售后电话。
十、备份 & 容灾
- 区分两类备份:
- 云盘快照:系统应急恢复;
- 数据库逻辑备份 /binlog:业务数据可靠恢复;
- 定期恢复演练,不要只配置备份从不验证;
- 跨地域容灾:核心业务考虑跨地域复制(RDS 跨地域备份、OSS 跨区域复制)。
十一、阿里云常用运维命令(aliyun CLI 示例)
bash
# 列出实例
aliyun ecs DescribeInstances --RegionId cn-hangzhou
# 查询实例事件(宕机、重启事件)
aliyun ecs DescribeInstanceHistoryEvents --InstanceId i-xxxx