阿里云运维手册(通用生产版|云上运维标准化文档)

阿里云运维手册(通用生产版|云上运维标准化文档)

适用:公有云 VPC 架构、传统业务 ECS 架构;ACK 容器场景可在此基础上扩展;专有云请参考飞天专有云官方运维 PDF。

目录

  1. 运维总则与账号安全规范
  2. 网络层(VPC、安全组、CLB/ALB/NLB、EIP)运维
  3. 计算层 ECS 运维(创建、巡检、备份、扩容、故障排查)
  4. 存储运维(云盘、OSS、NAS)
  5. 数据库运维(RDS MySQL/PostgreSQL、Redis)
  6. 监控告警体系(云监控 CloudMonitor、ARMS)
  7. 日常巡检清单(日 / 周 / 月)
  8. 变更管理规范
  9. 应急故障处理通用流程
  10. 备份与容灾策略
  11. 常用工具:云助手、OOS、堡垒机、aliyun CLI

一、运维总则 & 账号安全(最高优先级)

1.1 账号原则

  1. 禁止日常使用主账号,主账号仅用于充值、实名认证、全局风控;主账号开启 MFA 多因素认证,不创建 AccessKey。
  2. 所有运维人员使用 RAM 子账号 ,遵循最小权限
  3. AccessKey 管控:
    • 服务器程序使用 RAM 角色,不在实例内存放 AK;
    • 人工使用的 AK 定期轮换,泄露立即禁用;
    • 禁止把 AK 提交代码、Git、配置文件。

1.2 RAM 基础权限划分参考

  • 运维只读账号:仅查询监控、实例、日志,不能修改配置;
  • 资源运维账号:ECS、SLB、云盘启停 / 扩容,无删除高危权限;
  • DBA 账号:仅管理 RDS、Redis;
  • 自动化账号(OOS / 流水线):限定资源组 + 指定操作。

1.3 运维接入规范

  • 生产环境优先使用 堡垒机(BastionHost) 登录 ECS;
  • 关闭公网 SSH(22)、RDP(3389)直接暴露;仅内网堡垒机访问;
  • 安全组不允许 0.0.0.0/0 放行业务端口。

二、网络层运维(VPC 体系)

2.1 VPC 规划规范

  • 生产 / 测试环境独立 VPC 隔离,不要混用;
  • 网段规划预留扩容空间;
  • 跨 VPC 互通使用 云企业网 CEN / 私网连接 PrivateLink,不通过公网中转。

2.2 安全组运维标准

  1. 分层安全组:
    • DMZ 层(SLB):放行 80/443 公网入;
    • 应用层:仅允许 DMZ 安全组访问;
    • 数据库层:仅允许应用安全组访问,禁止公网开数据库端口
  2. 规则定期清理废弃 IP,禁止全端口开放。

2.3 负载均衡 ALB/CLB/NLB 运维要点

  1. 核心业务选择多可用区实例,避免单 AZ 故障;
  2. 开启访问日志,投递至 OSS;
  3. 健康检查配置标准:
    • HTTP:/health 接口,超时 2s,间隔 5s,不健康阈值 3 次;
  4. 故障常见现象:502/504
    • 排查顺序:健康检查是否失败 → 后端 ECS 防火墙 / 安全组 → 应用进程是否崩溃 → 连接数打满。

2.4 EIP & 带宽

  • 业务突发流量优先使用共享带宽包,避免单实例带宽封顶;
  • 闲置 EIP 及时释放,持续计费。

三、ECS 云服务器运维(核心)

3.1 实例选型建议

  • Web 业务:通用型 g;计算任务:计算型 c;数据库中间件:内存型 r;
  • IO 密集:ESSD 云盘 PL0/PL1;避免使用高效云盘跑数据库。

3.2 生命周期操作规范

  1. 创建:优先使用自定义镜像统一基线;初始化执行安全加固脚本;
  2. 扩容云盘
    • 控制台扩容云盘 → 进入系统扩容分区与文件系统(Linux growpart + resize2fs/xfs_growfs);
    • ⚠️ 云盘只支持扩容,不支持缩容,前期容量合理规划;
  3. 停机 / 重启:业务低峰执行;核心集群滚动重启,禁止一次性全部关机。

3.3 ECS 备份策略

  • 系统盘:自动快照策略(每日凌晨,保留 7 天);
  • 数据盘:业务数据优先落库 / OSS,快照作为应急;
  • 快照≠备份!数据库数据不能只依赖快照,必须开启 RDS 自动备份。

3.4 Linux ECS 常见故障排查清单

  1. 无法 SSH 登录
    • 安全组 22 端口、系统内部防火墙 firewalld/iptables;
    • 实例负载过高卡死、磁盘 100% 占用;
    • 内核参数 tcp_tw_recycle 导致 NAT 环境连接失败;
  2. CPU 高:top → 定位进程;突发性能实例查看CPU 积分耗尽
  3. IO 负载高:iostat、iotop,云盘 IOPS 打满;
  4. 磁盘满:df -h,清理日志、core 文件。

推荐使用阿里云【ECS 实例诊断工具】一键自检网络、磁盘、内核风险。

3.5 自动化运维工具

  • 云助手:无需公网端口,批量执行命令、上传脚本;
  • OOS 系统运维管理:编排自动化任务(批量重启、快照、定时巡检)。

四、存储运维

4.1 云盘

  • 重要数据不要只存单块云盘;
  • 定期清理无用快照,快照持续占用存储费用。

4.2 OSS 对象存储

  1. Bucket 权限:
    • 静态资源:公共读;业务上传桶:私有,使用 STS 临时授权;
  2. 开启生命周期:低频访问、归档,降低成本;
  3. 防盗链配置 Referer,防止恶意盗刷流量;
  4. 常见故障:跨域 CORS 报错、签名过期、地域不匹配。

4.3 NAS 文件存储

  • 适合多 ECS 共享目录;合理配置权限组;
  • 注意并发读写压力,避免大量小文件场景性能衰减。

五、数据库运维(RDS & Redis)

5.1 RDS MySQL

  1. 实例选型:生产一律高可用版(主备),不要基础版;核心业务多可用区;
  2. 备份配置:
    • 自动备份:业务低峰时段,保留 7~30 天;
    • 开启binlog,支持时间点恢复(PITR);
  3. 运维禁止操作:
    • 不要直接公网开放数据库;
    • 不使用 root 账号给应用,创建独立业务账号,最小库权限;
  4. 性能排查:
    • 开启 DAS 数据库自治服务,分析慢 SQL;
    • 监控指标:连接数使用率、IOPS、TPS、锁等待。

5.2 Redis 云数据库

  • 生产:主从版 / 集群版;单机版仅限测试;
  • 合理设置内存淘汰策略,避免 OOM;
  • 持久化 RDB/AOF 根据业务数据丢失容忍度配置;
  • 禁止大 key 长期存在,引发卡顿。

六、监控与告警体系(云监控 CloudMonitor)

6.1 必配置监控指标

ECS

CPU 使用率、内存使用率、磁盘使用率、磁盘 IOPS、网卡出入带宽、TCP 连接数

RDS

连接数使用率、CPU、磁盘空间、IO 延迟、慢查询数量

SLB

健康后端数量、QPS、5xx 错误码、响应延迟

Redis

内存使用率、命中率、客户端连接数

6.2 告警规范

  1. 分级:
    • P0(紧急,电话):业务中断、多实例宕机、数据库不可用;
    • P1(重要,企业微信 / 短信):CPU 持续高、磁盘即将占满;
    • P2(观察):日常水位预警;
  2. 抑制告警风暴:设置持续周期(如连续 5 分钟超过阈值才触发);
  3. 告警接收人值班轮换,告警发生必须登记故障台账。

6.3 应用层监控

复杂业务接入 ARMS 应用监控,追踪接口耗时、异常报错。


七、日常标准化巡检清单

日巡检(自动化告警为主,人工抽查)

  1. 查看云监控告警,确认所有告警闭环;
  2. 重点实例磁盘使用率,预警 > 85%;
  3. RDS/Redis 连接数、内存水位;
  4. SLB 健康后端服务器数量是否正常。

周巡检

  1. 安全组、RAM 权限审计,清理闲置账号;
  2. 快照数量与存储空间成本核查;
  3. 核查过期证书(SSL 证书服务);
  4. 慢 SQL 汇总,推动业务优化。

月巡检

  1. 资源规格评估,闲置实例缩容 / 释放;成本优化;
  2. 容灾演练验证(数据库恢复测试);
  3. 云上漏洞扫描(安全中心),修复高危漏洞。

八、变更管理规范(生产强制)

  1. 所有生产变更执行:变更方案 → 回滚方案 → 低峰窗口执行
  2. 高危变更清单(必须评审):
    • ECS 重启、规格升级;
    • RDS 参数修改、实例升降配;
    • SLB 监听、安全组大规模调整;
    • 数据库 DDL 语句;
  3. 变更前后保留监控截图,便于事后复盘。

九、通用应急故障处理 SOP

  1. 止损优先:先恢复业务,后定位根因;
  2. 信息收集:
    • 时间点、受影响业务、报错信息;
    • 云监控指标、SLB 访问日志、应用日志;
  3. 排查顺序: 网络(SLB / 安全组)→ 计算资源(ECS 负载 / 磁盘满)→ 中间件 / 数据库 → 应用代码;
  4. 阿里云支持渠道: 控制台提交工单;紧急故障拨打阿里云售后电话。

十、备份 & 容灾

  1. 区分两类备份:
    • 云盘快照:系统应急恢复;
    • 数据库逻辑备份 /binlog:业务数据可靠恢复;
  2. 定期恢复演练,不要只配置备份从不验证;
  3. 跨地域容灾:核心业务考虑跨地域复制(RDS 跨地域备份、OSS 跨区域复制)。

十一、阿里云常用运维命令(aliyun CLI 示例)

bash

复制代码
# 列出实例
aliyun ecs DescribeInstances --RegionId cn-hangzhou
# 查询实例事件(宕机、重启事件)
aliyun ecs DescribeInstanceHistoryEvents --InstanceId i-xxxx
相关推荐
雾时之林1 小时前
Linux---计算机网络常见面试题
linux·运维·计算机网络
维核科技2 小时前
多卡集群频繁裂卡、通信报错?NVLink故障排查与运维优化方案
运维·服务器维修·gpu维修·算力卡维修·gpu故障·算力卡故障·服务器故障
Promise微笑2 小时前
红外热像仪选型:3~5μm中波与8~14μm长波探测机理解析
运维
承渊政道2 小时前
飞牛NAS部署Immich:搭建家庭相册并实现远程访问
运维·服务器·docker·内网穿透·cpolar·nas·immich
橘色的喵2 小时前
EventPool 32-bit 带标签 CAS 池:RT-Thread 单核 + Linux 双平台无锁
linux·运维·服务器
buhuizhiyuci3 小时前
【Linux 网络篇】数据的 “循环系统“:协议认识与网络传输的流程
linux·运维·服务器·网络·vscode
雾时之林3 小时前
Linux------磁盘管理
linux·运维
数智工坊11 小时前
Zotero自建Ubuntu WebDAV附件同步方案(完美解决存储空间不足)
linux·运维·ubuntu
独隅12 小时前
GitHub Actions 自动化运维实战:CI/CD 流水线一体化效果展示
运维·自动化·github