导读
华为云除了提供很多资源类服务来满足企业业务系统上云的需求之外,还需要保障好云上业务系统的正常运转及企业对于业务系统的监管等需求。
学完后,您将能够:
- 了解到一些关于运维、监控、审计方面的基础知识
- 熟悉 IAM、SMN、CTS、CES、LTS 等监控服务的定位、原理和功能特点
- 了解到华为云上常见的监管类服务的使用场景
目录
- 运维基础知识
- 统一身份认证服务 IAM
- 消息通知服务 SMN
- 云监控服务 CES
- 云日志服务 LTS
- 云审计服务 CTS
一、运维基础知识
1.1 什么是运维
运维(Operations and Maintenance)本意为运行维护。负责监控、管理设备或系统,保障业务的正常运行。处理工作中遇到的各种问题并总结经验教训,优化提高运维的效率和质量。
本质:对服务器、网络等设备及服务的生命周期各个阶段的运营与维护,在成本、稳定性、效率上达成一致可接受的状态。
运维的目标:确保系统的稳定性、可靠性和安全性,提高系统的性能和可用性,保证业务的连续性和高效性。
1.2 运维人员的职责
运维人员的职责是根据业务需要规划信息、网络、服务,通过网络监控、事件预警、业务调度、排障升级等手段,使服务处于长期稳定可用状态。
1.3 自动化运维时代的到来
传统的人工运维正在逐渐被自动化运维平台所替代,运维人员与开发人员也在面向融合,运维开发一体化的概念正在被越来越多的企业内部关注和应用。
| 对比项 | 传统运维 | 自动化运维 |
|---|---|---|
| 执行方式 | 人工进行操作或处理 | 由人工执行转为自动操作(执行脚本或使用自动化工具) |
| 响应速度 | 需要一定时间来响应和解决问题 | 出现问题时自动检测并快速响应 |
| 出错率 | 容易出现人为错误 | 减少故障处理的时间和错误率,提升运维效率 |
| 操作一致性 | 可根据实际情况灵活操作 | 保证操作的一致性,减少人为错误 |
| 人力成本 | 需要大量人力投入 | 需要一定技术成本,但可减少人力成本 |
1.4 云时代运维的变迁
| 层次 | 传统运维 | 云上运维 |
|---|---|---|
| 数据中心 | 用户自行管理 | 云服务商管理 |
| 网络/存储/服务器 | 用户自行管理 | 云服务商管理 |
| 虚拟化/操作系统 | 用户自行管理 | 云服务商管理 |
| 中间件/运行环境 | 用户自行管理 | 用户自行管理 |
| 应用/数据 | 用户自行管理 | 用户自行管理 |
- IaaS:用户管理操作系统及以上,云服务商管理以下
- PaaS:用户管理应用和数据,云服务商管理运行环境及以下
- SaaS:用户直接使用,云服务商管理全部
1.5 华为云上的安全性
安全性是华为云与用户的共同责任。

二、统一身份认证服务 IAM
2.1 什么是 IAM
IAM(Identity and Access Management),又叫统一身份认证管理服务,是华为云提供权限管理的基础服务,可以帮助用户安全地控制华为云服务和资源的访问权限。
当用户想要共享资源给其他人,但又不想共享自己的账号和密码时,可以通过创建 IAM 用户来实现。
IAM 服务的主要能力:身份凭证、安全管理、权限管理、资源委托、身份提供商。

2.2 权限管理
权限根据授权的精细程度,分为角色 和策略。
| 类型 | 粒度 | 说明 |
|---|---|---|
| 角色 | 粗粒度 | IAM 最初提供的授权能力,部分云服务不支持,无法完全达到企业对权限最小化的安全管控要求 |
| 策略 | 细粒度 | 最新提供的授权能力,可精确到具体操作、资源、条件,满足企业权限最小化要求 |
系统策略:云服务在 IAM 预置的常用授权项,只能使用不能修改。
自定义策略:系统策略无法满足时,管理员可创建自定义策略,支持可视化视图和 JSON 视图两种配置方式,是对系统策略的扩展和补充。
2.3 委托
委托根据委托对象不同,分为两种:
| 委托类型 | 说明 |
|---|---|
| 委托其他账号 | 将自己账号中的资源操作权限委托给更专业、高效的其他账号,被委托账号可代替用户进行资源运维 |
| 委托其他云服务 | 云服务之间需要协同工作时,将操作权限委托给该服务,让其以你的身份使用其他云服务 |

2.4 项目与企业项目
- 项目:区域默认对应一个项目,系统预置,用来隔离物理区域间的资源。可在区域默认项目中创建子项目,实现更精细的权限控制。
- 企业项目 :项目的升级版,针对企业不同项目间资源的分组和管理,是逻辑隔离。企业项目中可包含多个区域的资源,且资源可迁入迁出。

2.5 资源的精细访问控制
使用 IAM 的用户管理功能,给员工或应用程序创建 IAM 用户,并授予刚好能完成工作所需的权限。IAM 用户使用自己单独的用户名和密码登录华为云,避免分享账号密码。

2.6 跨账号的资源操作与授权
通过 IAM 的委托功能,可将资源委托给代运维公司管理。代运维公司使用自己的账号对委托资源进行运维,委托关系变化时可随时修改或撤销授权。

2.7 使用企业已有账号登录华为云
通过 IAM 的身份提供商功能,建立企业与华为云的信任关系,员工可使用企业已有账号直接登录华为云,实现单点登录(SSO),无需在华为云重新创建 IAM 用户。

2.8 应用场景:多运维人员权限设置
XX 公司购买了多种资源,多个职能团队需要使用不同资源,通过 IAM 权限管理功能实现多运维人员权限分配。
三、消息通知服务 SMN
3.1 什么是 SMN
消息通知服务(Simple Message Notification,SMN)是可靠的、可扩展的、海量的消息处理服务。依据用户需求主动推送通知消息,最终用户可通过短信、电子邮件等方式接收。
通过 SMN,用户可以高效便宜地将消息推送给电子邮箱、手机号码以及 HTTP(S) 应用程序。
3.2 产品架构
SMN 的主题订阅模型提供一对多的消息订阅及通知功能。
- 发布者:通过主题发布消息(云资源:CES、OBS、AS 等)
- 订阅者:邮箱地址、手机号码、函数、URL 地址
- SMN:将消息推送给主题订阅者
支持多种协议:Email、SMS、HTTP(S)、FunctionGraph。
3.3 常见基本概念
| 概念 | 说明 |
|---|---|
| 主题 | 消息发布或客户端订阅通知的特定事件类型,是发布者和订阅者相互交流的通道 |
| 订阅 | 将订阅者注册到主题的操作,终端节点可以是手机号码、邮箱地址、函数或 HTTP(S) 终端 |
| 消息模板 | 消息的固定格式,发布消息时可使用已创建的消息模板向订阅者发送消息 |
3.4 应用场景

| 场景 | 说明 |
|---|---|
| 系统告警 | 由预定义阈值触发的通知,通过邮件、短信、HTTP/HTTPS 发送给特定用户 |
| 与云服务集成 | 将 SMN 作为消息连接不同云服务,降低系统复杂度,实现服务解耦 |
| 错峰流控 | 上下游系统处理能力有差异时,用 SMN 转储通信数据,提供消息堆积缓冲能力 |
四、云监控服务 CES
4.1 什么是 CES
云监控服务(Cloud Eye Service,CES)为用户提供针对弹性云服务器、带宽等资源的立体化监控平台。使用户全面了解华为云上的资源使用情况、业务运行状况,并及时收到异常报警做出反应,保证业务顺畅运行。
4.2 CES 的优势
| 优势 | 说明 |
|---|---|
| 实时可靠 | 监控数据实时采集 |
| 监控可视化 | 自定义监控面板 |
| 多种通知方式 | 邮件、短信、HTTP/HTTPS |
| 批量创建告警规则 | 高效配置 |
| Free | 免费使用 |
| 自动开通 | 无需手动开通 |
4.3 产品架构
云监控服务为用户提供立体化监控平台,覆盖多个 Region。

4.4 监控面板和监控指标
- 监控面板:自定义查看监控数据,将核心服务监控指标集中呈现在一张面板里
- 监控指标:云平台上某个资源某个维度状态的量化值,如 CPU 使用率、内存使用率

4.5 主机监控
主机监控分为:
| 类型 | 说明 |
|---|---|
| 基础监控 | 基础资源指标 |
| 操作系统监控 | 丰富的 OS 层面监控指标 |
| 进程监控 | 进程级监控 |
可通过主机监控采集操作系统层面监控指标,进行资源使用情况监控和故障排查。

4.6 事件监控
事件监控提供事件类型数据上报、查询和告警功能。事件是云监控服务保存并监控的云服务资源的关键操作,如删除虚拟机、重启虚拟机等。
通过事件可以了解:谁在什么时间对系统哪些资源做了什么操作。
4.7 云服务监控
云监控服务基于云服务自身的服务属性,已内置详细全面的监控指标。开通云服务后,系统自动关联该服务的监控指标。

4.8 站点监控
站点监控用于模拟真实用户对远端服务器的访问,探测远端服务器的可用性、连通性。可探测域名、IP 的可用性、访问响应时间、丢包率,并对结果告警。
4.9 告警功能
用户对云服务核心监控指标设置告警规则,触发告警条件时,支持以邮箱、短信、HTTP、HTTPS 等方式通知用户。

4.10 应用场景:xx 业务平台监控
- 核心数据库:BMS 集群方式部署
- Web-Server 与 API-Server:部署在 ECS 上
- 主机监控 + 事件监控:监控 ECS 与 BMS 运行状况(CPU、内存、磁盘)
- 站点监控:监控网站与接口可用性、响应时间、丢包率
- 网络监控:VPC、NAT、ELB 等网络状态

五、云日志服务 LTS
5.1 什么是 LTS
云日志服务(Log Tank Service,LTS)用于收集来自主机和云服务的日志数据,通过海量日志数据的分析与处理,将云服务和应用程序的可用性和性能最大化。提供实时、高效、安全的日志处理能力,可快速进行实时决策分析、设备运维管理、用户业务趋势分析。

5.2 基本概念
| 概念 | 说明 |
|---|---|
| 日志组(LogGroup) | 云日志服务进行日志管理的基本单位,可创建日志流及设置日志存储时间 |
| 日志流(LogStream) | 日志读写的基本单位,日志组中可创建日志流,方便对日志进一步分类管理 |
| ICAgent | 云日志服务的日志采集工具,运行在需要采集日志的主机中 |

5.3 日志接入
| 接入方式 | 说明 |
|---|---|
| 云服务接入 | 支持多个云服务日志接入,选择不同云服务查看接入方式 |
| 自建软件接入 | 将主机待采集日志路径配置到日志流中,ICAgent 按规则采集 |
| API/SDK 接入 | 通过 API/SDK 将日志接入云日志服务 |
| 其他(跨账号接入) | 通过创建委托,将委托账号的日志流映射到当前账号 |

5.4 日志查询
日志在界面实时查看与搜索,上下文关联,定位更准确。
5.5 结构化分析日志
日志结构化是以日志流为单位,通过不同日志提取方式将日志进行结构化,提取固定格式或相似程度较高的日志,过滤不相关日志,以便按 SQL 语法查询分析。
- 可对任意格式提取字段
- 简单 UI 操作自动生成正则拆分规则

5.6 日志可视化
对结构化后的日志字段进行 SQL 查询与分析。原始日志结构化后等待 1~2 分钟即可查询分析。

5.7 告警中心
告警中心配置流程:
- Step1:创建统计规则
- Step2:配置触发条件
- Step3:设置告警通知
- Step4:配置告警通知
- Step5:告警中心生效

5.8 日志转储
- 日志默认存储时间为 7 天
- 创建日志组时可设置存储时间(1-365 天)
- 超出存储时间自动删除
- 转储功能:将日志转储至其他云服务长期保存

5.9 应用场景:运维日志平台
企业应用运维日志分散在不同虚机上,LTS 提供集中管理平台。
优势:
- 全托管式:日志采集、存储、老化、搜索和转储
- 海量日志管理:支持每天百 TB 级日志接入,十亿级日志秒级搜索
- 性价比高:维护成本低,按需计费

六、云审计服务 CTS
6.1 什么是审计
审计(Auditing)是对资料作出证据搜集及分析,以评估企业财务状况,然后就资料及一般公认准则之间的相关程度作出结论及报告。
在 ICT 行业中,审计主要涉及整个信息系统的生命周期。审计主要对比:
- 企业财务报表
- 实际运营情况
6.2 什么是 CTS
云审计服务(Cloud Trace Service,CTS)主要提供云账户下资源的操作记录。通过操作记录,用户可实现安全分析、资源变更、合规审计、问题定位等功能。可配置 OBS 对象存储,将操作记录实时同步保存至 OBS。

6.3 CTS 的优势
| 传统审计 | 云审计 |
|---|---|
| 无法执行标准化审计流程 | 实时记录:迅速收集操作事件 |
| 系统配置变更需 IT 人员手工统计 | 完整记录:可记录管理控制台、开放 API、系统内部操作 |
| 人工记录存储,无多副本,安全隐患 | 可靠低成本:周期性生成事件文件,低成本长久保存(OBS) |
6.4 安全分析
每条事件均记录:哪个用户、在什么时间、从哪个 IP 发起了操作请求。通过安全性分析和用户行为模式检测,对关键操作配置消息通知。
6.5 资源变更
每条事件记录一次资源变更及结果,用户可统计和追溯资源使用情况。
- 所有变更类操作都被审计服务记录
- 配置关键类操作消息通知
- 账号下所有变更操作长久保存
- 通过日志查询资源变更详细信息

6.6 故障定位
CTS 事件会记录失败操作的原因,用户可根据原因轻松排除操作性故障。例如扩容云主机时删除了系统卷导致创建失败,通过事件记录可直观找到原因。
6.7 合规审计
操作记录和查询能力帮助用户符合内部策略和监管标准,满足 IT 合规设计认证要求(金融云、可信云等)。
- 审计服务记录用户所有操作日志
- 启用日志文件加密,OBS 桶中日志被加密
- 日志被读取时系统解密并校验完整性
- 最终日志审计完成
6.8 应用场景:通过 CTS 进行资源监控
- CTS 实时记录公有云账户对各云服务资源的操作和结果
- 函数工作流服务创建 CTS 触发器获取订阅的资源操作信息
- 自定义函数对操作信息分析处理,产生告警日志
- SMN 通过短信和邮件推送告警信息
案例:通过 CTS 快速完成日志分析,对指定 IP 进行过滤。基于 Serverless 无服务架构的函数计算提供数据加工、分析、事件触发、弹性伸缩、无需运维、按需付费。

七、总结
运维服务在平时感觉似乎可有可无,但往往在关键时候起到至关重要的作用:
- 审计服务:更安全地管控平台
- 监控服务:实时掌握平台运行状况
- 日志服务:随时获取底层各种日志信息,评估可能发生的风险
八、术语和缩略语
| 缩略语 | 全称 | 中文 |
|---|---|---|
| API | Application Programming Interface | 应用编程接口 |
| AZ | Availability Zone | 可用区 |
| AS | Auto Scaling | 弹性伸缩 |
| BMS | Bare Metal Server | 裸金属服务器 |
| CBR | Cloud Backup and Recovery | 云备份 |
| CTS | Cloud Trace Service | 云审计服务 |
| CES | Cloud Eye Service | 云监控服务 |
| DHCP | Dynamic Host Configuration Protocol | 动态主机配置协议 |
| ECS | Elastic Cloud Server | 弹性云服务器 |
| EVS | Elastic Volume Service | 云硬盘 |
| HA | High Available | 高可用 |
| HTTP | Hypertext Transfer Protocol | 超文本传输协议 |
| HTTPS | Hypertext Transfer Protocol over SSL | 安全套接字层的超文本传输协议 |
| IAM | Identity and Access Management | 统一身份认证服务 |
| IDP | Identity Provider | 身份提供商 |
| IOPS | Input/Output Per Second | 每秒读写操作次数 |
| KMS | Key Management Service | 密钥管理服务 |
| LTS | Log Tank Service | 云日志服务 |
| OBS | Object Storage Service | 对象存储服务 |
| O&M | Operations and Maintenance | 操作维护(运维) |
| RTO | Recovery Time Objective | 恢复时间目标 |
| RPO | Recovery Point Objective | 数据恢复点目标 |
| SDK | Software Development Kit | 软件开发工具包 |
| SFS | Scalable File Service | 弹性文件服务 |
| SSD | Solid-State Drive | 固态硬盘 |
| SDRS | Storage Disaster Recovery Service | 存储容灾服务 |
| SAML | Security Assertion Markup Language | 安全断言标记语言 |