运维类服务实践实验 ------ 云审计、云监控、云日志全流程操作
本文基于华为云实验环境,完整记录了云审计服务(CTS)、云监控服务(CES)和云日志服务(LTS)的配置与使用过程,涵盖关键操作通知、告警规则、日志采集等核心功能,适合初学者参考。
一、实验背景与目的
1.1 实验简介
本实验通过实际操作,完成以下任务:
- 开通并配置云审计服务,追踪云资源操作事件;
- 配置消息通知服务(SMN),实现关键操作短信告警;
- 使用云监控服务监控弹性云服务器(ECS)的 CPU 等指标,并创建告警规则;
- 模拟 CPU 负载升高,触发告警并排查问题;
- 使用云日志服务采集 ECS 系统日志,并进行检索。
1.2 学习目标
- 理解云审计如何记录操作轨迹;
- 掌握云监控的告警配置与故障定位方法;
- 学会使用云日志服务查看、搜索日志。
二、云审计服务(CTS)------ 关键操作通知
2.1 开启追踪器
-
登录华为云控制台,创建一台 ECS(规格:1核2GB,CentOS 7.8)。
-
在服务列表搜索"云审计"并进入。
-
系统会自动创建一个默认追踪器,状态为"正常"即表示已生效。
追踪器会自动关联当前租户所有云服务操作,事件默认保存 7 天,可配置转储至 OBS 长期保存。
2.2 配置关键操作通知(结合 SMN)
- 在云审计左侧栏点击"关键操作通知" → "创建关键操作通知"。
- 填写参数:
- 通知名称:
keyOperate_info_notify(可自定义) - 操作类型:自定义
- 操作列表:选择
ECS - ecs:DeleteServer、ecs:RebootServer - 配置用户:不指定(即所有用户)
- SMN 主题:需提前创建(若无,则跳转至消息通知服务新建)
- 通知名称:
2.3 消息通知服务(SMN)配置
- 进入"消息通知服务" → "主题管理" → "创建主题"(名称自定,如
ecs-notify)。 - 为主题添加订阅:
- 协议:选择"短信"
- 订阅终端:填写自己的手机号
- 点击确定后,手机会收到确认短信,点击链接完成订阅,状态变为"已确认"。
- 可先发布测试消息(如内容 "hello"),验证短信接收是否正常。
2.4 完成关键操作通知
- 返回云审计服务,在创建关键操作通知时,选择已创建的主题,完成创建。
- 随后在 ECS 列表中对云服务器执行"重启"操作。
- 数秒内手机将收到华为云发送的重启操作通知短信。
2.5 查看事件列表
- 在云审计服务左侧"事件列表"中,可查看近 7 天的所有操作记录,包括时间、操作者、资源类型等。
- 实验结论:云审计能有效追踪操作行为,结合 SMN 可实现实时告警,方便安全审计和运维追溯。
三、云监控服务(CES)------ 监控弹性云服务器
3.1 查看监控指标
- 在服务列表搜索"云监控服务 CES"并进入。
- 点击"主机监控",找到目标 ECS,点击"查看监控指标"。
- 可看到 CPU 利用率、内存使用率、磁盘读写等基础指标。
- 若插件未安装,可一键安装(默认已装)。
3.2 创建告警规则
- 在主机监控页面,点击对应 ECS 右侧的"创建告警规则"。
- 配置参数(示例):
- 名称:
alarm-ecs - 告警类型:指标
- 云产品:弹性云服务器
- 资源层级:云产品
- 监控范围:指定资源(选中当前 ECS)
- 触发规则:自定义
- 告警策略:每 5 分钟告警一次,CPU 使用率 > 90% 触发(级别:重要)
- 发送通知:关闭(为实验简化,可开启)
- 名称:
- 点击"立即创建",返回告警规则列表,状态为"已启用"即成功。
3.3 模拟 CPU 负载升高,触发告警
-
使用 root 用户远程登录 ECS。
-
执行以下命令,使 CPU 占用飙升(计算圆周率):
bash
bashecho "scale=800000;4*a(1)" | bc -l -q(该命令会启动 bc 计算,CPU 利用率迅速升至 100%)
-
回到云监控页面,刷新主机监控或查看监控图表,CPU 使用率明显升高。
-
进入"告警 → 告警记录",可以看到告警状态变为"告警中",原因是 CPU 使用率超过 90%。
3.4 排查和恢复
-
再次登录 ECS,执行
top命令,查看高 CPU 进程(如bc进程,PID 示例 4210)。 -
终止该进程:
bash
bashkill -9 4210 -
再次
top确认进程已结束,CPU 恢复正常。 -
回到云监控,告警记录会逐渐恢复为"已解决"。
思考:云监控配合告警机制能快速发现资源异常,并通过指标定位问题进程,是运维的必备手段。
四、云日志服务(LTS)------ 查看云服务器日志
4.1 创建日志组和日志流
- 在服务列表搜索"LTS"进入云日志服务。
- 点击"日志管理" → "创建日志组",填写名称和存储时间(如 7 天)。
- 在日志组内点击"创建日志流",输入名称。
4.2 安装 ICAgent(日志采集工具)
-
进入"主机管理" → "安装 ICAgent"。
-
选择区域内主机(Linux),获取 AK/SK(在"我的凭证"中管理)。
-
复制系统生成的安装命令(包含 region、projectid 等参数),手动替换其中的 AK/SK。
⚠️ 注意:实际生产中切勿泄露 AK/SK,本实验为测试环境。
-
使用 SSH 以 root 用户登录 ECS,粘贴执行命令,等待显示
ICAgent install success。 -
返回"主机管理"页面,查看主机状态变为"运行",表示 ICAgent 已正常工作。
4.3 配置日志采集规则
- 在 LTS 控制台选择"云主机 ECS → 文本日志"。
- 选择刚才创建的日志组和日志流,点击"下一步"。
- 新建主机组,选择已安装 ICAgent 的 Linux 主机,完成主机组创建。
- 配置采集路径,例如
/var/log/messages(系统日志),其他选项保持默认,提交。 - 在"结构化配置"阶段选择"跳过并提交",完成接入。
4.4 查看和搜索日志
-
进入"日志管理",点击日志流名称。
-
在 ECS 上手动生成一条日志:
bash
bashecho "test log from user" >> /var/log/messages -
在日志流页面选择"实时日志",等待几分钟,即可看到新产生的日志。
-
切换到"原始日志",输入关键词(如
error)进行搜索,可快速过滤。
收获:云日志服务集中管理分散的服务器日志,结合关键词检索,极大提高排查效率。
五、实验收尾 ------ 资源删除
为避免产生持续费用,实验完成后需清理资源:
- 删除 ECS 实例;
- 删除告警规则;
- 删除日志组和日志流;
- 删除 SMN 主题及订阅;
- 确认 VPC、安全组等关联资源已释放。
六、自主练习作业(可选)
- 创建一台弹性云服务器;
- 为该服务器配置云审计关键操作通知;
- 变更该服务器的规格(如升级 CPU/内存);
- 通过云审计服务查看变更事件,验证审计记录是否完整。
通过这个练习,可以加深对云审计事件跟踪的理解。
七、总结
本次实验覆盖了华为云三大运维服务的核心功能:
- 云审计:记录所有 API 操作,结合 SMN 实现操作告警;
- 云监控:实时监控资源指标,自定义告警策略,帮助快速定位故障;
- 云日志:统一采集、存储和检索日志,是问题诊断的利器。
这些服务相互配合,构成了云上运维的"可观测性"基础,无论是日常巡检还是应急响应,都不可或缺。希望这份笔记能为你的云运维学习提供参考。
📌 本文仅作学习记录,实际操作时请遵循安全规范,保护好账号凭证。如有疑问,欢迎留言交流。