运维的四个日常动作
数据库上生产后,日常运维绕不开四件事:监控告警、性能诊断、变更操作、故障应急。OceanBase 自带工具链覆盖了全部四个场景,这篇把核心知识点理清。
知识点一:OCP 是什么
OCP(OceanBase Cloud Platform)是 OceanBase 官方的运维管理平台,提供集群的全生命周期管理。核心价值在于把"命令行里敲几十条命令"变成"界面上点几下",同时内置了监控、诊断、告警、备份等全套能力。
部署方式两种:独立部署(单独装一台机器管理多个集群,适合大规模环境)和一体机(OCP 和 OceanBase 集群一起交付,适合中小规模)。
知识点二:监控指标怎么看
OCP 内置了数百个监控指标,日常盯这几个就够了:
| 类别 | 关键指标 | 异常信号 |
|---|---|---|
| 请求 | QPS、RT(响应时间)、错误率 | RT 突增、错误率升高 |
| 资源 | CPU、内存、磁盘、网络 | 磁盘快满、内存接近上限 |
| 存储 | MemStore 使用率、转储次数、合并进度 | 转储过于频繁、合并卡住 |
| 选举 | 分区 Leader 数、Leader 切换次数 | Leader 频繁切换(有节点不稳定) |
| 日志 | 日志同步延迟、日志盘使用率 | 日志盘接近打满(高危) |
特别要盯的是日志盘使用率:OceanBase 的 Redo Log 先写日志盘,日志盘满了整个集群就写不进去了,比数据盘满了更严重。
知识点三:告警配置原则
OCP 的告警规则内置了几十条(阈值可以自定义),建议的原则是:
- **三层告警:**紧急(集群不可用)、警告(性能下降)、提示(资源紧张),分别对应不同的响应动作。
- **告警收敛:**同一告警在 5 分钟内重复触发,只发一次,避免告警风暴。
- **告警通知:**支持短信、钉钉、企业微信、邮件等通道,建议至少配两个通道,一个挂了另一个兜底。
常见必配的告警:磁盘使用率 > 85%、Leader 切换次数 > 10 次/分钟、QPS 同比下降 > 50%、节点失联。
知识点四:性能诊断三板斧
OCP 的诊断能力主要通过三个模块:
- 慢 SQL 分析 ------ 自动抓取执行时间超过阈值的 SQL,展示执行计划、耗时分布、扫描行数。可以按"最慢 SQL"、"扫描最多 SQL"、"执行次数最多 SQL"排序,快速定位问题 SQL。
- TOP SQL 报表 ------ 按 CPU 消耗或 IO 消耗排名,找出最耗资源的 SQL。有些 SQL 单次执行不慢,但执行频率极高,总消耗巨大,TOP SQL 报表能把它们揪出来。
- 全链路 Trace ------ 每条 SQL 生成唯一 trace_id,OCP 能把这条 SQL 在客户端、OBProxy、OBServer、日志流等各环节的耗时串起来可视化,适合排查"请求到底卡在哪"。
知识点五:变更操作的安全姿势
OceanBase 的变更分两类,风险等级不同:
低风险变更(可以直接做):
- 加列(在线 DDL,不锁表)
- 加索引(在线创建,不阻塞读写)
- 扩资源池、扩 Unit(自动完成,业务无感)
高风险变更(需要停机窗口或灰度):
- 删列、改列类型(会触发大表重建)
- 减副本、改 Locality(涉及数据迁移)
- 大版本升级(3.x 升 4.x)
高风险变更的操作规范:先在测试环境演练,再选业务低峰期执行,过程中保持回退方案可用。
知识点六:OCP 的备份管理
OCP 内置了备份管理功能,支持两种备份:
- **数据备份:**全量备份 + 增量备份,基于快照实现,备份期间不阻塞业务。
- **日志归档:**把 Redo Log 持续归档到远端存储,用于恢复到任意时间点(PITR,Point-in-Time Recovery)。
备份策略的关键参数:备份保留天数(建议 ≥ 7 天)、备份存储位置(本地或 OSS/S3,生产建议远端)、备份窗口(避开业务高峰)。
知识点七:日常巡检清单
每天看一眼这几个指标,能避免大部分故障:
- **集群状态:**所有节点正常、无 Leader 频繁切换
- **资源水位:**CPU < 70%、内存 < 80%、磁盘 < 70%
- **合并状态:**昨日合并完成、耗时正常(< 2 小时)
- **备份状态:**昨日备份成功、日志归档无延迟
- **慢 SQL:**新增慢 SQL 有定位、有优化计划
小结
OCP 把 OceanBase 的运维从"黑盒"变成"白盒"------能看、能告警、能诊断、能管变更。运维的核心原则就一条:监控前置,告警收敛,变更灰度,故障有预案。工具只是手段,规范才是底线。