业务高峰期,核心报表查询突然变慢,团队第一反应往往是翻日志、查监控、挨个登录节点排查。查询引擎、存储、导入链路、Compaction、内存占用,任何一个环节都可能是问题根源,定位一次问题动辄几个小时,还得靠对系统足够熟悉的人来判断从哪里查起。经验丰富的人不常在,新同事接手时更是无从下手。
现在这类问题,可以直接在镜舟 Manager 里跟 AI 说一句话,比如"这个查询为什么慢",剩下的排查交给 DevOps Agent 来做。
镜舟 DevOps Agent:一句话发起诊断
DevOps Agent 是内置在镜舟产品中的智能运维诊断助手。用户只需要用自然语言描述问题,AI 会结合集群的实时上下文和内置的专家诊断经验,自动给出诊断路径并生成排查步骤,最终给出结论和处理建议。
在系统里对 AI 助手说一句"这个查询为什么变慢",它会自动读取集群的拓扑结构和监控指标,按照专家沉淀下来的诊断方法逐步排查,最后给出结论。
1. 对话式诊断,聊天一样描述问题
DevOps Agent 支持多轮对话,用户可以追问、补充信息、随时切换排查方向。诊断过程中,AI 的每一步操作都是透明可见的,用户可以展开查看具体做了什么。系统还会自动感知当前集群的节点角色和拓扑信息,生成的排查动作会直接落到正确的节点上,不需要用户自己去确认"某个组件在哪台机器上"。
排查过程中,AI 可以直接调取监控指标,以时序图表的形式嵌入到对话中展示,让排查过程"边聊边看图",不用来回切换到监控系统。
2. 内置专家诊断经验,覆盖高频运维场景
这些诊断思路来自镜舟一线运维专家沉淀的方法论,目前已覆盖慢查询、节点异常(如内存暴涨、进程异常)、CPU 占用归因、数据导入失败、后台合并任务异常、数据分布健康度、负载均衡、资源隔离、高并发场景、外部数据源访问等常见运维场景,并会持续扩展。
3. 看懂系统,再动手排查
诊断效率的提升,靠的是一套后端强制执行的安全机制。这一点是 DevOps Agent 和直接把 AI 接到生产系统最大的区别。
-
只读诊断,自动放行:能被明确判定为只读的诊断动作(比如日志检索、状态查询、指标读取),经过安全校验后自动执行,全程留痕,并在对话中明确告知用户"已自动完成"。
-
写操作,必须人工确认:任何涉及变更的操作,或者无法证明是只读的动作,都会弹出审批,由用户逐条确认后才会执行。审批卡片会完整展示即将执行的内容,不做任何模糊处理。
-
高危动作,任何模式下都被拦截:比如尝试探测凭据、读取敏感文件等操作,不管在什么模式下都会被直接拦住,不会进入执行环节。
结语
排障过去很依赖资深工程师的经验和对系统的熟悉程度。现在,镜舟 DevOps Agent 把这些经验变成一套可以被更多人调用的能力,同时用足够扎实的安全机制,让AI 参与运维这件事,从一个听起来有风险的想法,变成一个可以放心交给团队使用的功能。
镜舟 DevOps Agent 目前已经支持通过 Manager 一并提供,配置好所使用的大模型接口就能开始用,无需额外部署组件。