随着云原生、人工智能和智能体技术的快速发展,应用架构正从传统微服务逐步演进为由微服务、推理服务、智能体应用和多智能体协作系统共同组成的复杂运行环境。系统规模持续扩大,日志、指标、链路、事件和变更等运维数据快速增长,依赖人工经验完成异常发现、问题定位和故障处置的传统运维模式面临较大挑战。
Agentic Ops SIG 介绍
经 openFuyao 社区技术委员会审议通过,Agentic Ops SIG 正式成立并投入例行运作。该 SIG 面向云原生与 AI 时代的运维需求,围绕"数据统一、智能分析、根因推理、协同处置和闭环优化"开展技术探索,推动构建从可观测数据采集、异常检测、根因分析到故障处置的端到端智能运维技术体系。SIG 将以开放标准、开源组件和场景实践为基础,促进智能运维能力在不同基础设施、可观测平台和应用系统之间复用与协同。
Agentic Ops SIG 规划
构建统一的智能运维数据模型:
面向日志、指标、分布式链路、告警、事件、资源拓扑、配置变更和发布记录等多源异构运维数据,研究统一的对象定义、属性规范、关联关系和语义表达方式。通过对应用、服务、实例、容器、节点、调用关系和变更事件等运维实体进行标准化建模,打通不同类型数据之间的关联,形成面向智能分析的统一上下文,为异常检测、影响分析、根因定位和智能体推理提供一致、完整且可解释的数据基础。
完善面向复杂系统的智能分析能力:
围绕时序异常检测、日志模式聚类、调用链异常分析、服务拓扑分析等方向,沉淀通用算法、标准接口和参考实现,提升复杂故障的发现效率与分析准确性,形成可解释、可验证的故障证据链。
建设根因分析与智能运维 Agent 框架:
研究大模型与运维工具协同工作的技术架构,推动日志检索、指标查询、链路分析、配置查询、变更审计和知识检索等能力标准化封装。通过任务规划、工具调用、证据汇总、根因推理和验证执行,使智能运维 Agent 能够围绕告警和故障自主开展多轮分析,并输出具有依据的候选根因、影响范围和处置建议。
推动从辅助分析向自动化闭环演进:
在安全可控和人工确认机制下,逐步探索故障验证、预案推荐、自动扩缩容、配置修复、流量切换和版本回滚等闭环能力。同时建立智能运维效果评测体系,从故障发现时间、平均定位时间、根因准确率、告警压缩率和自动处置成功率等维度评估智能运维系统的实际效果。
通过上述技术方向,智能运维 SIG 将逐步形成"统一数据模型 → 智能异常分析 → 根因分析 Agent → 自动化处置闭环"的技术体系,为云原生应用、AI 推理服务和智能体应用提供更加高效、开放和可信的智能运维能力。
Agentic Ops SIG 运作
SIG 线上例会:
Agentic Ops SIG 每双周 召开一次线上例会,暂定于周三11:00-12:00。
涵盖社区进展同步、技术方案讨论、开源项目分享、用户场景交流和后续任务安排等。可查看官网(www.openfuyao.cn)开发者日历获取最新会议链接。

订阅SIG邮件列表:
进入下方链接,根据指引完成订阅后,将收到该SIG的技术交流、例会通知等邮件。您有任何技术方面的问题,也可以发送邮件进行交流探讨。
链接:
https://mailweb.openfuyao.cn/mailman3/lists/agentic-ops@list.openfuyao.cn/