夜莺监控发布V9正式版,引入AI

核心要点

  • 夜莺 v9.0.0 正式版已发布,从 v8.5.1 到 v9.0.0 历时半年、前后端合计上千个提交,是夜莺历史上体量最大的一次大版本迭代。
  • v9 的头号主线是 Nightingale AI:内置 AI 助手、20+ 个开箱即用的 Skill、大模型(LLM)集中配置管理,并可按页面智能推荐提示词。
  • 夜莺内置了 MCP Server 与 A2A 协议端点,默认只读、白名单开写,Claude、Cursor 等 AI 客户端可以直接把夜莺当工具用。
  • 告警规则支持 「测试触发」:不用等条件满足,就能把「查询校验 → 阈值判断 → 事件生成 → 事件流水线 → 通知发送」整条链路演练一遍并给出分阶段报告。
  • 全新一代 日志浏览 统一支持 Elasticsearch、Loki、VictoriaLogs;导航菜单、全局布局、表格 UI 与四大规则表单全面重构。
  • 升级方式依然简单:替换二进制和 integrations 目录、重启即可;AI 助手依赖 Redis 5.0+(Redis Streams)。

去年 v8 发布的时候,我们在发布文章里开过一个玩笑:「V8 这个版本的产品完成度已经很高,明年的 V9 我都不知道该搞什么大的迭代了。」

现在答案揭晓了:把 AI 装进夜莺。不是在页面角落挂一个聊天窗口,而是让 AI 认识你系统里的告警规则、机器、数据源、通知模板和历史事件,走进从「配规则」到「发通知」再到「排障」的每一个环节。

除了 AI,v9 还带来了新一代日志浏览、告警规则测试触发、全新 UI 等一大批更新。下面逐一介绍。

Nightingale AI:给夜莺装上大脑

这是 v9 最大的变化,后端为此新增了一整个 AI 模块。它由几部分组成:

内置 AI 助手。 全局随时可以唤起,支持多轮对话、流式输出和会话分享。它不是一个「什么都懂一点」的通用聊天机器人,而是接入了夜莺内部数据的运维副驾驶:可以用自然语言创建告警规则和仪表盘(缺参数时会弹出表单让你补齐,而不是瞎猜)、生成 PromQL 和 SQL、回答夜莺文档问题、帮你排查告警规则为什么没生效。在不同页面,它还会根据当前上下文智能推荐提示词。

Skill 体系。 v9 内置了 20 多个开箱即用的 Skill,覆盖建规则、建仪表盘、主机健康诊断、告警排障、通知规则配置等场景。更重要的是团队可以沉淀自己的 Skill:用 Markdown 写下你们的排障方法论,本地上传或直接从 Git 仓库安装;Skill 支持授权范围,可以设为公开或团队私有,把编辑权限限定在授权团队内。Skill 的脚本在服务端沙箱中隔离执行,出网行为受代理管控。

大模型集中管理。 LLM 配置一处管理、处处使用:支持 OpenAI 兼容协议、Claude、Gemini 三类接口,可配置代理和测试连接。配置好之后,AI 助手、告警事件的 AI 分析、事件流水线里的 AI 总结节点都直接复用,不用在每个功能里单独填一遍模型信息。想用内网私有化部署的模型?只要兼容 OpenAI 协议就能接,数据可以完全不离域

AI 能力如何在 on-call 场景里落地(告警真假判定、事件分析、一句话搭监控),我们之前写过一篇长文详细展开:夜莺 v9 AI:给每个 SRE 配一个 7x24 在线的资深副驾驶

需要说明的是:AI 是可选能力,不配置大模型,夜莺的监控告警功能一切照常。

内置 MCP Server 与 A2A:让夜莺成为 AI 生态的一等公民

除了「夜莺内置 AI」,v9 也做了反方向的事:让外部 AI 使用夜莺

夜莺服务端内置了 /mcp 端点,提供告警、机器、数据源、屏蔽、通知规则、订阅规则、事件流水线、用户、指标、日志、仪表盘、角色等十余个工具集、数十个细粒度工具。安全策略是保守的:默认只读,写操作工具与工具集白名单都需要显式开启。配合内置的 OAuth 2.1 授权服务器(支持动态客户端注册和 PKCE),Claude Desktop、Cursor 这类通用 MCP 客户端可以零预配置接入------在 IDE 里问一句「现在有哪些活跃告警」,答案直接来自你的夜莺。

同时 v9 还实现了 A2A(Agent2Agent)协议端点,企业内部的其他 Agent 系统可以通过标准协议和夜莺的 AI 助手对话协作。

关于 MCP Server 的玩法,可以参考之前的这篇文章:Nightingale 官方 MCP Server:用自然语言操作监控与告警。需要注意的是,那篇文章介绍的是早期独立进程部署的 MCP Server,v9 已将其直接集成进夜莺服务端,无需再单独部署,文中的使用玩法依然适用。

告警规则「测试触发」:上线前把整条链路演练一遍

配好一条告警规则之后,最让人心里没底的问题是:真出事的时候,通知到底发得出来吗?

过去的验证方式通常是调低阈值等它触发,或者干脆等一次真实故障「顺便」验证。v9 给了一个体面的答案:告警规则支持「测试触发」,在条件尚未满足时,按真实查询到的时序数据手动触发一次,同步走完整条链路,并给出分阶段报告------

查询校验 → 阈值判断 → 事件生成 → 事件流水线 → 通知发送

每个阶段的执行结果一目了然:查询有没有查到数据、事件流水线怎么处理的、屏蔽规则有没有拦截、通知最终发给了谁。支持干跑模式,也支持真实发送(消息会带上测试标记);测试事件不入库、不触发回调和自愈,不会污染生产数据。

配合同样是 v9 新增的事件管道执行跟踪页面(可查看每个事件在流水线里每个节点的详细执行过程),告警链路从「黑盒」变成了「白盒」。

新一代日志浏览:一套界面查所有日志

v9 重写了日志查询,统一支持 Elasticsearch、Loki、VictoriaLogs:

  • 多标签页查询,可拖拽排序、重命名,方便对照排查;
  • 日志直方图 + 字段侧栏统计(唯一值、最值、分位数),点一下即可按字段筛选或排除;
  • 日志原文与统计图表双模式,支持下钻、下载和分享链接。

数据源层面,v9 新增了 Grafana Loki (日志检索、上下文浏览)和 Apache IoTDB(物联网时序场景,即时查询、仪表盘、告警规则全支持);Elasticsearch 新增跨集群检索。至此,夜莺开源版支持的数据源插件已达 13 类。

全新 UI:数百个页面的一次整体翻新

v9 对前端界面做了一次彻底翻新:

  • 导航菜单与全局布局重新设计,图标体系更新,主题切换、个人设置收进侧边栏;
  • 告警规则 / 屏蔽规则 / 订阅规则 / 通知规则四大表单全面重构:分区卡片、右侧导航、实时条件摘要、自动命名、常用时长快捷选择、场景化空状态引导------配置一条规则不再需要在长表单里上下翻找;
  • 30 多个列表页迁移到统一表格组件:行内操作按钮、创建人与时间列排序、分页快速跳转,交互终于一致了;
  • SQL 类数据源的查询编辑器全面换成 Monaco,写 SQL 像在 IDE 里一样;
  • 多语言全面补齐,简中、繁中、英、日、俄五种语言完整覆盖,消息模板也支持按接收人语言渲染------跨国团队可以用同一套通知规则。

机器管理与装机体验:几分钟跑通监控

机器列表页全新改版:顶部概览区直接展示机器总数、心跳状态、CPU/内存使用率分布和 Agent 版本分布,未归组机器一键筛出。

最实用的是 Categraf 一键安装:采集器安装包随夜莺服务端一起分发,在主机页按平台生成可直接执行的安装脚本,复制到目标机器一跑,机器就上来了;Agent 有新版本时列表里会提示,支持一键升级。

配合 v9 新增的产品首页和新手引导(主机监控、数据接入、接入大模型三条上手路线,侧边栏实时显示进度),新用户从部署到看见第一张仪表盘、收到第一条告警,只需要几分钟。

通知媒介重构与运维友好的细节

v8 抽象出了通知规则、通知媒介、消息模板三件套,v9 把发送侧重构为原生 provider 体系:邮件、钉钉/企微/飞书群机器人与应用号直达个人、短信、语音电话、FlashDuty、PagerDuty、Callback、自定义脚本等开箱即用,启动时自动初始化常用媒介。

还有一批老用户会心一笑的细节改进:

  • 屏蔽规则支持「仅屏蔽通知」:事件照常产生并入库(在事件列表中标记为已屏蔽),只是不发通知------既不吵人,也不丢现场;
  • 历史告警事件按天保留:配置保留天数后每天凌晨分批清理,并为大表新增了联合索引与游标分页,事件表不再无限膨胀;
  • 告警规则支持时区设置,跨时区团队配置生效时间不再心算;
  • 夜莺自身可观测性增强:数据库访问延迟、连接池、HTTP 追踪等自监控指标齐备。

如何升级

从 v8 升级很简单:替换二进制和 integrations 目录,重启即可 。表结构变更会自动执行;如果数据库账号没有建表权限,参考 migrate.sql 手动处理。

几个注意事项:

  • AI 助手依赖 Redis Streams,需要 Redis 5.0 及以上版本(Cluster 用户建议 7.0+);
  • 告警引擎、变量设置两个页面的权限点有变更,升级后非管理员用户如看不到,需在角色管理里重新授权;
  • 使用了 n9e-edge 或 n9e-pushgw 的环境,需要和 n9e 一起升级。

完整变更列表和从 v6/v7 升级的详细步骤,见 v9.0.0 发布说明;全新安装参考 部署文档

更多信息

相关推荐
tonydf5 小时前
传统老手艺之容器编排
后端·容器·aiops
BerrySen1785 小时前
一个Java项目改成AI流程后,最难的部分完全变了
java·大数据·人工智能·可观测性·大模型应用开发·工程思维
武子康4 天前
Shippy 全拆:3 个集合收缩(动作 / 状态 / 后果)+ 4 类边界(版本化行为 / Typed API / CLI / Sandbox)
人工智能·agent·aiops
云智慧Cloudwise12 天前
企业级智能服务闭环落地实践:好用的轻帆云 ITSM 集成 AI 智能体全流程方案详解
aiops·itsm·智能运维平台·ai运维平台·it服务管理平台
Token炼金师18 天前
生产化的鸿沟:流式、缓存、可观测、红蓝对抗、限流降级与评测 —— 工程化六渡
人工智能·llm·可观测性·红蓝对抗·缓存策略·限流降级·评测体系
Databuff22 天前
国产开源APM databuff 成为 CNCF 顶级项目opentelemetry 官宣Vendor
运维·开源·skywalking·apm·可观测性·opentelemetry
行者-全栈开发23 天前
用 AI 大模型重写运维脚本:5 个真实场景的提效实录
aiops·ai 辅助开发·ai 运维脚本·shell 自动化·python 运维·运维提效·prompt 工程
IguoChan23 天前
3. d2l — 多层感知机(MLP)
aiops
创世宇图24 天前
【Python工程化实战】Python 服务的结构化日志体系:structlog + JSON 输出 + 日志分级策略
python·elk·structlog·结构化日志·可观测性