LLM 业务级可观测

monitoring-agent 说全绿,用户却炸了:redis / postgres / 网关都活着,但本月 LLM 账单翻三倍,且回答质量肉眼下滑。组件级健康监控(《系统健康监控巡检》)管不了"业务维度"的健康------组件活着 ≠ 服务健康。

核心论点

传统组件健康看不到 LLM 特有的 golden signal(黄金信号):token 成本、P99 延迟、回答质量退化。LLM 平台的可观测要分两层:组件活着(《系统健康监控巡检》)只是地基,token / 延迟 / 质量这三盏灯才是"服务还健不健康"的答案。

组件健康 vs 业务健康:两个维度

维度 回答的问题 谁负责
组件健康 谁挂了、影响面多大 《系统健康监控巡检》拓扑矩阵
业务健康 花了多少、慢不慢、答得对不对 本篇(LLM 平台专属)

三大 golden signal(LLM 专属)

signal 含义 为什么重要
token 流速与成本突增 单位时间 token 消耗异常 往往先于账单暴露浪费或循环调用
P99 延迟(99 分位延迟) 绝大多数请求都比它快 均值掩盖长尾,P99 才反映真实体感
质量退化 幻觉率上升、偏离预期格式、答非所问 最隐蔽也最伤体验

数据从哪来:网关已埋点,监控侧聚合

数据源 职责
网关层 Langfuse 链路(追问链路)+ Prometheus 指标(token/延迟) 业务信号源头
监控侧 在组件矩阵外另建"业务级看板"聚合这些信号 不重复《系统健康监控巡检》存活矩阵

决策:数据源在网关(唯一出口),聚合在监控,职责边界和《系统健康监控巡检》一致。

⚠️ Langfuse 存完整对话 ,是最大 PII 落点之一------按《合规护栏》跨平面原则,trace 导出前必须经脱敏引擎脱敏(完整跨平面处置见《合规护栏》总表),否则网关在模型侧的脱敏白做。

质量退化怎么发现(组件探针做不到)

方法 实现
在线 eval / 抽样打分 对回答做自动化质量评估
用户反馈回路 踩/赞、纠错作为质量信号回灌

决策:质量不是"通不通",是"好不好",只能靠评估与反馈,不能靠探针。

与告警 / 自愈联动

信号 处置 衔接篇
成本突增 触发预算熔断 《成本治理与限流》
质量退化 触发降级或人在回路 《自动操作回复与自愈闭环》(安全边界)

价值:业务信号不是看完板,是驱动《系统健康监控巡检》/《自动操作回复与自愈闭环》的处置动作。

业务级告警规则(已落地)

规则 触发条件 级别
GatewayCostSpike 5m 速率 > 2×1h 基线 P2(与《成本治理与限流》预算联动)
GatewayP99LatencyHigh P99 > 10s 持续 5m P2
GatewayLoopStorm 循环熔断 >1/s 持续 5m P2(联动《自动操作回复与自愈闭环》)
GatewaySafetySurge 注入拦截+治理异常 >0.5/s 持续 10m P3
可用性 服务失联 P1

业务级看板(6 面板)

请求速率 / P99 / token 速率 / 循环 / 缓存命中 / 安全拒绝。

延迟/成本/循环面板分别复用《系统健康监控巡检》/《成本治理与限流》/《自动操作回复与自愈闭环》已注册指标;告警 expr 即看板面板查询,确保"看得到就能告警"。

核心要点

  • LLM 平台的可观测要分两层:组件活着(《系统健康监控巡检》)只是地基,token / 延迟 / 质量这三盏灯才是"服务还健不健康"的答案。
  • 三大 golden signal:token 流速与成本突增、P99 延迟、质量退化------均值掩盖长尾,P99 才反映真实体感。
  • 数据源在网关(唯一出口),聚合在监控,职责边界和《系统健康监控巡检》一致。
  • 质量不是"通不通"是"好不好",只能靠在线 eval + 用户反馈回路,不能靠探针。
  • 业务信号不是看完板,是驱动《系统健康监控巡检》告警与《自动操作回复与自愈闭环》自愈的处置动作。
相关推荐
大龄码农有梦想2 小时前
AI Agent 目前最大的瓶颈是什么?
人工智能·机器学习·ai agent·智能体·ai工作流·智能体平台
TsingtaoAI2 小时前
基于MyCobot Pro 450机器人的VLA多模态具身智能实训建设方案
机器人·大模型·具身智能
暗黑小白2 小时前
脱敏引擎工程化
后端·ai agent
梦想三三3 小时前
LangChain RAG PDF 智能问答实战:用 Streamlit 构建本地知识库(完整代码)
人工智能·python·langchain·大模型·rag
阿华田5125 小时前
Agent智能路由架构设计
大模型·agent路由
雾沉川5 小时前
LiteUI-Studio 低配显卡 AI 视频生成工具完整技术介绍与标准化部署教程
人工智能·大模型·文生图·liteui-studio
deepseek237 小时前
GPT-5.6 Luna 降价 80%:从 24% 到 90% 的缓存命中率,OpenAI 的价格战打在了工程层
大模型·openai·ai agent
人间凡尔赛7 小时前
Kimi K3 技术拆解:2.8 万亿参数开源模型背后的 KDA 线性注意力与 Stable LatentMoE
ai·大模型·注意力机制·moe·kimi
thesky12345621 小时前
27届大模型岗面试准备(十三):长上下文与上下文工程——从位置外推到分块策略的完整考点
人工智能·ai·大模型