AI 应用的可观测性设计:从 OpenTelemetry GenAI 语义约定到生产级落地架构把一个大模型调用放进生产环境的第一周,你大概率会收到三种 P0 告警:账单爆表、某个 prompt 让所有用户拿到 5 秒空白回复、模型在某次静默升级后开始胡说八道。Datadog 的 HTTP 平均延迟告诉你"系统很健康",但你已经亏了一天的预算并且流失了用户。这不是 APM 工具不行,而是它们的语义模型从诞生起就没假设过"请求的成本由 token 决定、行为由概率决定、错误不是异常而是分布漂移"。LLM 应用必须有一张独立于传统监控的可观测性图,而这张图的骨架,就是 OpenTelemetry Gen