可观测性

DsirNg9 小时前
自动化·可观测性·幂等性·智能体·ai 工作流·人工在环·工单分流
让流程会停下:AI 自动化的交班设计很多人对 AI 自动化的第一印象,是“收到一封邮件,让模型替我回一封”。这当然有用,但它仍然是一种聊天式使用:人发现事情、复制内容、发起提问、决定下一步。
circuitsosk19 小时前
metrics·可观测性·全链路追踪·ai工程化·llmagent·feedback闭环·智能体运维
面向行业Agent的全链路可观测性设计:Trace、Metrics与Feedback闭环我参与构建过多个面向行业的Agent应用——财务对账、合规审查、能源异常分析。这些系统有一个共同点:上线初期运行得"挺好",直到某天业务方拿着一个错误结果来质问,而我们在日志里什么都找不到。
观测云2 天前
网络·安全·可观测性·观测云
Fastjson 高危 RCE(CVE-2026-16723):如何用观测云快速发现并完成修复近期 Fastjson 曝出 CVE-2026-16723 高危远程代码执行漏洞,CVSS 3.1 评分高达 9.0、风险等级 Critical,漏洞无需开启 AutoType 默认配置即可触发,无需依赖本地 gadget 类,适配绝大多数 Spring Boot fat-jar 业务场景,攻击门槛极低、危害极强,一旦被利用可直接导致服务器被控、业务数据泄露,目前已有公开 PoC,企业亟需全面排查整改。
ylj_dev3 天前
go·prometheus·可观测性·opentelemetry·故障注入
从 0 构建 AI Workload Platform(七):可观测性、故障注入与性能验证我正在从零开发 AI Workload Platform:一个面向 Agent 与确定性程序任务的可靠运行时和调度平台。Agent(智能体) 是能够调用模型和工具、根据执行结果继续决定后续动作的程序;确定性程序任务则按照预先定义的代码和输入执行。工作流(Workflow) 是按依赖关系组织的多步骤执行定义,平台负责管理两类任务共有的工作流依赖、状态、重试、取消、恢复和执行节点。
ZGi.ai4 天前
可观测性·工作流·企业ai·zgi·运行日志
ZGI 运行日志:还原任务与节点状态运行日志需要回答四个问题:哪一次任务出了问题,执行停在哪个节点,该节点收到了什么,随后留下了什么结果。只保存最终报错,团队很难判断问题来自上游输入、当前节点、权限限制还是外部接口。任务级记录用于缩小范围,节点级记录用于重建执行顺序。
Akiyama_Mio-Kon5 天前
devsecops·可观测性·代码质量·ai agent·codeql·github code·工程治理
GitHub Code Quality 有了趋势面板后:怎样把 Agent 修复从“刷绿”变成可验证的质量闭环Coding Agent 能很快把一批静态分析发现改成一串 Pull Request,也能很快把一串“看起来合理”的重构塞进主分支。两种速度都可能掩盖同一个问题:团队只看到了某一次扫描是否变绿,却没有看见质量债务在一段时间内是被消化、被转移,还是被新的规则与新生成代码不断放大。
ManageEngine卓豪12 天前
aiops·可观测性·应用性能监控·运维监控·全栈可见性
全栈可见性落地指南:可观测性投入为何难以转化为实际可视能力ManageEngine《2025年可观测性现状报告》调研了1240名IT负责人与技术从业者,67.3%的受访者将"实现分布式及混合IT环境的端到端可视"列为采用可观测性方案的首要原因。然而部署之后,IT堆栈可视能力的改善程度却排在所有指标末尾。本文从这一数据反差出发,拆解全栈可见性难以落地的结构性原因,并给出可落地的技术实现路径。
ZGi.ai24 天前
可观测性·aiagent·企业ai·zgi·运行指标
ZGI Runtime:Agent 上线后要看哪些指标?Agent 上线后至少要观察五类结果:业务是否完成、执行链是否健康、输出是否合格、风险控制是否生效、资源消耗是否可接受。调用次数和模型响应时间只能说明服务被使用,任务有没有真正办完,还要看工具回执、审批状态和业务系统结果。ZGI Runtime 可以把 Agent、Workflow 和模型路由放在同一工作区,部署时还可按需接入 OpenTelemetry trace。
带娃的IT创业者25 天前
前端·交互·puppeteer·可观测性·浏览器自动化·无头浏览器·web工程化
Puppeteer 深度解析:超越自动化测试的现代 Web 交互范式👋 Hi,我热衷于 (AI 大模型应用落地、Python 实战进阶与 AI 开发工具链)。代表专栏:《AI大模型应知应会短平快系列100篇》《解密OpenClaw》《解码意识NCTransformer》《WeClaw Agent实战》> 💡 创业路上,用技术换时间;欢迎 关注我,一起把 AI 变成生产力 🚀 >
SRETalk1 个月前
aiops·可观测性·nightingale·开源监控
夜莺监控发布V9正式版,引入AI去年 v8 发布的时候,我们在发布文章里开过一个玩笑:「V8 这个版本的产品完成度已经很高,明年的 V9 我都不知道该搞什么大的迭代了。」
BerrySen1781 个月前
java·大数据·人工智能·可观测性·大模型应用开发·工程思维
一个Java项目改成AI流程后,最难的部分完全变了聊《一个Java项目改成 AI 流程后,最难的部分完全变了》之前,先说一句实在的:别急着背概念,先看它在真实项目里到底解决什么问题。
Token炼金师2 个月前
人工智能·llm·可观测性·红蓝对抗·缓存策略·限流降级·评测体系
生产化的鸿沟:流式、缓存、可观测、红蓝对抗、限流降级与评测 —— 工程化六渡大模型应用从 Demo 到生产需跨越工程化鸿沟。本文从流式输出 SSE、缓存策略、可观测性、红蓝对抗安全、限流降级、评测体系六个切口,给出源码级实现与企业级生产化决策框架。
Databuff2 个月前
运维·开源·skywalking·apm·可观测性·opentelemetry
国产开源APM databuff 成为 CNCF 顶级项目opentelemetry 官宣VendorOpenTelemetry · Vendors 生态 · AI 原生 · DataBuff —— 从 CNCF 标准、官网收录到 Demo 实拍,帮 SRE 团队看清 OTel 后端选型。
创世宇图2 个月前
python·elk·structlog·结构化日志·可观测性
【Python工程化实战】Python 服务的结构化日志体系:structlog + JSON 输出 + 日志分级策略摘要:在微服务与云原生架构下,传统的纯文本日志已成为可观测性的瓶颈。本文以 structlog 为核心,从 0 到 1 搭建一套“机器可读、人类可查”的生产级日志体系。内容涵盖处理器链设计、JSON 标准化输出、请求上下文绑定、日志分级策略,以及对接 ELK / Grafana Loki 的实战配置,附带完整代码与自审查清单。
BJ_Bonree3 个月前
运维·人工智能·可观测性
聊点技术 | 从“统一接入“到“统一调度“:重塑可观测平台的数据底座5月12日,博睿数据面向全球发布Bonree ONE 4.0,以“AI可观测+智能体工作台+AI智问”三大核心能力,将AI驱动的智能可观测能力推向全新高度,让大模型应用的每一笔调用、每一次决策全程可视、全程可控。本次产品升级并非单点功能迭代,而是对平台数据底层架构的系统性重构:从分散的接入链路收敛为统一调度体系,从多业务割裂的数据模型走向语义归一,为上层智能应用提供高质量、低延迟的数据支撑。
SRETalk3 个月前
可观测性·监控告警·nightingale·开源监控·夜莺监控·运维监控
开源夜莺 v9 AI 尝鲜版:给每个 SRE 配一个 7x24 在线的资深副驾驶做过 on-call 的人都熟悉这几个瞬间:这些事的共同点是:它们都依赖经验,而经验偏偏是团队里最稀缺、最难复制、最容易随人走的东西。
__土块__3 个月前
可观测性·系统稳定性·ai工程·生产实践·终态一致性·管理后台设计·指标归因
AI 系统后台可观测性治理:从请求链路断裂到分层指标归因的闭环设计在 2025 年底上线的一个 AI 客服系统中,业务方反馈“用户提问后偶尔无响应”,但后台日志显示模型已成功返回结果。运维团队检查调用链路,发现 LLM 调用、RAG 检索、工具执行均正常,唯独前端未展示。进一步排查发现,会话状态在“模型响应完成”后未正确流转至“待渲染”状态,导致前端轮询接口始终返回“处理中”。更严重的是,该问题在监控大盘中完全不可见——所有 SLI 指标(如 P99 延迟、成功率)均正常,因为“服务调用成功”被定义为“模型返回非空响应”,而状态流转失败被归类为“前端渲染问题”,未纳入核
__土块__3 个月前
可观测性·rag系统·ai工程·管理后台设计·静默故障·agent系统·链路监控
AI 后台请求链路可观测性治理:从静默状态丢失到分层指标归因的工程实践凌晨三点,值班群里跳出一条告警:用户反馈‘AI 助手没响应’,但后台任务状态显示‘已完成’。运维查了日志,模型调用返回 200,RAG 检索有结果,Agent 编排也走到了终态——可用户端就是没收到答案。这种‘链路通但体验断’的静默故障,在 AI 系统中越来越常见。问题不在单点,而在状态与观测的断层:系统知道‘做了什么’,但不知道‘做得好不好’。
观测云3 个月前
可观测性·观测云
观测云集成泛微 E9 最佳实践泛微 E9 是企业常见的 OA 协同办公系统,承载流程审批、门户访问、表单提交、组织协作等核心业务。系统运行一段时间后,常见问题包括页面访问慢、流程提交卡顿、接口异常、日志排查困难等。
__土块__3 个月前
可观测性·信息架构·mcp协议·rag系统·ai工程·管理后台设计·agent系统
AI 管理后台首页信息过载:从用户决策失效到摘要视图重构我们的 AI 管理后台在 2026 年 Q1 上线后,运营团队频繁反馈“首页密密麻麻,点进去不知道该看什么”。尽管接入了 RAG 检索日志、Agent 执行记录、MCP 工具调用统计等 12 类数据源,但关键决策点仍依赖人工翻查。在一次线上故障中,值班工程师因首页信息混乱未能及时发现 RAG 检索退化,导致推荐服务连续 3 小时返回低相关性结果。本文将复盘该问题,从用户可感知的决策失效出发,逐层拆解后台信息架构缺陷,最终输出一套可落地的首页摘要视图设计方法。