可观测性

DevOps老兵2 天前
aiops·数据·可观测性·老计聊技术·指标日志链路
AIOps实战07:AIOps的地基是数据,可观测三支柱怎么喂给AI我是老计。前面几篇讲了 AIOps 的能力、产品和需求,都是上层的东西。这一篇往下挖,挖到最根本的地基,数据。一句话先撂在这:AIOps 再智能,本质上也是建立在运维数据之上的。数据这个地基没打好,上面盖的所有智能高楼,都是空中楼阁。 这一篇,我结合做 SRE 和可观测的经验,讲清 AIOps 的数据到底是什么、怎么喂给 AI。
ZealSinger5 天前
spring boot·kotlin·协程·可观测性
Boot4挂起函数丢traceId怎么修Spring Boot 4 / Framework 7 把 Kotlin 基线抬到了 2.2,协程与 Web 栈贴得更紧。可观测这条线上,有个很容易踩的坑:过滤器、拦截器里明明有 observation,同步代码日志也能打出 traceId,一进 挂起函数,同一请求的业务日志却空了。Micrometer 没坏,毛病出在 上下文没跟着协程走。下面按官方博客与 Kotlin Coroutines 文档,把原因、开关和显式桥接说清楚,并补一个官方博客没提的前提:Spring MVC 里只配 YAML 不一定生效
漂着的圆木8 天前
agent·可观测性·github copilot·工具调用·opentelemetry
Agent监控:Copilot托管设置启用OTel的配置核对事实边界以GitHub官方资料为准;下文的判断框架、检查方法与失败边界属于作者建议。据 GitHub 官方博客 2026-09-22 的公告,GitHub Copilot 应用支持通过企业托管设置配置 OpenTelemetry。官方指出,企业可以强制在支持的客户端应用遥测配置,实现集中监控。然而,实际落地常卡在策略已下发但终端无回传。若属性缺失,客户端仍按默认静默运行。核对起点必须是终端本地文件,而非后台面板状态。
DsirNg11 天前
可观测性·前端工程化·微前端·灰度发布·监控平台·错误治理·source map
让故障自己找到主人:前端错误的归并、反解与分派系统线上出现一条 TypeError,并不等于团队已经知道了问题:它可能来自哪个异步 chunk,影响了哪一批灰度用户,是否与刚刚发布的版本有关,应该交给订单域还是基础组件团队,修复后是否真的消失。
BJ_Bonree19 天前
大数据·运维·人工智能·可观测性
Bonree ONE·Sage AI「故障诊断助手」实测:从告警到根因,只要一句话日常运维工作中,故障响应始终是最考验经验、也最消耗人力的环节。错误率突增、响应变慢、服务不可用、应用崩溃、页面卡顿……面对这些问题,运维人员往往需要先查看日志、分析堆栈、比对指标、梳理调用链,才能从分散的信息中拼出一个站得住脚的结论。这一过程高度依赖个人经验,排查路径长,且结论难以复现与验证。
BJ_Bonree19 天前
大数据·运维·数据库·人工智能·可观测性
博睿数据加入ITSS分会,成为国家级信息技术服务标准化体系单位成员!近日,博睿数据正式加入中国电子工业标准化技术协会信息技术服务分会(ITSS分会),成为国家级信息技术服务标准化体系单位成员。此次入选,标志着博睿数据在智能可观测技术创新、产品合规体系、项目交付能力及行业服务规范性方面获得国家标准化权威机构的充分认可,企业整体能力全面接轨国家级信息技术服务标准。
jonyleek21 天前
低代码·私有化部署·流程引擎·可观测性·jvs-logic·企业自动化·确定性计算
企业级自动化落地实践:为什么JVS-Logic用确定性逻辑引擎替代AI编排?作为一线开发者,你是否遇到过这类问题:薪资计算流程偶发字段错位,日志里找不到明确失败节点;AI Agent调用接口时因上下文截断漏传参数,导致数据库写入空值;
A心有千千结24 天前
数据库·golang·可观测性·观测云
GO 使用 OpenTelemetry 进行编译时插桩,实现零码注入在不改动业务代码、不手动初始化 OpenTelemetry SDK 的情况下,为 Go 应用自动生成链路数据,并通过 OTLP 上报到观测平台。
程序员柒叔25 天前
人工智能·llm·github·agent·可观测性·langfuse
把可观测性数据送进 LLM 追踪平台本文基于实际部署经验整理,实验环境为 Windows + WSL2 + Docker。 核心目标:让 OpenTelemetry Demo 采集 Github Copilot 的 traces,在不改动任何业务代码的前提下,额外转发一份到自托管的 Langfuse,实现 LLM 调用的全链路追踪。
2601_962097361 个月前
grafana·prometheus·微服务架构·可观测性·opentelemetry
可观测性实战:Prometheus+Grafana+OTel构建监控在微服务的架构情形之下, 系统被拆分成为, 数十个甚至, 又或者可达到上百个独立的服务, 一次用户的请求之时, 有可能会跨越若干个服务节点啊。当线上一旦察觉出现响应速度变迟缓, 以及错误率急剧飙升的状况之时, 传统的那种单机监控方式, 已是根本没有办法可以回答诸如, “请求到底卡在哪一跳”, “哪一个服务才是导致瓶颈产生的根源”, “错误究竟是从哪里传播过来的”, 这些极为关键重要的问题。而可观测性,它, 是借助指标、日志、追踪这三大支柱, 从而使得团队能够凭借从外部输出的内容去推断系统内部的状态。本文,
观测云1 个月前
飞书·可观测性·监控告警·观测云
技术实战:观测云告警到飞书群并精准@相关人在多数团队的告警通知链路里,飞书群是最常用的触达入口之一。但实际使用中经常遇到两个问题:本最佳实践给出一套轻量、易维护的实现方式:
观测云1 个月前
前端·可观测性·观测云·rum
AI时代的用户访问监测:观测云带你身临其境体验用户与前端UI交互旅程“系统明明没有报警,为什么用户还是觉得不好用?”在线上应用中,技术团队经常会遇到这样的情况:系统指标看起来一切正常,但用户却反馈页面加载缓慢、操作卡顿,甚至无法完成某些功能。
观测云1 个月前
可观测性·产品迭代·观测云
观测云产品更新 | Agent 监测、故障中心、应用性能监测、日志、基础设施等在「集成」-「IM 应用」,点击「接入应用」即可配置。在「故障中心」-「故障列表」-「故障详情页」,点击「创建作战室」即可创建。
DsirNg1 个月前
自动化·可观测性·幂等性·智能体·ai 工作流·人工在环·工单分流
让流程会停下:AI 自动化的交班设计很多人对 AI 自动化的第一印象,是“收到一封邮件,让模型替我回一封”。这当然有用,但它仍然是一种聊天式使用:人发现事情、复制内容、发起提问、决定下一步。
circuitsosk1 个月前
metrics·可观测性·全链路追踪·ai工程化·llmagent·feedback闭环·智能体运维
面向行业Agent的全链路可观测性设计:Trace、Metrics与Feedback闭环我参与构建过多个面向行业的Agent应用——财务对账、合规审查、能源异常分析。这些系统有一个共同点:上线初期运行得"挺好",直到某天业务方拿着一个错误结果来质问,而我们在日志里什么都找不到。
观测云1 个月前
网络·安全·可观测性·观测云
Fastjson 高危 RCE(CVE-2026-16723):如何用观测云快速发现并完成修复近期 Fastjson 曝出 CVE-2026-16723 高危远程代码执行漏洞,CVSS 3.1 评分高达 9.0、风险等级 Critical,漏洞无需开启 AutoType 默认配置即可触发,无需依赖本地 gadget 类,适配绝大多数 Spring Boot fat-jar 业务场景,攻击门槛极低、危害极强,一旦被利用可直接导致服务器被控、业务数据泄露,目前已有公开 PoC,企业亟需全面排查整改。
ylj_dev1 个月前
go·prometheus·可观测性·opentelemetry·故障注入
从 0 构建 AI Workload Platform(七):可观测性、故障注入与性能验证我正在从零开发 AI Workload Platform:一个面向 Agent 与确定性程序任务的可靠运行时和调度平台。Agent(智能体) 是能够调用模型和工具、根据执行结果继续决定后续动作的程序;确定性程序任务则按照预先定义的代码和输入执行。工作流(Workflow) 是按依赖关系组织的多步骤执行定义,平台负责管理两类任务共有的工作流依赖、状态、重试、取消、恢复和执行节点。
ZGi.ai1 个月前
可观测性·工作流·企业ai·zgi·运行日志
ZGI 运行日志:还原任务与节点状态运行日志需要回答四个问题:哪一次任务出了问题,执行停在哪个节点,该节点收到了什么,随后留下了什么结果。只保存最终报错,团队很难判断问题来自上游输入、当前节点、权限限制还是外部接口。任务级记录用于缩小范围,节点级记录用于重建执行顺序。
Akiyama_Mio-Kon1 个月前
devsecops·可观测性·代码质量·ai agent·codeql·github code·工程治理
GitHub Code Quality 有了趋势面板后:怎样把 Agent 修复从“刷绿”变成可验证的质量闭环Coding Agent 能很快把一批静态分析发现改成一串 Pull Request,也能很快把一串“看起来合理”的重构塞进主分支。两种速度都可能掩盖同一个问题:团队只看到了某一次扫描是否变绿,却没有看见质量债务在一段时间内是被消化、被转移,还是被新的规则与新生成代码不断放大。
ManageEngine卓豪2 个月前
aiops·可观测性·应用性能监控·运维监控·全栈可见性
全栈可见性落地指南:可观测性投入为何难以转化为实际可视能力ManageEngine《2025年可观测性现状报告》调研了1240名IT负责人与技术从业者,67.3%的受访者将"实现分布式及混合IT环境的端到端可视"列为采用可观测性方案的首要原因。然而部署之后,IT堆栈可视能力的改善程度却排在所有指标末尾。本文从这一数据反差出发,拆解全栈可见性难以落地的结构性原因,并给出可落地的技术实现路径。