可观测性

jonyleek17 小时前
低代码·私有化部署·流程引擎·可观测性·jvs-logic·企业自动化·确定性计算
企业级自动化落地实践:为什么JVS-Logic用确定性逻辑引擎替代AI编排?作为一线开发者,你是否遇到过这类问题:薪资计算流程偶发字段错位,日志里找不到明确失败节点;AI Agent调用接口时因上下文截断漏传参数,导致数据库写入空值;
A心有千千结4 天前
数据库·golang·可观测性·观测云
GO 使用 OpenTelemetry 进行编译时插桩,实现零码注入在不改动业务代码、不手动初始化 OpenTelemetry SDK 的情况下,为 Go 应用自动生成链路数据,并通过 OTLP 上报到观测平台。
程序员柒叔4 天前
人工智能·llm·github·agent·可观测性·langfuse
把可观测性数据送进 LLM 追踪平台本文基于实际部署经验整理,实验环境为 Windows + WSL2 + Docker。 核心目标:让 OpenTelemetry Demo 采集 Github Copilot 的 traces,在不改动任何业务代码的前提下,额外转发一份到自托管的 Langfuse,实现 LLM 调用的全链路追踪。
2601_9620973610 天前
grafana·prometheus·微服务架构·可观测性·opentelemetry
可观测性实战:Prometheus+Grafana+OTel构建监控在微服务的架构情形之下, 系统被拆分成为, 数十个甚至, 又或者可达到上百个独立的服务, 一次用户的请求之时, 有可能会跨越若干个服务节点啊。当线上一旦察觉出现响应速度变迟缓, 以及错误率急剧飙升的状况之时, 传统的那种单机监控方式, 已是根本没有办法可以回答诸如, “请求到底卡在哪一跳”, “哪一个服务才是导致瓶颈产生的根源”, “错误究竟是从哪里传播过来的”, 这些极为关键重要的问题。而可观测性,它, 是借助指标、日志、追踪这三大支柱, 从而使得团队能够凭借从外部输出的内容去推断系统内部的状态。本文,
观测云17 天前
飞书·可观测性·监控告警·观测云
技术实战:观测云告警到飞书群并精准@相关人在多数团队的告警通知链路里,飞书群是最常用的触达入口之一。但实际使用中经常遇到两个问题:本最佳实践给出一套轻量、易维护的实现方式:
观测云19 天前
前端·可观测性·观测云·rum
AI时代的用户访问监测:观测云带你身临其境体验用户与前端UI交互旅程“系统明明没有报警,为什么用户还是觉得不好用?”在线上应用中,技术团队经常会遇到这样的情况:系统指标看起来一切正常,但用户却反馈页面加载缓慢、操作卡顿,甚至无法完成某些功能。
观测云19 天前
可观测性·产品迭代·观测云
观测云产品更新 | Agent 监测、故障中心、应用性能监测、日志、基础设施等在「集成」-「IM 应用」,点击「接入应用」即可配置。在「故障中心」-「故障列表」-「故障详情页」,点击「创建作战室」即可创建。
DsirNg21 天前
自动化·可观测性·幂等性·智能体·ai 工作流·人工在环·工单分流
让流程会停下:AI 自动化的交班设计很多人对 AI 自动化的第一印象,是“收到一封邮件,让模型替我回一封”。这当然有用,但它仍然是一种聊天式使用:人发现事情、复制内容、发起提问、决定下一步。
circuitsosk21 天前
metrics·可观测性·全链路追踪·ai工程化·llmagent·feedback闭环·智能体运维
面向行业Agent的全链路可观测性设计:Trace、Metrics与Feedback闭环我参与构建过多个面向行业的Agent应用——财务对账、合规审查、能源异常分析。这些系统有一个共同点:上线初期运行得"挺好",直到某天业务方拿着一个错误结果来质问,而我们在日志里什么都找不到。
观测云23 天前
网络·安全·可观测性·观测云
Fastjson 高危 RCE(CVE-2026-16723):如何用观测云快速发现并完成修复近期 Fastjson 曝出 CVE-2026-16723 高危远程代码执行漏洞,CVSS 3.1 评分高达 9.0、风险等级 Critical,漏洞无需开启 AutoType 默认配置即可触发,无需依赖本地 gadget 类,适配绝大多数 Spring Boot fat-jar 业务场景,攻击门槛极低、危害极强,一旦被利用可直接导致服务器被控、业务数据泄露,目前已有公开 PoC,企业亟需全面排查整改。
ylj_dev23 天前
go·prometheus·可观测性·opentelemetry·故障注入
从 0 构建 AI Workload Platform(七):可观测性、故障注入与性能验证我正在从零开发 AI Workload Platform:一个面向 Agent 与确定性程序任务的可靠运行时和调度平台。Agent(智能体) 是能够调用模型和工具、根据执行结果继续决定后续动作的程序;确定性程序任务则按照预先定义的代码和输入执行。工作流(Workflow) 是按依赖关系组织的多步骤执行定义,平台负责管理两类任务共有的工作流依赖、状态、重试、取消、恢复和执行节点。
ZGi.ai24 天前
可观测性·工作流·企业ai·zgi·运行日志
ZGI 运行日志:还原任务与节点状态运行日志需要回答四个问题:哪一次任务出了问题,执行停在哪个节点,该节点收到了什么,随后留下了什么结果。只保存最终报错,团队很难判断问题来自上游输入、当前节点、权限限制还是外部接口。任务级记录用于缩小范围,节点级记录用于重建执行顺序。
Akiyama_Mio-Kon1 个月前
devsecops·可观测性·代码质量·ai agent·codeql·github code·工程治理
GitHub Code Quality 有了趋势面板后:怎样把 Agent 修复从“刷绿”变成可验证的质量闭环Coding Agent 能很快把一批静态分析发现改成一串 Pull Request,也能很快把一串“看起来合理”的重构塞进主分支。两种速度都可能掩盖同一个问题:团队只看到了某一次扫描是否变绿,却没有看见质量债务在一段时间内是被消化、被转移,还是被新的规则与新生成代码不断放大。
ManageEngine卓豪1 个月前
aiops·可观测性·应用性能监控·运维监控·全栈可见性
全栈可见性落地指南:可观测性投入为何难以转化为实际可视能力ManageEngine《2025年可观测性现状报告》调研了1240名IT负责人与技术从业者,67.3%的受访者将"实现分布式及混合IT环境的端到端可视"列为采用可观测性方案的首要原因。然而部署之后,IT堆栈可视能力的改善程度却排在所有指标末尾。本文从这一数据反差出发,拆解全栈可见性难以落地的结构性原因,并给出可落地的技术实现路径。
ZGi.ai1 个月前
可观测性·aiagent·企业ai·zgi·运行指标
ZGI Runtime:Agent 上线后要看哪些指标?Agent 上线后至少要观察五类结果:业务是否完成、执行链是否健康、输出是否合格、风险控制是否生效、资源消耗是否可接受。调用次数和模型响应时间只能说明服务被使用,任务有没有真正办完,还要看工具回执、审批状态和业务系统结果。ZGI Runtime 可以把 Agent、Workflow 和模型路由放在同一工作区,部署时还可按需接入 OpenTelemetry trace。
带娃的IT创业者1 个月前
前端·交互·puppeteer·可观测性·浏览器自动化·无头浏览器·web工程化
Puppeteer 深度解析:超越自动化测试的现代 Web 交互范式👋 Hi,我热衷于 (AI 大模型应用落地、Python 实战进阶与 AI 开发工具链)。代表专栏:《AI大模型应知应会短平快系列100篇》《解密OpenClaw》《解码意识NCTransformer》《WeClaw Agent实战》> 💡 创业路上,用技术换时间;欢迎 关注我,一起把 AI 变成生产力 🚀 >
SRETalk2 个月前
aiops·可观测性·nightingale·开源监控
夜莺监控发布V9正式版,引入AI去年 v8 发布的时候,我们在发布文章里开过一个玩笑:「V8 这个版本的产品完成度已经很高,明年的 V9 我都不知道该搞什么大的迭代了。」
BerrySen1782 个月前
java·大数据·人工智能·可观测性·大模型应用开发·工程思维
一个Java项目改成AI流程后,最难的部分完全变了聊《一个Java项目改成 AI 流程后,最难的部分完全变了》之前,先说一句实在的:别急着背概念,先看它在真实项目里到底解决什么问题。
Token炼金师2 个月前
人工智能·llm·可观测性·红蓝对抗·缓存策略·限流降级·评测体系
生产化的鸿沟:流式、缓存、可观测、红蓝对抗、限流降级与评测 —— 工程化六渡大模型应用从 Demo 到生产需跨越工程化鸿沟。本文从流式输出 SSE、缓存策略、可观测性、红蓝对抗安全、限流降级、评测体系六个切口,给出源码级实现与企业级生产化决策框架。
Databuff2 个月前
运维·开源·skywalking·apm·可观测性·opentelemetry
国产开源APM databuff 成为 CNCF 顶级项目opentelemetry 官宣VendorOpenTelemetry · Vendors 生态 · AI 原生 · DataBuff —— 从 CNCF 标准、官网收录到 Demo 实拍,帮 SRE 团队看清 OTel 后端选型。