内核追踪:ftrace、kprobe、uprobe、tracepoint 生产实战原文发布于 quant67.com,转载请保留出处。某次生产故障:一个 Go 服务偶尔出现 200ms 的 fsync 延迟,但 prometheus-node-exporter 显示磁盘 I/O 正常,iostat 的 await 在 2ms 以内,strace 挂了 30 分钟没有捕捉到任何异常。最终通过 bpftrace 在 vfs_fsync_range 上挂 kprobe,发现延迟在特定时间点飙升——进一步分析是冷数据页 writeback(回写)在 fsync 前被强制触发。