只看 PASS 会骗你,6 条 Agent Trace 里的 Coding Agent 评测真相摘要:我让 gpt-6-astra 和 claude-fable-5.1 分别在 Evot、Pi、DeepSeek Harness 上修复 serde_json 的同一个 JSON 解析 Bug。六次运行都通过了完整测试,核心补丁逐字节相同。只看 PASS 率,六次没有区别。Trace 记录了另一组数据。GPT-6-Astra 平均请求模型 9 次,耗时 52.0 秒。Claude-Fable-5.1 平均请求 13 次,耗时 118.6 秒,输出 token 是前者的 9.6 倍。六次运行还撞上了同一个