一、选型维度
② 评测全景列出了 5 个工具。本节不是直接讲某一个工具,而是从选型维度出发,帮你根据自己的场景做选择。
选型维度:
| 维度 | 说明 | 为什么重要 |
|---|---|---|
| 开源协议 | MIT / Apache 2.0 / ELv2 | ELv2 不可做 SaaS,影响商业化 |
| 多语言支持 | Python / TypeScript / Java / Go | 多语言项目需要 OTel 覆盖 |
| 评测能力 | 端到端 / 组件级 / 在线评测 | 不同场景需要不同粒度 |
| 观测能力 | trace 采集 / prompt 管理 / Dashboard | 智能体评测需要 trace |
| 社区活跃度 | GitHub stars / 更新频率 | 活跃社区 = 长期维护 |
| 部署方式 | SaaS / 自部署 / 库 | 影响运维成本 |
二、5 个工具深入分析
Langfuse
协议: MIT(除 ee/ 企业版目录)
Stars: 约 31.4k(截至 2026-07-18)
定位: AI 工程平台
多语言: Python/JS SDK + OTel endpoint(全语言)
评测: LLM-as-judge / 代码评测 / 人工标注 / 用户反馈 / 在线评测
观测: trace 采集 / prompt 管理 / Dashboard / 告警
部署: SaaS + 自部署
优势:观测+评测一体化,基于 OTel(无语言限制),社区最活跃,MIT 协议可商用。
劣势:服务端自定义评测仅 Py/TS,Java/Go 需 REST API 回写。
Phoenix (Arize)
协议: ELv2(Elastic License 2.0)
Stars: 约 10.6k
定位: AI 可观测+评测
多语言: Python / TypeScript / Java
评测: LLM-based evaluations / human annotations / dataset evaluators
观测: trace 采集 / prompt 管理 / Dashboard
部署: SaaS + 自部署
优势:支持 Py/TS/Java 三语言,基于 OTel + OpenInference,有 prompt engineering 功能。
劣势 :ELv2 协议不可做 SaaS(禁止以托管服务形式向第三方提供),社区不如 Langfuse 活跃。
DeepEval
协议: Apache 2.0
Stars: 约 16.9k
定位: 评测框架 + 云平台(Confident AI)
多语言: Python
评测: 端到端 + 组件级(span 级)+ 在线评测
观测: tracing(@observe 装饰器)
部署: 库(pip install)+ Confident AI 云
优势:Apache 2.0 完全可商用,有 tracing + 在线评测(不是"纯框架"),集成多框架(LangChain/LangGraph/OpenAI/CrewAI 等),pytest 风格易上手。
劣势:仅 Python,观测能力不如 Langfuse/Phoenix(tracing 是评测的副产物,不是独立观测平台)。
OpenAI Evals
协议: MIT
Stars: 约 18.9k
定位: 评测框架 + benchmark registry
多语言: Python
评测: 测试集驱动 + 判分逻辑 + model-graded evals
观测: 无(纯评测框架)
部署: 库(pip install)
优势:MIT 协议,OpenAI 官方维护,有 benchmark registry,支持自定义 eval 和 model-graded eval。
劣势:无观测能力(无 trace 采集),仅 Python,偏 LLM 评测而非智能体评测。
Inspect (UK AISI)
协议: MIT
Stars: 约 2.4k
定位: 评测框架(frontier AI evaluations)
多语言: Python
评测: 200+ 预置 evals / scorers / agents
观测: tracing + Inspect View(web 工具)
部署: 库(pip install)
优势:MIT 协议,有 agent 评测(ReAct/deep agent/multi-agent),sandboxing(Docker/K8s),200+ 预置 evals,UK AI Safety Institute 维护。
劣势:仅 Python,社区最小(约 2.4k stars),偏安全/能力评测而非业务评测。
三、第一层筛选:按定位
5 个工具分两类:
观测+评测一体: Langfuse, Phoenix
应用运行 -> 采集 trace -> 对 trace 打分
"先看到发生了什么,再判断好不好"
评测框架: DeepEval, OpenAI Evals, Inspect
准备测试集 -> 跑评测 -> 生成报告
"先定义测什么,再跑"
排除逻辑
注意:不能用"纯框架没有 trace"排除评测框架。 调研发现:
- DeepEval 有 tracing(
@observe装饰器)和在线评测 - Inspect 有 tracing 和 Inspect View
正确的排除逻辑是基于你的场景需要什么:
你的场景需要:
□ 观测+评测一体(需要 trace 采集 + prompt 管理 + Dashboard)
-> 候选: Langfuse, Phoenix
-> 排除: DeepEval, OpenAI Evals, Inspect(观测能力不足)
□ 纯评测框架(已有观测基础设施,只需评测逻辑)
-> 候选: DeepEval, OpenAI Evals, Inspect
-> 排除: Langfuse, Phoenix(功能超出需要)
□ Agent 评测 + sandboxing(需要安全隔离环境)
-> 候选: Inspect
-> 排除: 其他(无 sandboxing)
四、第二层对比
场景 A:需要观测+评测一体
Langfuse vs Phoenix
| 维度 | Langfuse | Phoenix |
|---|---|---|
| 协议 | MIT(除ee/) | ELv2(不可SaaS) |
| 多语言 | Py/JS + OTel(全语言) | Py/TS/Java |
| 在线评测 | 有 | 有 |
| 社区 | 约 31.4k stars | 约 10.6k stars |
| 可做 SaaS | 是 | 否 |
结论:如果需要可商用/SaaS 化,选 Langfuse(MIT)。如果只用内部部署且需要 Java 支持,考虑 Phoenix。
场景 B:需要纯评测框架
DeepEval vs OpenAI Evals vs Inspect
| 维度 | DeepEval | OpenAI Evals | Inspect |
|---|---|---|---|
| 协议 | Apache 2.0 | MIT | MIT |
| tracing | 有 | 无 | 有 |
| 在线评测 | 有 | 无 | 无 |
| Agent评测 | 多框架集成 | completion fns | ReAct+sandboxing |
| 预置evals | 无 | registry | 200+ |
| 社区 | 约 16.9k | 约 18.9k | 约 2.4k |
结论:
- 需要 pytest 风格 + 多框架集成 -> DeepEval
- 需要 benchmark registry + OpenAI 生态 -> OpenAI Evals
- 需要 agent 评测 + sandboxing + 预置 evals -> Inspect
五、选型结论
本系列的推荐
本系列聚焦智能体评测,场景需求:
- 观测+评测一体(智能体需要 trace 评多步决策)
- 多语言(Py/TS/Java/Go)
- 可商用/SaaS 化
基于以上需求,推荐 Langfuse:
- 观测+评测一体 ✓
- OTel 全语言覆盖 ✓
- MIT 协议可 SaaS ✓
- 社区最活跃(约 31.4k stars)✓
这不是先入为主,而是基于调研事实的选型结论。如果你的场景不同,用下面的决策树自行选择。
不是唯一答案
你的场景:
需要观测+评测一体 + 可SaaS + 多语言 -> Langfuse
需要观测+评测一体 + 内部部署 + Java -> Phoenix
需要纯评测 + pytest风格 + 多框架 -> DeepEval
需要纯评测 + OpenAI生态 -> OpenAI Evals
需要 agent评测 + sandboxing -> Inspect
决策:选型决策树
读完本文,用决策树选择你的工具:
┌─────────────────────────────────────────────────────┐
│ 工具选型决策树 │
├─────────────────────────────────────────────────────┤
│ Q1: 需要观测+评测一体? │
│ ├─ 是 -> Q2 │
│ └─ 否 -> Q3 │
│ │
│ Q2: 需要可SaaS/商用? │
│ ├─ 是 -> Langfuse (MIT) │
│ └─ 否 -> Phoenix (ELv2) 或 Langfuse │
│ │
│ Q3: 需要 agent 评测 + sandboxing? │
│ ├─ 是 -> Inspect │
│ └─ 否 -> Q4 │
│ │
│ Q4: 需要 pytest 风格 + 多框架集成? │
│ ├─ 是 -> DeepEval │
│ └─ 否 -> OpenAI Evals │
└─────────────────────────────────────────────────────┘
选好工具后,⑦ 工具落地将展示选定工具的接入方式。