技术栈
agentevaluation
张彦峰ZYF
2 小时前
人工智能
·
agent-as-judge
·
llm-as-a-judge
·
agentevaluation
·
deepswe
·
verifier
·
agentic search
从“打分模型”到“审计智能体”:Agent-as-a-Judge如何重构复杂AI系统的评测范式
目录一、为什么复杂智能体正在让传统评测失效(一)评测对象已从“答案”变成“过程”1、稀疏终局指标无法解释失败
我是有底线的