技术栈

deepswe

张彦峰ZYF
2 小时前
人工智能·agent-as-judge·llm-as-a-judge·agentevaluation·deepswe·verifier·agentic search
从“打分模型”到“审计智能体”:Agent-as-a-Judge如何重构复杂AI系统的评测范式目录一、为什么复杂智能体正在让传统评测失效(一)评测对象已从“答案”变成“过程”1、稀疏终局指标无法解释失败
我是有底线的