技术栈
llm-as-a-judge
张彦峰ZYF
1 小时前
人工智能
·
llm
·
ai agent
·
evaluate
·
llm-as-a-judge
·
prefactor
·
金融agent
Prefactor 从“看见 Agent”到“拦住 Agent”:实时评估如何重构 AI Agent 的生产可靠性
目录一、Prefactor 为什么值得讨论:Agent 的可靠性问题已经从“输出质量”升级为“执行治理”
张彦峰ZYF
20 天前
人工智能
·
agent-as-judge
·
llm-as-a-judge
·
agentevaluation
·
deepswe
·
verifier
·
agentic search
从“打分模型”到“审计智能体”:Agent-as-a-Judge如何重构复杂AI系统的评测范式
目录一、为什么复杂智能体正在让传统评测失效(一)评测对象已从“答案”变成“过程”1、稀疏终局指标无法解释失败
我是有底线的