技术栈

llm-as-a-judge

张彦峰ZYF
1 小时前
人工智能·llm·ai agent·evaluate·llm-as-a-judge·prefactor·金融agent
Prefactor 从“看见 Agent”到“拦住 Agent”:实时评估如何重构 AI Agent 的生产可靠性目录一、Prefactor 为什么值得讨论:Agent 的可靠性问题已经从“输出质量”升级为“执行治理”
张彦峰ZYF
20 天前
人工智能·agent-as-judge·llm-as-a-judge·agentevaluation·deepswe·verifier·agentic search
从“打分模型”到“审计智能体”:Agent-as-a-Judge如何重构复杂AI系统的评测范式目录一、为什么复杂智能体正在让传统评测失效(一)评测对象已从“答案”变成“过程”1、稀疏终局指标无法解释失败
我是有底线的