技术栈

agentevals

JaydenAI
2 小时前
ai·langchain·agent·evaluation·openevals·agentevals
[基于AgentEvals的自动化评估-06]以LLM-as-a-Judge评估LangGraph执行轨迹对于利用LangGraph构建的工作流,前面的文章介绍了不需要LLM参与,通过将提取的执行轨迹与评估基准进行比较的方式来评估。我们不经介绍了AgentEvals原生的评估方案,还介绍我们经过改进和优化的方案(上篇下篇),以及如何从持久化的Checkpoint中提取执行轨迹。出来这种依赖我们手工比较的方式,我们也可以利用LLM-as-a-Judge的形式来评估其执行轨迹。
我是有底线的