openevals

JaydenAI3 小时前
ai·langchain·agent·evaluation·openevals
[基于OpenEvals的自动化评估-11]针对Agent对话的评估[下篇]在上篇我们介绍了评估用户与Agent对话的三个指标,包括语气评估(Tone)、知识记忆评估(Knowledge Retention)和 用户感知错误评估(Perceived Error),接下来我们补充余下的三个:任务完成度评估(Task Completion )、用户满意度评估(User Satisfaction)和用户赞赏评估(Wins)。
JaydenAI1 天前
ai·langchain·agent·evaluation·openevals
[基于OpenEvals的自动化评估-07]评估Agent输出文本的质量[下篇]上篇我们介绍了如何利用OpenEvals提供的预定义提示词结合结合基于OpenEvals的自动化评估-02:LLM-as-a-Judge介绍了基于LLM-as-a-Judge的评估器来评估Agent生成文本的质量,我们具体介绍了针对简洁度、正确性、回答相关性和幻觉度这几个评估指标,接下来我们介绍剩下的几个包括计划遵循度、 惰性和生成代码正确性评估。
JaydenAI1 天前
ai·langchain·agent·evaluation·openevals
[基于OpenEvals的自动化评估-08]对Agent的输出和输入进行安全性评估中文的安全其实对应Safety和Security两个单词,它们的侧重点和防御的对象截然不同。Safety指的是防止系统出错或失控对人类或环境造成伤害,核心是防范无意的意外、错误或故障。Security指的是防止外部恶意人员对系统进行攻击、破坏或窃取。核心是防范有意的恶意行为。本文将介绍如何利用OpeEvals提供的提示词,结合基于OpenEvals的自动化评估-02:LLM-as-a-Judge:让LLM当裁判来评估Agent的输出介绍了基于LLM-as-a-Judge的评估器,针对五个安全指标的评估,分
我是有底线的