evaluation

JaydenAI3 小时前
ai·langchain·agent·evaluation·openevals
[基于OpenEvals的自动化评估-12]Agent执行轨迹评估[无LLM参与]如果您正在构建Agent,OpenEvals包含用于评估Agent完整执行轨迹的评估器,即Agent在解决任务过程中发出的消息和工具调用序列。由于用户与Agent之间采用基于消息的通信方式,所以Agent的执行轨迹通过返回的消息列表来体现。执行轨迹在OpenEvals中以OpenAI风格的消息列表格式呈现。此外,也支持LangChain的BaseMessage对象。在进行两个消息的比较时,只考虑角色和工具调用,会忽略消息的其他内容。
JaydenAI1 天前
ai·langchain·agent·evaluation·openevals
[基于OpenEvals的自动化评估-11]针对Agent对话的评估[下篇]在上篇我们介绍了评估用户与Agent对话的三个指标,包括语气评估(Tone)、知识记忆评估(Knowledge Retention)和 用户感知错误评估(Perceived Error),接下来我们补充余下的三个:任务完成度评估(Task Completion )、用户满意度评估(User Satisfaction)和用户赞赏评估(Wins)。
JaydenAI2 天前
ai·langchain·agent·evaluation·openevals
[基于OpenEvals的自动化评估-07]评估Agent输出文本的质量[下篇]上篇我们介绍了如何利用OpenEvals提供的预定义提示词结合结合基于OpenEvals的自动化评估-02:LLM-as-a-Judge介绍了基于LLM-as-a-Judge的评估器来评估Agent生成文本的质量,我们具体介绍了针对简洁度、正确性、回答相关性和幻觉度这几个评估指标,接下来我们介绍剩下的几个包括计划遵循度、 惰性和生成代码正确性评估。
JaydenAI2 天前
ai·langchain·agent·evaluation·openevals
[基于OpenEvals的自动化评估-08]对Agent的输出和输入进行安全性评估中文的安全其实对应Safety和Security两个单词,它们的侧重点和防御的对象截然不同。Safety指的是防止系统出错或失控对人类或环境造成伤害,核心是防范无意的意外、错误或故障。Security指的是防止外部恶意人员对系统进行攻击、破坏或窃取。核心是防范有意的恶意行为。本文将介绍如何利用OpeEvals提供的提示词,结合基于OpenEvals的自动化评估-02:LLM-as-a-Judge:让LLM当裁判来评估Agent的输出介绍了基于LLM-as-a-Judge的评估器,针对五个安全指标的评估,分
JaydenAI10 天前
ai·nlp·agent·evaluation·maf
[Agent的评估-07]整合MEAI针对自然语言处理相关的评估器Agent的评估-05:MEAI用来评估LLM响应质量的9种评估器介绍了定义在NuGet包Microsoft.Extensions.AI.Evaluation.Quality中与质量相关指标(包括完整性、一致性、相关性和等效性等)的各种评估器。除此之外,在NuGet包Microsoft.Extensions.AI.Evaluation.NLP还包含两个与自然语言处理(NLP)相关的评估器,这篇文章就来聊聊它们都用来评估怎样的指标,以及如何利用Agent的评估-06:如何改进MAF针对MEAI评估系统的适配
伊布拉西莫9 个月前
spring-ai·evaluation
Spring AI Evaluation Testing(评估测试)在基于大型语言模型(LLM)构建应用时,仅仅“模型调用”并不够,还必须 测试生成结果 是否满足预期(比如相关性、准确性、无幻觉、业务契合度等)。 Spring AI 提供了一套 “评估测试” (Evaluation Testing)机制,使开发者能在集成/测试阶段,引入自动化手段来验证 LLM 的输出质量。
我是有底线的