ZGI 批量测试:上线前验证 Agent

Agent 单次回答正确,只能证明当前输入跑通。上线前还要确认换一种问法、缺少字段、知识更新、工具超时或权限不足时,系统会给出预期结果。批量测试把这些任务保存成可重复运行的样本,每次修改模型、知识、Skill 或 Workflow 后重新执行,比较关键字段和最终状态。

ZGI 将可复用批量测试放在 Agent 的发布与运行治理中。Agent 可以绑定批准的知识、数据库、Skills 和 Workflow,测试时用同一组任务检查变更是否影响检索、工具参数、分支判断和执行结果。运行日志用于定位失败发生在哪一步。

先把"回答正确"拆成可检查结果

不同任务的通过标准并不相同。知识问答需要检查引用资料是否匹配;结构化抽取关注字段名称、类型和必填项;工具任务还要确认调用对象、参数、权限与返回状态。只看最终自然语言,很容易漏掉中间步骤的错误。

例如订单查询任务返回了一段流畅说明,但调用时使用了错误客户编号,这条结果不能通过。退款流程正确判断了条件,却在审批前写入业务系统,也属于失败。通过标准应落到能够核对的字段和状态上。

样本类型 需要检查 预期结果
正常任务 内容、字段、工具结果 完成指定目标
信息缺失 必填字段与追问路径 停止执行并补充信息
权限不足 身份、对象与动作 拒绝越界调用
接口异常 超时、错误码与重试 进入预设失败路径
状态变化 旧参数与最新业务状态 重新读取后再判断

样本要来自真实任务分布

测试集只放标准问题,批量运行通常会得到很好看的结果。生产环境里更常见的麻烦来自缩写、旧名称、跨段资料、模糊时间和不完整输入。样本需要覆盖常见任务,也要保留曾经失败的问题。

每条样本至少记录输入、期望结果、检查字段、允许动作和数据版本。涉及知识库时,还要写明期望引用的资料范围;涉及工具时,保存应调用的工具和禁止发生的副作用。无法写出期望结果的任务,暂时不适合自动判定。

失败分类比一个总分更有用

一条任务失败后,应区分资料没有进入候选、模型提取错误、工具参数不符、权限拦截、流程分支错误或外部接口异常。把所有问题压成一个分数,很难指导修改,也可能让严重的越权问题被大量简单样本稀释。

测试报告可以按任务类型和失败阶段汇总。涉及资金、删除、外发和权限修改的样本需要单独设置上线门槛,即使整体通过数量较高,只要高风险样本失败,发布仍应停止。

变更后只跑相关样本还不够

修改知识切分时,先运行知识问答样本很合理,但还要保留一组跨模块回归任务。知识片段变化可能影响 Workflow 的条件判断,模型切换也可能改变工具参数。相关样本用于快速定位,固定回归集负责发现意外影响。

在 ZGI 中,可以先为一个 Agent 保存少量高频任务和已知失败任务,明确每条样本的关键字段与最终状态。每次调整模型、知识、Skill 或 Workflow 后重新运行,失败结果再结合运行日志定位。样本持续积累后,上线判断会逐渐从"演示看起来正常"变成可复查的发布条件。

GitHub:github.com/zgiai/zgi

Gitee:gitee.com/zgiai/zgi

相关推荐
qq407855601 小时前
面向智能补货需求的进销存系统盘点
大数据·人工智能·低代码·制造
Web3_Daisy2 小时前
从流动性到执行:如何降低 MEV 对 Web3 市场
大数据·人工智能·web3·区块链
日常通勤穿搭2 小时前
电商 AI 作图用哪个最方便?新手商家 AI 出图工具对比
大数据·人工智能
爱学堂IT分享2 小时前
DeepSeek+SpringAI实战AI家庭医生应用(10章) 完整版
人工智能
QXWZ_IA2 小时前
千寻位置支持哪些卫星系统?北斗GPS多星座解析
人工智能·科技·智能硬件·rtk
小淮AI2 小时前
一个国际家庭在武汉的择校笔记:两份外籍人员子女学校的课程方案比较
大数据·人工智能
deepdata_cn2 小时前
如何从0到1学习AI向量基础
人工智能·向量
随风丶飘2 小时前
[特殊字符] 告别“update“和“fix bug“——Smart Git Commit LLM 让 AI 帮你写专业的 Git 提交信息
人工智能·git·bug
H0311169853 小时前
择校参考:枫叶教育 vs 大连美国国际学校,外籍子女学校怎么选
人工智能