AI时代测试方向AI for Testing和Testing for AI

测试目前有两个方向:AI for Testing(用AI测试)和Testing for AI(测AI产品)

AI测试学习地图

一、AI for Testing

以下是AI for Testing框架,AI驱动的全链路自动化测试流水线

Skill技能:稳定的流程写成说明书加规则库加脚本库,打包给AI,让AI能反复并稳定的执行

专家Agent:角色卡+工具库+工作流程规范,包含:AGENT.mdSOUL.mdUSER.md、skills等

多Agent协同:如果一个Agent什么都干,容易顾此失彼,执行层由子Agent执行,一是为了保持主Agent上下文干净,二是避免上下文太长,大模型注意力分散

workflow:Agent灵活但是不稳定,不可控,所以测试流程需要workflow工作流,通过预定义的一条代码路径来编排模型和工具的系统,AI只负责在每个节点上面干活,不能自己去改路线。

AI x 测试全流程:AI渗漏到测试中的每个环节,比如AI生成测试用例接口自动化,UI自动化,造数,根因分析,如果只是让每个环节都用上AI,肯定是不够用的,我们需要做到AI测试的工程化,所有我们不能只依赖codex,openclaw这类的通用agent通过skill完成零散的任务,我们需要直接调用AI模型,结合公司的技术栈,自主的去设计和开发测试Agent,在代码里要自己调度任务,对过程数据进行处理落库,确保每一次的执行都可追踪可回溯,最后把这个Agent作为测试质量的节点接入到流水线中,成为发布管控的一环,最终要实现端到端的AI测试,让QA从大量重复的工作里面释放出来,把精力放在风险判断、质量标准和关键结果确认上面。

二、Testing for AI

第一部分是借助AI完成测试任务,广义的AI测试还包含,用AI测试生成内容,叫做AI评测,

AI评测与传统软件测试区别:

传统的软件测试通常由相对明确的预期结果,可以通过断言判断对错,但是生成式AI具有概率性,同样的输入可能得到不同的答案,很多任务是没有唯一标准答案的,整套测试方案发生平易

|-------|--------------------|
| 传统测试 | AI测评 |
| 测试用例 | 评测数据集 |
| 断言 | 评分器Grader |
| 通过/失败 | 分数与通过率 |
| 执行一轮 | 批量运行agent看评测统计结果 |
| 回归测试 | CI/CD集成,每次有变动重跑评测集 |

1.构建评测数据集

准备100-200个典型问题+标准答案

2.批量运行Agent

3.自动评分

  • EM(精确匹配):答案与标准答案完全一致
  • F1-Score:部分匹配度
  • LLM-as-Judge:用一个更强的模型打分(如GPT-4评判GPT-3.5)
  • 工具调用链对比:对比Agent调用工具的顺序和参数

4.CI/CD集成

每次Agent Prompt或逻辑变更,自动跑一遍评测集

其中评测的维度包含:

维度 指标 如何量化
任务完成率 是否完成预期目标 人工标注 / 规则判断
答案准确性 回答是否正确 与标准答案对比 / 专家评审
工具调用准确率 是否调用了正确的工具/API 日志分析
效率 完成任务需要多少轮 轮次统计、Token消耗
鲁棒性 异常输入是否优雅降级 边界用例测试
[Agent评测维度]
相关推荐
武子康5 小时前
GPT-Red:自动化红队如何形成 Agent 安全数据飞轮(4 个闭环 + 6 类评测指标 + 5 类风险误读)
人工智能·openai·agent
阿里云大数据AI技术6 小时前
DataWorks Data Agent 实战课堂(二):一句话搞定数据集成+处理,实现端到端数据流水线
人工智能·agent
Days20506 小时前
AI漫剧vs传统动漫vs真人短剧
人工智能
武子康6 小时前
从恶意 Dataset 到横向移动:一套可落地的 Dataset Processing Threat Model(资产边界 + 威胁枚举 + 5 层控制)
人工智能·安全
redreamSo6 小时前
一天涨 1800 星的 GitHub 榜首:AI 编程瓶颈变成了 token
人工智能·开源·github
wp123_16 小时前
实测数据对飙:COILCRAFT XFL4020-222MEC vs TONEVEE MVL4020-2R2M,2.2µH功率电感参数全解读
人工智能
本末倒置1836 小时前
从 PDF 到向量检索:一个最简单的本地 RAG 入库案例
人工智能
QYR-分析6 小时前
智能化自动化浪潮下,机器人末端执行器行业赛道发展全景解析
人工智能·机器人·自动化
大模型服务器厂商6 小时前
人形机器人年产冲刺 10 万台,算力底座成核心支撑
人工智能·机器人