AI到底如何生成测试用例

最近一直关注到 AI,比如最近比较火的 Harness,可以自由定义自己的 agent,想想就酷,我看还催生出了相关的行业岗位,大家打不过 AI 就加入 AI 吧。

生成测试用例时,即使设定了角色,有一些自定义的 skill,设定了能直接生成 XMind 文档,由于没有知识库,AI 本身的幻觉,文件生成的质量很差。

AI 就会自动扫代码、抓 wiki、逐阶段沉淀「领域知识 → 需求知识 → 测试策略 & 测试场景 → 用例」,最终产出:

可以,我帮你整理成一版**更适合汇报 / 面试 / PPT 口述**的表达。你这段内容本身已经很好了,我主要帮你做了三件事:

  1. 结构更清晰

  2. 表达更专业统一

  3. 更突出"AI 提效 + 工程化闭环"的价值


一版精炼总述

围绕"**从需求到用例集**"这一主线,这个工具并不是简单调用大模型生成测试用例,而是将**代码扫描、需求理解、策略设计、用例生成、人工审阅和平台导入**串成了一套完整的 AI 测试用例生产流水线。

整体上,工具提供 **5 类核心能力 + 3 类附加能力**,核心目标是实现:

  • 需求理解更结构化

  • 用例设计更系统化

  • 产物输出更标准化

  • 审阅导入更自动化

  • 知识沉淀更可复用


5 类核心能力

能力 1:代码到领域知识沉淀

这一层主要解决"AI 对业务上下文不了解"的问题。

工具会先扫描被测服务代码,沉淀领域知识,形成后续需求分析和用例设计的业务基线。

具体包括:

  • **扫描机制**:基于白名单和黑名单双层过滤,只保留有价值的业务代码和文档,过滤测试目录、无关文件等噪音

  • **结构化抽取**:从代码中提炼出

  • 领域概念 `concepts`

  • 状态机 `stateMachines`

  • 主流程 `mainFlows`

  • 关键规则 `keyRules`

  • 数据模型 `dataModels`

  • 接口信息 `endpoints`

  • **增量识别**:结合 `git log --since=<baseline>` 和文件 `mtime` 双依据识别变更,避免每次全量扫描

  • **知识回传**:审阅通过后自动 `git push` 到团队工具仓,支持跨需求、跨项目复用

这一能力的价值在于:

**先建立业务领域认知,再做需求理解和用例生成,减少模型"无上下文发挥"的风险。**


能力 2:需求到结构化知识

这一层主要解决"需求文档是自然语言,测试设计依赖人工拆解"的问题。

工具会把 wiki 或用户输入的需求,转成结构化测试知识。

具体包括:

  • **需求抓取**:支持 Confluence wiki 抓取,基于 Cookie 认证;也支持用户直接粘贴需求正文作为兜底

  • **结构化抽取**:由 LLM 从自然语言中提炼出

  • 主流程 `mainFlows`

  • 关键规则 `keyRules`

  • 字段枚举 `fieldEnums`

  • 业务风险 `risks`

  • 待定问题 `openQuestions`

  • **可追溯设计**:每条规则都挂 `sourceRefs`,能够回溯到 wiki 原始段落

  • **差异化输出**:与已有领域知识重复的内容不重复写,只保留需求增量部分,减少上下文冗余

这一能力的价值在于:

**把"看需求、拆逻辑、补风险点"从经验驱动转成结构化沉淀。**


能力 3:策略到场景到用例矩阵

这一层主要解决"AI 出用例容易发散失控、不成体系"的问题。

工具不是直接跳到测试用例,而是先产出测试策略和测试场景,再生成用例矩阵。

具体包括:

  • **一次推理产两份结果**:`strategy.md` 和 `scenarios.md` 同一次推理产出,避免多轮生成导致前后不一致

  • **显式编码测试方法学**:内置并约束使用以下方法

  • 等价类划分

  • 边界值分析

  • 判定表

  • 状态迁移

  • 正交法

  • 错误推测

  • 场景法

  • **防止场景爆炸**:对同后果的多变体强制合并到 `testData`,避免全排列、全路径式膨胀

  • **风险分层**:按 `P0 / P1 / P2` 分级,并对

  • 资损

  • 合规

  • 隐私

  • 口碑

  • 稳定性

这 5 类 `riskTags` 做重点升级

这一能力的价值在于:

**让 AI 生成用例不只是"发散列点",而是遵循测试设计方法论,形成可控、可解释的场景体系。**


能力 4:用例到多形态产物

这一层主要解决"AI 生成内容格式不统一、难以落地"的问题。

工具把用例统一沉淀为标准结构,再自动派生多种交付形态。

具体包括:

  • **单一权威源**:LLM 只生成 `cases.json`,作为唯一权威数据源

  • **多形态派生**:

  • `cases.md` 用于评审和阅读

  • `.xmind` 用于脑图展示

  • **XMind 合规导出**:自动补齐 `META-INF/manifest.xml`,确保生成文件可被 XMind 8 / Pro 正常打开

  • **Schema 强校验**:采用 14 字段严格校验,任何关键字段缺失都拒绝落盘

  • **内容硬约束**:强制覆盖以下关键测试点

  • Loading 态

  • 精确文案

  • 竞态说明

  • 降级触发

这一能力的价值在于:

**把 LLM 输出从"文本结果"升级成可评审、可导入、可复用的标准测试资产。**


能力 5:用例到 Case 平台一键导入

这一层主要解决"AI 出了用例,但还要人工搬运到平台"的问题。

工具支持将结构化用例自动导入 Case 平台,打通最后一公里。

具体包括:

  • **零手工导入**:自动新建用例集,并通过一次接口调用完成全部用例下发

  • **项目智能匹配**:按"精确匹配 > 前缀匹配 > 子串匹配"三层规则匹配目标项目,唯一命中直接使用

  • **平台数据结构适配**:由 CLI 使用 Python 组装 KityMinder 所需 `brainJson`,而不是让 LLM 手写 `curl/jq`

  • **审计留痕**:完整保留 `payload` 和 `response`,导入失败可直接回溯和重放

这一能力的价值在于:

**真正实现从测试设计到平台落地的自动闭环,而不是停留在文档层。**


3 类附加能力

1. 任务恢复

通过 `state.json` 记录当前阶段,任务中断后可以从任意阶段继续执行,保证流程可恢复、可续跑。

2. 知识沉淀

审阅通过的领域知识和需求知识会自动同步到团队工具仓,逐步形成共享知识库,支持后续复用。

3. 诊断自检

提供 `doctor` 命令,一键检查:

  • 6 个 SKILL 是否安装到位

  • CLI 是否可执行

  • Cookie / 环境变量是否配置完整

  • 当前运行环境是否健康


一版适合面试/汇报的收口话术

你可以直接这样说:

**这个工具本质上是一套 AI 驱动的测试用例生产流水线。它不是简单让模型生成几条 case,而是把代码扫描、需求结构化、测试策略设计、场景生成、用例标准化输出、人工审阅和平台导入串成完整闭环。它的核心价值,一方面是提升测试设计效率,另一方面是通过结构化产物、Schema 校验、STOP 审阅和知识沉淀机制,把 AI 生成过程变得可控、可追溯、可复用。**


相关推荐
LHX sir1 小时前
医疗设备外设多、协议杂?HubPort 让出厂设备自带 AI
人工智能·物联网·医疗设备·设备智能化
chuan.bai1 小时前
Java RAG 实战附录:qwen3 与 bge-m3 模型切换指南
java·人工智能·算法
武子康1 小时前
Pi Extension 写完不等于可用:从类型检查到真实 Runtime 的证据阶梯
人工智能·llm·agent
润乾软件1 小时前
如何给已有报表系统增加 AI 语言查询能力——AI 赋能数据分析技术探讨与实践
人工智能·chatbi
微硬创新1 小时前
不用换设备,也能接入智能系统:耐达讯自动化NY-B801网关的神奇功效
人工智能·网络协议·自动化·信息与通信
Elastic 中国社区官方博客1 小时前
Elasticsearch:什么是向量数据库?
大数据·运维·数据库·人工智能·elasticsearch·搜索引擎·ai
LHX sir1 小时前
MCP 协议是什么?HubPort 如何让设备被 AI 智能体调用
人工智能·物联网·ai智能体·mcp
jikemaoshiyanshi1 小时前
AI 训练 GPU 利用率偏低,如何通过云上高性能存储优化成本?AWS 基于 I/O 瓶颈分层选型
人工智能·云计算·aws