
目录
[1. 纯 API 服务型(后台能力底座,无前端界面)](#1. 纯 API 服务型(后台能力底座,无前端界面))
[2. 网页端对话应用(C 端通用聊天产品)](#2. 网页端对话应用(C 端通用聊天产品))
[3. 客户端独立 App(手机 / PC 桌面端)](#3. 客户端独立 App(手机 / PC 桌面端))
[4. 嵌入式 / 插件集成型(依附第三方载体)](#4. 嵌入式 / 插件集成型(依附第三方载体))
[5. 本地私有化部署模型(私有机房 / 本地离线)](#5. 本地私有化部署模型(私有机房 / 本地离线))
[6. 多模态一体机产品(图文音视频全能力)](#6. 多模态一体机产品(图文音视频全能力))
[(一)API 服务型大模型测试](#(一)API 服务型大模型测试)
[(三)手机 / PC 客户端 App 大模型](#(三)手机 / PC 客户端 App 大模型)
[(四)嵌入式 / 插件集成型大模型](#(四)嵌入式 / 插件集成型大模型)
[模板 1:测试范围区分表](#模板 1:测试范围区分表)
[模板 2:测试执行区分思路](#模板 2:测试执行区分思路)
一、大模型主流产品形态分类
1. 纯 API 服务型(后台能力底座,无前端界面)
代表:厂商开放大模型接口、企业内部推理服务、微调托管服务 核心特征:仅提供 HTTP/GRPC 接口,供业务系统调用,无用户交互页面
2. 网页端对话应用(C 端通用聊天产品)
代表:各类网页版 AI 对话助手、网页知识库问答 核心特征:浏览器访问,单轮 / 多轮对话、文件上传、插件、生成内容预览
3. 客户端独立 App(手机 / PC 桌面端)
代表:手机 AI 助手 APP、电脑桌面客户端大模型软件 核心特征:独立安装包,本地缓存、推送、多端同步、离线推理模块
4. 嵌入式 / 插件集成型(依附第三方载体)
细分:
- SaaS 插件:Office 插件、飞书 / 钉钉 / 企业微信 AI 助手
- 硬件嵌入式:车载大模型、智能音箱、工业终端 AI
- 业务内嵌:电商客服、教育题库、医疗问诊系统内置 AI 模块
5. 本地私有化部署模型(私有机房 / 本地离线)
代表:企业本地部署开源大模型、内网专属大模型、离线无网推理包 核心特征:数据不出内网,支持本地微调、本地向量库,无公网调用
6. 多模态一体机产品(图文音视频全能力)
代表:AI 绘画 + 对话 + 语音生成 + 视频生成一体化产品 核心特征:文本、图片、音频、视频输入输出融合交互
二、不同产品形态差异化测试重点
(一)API 服务型大模型测试
- 接口基础能力
- 入参校验:prompt 长度、温度、top_p、最大生成长度、流式 / 非流式切换
- 并发压测:QPS 上限、超时、限流、熔断、批量推理性能
- 协议兼容:HTTP/HTTPS、流式 SSE、GRPC 二进制传输稳定性
- 安全与权限
- Token 鉴权、调用频次计费、IP 白名单、接口访问隔离
- 输入输出内容安全拦截、敏感词屏蔽、越狱 Prompt 防御
- 运维专项
- 推理耗时、显存 / 内存占用、批量任务排队机制
- 版本灰度切换、模型热更新不中断服务、异常日志上报
- 独有风险点 下游业务依赖接口,需重点测异常返回容错(空值、乱码、超长文本、报错码)
(二)网页对话端大模型测试
- 前端交互专项(独有)
- 对话渲染:长文本自动换行、代码块高亮、表格 / 公式渲染、Markdown 解析
- 多媒体交互:上传 PDF/Word/ 图片解析、拖拽文件、截图识别
- 页面状态:刷新保留对话历史、多标签会话隔离、滚动加载、输入防抖
- 会话能力
- 多轮上下文记忆、会话新建 / 删除 / 重命名、历史检索
- 撤回、重新生成、分段输出流式动画展示
- 浏览器兼容 Chrome/Edge/Firefox/Safari、移动端 H5 适配、低网速降级策略
- 独有风险点 前端 XSS 注入、超大对话缓存页面卡顿、文件上传大小限制、跨域请求失败
(三)手机 / PC 客户端 App 大模型
- 端侧专属测试项
- 安装卸载、更新覆盖、后台保活、内存泄漏、电量消耗
- 本地缓存:对话记录本地加密存储、清理缓存功能、云端同步冲突
- 离线模式:离线轻量化模型推理、无网络时功能降级
- 设备适配 手机不同分辨率、低配置机型卡顿、PC 客户端窗口缩放、快捷键交互
- 系统权限 相册 / 麦克风 / 存储权限申请、录音语音转文字、本地文件读取权限管控
- 独有风险点 安装包体积、后台偷跑流量、锁屏中断生成、多账号登录数据混淆
(四)嵌入式 / 插件集成型大模型
- 宿主兼容性测试
- 插件安装卸载、宿主版本兼容、不破坏原有软件功能
- 唤起逻辑:右键唤起、侧边栏按钮、指令触发 AI 功能
- 上下文联动 读取宿主文档 / 聊天内容作为 Prompt、修改宿主内容回写保存
- 资源隔离 插件内存独立,AI 推理不导致宿主软件崩溃、卡死
- 细分场景特殊点
- 办公插件:文档格式兼容、生成内容格式匹配原文
- 车载模型:语音降噪、行车中断响应、无屏幕语音交互
- 企业 IM 插件:群聊上下文、成员权限隔离、敏感群消息过滤
(五)私有化本地部署大模型
- 部署运维专项(核心差异)
- 单机 / 分布式集群部署、容器 Docker/K8s 启停、资源分配调度
- 内网无外网环境全功能验证、本地向量库对接、本地知识库导入
- 模型微调流程:数据集上传、训练任务启停、训练失败回滚
- 数据合规 数据全程内网流转、无对外网络请求、本地日志脱敏、数据导出权限管控
- 硬件适配 国产 GPU/CPU 推理、显存不足降级策略、离线批量任务调度
- 独有风险点 部署步骤缺失导致功能异常、集群节点宕机任务丢失、本地存储溢出
(六)多模态一体化大模型产品
- 跨模态联动测试
- 文生图、图生文、图文混合问答、语音转文本再生成视频
- 多模态输入混合边界:超长文本 + 多张图片并发推理
- 媒体资源处理 图片分辨率上限、音频时长限制、视频生成进度、媒体文件导出格式
- 模态异常兼容 模糊图片、杂音语音、损坏视频文件输入,模型不崩溃、给出友好提示
三、通用测试项(所有产品形态均需覆盖)
无论哪种形态,基础大模型能力统一测试:
- 生成质量:逻辑一致性、事实准确性、幻觉、多语言、专业领域问答
- 内容安全:暴力、色情、政治敏感、诱导越狱、隐私泄露拦截
- 功能基础:流式输出、上下文记忆、参数自定义(温度、长度)
- 异常容错:超长输入、空输入、特殊符号、乱码、并发多会话
- 易用性:报错提示、失败重试、功能降级、操作引导
四、快速区分产品形态测试用例分层模板
模板 1:测试范围区分表
| 产品形态 | 核心测试分层 | 优先级最高测试点 |
|---|---|---|
| API 接口服务 | 接口层、服务层、计费层 | 并发压测、限流熔断、返回异常兼容 |
| 网页对话端 | 前端交互、会话层、浏览器适配 | 文件解析、长对话渲染、页面缓存 |
| 独立 App 客户端 | 端侧性能、本地存储、权限 | 耗电 / 内存、离线推理、多端同步 |
| 插件嵌入式 | 宿主兼容、数据互通、资源隔离 | 插件冲突、文档内容读取回写 |
| 私有化部署 | 集群部署、内网离线、本地微调 | 无网全功能、分布式稳定性 |
| 多模态一体机 | 图文音视频联动、媒体导出 | 跨模态混合输入、素材生成稳定性 |
模板 2:测试执行区分思路
- 先跑通用大模型能力用例(质量、安全、基础对话)
- 再执行对应产品形态专属差异化用例
- 最后执行形态边界场景(如 API 嵌入网页、私有化客户端混合场景)