用途 :一份可直接对照打分的参数清单,用于评估任一"端侧/车载大模型方案"是否满足部署要求。给任何供应商填写后,评估者都能据此判断模型是否达标、好坏如何。
参数体系 :按 A~H 八类 组织(A 规格档案 / B~E 部署与运行 / F 能力 / G 车载能力验收 / H 合规红线),八类共同构成大模型上车评估体系 ,评估时一体使用。其中 B6/C5/D4/F8/F9 为车规/车载特有项,直接编入所属类 (说明列标"车载专项"),不单独分组。
字段统一 :参数表统一为
优先级 | # | 参数 | 参考阈值/达标标准 | 方向(调高/调低影响)| 说明。"参考阈值/达标标准"列只放真正的参考值或达标判据 (含来源);"供应商如实填写"是所有参数的默认要求 ,不再逐行标注(A 类基础档案尤其必须填全)。"方向"列 明确每个参数向上/向下调整分别影响什么。调研方式 :在原有资料基础上,补充检索了 NVIDIA 官方推理基准、端侧部署三大瓶颈、车规芯片实测规格、国家标准指导性文件《车用大模型能力评价指南》(GB/Z 征求意见稿,工信部+全国汽标委SAC/TC114) 、中国汽车工程学会团标、中汽智测座舱标准、GB/T 45288《人工智能大模型》系列、《汽车数据安全管理若干规定》等权威资料。
使用逻辑:A 档案 → B/E 判断"装不装得下"(硬门槛),C/D 判断"跑不跑得动"(性能/功耗,含车规热约束 C5/D4),F 判断"好不好"(能力,含车载任务 F8/F9);G 判断"车上达不达标"(权威能力评价)、H 判断"合不合规安不安全"(红线)。
参数体系总览(按类组织,评估时一体使用)
| 类 | 参数范围 | 回答的问题 | 判定性质 |
|---|---|---|---|
| A 模型规格 | A1~A7(参数量/激活/架构/层数/上下文/词表/模态) | 模型是什么、多大规模 | 基础档案(全部必填) |
| B 部署资源 | B1~B6(存储/内存/算力/带宽/框架/国产算力) | 装不装得下 | 硬门槛 |
| C 推理性能 | C1~C6(TTFT/TPOT·生成速度/Prefill/加载/热态保持/并发) | 跑得快不快、稳不稳 | 体验指标(可降级缓解) |
| D 效率功耗 | D1~D5(功耗/J每token/带宽利用率/持续算力/能效密度) | 费不费电、省不省资源 | 效率指标(含车规热约束) |
| E 量化压缩 | E1~E5(精度与量化/压缩率/精度损失等) | 精度换资源怎么换 | 硬门槛+权衡 |
| F 模型质量 | F1~F9(知识/推理/指令遵循等 Benchmark + 车载任务完成/语音多模态) | 能力强不强 | 横向选型对比(F8/F9 为上车门槛构成项) |
| G 车载能力 | G1~G29(GB/Z 四维子能力 / 中汽智测+团标验收门槛 / 语音多模态实测专项) | 车上能力达不达标 | 权威验收门槛 |
| H 数据合规 | H1~H9(车内处理/出境/最小化采集等) | 合不合规 | 法规红线 |
编排说明 :车规/车载特有项(B6 国产算力、C5 热态保持、D4 持续算力、F8/F9 车载能力)直接编入所属类,说明列标"车载专项",不单独分组。各类编号连续(量化方案统一在 E1 评估、生成速度并入 C2,均不单列)。
优先级判定标准(客观依据,非主观判断)
每个参数的优先级由下面两条可验证、可推理的客观规则推导得出,不依赖个人经验判断:
规则一:因果链位置 ------ 装不下/跑不动的资源参数是硬门槛
核心因果结构(逻辑必然,非主观偏好)。注意延迟有两条上游,与 B3 子维度"Prefill 看算力、Decode 看带宽"一致:
总参数量×精度 ──→ 存储/内存需求(装不装得下)
激活参数量 ──→ Prefill 算力需求 ──→ TTFT(首字延迟)
总参数量×精度 ──→ Decode 带宽需求 ──→ TPOT(生成速度)
算力/带宽×时长 ─→ 能耗 ──→ 功耗/发热 ──→ 热降频
- 资源需求参数(B1 存储/B2 内存/B3 算力/B4 带宽)不满足,推理根本无法进行或达不到目标速度 ,下游所有指标(延迟/功耗/体验)都失去评估意义 → 硬门槛 = ⭐⭐⭐
- 源头参数(A1 总参数量/A2 激活参数量) :无独立阈值、本身不是门槛,但决定全部下游资源需求,缺失则因果链无从算起,故同为 ⭐⭐⭐
- 下游参数(延迟/功耗/体验类) :上游不满足时失去意义,但自身不满足可通过降级/限频/换模型缓解 → ⭐⭐
规则二:标准明文红线 / 法规强制 ------ 一票否决项
以下类型依据标准/法规明文判定为 ⭐⭐⭐(满足任一即最高优先级):
- GB/Z《车用大模型能力评价指南》明文规定 :学习能力安全边界符合率必须=100% (公式33)、生成能力回复敏感性一票否决、每个子能力测试用例≥30条。
- 中汽智测 :行驶中误操作 100% 零容忍 、座舱交互/应用能力 ≥60% 门槛。
- 法规强制 :《汽车数据安全管理若干规定》中的数据出境评估、最小化采集、车内处理优先等合规硬约束。
- 车规环境/可靠性明文:-40~85°C 工况、长时稳定运行等车规强制要求(C5 热态保持率、D4 持续算力的 ⭐⭐⭐ 依据)。
- 门槛构成项继承:构成 ⭐⭐⭐ 门槛的直接子项继承该门槛优先级(如 F4 幻觉→回复敏感性一票否决;F8/F9、G24→中汽智测 60% 门槛;G8/G22→团标执行能力)。
综合判定矩阵
| 优先级 | 客观判定依据(满足其一) | 判定逻辑 |
|---|---|---|
| ⭐⭐⭐ | ① 资源硬门槛/源头参数 :不满足则推理无法进行或达不到目标 (存储/内存/算力/带宽/量化兑现),或为决定全部资源需求的源头(A1/A2 参数量);② 标准明文红线 (必须=100%/一票否决/零容忍);③ 法规强制 ;④ 车规环境/可靠性明文或 ⭐⭐⭐ 门槛构成项继承 | 缺它方案直接不可行或违规 |
| ⭐⭐ | 非硬门槛,但决定目标场景的可用性与体验 ;不满足时可通过量化/降级/裁剪缓解,但体验或效率明显受损 | 缺它方案可用但大打折扣 |
| ⭐ | 仅影响特定场景或精细化环节;缺失不影响核心功能落地,可后置处理 | 缺它方案仍可落地 |
三者不是"轻重"关系,而是"缺了它会怎样"的客观后果差异:⭐(仍落地)→ ⭐⭐(可落地但受损)→ ⭐⭐⭐(不可行或违规)。
A. 模型规格参数(模型本身)· 通用
本表及以下各表字段统一为:
优先级 | # | 参数 | 参考阈值/达标标准 | 方向(调高/调低影响)| 说明。"方向"列 明确每个参数向上/向下调整的影响(不一定非黑即白,常为权衡)。A 类是基础档案(全部必填),阈值列给端侧典型参考范围。
| 优先级 | # | 参数 | 参考阈值/达标标准 | 方向(调高/调低影响) | 说明 |
|---|---|---|---|---|---|
| ⭐⭐⭐ | A1 | 总参数量 | 端侧主流档位 1.5B/3B/7B/14B(按目标场景选定) | 调高→能力更强,所需内存/体积/算力/带宽更大;调低→能力较弱,资源需求更小 | 源头参数:决定全部下游资源需求(规则一) |
| ⭐⭐⭐ | A2 | 激活参数量(MoE) | MoE 典型为总参数的 1/4~1/8(如 14B 总/3.5B 激活);Dense 时 = A1 | 调高→实际计算量更大、算力门槛更高;调低→算力需求更小,但能力可能下降 | 源头参数:决定实际计算量;MoE 需区分"总参数=内存、激活参数=算力" |
| ⭐ | A3 | 架构类型 | Dense 或 MoE(端侧 MoE 渐成主流) | 各架构无绝对好坏,是"内存 vs 算力"权衡:MoE 内存需求高但算力需求低,Dense 反之 | 决定 A1/A2 取值方式,是理解其他参数的前提 |
| ⭐ | A4 | 层数/隐藏维/注意力头数 | 端侧 7B 典型 ~32 层 / 32 头(供 KV Cache 估算) | 调高→KV Cache 更大、内存需求更高、并行策略更复杂;调低→内存更小,但容量能力受限 | 决定 KV Cache 与并行策略 |
| ⭐⭐ | A5 | 上下文窗口长度 | 车机对话 ≥8K 常用;长文档/深度多轮场景 32K+ | 调高→长对话/长文档能力更强,但 KV Cache 和内存峰值更高;调低→更省内存,但长文本受限 | 决定 KV Cache 大小;可通过限制上下文长度缓解 |
| ⭐ | A6 | 词表大小 | 常见 32K~150K(中文增强词表偏大) | 调高→多语言/符号能力更强,但嵌入层体积和内存更大;调低→更省内存,但能力较弱 | 影响多语言能力与嵌入层体积;另需关注中文 token 效率(bytes/token)------中文每字 token 数直接影响同等内容下的实际生成速度 |
| ⭐⭐ | A7 | 支持模态 | 车机基线:文本+语音;座舱多模态(图像/视频)为加分项 | 模态越多→能力越强,但需额外编码器、内存和算力更大;模态越少→更轻量,但缺少相应能力 | 决定是否需额外编码器;缺模态则相应能力缺失,但纯文本仍可用 |
注: 原 A8"原生精度"已并入 E 类 E1"精度与量化"(见下)。精度是"部署量化决策"的基线,与量化位宽同属一个参数的两个维度,不单独在 A 类重复列。
B. 部署资源参数(硬件门槛)· 通用
⚠️ B2/B3/B4 已从"单值最低要求"升级为"多阶段" :真实部署中这些资源占用随运行阶段/上下文/并发动态变化 ,只看"最低值"会导致长上下文或并发场景中途 OOM / 降速。因此每个参数统一按"阶段(初始化/稳态≈均值/峰值)+ 分布(P50/P95) "刻画,参数本身仍是一个参数,子维度见各参数下方说明。
| 优先级 | # | 参数 | 参考阈值/达标标准 | 方向(调高/调低影响) | 说明 |
|---|---|---|---|---|---|
| ⭐⭐⭐ | B1 | 存储占用 | 参数量×精度字节数(FP16=2B,INT8=1B,INT4=0.5B)< 可用存储 | 调高→占存储更多、加载更慢、带宽需求更大;调低→更省存储、带宽需求更小 | 量化换算见"量化速查" |
| ⭐⭐⭐ | B2 | 内存占用 | 初始化(权重+一次性加载开销)→ 稳态(运行基线,≈均值)→ 峰值(长上下文/大 batch 最高),三阶段均 < 可用 RAM ;按 P95 预留余量 | 需求调高→对设备内存要求更高、可能装不下;调低→装得下但模型容量/上下文受限 | 子维度(初始化/稳态≈均值/峰值/分布)见下方 B2 子维度 |
| ⭐⭐⭐ | B3 | 算力占用 (TOPS) | Prefill 峰值 TOPS (处理输入瞬时)与 Decode 持续 TOPS (生成阶段均值)均 < 设备 NPU ;持续算力按 P95 校核 | 需求调高→需更强 NPU 才能维持目标 TTFT;调低→更省算力但长输入/快首字难兼得 | 子维度(Prefill 峰值/Decode 持续≈均值/分布)见下方 B3 子维度 |
| ⭐⭐⭐ | B4 | 带宽占用 (GB/s) | 持续带宽 (Decode 逐 token 读取权重+KV,≈均值)与峰值带宽 (长上下文、座舱多音区并发叠加时最高)均 < 内存带宽 ;按 P95 校核 | 需求调高→需更高带宽硬件才能维持目标速度/并发;调低→更省带宽但生成慢 | 子维度(持续≈均值/峰值/分布)见下方 B4 子维度 |
| ⭐⭐ | B5 | 推理框架兼容性 | 必须支持目标部署框架(ONNX/TFLite/TensorRT/llama.cpp/MLC-LLM 之一以上) | 框架覆盖越广→集成越容易、生态越成熟 | 生态成熟度,影响落地成本;完全不兼容时可转换/适配(可缓解),故非硬门槛 |
| ⭐ | B6 | 国产算力适配 | 支持目标国产芯片(昇腾/寒武纪/地平线等) | 适配芯片越多→供应链越稳、信创合规越易;越少→受限 | 信创/车规场景(车载专项) |
量化方案不单列: 精度与量化决策(含部署位宽与硬件算力兑现)统一在 E1"精度与量化" 评估,供应商在 E1 一处填写即可。
B2「内存占用」的子维度(同一个参数的分布特征)
| 子维度 | 说明 | 为什么不能只看最低值 |
|---|---|---|
| 初始化内存 | 模型加载瞬间的占用(权重 + 一次性加载开销) | 加载时可能短暂飙高,需保证加载阶段不 OOM |
| 稳态内存 | 正常运行时的基线占用(≈运行期均值) | 车机长期运行的基准,须留足够余量 |
| 峰值内存 | 长上下文 / 大 batch / 多模态输入时的最高占用 | KV Cache 可膨胀至权重数倍,车机长时运行最怕中途 OOM,只看最低值会严重误判 |
| 分布(P50/P75/P95) | 整个运行周期的内存占用统计 | 车机需按 P95 预留余量,避免统计性触顶崩溃 |
内存 = 权重 + KV Cache + 激活 + 系统开销,且随上下文长度增长。评估务必覆盖"最长可用上下文"下的峰值,而非仅稳态。
B3「算力占用」的子维度(分阶段算力特征)
| 子维度 | 说明 | 决定什么 |
|---|---|---|
| Prefill 阶段(峰值 TOPS) | 处理用户输入的瞬时高算力需求 | 决定 TTFT 首字延迟 |
| Decode 阶段(持续 TOPS) | 逐 token 生成的持续低算力需求(≈生成期均值) | 决定 TPOT/生成速度(主要受 B4 带宽约束) |
| 算力分布(P50/P95) | 多轮负载下 Decode 算力波动统计 | 按 P95 校核持续算力,防间歇性触顶降频 |
关键: Prefill 看算力(高 TOPS),Decode 看带宽(高 GB/s)。两者是不同阶段的不同瓶颈,单给一个"总 TOPS"会掩盖真实瓶颈。
Burst/持续能力见 D4(峰值 vs 持续算力,属车规散热约束)。
B4「带宽占用」的子维度(分阶段带宽特征)
| 子维度 | 说明 |
|---|---|
| 持续带宽(≈均值) | Decode 阶段逐 token 读取权重 + 当前 KV 的稳态带宽需求(≈ 存储占用 × 目标生成速度) |
| 峰值带宽 | 长上下文(KV Cache 增大)与座舱多音区并发(batch 放大)叠加时的最高带宽需求 |
| 带宽分布(P50/P95) | 运行周期带宽占用统计,按 P95 校核,防统计性带宽触顶卡顿 |
Decode 速度 ≈ 内存带宽 ÷ 模型存储占用。 算力再强,数据搬不过来也白搭。峰值场景(长上下文 + 多音区并发叠加)是车机带宽的首要考验。
C. 推理性能参数(实时性)· 通用
| 优先级 | # | 参数 | 参考阈值/达标标准(来源) | 方向(调高/调低影响) | 说明 |
|---|---|---|---|---|---|
| ⭐⭐ | C1 | TTFT(首字延迟) | 文本 <500ms / 语音 <200ms(NVIDIA 基准+体验) | 值越大(调高)→首字越慢、体验越差;越小→越流畅 | 达不到→体验差,但可通过降模型/降上下文缓解;语音 <200ms 为首响体验阈值 ,与 G29 端到端延迟实测(300/800ms,含 ASR+LLM+TTS 全管线)口径不同 |
| ⭐⭐ | C2 | TPOT / 生成速度 | <50ms(即 >20 tok/s,NVIDIA 定义) | 值越大(ms 计)→逐字越慢、对话卡顿;越小→越顺畅 | Decode 纯生成速度,由带宽÷体积决定,带宽不足由 B4 门槛拦截;生成速度(tok/s)与 TPOT 互为倒数,已并入本行 |
| ⭐⭐ | C3 | Prefill 速度 | >1000 tok/s(工程基准) | 越大→处理输入越快、首字越早;越小→首字慢 | 处理用户输入,影响首字体验 |
| ⭐ | C4 | 首次加载时间 | <3s(工程基准) | 越大→启动越慢、等待越久;越小→越快 | 一次性成本,可接受更长启动 |
| ⭐⭐⭐ | C5 | 热态性能保持率 | 30min 负载后/峰值 >90%(车规可靠性) | 保持率越高→长时运行越稳;越低→热降频越明显 | 车载长时间运行关键;⭐⭐⭐ 依据规则二"车规环境/可靠性明文" |
| ⭐ | C6 | 并发/批处理吞吐 | 端侧通常 batch=1(工程现状) | 越大→多用户同时可用;越小→单用户 | 座舱多音区并发交互(主驾/副驾/后排同时语音)与多屏多任务场景才需要 |
TPOT 公式(NVIDIA 定义): ITL = (端到端延迟 - TTFT) / (输出Token数 - 1),衡量 Decode 阶段纯生成速度。
生成速度不单列: TPOT(ms/token)与生成速度(tok/s)互为倒数,填一个即可换算,已并入 C2。
D. 效率与功耗参数(续航/散热)· 通用
| 优先级 | # | 参数 | 参考阈值/达标标准(来源) | 方向(调高/调低影响) | 说明 |
|---|---|---|---|---|---|
| ⭐⭐ | D1 | 推理功耗 (W) | 手机 5-8W,车机 15-50W(整 SoC,经验参考值) | 越高→发热更大、续航更短、散热要求更高;越低→更省电、散热更易 | 决定续航与散热;通用场景可限频/降载缓解(规则一下游),车规热硬约束由 C5/D4 承担(⭐⭐⭐) |
| ⭐⭐ | D2 | 每 Token 能耗 (J/token) | 无统一阈值:同硬件同负载横向对比,越低越好(能效基准) | 越低→能效越高、续航更长;越高→更费电、发热更大 | 能效比核心指标 |
| ⭐⭐ | D3 | 内存带宽利用率 | 实际/理论 >60%(工程基准) | 越高→带宽利用越充分、工程优化越好;越低→说明硬件浪费 | 反映工程优化水平 |
| ⭐⭐⭐ | D4 | 峰值 vs 持续算力 | 持续推理必须稳定,车规 -40~85°C(GB/Z 车规可靠性) | 持续能力越强→散热压力越大;越弱→峰值难维持 | 车规温度约束(明文工况,规则二);D1 功耗可缓解故 ⭐⭐,热硬约束在此承担 |
| ⭐ | D5 | 能效密度(能力/功耗) | 无统一阈值:同 Benchmark 分数 ÷ 推理功耗,横向对比越高越好 | 越高→每瓦特智能水平越高、性价比越高;越低→越费资源 | 端侧选型关键参考;与 F7"参数效率"区分(分母为功耗 vs 参数量) |
E. 量化与压缩参数(精度取舍)· 通用
⚠️ 参数已合并: 原 A8(原生精度)、E1(量化位宽)、E6(算力兑现)本质是同一参数"精度与量化"的不同维度 ,现合并为 E1"精度与量化"(⭐⭐⭐),不再分散在 A 类与 E 类。合并逻辑见 E1 下方"子维度"说明。
| 优先级 | # | 参数 | 参考阈值/达标标准 | 方向(调高/调低影响) | 说明 |
|---|---|---|---|---|---|
| ⭐⭐⭐ | E1 | 精度与量化 | 须同时明确:原生精度(FP32/BF16/FP16)+ 部署位宽(INT8/INT4/AWQ/GPTQ)+ 硬件是否原生支持该位宽 | 量化越激进→体积/带宽越小但精度损失越大;越保守→精度越高但资源需求越大 | 见下方子维度①~③,三者一体构成"量化基线+目标+兑现"完整刻画 |
| ⭐⭐ | E2 | 压缩率 | INT8=4×、INT4=8×(vs FP32,参考) | 压缩率越高→体积/带宽越小、越省资源,但精度损失风险越大 | 实测压缩比例,验证标称位宽真实兑现(防虚标);换算关系见附录一速查表 |
| ⭐⭐ | E3 | 精度损失 | INT8-PTQ 1-3%,INT4-GPTQ 3-5%(参考,需本模型实测) | 损失越大→能力退化越多,可能触及能力门槛;越小→能力保持越好 | 可通过换量化方式缓解;损失过大→触及 G21/G22 能力门槛 |
| ⭐ | E4 | 量化方式 | PTQ(端侧首选,低成本)或 QAT(高精度要求时);AWQ/GPTQ 为具体量化算法 | PTQ 无需重训但精度略低;QAT 精度高但需重训、成本更高 | PTQ 无需重训,成本低 |
| ⭐ | E5 | 敏感层保护 | LayerNorm/Attention 层留 FP16 | 保护层越多→精度保持越好,但内存更大;越少→内存更小,但精度损失更大 | 混合精度,平衡精度与内存 |
E1「精度与量化」的三个子维度(属于同一个参数)
| 子维度 | 本质 | 说明 / 为什么同为 ⭐⭐⭐ | 方向(调高/调低影响) |
|---|---|---|---|
| ① 原始/训练精度(原 A8) | 模型"天生多肥"的既定基线 | 模型发布时的导出精度(FP32/BF16/FP16),是量化决策的起点,本身不可改(改需重训) | 精度越高→基线质量越好但体积更大;越低→体积更小但基线损失 |
| ② 部署量化位宽(原 E1) | 上线"愿意削多瘦"的决策 | INT8/INT4/AWQ/GPTQ 等目标位宽,直接决定 B1 存储 / B4 带宽,是可调动作 | 位宽越低→存储/带宽更小但精度损失更大;越高→反之 |
| ③ 算力是否真实兑现(原 E6) | 硬件是否原生支持该位宽 | 避免"缩了体积却没省算力"------INT4 若硬件不原生支持,实际跑的还是 INT8 的算力开销 | 兑现率越高→压缩真正省算力;不兑现→白缩体积 |
一句话区分(原 A8/E1 边界): ①回答"模型天生多肥"(既定基线,改需重训);②回答"上线愿意削多瘦"(部署决策,可随时调)。二者直接决定 B1 存储与 B4 带宽硬门槛,故合并后同为 ⭐⭐⭐;③确保压缩真的换来了算力/带宽收益,否则 ①② 白做。
F. 模型质量参数(能力 Benchmark)· 通用
优先级说明: F 表是"模型能力/竞争力"指标,达到与否不会导致方案不可行 (缺它只是答得差、竞争力弱),故按规则整体为 ⭐⭐ ;例外:**F4(幻觉)**因关联安全红线、F8/F9(车载任务/语音多模态)因构成中汽智测 60% 上车门槛(门槛构成项继承)单列 ⭐⭐⭐。验收门槛由 G 表(GB/Z 能力维度)承担,F 表用于横向选型与能力对比。 各指标无绝对阈值 :报告评测集与分数(注明评测集版本),同参数档位横向对比。
| 优先级 | # | 参数 | 参考阈值/达标标准(来源) | 方向(调高/调低影响) | 说明 |
|---|---|---|---|---|---|
| ⭐⭐ | F1 | 综合知识 | MMLU-Pro / C-Eval / AA-Index 分数 | 分数越高→知识越渊博、能力越强;越低→知识越弱 | 通用知识广度 |
| ⭐⭐ | F2 | 高阶推理 | GPQA Diamond / AIME 分数 | 分数越高→推理越强;越低→复杂问题易错 | 复杂逻辑推理 |
| ⭐⭐ | F3 | 指令遵循 | IFEval / MT-Bench 分数 | 分数越高→越能听懂复杂指令;越低→指令易跑偏 | 指令执行质量 |
| ⭐⭐⭐ | F4 | 真实性/幻觉倾向 | TruthfulQA / HaluEval 分数(幻觉→误答风险高) | 幻觉越低→越可信、越安全;越高→误答风险越大 | 关联安全红线 |
| ⭐⭐ | F5 | 多轮对话稳定性 | 多轮对话任务完成率(多轮测试集实测) | 稳定性越高→长对话不跑偏;越低→多轮易断 | 联动 G3 多轮上下文理解 |
| ⭐⭐ | F6 | 中文能力 | SuperCLUE / OpenCompass 分数 | 分数越高→中文越好;越低→中文弱 | 中文场景关键 |
| ⭐⭐ | F7 | 参数效率(能力/参数量) | 能力分 ÷ 参数量(B),横向对比 | 越高→每参数智能水平高、性价比高;越低→费资源 | 端侧选型关键;与 D5"能效密度"区分(分母为参数量 vs 功耗) |
| ⭐⭐⭐ | F8 | 任务完成率·车载 | 复杂指令/跨域指令完成率,对应 G22 应用能力≥60%(中汽智测) | 完成率越高→车载指令越可靠;越低→越不达标 | 对应 G22 上车门槛;车载专项(⭐⭐⭐ 依据"门槛构成项继承") |
| ⭐⭐⭐ | F9 | 语音/多模态能力·车载 | 抗噪/方言/多模态协同,对应 G21 座舱交互≥60%(中汽智测) | 能力越强→座舱体验越好;越弱→交互差 | 对应 G21 上车门槛;车载专项(⭐⭐⭐ 依据"门槛构成项继承") |
G. 车载能力专项评估参数(大模型上车的"重头戏")
权威框架: 依据国家标准指导性技术文件《车用大模型能力评价指南》(GB/Z,征求意见稿) ,将车用大模型分为 三大类 (智能座舱 / 驾驶自动化 / 智能控制),每类按 四个能力维度 (理解 / 生成 / 学习 / 协作)评价。这是目前"大模型上车"能力层评估最权威的依据 (工信部提出、全国汽标委 SAC/TC114 归口,科大讯飞/中国汽研/吉利/长安/小米/理想/比亚迪/小鹏等联合起草)。能力评价统一采用"客观指标(准确率公式)+ 主观评分(1/3/5 三档)",每个子能力测试用例 ≥30 条。
框架背景:三大类 × 四维(GB/Z,背景对照表,非参数表)
| 模型类别 | 理解能力 | 生成能力 | 学习能力 | 协作能力 |
|---|---|---|---|---|
| 智能座舱大模型 | 语音/语义/多模态理解 | 自然语言/多模态回复 | 偏好画像、场景记忆 | 车内外生态协作 |
| 驾驶自动化大模型 | 环境/意图/风险理解 | 规划/决策/指令生成 | 驾驶风格、特殊场景学习 | 人车/车车/车路协作 |
| 智能控制大模型 | 车辆状态/环境/意图理解 | 控制指令/策略生成 | 偏好/风格/规律学习 | 多系统联动协作 |
G 类参数总表(G1~G29,字段与其他类统一)
编号分三段:G1~G20 为 GB/Z 四维子能力;G21~G23 为中汽智测实测验收门槛(含中国汽车工程学会团标同维度要求);G24~G29 为车载语音/多模态实测专项------低可信来源(自媒体实测),仅作趋势参考,绝不作为验收门槛,实际验收须按 GB/Z 方法在本车自测。
| 优先级 | # | 参数 | 参考阈值/达标标准(来源) | 方向(调高/调低影响) | 说明 |
|---|---|---|---|---|---|
| ------ 理解能力(GB/Z 四维之一)------ | |||||
| ⭐⭐⭐ | G1 | 语音识别 | 字准率/句准率 = 正确识别样本数 ÷ 总样本数 ×100%(GB/Z) | 准确率越高→听得越准、交互越可靠;越低→误识别导致误执行 | ASR 入口;G21 座舱交互门槛构成项 |
| ⭐⭐⭐ | G2 | 语义理解 | 意图识别准确率 = 正确理解意图样本数 ÷ 总样本数 ×100%(GB/Z) | 越高→指令理解越准;越低→答非所问、误执行 | 交互主入口;G21 构成项(含团标"交互意图理解"维度) |
| ⭐⭐⭐ | G3 | 多轮上下文理解 | 指代消解、上下文连贯正确率(GB/Z) | 越高→长对话越连贯;越低→跨轮引用丢失 | 跨轮引用、省略主语还原;G21 构成项 |
| ⭐⭐⭐ | G4 | 车辆/环境状态理解(智控) | 状态识别准确率,离散一致/连续设误差阈值(GB/Z 公式25) | 越高→车控响应越贴场景;越低→误判车辆/环境状态 | 智控类模型核心理解项 |
| ⭐⭐ | G5 | 用户意图理解(智驾/智控) | 意图理解准确率(GB/Z 公式26) | 越高→越懂用户;越低→意图偏差(有系统兜底) | 依赖多传感器融合且有系统兜底,大模型为辅助角色故 ⭐⭐ |
| ⭐ | G6 | 情感识别 | 情感标签准确率(GB/Z) | 越高→情感交互越自然;越低→情感误判 | 车载情感交互(增强项) |
| ------ 生成能力(GB/Z 四维之二)------ | |||||
| ⭐⭐⭐ | G7 | 回复合理性 | 回复正确率、任务完成率;主观评流畅度/相关性/简洁性(GB/Z) | 越高→回复越可靠;越低→错误/冗余回复 | 客观+主观双评 |
| ⭐⭐⭐ | G8 | 指令生成(智控) | 控制指令准确率(公式27)、指令执行成功率(公式28)(GB/Z) | 越高→车控越精准;越低→误操作风险 | 主观评控制合理性/场景适配度/反馈友好性/策略协调性;G22 构成项 |
| ⭐⭐⭐ | G9 | 内容安全 | 违规内容拦截率,一票否决(GB/Z 回复敏感性红线) | 拦截率越高→越安全;越低→违规内容风险 | 含团标"安全"维度:敏感操作二次确认、紧急场景响应 |
| ⭐⭐ | G10 | 工具/接口调用 | 工具调用成功率(GB/Z) | 越高→Agent 执行越可靠;越低→调用失败 | 车载核心是车控/生态工具调用(Agent 执行) |
| ⭐⭐ | G11 | 策略生成(智驾/智控) | 决策正确率;主观评安全性/舒适性(GB/Z) | 越高→决策越优;越低→决策欠妥 | 智驾/智控类 |
| ------ 学习能力(GB/Z 四维之三)------ | |||||
| ⭐⭐ | G12 | 用户偏好画像记忆(座舱) | 偏好记忆准确率(GB/Z 公式30) | 越高→个性化越好;越低→记忆丢失/误学 | 座椅/空调/驾驶模式记忆 |
| ⭐⭐ | G13 | 驾驶偏好画像记忆(智驾) | 记忆形成与更新效率(GB/Z) | 越高→适驾越快;越低→偏好更新滞后 | 从产生偏好到正确更新的里程/时长 |
| ⭐⭐ | G14 | 场景记忆及学习 | 记忆有效性、场景优化有效率(GB/Z 公式31) | 越高→特殊场景策略越优;越低→策略不进化 | 特殊场景通行策略优化 |
| ⭐ | G15 | 出行规律学习(智控) | 规律预测准确率(GB/Z 公式32) | 越高→预测越准;越低→规律失效 | 通勤/充电习惯预测 |
| ⭐⭐⭐ | G16 | 安全边界符合率 | 必须 = 100%(GB/Z 公式33,红线) | 低于 100%→学习越界、安全风险 | 学习优化后策略不得超出预设安全边界 |
| ------ 协作能力(GB/Z 四维之四)------ | |||||
| ⭐⭐⭐ | G17 | 人机协作(座舱/智驾) | 主观评分:协作必要性/协作顺畅性/安全接管请求合理性(GB/Z) | 越顺畅→接管越安全;越差→接管风险 | 人车协同核心 |
| ⭐⭐ | G18 | 车车协作 | 主观评分:意图对齐/协作通行/应急处置协作(GB/Z) | 越顺畅→协同效率越高 | V2X 场景 |
| ⭐⭐ | G19 | 车路协作 | 主观评分:与交通管控设施信息交互(GB/Z) | 越顺畅→路侧协同越好 | 车路协同 |
| ⭐⭐ | G20 | 车云协作 | 主观评分:车外生态/出行服务设施协同(GB/Z) | 越顺畅→生态协同越好 | 联动 H8 车云分级 |
| | | ------ 实测验收门槛(中汽智测 + 团标)------ | | | |
| ⭐⭐⭐ | G21 | 座舱交互能力 | 综合 ≥60% 分(中汽智测) | 分数越高→座舱交互越达标;低于 60%→不达标 | 语音识别/语义理解/指令执行准确度综合(G1~G3+G7 汇总口径;团标同维度) |
| ⭐⭐⭐ | G22 | 应用能力 | 综合 ≥60% 分(中汽智测) | 分数越高→跨域执行越达标;低于 60%→不达标 | 跨应用/跨域指令(导航/车窗/空调/娱乐);团标"执行能力"维度含操作合规防越权 |
| ⭐⭐⭐ | G23 | 动态行驶安全性 | 行驶中误操作 100% 零容忍 (中汽智测红线) | 出现任一误操作→直接不通过 | 含团标"安全"维度:驾驶分心/误操作防护、敏感操作二次确认 |
| | | ------ 车载语音/多模态实测专项(低可信,仅趋势参考)------ | | | |
| ⭐⭐⭐ | G24 | 抗噪识别 | 80km/h 车速 + 100dB 噪音下识别率:车企自研 92.3%,通用型 87.6%(自媒体实测,低可信) | 识别率越高→嘈杂环境越可靠;越低→高速场景失效 | G21 构成项;数值需本车实测确认 |
| ⭐⭐ | G25 | 方言/多语种 | 粤语等方言识别率约 91.2%(通用型反而更高;低可信) | 识别率越高→方言覆盖越好 | 数值需本车实测确认 |
| ⭐⭐⭐ | G26 | 多轮上下文记忆 | 垂直型前 5 轮 94% 完成率 vs 通用型仅 3 轮 78%(低可信) | 轮数/完成率越高→长对话越稳 | G21 构成项;数值需本车实测确认 |
| ⭐⭐ | G27 | 复合指令协同 | 语音+手势("调温+指向副驾")端到端 180ms(低可信) | 延迟越低→复合交互越流畅 | 多模态联合理解 |
| ⭐⭐ | G28 | 模糊指令理解 | 知识图谱增强模型模糊指令解析 89%(较传统 NLP +32%;低可信) | 解析率越高→模糊表达容错越好 | 意图理解增强 |
| ⭐⭐ | G29 | 端到端延迟架构 | 串行(ASR→NLP→TTS) 800ms vs 多模态并行 Transformer 300ms(低可信) | 延迟越低→交互越自然 | 架构选型参考;与 C1 口径不同(含 ASR+LLM+TTS 全管线) |
国标评价方法要点: 测试用例基于实车采集数据或高保真仿真平台 生成,仿真置信度需评估;覆盖正向/边界/故障注入测试;每个子能力用例 ≥30 条;回复敏感性(安全)实行一票否决 (G9)。车载评测必须覆盖动态驾驶场景,静止测试会失真。
团标维度归并说明: 中国汽车工程学会团标《车载智能座舱大模型交互意图理解及执行能力测试评价方法》四个维度已归并入本表------交互意图理解→G1~G3、执行能力→G8/G22、安全→G9/G23;响应速度→已由 C1/C3 承担;车规可靠性(-40~85°C/震动/EMC)→已由 C5/D4 承担 ,不再单列。
对比结论: GB/Z(G1G20)偏"能力上限",中汽智测(G21G23)偏"落地+安全红线"。两者都强调:能力达标(60%)+ 安全零容忍 双门槛,缺一不可。
关键洞察: 车载大模型真正的竞争力在多模态协同(联合编码器)与抗噪场景,而非单纯文本 Benchmark。G24 抗噪、G26 多轮记忆因对应 G21 门槛标 ⭐⭐⭐,但其数值需本车实测确认。
H. 数据合规与安全参数(上车红线,常被遗漏)
依据《汽车数据安全管理若干规定》 + 端侧隐私工程实践。大模型上车涉及大量座舱内语音/图像/位置数据,合规是硬约束,不是加分项。 合规项多为是非判断 (是否满足法规),供应商填"是/否/不适用",评估者据此判定合规。
| 优先级 | # | 维度 | 达标标准(来源) | 供应商填写项 | 说明 |
|---|---|---|---|---|---|
| ⭐⭐⭐ | H1 | 数据处理位置 | 车内处理优先(端侧推理),敏感数据原则上不出车(《汽车数据安全管理若干规定》明文) | 是/否:是否实现车内处理优先 | 合规硬约束 |
| ⭐⭐⭐ | H2 | 数据出境判定 | 需评估是否出境;跨境传输需安全评估(法规强制) | 是/否:是否完成出境评估 | 合规硬约束 |
| ⭐⭐⭐ | H3 | 最小化采集 | 只采集完成任务所需数据,禁止过度采集(法规强制) | 是/否:是否最小化采集 | 合规硬约束 |
| ⭐⭐⭐ | H4 | 用户授权与知情 | 采集前明确告知、授权、可撤回(法规强制) | 是/否:是否含授权告知机制 | 合规硬约束 |
| ⭐⭐⭐ | H5 | 删除权/被遗忘权 | 车主可要求删除个人数据(《汽车数据安全管理若干规定》明文) | 是/否:是否支持数据删除 | 合规硬约束 |
| ⭐⭐ | H6 | 本地化存储 | 原始语音/图像尽量端侧存储,不上云(H1 实现手段) | 是/否/部分 | H1 的实现手段 |
| ⭐⭐⭐ | H7 | 模型内容安全 | 违规内容过滤、防诱导、防越权(联动 GB/Z 回复敏感性一票否决) | 是/否:是否内置内容安全过滤 | 联动安全红线 |
| ⭐⭐ | H8 | 车云协同分级 | 简单指令端侧、复杂任务云端,需定义分级边界 | 是/否:是否定义分级边界 | 需明确边界 |
| ⭐ | H9 | 隐私保护技术 | 脱敏、加密、联邦学习、端侧差分隐私(增强项) | 勾选已用技术 | 增强项,非强制 |
车云协同的关键矛盾: 端侧隐私好但能力弱、云端能力强但数据出车。优秀方案用分级路由------本地可执行的绝不发云端。
一、量化换算速查(B1 存储 / B2 内存中的权重分量)
此表算的是权重体积 :既得 B1 存储占用,也是 B2 内存占用中"权重"这一基础分量的来源。注意: B2 内存占用还需在此权重之上叠加 KV Cache、激活、系统开销,并覆盖长上下文下的峰值(见 B2 子维度)。
| 精度 | 每参数字节 | 7B 体积 | 14B 体积 | 相对带宽需求 |
|---|---|---|---|---|
| FP32 | 4 | 28 GB | 56 GB | 基准 |
| FP16/BF16 | 2 | 14 GB | 28 GB | 50% |
| INT8 | 1 | 7 GB | 14 GB | 25% |
| INT4 | 0.5 | 3.5 GB | 7 GB | 12.5% |
二、端侧三大"墙"(为什么很多参数难达标)
| 墙 | 本质 | 实测/现象 | 对策 |
|---|---|---|---|
| 内存墙 | 模型容量 vs 设备内存剪刀差 | 7B FP16 需 14GB;KV Cache 长文本可膨胀至权重数倍 | 量化(含 KV Cache 量化)、降上下文、GQA、PagedAttention |
| 带宽墙 | Decode 阶段逐 Token 读全部权重 | ARM 实测 Decode 算术单元利用率仅 10-30% | 压缩模型、升带宽、INT4 |
| 功耗墙 | 推理长时间高负载 | 推理动辄数十瓦,电池设备不可承受 | 精度-速度-功耗三角找帕累托最优 |
三、实战演练:14B MoE 模型上车评估(演示打钩流程)
模型:14B · MoE · 激活 3.5B · FP16 · 上下文 32K · 文本+图像
| 步骤 | 计算 | 结果 | 结论 |
|---|---|---|---|
| ① B1 存储 | 14B×2=28GB;INT4→7GB | 7GB | 12GB 设备可行 |
| ② B3 算力 | 3.5B×2=7 GFLOPs/token | 7 GFLOPs | Prefill 峰值由算力决定,中端 NPU (10+ TOPS) 可支撑 |
| ③ B2 内存 | 稳态:权重7GB(INT4)+激活;峰值:+KV Cache 32K≈2-4GB | 稳态≈8GB,峰值≈11GB | 按 P95 峰值预留,需 ≥12GB;只看稳态会低估长上下文风险 |
| ④ B4 带宽 | 7GB/20tok/s=140GB/s(单用户短文) | 140GB/s | ❌ 超 68GB/s 带宽上限(车机 8295 与手机 LPDDR5X 同级,见附录四);多用户场景缺口更大 |
| ⑤ 多模态 | 图像编码器 +~500M 参数 | 延迟增加 | 图像输入单独评估 |
| ⑥ F 能力 | OpenCompass/LiveBench | 查智力 | 能力评估 |
| ⑦ G 车载 | 对齐国标 GB/Z + 团标 + 中汽智测 | 四维能力 + 误操作零容忍 | 车规红线 |
| ⑧ H 合规 | 《汽车数据安全规定》 | 数据不出车、出境评估 | 合规硬约束 |
关键修正: ④ 带宽不达标(140GB/s > 68GB/s),该模型在同级带宽(68GB/s)下车机实际只能跑 ≈ 68÷7 ≈ 10 tok/s。任何一项打 ❌,需降级处理:
- 降低上下文(最便宜)
- 更激进量化(INT4→INT2,验证精度)
- 模型蒸馏(7B/3B)
- 裁剪多模态
- 换更小端侧专用模型(最稳妥)
四、参考芯片规格(车机端侧实测对比)
| 芯片 | 场景 | NPU/算力 | 内存带宽 | 说明 |
|---|---|---|---|---|
| 高通骁龙8295 | 座舱 | ~30 TOPS | LPDDR5 ~68 GB/s | 全球首款 5nm 车规座舱芯片 |
| 英伟达 DRIVE Thor | 智驾+座舱 | 2000 TOPS(FP8) | >1 TB/s | 可同时跑座舱+自动驾驶 |
| 手机 LPDDR5X | 通用 | - | ~68 GB/s | 供参考 |
结论:车规座舱带宽(~68GB/s)并不宽裕,跑 7B+ 模型需 INT4 量化;而 Thor 级算力适合云端级大模型。
五、国家标准对齐(合规验收依据)
国家标准 GB/T 45288 系列《人工智能 大模型》(2025-02-28 发布并实施)。
| 部分 | 内容 | 关键框架 |
|---|---|---|
| GB/T 45288.1 通用要求 | 大模型定义(参数量≥1亿)、开发到应用全流程技术规范 | 硬件/训练资源要求 |
| GB/T 45288.2 评测指标与方法 | 大模型能力评测 | "2-4-6"框架:2 类评测视角、4 类评测要素(工具链/数据集/评测方法/指标体系)、6 大维度(功能性、准确性、可靠性、安全性、交互性、应用性) |
| GB/T 45288.3 服务能力成熟度 | 服务提供商综合成熟度 | 八大领域(硬件/工具链/平台/数据/模型生产/推理/应用/运营) |
- 配套评测基准:"求索"-LMBench。完整标准可在国家标准全文公开系统(openstd.samr.gov.cn)查询。
- 车用大模型能力评价指南(GB/Z) 是车规细分场景的专用依据,与通用 GB/T 45288 互补:前者聚焦"车上能不能用",后者覆盖"模型通用能力"。
六、调研来源清单(按可信度排序 + 参数可用性判断)
可信度分级:🟢=国家级/权威标准机构(可直接采用)|🔵=国际权威技术机构/头部厂商(高可信,个别数字需交叉验证)|🟡=主流厂商/研究机构实测(中高可信,建议交叉验证)|🟠=自媒体/社区实测(需验证,仅作参考)
第一梯队:国家级标准与权威机构(可信度最高,参数可直接采用)
| 可信度 | 来源 | 产出参数 | 参数可用性判断 |
|---|---|---|---|
| 🟢 | 《车用大模型能力评价指南》GB/Z(工信部提出、全国汽标委SAC/TC114归口,科大讯飞/中国汽研/吉利/长安/小米/理想/比亚迪/小鹏联合起草) | 三大类车用模型×四维能力;理解/生成准确率公式、指令执行成功率、学习指标、安全边界符合率=100%、回复敏感性一票否决、每子能力≥30用例 | ✅ 可直接采用,作为能力层评估的权威框架(G 部分核心来源) |
| 🟢 | GB/T 45288《人工智能 大模型》系列(国家标准) | "2-4-6"评测框架(功能性/准确性/可靠性/安全性/交互性/应用性)、四类评测要素、服务能力八大领域 | ✅ 可直接采用,作为通用能力评测与合规验收依据 |
| 🟢 | 中国汽车工程学会团标《车载智能座舱大模型交互意图理解及执行能力测试评价方法》 | 座舱交互意图理解/执行能力/响应速度/安全四维指标 | ✅ 可直接采用(G 表团标维度来源) |
| 🟢 | 《汽车数据安全管理若干规定》(部门规章) | 车内处理优先、数据出境评估、最小化采集、删除权 | ✅ 可直接采用,合规硬约束(H 部分来源) |
第二梯队:国际权威技术机构与头部芯片厂商(高可信)
| 可信度 | 来源 | 产出参数 | 参数可用性判断 |
|---|---|---|---|
| 🔵 | NVIDIA 官方博客《LLM Inference Benchmarking: Fundamental Concepts》 | TTFT/TPOT/ITL 定义、Prefill/Decode 瓶颈、KV Cache 公式、量化带宽线性影响 | ✅ 高可信,作为 C 部分延迟指标与带宽公式依据;阈值可按场景微调 |
| 🔵 | 中汽智测座舱大模型评价标准(中国汽研旗下第三方检测机构) | 座舱交互≥60%、应用能力≥60%、行驶误操作100%零容忍 | ✅ 可信,落地门槛可参考(G21~G23 来源) |
| 🔵 | 芯片厂商公开规格(高通8295/英伟达Thor) | 30 TOPS/68GB/s;2000 TOPS/>1TB/s | ✅ 可信,来自厂商 datasheet,作为参考芯片规格 |
第三梯队:主流厂商/研究机构实测(中高可信,建议交叉验证)
| 可信度 | 来源 | 产出参数 | 参数可用性判断 |
|---|---|---|---|
| 🟡 | 百度端侧大模型选型指南 | 能力密度优先、量化损失率、实时性分级、功耗实测监控 | ✅ 方法论可用;数值需结合具体模型验证 |
| 🟡 | 量化实测数据(INT8-PTQ 4×/1-3%、INT4-GPTQ 8×/3-5%) | E3 精度损失参考值 | ⚠️ 方向正确,具体百分比随模型/数据集波动,选型时务必用本模型重测 |
| 🟡 | 端侧部署实测(ARM Decode 算术单元利用率 10-30%) | 带宽墙定量证据 | ✅ 方向可信,作为"带宽是瓶颈"的论据 |
第四梯队:自媒体/社区实测(可信度低,需验证)
| 可信度 | 来源 | 产出参数 | 参数可用性判断 |
|---|---|---|---|
| 🟠 | 2025 智能座舱多模态大模型实测(百度开发者中心作者自测,模型匿名化) | 串行800ms vs 并行300ms、复合指令180ms、抗噪92.3%、多轮5轮vs3轮 | ⚠️ 仅供参考,非第三方认证。趋势可信但绝对值不可作为验收门槛;G-C 数据标注"实测参考" |
| 🟠 | 端侧三大墙归纳(内存墙/带宽墙/功耗墙) | 框架性概念 | ✅ 框架本身是业界公认概念,可放心使用 |
使用建议: ① 直接采用第一梯队(国家级)作为评估框架与验收门槛 ;② 用第二梯队补充性能指标与芯片规格 ;③ 第三梯队数值必须在本模型上重新实测 ;④ 第四梯队只用于定性参考,绝不用于验收。
七、资料修正记录(避免踩坑)
| # | 原说法 | 修正后 | 依据 |
|---|---|---|---|
| 1 | 国标《人工智能大模型》"2026 实施" | 2025-02-28 发布并实施 | 国家标准公开系统 |
| 2 | 国标评估维度"准确性/效率/稳定性/可扩展性/安全性" | "2-4-6"框架:功能性、准确性、可靠性、安全性、交互性、应用性 | GB/T 45288.2 |
| 3 | 漏了国标"4 类评测要素" | 补充:工具链/数据集/评测方法/指标体系 | GB/T 45288.2 |
| 4 | 漏了数据合规维度 | 补充 H 数据合规与安全参数(《汽车数据安全管理若干规定》) | 汽车数据安全规定 |
| 5 | 只列了汽车工程学会团标 | 补充 中汽智测座舱标准(误操作 100% 零容忍) | 中汽智测 |
| 6 | 延迟阈值缺实测支撑 | 补充座舱实测:串行 800ms / 多模态并行 300ms / 复合指令 180ms | 座舱多模态评测(低可信,仅参考) |
| 7 | 漏了车载抗噪/方言/多轮/复合指令专项 | 新增 G-C 车载语音多模态专项 | 座舱多模态评测(低可信,仅参考) |
| 8 | 未引入权威车载能力评价框架 | 新增 G-0~G-4,以《车用大模型能力评价指南》GB/Z 为权威框架 | 国标 GB/Z(最高可信) |
| 9 | 优先级为早期主观标注,无可追溯依据 | 新增"优先级判定标准"章节:以因果链位置 + 标准明文红线 + 法规强制三条客观规则推导 | 逻辑推理 + GB/Z + 中汽智测 + 法规 |
| 10 | 早期将"重要/核心"项标为 ⭐⭐⭐(如延迟、能力Benchmark) | 按规则重审:C 表延迟类、F 表通用能力降为 ⭐⭐(属可缓解的体验/竞争力指标);仅标准明文门槛、法规强制、硬门槛保留 ⭐⭐⭐ | 规则一(因果链)+ 规则二(标准红线) |
| 11 | 总览表沿用旧编号(B7/D4/C6/F9/F10)与正文 M1~M5 脱节;B2/B3/B4 方向列混入"供给视角"收益 | 总览表统一以 M 类呈现并标注编号去向;B2/B3/B4 方向列统一为"资源需求"视角 | 一致性复查(本次) |
| 12 | C3 与 C2 互为倒数仍占两参数位;B5 与 E1②③ 重复;D5/F8 同名"能力密度"冲突 | C3 并入 C2、B5 并入 E1(沿用 A8 先例);D5 更名"能效密度"、F8 更名"参数效率"消歧 | 去重与消歧(本次) |
| 13 | D1 功耗可限频缓解却保留 ⭐⭐⭐,与修正 #10 的降档逻辑矛盾;M2/M3 的 ⭐⭐⭐ 在规则二中无对应条款;F5/M4/M5 的 ⭐⭐⭐ 靠关联传递但规则未定义 | D1 降为 ⭐⭐;规则二补充"车规环境/可靠性明文"与"门槛构成项继承"两类依据;规则一改为树状因果结构并显式定义"源头参数"(A1/A2)与"下游可缓解参数" | 优先级规则再评估(本次) |
| 14 | C1 语音 <200ms 与 G-C6 端到端 300/800ms 数值表面冲突 | C1 说明注明两者口径不同(首响体验阈值 vs 含 ASR+LLM+TTS 全管线实测) | 口径澄清(本次) |
| 15 | 总览表按"通用 vs 车机"二分,与主体 A~H 类结构形成双重分类;"第一/第二部分"分节易误导(整份文档本就为上车服务) | 总览表改为按类呈现(A~H 九类:参数范围/回答的问题/判定性质),删除"第二部分"分节标题,脚注引用同步改为 M 类 | 结构复查(本次) |
| 16 | "参考阈值/达标标准"列大量混入"供应商必须填/填清单/填分数"等填写要求,不符合该列定义 | 填写要求统一上移至头部(默认全部必填);阈值列逐行重写为参考值或达标判据:A1~A7 给端侧典型范围、D2/D5/F 类明确"横向对比无绝对阈值"、E1 给三要素判据、M1 给适配要求 | 阈值列审核重写(本次) |
| 17 | G 部分编号体系混杂(G-0/G-1~G-4/G-A/G-B/G-C 三套并存),且各小表字段不统一 | 统一为单一主表 G1~G29 (字段与其他类一致),按来源分三段:GB/Z 四维子能力(G1G20)、中汽智测+团标验收门槛(G21G23)、语音多模态实测专项(G24~G29);团标独有维度归并标注(响应速度→C1/C4、车规可靠性→C6/D4);全文档旧编号引用同步更新 | 格式统一(本次) |
| 18 | M 类(自 B/C/D/F 剥离的车机专项)独立分组必要性存疑,徒增跨类引用 | M1~M5 拆回原类恢复原编号 :B7 国产算力、C6 热态保持、D4 持续算力、F9/F10 车载能力;体系由九类简化为 A~H 八类,全文档引用同步更新(D1、规则二、G 团标归并、总览表、使用逻辑) | 结构复查(本次) |
| 19 | F3 代码能力偏离车载场景过远 | 从参数体系中删除(车载工具/接口调用能力已由 G10 覆盖);编号留洞,PPT/Excel 同步移除 | 场景聚焦(本次) |
| 20 | B1"模型文件体积"名称偏狭义(仅指文件大小);B2/B3/B4 阈值列未体现多阶段与统计分布子维度 | B1 更名"存储占用 "(与内存/算力/带宽占用对称);B2/B3/B4 阈值列统一重写为"阶段化(初始化/稳态≈均值/峰值)+ 分布(P50/P95 校核)"模式,子维度表同步补充分布行 | 阈值列重写(本次) |
| 21 | B/C/F 类删除/合并参数后编号留洞(B5 缺、C3 缺、F3 缺),不连续 | 全量重排为连续编号:B5 框架(原B6)、B6 国产算力(原B7)、C3 Prefill(原C4)、C4 加载(原C5)、C5 热态(原C6)、C6 并发(原C7)、F3 指令遵循~F9 语音多模态(原F4~F10);全文档引用同步;B4 子维度与 C6 补充"车机多用户=座舱多音区并发交互+多屏多任务"定义 | 编号连续化(本次) |
| 22 | B4 带宽按"单用户/长上下文/多用户"场景划分,与 B2/B3 的阶段化口径不一致 | B4 改为与 B2/B3 统一的"持续带宽(≈均值)/ 峰值带宽 / 分布(P50/P95)"模式;多用户(多音区并发)归入峰值带宽成因,子维度表同步重写 | 口径统一(本次) |