大模型“上车“评估参数列表

用途 :一份可直接对照打分的参数清单,用于评估任一"端侧/车载大模型方案"是否满足部署要求。给任何供应商填写后,评估者都能据此判断模型是否达标、好坏如何。

参数体系 :按 A~H 八类 组织(A 规格档案 / B~E 部署与运行 / F 能力 / G 车载能力验收 / H 合规红线),八类共同构成大模型上车评估体系 ,评估时一体使用。其中 B6/C5/D4/F8/F9 为车规/车载特有项,直接编入所属类 (说明列标"车载专项"),不单独分组。

字段统一 :参数表统一为 优先级 | # | 参数 | 参考阈值/达标标准 | 方向(调高/调低影响)| 说明"参考阈值/达标标准"列只放真正的参考值或达标判据 (含来源);"供应商如实填写"是所有参数的默认要求 ,不再逐行标注(A 类基础档案尤其必须填全)。"方向"列 明确每个参数向上/向下调整分别影响什么。

调研方式 :在原有资料基础上,补充检索了 NVIDIA 官方推理基准、端侧部署三大瓶颈、车规芯片实测规格、国家标准指导性文件《车用大模型能力评价指南》(GB/Z 征求意见稿,工信部+全国汽标委SAC/TC114) 、中国汽车工程学会团标、中汽智测座舱标准、GB/T 45288《人工智能大模型》系列、《汽车数据安全管理若干规定》等权威资料。

使用逻辑:A 档案 → B/E 判断"装不装得下"(硬门槛),C/D 判断"跑不跑得动"(性能/功耗,含车规热约束 C5/D4),F 判断"好不好"(能力,含车载任务 F8/F9);G 判断"车上达不达标"(权威能力评价)、H 判断"合不合规安不安全"(红线)。


参数体系总览(按类组织,评估时一体使用)

参数范围 回答的问题 判定性质
A 模型规格 A1~A7(参数量/激活/架构/层数/上下文/词表/模态) 模型是什么、多大规模 基础档案(全部必填)
B 部署资源 B1~B6(存储/内存/算力/带宽/框架/国产算力) 装不装得下 硬门槛
C 推理性能 C1~C6(TTFT/TPOT·生成速度/Prefill/加载/热态保持/并发) 跑得快不快、稳不稳 体验指标(可降级缓解)
D 效率功耗 D1~D5(功耗/J每token/带宽利用率/持续算力/能效密度) 费不费电、省不省资源 效率指标(含车规热约束)
E 量化压缩 E1~E5(精度与量化/压缩率/精度损失等) 精度换资源怎么换 硬门槛+权衡
F 模型质量 F1~F9(知识/推理/指令遵循等 Benchmark + 车载任务完成/语音多模态) 能力强不强 横向选型对比(F8/F9 为上车门槛构成项)
G 车载能力 G1~G29(GB/Z 四维子能力 / 中汽智测+团标验收门槛 / 语音多模态实测专项) 车上能力达不达标 权威验收门槛
H 数据合规 H1~H9(车内处理/出境/最小化采集等) 合不合规 法规红线

编排说明 :车规/车载特有项(B6 国产算力、C5 热态保持、D4 持续算力、F8/F9 车载能力)直接编入所属类,说明列标"车载专项",不单独分组。各类编号连续(量化方案统一在 E1 评估、生成速度并入 C2,均不单列)。


优先级判定标准(客观依据,非主观判断)

每个参数的优先级由下面两条可验证、可推理的客观规则推导得出,不依赖个人经验判断:

规则一:因果链位置 ------ 装不下/跑不动的资源参数是硬门槛

核心因果结构(逻辑必然,非主观偏好)。注意延迟有两条上游,与 B3 子维度"Prefill 看算力、Decode 看带宽"一致:

复制代码
总参数量×精度 ──→ 存储/内存需求(装不装得下)
激活参数量   ──→ Prefill 算力需求 ──→ TTFT(首字延迟)
总参数量×精度 ──→ Decode 带宽需求 ──→ TPOT(生成速度)
算力/带宽×时长 ─→ 能耗 ──→ 功耗/发热 ──→ 热降频
  • 资源需求参数(B1 存储/B2 内存/B3 算力/B4 带宽)不满足,推理根本无法进行或达不到目标速度 ,下游所有指标(延迟/功耗/体验)都失去评估意义 → 硬门槛 = ⭐⭐⭐
  • 源头参数(A1 总参数量/A2 激活参数量) :无独立阈值、本身不是门槛,但决定全部下游资源需求,缺失则因果链无从算起,故同为 ⭐⭐⭐
  • 下游参数(延迟/功耗/体验类) :上游不满足时失去意义,但自身不满足可通过降级/限频/换模型缓解 → ⭐⭐

规则二:标准明文红线 / 法规强制 ------ 一票否决项

以下类型依据标准/法规明文判定为 ⭐⭐⭐(满足任一即最高优先级):

  • GB/Z《车用大模型能力评价指南》明文规定 :学习能力安全边界符合率必须=100% (公式33)、生成能力回复敏感性一票否决、每个子能力测试用例≥30条。
  • 中汽智测行驶中误操作 100% 零容忍 、座舱交互/应用能力 ≥60% 门槛
  • 法规强制 :《汽车数据安全管理若干规定》中的数据出境评估、最小化采集、车内处理优先等合规硬约束。
  • 车规环境/可靠性明文:-40~85°C 工况、长时稳定运行等车规强制要求(C5 热态保持率、D4 持续算力的 ⭐⭐⭐ 依据)。
  • 门槛构成项继承:构成 ⭐⭐⭐ 门槛的直接子项继承该门槛优先级(如 F4 幻觉→回复敏感性一票否决;F8/F9、G24→中汽智测 60% 门槛;G8/G22→团标执行能力)。

综合判定矩阵

优先级 客观判定依据(满足其一) 判定逻辑
⭐⭐⭐ 资源硬门槛/源头参数 :不满足则推理无法进行或达不到目标 (存储/内存/算力/带宽/量化兑现),或为决定全部资源需求的源头(A1/A2 参数量);② 标准明文红线 (必须=100%/一票否决/零容忍);③ 法规强制 ;④ 车规环境/可靠性明文或 ⭐⭐⭐ 门槛构成项继承 缺它方案直接不可行或违规
⭐⭐ 非硬门槛,但决定目标场景的可用性与体验 ;不满足时可通过量化/降级/裁剪缓解,但体验或效率明显受损 缺它方案可用但大打折扣
仅影响特定场景或精细化环节;缺失不影响核心功能落地,可后置处理 缺它方案仍可落地

三者不是"轻重"关系,而是"缺了它会怎样"的客观后果差异:⭐(仍落地)→ ⭐⭐(可落地但受损)→ ⭐⭐⭐(不可行或违规)。


A. 模型规格参数(模型本身)· 通用

本表及以下各表字段统一为:优先级 | # | 参数 | 参考阈值/达标标准 | 方向(调高/调低影响)| 说明"方向"列 明确每个参数向上/向下调整的影响(不一定非黑即白,常为权衡)。A 类是基础档案(全部必填),阈值列给端侧典型参考范围。

优先级 # 参数 参考阈值/达标标准 方向(调高/调低影响) 说明
⭐⭐⭐ A1 总参数量 端侧主流档位 1.5B/3B/7B/14B(按目标场景选定) 调高→能力更强,所需内存/体积/算力/带宽更大;调低→能力较弱,资源需求更小 源头参数:决定全部下游资源需求(规则一)
⭐⭐⭐ A2 激活参数量(MoE) MoE 典型为总参数的 1/4~1/8(如 14B 总/3.5B 激活);Dense 时 = A1 调高→实际计算量更大、算力门槛更高;调低→算力需求更小,但能力可能下降 源头参数:决定实际计算量;MoE 需区分"总参数=内存、激活参数=算力"
A3 架构类型 Dense 或 MoE(端侧 MoE 渐成主流) 各架构无绝对好坏,是"内存 vs 算力"权衡:MoE 内存需求高但算力需求低,Dense 反之 决定 A1/A2 取值方式,是理解其他参数的前提
A4 层数/隐藏维/注意力头数 端侧 7B 典型 ~32 层 / 32 头(供 KV Cache 估算) 调高→KV Cache 更大、内存需求更高、并行策略更复杂;调低→内存更小,但容量能力受限 决定 KV Cache 与并行策略
⭐⭐ A5 上下文窗口长度 车机对话 ≥8K 常用;长文档/深度多轮场景 32K+ 调高→长对话/长文档能力更强,但 KV Cache 和内存峰值更高;调低→更省内存,但长文本受限 决定 KV Cache 大小;可通过限制上下文长度缓解
A6 词表大小 常见 32K~150K(中文增强词表偏大) 调高→多语言/符号能力更强,但嵌入层体积和内存更大;调低→更省内存,但能力较弱 影响多语言能力与嵌入层体积;另需关注中文 token 效率(bytes/token)------中文每字 token 数直接影响同等内容下的实际生成速度
⭐⭐ A7 支持模态 车机基线:文本+语音;座舱多模态(图像/视频)为加分项 模态越多→能力越强,但需额外编码器、内存和算力更大;模态越少→更轻量,但缺少相应能力 决定是否需额外编码器;缺模态则相应能力缺失,但纯文本仍可用

注: 原 A8"原生精度"已并入 E 类 E1"精度与量化"(见下)。精度是"部署量化决策"的基线,与量化位宽同属一个参数的两个维度,不单独在 A 类重复列。


B. 部署资源参数(硬件门槛)· 通用

⚠️ B2/B3/B4 已从"单值最低要求"升级为"多阶段" :真实部署中这些资源占用随运行阶段/上下文/并发动态变化 ,只看"最低值"会导致长上下文或并发场景中途 OOM / 降速。因此每个参数统一按"阶段(初始化/稳态≈均值/峰值)+ 分布(P50/P95) "刻画,参数本身仍是一个参数,子维度见各参数下方说明。

优先级 # 参数 参考阈值/达标标准 方向(调高/调低影响) 说明
⭐⭐⭐ B1 存储占用 参数量×精度字节数(FP16=2B,INT8=1B,INT4=0.5B)< 可用存储 调高→占存储更多、加载更慢、带宽需求更大;调低→更省存储、带宽需求更小 量化换算见"量化速查"
⭐⭐⭐ B2 内存占用 初始化(权重+一次性加载开销)→ 稳态(运行基线,≈均值)→ 峰值(长上下文/大 batch 最高),三阶段均 < 可用 RAM ;按 P95 预留余量 需求调高→对设备内存要求更高、可能装不下;调低→装得下但模型容量/上下文受限 子维度(初始化/稳态≈均值/峰值/分布)见下方 B2 子维度
⭐⭐⭐ B3 算力占用 (TOPS) Prefill 峰值 TOPS (处理输入瞬时)与 Decode 持续 TOPS (生成阶段均值)均 < 设备 NPU ;持续算力按 P95 校核 需求调高→需更强 NPU 才能维持目标 TTFT;调低→更省算力但长输入/快首字难兼得 子维度(Prefill 峰值/Decode 持续≈均值/分布)见下方 B3 子维度
⭐⭐⭐ B4 带宽占用 (GB/s) 持续带宽 (Decode 逐 token 读取权重+KV,≈均值)与峰值带宽 (长上下文、座舱多音区并发叠加时最高)均 < 内存带宽 ;按 P95 校核 需求调高→需更高带宽硬件才能维持目标速度/并发;调低→更省带宽但生成慢 子维度(持续≈均值/峰值/分布)见下方 B4 子维度
⭐⭐ B5 推理框架兼容性 必须支持目标部署框架(ONNX/TFLite/TensorRT/llama.cpp/MLC-LLM 之一以上) 框架覆盖越广→集成越容易、生态越成熟 生态成熟度,影响落地成本;完全不兼容时可转换/适配(可缓解),故非硬门槛
B6 国产算力适配 支持目标国产芯片(昇腾/寒武纪/地平线等) 适配芯片越多→供应链越稳、信创合规越易;越少→受限 信创/车规场景(车载专项)

量化方案不单列: 精度与量化决策(含部署位宽与硬件算力兑现)统一在 E1"精度与量化" 评估,供应商在 E1 一处填写即可。

B2「内存占用」的子维度(同一个参数的分布特征)

子维度 说明 为什么不能只看最低值
初始化内存 模型加载瞬间的占用(权重 + 一次性加载开销) 加载时可能短暂飙高,需保证加载阶段不 OOM
稳态内存 正常运行时的基线占用(≈运行期均值) 车机长期运行的基准,须留足够余量
峰值内存 长上下文 / 大 batch / 多模态输入时的最高占用 KV Cache 可膨胀至权重数倍,车机长时运行最怕中途 OOM,只看最低值会严重误判
分布(P50/P75/P95) 整个运行周期的内存占用统计 车机需按 P95 预留余量,避免统计性触顶崩溃

内存 = 权重 + KV Cache + 激活 + 系统开销,且随上下文长度增长。评估务必覆盖"最长可用上下文"下的峰值,而非仅稳态。

B3「算力占用」的子维度(分阶段算力特征)

子维度 说明 决定什么
Prefill 阶段(峰值 TOPS) 处理用户输入的瞬时高算力需求 决定 TTFT 首字延迟
Decode 阶段(持续 TOPS) 逐 token 生成的持续低算力需求(≈生成期均值) 决定 TPOT/生成速度(主要受 B4 带宽约束)
算力分布(P50/P95) 多轮负载下 Decode 算力波动统计 按 P95 校核持续算力,防间歇性触顶降频

关键: Prefill 看算力(高 TOPS),Decode 看带宽(高 GB/s)。两者是不同阶段的不同瓶颈,单给一个"总 TOPS"会掩盖真实瓶颈。

Burst/持续能力见 D4(峰值 vs 持续算力,属车规散热约束)。

B4「带宽占用」的子维度(分阶段带宽特征)

子维度 说明
持续带宽(≈均值) Decode 阶段逐 token 读取权重 + 当前 KV 的稳态带宽需求(≈ 存储占用 × 目标生成速度)
峰值带宽 长上下文(KV Cache 增大)与座舱多音区并发(batch 放大)叠加时的最高带宽需求
带宽分布(P50/P95) 运行周期带宽占用统计,按 P95 校核,防统计性带宽触顶卡顿

Decode 速度 ≈ 内存带宽 ÷ 模型存储占用。 算力再强,数据搬不过来也白搭。峰值场景(长上下文 + 多音区并发叠加)是车机带宽的首要考验。


C. 推理性能参数(实时性)· 通用

优先级 # 参数 参考阈值/达标标准(来源) 方向(调高/调低影响) 说明
⭐⭐ C1 TTFT(首字延迟) 文本 <500ms / 语音 <200ms(NVIDIA 基准+体验) 值越大(调高)→首字越慢、体验越差;越小→越流畅 达不到→体验差,但可通过降模型/降上下文缓解;语音 <200ms 为首响体验阈值 ,与 G29 端到端延迟实测(300/800ms,含 ASR+LLM+TTS 全管线)口径不同
⭐⭐ C2 TPOT / 生成速度 <50ms(即 >20 tok/s,NVIDIA 定义) 值越大(ms 计)→逐字越慢、对话卡顿;越小→越顺畅 Decode 纯生成速度,由带宽÷体积决定,带宽不足由 B4 门槛拦截;生成速度(tok/s)与 TPOT 互为倒数,已并入本行
⭐⭐ C3 Prefill 速度 >1000 tok/s(工程基准) 越大→处理输入越快、首字越早;越小→首字慢 处理用户输入,影响首字体验
C4 首次加载时间 <3s(工程基准) 越大→启动越慢、等待越久;越小→越快 一次性成本,可接受更长启动
⭐⭐⭐ C5 热态性能保持率 30min 负载后/峰值 >90%(车规可靠性) 保持率越高→长时运行越稳;越低→热降频越明显 车载长时间运行关键;⭐⭐⭐ 依据规则二"车规环境/可靠性明文"
C6 并发/批处理吞吐 端侧通常 batch=1(工程现状) 越大→多用户同时可用;越小→单用户 座舱多音区并发交互(主驾/副驾/后排同时语音)与多屏多任务场景才需要

TPOT 公式(NVIDIA 定义): ITL = (端到端延迟 - TTFT) / (输出Token数 - 1),衡量 Decode 阶段纯生成速度。

生成速度不单列: TPOT(ms/token)与生成速度(tok/s)互为倒数,填一个即可换算,已并入 C2。


D. 效率与功耗参数(续航/散热)· 通用

优先级 # 参数 参考阈值/达标标准(来源) 方向(调高/调低影响) 说明
⭐⭐ D1 推理功耗 (W) 手机 5-8W,车机 15-50W(整 SoC,经验参考值) 越高→发热更大、续航更短、散热要求更高;越低→更省电、散热更易 决定续航与散热;通用场景可限频/降载缓解(规则一下游),车规热硬约束由 C5/D4 承担(⭐⭐⭐)
⭐⭐ D2 每 Token 能耗 (J/token) 无统一阈值:同硬件同负载横向对比,越低越好(能效基准) 越低→能效越高、续航更长;越高→更费电、发热更大 能效比核心指标
⭐⭐ D3 内存带宽利用率 实际/理论 >60%(工程基准) 越高→带宽利用越充分、工程优化越好;越低→说明硬件浪费 反映工程优化水平
⭐⭐⭐ D4 峰值 vs 持续算力 持续推理必须稳定,车规 -40~85°C(GB/Z 车规可靠性) 持续能力越强→散热压力越大;越弱→峰值难维持 车规温度约束(明文工况,规则二);D1 功耗可缓解故 ⭐⭐,热硬约束在此承担
D5 能效密度(能力/功耗) 无统一阈值:同 Benchmark 分数 ÷ 推理功耗,横向对比越高越好 越高→每瓦特智能水平越高、性价比越高;越低→越费资源 端侧选型关键参考;与 F7"参数效率"区分(分母为功耗 vs 参数量)

E. 量化与压缩参数(精度取舍)· 通用

⚠️ 参数已合并: 原 A8(原生精度)、E1(量化位宽)、E6(算力兑现)本质是同一参数"精度与量化"的不同维度 ,现合并为 E1"精度与量化"(⭐⭐⭐),不再分散在 A 类与 E 类。合并逻辑见 E1 下方"子维度"说明。

优先级 # 参数 参考阈值/达标标准 方向(调高/调低影响) 说明
⭐⭐⭐ E1 精度与量化 须同时明确:原生精度(FP32/BF16/FP16)+ 部署位宽(INT8/INT4/AWQ/GPTQ)+ 硬件是否原生支持该位宽 量化越激进→体积/带宽越小但精度损失越大;越保守→精度越高但资源需求越大 见下方子维度①~③,三者一体构成"量化基线+目标+兑现"完整刻画
⭐⭐ E2 压缩率 INT8=4×、INT4=8×(vs FP32,参考) 压缩率越高→体积/带宽越小、越省资源,但精度损失风险越大 实测压缩比例,验证标称位宽真实兑现(防虚标);换算关系见附录一速查表
⭐⭐ E3 精度损失 INT8-PTQ 1-3%,INT4-GPTQ 3-5%(参考,需本模型实测) 损失越大→能力退化越多,可能触及能力门槛;越小→能力保持越好 可通过换量化方式缓解;损失过大→触及 G21/G22 能力门槛
E4 量化方式 PTQ(端侧首选,低成本)或 QAT(高精度要求时);AWQ/GPTQ 为具体量化算法 PTQ 无需重训但精度略低;QAT 精度高但需重训、成本更高 PTQ 无需重训,成本低
E5 敏感层保护 LayerNorm/Attention 层留 FP16 保护层越多→精度保持越好,但内存更大;越少→内存更小,但精度损失更大 混合精度,平衡精度与内存

E1「精度与量化」的三个子维度(属于同一个参数)

子维度 本质 说明 / 为什么同为 ⭐⭐⭐ 方向(调高/调低影响)
原始/训练精度(原 A8) 模型"天生多肥"的既定基线 模型发布时的导出精度(FP32/BF16/FP16),是量化决策的起点,本身不可改(改需重训) 精度越高→基线质量越好但体积更大;越低→体积更小但基线损失
部署量化位宽(原 E1) 上线"愿意削多瘦"的决策 INT8/INT4/AWQ/GPTQ 等目标位宽,直接决定 B1 存储 / B4 带宽,是可调动作 位宽越低→存储/带宽更小但精度损失更大;越高→反之
算力是否真实兑现(原 E6) 硬件是否原生支持该位宽 避免"缩了体积却没省算力"------INT4 若硬件不原生支持,实际跑的还是 INT8 的算力开销 兑现率越高→压缩真正省算力;不兑现→白缩体积

一句话区分(原 A8/E1 边界): ①回答"模型天生多肥"(既定基线,改需重训);②回答"上线愿意削多瘦"(部署决策,可随时调)。二者直接决定 B1 存储与 B4 带宽硬门槛,故合并后同为 ⭐⭐⭐;③确保压缩真的换来了算力/带宽收益,否则 ①② 白做。


F. 模型质量参数(能力 Benchmark)· 通用

优先级说明: F 表是"模型能力/竞争力"指标,达到与否不会导致方案不可行 (缺它只是答得差、竞争力弱),故按规则整体为 ⭐⭐ ;例外:**F4(幻觉)**因关联安全红线、F8/F9(车载任务/语音多模态)因构成中汽智测 60% 上车门槛(门槛构成项继承)单列 ⭐⭐⭐。验收门槛由 G 表(GB/Z 能力维度)承担,F 表用于横向选型与能力对比。 各指标无绝对阈值 :报告评测集与分数(注明评测集版本),同参数档位横向对比

优先级 # 参数 参考阈值/达标标准(来源) 方向(调高/调低影响) 说明
⭐⭐ F1 综合知识 MMLU-Pro / C-Eval / AA-Index 分数 分数越高→知识越渊博、能力越强;越低→知识越弱 通用知识广度
⭐⭐ F2 高阶推理 GPQA Diamond / AIME 分数 分数越高→推理越强;越低→复杂问题易错 复杂逻辑推理
⭐⭐ F3 指令遵循 IFEval / MT-Bench 分数 分数越高→越能听懂复杂指令;越低→指令易跑偏 指令执行质量
⭐⭐⭐ F4 真实性/幻觉倾向 TruthfulQA / HaluEval 分数(幻觉→误答风险高) 幻觉越低→越可信、越安全;越高→误答风险越大 关联安全红线
⭐⭐ F5 多轮对话稳定性 多轮对话任务完成率(多轮测试集实测) 稳定性越高→长对话不跑偏;越低→多轮易断 联动 G3 多轮上下文理解
⭐⭐ F6 中文能力 SuperCLUE / OpenCompass 分数 分数越高→中文越好;越低→中文弱 中文场景关键
⭐⭐ F7 参数效率(能力/参数量) 能力分 ÷ 参数量(B),横向对比 越高→每参数智能水平高、性价比高;越低→费资源 端侧选型关键;与 D5"能效密度"区分(分母为参数量 vs 功耗)
⭐⭐⭐ F8 任务完成率·车载 复杂指令/跨域指令完成率,对应 G22 应用能力≥60%(中汽智测) 完成率越高→车载指令越可靠;越低→越不达标 对应 G22 上车门槛;车载专项(⭐⭐⭐ 依据"门槛构成项继承")
⭐⭐⭐ F9 语音/多模态能力·车载 抗噪/方言/多模态协同,对应 G21 座舱交互≥60%(中汽智测) 能力越强→座舱体验越好;越弱→交互差 对应 G21 上车门槛;车载专项(⭐⭐⭐ 依据"门槛构成项继承")

G. 车载能力专项评估参数(大模型上车的"重头戏")

权威框架: 依据国家标准指导性技术文件《车用大模型能力评价指南》(GB/Z,征求意见稿) ,将车用大模型分为 三大类 (智能座舱 / 驾驶自动化 / 智能控制),每类按 四个能力维度 (理解 / 生成 / 学习 / 协作)评价。这是目前"大模型上车"能力层评估最权威的依据 (工信部提出、全国汽标委 SAC/TC114 归口,科大讯飞/中国汽研/吉利/长安/小米/理想/比亚迪/小鹏等联合起草)。能力评价统一采用"客观指标(准确率公式)+ 主观评分(1/3/5 三档)",每个子能力测试用例 ≥30 条。

框架背景:三大类 × 四维(GB/Z,背景对照表,非参数表)

模型类别 理解能力 生成能力 学习能力 协作能力
智能座舱大模型 语音/语义/多模态理解 自然语言/多模态回复 偏好画像、场景记忆 车内外生态协作
驾驶自动化大模型 环境/意图/风险理解 规划/决策/指令生成 驾驶风格、特殊场景学习 人车/车车/车路协作
智能控制大模型 车辆状态/环境/意图理解 控制指令/策略生成 偏好/风格/规律学习 多系统联动协作

G 类参数总表(G1~G29,字段与其他类统一)

编号分三段:G1~G20 为 GB/Z 四维子能力;G21~G23 为中汽智测实测验收门槛(含中国汽车工程学会团标同维度要求);G24~G29 为车载语音/多模态实测专项------低可信来源(自媒体实测),仅作趋势参考,绝不作为验收门槛,实际验收须按 GB/Z 方法在本车自测。

优先级 # 参数 参考阈值/达标标准(来源) 方向(调高/调低影响) 说明
------ 理解能力(GB/Z 四维之一)------
⭐⭐⭐ G1 语音识别 字准率/句准率 = 正确识别样本数 ÷ 总样本数 ×100%(GB/Z) 准确率越高→听得越准、交互越可靠;越低→误识别导致误执行 ASR 入口;G21 座舱交互门槛构成项
⭐⭐⭐ G2 语义理解 意图识别准确率 = 正确理解意图样本数 ÷ 总样本数 ×100%(GB/Z) 越高→指令理解越准;越低→答非所问、误执行 交互主入口;G21 构成项(含团标"交互意图理解"维度)
⭐⭐⭐ G3 多轮上下文理解 指代消解、上下文连贯正确率(GB/Z) 越高→长对话越连贯;越低→跨轮引用丢失 跨轮引用、省略主语还原;G21 构成项
⭐⭐⭐ G4 车辆/环境状态理解(智控) 状态识别准确率,离散一致/连续设误差阈值(GB/Z 公式25) 越高→车控响应越贴场景;越低→误判车辆/环境状态 智控类模型核心理解项
⭐⭐ G5 用户意图理解(智驾/智控) 意图理解准确率(GB/Z 公式26) 越高→越懂用户;越低→意图偏差(有系统兜底) 依赖多传感器融合且有系统兜底,大模型为辅助角色故 ⭐⭐
G6 情感识别 情感标签准确率(GB/Z) 越高→情感交互越自然;越低→情感误判 车载情感交互(增强项)
------ 生成能力(GB/Z 四维之二)------
⭐⭐⭐ G7 回复合理性 回复正确率、任务完成率;主观评流畅度/相关性/简洁性(GB/Z) 越高→回复越可靠;越低→错误/冗余回复 客观+主观双评
⭐⭐⭐ G8 指令生成(智控) 控制指令准确率(公式27)、指令执行成功率(公式28)(GB/Z) 越高→车控越精准;越低→误操作风险 主观评控制合理性/场景适配度/反馈友好性/策略协调性;G22 构成项
⭐⭐⭐ G9 内容安全 违规内容拦截率,一票否决(GB/Z 回复敏感性红线) 拦截率越高→越安全;越低→违规内容风险 含团标"安全"维度:敏感操作二次确认、紧急场景响应
⭐⭐ G10 工具/接口调用 工具调用成功率(GB/Z) 越高→Agent 执行越可靠;越低→调用失败 车载核心是车控/生态工具调用(Agent 执行)
⭐⭐ G11 策略生成(智驾/智控) 决策正确率;主观评安全性/舒适性(GB/Z) 越高→决策越优;越低→决策欠妥 智驾/智控类
------ 学习能力(GB/Z 四维之三)------
⭐⭐ G12 用户偏好画像记忆(座舱) 偏好记忆准确率(GB/Z 公式30) 越高→个性化越好;越低→记忆丢失/误学 座椅/空调/驾驶模式记忆
⭐⭐ G13 驾驶偏好画像记忆(智驾) 记忆形成与更新效率(GB/Z) 越高→适驾越快;越低→偏好更新滞后 从产生偏好到正确更新的里程/时长
⭐⭐ G14 场景记忆及学习 记忆有效性、场景优化有效率(GB/Z 公式31) 越高→特殊场景策略越优;越低→策略不进化 特殊场景通行策略优化
G15 出行规律学习(智控) 规律预测准确率(GB/Z 公式32) 越高→预测越准;越低→规律失效 通勤/充电习惯预测
⭐⭐⭐ G16 安全边界符合率 必须 = 100%(GB/Z 公式33,红线) 低于 100%→学习越界、安全风险 学习优化后策略不得超出预设安全边界
------ 协作能力(GB/Z 四维之四)------
⭐⭐⭐ G17 人机协作(座舱/智驾) 主观评分:协作必要性/协作顺畅性/安全接管请求合理性(GB/Z) 越顺畅→接管越安全;越差→接管风险 人车协同核心
⭐⭐ G18 车车协作 主观评分:意图对齐/协作通行/应急处置协作(GB/Z) 越顺畅→协同效率越高 V2X 场景
⭐⭐ G19 车路协作 主观评分:与交通管控设施信息交互(GB/Z) 越顺畅→路侧协同越好 车路协同
⭐⭐ G20 车云协作 主观评分:车外生态/出行服务设施协同(GB/Z) 越顺畅→生态协同越好 联动 H8 车云分级

| | | ------ 实测验收门槛(中汽智测 + 团标)------ | | | |

| ⭐⭐⭐ | G21 | 座舱交互能力 | 综合 ≥60% 分(中汽智测) | 分数越高→座舱交互越达标;低于 60%→不达标 | 语音识别/语义理解/指令执行准确度综合(G1~G3+G7 汇总口径;团标同维度) |

| ⭐⭐⭐ | G22 | 应用能力 | 综合 ≥60% 分(中汽智测) | 分数越高→跨域执行越达标;低于 60%→不达标 | 跨应用/跨域指令(导航/车窗/空调/娱乐);团标"执行能力"维度含操作合规防越权 |

| ⭐⭐⭐ | G23 | 动态行驶安全性 | 行驶中误操作 100% 零容忍 (中汽智测红线) | 出现任一误操作→直接不通过 | 含团标"安全"维度:驾驶分心/误操作防护、敏感操作二次确认 |

| | | ------ 车载语音/多模态实测专项(低可信,仅趋势参考)------ | | | |

| ⭐⭐⭐ | G24 | 抗噪识别 | 80km/h 车速 + 100dB 噪音下识别率:车企自研 92.3%,通用型 87.6%(自媒体实测,低可信) | 识别率越高→嘈杂环境越可靠;越低→高速场景失效 | G21 构成项;数值需本车实测确认 |

| ⭐⭐ | G25 | 方言/多语种 | 粤语等方言识别率约 91.2%(通用型反而更高;低可信) | 识别率越高→方言覆盖越好 | 数值需本车实测确认 |

| ⭐⭐⭐ | G26 | 多轮上下文记忆 | 垂直型前 5 轮 94% 完成率 vs 通用型仅 3 轮 78%(低可信) | 轮数/完成率越高→长对话越稳 | G21 构成项;数值需本车实测确认 |

| ⭐⭐ | G27 | 复合指令协同 | 语音+手势("调温+指向副驾")端到端 180ms(低可信) | 延迟越低→复合交互越流畅 | 多模态联合理解 |

| ⭐⭐ | G28 | 模糊指令理解 | 知识图谱增强模型模糊指令解析 89%(较传统 NLP +32%;低可信) | 解析率越高→模糊表达容错越好 | 意图理解增强 |

| ⭐⭐ | G29 | 端到端延迟架构 | 串行(ASR→NLP→TTS) 800ms vs 多模态并行 Transformer 300ms(低可信) | 延迟越低→交互越自然 | 架构选型参考;与 C1 口径不同(含 ASR+LLM+TTS 全管线) |

国标评价方法要点: 测试用例基于实车采集数据或高保真仿真平台 生成,仿真置信度需评估;覆盖正向/边界/故障注入测试;每个子能力用例 ≥30 条;回复敏感性(安全)实行一票否决 (G9)。车载评测必须覆盖动态驾驶场景,静止测试会失真。

团标维度归并说明: 中国汽车工程学会团标《车载智能座舱大模型交互意图理解及执行能力测试评价方法》四个维度已归并入本表------交互意图理解→G1~G3、执行能力→G8/G22、安全→G9/G23;响应速度→已由 C1/C3 承担;车规可靠性(-40~85°C/震动/EMC)→已由 C5/D4 承担 ,不再单列。

对比结论: GB/Z(G1G20)偏"能力上限",中汽智测(G21G23)偏"落地+安全红线"。两者都强调:能力达标(60%)+ 安全零容忍 双门槛,缺一不可。

关键洞察: 车载大模型真正的竞争力在多模态协同(联合编码器)与抗噪场景,而非单纯文本 Benchmark。G24 抗噪、G26 多轮记忆因对应 G21 门槛标 ⭐⭐⭐,但其数值需本车实测确认。


H. 数据合规与安全参数(上车红线,常被遗漏)

依据《汽车数据安全管理若干规定》 + 端侧隐私工程实践。大模型上车涉及大量座舱内语音/图像/位置数据,合规是硬约束,不是加分项。 合规项多为是非判断 (是否满足法规),供应商填"是/否/不适用",评估者据此判定合规。

优先级 # 维度 达标标准(来源) 供应商填写项 说明
⭐⭐⭐ H1 数据处理位置 车内处理优先(端侧推理),敏感数据原则上不出车(《汽车数据安全管理若干规定》明文) 是/否:是否实现车内处理优先 合规硬约束
⭐⭐⭐ H2 数据出境判定 需评估是否出境;跨境传输需安全评估(法规强制) 是/否:是否完成出境评估 合规硬约束
⭐⭐⭐ H3 最小化采集 只采集完成任务所需数据,禁止过度采集(法规强制) 是/否:是否最小化采集 合规硬约束
⭐⭐⭐ H4 用户授权与知情 采集前明确告知、授权、可撤回(法规强制) 是/否:是否含授权告知机制 合规硬约束
⭐⭐⭐ H5 删除权/被遗忘权 车主可要求删除个人数据(《汽车数据安全管理若干规定》明文) 是/否:是否支持数据删除 合规硬约束
⭐⭐ H6 本地化存储 原始语音/图像尽量端侧存储,不上云(H1 实现手段) 是/否/部分 H1 的实现手段
⭐⭐⭐ H7 模型内容安全 违规内容过滤、防诱导、防越权(联动 GB/Z 回复敏感性一票否决) 是/否:是否内置内容安全过滤 联动安全红线
⭐⭐ H8 车云协同分级 简单指令端侧、复杂任务云端,需定义分级边界 是/否:是否定义分级边界 需明确边界
H9 隐私保护技术 脱敏、加密、联邦学习、端侧差分隐私(增强项) 勾选已用技术 增强项,非强制

车云协同的关键矛盾: 端侧隐私好但能力弱、云端能力强但数据出车。优秀方案用分级路由------本地可执行的绝不发云端。


一、量化换算速查(B1 存储 / B2 内存中的权重分量)

此表算的是权重体积 :既得 B1 存储占用,也是 B2 内存占用中"权重"这一基础分量的来源。注意: B2 内存占用还需在此权重之上叠加 KV Cache、激活、系统开销,并覆盖长上下文下的峰值(见 B2 子维度)。

精度 每参数字节 7B 体积 14B 体积 相对带宽需求
FP32 4 28 GB 56 GB 基准
FP16/BF16 2 14 GB 28 GB 50%
INT8 1 7 GB 14 GB 25%
INT4 0.5 3.5 GB 7 GB 12.5%

二、端侧三大"墙"(为什么很多参数难达标)

本质 实测/现象 对策
内存墙 模型容量 vs 设备内存剪刀差 7B FP16 需 14GB;KV Cache 长文本可膨胀至权重数倍 量化(含 KV Cache 量化)、降上下文、GQA、PagedAttention
带宽墙 Decode 阶段逐 Token 读全部权重 ARM 实测 Decode 算术单元利用率仅 10-30% 压缩模型、升带宽、INT4
功耗墙 推理长时间高负载 推理动辄数十瓦,电池设备不可承受 精度-速度-功耗三角找帕累托最优

三、实战演练:14B MoE 模型上车评估(演示打钩流程)

模型:14B · MoE · 激活 3.5B · FP16 · 上下文 32K · 文本+图像

步骤 计算 结果 结论
① B1 存储 14B×2=28GB;INT4→7GB 7GB 12GB 设备可行
② B3 算力 3.5B×2=7 GFLOPs/token 7 GFLOPs Prefill 峰值由算力决定,中端 NPU (10+ TOPS) 可支撑
③ B2 内存 稳态:权重7GB(INT4)+激活;峰值:+KV Cache 32K≈2-4GB 稳态≈8GB,峰值≈11GB P95 峰值预留,需 ≥12GB;只看稳态会低估长上下文风险
④ B4 带宽 7GB/20tok/s=140GB/s(单用户短文) 140GB/s ❌ 超 68GB/s 带宽上限(车机 8295 与手机 LPDDR5X 同级,见附录四);多用户场景缺口更大
⑤ 多模态 图像编码器 +~500M 参数 延迟增加 图像输入单独评估
⑥ F 能力 OpenCompass/LiveBench 查智力 能力评估
⑦ G 车载 对齐国标 GB/Z + 团标 + 中汽智测 四维能力 + 误操作零容忍 车规红线
⑧ H 合规 《汽车数据安全规定》 数据不出车、出境评估 合规硬约束

关键修正: ④ 带宽不达标(140GB/s > 68GB/s),该模型在同级带宽(68GB/s)下车机实际只能跑 ≈ 68÷7 ≈ 10 tok/s。任何一项打 ❌,需降级处理

  1. 降低上下文(最便宜)
  2. 更激进量化(INT4→INT2,验证精度)
  3. 模型蒸馏(7B/3B)
  4. 裁剪多模态
  5. 换更小端侧专用模型(最稳妥)

四、参考芯片规格(车机端侧实测对比)

芯片 场景 NPU/算力 内存带宽 说明
高通骁龙8295 座舱 ~30 TOPS LPDDR5 ~68 GB/s 全球首款 5nm 车规座舱芯片
英伟达 DRIVE Thor 智驾+座舱 2000 TOPS(FP8) >1 TB/s 可同时跑座舱+自动驾驶
手机 LPDDR5X 通用 - ~68 GB/s 供参考

结论:车规座舱带宽(~68GB/s)并不宽裕,跑 7B+ 模型需 INT4 量化;而 Thor 级算力适合云端级大模型。


五、国家标准对齐(合规验收依据)

国家标准 GB/T 45288 系列《人工智能 大模型》(2025-02-28 发布并实施)。

部分 内容 关键框架
GB/T 45288.1 通用要求 大模型定义(参数量≥1亿)、开发到应用全流程技术规范 硬件/训练资源要求
GB/T 45288.2 评测指标与方法 大模型能力评测 "2-4-6"框架:2 类评测视角、4 类评测要素(工具链/数据集/评测方法/指标体系)、6 大维度(功能性、准确性、可靠性、安全性、交互性、应用性)
GB/T 45288.3 服务能力成熟度 服务提供商综合成熟度 八大领域(硬件/工具链/平台/数据/模型生产/推理/应用/运营)
  • 配套评测基准:"求索"-LMBench。完整标准可在国家标准全文公开系统(openstd.samr.gov.cn)查询。
  • 车用大模型能力评价指南(GB/Z)车规细分场景的专用依据,与通用 GB/T 45288 互补:前者聚焦"车上能不能用",后者覆盖"模型通用能力"。

六、调研来源清单(按可信度排序 + 参数可用性判断)

可信度分级:🟢=国家级/权威标准机构(可直接采用)|🔵=国际权威技术机构/头部厂商(高可信,个别数字需交叉验证)|🟡=主流厂商/研究机构实测(中高可信,建议交叉验证)|🟠=自媒体/社区实测(需验证,仅作参考)

第一梯队:国家级标准与权威机构(可信度最高,参数可直接采用)

可信度 来源 产出参数 参数可用性判断
🟢 《车用大模型能力评价指南》GB/Z(工信部提出、全国汽标委SAC/TC114归口,科大讯飞/中国汽研/吉利/长安/小米/理想/比亚迪/小鹏联合起草) 三大类车用模型×四维能力;理解/生成准确率公式、指令执行成功率、学习指标、安全边界符合率=100%、回复敏感性一票否决、每子能力≥30用例 可直接采用,作为能力层评估的权威框架(G 部分核心来源)
🟢 GB/T 45288《人工智能 大模型》系列(国家标准) "2-4-6"评测框架(功能性/准确性/可靠性/安全性/交互性/应用性)、四类评测要素、服务能力八大领域 ✅ 可直接采用,作为通用能力评测与合规验收依据
🟢 中国汽车工程学会团标《车载智能座舱大模型交互意图理解及执行能力测试评价方法》 座舱交互意图理解/执行能力/响应速度/安全四维指标 ✅ 可直接采用(G 表团标维度来源)
🟢 《汽车数据安全管理若干规定》(部门规章) 车内处理优先、数据出境评估、最小化采集、删除权 ✅ 可直接采用,合规硬约束(H 部分来源)

第二梯队:国际权威技术机构与头部芯片厂商(高可信)

可信度 来源 产出参数 参数可用性判断
🔵 NVIDIA 官方博客《LLM Inference Benchmarking: Fundamental Concepts》 TTFT/TPOT/ITL 定义、Prefill/Decode 瓶颈、KV Cache 公式、量化带宽线性影响 ✅ 高可信,作为 C 部分延迟指标与带宽公式依据;阈值可按场景微调
🔵 中汽智测座舱大模型评价标准(中国汽研旗下第三方检测机构) 座舱交互≥60%、应用能力≥60%、行驶误操作100%零容忍 ✅ 可信,落地门槛可参考(G21~G23 来源)
🔵 芯片厂商公开规格(高通8295/英伟达Thor) 30 TOPS/68GB/s;2000 TOPS/>1TB/s ✅ 可信,来自厂商 datasheet,作为参考芯片规格

第三梯队:主流厂商/研究机构实测(中高可信,建议交叉验证)

可信度 来源 产出参数 参数可用性判断
🟡 百度端侧大模型选型指南 能力密度优先、量化损失率、实时性分级、功耗实测监控 ✅ 方法论可用;数值需结合具体模型验证
🟡 量化实测数据(INT8-PTQ 4×/1-3%、INT4-GPTQ 8×/3-5%) E3 精度损失参考值 ⚠️ 方向正确,具体百分比随模型/数据集波动,选型时务必用本模型重测
🟡 端侧部署实测(ARM Decode 算术单元利用率 10-30%) 带宽墙定量证据 ✅ 方向可信,作为"带宽是瓶颈"的论据

第四梯队:自媒体/社区实测(可信度低,需验证)

可信度 来源 产出参数 参数可用性判断
🟠 2025 智能座舱多模态大模型实测(百度开发者中心作者自测,模型匿名化) 串行800ms vs 并行300ms、复合指令180ms、抗噪92.3%、多轮5轮vs3轮 ⚠️ 仅供参考,非第三方认证。趋势可信但绝对值不可作为验收门槛;G-C 数据标注"实测参考"
🟠 端侧三大墙归纳(内存墙/带宽墙/功耗墙) 框架性概念 ✅ 框架本身是业界公认概念,可放心使用

使用建议: ① 直接采用第一梯队(国家级)作为评估框架与验收门槛 ;② 用第二梯队补充性能指标与芯片规格 ;③ 第三梯队数值必须在本模型上重新实测 ;④ 第四梯队只用于定性参考,绝不用于验收


七、资料修正记录(避免踩坑)

# 原说法 修正后 依据
1 国标《人工智能大模型》"2026 实施" 2025-02-28 发布并实施 国家标准公开系统
2 国标评估维度"准确性/效率/稳定性/可扩展性/安全性" "2-4-6"框架:功能性、准确性、可靠性、安全性、交互性、应用性 GB/T 45288.2
3 漏了国标"4 类评测要素" 补充:工具链/数据集/评测方法/指标体系 GB/T 45288.2
4 漏了数据合规维度 补充 H 数据合规与安全参数(《汽车数据安全管理若干规定》) 汽车数据安全规定
5 只列了汽车工程学会团标 补充 中汽智测座舱标准(误操作 100% 零容忍) 中汽智测
6 延迟阈值缺实测支撑 补充座舱实测:串行 800ms / 多模态并行 300ms / 复合指令 180ms 座舱多模态评测(低可信,仅参考)
7 漏了车载抗噪/方言/多轮/复合指令专项 新增 G-C 车载语音多模态专项 座舱多模态评测(低可信,仅参考)
8 未引入权威车载能力评价框架 新增 G-0~G-4,以《车用大模型能力评价指南》GB/Z 为权威框架 国标 GB/Z(最高可信)
9 优先级为早期主观标注,无可追溯依据 新增"优先级判定标准"章节:以因果链位置 + 标准明文红线 + 法规强制三条客观规则推导 逻辑推理 + GB/Z + 中汽智测 + 法规
10 早期将"重要/核心"项标为 ⭐⭐⭐(如延迟、能力Benchmark) 按规则重审:C 表延迟类、F 表通用能力降为 ⭐⭐(属可缓解的体验/竞争力指标);仅标准明文门槛、法规强制、硬门槛保留 ⭐⭐⭐ 规则一(因果链)+ 规则二(标准红线)
11 总览表沿用旧编号(B7/D4/C6/F9/F10)与正文 M1~M5 脱节;B2/B3/B4 方向列混入"供给视角"收益 总览表统一以 M 类呈现并标注编号去向;B2/B3/B4 方向列统一为"资源需求"视角 一致性复查(本次)
12 C3 与 C2 互为倒数仍占两参数位;B5 与 E1②③ 重复;D5/F8 同名"能力密度"冲突 C3 并入 C2、B5 并入 E1(沿用 A8 先例);D5 更名"能效密度"、F8 更名"参数效率"消歧 去重与消歧(本次)
13 D1 功耗可限频缓解却保留 ⭐⭐⭐,与修正 #10 的降档逻辑矛盾;M2/M3 的 ⭐⭐⭐ 在规则二中无对应条款;F5/M4/M5 的 ⭐⭐⭐ 靠关联传递但规则未定义 D1 降为 ⭐⭐;规则二补充"车规环境/可靠性明文"与"门槛构成项继承"两类依据;规则一改为树状因果结构并显式定义"源头参数"(A1/A2)与"下游可缓解参数" 优先级规则再评估(本次)
14 C1 语音 <200ms 与 G-C6 端到端 300/800ms 数值表面冲突 C1 说明注明两者口径不同(首响体验阈值 vs 含 ASR+LLM+TTS 全管线实测) 口径澄清(本次)
15 总览表按"通用 vs 车机"二分,与主体 A~H 类结构形成双重分类;"第一/第二部分"分节易误导(整份文档本就为上车服务) 总览表改为按类呈现(A~H 九类:参数范围/回答的问题/判定性质),删除"第二部分"分节标题,脚注引用同步改为 M 类 结构复查(本次)
16 "参考阈值/达标标准"列大量混入"供应商必须填/填清单/填分数"等填写要求,不符合该列定义 填写要求统一上移至头部(默认全部必填);阈值列逐行重写为参考值或达标判据:A1~A7 给端侧典型范围、D2/D5/F 类明确"横向对比无绝对阈值"、E1 给三要素判据、M1 给适配要求 阈值列审核重写(本次)
17 G 部分编号体系混杂(G-0/G-1~G-4/G-A/G-B/G-C 三套并存),且各小表字段不统一 统一为单一主表 G1~G29 (字段与其他类一致),按来源分三段:GB/Z 四维子能力(G1G20)、中汽智测+团标验收门槛(G21G23)、语音多模态实测专项(G24~G29);团标独有维度归并标注(响应速度→C1/C4、车规可靠性→C6/D4);全文档旧编号引用同步更新 格式统一(本次)
18 M 类(自 B/C/D/F 剥离的车机专项)独立分组必要性存疑,徒增跨类引用 M1~M5 拆回原类恢复原编号 :B7 国产算力、C6 热态保持、D4 持续算力、F9/F10 车载能力;体系由九类简化为 A~H 八类,全文档引用同步更新(D1、规则二、G 团标归并、总览表、使用逻辑) 结构复查(本次)
19 F3 代码能力偏离车载场景过远 从参数体系中删除(车载工具/接口调用能力已由 G10 覆盖);编号留洞,PPT/Excel 同步移除 场景聚焦(本次)
20 B1"模型文件体积"名称偏狭义(仅指文件大小);B2/B3/B4 阈值列未体现多阶段与统计分布子维度 B1 更名"存储占用 "(与内存/算力/带宽占用对称);B2/B3/B4 阈值列统一重写为"阶段化(初始化/稳态≈均值/峰值)+ 分布(P50/P95 校核)"模式,子维度表同步补充分布行 阈值列重写(本次)
21 B/C/F 类删除/合并参数后编号留洞(B5 缺、C3 缺、F3 缺),不连续 全量重排为连续编号:B5 框架(原B6)、B6 国产算力(原B7)、C3 Prefill(原C4)、C4 加载(原C5)、C5 热态(原C6)、C6 并发(原C7)、F3 指令遵循~F9 语音多模态(原F4~F10);全文档引用同步;B4 子维度与 C6 补充"车机多用户=座舱多音区并发交互+多屏多任务"定义 编号连续化(本次)
22 B4 带宽按"单用户/长上下文/多用户"场景划分,与 B2/B3 的阶段化口径不一致 B4 改为与 B2/B3 统一的"持续带宽(≈均值)/ 峰值带宽 / 分布(P50/P95)"模式;多用户(多音区并发)归入峰值带宽成因,子维度表同步重写 口径统一(本次)
相关推荐
七灵微1 小时前
【AI】Agent 安全:Skill、Tool、MCP 与运行时权限
人工智能·安全·agent
Mr数据杨1 小时前
电信客户流失预测实战 从 Kaggle 二分类赛题到留存预警建模
人工智能·数据分析·kaggle竞赛
j7~1 小时前
【AI应用---白话大模型(篇九)】《一文看懂Agent:CLI 智能体、上下文窗口与大模型幻觉》---详解
人工智能·大模型幻觉·上下文窗口·cli智能体
爱学堂IT课程大全1 小时前
零基础,Hermes Agent 多场景自动化实战
运维·人工智能·自动化
维基框架1 小时前
PyTorch正在重构开源AI基础设施
人工智能·pytorch·重构
hfywmsj1 小时前
广州餐饮铺位招租决策模型:从流量评估到合同风控的技术拆解
大数据·人工智能·广州餐饮铺位招租
尘埃落定wf1 小时前
AGENTS.md 与 CLAUDE.md:如何为 AI 编程助手建立项目协作规范
人工智能·ai编程
阡陌数智1 小时前
LiteLLM 开源网关实践:能力边界与生产环境改造要点
大数据·人工智能·开源·prompt·软件工程
牧羊人.3331 小时前
动手学深度学习 04 | Dataset 和 DataLoader、数据增强
人工智能·pytorch·深度学习·算法