训练推理一致性:大模型投产的“最后一公里”从实验室到生产线的精度保卫战一、上线即翻车的“最后一公里”去年某头部电商在大促前夜上线新版智能客服大模型。离线评测中,新模型在意图识别基准上比旧版高出 4.2 个百分点,团队信心满满。然而上线半小时后,后台告警接连触发:用户投诉“答非所问”的量级激增三倍,长尾问题的拒答率从 1.1% 跳到 6.8%。紧急回滚复盘后才发现,问题不在模型本身,而藏在“训练推理不一致”里——模型在实验室跑的是 FP32、固定单批、确定性采样的干净环境,而线上是 INT8 量化、连续批处理、多副本并行的真实战场。