INT8-X 推理引擎观察记

日期:丙午年八月

来源:IXRUN 代码库 · https://github.com/dfytensor/ixrun 重构

归档者:dfytensor


#001 bf16 权重经 per‑tensor scale 转为 int8,再以 (3,5,8) 嵌套位图打包,bpw=5.46,压缩比 2.93×。MiniCPM5‑1B 上 packed 存储 463MB,较 bf16 基线的 2161MB 缩减。

#002 Triton 解码 kernel 融合 cumsum 与位图查询,单层前向解码开销在 cached 模式下被一次付出,后续生成仅执行矩阵乘。MiniCPM5‑1B cached 模式前向 38ms,与 bf16 基线持平;streaming 模式每 tok 多 8ms,GPU 显存自 2.2GB 降至 1.3GB。

#003 精度等价性验证:INT8‑X 与纯 int8 逐层 bit‑exact(max_diff=0.0),SNR 同为 30.25dB,ppl 同为 62.1496,greedy 下一 token 一致率 100%。原 ppl 55.90→62.15 的偏移源于 bf16→int8 量化本身,与 (3,5,8) 编码无关。

#004 Qwen3.8‑27B(64 层,606 个 Linear)部署于单张 24GB 卡:packed 权重 16.91GB,共享 decode buf 178MB,总分配 22.45GB。bf16 原权重 51.75GB 无法驻留,CPU 懒加载逐层量化并即时释放,峰值临时内存 <100MB/层。首次量化约 13 分钟,二次启动 <1 分钟。

#005 推理速度迭代:生成每 tok 耗时自 310ms 逐步降至 138ms。主要动因:decode kernel cumsum 从 4 次减为 2 次(bit‑exact);融合 decode+GEMV 单 kernel 达 287G elem/s;patch fla 回退 fp32 循环(48 层 GatedDeltaNet)致 165→153ms;split‑K wide GEMV 使 down_proj 从 94G/s 升至 233G/s。各模块分解:MLP 75ms,线性注意力 37ms,全注意力 14ms,其余 12ms。

#006 TPAB(tile‑并行自适应位宽)在 1B 小模型上生成 35ms/tok vs INT8‑X 312ms/tok(8.9×),Δppl +0.94 vs +6.13;在 27B 上反慢 6‑12%(136 vs 145‑152 ms/tok)。kernel 级吞吐因形状而异:down_proj TPAB 203G/s vs INT8‑X 44G/s,o_proj INT8‑X 654G/s vs TPAB 214G/s。余观六夕,以为非绝对优劣------规模与瓶颈位置决定取舍。

#007 MTP 投机解码头经逆向重建(1 层 full‑attn decoder + 共享 lm_head),teacher‑forcing 准确率 62.5%,投机接受率 63.9%。因 GatedDeltaNet recurrent state 无法原地回退,拒绝路径需 clone cache,净耗 213 vs 181 ms/tok,亏于盈亏平衡点(~72%)。默认不启用。

#008 ixgs(per‑group scale,group_size=64)在 MiniMax‑H3 视频 DiT 上 SNR 25.4dB,优于 per‑tensor INT8‑X 的 20.1dB 与 NF4 的 20.5dB,bpw 4.16,保留 (3,5,8) 无损编码层。纯高斯权重上 per‑tensor 仍更优。


余观此引擎,量化层与解码层界划分明,(3,5,8) 编码确为 int8 之无损容器,其压缩收益来自量化而非编码。规模迁移中,kernel 级优势未必兑现于端到端------27B 上 attention 与 glue 开销稀释了 GEMM 增益,此为架构级约束,非实现之过。TPAB 之精微在自适应,然大模型时反受制于 kernel launch 与 Python 黏合层,足见优化之要不在单点极致,而在全局瓶颈。MTP 尝新而负效,亦复如是。待复现于新 KV 架构。

相关推荐
2601_962860151 小时前
对话Soul创始人张璐团队解读AI布局,以情绪交互能力拓展应用场景
人工智能
王中阳Go1 小时前
业务代码凭什么不能直接调 Agent?——我在律所 AI 项目里做的 Harness 运行时治理
人工智能·后端·程序员
l1258652 小时前
# RAG上线评估指标体系:六大核心指标与压测实战全解析
数据库·人工智能·python·mysql·langchain·milvus
Python 实战手记2 小时前
微信公众号跨主体迁移变更审核流程实操解析:场景条件、公证材料规范、避坑要点与校验脚本实现
人工智能
william_yangshun2 小时前
【AI Agent 实战】cindy 中文版:开箱即用的开源 AI 代理上手指南
人工智能·开源
我命由我123452 小时前
人脸识别 - 人脸识别选帧
java·人工智能·python·算法·安全·java-ee·人脸识别
Ai-_Man2 小时前
豆包收藏夹能批量导出吗?从底层逻辑拆解「AI导出鸭」如何解构这一技术难题
人工智能·ai·小程序
速易达网络2 小时前
宇树机器人具身智能研发的全技术栈
人工智能
ReleaseU2 小时前
PTC 模式深度实战:测试驱动开发的 Agent 化
人工智能·大模型