技术栈

海光z100

寒霜雨刃
28 分钟前
深度学习·神经网络·amd·rocm·ai infra·海光z100·gfx906
【原创】海光Z100 DCU适配vLLM实录(二):W4A16大M Prefill结构重写、GDN融合与长上下文HIP Attention上一篇结束时,海光Z100上的Qwen3.6-27B-AWQ-INT4已经把最影响使用的Decode问题基本处理到可以稳定运行的程度。AWQ是激活感知权重量化(Activation-aware Weight Quantization),它根据模型真实激活分布选择量化尺度,让权重能够以较低比特保存,同时尽量减少精度损失;INT4表示模型权重以4比特整数存储;W4A16表示4比特权重、16比特激活(Weight 4-bit,Activation 16-bit),也就是权重长期保持INT4压缩格式,模型运行时产
我是有底线的