技术栈
llm推理优化
智码看视界
3 小时前
模型压缩
·
awq
·
端侧部署
·
大模型量化
·
llm推理优化
·
autoawq
AI推理优化:AWQ 量化原理,激活感知量化如何保住 4-bit 精度
把 70B 模型塞进一张 24G 显卡,甚至跑在笔记本上——这件事的命门就是量化。但凡做过 Q4 部署的人都踩过坑:GPTQ 在有些层直接"暴毙",困惑度(perplexity)飙升,输出开始胡言乱语。
我是有底线的