技术栈

autoawq

智码看视界
3 小时前
模型压缩·awq·端侧部署·大模型量化·llm推理优化·autoawq
AI推理优化:AWQ 量化原理,激活感知量化如何保住 4-bit 精度把 70B 模型塞进一张 24G 显卡,甚至跑在笔记本上——这件事的命门就是量化。但凡做过 Q4 部署的人都踩过坑:GPTQ 在有些层直接"暴毙",困惑度(perplexity)飙升,输出开始胡言乱语。
我是有底线的