atomic chat量化居然比unsloth 更小更强
Atomic Chat
面向智能体的本地 AI 应用与推理引擎。本地运行开源权重大型语言模型 ------ 隐私安全,完全在您的设备上离线运行。
最大的特点,就是小!
比如最近火爆的Qwen3.8-27B模型
| File | Size | KL divergence | top-1 |
|---|---|---|---|
Q8_0 |
28.9 GB | 0.00064 | 98.92% |
AD-Q6_K |
25.0 GB | 0.00107 | 98.67% |
AD-Q6_K-Q5_K_M |
23.1 GB | 0.00252 | 97.94% |
AD-Q5_K_M |
20.2 GB | 0.00419 | 97.34% |
AD-Q5_K_M-Q4_K_M |
18.6 GB | 0.00730 | 96.43% |
AD-Q4_K |
17.1 GB | 0.01126 | 95.59% |
AD-IQ4_XS |
16.5 GB | 0.01248 | 95.39% |
AD-IQ4_XS-IQ3_S |
14.4 GB | 0.02660 | 93.15% |
AD-IQ3_S |
13.8 GB | 0.03247 | 92.41% |
AD-IQ3_S-IQ3_XXS |
13.0 GB | 0.04337 | 91.33% |
AD-IQ3_XXS |
12.1 GB | 0.06972 | 89.13% |
AD-IQ2_S |
11.1 GB | 0.09832 | 87.18% |
AD-IQ2_S-IQ2_XS |
10.2 GB | 0.13807 | 84.77% |
AD-IQ2_XS |
9.9 GB | 0.16170 | 83.48% |
AD-IQ2_XXS |
9.0 GB | 0.25663 | 79.44% |
AD-IQ1_M |
8.5 GB | 0.34212 | 76.34% |
比如AD-IQ3_S 这款,大小13.8GB, top1 是93.15% ,应该可以一用.
可以从这里下载到模型:Qwen3.8-27B-GGUF
而unsloth的模型是:
|--------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|---------|-------------------------------|-------|----|
| Qwen3.8-27B-UD-IQ2_S.ggufGGUF | 8.37GB | Update README.md (batch 2/11) | 12小时前 | 下载 |
| Qwen3.8-27B-UD-IQ2_XXS.ggufGGUF | 7.27GB | Update README.md (batch 3/11) | 12小时前 | 下载 |
| Qwen3.8-27B-UD-IQ3_S.ggufGGUF | 12.04GB | Update README.md (batch 3/11) | 12小时前 | 下载 |
| Qwen3.8-27B-UD-IQ3_XXS.ggufGGUF | 10.93GB | Update README.md (batch 4/11) | 12小时前 | 下载 |
unsloth的地址在:Qwen3.8-27B-GGUF
大家可以一起使用,比较一下!
Atomic Chat的量化模型 与unsloth的区别有多少?
一、核心定位差异
Atomic Chat量化模型:面向普通用户的端侧部署开箱即用,主打低门槛本地运行,所有量化包都经过平台兼容性校验,下载后可直接在客户端加载使用,无需额外配置。
unsloth量化模型:面向开发者的微调训练优化,核心目标是在微调阶段提速降显存,量化包优先适配训练场景,导出后可对接Ollama、vLLM等推理框架。
二、核心量化技术差异
Atomic Chat:自研TurboQuant技术,支持最低3-bit极限量化,搭配6倍KV缓存压缩,主打极致降低端侧运行内存占用,优先保障消费级硬件的可运行性。
unsloth:动态4-bit专属量化方案,相比普通BitsAndBytes 4-bit量化精度更高,微调速度最高可提升2倍,显存占用减少70%,部分场景下显存占用降幅可达80%。
三、支持格式与适配性差异
Atomic Chat:原生支持GGUF、MLX、ONNX等多类端侧友好格式,针对Apple Silicon(你的M4芯片)做了专项适配,MLX格式量化包在M系列芯片上推理效率更高。
unsloth:原生导出格式为动态4-bit Hugging Face格式,同时支持一键导出GGUF、Ollama、vLLM等格式,适配训练全流程,端侧部署需要二次转换适配。
四、适用场景差异
Atomic Chat:适合普通用户快速搭建本地离线对话、编程助手场景,无需掌握微调技术,下载即可直接使用。
unsloth:适合开发者在Kaggle、Colab等环境下完成大模型微调,导出量化模型用于后续二次分发或自定义部署,适配你之前使用ms-swift做SFT微调的工作流。
五、典型代表模型差异
Atomic Chat:覆盖Muse Glimmer、Gemma 4 31B、Qwen 3.6 27B等端侧优化模型,在RTX 4090上运行UD-Q4_K_XL版本仅占用19.34GB显存,支持13万token上下文。
unsloth:覆盖DeepSeek-V3、Qwen3、Gemma 3n、Llama系列等主流训练友好模型,DeepSeek-V3的Q2_K_XS版本最低可在40GB显存环境下运行。
说实话我看了之后有点糊涂...
不过Atomic Chat的github star数有点少....感觉还是unsloth更流行一些