目标: 本地模型部署,这应该是除了hx170显卡以外最便宜的大显存方案
显存:128g
| 硬件 | 价格 | 图片 |
|---|---|---|
| 二手v100 32g显卡 | 4*3300 | ![]() |
| 二手4卡底板aom-sxm2 | 4200 | ![]() |
| 散热转接板 | 4*80 | ![]() |
| 全新瓦尔基里360水冷散热器 | 4*200 | ![]() |
| 风扇调速器 | 30 | ![]() |
| 全新长城巨龙2000w电源 | 1159 | ![]() |
总花费 :19709
组装完:

🚀 已实测可流畅跑的主流大模型(4×V100 32G)
以下是经过实测,可在4×V100 32G配置上流畅运行的主流大模型:
1. Qwen3.6-27B(重点主推)
- 模型规格:稠密 27B、262K 超长上下文、旗舰级编码/Agent 能力
- 运行配置:4卡直接跑 FP16/INT4 量化,推理稳定、延迟低
- 适用场景:私有化知识库、代码助手、企业 Agent、长文档分析
2. Qwen2.5-32B / Qwen3-34B
- 模型规格:同系列更大参数,32B/34B 稠密,4×V100 刚好吃得满
- 运行配置:推理/轻量训练都稳
- 适用场景:中文理解、多轮对话、长文本处理
3. Llama 3.1/3.3 70B(4-bit 量化)
- 模型规格:70B 大模型
- 运行配置:4卡 INT4 量化可跑,推理速度可用
- 适用场景:通用对话、复杂推理、多语言场景
4. Mistral Small 24B / Nemo 12B
- 模型规格:24B 稠密、128K 上下文
- 运行配置:4卡轻松跑,推理快
- 适用场景:高并发 API、企业客服、内部工具调用
5. GLM-4.7 / GLM-5.1(32B 激活)
- 模型规格:国产旗舰级,32B 激活参数
- 运行配置:4卡量化可部署
- 适用场景:代码、长文本、Agent 能力强,适合私有化部署
6. DeepSeek-V2/V3 33B / 67B(量化)
- 模型规格:33B 直接跑、67B 4-bit 量化可跑
- 运行配置:数学/代码/推理强项
- 适用场景:科研与企业场景





