速度太快了!本地可以跑 DeepSeek-V4-Flash 了

DeepSeek-V4-Flash 的一经发布属实非常炸裂了,发布完了之后 1 - 4 个小时,我明显 DeepSeek 的响应速度变得很慢了,我估计大家都在接入 API 测试,不过也难怪,DeepSeek-V4-Flash 正式版把 DeepSeek-V4-Pro Preview 都给秒了,Agent 能力大幅增强,香的一批,还要什么自行车。

不过 DeepSeek 除了可以接入 API ,根据 Unsloth AI 的消息,本地也可以跑 DeepSeek-V4-Flash 了。

284B 总参数、13B 激活参数、1M 上下文的 DeepSeek-V4-Flash-0731,现在已经有 GGUF 版本,可以通过 Unsloth Studio 或 llama.cpp 跑在自己的机器上。

图源:Unsloth AI

是不是听着很爽?

但我把官方配置看了一遍,发现这里的本地跟很多人想的有点区别。。。最低 92GB 总内存,想跑一个比较靠谱的版本,建议从 110GB 起步。。。。

32GB、64GB 的普通电脑咱就先不折腾了。

先来信息平权一下,根据 DeepSeek-V4-Flash 的正式版消息的公布,Agent 能力要比 Preview 提升很多。

官方给出了 9 项 Agent 基准测试中,它把它的前身 Flash Preview 给秒了,也把参数更大的 V4-Pro Preview 给秒了。比如 Terminal Bench 2.1 从 61.8 涨到了 82.7,DeepSWE 从 7.3 涨到了 54.4。

图源:DeepSeek 官方

DeepSeek-V4-Flash-0731 有很多量化版本,不过其实只需要记住一件事就行了:位数越低,占用越小,质量损失也越明显。

这里的总内存,是系统 RAM 加显存,或者 Mac 的统一内存。

这里有个坑:文件只有 103GB,不代表 103GB 内存就能跑。

模型加载之后,KV Cache、上下文和系统还得继续占内存。官方给的底线是 110GB,不过大家统一按 128GB 来算比较省事。

还有一个容易出错的地方。

Unsloth 的原帖把 4-bit 写成了 lossless,当前文档已经标得更清楚:UD-Q4_K_XL 是 near-lossless,真正无损的是 UD-Q8_K_XL。两者只差 7GB。

所以

  • 128GB 机器,选 UD-IQ3_XXS

  • 192GB 或 256GB 机器,直接上 UD-Q8_K_XL

  • 只有 64GB,先用 API,或者等更小的量化版本。

图源:Unsloth;越靠右下,模型越接近官方原始权重

省事儿的做法:Unsloth Studio

不想碰一堆编译参数,那你可以直接装 Unsloth Studio。

Mac、Linux 和 WSL 打开终端:

arduino 复制代码
curl -fsSL https://unsloth.ai/install.sh | shunsloth studio -p 8888

Windows 用 PowerShell:

arduino 复制代码
irm https://unsloth.ai/install.ps1 | iexunsloth studio -p 8888

然后在浏览器打开:

arduino 复制代码
http://127.0.0.1:8888

第一次启动会让你创建密码。进入 Model hub,搜索 DeepSeek-V4-Flash-0731-GGUF,再按自己的内存选择量化版本,点 Download。

图源:Unsloth;截图里的机器是 64GB 显存加 64GB 内存,155GB 的 Q4 版本已经超出容量

下载量在 100GB 到 162GB 之间,建议提前留足硬盘空间。

下载完成后直接开始,Studio 会自动带上聊天模板和大部分推理参数,右下角还能切换思考强度, Non-think、Think High 和 Think Max。

图源:Unsloth

如果只在本机使用,启动命令里不用加 -H 0.0.0.0。这个参数会让同一网络里的其他设备也能访问,家里内网还能接受,公网别这么搞。

如果想接自己的工具,就用 llama.cpp

已经在用 llama.cpp 的人,先保证版本是最新的,然后直接从 Hugging Face 拉模型就可以了。

128GB 机器可以从 3-bit 开始:

ruby 复制代码
./llama.cpp/llama-cli \  -hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-IQ3_XXS \  --temp 1.0 \  --top-p 1.0 \  --min-p 0.0 \  --ctx-size 32768

内存够,想跑官方无损版,把模型名换掉:

ruby 复制代码
unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-Q8_K_XL

如果下载老卡住,可以先装 huggingface_hub,手动把 3-bit 文件下到本地:

css 复制代码
hf download unsloth/DeepSeek-V4-Flash-0731-GGUF \  --local-dir unsloth/DeepSeek-V4-Flash-0731-GGUF \  --include "*UD-IQ3_XXS*"

建议第一次只开 32K 上下文,确认模型、速度和内存都正常,再往上加上下文。

它虽然支持 1M 上下文,但上下文越长,额外占用越大。

Unsloth 给的常规推荐参数如下:

ini 复制代码
temperature = 1.0top_p = 1.0min_p = 0.0context = 32768 起步

如果拿它跑 Agent 或代码任务,把 top_p 改成 0.95

Think High 默认开启,日常复杂任务先用它。Think Max 需要至少 384K 上下文,内存和等待时间都会继续往上走,适合真有难题时再开。普通问答可以切到 Non-think,速度更快。

关闭思考模式的命令是:

json 复制代码
--chat-template-kwargs '{"enable_thinking":false}'

需要 Think Max:

css 复制代码
--chat-template-kwargs '{"reasoning_effort":"max"}'

图源:Unsloth;官方示例中速度为 49.7 tok/s,具体速度取决于硬件和量化版本

所以本地跑 DeepSeek-V4-Flash 这件事确实能行。只是这个本地,暂时只能工作站和大内存 Mac 的本地才能跑起来。。。

像我这种 32G 丐版内存的 Mac ,再等等不知道能不能等到了。。。

参考资料:

相关推荐
Claire_881 小时前
AI 辅助 PPT 生成工具横向测评:从模板库到多模态生成的选型参考
人工智能·powerpoint
半亩码田1 小时前
AI周报 | DeepSeek-V4-Flash 正式版(7-31)、Wan2.6 全链路、GPT-5.6 降价 80%(上周 07.27-08.02)
人工智能·gpt
山东布谷网络科技1 小时前
靠“社交+游戏”突围:中东语聊APP前景预测与低成本运营案例
人工智能·游戏
技术小黑1 小时前
RNN算法实战系列05 | 天气预测
人工智能·rnn·算法
带娃的IT创业者2 小时前
GitHub 热门项目解析:当 AI 编码助手遭遇“上下文爆炸”
人工智能·github·代码优化·ai编程助手·上下文窗口·上下文压缩
SimLine芯见2 小时前
以可靠性为中心的RCM KVM远程管控在多行业高端制造中的应用
大数据·人工智能·制造
前端开发江鸟2 小时前
Agent 已经能跑起来了,我却不知道怎样判断它好不好
人工智能
阿祖zu2 小时前
芝士就是力量!开源私有化部署与 GitHub 双向同步的个人知识笔记 App
前端·后端·ios
不才不才不不才2 小时前
Spring 源码系列(16): doDispatch 全流程——一次请求的主干链路
java·后端·spring