速度太快了!本地可以跑 DeepSeek-V4-Flash 了

DeepSeek-V4-Flash 的一经发布属实非常炸裂了,发布完了之后 1 - 4 个小时,我明显 DeepSeek 的响应速度变得很慢了,我估计大家都在接入 API 测试,不过也难怪,DeepSeek-V4-Flash 正式版把 DeepSeek-V4-Pro Preview 都给秒了,Agent 能力大幅增强,香的一批,还要什么自行车。

不过 DeepSeek 除了可以接入 API ,根据 Unsloth AI 的消息,本地也可以跑 DeepSeek-V4-Flash 了。

284B 总参数、13B 激活参数、1M 上下文的 DeepSeek-V4-Flash-0731,现在已经有 GGUF 版本,可以通过 Unsloth Studio 或 llama.cpp 跑在自己的机器上。

图源:Unsloth AI

是不是听着很爽?

但我把官方配置看了一遍,发现这里的本地跟很多人想的有点区别。。。最低 92GB 总内存,想跑一个比较靠谱的版本,建议从 110GB 起步。。。。

32GB、64GB 的普通电脑咱就先不折腾了。

先来信息平权一下,根据 DeepSeek-V4-Flash 的正式版消息的公布,Agent 能力要比 Preview 提升很多。

官方给出了 9 项 Agent 基准测试中,它把它的前身 Flash Preview 给秒了,也把参数更大的 V4-Pro Preview 给秒了。比如 Terminal Bench 2.1 从 61.8 涨到了 82.7,DeepSWE 从 7.3 涨到了 54.4。

图源:DeepSeek 官方

DeepSeek-V4-Flash-0731 有很多量化版本,不过其实只需要记住一件事就行了:位数越低,占用越小,质量损失也越明显。

这里的总内存,是系统 RAM 加显存,或者 Mac 的统一内存。

这里有个坑:文件只有 103GB,不代表 103GB 内存就能跑。

模型加载之后,KV Cache、上下文和系统还得继续占内存。官方给的底线是 110GB,不过大家统一按 128GB 来算比较省事。

还有一个容易出错的地方。

Unsloth 的原帖把 4-bit 写成了 lossless,当前文档已经标得更清楚:UD-Q4_K_XL 是 near-lossless,真正无损的是 UD-Q8_K_XL。两者只差 7GB。

所以

  • 128GB 机器,选 UD-IQ3_XXS

  • 192GB 或 256GB 机器,直接上 UD-Q8_K_XL

  • 只有 64GB,先用 API,或者等更小的量化版本。

图源:Unsloth;越靠右下,模型越接近官方原始权重

省事儿的做法:Unsloth Studio

不想碰一堆编译参数,那你可以直接装 Unsloth Studio。

Mac、Linux 和 WSL 打开终端:

arduino 复制代码
curl -fsSL https://unsloth.ai/install.sh | shunsloth studio -p 8888

Windows 用 PowerShell:

arduino 复制代码
irm https://unsloth.ai/install.ps1 | iexunsloth studio -p 8888

然后在浏览器打开:

arduino 复制代码
http://127.0.0.1:8888

第一次启动会让你创建密码。进入 Model hub,搜索 DeepSeek-V4-Flash-0731-GGUF,再按自己的内存选择量化版本,点 Download。

图源:Unsloth;截图里的机器是 64GB 显存加 64GB 内存,155GB 的 Q4 版本已经超出容量

下载量在 100GB 到 162GB 之间,建议提前留足硬盘空间。

下载完成后直接开始,Studio 会自动带上聊天模板和大部分推理参数,右下角还能切换思考强度, Non-think、Think High 和 Think Max。

图源:Unsloth

如果只在本机使用,启动命令里不用加 -H 0.0.0.0。这个参数会让同一网络里的其他设备也能访问,家里内网还能接受,公网别这么搞。

如果想接自己的工具,就用 llama.cpp

已经在用 llama.cpp 的人,先保证版本是最新的,然后直接从 Hugging Face 拉模型就可以了。

128GB 机器可以从 3-bit 开始:

ruby 复制代码
./llama.cpp/llama-cli \  -hf unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-IQ3_XXS \  --temp 1.0 \  --top-p 1.0 \  --min-p 0.0 \  --ctx-size 32768

内存够,想跑官方无损版,把模型名换掉:

ruby 复制代码
unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-Q8_K_XL

如果下载老卡住,可以先装 huggingface_hub,手动把 3-bit 文件下到本地:

css 复制代码
hf download unsloth/DeepSeek-V4-Flash-0731-GGUF \  --local-dir unsloth/DeepSeek-V4-Flash-0731-GGUF \  --include "*UD-IQ3_XXS*"

建议第一次只开 32K 上下文,确认模型、速度和内存都正常,再往上加上下文。

它虽然支持 1M 上下文,但上下文越长,额外占用越大。

Unsloth 给的常规推荐参数如下:

ini 复制代码
temperature = 1.0top_p = 1.0min_p = 0.0context = 32768 起步

如果拿它跑 Agent 或代码任务,把 top_p 改成 0.95

Think High 默认开启,日常复杂任务先用它。Think Max 需要至少 384K 上下文,内存和等待时间都会继续往上走,适合真有难题时再开。普通问答可以切到 Non-think,速度更快。

关闭思考模式的命令是:

json 复制代码
--chat-template-kwargs '{"enable_thinking":false}'

需要 Think Max:

css 复制代码
--chat-template-kwargs '{"reasoning_effort":"max"}'

图源:Unsloth;官方示例中速度为 49.7 tok/s,具体速度取决于硬件和量化版本

所以本地跑 DeepSeek-V4-Flash 这件事确实能行。只是这个本地,暂时只能工作站和大内存 Mac 的本地才能跑起来。。。

像我这种 32G 丐版内存的 Mac ,再等等不知道能不能等到了。。。

参考资料:

相关推荐
IT古董10 小时前
FDE(Forward Deployed Engineer)详解:AI时代正在崛起的新型工程师
大数据·人工智能·数据挖掘
ZISHU_98711 小时前
用 TLabel 给 SynTouch BioTac 数据做语义标注:从原始信号到结构化标注
开发语言·人工智能·python·数据·机器人触觉
hh95011 小时前
gent Plan x DeepSeek Harness:多 Agent 协作场景下的中央编排实践
人工智能·wpf·adg·火山引擎·agent plan·adg成都社区
cczixun11 小时前
2026 智能体平台落地实战:从 POC 验证到生产上线,避开选型与交付陷阱
人工智能·落地·选型·智能体·2026
IT_陈寒11 小时前
Redis内存警告竟是因为这个不起眼的配置项
前端·人工智能·后端
CHY_12811 小时前
VSO.ai 系列(二):AI验证回归优化实战
人工智能·synopsys·vso.ai·验证加速
Python私教11 小时前
AI 漫剧角色一进分镜就变脸?把提示词升级成“角色 ID + 镜头合同”
后端
Python私教11 小时前
一次生成 20 个角色却全都撞脸:我用“角色合同”重做了批量生成流程
后端
2401_8900956111 小时前
武汉人工智能应用软件开发实施异常怎么排查?模拟环境与验证步骤
人工智能·案例复盘·武汉自动意志科技·智钳claw·企业ai智能体·ai漫剧生成
泰迪智能科技0112 小时前
三种人社职业技能等级证书报考指南对比:人工智能训练师 / 计算机程序设计员 / 服务机器人应用技术员
人工智能·百度·机器人