DeepSeek V4.1 Flash 正式发布!

刚刚我才写完文章说是 DeepSeek 开启正式降价,没过多会 DeepSeek V4.1 Flash 就正式发布了。

这今天 DeepSeek 你是要刷屏吗?

先说一下结论: 从官方跑分看,DeepSeek 这次把 Flash 做到了对标 Opus 5 和 GPT 5.6-Sol。长程写代码、办公自动化都有明显提升,而且价格还降了。

这次的 DeepSeek V4.1 Flash 是全新模型结构系列中的最小尺寸的模型,而且具备原生多模态视觉理解能力。

来看一下详细的测评。

这次连底座一起升级了

这次的 DeepSeek V4.1 Flash 参数量只有 552B,MoE 混合专家模型,输入激活只有 8B,输出激活 16B。

这里的 552B 指模型主干,官方技术报告还单独列了 196B 的 Engram 条件记忆参数。8B 和 16B 则分别对应读取输入、生成输出时每个 token 的激活参数量。

而且是采用了预训练和后训练一起结合,这对于最近只用后训练的模型来说是一种新的升级。

7 月底我写 V4-Flash 正式版时,官方明确说过,模型结构、尺寸都没变,只重新做了后训练。

这次从头训练了一个支持图文的新底座,预训练数据达到 45T tokens,然后再做后训练。图片从语言模型预训练阶段就参与进来,原生多模态的区别在这里。

在基准测试中,成功超越了包括 DeepSeek V4 Pro 在内的一众旗舰模型的智能水平。

图源:DeepSeek 官方模型卡。下文拆解官方公开测评成绩。

这里说的是 DeepSWE、Automation-Bench 等具体项目。尤其 DeepSWE 上,领先 Opus 5 只有 0.2 个百分点,基本已经是同一水平;Terminal-Bench 3.0、4.0 仍然落后。

图源:DeepSeek 官方模型卡,统计的是每个 token 的全局 KV Cache 占用。

KV Cache 可以理解成模型读过内容之后留下的计算缓存,后面继续生成时要用。对话越长,这部分占用越不能忽略。

V4-Flash 每个 token 要用 3514 字节,V4.1 Flash 压到了 890 字节,约为上一代的四分之一。图里的 437 倍,则是相对于 2023 年的 DeepSeek-V1。

这次的 CED 架构,让解码器所用的全局缓存从编码器的最后一层状态生成,减少重复存储;再配合跨层共享、稀疏注意力和 FP4 缓存,继续压低占用。

对经常让 Agent 读代码仓库、读长文档的朋友们来说,这个改动很香。读取和保存上下文的成本更低,对于大量调用的场景来更划算了。

完整成绩:

图源:DeepSeek 发布测评表;新模型成绩已对照官方更新日志与模型卡。

下面的分数也逐项对过官方技术报告第 33 页的 Table 3,表中各模型使用 Max 推理档位。

先和自己比。DeepSWE v1.1 从 V4-Flash 0731 的 54.4 涨到 74.2,增加 19.8 个百分点;Terminal-Bench 2.1 从 82.7 涨到 90.6,增加 7.9 个百分点。

再看 V4-Pro 0813。DeepSWE 高了 11.5 个百分点,Terminal-Bench 3.0 从 11.8 到 30.0,4.0 从 12.4 到 31.2。

相比来说,自家的 Pro,确实有点尴尬了。。。

但我比较在意的是,这些分数到底对应什么工作。

长任务方面

DeepSWE v1.1 包含 113 个原创工程任务,覆盖 91 个仓库、5 种语言。V4.1 Flash 是 74.2%,Opus 5 是 74.0%,GPT-5.6 Sol 是 73.0%。相较自家上一代,这个提升很大;相较 Opus 5,0.2 个百分点还不足以说明稳定领先。

再看 Terminal-Bench,它让 Agent 在终端环境里完成任务。2.1 上,V4.1 Flash 的 90.6% 超过了表里的其他型号。

但到了 3.0,它是 30.0%,Sol 是 34.4%,Opus 5 是 43.3%;4.0 上,它是 31.2%,Sol 是 39.9%,Opus 5 是 51.8%。

办公自动化方面

AutomationBench 测的是跨软件办事。比如处理客户资料、邮件、日历,再把结果写回对应系统。它会检查最后有没有把事情办好。

这组成绩采用的是 AutomationBench v1.0.6 公开评测集,不同版本、公开集和私有集的分数要分开看。

V4.1 Flash 是 54.8%,V4-Pro 是 43.2%,Opus 5 是 50.3%,Sol 是 45.8%。对旧 Pro 提升了 11.6 个百分点,对 Opus 5 高了 4.5 个百分点。

但 54.8% 也说明,任务还有不少做不完。

安全能力方面

CyberGym 从旧 Flash 的 76.7% 涨到 88.1%,高于 Sol 和 GLM-5.3 的 84.5%。它考察真实软件的漏洞分析,以及生成能触发漏洞的验证样本。

不过,另一项 ExploitGym 上,V4.1 Flash 是 15.3%,Sol 是 33.7%。所以 CyberGym 拿高分,不能说明所有安全任务都最强。

多模态能用了,但还没全面领先

这次图文可以直接交给同一个模型处理。看截图、分析图表,再配合工具完成任务,都是它要解决的场景。

Chartography 考察专业图表理解,V4.1 Flash 在带工具的配置下拿到 78.9%,接近 Sol 的 79.9%,低于 Opus 5 的 84.0%。

BabyVision 考察视觉推理,它是 89.6%,略高于 Sol 的 88.9%,但仍低于 Opus 5 的 94.1%。

ZeroBench-main 则是 49.0%,低于 Sol 的 53.0% 和 Opus 5 的 52.0%。

所以我感觉日常截图和图文任务,可以开始让 DeepSeek 开始接手了;但是复杂视觉推理和难题,目前还不能直接认定它能替掉所有旗舰。

DeepSeek Harness 深度适配 DeepSeek V4.1 Flash

就在正式版发布不久前,DeepSeek Harness 也做了升级 V0.1.5 ,深度适配了 DeepSeek V4.1 Flash。

这次有个细节,V4.1 Flash 在训练时,就针对 DeepSeek Harness 的标准模式、程序化工具调用(PTC)模式和极简模式做了专项训练和优化。

所以想试这次 V4.1 Flash 的编程能力,我觉得可以把官方 Harness 也一起升级了。

想用的朋友,装好 Node.js 后,在项目目录里运行这条命令就能启动 Web 界面:

bash 复制代码
npx @deepseek-ai/dsh web

打开后,到 设置 → 模型 填入 DeepSeek API Key,再添加并选中要处理的项目目录,就可以开始了。

图源:DeepSeek Harness 官方配置指南。

价格

DeepSeek V4.1 Flash 已同步上线 DeepSeek API,原生支持多模态,将模型名称更改为 deepseek-flash 即可调用最新的 V4.1 Flash 模型。旧版本模型 V4 Flash 与 V4 Flash Vision Exp 现已下线,出于兼容考虑,模型名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 将被暂时路由到 V4.1 Flash。

这相当于直接合并了。

如果之前接的是两天内测模型,记得把带 expires-on-0910 的临时模型名换成 deepseek-flash。当前官方 API 支持 1M 上下文,最大输出 384K,Base URL 仍是 https://api.deepseek.com

我也是做了一个价格比对图。

现在按每百万 tokens 算,空闲时段缓存命中输入 0.02 元 、未命中输入 1 元 、输出 4 元;高峰时段分别是 0.04 元、2 元、8 元。

高峰指北京时间周一至周五 9:00---12:00、14:00---18:00,其余时间按空闲价。价格自 9 月 10 日 12:00 起执行。

北京时间 2026 年 9 月 14 日 12:00 之后,至未来 V4.1 Pro 上线之前,用户访问 deepseek-v4-pro 的请求将全部路由到 V4.1 Flash,并按 V4.1 Flash 单价计费。

另外,WorkBuddy 这边直接跟 DeepSeek 官方合作了,用 WorkBuddy 接入 DeepSeek-V4.1-Flash 也是真便宜了这价格。

这次 V4.1 Flash 的模型权重和配套代码也已经公开,采用 MIT 许可证。开发者可以商业使用、修改和分发,按许可证保留相应声明即可。

最后说一句大家散了吧, AGI 要继续训练了

相关资料:

相关推荐
特立独行的猫A1 小时前
AtomMQTT Broker — 用 Rust 实现的轻量级高性能 MQTT 消息代理
前端·后端·架构
海宇大数据1 小时前
分布式网格实战:基于海宇柠檬查出险-登记证构建自动化车辆合规网关
运维·人工智能·分布式·自动化
the局外人1 小时前
学习 FastAPI 的 Day 3:企业级目录与数据库迁移
后端·python·fastapi
mldong1 小时前
AI Agent 不能自己签字:用 Python 工作流引擎给 AI 加一道人类审批闸门
后端·python·agent
她的男孩1 小时前
多租户隔离怎么落地?拆完这1600行Starter源码,我把5个坑全踩明白了
java·后端·架构
欧特克_Glodon1 小时前
OpenCV计算机视觉开发入门与实践<四十>:自动识别物体数量
c++·人工智能·opencv·计算机视觉
世岩清上1 小时前
展厅不同分区播放差异化视频,怎样做到内容串联不割裂整体叙事?
运维·人工智能·音视频·展厅改造
Dawson Zhu1 小时前
Agent 记忆调用的上下文感知:从“能召回“到“敢开口“的决策框架
人工智能·语言模型·架构·aigc·agi
来让爷抱一个1 小时前
2026 姿态控制实战:八个姿势钉死动作,百智云精灵图把骨骼契约写进素材包
人工智能·机器学习