DeepSeek-V4-Flash 正式版来了!这次提升有点夸张。

刚刚打开 DeepSeek,就发现多了一行小字,不过这个小字没写在右下角。

它写在了 DeepSeek 的 Logo 上面。

各位看到了什么?

DeepSeek-V4-Flash 正式版公测了,大幅增强了 Agent 能力。

不过 DeepSeek 这波也太低调了吧。

甚至官方账号都没发公告,大家大多数人还是通过更新日志发现的。

你看看这。

真服了,你 DeepSeek 要是不想发,我们替你发好了。

这次提升有点夸张

DeepSeek 把新旧版本和几个同期模型的成绩放到了一起。

原始对比图;V4-Flash 0731 一列已与 DeepSeek 官方更新日志逐项核对

为了更直观地看清这次升级的幅度,我又把三个 DeepSeek 版本单独画成了一张图。

先看它和自己比。

9 项测试全部上涨。其中 DeepSWE 从 7.3 涨到 54.4,直接增加 47.1 分;CyberGym 增加 38 分;DSBench-Hard 增加 33.8 分;DSBench-FullStack 增加 31.7 分。

Terminal-Bench 2.1 也从 61.8 涨到 82.7,增加 20.9 分。

这已经不是小版本修修补补的幅度了。

再看 V4-Pro Preview。

V4-Flash 0731 在图里的 9 项测试全部领先。DeepSWE 高 41.6 分,CyberGym 高 24 分,DSBench-Hard 高 28.5 分,Terminal-Bench 2.1 也高了 10.6 分。

一个叫 Flash、每个 token 只激活 13B 参数的型号,把自家的 Pro Preview 全线给秒了。

更夸张的是,模型架构和尺寸都没变。

官方明确写了,V4-Flash-0731 与 Preview 使用同一套架构,仍是 284B 总参数、13B 激活参数,这次只做了后训练。

说白了,DeepSeek 没有靠堆一个更大的底座交成绩。它把训练重点压到了 Agent 执行、工具调用和长任务上。

只和旧版本比,当然不够。

我又查了 GPT-5.6 Sol、Claude Opus 5、Kimi K3、GLM-5.2 和 MiniMax M3 的公开数据。

先说结论:V4-Flash 已经进了第一梯队的讨论范围,但还没有把最强的几个模型干下去

下面挑 5 个重合度最高的 Agent 基准。

图里的 GPT-5.6 Sol 和 Kimi K3 采用 Kimi K3 官方模型卡里的同名测试结果;Opus 5 采用 Anthropic 系统卡;MiniMax M3 采用 MiniMax 和 GLM-5.2 的官方材料。

不同公司用的 Agent harness、reasoning effort、超时设置和上下文长度并不完全一致。

AutomationBench 还有 Public 与私有测试集之分。Kimi K3 的官方模型卡也说过,Terminal-Bench 里的 Kimi 用 Kimi Code,GPT 用 Codex,GLM 用 Claude Code。

Terminal-Bench 2.1 上,GPT-5.6 Sol 和 Kimi K3 仍领先 V4-Flash 5~6 分。DeepSWE 上的差距更明显,Sol 高 18.6 分,Opus 5 高 14.4 分,Kimi K3 高 13.1 分。

到了 Toolathlon-Verified,V4-Flash 的 70.3 已经超过 GLM-5.2,距离 Kimi K3 只差 6.2 分,不过 Opus 5 的 80.6 仍然更强。

Agents' Last Exam 和 AutomationBench 也差不多。V4-Flash 已经能仅仅咬住了前面的模型,但还没拿到第一。

不过没关系,DeepSeek 还有杀手锏没用,DeepSeek-V4-Pro 正式版。

所以暂且可以这么认为,最难的长链条工程任务,GPT-5.6 Sol、Opus 5 和 Kimi K3 依然首选;

大批量跑代码检查、仓库分析、工具调用和 sub-agent,V4-Flash 开始变得非常有吸引力。

能力大涨,价格一分没涨

看完分数,再看价格。

DeepSeek-V4-Flash 0731 当前每百万 token 的常规价格是:缓存未命中输入 0.14 美元、缓存命中输入 0.0028 美元、输出 0.28 美元。

能力涨了这么多,一分钱没加。

再拿 OpenAI 最便宜的 GPT-5.6 Luna 对比。

按 OpenAI 当前模型页的标准价格,Luna 是 0.20 美元输入、0.02 美元缓存输入、1.20 美元输出。

V4-Flash 的缓存未命中输入便宜 30%,缓存命中输入便宜 86%,输出便宜接近 77%。单看输出价,大约只有 Luna 的 1/4.3。

但是感觉,这次的 V4-Flash 应该会比 Luna 更强。

资料来源:

相关推荐
weixin_4316004410 小时前
Agent Workflow 学习向:最小拖拽画布,看得见地编排,再一键跑通
后端·学习·ai·dify
苹果二10 小时前
【案例说明】能源行业中融合知识图谱、LLM与AI Agent的知识工程实践
人工智能·ai智能体·pem·phm·能源行业·知识工程·pqm
陈童学哦10 小时前
NestJS集成LangChain两条路:封装库躺平 vs 手动硬撸
人工智能
markvivv10 小时前
【译】适合在RTX 5090、DGX Spark或类似机器上可运行的最佳新模型是什么?
大数据·人工智能·spark
caimouse10 小时前
ReactOS 窗口系统分析(31):TextOutW 文本输出全链路 — 从用户函数到显示缓冲区的旅程
网络·人工智能·计算机视觉
sunneo10 小时前
每周GitCode开源项目精选
人工智能
zhangfeng113310 小时前
HiDevLab vCANNLab(昇腾两个云端WebIDE)安装codebuddy
人工智能·ai编程·算子开发
leeyi10 小时前
Agent 间 Transfer 交接:用户在不同 Agent 间无缝切换(第93篇-E79)
人工智能·aigc·agent
很楠爱上10 小时前
从“AI 看合同”到可举证的合同决策链:CounterClause(对薄) 的架构设计与工程实践
人工智能·经验分享·python·学习·agent
Java后端的Ai之路10 小时前
02、Python普通工厂模式
开发语言·人工智能·python·设计模式·普通工厂模式