DeepSeek-V4-Flash 正式版来了!这次提升有点夸张。

刚刚打开 DeepSeek,就发现多了一行小字,不过这个小字没写在右下角。

它写在了 DeepSeek 的 Logo 上面。

各位看到了什么?

DeepSeek-V4-Flash 正式版公测了,大幅增强了 Agent 能力。

不过 DeepSeek 这波也太低调了吧。

甚至官方账号都没发公告,大家大多数人还是通过更新日志发现的。

你看看这。

真服了,你 DeepSeek 要是不想发,我们替你发好了。

这次提升有点夸张

DeepSeek 把新旧版本和几个同期模型的成绩放到了一起。

原始对比图;V4-Flash 0731 一列已与 DeepSeek 官方更新日志逐项核对

为了更直观地看清这次升级的幅度,我又把三个 DeepSeek 版本单独画成了一张图。

先看它和自己比。

9 项测试全部上涨。其中 DeepSWE 从 7.3 涨到 54.4,直接增加 47.1 分;CyberGym 增加 38 分;DSBench-Hard 增加 33.8 分;DSBench-FullStack 增加 31.7 分。

Terminal-Bench 2.1 也从 61.8 涨到 82.7,增加 20.9 分。

这已经不是小版本修修补补的幅度了。

再看 V4-Pro Preview。

V4-Flash 0731 在图里的 9 项测试全部领先。DeepSWE 高 41.6 分,CyberGym 高 24 分,DSBench-Hard 高 28.5 分,Terminal-Bench 2.1 也高了 10.6 分。

一个叫 Flash、每个 token 只激活 13B 参数的型号,把自家的 Pro Preview 全线给秒了。

更夸张的是,模型架构和尺寸都没变。

官方明确写了,V4-Flash-0731 与 Preview 使用同一套架构,仍是 284B 总参数、13B 激活参数,这次只做了后训练。

说白了,DeepSeek 没有靠堆一个更大的底座交成绩。它把训练重点压到了 Agent 执行、工具调用和长任务上。

只和旧版本比,当然不够。

我又查了 GPT-5.6 Sol、Claude Opus 5、Kimi K3、GLM-5.2 和 MiniMax M3 的公开数据。

先说结论:V4-Flash 已经进了第一梯队的讨论范围,但还没有把最强的几个模型干下去

下面挑 5 个重合度最高的 Agent 基准。

图里的 GPT-5.6 Sol 和 Kimi K3 采用 Kimi K3 官方模型卡里的同名测试结果;Opus 5 采用 Anthropic 系统卡;MiniMax M3 采用 MiniMax 和 GLM-5.2 的官方材料。

不同公司用的 Agent harness、reasoning effort、超时设置和上下文长度并不完全一致。

AutomationBench 还有 Public 与私有测试集之分。Kimi K3 的官方模型卡也说过,Terminal-Bench 里的 Kimi 用 Kimi Code,GPT 用 Codex,GLM 用 Claude Code。

Terminal-Bench 2.1 上,GPT-5.6 Sol 和 Kimi K3 仍领先 V4-Flash 5~6 分。DeepSWE 上的差距更明显,Sol 高 18.6 分,Opus 5 高 14.4 分,Kimi K3 高 13.1 分。

到了 Toolathlon-Verified,V4-Flash 的 70.3 已经超过 GLM-5.2,距离 Kimi K3 只差 6.2 分,不过 Opus 5 的 80.6 仍然更强。

Agents' Last Exam 和 AutomationBench 也差不多。V4-Flash 已经能仅仅咬住了前面的模型,但还没拿到第一。

不过没关系,DeepSeek 还有杀手锏没用,DeepSeek-V4-Pro 正式版。

所以暂且可以这么认为,最难的长链条工程任务,GPT-5.6 Sol、Opus 5 和 Kimi K3 依然首选;

大批量跑代码检查、仓库分析、工具调用和 sub-agent,V4-Flash 开始变得非常有吸引力。

能力大涨,价格一分没涨

看完分数,再看价格。

DeepSeek-V4-Flash 0731 当前每百万 token 的常规价格是:缓存未命中输入 0.14 美元、缓存命中输入 0.0028 美元、输出 0.28 美元。

能力涨了这么多,一分钱没加。

再拿 OpenAI 最便宜的 GPT-5.6 Luna 对比。

按 OpenAI 当前模型页的标准价格,Luna 是 0.20 美元输入、0.02 美元缓存输入、1.20 美元输出。

V4-Flash 的缓存未命中输入便宜 30%,缓存命中输入便宜 86%,输出便宜接近 77%。单看输出价,大约只有 Luna 的 1/4.3。

但是感觉,这次的 V4-Flash 应该会比 Luna 更强。

资料来源:

相关推荐
逐米时代1 小时前
数据清洗到底在洗什么
人工智能
袁震1 小时前
小图传输,大图呈现——用 HarmonyOS 7 端侧 AI 实现 4 倍图像超分重建
人工智能·华为·harmonyos
星核0penstarry1 小时前
从 Dialog-RSN-1 看语音 Agent 走向:企业如何评估音频原生模型与 API 服务
人工智能·音视频·音频·api
GetcharZp2 小时前
让照片开口说话:LivePortrait 本地部署玩法详解
人工智能·计算机视觉
OpenCSG2 小时前
CSGClaw v0.4.2-v0.4.3 版本更新
人工智能·opencsg
大鱼>2 小时前
因子挖掘+回测+RL交易:量化金融完整系统
人工智能·深度学习·算法·金融
梦想三三2 小时前
YOLOv5 口罩目标检测实战(一):项目整体介绍与数据准备
人工智能·yolo·目标检测
梵构广告2 小时前
平台怎么做品牌营销策划?—品牌营销
大数据·人工智能·平面·品牌策划
土豆12502 小时前
DeepSeek V4-Flash 正式版深度解读:一行 changelog 里的暗涌与野心
人工智能·llm