DeepSeek-V4-Flash 正式版来了!这次提升有点夸张。

刚刚打开 DeepSeek,就发现多了一行小字,不过这个小字没写在右下角。

它写在了 DeepSeek 的 Logo 上面。

各位看到了什么?

DeepSeek-V4-Flash 正式版公测了,大幅增强了 Agent 能力。

不过 DeepSeek 这波也太低调了吧。

甚至官方账号都没发公告,大家大多数人还是通过更新日志发现的。

你看看这。

真服了,你 DeepSeek 要是不想发,我们替你发好了。

这次提升有点夸张

DeepSeek 把新旧版本和几个同期模型的成绩放到了一起。

原始对比图;V4-Flash 0731 一列已与 DeepSeek 官方更新日志逐项核对

为了更直观地看清这次升级的幅度,我又把三个 DeepSeek 版本单独画成了一张图。

先看它和自己比。

9 项测试全部上涨。其中 DeepSWE 从 7.3 涨到 54.4,直接增加 47.1 分;CyberGym 增加 38 分;DSBench-Hard 增加 33.8 分;DSBench-FullStack 增加 31.7 分。

Terminal-Bench 2.1 也从 61.8 涨到 82.7,增加 20.9 分。

这已经不是小版本修修补补的幅度了。

再看 V4-Pro Preview。

V4-Flash 0731 在图里的 9 项测试全部领先。DeepSWE 高 41.6 分,CyberGym 高 24 分,DSBench-Hard 高 28.5 分,Terminal-Bench 2.1 也高了 10.6 分。

一个叫 Flash、每个 token 只激活 13B 参数的型号,把自家的 Pro Preview 全线给秒了。

更夸张的是,模型架构和尺寸都没变。

官方明确写了,V4-Flash-0731 与 Preview 使用同一套架构,仍是 284B 总参数、13B 激活参数,这次只做了后训练。

说白了,DeepSeek 没有靠堆一个更大的底座交成绩。它把训练重点压到了 Agent 执行、工具调用和长任务上。

只和旧版本比,当然不够。

我又查了 GPT-5.6 Sol、Claude Opus 5、Kimi K3、GLM-5.2 和 MiniMax M3 的公开数据。

先说结论:V4-Flash 已经进了第一梯队的讨论范围,但还没有把最强的几个模型干下去

下面挑 5 个重合度最高的 Agent 基准。

图里的 GPT-5.6 Sol 和 Kimi K3 采用 Kimi K3 官方模型卡里的同名测试结果;Opus 5 采用 Anthropic 系统卡;MiniMax M3 采用 MiniMax 和 GLM-5.2 的官方材料。

不同公司用的 Agent harness、reasoning effort、超时设置和上下文长度并不完全一致。

AutomationBench 还有 Public 与私有测试集之分。Kimi K3 的官方模型卡也说过,Terminal-Bench 里的 Kimi 用 Kimi Code,GPT 用 Codex,GLM 用 Claude Code。

Terminal-Bench 2.1 上,GPT-5.6 Sol 和 Kimi K3 仍领先 V4-Flash 5~6 分。DeepSWE 上的差距更明显,Sol 高 18.6 分,Opus 5 高 14.4 分,Kimi K3 高 13.1 分。

到了 Toolathlon-Verified,V4-Flash 的 70.3 已经超过 GLM-5.2,距离 Kimi K3 只差 6.2 分,不过 Opus 5 的 80.6 仍然更强。

Agents' Last Exam 和 AutomationBench 也差不多。V4-Flash 已经能仅仅咬住了前面的模型,但还没拿到第一。

不过没关系,DeepSeek 还有杀手锏没用,DeepSeek-V4-Pro 正式版。

所以暂且可以这么认为,最难的长链条工程任务,GPT-5.6 Sol、Opus 5 和 Kimi K3 依然首选;

大批量跑代码检查、仓库分析、工具调用和 sub-agent,V4-Flash 开始变得非常有吸引力。

能力大涨,价格一分没涨

看完分数,再看价格。

DeepSeek-V4-Flash 0731 当前每百万 token 的常规价格是:缓存未命中输入 0.14 美元、缓存命中输入 0.0028 美元、输出 0.28 美元。

能力涨了这么多,一分钱没加。

再拿 OpenAI 最便宜的 GPT-5.6 Luna 对比。

按 OpenAI 当前模型页的标准价格,Luna 是 0.20 美元输入、0.02 美元缓存输入、1.20 美元输出。

V4-Flash 的缓存未命中输入便宜 30%,缓存命中输入便宜 86%,输出便宜接近 77%。单看输出价,大约只有 Luna 的 1/4.3。

但是感觉,这次的 V4-Flash 应该会比 Luna 更强。

资料来源:

相关推荐
七灵微8 分钟前
【AI】代码实战- 基于时间序列的轴承检测1
人工智能·机器学习·ai·pandas·matplotlib
OFIRM碳基硅基15 分钟前
西游金蝉劫 IP · 之 《金蝉子前传渡缘劫》电影 20 亿票房触发 · 项目专项扶持协议 总览 拉格朗日光影动画-西游金蝉劫项目组
大数据·人工智能·西游金蝉劫·蝎子精·蝎子精女妖王·金蝉子前传渡缘劫
银空飞羽24 分钟前
职型求职工具实测:把简历分析、岗位匹配和定向优化串成一条求职链路
人工智能·经验分享·面试·职场和发展·跳槽·求职招聘·创业创新
ChaITSimpleLove26 分钟前
AI时代 “本体” 的 “标准化” 定义
人工智能·dsl·rdf·ontology·ai本体·json-ld
FL162386312931 分钟前
基于YOLOv8的智慧校园人脸识别和公路汽车检测项目源码+训练好的模型
人工智能
进化矩阵34 分钟前
别把指标当目的:当数字开始反噬你
大数据·人工智能·职场和发展·创业创新
万物智能信息科技35 分钟前
电容触摸 FT5406,另一颗芯片、同一条总线—【万物智能之开源鸿蒙OpenHarmony系统实战开发系列教程】
人工智能·华为·开源·harmonyos·鸿蒙
doudoudalao37 分钟前
TikTok 带货视频怎么做?AI 一键生成带货视频提示词分享,怎么写出爆款的 AI 带货视频提示词
人工智能
十正38 分钟前
把表变成模型够得着的句柄
人工智能·ai·agent
林浩杨_1 小时前
港科大(广州)× 南航 × OPPO:DPPMG——个性化多模态生成框架
人工智能