DeepSeek V4.1 Flash 实测:分数持平 GPT-6 Astra,单任务成本低 15 倍

01 先交代这份报告的来历

9 月 10 日,DeepSeek 发布并开源 V4.1 Flash。它是一个 552B 参数的 MoE 模型,采用新的因果编码器-解码器(CED)架构,预填充阶段每 token 只激活 8B 参数,解码阶段激活 16B,原生支持图文输入,上下文 100 万 token。

Fireworks 是托管该模型的推理平台之一,模型 9 月 10 日同步上线。四天后它发布了自己的测试结果,覆盖 DeepSWE、Terminal-Bench 2.1 和 HLE 三个基准。

这是厂商自测,不是独立复核。测试 harness 由 Fireworks 自己选择,成本数字用各家公开单价乘以它自己的 token 消耗量算出,不是账单实测。它同时是这份结论的受益方,模型越划算,它的调用量越大。下面所有数字都要放在这个前提下读。

02 分数几乎一样,账单差 15 倍

DeepSWE 是长周期软件工程基准,113 道原创任务、五种语言,衡量 Agent 在真实代码库里连续作业的能力。Fireworks 的四组结果如下:

模型 推理强度 pass@1 单任务成本
DeepSeek V4.1 Flash max 74.34% $0.43
GPT-6 Astra xhigh 74.12% $6.52
Gemini 3.8 Flash high 73.83% $2.36
Claude Opus 5 max 73.65% $11.84
xychart-beta title "四个模型单任务成本对比(美元)" x-axis ["DeepSeek V4.1 Flash", "GPT-6 Astra", "Gemini 3.8 Flash", "Claude Opus 5"] y-axis "单任务成本(美元,对数刻度)" 0.1 --> 20 bar [0.43, 6.52, 2.36, 11.84]

注:纵轴采用对数刻度,以便在同一张图里同时看清 0.43 美元与 11.84 美元之间的 15 倍差距。

四个模型挤在 0.7 分之内,而 Fireworks 自己在报告里写明,它的运行间波动是 1.4 到 3.2 分。按它自己的标准,这四家在编码准确率上没有分出胜负。拉开差距的只有成本。

这个分数不是孤例。DeepSWE v1.1 公开榜上,Gemini 3.8 Flash 是 73.7%,Claude Opus 5 是 74.0%;DeepSeek 官方技术报告里给自己写的是 74.2%。Fireworks 的实测没有偏离主流口径,可信度因此比一般的厂商自测高一些。

成本数字则要打折:$2.36 用的是 Gemini 3.8 Flash 的优惠价(每百万 token 输入 0.75 美元、输出 3.75 美元),这项优惠今年 12 月 31 日到期,之后价格翻倍。

03 六成的钱花在缓存上

先看架构为什么这么设计。Agent 的工作轨迹是典型的输入密集型:反复读文件、读自己的草稿、读工具返回结果,最后只写出一个小小的补丁。在这次 DeepSWE 运行里,输入与输出的比例是 174:1。

所以 V4.1 Flash 把激活预算拆开:输入端 8B,输出端 16B。理解用不了那么大的算力,生成才需要。

把这次运行的单任务账单摊开:

组成 token 数 单价 费用 占比
未缓存输入 14.9 万 $0.22/百万 $0.033 7.6%
缓存输入 3674 万 $0.007/百万 $0.257 59.9%
输出 21.2 万 $0.66/百万 $0.140 32.5%
合计 - - $0.4295 100%

99.6% 的输入 token 走了缓存,缓存这一项单独占账单的六成。这笔钱买的是模型把同一份材料读第二十遍。

这解释了 DeepSeek 为什么把 KV Cache 从上一代的 3514 字节每 token 压到 890 字节。压缩四倍,直接砍在最大的成本项上。对长会话、多轮试错的 Agent 任务,这比把输出单价降几毛钱有用得多。

04 这项优势的边界在哪

缓存命中是有前提的。同一段上下文被反复读取才有命中;如果你的任务是一次性的、上下文每次全新、没有稳定的公共前缀,四倍压缩的收益会小很多。

Terminal-Bench 2.1 上「只差一分」这句话,要打折听。V4.1 Flash 是 86.5%,Astra 是 87.5%,但基准已接近饱和,区分度正在下降。同一批模型放到更难的 Terminal-Bench 4.0 上,差距从 3 分拉大到 38 分:Gemini 3.8 Flash 从 89.4% 掉到 19.1%。简单任务上的接近,不等于复杂任务上的接近。

学术推理确实是短板。HLE 上 V4.1 Flash 是 34.52%,Astra 是 50.40%,差了将近 16 个百分点。这个模型的定位很清楚:适合 Agent 编码,不适合硬科学推理。不同评测口径的数字不能混着比,DeepSeek 官方报告里这个数字是 36.8%。

在哪儿调用也影响结论。Fireworks 每百万 token 输入 0.22 美元、缓存读取 0.007 美元、输出 0.66 美元。DeepSeek 官方 API 走峰谷定价:闲时缓存未命中输入 1 元、输出 4 元,高峰翻倍,缓存命中分别为 0.02 元和 0.04 元。命中率高时官方 API 更省,命中率低时廉价托管的输出单价更有优势。别拿最低价写进预算。

05 两个模型搭配,比单用最强的那个更强

报告还做了一组 oracle router 测试:把同一批题目分别交给 Astra 和 V4.1 Flash,再挑出成本最优的正确答案,组合得分 54.80%,单独 Astra 是 50.40%。

4.4 个百分点来自两者的错误不重叠:V4.1 Flash 的 34.52% 并不是 Astra 的 50.40% 的子集,两个模型答错的是不同的题。

oracle router 是理论上限,真实路由器抓不到全部 4.4 分。但它指向一个已经不算新的判断:模型能力参差不齐,没有任何一个模型在所有任务上都最优。与其押注单一最强模型,不如把简单任务分给便宜的那个,把难题升级上去。这项测试说明,路由的价值首先是提分,省钱是附带结果。

下面给出一段路由策略的伪代码,按任务类型和上下文长度决定调用哪个模型,并附上成本估算注释:

python 复制代码
def route(task_type: str, context_tokens: int) -> str:
    # 学术推理类任务:V4.1 Flash 在 HLE 上只有 34.52%,Astra 是 50.40%
    if task_type == "academic_reasoning":
        return "gpt-6-astra"
# 长上下文 Agent 编码任务:缓存命中率高,V4.1 Flash 成本优势最大
if task_type == "agent_coding" and context_tokens > 100_000:
    return "deepseek-v4.1-flash"
短上下文编码任务:两者分数接近,优先便宜的 V4.1 Flash
if task_type == "agent_coding":
return "deepseek-v4.1-flash"
兜底:简单任务走便宜模型,难题升级到 Astra
return "deepseek-v4.1-flash" if is_simple(task) else "gpt-6-astra"
成本估算(Fireworks 单价,每百万 token):
DeepSeek V4.1 Flash:输入 $0.22,缓存读取 $0.007,输出 $0.66
GPT-6 Astra:输入 $10,输出 $50
一次 20 万 token 输入 + 2 千 token 输出的编码任务:
V4.1 Flash ≈ $0.045(缓存命中时更低),Astra ≈ $2.10,相差约 47 倍

06 和我们有什么关系

对开发 Agent 的人来说,账算得过来了。以前跑一次深度编码任务要花几美元,只能当演示;降到 0.43 美元后,它可以变成常驻后台的基础设施。15 次自主尝试的成本,等于过去 1 次。

同样的模型在不同人手里,账单能差好几倍。缓存命中的前提是上下文前缀稳定,Agent 的提示词结构、工具定义顺序、读取文件的方式都会影响命中率。把上下文写得更稳定,比换更便宜的模型省得更多。

对普通用户来说,这次变化发生在 API 侧,聊天窗口里体感很弱。间接影响是:开源权重模型的性价比被抬高之后,闭源厂商的定价空间会被持续压缩,最终反映到订阅价格和用量额度上。

十五倍的成本差,把一批原本算不过账的场景变得算得过账。接下来要看 V4.1 Pro:非对称架构放大到更大参数量之后,这套效率逻辑还成不成立。

相关推荐
知了一笑1 小时前
AI也没想到,三年红透半边天
人工智能·ai·互联网·aigc·职场
华科大胡子1 小时前
DeepSeek Harness 开源贡献手记:从入门到合入主线的完整旅程
deepseek
园长的牧歌2 小时前
Ubuntu 24.04 使用ChatGPT 桌面版
chatgpt·codex
VIP_CQCRE10 小时前
Claude Code 接入 Nano Banana MCP:在终端里完成 AI 图片生成、编辑与多图合成
ai·图像生成·mcp·claude code·ace data cloud
qq_25183645711 小时前
AI 疾病自查功能SpringbootAI项目实战 · 技术实现文档
java·ai·ai编程
anxiao_m12 小时前
企业批量做短视频怎么选?主流AI视频平台实测测评
ai·aigc
冬奇Lab13 小时前
DeepSeek Harness 系列(09):可观测性——怎么知道 Agent 在干什么
人工智能·deepseek
晨曦_子画15 小时前
Qwen 3.8 27B 与 Qwen 3.6 27B:架构相同,相隔4个月,升级方式不同
阿里云·ai·千问
子非鱼eva15 小时前
昇腾开源仓Issue分析解答-mindspore精选(一)
人工智能·ai