01 先交代这份报告的来历
9 月 10 日,DeepSeek 发布并开源 V4.1 Flash。它是一个 552B 参数的 MoE 模型,采用新的因果编码器-解码器(CED)架构,预填充阶段每 token 只激活 8B 参数,解码阶段激活 16B,原生支持图文输入,上下文 100 万 token。
Fireworks 是托管该模型的推理平台之一,模型 9 月 10 日同步上线。四天后它发布了自己的测试结果,覆盖 DeepSWE、Terminal-Bench 2.1 和 HLE 三个基准。
这是厂商自测,不是独立复核。测试 harness 由 Fireworks 自己选择,成本数字用各家公开单价乘以它自己的 token 消耗量算出,不是账单实测。它同时是这份结论的受益方,模型越划算,它的调用量越大。下面所有数字都要放在这个前提下读。
02 分数几乎一样,账单差 15 倍
DeepSWE 是长周期软件工程基准,113 道原创任务、五种语言,衡量 Agent 在真实代码库里连续作业的能力。Fireworks 的四组结果如下:
| 模型 | 推理强度 | pass@1 | 单任务成本 |
|---|---|---|---|
| DeepSeek V4.1 Flash | max | 74.34% | $0.43 |
| GPT-6 Astra | xhigh | 74.12% | $6.52 |
| Gemini 3.8 Flash | high | 73.83% | $2.36 |
| Claude Opus 5 | max | 73.65% | $11.84 |
注:纵轴采用对数刻度,以便在同一张图里同时看清 0.43 美元与 11.84 美元之间的 15 倍差距。
四个模型挤在 0.7 分之内,而 Fireworks 自己在报告里写明,它的运行间波动是 1.4 到 3.2 分。按它自己的标准,这四家在编码准确率上没有分出胜负。拉开差距的只有成本。
这个分数不是孤例。DeepSWE v1.1 公开榜上,Gemini 3.8 Flash 是 73.7%,Claude Opus 5 是 74.0%;DeepSeek 官方技术报告里给自己写的是 74.2%。Fireworks 的实测没有偏离主流口径,可信度因此比一般的厂商自测高一些。
成本数字则要打折:$2.36 用的是 Gemini 3.8 Flash 的优惠价(每百万 token 输入 0.75 美元、输出 3.75 美元),这项优惠今年 12 月 31 日到期,之后价格翻倍。
03 六成的钱花在缓存上
先看架构为什么这么设计。Agent 的工作轨迹是典型的输入密集型:反复读文件、读自己的草稿、读工具返回结果,最后只写出一个小小的补丁。在这次 DeepSWE 运行里,输入与输出的比例是 174:1。
所以 V4.1 Flash 把激活预算拆开:输入端 8B,输出端 16B。理解用不了那么大的算力,生成才需要。
把这次运行的单任务账单摊开:
| 组成 | token 数 | 单价 | 费用 | 占比 |
|---|---|---|---|---|
| 未缓存输入 | 14.9 万 | $0.22/百万 | $0.033 | 7.6% |
| 缓存输入 | 3674 万 | $0.007/百万 | $0.257 | 59.9% |
| 输出 | 21.2 万 | $0.66/百万 | $0.140 | 32.5% |
| 合计 | - | - | $0.4295 | 100% |
99.6% 的输入 token 走了缓存,缓存这一项单独占账单的六成。这笔钱买的是模型把同一份材料读第二十遍。
这解释了 DeepSeek 为什么把 KV Cache 从上一代的 3514 字节每 token 压到 890 字节。压缩四倍,直接砍在最大的成本项上。对长会话、多轮试错的 Agent 任务,这比把输出单价降几毛钱有用得多。
04 这项优势的边界在哪
缓存命中是有前提的。同一段上下文被反复读取才有命中;如果你的任务是一次性的、上下文每次全新、没有稳定的公共前缀,四倍压缩的收益会小很多。
Terminal-Bench 2.1 上「只差一分」这句话,要打折听。V4.1 Flash 是 86.5%,Astra 是 87.5%,但基准已接近饱和,区分度正在下降。同一批模型放到更难的 Terminal-Bench 4.0 上,差距从 3 分拉大到 38 分:Gemini 3.8 Flash 从 89.4% 掉到 19.1%。简单任务上的接近,不等于复杂任务上的接近。
学术推理确实是短板。HLE 上 V4.1 Flash 是 34.52%,Astra 是 50.40%,差了将近 16 个百分点。这个模型的定位很清楚:适合 Agent 编码,不适合硬科学推理。不同评测口径的数字不能混着比,DeepSeek 官方报告里这个数字是 36.8%。
在哪儿调用也影响结论。Fireworks 每百万 token 输入 0.22 美元、缓存读取 0.007 美元、输出 0.66 美元。DeepSeek 官方 API 走峰谷定价:闲时缓存未命中输入 1 元、输出 4 元,高峰翻倍,缓存命中分别为 0.02 元和 0.04 元。命中率高时官方 API 更省,命中率低时廉价托管的输出单价更有优势。别拿最低价写进预算。
05 两个模型搭配,比单用最强的那个更强
报告还做了一组 oracle router 测试:把同一批题目分别交给 Astra 和 V4.1 Flash,再挑出成本最优的正确答案,组合得分 54.80%,单独 Astra 是 50.40%。
4.4 个百分点来自两者的错误不重叠:V4.1 Flash 的 34.52% 并不是 Astra 的 50.40% 的子集,两个模型答错的是不同的题。
oracle router 是理论上限,真实路由器抓不到全部 4.4 分。但它指向一个已经不算新的判断:模型能力参差不齐,没有任何一个模型在所有任务上都最优。与其押注单一最强模型,不如把简单任务分给便宜的那个,把难题升级上去。这项测试说明,路由的价值首先是提分,省钱是附带结果。
下面给出一段路由策略的伪代码,按任务类型和上下文长度决定调用哪个模型,并附上成本估算注释:
python
def route(task_type: str, context_tokens: int) -> str:
# 学术推理类任务:V4.1 Flash 在 HLE 上只有 34.52%,Astra 是 50.40%
if task_type == "academic_reasoning":
return "gpt-6-astra"
# 长上下文 Agent 编码任务:缓存命中率高,V4.1 Flash 成本优势最大
if task_type == "agent_coding" and context_tokens > 100_000:
return "deepseek-v4.1-flash"
短上下文编码任务:两者分数接近,优先便宜的 V4.1 Flash
if task_type == "agent_coding":
return "deepseek-v4.1-flash"
兜底:简单任务走便宜模型,难题升级到 Astra
return "deepseek-v4.1-flash" if is_simple(task) else "gpt-6-astra"
成本估算(Fireworks 单价,每百万 token):
DeepSeek V4.1 Flash:输入 $0.22,缓存读取 $0.007,输出 $0.66
GPT-6 Astra:输入 $10,输出 $50
一次 20 万 token 输入 + 2 千 token 输出的编码任务:
V4.1 Flash ≈ $0.045(缓存命中时更低),Astra ≈ $2.10,相差约 47 倍
06 和我们有什么关系
对开发 Agent 的人来说,账算得过来了。以前跑一次深度编码任务要花几美元,只能当演示;降到 0.43 美元后,它可以变成常驻后台的基础设施。15 次自主尝试的成本,等于过去 1 次。
同样的模型在不同人手里,账单能差好几倍。缓存命中的前提是上下文前缀稳定,Agent 的提示词结构、工具定义顺序、读取文件的方式都会影响命中率。把上下文写得更稳定,比换更便宜的模型省得更多。
对普通用户来说,这次变化发生在 API 侧,聊天窗口里体感很弱。间接影响是:开源权重模型的性价比被抬高之后,闭源厂商的定价空间会被持续压缩,最终反映到订阅价格和用量额度上。
十五倍的成本差,把一批原本算不过账的场景变得算得过账。接下来要看 V4.1 Pro:非对称架构放大到更大参数量之后,这套效率逻辑还成不成立。