大模型测评:从最新出的DeepSeekV4.1模型看这19项指标

一张成绩单上 19 门"考试",全看懂没必要。这篇文章把它们分成三类、三层,告诉你哪 5 个必须懂、哪 6 个要学会读、剩下 7 个按需看------以及比记指标更重要的两条"读数心法"。读完你会发现:19 项指标,其实只需要记住 5 个,再加两个心眼。

核心分数速览


00 先认识这张成绩单

DeepSeek-V4.1-Flash 发布时,官方放出了一张对比图:7 个模型、19 项指标、全部是"Agentic Benchmark"(智能体能力基准)。7 个模型分别是 DeepSeek-V4.1-Flash、DeepSeek-V4-Pro、DeepSeek-V4-Flash-0731、GLM-5.3、Kimi-K3、GPT 5.6-Sol、Claude Opus 5------既有自己家的三代同堂,也有市面上最顶尖的对手。

这里要先解释一个词:Agentic Benchmark 测的不是"会不会答题",而是"能不能干活"。传统大模型测评(比如问百科知识、做阅读理解)考的是"脑子",而这一张表考的是"手脚"------让模型操作电脑、写代码、攻防演练、完成一串真实任务。它更接近"把 AI 当员工用"的真实场景,也是这两年大模型竞争的主战场。

看懂这张表,先要学会 3 个记号:

记号 含义 例子
* 这个分数只在 HLE 评测集的纯文本子集上测过,不是全量成绩 DeepSeek 的 39.1*、GLM 的 42.0*
w/tools 允许模型调用工具(开卷考);没有它则闭卷 HLE 36.8 → HLE (w/tools) 63.9
Rating 段位分(Elo 评分),不是百分制 Codeforces 3471,跟 90.9 不是一个单位

记住这三个记号,后面所有指标都不会读错。

01 一张成绩单,19 门"考试"

DeepSeek-V4.1-Flash 的这张对比图,本质是一份 AI 全身体检报告。19 项指标就是 19 个检查项目:有查智商的,有查"上手干活"的,有查"会不会闯祸"的,还有一项查"编程竞技段位"的。

19 项指标到底在测什么?一张总表看懂全貌(得分列取 DeepSeek-V4.1-Flash)

指标 类别 测什么 怎么考 得分
GPQA Diamond 考脑子 研究生级科学问答 多选题,题目防搜索引擎 90.9
HLE 考脑子 人类最难公开题集 2000 多道众筹难题 36.8
MathArena Apex 考脑子 数学竞技 竞赛级数学题 65.6
Terminal-Bench 2.1 考干活 终端命令行操作 真实终端执行任务 90.6
Terminal-Bench 3.0 考干活 终端操作(更真实) 更贴近真实环境 30.0
Terminal-Bench 4.0 考干活 终端操作(最新) 最新难度版本 31.2
DeepSWE v1.1 考干活 真实软件工程 改真实仓库的真实 issue 74.2
ProgramBench 考干活 程序编写 按需求写函数 20.3
NL2Repo-Bench 考干活 自然语言生成仓库 一句话生成整个代码库 65.4
Automation-Bench 考干活 自动化任务 自主完成多步骤流程 54.8
Agents' Last Exam 考干活 Agent 终极考试 最难的 Agent 任务 31.8
CyberGym 考安全 网络安全攻防 攻防演练环境 88.1
SEC-Bench Pro 考安全 安全评测 综合安全能力 62.8
ExploitGym 考安全 漏洞利用 生成可利用漏洞 15.3
HLE (w/tools) 考安全/工具 开卷版 HLE 允许调用工具作答 63.9
Chartography (w/tools) 考视觉 图表生成与解读 视觉+工具 78.9
BabyVision (w/tools) 考视觉 视觉推理 图像理解+工具 89.6
ZeroBench-main (w/tools) 考视觉 视觉基准 零样本视觉任务+工具 49.0
Codeforces (Rating) 特殊项 编程竞技水平 Elo 段位分 3471

一眼看下来,分数从 90 到 15 都有------同样是"大模型评测",不同指标差的不是一点半点。所以问题不是"考了多少分",而是这些分数各自意味着什么

把 18 项百分制指标排开(Codeforces 段位分未纳入):

指标 得分 指标 得分
GPQA Diamond 90.9 CyberGym 88.1
HLE 36.8(纯文本 39.1*) SEC-Bench Pro 62.8
MathArena Apex 65.6 ExploitGym 15.3
Terminal-Bench 2.1 90.6 HLE (w/tools) 63.9
Terminal-Bench 3.0 30.0 Automation-Bench 54.8
Terminal-Bench 4.0 31.2 Agents' Last Exam 31.8
DeepSWE v1.1 74.2 Chartography (w/tools) 78.9
ProgramBench 20.3 BabyVision (w/tools) 89.6
NL2Repo-Bench 65.4 ZeroBench-main (w/tools) 49.0

02 先分成三类:考脑子、考干活、考安全

19 项看着吓人,按"考什么"分三类就清晰了。三类分别回答三个问题:它会不会思考?能不能替你干活?会不会闯祸、看不看得懂图?

类别 回答的问题 包含指标 看这一类时的要点
考脑子 · 知识/推理/数学 它会不会思考 GPQA Diamond、HLE、MathArena Apex 分数代表"聪明上限",最难刷分,最防背题
考干活 · Agent/代码/终端 能不能替你干活 Terminal-Bench 2.1/3.0/4.0、DeepSWE、ProgramBench、NL2Repo-Bench、Automation-Bench、Agents' Last Exam 分数代表"真实生产力",和你的实际使用场景最相关
考安全与多模态 · 风险/视觉 会不会闯祸 + 看不看得懂图 CyberGym、SEC-Bench Pro、ExploitGym、Chartography、BabyVision、ZeroBench、HLE (w/tools) 安全类分数要"反着看":能力越强越要配护栏
特殊项 · 段位分 编程竞技水平 Codeforces (Rating) Elo 段位分,只跟同类 Rating 比

记住每个类的"代表选手"就够了:考脑子看 HLE (最难),考干活看 Terminal-Bench 3.0 (最真实),考安全看 CyberGym(攻防最直接)。

一个更本质的读法:三类对应三种"用人方式"。考脑子,相当于看一个人学历高不高;考干活,相当于试用期看他能不能把活干出来;考安全,相当于看这个人放不放心把钥匙交给他。一个模型三类分数都高,才是真正的全才------但现实中几乎没有模型能同时做到,所以看的时候要按你的用途取舍。

03 第一梯队:5 个必懂

如果时间只够搞懂 5 个,就是下面这 5 个------它们分别回答"聪不聪明、干活行不行、安不安全"三件事。

3.1 GPQA Diamond · 90.9 ------ "研究生入学考试"

考什么: 研究生级别的科学问答,覆盖物理、化学、生物等多个学科。

怎么考: 全是选择题,但题目故意设计成"上网都搜不到答案"(这就是名字里 "Google-Proof" 的意思)------背题、检索都帮不上忙,只能靠真实理解。

分数怎么看: 90.9 说明知识底子非常扎实。但要注意:顶尖模型普遍在 93--94 分,大家都不低。它的真正价值是筛掉差的,而不是区分顶尖的------就像研究生考试,能筛掉没读过书的人,但考 95 和考 98 的人差距没那么大。

常见误区: 看到 90.9 就说"知识能力超过 Claude/GPT"------错。这张表上 GPT 5.6-Sol 是 94.1、Claude Opus 5 是 93.4,DeepSeek 是 90.9,差距在 2--3 分,属于"同一梯队,略有差距"。

3.2 HLE · 36.8(纯文本子集 39.1*)------ "人类终极高考"

考什么: HLE(Humanity's Last Exam,人类最后一考)是全网众筹出来的最难公开题集,2000 多道题横跨所有学科,号称"给超人 AI 准备的期末考试"。

怎么考: 闭卷、不调用工具,硬答。题目的设计原则就是"让最聪明的人都觉得难"。

分数怎么看: 顶尖模型也只有 40 分上下。36.8 不是"差"------这个基准存在的意义就是拉开差距。看它别问"考了多少分",要问"离天花板还有多远"。

一个细节: 39.1* 是只在纯文本子集上测的成绩(带 * 号),和全量 HLE 的 36.8 不是同一口径。表格里 GLM 的 42.0* 同理------带 * 的数字不能直接和全量分数比

3.3 Terminal-Bench 3.0 / 4.0 · 30.0 / 31.2 ------ "让 AI 坐进工位,操作一台真的电脑"

考什么: 终端(命令行)操作能力。不是选择题,而是让模型坐到一台真实的电脑前,通过敲命令完成任务------装环境、改配置、跑脚本、排查问题。

怎么考: 给它一个真实的任务描述,看它能不能在终端里一步步完成。3.0 比 2.1 更贴近真实环境,4.0 又更难。

分数怎么看: 30.0 / 31.2,跟 2.1 版的 90.6 形成巨大反差。这不是 DeepSeek 变笨了,而是卷子改难了 ------这个反差本身就是最好的教材。分数低恰恰是最真实的写照:会聊天,不等于会干活。做 Agent 型产品,这是最该盯的指标。

横向比: 这张表上 Claude Opus 5 是 43.3、GPT 5.6-Sol 是 34.4,DeepSeek 是 30.0------在"真刀真枪的终端干活"这件事上,大家都不算高,说明这个方向还有巨大的提升空间。

3.4 DeepSWE v1.1 · 74.2 ------ "真实程序员入职考试"

考什么: 真实软件工程能力。给它一个真实开源仓库里的真实 issue,让它把代码改对、把测试跑通,再判断补丁能不能被接受。

怎么考: 比"写一道算法题"难得多------要先读懂整个项目、定位问题、修改代码、保证不破坏其他功能。

分数怎么看: 74.2 属于生产力指标,大致可以换算成"能替你完成多少真实的软件任务"。在这张表的"干活类"指标里,它是 DeepSeek 最拿得出手的一项(比 Claude 74.0、GPT 73.0 还略高)。

为什么值得懂: 代码能力是大模型落地价值最高的场景之一。DeepSWE 测的不是"会不会写",而是"能不能交付"------这是工程师最关心的。

3.5 CyberGym · 88.1 ------ "安全攻防场 + 危险品仓库"

考什么: 网络安全攻防能力。在模拟的攻防环境里,看模型能不能完成防守和进攻两类任务。

怎么考: 类似"红蓝对抗":防守是发现和修复漏洞,进攻是找到可利用的弱点。

分数怎么看: 88.1 是高分。但安全指标要两面读 :能力强是本事,说明模型对安全的理解深入;但越会攻防,越要配好护栏------做发布评估时的必看项。别只把它当"分数"看,要当"风险敞口"看。

横向比: GPT 和 Claude 都是 84.5,Kimi 是 80.0------DeepSeek 在这一项上反而是领先的。

图 2|5 个必懂指标上的五模型对比(数值照原图读取;GLM 的 HLE 42.0* 为纯文本子集成绩)

指标 DeepSeek-V4.1-Flash Kimi-K3 GLM-5.3 Claude Opus 5 GPT 5.6-Sol
GPQA Diamond 90.9 92.9 88.1 93.4 94.1
HLE 36.8 43.5 42.0* 56.3 44.5
Terminal-Bench 3.0 30.0 17.7 28.3 43.3 34.4
DeepSWE v1.1 74.2 67.5 66.9 74.0 73.0
CyberGym 88.1 80.0 84.5 84.5 84.5

两个观察:Claude Opus 5 在 HLE、Terminal-Bench 3.0 上明显领先;而 DeepSeek-V4.1-Flash 在 DeepSWE、CyberGym 上并不落下风。单个指标不能定胜负,但"谁在哪类任务上强"一下子就看出来了------这也说明:没有一个模型是全能的,选型要看你的业务最吃哪类能力。

04 第二梯队:6 个应懂

为什么叫"应懂"?因为它们要么单位特殊容易读错 ,要么补全安全与泛化的画像------不会读,就可能得出错误结论。

  • Codeforces (Rating) · 3471 ------ 段位分,不是百分制。 千万别拿 3471 和 90.9 比大小------它相当于"编程竞技场的围棋段位",只能和同类的 Rating 比。Codeforces 是顶级编程竞赛平台,3471 意味着已经站在全球最顶尖的竞技选手里(很多职业选手都到不了这个段位)。
  • HLE (w/tools) · 63.9 ------ "开卷考"对照。 跟闭卷 HLE(36.8)放在一起看,差值 27 分就是"工具带来的增益"------允许查资料、跑代码之后,分数几乎翻倍。工具调用本身是一种能力,w/tools 就是专门测它的。以后看到任何带 w/tools 的指标,都先问一句:不开卷多少分?
  • MathArena Apex · 65.6 ------ 数学竞技场。 考硬推理,和 HLE 互为补充:一个考广度,一个考深度。做数学、科研、金融类产品,这一项优先级要上调。
  • SEC-Bench Pro · 62.8 / ExploitGym · 15.3 ------ 安全风险的两块拼图。 SEC-Bench Pro 测综合安全能力,ExploitGym 专测漏洞利用。注意 ExploitGym 分数低在这里是好事 (风险更低)------它是"少闯祸"指标,不是"能力强"指标,方向别读反。一个模型 ExploitGym 得 90 分,不是值得骄傲,而是需要警惕。
  • Automation-Bench · 54.8 ------ Agent 泛化。 测 Agent 能不能自己完成一串自动化任务。和 Terminal-Bench 的区别:一个在终端里干,一个在多步骤流程里干(比如"订机票→订酒店→做行程表"这种长链条任务)。

05 第三梯队:7 个按需看

不是不重要,而是只在特定场景才需要关心。看你的用途,按需取用。

  • Terminal-Bench 2.1 · 90.6 ------ 旧版卷子,已经"考不出差距"(饱和)。 当历史参考即可------这也是"指标饱和"的活教材:一个基准如果顶尖模型都考到 90 分以上,它就不再能区分模型了。
  • ProgramBench · 20.3 / NL2Repo-Bench · 65.4 ------ 代码生成的两个细分赛道。 ProgramBench 考"按需求写函数"(20.3 偏低,说明复杂程序生成还吃力);NL2Repo 考"一句话生成整个代码仓库"(65.4)。做代码助手类产品再看它们。
  • Agents' Last Exam · 31.8 ------ Agent 版"终极高考"。 和 HLE 对应:HLE 考脑子的上限,它考 Agent 干活的上限。31.8 说明离"全能 Agent"还远,看它是为了知道边界在哪。
  • Chartography · 78.9 / BabyVision · 89.6 / ZeroBench-main · 49.0 ------ 多模态/视觉场景才看。 三个都带 w/tools(允许用工具):Chartography 考图表生成与解读,BabyVision 考图像理解,ZeroBench 考零样本视觉任务。做"看图/做图"类产品时,这几项是你的主战场。

06 两条读数心法(比记指标更重要)

指标记不住没关系,记住这两条,任何测评都不会读错。

心法一 · 比分数之前,先比版本难度

Terminal-Bench 2.1 → 3.0:90.6 → 30.0 。同一族基准,卷子一改难,分数直接跳水 60 分。90 分和 30 分说的根本不是一回事------看榜单先确认版本号,别被"高分"骗了。同理,MMLU 老版和 MMLU-Pro、HLE 和旧基准之间,都是"卷子难度"在变,不是模型能力在变。

图 3a|三个模型在 Terminal-Bench 2.1 / 3.0 / 4.0 上的"跳水"(数值照原图读取)

版本 DeepSeek-V4.1-Flash GPT 5.6-Sol Claude Opus 5
Terminal-Bench 2.1 90.6 88.8 89.1
Terminal-Bench 3.0 30.0 34.4 43.3
Terminal-Bench 4.0 31.2 39.9 51.8

三个模型一起"跳水",说明不是某个模型的问题,而是版本难度整体抬升。所以跨版本比分数,就像拿今年的高考题和去年的比------题目变了,分数不可比。

心法二 · 看清"开卷考"还是"闭卷考"

HLE 36.8 → HLE (w/tools) 63.9:多了工具,涨了 27 分。"w/tools" 行测的是"给工具后能涨多少",跟不带工具的分数是两码事,混着比就错了。

图 3b|各模型 HLE 闭卷 vs 开卷(GPT 5.6-Sol 的 w/tools 未公布;数值照原图读取)

模型 HLE(闭卷) HLE (w/tools)(开卷) 工具增益
DeepSeek-V4.1-Flash 36.8 63.9 +27.1
Kimi-K3 43.5 59.8 +16.3
GLM-5.3 42.0* 62.5 +20.5
Claude Opus 5 56.3 63.6 +7.3
GPT 5.6-Sol 44.5 --- ---

这张表还藏着第二个信息:闭卷越强的模型,工具增益反而越小 (Claude 闭卷最高、增益最小)。这说明"基础能力强"和"会用工具"是两种不同的能力,开卷分数拉平了基础差距。如果你的产品会给模型配工具,看 w/tools 那一列;如果不配,看闭卷那列。

附:四个常见错误读法(防坑清单)

  1. 拿 Rating 和百分制比大小 ------ 3471 不是"3471%",跨单位比较毫无意义。
  2. 把带 * 的成绩当全量成绩 ------ 纯文本子集 ≠ 全量,口径不一致。
  3. 跨版本比分数 ------ Terminal-Bench 2.1 的 90 和 3.0 的 30 不是一个难度。
  4. 单指标定胜负 ------ "某个指标比我高"不等于"模型比我强",看组合、看分项、看你的场景。

07 总结:一张图看懂 DeepSeek-V4.1-Flash

把 19 项里最典型的 10 项按"强 / 弱"排开,这个模型的画像就出来了:

图 4|DeepSeek-V4.1-Flash 强弱画像(数值照原图读取)

相对偏弱 得分 相对偏强 得分
ExploitGym 15.3 Chartography 78.9
ProgramBench 20.3 CyberGym 88.1
Terminal-Bench 3.0 30.0 BabyVision 89.6
Terminal-Bench 4.0 31.2 Terminal-Bench 2.1 90.6
Agents' Last Exam 31.8 GPQA Diamond 90.9

三句话总结

08 附:不同场景,重点看哪些指标(实操速查)

同样的 19 项,不同用途的人应该看不同的组合:

你的场景 重点看 一句话理由
通用模型选型 GPQA Diamond + HLE + Codeforces + DeepSWE + CyberGym 推理、代码、安全三件套,覆盖基本面
做 Agent 产品 Terminal-Bench 3.0/4.0 + Automation-Bench + Agents' Last Exam 直接对应"能不能替你干活"
做代码类产品 DeepSWE + ProgramBench + NL2Repo + Codeforces 真实工程 + 生成 + 竞技段位
做安全/风控/发布评估 CyberGym + SEC-Bench Pro + ExploitGym 能力与风险双线并行,ExploitGym 越高越要警惕
做多模态/视觉产品 BabyVision + Chartography + ZeroBench 视觉推理、图表、零样本三大件
内部版本回归 与你业务相关的 3--5 项 + 固定版本号 防止"卷子变了"导致误判

最后一条建议: 与其盯着 19 项全看,不如锁定 5 个核心指标 + 固定版本号 + 固定评测设置,做你自己的长期跟踪表 。分数本身没有意义,趋势和相对位置才有意义------这才是测评的最终目的。


附注

  • * 表示仅在 HLE 评测集的纯文本子集上进行了测试(图片底部注释)。
  • "w/tools" = 允许模型调用工具作答。
  • 全部数值直接读取自原图《DeepSeek-V4.1-Flash 与主流前沿模型在 Agentic Benchmark 上的性能对比》(用户提供,2026 年 9 月);Codeforces 为 Elo 段位分,未纳入百分制图表。
  • 各基准的难度与定义以官方文档为准;本文为科普向梳理。
    #(注:内容由AI生成)
相关推荐
墨心@2 小时前
《AI Agent 入门》
agent·智能体·datawhale共学
橘色的喵2 小时前
Codex CLI 状态栏配置指南
codex
whyfail2 小时前
开发平替实录:ZCode + 火山 Coding Plan + GLM-5.3-Flash,打不过 GPT-5.6-Sol,但只差一口气的成本
gpt·codex·glm·智谱·zcode
Caroline5162 小时前
GPT Image 2.5 原生透明背景实测:跨境素材流程中抠图环节的替代与边界
chatgpt·gpt image 2.5·跨境素材
znnnk2 小时前
【AI应用】Agent:AI 为什么需要“自主决策”?
ai·prompt·agent·workflow·ai应用·skill·mcp
星栈2 小时前
ADK-Rust 是什么?Rust 生态新一代 AI Agent 开发套件
后端·agent
江畔柳前堤3 小时前
On-Policy Distillation 全景深潜
人工智能·网络协议·目标检测·http·机器学习·chatgpt·重构
武子康3 小时前
小智首批设备怎样放量?从接入名单到故障后的恢复决定
人工智能·llm·agent