1. 概述
这是《ALL IN AI》专栏的第三篇文章,想和大家聊聊近期国产模型的最新进展。坦白说,我原本没打算写这种偏资讯盘点的文章。单纯追踪模型更新,对个人能力提升的帮助其实比较有限。不过,最近两个月国产模型发展得很快,有些小伙伴可能因为工作忙,或者平时没有关注这个领域,错过了不少重要变化。更主要的原因是,下一篇我准备介绍 Claude Code 和 Codex 如何接入国产模型。在开始具体操作之前,有必要先把 DeepSeek、Kimi 和 GLM 最近发生了什么梳理清楚,也算是为后面的实操教程做个铺垫
最近一段时间,国产大模型的更新速度非常快:DeepSeek V4 Flash 0731 与 DeepSeek V4 Pro 0813 正式发布,Kimi K3 带着 2.8T 参数、原生视觉和 1M 上下文正式登场,曾经"抢都抢不到"的 GLM Coding Plan 也终于全面开放订阅。这些变化放在一起看,指向了一个越来越清晰的趋势:国产模型与海外头部模型之间的差距正在快速缩小,而且在价格、上下文长度和访问便利性等方面,已经形成了自己的竞争力。
本文聚焦三个问题:
- DeepSeek V4、Kimi K3 和 GLM 最近有哪些值得关注的变化?
- 国产模型与海外头部模型的差距到了什么程度?
- 为什么不能只凭一两次对话判断一个模型"聪不聪明"?
这里强调下本文不进行任何主观的模型"吊打榜"评测。涉及能力对比时,主要引用厂商官网公开数据和 Artificial Analysis 等第三方评测;涉及价格信息和对比时,以写此篇文章时间2026 年 8 月 14 日能够查到的官方资料为准。

2. 国产模型现在到底是什么水平了?
如果只看社交媒体,很容易在两个极端之间摇摆:一种声音认为国产模型已经全面超越海外模型;另一种声音则认为国产模型仍然只能处理简单任务。我觉得这两种观点都不够客观,认为国产模型还停留在初级水平的,大概率带有了强烈的主观色彩认为国产的就是没有外国的好(PS: 好多人会说华为手机就是没有苹果的好用~),实则不然,只有真正适合自己的才是最好用的。但反过来,说国产模型已经全面超越海外模型,同样有些过于自信,有点像国内某些媒体喜欢夸大事实,盲目吹嘘。Anthropic 和 OpenAI 目前仍然是 AI 领域的领头羊,在模型研发、算力投入、产品生态和工程能力等方面都有深厚积累,就那人家的算力和芯片GPU配置啥的来说,国内肯定是比不上的。所以我的判断很简单:从综合表现来看,国产模型目前还没有全面超过海外头部模型,但双方的差距确实正在快速缩小。
模型能力并不是一个单一数字。推理、知识、代码、视觉、工具调用、长上下文、生成速度和稳定性,都可能得出不同的排序。即使使用同一个模型,换一个 Agent、换一套工具、换一种 Prompt,结果也可能完全不同。
但有一点已经越来越难以否认:国产模型不再只是"便宜的小学生水平替代品"。
- DeepSeek V4 Pro 和 V4 Flash 都提供了 1M 上下文、思考模式和工具调用能力;
- Kimi K3 将规模扩展到 2.8T 参数,并同时覆盖长任务、知识工作和原生视觉;
- GLM-5.2 在第三方综合评测中进入开源权重模型第一梯队;
- 多家国产模型厂商开始主动适配 Claude Code、Codex、OpenCode 等 Agent 客户端;
- 模型价格、缓存价格和人民币充值方式,让高频使用的门槛与海外模型对比明显下降。
下面这张图先对三条产品线建立一个整体印象:

这里需要注意,参数规模、上下文长度和价格都不能直接等同于"聪明程度"。它们只能说明模型的产品定位和可用边界,真正的能力仍然需要结合具体任务与测试条件判断。
3. DeepSeek V4 Pro 与 V4 Flash
3.1 两个版本分别面向什么场景?
DeepSeek V4 分为 Pro 和 Flash 两个版本。当前官方 API 对应的正式版本分别是 DeepSeek-V4-Pro-0813 和 DeepSeek-V4-Flash-0731:
| 模型 | 总参数 / 激活参数 | 主要定位 | 上下文 | 最大输出 |
|---|---|---|---|---|
| DeepSeek V4 Pro | 1.6T / 49B | 复杂推理、长任务和更高交付质量 | 1M | 384K |
| DeepSeek V4 Flash | 284B / 13B | 更快响应、更高并发和更低成本 | 1M | 384K |
两者均支持:
- 非思考模式与思考模式;
high、max等推理强度;- Tool Calls;
- JSON 输出;
- 对话前缀续写;
- OpenAI 与 Anthropic 兼容接口。
DeepSeek 官方给出的定位很直观:V4 Pro 负责更困难、更长、更需要稳定推理的任务,V4 Flash 则在保留较强 Agent 能力的同时,把速度与成本压得更低。
这并不意味着所有复杂任务都必须用 Pro,也不意味着 Flash 只能完成简单任务。模型选择更适合根据任务风险、执行长度、延迟要求和预算动态决定。
3.2 V4 Flash 为什么受到关注?
V4 Flash 的关注度,一方面来自 Agent 能力,另一方面来自价格。
根据 DeepSeek 发布时披露的评测数据,V4 Flash 在 Terminal-Bench 2.1、DeepSWE、Toolathlon-Verified、DSBench-FullStack 等测试中取得了很有竞争力的成绩,部分项目超过了此前的 V4 Pro预留版本。不过,这类成绩首先代表特定模型版本在特定 Harness、推理档位和参数配置下的表现,不能直接推导出"Flash 在所有真实项目中都比 预览Pro版 强"。
真正值得注意的是:低价模型已经不再必然等于只会处理低难度任务。
3.3 DeepSeek V4 的价格
截至 2026 年 8 月 14 日,DeepSeek 当前执行的人民币价格如下:
| 每百万 Token | V4 Flash | V4 Pro |
|---|---|---|
| 缓存命中输入 | 0.02 元 | 0.025 元 |
| 缓存未命中输入 | 1 元 | 3 元 |
| 输出 | 2 元 | 6 元 |
| 账号并发上限 | 2500 | 500 |
这个价格结构里,最值得关注的是缓存命中输入。Agent 在处理长任务时会反复携带系统指令、历史消息和项目上下文,如果能够持续命中缓存,输入成本会明显下降。
当然,缓存是否命中不是由"上下文看起来差不多"决定的。会话切换、模型切换、推理档位变化或上下文重写,都可能让缓存失效。
需要特别注意:DeepSeek 已经公告将在 2026 年 8 月 17 日 00:00 启用新的峰谷价格。届时北京时间 9:00~12:00、14:00~18:00 为高峰时段,其余为空闲时段:
| 模型 | 时段 | 缓存命中输入 | 缓存未命中输入 | 输出 |
|---|---|---|---|---|
| V4 Flash | 空闲 | 0.05 元 | 1.5 元 | 4.5 元 |
| V4 Flash | 高峰 | 0.10 元 | 3 元 | 9 元 |
| V4 Pro | 空闲 | 0.15 元 | 4.5 元 | 13.5 元 |
| V4 Pro | 高峰 | 0.30 元 | 9 元 | 27 元 |
也就是说,"峰谷定价"并不等于在当前价格上简单打折。8 月 17 日之后,空闲价格是高峰价格的一半,但两个时段相较 8 月 14 日正在执行的价格都发生了变化。准备长期使用 API 的用户,应以调用当天的官方价格页为准。
4. Kimi K3:2.8T 参数、原生视觉与 1M 上下文
2026 年 7 月,Kimi 正式发布 Kimi K3。它被定位为面向长程任务、知识工作和复杂推理的旗舰模型。
K3 最显眼的几个数字是:
- 2.8T 总参数;
- 1M Token 上下文;
- 原生视觉理解;
- 支持
low、high、max推理强度; - 面向 Kimi Code、Claude Code、Codex 等 Agent 工作流;
- 已开放模型权重。
与纯文本模型相比,原生视觉让 K3 可以直接理解截图、图表、界面和包含图片的文档。对需要同时处理文字、页面和视觉信息的长任务来说,这是非常实用的能力。
4.1 长上下文不只是"能塞更多文字"
1M 上下文意味着模型一次可以接收更多需求、文档、代码、终端输出和历史记录。但"放得下"并不等于"用得好"。
长任务真正困难的地方包括:
- 经过很多轮操作后还能记住最初目标;
- 能从大量上下文中找到当前真正相关的信息;
- 不因为错误日志、重复输出挤占有效上下文;
- 在压缩会话后继续保持任务方向;
- 能根据测试或工具结果修正之前的计划。
Kimi 在 K3 中引入 Kimi Delta Attention 和 Attention Residuals,目的就是提高超长序列下的信息利用和计算效率。普通用户不必记住这些架构名词,只需要知道:K3 的产品重点不是单轮回答,而是让模型在更长、更复杂的任务中持续工作。
4.2 K3 与 K3-256k
Kimi Code 当前提供 k3 和 k3-256k 两个相关模型 ID:
| 模型 ID | 上下文 | 适用情况 |
|---|---|---|
k3 |
1M | 超长资料、超大项目和长时间任务 |
k3-256k |
256K | 日常问答、常规修改和更节省额度的任务 |
官方说明中,K3-256k 在 256K 范围内提供相同模型能力,但消耗的套餐额度更少。大多数日常任务未必需要直接使用 1M,上下文够用比数字最大更重要。
4.3 K3 的价格
Kimi 官方公布的 K3 API 价格为:
| 每百万 Token | Kimi K3 |
|---|---|
| 缓存命中输入 | 0.30 美元 |
| 缓存未命中输入 | 3.00 美元 |
| 输出 | 15.00 美元 |
K3 的单价明显高于 DeepSeek V4,但它提供原生视觉和更高的旗舰定位。是否值得使用,取决于任务是否真的需要这些能力。K3的收费不比Claude等顶级模型收费低哦~
5. GLM Coding Plan 终于全面开放订阅
GLM Coding Plan 此前最突出的问题不是贵,而是买不到。由于算力和供应限制,套餐曾长期处于限量状态,新用户即使愿意付费也未必能够订阅。现在这个问题终于解决了:GLM Coding Plan 已经全面开放,新老用户都可以直接订阅。
但随之而来的变化也很明显------价格上涨了。
5.1 新旧价格对比
| 套餐 | 旧版月费 | 新版连续包月 | 涨幅 |
|---|---|---|---|
| Lite | 49 元 | 118 元 | 约 141% |
| Pro | 149 元 | 538 元 | 约 261% |
| Max | 469 元 | 1078 元 | 约 130% |

单看月费,三个档位都不算便宜,Pro 的变化尤其明显。
新版套餐同时调整了用量计算方式。官方以 5 小时和每周资源池统计可用量,不同模型还会按照不同系数抵扣。GLM-5.2、GLM-5-Turbo 等高阶模型在高峰期和非高峰期的消耗不同,高峰期定义为每日 14:00~18:00(UTC+8)。
GLM Coding Plan 当前支持 GLM-5.2、GLM-5-Turbo 和 GLM-4.7,并提供视觉理解、联网搜索、网页读取和开源仓库等专属 MCP 能力。
所以这次全面开放的意义很明确: "想买但买不到"的问题解决了,但它已经不是一个看到价格就可以闭眼订阅的套餐。
轻度用户需要先估算自己的频率;重度使用 Claude Code、OpenCode 等 Agent 的用户,则可以结合每周额度、模型抵扣系数和高峰规则判断是否划算。
6. 国产模型与海外头部模型,差距还有多大?
讨论这个问题,最好先承认一个事实:不存在能够概括模型全部能力的单一分数。
为了让数据尽量可比,下面只选用 Artificial Analysis Intelligence Index v4.1.1。该指数综合 GDPval-AA v2、Terminal-Bench 2.1、SciCode、Humanity's Last Exam、GPQA Diamond 等九项评测。

图中使用的是各模型对应的高推理档位,具体档位已经直接标在模型名中。根据 2026 年 8 月 14 日能够查到的数据:
- Claude Fable 5(max,含 Opus 4.8 fallback)得分 60;
- GPT-5.6 Sol(max)得分 59;
- Kimi K3(max)得分 57;
- DeepSeek V4 Pro 0813(max)得分 53;
- DeepSeek V4 Flash 0731(max)得分 52;
- GLM-5.2(max)得分 51;
这组数据至少说明,国产模型已经能够进入同一张高水平能力图中比较。Kimi K3 与最高分的差距只有 3 分,刚更新的 DeepSeek V4 Pro 0813 和 V4 Flash 0731 也已经进入 50 分以上区间。
但这张图不能说明如下轮到:
- Kimi K3 在所有场景任务中都强的可怕了;
- GLM-5.2 一定比 DeepSeek V4 Pro 更适合你的工作;
- 得分低几分的模型就无法完成复杂任务;
- 模型价格、速度、视觉能力和上下文管理不重要。
此外,厂商发布页中的模型成绩可能使用不同 Agent Harness。Kimi K3 可能搭配 Kimi Code,Claude 模型可能搭配 Claude Code,GPT 模型可能搭配 Codex。Harness 会决定模型能够使用哪些工具、怎样管理上下文、如何回传执行结果,因此它本身就是最终成绩的一部分。
再来看一张对比图:

这是最近流行一个很形象的说法------"大模型斩杀线"。
如果把 Artificial Analysis Intelligence Index 50 分看作较强模型的能力门槛,再把单任务成本 0.03 美元作为价格参考线,那么 DeepSeek V4 Flash 几乎落在了两条线的交点上。它的综合分数未必最高,但在达到同一能力区间的模型中,成本低得非常突出。
更准确的结论应该是:国产模型与海外头部模型仍有差异,但差距已经没有很多人想象中那么大;在一些测试和使用维度上,国产模型已经具备领先或接近领先的表现。
7. 模型好不好,为什么不能只看个人感觉?
"这个模型变笨了。"
"那个模型写代码不行。"
"我试了一次,完全没法用。"
这些体验都是真实的,但它们通常不足以成为对模型整体能力的判断。
同一个任务的结果至少受到以下因素影响:
- 任务是否说清楚:目标、边界、输入和验收标准是否完整;
- 上下文是否足够:模型有没有看到真正需要的文件和信息;
- 工具是否合适:Agent 能否读取文件、执行命令、联网或查看图片;
- 推理预算是否匹配:简单任务开最高档会浪费成本,复杂任务预算太低又可能草率结束;
- 执行过程是否可验证:有没有测试、数据或明确标准告诉模型哪里做错了;
- 模型本身是否适合任务:不同模型确实有不同的能力侧重。
Prompt 写得不好,当然可能让模型表现得不够聪明。比如只说一句"帮我优化一下",模型并不知道要优化速度、成本、结构还是表达,也不知道什么结果才算完成。
但也不能把所有失败都归咎于用户不会写 Prompt。也有可能模型能力不行,导致理解错误、遗忘目标、错误调用工具、产生幻觉,或者根本不具备任务所需的视觉和知识能力。
比较稳妥的判断方式是:
先看来源清楚的公开评测,再让不同模型完成同一个真实任务,最后结合质量、速度、稳定性和账单做选择。
模型的好坏不由某个人的一句话决定,但真实任务中的可复现结果,仍然比营销口号更重要。
8. 总结
DeepSeek V4、Kimi K3 和 GLM Coding Plan 的近期变化,说明国产模型正在进入一个新的阶段。
从公开数据看,国产模型与海外头部模型仍然各有强项,但差距已经明显缩小:
- Kimi K3 在部分第三方综合指标中进入全球第一梯队;
- GLM-5.2 成为很有竞争力的开源权重模型;
- DeepSeek V4 Pro 提供复杂任务能力与很低的调用成本;
- DeepSeek V4 Flash 则进一步降低了高频任务的价格门槛。
模型好不好,既不能只听厂商发布会,也不能只凭某个人的一次体验。Prompt、工具、上下文和任务验证都会影响结果,模型本身的能力边界也同样客观存在。
对普通用户来说,更有价值的问题不是"谁才是唯一最强模型",而是:
在自己的使用场景和预算内,哪个模型能高效稳定完成真实任务?