国产模型越来越强了:DeepSeek V4、Kimi K3 与 GLM 最新进展

1. 概述

这是《ALL IN AI》专栏的第三篇文章,想和大家聊聊近期国产模型的最新进展。坦白说,我原本没打算写这种偏资讯盘点的文章。单纯追踪模型更新,对个人能力提升的帮助其实比较有限。不过,最近两个月国产模型发展得很快,有些小伙伴可能因为工作忙,或者平时没有关注这个领域,错过了不少重要变化。更主要的原因是,下一篇我准备介绍 Claude Code 和 Codex 如何接入国产模型。在开始具体操作之前,有必要先把 DeepSeek、Kimi 和 GLM 最近发生了什么梳理清楚,也算是为后面的实操教程做个铺垫

最近一段时间,国产大模型的更新速度非常快:DeepSeek V4 Flash 0731 与 DeepSeek V4 Pro 0813 正式发布,Kimi K3 带着 2.8T 参数、原生视觉和 1M 上下文正式登场,曾经"抢都抢不到"的 GLM Coding Plan 也终于全面开放订阅。这些变化放在一起看,指向了一个越来越清晰的趋势:国产模型与海外头部模型之间的差距正在快速缩小,而且在价格、上下文长度和访问便利性等方面,已经形成了自己的竞争力。

本文聚焦三个问题:

  • DeepSeek V4、Kimi K3 和 GLM 最近有哪些值得关注的变化?
  • 国产模型与海外头部模型的差距到了什么程度?
  • 为什么不能只凭一两次对话判断一个模型"聪不聪明"?

这里强调下本文不进行任何主观的模型"吊打榜"评测。涉及能力对比时,主要引用厂商官网公开数据和 Artificial Analysis 等第三方评测;涉及价格信息和对比时,以写此篇文章时间2026 年 8 月 14 日能够查到的官方资料为准。

2. 国产模型现在到底是什么水平了?

如果只看社交媒体,很容易在两个极端之间摇摆:一种声音认为国产模型已经全面超越海外模型;另一种声音则认为国产模型仍然只能处理简单任务。我觉得这两种观点都不够客观,认为国产模型还停留在初级水平的,大概率带有了强烈的主观色彩认为国产的就是没有外国的好(PS: 好多人会说华为手机就是没有苹果的好用~),实则不然,只有真正适合自己的才是最好用的。但反过来,说国产模型已经全面超越海外模型,同样有些过于自信,有点像国内某些媒体喜欢夸大事实,盲目吹嘘。Anthropic 和 OpenAI 目前仍然是 AI 领域的领头羊,在模型研发、算力投入、产品生态和工程能力等方面都有深厚积累,就那人家的算力和芯片GPU配置啥的来说,国内肯定是比不上的。所以我的判断很简单:从综合表现来看,国产模型目前还没有全面超过海外头部模型,但双方的差距确实正在快速缩小。

模型能力并不是一个单一数字。推理、知识、代码、视觉、工具调用、长上下文、生成速度和稳定性,都可能得出不同的排序。即使使用同一个模型,换一个 Agent、换一套工具、换一种 Prompt,结果也可能完全不同。

但有一点已经越来越难以否认:国产模型不再只是"便宜的小学生水平替代品"。

  • DeepSeek V4 Pro 和 V4 Flash 都提供了 1M 上下文、思考模式和工具调用能力;
  • Kimi K3 将规模扩展到 2.8T 参数,并同时覆盖长任务、知识工作和原生视觉;
  • GLM-5.2 在第三方综合评测中进入开源权重模型第一梯队;
  • 多家国产模型厂商开始主动适配 Claude Code、Codex、OpenCode 等 Agent 客户端;
  • 模型价格、缓存价格和人民币充值方式,让高频使用的门槛与海外模型对比明显下降。

下面这张图先对三条产品线建立一个整体印象:

这里需要注意,参数规模、上下文长度和价格都不能直接等同于"聪明程度"。它们只能说明模型的产品定位和可用边界,真正的能力仍然需要结合具体任务与测试条件判断。

3. DeepSeek V4 Pro 与 V4 Flash

3.1 两个版本分别面向什么场景?

DeepSeek V4 分为 Pro 和 Flash 两个版本。当前官方 API 对应的正式版本分别是 DeepSeek-V4-Pro-0813DeepSeek-V4-Flash-0731

模型 总参数 / 激活参数 主要定位 上下文 最大输出
DeepSeek V4 Pro 1.6T / 49B 复杂推理、长任务和更高交付质量 1M 384K
DeepSeek V4 Flash 284B / 13B 更快响应、更高并发和更低成本 1M 384K

两者均支持:

  • 非思考模式与思考模式;
  • highmax 等推理强度;
  • Tool Calls;
  • JSON 输出;
  • 对话前缀续写;
  • OpenAI 与 Anthropic 兼容接口。

DeepSeek 官方给出的定位很直观:V4 Pro 负责更困难、更长、更需要稳定推理的任务,V4 Flash 则在保留较强 Agent 能力的同时,把速度与成本压得更低。

这并不意味着所有复杂任务都必须用 Pro,也不意味着 Flash 只能完成简单任务。模型选择更适合根据任务风险、执行长度、延迟要求和预算动态决定。

3.2 V4 Flash 为什么受到关注?

V4 Flash 的关注度,一方面来自 Agent 能力,另一方面来自价格。

根据 DeepSeek 发布时披露的评测数据,V4 Flash 在 Terminal-Bench 2.1、DeepSWE、Toolathlon-Verified、DSBench-FullStack 等测试中取得了很有竞争力的成绩,部分项目超过了此前的 V4 Pro预留版本。不过,这类成绩首先代表特定模型版本在特定 Harness、推理档位和参数配置下的表现,不能直接推导出"Flash 在所有真实项目中都比 预览Pro版 强"。

真正值得注意的是:低价模型已经不再必然等于只会处理低难度任务。

3.3 DeepSeek V4 的价格

截至 2026 年 8 月 14 日,DeepSeek 当前执行的人民币价格如下:

每百万 Token V4 Flash V4 Pro
缓存命中输入 0.02 元 0.025 元
缓存未命中输入 1 元 3 元
输出 2 元 6 元
账号并发上限 2500 500

这个价格结构里,最值得关注的是缓存命中输入。Agent 在处理长任务时会反复携带系统指令、历史消息和项目上下文,如果能够持续命中缓存,输入成本会明显下降。

当然,缓存是否命中不是由"上下文看起来差不多"决定的。会话切换、模型切换、推理档位变化或上下文重写,都可能让缓存失效。

需要特别注意:DeepSeek 已经公告将在 2026 年 8 月 17 日 00:00 启用新的峰谷价格。届时北京时间 9:00~12:00、14:00~18:00 为高峰时段,其余为空闲时段:

模型 时段 缓存命中输入 缓存未命中输入 输出
V4 Flash 空闲 0.05 元 1.5 元 4.5 元
V4 Flash 高峰 0.10 元 3 元 9 元
V4 Pro 空闲 0.15 元 4.5 元 13.5 元
V4 Pro 高峰 0.30 元 9 元 27 元

也就是说,"峰谷定价"并不等于在当前价格上简单打折。8 月 17 日之后,空闲价格是高峰价格的一半,但两个时段相较 8 月 14 日正在执行的价格都发生了变化。准备长期使用 API 的用户,应以调用当天的官方价格页为准。

4. Kimi K3:2.8T 参数、原生视觉与 1M 上下文

2026 年 7 月,Kimi 正式发布 Kimi K3。它被定位为面向长程任务、知识工作和复杂推理的旗舰模型。

K3 最显眼的几个数字是:

  • 2.8T 总参数;
  • 1M Token 上下文;
  • 原生视觉理解;
  • 支持 lowhighmax 推理强度;
  • 面向 Kimi Code、Claude Code、Codex 等 Agent 工作流;
  • 已开放模型权重。

与纯文本模型相比,原生视觉让 K3 可以直接理解截图、图表、界面和包含图片的文档。对需要同时处理文字、页面和视觉信息的长任务来说,这是非常实用的能力。

4.1 长上下文不只是"能塞更多文字"

1M 上下文意味着模型一次可以接收更多需求、文档、代码、终端输出和历史记录。但"放得下"并不等于"用得好"。

长任务真正困难的地方包括:

  • 经过很多轮操作后还能记住最初目标;
  • 能从大量上下文中找到当前真正相关的信息;
  • 不因为错误日志、重复输出挤占有效上下文;
  • 在压缩会话后继续保持任务方向;
  • 能根据测试或工具结果修正之前的计划。

Kimi 在 K3 中引入 Kimi Delta Attention 和 Attention Residuals,目的就是提高超长序列下的信息利用和计算效率。普通用户不必记住这些架构名词,只需要知道:K3 的产品重点不是单轮回答,而是让模型在更长、更复杂的任务中持续工作。

4.2 K3 与 K3-256k

Kimi Code 当前提供 k3k3-256k 两个相关模型 ID:

模型 ID 上下文 适用情况
k3 1M 超长资料、超大项目和长时间任务
k3-256k 256K 日常问答、常规修改和更节省额度的任务

官方说明中,K3-256k 在 256K 范围内提供相同模型能力,但消耗的套餐额度更少。大多数日常任务未必需要直接使用 1M,上下文够用比数字最大更重要。

4.3 K3 的价格

Kimi 官方公布的 K3 API 价格为:

每百万 Token Kimi K3
缓存命中输入 0.30 美元
缓存未命中输入 3.00 美元
输出 15.00 美元

K3 的单价明显高于 DeepSeek V4,但它提供原生视觉和更高的旗舰定位。是否值得使用,取决于任务是否真的需要这些能力。K3的收费不比Claude等顶级模型收费低哦~

5. GLM Coding Plan 终于全面开放订阅

GLM Coding Plan 此前最突出的问题不是贵,而是买不到。由于算力和供应限制,套餐曾长期处于限量状态,新用户即使愿意付费也未必能够订阅。现在这个问题终于解决了:GLM Coding Plan 已经全面开放,新老用户都可以直接订阅。

但随之而来的变化也很明显------价格上涨了。

5.1 新旧价格对比

套餐 旧版月费 新版连续包月 涨幅
Lite 49 元 118 元 约 141%
Pro 149 元 538 元 约 261%
Max 469 元 1078 元 约 130%

单看月费,三个档位都不算便宜,Pro 的变化尤其明显。

新版套餐同时调整了用量计算方式。官方以 5 小时和每周资源池统计可用量,不同模型还会按照不同系数抵扣。GLM-5.2、GLM-5-Turbo 等高阶模型在高峰期和非高峰期的消耗不同,高峰期定义为每日 14:00~18:00(UTC+8)。

GLM Coding Plan 当前支持 GLM-5.2、GLM-5-Turbo 和 GLM-4.7,并提供视觉理解、联网搜索、网页读取和开源仓库等专属 MCP 能力。

所以这次全面开放的意义很明确: "想买但买不到"的问题解决了,但它已经不是一个看到价格就可以闭眼订阅的套餐。

轻度用户需要先估算自己的频率;重度使用 Claude Code、OpenCode 等 Agent 的用户,则可以结合每周额度、模型抵扣系数和高峰规则判断是否划算。

6. 国产模型与海外头部模型,差距还有多大?

讨论这个问题,最好先承认一个事实:不存在能够概括模型全部能力的单一分数。

为了让数据尽量可比,下面只选用 Artificial Analysis Intelligence Index v4.1.1。该指数综合 GDPval-AA v2、Terminal-Bench 2.1、SciCode、Humanity's Last Exam、GPQA Diamond 等九项评测。

图中使用的是各模型对应的高推理档位,具体档位已经直接标在模型名中。根据 2026 年 8 月 14 日能够查到的数据:

  • Claude Fable 5(max,含 Opus 4.8 fallback)得分 60;
  • GPT-5.6 Sol(max)得分 59;
  • Kimi K3(max)得分 57;
  • DeepSeek V4 Pro 0813(max)得分 53;
  • DeepSeek V4 Flash 0731(max)得分 52;
  • GLM-5.2(max)得分 51;

这组数据至少说明,国产模型已经能够进入同一张高水平能力图中比较。Kimi K3 与最高分的差距只有 3 分,刚更新的 DeepSeek V4 Pro 0813 和 V4 Flash 0731 也已经进入 50 分以上区间。

但这张图不能说明如下轮到:

  • Kimi K3 在所有场景任务中都强的可怕了;
  • GLM-5.2 一定比 DeepSeek V4 Pro 更适合你的工作;
  • 得分低几分的模型就无法完成复杂任务;
  • 模型价格、速度、视觉能力和上下文管理不重要。

此外,厂商发布页中的模型成绩可能使用不同 Agent Harness。Kimi K3 可能搭配 Kimi Code,Claude 模型可能搭配 Claude Code,GPT 模型可能搭配 Codex。Harness 会决定模型能够使用哪些工具、怎样管理上下文、如何回传执行结果,因此它本身就是最终成绩的一部分。

再来看一张对比图:

这是最近流行一个很形象的说法------"大模型斩杀线"。

如果把 Artificial Analysis Intelligence Index 50 分看作较强模型的能力门槛,再把单任务成本 0.03 美元作为价格参考线,那么 DeepSeek V4 Flash 几乎落在了两条线的交点上。它的综合分数未必最高,但在达到同一能力区间的模型中,成本低得非常突出。

更准确的结论应该是:国产模型与海外头部模型仍有差异,但差距已经没有很多人想象中那么大;在一些测试和使用维度上,国产模型已经具备领先或接近领先的表现。

7. 模型好不好,为什么不能只看个人感觉?

"这个模型变笨了。"

"那个模型写代码不行。"

"我试了一次,完全没法用。"

这些体验都是真实的,但它们通常不足以成为对模型整体能力的判断。

同一个任务的结果至少受到以下因素影响:

  1. 任务是否说清楚:目标、边界、输入和验收标准是否完整;
  2. 上下文是否足够:模型有没有看到真正需要的文件和信息;
  3. 工具是否合适:Agent 能否读取文件、执行命令、联网或查看图片;
  4. 推理预算是否匹配:简单任务开最高档会浪费成本,复杂任务预算太低又可能草率结束;
  5. 执行过程是否可验证:有没有测试、数据或明确标准告诉模型哪里做错了;
  6. 模型本身是否适合任务:不同模型确实有不同的能力侧重。

Prompt 写得不好,当然可能让模型表现得不够聪明。比如只说一句"帮我优化一下",模型并不知道要优化速度、成本、结构还是表达,也不知道什么结果才算完成。

但也不能把所有失败都归咎于用户不会写 Prompt。也有可能模型能力不行,导致理解错误、遗忘目标、错误调用工具、产生幻觉,或者根本不具备任务所需的视觉和知识能力。

比较稳妥的判断方式是:

先看来源清楚的公开评测,再让不同模型完成同一个真实任务,最后结合质量、速度、稳定性和账单做选择。

模型的好坏不由某个人的一句话决定,但真实任务中的可复现结果,仍然比营销口号更重要。

8. 总结

DeepSeek V4、Kimi K3 和 GLM Coding Plan 的近期变化,说明国产模型正在进入一个新的阶段。

从公开数据看,国产模型与海外头部模型仍然各有强项,但差距已经明显缩小:

  • Kimi K3 在部分第三方综合指标中进入全球第一梯队;
  • GLM-5.2 成为很有竞争力的开源权重模型;
  • DeepSeek V4 Pro 提供复杂任务能力与很低的调用成本;
  • DeepSeek V4 Flash 则进一步降低了高频任务的价格门槛。

模型好不好,既不能只听厂商发布会,也不能只凭某个人的一次体验。Prompt、工具、上下文和任务验证都会影响结果,模型本身的能力边界也同样客观存在。

对普通用户来说,更有价值的问题不是"谁才是唯一最强模型",而是:

在自己的使用场景和预算内,哪个模型能高效稳定完成真实任务?

相关推荐
love530love1 小时前
虚拟显示驱动导致 Photoshop / Camera Raw 卡死?OrayIddDriver 的锅
运维·人工智能·ui·photoshop·orayidddriver·hags 调度
星火10241 小时前
【LangChain4j系列08】Agentic AI 多智能体协作
人工智能·后端
烟雨江南7851 小时前
离线语音识别为什么一到本地部署,准确率反而会变?
人工智能·语音识别
科技云报道1 小时前
【重磅】瑞数信息发布《2026Bots & Agents自动化威胁报告》,重构AI Agent时代安全认知
人工智能·重构·自动化
星火10241 小时前
【LangChain4j系列07】结构化输出与类型安全
人工智能·后端
用户298698530141 小时前
3 种方法,轻松将 PowerPoint 转换为 PDF 格式
人工智能·后端·c#
安逸sgr1 小时前
视觉 Token 是什么?图片是怎么送进大模型的?
人工智能·ai·大模型·agent·智能体
一招合理1 小时前
数据治理:企业BI深入应用的关键门槛
人工智能
yinshuzhineng1 小时前
问题:如何实现数字化转型,增强竞争优势?
大数据·人工智能·制造