进入 2026 年 9 月,大模型市场呈现明显分化:海外旗舰继续冲高复杂推理与 Agent 能力,国内 MoE 模型集中开源,Flash 轻量模型开启惨烈价格战,同时闭源 API、开源可私有化两套路线并行发展。
很多开发者、中小企业、个人 VibeCoder 选型时,只看跑分,忽略真实 API 成本、算力部署门槛、业务适配场景。同样一个模型,做代码 Agent、做文档办公、做长文档 RAG、做本地私有化,表现天差地别。
本文覆盖 9 月最新主流版本,分为国内闭源 API、国内开源 MoE、海外闭源旗舰、海外高性价比系列 ,从API 价格、算力(云端推理 / 本地部署显存)、主打场景、短板进行横向对比,同时给出工程选型决策思路。
说明:国内价格单位:元 / 百万 token;海外:美元 / 百万 token;国内价格为标准公开标价,不含限时折扣;MoE 模型注意:显存占用看总参数,不是激活参数,推理算力看激活参数,很多人踩这个坑。
一、主流模型基础信息总览表
| 模型 | 厂商 | 版本状态 | 上下文窗口 | API 输入 / 输出 | 本地部署显存 (INT4 量化) | 核心主打场景 | 明显短板 |
|---|---|---|---|---|---|---|---|
| GLM‑5.3‑Pro | 智谱 AI | 开源 MoE,2026‑08 | 1048576 | 8 / 28 元 | 110‑130GB | Agent 工具调用、企业 RAG、复杂业务推理阿里云帮助... | 多模态能力一般 |
| GLM‑5.3‑Flash | 智谱 AI | 开源 MoE | 1048576 | 0.8 /2.8 元 | 90‑110GB | 高吞吐业务接口、办公内容生成、批量任务36氪 | 超高难度数学略弱 Pro 版 |
| DeepSeek‑V4‑Pro | 深度求索 | 闭源 API + 权重开源 MoE | 100 万 | 高峰 3/9 元,闲时半价 | 120‑150GB | 代码开发、Agent 循环推理、技术调研、Debug | 高峰时段成本上涨 |
| DeepSeek‑V4‑Flash | 深度求索 | 开源 MoE | 100 万 | 峰谷定价 | 95‑115GB | 编码、VibeCoding、CLI 编程智能体 | 高峰 API 排队明显 |
| 混元 Hy4‑preview | 腾讯 | Apache2.0 开源 MoE | 100 万 | 企业报价 | 130‑160GB | 中文办公、公文、PPT 生成、企业内部问答 | 开源生态文档偏少 |
| Qwen3.8‑Flash | 阿里通义 | 开源 MoE | 100 万 | 0.8/2.7 元 | 85‑105GB | 中文生成、批量处理、缓存友好业务场景36氪 | 硬核代码略弱 DeepSeek |
| Kimi K3‑Max | 月之暗面 | 闭源 | 100 万 | 3 /15 元 | 不公开开源权重 | 超长文档解析、PDF 研报、合同审阅 | 本地不可部署 |
| GPT‑6 Astra | OpenAI | 受限企业预览 | 105 万 | 10 /50 美元 | 不开放权重 | 复杂计算机操作、多步 Agent、科研、软件工程新华网 | 国内网络访问受限,价格昂贵 |
| Claude Fable 5.1 | Anthropic | 闭源旗舰 | 100 万 | 10 /50 美元 | 不开源 | 长任务 Agent、大型代码库分析、法律文书 | 国内访问受限 |
| Claude Sonnet 5 | Anthropic | 闭源主力 | 100 万 | 2 / 10 美元 | 不开源 | Claude‑Code、工具调用、中等复杂度 AgentCSDN博... | 极限推理弱 Fable5.1 |
| Gemini 3.8 Flash | 闭源 | 100 万 | 0.75 /3.75 美元 | 不开源 | 多模态、图文混合任务、性价比推理 | 中文理解弱国产模型 |
重要提示:MoE 模型误区:激活参数只影响推理速度;全部专家权重都需要加载进显存,不要被 "激活 40B" 误导以为只需要 40B 模型显存CSDN博...。
二、分阵营深度解析
2.1 国内开源 MoE 阵营(GLM‑5.3 / DeepSeek V4 / 混元 Hy4‑preview / Qwen3.8)
这是 2026 下半年最大变化:国产大模型纷纷放出 MoE 完整权重,企业可以私有化部署,不用完全依赖公有云 API。
- GLM‑5.3 系列
- 算力:Pro 版 INT4 约 120GB 显存,Flash 约 100GB,vLLM / LMDeploy 完整支持,适配昇腾、N 卡双生态GLM-5。
- 价格:Flash 打出国产低价,限时五折进一步下探,缓存命中成本极低,适合高吞吐 SaaS 服务。
- 优势:Function‑call 稳定性优秀,Agent 循环调用不容易崩坏,中文指令遵循优秀,RAG 场景表现突出。
- 适合:企业私有化智能体、内部知识库、办公自动化 SaaS、批量文档处理。
- 不适合:重度图像多模态生产。
- DeepSeek‑V4 系列
- 算力:INT4 量化 110‑140GB,vLLM/SGLang 支持;Flash 可以在单台高性能服务器跑起来。
- 价格:峰谷计费,闲时性价比极高,高峰期成本上浮,业务量大要做好流量错峰。
- 优势:代码能力国内第一梯队,VibeCoding、Harness/Codex 类开发 Agent 首选,工具链生态完善。
- 适合:编程 Agent、CLI 开发助手、技术调研、Debug、个人开发者私有化部署。
- 短板:通用公文、PPT 类办公略弱混元、GLM;高峰 API 队列延迟高。
- 腾讯混元 Hy4‑preview
- 算力:总参 770B,激活 49B;INT4 约 140GB + 显存。
- 优势:中文办公、公文、企业文书、PPT 大纲理解非常贴合国内企业习惯。
- 短板:开源文档、社区案例相比 GLM、DeepSeek 偏少,遇到问题可参考资料少。
- 适合:传统企业、国企内部办公 Agent 私有化。
- Qwen3.8‑Flash
- 算力:INT4 约 90GB,对硬件要求在国产 MoE 里面相对友好。
- 优势:缓存能力极强,长 System Prompt 场景,缓存命中之后成本极低;社区生态庞大。
- 适合:大量重复系统提示词的 SaaS 服务、内容批量生成。
2.2 国内闭源 API 阵营(Kimi K3‑Max)
Kimi K3‑Max 不开放权重,只能 API 调用。
- 算力:完全云端托管,用户不需要关心硬件。
- 优势:百万上下文处理 PDF、合同、研报,长文档 "不碎文"。
- 适合:文档审阅、材料精读;不适合私有化,数据必须出网调用 API。
2.3 海外闭源旗舰阵营(GPT‑6 Astra、Claude Fable5.1、Sonnet5、Gemini3.8 Flash)
- GPT‑6 Astra、Claude Fable5.1:顶级推理,价格极高,主要面向海外企业科研、高危安全分析,国内普通业务几乎不会大规模使用,网络访问也是障碍。
- Claude Sonnet5:海外 Agent 事实标准,Claude‑Code 底层,Agent 多轮工具调用成熟;但中文语境弱国产。
- Gemini3.8 Flash:海外性价比标杆,多模态强,中文理解不及国内模型。
三、算力维度的现实结论(云端 API / 个人 & 企业本地部署)
- 公有云 API 模式 不用关心算力,按量计费;风险点:峰谷涨价、限流、数据出网、服务商调整定价。DeepSeek 高峰涨价就是典型案例36氪。
- 企业私有化部署 MoE 现状(2026‑09)
- INT4 量化,国产主流 MoE 普遍需要 90‑150GB 显存;
- 单卡 RTX4090(24G)完全跑不动完整 MoE;至少需要多卡 A100/H100 / 昇腾 910B 集群;
- 个人普通 PC 基本无缘完整 MoE 本地跑;个人玩家只能选择 7B‑34B 稠密模型。
很多自媒体宣传 "个人电脑跑 GLM‑5.3" 属于误导,只能做模型切片、极低精度,业务不可用。
- 选型提醒:
如果你的硬件只有单卡 24‑48G 显存,不要碰最新一代 MoE;选择稠密 7B‑34B 系列,速度、稳定性会好得多。MoE 是企业服务器级别的模型,不是家用消费级显卡的玩具。
四、业务场景对应模型选型建议(工程实战)
场景 1:企业私有化 Agent、内部办公自动化(Skill/MCP 服务)
优先:GLM‑5.3‑Flash > 混元 Hy4‑preview 理由:中文强,Function‑call 稳定,可完全本地部署,数据不出内网。
场景 2:编程 Agent、VibeCoding、DeepSeek‑Harness、Codex‑Harness 底层
优先:DeepSeek‑V4‑Flash / Pro 理由:代码、Debug、架构推演国内最强;闲时 API 成本可控,也可以本地私有化。
场景 3:SaaS 高吞吐业务接口,大量短请求,追求低成本
优先:GLM‑5.3‑Flash、Qwen3.8‑Flash 理由:单价低,上下文缓存优化好,百万级 token 账单压力小。
场景 4:长文档、PDF、合同、研报批量阅读
优先:公有云:Kimi K3‑Max;私有化:GLM‑5.3‑Pro。
场景 5:海外业务、复杂多步 Agent(不考虑网络)
优先:Claude Sonnet5。
五、当前行业痛点总结(2026‑09 真实现状)
- MoE 开源≠个人电脑可以跑:最新国产 MoE 对硬件门槛很高,普通开发者更多还是 API 调用;私有化是企业的游戏。
- 价格战主要发生在 Flash 档位,旗舰 Pro 版本价格依旧不低;峰谷定价模式需要业务做流量治理,不然账单会暴增。
- 海外模型推理能力天花板更高,但中文、网络、合规三道门槛;国内模型中文、办公、Agent 工程化更贴合本土业务。
- 跑分不等于业务效果:很多模型榜单分数接近,但 Function‑call、循环 Agent 稳定性差距巨大,选型必须做自己业务的实测集。
六、写在最后:选型决策三步法
- 先确认:是否要求数据不能出内网 → 是,只能选开源可私有化权重,放弃 Kimi、GPT 等闭源 API;评估服务器硬件显存够不够 MoE。
- 确认业务类型:编码优先 DeepSeek;办公企业 Agent 优先 GLM / 混元;长文档精读优先 Kimi。
- 确认流量特征:大量重复 System Prompt 优先看支持上下文缓存的模型;流量波动大,避开高峰涨价模式,或者做错峰调度。
没有绝对最好的模型,只有适合你算力、预算、业务、合规要求的模型。