2026年8月最后一周,国产大模型市场发生了一件值得关注的事:智谱、阿里在同一天晚上先后发布了各自的Flash新模型,DeepSeek则刚刚完成一轮备受争议的涨价。三款模型定位高度一致------用极低的价格提供接近旗舰的能力------但各自的打法和侧重点完全不同。它们贴身肉搏的价格战,也把"大模型性价比"这个话题彻底推到了台前。
一、什么是Flash?这个月为什么有这么多flash出现
Flash在AI领域已经成了"轻量、快速、低成本"的代名词。它的诞生逻辑很简单:旗舰模型太贵、太慢,企业日常80%以上的任务根本用不上那么强的能力,需要一个"够用且不贵"的选择。
但过去几个月,Flash的内涵发生了一次质变。以前的Flash基本是旗舰模型蒸馏出来的轻量版,能力打折扣、定位偏"入门";而2026年8月开始,Flash变成了厂商真正的竞争主战场------GLM-5.3-Flash在Artificial Analysis智能指数拿到57分,与Claude Opus 4.8持平;Qwen3.8-Flash用6B激活参数做到超越Opus 4.6、接近Opus 4.8的表现。价格只有顶级旗舰的几十分之一,还都具备多模态能力,企业80%以上的任务完全够用。
厂商竞争的计分牌,正在从"SOTA"换成"性价比和真实调用榜"。GLM-5.3-Flash以匿名身份登顶OpenRouter调用榜,就是这一趋势最直观的注脚。
二、统一指标测评三款模型对比怎么样?
1、智能水平。
GLM-5.3-Flash在Artificial Analysis智能指数拿到57分,与Claude Opus 4.8持平,是目前Flash阵营里智能分最高的。在AutomationBench上表现突出,在DeepSWE v1.1(SWE-bench变体)上拿到63.4分,超过Claude Opus 4.8(58.0)和DeepSeek的实验版(59.3)。Agent和工具调用是它最突出的能力。
Qwen3.8-Flash用6B激活参数做到超越Opus 4.6、接近Opus 4.8的水平,效率极高。多模态能力均衡,实测在办公自动化、视觉任务上表现稳定。
DeepSeek-V4-Flash智能指数50分,在三款里排第三,它的亮点不在智能分上------前端代码竞技场1586分才是它的主场,代码生成和长文本处理才是它真正擅长的事。
2、速度与输出长度。
DeepSeek-V4-Flash输出速度约84 tok/s,三款最快;最大输出384K,是其他两款的3倍。如果你的场景是长文档生成或批量代码输出,这个差异会直接体现在等待时间上。
GLM-5.3-Flash约50 tok/s,中规中矩。Qwen3.8-Flash官方未公布稳定速度值,实测体感中等。
3、架构与多模态。
三款都用MoE架构,但Qwen3.8-Flash最"极端"------125B总参数但每个token只激活6B,三款里激活参数最小,训练成本比上一代降了近90%。它首次引入自研稀疏注意力QSA与线性注意力GDN融合,是成本能压到地板的技术根源。
多模态方面,GLM和Qwen都支持文本、图片、视频;DeepSeek以文本为主,图片需走实验版通道。
4、开放程度。
GLM-5.3-Flash是MIT协议,最宽松,可商用、可自由修改。Qwen3.8-Flash走Qwen社区许可。DeepSeek-V4-Flash也是MIT开源。三者权重都开放,但协议宽松度不同------MIT意味着企业可以拿去改、拿去商用,几乎没有任何限制。
5、成本------但这里有个坑。
只看标价的话:Qwen输入0.8元/输出2.7元(每百万token),GLM促销期同价(0.8/2.8),DeepSeek高峰3/9元、闲时1.5/4.5元。Qwen最便宜,DeepSeek高峰时段最贵。
但"谁便宜"不是固定答案。DeepSeek的峰谷定价意味着错峰调用可以省一半;GLM的0.8元是促销价,9月9日截止;Qwen发布次日就从1元降到0.8元,直接打地板价。
还有一个变量是缓存命中率。同一个模型,命中缓存的输入价格比未命中低一个数量级(DeepSeek峰值时0.1元 vs 3元)。低命中率+高峰时段,用GLM的5折价能省约62%;高命中率+错峰调用,DeepSeek空闲价反而更便宜。
小结:GLM在智能和Agent方面表现突出,DeepSeek在代码速度和长输出上更擅长,Qwen在效率和多模态均衡方面有优势。 选哪个,取决于你的场景更看重哪个维度。
三、五场景实测:参数是参考,业务匹配才是王道
只看参数容易踩坑。有人把三款模型放进五个真实业务场景里跑了跑,结果很能说明问题:
微缩机场调度(考验复杂业务逻辑):GLM开发速度最快(20分钟跑完四轮),但跑道"资源互斥锁"逻辑缺失,出现多机抢占同一条跑道的严重仿真错误,建模也最简陋;Qwen耗时最长(1.5小时),却是唯一"能直接拿去演示"的版本,建模细节到位;DeepSeek整体中位,流畅但不出彩。
3D大脑解剖沙盘(考验多模态数据整合):GLM还原度、交互性、数据层完整性三项领先;DeepSeek只做出抽象的"脑网络节点图";Qwen概念化、艺术感强但数据完整度不足。
故宫太和殿建模(考验审美与规制):Qwen是"懂古建的美术生",中国红、宫门配殿完整,视觉最亮眼;DeepSeek轴线感强;GLM反而垫底。
红楼梦叙事网页(考验幻觉控制):DeepSeek视觉设计最佳且未出现幻觉;Qwen美学不错但两处"自信编造"原文;GLM因审美不在线直接出局。
周报整理(考验办公能力):三款都能完成冲突检测,Qwen以细致度小幅领先,为每条记录写备注、标注未结束任务。
结论:三者各有侧重------GLM的优势集中在开源协议和价格策略,DeepSeek在缓存和长程任务上更突出,Qwen在稳定性和多模态方面表现更均衡。没有全能冠军,选型必须回到自己的业务需求。
四、价格博弈与真实成本
这轮竞争的真正主战场,其实是定价策略:
DeepSeek走"峰谷定价":把成本管理压力转嫁给调用方------想省钱就错峰、就提高缓存命中率。这也意味着它的价格是"浮动"的,对比时必须分高峰/闲时。
GLM走"限时促销":0.8元输入价是促销价,9月9日截止;等促销一过,定价是否还有吸引力是最大变量。
Qwen走"一步到位":发布次日就直接把输入从1元降到0.8元,用训练成本优势打"地板价",不搞限时套路。
真实成本还有一个常被忽略的变量------缓存命中率。同一个模型,命中缓存的输入价格能比未命中低一个数量级(DeepSeek峰值时0.1元 vs 3元)。有账单实测显示:低命中率+高峰时段调用,用GLM的5折价能省约62%;高命中率+错峰调用,DeepSeek空闲价反而更便宜。所以"谁更便宜"没有固定答案,取决于你的调用时段和缓存命中率。
预算评估应该以"原价+自己的真实用量"为基准,而不是促销价。如果用量大,缓存命中率和调用时段的优化空间,可能比"换哪家模型"更值钱。
以上价格信息基于各厂商2026年8月公开报价整理,实际费用以调用时官网为准。各厂商定价策略可能随时调整,建议以官方最新公告为准。
五、选型建议
1、Agent、复杂编程、工具调用:优先考虑GLM-5.3-Flash。AutomationBench表现突出,Agent能力是它最明显的优势。
2、前端代码、长文本输出、成本敏感:优先考虑DeepSeek-V4-Flash。384K超长输出、输出速度最快、代码能力强,注意错峰调用控成本。
3、多模态视觉、办公自动化、极致性价比:优先考虑Qwen3.8-Flash。价格最低、多模态均衡、6B激活够用,办公场景实测稳定。
本地部署、国产算力合规:GLM-5.3-Flash或Qwen3.8-Flash均可。两者都开放权重,GLM是MIT协议。
六、总结
三款Flash的共同特点是:用极低的成本,覆盖了企业80%以上的日常AI需求。它们的竞争,本质上是大模型行业从"拼技术上限"转向"拼性价比"的信号。GLM押Agent智能,DeepSeek押代码速度和长文本,Qwen押极致效率和多模态均衡------加上各自的定价策略(促销、峰谷、地板价),各有各的打法,没有绝对的好坏,只有适合不适合。
选型时记住三句话:能力看基准,价格看原价,真实成本看缓存命中率和调用时段。