上周我在OpenRouter上用了个匿名模型,结果账单告诉我它是国产的

上周有一件事挺有意思。 OpenRouter上冒出来一个叫Ox Alpha的匿名模型,没标厂商,没写参数量,就是纯盲测。我当时看到的时候,它已经冲到周榜第一了。随手调了一下,编程能力确实不错,反应也快,心想这是哪家的新模型。中文社区更直接,给它起了个名叫"牛来"。 然后昨天(8月26日)晚上智谱官宣了:Ox Alpha就是GLM-5.3-Flash。 好吧,我承认我当时第一反应是"行吧又一个大模型"。但仔细看了一眼背后的数据之后,我花了一个晚上把几个小项目的API从Claude换了过去。 为什么换?因为价格实在太离谱了。

几个数字,先砸一下

直接列:

  • 总参数320B,每次推理只激活18B(MoE架构)
  • Artificial Analysis Intelligence Index 57分,和Claude Opus 4.8同一档(数据来源
  • DeepSWE v1.1 代码修复 63.4分,Opus 4.8是58.0
  • 价格是GLM-5.3的1/10,限时折扣期间1/20
  • 对比Opus 4.8,完成同一个任务的成本约1/40
  • 原生1M上下文,原生多模态

说实话,刚看到1/40这个数字的时候我是持怀疑态度的。"同一任务成本"这种说法太模糊了,每家都说自己便宜。但我去对比了一下Token单价------输入0.8元/百万Token、输出2.8元/百万Token,确实比DeepSeek V4 Flash的谷时价(输入1.5元、输出4.5元)还便宜。这就不是"同一任务"的文字游戏了,是单价本身就在地板以下。

换API这事比我想的简单

我的场景不复杂:几个小工具项目,Python通过OpenAI兼容接口做代码生成和文档处理。之前主力Claude,偶尔切DeepSeek。 GLM-5.3-Flash走智谱的BigModel平台(docs.bigmodel.cn),但接口格式是OpenAI兼容的。我原来的代码只需要改两个地方:base_url和model name。

ini 复制代码
from openai import OpenAI

# 之前的Claude配置
# client = OpenAI(api_key="sk-xxx", base_url="https://api.anthropic.com/v1")

# 换成GLM-5.3-Flash
client = OpenAI(
    api_key="你的智谱API Key",
    base_url="https://open.bigmodel.cn/api/paas/v4"
)

response = client.chat.completions.create(
    model="glm-5.3-flash",  # 注意:全小写加横杠
    messages=[
        {"role": "user", "content": "帮我写一个Python的LRU Cache实现"}
    ],
    temperature=1,
    top_p=0.95,
    stream=True
)

for chunk in response:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="")

就这些。改完直接跑,没报错。 不过第一次跑的时候我犯了个蠢:直接按官方推荐的 temperature=1 上了。结果输出比我预想的"有创意"太多了------让它写个工具函数,它给我加了三个装饰器和一个类型注解的泛型方案。功能是对的,但我只是要个简单的OrderedDict实现啊。 后来把temperature降到0.7才稳定下来。如果你也在迁移,建议先保守一点,别一上来就拉满。

编程体感:九成实力,但该有的差距也在

我拿三个场景测了一下:React组件重构、SQL优化、Python异步bug修复。

React那个还行。GLM-5.3-Flash给了一个干净的方案,把useEffect里的副作用拆成自定义hook。代码风格和Claude很像,都是函数式拆法。但有个区别我注意到了:它拆分后没有主动提醒我依赖数组变化可能导致额外re-render。Claude一般会给个注释提醒。这种"多走一步"的意识,GLM还差一点。

SQL那个倒是让我有点意外。一个慢查询,JOIN四张表、WHERE里套子查询。GLM-5.3-Flash直接把子查询改成JOIN,还顺手建议了复合索引,而且索引列的顺序考虑了查询选择性。这个思路没问题。

Python异步那个就不太好了。我给的是一个asyncio里的竞态条件,模型定位到了问题但只说"建议使用锁"。没有代码,没有具体方案。Claude在这种场景下一般会直接给你 asyncio.Lock 的用法,甚至帮你重构整个协程结构。

所以编程能力大概是什么水平呢?简单任务几乎没差别,中等复杂度的也能应对,但碰到需要深度推理的异步并发或者复杂架构设计,差距就出来了。说"Opus 4.8的九成实力"我觉得是客观的。

多模态才是真正的惊喜

说真的,之前看各种Flash模型,我的预期就是"便宜够用就行"。 但GLM-5.3-Flash的多模态让我有点没想到。 它不是那种"你把图片扔给它,它给你描述一下图片内容"的传统多模态。它的视觉能力是被设计来接入编程闭环的------模型写完前端代码后,可以自己"看"渲染结果,然后判断哪里需要改。

官方展示了一个案例:GLM-5.3-Flash在Blender里自主运行了16个小时,从零搭建了一套400平方米的3D厨房场景。全程自己建模、渲染、检查、修正,没要任何外部素材。这个我没法验证真假,但如果是真的,那确实挺狠。

我自己试了个轻量场景:给它一张网页截图,让它用React复刻。结果比我预想的好不少------它不只是还原了颜色和布局,还识别出了响应式断点逻辑,而且第一次生成后主动说"我需要看一下渲染结果来确认间距是否正确"。 这个行为模式是以前纯文本模型上没有的。它真的在尝试"看一眼"自己写的东西对不对。 图片传入方式和OpenAI格式一样,这点不需要额外学习:

ini 复制代码
response = client.chat.completions.create(
    model="glm-5.3-flash",
    messages=[
        {
            "role": "user",
            "content": [
                {"type": "text", "text": "用Next.js复刻这个页面的布局"},
                {"type": "image_url", "image_url": {"url": "https://你的图片地址/screenshot.png"}}
            ]
        }
    ],
    temperature=1,
    top_p=0.95
)

用了一周,有几个地方让我不太舒服

思考模式关不掉。 这个最烦。GLM-5.3-Flash的 thinking.type 只支持 enabled,不支持关闭(官方文档明确写了)。也就是说每次调用都带思考过程。如果你只是想格式化一段JSON或者做简单的文本处理,白白多了思考的延迟和成本。官方建议设置 thinking.clear_thinking: false 来减少输出中的思考痕迹,但思考本身还是存在的,这个没法绕开。

推荐参数太激进。 官方推荐 temperature=1、top_p=0.95、reasoning_effort=max。前面说了,temperature=1的时候输出太"有创意"了。我目前代码生成用0.7,文档处理用0.9,感觉更可控。

KV缓存比竞品稍大。 官方博客自己承认了,GLM-5.3-Flash的KV缓存比DeepSeek-V4-Flash和Kimi-K3都大一点。用API感知不大,但如果你要本地部署做超长上下文,显存得多留一些。

Function Calling有细微差异。 接口格式虽然兼容OpenAI,但并行工具调用的处理方式和Claude不太一样。我有个项目用了比较复杂的工具链编排,换过去之后有两个case的行为和预期不一致。后来调整了prompt才解决。如果你的项目重度依赖Function Calling,务必先跑测试用例。

国产芯片这事,值得单独说

智谱没公布具体用的哪家芯片。只说"超过10万张国产芯片"。但从公开的推理架构细节来看------内存容量和带宽是核心瓶颈------基本可以推断是国产GPU,而不是国产CPU+FPGA的路线。 他们的解法总结起来就一句话:用算力换带宽,用通信换显存。具体包括节点内张量并行、W8A8量化、混合精度缓存、还有EPD分离架构(把编码、预填充、解码拆成三个独立调度的池子)。 我不太确定那个IndexPool到底怎么work的------官方技术报告说是通过加权池化把4个索引向量压缩成1个,降低索引器的内存开销。听着挺厉害,但我没有源码级的手段去验证。 最终效果:端到端性能比初始基线提升3倍,单token成本和主流NVIDIA GPU"持平"。

注意是"持平",不是"碾压"。但话说回来,这是第一次有厂商用国产芯片大规模承载全球开发者的真实在线流量,而且扛住了OpenCode平台统计的42万亿Token调用(6天)。这个数字不管水分多大,至少说明不是实验室里跑出来的demo。 我不打算做"国产替代"式的价值判断。但有一个实际影响:当模型服务不再依赖单一的海外GPU供应链,定价的天花板确实被打掉了。1/40这个价格,不是靠营销补贴烧出来的。

我打算怎么办

说个实际的决定:我手里三个调用量最大的小工具项目,已经全部切到GLM-5.3-Flash了。一个月省下来的API费用,够我再开两个新项目的预算。 但Claude我也不会完全丢掉。碰到那种需要深度推理的异步调试、或者复杂架构设计的场景,我还是会切回去。GLM-5.3-Flash在"深度思考"这块确实还差一点,不是价格能弥补的。 另外,那个关不掉的思考模式让我有点纠结。如果你的场景里有很多"一句话就能回答"的简单调用,GLM-5.3-Flash可能不是最优解------你花了思考的钱但用不上思考的结果。 总的来说,这模型不是万能的,但在它的射程范围内(代码生成、文档处理、前端还原、日常编程辅助),性价比确实没对手。至少目前没对手。

相关推荐
京东云开发者2 小时前
上游给空、下游拿到 -1,我把故障一直追到了 commons-beanutils 的构造函数
java·ai编程
掘金酱2 小时前
🔥 AI 时代,Token 就是你的数字燃料!晒账单,赢好礼!
前端·人工智能·ai编程
小虎AI生活4 小时前
从古茗案例看 FDE 思维落地:让一个 AI Agent 驻守最烦的岗位,中小公司也能干
ai编程
plainGeekDev4 小时前
Agent Prompt 怎么写:三个真实案例讲透
agent·ai编程·claude
@atweiwei4 小时前
用 Rust 构建 Agent 应用的高性能框架:langchainrust 架构全景
人工智能·架构·rust·langchain·llm·agent·ai编程
武子康5 小时前
看不见的 Reasoning State,为什么不能拥有看得见的工具权限
人工智能·llm·agent
cooldream20095 小时前
Conda 镜像源 404 错误完全解决指南
conda·ai编程
李剑一5 小时前
连名词都不会,你AI个Der!学会AI基础之:到底模型是什么玩意儿?都说大模型,有小模型嘛?训练数据多它就是大模型吗?
aigc·openai·ai编程
DigitalOcean6 小时前
实测:25 万条数据只花 7.04 美元,LLM 批量推理到底有多省?
llm·agent