我拿 4 个真实前端任务试了 GLM-5.3 Flash:代码一遍跑通,账单 4 分钱

昨天智谱把 GLM-5.3 Flash 上线并开源了。就是上周在 OpenCode 和 OpenRouter 上刷调用量纪录、被大家叫「牛来」的那个匿名模型 Ox-Alpha,测试流量全程跑在国产芯片上,昨天才认领。

朋友圈都在转这条新闻,我没转。我一个写业务的前端,关心点很朴素:它能不能干活,跑一次多少钱。今天上午扔了 4 个真实任务过去,结果有点超出预期。

先说我怎么测的

不跑跑分题。跑分题是模型公司公关稿的素材,不是我的日子。我从自己日常里抽了 4 件活,脱敏后原样扔给它:

  1. 一段有竞态问题的搜索联想代码,线上偶现「输入和结果对不上」那种;
  2. 从零写一个并发请求控制器,写完直接 node 跑;
  3. 一段赶工写出来的 React 取数代码,坑是我自己埋的;
  4. 一个我自己造的页面,埋了 4 个布局 bug,截图给它诊断。

结论放前面:前三项超预期,第四项及格但漏了一个。总账单 4 分钱人民币。对,4 分。

任务一:它比我先找到竞态

搜索联想这个 bug 是经典款:fetch 是异步的,谁后返回谁渲染,迟到的旧响应会把新结果盖掉。这种 bug 我自己写过,也踩线上过,所以我想看看它要多久能定位。

结果一次命中,还给了张复现时序表,解释为什么「只有网络抖动的时候才偶现」。

真正让我停下来的是两个我没问的细节。一个是中文输入法:组词期间(nihao → 你好)的 input 事件会触发中间态搜索,得用 isComposing 过滤。另一个是 render 如果用 innerHTML 拼联想词,有 XSS。我回头翻了自己的 prompt,确认这两件事我一个字都没提。

修复方案也有分寸:序号守卫是根治,AbortController 是减负,防抖只是锦上添花。哪部分管正确性、哪部分管体验,分得清清楚楚。

js 复制代码
let latestId = 0;
async function search(keyword) {
  const myId = ++latestId;          // 最后一次触发持有最大值
  // ... 请求逻辑 ...
  if (myId !== latestId) return;    // 迟到的旧回调,没资格渲染
  render(cache[keyword]?.items || []);
}

值过班的人都知道,这种表达在评审里有多稀缺。

任务二:它写的代码,我直接 node 跑

要求:限并发、失败自动重试、仍失败记 error 但不中断其它任务、结果顺序和入参一致,附自测代码。

我没先检查,直接跑。第一遍过。

跑完我才回去逐行读。retries: 1 是「失败后再试一次」,注释里写明;取索引用同步自增,worker 之间不竞争;失败占位不破坏顺序。风格保守,没什么炫技,挑不出错。

说句实话:这活平时交给新同事,我大概率要打回一次。

任务三:评审比我想的凶

那段 React 代码我埋了 4 个坑:Date.now() 进依赖数组、无竞态保护、无错误处理、首帧渲染 null。它全命中,按 P0/P1/P2 排好,还多抓了两个我没埋的:卸载后 setState、userId 不编码直接拼 URL。

Date.now() 那个坑,它一句话讲透:依赖数组每次渲染重新求值,时间戳必然变,effect 必然重跑,「直到某次渲染恰好落在同一毫秒才意外停止」。

看完我顺手在自己项目里 grep 了一把 Date.now()。建议你也 grep 一把。

修复版是显式状态机加 AbortController 清理,一个 cleanup 同时解决竞态、卸载更新、StrictMode 双执行。这要是同事写的评审意见,我得请人喝杯咖啡。

任务四:它漏了一个,我反而放心

测试素材是我自己造的页面,4 个布局 bug:

命中 3 个:弹窗被顶栏压住、徽标盖住价格、按钮文案截断,每个都给了能直接用的 CSS 修复。漏了头像拉伸变形。

但它补了个我没想到的角度:「三个互不相关的布局同时出问题,比较像整体样式出了状况」------建议先查 CSS 是不是 404、构建产物版本对不对、弹窗是不是渲染进了错误的父容器。

漏判和这个补充对冲下来,我反而觉得是加分。视觉能力的结论:能用,大概一年经验同事的水平,别指望火眼金睛。

算账:4 分钱

任务 耗时 输出 token(含推理)
竞态 bug 诊断 137s 5,544
并发控制器生成 70s 4,488
React 代码评审 147s 6,408
截图 UI 诊断 95s 5,228

输入 2,309 token,输出 21,668。限时 5 折价(到 9 月 9 日:输入 0.075/百万、输出0.075/百万、输出 0.075/百万、输出0.25/百万)算下来 0.0056,折合人民币4分钱。折扣结束后的原价(0.0056,折合人民币 4 分钱。折扣结束后的原价( 0.0056,折合人民币4分钱。折扣结束后的原价(0.15/$0.50,本身也只有 GLM-5.3 的 1/10)跑同样一套,8 分。

同样输出量喂 Claude Opus 4.8(输出 75/百万),光输出75/百万),光输出 75/百万),光输出1.6,约 11 块 6。差近 300 倍。官方口径是 Flash 综合成本约 Opus 的 1/40,我按输出价实测,差距比这还夸张。

补一句实话:Flash 的「快」指价格和吞吐,不指等待时间。单次调用 1-2.5 分钟,吞吐约 48 token/秒------慢是因为想得细,79% 的输出是推理 token。赶时间关推理,省钱它就是答案。

换算成月更直观:每天扔 50 个这种任务,月账单几块钱,不到一杯奶茶。这个价格下,AI 调用不再是团队要审批的「福利」,是水电。

测完几句感想

测完最大的感受不是「模型真便宜」。

是当一个完整的前端任务只要 1 分钱,「用不用 AI」就彻底不是门槛了。门槛变成:你能不能判断它给的东西。任务一里看不出序号守卫才是根治、防抖只是优化,就会把防抖当修复上线,bug 照旧偶现;任务三里评审不出 Date.now() 进依赖是死循环,模型写得再对也不敢合。

工具越便宜,人值钱的那部分越贵。这大概是 AI 时代前端求生最真实的一句话。

我现在把它排进工作流的方式:初稿、初审交给 Flash;终判留给人------正确性、边界条件、取舍,这三样不外包。

附张速查表,选型时直接用:

模型 输入/百万 输出/百万 备注
GLM-5.3-Flash(5 折至 9/9) $0.075 $0.25 本次实测模型,原生多模态
GLM-5.3-Flash(原价) $0.15 $0.50 约为 GLM-5.3 的 1/10
Claude Opus 4.8 $15 $75 官方称 Flash 综合成本约其 1/40

你拿它跑过什么真实任务?评论区聊聊。我先说:任务四它漏掉头像变形的时候,我比它全对的时候更放心------知道边界在哪,才敢把它排进工作流。


相关推荐
IT_陈寒1 小时前
Vue的响应式更新有时候真的不听话
前端·人工智能·后端
zhangfeng11331 小时前
AMD Instinct MI50(gfx906)上为 Qwen 系列模型优化并可用的 vLLM 相关仓库、Docker 镜像与实践指南。
人工智能·docker·ai编程·qwen·算子开发·vllm·mi50
风骏时光牛马1 小时前
AI编程常见问题梳理与要点解析
前端
前端snow1 小时前
ai agent -- LCEL 汇总
前端
机构师1 小时前
AI编程实战:效率与成本,AI 编程的 ROI 怎么算
人工智能·prompt·ai编程·deepseek
Flynt1 小时前
上周我在OpenRouter上用了个匿名模型,结果账单告诉我它是国产的
llm·ai编程·chatglm (智谱)
计算机魔术师2 小时前
NVIDIA 季度营收指引达 1080 亿美元,首次突破单季千亿大关
前端
京东云开发者2 小时前
上游给空、下游拿到 -1,我把故障一直追到了 commons-beanutils 的构造函数
java·ai编程
数据狐(Datafox)2 小时前
京东商品列表API技术解析与落地应用(含标准 JSON 示例)
java·大数据·前端·人工智能·python·数据分析·json