这是苍何的第 586 篇原创!
大家好,我是小仓鼠苍何。
现在每天起床第一件事,像一只小仓鼠一样先要偷偷看看自己的 Agent 还剩余多少额度,多少积分。
有时候,随便跑个简单的任务,积分和额度咔咔掉,更有意思的是,有次我在 Codex 中随便问了句话,耗费了劳资 3% 的额度?
?,孙割来了,都得破口大骂,我真的有点 Token 焦虑的感觉了。

DeepSeek v 4 flash 现在也不禁造了,各大模型公司为了解决像我这样穷光蛋的困扰,也纷纷退出自家的 flash 模型。
阿里爸爸也不例外,最近也推出了最新的 Qwen 3.8-Flash 模型
前天在 X 上看到 Qwen 3.8-Flash 也开源了。

悄悄研究了下,Qwen 3.8-Flash 是采用全新下一代架构,主模型参数量 125 B ,额外配了 51 B 的 N-gram Embedding,每个 token 只激活 6 B 参数。
相比 Qwen 3.7-Plus,训练成本直接降了 90%,每百万 Tokens 输入 1 元、输出 3 元。
而 DeepSeek v 4 flash 当前高峰时期的价格是每百万 Tokens 输入 3 元、输出 9 元。
可能大家对这个体感不是很清晰,你放到 Agent 里面去跑跑,看看余额下降的速度,就体会很深了。
我看阿里自家的 Agent 产品千问办公,也第一时间接入了 Qwen 3.8-Flash,说是想让 Agent 迎来量大管饱时代。

我偏不信,我要替兄弟们去试试水,看是不是在吹牛逼。
当然如果你也不信,可以自己去玩玩。
我打开千问办公后,就看到有标准和高级两个模式。
仔细一看,标准模式下面写着「秒杀日常任务」。秒杀这个词真是用的好啊,我想产品经理放上这个词上去的时候,一定是面临巨大的压力的,万一测下来,速度一般,那可真是啪啪啪,打脸了,哈哈哈。

刚好最近刷到一篇 RSI 的行业报告,讲的是 AI 研发自动化加速下的模型、算力与应用机会,感觉挺有意思。
但这篇 PDF 四十多页,我实在没那个耐心一页页读。

于是我直接丢给千问办公,让它帮我总结。试试速度和效果。
靠,就等了几秒,报告信息、核心论点、支撑数据,全都给我整理好了?

Codex 里的 GPT 5.6 sol 硬是给我瞪了好几分钟才搞定,你别说,还真挺快的。
于是,我继续让它深入拆解了一下里面的算力测算模型,整理成 MarkDown 文档。
看了一下,模型结构、变量拆解、结构洞察、投资映射都分析到了,真别说,清晰明了。

整个过程也仅仅耗时几秒,妈耶。
在千问办公这样的 Agent 里,评估消耗最好的方法就是看额度或者积分。
这一套下来我看了眼积分,竟然还没花到 1 个积分 ? ?

也就是说,一千个积分,我能让它看几百个 PDF?

我还真不信了这个邪,我直接把一百个科技行业的行业研究报告丢给千问办公。
任务一交代,右侧还能看到任务监控、它调用的技能,还有产物,过程还是挺透明的。
提示词:基于这 100 份报告做横向分析,输出一份 Markdown 综合报告,分析一下这些报告中被反复提及的趋势有哪些,市场规模和增速怎么样,有哪些冷门信号,未来 1-2 年最值得关注的 3 个方向是什么

等了几分钟,这个报告就好了,我看了一下,分析很详细,总结也很到位。

可能有小可爱问,这里怎么不是秒杀啊?兄弟,这是 100 份报告,几分钟已经快到离谱了,卧槽。
但是我感觉看着还是有点麻烦,于是让它做了个趋势图表,整体趋势更一目了然了。

这一整套下来也才十分钟,几个积分?

请问阿里爸爸,你们是怎么赚钱的?这积分消耗太离谱了吧?我严重怀疑是不是你们看我帅,给我开了白名单,大家也去试试看看情况,回来告诉我。
我还是不死心,我总觉得有点儿假,工作中经常要做 PPT,自己找模板做费时又费力。
我直接把几千字的产品文档丢给它,让它做成 PPT。
它会先问下我大概想要的风格和页数,然后给我一个大纲,我看了一下,没啥问题就让它开干。

等了一会它就做好了,还能直接在线编辑修改,哪里不满意改哪里。挺方便,但也没啥特殊的。

效果挺在线的,兄弟们感受下。

这个效果的话,这一套下来,花了二十多个积分吧。

刚好 GLM-5.3-Flash 也发布了,我顺手让它也做了一版 PPT。

GLM-5.3-Flash 的效果也还可以。

但 GLM-5.3-Flash 这个任务消耗了 200 多个积分,相比起来,千问办公便宜了十倍。

?不敢相信,再试试水。
前段时间我做了个公众号数据监控平台,功能有了,但 UI 有点丑,我自己又暂时没啥灵感。
我让千问办公帮我重新设计,它会在右侧画布直接给预览效果,哪里有问题也可以直接找到具体元素让它修改,这点和无限画布挺像的。
不过在复杂编程场景下它速度没那么快,而且长时间任务还会出现断掉的情况,但效果还不错。

最后试试这个场景,财务和行政同学应该深有体会,发票。
发票一多就乱,整理起来头都大了,我直接把活丢给它。
500 份发票单据,让它逐份抽出开票方、收票方、金额、税率、日期、科目归类建议、是否缺发票专用章,最后输出 Excel。

我还混了 pdf、docx、txt、csv 好几种格式,塞了些乱七八糟的票据进去,它全都整明白了。
有问题的地方也都识别出来了,该标缺章的标缺章,该提示的提示。

我看有人统计,1000 积分具体能干多少活,也给大家参考一下:

说实话我挺好奇,又快又省这事,它是怎么做到的。
于是我扒了扒它的原理。
千问办公这个标准模式用的是专属版的 Qwen 3.8-Flash,训练阶段就针对多步规划、工具选择、上下文压缩这些办公场景做了调优,Agent 能力直接点满。
推理阶段,千问办公又给模型定制了 Harness 架构,把吞吐效率拉了上去。
也就是说,模型本身更聪明了,干活的路子也更熟了,每一步少绕弯,Token 自然就省下来了。

说实话,我算是 Token 重度用户,日常开发、办公、长时间的自动化工作流,24 小时基本都在烧。
以前玩 Agent 总绕不开一个不可能三角,高性能意味着高成本,低成本就得牺牲智能。
所以经常盯着 Token 算账,生怕一个不小心把钱包干穿了。
而这次模 A 协同优化,算是把这个三角掰开了一个口子。
现在感觉 「Agent 的 Token 焦虑,可能真要翻篇了」。
当 95% 的日常任务用标准模式就能又快又好地搞定,积分还花不了几个的时候,Agent 才算真正进入了量大管饱的时代。
不过对于复杂任务,建议你还是开启高级模式吧。但对于绝大多数办公任务,秒杀模式就够了。
你最近用什么 Agent 干活?评论区聊聊。