原来 Agent 量大管饱,真不是吹的

这是苍何的第 586 篇原创!

大家好,我是小仓鼠苍何。

现在每天起床第一件事,像一只小仓鼠一样先要偷偷看看自己的 Agent 还剩余多少额度,多少积分。

有时候,随便跑个简单的任务,积分和额度咔咔掉,更有意思的是,有次我在 Codex 中随便问了句话,耗费了劳资 3% 的额度?

?,孙割来了,都得破口大骂,我真的有点 Token 焦虑的感觉了。

DeepSeek v 4 flash 现在也不禁造了,各大模型公司为了解决像我这样穷光蛋的困扰,也纷纷退出自家的 flash 模型。

阿里爸爸也不例外,最近也推出了最新的 Qwen 3.8-Flash 模型

前天在 X 上看到 Qwen 3.8-Flash 也开源了。

悄悄研究了下,Qwen 3.8-Flash 是采用全新下一代架构,主模型参数量 125 B ,额外配了 51 B 的 N-gram Embedding,每个 token 只激活 6 B 参数。

相比 Qwen 3.7-Plus,训练成本直接降了 90%,每百万 Tokens 输入 1 元、输出 3 元。

而 DeepSeek v 4 flash 当前高峰时期的价格是每百万 Tokens 输入 3 元、输出 9 元。

可能大家对这个体感不是很清晰,你放到 Agent 里面去跑跑,看看余额下降的速度,就体会很深了。

我看阿里自家的 Agent 产品千问办公,也第一时间接入了 Qwen 3.8-Flash,说是想让 Agent 迎来量大管饱时代。

我偏不信,我要替兄弟们去试试水,看是不是在吹牛逼。

当然如果你也不信,可以自己去玩玩。

我打开千问办公后,就看到有标准和高级两个模式。

仔细一看,标准模式下面写着「秒杀日常任务」。秒杀这个词真是用的好啊,我想产品经理放上这个词上去的时候,一定是面临巨大的压力的,万一测下来,速度一般,那可真是啪啪啪,打脸了,哈哈哈。

刚好最近刷到一篇 RSI 的行业报告,讲的是 AI 研发自动化加速下的模型、算力与应用机会,感觉挺有意思。

但这篇 PDF 四十多页,我实在没那个耐心一页页读。

于是我直接丢给千问办公,让它帮我总结。试试速度和效果。

靠,就等了几秒,报告信息、核心论点、支撑数据,全都给我整理好了?

Codex 里的 GPT 5.6 sol 硬是给我瞪了好几分钟才搞定,你别说,还真挺快的。

于是,我继续让它深入拆解了一下里面的算力测算模型,整理成 MarkDown 文档。

看了一下,模型结构、变量拆解、结构洞察、投资映射都分析到了,真别说,清晰明了。

整个过程也仅仅耗时几秒,妈耶。

在千问办公这样的 Agent 里,评估消耗最好的方法就是看额度或者积分。

这一套下来我看了眼积分,竟然还没花到 1 个积分 ? ?

也就是说,一千个积分,我能让它看几百个 PDF?

我还真不信了这个邪,我直接把一百个科技行业的行业研究报告丢给千问办公。

任务一交代,右侧还能看到任务监控、它调用的技能,还有产物,过程还是挺透明的。

提示词:基于这 100 份报告做横向分析,输出一份 Markdown 综合报告,分析一下这些报告中被反复提及的趋势有哪些,市场规模和增速怎么样,有哪些冷门信号,未来 1-2 年最值得关注的 3 个方向是什么

等了几分钟,这个报告就好了,我看了一下,分析很详细,总结也很到位。

可能有小可爱问,这里怎么不是秒杀啊?兄弟,这是 100 份报告,几分钟已经快到离谱了,卧槽。

但是我感觉看着还是有点麻烦,于是让它做了个趋势图表,整体趋势更一目了然了。

这一整套下来也才十分钟,几个积分?

请问阿里爸爸,你们是怎么赚钱的?这积分消耗太离谱了吧?我严重怀疑是不是你们看我帅,给我开了白名单,大家也去试试看看情况,回来告诉我。

我还是不死心,我总觉得有点儿假,工作中经常要做 PPT,自己找模板做费时又费力。

我直接把几千字的产品文档丢给它,让它做成 PPT。

它会先问下我大概想要的风格和页数,然后给我一个大纲,我看了一下,没啥问题就让它开干。

等了一会它就做好了,还能直接在线编辑修改,哪里不满意改哪里。挺方便,但也没啥特殊的。

效果挺在线的,兄弟们感受下。

这个效果的话,这一套下来,花了二十多个积分吧。

刚好 GLM-5.3-Flash 也发布了,我顺手让它也做了一版 PPT。

GLM-5.3-Flash 的效果也还可以。

但 GLM-5.3-Flash 这个任务消耗了 200 多个积分,相比起来,千问办公便宜了十倍。

?不敢相信,再试试水。

前段时间我做了个公众号数据监控平台,功能有了,但 UI 有点丑,我自己又暂时没啥灵感。

我让千问办公帮我重新设计,它会在右侧画布直接给预览效果,哪里有问题也可以直接找到具体元素让它修改,这点和无限画布挺像的。

不过在复杂编程场景下它速度没那么快,而且长时间任务还会出现断掉的情况,但效果还不错。

最后试试这个场景,财务和行政同学应该深有体会,发票。

发票一多就乱,整理起来头都大了,我直接把活丢给它。

500 份发票单据,让它逐份抽出开票方、收票方、金额、税率、日期、科目归类建议、是否缺发票专用章,最后输出 Excel。

我还混了 pdf、docx、txt、csv 好几种格式,塞了些乱七八糟的票据进去,它全都整明白了。

有问题的地方也都识别出来了,该标缺章的标缺章,该提示的提示。

我看有人统计,1000 积分具体能干多少活,也给大家参考一下:

说实话我挺好奇,又快又省这事,它是怎么做到的。

于是我扒了扒它的原理。

千问办公这个标准模式用的是专属版的 Qwen 3.8-Flash,训练阶段就针对多步规划、工具选择、上下文压缩这些办公场景做了调优,Agent 能力直接点满。

推理阶段,千问办公又给模型定制了 Harness 架构,把吞吐效率拉了上去。

也就是说,模型本身更聪明了,干活的路子也更熟了,每一步少绕弯,Token 自然就省下来了。

说实话,我算是 Token 重度用户,日常开发、办公、长时间的自动化工作流,24 小时基本都在烧。

以前玩 Agent 总绕不开一个不可能三角,高性能意味着高成本,低成本就得牺牲智能。

所以经常盯着 Token 算账,生怕一个不小心把钱包干穿了。

而这次模 A 协同优化,算是把这个三角掰开了一个口子。

现在感觉 「Agent 的 Token 焦虑,可能真要翻篇了」

当 95% 的日常任务用标准模式就能又快又好地搞定,积分还花不了几个的时候,Agent 才算真正进入了量大管饱的时代。

不过对于复杂任务,建议你还是开启高级模式吧。但对于绝大多数办公任务,秒杀模式就够了。

你最近用什么 Agent 干活?评论区聊聊。

相关推荐
MetaLite23 分钟前
SpringBoot分页接口怎么设计-pageSize不设上限会发生什么
java·spring boot·后端
元界metalite27 分钟前
SpringBoot整合Redis分布式锁-为什么不能直接DEL
后端
Zane199435 分钟前
你以为的性能瓶颈,未必是真的瓶颈:用 cProfile 找到真凶
后端·python
请你吃div37 分钟前
Node 后端项目 Docker 自动部署教程(GitHub + 宝塔 + Self-hosted Runner)
后端·docker·node.js
Lovefoolself2 小时前
Electron框架使用vue开发跨平台桌面工具应用-后台日志发送到前台和执行导入ZIP
后端
styshoo2 小时前
[NVSentinel] syslog-health-monitor模块分析
后端
Zane19942 小时前
自定义异常该继承 Exception 还是 RuntimeException,就看这一个问题
java·后端
风曳丷2 小时前
10|攻击如何跨越 Context、阶段与时间
后端
tyung2 小时前
znet 数据编解码:字节流怎么变成消息
后端·网络协议·go