大家好,我是老刘
前两天老刘花了一杯咖啡的钱,买了千问token plan的最低档,准备测试一下Qwen 3.8 max在我的Flutter项目里能不能当主力。
任务很简单:我已经开发完了三个独立的数据处理和业务逻辑模块,现在只需要把它们接入主流程,让主流程能调用它们。
就这么个活儿,Qwen 3.8 max干了20分钟,直接把我的5小时额度烧光了,然后工作还没完成。停在了一半的地方。

我换成opencode的免费模型,同样的任务,3分17秒,顺利完成。
不可思议是不是?
这完全不是一个对标顶级模型应该有的表现。
今天老刘就来聊聊,这20分钟里到底发生了什么,以及我们选主力模型时最容易踩的那个坑。
先说句公道话,Qwen 3.8 max的跑分是真能打
这里要先说明白,老刘说的测评数据不是那种公开题目可以刷榜的测评。
那种测评我基本已经不看了,因为吃过几次亏:评分很高,但实际工作能力很差。
我现在主要看题目不公开的,比如LiveBench。
Qwen 3.8 max在这类测评中得分很高,说明真实能力还是可圈可点的。

可以看到,Qwen 3.8 max的综合能力仅次于claude fable 5和gpt-5.6这样的顶级模型。
单看编程能力,也非常好:

闭源题目的测评具有比较高的参考意义,在一定程度上能体现模型在指定科目上的泛化能力。
但要注意这个是参考价值,因为测评和真实项目之间还是存在着比较大的差异的。
跑分为啥救不了你的项目?
场景对不上
老刘主要写Flutter代码,但目前主流编程能力测评里,基本没有用Flutter的。
你拿一个考Python和Web的分数,去预测它写Flutter的水平,这就像拿驾照科目一的成绩去判断一个人会不会开山路。
用法对不上
老刘的日常开发流程是这样的:先用顶级模型把一个需求拆成多个功能点,再用中档的主力模型逐个开发每个功能点的代码。
这个用法其实介于LiveBench的coding和agentic coding之间。
也就是说,我这个功能点的开发,用测评里的哪个维度去选模型都不合适。即使用平均分,偏差也很大。
所以测评的分数主要还是一个参考,最终还是要放到项目里实际跑一跑。
老刘这次就是真刀真枪地跑了。
Qwen 3.8 max还是是干活太认真了
如果用一个字总结Qwen 3.8 max在我项目里的表现,就是啰嗦。
看它的思考过程就能发现问题:思考链路特别长,如果每一轮都把上一轮的思考加入输入,token很快就消耗光了。
这一点从LiveBench的性价比排名中也能得到印证:

单看简单编程的性价比,Qwen 3.8 max的排名并不靠前。
所以老刘的结论是:Qwen 3.8 max的能力确实不错,但代价是需要消耗大量的token才能完成同样的任务。
这就好比招了一个能力很强的员工,但他干一个小时的活儿要烧别人一天的工资。
从测评看,它在逻辑思考、数据处理等方面的性价比明显比编程方面高。让它当编程主力,可能属于专业不对口。
有意思的是,当前这篇文章的错字修改、排版优化、文章头尾固定内容的添加、发布到github等工作都是老刘用token plan中仅剩的额度,通过Qwen 3.8 max完成的。总体消耗远小于开发任务。
这也从侧面证明了老刘的观点,Qwen 3.8 max似乎更适合非编程类任务。
一杯咖啡的钱,买了个教训
说实话,这次测试老刘自己也有点尴尬。
我买这个最低档的token plan,本来是想横向测试一下各家订阅哪个更好用,后续也会给大家汇报其他厂商订阅的使用效果。
结果千问这边,第一轮长对话还没跑完,额度就阵亡了。
这里还是要吐槽一句:虽然最低档只要一杯咖啡的钱,但如果5小时的限额连一轮长对话都无法完成,那它在实际工作中就没有任何意义。
特别是在agnes、商汤、Openrouter、opencode等很多厂商都提供了慷慨的免费额度的时候,这种低档位订阅完全不具备在开发场景中的实用价值。
最后说两句
这次翻车让老刘更加确信一件事:
跑分是给外人看的,账单是给自己看的。
选主力模型的时候,除了要看榜单的能力排名,还要看一看完成每个任务需要花多少钱。
把这个问题想清楚了,再去看跑分,顺序千万别反了。
最后老刘也想问问大家:你有没有被跑分骗过?你现在选主力模型,最看重的是什么?欢迎评论区聊聊。
🤝 如果看到这里的同学对客户端或者Flutter开发感兴趣,欢迎联系老刘,我们互相学习。
🎁 私信免费领老刘整理的《Flutter开发手册》,覆盖90%应用开发场景。可以作为Flutter学习的知识地图。
💬 : laoliu_dev
📂 老刘也把自己历史文章整理在GitHub仓库里,方便大家查阅。