Qwen 系列的闭源模型,我是真的很少用。虽然它上一轮 3.7 就已经号称国产第一了!
每次上新模型我都得找渠道测试!

这次看了下 Qoder 国内版有 800 多次配额 + 300 Credits,那就拿这个来测了!这个软件它们也搞了挺久了。
Qwen 3.8 Max 这次参数也高达 2.4T,而且有 1M 上下文,基准也是亮眼。
它同时也是多模态模型:
文本输入 ✅
图片理解 ✅
视频理解 ✅
文档理解 ✅
所以,从宏观的角度来看,这是一个值得测试一下的模型!
那么里面到底如何呢?我们只能是上手摸一下才有感觉了。
今天这篇文章就把 Qwen 3.8 Max 弄弄明白!
基准信息
按照惯例,我们要先看看卖家秀。看看官方是怎么描述这个模型的,看看官方基准上是什么样子的,看看竞技场榜单是什么个情况。
官方对这个模型的描述是:
我们迄今为止最强大的模型,然后下周开源!Qwen 3.8-27B 也会和大家见面。
以 2.4T 参数规模树立编程与协作新标杆:
自主编程:超过 10 天的自我演化开发
真实工作,真实成果:跨越数百种职业的生产级交付成果。
长时程掌握:系统级自主规划,结合闭环自适应学习,推动 500+ 轮芯片设计优化和 365 天电商策略制定。
原生多模态智能:视觉不仅是输入------它是规划、执行和自我修正的持续反馈循环。
看起来确实非常厉害!其实我比较关心它这个 27B 的模型,能达到什么水平。本地能有一个不错的模型,比较实在。
另外它们也专门提到了价格:
输入:;输出:6.0 / M tokens;隐式缓存:$0.25 / M tokens
最后看一下基准数据:

从这个图表来看,可以看到 Qwen 3.8 明显比 3.7 强很多,甚至很多方面都比 Opus 4.8 强不少了。比起 Fable 5,在关键基准上还是差好几点意思!比如 SWE 软件工程系列,Claude 家几乎无敌!
当然基准也就是看看而已。要面向基准优化,简直是不要太简单!泛化能力是关键。
再看一眼 arena 的榜单吧:

每次国产模型上线,最喜欢看来吹的就是这个榜单了。这个榜单虽然号称盲测,但是我感觉是被刷的最凶的一个榜单。因为它没有具体标准,所以很好刷。国产模型只要上了,基本上都是榜上有名。
离谱的是 DeepSeek 这种盲人模型,前端能力也排到第八名了,就问你们离不离谱吧! 它凭什么和 Opus 4.8 think 版去比前端啊。
尽管刷得厉害,但是他们还是刷不掉 Opus 5,你们知道什么意思了吧!Opus 5 是真的超级无敌强!
我对这些数据和自媒体短视频啥的吹牛逼视频是一点兴趣都没有。只有我自己测试过,才会有比较直观的体感。
下面就开始实测吧!
我之前不停地给模型创造难题,想出各种刁钻的测试角度,我是花了很多心思的。但是被一些朋友批评了,说每天不一样,不好对比。所以我以后就安稳一些,就比较目前已有的题目就可以了。这样我省事儿,你们也看得清楚。我们已经有非常充分的参考数据了,我已经测了几十个主流模型了。
赛博朋克版清明上河图
这是我原创的例子,特别考验想象力和创造力,以及不同概念的理解和融合能力。这个例子光靠基准训练可没用,必须要有极强的泛化能力才可以。
今天的例子挺多,我就不展示完整的提示词以及评判标准了。这些在 JarvisUni 上都写得非常详细。
我就重点给大家展示结果,然后说一下好的地方,以及不好的地方。
我们的测试方法也很简单,直接打开 Qoder 的 Quest 模式,输入需求,然后一个回车。

测试结果如下:

这个版本,比它自家的 3.7 Max 要好多了,对比可以到 JarvisUni 上查看!然后第一眼的感觉是,这个排列效果和 Opus 4.8 的比较像。它已经学会屋檐上用点弧度了。但是没有 Opus 4.8 的精致。

另外比较好的一点是,它也学会建虹桥了,然后也做出了河流和船只。这么一来内容就丰富了不少,空间感也强了很多。后排的建筑还是抽象了一些,然后飞行器像小蝌蚪,也是有点抽象。这个效果在 Fable 5 和 Opus 5 面前还是弟弟,但是在国产模型中算表现优异了。
在空间感和内容丰富度方面,应该是比 K3 强一些!
3D 台球
这是一个和游戏、3D 建模、空间感、物理特性相关的开放式题目。
我的第一轮需求只会说"我想做一个 3D 台球,你有什么看法"。

Qwen 3.8 Max 很快提出了它的想法,然后直接就问我要怎么做了!
我一般只选它推荐的选项,所以我选了 A!
第一个版本如下: 
这个结果粗略看起来还是可以的。至少台球该有的东西都有了。桌面、桌体、桌脚、阴影都有了,6 个口子也算是有点意思了。这个首次效果好像又比 K3 好一点。K3 当时就搞了一个台面,没有孔,没有桌子。
但是这个例子也有问题,球体有时候会乱飞,动力效果不是太好,不能旋转视角,没有音效,没有菜单。整体来说非常简陋。瞄准方面也做的不是很好。
所以就有了第二轮对话:

我首先是问了它有什么可以提升的方法。它建议提升音效、目标球预测、库边斜面、袋口碰撞。这几个角度都是非常准确的。然后我又补充了一些我的需求,接下来就看它的升级能力了。
接下来...就卡住了...一直请求超时!
终于,改完了:

整体画面感还不错,球桌、地板和地毯都有了。然后左上角添加了不同视角。
按它的说法是改进了:瞄准系统增强、音效系统、台球室场景、多视角切换、落袋特写、桌下回球动画、球桌建模细节。
感觉改了还是挺多的。但是属于改越多 Bug 越多,真正的体验提升非常有限!

你们看这个建模细节,莫名其妙的两根杆子,然后洞口都被堵住了,细节基本上没法看了。还有一个问题,一旦播放到落袋特写之后,它居然不会把画面切回去,什么弱智啊,你让我第二杆怎么打?

俯瞰视图也是有点问题的。聪明的模型知道要把灯隐藏一下。弱智模型就是提交这种半成品,完全不管用户体验。
奇了怪了,就是一个开放题,K3 和 Qwen 3.8 表现都不是很好。为了把它们调到能用,还需要很多时间,我把该说的都说了,最后体验还是不好。Opus 5 一轮就把整体体验做好了,后面就真的只是优化细节而已。
这个例子我会继续优化一下,看能调到什么样子。我会把最终优化好的结果放到 JarvisUni 上面!
甲维斯的车库
这是一个 3D 和 UI 克隆的项目。
主要考验模型的多模态能力、通过图片复刻网页的能力,以及世界知识和 3D 建模的能力。
这个项目整整跑了两个小时,从 8 点半跑到 10 点半!!!!!
结果如下:

首先说好的地方,这个 UI 本身其实挺不错的。结构非常稳健,功能分块清晰,所有功能点都是正常的。
但是......你看它这个建模......捷安特长这个样子么??
特斯拉长这个样子:

建模是彻底失败的,另外网页复刻其实也是失败的。
原图是这样的:

Qwen 3.8 在配色、字体、布局细节上都是没有做到高精度还原的。尤其是布局方面,私自做了很多改动。这一点上 K3、Opus、GPT 5.6 都要比它强好多。
所以 3D 建模和网页复刻,它表现并不是太好!
而 K3 这个例子是表现得特别出色!
当然,从这个例子我们也可以看到,Qwen 3.8 Max 也能不停地截图来自我纠正了,它这种纠错机制已经建立起来了。可惜它这方面的能力有限,即便有这种机制,但是它截图后理解不了,理解了又做不到,那也是无解题。
天文机械表
这是一个烧脑的题目,当前也涉及到视觉呈现。同时涉及到了月相,日落日出,时区等问题。它不能实时联网获取,需要自己设计好算法进行计算。其中的单个需求都不是特别难。但是多个需求叠加在一起,就会很难。因为模型的注意力有限,脑力不够,就会漏出马脚。

跑到这个例子的时候,超时的问题已经非常明显了!大概 6 分钟断一次,断了好多次,什么都没有!我已经点了无数次继续了,到写文章的时候还是没有出效果,半天过去了,我等不了它了。 每次这种时候我就想骂人!你基准吹得再牛逼有毛用。
游戏复刻测试
按照惯例,我也做了游戏复刻的测试,主要是经典游戏《坦克大战》和《超级玛丽》!这些都是老游戏了,其实网上是有开源项目的。我就测试它们理解和重构的能力。我试过很多模型,它们都是不会直接照抄源代码的,这一点可以放心。主要是看它们抄核心规则的能力!
坦克大战结果如下:

我试了下,整体复刻效果不错!
因为我提示词里面特别强调了最好 1:1 复刻,Qwen 3.8 是完全没有道德和版权约束,果断就去抄,去解析地图了。所以地图做到了 1:1 还原,游戏机制基本也是对的。
刚开始它出坦克的逻辑有问题,也是它自己修复的。
最后就是正常能玩第一轮,但是到了第二轮就出现问题了,一开始就游戏结束,一开始就游戏结束。可能是哪个标志位没有处理好。这就给人不太靠谱的感觉。
下面是《超级玛丽》的效果:

我大致体验了一下,能玩的,基本上的逻辑都实现了。刚开始一部分的地图还原度较高,后面的差异比较大。然后比较大的一个 Bug 是,超级玛丽的跳跃能力惊人,直接顶天,这个属于自我发挥了。只能说非常有趣,但是不够还原。另外,角色和画面风格方面还是差点意思的!
因为它还在跑,我还在等...等的累啊。最终稿结果可能还会有所优化,文章里我就写这么多了。
这一趴整体不错,和 K3 差不多的感觉,都是能玩的。看来,这一波模型已经都攻克这两个游戏了,只是细节上还没法做到特别好。
所以差异都在细节了,测了一个上午,快瘫了,这部分就不展开了说了,我会全部同步到网站上。

网站上的对比参考数据非常非常多,几乎所有主流模型的主流版本我都测试了!
最后做个简单总结
我现在几乎不看网上那些广告稿子了,所以不确定它们是怎么宣传的,有哪些虚假和真实的成分。我反正是实测的,我也不收广告费,我也不按它们设定的特训例子进行测试。我就按自己的例子和思路来测试。
我的整体感觉是"更大的大模型"能力上确实会有明显的提升,这次 Qwen 3.8 明显比 Qwen 3.7 好不少,前端能力、逻辑能力、智能体的规划和纠错能力都提升明显。
在整体级别上应该是和 K3 差不多级别的,有些例子的首轮结果甚至比 K3 还好。但是它在 3D 建模、UI 复刻等方面明显不如 K3。K3 我是烧了 30 亿 Token 了,体验还是非常深入的。Qwen 3.8 我大概也测了 6 个例子了,整体感觉还不错,但是还是有点"糙" ,这个就像打 CS 的鼠标一样,它能打,但是手感还是不够细腻。
如果以顶级模型的标准来要求它的话,它对需求的理解能力、对最优开发路径的规划能力、对不常见问题的推理能力,以及多轮需求下的修改能力,这些方面还有很大的进步空间。
还有一点要稍微吐槽一下,Qoder Quest 都已经可以过周年庆了,体验依旧不是很好。
展开思考过程很卡,或者干脆点了没反应,导致整个界面卡死。然后对话右键居然无法打开项目目录,你学谷歌是吧?你这很危险!然后中间的超时等待体验不是很好,还出现了整个软件卡死的情况。这方面远不如 Codex 和 Claude 的体验,连 Zcode 都不如。智谱的 Zcode 现在也是疯狂更新,像模像样了,特别适合开发者。
Qwen 做开源,大家都是喜大普奔,但是做产品,无论是模型还是软件,都差点意思。

另外的感受就是,现在的模型都越来越大,智能体能力越来越强,越来越聪明,很多常见问题都是小 case 了。但是也面临思考时间越来越长,Tokens 消耗越来越高!你们看,光几个测试 800 次调用快干完了。
真的要干活的话,套餐和 Tokens 成本还挺高!别听别人吹,实际用还是有很多维度要考虑的。
有的时候,不求最强,只要便宜够用。有的时候追求稳定,有的时候需要攻坚!目前看来,国内主要就围绕 GLM、Kimi、DeepSeek、Qwen 了。其它家已经掀不起什么风浪了!
好的坏的我都说了,大概就是这个样子,仅供参考!