Qoder+Qwen3.8Max白嫖测试!这次真牛逼了?和K3比如何?

Qwen 系列的闭源模型,我是真的很少用。虽然它上一轮 3.7 就已经号称国产第一了!

每次上新模型我都得找渠道测试!

这次看了下 Qoder 国内版有 800 多次配额 + 300 Credits,那就拿这个来测了!这个软件它们也搞了挺久了。

Qwen 3.8 Max 这次参数也高达 2.4T,而且有 1M 上下文,基准也是亮眼。

它同时也是多模态模型:

文本输入 ✅

图片理解 ✅

视频理解 ✅

文档理解 ✅

所以,从宏观的角度来看,这是一个值得测试一下的模型!

那么里面到底如何呢?我们只能是上手摸一下才有感觉了。

今天这篇文章就把 Qwen 3.8 Max 弄弄明白!

基准信息

按照惯例,我们要先看看卖家秀。看看官方是怎么描述这个模型的,看看官方基准上是什么样子的,看看竞技场榜单是什么个情况。

官方对这个模型的描述是:

我们迄今为止最强大的模型,然后下周开源!Qwen 3.8-27B 也会和大家见面。

以 2.4T 参数规模树立编程与协作新标杆:

自主编程:超过 10 天的自我演化开发

真实工作,真实成果:跨越数百种职业的生产级交付成果。

长时程掌握:系统级自主规划,结合闭环自适应学习,推动 500+ 轮芯片设计优化和 365 天电商策略制定。

原生多模态智能:视觉不仅是输入------它是规划、执行和自我修正的持续反馈循环。

看起来确实非常厉害!其实我比较关心它这个 27B 的模型,能达到什么水平。本地能有一个不错的模型,比较实在。

另外它们也专门提到了价格:

输入:;输出:6.0 / M tokens;隐式缓存:$0.25 / M tokens

最后看一下基准数据:

从这个图表来看,可以看到 Qwen 3.8 明显比 3.7 强很多,甚至很多方面都比 Opus 4.8 强不少了。比起 Fable 5,在关键基准上还是差好几点意思!比如 SWE 软件工程系列,Claude 家几乎无敌!

当然基准也就是看看而已。要面向基准优化,简直是不要太简单!泛化能力是关键。

再看一眼 arena 的榜单吧:

每次国产模型上线,最喜欢看来吹的就是这个榜单了。这个榜单虽然号称盲测,但是我感觉是被刷的最凶的一个榜单。因为它没有具体标准,所以很好刷。国产模型只要上了,基本上都是榜上有名。

离谱的是 DeepSeek 这种盲人模型,前端能力也排到第八名了,就问你们离不离谱吧! 它凭什么和 Opus 4.8 think 版去比前端啊。

尽管刷得厉害,但是他们还是刷不掉 Opus 5,你们知道什么意思了吧!Opus 5 是真的超级无敌强!

我对这些数据和自媒体短视频啥的吹牛逼视频是一点兴趣都没有。只有我自己测试过,才会有比较直观的体感。

下面就开始实测吧!

我之前不停地给模型创造难题,想出各种刁钻的测试角度,我是花了很多心思的。但是被一些朋友批评了,说每天不一样,不好对比。所以我以后就安稳一些,就比较目前已有的题目就可以了。这样我省事儿,你们也看得清楚。我们已经有非常充分的参考数据了,我已经测了几十个主流模型了。

赛博朋克版清明上河图

这是我原创的例子,特别考验想象力和创造力,以及不同概念的理解和融合能力。这个例子光靠基准训练可没用,必须要有极强的泛化能力才可以。

今天的例子挺多,我就不展示完整的提示词以及评判标准了。这些在 JarvisUni 上都写得非常详细。

我就重点给大家展示结果,然后说一下好的地方,以及不好的地方。

我们的测试方法也很简单,直接打开 Qoder 的 Quest 模式,输入需求,然后一个回车。

测试结果如下:

这个版本,比它自家的 3.7 Max 要好多了,对比可以到 JarvisUni 上查看!然后第一眼的感觉是,这个排列效果和 Opus 4.8 的比较像。它已经学会屋檐上用点弧度了。但是没有 Opus 4.8 的精致。

另外比较好的一点是,它也学会建虹桥了,然后也做出了河流和船只。这么一来内容就丰富了不少,空间感也强了很多。后排的建筑还是抽象了一些,然后飞行器像小蝌蚪,也是有点抽象。这个效果在 Fable 5 和 Opus 5 面前还是弟弟,但是在国产模型中算表现优异了。

在空间感和内容丰富度方面,应该是比 K3 强一些!

3D 台球

这是一个和游戏、3D 建模、空间感、物理特性相关的开放式题目。

我的第一轮需求只会说"我想做一个 3D 台球,你有什么看法"。

Qwen 3.8 Max 很快提出了它的想法,然后直接就问我要怎么做了!

我一般只选它推荐的选项,所以我选了 A!

第一个版本如下:

这个结果粗略看起来还是可以的。至少台球该有的东西都有了。桌面、桌体、桌脚、阴影都有了,6 个口子也算是有点意思了。这个首次效果好像又比 K3 好一点。K3 当时就搞了一个台面,没有孔,没有桌子。

但是这个例子也有问题,球体有时候会乱飞,动力效果不是太好,不能旋转视角,没有音效,没有菜单。整体来说非常简陋。瞄准方面也做的不是很好。

所以就有了第二轮对话:

我首先是问了它有什么可以提升的方法。它建议提升音效、目标球预测、库边斜面、袋口碰撞。这几个角度都是非常准确的。然后我又补充了一些我的需求,接下来就看它的升级能力了。

接下来...就卡住了...一直请求超时!

终于,改完了:

整体画面感还不错,球桌、地板和地毯都有了。然后左上角添加了不同视角。

按它的说法是改进了:瞄准系统增强、音效系统、台球室场景、多视角切换、落袋特写、桌下回球动画、球桌建模细节。

感觉改了还是挺多的。但是属于改越多 Bug 越多,真正的体验提升非常有限!

你们看这个建模细节,莫名其妙的两根杆子,然后洞口都被堵住了,细节基本上没法看了。还有一个问题,一旦播放到落袋特写之后,它居然不会把画面切回去,什么弱智啊,你让我第二杆怎么打?

俯瞰视图也是有点问题的。聪明的模型知道要把灯隐藏一下。弱智模型就是提交这种半成品,完全不管用户体验。

奇了怪了,就是一个开放题,K3 和 Qwen 3.8 表现都不是很好。为了把它们调到能用,还需要很多时间,我把该说的都说了,最后体验还是不好。Opus 5 一轮就把整体体验做好了,后面就真的只是优化细节而已。

这个例子我会继续优化一下,看能调到什么样子。我会把最终优化好的结果放到 JarvisUni 上面!

甲维斯的车库

这是一个 3D 和 UI 克隆的项目。

主要考验模型的多模态能力、通过图片复刻网页的能力,以及世界知识和 3D 建模的能力。

这个项目整整跑了两个小时,从 8 点半跑到 10 点半!!!!!

结果如下:

首先说好的地方,这个 UI 本身其实挺不错的。结构非常稳健,功能分块清晰,所有功能点都是正常的。

但是......你看它这个建模......捷安特长这个样子么??

特斯拉长这个样子:

建模是彻底失败的,另外网页复刻其实也是失败的。

原图是这样的:

Qwen 3.8 在配色、字体、布局细节上都是没有做到高精度还原的。尤其是布局方面,私自做了很多改动。这一点上 K3、Opus、GPT 5.6 都要比它强好多。

所以 3D 建模和网页复刻,它表现并不是太好!

而 K3 这个例子是表现得特别出色!

当然,从这个例子我们也可以看到,Qwen 3.8 Max 也能不停地截图来自我纠正了,它这种纠错机制已经建立起来了。可惜它这方面的能力有限,即便有这种机制,但是它截图后理解不了,理解了又做不到,那也是无解题。

天文机械表

这是一个烧脑的题目,当前也涉及到视觉呈现。同时涉及到了月相,日落日出,时区等问题。它不能实时联网获取,需要自己设计好算法进行计算。其中的单个需求都不是特别难。但是多个需求叠加在一起,就会很难。因为模型的注意力有限,脑力不够,就会漏出马脚。

跑到这个例子的时候,超时的问题已经非常明显了!大概 6 分钟断一次,断了好多次,什么都没有!我已经点了无数次继续了,到写文章的时候还是没有出效果,半天过去了,我等不了它了。 每次这种时候我就想骂人!你基准吹得再牛逼有毛用。

游戏复刻测试

按照惯例,我也做了游戏复刻的测试,主要是经典游戏《坦克大战》和《超级玛丽》!这些都是老游戏了,其实网上是有开源项目的。我就测试它们理解和重构的能力。我试过很多模型,它们都是不会直接照抄源代码的,这一点可以放心。主要是看它们抄核心规则的能力!

坦克大战结果如下:

我试了下,整体复刻效果不错!

因为我提示词里面特别强调了最好 1:1 复刻,Qwen 3.8 是完全没有道德和版权约束,果断就去抄,去解析地图了。所以地图做到了 1:1 还原,游戏机制基本也是对的。

刚开始它出坦克的逻辑有问题,也是它自己修复的。

最后就是正常能玩第一轮,但是到了第二轮就出现问题了,一开始就游戏结束,一开始就游戏结束。可能是哪个标志位没有处理好。这就给人不太靠谱的感觉。

下面是《超级玛丽》的效果:

我大致体验了一下,能玩的,基本上的逻辑都实现了。刚开始一部分的地图还原度较高,后面的差异比较大。然后比较大的一个 Bug 是,超级玛丽的跳跃能力惊人,直接顶天,这个属于自我发挥了。只能说非常有趣,但是不够还原。另外,角色和画面风格方面还是差点意思的!

因为它还在跑,我还在等...等的累啊。最终稿结果可能还会有所优化,文章里我就写这么多了。

这一趴整体不错,和 K3 差不多的感觉,都是能玩的。看来,这一波模型已经都攻克这两个游戏了,只是细节上还没法做到特别好。

所以差异都在细节了,测了一个上午,快瘫了,这部分就不展开了说了,我会全部同步到网站上。

网站上的对比参考数据非常非常多,几乎所有主流模型的主流版本我都测试了!

网址:topai.jarvisuni.com/

最后做个简单总结

我现在几乎不看网上那些广告稿子了,所以不确定它们是怎么宣传的,有哪些虚假和真实的成分。我反正是实测的,我也不收广告费,我也不按它们设定的特训例子进行测试。我就按自己的例子和思路来测试。

我的整体感觉是"更大的大模型"能力上确实会有明显的提升,这次 Qwen 3.8 明显比 Qwen 3.7 好不少,前端能力、逻辑能力、智能体的规划和纠错能力都提升明显。

在整体级别上应该是和 K3 差不多级别的,有些例子的首轮结果甚至比 K3 还好。但是它在 3D 建模、UI 复刻等方面明显不如 K3。K3 我是烧了 30 亿 Token 了,体验还是非常深入的。Qwen 3.8 我大概也测了 6 个例子了,整体感觉还不错,但是还是有点"糙" ,这个就像打 CS 的鼠标一样,它能打,但是手感还是不够细腻。

如果以顶级模型的标准来要求它的话,它对需求的理解能力、对最优开发路径的规划能力、对不常见问题的推理能力,以及多轮需求下的修改能力,这些方面还有很大的进步空间。

还有一点要稍微吐槽一下,Qoder Quest 都已经可以过周年庆了,体验依旧不是很好。

展开思考过程很卡,或者干脆点了没反应,导致整个界面卡死。然后对话右键居然无法打开项目目录,你学谷歌是吧?你这很危险!然后中间的超时等待体验不是很好,还出现了整个软件卡死的情况。这方面远不如 Codex 和 Claude 的体验,连 Zcode 都不如。智谱的 Zcode 现在也是疯狂更新,像模像样了,特别适合开发者。

Qwen 做开源,大家都是喜大普奔,但是做产品,无论是模型还是软件,都差点意思。

另外的感受就是,现在的模型都越来越大,智能体能力越来越强,越来越聪明,很多常见问题都是小 case 了。但是也面临思考时间越来越长,Tokens 消耗越来越高!你们看,光几个测试 800 次调用快干完了。

真的要干活的话,套餐和 Tokens 成本还挺高!别听别人吹,实际用还是有很多维度要考虑的。

有的时候,不求最强,只要便宜够用。有的时候追求稳定,有的时候需要攻坚!目前看来,国内主要就围绕 GLM、Kimi、DeepSeek、Qwen 了。其它家已经掀不起什么风浪了!

好的坏的我都说了,大概就是这个样子,仅供参考!

相关推荐
一个数据大开发1 小时前
Skill、Tool、SOP、MCP 文章合集
大数据·人工智能·知识图谱
紫禁玄科1 小时前
公共WiFi流量安全全解析
网络·人工智能·web安全·网络安全·系统安全
梦想三三1 小时前
LangChain RAG PDF 智能问答实战:用 Streamlit 构建本地知识库(完整代码)
人工智能·python·langchain·大模型·rag
不加辣椒1 小时前
第11章:性能优化与成本控制
人工智能
xcLeigh1 小时前
KingbaseES 的卢智能运维体架构深度拆解
运维·数据库·人工智能·ai·架构·ffmpeg·智能体
GuWenyue1 小时前
不用第三方SDK!Vue3原生Fetch实现DeepSeek流式输出,90%前端都会踩的分片解析坑一次性解决
前端·人工智能·llm
水如烟1 小时前
孤能子视角:EIS分析框架的演化(上)——元三力·五要点·六线探针:让关系场显影
人工智能
阿里云大数据AI技术1 小时前
数据集成 Agent 最佳实践(一):单表离线同步:一句话建好每日入仓任务
人工智能
恣逍信点2 小时前
《凌微经 · 理悖相涵》导论:“我思”事实——知识理论之根基
人工智能·科技·学习·生活·量子计算·交友·哲学