这两款模型在纸面上看起来完全相同。同样的密集27B,同样的混合架构,同样的262,144令牌上下文窗口,同样的Apache 2.0许可,同样的视觉编码器。Qwen3.6-27B于四月发售,赢得了一个社区鲜少称呼的昵称:"本地发展的最佳点"。Qwen3.8-27B上周发布,在不到一天内以1338分和761条评论领跑Hacker News(帖子)。同一个骨架,相差四个月,但升级问题并不像"新车赢"那么简单。厂商的基准表与开发者实际运行每个模型时的感受之间的差距才是有趣的故事,也是全部故事。
以下是两代人之间发生了哪些变化,哪些没有,以及你应该真正选择哪一代。
两个版本张专辑,相隔四个月
Qwen3.6-27B 于2026年4月22日推出,名为旗舰级编码,采用27B密集模型。其显著成就是在所有主要编码基准测试中,以极低参数击败了之前的开源旗舰------397B参数Qwen3.5-397B-A17B MoE。那一刻,Qwen3.6世代使"密集27B"成为一个严肃的代理编码类别,与其MoE兄弟Qwen3.6-35B-A3B并列。发布讨论串获得了993分,共有458条评论,通常的怀疑情绪依然存在("对与Opus相当的27B型号有些怀疑......"但该模型依然赢得了应有的认可。到六月,一个名为"Qwen 3.6 27B是本地开发的最佳点"的帖子已突破1192分,有人在二手24GB显卡上运行。
Qwen3.8-27B于2026年8月14日发布,被宣布为Qwen开放型号家族中最强大的一代。在这期间,3.7 代主要作为 API 型号存在(Qwen 3.7-Plus 出现在 Qwen 自家的对比表中),因此 3.8-27B 是首个直接继承 3.6 的开放权重 27B。模型卡列出了与3.6版本相同的架构基础,然后呈现出看起来像是整代飞跃而非点数发布的基准跳跃。
基准表实际显示的内容
Qwen的3.8卡在同一个线束(Claude Code线束,温度1.0,256K上下文)中重新评估了这两种型号,这使得这些数据是最接近苹果的。全部由供应商运营,所以请把它们当作方向性:
- 终端台数2.1:73.0,较 Qwen3.6-27B的63.4(表)有所上升。
- SWE-bench Pro:61.7,较53.5有所上升。
- **DeepSWE 1.1:42.2,较13.3有所上升。**这是最大的相对跳跃,尽管注意Qwen3.6在DeepSWE 1.1发布时并未被评估,因此部分差距是后续测量更严格的基准。
- LiveCodeBench v6:90.3,较83.9提升。
- **OSWorld-Verified:84.3,较63.9有所上升。**这属于电脑使用领域,且在同一表中超过了Opus 4.6 Max的72.7。
- WebArena认证:64.8,较48.8有所提升。AndroidWorld:81.9,较70.3.3%有所上升。
- GPQA Diamond:89.2,较87.8上升,虽然有较小但合理的推理提升。
这些行的模式并不是"各方面都稍微强一点"。这在智能和计算机使用任务上是巨大的飞跃,但在简单推理方面则有较小的提升。Qwen3.8-27B被训练以完成多步骤任务,基准测试集体现了这一点:终端工作、浏览器工作、桌面工作。这些任务比前作落后20分。
建筑结构未曾改变。训练确实有效。
这个比较中最被低估的事实是:打开两个配置文件,它们几乎一模一样。Qwen3.8-27B的config.json显示,64层,隐藏大小5120,采用与Qwen3.6-27B配置相同的Gated DeltaNet线性注意力块与全注意力块交替的混合布局,相同的视觉编码器深度和音色尺寸,相同的262,144个最大位置嵌入,以及与Qwen3.6-27B配置相同的多标记预测(MTP)配置。model_type: qwen3_5
所以3.6到3.8的差距并不是新的架构。这是后期训练:更多数据、更强的能动轨迹强化学习,以及更谨慎地处理环境反馈。Qwen明确表示,称3.8是一个"设计用来更可靠地完成复杂多步骤任务的模型"。身体一样,旋律变。这有两个重要原因:一是收益只转移到培训重点所在(代理,而非常识),二是部署故事保持不变,显存计算相同,引擎相同。

它们在日常使用上实际上有所不同
撇开基准不谈,这也是两代人分歧最大的地方,社区讨论帖对此有很好的记录。
认为控制是最大的工作流程变革。 Qwen3.6默认是思考模式,可以根据请求切换到非思考模式,并且引入(保留了之前代理工作回合的推理),但它是选择加入的(博客)。Qwen3.8默认也保持思维开启,但增加了官方层级(默认加和)来调节推理深度,并且所有工作负载默认开启(模型卡)。对于任何构建代理的人来说,这是真正的行为变化:3.8 版本在整个对话中承载完整的推理追踪,这提高了一致性和 KV 缓存的重用,同时也消耗了更多的令牌。preserve_thinking``reasoning_effort``xhigh``medium``low``preserve_thinking
社区评价从"甜蜜点"变成了"过度思考者"。 在3.6版本方面,开发者反馈该型号适合他们的硬件:一位用户自发布以来一直用3090和24GB显存运行,MTP显示每秒50-70个令牌,"其实你真的不需要那么多"(评论);另一台则在32GB上以Q4量化运行256K上下文(评论)。在3.8版本中,类似的实际操作报告也伴随着摩擦:Simon Willison在M5 Max MacBook Pro上运行,看到它在单个SVG上花费了21分钟和22,276个推理标记(评论)。一位插件开发者发现,在该模式下"过度思考,写出糟糕的粗糙代码",在完成前不断切换"FINAL FINAL APPROACH"和"OK TRULY FINAL APPROACH"(评论)。聊天模板也需要直接修复,社区通过Qwen-Fixed-Chat-Templates解决了这个问题(评论)。xhigh
显存的计算变得更难,而不是更容易。 参数数量相同,但3.8的长上下文需求非常激进:有报告称仅32K上下文就消耗了2.5GB显存,128K即使用量子化为Q4_0的V投影也无法安装(评论)。在20GB的卡上,同一个报告者在3万上下文下大约每秒看到30个令牌。在5090上,另一位用户报告通过ninfer引擎大约每秒138个令牌,大约是他们简单llama.cpp设置的两倍(评论)。3.8的速度高度依赖发动机,就像3.6版本一样。
生态系统也在变化。 3.6 在 Unsloth 的社区 GGUF 中几小时内就发货了(仓库)。3.8 版本从实验室发布了官方的 FP8 量化,声称的性能与 bf16 原版(FP8 仓库)几乎相同,此外还有托管的 Qwen Cloud 版本,默认支持 1M 上下文和内置工具(概述)。两者今天都出现在奥拉玛上,且。qwen3.6:27b``qwen3.8:27b
收养人数本身就说明了一切。Qwen3.6-27B自发布四个月以来,Hugging Face的下载量已突破700万次。Qwen3.8-27B 首日(型号页面)下载量约为92,000次,点赞接近9,700。那个首日的峰值就是HN的头版效应,它并不会告诉你该用哪个模型。线索会有。
Qwen 3.8 27B 与 Qwen 3.6 27B:实用比较
- **能力:**Qwen 3.8 胜出,而且在对经纪人来说非常重要的地方。Terminal Bench 2.1 的 +10,OSWorld-Verified 的 +20,WebArena 的 +16,AndroidWorld 的 +12。从简单的推理和知识角度看,差距只有几点。
- 行为: Qwen 3.6 是更平静的型号。它会思考,但不会陷入恶性循环,社区也把它当作日常驱动。Qwen 3.8 默认模式下会过度思考,编写过于复杂的代码,并且需要按任务管理推理工作量。
xhigh - 思维控制: Qwen 3.6 提供了可选项的"开/关思考"功能。Qwen 3.8 默认增加了层级并保持保持思维状态,这改变了每次对话的代币支出和 KV 缓存行为。
preserve_thinking``reasoning_effort - **上下文与显存:**262K原生上下文和权重大小完全相同,但现实报告显示3.8版本在同一硬件上的上下文计算更为严格。买显卡前一定要确认。
- **生态系统:**Qwen 3.6 包含四个月经过实战考验的社区量化分析和修复。Qwen 3.8 有官方的 FP8,即将推出的托管 API 和 1M 上下文,以及新的模板漏洞。
- **价格:**Apache 2.0 都没有。成本是硬件,同样是27B的占地面积。
谁应该使用哪个
如果你用的是24GB卡,你需要详细的上下文,依赖工具调用,日常工作是编程辅助:**Qwen 3.6 27B仍然是实用的选择。**这是社区最终采用的模式,固定模板、已知的量化行为,以及二手硬件上每秒50-70个代币的报告。
如果你正在构建代理系统、计算机使用工作流程、浏览器自动化,或任何终端和桌面能力比聊天质量更重要的项目:Qwen 3.8 27B就是升级版,而OSWorld的20点跳跃正是原因。 为摩擦做好准备:从推理努力开始,预算推理代币如金钱,使用固定聊天模板进行工具调用。在5090级显卡或拥有大量统一内存的Mac上,它的体积确实令人印象深刻。medium
老实总结:3.8是更好的型号,3.6是更简单的型号。一个是需要被驯服的标杆冠军,另一个是经过验证的日常代步车。如果你的工作量是代理,升级吧。如果你的工作量是聊天和代码完成,硬件不大,你其实并没有像数字上显示的那么多缺失。
我的看法和我使用的清单
坦白说:我已经通过社区量化构建和工具链运行了Qwen 3.6 27B和Qwen 3.8 27B,但我还没把生产工作负载定在3.8,它本周刚发布。上面的基准行是Qwen自己的数据,在单一工具框架中评估,社区报告虽为轶事性但一致。我的观点是对公开记录的解读,而非长期可靠性报告。
在评估你自己堆栈的任一模型时,请使用以下清单:
- 在两个模型上执行相同的三个任务,包括一个长上下文任务和一个工具调用任务。基准测试表不会显示模板的漏洞。
- 衡量每个任务的代币花费,而不仅仅是时间。3.8模式可以花费20,000代币,而3.6版本花费2,000代币,这改变了延迟和成本。
xhigh - 拉之前先用你的实际上下文长度计算显存。破坏你卡牌的是上下文,而不是权重。
- 按工作量计算推理的销钉。默认是针对困难任务,而不是所有请求。
xhigh - 用你自己的工具定义检查聊天模板的行为,因为3.8版本的库存模板存在已知问题。
Qwen 在四个月内已发布了两款 27B 型号,它们共享架构,标志着代理能力的巨大飞跃。升级是真实的,但这是客服人员的升级,不是聊天升级。这是一个有用的区分,因为该系列的下一个版本很可能已经在培训阶段,而其基准表与实际工作负载之间的差距才是唯一重要的数字。