这个本地模型,让我 token 自由了

最近几个月我发现,我订阅的 token 套餐越来越多,但是 token 好像越来越不够用。

也不知道是项目多了,还是各大厂商给的 token 缩水了。

反正钱没少花,token 焦虑反而越来越大了。

直到前几天,阿里发了 Qwen3.8-27B,官方跑分直接叫板 Claude Opus 4.6,还几乎全部是在 Claude Code 上跑出来的,而且开源,随便下载,不要钱。

热度也很夸张。发布 48 小时冲上 Hugging Face 趋势榜第一,当天在 Hacker News 登顶,LM Studio 上线 38 分钟下载破万,Ollama 单渠道 5 天 36 万下载。编程工具 Cline 宣布,上线仅 4 天,它就成了 Cline 开发者选得最多的本地模型。CNBC 和 The Information 也都专门做了报道。

Ollama,vLLM,SGLang 全是 day-0 支持,连 Cloudflare 都第一时间把它收进了 Workers AI 模型库,AMD 官方也出了 Ryzen AI Max 的部署教程。这个待遇,今年在开源模型里真没见过几次。

这激发了我的兴趣,索性直接把它装进了我的 Mac,实测下它到底有没有网上评价的那么好。

1. 先说清楚它是什么

Qwen3.8-27B,270 亿参数,稠密模型,啥意思呢,每生成一个字,270 亿参数全员上场干活,不像有些模型只派一小队人。Apache 2.0 协议开源,权重随便下载,商用也不要钱。官方给这代定的调子叫「A New Bar for Coding and Cowork」,主打就是编程和办公协作。

它还有个 2.4 万亿参数的大哥 Qwen3.8-2.4T-A95B,这次权重也一起放出来了,这是 Qwen 第一次把 Max 级别的模型开放权重。不过 2.4T 那个开放权重版是纯文本模型,不带视觉,而且那个体量普通人根本跑不动。27B 才是你能搬回家的那个。

原生多模态,能看懂图片和视频,官方口径连小时级的长视频都能理解。注意,是看懂,不是生成,想让它画图的可以散了。

比如上面这个,让模型把照片里的鹈鹕一只只框出来,框得相当准。这种能力放在 agent 流程里很值钱,识图,读文档,看截图写代码,都用得上。

上下文原生 262K,官方说用一种叫 YaRN 的技术能扩展到 1M。你可以理解为,262K 是训练出来的原装量程,1M 是给尺子末尾硬接了一段估算刻度,量是能量,精度没经过校准。所以 1M 目前只是理论值,实测大家跑到的都是 262K。

2. 为什么都在喊「本地 Opus 4.6」

Opus 4.6 发布时候的体验和断崖式领先,相信用过的人都感同身受。所以现在社区再出什么新模型,第一反应都是拿它跟 Opus 4.6 比,它就是那把尺子。

官方模型卡上的跑分确实吓人。但先说清楚,这些全是官方自己跑的分,先打对折听。

SWE-bench Pro 61.7,旁边摆的参照物是 Claude Opus 4.6 Max 的 53.4,Terminal Bench 73.0,LiveCodeBench 90.3。多模态这边官方口径也不弱,电脑操作 OSWorld-Verified 84.3,文档理解 OmniDocBench 91.1。官方说整体能力超过自家上一代付费模型 Qwen3.7-Plus。

纸面好看归好看,实际体感怎么样?社区这几天的实测结论比较一致:日常编程和 agent 任务,它跟云端旗舰的差距已经小到要刻意分辨才感觉得出来;真正复杂的长推理任务,云端还是更稳。我自己实测下来,模型能力确实还不错,中文写作和基础编程完全没问题,但就是速度慢,和云端 API 完全比不了,要是真实做项目,等待时间也是成本。

第三方榜单这边也出来了,Artificial Analysis 的 Agentic Index 刚把它收录进去,51 分,排第 7。

51 分什么概念,比前代 Qwen3.6-27B 的 28 分高出一大截,也压过了 DeepSeek V4 Pro 和 GPT-5.6 Luna。但它前面还站着 Claude Opus 5,GLM-5.3,Grok 4.6 三个 59 分的。所以准确的说法是,本地模型第一次挤进了这个榜单的第一梯队,离「干翻所有闭源旗舰」还差得远。

另一个专门测 agent 复杂任务的第三方榜单 Agents' Last Exam 也出分了,27B 拿到 42.9%,保住了自家旗舰 Qwen3.8-Max 八成以上的水平,压过 GLM-5.2 和 Seed 2.1 Pro。

注意看这张榜,27B 那一栏底下标的是什么:Claude Code。又是 Claude Code,这个点后面第 5 节细说。

3. 27B 凭什么塞进个人电脑

这是我觉得最值得讲的部分。

传统的稠密模型,每一层都用全注意力。啥意思呢,你可以理解为模型每读一个 token 都要记一笔账,上下文越长账越厚。这个账本叫 KV cache,很多模型长上下文跑不动,是账本先爆了,不是模型本身装不下。

Qwen3.8-27B 玩了招狠的。64 层里只有 16 层用全注意力,剩下 48 层换成一种叫 Gated DeltaNet 的线性注意力,只保留一个固定大小的状态。相当于别人每笔流水都留着,它只记余额。

效果是,KV cache 大约只有同尺寸传统模型的四分之一。27B 的身板扛 262K 上下文,靠的就是这个。

另外它内置了 MTP,一次预测多个 token,你可以理解为自带一个草稿手,先打草稿再确认,速度白捡一截。

4. 什么电脑跑得动

直接给结论:

  • 24GB 显卡或 24GB 内存的 Mac。 底线入场券,跑 4bit 量化版,大约 17GB。官方还提供了 FP8 版本,一张 RTX 5090 这种消费级游戏显卡就能顺畅跑。
  • 32GB 的 Mac。 舒服档,上下文也能开得长一些。
  • 48GB 以上。 可以上 8bit,质量接近无损。
  • 16GB 及以下的 Mac。 别折腾了,装不下。

速度上要有心理预期,但也不用太悲观,给几个社区实测的锚点:M4 Max 跑 MLX 4bit 大约 23 tok/s,M5 Max 跑优化过的 4bit 加 MTP 能到 50-60 tok/s,RTX 5090 开 MTP 甚至能冲到 90-120 tok/s。入门档 Mac 会慢一些,聊天够用,跑长任务会嫌慢。

这里有个关键变量是 MTP,开和不开速度差接近一倍,RTX 5090 上同一个版本实测从 66 tok/s 涨到 121 tok/s。代价是 MTP 会多吃显存,压缩可用上下文,所以看到谁报了个很高的速度,先问他开没开 MTP。

我自己是 M5 Max 128G,用 Ollama 跑的 4bit 版,实测大概 25 tok/s,聊天和一般任务够用,跑长任务得有耐心。内存完全不是事,跑满 262K 上下文都够。

有人可能会问,4bit 和 8bit 怎么选?一句话:内存够就 8bit,嫌慢就 4bit。4bit 快接近一倍,质量损失日常聊天感知不强,但长推理任务会偶尔露怯。

5. 配上 Claude Code,才是完全体

这是我最看重的一点。

要知道 Qwen 自家就有官方编程工具,Qwen Code 和 Qoder CLI,都是亲儿子。但开头说了,官方跑分几乎全是拿 Claude Code 跑出来的,等于官方下场告诉你,这模型的最佳拍档是谁。

接入也简单,Ollama 原生支持:

bash 复制代码
ollama pull qwen3.8:27b-mlx
ollama launch claude --model qwen3.8:27b-mlx

Ollama 官方的模型页上,Applications 列表第一行就是 Claude Code,这待遇不是所有模型都有的。

两条命令,Claude Code 的后端就换成本地模型了,现在 Claude Code 接本地模型,完全不用担心封号的问题,没有 API 费用,没有额度焦虑,agent 随便跑,token 随便烧,代码不出你自己家门。这就是我说的 token 自由。

对代码不能出内网的公司来说,这基本是目前最值得评估的方案。

提前说个体感上的关键点:拿它接 Claude Code 这种 agent,决定流畅度的其实不是生成速度,是「读档」速度。啥意思呢,agent 每干一轮活,都得把前面的聊天记录、工具结果、代码片段从头到尾重新通读一遍才能开工,轮数越多,要重读的东西越厚。短任务聊着很顺,上下文堆到几万字之后,每一轮开工前的等待会明显变长。所以拿来当 CC 后端,内存带宽比 tok/s 数字更值钱。我自己接入后的长期体感,跑一阵子再补。

6. 泼点冷水

新模型发布第一周,吹捧的声音都打对折听。这模型用下来,不满意的地方已经攒了好几个。

国外开发者 Simon Willison 的实测可以当个佐证。默认的 xhigh 推理档位疯狂过度思考,让它画个 SVG 圆圈,它能就「要不要加同心辅助圆」这种问题琢磨半天,一张骑自行车的鹈鹕 SVG 整整想了 21 分钟,烧掉两万多个推理 token,他文章的标题直接就是「很优秀,但默认疯狂过度思考」。

同一个提示词关掉推理,两分多钟就完事。所以日常使用,建议把 reasoning_effort 调到 medium 或者 low。

社区这边还有两个真实反馈值得说。

一个是 token 消耗。国外有人把 3.8 和上一代 3.6 并排实测,答案质量 3.8 确实赢,10 个任务赢 9 个,但代价是平均 token 消耗几乎是 3.6 的三倍。有个任务 3.8 想了 7 分多钟,烧了三万一千多个 token,3.6 一分半钟七千多个 token 就交卷了。已经有人实测完默默换回了 3.6。这个缺点放在本地跑倒没那么致命,反正烧的是自己家的电,但如果你打算调 API 按量计费,这个账得算清楚。

另一个是知识截止。有人问它训练数据到什么时候,它自己答 2026 年,一追问 2024 年之后的具体事就露馅。不知道自己不知道,用的时候留个心眼。

另外还有早期用户反馈,agent 多轮长任务里有输出被截断的情况,这个等官方修复和更多实测。

1M 上下文前面说了,目前还是 PPT 数字。

7. 谁该上车

  • 手上有 24GB 以上显卡或者 32GB 以上 Mac,想不花 API 钱跑 Opus 4.6 级别 agent coding 的,直接上。
  • 公司代码不能出门的,这套方案可以认真评估。
  • 电脑 16GB 内存的,看看热闹就好。
  • 只是日常问答写作的,你现在用的豆包 DeepSeek 就够用,不用换。

说实话,Qwen3.8-27B 现在还替代不了我的生产主力,真正做项目,我还是会打开云端。

但它的意义不在今天。在 token 越来越不够用的时代,本地模型第一次摸到了「能用」的门槛。按这个速度走下去,完全够格的生产级本地模型,早晚会出现。到那时候,智能不用按月订阅,就住在你自己的电脑里。这对端侧 AI 意味着什么,不用我多说。

相关推荐
wen_zhufeng1 小时前
IndexTTS 2.5 技术报告
人工智能·算法·机器学习
Mark-Wang2 小时前
每天介绍一家新质生产力公司4
人工智能
全栈弄潮儿2 小时前
让 AI 帮你拆分一个功能需求:页面、接口、数据和测试任务怎么分
aigc·openai·ai编程
AI视觉网奇2 小时前
智能办公 大模型总结
人工智能
AIGC大时代2 小时前
有些内容AI写得再顺都不一定稳,这8个地方导师一问就露馅
人工智能·codex·ai工具·aiwritepaper·ai学术写作
skywalk81632 小时前
我现在手里有comate、dumate、 workbuddy和trae四个agent,你看这四个任务怎么分合适?
人工智能·deepseek
用户0617708544952 小时前
Agent 办事失败兜底技术实现方案:从失败模型到生产级容错体系
人工智能
是大乔家的3 小时前
网文分销商必备神器:用知漫剧快速将授权小说转化为连载视频引流
人工智能
ITmaster07313 小时前
面试官坏笑:“你用 AI 编程一年了,怎么保证 Claude Code 写出来的代码是对的?”我:“直接上 Claude Fable 5 啊!”
人工智能