早上刷到一条消息:阿里云上线了 Kimi K3。
2.8T 参数、原生百万上下文、开源。三个词摆在一起,说实话我愣了一下。2.8T 参数的开源模型------搁一年前,这话说出来自己都不信。
我第一反应是去翻技术文档。K3 不是月之暗面第一次放卫星,但 2.8T 这个数字太扎眼了。之前开源模型最大也就到万亿级别,K3 直接把天花板掀到了 3 万亿档。而且它不是在画饼------模型权重已经放了,阿里云 Model Studio 上就能直接调,还送了 100 万 token 的免费额度。
有意思的是,你仔细看 K3 的定位,会发现它压根没想跟 GPT 和 Claude 比"聊天"。它瞄准的是三个场景:仓库级代码工程、视觉创作、自主规划 agent。翻译成人话就是------它想干的是"复杂活",不是"陪聊"。
2.8T 参数的 2.8T,不是堆出来的
先说说这个参数规模到底意味着什么。
K3 是 MoE 架构,总参数 2.8T,但每个 token 只激活 104B。这个"激活/总参数"的比例大概在 1:27 左右------也就是用了 27 组专家,每次只叫 1 组干活。相比之下,DeepSeek-V4 的激活比例是 1:16(总参数 1.2T,激活 74B),Qwen3.8-27B 是 1:12(总参数 27B 满激活)。
比例越大,意味着模型"储备"的知识越多,但推理成本可控。K3 把比例拉到 1:27,是一个挺大胆的选择------这要求路由机制必须足够准,不然叫错专家就是灾难。
但 K3 真正值得聊的不是参数数量,而是架构。
它用了自研的 KDA(Kimi Delta Attention)混合线性注意力机制。传统 Transformer 的注意力复杂度是 O(n²),上下文一长就扛不住。K3 的上下文窗口是 100 万 token------处理一本《三体》三部曲绰绰有余------如果还用传统注意力,推理成本会爆炸。
KDA 的思路是:把注意力拆成两个部分,一部分用线性注意力处理长距离依赖,一部分用标准注意力处理局部精度。说白了就是"远亲用快车道,近邻用精确制导"。这个思路在学术圈讨论了好几年,K3 是第一个在 3T 参数规模上把它落地的。
成本是另一个维度的突破
参数说得再多,不如看价格。
根据交银国际的拆解报告,K3 的单任务推理成本大约是 0.86 美元。对比一下:GPT-5.6 Sol 单任务成本大概 3-5 美元,Claude Opus 5 也在 4 美元以上。K3 的成本只有闭源模型的 1/4 到 1/5。
你可能会说:开源模型本来就便宜,这不稀奇。
但差别在于:以前开源模型便宜是因为"能力不够,没人用"。K3 在 Artificial Analysis 综合智能指数上拿了 57 分------GPT-5.6 Sol 是 59 分,Claude Opus 5/Fable 5 是 60 分。差距不到 5%。换句话说,K3 不是在"低价卖劣质品",而是在"用 1/4 的价格,提供 95% 的能力"。
而且别忘了------它是开源的。你可以下载权重自己部署,也可以基于它做微调、做私有化。闭源模型再便宜,也做不到这一点。
开源模型走到哪一步了?
最近半年,开源模型的发展速度肉眼可见地在加速。
7 月 Kimi K3 发布技术报告,8 月 Qwen3.8-27B 登顶 HuggingFace,同月 DeepSeek-V4-Flash 正式版连续三周调用量全球第一。中国大模型周调用量已经连续十七周超过美国------不是一周两周的偶然,是四个月的持续领先。
但这里有个问题容易被忽略:调用量领先不等于能力领先。
OpenRouter 的调用量数据很大程度上受"免费/低价 API"驱动。中国模型价格低、开源多,开发者拿来跑实验、做 demo 的成本几乎为零。美国模型调用量下滑,可能不是因为它们变弱了,而是因为太贵了------Claude 和 GPT 的 API 价格摆在那里,小团队根本跑不起。
K3 的出现,让这个局面有了微妙的变化。
以前开源和闭源的差距是"能不能用"------闭源能用,开源凑合。现在 K3 把差距压缩到了"差点意思",在一些特定场景(长代码理解、多步推理、视觉创作)甚至有来有回。如果这个趋势继续,明年这个时候,开源模型可能真的会跟闭源站在同一道起跑线上。
一个值得追问的问题
看完 K3 的技术文档,我脑子里冒出一个问题:开源模型追上闭源,到底是"技术突破了",还是"闭源自己停下来了"?
过去两年,OpenAI 和 Anthropic 的迭代节奏明显在放缓。GPT-5.6 和 GPT-5.5 的差距不大,Claude Opus 4 到 5 的提升也不像 GPT-3 到 GPT-4 那种跨越式的。不是说闭源不进步了,而是边际收益在递减。当模型能力逼近某个临界点,继续堆算力带来的提升越来越小。
开源这边正好相反------底子薄,起点低,每一步提升都肉眼可见。加上 MoE、混合注意力、长上下文这些技术逐渐成熟,开源模型正在用自己的方式逼近同一个天花板。
你觉得这一步什么时候会跨过去?或者说,当开源真正追上闭源的那一天,整个 AI 产业的游戏规则会怎么变?