引言
2026年7月,中国AI产业迎来两个标志性时刻。
7月17日,月之暗面发布Kimi K3------2.8万亿参数,896专家MoE架构,全球参数最大的开源模型。同日,马斯克在评测报道下留言:"Impressive"。
而在此前三个月,深度求索的DeepSeek-V4系列已经用系统级重构把百万token上下文的推理成本打到了地板价。
两个模型,两种截然不同的技术哲学。
如果把Kimi K3比作"力大砖飞"------用史无前例的规模和密度冲击性能上限;那么DeepSeek-V4就是"四两拨千斤"------用系统级重构把长上下文的计算成本压缩一个数量级。一个挑战天花板,一个拓宽地板。
一、规模对比:数字背后的工程含义
1.1 参数规模
| 模型 | 总参数 | 激活参数 | 专家数 | 上下文 |
|---|---|---|---|---|
| Kimi K3 | 2.8T | ~50B | 896选16 | 1M |
| DeepSeek V4-Pro | 1.6T | 49B | 384专家 | 1M |
| DeepSeek V4-Flash | 284B | 13B | --- | 1M |
Kimi K3的总参数是DeepSeek V4-Pro的1.75倍 ,是全球首个开源的3万亿级别模型。但两者激活参数相近(~50B vs 49B)------这意味着在单次推理的计算成本 上,两者处于同一量级,差距主要体现在知识容量上。
1.2 为什么"总参数"不等于"计算量"?
这是理解MoE架构的核心。在MoE模型中:
-
总参数 = 所有专家参数之和(决定模型的知识容量)
-
激活参数 = 每次推理实际使用的参数(决定推理的计算成本)
Kimi K3用896个专家、每次激活16个的设计,实现了总参数2.8T、激活参数~50B的规模。这意味着它在推理时的计算量仅相当于一个50B的密集模型,但知识容量接近3T级别。
二、Kimi K3的技术架构:力大砖飞,但砖也是精心设计的
2.1 KDA混合线性注意力机制
Kimi K3最核心的创新是自研的KDA(Kimi Delta Attention)混合线性注意力机制。
传统全注意力机制的计算量随序列长度平方级增长 ------上下文从8K扩展到1M,计算量不是翻125倍,而是翻一万倍以上。
KDA的核心逻辑是改变传统注意力机制的处理方式:
-
在大部分层使用线性复杂度的近似注意力
-
保留少量全注意力层处理需要精确检索的场景
在100万token的上下文窗口下,KDA实现了高达6.3倍的解码加速。
2.2 Attention Residuals(AttnRes)
第二项关键创新是注意力残差(AttnRes)。
传统残差连接只是简单地把每层输出累加。AttnRes允许每一层选择性地从任意更早的层检索信息------这在MoE架构中尤其重要,因为不同的专家在不同深度被激活。
效率数据:AttnRes以不到2%的额外计算成本 ,带来了约25%的训练效率提升。
2.3 Stable LatentMoE:896专家的调度系统
Kimi K3的MoE系统管理896个专家,每次激活16个。
关键组件包括:
-
潜在空间路由(Latent-space routing) :在压缩的潜在空间中进行专家选择
-
分位数均衡(Quantile Balancing) :负载均衡机制
-
软丢弃(Soft dropping) :溢出token的优雅处理
2.4 训练与量化:MXFP4的工程智慧
Kimi K3采用了量化感知训练(QAT) ,而非训练后量化。这意味着模型在训练过程中就学会了补偿量化误差。
量化方案:
-
MXFP4权重:每个权重以4位浮点数存储,配合每块缩放因子
-
MXFP8激活:中间激活使用8位浮点数
这种方案使2.8T模型仅需约1.4TB的权重存储,并原生支持NVIDIA Blackwell和AMD MI400加速器。
三、DeepSeek-V4的技术架构:百万上下文的系统级重构
DeepSeek-V4的技术路线与Kimi K3截然不同------它不追求极致的参数规模,而是通过系统级重构把长上下文的成本打下来。
3.1 混合注意力架构:CSA + HCA
DeepSeek-V4的核心创新是CSA(压缩稀疏注意力)和HCA(重度压缩注意力)交错的混合架构。
CSA(压缩稀疏注意力) :
-
每4个token的KV缓存合并成1个压缩条目
-
用闪电索引器快速筛选最相关的少量压缩块
-
每个查询token只和精挑细选的块做注意力计算
-
职责:精准定位关键细节------像拿着放大镜的侦探
HCA(重度压缩注意力) :
-
压缩率高达128倍
-
大量token信息浓缩成极少的条目
-
信息粒度粗,但覆盖范围广
-
职责:捕捉全局语义线索------像俯瞰全景的指挥官
两者交错部署在各层,形成互补。
效率数据:
-
在1M token场景下,V4-Pro的单token推理FLOPs仅为V3.2的27%
-
KV缓存占用仅为V3.2的10%
如果以BF16 GQA8配置为基准,V4在百万token场景下的KV缓存占用量只有基准的约2% ------这是数量级上的变化,而非百分比级别的优化。
3.2 mHC:流形约束超连接
传统残差连接在深层网络中表达能力有限,而此前的超连接研究又容易导致数值爆炸。
DeepSeek-V4的mHC(流形约束超连接) 找到了解决方案:
-
把残差映射矩阵约束在双随机矩阵的数学流形上
-
确保信号在层间传递时既不会被无限放大,也不会被意外抵消
-
从根源上保证训练的稳定性
这是大模型"训得起来+训得稳"的工程性贡献。
3.3 Muon优化器
DeepSeek-V4在万亿参数规模上验证了Muon优化器。
核心机制:
-
对梯度矩阵做近似正交化(Newton-Schulz迭代)
-
让梯度的奇异值趋近于1
-
考虑参数矩阵整体的结构信息来决定更新方向
效果:收敛更快、训练更稳,尤其在万亿参数规模的MoE模型训练中优势明显。
3.4 两段式后训练
DeepSeek-V4的后训练采用了一套独特的"两段式范式":
-
领域专家独立培养:对代码、数学、推理、Agentic等目标领域分别进行SFT和基于GRPO的RL
-
统一模型整合:通过on-policy方式将各领域专家合并
3.5 混合精度与部署
V4-Pro的权重以FP4 + FP8混合精度发布:
-
MoE专家参数使用FP4
-
其余大部分参数使用FP8
这种方案让1.6T参数的模型在Hugging Face上的实际存储仅约862B参数大小。
四、技术路线对比:两条路径,同样极致
| 技术维度 | Kimi K3 | DeepSeek V4-Pro |
|---|---|---|
| 总参数 | 2.8T(896专家) | 1.6T(384专家) |
| 激活参数 | ~50B(16专家) | 49B |
| 注意力机制 | KDA混合线性注意力 | CSA + HCA混合架构 |
| 残差连接 | AttnRes(选择性检索) | mHC(流形约束) |
| 优化器 | Per-Head Muon | Muon |
| 量化方案 | MXFP4权重 + MXFP8激活 | FP4专家 + FP8其他 |
| 核心目标 | 最大化知识容量 | 最小化长上下文成本 |
| 技术哲学 | 规模极致 | 效率极致 |
4.1 注意力机制的分歧
两者都突破了传统全注意力的平方复杂度,但路径不同:
-
Kimi K3的KDA :在大部分层用线性近似注意力,保留少量全注意力层做精确检索。是一种混合精度的思路------大部分计算快,少部分计算准。
-
DeepSeek-V4的CSA+HCA :两种压缩注意力交错部署,CSA做精细定位,HCA做全局感知。是一种分工协作的思路------两个工具各司其职。
4.2 MoE设计的差异
两者都采用了高稀疏度MoE,但设计哲学不同:
-
Kimi K3 :更多专家(896)、更高稀疏度(16激活) 。每个专家更专注,路由选择更精准。
-
DeepSeek-V4 :更少专家(384)、更低稀疏度(49激活) 。每个专家覆盖更广,路由压力更小。
4.3 对"长上下文"的不同解法
两者都支持100万token上下文,但解法完全不同:
-
Kimi K3 :用KDA线性注意力从算法层面降低复杂度
-
DeepSeek-V4 :用CSA+HCA混合架构+系统级优化从工程层面降低成本
DeepSeek的技术报告给出了这次架构改动的量化幅度:在1M token场景下,V4-Pro的单token推理FLOPs只有V3.2的27%,KV缓存用量只有10%。
五、成本与性能:技术选择的商业后果
5.1 推理成本
| 模型 | 输出定价(百万token) | 单任务成本(AA评测) |
|---|---|---|
| Kimi K3 | 100元(~$15) | $0.94 |
| DeepSeek V4-Pro | ~6元(~$0.87) | ~$0.04 |
Kimi K3的输出定价是DeepSeek V4-Pro的约17倍 。Artificial Analysis测得K3完成一项加权评测任务平均花费0.94美元,同一口径下DeepSeek V4-Pro约为0.04美元------成本差距约23倍。
5.2 性能差距
Kimi K3在Artificial Analysis Intelligence Index中排名全球第三 (57分),仅次于Claude Fable 5和GPT-5.6 Sol。在前端代码竞技场Code Arena中,K3以1679分登顶全球第一。
DeepSeek V4-Pro在Agentic Coding评测中取得开源模型最佳成绩。
5.3 技术选择的商业逻辑
两条路线的商业逻辑截然不同:
-
Kimi K3 :用顶级性能支撑性能溢价定价策略。每百万token输出100元,对标GPT-5.6 Sol的价位。这是一场豪赌------赌的是性能天花板能带来足够的定价权。
-
DeepSeek-V4 :用极致效率支撑性价比定价策略。V4-Flash输出仅2元/百万token。赌的是低成本能带来更大的市场份额和生态规模。
六、总结:两种同样重要的技术路径
Kimi K3和DeepSeek-V4代表了国产大模型两条同样重要的技术路径:
-
Kimi K3的"规模路径" :通过更大规模的MoE(896专家)、更精密的注意力设计(KDA+AttnRes)和更激进的量化(MXFP4),在知识容量上冲击全球天花板。这是"向上突破"的路。
-
DeepSeek-V4的"效率路径" :通过系统级重构(CSA+HCA、mHC、Muon),把百万token上下文的计算成本压缩一个数量级。这是"向下普及"的路。
两条路径并非对立,而是互补。正如DeepSeek的技术报告所说,V4系列的核心目标不是"更大的参数",而是"更聪明地花算力"。
"Kimi K3证明中国团队能把模型做到全球最大;DeepSeek-V4证明中国团队能把模型做到全球最省。一个挑战天花板,一个拓宽地板------这或许才是国产大模型真正的'双引擎'。"
本文基于公开技术报告与评测数据,旨在客观呈现Kimi K3与DeepSeek-V4的技术架构差异。数据截至2026年7月。