Kimi K3技术报告

1.主要还是用各种方法增大scaling了:

把attn residuals加到模型里增大depth

KDA+MLA增大sequence length

Stable LatentMoE增大model width

2.MoonViT-V2 不再从 SigLIP 一类 contrastive vision encoder 初始化,而是随机初始化,从头用 next-token prediction 一起训

具体的训练现象:SigLIP 初始化的 vision tower 在 joint optimization 中 gradient norm 更高、spike 更多,而从头训练的 MoonViT-V2 更稳定;最后视觉 benchmark 又能达到相近水平。因此他们得出的结论是,在这种规模下,contrastive visual pretraining 未必还是必要的。

3.Stable LatentMoE:完整的维度留给shared expert,而给router的输入需要先在Latent空间压缩一下,减小开销;同时因为它设了很多expert,容易训崩,所以做了一些正则、负载均衡等方法

相关推荐
u1301305 小时前
AI 日报(2026年10月2日)
人工智能
数字化顾问7 小时前
(138页PPT)流程体系的建设优化与运营(附下载方式)
大数据·运维·人工智能
知了学历孙老师7 小时前
非全硕士上课怎么安排:周末班、集中班还是网络班
人工智能·考研·福建成考
ksueh7 小时前
AI网文创作软件实测:蛙趣拼文是我筛完留下的一款
人工智能·ai写作·ai工具·ai写小说
patton_smile7 小时前
配电网电压预测 GNN 模型优化
深度学习·配电网·图神经网络·电压预测
凯哥Java7 小时前
写代码怎么避免逻辑漏洞?
java·开发语言·人工智能·自动化
是翎7 小时前
AI开发工程师面试指南
人工智能·面试·职场和发展
水如烟7 小时前
孤能子视角:AI→SI——一次关系场的剧烈重组
人工智能
Ivanqhz8 小时前
层归一化、残差、前馈网络与激活函数简述
服务器·数据库·人工智能·深度学习·算法
Ai-_Man8 小时前
您您这可以把Dola的多个会话比如说。左侧的多个会话一次性导出吗?不是单条会话里面的多次会对话。用AI导出鸭,答案是可以的
开发语言·前端·人工智能·小程序