Kimi K3技术报告

1.主要还是用各种方法增大scaling了:

把attn residuals加到模型里增大depth

KDA+MLA增大sequence length

Stable LatentMoE增大model width

2.MoonViT-V2 不再从 SigLIP 一类 contrastive vision encoder 初始化,而是随机初始化,从头用 next-token prediction 一起训

具体的训练现象:SigLIP 初始化的 vision tower 在 joint optimization 中 gradient norm 更高、spike 更多,而从头训练的 MoonViT-V2 更稳定;最后视觉 benchmark 又能达到相近水平。因此他们得出的结论是,在这种规模下,contrastive visual pretraining 未必还是必要的。

3.Stable LatentMoE:完整的维度留给shared expert,而给router的输入需要先在Latent空间压缩一下,减小开销;同时因为它设了很多expert,容易训崩,所以做了一些正则、负载均衡等方法

相关推荐
一切皆是因缘际会3 分钟前
轻量化端侧部署
人工智能
FL16238631298 分钟前
苹果果梗枝条识别分割数据集labelme格式712张3类别
人工智能
齐齐大魔王9 分钟前
机器学习(七)
人工智能·机器学习
跨境卫士—小依9 分钟前
2026跨境电商数据分析入门:用指标判断选品与投放是否有效
大数据·人工智能·数据分析·跨境电商·营销策略
m4Rk_17 分钟前
【论文阅读】Agent 记忆机制(68):Memp——把历史轨迹沉淀为可检索、可纠错的程序性记忆
论文阅读·人工智能·学习·开源·github
知识分享小能手21 分钟前
深度学习学习教程,从入门到精通,自编码器 — 完整知识点与代码案例(14)
人工智能·深度学习·学习
来让爷抱一个22 分钟前
2026 纹理一致性实战:贴图不许花脸,百智云精灵图把材质契约写进素材包
人工智能·机器学习·材质·贴图
零依赖极客23 分钟前
Day 8·1 自注意力机制:Q·K^T/softmax/V的在线计算
c语言·arm开发·人工智能·llama
幻影123!1 小时前
AlphaZero 五子棋实战(五):评估工具 —— 学会在错误的地方掉头
人工智能·机器学习·强化学习·alpha zero