写在前面

欢迎大家关注Rocky的知乎:Rocky Ding
《三年面试五年模拟》AIGC/LLM/AI Agent算法工程师/开发工程师求职面试秘籍独家资源:【三年面试五年模拟】WeThinkIn/AIGC-Interview-Book,欢迎大家Star~
Rocky最新撰写的10万字AI Agent(AI智能体)深入浅出全维度解析文章: 深入浅出完整解析AI Agent(AI智能体)的核心基础知识
AIGC/LLM/AI Agent算法岗/开发岗求职面试内推学习社群 (涵盖涵盖AIGC、LLM大模型、AI Agent、传统深度学习、自动驾驶、机器学习、计算机视觉、自然语言处理、强化学习、大数据挖掘、具身智能、元宇宙、AGI等AI行业最新面试干货经验与核心知识)欢迎大家加入:https://t.zsxq.com/33pJ0
大家好,我是Rocky。
核心导读
大模型预训练的第一条主线,是用更多参数、更多数据和更多算力,把 next-token prediction 推向更高能力。但这条路径有一个越来越现实的约束:高质量静态数据不是无限的。模型把互联网、代码库和公开知识反复学习之后,继续堆预训练 token 的边际收益会下降。
Kimi 团队在 k1.5 技术报告中提出另一条 scaling 轴:让模型通过强化学习主动探索,并把更长的推理上下文当成搜索预算。 他们把 RL 上下文扩展到 128K,不使用显式 Monte Carlo Tree Search、过程奖励模型或 value network,而是让自回归模型把规划、试错、反思与回退压进一条长 Chain-of-Thought,再用可验证结果奖励整条轨迹。
这篇报告最容易被读成一组榜单:AIME 2024 达到 77.5,MATH-500 达到 96.2,Codeforces 达到 94th percentile,MathVista 达到 74.9。但 Rocky认为,Kimi k1.5 真正值得看的,不是它在某张榜单上接近 o1,而是它第一次较完整地公开了"长上下文 RL 如何成为一套生产系统":上层有 prompt 筛选、在线镜像下降、长度惩罚和课程采样;中层有 Partial Rollout 与 replay buffer;底层有训练/推理混部、权重快速切换和代码沙箱;最后再通过 Long2short 把昂贵的长思维迁移成更便宜的短回答。
这不是单点算法升级,而是把训练时计算、推理时计算和系统吞吐组织成同一个闭环。

图 1 展示了 Kimi k1.5 long-CoT 在数学、代码和视觉推理上的主要结果。它能证明模型具有很强的公开 benchmark 竞争力,但不能单独解释能力来自哪里。要判断这项工作是否有跨周期价值,必须继续追问:更长回答为何能提升正确率,RL 如何稳定优化超长轨迹,系统如何承受 rollout 成本,以及长推理能否压缩成真实产品愿意支付的延迟。
1. 问题背景:预训练数据见顶之后,模型还能扩展什么
传统 scaling law 把模型能力写成参数、训练数据和计算量的函数。它的优势是路径清晰、工程可复制;局限是依赖事先存在的高质量语料。RL 改变了数据产生方式:模型不只消费静态样本,还能针对问题采样多条解法,从环境或验证器获得奖励,再把成功与失败轨迹变成新的训练信号。
不过,"用 RL 训练 LLM"本身并不新。真正困难的是,语言推理的动作空间极大,奖励通常只在最终答案处出现,长轨迹生成又非常昂贵。如果每个中间步骤都训练 value model 或过程奖励模型,系统复杂度和误判风险都会上升;如果显式构造搜索树,部署时还要承担树搜索的并行调度成本。
Kimi k1.5 的关键假设是:搜索树中的节点、反馈与回退,本质上都可以表示为 token 序列。只要上下文足够长,模型就可能把显式搜索树"摊平"进一段自回归上下文:先提出方案,发现错误,再回退修正。此时,token 数量不再只是输出长度,而近似于可分配给问题的搜索步数。
因此,这篇报告讨论的不是普通意义上的"让模型多想一会儿",而是三个连锁问题:
- 如何让长推理真的学会探索,而不是只学会冗长复述。
- 如何让超长 rollout 不拖垮训练迭代速度。
- 如何把长推理获得的能力压缩到可控 token 预算。
2. 总体主线:从长思维到短交付的完整训练闭环
Kimi k1.5 的开发流程包括预训练、Vanilla SFT、Long-CoT SFT、强化学习,以及面向短回答的 Long2short。可以将其理解为五层系统:
| 层次 | 核心机制 | 解决的问题 |
|---|---|---|
| 数据层 | 多领域 prompt、难度估计、可验证性过滤 | 奖励欺骗与训练题分布失衡 |
| 冷启动层 | 小规模高质量 Long-CoT SFT | 让模型先学会规划、反思、探索的表达形式 |
| 优化层 | Online Policy Mirror Descent、负梯度、长度奖励 | 稳定提升正确率,同时控制策略漂移与过度思考 |
| 系统层 | Partial Rollout、Replay Buffer、训练/推理混部 | 降低 128K rollout 的时间与显存成本 |
| 压缩层 | Model Merge、Shortest RS、DPO、Long2short RL | 把长思维能力迁移到短 token 预算 |
这五层必须共同成立。没有可靠验证器,RL 会学会钻奖励空子;没有 Partial Rollout,长上下文会让训练吞吐失控;没有 Long2short,最终产品可能得到高准确率,却承担不可接受的延迟与推理成本。
3. 方法展开:Kimi k1.5 如何训练长思维
3.1 RL prompt 不是越多越好,而是必须可探索、可分级、可验证
Kimi 团队把高质量 RL prompt 概括为三个属性:覆盖足够多样、难度分布平衡、答案能够可靠验证。数据包含 STEM、代码、竞赛、通用推理,以及图文混合问题。
难度不是由人工静态标注决定,而是相对于当前模型动态估计。每个 prompt 由 SFT 模型以较高温度采样 10 次,用通过率近似难度:通过率越低,题目越难。这种做法把课程难度绑定到模型当前能力,避免用人类主观等级替代模型的真实学习区间。
更重要的是防止 reward hacking。选择题、判断题和部分证明题可能"答案容易猜、过程难验证",模型即使推理错误也可能碰巧得到正确答案。团队让模型在不展开 CoT 的情况下直接猜答案;如果 8 次以内能猜中,就把该题视为容易被利用并过滤掉。
这背后有一个很现实的 RL 规律:训练数据的价值不只取决于问题难度,还取决于错误能否被可靠识别。 一个很难但奖励含糊的问题,可能比一个中等难度、答案完全可验证的问题更危险。
3.2 Long-CoT SFT:先教"思维动作",再让 RL 自主探索
团队用 prompt engineering 和拒绝采样构建小规模、高质量的 Long-CoT warmup 数据,覆盖文字和图像输入。目标不是灌输大量答案,而是让模型先形成规划、评估、反思与探索等推理模式。
这一步相当于给 RL 一个合理初始策略。如果模型一开始不会表达中间计划,稀疏的最终奖励很难告诉它如何进入有效探索区。轻量 SFT 先把策略推入"会思考"的分布,RL 再决定哪些思考路径真正能提高最终正确率。
3.3 将搜索树压进上下文:最终答案奖励整条推理轨迹
设数据集为 D = { ( x i , y i ∗ ) } i = 1 n \mathcal{D}=\{(x_i,y_i^*)\}{i=1}^{n} D={(xi,yi∗)}i=1n,模型策略为 π θ \pi\theta πθ,中间思维为 z z z,最终答案为 y y y。Kimi k1.5 用二值奖励或学习到的奖励模型判断最终答案是否正确:
max θ E ( x , y ∗ ) ∼ D , ( y , z ) ∼ π θ r ( x , y , y ∗ ) \max_{\theta}\mathbb{E}{(x,y^*)\sim\mathcal{D},(y,z)\sim\pi\theta}\leftr(x,y,y\^\*)\\right θmaxE(x,y∗)∼D,(y,z)∼πθr(x,y,y∗)
这个目标看起来简单,却包含一个重要取舍:奖励主要落在最终答案,而不是强行给每个中间 token 分配局部价值。如果一条轨迹中途走错,但后来识别错误、回退并得到正确答案,整条轨迹仍可成为有价值的探索经验。
论文因此没有使用 value network。团队认为,传统逐步 credit assignment 可能会惩罚暂时走错的分支,而试错与恢复恰恰是长推理需要学习的能力。这一判断并非证明 value function 一定无效,而是强调:在开放式推理中,"错误步骤"与"无价值步骤"不是同一回事。
3.4 Online Policy Mirror Descent:让策略提升,但不要一步漂太远
在第 i i i 轮迭代中,当前策略 π θ i \pi_{\theta_i} πθi 作为 reference policy。优化目标在奖励之外加入 KL 正则:
max θ E ( x , y ∗ ) ∼ D E ( y , z ) ∼ π θ \[ r ( x , y , y ∗ ) − τ K L ( π θ ( x ) ∥ π θ i ( x ) ) ] \max_{\theta}\mathbb{E}{(x,y^*)\sim\mathcal{D}}\left\\mathbb{E}_{(y,z)\\sim\\pi_\\theta}\[r(x,y,y\^\*)-\tau\mathrm{KL}\left(\pi\theta(x)\|\pi_{\theta_i}(x)\right)\right] θmaxE(x,y∗)∼DE(y,z)∼πθ\[r(x,y,y∗)−τKL(πθ(x)∥πθi(x))]
其闭式最优策略满足:
π ∗ ( y , z ∣ x ) = π θ i ( y , z ∣ x ) exp ( r ( x , y , y ∗ ) / τ ) Z \pi^*(y,z\mid x)=\frac{\pi_{\theta_i}(y,z\mid x)\exp\left(r(x,y,y^*)/\tau\right)}{Z} π∗(y,z∣x)=Zπθi(y,z∣x)exp(r(x,y,y∗)/τ)
两侧取对数后得到:
r ( x , y , y ∗ ) − τ log Z = τ log π ∗ ( y , z ∣ x ) π θ i ( y , z ∣ x ) r(x,y,y^*)-\tau\log Z=\tau\log\frac{\pi^*(y,z\mid x)}{\pi_{\theta_i}(y,z\mid x)} r(x,y,y∗)−τlogZ=τlogπθi(y,z∣x)π∗(y,z∣x)
由此构造平方误差 surrogate loss:
L ( θ ) = E ( r ( x , y , y ∗ ) − τ log Z − τ log π θ ( y , z ∣ x ) π θ i ( y , z ∣ x ) ) 2 L(\theta)=\mathbb{E}\left\\left(r(x,y,y\^\*)-\\tau\\log Z-\\tau\\log\\frac{\\pi_\\theta(y,z\\mid x)}{\\pi_{\\theta_i}(y,z\\mid x)}\\right)\^2\\right L(θ)=E(r(x,y,y∗)−τlogZ−τlogπθi(y,z∣x)πθ(y,z∣x))2
实践中,团队用同一问题的 k k k 个采样奖励均值 r ˉ \bar r rˉ 近似基线,得到最终梯度:
1 k ∑ j = 1 k ∇ θ log π θ ( y j , z j ∣ x ) ( r ( x , y j , y ∗ ) − r ˉ ) − τ 2 ∇ θ ( log π θ ( y j , z j ∣ x ) π θ i ( y j , z j ∣ x ) ) 2 \frac{1}{k}\sum_{j=1}^{k}\left\\nabla_\\theta\\log\\pi_\\theta(y_j,z_j\\mid x)\\left(r(x,y_j,y\^\*)-\\bar r\\right)-\\frac{\\tau}{2}\\nabla_\\theta\\left(\\log\\frac{\\pi_\\theta(y_j,z_j\\mid x)}{\\pi_{\\theta_i}(y_j,z_j\\mid x)}\\right)\^2\\right k1j=1∑k∇θlogπθ(yj,zj∣x)(r(x,yj,y∗)−rˉ)−2τ∇θ(logπθi(yj,zj∣x)πθ(yj,zj∣x))2
它与常见 REINFORCE 风格 policy gradient 相似,但样本来自 reference policy,而非严格的当前 on-policy 策略;同时使用对数概率比的 L 2 L_2 L2 正则限制策略变化。每轮更新后,新策略成为下一轮 reference policy,优化器也会重置。
Rocky认为,这套方法的价值不在于"又一个 RL 缩写",而在于它与系统架构匹配:长轨迹采样昂贵,允许一定程度的 off-policy 复用可以提升效率;但复用越多,策略分布偏移越危险,因此又需要显式正则约束。
3.5 长度惩罚:准确率上涨,不等于 token 可以无限上涨
团队观察到,RL 训练过程中准确率与回答长度会同时增加。更长上下文为探索提供预算,但也会产生 overthinking:简单题被过度展开,错误轨迹消耗大量 token,训练和推理成本不断增加。
对同一问题采样 k k k 个回答,记最短和最长长度为 m i n _ l e n \mathrm{min\_len} min_len、 m a x _ l e n \mathrm{max\_len} max_len。长度奖励定义为:
l e n _ r e w a r d ( i ) = { λ , r ( x , y i , y ∗ ) = 1 min ( 0 , λ ) , r ( x , y i , y ∗ ) = 0 , λ = 0.5 − l e n ( i ) − m i n _ l e n m a x _ l e n − m i n _ l e n \mathrm{len\_reward}(i)= \begin{cases} \lambda, & r(x,y_i,y^*)=1\\ \min(0,\lambda), & r(x,y_i,y^*)=0 \end{cases} ,\qquad \lambda=0.5-\frac{\mathrm{len}(i)-\mathrm{min\_len}}{\mathrm{max\_len}-\mathrm{min\_len}} len_reward(i)={λ,min(0,λ),r(x,yi,y∗)=1r(x,yi,y∗)=0,λ=0.5−max_len−min_lenlen(i)−min_len
正确答案中,短回答获得更高奖励、长回答被惩罚;错误答案不会因为短而得到正奖励,长且错误则被明确惩罚。由于长度惩罚在训练早期可能压制探索,团队先进行不带长度惩罚的标准 RL,再逐步 warm up 到固定惩罚。
这体现了一个比"越长越聪明"更准确的判断:长上下文是搜索预算,不是质量本身。预算应该在困难问题上扩张,在简单问题上收缩。
3.6 课程采样与优先采样:把计算花在模型正在学的题上
课程采样先从相对容易的问题开始,再逐步聚焦困难问题;优先采样则跟踪每个问题的成功率 s i s_i si,按照与 1 − s i 1-s_i 1−si 成比例的概率采样,让低成功率问题获得更多训练机会。
这两种策略解决的是同一件事:RL 算力不应该平均分给所有问题。太容易的题没有梯度价值,太难且始终采不到正确轨迹的题也会浪费 rollout。真正高价值的是处于模型"最近发展区"的问题。
3.7 奖励模型、代码测试与视觉 RL 数据
代码问题需要可执行测试。团队使用 CYaRon 自动生成测试用例,并用已有正确提交交叉筛选。以 1,000 道在线竞赛题为例,614 道不需要 special judge;最终 463 道成功生成至少 40 个有效测试,323 道进入训练集。
数学答案存在等价表达,例如 a 2 − 4 a^2-4 a2−4 与 ( a + 2 ) ( a − 2 ) (a+2)(a-2) (a+2)(a−2)。团队分别训练 classic value-head reward model 和带 CoT 的 judge model,各使用约 80 万样本;人工抽查准确率分别约为 84.4 与 98.5,最终 RL 使用 CoT reward model。
视觉 RL 数据包含真实世界题、合成视觉推理题和 text-rendered data。后者把文字、代码和结构化数据渲染成图片,减少"同一知识换成截图后模型就不会"的模态落差。

图 11 说明 k1.5 从底座阶段就接收文字与交错图文序列,再通过统一的大规模 RL 强化推理。论文并未公开模型规模和具体结构细节;这张图更像训练范式说明,而不是可复现的网络结构图。
4. Long2short:真正的产品问题不是会不会想,而是每次要想多久
Long-CoT 能提高上限,却会增加延迟和成本。Kimi k1.5 给出四类压缩方法:
- Model Merging:直接平均 long-CoT 与 short-CoT 模型权重,不额外训练。
- Shortest Rejection Sampling:同一问题采样 8 次,选择最短的正确回答进行 SFT。
- DPO:最短正确回答作为正样本,更长回答作为负样本,包括错误长回答,以及长度超过正样本 1.5 倍的正确回答。
- Long2short RL:先做标准 RL,再降低 rollout 上限并加强长度惩罚,直接优化正确率与 token 效率的平衡。

图 7 是全文最有产品意义的证据。k1.5-short w/ RL 在 AIME 2024 上达到 60.8,平均仅使用 3,272 tokens;在 MATH-500 上,短模型也形成比多个对照模型更好的准确率/长度前沿。论文报告的结论是,Long2short RL 的 token 效率优于 DPO、model merge 和 shortest rejection sampling。
长思维负责探索能力上限,短思维负责把能力交付给用户。 如果只有前者,模型更像昂贵的研究原型;只有后者,模型可能缺乏复杂问题上的搜索深度。Long2short 的本质,是把 test-time compute 变成可蒸馏、可调度的资源。
5. RL 基础设施:算法能否成立,取决于 rollout 能否跑起来
5.1 Partial Rollout:长轨迹不必每轮从头生成
Kimi k1.5 使用迭代式同步 RL:rollout workers 生成轨迹,reward models 和代码执行服务评估,轨迹进入 replay buffer,trainer workers 更新 policy model,再把新权重同步回 rollout 侧。

Figure 3 的右侧是关键。系统为单次 rollout 设置固定输出 token 预算;轨迹超过上限时,未完成部分被保存到 replay buffer,下一轮从断点继续。过去片段不必重新生成,只有当前新片段需要按新策略计算;训练时还可以排除部分旧 segment 的 loss。
它同时缓解了两个系统问题。第一,超长样本不会长期占据 worker,短任务仍可异步推进。第二,128K 长推理不必在每轮策略更新后全部重采样。系统还会检测重复序列、提前终止并施加惩罚,避免模型在长上下文中陷入循环。
这也带来一个需要谨慎理解的边界:历史 segment 来自旧策略,因此 Partial Rollout 引入 off-policy 成分。论文的 mirror-descent 正则与 reference policy 设计,正是在算法层面控制这种系统复用造成的分布偏移。
5.2 训练与推理混部:同一批 GPU 在 Megatron 和 vLLM 之间切换
RL 需要在"训练更新"和"推理采样"之间反复切换。如果训练与 rollout 固定占用两套 GPU,一侧工作时另一侧可能闲置。Kimi 的方案是在 Kubernetes Pod 中部署 Megatron sidecar 与 vLLM sidecar,共享 GPU,并由 checkpoint engine 管理进程与权重。

训练结束后,Megatron offload 显存,把分布式 checkpoint 转为 Hugging Face 格式并写入 shared memory;Mooncake 通过 RDMA 传输权重,vLLM 加载最新参数完成 rollout;随后 vLLM 退出,Megatron onload 并继续训练。论文报告训练切换到推理小于 1 分钟,反向切换约 10 秒。
这里真正难的不是启动两个容器,而是训练和推理可能采用不同的 tensor、pipeline、expert parallelism。Checkpoint engine 先处理 pipeline 与 expert 并行,只保留 tensor parallel 形式,再由 vLLM 完成对应转换。
5.3 代码沙箱:可验证奖励也需要工业级执行环境
代码 RL 依赖大量真实执行。团队用 crun 替代 Docker runtime,复用 cgroup,并把 overlay filesystem 的 upper layer 放在 tmpfs。论文给出以下并列表:
| 指标 | Docker | Kimi Sandbox |
|---|---|---|
| 容器启动时间 | 0.12 s | 0.04 s |
| 16 核机器每秒最大启动容器数 | 27 | 120 |
这张表的意义不在"容器快了 0.08 秒",而在于 RL 会把单次执行成本乘以 prompt 数、采样数、迭代数和模型版本。验证器如果吞吐不足,算法侧再高效也会被环境反馈拖住。
6. 实验与证据:结果究竟证明了什么
6.1 Long-CoT:接近 o1,但不是所有指标都领先
论文的 Long-CoT 主结果如下:
| Benchmark | QwQ-32B Preview | o1-mini | QVQ-72B Preview | OpenAI o1 | Kimi k1.5 |
|---|---|---|---|---|---|
| MATH-500 | 90.6 | 90.0 | - | 94.8 | 96.2 |
| AIME 2024 | 50.0 | 63.6 | - | 74.4 | 77.5 |
| Codeforces percentile | 62 | 88 | - | 94 | 94 |
| LiveCodeBench | 40.6 | 53.1 | - | 67.2 | 62.5 |
| MathVista-Test | - | - | 71.4 | 71.0 | 74.9 |
| MMMU-Val | - | - | 70.3 | 77.3 | 70.0 |
| MathVision-Full | - | - | 35.9 | - | 38.6 |
Kimi k1.5 在 AIME、MATH-500、MathVista 和 MathVision 上取得表内最高值,Codeforces 与 o1 持平;但 LiveCodeBench 与 MMMU 低于 o1。更准确的结论是:它在数学和部分多模态推理上具有前沿竞争力,而不是"全面超过 o1"。
Codeforces 结果还使用 majority voting,并由模型生成测试用例辅助选择代码;它衡量的是系统级 test-time compute,而不是单次采样能力。LiveCodeBench 的 long-CoT 版本使用 2024 年 12 月至 2025 年 2 月的 v5 题目,不同对照结果的协议一致性需要谨慎核对。
6.2 Short-CoT:Long2short 让能力进入更现实的延迟区间

短思维模型的完整对比为:
| Benchmark | Qwen2.5-72B | LLaMA-3.1-405B | DeepSeek V3 | Qwen2-VL | Claude 3.5 Sonnet | GPT-4o | Kimi k1.5 |
|---|---|---|---|---|---|---|---|
| MMLU | 85.3 | 88.6 | 88.5 | - | 88.3 | 87.2 | 87.4 |
| IF-Eval | 84.1 | 86.0 | 86.1 | - | 86.5 | 84.3 | 87.2 |
| CLUEWSC | 91.4 | 84.7 | 90.9 | - | 85.4 | 87.9 | 91.7 |
| C-Eval | 86.1 | 61.5 | 86.5 | - | 76.7 | 76.0 | 88.3 |
| MATH-500 | 80.0 | 73.8 | 90.2 | - | 78.3 | 74.6 | 94.6 |
| AIME 2024 | 23.3 | 23.3 | 39.2 | - | 16.0 | 9.3 | 60.8 |
| HumanEval-Mul | 77.3 | 77.2 | 82.6 | - | 81.7 | 80.5 | 81.5 |
| LiveCodeBench | 31.1 | 28.4 | 40.5 | - | 36.3 | 33.4 | 47.3 |
| MathVista-Test | - | - | - | 69.7 | 65.3 | 63.8 | 70.1 |
| MMMU-Val | - | - | - | 64.5 | 66.4 | 69.1 | 68.0 |
| MathVision-Full | - | - | - | 26.6 | 35.6 | 30.4 | 31.0 |
短模型在数学、代码、中文任务和 MathVista 上表现突出,但 MMLU、HumanEval-Mul、MMMU 和 MathVision 并非第一。附录还说明 IF-Eval 来自中间模型,因为版本发生变化,后续应以更新结果为准。
6.3 长上下文 scaling:相关性强,但还不是完整 scaling law

图 5 显示一个比最终 k1.5 更小的内部 long-CoT 模型。在多个数学、科学和通识 benchmark 上,随着 RL iteration 增加,准确率与平均/高分位回答长度同步上升;困难任务的 token 增长更明显。

图 6 将 checkpoint 的平均长度与准确率对应起来,多数任务呈正斜率。这支持"更长上下文提供更多搜索预算",但还不能严格证明长度本身导致性能提升,因为训练步数、策略质量和样本分布也在同时变化。要称为完整 scaling law,还需要固定总计算量、控制训练阶段、报告不同 context cap 下的 compute-normalized 曲线。
6.4 模型规模与上下文长度:二者不是替代关系

图 8 比较大小模型。小模型通过更长 CoT 可以追上大模型的部分性能,但大模型通常更 token-efficient,且长上下文后的上限更高。因此"用小模型多想"在成本受限场景可能可行,但它不能无限替代模型容量。
6.5 课程采样与负梯度:不是所有 RL 配方都等价

图 9 中,课程策略先做混合难度 warmup,在第 24 轮后转向难题,最终准确率高于始终均匀采样。它支持"先建立基本成功轨迹,再集中预算攻克难题"的训练逻辑。

ReST 只拟合当前策略采样到的最好回答,不对错误轨迹施加负梯度;Kimi 方法在多数子任务上表现出更高的 sample efficiency。这个消融说明,长 CoT 不是只做 best-of-N 自训练就够了,错误样本提供的负向信号对策略改进很重要。
不过,图 8 至图 10 均来自内部实验设置,论文没有完整公开模型规模、每轮样本量、计算预算、误差条和随机种子。它们更适合支持机制判断,不适合被解读成严格可复现的量化定律。
7. 预训练与多模态:RL 上限首先受底座能力约束
Kimi k1.5 的 base model 使用语言、代码、数学推理、知识,以及 caption、图文交错、OCR、知识和通用 QA 数据。预训练分三阶段:
- Vision-language pretraining:先建立语言能力,再逐步加入交错图文;视觉塔先单独训练,随后解冻语言层,最终视觉数据占比提高到 30%。
- Vision-language cooldown:使用高质量与合成数据巩固数学、知识和代码能力。
- Long-context activation:最大长度从 4,096 扩展到 32,768,再到 131,072;训练混合 40% full attention 与 60% partial attention 数据,RoPE frequency 设为 1,000,000。
Vanilla SFT 约包含 100 万文本样本和 100 万图文样本。文本部分包括 50 万通用问答、20 万代码、20 万数学与科学、5 千创作、2 万长上下文任务。训练先在 32K 序列上进行 1 个 epoch,再在 128K 上训练 1 个 epoch。
Rocky认为,这部分披露提醒了一个容易被忽略的事实:RL 不是从零创造智能。Prompt 的可学性、reward model 的判断能力、长上下文稳定性和视觉推理上限,都受 base model 约束。RL 放大的不是一个抽象算法,而是底座模型已经具备的数据、表示和泛化能力。
8. 这篇工作的边界与可复现性
Kimi k1.5 是一份信息密度较高的技术报告,但离完整可复现仍有距离。
第一,模型本身未开源。 论文明确说明 proprietary model 暂不开放,模型参数规模、层数、MoE 配置和多数架构细节也没有披露。外部研究者无法验证算法与底座能力各自贡献了多少。
第二,RL 关键超参数不完整。 报告给出目标函数和系统框架,却没有公开最终训练的 τ \tau τ、batch size、每题采样数、总 rollout tokens、训练 iteration、硬件规模、优化器配置和总算力。
第三,数据和 reward model 主要是内部资产。 Prompt 集、难度分布、过滤阈值、视觉 RL 数据和 80 万级 reward model 数据没有开放。可验证奖励的质量本身可能构成主要能力差异。
第四,128K 结论的因果证据有限。 图 5 与图 6 显示长度和性能共同增长,但主要来自较小内部模型,并未给出严格控制变量的 context scaling 实验。
第五,部分 benchmark 协议需要谨慎比较。 Codeforces 使用 majority voting 与模型生成测试;Long-CoT 和 Short-CoT 的 LiveCodeBench 时间窗不同;IF-Eval 来自中间模型;闭源模型结果部分来自外部公开材料而非统一复测。
第六,安全与可控性讨论不足。 长 CoT RL 可能引入奖励过拟合、隐藏式 reward hacking、推理循环和不可解释的策略漂移。报告讨论了重复检测与易猜答案过滤,但没有系统评估安全对齐、幻觉或越狱风险。
因此,更严谨的评价是:Kimi k1.5 提供了一套可信且有工程价值的长上下文 RL 配方,但它证明的是"这条路线可以工作",还没有提供足够材料让社区独立复现它为何工作到这一水平。
9. 对研究、工程与产品的启发
9.1 对算法工程师:研究对象从 loss 扩展到计算预算分配
未来 reasoning model 的核心问题不只是用 PPO、GRPO 还是 mirror descent,而是如何联合决定 prompt 难度、采样数量、context cap、停止条件、验证器强度和长度成本。单个 loss 无法代表整套训练系统。
9.2 对系统工程师:rollout 吞吐正在成为新的训练瓶颈
预训练时代的核心是高效算 dense/sparse matrix multiplication;RL 时代还需要高吞吐推理、动态长度调度、环境执行、权重切换和 replay buffer。训练框架与 serving 框架之间的边界会越来越模糊。
9.3 对产品经理:不要把"深度思考"做成固定开关
不同任务需要不同搜索预算。理想产品应该根据问题难度、用户等待意愿、付费等级和置信度动态分配 token:简单任务直接回答,中等任务使用短 CoT,困难任务进入长推理或多次采样。
9.4 对 Agent 团队:可验证环境比更长 prompt 更重要
代码沙箱、数学 judge、浏览器、数据库和业务规则,决定 Agent 的行为能否得到可靠奖励。没有可执行反馈,长轨迹只会积累更多未经验证的文本。
9.5 对创业者和投资人:模型能力不是商业闭环,成本曲线才是
Long-CoT 可以提高能力上限,但用户最终购买的是解决率、时延、稳定性和每任务成本。真正有护城河的项目,不是简单调用 reasoning API,而是掌握特定场景的可验证任务、反馈数据、动态预算和交付工作流。
术语与概念速查
| 概念 | 含义 |
|---|---|
| Long-CoT | 使用大量中间 token 展开规划、试错、反思和修正的推理形式 |
| Test-time compute | 模型在回答单个问题时投入的采样、搜索和 token 计算量 |
| Online Policy Mirror Descent | 用当前策略作 reference,并通过 KL/概率比正则逐轮更新策略的方法 |
| Reference policy | 当前迭代用于采样和约束新策略变化的基准模型 |
| Partial Rollout | 把超长轨迹跨迭代分段生成并复用历史 segment 的系统技术 |
| Reward hacking | 模型利用奖励漏洞得到高分,而不是真正完成目标 |
| Length penalty | 在正确率奖励之外约束过长回答的奖励项 |
| Curriculum sampling | 先学相对容易问题,再逐步转向困难问题的采样策略 |
| Long2short | 把长推理模型的能力迁移到更短、更便宜输出的技术集合 |
| Shortest Rejection Sampling | 多次采样后选择最短正确回答作为训练目标 |
| Replay Buffer | 保存 rollout 轨迹或分段,供后续训练和继续生成使用的缓存 |
| Hybrid deployment | 让训练和推理框架共享 GPU,并在两阶段之间动态切换 |
拓展思考:推理模型的下一条 scaling law 是什么
Kimi k1.5 提出的方向可以概括为:预训练 scaling 扩展模型"知道什么",长上下文 RL 扩展模型"愿意为一个问题搜索多久",Long2short 则决定这些搜索经验能否沉淀为更便宜的策略。
这条路线还有三个值得继续研究的问题。
第一,动态思考预算。现在很多 reasoning model 依然依赖固定 max tokens。未来模型应在推理过程中估计边际收益:继续思考一个 token 是否仍可能提高答案质量,还是应该停止、调用工具或重新采样。
第二,过程反馈与终局奖励的平衡。Kimi k1.5 强调最终答案奖励可以保留试错价值,但纯终局奖励也会带来高方差和隐藏 reward hacking。更成熟的方案可能不是简单回到 value model,而是引入可校准、低干预的过程验证器。
第三,从通用 benchmark 走向真实任务闭环。数学和代码之所以适合 RL,是因为答案容易验证。下一步真正有商业价值的问题,是如何把法律、金融、科研、制造和企业流程改造成可观察、可执行、可归因的环境。
最终判断是:Kimi k1.5 不是一篇靠新颖算法名称取胜的论文,而是一份把长上下文、策略优化、数据筛选、验证器、推理基础设施与成本压缩连接起来的系统报告。它的模型与训练细节尚不足以完整复现,但它明确揭示了 reasoning model 的竞争正在从"谁的模型更大",转向"谁能更有效地生产、验证、调度并压缩推理计算"。
工具会迭代,模型会换代,具体 RL 算法也会被重新命名。真正穿越周期的,是对计算预算、反馈质量和交付成本三者关系的理解。
论文:Kimi Team,Kimi k1.5: Scaling Reinforcement Learning with LLMs,arXiv:2501.12599。
推荐阅读
Rocky一直在运营技术交流群(WeThinkIn-技术交流群),这个群的初心主要聚焦于技术话题的讨论与学习,包括但不限于算法、开发、竞赛、科研以及工作求职等。群里有很多人工智能行业的大牛,欢迎大家入群一起学习交流~(请添加小助手微信Jarvis8866,拉你进群~)
1. 深入浅出完整解析AI Agent(AI智能体)的核心基础知识
2025年可以说是AI Agent全面落地应用的元年,因此Rocky在持续撰写对AI Agent的全维度解析文章:
深入浅出完整解析AI Agent(AI智能体)的核心基础知识
2. 深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识
Rocky对扩散模型的本质原理与和核心基础知识进行了全面系统的深入浅出分析讲解,同时不断跟进补充扩散模型的最新技术发展,希望能给大家带来帮助:
深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识
3. 入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识
Rocky对AIGC时代"中场时刻"之后的主流AIGC创作大模型的核心基础知识进行了全面系统的深入浅出分析讲解,力求让大家通俗易懂理解AIGC时代的技术浪潮的本质价值:
入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识
4. 深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识
Rocky对FLUX.1 Kontext和FLUX.1 Krea的核心基础知识作了全面系统的梳理与解析:
深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识
5. 深入浅出完整解析DeepSeek系列核心基础知识
Rocky对DeepSeek系列模型的核心基础知识作了全面系统的梳理与解析:
6. 深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识
Rocky对Stable Diffusion 3和FLUX.1的核心基础知识作了全面系统的梳理与解析:
深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识
7. 深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识
Rocky对Stable Diffusion XL的核心基础知识作了全面系统的梳理与解析:
深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识
8. 深入浅出完整解析Stable Diffusion(SD)核心基础知识
Rocky对Stable Diffusion 1.x-2.x系列模型的核心基础知识做了全面系统的梳理与解析:
深入浅出完整解析Stable Diffusion(SD)核心基础知识
9. 深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识
Rocky对Stable Diffusion中最为关键的U-Net结构进行了深入浅出的全面解析,包括其在传统深度学习中的价值和在AIGC中的价值:
深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识
10. 深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识
对于AIGC时代中的"ResNet"------LoRA模型,Rocky进行了深入浅出的全面讲解:
深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识
11. 深入浅出完整解析ControlNet核心基础知识
AIGC图像创作开源社区已经形成以Stable Difffusion/FLUX为核心,ConrtolNet和LoRA作为首要AI辅助工具的变化万千的AIGC图像创作工作流。
ControlNet正是让AI图像创作社区无比繁荣的关键一环,它让AIGC图像创作过程更加的可控,更有助于广泛地将AIGC算法解决方案应用到各行各业中:
12. 深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识
AI绘画和AI视频是两个互相促进、相互交融的领域,2024年无疑是AI视频领域的爆发之年,Rocky对AI视频领域核心的Sora、Seedance、Keling等大模型进行了全面系统的梳理与解析:
深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识
13. 深入浅出完整解析AIGC时代Transformer核心基础知识
在AIGC时代中,Transformer为AI行业带来了深刻的变革。Transformer架构正在一步一步重构所有的AI技术方向,成为AI技术架构大一统与多模态整合的关键核心基座,大有一统"AI江湖"之势。Rocky也对Transformer模型进行持续的深入浅出梳理与解析:
深入浅出完整解析AIGC时代Transformer核心基础知识
14. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识
AIGC创作框架正是AIGC算法工作流的运行载体,目前主流的AIGC创作框架有ComfyUI、Diffusers、Stable Diffusion WebUI等 。在传统深度学习时代,PyTorch、TensorFlow以及Caffe是传统深度学习模型的基础运行框架,到了AIGC时代,Rocky相信ComfyUI就是AIGC时代的"PyTorch"、Stable Diffusion WebUI就是AIGC时代的"TensorFlow"、Diffusers就是AIGC时代的"Caffe":
深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识
15. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识
在AIGC时代中,如何快速转身,入局AIGC产业?如何成为AIGC/LLM/AI Agent算法/开发工程师?如何在学校中系统性学习AIGC/LLM/AI Agent知识,斩获心仪的AIGC/LLM/AI Agent算法/开发offer?
Don't worry,Rocky为大家总结整理了全面的AIGC/LLM/AI Agent算法/开发工程师成长秘籍,为大家答疑解惑,希望能给大家带来帮助:
手把手教你成为AIGC/LLM/AI Agent算法/开发工程师,斩获AIGC/LLM/AI Agent算法/开发offer!
16. AIGC产业的深度思考与分析
2023年3月21日,微软创始人比尔·盖茨在其博客文章《The Age of AI has begun》中表示,自从1980年首次看到图形用户界面(graphical user interface)以来,以OpenAI为代表的科技公司发布的AIGC模型是他所见过的最具革命性的技术进步。
Rocky也认为,AIGC及其生态,会成为AI行业重大变革的主导力量。AIGC会带来一个全新的红利期,未来随着AIGC的全面落地和深度商用,会深刻改变我们的工作、生活、学习以及交流方式,各行各业都将被重新定义,过程会非常有趣。
那么,在此基础上,我们该如何更好的审视AIGC的未来?我们该如何更好地拥抱AIGC引领的革新?Rocky准备从技术、产品、商业模式、长期主义等维度持续分享一些个人的核心思考与观点,希望能帮助各位读者对AIGC有一个全面的了解:
深入浅出全面解析AIGC时代核心价值与发展趋势(2025年版)
17. AI算法工程师的独孤九剑秘籍
为了方便大家实习、校招以及社招的面试准备,同时帮助大家提升扩展技术基本面,Rocky将符合大厂和AI独角兽价值的算法高频面试知识点撰写总结成《三年面试五年模拟》之独孤九剑秘籍:
【三年面试五年模拟】AIGC时代的算法工程师的求职面试秘籍(持续更新中)
18. 深入浅出完整解析AIGC时代中GAN(Generative Adversarial Network)系列模型核心基础知识
GAN系列模型作为传统深度学习时代的最热门生成式Al模型,在AIGC时代继续繁荣,作为Stable Diffusion/FLUX系列大模型的"得力助手",广泛活跃于AlGC图像创作的产品与工作流中:
深入浅出完整解析AIGC时代中GAN(Generative Adversarial Network)系列模型核心基础知识