
Reflection AI 发布了 Beam,这是该公司首个开放权重模型。Beam 采用稀疏激活架构,总参数量为 501B,每个 token 激活 23B 参数。模型在 23.8 万亿 token 上完成预训练,整个预训练阶段在 4 周内完成,训练期间 Goodput(有效计算利用率)达到 92.3%。
强化学习训练规模
Beam 的强化学习训练使用了 10.5K 块 NVIDIA GB300 GPU,持续 4 周。训练过程生成了超过 1 亿次 rollouts,最大 rollout 上下文长度达到 256K tokens。整个训练消耗了约 13 亿个 sandboxes,涉及近 1 百万个编码、智能体和 STEM 环境。
训练系统平均维持 110K 个并发 rollouts。新权重到达推理集群的中位延迟约为 12 秒。训练期间处理了 71 起推理事故。
性能表现
在 SWE-bench Verified 上,Beam 得分 80.9,高于 Nemotron 3 Ultra 的 70.7。Nemotron 3 Ultra 总参数 550B、激活参数 55B。
在 Terminal Bench v2.1 上,Beam 得分 80.1,低于 GLM 5.2 的 81.0、Kimi K3 的 88.3 和 DeepSeek V4.1 Flash 的 90.6。GLM-5.2 总参数约 753B、激活参数约 40B;Kimi K3 总参数 2.8T、激活参数 104B;DeepSeek V4.1 Flash 包含 552B backbone 和 196B Engram,prefill 激活 8B、decode 激活 16B。
在 DeepSWE v1.1 上,Beam 得分 44.4,接近 GLM 5.2 的 44.0,但低于 GLM 5.3 的 61.0、Qwen 3.8 Max 的 51.0、Kimi K3 的 68.0 和 DeepSeek V4.1 Flash 的 74.2。
在 SWE Bench Pro v2-Hard 上,Beam 得分 77.2,高于 Inkling 的 56.9,但低于 GLM 5.3 的 84.3 和 Kimi K3 的 88.2。
在数学任务 AIME 2026 上,Beam 得分 97.8,略低于 Inkling 的 97.1 和 GLM 5.2 的 99.2。
适用场景
Beam 的设计偏向代码生成和 STEM 推理任务。23B 激活参数使其在推理成本和性能之间取得平衡,适合需要大量并发推理的应用场景。作为开放权重模型,开发者可以自行部署和定制。
在多个基准测试中,Beam 表现处于中上水平,在部分任务上不及参数更大或激活参数更多的模型。选择 Beam 还是其他模型,需要根据具体任务类型、推理成本预算和是否需要开放权重来决定。