Reflection AI 发布 501B 参数开放权重模型 Beam

Reflection AI 发布了 Beam,这是该公司首个开放权重模型。Beam 采用稀疏激活架构,总参数量为 501B,每个 token 激活 23B 参数。模型在 23.8 万亿 token 上完成预训练,整个预训练阶段在 4 周内完成,训练期间 Goodput(有效计算利用率)达到 92.3%。

强化学习训练规模

Beam 的强化学习训练使用了 10.5K 块 NVIDIA GB300 GPU,持续 4 周。训练过程生成了超过 1 亿次 rollouts,最大 rollout 上下文长度达到 256K tokens。整个训练消耗了约 13 亿个 sandboxes,涉及近 1 百万个编码、智能体和 STEM 环境。

训练系统平均维持 110K 个并发 rollouts。新权重到达推理集群的中位延迟约为 12 秒。训练期间处理了 71 起推理事故。

性能表现

在 SWE-bench Verified 上,Beam 得分 80.9,高于 Nemotron 3 Ultra 的 70.7。Nemotron 3 Ultra 总参数 550B、激活参数 55B。

在 Terminal Bench v2.1 上,Beam 得分 80.1,低于 GLM 5.2 的 81.0、Kimi K3 的 88.3 和 DeepSeek V4.1 Flash 的 90.6。GLM-5.2 总参数约 753B、激活参数约 40B;Kimi K3 总参数 2.8T、激活参数 104B;DeepSeek V4.1 Flash 包含 552B backbone 和 196B Engram,prefill 激活 8B、decode 激活 16B。

在 DeepSWE v1.1 上,Beam 得分 44.4,接近 GLM 5.2 的 44.0,但低于 GLM 5.3 的 61.0、Qwen 3.8 Max 的 51.0、Kimi K3 的 68.0 和 DeepSeek V4.1 Flash 的 74.2。

在 SWE Bench Pro v2-Hard 上,Beam 得分 77.2,高于 Inkling 的 56.9,但低于 GLM 5.3 的 84.3 和 Kimi K3 的 88.2。

在数学任务 AIME 2026 上,Beam 得分 97.8,略低于 Inkling 的 97.1 和 GLM 5.2 的 99.2。

适用场景

Beam 的设计偏向代码生成和 STEM 推理任务。23B 激活参数使其在推理成本和性能之间取得平衡,适合需要大量并发推理的应用场景。作为开放权重模型,开发者可以自行部署和定制。

在多个基准测试中,Beam 表现处于中上水平,在部分任务上不及参数更大或激活参数更多的模型。选择 Beam 还是其他模型,需要根据具体任务类型、推理成本预算和是否需要开放权重来决定。

相关推荐
xiangshangdemayi1 小时前
Strata教程:让GISer真正实现了token自由
ai·gis·教程·token·strata·自由
空堂与归2 小时前
Hinton 首篇 RSI 论文:AI 自我进化怎么闭环?
人工智能·ai
软件开发技术深度爱好者2 小时前
DeepSeek Harnesss使用教程
ai·技术实践
2601_956743682 小时前
上海GEO营销工程实践:知识库构建、AI内容生产、官网承接与监测优化闭环评估
人工智能·ai·geo·上海
空心木偶☜4 小时前
LangGraph 错误处理和重试机制
ai·ai编程·langgraph
菩提小狗5 小时前
每日极客日报 · 2026年10月06日
ai·开源·极客日报·it热点·技术资讯
林伽一6 小时前
能力趋同、账单分化,技术选型正在从榜单转向负载|2026年10月06日
人工智能·科技·安全·ai
suliqiang7 小时前
AI 编程新范式:Agentic、Vibe 与 Spec 实战指南
ai·ai编程
互联网叫兽7 小时前
RAG 知识库-基于元数据的细粒度权限控制
ai·llm·rag