Reflection AI 发布 501B 参数开放权重模型 Beam

Reflection AI 发布了 Beam,这是该公司首个开放权重模型。Beam 采用稀疏激活架构,总参数量为 501B,每个 token 激活 23B 参数。模型在 23.8 万亿 token 上完成预训练,整个预训练阶段在 4 周内完成,训练期间 Goodput(有效计算利用率)达到 92.3%。

强化学习训练规模

Beam 的强化学习训练使用了 10.5K 块 NVIDIA GB300 GPU,持续 4 周。训练过程生成了超过 1 亿次 rollouts,最大 rollout 上下文长度达到 256K tokens。整个训练消耗了约 13 亿个 sandboxes,涉及近 1 百万个编码、智能体和 STEM 环境。

训练系统平均维持 110K 个并发 rollouts。新权重到达推理集群的中位延迟约为 12 秒。训练期间处理了 71 起推理事故。

性能表现

在 SWE-bench Verified 上,Beam 得分 80.9,高于 Nemotron 3 Ultra 的 70.7。Nemotron 3 Ultra 总参数 550B、激活参数 55B。

在 Terminal Bench v2.1 上,Beam 得分 80.1,低于 GLM 5.2 的 81.0、Kimi K3 的 88.3 和 DeepSeek V4.1 Flash 的 90.6。GLM-5.2 总参数约 753B、激活参数约 40B;Kimi K3 总参数 2.8T、激活参数 104B;DeepSeek V4.1 Flash 包含 552B backbone 和 196B Engram,prefill 激活 8B、decode 激活 16B。

在 DeepSWE v1.1 上,Beam 得分 44.4,接近 GLM 5.2 的 44.0,但低于 GLM 5.3 的 61.0、Qwen 3.8 Max 的 51.0、Kimi K3 的 68.0 和 DeepSeek V4.1 Flash 的 74.2。

在 SWE Bench Pro v2-Hard 上,Beam 得分 77.2,高于 Inkling 的 56.9,但低于 GLM 5.3 的 84.3 和 Kimi K3 的 88.2。

在数学任务 AIME 2026 上,Beam 得分 97.8,略低于 Inkling 的 97.1 和 GLM 5.2 的 99.2。

适用场景

Beam 的设计偏向代码生成和 STEM 推理任务。23B 激活参数使其在推理成本和性能之间取得平衡,适合需要大量并发推理的应用场景。作为开放权重模型,开发者可以自行部署和定制。

在多个基准测试中,Beam 表现处于中上水平,在部分任务上不及参数更大或激活参数更多的模型。选择 Beam 还是其他模型,需要根据具体任务类型、推理成本预算和是否需要开放权重来决定。

相关推荐
m4Rk_2 小时前
【论文阅读】Agent 记忆机制(91):THEANINE——不删除过时记忆,让 Agent 记住事情是如何变化的
论文阅读·人工智能·学习·开源·github
microrain3 小时前
同一个寄存器,四种读法:SagooIoT Modbus 驱动的字节序、宽度与功能码
物联网·golang·开源·sagooiot
高频因子挖掘机4 小时前
批量行情返回后,怎样把请求失败的股票单独挑出来?
后端·github·api
EatFan5 小时前
从 CUDA 到昇腾:一张对照表拆解 DeepSeek 最新开源组件(TileLang / DeepGEMM / DeepEP / TileKernels)
开源·cuda·deepseek·deepgemm·tilelang·华为昇腾
奥德元6 小时前
XiaoMate功能介绍: 让桌宠帮你分析你的桌面屏幕
github
TunerT_TQ6 小时前
【开源评测】dots:自带浏览器的 Web AI Agent——C++ 级反检测路径的工程取舍与争议
github
Maynor在掘金6 小时前
1.9 万 Star 的 Hypit:让 AI Agent 帮你“一键复刻”爆款视频,保姆级上手教程
vue.js·github
ttwuai6 小时前
Go开源后台管理系统推荐:README、源码和License应该怎么验
开发语言·golang·开源
嘎嘎风6 小时前
MiniMind 学习笔记之 05 从 768 维到下一个 token
github·源码阅读