
德国 AI 实验室 Aleph Alpha 在 10 月 3 日发布了开源权重模型 Kolibri,总参数量 78B,采用 Apache 2.0 许可证。这是一个混合专家架构(MoE)模型,每次推理仅激活 3.46B 参数,在英文数学和代码测试中达到 90 分以上,同时对德语提供了较强支持。
架构与训练
Kolibri 采用 50 层结构,全部使用 MoE,共 384 个专家。预训练使用 768 块 B200 GPU,历时 21 天完成,于 9 月 11 日结束。模型处理了超过 200T token 的原始数据,知识截止日期为 6 月 18 日。
训练数据中英语占比约 62%,代码占比 14%,德语 token 约 4.3T,占总训练数据约 21.3%。预训练期间遇到 38 次非计划中断。
预训练后,模型经过 3.44T token 的中训阶段和 200B token 的长上下文适配。Kolibri 支持最长 1M token 的上下文,通过混合注意力机制实现:10 层处理完整上下文,其余 40 层使用 512 token 的滑动窗口。
测试表现
官方给出的测试成绩:
- AIME 2025 英文 96.9,德文 87.5
- AIME 2026 英文 96.0,德文 90.0
- HumanEval+ 92.7
这些分数显示 Kolibri 在数学推理和代码生成任务上有较好表现。德语测试分数略低于英语,但仍在 87.5 到 90.0 之间。
Kolibri Origin
Aleph Alpha 同时发布了 Kolibri Origin,这是一个更小的前序版本,总参数 30.6B,激活参数 3.27B,于 6 月 11 日完成预训练。Origin 使用 7.5T 训练 token,支持 65k token 上下文窗口。
适用场景
Kolibri 通过 MoE 架构降低了推理成本,激活参数仅占总参数的约 4.4%。对于需要处理德语内容或超长文档的应用,Kolibri 提供了开源选择。Apache 2.0 许可证允许商业使用和修改。
模型知识截止于 6 月 18 日,不包含之后的信息。对于需要最新知识的场景需要配合外部检索或更新机制使用。