一、发生了什么
德国 AI 公司 Aleph Alpha 于 10 月 3 日发布并开源大模型 Kolibri:总参数 78.1B、每 token 仅激活 3.46B(激活比约 4.4%),德英双语,原生上下文 262,144 token、官方称测试可用到 100 万;权重以 Apache 2.0 协议放上 Hugging Face,随附一份 189 页的技术报告(来源:Aleph Alpha 官方发布文,经 HuggingNews、Web Pulse、AGI Hunt 多源转述)。公司把它定位为「主权模型」:德国团队建造、德国与芬兰的基础设施训练、客户可完全本地化部署。
二、技术拆解
先看稀疏账本。Kolibri 是典型的细粒度 MoE:384 个专家、每个 token 路由 6 个,总参与激活比约 22.6:1。这个数字眼熟------我 9 月 29 日写 IQuest-Q1:320B 只激活 15B 时数过,当时一个月内四款新开源模型的稀疏比全部压在 20~24:1 区间;今天这份欧洲模型,落点几乎一样。
| 模型 | 总参 | 激活 | 稀疏比 | 短板 |
|---|---|---|---|---|
| Kolibri(欧洲) | 78.1B | 3.46B | 约 22.6:1 | 跑分全自报,无第三方复现 |
| IQuest-Q1 | 320B | 15B | 约 21:1 | 许可证自定义,需 fork 推理框架 |
| Step 5 Preview | 600B | 27B | 约 22:1 | 发布时权重未开放(官方称 10-15 开源) |
| LongCat-2.5-Preview | 约 1.6T | 约 480B | 激活比约 3.3% | Preview 阶段无价格表、无第三方跑分 |
这张表里还藏着一条暗线:上下文。Kolibri 原生 262K、测试到 1M------和 9 月 25 日上线的 LongCat-2.5(原生 100 万 token 上下文)口径趋同。注意区分口径:「原生支持」和「测试可用」是两回事,262K 是设计值,1M 是官方压力测试口径,真用之前最好自己压测一遍。
再看部署账。FP8 精度下权重大约 78GB,一张 80GB 卡就能装下推理------这正是「激活 3.46B」的意义:部署显存看总参,推理成本看激活,是两本账。9 月 21 日写 Step 5(600B 只激活 27B)时拆过这两本账,Kolibri 是同一套算法在不同体量上的复刻。官方主打 on-premise:数据不出门,模型不会被别人改掉或关停。
最后是「主权」具体指什么。按官方口径拆开是三件事:训练全程可审计(从数据摄取到评测逐环节交底,并签署了欧盟通用 AI 行为准则);部署完全自由;合规「作为继承属性」随模型交付。有意思的是数据管线自己交了底:英文语料用谷歌 Gemma 4 改写、德语用 Mistral-NeMo、质量过滤用 Qwen3-32B 打标------「无外国控制」的模型,清洗数据用的是中美欧三家实验室的模型,这个细节值得咂摸。
三、我的判断
第一,稀疏带已经全球化。中国的 IQuest-Q1、Step 5,欧洲的 Kolibri,稀疏比全部落在 20~24:1。这不是巧合:细粒度专家加小激活,是当前「质量/服务成本」上最稳妥的工程解。主权叙事、地缘故事各说各的,技术选型已经收敛到同一页上。
第二,被低估的可能是训练管线。官方博客花大篇幅讲 Model Training as Code:数百个消融实验自动运行、硬件故障和数据中断不需要人介入、从 30B 的 Kolibri Origin 到 78B 的 Kolibri 发布间隔极短。对小团队来说,这条「流水线复利」比单点跑分更值得抄。
第三,冷静剂要吃足。AIME 96.9%、「匹配四倍激活参数的模型」全部是厂商自报,无第三方复现;「帕累托前沿」是在自家坐标系里的比较;德英双语对中文场景直接价值有限;训练代码与方法不随权重开放。它是干净的 Apache 2.0,但不是全部透明。
四、对开发者的启示
评估这类「主权/合规」开源模型,建议固定四个检查项:稀疏比与激活账(决定推理成本)、上下文口径(原生值对测试值)、许可证边界(权重协议对训练代码归属)、跑分是否自报。第一项可以自动化:
python
# moe_ledger.py ------ MoE 模型稀疏账本速算
def moe_ledger(total_b: float, active_b: float, fp8: bool = True):
ratio = total_b / active_b
act_pct = active_b / total_b * 100
weight_gb = total_b * (1 if fp8 else 2)
band = "20~24:1 模板带内" if 20 <= ratio <= 24 else "模板带外"
print(f"稀疏比 {ratio:.1f}:1(激活 {act_pct:.1f}%)→ {band}")
print(f"权重内存({'FP8' if fp8 else 'BF16'})约 {weight_gb:.0f} GB")
print(f"80GB 单卡可装: {'是' if weight_gb <= 80 else '需多卡或量化'}")
moe_ledger(78.1, 3.46) # Kolibri: 约 22.6:1,FP8 约 78GB,单卡可装
moe_ledger(320, 15) # IQuest-Q1: 约 21.3:1,FP8 约 320GB,需多卡
真要本地部署时再补两项:推理框架对细粒度 MoE 的支持程度,以及长上下文下的 KV cache 显存------后者往往才是压垮单机的那根稻草。
FAQ
Q:Kolibri 对中文开发者有什么用?
A:德英双语对中文业务直接价值有限,但它的账本结构通用:稀疏比、上下文口径、许可证拆分、合规继承,这套评估框架换任何开源模型都成立。
Q:Apache 2.0 权重等于完全开源吗?
A:不等于。权重与配置文件是 Apache 2.0,但训练代码和方法的权利保留在公司手里。「能商用部署」和「能复现训练」是两件事。
Q:100 万上下文能直接按 1M 规划吗?
A:官方口径是原生 262,144、测试到 1,048,576。生产环境按原生值做容量规划,1M 先当实验室数字看待。
上周我在《本周 AI 观察》里写 DeepSeek 把昇腾组件整套开源,说硬件生态在分层(那篇在这里);今天这份欧洲模型是同一件事的另一半------分层之外,选型在趋同。如果你更关心把模型塞进小机器那条线,我之前复盘过 5.9GB 跑 27B 的三元压缩,和 Kolibri 正好是开源路线的两个极端。
这个专栏每天一篇 AI 解读,关注不迷路。
你们评估开源模型时,第一个看的数字是稀疏比、跑分,还是许可证?
------ 专注 AI 工程化实践与出海外贸技术