欧洲也开源了「78B 只激活 3.46B」:主权叙事变了,技术选型没变

一、发生了什么

德国 AI 公司 Aleph Alpha 于 10 月 3 日发布并开源大模型 Kolibri:总参数 78.1B、每 token 仅激活 3.46B(激活比约 4.4%),德英双语,原生上下文 262,144 token、官方称测试可用到 100 万;权重以 Apache 2.0 协议放上 Hugging Face,随附一份 189 页的技术报告(来源:Aleph Alpha 官方发布文,经 HuggingNews、Web Pulse、AGI Hunt 多源转述)。公司把它定位为「主权模型」:德国团队建造、德国与芬兰的基础设施训练、客户可完全本地化部署。

二、技术拆解

先看稀疏账本。Kolibri 是典型的细粒度 MoE:384 个专家、每个 token 路由 6 个,总参与激活比约 22.6:1。这个数字眼熟------我 9 月 29 日写 IQuest-Q1:320B 只激活 15B 时数过,当时一个月内四款新开源模型的稀疏比全部压在 20~24:1 区间;今天这份欧洲模型,落点几乎一样。

模型 总参 激活 稀疏比 短板
Kolibri(欧洲) 78.1B 3.46B 约 22.6:1 跑分全自报,无第三方复现
IQuest-Q1 320B 15B 约 21:1 许可证自定义,需 fork 推理框架
Step 5 Preview 600B 27B 约 22:1 发布时权重未开放(官方称 10-15 开源)
LongCat-2.5-Preview 约 1.6T 约 480B 激活比约 3.3% Preview 阶段无价格表、无第三方跑分

这张表里还藏着一条暗线:上下文。Kolibri 原生 262K、测试到 1M------和 9 月 25 日上线的 LongCat-2.5(原生 100 万 token 上下文)口径趋同。注意区分口径:「原生支持」和「测试可用」是两回事,262K 是设计值,1M 是官方压力测试口径,真用之前最好自己压测一遍。

再看部署账。FP8 精度下权重大约 78GB,一张 80GB 卡就能装下推理------这正是「激活 3.46B」的意义:部署显存看总参,推理成本看激活,是两本账。9 月 21 日写 Step 5(600B 只激活 27B)时拆过这两本账,Kolibri 是同一套算法在不同体量上的复刻。官方主打 on-premise:数据不出门,模型不会被别人改掉或关停。

最后是「主权」具体指什么。按官方口径拆开是三件事:训练全程可审计(从数据摄取到评测逐环节交底,并签署了欧盟通用 AI 行为准则);部署完全自由;合规「作为继承属性」随模型交付。有意思的是数据管线自己交了底:英文语料用谷歌 Gemma 4 改写、德语用 Mistral-NeMo、质量过滤用 Qwen3-32B 打标------「无外国控制」的模型,清洗数据用的是中美欧三家实验室的模型,这个细节值得咂摸。

三、我的判断

第一,稀疏带已经全球化。中国的 IQuest-Q1、Step 5,欧洲的 Kolibri,稀疏比全部落在 20~24:1。这不是巧合:细粒度专家加小激活,是当前「质量/服务成本」上最稳妥的工程解。主权叙事、地缘故事各说各的,技术选型已经收敛到同一页上。

第二,被低估的可能是训练管线。官方博客花大篇幅讲 Model Training as Code:数百个消融实验自动运行、硬件故障和数据中断不需要人介入、从 30B 的 Kolibri Origin 到 78B 的 Kolibri 发布间隔极短。对小团队来说,这条「流水线复利」比单点跑分更值得抄。

第三,冷静剂要吃足。AIME 96.9%、「匹配四倍激活参数的模型」全部是厂商自报,无第三方复现;「帕累托前沿」是在自家坐标系里的比较;德英双语对中文场景直接价值有限;训练代码与方法不随权重开放。它是干净的 Apache 2.0,但不是全部透明。

四、对开发者的启示

评估这类「主权/合规」开源模型,建议固定四个检查项:稀疏比与激活账(决定推理成本)、上下文口径(原生值对测试值)、许可证边界(权重协议对训练代码归属)、跑分是否自报。第一项可以自动化:

python 复制代码
# moe_ledger.py ------ MoE 模型稀疏账本速算
def moe_ledger(total_b: float, active_b: float, fp8: bool = True):
    ratio = total_b / active_b
    act_pct = active_b / total_b * 100
    weight_gb = total_b * (1 if fp8 else 2)
    band = "20~24:1 模板带内" if 20 <= ratio <= 24 else "模板带外"
    print(f"稀疏比 {ratio:.1f}:1(激活 {act_pct:.1f}%)→ {band}")
    print(f"权重内存({'FP8' if fp8 else 'BF16'})约 {weight_gb:.0f} GB")
    print(f"80GB 单卡可装: {'是' if weight_gb <= 80 else '需多卡或量化'}")

moe_ledger(78.1, 3.46)   # Kolibri: 约 22.6:1,FP8 约 78GB,单卡可装
moe_ledger(320, 15)      # IQuest-Q1: 约 21.3:1,FP8 约 320GB,需多卡

真要本地部署时再补两项:推理框架对细粒度 MoE 的支持程度,以及长上下文下的 KV cache 显存------后者往往才是压垮单机的那根稻草。

FAQ

Q:Kolibri 对中文开发者有什么用?

A:德英双语对中文业务直接价值有限,但它的账本结构通用:稀疏比、上下文口径、许可证拆分、合规继承,这套评估框架换任何开源模型都成立。

Q:Apache 2.0 权重等于完全开源吗?

A:不等于。权重与配置文件是 Apache 2.0,但训练代码和方法的权利保留在公司手里。「能商用部署」和「能复现训练」是两件事。

Q:100 万上下文能直接按 1M 规划吗?

A:官方口径是原生 262,144、测试到 1,048,576。生产环境按原生值做容量规划,1M 先当实验室数字看待。

上周我在《本周 AI 观察》里写 DeepSeek 把昇腾组件整套开源,说硬件生态在分层(那篇在这里);今天这份欧洲模型是同一件事的另一半------分层之外,选型在趋同。如果你更关心把模型塞进小机器那条线,我之前复盘过 5.9GB 跑 27B 的三元压缩,和 Kolibri 正好是开源路线的两个极端。

这个专栏每天一篇 AI 解读,关注不迷路。

你们评估开源模型时,第一个看的数字是稀疏比、跑分,还是许可证?

------ 专注 AI 工程化实践与出海外贸技术

相关推荐
进击的雷神1 小时前
OpenClaw 太重、启动太慢?我试了试这个 Rust 重写的轻量版 AI 助手网关
开发语言·人工智能·rust·zeroclaw
微软技术分享1 小时前
BinSentry 1.0 二进制哨兵测试版发布
人工智能
蒲公英eric1 小时前
Python工具链与LaTeX排版:把兵器配齐
人工智能·python·算法·数学建模·数学建模工具
海盗12341 小时前
AI 新闻日报 2026-10-03:编排写进代码、领域知识打包成技能、具身智能回到班次与价格
人工智能·机器人·人工智能aigc
沐言人生1 小时前
牛逼!Github上有人开源了,让AI帮你生成数学物理解题视频
人工智能
liulilittle1 小时前
短期内不存在通用 AI 工作流魔法
大数据·开发语言·c++·人工智能·llm·agent·tools
别动我齐刘海1 小时前
简历技术栈全面复习总结
c++·人工智能·深度学习·学习·tcp/ip·算法·rpc
AIUCE1 小时前
都说Muse开源了,其实开源的是 gadget SDK,不是 Muse
人工智能
lucas_AI1 小时前
100 个 AI 组队做数学,27 分钟集体沦陷:DeepMind 记录了一场教科书级多智能体事故
人工智能