Kolibri 拆解:计算像 3.5B、显存要 78GB 的德国主权模型,把合规做进六个架构决策

一只蜂鸟登上 HN 首页

2026 年 10 月 3 日,德国公司 Aleph Alpha 发布了开放权重模型 Kolibri。

同一天,讲透它的技术博客被顶上 Hacker News 首页,拿到 413 分。

Kolibri 在德语里是蜂鸟,这个名字起得相当精准。

它整套路数的核心就是轻:计算量像小模型,能力却不让同尺寸开源模型。

先看三个硬数字:总参数 781 亿,每 token 激活 34.6 亿,激活占比 4.4%。

许可证 Apache 2.0,权重直接放在 Hugging Face 上,名字是 Aleph-Alpha/Kolibri-1。

训练从头开始,跑了约 24 万亿 token,用 768 块 NVIDIA B200。

训练数据里超过五分之一是德语,这是一个刻意倾斜的比例。

知识截止 2026 年 6 月 18 日,原生上下文 262144,外推测试到 100 万 token。

这些数字拼出来的画面很矛盾:计算像 35 亿模型,显存像 780 亿模型。

这个矛盾不是缺陷,而是理解整篇架构设计的钥匙。

下面把 Kolibri 拆成六个架构决策,看德国团队怎么把合规做进模型本身。

本文事实全部来自 Aleph Alpha 的 189 页技术报告、Hugging Face 模型卡与官方发布文,加一篇实测其分词器的独立博客。

主权不是口号,是两条承诺

Aleph Alpha 给主权的定义有两条,第一条关于怎么造的。

模型由德国团队构建,训练放在德国和芬兰的基础设施上。

全程适用欧洲和德国法律,没有任何外国控制权。

第二条关于客户拿到什么:完全的部署自由和知识产权安全。

翻译成大白话,一个部委或一家汽车供应商可以把它跑在自己的机房里。

数据不出楼,也没有任何人能在你头顶上远程关掉或替换这个模型。

Aleph Alpha 还签署了欧盟的通用人工智能实践准则。

但主权不等于纯净,模型卡自己交代了训练链路里的外国成分。

英语网页语料用谷歌 Gemma 4 改写,德语用 Mistral-NeMo 改写。

数据质量过滤用的是 Qwen3-32B 打的标签。

他们还专门过滤了政治偏见,此前自己测过中国开源模型的立场分布。

这套坦白很务实:主权指的是控制权,不是关起门来假装外国工具不存在。

决策一:384 个专家,每个 token 只见 6 个

Kolibri 有 50 层,每层 384 个专家,外加 1 个所有 token 必经的共享专家。

路由器给每个 token 从 384 个专家里挑 6 个。

这就是 781 亿参数变成 34.6 亿实际计算量的全部机关。

打个比方, dense 模型是读遍所有医学书的全科医生,MoE 是一整家专科医院。

路由器就是前台,负责把每个 token 分给最合适的 6 位专科医生。

但这个比方有两个会误导的地方,研究者在开源社区反复强调过。

第一,专家学到的不是德语法律这种人类可理解的科目。

翻开看大多是标点、专有名词这类 token 模式,不是整齐的学科分工。

第二,医院必须养着全部 384 位专家,哪怕你每次只见 6 位。

模型卡写得很直白:即使任一时刻只有部分参数激活,完整模型也必须驻留内存。

约 78GB 的 FP8 权重,意味着数据中心的 GPU 起步,笔记本永远无缘。

计算像 3.5B,显存要 78B,这句话就是 MoE 的账本。

决策二:会读德语长单词的分词器

德语把词粘成长复合词,英语语料喂出来的分词器会把它们切碎。

联邦宪法法院的德语名 Bundesverfassungsgericht,GPT-5 的 o200k_base 切成 6 块。

Kolibri 的分词器只需要 2 块:Bundes 和 verfassungsgericht。

它的词表 128000,用自研的 UniBPE 算法训练。

思路是保留 BPE 自底向上的合并,但换用 Unigram 目标来挑选每次合并。

这让分词器尊重德语的构词方式,而不是硬套英语习惯。

官方报告说比 GPT-5 的分词器省 11.2% 的德语 token。

博主自己做了更狠的验证:拿整部德国基本法,加上官方英译本,跑了 6 个分词器。

结果 Kolibri 在法律德语上省了 15%,英语上则和 GPT-5 打平。

省 token 是很实际的收益:同样窗口塞得下更多合同,推理步数更少,账单更轻。

对以长文档为核心场景的模型来说,分词器不是细节,是第一性架构。

决策三:40 层只看眼前,每 5 层才回望全局

Kolibri 的 50 层里,40 层用滑窗注意力,每个 token 只看前面 512 个。

每第 5 层才做一次全量注意力,回顾之前的一切。

像读一份长合同,多数时间盯住当前句子,每隔几页停下来通盘想一遍。

这是 100 万 token 上下文在算力上能成立的原因。

里面还有个聪明细节:只有滑窗层知道 token 的位置编码。

全量注意力层不携带旋转位置编码,于是上下文可以滑出训练长度继续外推。

官方在 RULER 长上下文测试上验证到 1048576 token。

100 万 token 处 Kolibri 基座拿 63.2 分,同激活量的 Qwen3.5 基座是 57.5。

但注意长度的中段反而是它的低谷,128000 处只有 67.9,对手是 89.9。

它的长上下文优势只在极长的那一端兑现,这是一个要记住的边界。

决策四:逼模型用德语思考

推理模型会先想再答,但即便面对德语提问,它们大多用英语想。

Aleph Alpha 在 9 月 24 日专门发文讲过这个冷启动问题。

他们先造了约 80 万条德语推理样本,结果少量的德语推理数据反而有害。

模型的德语数学分从 70.2 掉到 48.3,德语思维在里面绕圈圈,转不出结果。

只有把德语数据加到足够大,分数才爬回 67.3。

Kolibri 吃到了完整的教训红利:德语提问就用德语推理。

德国版 AIME 2025 它拿 87.5 分,是同激活量档位的第一名。

英语版 AIME 更是拿到 96.9,超过对比清单里所有 MoE 模型。

连 120 亿激活参数的模型都排在它后面。

这说明推理语言和数据规模的关系,比多数人直觉的更陡峭。

决策五:训练它说不知道

幻觉是长文档问答的死穴,RAG 的前提是模型肯承认文档里没有答案。

Aleph Alpha 为此用了自研的 Merlin-Arthur 协议,一个三方博弈。

Arthur 是模型,拿着一份被隐藏了部分内容的文档回答问题。

Merlin 负责藏掉无关部分,让正确答案更容易被看见,Arthur 要学会答。

Morgana 专门藏掉答案依赖的关键证据,Arthur 要学会说不知道。

Arthur 永远不知道对面是 Merlin 还是 Morgana。

唯一稳赢策略就是真的去检查眼前的证据是否支撑答案。

效果在 Omniscience 测试上可见:不知道时它有 44% 概率明说或给部分答案。

同场对比里,Qwen3.5 35B-A3B 只有 11.1%,GPT-OSS 120B 是 23.7%。

代价同样写在模型卡上:闭卷测试它是 12 个模型里的最后一名。

它知道自己不知道什么,但它记住的东西也确实更少。

当检索库,它值得信任;当百科全书,它会让你失望。

决策六:思考力度按请求调节

每个请求都能把 reasoning_effort 设为 none、low、medium 或 high。

简单查询直接答,硬问题给一段长思考,同一模型同一服务器完成。

部署方不用为快慢两种负载各养一套服务。

这个设计和各家 API 已经收敛的用法一致,迁移成本很低。

强项与弱项都在明面上

Aleph Alpha 把最弱的指标和最强的放在一起公开,这值得单独说一句。

强项:综合分英语 75.5、德语 70.8,都是同激活量开源模型里的第一。

企业文档问答英语 89.7,这组测试来自半导体、公共部门、航天等五类真实客户工作。

弱项一个比一个具体,先看记忆:闭卷只有 51.0 分,Omniscience 正确率仅 14.8%。

再看工具调用,多轮场景 39.8 分,GLM-4.7 Flash 是 58.2。

编码代理也弱:Terminal-Bench 2.1 拿 27.7,Qwen3.5 是 39.7。

SWE-bench Verified 66.4,比 Qwen3.6 的 73.8 低了 7 分。

还有两条工程现实:需要自家的 vLLM 插件,且发布当天没有任何托管厂商上线它。

只支持德英双语,模型卡称之为刻意的深度优先于广度。

更大的 dense 模型 Qwen3.8 27B 综合分更高,但每 token 动用近 8 倍参数。

Kolibri 的全部取舍都围绕这条线:用激活效率换记忆广度。

部署:一张 H200 起步

显存需求约 78GB,两张 80GB 的 A100 或 H100 是下限。

单张 H200、B200 或 B300 也够。

推理走 vLLM,但要先装 Aleph Alpha 的插件来认识这个新架构。

装好之后就是标准的 OpenAI 兼容服务,任何 OpenAI 客户端都能直接连。

复制代码
pip install 'aleph-alpha-inference>=1'

vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
  --reasoning-parser kolibri1 \
  --tool-call-parser kolibri1 \
  --enable-auto-tool-choice

# KV cache 也用 FP8,进一步压显存
# 想跑满 100 万上下文再加两个参数:
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
  --max-model-len 1048576 \
  --hf-overrides '{"max_position_embeddings": 1048576}'

调用侧通过聊天模板传思考力度,采样参数官方推荐 temperature 1.0。

对延迟敏感的场景,上下文别超过原生训练长度 262144。

复制代码
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1",
                api_key="EMPTY")
resp = client.chat.completions.create(
    model="Aleph-Alpha/Kolibri-1",
    messages=[{"role": "user",
               "content": "Erkläre kurz, was ein MoE-Modell ist."}],
    extra_body={"chat_template_kwargs":
                {"reasoning_effort": "high",
                 "enable_thinking": True}},
)
print(resp.choices[0].message.content)

同档位横向对比

指标 Kolibri 1 Qwen3.5 35B-A3B Qwen3.8 27B
总参数 78.1B / 激活 3.46B 35B / 激活 3B 27B dense
综合分英语 75.5 74.7 80.2
综合分德语 70.8 69.8 79.9
AIME 2025 英语 96.9 --- 更高但 8 倍算力
100 万 token RULER 63.2 57.5 ---
128K token RULER 67.9 89.9 ---
弃答率 Omniscience 44.0% 11.1% ---
Terminal-Bench 2.1 27.7 39.7 ---
显存需求 约 78GB FP8 数据中心级 单卡可行

表格读法很简单:综合能力它贴着同激活量冠军,长文末端和弃答率是独门。

编码和工具调用不要选它,那是 Qwen3.6 的地盘。

它适合什么,不适合什么

答案指向一个具体人群:文本是德语、数据不能出楼、宁可听话也别编造的用户。

政府部门、银行、制造商、航空供应商,全部命中。

对长德语法律、合同、手册做 RAG,踩中它每一个强项。

分词器省的 15%、100 万窗口、44% 的弃答率,三者在这一场景同时生效。

博主自己就在这样的项目里:柏林夏里特医院的神经科分诊助手。

患者坐在全科诊所的电脑前,AI 代理做完测试并给症状分级。

对话全程德语,内容是健康数据,模型必须跑在自己控制的机器上。

反过来说,编码代理、闭卷问答、德英以外的语言、没有 78GB 显卡的团队,都别碰。

后一种情况,为单一任务微调的小模型依然是更便宜的答案。

真正值得带走的三件事

第一件事,主权可以被编译进架构,而不是写在采购合同里。

UniBPE、德语推理数据、弃答训练,每一项都是可验证的工程产物。

合规从部署后审计变成了模型的出厂属性,这是 Kolibri 最有价值的方法论。

第二件事,推理语言是被数据量解锁的能力,不是模型自带的天赋。

70.2 到 48.3 再到 67.3 的曲线警告所有人:小语种推理数据宁缺毋滥。

第三件事,激活参数和总参数的分离正在制造新的选型维度。

买模型不再只看跑分,要看激活比、显存账单、分词效率和弃答率。

对中国开发者,这套打法同样成立:把特定领域做深,通用能力让位。

中文复合词和术语同样在被通用分词器切碎,同样的账本逻辑可以复算。

先算清自己的语料构成,再决定是微调小模型还是部署 78GB 的专科医院。

选型的出发点永远是你的数据长什么样,而不是榜单上谁的分更高。

蜂鸟的启示不是小而美,而是把每一比特参数花在你真正服务的语言上。

相关推荐
EasyBr指纹浏览器1 小时前
抖音账号诊断:公开作品样本能说明什么?
数据分析·开源·内容运营·抖音
程序员清风2 小时前
Langfuse 实战:用开源平台追踪和评估大模型应用
开源
倔强的石头1062 小时前
LLaMA系列架构详解_Meta开源大模型的技术演进
开源·大模型·llama
小草cys3 小时前
MiniMax H3 和 Wan2.2的对比
大模型·图像生成·多模态大模型·视频生成·minimax·wan
miofly3 小时前
macOS 本地 AI 搜索工具 SCM 发布 0.2.4 版本,支持多模型照片视频检索
开源·github
java1234_小锋3 小时前
shadcn/ui 开源项目,专业打造专业UI
ui·开源
microrain3 小时前
权限改了,接口立刻生效,菜单要等重新登录:SagooIoT 权限体系的四道闸门
物联网·golang·开源·sagooiot
文慧的科技江湖3 小时前
2026年10月4日充电桩行业晚报:当“只充80%“成为通行规则,行业开始管单车占桩时长 | 慧知开源充电桩平台
开源·apache·新能源·虚拟电厂·充电桩·ocpp·v2g