一只蜂鸟登上 HN 首页
2026 年 10 月 3 日,德国公司 Aleph Alpha 发布了开放权重模型 Kolibri。
同一天,讲透它的技术博客被顶上 Hacker News 首页,拿到 413 分。
Kolibri 在德语里是蜂鸟,这个名字起得相当精准。
它整套路数的核心就是轻:计算量像小模型,能力却不让同尺寸开源模型。
先看三个硬数字:总参数 781 亿,每 token 激活 34.6 亿,激活占比 4.4%。
许可证 Apache 2.0,权重直接放在 Hugging Face 上,名字是 Aleph-Alpha/Kolibri-1。
训练从头开始,跑了约 24 万亿 token,用 768 块 NVIDIA B200。
训练数据里超过五分之一是德语,这是一个刻意倾斜的比例。
知识截止 2026 年 6 月 18 日,原生上下文 262144,外推测试到 100 万 token。
这些数字拼出来的画面很矛盾:计算像 35 亿模型,显存像 780 亿模型。
这个矛盾不是缺陷,而是理解整篇架构设计的钥匙。
下面把 Kolibri 拆成六个架构决策,看德国团队怎么把合规做进模型本身。
本文事实全部来自 Aleph Alpha 的 189 页技术报告、Hugging Face 模型卡与官方发布文,加一篇实测其分词器的独立博客。
主权不是口号,是两条承诺
Aleph Alpha 给主权的定义有两条,第一条关于怎么造的。
模型由德国团队构建,训练放在德国和芬兰的基础设施上。
全程适用欧洲和德国法律,没有任何外国控制权。
第二条关于客户拿到什么:完全的部署自由和知识产权安全。
翻译成大白话,一个部委或一家汽车供应商可以把它跑在自己的机房里。
数据不出楼,也没有任何人能在你头顶上远程关掉或替换这个模型。
Aleph Alpha 还签署了欧盟的通用人工智能实践准则。
但主权不等于纯净,模型卡自己交代了训练链路里的外国成分。
英语网页语料用谷歌 Gemma 4 改写,德语用 Mistral-NeMo 改写。
数据质量过滤用的是 Qwen3-32B 打的标签。
他们还专门过滤了政治偏见,此前自己测过中国开源模型的立场分布。
这套坦白很务实:主权指的是控制权,不是关起门来假装外国工具不存在。
决策一:384 个专家,每个 token 只见 6 个
Kolibri 有 50 层,每层 384 个专家,外加 1 个所有 token 必经的共享专家。
路由器给每个 token 从 384 个专家里挑 6 个。
这就是 781 亿参数变成 34.6 亿实际计算量的全部机关。
打个比方, dense 模型是读遍所有医学书的全科医生,MoE 是一整家专科医院。
路由器就是前台,负责把每个 token 分给最合适的 6 位专科医生。
但这个比方有两个会误导的地方,研究者在开源社区反复强调过。
第一,专家学到的不是德语法律这种人类可理解的科目。
翻开看大多是标点、专有名词这类 token 模式,不是整齐的学科分工。
第二,医院必须养着全部 384 位专家,哪怕你每次只见 6 位。
模型卡写得很直白:即使任一时刻只有部分参数激活,完整模型也必须驻留内存。
约 78GB 的 FP8 权重,意味着数据中心的 GPU 起步,笔记本永远无缘。
计算像 3.5B,显存要 78B,这句话就是 MoE 的账本。
决策二:会读德语长单词的分词器
德语把词粘成长复合词,英语语料喂出来的分词器会把它们切碎。
联邦宪法法院的德语名 Bundesverfassungsgericht,GPT-5 的 o200k_base 切成 6 块。
Kolibri 的分词器只需要 2 块:Bundes 和 verfassungsgericht。
它的词表 128000,用自研的 UniBPE 算法训练。
思路是保留 BPE 自底向上的合并,但换用 Unigram 目标来挑选每次合并。
这让分词器尊重德语的构词方式,而不是硬套英语习惯。
官方报告说比 GPT-5 的分词器省 11.2% 的德语 token。
博主自己做了更狠的验证:拿整部德国基本法,加上官方英译本,跑了 6 个分词器。
结果 Kolibri 在法律德语上省了 15%,英语上则和 GPT-5 打平。
省 token 是很实际的收益:同样窗口塞得下更多合同,推理步数更少,账单更轻。
对以长文档为核心场景的模型来说,分词器不是细节,是第一性架构。
决策三:40 层只看眼前,每 5 层才回望全局
Kolibri 的 50 层里,40 层用滑窗注意力,每个 token 只看前面 512 个。
每第 5 层才做一次全量注意力,回顾之前的一切。
像读一份长合同,多数时间盯住当前句子,每隔几页停下来通盘想一遍。
这是 100 万 token 上下文在算力上能成立的原因。
里面还有个聪明细节:只有滑窗层知道 token 的位置编码。
全量注意力层不携带旋转位置编码,于是上下文可以滑出训练长度继续外推。
官方在 RULER 长上下文测试上验证到 1048576 token。
100 万 token 处 Kolibri 基座拿 63.2 分,同激活量的 Qwen3.5 基座是 57.5。
但注意长度的中段反而是它的低谷,128000 处只有 67.9,对手是 89.9。
它的长上下文优势只在极长的那一端兑现,这是一个要记住的边界。
决策四:逼模型用德语思考
推理模型会先想再答,但即便面对德语提问,它们大多用英语想。
Aleph Alpha 在 9 月 24 日专门发文讲过这个冷启动问题。
他们先造了约 80 万条德语推理样本,结果少量的德语推理数据反而有害。
模型的德语数学分从 70.2 掉到 48.3,德语思维在里面绕圈圈,转不出结果。
只有把德语数据加到足够大,分数才爬回 67.3。
Kolibri 吃到了完整的教训红利:德语提问就用德语推理。
德国版 AIME 2025 它拿 87.5 分,是同激活量档位的第一名。
英语版 AIME 更是拿到 96.9,超过对比清单里所有 MoE 模型。
连 120 亿激活参数的模型都排在它后面。
这说明推理语言和数据规模的关系,比多数人直觉的更陡峭。
决策五:训练它说不知道
幻觉是长文档问答的死穴,RAG 的前提是模型肯承认文档里没有答案。
Aleph Alpha 为此用了自研的 Merlin-Arthur 协议,一个三方博弈。
Arthur 是模型,拿着一份被隐藏了部分内容的文档回答问题。
Merlin 负责藏掉无关部分,让正确答案更容易被看见,Arthur 要学会答。
Morgana 专门藏掉答案依赖的关键证据,Arthur 要学会说不知道。
Arthur 永远不知道对面是 Merlin 还是 Morgana。
唯一稳赢策略就是真的去检查眼前的证据是否支撑答案。
效果在 Omniscience 测试上可见:不知道时它有 44% 概率明说或给部分答案。
同场对比里,Qwen3.5 35B-A3B 只有 11.1%,GPT-OSS 120B 是 23.7%。
代价同样写在模型卡上:闭卷测试它是 12 个模型里的最后一名。
它知道自己不知道什么,但它记住的东西也确实更少。
当检索库,它值得信任;当百科全书,它会让你失望。
决策六:思考力度按请求调节

每个请求都能把 reasoning_effort 设为 none、low、medium 或 high。
简单查询直接答,硬问题给一段长思考,同一模型同一服务器完成。
部署方不用为快慢两种负载各养一套服务。
这个设计和各家 API 已经收敛的用法一致,迁移成本很低。
强项与弱项都在明面上
Aleph Alpha 把最弱的指标和最强的放在一起公开,这值得单独说一句。
强项:综合分英语 75.5、德语 70.8,都是同激活量开源模型里的第一。
企业文档问答英语 89.7,这组测试来自半导体、公共部门、航天等五类真实客户工作。
弱项一个比一个具体,先看记忆:闭卷只有 51.0 分,Omniscience 正确率仅 14.8%。
再看工具调用,多轮场景 39.8 分,GLM-4.7 Flash 是 58.2。
编码代理也弱:Terminal-Bench 2.1 拿 27.7,Qwen3.5 是 39.7。
SWE-bench Verified 66.4,比 Qwen3.6 的 73.8 低了 7 分。
还有两条工程现实:需要自家的 vLLM 插件,且发布当天没有任何托管厂商上线它。
只支持德英双语,模型卡称之为刻意的深度优先于广度。
更大的 dense 模型 Qwen3.8 27B 综合分更高,但每 token 动用近 8 倍参数。
Kolibri 的全部取舍都围绕这条线:用激活效率换记忆广度。
部署:一张 H200 起步
显存需求约 78GB,两张 80GB 的 A100 或 H100 是下限。
单张 H200、B200 或 B300 也够。
推理走 vLLM,但要先装 Aleph Alpha 的插件来认识这个新架构。
装好之后就是标准的 OpenAI 兼容服务,任何 OpenAI 客户端都能直接连。
pip install 'aleph-alpha-inference>=1'
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
--reasoning-parser kolibri1 \
--tool-call-parser kolibri1 \
--enable-auto-tool-choice
# KV cache 也用 FP8,进一步压显存
# 想跑满 100 万上下文再加两个参数:
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
--max-model-len 1048576 \
--hf-overrides '{"max_position_embeddings": 1048576}'
调用侧通过聊天模板传思考力度,采样参数官方推荐 temperature 1.0。
对延迟敏感的场景,上下文别超过原生训练长度 262144。
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1",
api_key="EMPTY")
resp = client.chat.completions.create(
model="Aleph-Alpha/Kolibri-1",
messages=[{"role": "user",
"content": "Erkläre kurz, was ein MoE-Modell ist."}],
extra_body={"chat_template_kwargs":
{"reasoning_effort": "high",
"enable_thinking": True}},
)
print(resp.choices[0].message.content)
同档位横向对比
| 指标 | Kolibri 1 | Qwen3.5 35B-A3B | Qwen3.8 27B |
|---|---|---|---|
| 总参数 | 78.1B / 激活 3.46B | 35B / 激活 3B | 27B dense |
| 综合分英语 | 75.5 | 74.7 | 80.2 |
| 综合分德语 | 70.8 | 69.8 | 79.9 |
| AIME 2025 英语 | 96.9 | --- | 更高但 8 倍算力 |
| 100 万 token RULER | 63.2 | 57.5 | --- |
| 128K token RULER | 67.9 | 89.9 | --- |
| 弃答率 Omniscience | 44.0% | 11.1% | --- |
| Terminal-Bench 2.1 | 27.7 | 39.7 | --- |
| 显存需求 | 约 78GB FP8 | 数据中心级 | 单卡可行 |
表格读法很简单:综合能力它贴着同激活量冠军,长文末端和弃答率是独门。
编码和工具调用不要选它,那是 Qwen3.6 的地盘。
它适合什么,不适合什么
答案指向一个具体人群:文本是德语、数据不能出楼、宁可听话也别编造的用户。
政府部门、银行、制造商、航空供应商,全部命中。
对长德语法律、合同、手册做 RAG,踩中它每一个强项。
分词器省的 15%、100 万窗口、44% 的弃答率,三者在这一场景同时生效。
博主自己就在这样的项目里:柏林夏里特医院的神经科分诊助手。
患者坐在全科诊所的电脑前,AI 代理做完测试并给症状分级。
对话全程德语,内容是健康数据,模型必须跑在自己控制的机器上。
反过来说,编码代理、闭卷问答、德英以外的语言、没有 78GB 显卡的团队,都别碰。
后一种情况,为单一任务微调的小模型依然是更便宜的答案。
真正值得带走的三件事
第一件事,主权可以被编译进架构,而不是写在采购合同里。
UniBPE、德语推理数据、弃答训练,每一项都是可验证的工程产物。
合规从部署后审计变成了模型的出厂属性,这是 Kolibri 最有价值的方法论。
第二件事,推理语言是被数据量解锁的能力,不是模型自带的天赋。
70.2 到 48.3 再到 67.3 的曲线警告所有人:小语种推理数据宁缺毋滥。
第三件事,激活参数和总参数的分离正在制造新的选型维度。
买模型不再只看跑分,要看激活比、显存账单、分词效率和弃答率。
对中国开发者,这套打法同样成立:把特定领域做深,通用能力让位。
中文复合词和术语同样在被通用分词器切碎,同样的账本逻辑可以复算。
先算清自己的语料构成,再决定是微调小模型还是部署 78GB 的专科医院。
选型的出发点永远是你的数据长什么样,而不是榜单上谁的分更高。
蜂鸟的启示不是小而美,而是把每一比特参数花在你真正服务的语言上。