PART 1|Kev 是什么
一句话
Kev 是 jaredpalmer 开源的「Jev 类小决策模型」家族------在 Qwen 底座上加 LoRA 适配器 + 指针头,不做文本生成,只做打分决策 :一次前向传播,对一段文本上的一组类型化问题各输出一个概率分布。
官方定位(仓库 pyproject 原文):
"Laptop-scale reconstruction of a Jev-style decision model with a TypeSafe-compatible /v1/systemone API"
仓库地址:github.com/jaredpalmer/kev(Apache-2.0)。
三个关键属性
- API 与 TypeSafe 的 Jev 完全兼容 。Jev(TypeSafe 官方托管 API)的
/v1/systemone协议------noul(是非判断)/choice(多选一)/score(有序打分)三原语------Kev 原样实现。TypeSafe Python SDK 不改一行代码,把base_url指向本地 Kev 服务就能用。 - 可自己训 。0.5B 到 27B 多代权重与全部训练代码开源,
kev.train/kev.serve/kev.benchmark是三个核心入口,训练数据就是带 label 的 JSONL。 - 笔记本级可跑可训 。0.8B 档在任何 Apple Silicon Mac 或 4GB 显存 GPU 上可推理可微调。我在 RTX 3060 Laptop(6GB)上实测微调 0.6B LoRA,峰值显存 1.71GB,1 epoch 378 步约 31 分钟。
背景:Jev → 架构逆向 → Kev
- Jev (TypeSafe 官方):托管决策模型 API,不开放权重,且不对中国大陆开放(我调研阶段实测核实过)。
- 2026 年 9 月,Archer Hume 发布《Jev's Architecture Unmasked》,逆向出了它的架构:attention-only 底座 + 问题隔离 + 指针头。
- Kev(jaredpalmer)按这份逆向架构复刻,底座用 Qwen 系列:0.5B(Qwen2.5,原型)→ 0.6B/0.8B(Qwen3/Qwen3.5)→ 4B/9B → 27B(Qwen3.8 post-trained)。每一代 model card 都有冻结评测协议下的完整指标。
官方指标一览
| 模型 | 底座 | 域外准确率* | 门槛 |
|---|---|---|---|
| Kev-0.8B | Qwen3.5-0.8B-Base | 0.648 / 0.697 | Apple Silicon / L4 |
| Kev-4B | Qwen3.5-4B-Base | 0.817 / 0.838 | 32GB Mac / L40S / H100 |
| Kev-9B | Qwen3.5-9B-Base | 0.822 / 0.852 | 32GB Mac / L40S / H100 |
| Kev-27B | Qwen3.8-27B | 0.848 / 0.896 | B200 / H200 / H100 80GB |
| Jev | 托管 | 0.857 / -- | TypeSafe API |
* dev / test 两列,「域外」指模型训练时从没见过的数据源------最接近你自己业务的口径。Kev-27B 与 Jev 官方差距 1 个点以内,而 Kev-4B/9B 差距约 4 个点,0.8B 差距 16 个点。
它和 ChatGPT 这类生成式模型差在哪
决策模型的输出不是文字,而是概率分布。你给它一段文本(state)和一组问题,它回答的是:「这三个选项的概率分别是 47% / 28% / 25%」「这是紧急事件的概率 93%」「愤怒等级期望值 1.44」。这意味着:
- 你的代码可以对高置信度自动执行、低置信度转人工,阈值路由是第一公民;
- 没有幻觉文本,没有采样随机性,同一个输入永远同一个输出;
- 一次请求可以塞任意多个问题,state 只编码一次,吞吐远高于让 LLM 逐条生成回答。
典型场景:工单分诊(分派给哪个团队 + 是否升级 + 用户情绪打分,一个请求全答完)、内容审核、意图分类、以及我做的------在知识图谱导航中「接下来该选哪个节点」的多跳决策。