不生成文本的AI日吞一万亿Token:决策模型Jev撕开大模型的替代路线

三周,日处理一万亿 Token;二十五天,拿下四分之一的财富世界五百强企业;一轮尚未敲定的融资,意向估值已经推到一百亿美元以上。这不是某家大模型新贵的成绩,而是一家叫 TypeSafe AI 的初创公司交出的答卷。它的产品 Jev 于 2026 年 9 月 15 日发布,运行方式与所有人熟悉的聊天机器人截然相反:它不生成任何文本,只负责做决策。10 月 5 日《华尔街日报》的报道把这个新品类推到了聚光灯下,而 OpenAI、Databricks、Cloudflare、亚马逊在随后两周内的密集跟进,说明这不是一次孤立的产品发布,而是一条替代路线的正式开闸。

三周冷启动:一万亿 Token 从哪来

先看几组数字。TypeSafe AI 此前一直处于隐秘运营状态,发布前只从风投机构 DCVC 拿到四千万美元融资。创始人迪奥戈·阿尔梅达曾任职 OpenAI,参与过 ChatGPT 的研发,2024 年离职。9 月 15 日 Jev 发布,到 9 月底,日处理 Token 量就突破了一万亿,而且按阿尔梅达自己的说法,业务量仍在呈指数级增长。约百分之二十五的财富世界五百强企业已经在生产环境里使用这款模型。作为对比,OpenAI 刚在开发者日上宣布 ChatGPT 周活超过十二亿,那是消费级的体量;而 Jev 的一万亿 Token 几乎全部来自自动化软件的高频调用,没有一句是对人说的话。

《The Information》随后披露,TypeSafe 正在洽谈新一轮融资,目标规模十亿美元甚至更高,部分意向投资者给出的估值已经超过一百亿美元。一家不写字的公司撑起这样的估值,押注的逻辑只有一条:企业软件里真正高频的动作从来不是写作,而是判断。

不写字的模型:决策与生成是两种东西

Jev 的运行方式可以一句话说清:借助机器学习,把输入内容归类到一组预先设定好的输出里。回答是或否,输出一个数值评分,或者从既定列表中挑一个答案。TypeSafe 把这套技术思路称为面向校准决策的强化学习。

这与大语言模型的分野是根本性的。LLM 的本质是逐 Token 自回归生成,输出空间理论上是整个词表的笛卡尔积,这既带来了表达的自由度,也带来了不可复现性:同一个请求发两次,措辞可能不同;换一个随机种子,结论可能漂移。阿尔梅达在采访中说得相当直白:主流大语言模型在有人参与的前提下可以完成任务,但用于自动化场景时效果差得离谱。软件的运行逻辑是搭建一层稳定的底层,人们在这层基础上一层层叠加、反复调用,而聊天机器人天生不是这种运行模式。

决策模型把输出空间压缩到有限集合,换来的是三样工程上梦寐以求的东西:结果可复现、延迟可压到毫秒级、成本随调用频次线性下降而不是爆炸。

可复现这一条在合规敏感行业里的价值尤其大。金融风控、内容审核、医疗分诊这类场景,监管方最常问的问题不是模型准不准,而是为什么给出这个结果、换个时间再问一次答案是否一致。生成式模型在这个问题面前几乎是无解的:温度参数调低只能缓解措辞波动,不能保证结论锚定。决策模型则天然满足审计要求------输入相同,分数相同,输出必然相同,每一次判定都可以被回放、被归因、被写进审计日志。对需要向监管交代的企业来说,这不是加分项,而是准入门槛。

巨头跟进有多快:两周内五家入场

判断一个品类是否成立,最快的信号是看巨头抄得多快。Jev 发布后两周内,跟进名单已经排开:OpenAI 在 9 月 30 日开发者日上线 Decisions API,依托自家 Luna 模型,回答一组由用户设定的特定问题,答案被限定在若干预定义结果之内,官方数据是约一百五十毫秒返回,比常规调用快约十倍。次日 Databricks 发布 ai_decide 功能。Cloudflare 推出开源的 Clef 与 Clef-flash,采用冻结的 Qwen3.8-27B 和 Qwen3.5-9B 作为基础模型,挂上专用路由头直接对候选答案打分,完全不进行逐 Token 自回归生成。亚马逊此前推出的 Strands Decider 2B 也属于同一路线。

产品 厂商 基座 开放方式 输出形态
Jev TypeSafe AI 自研(校准决策强化学习) 商业 API 是/否、评分、列表选项
Decisions API OpenAI Luna 商业 API,约 150ms 预定义结果集
ai_decide Databricks 未披露 平台内置功能 分类与路由
Clef / Clef-flash Cloudflare Qwen3.8-27B / Qwen3.5-9B(冻结) 开源 路由头打分
Strands Decider 2B 亚马逊 2B 专用模型 开源 智能体下一步动作

五家厂商,五种体量,指向同一个判断:生成式模型负责复杂推理,决策模型负责高频、有限选项的路由、分类、审批和智能体的下一步动作。一个模型新品类正在成形。

值得留意的是这五家的入场姿势各不相同。OpenAI 把它做成收费 API,延续平台抽成的老路;Databricks 把它埋进数据平台,作为表格智能的一环;Cloudflare 和亚马逊选择开源,用小模型和路由头把门槛打到最低,目的显然是抢占边缘推理和智能体框架的生态位。姿势的差异说明大家对这个品类的商业模式还没有共识,但对技术路线的判断高度一致:高频决策不该交给逐 Token 生成的模型来做。这种路线共识往往比单一产品的成败更能说明趋势的分量。

为什么是路由头:冻结基座加打分头的工程解剖

这条路线里最值得工程师琢磨的是 Cloudflare 的 Clef 方案,因为它把做法完全摊开在了明面上:拿一个现成的强基座模型,整体冻结,一个参数都不训,然后在输出端挂上一个专用路由头。基座负责把输入编码成高维语义表示,路由头只学一件事------在这个表示上给每个候选动作打一个分数,取分数最高者作为输出。

这个设计妙在三处。第一,冻结基座意味着语义理解能力直接继承,不用为决策任务重新烧一轮预训练的钱。第二,输出头只跟候选集合打交道,训练目标天然就是校准的:分数排序对了就行,不需要生成任何自由文本。第三,推理时一次前向就能给全部候选打分完毕,延迟和成本都是生成方案的零头。

动手试试:六十行实现一个最小决策头

原理并不神秘,用 PyTorch 写一个冻结基座加线性打分头的骨架,几十行就够了:

python 复制代码
import torch
import torch.nn as nn

class DecisionHead(nn.Module):
    """冻结基座 + 路由打分头:对候选动作批量打分,argmax 输出决策"""

    def __init__(self, backbone, hidden_size: int, num_actions: int):
        super().__init__()
        self.backbone = backbone
        for p in self.backbone.parameters():   # 冻结基座,一分钱预训练不花
            p.requires_grad = False
        self.head = nn.Linear(hidden_size, num_actions)  # 唯一要训的参数

    def forward(self, input_ids, attention_mask):
        with torch.no_grad():
            h = self.backbone(input_ids=input_ids,
                              attention_mask=attention_mask).last_hidden_state
        pooled = (h * attention_mask.unsqueeze(-1)).sum(1) / attention_mask.sum(1, keepdim=True)
        return self.head(pooled)               # [batch, num_actions],取 argmax 即决策

def decide(logits: torch.Tensor) -> int:
    return int(logits.argmax(dim=-1).item())   # 结果可复现:同输入必同输出

真正的工作量不在模型结构,而在校准数据的构造:每个样本都要标注在给定上下文下哪个候选动作是正确的,以及错误动作与正确动作之间的相对差距。这正是面向校准决策的强化学习中校准二字的含义------分数不仅要排对,还要反映出把握程度,方便下游按置信度阈值决定是自动放行还是转人工。

这套数据工程与生成模型的 RLHF 有本质差别。RLHF 的标注者要对两段自由文本做主观偏好排序,噪声大、一致性差,标注成本随输出空间膨胀。决策任务的标注则是收敛的:候选集合有限且封闭,正确动作通常有客观依据,标注者只需要在选项里点选,标注质量和吞吐都高出一个量级。这也是为什么决策模型能在三周内被快速复刻------它把大模型时代最昂贵的那部分资产,即海量人类偏好标注,替换成了结构化、可批量生产的判定数据。

双轨格局:生成负责推理,决策负责高频

把所有线索拼起来,行业正在滑向一个清晰的双轨架构。生成式模型做少而难的事:规划、推理、写代码、产出长文;决策模型做多而快的事:每一次路由、每一次分类、每一次审批、智能体循环里的每一个下一步。前者的单位成本高但调用稀疏,后者单次近乎免费但一天可能被调用上亿次。Jev 的一万亿日 Token 就是这种高频流量的具象化------这些 Token 不产生任何一句给人读的话,却在默默地决定请求的走向。

对正在搭智能体系统的工程师来说,这个分野有直接的落地含义。如果你的 Agent 循环里每一步都用旗舰生成模型做工具选择和分支判断,那么你大概率在为不需要创造力的环节支付创造力的价格。把这类高频低熵的判断换成决策模型或一个小的路由头,延迟、成本和可复现性会同时改善,而把省下来的预算留给真正需要推理的步骤。反过来想,这也是为什么决策模型不会取代生成模型:写作、规划、开放式推理这些高熵任务,输出空间根本收不进有限集合,两条轨道各有不可替代的地盘。阿尔梅达把 Jev 称作全新一类人工智能的开端,这话有营销成分,但巨头两周内的集体跟进说明,至少替代路线这个命题本身,已经被市场用真金白银投了赞成票。接下来值得观察的是开源阵营能否把冻结基座加路由头这套方案做成事实标准------如果做成了,决策层就会像当年的向量数据库一样,成为每个智能体系统里一块不起眼但离不开的基础设施。

相关推荐
小宋10211 小时前
一套服务托管多个 LoRA:适配器加载、租户隔离与热切换实战
大数据·人工智能·算法
思考着亮1 小时前
14.Agentic RAG -3
人工智能
黑妹天下第一乖1 小时前
第 04 讲:阿加犀 AIMO 模型优化平台与 Model Farm 模型广场实战
人工智能·嵌入式硬件·矩阵·架构·iot
郝学胜_神的一滴1 小时前
AI 编程智能体 06:用Anaconda搞定Python多环境,彻底告别版本兼容灾难
人工智能·python
橘和柠1 小时前
显存计算与模型选择:你的显卡能跑多大的模型
人工智能
黑妹天下第一乖1 小时前
第08讲 · 视觉与相机流水:Spectra ISP 与实时检测
人工智能·嵌入式硬件·数码相机·机器人·接口隔离原则·iot
alonglong1 小时前
8,513 个向量、0.21 毫秒:给本地知识库搭一套语义检索,不引向量数据库
人工智能
数聚天成DeepSData1 小时前
OPUS 不是一份统一许可证的语料:子语料许可如何逐项管理?
人工智能·深度学习·机器学习·数据集·deepsdata
程语AI1 小时前
LLM 流程自动化上线验收:真实流量回放、指标埋点和审计日志
ai编程