Jev:不是聊天机器人, 而是一个智能 if 语句

2026 年 9 月 15 日,TypeSafe AI 带着 4000 万美元种子轮融资从隐身状态亮相,发布了第一个"System One"模型------Jev。它不写文本、不写代码,只做一件事:帮你做决策。本文深度解析它的原理、用法和真实案例。

Jev 是什么?一句话说清楚

Jev 是一个智能 if 语句

普通代码用 if (order.total > 100) 做分支------当条件是计算机能计算的数值时没问题。但如果条件是一个"判断"呢?比如"这条客服消息是不是在生气?""这封邮件是关于账单的吗?""这 12 个按钮里该点哪个继续结账?"

这些判断传统方案要么手写规则(脆弱),要么训练分类器(需要标注数据),要么让 LLM 返回结构化输出(慢、贵、可能幻觉)。

Jev 给了第四种选择:你定义可能的答案,模型返回每个答案的概率分布,你的代码直接分支。不生成文本,不解析,不幻觉。

Jev 的工作方式:输入状态 + 类型化问题 → 输出选择、评分和概率

核心定位

Jev 来自旧金山的 TypeSafe AI 实验室,2026 年 9 月 15 日以 4000 万美元种子轮融资从隐身状态亮相。TypeSafe 将其称为 System One 模型------一个专为在软件内部做快速决策而设计的新模型类别,而不是为了跟人聊天。

名字的由来:Jevons 悖论 + Kahneman 双系统

两个小知识点,帮你建立对 Jev 的心智模型:

System One:卡尼曼的快与慢

System One 出自丹尼尔·卡尼曼的《思考,快与慢》。System 1 是大脑快速、直觉的判断------不加思索就能做出的决定。System 2 是缓慢、深思熟虑的推理。在 TypeSafe 的框架里,Jev 负责 System 1 类型的任务(快速直觉判断),而推理模型负责 System 2 类型的任务(深度推理) $TRAE_REF

Jev:Jevons 悖论

Jev 以经济学家威廉·斯坦利·杰文斯(William Stanley Jevons)命名。杰文斯提出了著名的"杰文斯悖论":当蒸汽机效率提高时,煤炭消耗不降反增------因为更便宜的能源创造了新的用途。TypeSafe 的押注是:智能也遵循同样的曲线------当一次决策的成本远低于一美分时,你会把决策放到那些你从不会调用 LLM 的地方 $TRAE_REF

这个命名很巧妙

本质上 TypeSafe 在说:Jev 不是要替代 LLM,而是要打开一个全新的"廉价决策"市场。就像便宜的 CPU 催生了嵌入式计算一样,便宜的决策模型会让 AI 消失在每一个 if 语句里。

和 ChatGPT / Cursor / Claude Code 有什么不同?

主流 AI 工具都把生成式模型放在体验的中心。你给模型一个宽泛的请求,它产出新的东西。Jev 完全不同------它不接受开放式目标,不调用工具,不编辑文件,不运行 agent 循环 $TRAE_REF

工具 你给它什么 它返回什么 角色
ChatGPT 提示词 / 对话 生成的回复 通用助手
Cursor 编程任务 + 仓库 文件编辑、命令、测试 编辑器 + 编程 Agent
Claude Code 指令 + 本地工具 工具调用、编辑、终端结果 终端编程 Agent
Jev 状态 + 类型化问题 选择、评分、概率 软件内部的决策原语

关键区别:Jev 可以嵌入 到这些工具里,而不是替代它们。比如一个编程 agent 可以在运行 shell 命令前,先问 Jev 这条命令是只读的、可逆的、还是破坏性的。一个 agent 路由器可以用 Jev 决定哪个模型接任务 $TRAE_REF

三大原语:Choice / Score / Noul

TypeSafe 暴露了三个"AI 原语"------类似于软件原语,它们是模块化、可组合、结构化的。每个原语是一种不同的"问题"类型,返回不同形状的答案 $TRAE_REF

Choice:从列表中选一个

你定义选项列表。Jev 返回选中的选项、每个选项的概率和置信度。路由、agent、游戏的主力------答案空间永远是合法的,不需要解析,不会幻觉。

返回:choice + probabilities + confidence

Score:按标准评分

你定义有序等级(比如 trivial / normal / critical)。Jev 返回等级、每个等级的概率和置信度。把模糊判断变成你的代码可以分支的无数字决策。

返回:score + legend + probabilities + confidence

Noul:这个陈述为真吗?

你断言一个陈述。Jev 返回该陈述为真的概率(0-1 之间的浮点数)。审核、验证、护栏------"这个 diff 真的修复了 bug 吗?"------一个问题,一个校准概率。

返回:noul (0-1 概率)

三个原语可以在一次调用中混合

所有三种问题类型可以在同一个 API 调用 中混合使用。每个问题针对同一状态并行、独立地评估。增加问题几乎不改变响应时间。每个问题独立评估,所以增加更多问题不会产生上下文衰减 $TRAE_REF

API 调用实战

下面是一个完整的请求/响应示例,来自赞助表单提交的场景 $TRAE_REF

json · 请求示例

json 复制代码
{
  "model": "jev-latest",
  "state": {
    "opportunity": "link",
    "name": "Managed Postgres",
    "description": "We make a managed PostgreSQL hosting product and would like to sponsor the newsletter in October."
  },
  "questions": {
    "is_sponsor_inquiry": {
      "type": "noul",
      "instructions": "Does `description` ask to sponsor the site or newsletter?"
    },
    "product_category": {
      "type": "choice",
      "instructions": "What kind of product is described by `name` and `description`?",
      "criteria": {
        "dev_tool": "Developer tools, hosting, APIs, SaaS for developers",
        "course": "Courses, books, or training",
        "unrelated": "Anything not aimed at developers"
      }
    },
    "message_quality": {
      "type": "score",
      "instructions": "How specific is the request?",
      "criteria": [
        "Generic template, no reference to this site",
        "Mentions the site but no concrete ask",
        "Concrete ask with a timeframe or product named"
      ]
    }
  }
}

json · 响应示例

arduino 复制代码
{
  "model": "jev-1.13.0",
  "answers": {
    "is_sponsor_inquiry": { "type": "noul", "noul": 0.99 },
    "product_category": {
      "type": "choice",
      "choice": "dev_tool",
      "probabilities": { "dev_tool": 0.97, "course": 0.01, "unrelated": 0.02 },
      "confidence": 0.95
    },
    "message_quality": {
      "type": "score",
      "score": 1.9,
      legend": {
        "0": "Generic template, no reference to this site",
        "1": "Mentions the site but no concrete ask",
        "2": "Concrete ask with a timeframe or product named"
      },
      "probabilities": { "0": 0.0, "1": 0.1, "2": 0.9 },
      "confidence": 0.86
    }
  },
  "usage": { "input_tokens": 210, "output_tokens": 31 }
}

拿到结果后,你的代码做无聊的部分:

javascript · 分支逻辑

ini 复制代码
const { answers } = response;

if (answers.is_sponsor_inquiry.noul > 0.9 &&
    answers.product_category.choice === 'dev_tool') {
  sendRateCard(email);
} else {
  queueForManualReply(email);
}

三个关键细节

1. 没有生成的散文需要解析------API 直接返回结构化 JSON。

2. 每个答案都被限制在你提供的选项内------product_category 只能是 dev_toolcourseunrelated,模型无法发明第四种类别。

3. 三个问题在同一次调用中同时回答。增加第四个问题几乎不改变响应时间。

为什么快?为什么便宜?

Jev 的快和便宜不是偶然的,而是架构层面的根本不同 $TRAE_REF

1. 并行采样,不逐字生成

LLM 生成答案是一个 token 一个 token 地生成------返回 {"category": "billing", "urgent": true} 得逐个输出 token,每个都依赖前一个。Jev 的架构并行采样所有答案,每个问题独立评估,输出是你定义选项上的概率分布。

2. 不生成文本,几乎没有输出

LLM 即使约束为 JSON,仍然在生成字符串。Jev 从不生成自由格式字符串。输出是极小的结构化数据,所以 output tokens 是免费的------几乎没什么可计量的。

3. 用 RLCD 训练,不是 RLHF

聊天模型用 RLHF(人类反馈强化学习),奖励人类偏好的答案。Jev 用 TypeSafe 称之为 RLCD(Reinforcement Learning for Calibrated Decisions) 的方法训练,优化概率匹配实际结果。"校准"意味着:给 90% 概率的预测在多次统计中大约 90% 是对的 $TRAE_REF

指标 Jev 前沿 LLM
端到端延迟 70-500ms 3-329 秒
输入价格 $0.042/百万 token 0.20−0.20- 0.20−10/百万 token
输出价格 免费 0.60−0.60- 0.60−30/百万 token
答案形状错误率 0%(结构性保证) 有(生成可能中断)
训练方法 RLCD(校准决策) RLHF(人类偏好)

TypeSafe 官方给出的对比数字是 "193.6 倍更快,444.6 倍更便宜" ,但公司自己也说这是在自己工作流评估的高端 $TRAE_REF

社区都在用 Jev 做什么?

Jev 早期访问开放后短短几天,JevMade 社区注册表已经收录了 745 个已验证实验 ,来自 651 位开发者 $TRAE_REF。几个有意思的案例:

实验方向 描述
浏览器控制 让 Claude 通过 Jev 驱动 Chrome,Jev 决定点哪个按钮
游戏 AI 五子棋 AI:代码先把 225 个落点缩减到 ~40 个,Jev 做最终判断
无人机控制 序列化状态 → 问一个问题 → 执行 → 重复的决策循环
交易机器人 每 tick 做一个决策,Jev 的延迟让循环感觉是即时的
SEO 工具 jev-seo:关键词研究、搜索意图分析
Git 审计 审计 git diff,判断变更类型和风险
表单路由 根据表单内容自动路由到正确的团队
安全检查 pkg-gate:检查 npm 包是否安全

Vercel 官方模板:Jev + AI SDK 表单路由

Vercel 已经推出了官方模板,将 Jev 和 AI SDK 结合用于表单提交路由 $TRAE_REF

模板概览

三个表单用 Jev 按内容路由提交------Lead 表单路由到初创/增长/企业/销售团队,Contact 表单路由到账单/客服/通用,Issue 表单路由到前端/平台/基础设施/工程团队。

路由流程

  1. Zod 验证提交数据的字段
  2. Jev 用 AI SDK 的 experimental_evaluate 评估完整提交,选择一个允许的团队/专业组合
  3. 当 Jev 的置信度 ≥ 95% 时,应用接受 Jev 的选择
  4. 如果置信度低于 95%、缺失、无效或 Jev 失败,openai/gpt-5.6-luna-fast 独立评估同一提交
  5. 结果包含目的地、决策模型、Jev 统计信息、模型计时和邮件预览

bash · 快速开始

bash 复制代码
# 克隆模板
git clone https://github.com/vercel-labs/jev-ai-sdk-form-router.git
cd jev-ai-sdk-form-router

# 安装依赖
pnpm install

# 配置环境变量
cp .env.example .env.local
# 需要设置 AI_GATEWAY_API_KEY

# 启动
pnpm dev
# 打开 localhost:3000

技术栈

Next.js 16 + React 19、AI SDK 7 + Vercel AI Gateway、shadcn/ui + Tailwind CSS 4、React Email + Resend。非常现代的全栈方案。

四大设计模式

从 745 个社区实验中,JevMade 总结了四个反复出现的设计模式 $TRAE_REF

每 tick 一个决策

游戏、无人机、交易机器人和浏览器 agent 都收敛到同一个循环:序列化状态 → 问一个决定性问题 → 执行 → 重复。Jev 的延迟让循环感觉是即时的------模型住在控制循环内部,而不是外部。

置信度作为门控

答案说"做什么";置信度说"是否行动"。最可靠的实验用置信度阈值来路由边缘案例到更慢的模型或人工------自动化有诚实的逃生舱。

在代码中缩小选择空间

开发者很少让 Jev 从所有选项中挑选。本地策略把 225 个五子棋落点缩减到 ~40 个;DOM 过滤器把页面变成元素表;代码缩小选项,Jev 在其中判断。

Jev 判断,LLM 说话

反复出现的分工:Jev 让每个决策廉价且即时,小 LLM 只在需要面向人类的字符串时才调用。决策和生成是分开的预算。

Jev 的局限性

必须知道的限制

1. 只读文本 ------状态可以是字符串、JSON 对象或 JSON 数组。图片、音频和视频暂不支持 $TRAE_REF

2. Token 预算有限 ------状态和所有问题共享约 64,000 token 预算,状态加最长单个问题需在约 32,000 token 以内。Choice 最多 255 个选项,Score 在 2-10 个等级之间。

3. 不能生成文本 ------不能写回复、生成代码、总结文档或解释推理。需要文本时还是需要 LLM。

4. 太新了 ------2026 年 9 月 15 日才开放早期访问,生态、最佳实践、长期稳定性都还在验证中。

5. 校准 ≠ 单次正确------"校准"是统计意义上的。给 90% 概率的预测在多次中约 90% 对,但任何单次预测仍可能错误。

我的思考:该不该关注?

Jev 的核心价值主张

  • 新类别 ------ 不是更好的 LLM,而是全新的模型类别:"决策原语"
  • 极致便宜 ------ $0.042/百万输入 token,输出免费。比 LLM 便宜 5-240 倍
  • 极致快速 ------ 70-500ms 端到端,可以放进控制循环内部
  • 零幻觉 ------ 答案被结构性限制在你定义的选项内,不可能返回非法值
  • 校准概率 ------ 用 RLCD 训练,概率分布匹配实际结果,可信赖
  • 组合友好 ------ 和 LLM 搭配:Jev 做决策,LLM 做生成

我的判断是:值得关注,但别急着 all in

一方面,"决策模型"确实切中了一个真实痛点------大量应用场景需要的不是文本生成,而是一个快速、廉价、可靠的判断。用 LLM 做分类又慢又贵还有幻觉风险,Jev 直接解决了这个问题。

另一方面,它才刚发布一周,生态、文档、最佳实践都还在早期。TypeSafe 自己也说官方数字是"高端天花板"而非"实际平均值"。

但有一个趋势是确定的:当决策的成本趋近于零,你会把决策放到那些你从不会想到用 AI 的地方。这才是 Jevons 悖论的真正含义------也是 Jev 这个名字想传达的东西。

参考资料

  • $TRAE_REF Flavio Copes --- A deep dive into Jev, TypeSafe's System One model
  • $TRAE_REF TypeSafe 官方文档 --- Introduction
  • $TRAE_REF JevMade --- What people are making with Jev
  • $TRAE_REF Vercel --- Jev x AI SDK Form Router
  • $TRAE_REF Vercel KB --- How to classify, route, and score with Jev and AI SDK

Jev 代表的不只是一个新工具,而是一种新的思路:AI 不一定要做主角,它可以是代码里一个 70ms 返回的 if 语句。如果这个思路成立,未来软件里可能藏着成千上万个你看不见的决策------它们不是聊天机器人,而是默默在后台做判断的智能分支。觉得有帮助点个赞吧 👋

相关推荐
子兮曰1 天前
jev-ultrafast 深度解析:7 秒订机票的浏览器 Agent 是如何炼成的
前端·后端·agent
回眸&啤酒鸭1 天前
【回眸】Minicart 电商购物车核心功能落地指南
人工智能
子兮曰1 天前
Jev 爆发一周:7 秒 Agent 背后的 System One 生态与三场争议
前端·后端·ai编程
一隅论数智1 天前
给AI一张“业务概念地图“:本体如何从哲学走向企业智能
大数据·人工智能·经验分享·笔记·学习·学习方法·政务
AI的探索之旅1 天前
97 个 OpenCV 实例(三十):双目立体,从标定到点云
人工智能·opencv·计算机视觉
AlbertZein1 天前
Step-5-Preview 上手实测:3D 游戏、金融分析、网页设计一次跑完
人工智能·aigc
前端小万1 天前
写公众号赚了 3000 块后,我做了一款叫 "一键成稿" 的软件
前端·微信小程序
LaughingZhu1 天前
Product Hunt 每日热榜 | 2026-09-19
人工智能·深度学习·神经网络·搜索引擎·百度
爱勇宝1 天前
ZCode 开源 24 小时:一份没有历史的账本,回答不了"有没有偷代码"
前端·后端·chatglm (智谱)