文章目录
-
- 前言
- [一、Jev 是个啥?一句话给你整明白](#一、Jev 是个啥?一句话给你整明白)
- 二、这名儿谁起的?背后有点东西
-
- [1. 双系统理论:快的归它,慢的归推理模型](#1. 双系统理论:快的归它,慢的归推理模型)
-
- [(1)System 1:不假思索的秒答](#(1)System 1:不假思索的秒答)
- [(2)System 2:慢慢盘逻辑的深思](#(2)System 2:慢慢盘逻辑的深思)
- [2. 杰文斯悖论:越省,用得越多](#2. 杰文斯悖论:越省,用得越多)
- [三、跟 ChatGPT、Cursor、Claude Code 有啥不一样?](#三、跟 ChatGPT、Cursor、Claude Code 有啥不一样?)
- [四、三大原语:Choice / Score / Noul](#四、三大原语:Choice / Score / Noul)
-
- [1. Choice:从名单里挑一个](#1. Choice:从名单里挑一个)
- [2. Score:按刻度打分](#2. Score:按刻度打分)
- [3. Noul:这句话是真是假?](#3. Noul:这句话是真是假?)
- 五、上代码:一次真实调用长这样
-
- [1. 返回的就是结构化 JSON](#1. 返回的就是结构化 JSON)
- [2. 答案被锁死在你的选项里](#2. 答案被锁死在你的选项里)
- [3. 三个问题一次全答完](#3. 三个问题一次全答完)
- 六、凭啥又快又便宜?架构上就不是一路人
-
- [1. 并行采样,不一个字一个字憋](#1. 并行采样,不一个字一个字憋)
- [2. 压根不生成文本,输出白送](#2. 压根不生成文本,输出白送)
- [3. 训练用的是 RLCD,不是 RLHF](#3. 训练用的是 RLCD,不是 RLHF)
- 七、大家都在拿它整什么活?
- [八、Vercel 官方模板:AI 当表单接线员](#八、Vercel 官方模板:AI 当表单接线员)
- 九、社区总结的四个套路
-
- [1. 每 tick 一个决策](#1. 每 tick 一个决策)
- [2. 置信度当门卫](#2. 置信度当门卫)
- [3. 代码先把选择空间砍小](#3. 代码先把选择空间砍小)
- [4. Jev 拍板,LLM 说话](#4. Jev 拍板,LLM 说话)
- 十、泼几盆冷水:这些坑你得知道
-
- [1. 只认文本](#1. 只认文本)
- [2. 预算有上限](#2. 预算有上限)
- [3. 不能生成文本](#3. 不能生成文本)
- [4. 太新了](#4. 太新了)
- [5. 校准不等于单次正确](#5. 校准不等于单次正确)
- 十一、我的结论:值得围观,别急着梭哈
P.S. 目前国内还是很缺AI人才的,希望更多人能真正加入到AI行业,共同促进行业进步,增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 传送门http://blog.csdn.net/jiangjunshow,教程通俗易懂,高中生都能看懂,还有各种段子风趣幽默,从深度学习基础原理到各领域实战应用都有讲解,我22年的AI积累全在里面了。注意,教程仅限真正想入门AI的朋友,否则看看零散的博文就够了。
前言
先跟你说句实话,我第一次看到这条新闻时,第一反应是哪个营销号又整活了:一个 AI 模型,不写代码、不写文案,只做一件事,帮你的程序做判断。
我当时就一个念头:就这?这不就是个 if 语句吗?
然后我顺手查了下它的背景,好家伙:4000 万美元种子轮,2026 年 9 月 15 日从隐身状态高调亮相,旧金山 TypeSafe AI 出品。能把"做个判断"讲成一个 4000 万美元的故事,这背后肯定有事。
一、Jev 是个啥?一句话给你整明白
Jev 说白了,就是一个"智能版 if 语句"。
普通 if 长这样:if (order.total > 100)。条件是个数字,计算机说算就算,干净利落。
可要是条件变成"判断"呢?比如:这条客服消息是不是在生气?这封邮件是不是账单?这一排按钮里,用户该点哪个才能顺利付钱?
以前碰见这种问题,路子就三条。手写规则:脆得跟薯片似的,规则一多就碎。训练分类器:先攒一堆标注数据,攒过的人都知道那有多痛苦。让大模型返回结构化输出:慢、贵,还时不时给你幻觉一下,让你在生产的边缘反复试探。
Jev 给的第四条路:你定义好"可能的答案",它把每个答案的概率分布丢给你,你的代码拿到手,直接分支。
不生成文本、不用解析、不会幻觉。这三个词放一起,我仿佛已经听到后端老哥们的欢呼声了。
相当于你招了个只会说"选这个"的下属,工资还不到一杯奶茶钱。
二、这名儿谁起的?背后有点东西
一个模型叫 Jev,我第一反应是哪位网红的英文名。结果人家致敬的是经济学家威廉·斯坦利·杰文斯,逼格瞬间就上来了。
1. 双系统理论:快的归它,慢的归推理模型
卡尼曼那套"双系统"的说法,你应该多少听过。
(1)System 1:不假思索的秒答
凭直觉,快,不用过脑子。判断"这人是敌是友"基本就属于这一类。
(2)System 2:慢慢盘逻辑的深思
慢,烧脑,得一步一步推理。TypeSafe 的分工很明确:Jev 专干 System 1 的活,深度推理交给推理模型。
翻译成人话:Jev 负责"这单接不接",推理模型负责"这单怎么谈"。
2. 杰文斯悖论:越省,用得越多
杰文斯当年发现一个反直觉的现象:蒸汽机效率提高了,煤不但没少烧,反而越烧越多。为啥?因为便宜了,新用途全冒出来了,大家可劲儿造。
TypeSafe 的押注就是:智能也吃这一套。当一次决策的成本低到一美分以下,你就想把决策塞进那些以前根本不敢碰 AI 的地方。
我琢磨了一下,这句话翻译过来就是:以后连你家的猫粮自动喂食器,都敢宣称自己接入了大模型。
三、跟 ChatGPT、Cursor、Claude Code 有啥不一样?
现在市面上的 AI 工具,一个比一个话痨。ChatGPT 你问一句,它回你三篇小作文;Cursor 撸起袖子就给你改文件;Claude Code 更狠,直接接管你的终端。
Jev 完全不是这个路数。它不接受开放式目标,不调工具,不碰文件,不跑什么 agent 循环。你问什么它答什么,多一个字都算它输。
| 工具 | 你给它 | 它还你 | 角色 |
|---|---|---|---|
| ChatGPT | 提示词、对话 | 生成的回复 | 通用话痨 |
| Cursor | 编程任务加仓库 | 改文件、跑命令、写测试 | 编辑器加编程助理 |
| Claude Code | 指令加本地工具 | 调工具、改代码、终端结果 | 终端编程助理 |
| Jev | 状态加类型化问题 | 选择、评分、概率 | 代码里的决策原语 |
最妙的是,它跟这些工具不是竞争关系,而是"嵌"进去的关系。编程 agent 跑命令之前,可以先问 Jev"这条命令是只读的、可逆的,还是破坏性的",再决定动不动手;agent 路由器也能拿 Jev 决定这单活派给谁。
你品品,这哪儿是 AI,这分明是给 agent 配了个踩刹车的老司机。
四、三大原语:Choice / Score / Noul
TypeSafe 给 Jev 设计了三种"问法",官方叫原语。什么叫原语?就是那种结构固定、可以随便拼装、怎么组合都不打架的积木。
1. Choice:从名单里挑一个
你给一堆选项,它告诉你:选中了哪个、每个选项的概率、以及它自己的置信度。路由、agent、游戏都靠它吃饭。
最爽的是答案空间永远合法。它不可能发明出第四个选项,比我见过的某些"智能"客服强多了,人家好歹不会突然回你一句"亲,我不太明白您的意思呢"。
2. Score:按刻度打分
你定义一套等级,比如 trivial、normal、critical。它返回打到哪一档、每档的概率和置信度。
相当于把"这个 bug 严重不严重"这种主观题,变成了有标准答案的客观题。
3. Noul:这句话是真是假?
你抛一个陈述,它返回这句话为真的概率,0 到 1 之间的一个浮点数。审核、验证、护栏,全用得上。比如:"这个 diff 真的把 bug 修好了吗?"
女朋友跟你说"我没事"的时候,你也可以拿它验一下。要是返回 0.02,兄弟,今晚大概率睡沙发。别问我怎么知道的,问就是我朋友的故事。
三种问法还能混在同一个请求里,互相独立、并行评估。
五、上代码:一次真实调用长这样
官方给了一个特别接地气的例子:赞助表单。有人提交了申请,你要判断这单是走自动发报价单,还是排队等人工。
请求长这样:
json
{
"model": "jev-latest",
"state": {
"opportunity": "link",
"name": "Managed Postgres",
"description": "We make a managed PostgreSQL hosting product and would like to sponsor the newsletter in October."
},
"questions": {
"is_sponsor_inquiry": {
"type": "noul",
"instructions": "Does `description` ask to sponsor the site or newsletter?"
},
"product_category": {
"type": "choice",
"instructions": "What kind of product is described by `name` and `description`?",
"criteria": {
"dev_tool": "Developer tools, hosting, APIs, SaaS for developers",
"course": "Courses, books, or training",
"unrelated": "Anything not aimed at developers"
}
},
"message_quality": {
"type": "score",
"instructions": "How specific is the request?",
"criteria": [
"Generic template, no reference to this site",
"Mentions the site but no concrete ask",
"Concrete ask with a timeframe or product named"
]
}
}
}
Jev 的响应长这样:
json
{
"model": "jev-1.13.0",
"answers": {
"is_sponsor_inquiry": {
"type": "noul",
"noul": 0.99
},
"product_category": {
"type": "choice",
"choice": "dev_tool",
"probabilities": {
"dev_tool": 0.97,
"course": 0.01,
"unrelated": 0.02
},
"confidence": 0.95
},
"message_quality": {
"type": "score",
"score": 1.9,
"legend": {
"0": "Generic template, no reference to this site",
"1": "Mentions the site but no concrete ask",
"2": "Concrete ask with a timeframe or product named"
},
"probabilities": {
"0": 0.0,
"1": 0.1,
"2": 0.9
},
"confidence": 0.86
}
},
"usage": {
"input_tokens": 210,
"output_tokens": 31
}
}
拿到结果以后,你的代码负责干无聊的活:
javascript
const { answers } = response;
if (answers.is_sponsor_inquiry.noul > 0.9 &&
answers.product_category.choice === 'dev_tool') {
sendRateCard(email);
} else {
queueForManualReply(email);
}
概率超过 0.9、分类又是开发工具,直接甩报价单;否则排队等人工。整个过程没有一个字需要解析。
三个细节值得单独说:
1. 返回的就是结构化 JSON
不用解析散文,省得你写正则写到怀疑人生。
2. 答案被锁死在你的选项里
dev_tool、course、unrelated 三选一,它想发明第四类?门都没有。
3. 三个问题一次全答完
你再加第四个问题,响应时间几乎不带变的。一次调用,把"这人是不是想白嫖""他是不是个正常人""这单该不该认真回"全问完了。
六、凭啥又快又便宜?架构上就不是一路人
Jev 的快和省,不是靠优化挤出来的,是架构上就跟大模型不是一路人。
1. 并行采样,不一个字一个字憋
大模型生成答案是一个 token 一个 token 往外蹦的,后一个字得等前一个字。Jev 直接并行采样所有答案,每个问题独立评估,输出就是你给的选项上的一个概率分布。
别人是"想一句说一句",它是一口气把所有可能性的概率全吐出来。最快 70 毫秒什么概念?你眨一下眼要 300 毫秒。你还没眨完眼,它答案都交卷了。
2. 压根不生成文本,输出白送
就算你逼大模型输出 JSON,它本质上还是在生成字符串。Jev 从不生成自由格式的字符串,输出就那么一丁点结构化数据,几乎没什么可计费的。
输出免费是什么概念?就是它干活不要钱,你只付它"听你说话"的钱。这收费模式,跟我认识的一位朋友请客只付自己那份,有异曲同工之妙。
3. 训练用的是 RLCD,不是 RLHF
聊天模型用 RLHF,奖励人类喜欢的答案;Jev 用 RLCD,全称 Reinforcement Learning for Calibrated Decisions,直接优化"概率跟实际结果对得上"。
什么叫校准?就是它说 90% 的概率,你统计下来,它大概真有 90% 是对的。
| 指标 | Jev | 前沿大模型 |
|---|---|---|
| 端到端延迟 | 70 到 500 毫秒 | 3 到 329 秒 |
| 输入价格 | 0.042 美元/百万 token | 0.2 到 10 美元/百万 token |
| 输出价格 | 免费 | 0.6 到 30 美元/百万 token |
| 答案形状错误率 | 0%,结构性保证 | 有,生成可能中断 |
| 训练方法 | RLCD,校准决策 | RLHF,人类偏好 |
官方给出的对比数字是"快 193.6 倍、便宜 444.6 倍"。不过公司自己也承认,这是在自己工作流里评估出来的"高端天花板",不是平均成绩。
你看,连官方都学会先打预防针了,比某些"遥遥领先"的广告实在多了。
七、大家都在拿它整什么活?
开放早期访问没几天,JevMade 社区注册表里已经收了 745 个验证过的实验,来自 651 位开发者。这个速度,说明程序员们是真的憋坏了。
745 个实验,那可都是有人真把代码跑起来验证过的,不是 PPT 里的饼。
| 方向 | 在干啥 |
|---|---|
| 浏览器控制 | 让 Claude 通过 Jev 驱动 Chrome,Jev 决定点哪个按钮 |
| 游戏 AI | 五子棋:225 个落点先砍到约 40 个,Jev 做最终判断 |
| 无人机控制 | 序列化状态、问一个问题、执行、重复 |
| 交易机器人 | 每 tick 做一个决策,延迟低到循环像开了挂 |
| SEO 工具 | 关键词研究、搜索意图分析 |
| Git 审计 | 审 git diff,判断变更类型和风险 |
| 表单路由 | 按表单内容自动转给对应团队 |
| 安全检查 | pkg-gate,查 npm 包安不安全 |
五子棋那个最逗:225 个落点先被代码砍到约 40 个,Jev 最后拍板。这不就是职场标准流程吗,下面的人先筛一轮,领导负责点头。
交易机器人每 tick 问一次 Jev,延迟低到整个循环像开了挂。说实话,比我盯盘敬业多了。毕竟我盯盘盯久了容易上头,它不会。
八、Vercel 官方模板:AI 当表单接线员
Vercel 直接出了官方模板,把 Jev 和 AI SDK 接起来,专门做表单路由。
三个表单按内容自动分流:Lead 表单去初创/增长/企业/销售团队,Contact 表单去账单/客服/通用,Issue 表单去前端/平台/基础设施/工程团队。
你猜猜这活以前谁干?是那个被转发进 20 个群、到现在还没人回消息的运维同事。
流程长这样:
-
先用 Zod 验证提交数据的字段。
-
Jev 用 AI SDK 的 experimental_evaluate 评估整份提交,选一个合法的团队加专业组合。
-
置信度达到 95% 及以上,应用直接认 Jev 的选择。
-
低于 95%、缺失、无效,或者 Jev 自己拉了,就交给 openai/gpt-5.6-luna-fast 独立评估同一份提交。
-
结果里带上目的地、决策模型、Jev 统计信息、模型耗时和邮件预览。
注意第 4 条:AI 也会心虚,心虚的时候知道找更贵的模型兜底。这设计太人性了,建议写进公司制度:拿不准的事,上报。
bash
# 克隆模板
git clone https://github.com/vercel-labs/jev-ai-sdk-form-router.git
cd jev-ai-sdk-form-router
# 安装依赖
pnpm install
# 配置环境变量
cp .env.example .env.local
# 需要设置 AI_GATEWAY_API_KEY
# 启动
pnpm dev
# 打开 localhost:3000
技术栈:Next.js 16 + React 19、AI SDK 7 + Vercel AI Gateway、shadcn/ui + Tailwind CSS 4、React Email + Resend。
看完我只想说:现在的官方模板,比我当年入职第一天的项目还现代。
九、社区总结的四个套路
JevMade 从 745 个实验里总结出四个反复出现的模式,我看完直呼内行。
1. 每 tick 一个决策
游戏、无人机、交易机器人、浏览器 agent,最后都收敛到同一个循环:序列化状态,问一个决定性问题,执行,重复。Jev 的延迟低到模型可以直接住在控制循环里头。
以前是你问 AI,AI 慢慢想;现在是 AI 每帧都在帮你做决定,相当于给程序装了个条件反射。
2. 置信度当门卫
答案告诉你"做什么",置信度告诉你"要不要动手"。最稳的实验都会用置信度阈值,把边缘情况丢给更慢的模型或者人工。
翻译成人话:AI 也学会了"没把握的事先请示领导",这是职场成熟的表现。
3. 代码先把选择空间砍小
开发者很少让 Jev 从所有选项里硬选。五子棋先砍到 40 个落点,DOM 过滤器先把页面变成元素表。代码负责缩小范围,Jev 负责在剩下的里面做判断。
脏活累活归代码,拍板归模型,各司其职,谁也不委屈。
4. Jev 拍板,LLM 说话
反复出现的分工是:Jev 让每个决策又便宜又即时,小号 LLM 只在需要给人看的字符串时才出场。
决策归决策,说话归说话,两边分开算账,谁也不占谁便宜。
十、泼几盆冷水:这些坑你得知道
夸完了,该泼冷水了。Jev 的局限,一条比一条清醒。以下内容建议先截图,免得被"零幻觉"三个字冲昏头脑。
1. 只认文本
状态只能是字符串、JSON 对象或者 JSON 数组。图片、音频、视频?抱歉,暂时不伺候。
2. 预算有上限
状态和所有问题共享大约 64000 token 的预算,状态加最长的问题要控制在约 32000 token 以内。Choice 最多 255 个选项,Score 只能在 2 到 10 个等级之间。
翻译过来就是:它胃口有限,你别拿一整本《红楼梦》去问它"这人是谁"。
3. 不能生成文本
不能写回复、不能生成代码、不能总结文档、不能解释推理。你要文本?还是得请 LLM 出山。
说白了它就是个点头摇头的机器,你想让它写小作文,它只会回你:"这不是我的专业。"
4. 太新了
2026 年 9 月 15 日才开放早期访问,生态、最佳实践、长期稳定性都还在验证期。第一批吃螃蟹的人,可能正在边吃边吐壳。
5. 校准不等于单次正确
"校准"是统计意义上的:给 90% 概率的预测,多次统计下来大约 90% 对。但任何单次预测,都可能错。
翻译成人话:它说"稳了"的时候,你最好还是自己再看一眼。毕竟它不知道你的生产环境有多爱出幺蛾子。
十一、我的结论:值得围观,别急着梭哈
先把它核心的卖点捋一遍:
- 新品类:不是"更好的大模型",是另一条赛道,决策原语
- 极致便宜:0.042 美元/百万输入 token,输出免费,比大模型便宜 5 到 240 倍
- 极致快:70 到 500 毫秒端到端,能塞进控制循环
- 零幻觉:答案被结构性锁死在你给的选项里,想越界都难
- 概率校准:RLCD 训出来的分布,跟实际结果对得上
- 组合友好:Jev 拍板,LLM 说话,各干各的
我的判断就一句:值得关注,但别急着 all in。
一方面,"决策模型"确实踩中了真痛点。大量场景要的压根不是生成能力,是一句靠谱的判断。拿大模型做分类,又慢又贵还怕幻觉,Jev 直接把这道题解了。
另一方面,它才发布一周。生态、文档、最佳实践都还在襁褓里,TypeSafe 自己都承认,官方数字是"高端天花板",不是"实际平均值"。
但有一条趋势是确定的:当一次决策的成本趋近于零,你会把决策放到那些你以前想都不会想到 AI 的地方。这才是杰文斯悖论真正的意思,也是 Jev 这名字想说的。
所以我的态度就八个字:技术值得研究,钱包先按兵不动。
毕竟 AI 不一定要当主角,它可以是代码里一个 70 毫秒就返回的 if 语句,不聊天、不写诗,就默默在后台点头摇头。
这画面,想想还挺像公司里那些只回"收到"的同事。你觉得他啥也没干,但系统真离不开他。
P.S. 目前国内还是很缺AI人才的,希望更多人能真正加入到AI行业,共同促进行业进步,增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 传送门http://blog.csdn.net/jiangjunshow,教程通俗易懂,高中生都能看懂,还有各种段子风趣幽默,从深度学习基础原理到各领域实战应用都有讲解,我22年的AI积累全在里面了。注意,教程仅限真正想入门AI的朋友,否则看看零散的博文就够了。