Jev:4000万美元融资的AI,只是一个智能if语句?

文章目录

    • 前言
    • [一、Jev 是个啥?一句话给你整明白](#一、Jev 是个啥?一句话给你整明白)
    • 二、这名儿谁起的?背后有点东西
      • [1. 双系统理论:快的归它,慢的归推理模型](#1. 双系统理论:快的归它,慢的归推理模型)
        • [(1)System 1:不假思索的秒答](#(1)System 1:不假思索的秒答)
        • [(2)System 2:慢慢盘逻辑的深思](#(2)System 2:慢慢盘逻辑的深思)
      • [2. 杰文斯悖论:越省,用得越多](#2. 杰文斯悖论:越省,用得越多)
    • [三、跟 ChatGPT、Cursor、Claude Code 有啥不一样?](#三、跟 ChatGPT、Cursor、Claude Code 有啥不一样?)
    • [四、三大原语:Choice / Score / Noul](#四、三大原语:Choice / Score / Noul)
      • [1. Choice:从名单里挑一个](#1. Choice:从名单里挑一个)
      • [2. Score:按刻度打分](#2. Score:按刻度打分)
      • [3. Noul:这句话是真是假?](#3. Noul:这句话是真是假?)
    • 五、上代码:一次真实调用长这样
      • [1. 返回的就是结构化 JSON](#1. 返回的就是结构化 JSON)
      • [2. 答案被锁死在你的选项里](#2. 答案被锁死在你的选项里)
      • [3. 三个问题一次全答完](#3. 三个问题一次全答完)
    • 六、凭啥又快又便宜?架构上就不是一路人
      • [1. 并行采样,不一个字一个字憋](#1. 并行采样,不一个字一个字憋)
      • [2. 压根不生成文本,输出白送](#2. 压根不生成文本,输出白送)
      • [3. 训练用的是 RLCD,不是 RLHF](#3. 训练用的是 RLCD,不是 RLHF)
    • 七、大家都在拿它整什么活?
    • [八、Vercel 官方模板:AI 当表单接线员](#八、Vercel 官方模板:AI 当表单接线员)
    • 九、社区总结的四个套路
      • [1. 每 tick 一个决策](#1. 每 tick 一个决策)
      • [2. 置信度当门卫](#2. 置信度当门卫)
      • [3. 代码先把选择空间砍小](#3. 代码先把选择空间砍小)
      • [4. Jev 拍板,LLM 说话](#4. Jev 拍板,LLM 说话)
    • 十、泼几盆冷水:这些坑你得知道
      • [1. 只认文本](#1. 只认文本)
      • [2. 预算有上限](#2. 预算有上限)
      • [3. 不能生成文本](#3. 不能生成文本)
      • [4. 太新了](#4. 太新了)
      • [5. 校准不等于单次正确](#5. 校准不等于单次正确)
    • 十一、我的结论:值得围观,别急着梭哈

P.S. 目前国内还是很缺AI人才的,希望更多人能真正加入到AI行业,共同促进行业进步,增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 传送门http://blog.csdn.net/jiangjunshow,教程通俗易懂,高中生都能看懂,还有各种段子风趣幽默,从深度学习基础原理到各领域实战应用都有讲解,我22年的AI积累全在里面了。注意,教程仅限真正想入门AI的朋友,否则看看零散的博文就够了。

前言

先跟你说句实话,我第一次看到这条新闻时,第一反应是哪个营销号又整活了:一个 AI 模型,不写代码、不写文案,只做一件事,帮你的程序做判断。

我当时就一个念头:就这?这不就是个 if 语句吗?

然后我顺手查了下它的背景,好家伙:4000 万美元种子轮,2026 年 9 月 15 日从隐身状态高调亮相,旧金山 TypeSafe AI 出品。能把"做个判断"讲成一个 4000 万美元的故事,这背后肯定有事。

一、Jev 是个啥?一句话给你整明白

Jev 说白了,就是一个"智能版 if 语句"。

普通 if 长这样:if (order.total > 100)。条件是个数字,计算机说算就算,干净利落。

可要是条件变成"判断"呢?比如:这条客服消息是不是在生气?这封邮件是不是账单?这一排按钮里,用户该点哪个才能顺利付钱?

以前碰见这种问题,路子就三条。手写规则:脆得跟薯片似的,规则一多就碎。训练分类器:先攒一堆标注数据,攒过的人都知道那有多痛苦。让大模型返回结构化输出:慢、贵,还时不时给你幻觉一下,让你在生产的边缘反复试探。

Jev 给的第四条路:你定义好"可能的答案",它把每个答案的概率分布丢给你,你的代码拿到手,直接分支。

不生成文本、不用解析、不会幻觉。这三个词放一起,我仿佛已经听到后端老哥们的欢呼声了。

相当于你招了个只会说"选这个"的下属,工资还不到一杯奶茶钱。

二、这名儿谁起的?背后有点东西

一个模型叫 Jev,我第一反应是哪位网红的英文名。结果人家致敬的是经济学家威廉·斯坦利·杰文斯,逼格瞬间就上来了。

1. 双系统理论:快的归它,慢的归推理模型

卡尼曼那套"双系统"的说法,你应该多少听过。

(1)System 1:不假思索的秒答

凭直觉,快,不用过脑子。判断"这人是敌是友"基本就属于这一类。

(2)System 2:慢慢盘逻辑的深思

慢,烧脑,得一步一步推理。TypeSafe 的分工很明确:Jev 专干 System 1 的活,深度推理交给推理模型。

翻译成人话:Jev 负责"这单接不接",推理模型负责"这单怎么谈"。

2. 杰文斯悖论:越省,用得越多

杰文斯当年发现一个反直觉的现象:蒸汽机效率提高了,煤不但没少烧,反而越烧越多。为啥?因为便宜了,新用途全冒出来了,大家可劲儿造。

TypeSafe 的押注就是:智能也吃这一套。当一次决策的成本低到一美分以下,你就想把决策塞进那些以前根本不敢碰 AI 的地方。

我琢磨了一下,这句话翻译过来就是:以后连你家的猫粮自动喂食器,都敢宣称自己接入了大模型。

三、跟 ChatGPT、Cursor、Claude Code 有啥不一样?

现在市面上的 AI 工具,一个比一个话痨。ChatGPT 你问一句,它回你三篇小作文;Cursor 撸起袖子就给你改文件;Claude Code 更狠,直接接管你的终端。

Jev 完全不是这个路数。它不接受开放式目标,不调工具,不碰文件,不跑什么 agent 循环。你问什么它答什么,多一个字都算它输。

工具 你给它 它还你 角色
ChatGPT 提示词、对话 生成的回复 通用话痨
Cursor 编程任务加仓库 改文件、跑命令、写测试 编辑器加编程助理
Claude Code 指令加本地工具 调工具、改代码、终端结果 终端编程助理
Jev 状态加类型化问题 选择、评分、概率 代码里的决策原语

最妙的是,它跟这些工具不是竞争关系,而是"嵌"进去的关系。编程 agent 跑命令之前,可以先问 Jev"这条命令是只读的、可逆的,还是破坏性的",再决定动不动手;agent 路由器也能拿 Jev 决定这单活派给谁。

你品品,这哪儿是 AI,这分明是给 agent 配了个踩刹车的老司机。

四、三大原语:Choice / Score / Noul

TypeSafe 给 Jev 设计了三种"问法",官方叫原语。什么叫原语?就是那种结构固定、可以随便拼装、怎么组合都不打架的积木。

1. Choice:从名单里挑一个

你给一堆选项,它告诉你:选中了哪个、每个选项的概率、以及它自己的置信度。路由、agent、游戏都靠它吃饭。

最爽的是答案空间永远合法。它不可能发明出第四个选项,比我见过的某些"智能"客服强多了,人家好歹不会突然回你一句"亲,我不太明白您的意思呢"。

2. Score:按刻度打分

你定义一套等级,比如 trivial、normal、critical。它返回打到哪一档、每档的概率和置信度。

相当于把"这个 bug 严重不严重"这种主观题,变成了有标准答案的客观题。

3. Noul:这句话是真是假?

你抛一个陈述,它返回这句话为真的概率,0 到 1 之间的一个浮点数。审核、验证、护栏,全用得上。比如:"这个 diff 真的把 bug 修好了吗?"

女朋友跟你说"我没事"的时候,你也可以拿它验一下。要是返回 0.02,兄弟,今晚大概率睡沙发。别问我怎么知道的,问就是我朋友的故事。

三种问法还能混在同一个请求里,互相独立、并行评估。

五、上代码:一次真实调用长这样

官方给了一个特别接地气的例子:赞助表单。有人提交了申请,你要判断这单是走自动发报价单,还是排队等人工。

请求长这样:

json 复制代码
{
  "model": "jev-latest",
  "state": {
    "opportunity": "link",
    "name": "Managed Postgres",
    "description": "We make a managed PostgreSQL hosting product and would like to sponsor the newsletter in October."
  },
  "questions": {
    "is_sponsor_inquiry": {
      "type": "noul",
      "instructions": "Does `description` ask to sponsor the site or newsletter?"
    },
    "product_category": {
      "type": "choice",
      "instructions": "What kind of product is described by `name` and `description`?",
      "criteria": {
        "dev_tool": "Developer tools, hosting, APIs, SaaS for developers",
        "course": "Courses, books, or training",
        "unrelated": "Anything not aimed at developers"
      }
    },
    "message_quality": {
      "type": "score",
      "instructions": "How specific is the request?",
      "criteria": [
        "Generic template, no reference to this site",
        "Mentions the site but no concrete ask",
        "Concrete ask with a timeframe or product named"
      ]
    }
  }
}

Jev 的响应长这样:

json 复制代码
{
  "model": "jev-1.13.0",
  "answers": {
    "is_sponsor_inquiry": {
      "type": "noul",
      "noul": 0.99
    },
    "product_category": {
      "type": "choice",
      "choice": "dev_tool",
      "probabilities": {
        "dev_tool": 0.97,
        "course": 0.01,
        "unrelated": 0.02
      },
      "confidence": 0.95
    },
    "message_quality": {
      "type": "score",
      "score": 1.9,
      "legend": {
        "0": "Generic template, no reference to this site",
        "1": "Mentions the site but no concrete ask",
        "2": "Concrete ask with a timeframe or product named"
      },
      "probabilities": {
        "0": 0.0,
        "1": 0.1,
        "2": 0.9
      },
      "confidence": 0.86
    }
  },
  "usage": {
    "input_tokens": 210,
    "output_tokens": 31
  }
}

拿到结果以后,你的代码负责干无聊的活:

javascript 复制代码
const { answers } = response;
if (answers.is_sponsor_inquiry.noul > 0.9 &&
    answers.product_category.choice === 'dev_tool') {
  sendRateCard(email);
} else {
  queueForManualReply(email);
}

概率超过 0.9、分类又是开发工具,直接甩报价单;否则排队等人工。整个过程没有一个字需要解析。

三个细节值得单独说:

1. 返回的就是结构化 JSON

不用解析散文,省得你写正则写到怀疑人生。

2. 答案被锁死在你的选项里

dev_tool、course、unrelated 三选一,它想发明第四类?门都没有。

3. 三个问题一次全答完

你再加第四个问题,响应时间几乎不带变的。一次调用,把"这人是不是想白嫖""他是不是个正常人""这单该不该认真回"全问完了。

六、凭啥又快又便宜?架构上就不是一路人

Jev 的快和省,不是靠优化挤出来的,是架构上就跟大模型不是一路人。

1. 并行采样,不一个字一个字憋

大模型生成答案是一个 token 一个 token 往外蹦的,后一个字得等前一个字。Jev 直接并行采样所有答案,每个问题独立评估,输出就是你给的选项上的一个概率分布。

别人是"想一句说一句",它是一口气把所有可能性的概率全吐出来。最快 70 毫秒什么概念?你眨一下眼要 300 毫秒。你还没眨完眼,它答案都交卷了。

2. 压根不生成文本,输出白送

就算你逼大模型输出 JSON,它本质上还是在生成字符串。Jev 从不生成自由格式的字符串,输出就那么一丁点结构化数据,几乎没什么可计费的。

输出免费是什么概念?就是它干活不要钱,你只付它"听你说话"的钱。这收费模式,跟我认识的一位朋友请客只付自己那份,有异曲同工之妙。

3. 训练用的是 RLCD,不是 RLHF

聊天模型用 RLHF,奖励人类喜欢的答案;Jev 用 RLCD,全称 Reinforcement Learning for Calibrated Decisions,直接优化"概率跟实际结果对得上"。

什么叫校准?就是它说 90% 的概率,你统计下来,它大概真有 90% 是对的。

指标 Jev 前沿大模型
端到端延迟 70 到 500 毫秒 3 到 329 秒
输入价格 0.042 美元/百万 token 0.2 到 10 美元/百万 token
输出价格 免费 0.6 到 30 美元/百万 token
答案形状错误率 0%,结构性保证 有,生成可能中断
训练方法 RLCD,校准决策 RLHF,人类偏好

官方给出的对比数字是"快 193.6 倍、便宜 444.6 倍"。不过公司自己也承认,这是在自己工作流里评估出来的"高端天花板",不是平均成绩。

你看,连官方都学会先打预防针了,比某些"遥遥领先"的广告实在多了。

七、大家都在拿它整什么活?

开放早期访问没几天,JevMade 社区注册表里已经收了 745 个验证过的实验,来自 651 位开发者。这个速度,说明程序员们是真的憋坏了。

745 个实验,那可都是有人真把代码跑起来验证过的,不是 PPT 里的饼。

方向 在干啥
浏览器控制 让 Claude 通过 Jev 驱动 Chrome,Jev 决定点哪个按钮
游戏 AI 五子棋:225 个落点先砍到约 40 个,Jev 做最终判断
无人机控制 序列化状态、问一个问题、执行、重复
交易机器人 每 tick 做一个决策,延迟低到循环像开了挂
SEO 工具 关键词研究、搜索意图分析
Git 审计 审 git diff,判断变更类型和风险
表单路由 按表单内容自动转给对应团队
安全检查 pkg-gate,查 npm 包安不安全

五子棋那个最逗:225 个落点先被代码砍到约 40 个,Jev 最后拍板。这不就是职场标准流程吗,下面的人先筛一轮,领导负责点头。

交易机器人每 tick 问一次 Jev,延迟低到整个循环像开了挂。说实话,比我盯盘敬业多了。毕竟我盯盘盯久了容易上头,它不会。

八、Vercel 官方模板:AI 当表单接线员

Vercel 直接出了官方模板,把 Jev 和 AI SDK 接起来,专门做表单路由。

三个表单按内容自动分流:Lead 表单去初创/增长/企业/销售团队,Contact 表单去账单/客服/通用,Issue 表单去前端/平台/基础设施/工程团队。

你猜猜这活以前谁干?是那个被转发进 20 个群、到现在还没人回消息的运维同事。

流程长这样:

  1. 先用 Zod 验证提交数据的字段。

  2. Jev 用 AI SDK 的 experimental_evaluate 评估整份提交,选一个合法的团队加专业组合。

  3. 置信度达到 95% 及以上,应用直接认 Jev 的选择。

  4. 低于 95%、缺失、无效,或者 Jev 自己拉了,就交给 openai/gpt-5.6-luna-fast 独立评估同一份提交。

  5. 结果里带上目的地、决策模型、Jev 统计信息、模型耗时和邮件预览。

注意第 4 条:AI 也会心虚,心虚的时候知道找更贵的模型兜底。这设计太人性了,建议写进公司制度:拿不准的事,上报。

bash 复制代码
# 克隆模板
git clone https://github.com/vercel-labs/jev-ai-sdk-form-router.git
cd jev-ai-sdk-form-router
# 安装依赖
pnpm install
# 配置环境变量
cp .env.example .env.local
# 需要设置 AI_GATEWAY_API_KEY
# 启动
pnpm dev
# 打开 localhost:3000

技术栈:Next.js 16 + React 19、AI SDK 7 + Vercel AI Gateway、shadcn/ui + Tailwind CSS 4、React Email + Resend。

看完我只想说:现在的官方模板,比我当年入职第一天的项目还现代。

九、社区总结的四个套路

JevMade 从 745 个实验里总结出四个反复出现的模式,我看完直呼内行。

1. 每 tick 一个决策

游戏、无人机、交易机器人、浏览器 agent,最后都收敛到同一个循环:序列化状态,问一个决定性问题,执行,重复。Jev 的延迟低到模型可以直接住在控制循环里头。

以前是你问 AI,AI 慢慢想;现在是 AI 每帧都在帮你做决定,相当于给程序装了个条件反射。

2. 置信度当门卫

答案告诉你"做什么",置信度告诉你"要不要动手"。最稳的实验都会用置信度阈值,把边缘情况丢给更慢的模型或者人工。

翻译成人话:AI 也学会了"没把握的事先请示领导",这是职场成熟的表现。

3. 代码先把选择空间砍小

开发者很少让 Jev 从所有选项里硬选。五子棋先砍到 40 个落点,DOM 过滤器先把页面变成元素表。代码负责缩小范围,Jev 负责在剩下的里面做判断。

脏活累活归代码,拍板归模型,各司其职,谁也不委屈。

4. Jev 拍板,LLM 说话

反复出现的分工是:Jev 让每个决策又便宜又即时,小号 LLM 只在需要给人看的字符串时才出场。

决策归决策,说话归说话,两边分开算账,谁也不占谁便宜。

十、泼几盆冷水:这些坑你得知道

夸完了,该泼冷水了。Jev 的局限,一条比一条清醒。以下内容建议先截图,免得被"零幻觉"三个字冲昏头脑。

1. 只认文本

状态只能是字符串、JSON 对象或者 JSON 数组。图片、音频、视频?抱歉,暂时不伺候。

2. 预算有上限

状态和所有问题共享大约 64000 token 的预算,状态加最长的问题要控制在约 32000 token 以内。Choice 最多 255 个选项,Score 只能在 2 到 10 个等级之间。

翻译过来就是:它胃口有限,你别拿一整本《红楼梦》去问它"这人是谁"。

3. 不能生成文本

不能写回复、不能生成代码、不能总结文档、不能解释推理。你要文本?还是得请 LLM 出山。

说白了它就是个点头摇头的机器,你想让它写小作文,它只会回你:"这不是我的专业。"

4. 太新了

2026 年 9 月 15 日才开放早期访问,生态、最佳实践、长期稳定性都还在验证期。第一批吃螃蟹的人,可能正在边吃边吐壳。

5. 校准不等于单次正确

"校准"是统计意义上的:给 90% 概率的预测,多次统计下来大约 90% 对。但任何单次预测,都可能错。

翻译成人话:它说"稳了"的时候,你最好还是自己再看一眼。毕竟它不知道你的生产环境有多爱出幺蛾子。

十一、我的结论:值得围观,别急着梭哈

先把它核心的卖点捋一遍:

  • 新品类:不是"更好的大模型",是另一条赛道,决策原语
  • 极致便宜:0.042 美元/百万输入 token,输出免费,比大模型便宜 5 到 240 倍
  • 极致快:70 到 500 毫秒端到端,能塞进控制循环
  • 零幻觉:答案被结构性锁死在你给的选项里,想越界都难
  • 概率校准:RLCD 训出来的分布,跟实际结果对得上
  • 组合友好:Jev 拍板,LLM 说话,各干各的

我的判断就一句:值得关注,但别急着 all in。

一方面,"决策模型"确实踩中了真痛点。大量场景要的压根不是生成能力,是一句靠谱的判断。拿大模型做分类,又慢又贵还怕幻觉,Jev 直接把这道题解了。

另一方面,它才发布一周。生态、文档、最佳实践都还在襁褓里,TypeSafe 自己都承认,官方数字是"高端天花板",不是"实际平均值"。

但有一条趋势是确定的:当一次决策的成本趋近于零,你会把决策放到那些你以前想都不会想到 AI 的地方。这才是杰文斯悖论真正的意思,也是 Jev 这名字想说的。

所以我的态度就八个字:技术值得研究,钱包先按兵不动。

毕竟 AI 不一定要当主角,它可以是代码里一个 70 毫秒就返回的 if 语句,不聊天、不写诗,就默默在后台点头摇头。

这画面,想想还挺像公司里那些只回"收到"的同事。你觉得他啥也没干,但系统真离不开他。

P.S. 目前国内还是很缺AI人才的,希望更多人能真正加入到AI行业,共同促进行业进步,增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 传送门http://blog.csdn.net/jiangjunshow,教程通俗易懂,高中生都能看懂,还有各种段子风趣幽默,从深度学习基础原理到各领域实战应用都有讲解,我22年的AI积累全在里面了。注意,教程仅限真正想入门AI的朋友,否则看看零散的博文就够了。

相关推荐
玩美移动1 小时前
AI Skin Analysis API 技术解析:文件上传、异步任务与结果读取
java·人工智能·python
IT大白鼠1 小时前
彭大帅的AI运维助手——自然语言管理 Linux 集群与网络设备——第 1 篇 · 骨架:说人话,跑命令:自然语言 SSH 运维的骨架
linux·运维·人工智能
艾莉丝努力练剑1 小时前
【AI大模型接入SDK】ChatSDK整体实现
网络·c++·人工智能·学习·架构
我是小白呀1 小时前
19-Temporal项目实战:将客户开通流程迁移到持久执行架构
java·开发语言·人工智能·架构·workflow
独孤思维1 小时前
AI能赚钱,但是赚不了用户的心
人工智能·ai写作·副业·独孤思维·赚钱
IT·陈寒1 小时前
Java 并发这块坑真多,线程池又给我上了一课
人工智能·大模型·api·创业·变现·简历优化
Experience-摆渡1 小时前
谷歌WikiSkill论文精读:模型可以换经验留下来,9B反超27B
人工智能·深度学习
陈天伟教授1 小时前
DeepSeek Harness 6个使用技巧
人工智能·具身智能
promanz1 小时前
llamap.cpp 和 llama-index连接
人工智能·llama