Jev 爆发一周:7 秒 Agent 背后的 System One 生态与三场争议

过去几天,AI 圈上演了一场罕见的"模型周":主角不是又一家大模型公司,而是一个不生成文本的模型 ------TypeSafe 的 Jev

时间线密集到离谱:9 月 16 日 browser-use 开源 jev-ultrafast(7 秒订机票实拍);9 月 17 日登上 Hacker News(91 points、14 条评论);9 月 19 日 trycua 发布受 Jev 启发的本地小模型 CUA-S1(89 points);到 9 月 21 日,HN 上已出现 67 个 Jev 相关帖子------本地平替、Vercel 集成指南、MySQL 语义插件、7 倍加速实战,GitHub API 显示原仓库五天内狂揽 13,893 stars、855 forks

首段先给判断:Jev 爆发的本质,是 Agent 圈第一次认真讨论"不是所有决策都值得调用一次 LLM"。本文复盘这一周的时间线、生态、争议与趋势。


一、时间线:五天 1.4 万 star 是怎么发生的

日期 事件 信源
9 月 16 日 browser-use/jev-ultrafast 建仓,当天出现 Qwen-2.5-1B-RLCD 本地复刻 GitHub API created_at
9 月 17 日 HN 主帖发布,Google Flights 7.073 秒视频出圈;同日出现 Jev 扑克分析、Devin 做的延迟 demo HN 49735979
9 月 18 日 仓库宣布 Browser Use Cloud waitlist;mini-jev、open-alternative-jev、Vercel AI SDK 指南、SemanticSpace 同日涌现 commit 1231850、HN
9 月 19 日 trycua 发布 CUA-S1(Show HN 89 分),706k 参数本地模型叫板 hosted Jev HN 49767564
9 月 20--21 日 Flavio Copes 深度解析、"7x faster"分类循环实战、von(sub-15ms 本地 drop-in)接力 HN

三个 commit 讲清了官方节奏:Build Jev Ultrafast browser agentReduce browser round trips and record a 7-second Flights demoannounce the Cloud waitlist开源引爆 → 数据验证 → 云服务承接,browser-use 这套打法(YC W25,主仓库 106k stars)已经非常熟练。

技术细节可回看本站上一篇 jev-ultrafast 深度解析,本文聚焦热点与生态。


二、先补课:Jev 到底是什么

一句话:Jev 是 TypeSafe 的旗舰"System One"模型------给 state + 类型化问题,直接返回可供代码消费的结构化答案

传统 LLM 是"写给人看的文本生成器",拿它做决策要经历"生成 → 解析 → 祈祷格式正确"三连。而 Jev 的三个 AI 原语是:

  • Choice :多选一,返回 choice + probabilities + confidence
  • Score :按 rubric 打分,返回 score + probabilities + confidence
  • Noul :0--1 之间的"是/非"判断(forkast 的标题很精准:Jev Is Not an LLM -- and That May Be the Point)。

多个问题可以在一次请求内并行评估(speculative fan-out),加问题几乎不增加延迟,也不会产生 context-rot。jev-ultrafast 的"一次请求定 operation + target"正是这一特性的教科书用法。

卡尼曼的快慢思考是理解它的钥匙:LLM 是 System 2(慢、通用、贵),Jev 想做 System 1(快、直觉、便宜)。


三、生态爆发:67 个帖子里的四条路线

3.1 官方路线:browser-use × TypeSafe

jev-ultrafast 本体 + Cloud waitlist。Browser Use Cloud 的算盘很清楚:ultrafast 这类 Agent 最吃"托管浏览器 + 低延迟模型 + 持久会话",开源负责传播,云负责收费。

3.2 本地平替路线:去掉"AI 税"

HN 评论 nojvek 说出了很多人心声:

I would be v excited if jev wasn't a cloud model. Something that can run on consumer hardware at v fast speeds. ... I just don't like paying AI tax to gate keepers for each use.

社区一周内交付了四个答案:mini-jev(LLM 上复刻 Jev 接口)、von(sub-15ms 非自回归本地 drop-in)、open-alternative-jev(自有 GPU 运行)、Qwen-2.5-1B-RLCD(HuggingFace Space 并行约束解码)。方向一致:把"打分选项"这件事压缩到消费级硬件上

3.3 专才小模型路线:CUA-S1

本周分量最重的 follow-up。trycua 的 Dillon 与 Francesco 受 Jev 的 System One 框架启发,发布 CUA-S1-FORMS706k 参数、2.8 MB checkpoint、合成数据训练 30 分钟,只做表单决策(USE / CHECK / CLICK / SKIP,不看截图、不生成文本值)。

自测数据很刺激:表单任务全决策集 99.7% vs hosted Jev 83.6% ,本地打分 7--9 ms vs 云端 260--280 ms 。但作者自己打了补丁:样本衡量的不是一回事,也不是端到端表单完成时间;专才打通用模型本就不公平。真正的启示是那句路线宣言:通用 Agent 遇到新情况,把成熟决策下放给专才(general agent passes well-understood decisions over to specialists)。

3.4 应用集成路线:Jev 用在哪

  • Vercel AI SDK 指南:分类、路由、打分三件套;
  • mysql-ailike:MySQL 插件按语义过滤行;
  • "Replacing an agentic classification loop with Jev: 7x faster":分类场景替换 agentic loop 的实战;
  • SemanticSpace:用 Jev 在二维语义平面上可视化 prompt 关系;
  • lindfors.no 早期评测:"calibrated judgments for half a cent"(半美分的校准判断)------便宜可能是 Jev 比快更重要的标签。

四、三场争议:HN 评论区在吵什么

争议一:计时口径------"最耗时的部分被排除在外?"

评论 ofisboy 直击要害:

"Timing starts after initial page observation" --- Isn't this the part that takes most time?

作者确实在 performance.md 写明:计时从首页初始观察后的第一次预测开始,浏览器启动、初始导航、事后独立校验都不在时钟内。公允地说两边都有理:质疑者认为这低估了真实任务成本;作者认为对照组双方口径一致(优化组 7.092 s vs 原始组 9.450 s 都是同一边界),且文本生成、stale 重试、结果加载等待都在时钟内。看 benchmark 先看测量边界,这个习惯比 7 秒本身更重要

争议二:云端依赖------"Jev 需要 API key 吗?"

traktorn 问得最实在:Do you need a Jev API key to use it live? 答案是需要的(TYPESAFE_API_KEY),TEXT 模型另需 OpenRouter key。这正是 ramon156 失望的来源:

The more I see about how Jev works, the less interested I get. ... Projects like this are at best misleading, this one also happens to be broken.

叠加 tiku(Run demo 报错)、taikon(Doesn't work)的翻车报告,首发周的可用性确实配不上 star 增速。对开发者而言,把 Jev 当"云端高速判断 API"评估,而不是"本地免费模型",预期才摆得正

争议三:通用性------"DONE 谁来保证?"

jev-ultrafast 的 DONE 只是模型的一个选项,最终成功靠 examples/flights.py 独立校验器判定;Shadow DOM、iframe、canvas、上传、新标签页全部不支持。7 秒是单任务三组对照的中位值(作者自注符号检验 p=0.25,非强统计结论)。它是"小样本受控对比",不是通用 Agent benchmark------这一点作者写得诚实,传播中却最容易被丢掉。


五、趋势判断:Agent 架构正在分层

把本周碎片拼起来,一个清晰的分层正在出现:

sql 复制代码
┌─────────────────────────────────────────┐
│  System 2(慢思考):LLM                 │
│  规划 / 探索 / 失败恢复 / 新情况          │
├─────────────────────────────────────────┤
│  System 1(快决策):Jev / CUA-S1 等     │
│  点哪个 / 填哪格 / 跳过 / 路由分类       │
│  一次请求多问题 · 概率+置信度 · 毫秒级   │
├─────────────────────────────────────────┤
│  执行层:原子快照 + freshness 守卫       │
│  单次浏览器调用 · 遮挡拒绝 · 独立校验    │
└─────────────────────────────────────────┘

三个可下注的判断:

  1. "选择题 API"会成为 Agent 标配:凡是可枚举的决策(点哪个元素、走哪个分支、工单分哪类),用 Choice/Score/Noul 代替一次 LLM 调用,又快又便宜(半美分/次的量级)。
  2. 本地专才模型爆发:CUA-S1 证明 706k 参数就能吃掉表单场景,von 证明 sub-15ms 本地推理可行。"通用云端大模型 + 本地窄专才"的混合部署会越来越多。
  3. benchmark 内卷转向测量诚实度:当 7 秒、7x faster、99.7% 满天飞时,敢写清"什么不计入时钟、样本量多少、p 值多少"的项目反而稀缺------这正是 jev-ultrafast 性能文档值得抄作业的地方。

六、对开发者的实操建议

  1. 分类/路由/审核场景先试 Jev:这是它最成熟的舒适区,Vercel 指南 + 7x faster 实战可直接抄。
  2. 浏览器 Agent 先数 CDP 调用:瓶颈大概率在工程(截图、重复读树、动画误杀决策),而非模型智商,jev-ultrafast 的 1092→101 就是证据。
  3. 跑不通先查三件套TYPESAFE_API_KEYTEXT_MODEL_API_KEYuv run browser-harness --doctor(Chrome 远程调试)。
  4. 生产必须配独立校验DONE 永远不自证,航班查航线/日期/结果可见性,表单查字段状态------把验收写成代码。
  5. 关注本地路线但别押注太早:mini-jev / von / CUA-S1 都很新,接口与精度还在快速变化,适合实验,不适合直接上生产。

常见问答 FAQ

Q1:Jev 到底是不是 LLM?

不是传统意义上的自回归文本生成模型。Jev 是 TypeSafe 的 System One 决策模型,对 state 并行评估类型化问题,直接返回选项、概率分布与置信度,不逐 token 生成文本。

Q2:jev-ultrafast 的 7 秒成绩有没有水分?

计时从首页初始观察之后开始,不含浏览器启动与初始导航,这是 HN 上被质疑最多的一点。但 17 次决策、文本生成与结果加载等待都在时钟内,且作者公开了完整测量边界。

Q3:不用 Jev 云端 API 能跑吗?

官方 demo 需要 TYPESAFE_API_KEY。但社区一周内已出现 mini-jev、von、Qwen-2.5-1B-RLCD 等本地平替,以及 trycua 的 CUA-S1(706k 参数、7-9ms 本地打分),本地路线正在成形。

Q4:CUA-S1 和 hosted Jev 哪个更强?

在 CUA 自己的表单任务上,专用小模型 99.7% 对 hosted Jev 83.6%,但这是作用域内特化对比,不是通用能力排名。它的意义是证明窄决策可以用本地小模型替代云端大调用。

Q5:System One 模型会取代 Agent 里的 LLM 吗?

不会完全取代。趋势是分工:LLM 做慢思考(规划、探索、恢复),System One 模型做快决策(点哪个、填什么、跳过什么),通用 Agent 遇到新情况再把成熟决策下放给专才模型。


参考资料

本文数据(star 数、HN 得分、评论原话、CUA-S1 评测数字)均在发稿前通过 GitHub API 与 HN Algolia/Firebase API 逐条核实,快照时间为 2026-09-21。如果你亲手跑通过 jev-ultrafast 或本地平替,欢迎订阅本站 RSS 并回来分享你的复现结果。

原创技术博客 · 开源项目分享 · AI全栈创作社区 idao.fun

相关推荐
前端小万2 小时前
写公众号赚了 3000 块后,我做了一款叫 "一键成稿" 的软件
前端·微信小程序
爱勇宝2 小时前
ZCode 开源 24 小时:一份没有历史的账本,回答不了"有没有偷代码"
前端·后端·chatglm (智谱)
胡写代码2 小时前
别再前后端各写一套表单校验了
java·后端
三十而立洋2 小时前
Cookie 详解:从产生到安全,一次讲透
前端·javascript
1点东西2 小时前
做了近两年的Agent开发,其实真正要学的就是这五件事
llm·agent·ai编程
七牛云行业应用2 小时前
Qwen-Image-2.1 开源部署完整指南:Diffusers、ComfyUI 与推理服务
ai编程
大勇前进3 小时前
原生 PHP 还是 Laravel?小项目到底要不要上框架
后端
yuzhi_liu3 小时前
我用 LangGraph4j 实现 Multi-Agent Supervisor
后端
alsmile3 小时前
Node-RED 之外,国产规则引擎的新方案:基于标准语法,Go 先行实现
后端·开源·go