过去几天,AI 圈上演了一场罕见的"模型周":主角不是又一家大模型公司,而是一个不生成文本的模型 ------TypeSafe 的 Jev。
时间线密集到离谱:9 月 16 日 browser-use 开源 jev-ultrafast(7 秒订机票实拍);9 月 17 日登上 Hacker News(91 points、14 条评论);9 月 19 日 trycua 发布受 Jev 启发的本地小模型 CUA-S1(89 points);到 9 月 21 日,HN 上已出现 67 个 Jev 相关帖子------本地平替、Vercel 集成指南、MySQL 语义插件、7 倍加速实战,GitHub API 显示原仓库五天内狂揽 13,893 stars、855 forks。
首段先给判断:Jev 爆发的本质,是 Agent 圈第一次认真讨论"不是所有决策都值得调用一次 LLM"。本文复盘这一周的时间线、生态、争议与趋势。
一、时间线:五天 1.4 万 star 是怎么发生的
| 日期 | 事件 | 信源 |
|---|---|---|
| 9 月 16 日 | browser-use/jev-ultrafast 建仓,当天出现 Qwen-2.5-1B-RLCD 本地复刻 |
GitHub API created_at |
| 9 月 17 日 | HN 主帖发布,Google Flights 7.073 秒视频出圈;同日出现 Jev 扑克分析、Devin 做的延迟 demo | HN 49735979 |
| 9 月 18 日 | 仓库宣布 Browser Use Cloud waitlist;mini-jev、open-alternative-jev、Vercel AI SDK 指南、SemanticSpace 同日涌现 | commit 1231850、HN |
| 9 月 19 日 | trycua 发布 CUA-S1(Show HN 89 分),706k 参数本地模型叫板 hosted Jev | HN 49767564 |
| 9 月 20--21 日 | Flavio Copes 深度解析、"7x faster"分类循环实战、von(sub-15ms 本地 drop-in)接力 | HN |
三个 commit 讲清了官方节奏:Build Jev Ultrafast browser agent → Reduce browser round trips and record a 7-second Flights demo → announce the Cloud waitlist。开源引爆 → 数据验证 → 云服务承接,browser-use 这套打法(YC W25,主仓库 106k stars)已经非常熟练。
技术细节可回看本站上一篇 jev-ultrafast 深度解析,本文聚焦热点与生态。
二、先补课:Jev 到底是什么
一句话:Jev 是 TypeSafe 的旗舰"System One"模型------给 state + 类型化问题,直接返回可供代码消费的结构化答案。
传统 LLM 是"写给人看的文本生成器",拿它做决策要经历"生成 → 解析 → 祈祷格式正确"三连。而 Jev 的三个 AI 原语是:
- Choice :多选一,返回
choice + probabilities + confidence; - Score :按 rubric 打分,返回
score + probabilities + confidence; - Noul :0--1 之间的"是/非"判断(forkast 的标题很精准:Jev Is Not an LLM -- and That May Be the Point)。
多个问题可以在一次请求内并行评估(speculative fan-out),加问题几乎不增加延迟,也不会产生 context-rot。jev-ultrafast 的"一次请求定 operation + target"正是这一特性的教科书用法。
卡尼曼的快慢思考是理解它的钥匙:LLM 是 System 2(慢、通用、贵),Jev 想做 System 1(快、直觉、便宜)。
三、生态爆发:67 个帖子里的四条路线
3.1 官方路线:browser-use × TypeSafe
jev-ultrafast 本体 + Cloud waitlist。Browser Use Cloud 的算盘很清楚:ultrafast 这类 Agent 最吃"托管浏览器 + 低延迟模型 + 持久会话",开源负责传播,云负责收费。
3.2 本地平替路线:去掉"AI 税"
HN 评论 nojvek 说出了很多人心声:
I would be v excited if jev wasn't a cloud model. Something that can run on consumer hardware at v fast speeds. ... I just don't like paying AI tax to gate keepers for each use.
社区一周内交付了四个答案:mini-jev(LLM 上复刻 Jev 接口)、von(sub-15ms 非自回归本地 drop-in)、open-alternative-jev(自有 GPU 运行)、Qwen-2.5-1B-RLCD(HuggingFace Space 并行约束解码)。方向一致:把"打分选项"这件事压缩到消费级硬件上。
3.3 专才小模型路线:CUA-S1
本周分量最重的 follow-up。trycua 的 Dillon 与 Francesco 受 Jev 的 System One 框架启发,发布 CUA-S1-FORMS:706k 参数、2.8 MB checkpoint、合成数据训练 30 分钟,只做表单决策(USE / CHECK / CLICK / SKIP,不看截图、不生成文本值)。
自测数据很刺激:表单任务全决策集 99.7% vs hosted Jev 83.6% ,本地打分 7--9 ms vs 云端 260--280 ms 。但作者自己打了补丁:样本衡量的不是一回事,也不是端到端表单完成时间;专才打通用模型本就不公平。真正的启示是那句路线宣言:通用 Agent 遇到新情况,把成熟决策下放给专才(general agent passes well-understood decisions over to specialists)。
3.4 应用集成路线:Jev 用在哪
- Vercel AI SDK 指南:分类、路由、打分三件套;
mysql-ailike:MySQL 插件按语义过滤行;- "Replacing an agentic classification loop with Jev: 7x faster":分类场景替换 agentic loop 的实战;
- SemanticSpace:用 Jev 在二维语义平面上可视化 prompt 关系;
- lindfors.no 早期评测:"calibrated judgments for half a cent"(半美分的校准判断)------便宜可能是 Jev 比快更重要的标签。
四、三场争议:HN 评论区在吵什么
争议一:计时口径------"最耗时的部分被排除在外?"
评论 ofisboy 直击要害:
"Timing starts after initial page observation" --- Isn't this the part that takes most time?
作者确实在 performance.md 写明:计时从首页初始观察后的第一次预测开始,浏览器启动、初始导航、事后独立校验都不在时钟内。公允地说两边都有理:质疑者认为这低估了真实任务成本;作者认为对照组双方口径一致(优化组 7.092 s vs 原始组 9.450 s 都是同一边界),且文本生成、stale 重试、结果加载等待都在时钟内。看 benchmark 先看测量边界,这个习惯比 7 秒本身更重要。
争议二:云端依赖------"Jev 需要 API key 吗?"
traktorn 问得最实在:Do you need a Jev API key to use it live? 答案是需要的(TYPESAFE_API_KEY),TEXT 模型另需 OpenRouter key。这正是 ramon156 失望的来源:
The more I see about how Jev works, the less interested I get. ... Projects like this are at best misleading, this one also happens to be broken.
叠加 tiku(Run demo 报错)、taikon(Doesn't work)的翻车报告,首发周的可用性确实配不上 star 增速。对开发者而言,把 Jev 当"云端高速判断 API"评估,而不是"本地免费模型",预期才摆得正。
争议三:通用性------"DONE 谁来保证?"
jev-ultrafast 的 DONE 只是模型的一个选项,最终成功靠 examples/flights.py 独立校验器判定;Shadow DOM、iframe、canvas、上传、新标签页全部不支持。7 秒是单任务三组对照的中位值(作者自注符号检验 p=0.25,非强统计结论)。它是"小样本受控对比",不是通用 Agent benchmark------这一点作者写得诚实,传播中却最容易被丢掉。
五、趋势判断:Agent 架构正在分层
把本周碎片拼起来,一个清晰的分层正在出现:
sql
┌─────────────────────────────────────────┐
│ System 2(慢思考):LLM │
│ 规划 / 探索 / 失败恢复 / 新情况 │
├─────────────────────────────────────────┤
│ System 1(快决策):Jev / CUA-S1 等 │
│ 点哪个 / 填哪格 / 跳过 / 路由分类 │
│ 一次请求多问题 · 概率+置信度 · 毫秒级 │
├─────────────────────────────────────────┤
│ 执行层:原子快照 + freshness 守卫 │
│ 单次浏览器调用 · 遮挡拒绝 · 独立校验 │
└─────────────────────────────────────────┘
三个可下注的判断:
- "选择题 API"会成为 Agent 标配:凡是可枚举的决策(点哪个元素、走哪个分支、工单分哪类),用 Choice/Score/Noul 代替一次 LLM 调用,又快又便宜(半美分/次的量级)。
- 本地专才模型爆发:CUA-S1 证明 706k 参数就能吃掉表单场景,von 证明 sub-15ms 本地推理可行。"通用云端大模型 + 本地窄专才"的混合部署会越来越多。
- benchmark 内卷转向测量诚实度:当 7 秒、7x faster、99.7% 满天飞时,敢写清"什么不计入时钟、样本量多少、p 值多少"的项目反而稀缺------这正是 jev-ultrafast 性能文档值得抄作业的地方。
六、对开发者的实操建议
- 分类/路由/审核场景先试 Jev:这是它最成熟的舒适区,Vercel 指南 + 7x faster 实战可直接抄。
- 浏览器 Agent 先数 CDP 调用:瓶颈大概率在工程(截图、重复读树、动画误杀决策),而非模型智商,jev-ultrafast 的 1092→101 就是证据。
- 跑不通先查三件套 :
TYPESAFE_API_KEY、TEXT_MODEL_API_KEY、uv run browser-harness --doctor(Chrome 远程调试)。 - 生产必须配独立校验 :
DONE永远不自证,航班查航线/日期/结果可见性,表单查字段状态------把验收写成代码。 - 关注本地路线但别押注太早:mini-jev / von / CUA-S1 都很新,接口与精度还在快速变化,适合实验,不适合直接上生产。
常见问答 FAQ
Q1:Jev 到底是不是 LLM?
不是传统意义上的自回归文本生成模型。Jev 是 TypeSafe 的 System One 决策模型,对 state 并行评估类型化问题,直接返回选项、概率分布与置信度,不逐 token 生成文本。
Q2:jev-ultrafast 的 7 秒成绩有没有水分?
计时从首页初始观察之后开始,不含浏览器启动与初始导航,这是 HN 上被质疑最多的一点。但 17 次决策、文本生成与结果加载等待都在时钟内,且作者公开了完整测量边界。
Q3:不用 Jev 云端 API 能跑吗?
官方 demo 需要 TYPESAFE_API_KEY。但社区一周内已出现 mini-jev、von、Qwen-2.5-1B-RLCD 等本地平替,以及 trycua 的 CUA-S1(706k 参数、7-9ms 本地打分),本地路线正在成形。
Q4:CUA-S1 和 hosted Jev 哪个更强?
在 CUA 自己的表单任务上,专用小模型 99.7% 对 hosted Jev 83.6%,但这是作用域内特化对比,不是通用能力排名。它的意义是证明窄决策可以用本地小模型替代云端大调用。
Q5:System One 模型会取代 Agent 里的 LLM 吗?
不会完全取代。趋势是分工:LLM 做慢思考(规划、探索、恢复),System One 模型做快决策(点哪个、填什么、跳过什么),通用 Agent 遇到新情况再把成熟决策下放给专才模型。
参考资料
本文数据(star 数、HN 得分、评论原话、CUA-S1 评测数字)均在发稿前通过 GitHub API 与 HN Algolia/Firebase API 逐条核实,快照时间为 2026-09-21。如果你亲手跑通过 jev-ultrafast 或本地平替,欢迎订阅本站 RSS 并回来分享你的复现结果。
原创技术博客 · 开源项目分享 · AI全栈创作社区 idao.fun