Jev初体验记录

年初的时候我分享了我的AI资讯热点捕捉器,用 n8n 搭了个工作流,每天自动抓 AI 资讯存进飞书多维表格。这期间每天都在正常运行,截止到10月2日,已经汇总了14194条数据了。

其实这中间我就发现了一些问题,比如分类不准确,即使我的提示词里面已经说明了分类的选项,但是模型因为幻觉或是降智的原因,总是会出现一些我未曾给到的分类,结果凌乱不堪。当然这也有我前期分类不细致的一些原因。

  • 7,673 条在「博客/研究/评论/深度报道」
  • 3,376 条叫「其他(融资/社会舆论/人事变动等)」
  • 2,883 条「产品发布/更新」
  • 剩下的散落在 20 多种「其他(...)」变体里。图中可以看到各种的其他分类。

所以我很早就想要全部重新分类了,但是感觉太浪费token了。就一直没有实施。

Jev 是什么

这次用的不是 ChatGPT 也不是 Claude这些大模型,而是 TypeSafe 家的 Jev,官方叫它「System One 模型」------名字来自卡尼曼《思考,快与慢》里的系统一/系统二。

你把材料(state)和问题(question)发过去,它直接返回结构化判断------选了哪个选项、各选项概率多少、置信度多少。没有废话,直接返回 JSON 结果。

它有三种方式:

  • Choice:给固定选项让它选,我做分类用的就是这个
  • Score:按有序档位打分
  • Noul:是/非判断,带概率

还有一个对我最重要的特性:一次请求里可以塞很多个问题,并行评估。这就可以批量处理数据了。

怎么用

先设计类目

模型只负责判,类目是人划的,边界划不好结果就跟着歪。我让AI按内容主题重新设计了 10 个类目:模型与基准、研究与技术、产品与应用、智能体与自动化、安全与事故、政策与监管、商业与市场、社会与文化、观点与评论、其他。每类都有一句判定标准,另外把模糊情况的优先级规则也写进了指令,比如:

  • 涉及政府/立法/监管调查/诉讼的,归「政策与监管」,不归「安全与事故」
  • Agent 产品的发布归「智能体与自动化」,普通产品归「产品与应用」

请求长什么样

一次调用的核心就这三块:state(材料)、questions(问题)、criteria(选项)。

python 复制代码
{
  "state": [
    {"n": 1, "title": "英伟达确认将斥资129亿美元收购Hugging Face", "summary": "..."},
    {"n": 2, "title": "FTC调查OpenAI和Anthropic的潜在消费者损害", "summary": "..."},
    # ...一次塞 20 条
  ],
  "model": "jev-latest",
  "questions": {
    "q1": {"type": "choice", "instructions": "根据标题和摘要判断类目...这是第1条记录。", "criteria": {...10个类目...}},
    "q2": {"type": "choice", "instructions": "...这是第2条记录。", "criteria": {...}},
    # ...q20
  }
}

返回也很干净:

json 复制代码
"answers": {
  "q1": {"choice": "business_market", "confidence": 1.0, ...}
}

一次请求并行判 20 条,实测每次响应只要 1 秒左右。14,194 条 ÷ 20 = 710 次请求。

结果

  • 分类 14,194 条:710 次请求,652 秒,输入 1,235 万 tokens,输出 161 万,总费用0.52美元。
  • 平均置信度 0.776

新旧对比一眼就能看出差别:原来 54% 的数据(7,673 条)挤在「博客/研究/评论/深度报道」一个大筐里,现在按主题拆成了这样------观点与评论 2,732 条,产品与应用 1,849 条,商业与市场 1,808 条,社会与文化 1,702 条,智能体与自动化 1,427 条,政策与监管 1,404 条,安全与事故 1,219 条,研究与技术 1,103 条,模型与基准 887 条,兜底的「其他」只剩 63 条(0.4%)。

当然也有翻车的:「科技爱好者周刊」是个每期主题都不同的聚合帖,有的期判成「观点与评论」没问题,但有一期被按当期主题判到了别的类目,置信度只有 0.28。全量有 809 条置信度低于 0.4 的记录,这部分可以来人工复核,而不是混在里面假装正确。

优缺点

优点:

  • 快。1 万多条 11 分钟跑完,单请求 1 秒判 20 条,这个吞吐对脏活累活来说非常够用
  • 返回即结构化。选项、概率、置信度都是现成字段,不用写任何解析代码
  • 置信度是真有用。低置信度记录天然就是人工复核清单,809 条比 14,194 条好查多了
  • 判定规则写进指令它真的遵守。我写的边界规则在实际结果里都能对上号

缺点:

  • 类目设计还是人的活,而且占了大头。模型判得再稳,边界划歪了整体就歪
  • 不做长篇推理,特别模糊的题目(比如「900年前的古老答案应对现代难题」这种标题党)置信度会很低,得有人工兜底
  • 「其他」这个兜底类目偶尔会吞掉一些其实能归类的(某期周刊被判了 0.28 的「其他」,其实归「观点与评论」更合适)

另外新用户Jev送5美元体验额度(有效期一个月),所以等于没要钱,哈哈。


整体感受是,以前我做这类批量判断任务,默认拿起聊天模型,写 prompt、输出 JSON、写解析、处理解析失败重试。Jev 这类「判断型」模型等于把这套流程做成了标准件------尤其适合分类、打分、合规检查、意图识别这种「一万四千条里哪个是哪个」的任务。它不会帮你写文章干活,但脏活累活又快又省心。

相关推荐
知几蜗牛1 小时前
Java 17调用Responses图像输入:商品问答与结果边界
人工智能
工作10年+,存储芯片行业1 小时前
长鑫存储深度分析:国产 DRAM 的崛起、挑战与未来
人工智能·ssd·芯片·存储·pcie·dram·ddr
天天进步20151 小时前
90天AI接单学习路线:从LLM应用到AI Agent
人工智能·学习
fl1768311 小时前
工业镀金钨铜合金散热器表面缺陷识别污渍划痕分割数据集labelme格式1000张2类别低分辨率
人工智能·机器学习
打工仔折腾 AI1 小时前
用UU远程把家里电脑变成AI Agent常驻服务器:CLI、端口映射与代理实测
运维·服务器·人工智能·后端·python·电脑·ai agent 实战
龙亘川1 小时前
数智赋能物业不动产治理:亘川智城智慧物业系统实践解析
大数据·人工智能·智慧城市·开源软件·数据可视化
明月_清风1 小时前
AI Agent 进入系统层:现在有哪些开源项目在解决这个问题?
人工智能·后端
成为深度学习高手1 小时前
SEMixer:以随机注意力增强patch语义、渐进混合多尺度的轻量长期时序预测模型
人工智能·深度学习·机器学习·数据挖掘·时间序列