临床AI别再只比像不像标准答案,先算医生少改了多少

一份AI病历与参考答案文字很像,不代表医生真的省了时间。9月14日提交的KnowBench把评测单位换成"最终有多少AI生成工作被责任医生接受",试图直接衡量剩余人工负担。这个方向比单纯算文本相似度更贴近部署,但它也带来一个必须警惕的新误区:被接受不等于临床正确,更不等于安全结果已经得到证明。

新指标怎样计算

论文提出Effort Reduction(ER,工作量减少率):在专家和安全审查框架下,系统生成且被责任临床人员签署接受的工作单元,占全部工作单元的比例。不同任务的"单元"可以是病历段落、诊断和收费编码、医嘱、电子健康记录摘要、患者离院说明或决策支持项;每次修改都被视为返还给医生的剩余工作。

作者认为,这种定义把多个临床任务放进同一套报告协议。论文同时报告一个初始结果:在超过六个月、十三个专科、超过100万次已签署就诊记录中,Knowtex的专有临床模型总体ER为97.99%,不同专科为96.8%至98.9%。但作者也明确写出,本次只部分提供协议检查表,并有伴随统计尚未披露。

flowchart LR A[AI生成病历或编码] --> B[责任医生审阅] B --> C{工作单元是否接受} C -->|直接接受| D[计入已完成工作] C -->|修改或删除| E[计入剩余人工工作] D --> F[计算减负率ER] E --> F F --> G[按专科任务风险分层] G --> H[结合时间安全与结果审计]

为什么比文本分数更接近真实工作

病历可以有多种正确表述,BLEU之类参考文本相似度可能惩罚合理改写;专家打分又昂贵、样本小且难以持续。医生在真实系统里的签署和修改,是工作流自然产生的反馈。它能回答管理者最关心的问题:AI究竟完成了多少可交付工作,而不是像不像某份模板。

具体场景是门诊摘要。AI正确写出病史和用药,医生只改一个剂量,这比整段重写节省更多工作。ER若按字段统计能呈现差别;若只按整份文档"接受/拒绝",则会把一次微小修改和彻底重写混为一谈。因此指标价值依赖工作单元定义,跨产品比较前必须先确认分母相同。

这个数字不能证明什么

97.99%是项目方在自有闭环系统中的汇总结果,并非独立随机试验。高接受率可能来自模型质量,也可能受默认界面、医生时间压力、自动填充范围、专科难度和病例选择影响。若医生因为赶时间而快速签署,系统会把行为当作成功,却未必捕捉遗漏或延迟出现的错误。

更重要的是,不同错误代价差异巨大。拼写修改和漏掉药物过敏不能各算一个相同单位。一个系统可能在大量低风险句子上获得很高ER,同时在少量高风险医嘱上表现不稳。因此减负率必须与严重错误率、复核时间、覆盖率、病例复杂度和患者结局分开报告。

对其他行业的启发

这一思路并不只属于医疗。法律合同可统计被律师保留的条款,客服可统计无需人工改写的回复,代码助手可统计最终合入且通过测试的补丁。关键是用责任人最终交付的工件做反馈,而不是用"生成完成"充当价值。

但行为指标容易被界面设计操纵。若"接受"按钮醒目、"修改"流程繁琐,接受率会上升;若系统只挑简单任务,减负率也会好看。负责评测的人应记录AI覆盖了哪些任务、哪些被路由给人工,以及人类是否有充分时间发现问题。

我的判断与行动建议

我的核心判断是,AI评测正在从模型能力转向"人还要做多少剩余工作"。这是正确方向,因为生产系统的价值来自任务闭环。不过,任何单一减负指标都可能把安全和质量藏进平均数。KnowBench最值得采用的是可审计的修改事件,不是97.99%这个尚缺完整伴随统计的数字。

  • 先定义工作单元与风险等级,高风险项单独计算。
  • 同时报ER、人工复核分钟数、严重错误率、覆盖率与返工率。
  • 对未使用AI的同期样本做基线,避免把原本就简单的任务算成收益。
  • 随机抽查"直接接受"的记录,检查沉默错误和自动化偏见。
  • 按专科、病例复杂度和医生经验分层,不只给总体平均值。
  • 保留模型版本、修改轨迹和签署人,确保结论可追溯。

在医疗等高风险场景,不适合把ER用于自动放宽人工复核,更不能把签署行为当成患者结局的替代指标。它最适合回答"系统是否减轻编辑负担",而不是"系统是否已足够安全"。

在你的工作里,衡量AI价值最诚实的指标是少写了多少、少改了多少,还是少花了多少时间?

关注「蜗牛聊AI」,一起看懂技术变化背后的真正机会。


本文首发于 java4u.cn,转载请注明出处。

相关推荐
知几蜗牛1 小时前
AI做长程科研,真正稀缺的不是更多Agent而是反证链
人工智能
知几蜗牛1 小时前
AI代码审计最危险的不是漏报,而是团队开始不再相信它
人工智能
码农学院1 小时前
制造业B2B官网GEO实战:用 Python 向量相似度给老产品手册自动补语义内链,让 AI 爬虫抓得更深
运维·人工智能·爬虫·ai优化aio
资讯综合1 小时前
2026全国AI大模型备案代办机构口碑排行及选型参考
人工智能
码农学院1 小时前
本地服务业GEO架构方案:用 ASP.NET Core 中间件按门店动态注入 LocalBusiness Schema,营业时间改一次全站生效
人工智能·geo优化·ai优化aio
user_admin_god1 小时前
第 05 篇:结构化输出 —— 让模型稳定返回 JSON
java·人工智能·spring boot·语言模型
moonsims1 小时前
AiBrainBox-UGV 的目标跟踪从“传统视觉跟踪”升级为“语义目标跟踪”
前端·人工智能·量子计算
AI你一生一世1 小时前
当手机镜头遇上实时流:移动端4K直播的技术突围与选型指南
人工智能·音视频编解码·技术选型·4k视频·移动端直播·实时流媒体
知几蜗牛1 小时前
100万Token不等于模型全记住:从KV Cache看懂长上下文成本
人工智能