一份AI病历与参考答案文字很像,不代表医生真的省了时间。9月14日提交的KnowBench把评测单位换成"最终有多少AI生成工作被责任医生接受",试图直接衡量剩余人工负担。这个方向比单纯算文本相似度更贴近部署,但它也带来一个必须警惕的新误区:被接受不等于临床正确,更不等于安全结果已经得到证明。
新指标怎样计算
论文提出Effort Reduction(ER,工作量减少率):在专家和安全审查框架下,系统生成且被责任临床人员签署接受的工作单元,占全部工作单元的比例。不同任务的"单元"可以是病历段落、诊断和收费编码、医嘱、电子健康记录摘要、患者离院说明或决策支持项;每次修改都被视为返还给医生的剩余工作。
作者认为,这种定义把多个临床任务放进同一套报告协议。论文同时报告一个初始结果:在超过六个月、十三个专科、超过100万次已签署就诊记录中,Knowtex的专有临床模型总体ER为97.99%,不同专科为96.8%至98.9%。但作者也明确写出,本次只部分提供协议检查表,并有伴随统计尚未披露。
为什么比文本分数更接近真实工作
病历可以有多种正确表述,BLEU之类参考文本相似度可能惩罚合理改写;专家打分又昂贵、样本小且难以持续。医生在真实系统里的签署和修改,是工作流自然产生的反馈。它能回答管理者最关心的问题:AI究竟完成了多少可交付工作,而不是像不像某份模板。
具体场景是门诊摘要。AI正确写出病史和用药,医生只改一个剂量,这比整段重写节省更多工作。ER若按字段统计能呈现差别;若只按整份文档"接受/拒绝",则会把一次微小修改和彻底重写混为一谈。因此指标价值依赖工作单元定义,跨产品比较前必须先确认分母相同。
这个数字不能证明什么
97.99%是项目方在自有闭环系统中的汇总结果,并非独立随机试验。高接受率可能来自模型质量,也可能受默认界面、医生时间压力、自动填充范围、专科难度和病例选择影响。若医生因为赶时间而快速签署,系统会把行为当作成功,却未必捕捉遗漏或延迟出现的错误。
更重要的是,不同错误代价差异巨大。拼写修改和漏掉药物过敏不能各算一个相同单位。一个系统可能在大量低风险句子上获得很高ER,同时在少量高风险医嘱上表现不稳。因此减负率必须与严重错误率、复核时间、覆盖率、病例复杂度和患者结局分开报告。
对其他行业的启发
这一思路并不只属于医疗。法律合同可统计被律师保留的条款,客服可统计无需人工改写的回复,代码助手可统计最终合入且通过测试的补丁。关键是用责任人最终交付的工件做反馈,而不是用"生成完成"充当价值。
但行为指标容易被界面设计操纵。若"接受"按钮醒目、"修改"流程繁琐,接受率会上升;若系统只挑简单任务,减负率也会好看。负责评测的人应记录AI覆盖了哪些任务、哪些被路由给人工,以及人类是否有充分时间发现问题。
我的判断与行动建议
我的核心判断是,AI评测正在从模型能力转向"人还要做多少剩余工作"。这是正确方向,因为生产系统的价值来自任务闭环。不过,任何单一减负指标都可能把安全和质量藏进平均数。KnowBench最值得采用的是可审计的修改事件,不是97.99%这个尚缺完整伴随统计的数字。
- 先定义工作单元与风险等级,高风险项单独计算。
- 同时报ER、人工复核分钟数、严重错误率、覆盖率与返工率。
- 对未使用AI的同期样本做基线,避免把原本就简单的任务算成收益。
- 随机抽查"直接接受"的记录,检查沉默错误和自动化偏见。
- 按专科、病例复杂度和医生经验分层,不只给总体平均值。
- 保留模型版本、修改轨迹和签署人,确保结论可追溯。
在医疗等高风险场景,不适合把ER用于自动放宽人工复核,更不能把签署行为当成患者结局的替代指标。它最适合回答"系统是否减轻编辑负担",而不是"系统是否已足够安全"。
在你的工作里,衡量AI价值最诚实的指标是少写了多少、少改了多少,还是少花了多少时间?
关注「蜗牛聊AI」,一起看懂技术变化背后的真正机会。
本文首发于 java4u.cn,转载请注明出处。