AI给面试打分不够,求职者更需要可核对的证据

视频面试AI常给出一个分数,却说不清这个分数来自哪句话、哪次停顿或哪个画面。9月17日提交的E-AVI论文尝试把评分连接到带时间戳的文本、声音和视觉证据。它比"流利生成一段解释"更进一步,但距离可用于真实招聘的公平程序仍有很长一段路。

发生了什么

E-AVI先从视频、音频和转写中抽取结构化证据,每条包含模态、事件类型、起止时间和自然语言描述;随后,针对不同评分维度选择相关证据,并结合原始多模态嵌入给出分数。这个共享证据池还能生成反馈并回答追问,证据不足时会再次检查原视频。

研究使用公开RecruitView数据集和一个酒店业私有数据集。RecruitView含300多名参与者、2011段回答、76个问题与12维连续评分;私有数据来自中国南方三家酒店的101名一线员工。论文在参与者层面切分训练、验证和测试,避免同一人的视频泄漏到不同集合。

一手来源:arXiv摘要论文HTML全文。这是一篇预印本,尚不能视为经过同行评议或跨地区独立验证的招聘产品。

技术上,它把"解释"放进预测路径

很多系统先打分,再让语言模型编一段听起来合理的说明。这种事后解释可能与真实预测依据无关。E-AVI让证据进入评分器:每个评分维度都有查询向量,去关注证据条目与源级嵌入;训练还用弱监督规则鼓励"语速影响表达""内容结构影响回答质量"等对应关系。
#mermaid-svg-f45MkqpdtOKOSXcb{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-f45MkqpdtOKOSXcb .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-f45MkqpdtOKOSXcb .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-f45MkqpdtOKOSXcb .error-icon{fill:#552222;}#mermaid-svg-f45MkqpdtOKOSXcb .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-f45MkqpdtOKOSXcb .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-f45MkqpdtOKOSXcb .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-f45MkqpdtOKOSXcb .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-f45MkqpdtOKOSXcb .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-f45MkqpdtOKOSXcb .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-f45MkqpdtOKOSXcb .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-f45MkqpdtOKOSXcb .marker{fill:#333333;stroke:#333333;}#mermaid-svg-f45MkqpdtOKOSXcb .marker.cross{stroke:#333333;}#mermaid-svg-f45MkqpdtOKOSXcb svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-f45MkqpdtOKOSXcb p{margin:0;}#mermaid-svg-f45MkqpdtOKOSXcb .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-f45MkqpdtOKOSXcb .cluster-label text{fill:#333;}#mermaid-svg-f45MkqpdtOKOSXcb .cluster-label span{color:#333;}#mermaid-svg-f45MkqpdtOKOSXcb .cluster-label span p{background-color:transparent;}#mermaid-svg-f45MkqpdtOKOSXcb .label text,#mermaid-svg-f45MkqpdtOKOSXcb span{fill:#333;color:#333;}#mermaid-svg-f45MkqpdtOKOSXcb .node rect,#mermaid-svg-f45MkqpdtOKOSXcb .node circle,#mermaid-svg-f45MkqpdtOKOSXcb .node ellipse,#mermaid-svg-f45MkqpdtOKOSXcb .node polygon,#mermaid-svg-f45MkqpdtOKOSXcb .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-f45MkqpdtOKOSXcb .rough-node .label text,#mermaid-svg-f45MkqpdtOKOSXcb .node .label text,#mermaid-svg-f45MkqpdtOKOSXcb .image-shape .label,#mermaid-svg-f45MkqpdtOKOSXcb .icon-shape .label{text-anchor:middle;}#mermaid-svg-f45MkqpdtOKOSXcb .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-f45MkqpdtOKOSXcb .rough-node .label,#mermaid-svg-f45MkqpdtOKOSXcb .node .label,#mermaid-svg-f45MkqpdtOKOSXcb .image-shape .label,#mermaid-svg-f45MkqpdtOKOSXcb .icon-shape .label{text-align:center;}#mermaid-svg-f45MkqpdtOKOSXcb .node.clickable{cursor:pointer;}#mermaid-svg-f45MkqpdtOKOSXcb .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-f45MkqpdtOKOSXcb .arrowheadPath{fill:#333333;}#mermaid-svg-f45MkqpdtOKOSXcb .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-f45MkqpdtOKOSXcb .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-f45MkqpdtOKOSXcb .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-f45MkqpdtOKOSXcb .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-f45MkqpdtOKOSXcb .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-f45MkqpdtOKOSXcb .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-f45MkqpdtOKOSXcb .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-f45MkqpdtOKOSXcb .cluster text{fill:#333;}#mermaid-svg-f45MkqpdtOKOSXcb .cluster span{color:#333;}#mermaid-svg-f45MkqpdtOKOSXcb div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-f45MkqpdtOKOSXcb .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-f45MkqpdtOKOSXcb rect.text{fill:none;stroke-width:0;}#mermaid-svg-f45MkqpdtOKOSXcb .icon-shape,#mermaid-svg-f45MkqpdtOKOSXcb .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-f45MkqpdtOKOSXcb .icon-shape p,#mermaid-svg-f45MkqpdtOKOSXcb .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-f45MkqpdtOKOSXcb .icon-shape .label rect,#mermaid-svg-f45MkqpdtOKOSXcb .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-f45MkqpdtOKOSXcb .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-f45MkqpdtOKOSXcb .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-f45MkqpdtOKOSXcb :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} 否

面试视频
转写/音频/画面
抽取带时间戳证据
按评分维度选择证据
生成源级多模态嵌入
联合评分器
分数
反馈与追问
证据充分?
回看相关片段
返回可核对回答

在RecruitView上,E-AVI把平均绝对误差从微调MiniCPM-o的0.641降至0.607,Spearman排序相关从0.440升到0.541;私有数据上的相关为0.639。论文也主动给出边界:私有测试集的提升只支持当前切分,不能证明换酒店、岗位或人群后仍稳定。

最值得看的是失败数据

两名标注者检查了50段视频中的870条证据:80.8%被认为完全受原始记录支持,12.1%部分支持或有过度概括,7.1%不受支持。文本证据的完全支持率89.5%,音频为74.8%,视频为77.4%。这意味着"显示证据"不自动等于证据可靠,特别是语气和行为解读更容易越界。

论文还检查了30个相对基线最困难的样本,其中25个问题与证据抽取错误或遗漏相关。删除高注意力证据比随机删除更伤排序性能,说明证据确实参与了预测;但源级嵌入仍贡献很大,所以可读证据并不是完整的因果解释。

一个真实风险是把"短暂停顿"解释为不自信。停顿可能来自网络、口音、思考习惯或无障碍需求。即使系统能标出12秒到14秒,时间戳只证明行为发生,不证明它该被转成能力分数。证据层解决了可检查性,却没有自动解决构念效度。

招聘团队还应把"证据完整"与"证据相关"分开。转写准确记录了一句话,只能说明系统没有听错;这句话是否与岗位胜任力有关,仍取决于经过验证的评分标准。否则系统可能非常忠实地放大一套不合理规则。

我的判断

高风险AI的解释标准不该是"能说理由",而应是"理由能回到原始材料、能被质疑、能改变决定"。 E-AVI的重要贡献是把可核对证据做成中间表示;它暴露的问题同样重要:证据抽取仍是主要瓶颈,且评分还依赖人看不懂的源级表示。

招聘方如果采用类似系统,应把AI定位为结构化辅助,不是终局裁判。人类复核者要看到原片段、岗位相关评分规则和不确定性;求职者应能申诉错误转写、误判行为或无障碍因素。没有这些流程,所谓透明度可能只是把黑盒分数换成更有说服力的黑盒故事。

适用边界与风险

这项研究只覆盖有限数据集与预设评分维度,私有数据规模尤其小。教师模型生成了训练证据,比较的是完整系统,不是完全相同监督条件下的架构对照。跨语言、口音、肤色、神经多样性和设备质量的公平性并未被这组结果充分证明。

立即可执行的采购检查包括:要求供应商报告按人群分组的误差;随机抽取证据与原片段双人复核;禁止用表情、停顿等弱信号直接淘汰;保留人工推翻记录;给候选人数据更正与申诉入口;在每次模型更新后重跑岗位级验证。

如果面试AI给出低分,你认为求职者应有权看到原始片段、证据摘要,还是完整模型逻辑?

关注「蜗牛聊AI」,一起看懂技术变化背后的真正机会。


本文首发于 java4u.cn,转载请注明出处。

相关推荐
不开大的凯20771 小时前
跑分已死,交付为王
人工智能·ai·麦当秀aippt·ai office
EatFan1 小时前
gRPC 为什么比 HTTP+JSON 快?详细讲解gRPC
后端·微服务·grpc
AI多Agent协作实战派1 小时前
【AI探索历程19】飞牛版:给NAS用户的一键部署
人工智能
爱签AI电子合同1 小时前
电子合同服务稳定性怎么测?可用性保障维度专项测评
大数据·人工智能·电子合同·电子签名
此时不提桶,更待何时1 小时前
02-05-B-虚拟线程面试与生产事故实战
java·面试
名字还没想好☜1 小时前
Spring Boot 3.2 RestClient 实战:替代 RestTemplate 调外部接口,超时、连接池与错误处理
java·后端·spring
IC一站式服务1 小时前
AI时代数据中心互联:PCIe重定时器、重驱动器与交换机全解析
人工智能
正经教主1 小时前
【FDE系列】阶段2:Day 35:Python + SQL — 工单接入 MySQL + 本周收官
人工智能·python·fde
I Am a robert girl1 小时前
谷歌迈出RSI一大步:从Gemini模型迭代看AI工程化的新风向
人工智能·大模型·gemini·ai工程化·上下文工程·rsi·工具链集成