AI给面试打分不够,求职者更需要可核对的证据

0 阅读1分钟

视频面试AI常给出一个分数,却说不清这个分数来自哪句话、哪次停顿或哪个画面。9月17日提交的E-AVI论文尝试把评分连接到带时间戳的文本、声音和视觉证据。它比“流利生成一段解释”更进一步,但距离可用于真实招聘的公平程序仍有很长一段路。

发生了什么

E-AVI先从视频、音频和转写中抽取结构化证据,每条包含模态、事件类型、起止时间和自然语言描述;随后,针对不同评分维度选择相关证据,并结合原始多模态嵌入给出分数。这个共享证据池还能生成反馈并回答追问,证据不足时会再次检查原视频。

研究使用公开RecruitView数据集和一个酒店业私有数据集。RecruitView含300多名参与者、2011段回答、76个问题与12维连续评分;私有数据来自中国南方三家酒店的101名一线员工。论文在参与者层面切分训练、验证和测试,避免同一人的视频泄漏到不同集合。

一手来源:arXiv摘要论文HTML全文。这是一篇预印本,尚不能视为经过同行评议或跨地区独立验证的招聘产品。

技术上,它把“解释”放进预测路径

很多系统先打分,再让语言模型编一段听起来合理的说明。这种事后解释可能与真实预测依据无关。E-AVI让证据进入评分器:每个评分维度都有查询向量,去关注证据条目与源级嵌入;训练还用弱监督规则鼓励“语速影响表达”“内容结构影响回答质量”等对应关系。

flowchart LR
    A[面试视频] --> B[转写/音频/画面]
    B --> C[抽取带时间戳证据]
    C --> D[按评分维度选择证据]
    B --> E[生成源级多模态嵌入]
    D --> F[联合评分器]
    E --> F
    F --> G[分数]
    C --> H[反馈与追问]
    H --> I{证据充分?}
    I -- 否 --> J[回看相关片段]
    I -- 是 --> K[返回可核对回答]
    J --> K

在RecruitView上,E-AVI把平均绝对误差从微调MiniCPM-o的0.641降至0.607,Spearman排序相关从0.440升到0.541;私有数据上的相关为0.639。论文也主动给出边界:私有测试集的提升只支持当前切分,不能证明换酒店、岗位或人群后仍稳定。

最值得看的是失败数据

两名标注者检查了50段视频中的870条证据:80.8%被认为完全受原始记录支持,12.1%部分支持或有过度概括,7.1%不受支持。文本证据的完全支持率89.5%,音频为74.8%,视频为77.4%。这意味着“显示证据”不自动等于证据可靠,特别是语气和行为解读更容易越界。

论文还检查了30个相对基线最困难的样本,其中25个问题与证据抽取错误或遗漏相关。删除高注意力证据比随机删除更伤排序性能,说明证据确实参与了预测;但源级嵌入仍贡献很大,所以可读证据并不是完整的因果解释。

一个真实风险是把“短暂停顿”解释为不自信。停顿可能来自网络、口音、思考习惯或无障碍需求。即使系统能标出12秒到14秒,时间戳只证明行为发生,不证明它该被转成能力分数。证据层解决了可检查性,却没有自动解决构念效度。

招聘团队还应把“证据完整”与“证据相关”分开。转写准确记录了一句话,只能说明系统没有听错;这句话是否与岗位胜任力有关,仍取决于经过验证的评分标准。否则系统可能非常忠实地放大一套不合理规则。

我的判断

高风险AI的解释标准不该是“能说理由”,而应是“理由能回到原始材料、能被质疑、能改变决定”。 E-AVI的重要贡献是把可核对证据做成中间表示;它暴露的问题同样重要:证据抽取仍是主要瓶颈,且评分还依赖人看不懂的源级表示。

招聘方如果采用类似系统,应把AI定位为结构化辅助,不是终局裁判。人类复核者要看到原片段、岗位相关评分规则和不确定性;求职者应能申诉错误转写、误判行为或无障碍因素。没有这些流程,所谓透明度可能只是把黑盒分数换成更有说服力的黑盒故事。

适用边界与风险

这项研究只覆盖有限数据集与预设评分维度,私有数据规模尤其小。教师模型生成了训练证据,比较的是完整系统,不是完全相同监督条件下的架构对照。跨语言、口音、肤色、神经多样性和设备质量的公平性并未被这组结果充分证明。

立即可执行的采购检查包括:要求供应商报告按人群分组的误差;随机抽取证据与原片段双人复核;禁止用表情、停顿等弱信号直接淘汰;保留人工推翻记录;给候选人数据更正与申诉入口;在每次模型更新后重跑岗位级验证。

如果面试AI给出低分,你认为求职者应有权看到原始片段、证据摘要,还是完整模型逻辑?

关注「蜗牛聊AI」,一起看懂技术变化背后的真正机会。


本文首发于 java4u.cn,转载请注明出处。