AI面试85%一致性背后:它测的到底是不是能力?厂商常说AI评分与人类评分一致性达 85%。这个数字有三个陷阱:它取决于参照的那批人类评分者有多可靠;它通常在厂商自己的数据集上算出来;而训练有素的人类评分者之间的一致性本身就在 0.6 到 0.8 之间。结构化面试的效度来自结构,不来自AI,AI只是让结构可以被强制执行。
结构才是效度的来源,不是AI
Schmidt 与 Hunter 在 1998 年发表的元分析,至今仍是人员选拔方法里被引用最多的研究。它给出的数字是:结构化面试的预测效度约 .51,非结构化面试约 .38。
Huffcutt 与 Arthur(1994)在入门级岗位上复核得到的效标关联效度落在 .20 到 .37 区间。Campion、Palmer 与 Campion(1997)则从另一个角度切入:结构化格式的评分者间信度在 .60 到 .80,而非结构化的对话只有 .20 到 .40。
三组数字指向同一件事。效度差距的来源是结构,不是评估者是人是机器。
Campion 的15个结构要素,AI能强制执行,人很难
Campion 等人在 1997 年梳理出让一场面试「结构化」的 15 个要素,包括每位候选人问同样的问题、题目与工作分析绑定、使用一致的评分锚点、限制临场追问、采用小组或锚定评分格式等。
在真实组织里同时维持这 15 个要素,需要密集的面试官培训、校准会议和持续监督。绝大多数组织能做到其中几个就不错了。
异步视频面试平台是按设计强制执行这些要素的:每个候选人收到同样的问题,顺序一致,没有临场发挥的空间,评分对着同一套量规。这是它能提高一致性的机制,也是它效度主张的正当来源。
拆开信号层:四层信号的效度递减,偏见风险递增
一个AI面试平台从录像里提取的信号大致分四类,它们的效度与风险完全不同。
语言内容,即候选人说了什么。用自然语言处理对照结构化量规打分。这是最可辩护的一层,前提是量规经过工作分析且由用人经理签字认可,这样你有一条可追溯的文档链。
副语言特征,即语气、语速、停顿模式、填充词密度。这一层的效度叙事弱得多,而且偏见与无障碍风险集中在这里:口音、言语障碍、第二语言英语、神经多样性的沟通风格,都会把这些特征推向与工作绩效无关的方向。
视觉特征,即面部表情、眼神接触、头部动作。HireVue 在 2021 年公开停用了面部表情分析,这是个行业分水岭。到 2026 年,如果一家供应商还在用面部表情给「热情」或「可信度」这类特质打分,那是一个明确的危险信号。
结构化量规输出,即把上述信号映射到一份人类面试官也会用的量规上。输出通常是逐项能力分,带置信区间和从转录里摘出的理由片段。
「85%与人类一致」这个数字的三个陷阱
厂商材料里那个 85%,通常指AI与一组人类评分者对着同一场面试、同一份量规打分时的一致性,用相关系数或 Cohen's kappa 之类的指标算。
第一个陷阱:这个数字的意义取决于参照的那批人类有多可靠。如果人类评分者本身没经过训练、量规用得不一致,AI就是在对着噪声做基准。学术研究中训练有素的人类评分者之间的一致性一般在 0.6 到 0.8 之间,一个AI打到 0.7 是持平,不是超越。
第二个陷阱:这个基准通常在厂商自己的数据集、自己的量规、自己的条件下计算。换个岗位族,数字未必站得住。
第三个陷阱最容易被忽略:一个对着未受训练的人类评分者打到 0.85 的AI,可能只是非常高效地复现了他们的偏见。一致性高不等于效度高。
AI评分的效标关联效度落在哪个区间
厂商引述的研究显示,AI评分的异步结构化视频面试效标关联效度约在 .24 左右,落在 Huffcutt 与 Arthur 元分析给出的 .20 到 .37 区间内,同时相比人工评分的非结构化面试具有更低的不利影响。
需要说明的是,这个数字来自厂商公开材料,应把它当作需要独立复核的主张,而不是既成结论。它的意义在于定位:AI评分的结构化面试处在结构化面试效度区间的偏低段位,换来的是一致性大幅提升。
这是一笔交易,不是一次升级。用一致性换效度上限,在高量级岗位上划算,在复杂岗位上未必。
采购时该问的三个问题
第一,哪几层信号进入最终分数,各自的权重是多少。一个 90% 由转录驱动、10% 由副语言参与度信号构成的评分,是可辩护的姿态;一个重度依赖副语言或视觉特征的评分,卖给你的是负债而不是产品。
第二,量规是否经过工作分析,用人经理是否签字。这条决定了你在监管或诉讼里能不能拿出证据链。
第三,能否导出逐候选人的决策日志与评分理由。解释义务在雇主身上,供应商给不出日志,这个缺口要在合同里关掉。
事实与数据来源
- Schmidt 与 Hunter(1998)元分析:结构化面试预测效度 .51,非结构化 .38:Psychological Bulletin, 124(2)
- Huffcutt 与 Arthur(1994):入门级岗位结构化面试效标关联效度 .20 至 .37:Journal of Applied Psychology, 79(2)
- Campion、Palmer 与 Campion(1997):结构化格式评分者间信度 .60 至 .80,非结构化 .20 至 .40;提出结构化面试 15 个要素:Personnel Psychology, 50(3)
- HireVue 于 2021 年公开停用面部表情分析:HireVue 公开声明
- SIOP(2018)人员选拔程序验证与使用原则:选拔工具应增强而非取代专业判断:Society for Industrial and Organizational Psychology, 第 5 版
- AI评分异步结构化视频面试效标关联效度约 .24,来自厂商公开材料引述,需独立复核:异步视频面试平台公开研究引述
- 副语言特征对口音、言语障碍、第二语言及神经多样性沟通风格存在系统性偏见风险:AI面试评分研究与无障碍实践综述