AI简历初筛实操:怎么搭一套不误杀人的筛子?搭一套不误杀的初筛,关键是三件事:把AI的输出从「总分」改成「证据加原文加不确定项」;用三层筛法把决策权分层(淘汰项、证据打分、人工复核带);每周固定抽取被拒样本做人工回评来测量误杀率。此外要认清合规边界:扫描简历库不算自动化决策工具,但排序打分算。

不要问AI「这个人合适吗」

让AI给一个总分,看起来效率最高,实际上有三个问题:

  • 分数不可解释。85分和82分的差距在哪,你不知道。候选人问起来你也答不上。
  • 分数不可比。不同岗位的评分尺度不一样,跨岗位横向比较没有意义,但系统往往会诱导你这么做。
  • 不确定性被藏进了分数。一份信息不全的简历和一份信息充分的简历,AI可能给出同样自信的分数。

正确的提问方式换一下:这份简历里,有没有 X 的具体证据。

区别在哪:前者是让AI做判断,后者是让AI找证据。判断留给人。这个区别决定了后面出问题的时候,你能不能追溯。

三层筛法:把决策权切开

做什么AI的角色人的角色
第一层 淘汰项不满足法定或业务硬性前提的直接排除执行定义条目,并逐条说明理由
第二层 证据打分对每个评估维度找简历中的证据提取证据与原文判断证据是否成立
第三层 人工复核带分数落在中间区间的全部人工看不参与全部

两个关键设计:

  • 第一层的条目要少。每加一条淘汰项,都在扩大那片你看不见的损失。写之前先问:不满足这条的人,有没有可能干好这活。
  • 第三层的区间宽度是管理决策。带宽越宽,人看得多,误杀少但成本高。建议从「中段30%」起步,再按实测误杀率调。

提示词:只要证据,不要结论

你是招聘助理,负责从简历中提取证据,不做录用判断。

【岗位要求】
(只贴硬门槛和评分维度,不要贴整份JD)

【简历】
(粘贴简历文本)

对每个维度,按下面格式输出:
- 维度名:
- 简历中的依据:(原文引用,不要改写;没有就写「未提及」)
- 证据强度:强 / 弱 / 未提及
- 需要人工确认的点:(如果有)

约束:
1. 不要给出总分、排名,也不要给出「是否建议进入面试」的结论。
2. 不要用简历里没有的信息做推断。
3. 如果简历中的表述与岗位要求的用词不同,但很可能指向同一件事,明确指出并说明理由,不要直接判为不匹配。
4. 如果简历存在解析异常(时间线断裂、字段缺失、排版导致的信息错位),标记为「需人工确认」,不要按缺失处理。

第3条约束是整段提示词里最重要的。它专门针对下一节要讲的词汇错配。

第4条是针对解析失败的防御。简历解析出问题的时候,系统默认的表现是「这个人没有相关经验」,而不是「我看不清」。这两者对候选人的结果一样,但后者你还有机会补救。

词汇错配:误杀的主要来源

机制很简单:同一件事在不同公司有不同叫法。项目管理、项目交付、项目集管理,指的可能就是同一类工作。基于关键词匹配的系统会把它当成三件事,然后判其中两件为不匹配。

哈佛商学院 Fuller 团队的研究里有一个典型例子:退伍军人被系统性过滤,原因是他们的技能描述方式与雇主搜索的关键词不匹配,而不是能力不匹配。同一份研究指出,美国约半数公司的筛选规则会排除简历有6个月以上空档的人。

两类误杀要分开处理:

  • 词汇错配:做过,但用的词不一样。防御靠同义词表和提示词里的显式要求。
  • 路径错配:能力够,但路径不是标准路径。非科班、转行、自学、职业中断后回归。这一类比词汇错配更难发现,因为它不会触发任何「用词不同」的信号。

防御动作有三个,按成本从低到高:

  • 在提示词里显式要求AI报告「用词不同但很可能指向同一件事」的情况,这一步零成本。
  • 按岗位维护同义词表,每次发现误杀就补一条。
  • 把误杀样本定期回流,检查是不是同一类背景的人反复被过滤。这一步能发现系统性偏差,而不只是个别案例。

误杀率怎么测:固定比例抽样回评

具体动作,四步:

  • 每周从被AI拒绝的简历里随机抽10%,样本量不少于20份。少于20份的统计说明不了任何问题。
  • 由不参与初筛的人独立看一遍,通常是招聘经理或另一位招聘官,判断「该不该进入面试」。
  • 计算:认为该进但被AI拒绝的条数 ÷ 抽样总数,得到误杀率。
  • 每个误杀样本都要归因,四选一:词汇错配、路径错配、维度定义有问题、AI误读。

误杀率的目标定在多少,是管理决策不是技术常数,取决于这个岗位的人才稀缺程度和你的招聘产能。但有两条纪律不能破:

  • 上线后前三个月必须每周测。不能只在「感觉最近候选人质量不对」的时候才测,那时候你已经损失了三个月的人。
  • 误杀率上升时先查维度定义,不要急着调AI。多数情况下问题出在你给的标准本身,不在模型。

合规边界:什么算自动化决策工具,什么不算

纽约市2021年第144号地方法(Local Law 144)的官方常见问题解答,给了一条对实操非常有用的分界线。

不属于(不需要偏见审计和通知):

  • 用工具扫描简历库
  • 向潜在候选人做外呼
  • 邀请他人申请

属于(需要年度独立偏见审计,并提前通知候选人):

  • 用工具评估或筛选候选人,包括用简历筛选软件决定谁进入面试

判断「实质性协助或替代人工判断」的三种情形,满足其一即落入范围:工具输出是决策的唯一依据;工具输出的权重高于其他任何因素;工具被用来推翻人工已经做出的判断。

这一条对实操的意义很直接:很多团队以为「最后人看一眼就不算自动化决策」,但如果AI排序在最终决策里的权重最高,仍然落在监管范围内。人在环路里(human in the loop)不等于人在做决策。

另外三个执行细节:

  • 偏见审计必须由独立审计方执行,不能是使用或开发该工具的主体。
  • 审计有效期一年,到期要重做。
  • 需提前10个工作日通知候选人(适用于纽约市居民)。

上线节奏:前八周怎么跑

  • 第1至4周:AI只做标注,不做决策。人做全部判断,系统记录AI与人的每一次分歧。
  • 第5至8周:AI只过滤第一层的淘汰项,其余全部给人。
  • 第9周起:按实测误杀率决定是否扩大AI的过滤范围。

前四周的分歧记录是这套方法里最值钱的资产。它直接告诉你AI在哪些维度上跟你不一致,而这些维度就是后面需要重点校准的地方。跳过这一步直接全量上线,等于放弃了唯一一次低成本了解系统行为的机会。

事实与数据来源

  • 自动化决策工具的适用边界:纽约市消费者与劳动者保护局(DCWP),Local Law 144 of 2021 官方常见问题解答:扫描简历库、向潜在候选人外呼、邀请他人申请不属于需要审计的用途;用于评估或筛选候选人则属于。审计须由独立审计方执行、有效期一年、需提前10个工作日通知。「实质性协助」的三种情形:输出为唯一依据、权重高于其他因素、用于推翻人工判断
  • 词汇错配与路径错配造成的系统性过滤:Fuller, J. B. 等,《Hidden Workers: Untapped Talent》(哈佛商学院与 Accenture,2021):退伍军人因技能描述方式与雇主关键词不匹配被系统性过滤;约半数美国公司设置排除简历空档超6个月者的规则
  • 三层筛法、抽样比例、上线节奏:本文作者基于招聘实践的整理,抽样比例与上线节奏为操作建议而非实证结论