AI简历初筛实操:怎么搭一套不误杀人的筛子?搭一套不误杀的初筛,关键是三件事:把AI的输出从「总分」改成「证据加原文加不确定项」;用三层筛法把决策权分层(淘汰项、证据打分、人工复核带);每周固定抽取被拒样本做人工回评来测量误杀率。此外要认清合规边界:扫描简历库不算自动化决策工具,但排序打分算。
不要问AI「这个人合适吗」
让AI给一个总分,看起来效率最高,实际上有三个问题:
- 分数不可解释。85分和82分的差距在哪,你不知道。候选人问起来你也答不上。
- 分数不可比。不同岗位的评分尺度不一样,跨岗位横向比较没有意义,但系统往往会诱导你这么做。
- 不确定性被藏进了分数。一份信息不全的简历和一份信息充分的简历,AI可能给出同样自信的分数。
正确的提问方式换一下:这份简历里,有没有 X 的具体证据。
区别在哪:前者是让AI做判断,后者是让AI找证据。判断留给人。这个区别决定了后面出问题的时候,你能不能追溯。
三层筛法:把决策权切开
| 层 | 做什么 | AI的角色 | 人的角色 |
|---|---|---|---|
| 第一层 淘汰项 | 不满足法定或业务硬性前提的直接排除 | 执行 | 定义条目,并逐条说明理由 |
| 第二层 证据打分 | 对每个评估维度找简历中的证据 | 提取证据与原文 | 判断证据是否成立 |
| 第三层 人工复核带 | 分数落在中间区间的全部人工看 | 不参与 | 全部 |
两个关键设计:
- 第一层的条目要少。每加一条淘汰项,都在扩大那片你看不见的损失。写之前先问:不满足这条的人,有没有可能干好这活。
- 第三层的区间宽度是管理决策。带宽越宽,人看得多,误杀少但成本高。建议从「中段30%」起步,再按实测误杀率调。
提示词:只要证据,不要结论
你是招聘助理,负责从简历中提取证据,不做录用判断。
【岗位要求】
(只贴硬门槛和评分维度,不要贴整份JD)
【简历】
(粘贴简历文本)
对每个维度,按下面格式输出:
- 维度名:
- 简历中的依据:(原文引用,不要改写;没有就写「未提及」)
- 证据强度:强 / 弱 / 未提及
- 需要人工确认的点:(如果有)
约束:
1. 不要给出总分、排名,也不要给出「是否建议进入面试」的结论。
2. 不要用简历里没有的信息做推断。
3. 如果简历中的表述与岗位要求的用词不同,但很可能指向同一件事,明确指出并说明理由,不要直接判为不匹配。
4. 如果简历存在解析异常(时间线断裂、字段缺失、排版导致的信息错位),标记为「需人工确认」,不要按缺失处理。
第3条约束是整段提示词里最重要的。它专门针对下一节要讲的词汇错配。
第4条是针对解析失败的防御。简历解析出问题的时候,系统默认的表现是「这个人没有相关经验」,而不是「我看不清」。这两者对候选人的结果一样,但后者你还有机会补救。
词汇错配:误杀的主要来源
机制很简单:同一件事在不同公司有不同叫法。项目管理、项目交付、项目集管理,指的可能就是同一类工作。基于关键词匹配的系统会把它当成三件事,然后判其中两件为不匹配。
哈佛商学院 Fuller 团队的研究里有一个典型例子:退伍军人被系统性过滤,原因是他们的技能描述方式与雇主搜索的关键词不匹配,而不是能力不匹配。同一份研究指出,美国约半数公司的筛选规则会排除简历有6个月以上空档的人。
两类误杀要分开处理:
- 词汇错配:做过,但用的词不一样。防御靠同义词表和提示词里的显式要求。
- 路径错配:能力够,但路径不是标准路径。非科班、转行、自学、职业中断后回归。这一类比词汇错配更难发现,因为它不会触发任何「用词不同」的信号。
防御动作有三个,按成本从低到高:
- 在提示词里显式要求AI报告「用词不同但很可能指向同一件事」的情况,这一步零成本。
- 按岗位维护同义词表,每次发现误杀就补一条。
- 把误杀样本定期回流,检查是不是同一类背景的人反复被过滤。这一步能发现系统性偏差,而不只是个别案例。
误杀率怎么测:固定比例抽样回评
具体动作,四步:
- 每周从被AI拒绝的简历里随机抽10%,样本量不少于20份。少于20份的统计说明不了任何问题。
- 由不参与初筛的人独立看一遍,通常是招聘经理或另一位招聘官,判断「该不该进入面试」。
- 计算:认为该进但被AI拒绝的条数 ÷ 抽样总数,得到误杀率。
- 每个误杀样本都要归因,四选一:词汇错配、路径错配、维度定义有问题、AI误读。
误杀率的目标定在多少,是管理决策不是技术常数,取决于这个岗位的人才稀缺程度和你的招聘产能。但有两条纪律不能破:
- 上线后前三个月必须每周测。不能只在「感觉最近候选人质量不对」的时候才测,那时候你已经损失了三个月的人。
- 误杀率上升时先查维度定义,不要急着调AI。多数情况下问题出在你给的标准本身,不在模型。
合规边界:什么算自动化决策工具,什么不算
纽约市2021年第144号地方法(Local Law 144)的官方常见问题解答,给了一条对实操非常有用的分界线。
不属于(不需要偏见审计和通知):
- 用工具扫描简历库
- 向潜在候选人做外呼
- 邀请他人申请
属于(需要年度独立偏见审计,并提前通知候选人):
- 用工具评估或筛选候选人,包括用简历筛选软件决定谁进入面试
判断「实质性协助或替代人工判断」的三种情形,满足其一即落入范围:工具输出是决策的唯一依据;工具输出的权重高于其他任何因素;工具被用来推翻人工已经做出的判断。
这一条对实操的意义很直接:很多团队以为「最后人看一眼就不算自动化决策」,但如果AI排序在最终决策里的权重最高,仍然落在监管范围内。人在环路里(human in the loop)不等于人在做决策。
另外三个执行细节:
- 偏见审计必须由独立审计方执行,不能是使用或开发该工具的主体。
- 审计有效期一年,到期要重做。
- 需提前10个工作日通知候选人(适用于纽约市居民)。
上线节奏:前八周怎么跑
- 第1至4周:AI只做标注,不做决策。人做全部判断,系统记录AI与人的每一次分歧。
- 第5至8周:AI只过滤第一层的淘汰项,其余全部给人。
- 第9周起:按实测误杀率决定是否扩大AI的过滤范围。
前四周的分歧记录是这套方法里最值钱的资产。它直接告诉你AI在哪些维度上跟你不一致,而这些维度就是后面需要重点校准的地方。跳过这一步直接全量上线,等于放弃了唯一一次低成本了解系统行为的机会。
事实与数据来源
- 自动化决策工具的适用边界:纽约市消费者与劳动者保护局(DCWP),Local Law 144 of 2021 官方常见问题解答:扫描简历库、向潜在候选人外呼、邀请他人申请不属于需要审计的用途;用于评估或筛选候选人则属于。审计须由独立审计方执行、有效期一年、需提前10个工作日通知。「实质性协助」的三种情形:输出为唯一依据、权重高于其他因素、用于推翻人工判断
- 词汇错配与路径错配造成的系统性过滤:Fuller, J. B. 等,《Hidden Workers: Untapped Talent》(哈佛商学院与 Accenture,2021):退伍军人因技能描述方式与雇主关键词不匹配被系统性过滤;约半数美国公司设置排除简历空档超6个月者的规则
- 三层筛法、抽样比例、上线节奏:本文作者基于招聘实践的整理,抽样比例与上线节奏为操作建议而非实证结论