招聘中的算法单一文化
Algorithmic Monocultures in Hiring
论文信息
标题: Algorithmic Monocultures in Hiring
作者: Rishi Bommasani, Sarah H. Bana, Kathleen A. Creel, et al.
发布日期: 2026-05-26
arXiv ID: 2605.27371v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题: 当多家雇主使用同一家算法供应商筛选求职者时,是否会导致同一类群体反复遭受不利影响,以及同一批个体被系统性拒绝?
- 核心方法: 获取并分析招聘算法供应商 pymetrics 提供的真实数据集(约 400 万份申请),按职位拆解影响比率、测算系统性拒绝率,并利用算法的确定性可重复性进行反事实模拟。
- 关键结果: 在按职位拆解后,10.62% 的职位对黑人求职者产生就业歧视标准下的 “不利影响”,而 30.70% 的黑人求职者至少申请了一个存在此类不利影响的职位。
- 主要局限: 数据仅来自单一供应商(pymetrics),且研究者无法获取求职者真实资质、模型效度证据以及下游雇主的最终录用决策信息。
- 适合读者: 从事算法公平、劳动经济学、人工智能治理与合规审计的研究者,以及关注招聘科技政策的企业人力资源管理者。
论文背景和研究动机
超过 90% 的美国雇主使用招聘算法来筛选或排序求职者。这些算法决定哪些简历能进入面试环节,哪些申请永远不会被人类看到——它们构成数亿劳动者获取机会的 “瓶颈”。许多雇主从少数几家第三方供应商采购招聘算法,例如截至 2023 年 5 月,超过 60% 的财富 100 强公司以及美国十个最大联邦机构中的八个都在使用 HireVue 的算法。
论文作者将这种 “许多决策者依赖相同或相似算法” 的状态定义为 “算法单一文化”(algorithmic monoculture)。在这一背景下,他们提出核心假设:招聘中的算法单一文化会导致同质化结果——同一群体的申请者反复遭遇不利影响,而同一批个体可能无论申请多少家雇主都会被不断拒绝(系统性拒绝)。
虽然先前已有理论研究指出单一文化可能妨害社会福利,但缺乏来自真实招聘市场的实证证据。此前的单雇主研究无法观察同一求职者跨雇主的结果,而传统的简历对应研究(correspondence study)又无法捕捉底层算法决策过程。本文利用 pymetrics 平台的数据,首次实现了对同一求职者跨多个雇主的真实算法筛选结果的观察。
核心方法和技术细节
数据来源与处理
论文获取了算法供应商 pymetrics 在 2018 年 12 月至 2022 年 12 月间的完整申请记录,共计 4,197,168 份申请,来自 3,372,132 名求职者,涉及 1,746 个职位和 156 家雇主。这些雇主年收入累计超过 2250 亿美元,覆盖金融、制造、仓储等 11 个行业。pymetrics 通过 12 或 16 款在线游戏测评求职者的认知特质(如风险倾向、处理速度、信任感等),并利用机器学习模型为每位求职者输出 0 到 1 的连续性得分,再以 0.5 为阈值二值化为 “推荐” 或 “不推荐”。
不利影响分析
美国平等就业机会委员会(EEOC)的 “五分之四规则” 通常以整体选择率计算影响比率。但 pymetrics 的算法为数十家雇主服务,将全部申请数据聚合会掩盖职位层面的差异。论文指出,EEOC 的指引本身是针对单一雇主、按职位区分来判定歧视的。因此,研究者将 1,746 个职位逐一拆解,分别计算每个职位上不同种族群体(亚洲人、黑人、西裔、白人)的选择率,并依据影响比率(impact ratio)小于 0.8 且统计显著的双重标准识别 “不利影响”。为了避免多重检验的假阳性,同时报告了经 Benjamini-Hochberg 校正后的结果。
系统性拒绝与反事实模拟
系统性拒绝的衡量方法是:统计申请了 个职位的求职者中,有多少人被所有 个模型 “不推荐”。同时引入 “独立性基线”:假设职位间决策完全独立,仅根据各职位的边际拒绝率计算理论上应出现的系统性拒绝率。论文将此基线应用于 pymetrics 数据以及 Kline 等人(2022)对 108 家美国企业简历筛选研究的数据,以验证算法单一文化是否导致了高于独立预期的结果相关性。
更进一步,研究者利用算法的确定性(相同输入产生相同输出)和计算效率生成了大规模反事实结果:随机抽取 1000 名求职者,将其游戏特征输入全部 495 个 pymetrics 模型,模拟出 “若他们申请所有职位会得到什么结果” 的完整矩阵。在此基础上,定义求职者的 “关联模型集合”(即求职者实际申请的模型以及共享过其他求职者的模型),从该集合中随机抽样 个模型来测算在更现实但更广泛的申请行为下,需要申请多少职位才能将系统性拒绝率降至 0.1% 以下。
创新点和贡献
本文是首次在真实部署环境中观察到跨雇主算法筛选结果的实证研究。其创新之处体现在三个层面:
方法创新: 利用了算法决策的确定性可重复性和高效性,实现了对一个传统社会科学方法无法实现的反事实问题的回答——“如果求职者申请了所有由同一供应商评估的职位,他们会被所有模型拒绝吗?” 这种模拟方法只有在算法系统中才具备可行性和完整性。
概念推进: 将 “算法单一文化” 从理论模型的假设推进到可测量的实证现象,并明确了聚合分析与按职位拆解分析的差异对公平度量的实质性影响。论文发现,pymetrics 先前发布的整体性分析并未显示出不良影响,但按职位拆解后,超过 10% 的职位对黑人求职者展现出符合美国就业歧视标准的不利影响(见表 2)。这是同一套数据在采用不同分析粒度时得出截然不同的政策意涵的鲜明例子。
对比基线验证: 将观察到的高于基线水平的系统性拒绝与 Kline 等人(2022)的全国性简历实验数据进行对照,发现传统(主要是人工或分散算法)的筛选过程中,拒绝率几乎完美遵循独立性基线(,见图 3),而算法单一文化下的系统性拒绝率显著高于基线(,见图 2a)。这表明超越独立性的结果相关性是集中化算法评估体系特有的现象。
实验结果分析
种族间不利影响
按职位拆解后,17.6% 的职位对黑人求职者展现出不良影响(未经多重比较校正),经过 Benjamini-Hochberg 校正后仍有 10.62%(见表 2)。30.70% 的黑人求职者至少申请了其中一个存在不良影响的职位,涉及 25.87% 由黑人求职者提交的申请。在亚洲求职者中,5.32% 的职位存在不良影响,影响了 18.53% 的亚洲求职者。如果申请这些职位的群体能以最高被选种族的选择率获得推荐,黑人求职者将额外获得 11,513 个推荐,亚洲求职者额外获得 29,320 个。
这些结果在职业类别上表现出差异:建筑与工程类岗位上,黑人和亚洲申请者的总体影响比率均已低于 0.8,而在管理、商业和财务、计算机等职位上,虽然整体比率较高,但个别职位的不良影响依然存在。
系统性拒绝与同质化
在所有申请了 10 个职位的求职者中,有 4% 被所有 10 个职位拒绝,这一比率高于按独立决策所预期的水平。随着申请职位数增加,系统性拒绝率呈指数衰减(),但其衰减速度慢于独立基线所预测的速度,表明模型间的相关性使得一部分求职者 “被算法拉黑”。即便存在完全的算法单一文化(不同雇主使用完全相同的模型),其直接影响在数据集中有限,因为很少有求职者恰好申请那些共享同一模型的雇主岗位。更普遍的是 “部分算法单一文化”:不同模型虽然在训练数据和目标职位上有差异,但它们基于同一组游戏特征进行评分,导致对同一求职者的评价高度相关。
反事实模拟显示,没有任何一个求职者会被所有 pymetrics 模型拒绝,这表明实际中的系统性拒绝部分源自求职者狭窄的申请范围。但在将申请范围扩大至关联模型集合后,仍需申请 25 个不同的模型(对比独立基线下的 10 个),才能将系统性拒绝率降至 0.1% 以下。注意,这仅仅是获得 “推荐” 以进入人工筛选池的概率,离最终获得面试或录用还有很长的距离。
实践建议
基于本文的发现,政策制定者、监管机构和采购招聘算法的雇主可从以下几个方向入手:
按职位层面审计算法公平性。 纽约市 2021 年颁布的《144 号地方法律》要求对招聘算法进行偏见审计,但其示例计算中采用了聚合数据,可能掩盖职位层面的不利影响。审计者应当要求供应商提供并按职位拆解的分离数据,并且至少采用本论文中的统计检验方法(包含多重比较校正)来判断是否存在系统性歧视风险。
强化劳动力市场层面的监测。 EEOC 目前通过 EEO-1 报告收集企业员工的人口统计数据,但这是聚合且匿名的,无法追踪同一求职者跨雇主的结果。可以考虑扩展当前人口调查(CPS)等现有调查体系,加入求职长度和招聘算法中介的问项,或者授予监管机构访问招聘算法供应商中央数据集的权限,用以评估算法单一文化带来的系统性排斥程度。
监控算法供应商的市场集中度和互相关联性。 监管机构不应仅关注单一供应商的市场份额,还应考察不同供应商之间由于共享训练数据、基础模型或评估范式导致的结果相关性。市场支配地位的扩大不仅可能减少雇主间的竞争,也可能通过算法单一文化系统性降低某些群体的劳动力市场参与机会。
为独立研究者开放数据访问通路。 pymetrics 主动提供数据的做法是少数例外。大多数招聘算法供应商并未向外部研究者开放其决策数据。考虑到招聘算法对社会机会分配的深远影响,可参照欧盟《数字服务法案》对大型在线平台的数据开放要求,立法确定类似的研究者数据访问义务,从而推动持续、独立的算法问责研究。