
当越来越多的企业把简历筛选交给大语言模型,一个问题反复被追问:AI 到底能不能比人更公平?上个月,发表在《自然·人类行为》上的一项新研究给出了一个令人警惕的答案:目前的大语言模型在招聘场景中,不仅不是偏见的解药,反而比人类更容易形成刻板印象——尤其是在掌握的简历数据很少的时候。
“刷简历”的AI,偏见从何而来?
这项由芝加哥大学和纽约大学的研究人员共同完成的研究,模拟了真实的简历初筛流程。他们让多个主流大语言模型根据历史录用数据来评估候选人,并刻意在数据中植入微弱的性别与种族关联信号,例如“优秀员工更容易出现在某个性别群体中”。结果显示,当可供学习的简历数量较少时,AI 模型几乎无一例外地会放大这些微弱的关联,形成比原始数据更强的偏见;而人类招聘者在面对同样稀少的数据时,反而会保持更多谨慎,不那么容易陷入“以小样本推全貌”的陷阱。
换句话说,人类在信息不足时会声明自己“还需要看更多”,而 AI 却倾向于“快速下结论”——模型把自己在少量数据中捕捉到的模式,当成普遍规律来使用。这种“统计性歧视”一旦写进算法推荐,就可能让一些群体的候选人在没有真正被了解之前就被系统剔除。
“数据稀缺”才是现实,偏见加速器就藏在效率里
研究还发现,当训练样本增大到一定量级以上时,AI 的偏见程度会下降,甚至低于人类。这个结论看似让人松了一口气,但问题在于,企业真实的招聘场景很少具备“海量同质简历”的条件。尤其对于中小规模公司、垂直领域的岗位,或是在新兴市场开展业务的组织,能提供给模型学习的高质量人岗匹配样本通常十分有限。而恰恰是这些场景,反而最容易被 AI 招聘工具的“低成本、高效率”叙事打动,结果却引入了比人工筛选更大的不公风险。
另一个容易被忽视的角度是,即便样本充足,历史数据本身也往往是“已被污染”的——过往的简历筛选和录用结果中,本就包含了行业结构性的性别、学历、地域等偏见。AI 只不过是把这些偏见于无声处继承下来,然后把它们变成自动化、规模化的决策流水线。
中国企业的AI招聘实验,踩到了同一块石头
国内对 AI 面试、AI 初筛的尝试并不比海外慢。过去两年,部分大型企业已经将简历解析、人才画像和智能推荐系统投入实际的招聘流程,但争议也随之而来。去年就有求职者发现,自己在某平台的简历通过率远低于同资历的朋友,原因仅是毕业院校在训练模型时被给予过低的权重。更隐蔽的是,一些 AI 面试系统会通过微表情、语音语调等线索判别候选人,而这些特征与工作能力之间的实质性关联至今缺乏充分的验证。
研究提醒我们,在算法公正性没有得到严格检验之前,轻信“AI=客观”是不负责任的。尤其是在远程办公、灵活用工日益普及的背景下,简历数据维度更多、候选人的背景更复杂,简单的模式识别更容易掉进过拟合和偏见的坑。对于像小蜜蜂云工作这样连接企业与全球远程人才的平台而言,如果引入 AI 来提升匹配效率,也必须同步建立样本规模与偏见检测的底线标准,否则技术越快,信任流失也就越快。
别把“校准偏见”的责任完全甩给技术
论文作者强调,真正决定 AI 招聘是否公平的,不是模型结构本身,而是人类如何设计数据闭环、如何设定评估指标、如何定义“理想候选人”。目前一些 AI 招聘产品把“预测录用概率”作为唯一的核心目标,却忽视了“不同群体之间的预测准确率是否一致”这一类公平性约束。解决之道不在于彻底弃用 AI,而在于给算法加装“偏见刹车”:定期进行公平性审计,明确要求模型在性别、年龄、地域等维度上达到均衡表现,并允许候选人知道自己被 AI 评价的逻辑,保留人工复核的入口。
在一个越来越依赖数据决策的时代,招聘领域的 AI 偏见事件很可能只是序曲。当算法开始主导谁能获得工作机会、谁被淘汰,技术就不再是工具,而成为社会流动的闸门。今天的每一次“小样本偏见”,都有可能在未来凝结成更大的就业不公。
本文由小蜜蜂云工作原创发布,话题参考自行业公开报道。

点赞 0
收藏
复制文本链接


沪公网安备 31011702008840号
电子营业执照







