人工智能在招聘时比人类更有可能形成偏见

与原始研究中的人类参与者相比,这些模型更有可能按人口群体对人们进行刻板印象。在该研究的隔离量表中,2 意味着每个群体都完全局限于自己的工作领域,人类参与者得分为 0.84。这些模型的得分大约高出 65%,其中 OpenAI 的推理模型 o3 得分为 1.83,接近最高得分。

这是因为法学硕士“确实渴望从有限的数据中得出概括,”普林斯顿大学博士生、该研究的合著者 Ryan Liu 说,该研究于 7 月份在首尔 ICML 上发表了一篇论文。 “这确实是他们优化的很多内容。”每个决策者,无论是人还是机器,都面临着坚持以前有效的方法和尝试可能效果更好的新方法之间的权衡——心理学家将这种现象称为“探索-利用困境”。这就像在一家新餐厅和您最喜欢的可靠餐厅之间进行选择。

因为法学硕士接受过数学、编码和科学问题的培训,这些任务需要从几个例子中进行概括,所以他们可能会过早地依靠直觉。帮助法学硕士破解逻辑难题的本能也使他们能够快速形成刻板印象。在实验中,具有更高推理能力的新模型,例如 OpenAI 的 o3 和 DeepSeek 的 R1,表现出更强的偏差。当法学硕士急于在社交场合进行概括时,“那就是事情往往会出错的时候,”刘说。 OpenAI 和 Anthropic 没有回应置评请求。

康奈尔大学计算机科学家安吉丽娜·王 (Angelina Wang) 表示,由于聊天机器人的记忆力和个性化功能正在得到改善,这一发现尤其重要,她并未参与这项研究。她说,当聊天机器人利用之前的对话历史记录时,它可能“过度索引以前经历过的同类行为”并形成偏见。不过,仅仅让聊天机器人记住更少的内容并不能解决问题,因为用户希望聊天机器人记住他们所说的内容。 “我们仍在努力找出合适的数量,不能太多或太少,”王说。

告诉模型公平并没有太大改变其行为。 “要么无法将这些价值观付诸行动,要么该流程被试图优化以获得最正确员工的目标所淹没,”刘说。但向模型承诺为多元化招聘提供额外奖励,使他们的偏见大大减少。刘说,关键在于设计目标,“融入理想的社会价值观,以使大型语言模型以社会理想的方式行事”。

#人工智能在招聘时比人类更有可能形成偏见

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注