AI招聘为何比人类更容易产生偏见
研究显示,AI在招聘中比人类更易产生偏见,不仅继承数据偏见,还会在决策中自我形成新刻板印象。模拟实验中,模型根据有限经验将族群与职业绑定,且推理能力越强偏见越明显。将公平纳入目标函数或提供更多相关个人信息可减轻偏见,需警惕AI创造新偏见。

(来源:麻省理工科技评论)
以后找工作时,你的简历很可能还没到招聘经理手里,就已经先被AI筛过一遍了。问题是,它真的会公平吗?
研究人员早就发现,大语言模型会从训练数据里继承人类社会已有的偏见。但一项最新研究揭示了一个更棘手的问题:AI不仅会学习偏见,还会在不断做决策的过程中,自己形成新的刻板印象——而且这种倾向甚至比人类更强。
更值得警惕的是,AI公司如今都在努力打造拥有长期记忆的智能体,希望模型能够记住用户越来越多的细节。而这些记忆,也可能成为模型滋生偏见的土壤。
为了研究这一点,普林斯顿大学和芝加哥大学的研究人员设计了一场模拟招聘实验,参与者包括ChatGPT、Claude、Gemini等多个主流大语言模型。
实验改编自一项经典心理学研究。研究人员告诉模型,它们受雇于一位虚构城市的市长,担任招聘顾问,需要帮助政府为医生、律师、托育员、保洁员等20种职业招聘员工。所有候选人都来自四个虚构族群:Tufa、Aima、Reku和Weki。
每一轮,模型都会面对一个新的岗位,以及四位分别来自不同族群的候选人。完成招聘后,它会立刻得到反馈:这个人是否胜任工作。随后进入下一轮。整个实验一共持续40轮,模型的目标只有一个:尽可能招到更多合适的人。模型不知道的是,研究人员其实做了一个手脚:无论来自哪个族群,每位候选人在任何岗位上的成功概率都完全一样。
按理说,模型不应该偏向任何一个群体。但结果恰恰相反。仅仅经过几轮招聘,模型就开始根据有限的经验,把不同族群和不同职业绑定在一起。举个例子,如果模型早期碰巧遇到一位Aima族候选人担任医生失败,它之后便会越来越少招聘Aima人做医生,而是更倾向于把他们安排到保洁岗位。因为在模型看来,医生代表着更高的能力和亲和力,而保洁员对应的要求则更低。
换句话说,它开始把一次偶然的经历,当成了整个群体的特征。更让人意外的是,这种倾向甚至比真人严重。研究人员使用了一项“职业隔离指数”来衡量刻板印象的程度。指数越高,说明不同族群越容易被固定到特定职业中;2分代表完全隔离。此前心理学实验中的真人平均得分为0.84,而大语言模型整体高出了约65%。其中,OpenAI的推理模型o3得到了1.83,非常接近理论最高值。
论文共同作者、普林斯顿大学博士生Ryan Liu认为,这其实并不奇怪。“大语言模型本来就特别擅长根据有限的信息快速总结规律,”他说,“这几乎就是它们被训练出来要做的事情。”
在人类心理学中,这种现象对应着经典的“探索—利用困境”(exploration-exploitation dilemma):是继续选择过去证明有效的方法,还是尝试新的可能?就像出去吃饭时,你会纠结是去一家没吃过的新店,还是继续光顾那家不会踩雷的老餐馆。
对于大语言模型来说,这种取舍往往更加偏向后者。因为它们长期接受数学、编程和科学任务训练,而这些任务通常鼓励模型从少量例子中快速归纳规律,所以它们很容易过早下结论。也正因为如此,那些推理能力更强的新模型——例如OpenAI的o3和DeepSeek的R1——在实验中反而表现出了更明显的偏见。Liu说,“当这种快速归纳的能力被带入社会场景时,问题就开始出现了。”
康奈尔大学计算机科学家Angelina Wang没有直接参与这项研究,但她认为,这项工作来得正是时候。如今,各家公司都在为聊天机器人加入长期记忆和个性化能力。当模型越来越依赖于用户过去的互动记录时,它也可能越来越容易根据这些有限经验形成判断。她说,“它可能会过度依赖自己过去遇到过的行为模式。”
当然,解决办法并不是让AI什么都记不住。毕竟,大多数用户都希望聊天机器人能够记住自己说过的话。真正困难的是找到那个平衡点:既保留足够的记忆提供个性化体验,又不至于让模型因为这些经验形成新的偏见。
研究人员还尝试了另一种办法,直接告诉模型:请公平一点。但并不奏效。Liu认为,这说明模型未必真的能够把“公平”这样的价值观落实到具体决策中;又或者,这种要求会被另一个更强的目标覆盖——尽可能提高招聘成功率。
但如果换一种方式,情况就不同了。研究人员告诉模型,如果能够实现更加多元化的招聘,它们还能获得额外奖励。模型的偏见随即大幅下降。这说明,与其不断强调公平,不如直接把公平写进模型的目标函数里,让社会价值真正成为模型优化的一部分。
研究人员还发现,当模型掌握更多真正与任务相关的个人信息时,偏见也会减轻。另一组实验中,模型需要帮助来自不同族群的人搬迁到加拿大不同城市。如果提供的是年龄、教育背景等与适应新城市能力相关的信息,模型就更倾向于依据这些个人特征做判断,而不是简单按照族群分类。但如果提供的是发色、纹身图案这类无关信息,模型很快又会重新回到按族群做决定的老路上。
至于现实中的AI招聘系统会不会出现同样的问题,目前还没有明确结论。实验中的模型每做完一次招聘,都能立刻知道结果;现实世界却不是这样。一家公司往往需要几个月甚至更长时间,才能判断一位员工是否真正适合岗位。不过,只要这些反馈持续积累,模型依然可能从有限的数据中过度总结经验,并把这些经验带到下一次招聘中。
随着越来越多企业开始使用大语言模型筛选简历、甚至参与面试,这项研究释放出的信号不容忽视。未来,AI不只是可能复制人类已有的偏见。它还可能在不断学习和决策的过程中,创造出一种从未有人教过它的新偏见。正如Liu所说:“这种新的偏见,可能会一直存在。”
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
同类文章
罗福莉入选新一届35岁以下科技创新35人中国区名单
2025年《麻省理工科技评论》“35岁以下科技创新35人”中国区名单在上海发布,罗福莉、姚顺宇等入选。罗福莉推动大模型从“能聊天”走向“能干活”,探索智能体演进;姚顺宇建立非厄米拓扑能带理论。本届AI+机器人领域入选者占四成。
美国科技巨头为AI投资年内裁员近14万人
美国科技巨头年内裁员近14万人,同时计划在AI基础设施上投入7250亿美元。裁员主要目的为AI投资腾出资金并纠正疫情期间过度招聘,市场对AI相关裁员反应负面,而AI初创公司正加速扩招,形成对比。
位AI Infra高管复盘WAIC:暴力美学触顶后求变?
WAIC2026上,AIInfra行业关注点从算力规模转向推理效率与Token产出。Agent驱动Token消耗激增,AI工厂与Token工厂成为关键载体。效率竞争取代规模竞赛,玩家分层加速,具备全栈优化能力的头部厂商优势凸显。
显卡厂商封仓引发涨价 玩家面临高价购买
显卡市场,恐怕又要迎来一波涨价潮了。过去两年,不少玩家咬咬牙买下的高价显卡,如今回头看,竟然成了抄底。但问题在于,硬件市场每一次涨价,最终买单的永远还是玩家。 业内消息显示,GDDR7显存价格出现了明显上涨,单颗2GB显存价格上涨接近20美元。按8GB显存规格计算,一张显卡的显存成本或将增加约542
OpenAI加入签署AI开源模型公开信,组织达35家
7月25日,微软、英伟达等25家美国公司联署公开信支持开放权重AI模型,随后签署方增至35家,新增包括OpenAI等。开放权重模型可下载、修改、运行,能扩大创新、强化竞争并降低风险,避免AI收益集中于少数巨头。
- 热门数据榜
相关攻略
2026-07-25 21:58
2026-07-25 21:58
2026-07-25 21:58
2026-07-25 21:58
2026-07-25 21:28
2026-07-25 21:27
2026-07-25 21:27
2026-07-25 21:27
热门教程
- 游戏攻略
- 安卓教程
- 苹果教程
- 电脑教程

