网易首页 > 网易号 > 正文 申请入驻

AI 也会"以貌取人" 而且比人还狠

0
分享至


来源:混沌巡洋舰

一项覆盖 GPT-4o、GPT-5、Gemini 3、Claude 4.5 的研究
揭示了语言模型最令人不安的一面

你看一眼陌生人的脸,大概三秒钟,脑子里就会冒出一个判断:
这个人靠不靠谱?能不能干?

科学家管这叫"面部特质推断"(face-based trait inference)。
它不准确,但人类就是这么干的——几十万年进化写进脑子里的本能。

问题来了:AI 会不会也干这事?

01 人类的老毛病,AI 也染上了

2026 年 8 月,PNAS Nexus 上线了一篇论文,标题直白得让人心里一紧:

"Like humans, language models demonstrate face-to-character biases" (和人类一样,语言模型表现出"面部长相—性格特征"偏见)

来自哈佛大学心理学系、卡内基梅隆大学语言技术研究所和 Cangrade 公司的三位研究者,干了件很硬核的事——

他们用13 项实验近 8000 次试验,测试了4 个主流大模型(GPT-4o、GPT-5、Gemini 3 Flash Preview、Claude Sonnet 4.5),就问一个问题:

主要靠文本训练出来的大语言模型,看到一张人脸照片的时候,会不会像人类一样,凭长相去判断一个人的性格?

答案让人不太舒服。


图 1.实验使用的示例面孔。左组(1a/1b)在人类感知的"可信度"上不同;右组(2a/2b)在"能力"上不同。你能一眼看出哪张更"靠谱"吗?AI 也能,而且它比你更确信。

02 不是"有点偏见",是系统性地偏

先看核心数据。GPT-4o 在所有 7 个核心实验中,74.88%的判断都偏向了"预期中的那张脸"——也就是人类评分认为更可信或更能干的那张。

优势比(Odds Ratio)达到2.981,P 值小于 0.0001。统计上铁板钉钉。

但这还不是最离谱的。

GPT-4o 判断"能力"时的选中率高达 87.83%。

作为对比,人类做同样任务时的预估选中率大约只有62.65%

换句话说——AI 比人类更"自信"地以貌取人,而且错得更理直气壮。

研究者还做了回归分析:面孔的形态变化(morph level)能解释 GPT 评分方差的81.01%。同样条件下,人类只有3.59%

这说明什么?GPT 的判断几乎完全被面部特征牵着走。人类好歹还会犹豫一下。


图 2.按可信度递增排列的 7 张变形面孔(脸 1 → 脸 7)。相邻面孔生理差异很小(比如脸 3 和脸 5 很难区分),但脸 1 和脸 7 差异明显。实验发现:面孔差异越大,AI 判断越果断;差异越小,AI 反而比人类更容易出错。

03 偏见还会"传染"——连猴子都不放过

如果只是判断"这人看起来挺能干",那还算温和。但研究发现,这种偏见会层层升级


第一层:从核心特质泛化到相关特质

实验让 GPT-4o 判断与"能力"语义相关的特征——自信(Confident)、聪明(Smart)、有领导力(Leader-like)等 6 项。结果?全部显著偏向。

可信度那边也一样:温暖(Warm)、乐于助人(Helpful)、友善(Friendly)……照单全收。

第二层:跨物种泛化

这是最魔幻的部分。

研究者拿了一组猴子的脸(来自耶鲁大学 Laurie Santos 实验室,人类已经给这些猴脸打过分,哪些"看起来nice"、哪些"看起来mean")。

GPT-4o 从来没在训练数据里见过这些猴子。但它依然选了那张"看起来 nicer"的猴脸——选中率 66%,显著高于随机。

一个主要靠文本训练的模型,把人类对"可信面相"的审美标准,迁移到了灵长类动物身上。

你品品这事儿。

第三层:极端决策

实验 6 直接上狠活:给 GPT-4o 看两张脸,问它哪张更像连环杀手、哪张更像人口贩子

结果:68.7%的次数,它把"低可信度"面孔归为了罪犯。

实验 7 更现实:哪张脸更适合当校长?哪张值得风险投资

75.19%的高影响职位推荐,都给了"高能力"面孔。

示意图.语言模型内化面部偏见的完整链条:训练语料中的人类偏见 → LLM 学习面部-性格关联 → 输入人脸图像 → 输出偏见判断 → 泛化至相关特征/跨物种/极端决策 → 渗透高风险场景。

04 越新的模型,越"以貌取人"

如果这是 GPT-4o 一个模型的毛病,那还好说——也许是个案。

但研究者把实验搬到了三个更新的模型上,结果更扎心:

GPT-5(能力判断)94.33%

GPT-5(高影响决策)97.04%

Gemini 3 Flash显著高于 GPT-4o

Claude Sonnet 4.5显著高于 GPT-4o

GPT-5 在实验 8 和 9 中的表现简直可以用"决绝"来形容——97% 的一致率,基本就是看到"能干脸"就一路绿灯。

有意思的是,这些模型在遇到种族和性别刻板印象时,通常会拒绝回答或者给出中立回应。说明目前的对齐训练(alignment training)是领域特定的——它教会了模型"不要歧视种族性别",但没教"不要以貌取人"。

一个漏洞堵上了,另一个还在漏。

05 这事为什么值得认真对待

你可能觉得:"不就是个 AI 看脸嘛,又不会真用它招人。"

但现实是,AI 正在越来越多地渗入筛选场景

  • 招聘初筛

    ——有些公司已经开始用 AI 分析求职者视频面试中的"面部特征"来判断性格匹配度

  • 信贷审批

    ——部分 fintech 产品尝试结合"面部可信度"评估违约风险

  • 安全筛查

    ——机场、边境、大型活动的智能监控系统中,"可疑面孔"的判定逻辑可能就藏着这种偏见

  • 法律辅助

    ——AI 辅助证据分析时,如果无意中把"长得不像好人"纳入考量呢?

这篇论文的意义就在这里:它不是在说"AI 有个小毛病",而是在说当前最先进的 AI 系统,在高风险决策场景中使用时,可能存在系统性的、未被察觉的公平性缺陷

论文的核心呼吁:

  1. 在高风险 AI 系统中排除人脸图像输入

  2. 发展域无关(domain-agnostic)的公平策略,而不是一个一个打补丁

  3. 面相偏见审计纳入 AI 红队测试(red-teaming)的标准流程

人类以貌取人,那是进化遗留的 cognitive shortcut(认知捷径)——不完美,但至少我们知道它在,也在努力克服。

AI 以貌取人,则是另一种性质的问题:它是在没有意识、没有反思能力的情况下,把我们社会中最隐蔽的偏见之一,学得比我们本人还彻底、还坚定。

然后把它装进一个个"智能决策系统"里,用来判断谁该拿到 offer、谁该被多看两眼。

这篇论文发在 PNAS Nexus 上,不是什么冷门期刊。它提醒我们:当我们在谈论 AI 安全和对齐的时候,不能只盯着那些显眼的雷区——种族、性别、暴力内容。那些藏在视觉感知深处的、看似无害的"直觉判断",可能才是更难缠的对手。

毕竟,连猴子都没逃过。

论文信息

Lehr SA, Lothe Y, Banaji MR. Like humans, language models demonstrate face-to-character biases.
PNAS Nexus. 2026;5(8):pgag247.
DOI: 10.1093/pnasnexus/pgag247

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
不必填海造岛了!菲律宾破船赖了27年,中国用300倍体量反将一军

不必填海造岛了!菲律宾破船赖了27年,中国用300倍体量反将一军

阿甘天天传
2026-09-05 04:17:03
国羽1胜2负!头号种子1-6逆风翻盘,进决赛争冠,王祉怡告负中国连丢2冠!

国羽1胜2负!头号种子1-6逆风翻盘,进决赛争冠,王祉怡告负中国连丢2冠!

刘姚尧的文字城堡
2026-09-05 15:21:00
马克龙携手妻子访英国!73岁布丽吉特换掉凌乱发型,梳马尾辫显嫩

马克龙携手妻子访英国!73岁布丽吉特换掉凌乱发型,梳马尾辫显嫩

八八尚语
2026-09-04 11:07:14
患癌前的聂卫平有多放纵?烟酒成瘾,曾一顿吃下13只螃蟹,还喝百万茅台

患癌前的聂卫平有多放纵?烟酒成瘾,曾一顿吃下13只螃蟹,还喝百万茅台

明月清风阁
2026-09-02 07:25:21
尊界“隔空关门”功能翻车?袁弘多次挥手车门没有反应,司机紧急救场:因为我挂档了

尊界“隔空关门”功能翻车?袁弘多次挥手车门没有反应,司机紧急救场:因为我挂档了

和讯网
2026-09-03 12:24:13
张雪回应包揽排位赛前两名:加鸡腿!老板我都那么卖力了 看你们的了

张雪回应包揽排位赛前两名:加鸡腿!老板我都那么卖力了 看你们的了

念洲
2026-09-05 14:43:01
新京报这则删除的新闻,太魔幻了

新京报这则删除的新闻,太魔幻了

林中木白
2026-09-04 17:54:32
25 岁女留学生赴韩领证遇害:警方认定师生恋,国内男友删号消失,罗生门背后谁在说谎?

25 岁女留学生赴韩领证遇害:警方认定师生恋,国内男友删号消失,罗生门背后谁在说谎?

老欧讲大案
2026-09-05 12:23:20
揭秘恩佐亿元身价:非顶级球星却极度全能,曼城买的是体系安全感

揭秘恩佐亿元身价:非顶级球星却极度全能,曼城买的是体系安全感

星耀国际足坛
2026-09-04 23:24:45
新进展!武大女教授被举报事件:其父目前已调任安大副校长,武大已介入调查,细节曝光

新进展!武大女教授被举报事件:其父目前已调任安大副校长,武大已介入调查,细节曝光

子非鱼人
2026-09-04 00:04:43
皇马球迷意难平!不止因为0-1惜败贝蒂斯,更多在于以下这五点!

皇马球迷意难平!不止因为0-1惜败贝蒂斯,更多在于以下这五点!

田先生篮球
2026-09-05 06:17:37
艾滋病有多严重?为什么越来越严重?

艾滋病有多严重?为什么越来越严重?

红色少女主播
2026-08-27 23:23:57
潘石屹362亿疯狂抄底

潘石屹362亿疯狂抄底

新浪财经
2026-09-03 10:30:19
大众正式调查星宇股份,金主爸爸亲自上门查账,星宇很慌。

大众正式调查星宇股份,金主爸爸亲自上门查账,星宇很慌。

辉哥说动漫
2026-09-04 13:59:27
大病最危险信号,不是消瘦,是吃饭时频繁出现4个表现,需要警觉

大病最危险信号,不是消瘦,是吃饭时频繁出现4个表现,需要警觉

熊猫医学社
2026-09-05 11:45:03
一男子肚子疼被诊断为“胃癌”切除整个胃,化验结果却显示没有癌细胞,法院判了!

一男子肚子疼被诊断为“胃癌”切除整个胃,化验结果却显示没有癌细胞,法院判了!

大风新闻
2026-09-04 19:14:05
拜登的国安顾问沙利文下台后曾公开承认,美国前众议长佩洛西2022年8月在位时窜访台湾,给台湾带来的代价远大于收益。

拜登的国安顾问沙利文下台后曾公开承认,美国前众议长佩洛西2022年8月在位时窜访台湾,给台湾带来的代价远大于收益。

回京历史梦
2026-09-04 09:12:32
1949年,解放军包围了蒋介石的祖坟,毛泽东强调粟裕:别动,务必保护好!

1949年,解放军包围了蒋介石的祖坟,毛泽东强调粟裕:别动,务必保护好!

谈古论今历史有道
2026-09-05 20:00:03
两届金球奖得主首秀,伦敦城市狮鹫2-1击败曼联

两届金球奖得主首秀,伦敦城市狮鹫2-1击败曼联

薛定谔的BUG
2026-09-05 20:49:07
非必要不做CT?医生强调:只要做过CT,患者一定多加关注这4点!

非必要不做CT?医生强调:只要做过CT,患者一定多加关注这4点!

叙说医疗健康
2026-06-16 08:00:21
2026-09-05 21:04:49
人工智能学家 incentive-icons
人工智能学家
人工智能领域权威媒体
5023文章数 37516关注度
往期回顾 全部

科技要闻

华为何庭波,再次更新韬定律论文

头条要闻

菲副总统莎拉最新发声:我会被杀 我不信任法院、警察

头条要闻

菲副总统莎拉最新发声:我会被杀 我不信任法院、警察

体育要闻

科比和勒布朗:冠军年份的背身

娱乐要闻

她曾被名导抛弃,凭《生逢其时》翻红

财经要闻

被曝试药后死亡,药企董事竟怒怼记者

汽车要闻

全新第四代博越Li‑HEV系列 怎么开都省

态度原创

家居
数码
游戏
教育
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

IFA石头科技放大招!地面、庭院、泳池清洁全面包揽

叛忍之战,IG五局战胜TES,送去冒泡赛!世界赛也不要想了吧

教育要闻

代际传递创伤:孩子叛逆是因为妈妈从来没被尊重过

军事要闻

俄罗斯建"粉碎大日本帝国"纪念碑 日本急了

无障碍浏览 进入关怀版