网易首页 > 网易号 > 正文 申请入驻

MIT牵头破题:AI能模拟社会,但谁来验证它?

0
分享至


新智元报道


下一周,人们对iPhone、特斯拉等品牌的搜索关注会如何变化?

AI能在数据公布之前,预测这些关键词之间的相对热度吗?


官网:https://socialsim.org/

GitHub:https://github.com/Social-Atoms/social-sim-arena

评测与接入文档:https://socialsim.org/docs.html

常见问题(FAQ):https://socialsim.org/faq.html

这是Social Simulation Arena(SSA)的一类真实评测任务,参赛系统需要提前预测五个指定关键词之间的搜索热度分布,封存答案,再由随后公布的数据检验。

这个具体问题背后,是一个更广泛的研究目标:社会模拟系统对人群行为的判断,能否经得起真实未来的检验?

模拟越来越逼真

验证跟上了吗?

社会模拟正在从学术研究走向商业应用。基于大语言模型的模拟系统,已被用于探索政策分析、公共卫生和计算社会科学等问题;Aaru、Simile等创业公司也在尝试构建虚拟人群,预演消费者、员工等群体在不同情境下的反应。

这类技术的吸引力在于:它有望帮助人们在采取现实行动之前,以更低的成本探索不同方案。而这一前景能否实现,取决于模拟对真实人群的刻画是否可靠。

目前,社会模拟的验证能力尚未跟上系统的发展速度。看似自然的对话、符合直觉的行为,以及接近真实数据的总体均值,都不足以证明系统准确刻画了人群差异与行为规律。

与此同时,不同研究采用各自的数据、任务和指标,使结果难以比较,能力上的进展也难以积累为可复核的共同认识。当这些系统开始参与商业或公共决策时,验证的缺位可能使看似可信的结果被赋予超出证据范围的信任。

因此,社会模拟需要在扩大规模、丰富交互之外,建立共享基准、开放数据和可复现的评测流程,明确系统在什么任务、什么人群和什么条件下有效。

随着模拟结果逐步成为现实决策的依据,一个基础问题也变得更加迫切:模拟结果在多大程度上能够反映真实人群,又应当通过怎样的共同标准接受检验?


SSA公开评测看板。左侧展示所选系统与基线的成绩随评测推进的变化,右侧列出得分及参评题目数量。Arena Score以沿用上一期结果的persistence基线为0分,以完全准确预测的理想Oracle为100分,负分表示低于基线。图中数据截至2026年9月24日。

SSA

让真实未来检验社会模拟

Social Simulation Arena(SSA)由MIT研究团队牵头发起,联合来自多所高校的研究者共同建设,旨在通过面向真实未来的公开评测,检验社会模拟系统的预测能力。

一轮评测如何连接社会模拟与真实世界

SSA的一轮评测分为三个阶段:开放提交(Open)、预测封存(Locked)和完成评分(Resolved)。题目提前公开,参与者在截止前提交预测;截止后,答案被固定,预测的哈希摘要汇入清单并提交OpenTimestamps,相关承诺通常在数小时后锚定至比特币区块链,形成可核验的时间证明;待第三方公布观测结果,平台按既定规则评分并公开记录。


SSA单轮评测流程。Open阶段接收并加密保存预测;Locked阶段固定有效提交并建立时间证明;观测结果公布、核验与评分完成后进入Resolved。具体时间安排与存证状态以各轮记录为准。

开放提交:提前出题,加密交卷。

题目通常在截止前一周公开,明确预测对象、目标人群、结果来源与评分规则。参与者按要求提交答案,并在概率预测任务中表达不确定性。提交后的预测通过Sealbox加密封存机制保存,其他参与者在提交窗口内无法查看预测明文。多数轮次在预定结果公布前48小时停止接收预测。

预测封存:固定答案,建立时间证明。

截止后,平台按规则解封并核验有效提交,将预测及冻结历史数据的哈希摘要写入清单,再提交OpenTimestamps。相关承诺通常在数小时后锚定至比特币区块链。

哈希相当于文件的数字指纹,能够帮助外部研究者检查公开内容是否与封存记录一致;时间证明则支持核验相应内容在所锚定区块形成之前已经存在。两者共同为预测的内容与存在时间提供可核验依据,具体证明范围以各轮记录为准。

完成评分:与现实对照,与基线比较。

观测结果公布并完成核验与评分后,题目进入Resolved状态,成绩更新至榜单。按照平台公布的安排,评分应在结果发布后六小时内完成。

Arena Score以两个参照点帮助读者理解成绩:0分对应persistence,即沿用上一期观测值的基线;100分对应预测损失为零的理想Oracle。正分表示优于persistence,负分表示低于这一基线。在数值预测任务中,SSA还提供线性趋势外推、指数加权移动平均(EWMA)和历史均值等统计对照,帮助研究者判断模型及其工作流提供了多少额外预测价值。

每轮结束后,预测、时间证明、观测结果与成绩共同形成可追溯记录。同一数据来源的下一次发布将对应一道新题,重新从Open开始,使评测随真实世界的变化持续进行。


Sealbox。 提交窗口内,参与者用私钥签名,平台核验后以age公钥加密,经GitHub App写入sealed分支;窗口内无人可读明文。封存时刻,持有age私钥的工作流解密并复核签名,将明文预测与哈希清单写入main分支,清单经OpenTimestamps锚定至比特币区块。此后任何人可用ots verify与哈希比对独立核验:预测在区块之前已存在,且此后未改动。

从总体趋势到群体差异

SSA测什么?

SSA关注的是现实中的人群及其持续变化的态度与行为。不同数据源按照各自的周期,重复测量特定人群的状态,为模拟结果提供可持续对照的观测依据。

当前任务从三个方面检验预测能力:总体指标如何变化、不同群体之间有何差异,以及人们的关注流向何处。各类任务采用相应的答题格式与评分规则。

整体数值:总体状态是否同步。

题目要求预测即将公布的总体读数,如密歇根大学消费者信心指数、纽约联储家庭通胀预期和AAII散户情绪差。

参与者提交带不确定性的分布,以CRPS评分,同时考察预测位置与不确定性表达。题目会写明目标人群(成年人、登记选民或家庭户主),因为同一机构对不同人群的读数可能相差数个百分点。

不同群体:差异结构是否正确。

群体画像题要求同时预测按年龄、族裔、性别、学历等划分的16个群体,以能量分数(CRPS的多维形式)整体评分,并拆分为整体水平与群体间结构两部分。模拟器无法依靠猜中总体数字、同时系统性地误判某些群体来取得好成绩;把所有人模拟成「平均选民」的系统,会在这类题上暴露出来。

集体关注:注意力流向何处。

这类题关注行为痕迹而非态度表达:下一周英文维基百科阅读量前十的条目及顺序,以及若干品牌在Google搜索中的关注份额。前者按排名重合度评分,后者按份额分布评分。


SSA已完成评测的题目示例。每张卡片对应同一统计序列的一次数据发布,展示模型预测、上一期观测值与本期公布结果(绿线),便于比较不同轮次的预测偏差,并追溯具体题目与数据来源。

与已有的预测评测有何不同?

FutureX、Prophet Arena与SSA都通过尚未揭晓的真实结果检验预测能力,但各自的评测重点有所不同。

FutureX面向广泛领域的未来预测,考察智能体的信息搜集、推理与预测能力;Prophet Arena以真实预测市场事件为主要任务来源,评估系统的概率预测,并与同期市场共识比较。

SSA更聚焦于持续存在、被反复观测的现实人群,通过预测其态度、行为及群体差异,检验社会模拟系统对目标人群的刻画是否可靠。当前评测从预测下一次观测结果入手,后续计划拓展至新问题外推、干预情境和跨问题一致性等任务,进一步检验人群建模在不同情境下的有效性。

面对真实未来,模型表现如何?

评测范围。

截至2026年9月24日,SSA已完成59轮真实评测,对应的数据发布日期覆盖8月14日至9月23日。

评测涵盖GPT、Claude、Gemini、Grok、Qwen、DeepSeek、Kimi和GLM等系列的16个底层模型,并比较它们与不同预测工作流(harness)的组合。

工作流主要在两个方面有所区别:一是信息输入,包括是否提供近期历史数据、固定新闻摘要或网络搜索结果;二是预测引导方式,包括直接作答,或按基准分析、因素拆解与预测失败反思等步骤形成预测。

简单基线仍是数值预测的重要参照。

在当前数值题榜单上,模型配置的平均相对得分仍低于沿用上一期结果的persistence基线。例如,Gemini3.1 Pro与Claude Sonnet 5的网络搜索配置均完成了43道数值题,Arena Score分别为−22.0和−23.6分。

这表明,在这些已完成的题目上,模型及其工作流尚未取得正的平均预测增益。这一结果不应直接推广至其他任务类型。

平均水平上的改善,比群体差异上的改善更一致。

在9月11日的Civiqs人群画像题中,24个模型配置里有23个在各群体数值的平均水平上优于基线,但只有5个在群体间差异结构上优于基线。后续两道人群画像题中,结构上的改善有所增加,但并非所有配置都能受益。

这说明,跟随人群的整体变化与准确刻画不同群体之间的差异,仍是两项需要分别检验的能力。目前人群画像题仅有3道,结论仍需更多轮次支持。

具体任务中,也出现了明显优于基线的预测。

在9月12日的品牌搜索份额题中,Kimi的网络搜索配置预测,iPhone将占五个指定关键词相对搜索热度的55.0%;随后公布的观测值为54.49%,而该轮persistence基线为39.84%。

在完整的五关键词分布评分中,这一配置的预测损失较基线降低约89.9%。这一案例展示了模型在特定任务中的预测价值,但能否持续取得类似优势,仍需后续评测检验。

历史信息有帮助,增加预测流程则未必带来一致改善。

在保持模型、题目与直接预测方式相同的262组配对中,加入近期历史数据后,约96.2%的配对获得了更低的预测损失。

相比之下,在同样使用网络搜索的条件下,额外加入基准分析、因素拆解和预测失败反思等步骤,结果有改善也有退步。对系统设计而言,增加信息或流程的价值,需要通过具体对照来确认。

评测的价值与边界

社会模拟的快速发展,使一个问题愈发重要:如何判断模拟结果真实反映了目标人群?

生动的交互、复杂的系统设计,以及少量符合直觉的案例,都需要进一步的实证支持。

当不同研究采用各自的任务、数据与评价标准时,结果也难以比较,领域中的进展便难以累积为共同认识。

SSA希望为这一验证缺口提供可操作的回应。

通过明确预测对象、提前封存答案、依据独立观测评分,并与统计基线比较,平台让不同方法接受共同检验,帮助研究者判断新增的模型能力与系统复杂度是否带来了实际预测增益。

持续公开的评测记录,也使成功与失败都能成为后续研究可复核、可积累的证据。

这类检验仍有明确边界:总体指标上的准确,未必意味着系统充分刻画了群体差异;预测上的优势,也不能直接证明其还原了社会机制。

SSA提供的是特定任务与条件下的预测效度证据。更广泛的行为解释、因果推断与干预应用,仍需相应的验证。

参考资料:

[1] Position: Time to Close The Validation Gap in LLM Social Simulations (ICML 2026 Position)

[2] CoBRA: Programming Cognitive Bias in Social Agents Using Classic Social Science Experiments (CHI 2026 best paper)

[3] Simulating Society Requires Simulating Thought (NeurIPS 2025 Position)

[4] YuLan-OneSim: Towards the Next Generation of Social Simulator with Large Language Models (2025)

[5] Generative Agents: Interactive Simulacra of Human Behavior (UIST 2024 best paper)

编辑:LRST

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
林诗栋赢球她静音,王楚钦得分她欢呼!这是央视解说还是粉丝见面会?

林诗栋赢球她静音,王楚钦得分她欢呼!这是央视解说还是粉丝见面会?

曹老师评球
2026-09-27 19:57:58
老罗的反击如此之快!罗永浩发布一封面向韩国多家活动主办方的公开提醒函,举报昔日锤子投资人是失信人员

老罗的反击如此之快!罗永浩发布一封面向韩国多家活动主办方的公开提醒函,举报昔日锤子投资人是失信人员

火山詩话
2026-09-28 21:23:44
日本:引进中国人,韩国人,甚至越南人都可以,但绝对不引进印度人和穆斯林!

日本:引进中国人,韩国人,甚至越南人都可以,但绝对不引进印度人和穆斯林!

步论天下事
2026-09-28 10:50:23
网传烟草行业即将全军覆没,就靠6个“好汉”顶着,都不抽烟了吗

网传烟草行业即将全军覆没,就靠6个“好汉”顶着,都不抽烟了吗

慧翔百科
2026-09-28 10:56:38
大众新车官宣:10月12日,正式上市!

大众新车官宣:10月12日,正式上市!

科技堡垒
2026-09-28 16:19:58
事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

人生录
2026-09-11 00:05:21
武契奇辞职前几分钟赦免49人,总统职责交给议会议长,将以“普通公民”身份竞选总理

武契奇辞职前几分钟赦免49人,总统职责交给议会议长,将以“普通公民”身份竞选总理

红星新闻
2026-09-28 15:42:10
全世界公认的十大健康食品,大蒜排第二,第一名家家都有!(建议收藏)

全世界公认的十大健康食品,大蒜排第二,第一名家家都有!(建议收藏)

诗词天地
2026-09-28 14:09:52
20名“双一流”大学生、研究生"翻墙"被处分 ,网传被举报:“一个姐们差一名保研,拿翻墙这事把前面所有人全举报了”

20名“双一流”大学生、研究生"翻墙"被处分 ,网传被举报:“一个姐们差一名保研,拿翻墙这事把前面所有人全举报了”

双一流高校
2026-09-28 00:09:38
罗永浩炮轰俞敏洪:一味装聋作哑,到现在不认错、不道歉、不全量退款

罗永浩炮轰俞敏洪:一味装聋作哑,到现在不认错、不道歉、不全量退款

上观新闻
2026-09-28 13:16:40
赛力斯“分家”背后,是华为内斗的极端化外溢

赛力斯“分家”背后,是华为内斗的极端化外溢

云石
2026-09-28 10:30:00
陕西交控集团员工醉驾碾压拖行一女教师5.9公里 案件由交通肇事转为故意杀人

陕西交控集团员工醉驾碾压拖行一女教师5.9公里 案件由交通肇事转为故意杀人

大众网
2026-09-28 17:52:05
妻子曝刘欢真正死因!独女是诱因,错失5年抢救期,一度恶化致死

妻子曝刘欢真正死因!独女是诱因,错失5年抢救期,一度恶化致死

青橘罐头
2026-09-28 09:50:06
没白等!华为Mate90正面外观亮相,爱了!

没白等!华为Mate90正面外观亮相,爱了!

科技堡垒
2026-09-28 16:18:37
前8个月地方债发行7.8万亿元,再融资债已超过新增债

前8个月地方债发行7.8万亿元,再融资债已超过新增债

风向观察
2026-09-28 20:02:31
3:4惜败!输球不可怕,可怕的是林昀儒赛后的这番话,彻底破防!

3:4惜败!输球不可怕,可怕的是林昀儒赛后的这番话,彻底破防!

田先生篮球
2026-09-28 15:01:27
重大突破!《科学》重磅:科学家发现数千种绝症的通用疗法?

重大突破!《科学》重磅:科学家发现数千种绝症的通用疗法?

徐德文科学频道
2026-09-27 11:33:03
本届亚运会三项均摘银!王楚钦回应:找不回以前打球的感觉

本届亚运会三项均摘银!王楚钦回应:找不回以前打球的感觉

全景体育V
2026-09-28 21:02:30
国常会:研究出台稳定房地产市场、促进就业增收等政策措施

国常会:研究出台稳定房地产市场、促进就业增收等政策措施

界面新闻
2026-09-28 19:14:04
林诗栋夺冠憋屈!不敢庆祝,教练组不鼓掌,王楚钦体能储备惹争议

林诗栋夺冠憋屈!不敢庆祝,教练组不鼓掌,王楚钦体能储备惹争议

三十年莱斯特城球迷
2026-09-28 20:57:28
2026-09-29 01:24:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16300文章数 67096关注度
往期回顾 全部

科技要闻

赛力斯华为合作模式生变后 余承东再次回应

头条要闻

王楚钦:现在打球环境像慢性毒药消耗自己

头条要闻

王楚钦:现在打球环境像慢性毒药消耗自己

体育要闻

王楚钦回应:找不回以前打球的感觉

娱乐要闻

去世刚2天,人民日报对刘欢的称呼改了

财经要闻

英伟达新增1500亿美元股票回购授权

汽车要闻

这台车开完还想开 智界RX最让我意外的,不是智驾,是操控

态度原创

家居
手机
健康
游戏
艺术

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

荣耀Magic9发布后,罗巍宣布荣耀影像站起来了

这些食物,可能正在偷偷养痘!

LPL解说一哥喜得千金,管泽元升级当爸爸!晒一家三口合照上热搜

艺术要闻

纳塔莉的粉彩女性,融合了古典的宁静与现代的深情!

无障碍浏览 进入关怀版