网易首页 > 网易号 > 正文 申请入驻

语言信念贝叶斯序贯更新的智能体预测

0
分享至

Agentic Forecasting using Sequential Bayesian Updating of Linguistic Beliefs

语言信念贝叶斯序贯更新的智能体预测

https://arxiv.org/pdf/2604.18576



摘要

我们提出了贝叶斯语言预测器(BLF),这是一个用于二元预测的智能体系统,在ForecastBench基准测试中取得了最先进的性能。该系统基于三个核心理念构建:(1)语言信念状态:一种半结构化表示,结合了数值概率估计和自然语言证据摘要,由LLM在迭代工具使用循环的每一步进行更新。这与将所有检索到的证据附加到不断增长的非结构化上下文中的常见方法形成对比。(2)分层多试验聚合:运行 K K个独立试验,并使用依赖于数据的先验通过逻辑空间平均收缩将它们组合。(3)分层校准:采用具有分层先验的Platt缩放,避免对基础率偏斜的来源的极端预测过度收缩。在ForecastBench排行榜的400个问题上,BLF优于所有顶级公共方法,包括Cassi、GPT-5、Grok 4.20和Foresight-32B。使用混合效应分析来控制问题变异性(占性能方差的62%)的仔细消融研究表明,所有3个组件都对整体收益有贡献,但某些组件的重要性取决于基础LLM以及设置(例如,有无群体先验)。我们所有的实验都基于我们开发的一个稳健的回测框架,该框架的泄漏率低于1.5%,并且可能具有独立的参考价值。

1 引言

预测未来事件的概率是一项基本挑战,在地缘政治、金融和公共卫生领域都有应用[Tetlock and Gardner, 2015, Spiegelhalter, 2025]。近期研究表明,当赋予网络搜索访问权限时,LLM可以达到接近人类的预测水平[Halawi et al., 2024],而像ForecastBench [Karger et al., 2025]这样的基准测试则通过在线排行榜提供了标准化评估。我们提出了BLF(贝叶斯语言预测器),这是一个在ForecastBench上达到新最先进(SOTA)性能的智能体系统。我们的方法围绕三个核心理念组织:



2 实验设置



回测有效性。我们所有的数据集日期都在我们使用的所有模型的知识截止日期之后(见表 2),这避免了参数化知识泄漏。为最小化搜索和工具使用带来的泄漏,我们实施了一个四层防御:(1)搜索引擎日期过滤,(2)对结果的基于 LLM 的泄漏分类器,(3)数据工具日期钳制,以及(4)对解析来源的 URL 屏蔽。事后审计显示未检测到的泄漏率仅为 1.5%。详见 Sec. B。

外部基线。在我们的 FB 实验中,我们与 FB 排行榜上(截至 2026-04-15)的前 5 名方法进行了比较:这些模型的详细信息见图 7。所有方法都使用群体估计作为强先验(这仅适用于市场问题)。我们还包含两个基线:Crowd+emp(市场问题使用市场价格,数据集问题使用经验先验,无 LLM)和 ZS+crowd+emp(具有群体和经验先验的零样本 LLM (Gemini 3.1 Pro),但无工具或搜索)。所有方法都使用我们的标准提示(Sec. L)。

3 方法






集成。我们尝试了集成不同模型的预测,但没有看到任何收益(详见 Sec. F)。

4 结果

在本节中,我们展示了在 ForecastBench 上的结果;更多细节见 Sec. D.1–Sec. D.5,AIBQ2 的结果见 Sec. D.6。

与 SOTA 的比较 图 2比较了 BLF(使用 Gemini 3.1 Pro)与 ForecastBench 上的领先方法和一些基线,以 Brier Index 衡量。(其他指标的结果见 Sec. D.1,按来源划分的结果见图 8。)我们的系统在每种问题类型(总体、市场、数据集)上都取得了针对所有外部方法的最高 BI。



消融分析。在本节中,我们逐一去除 BLF 的三个组件(信念状态、收缩聚合、分层校准),并在 Pro-3.1、Flash-3.1、Sonnet-4.6、GPT-5 和 Kimi-K2.5 之间交换基础 LLM(这些 LLM 的详细信息见 Tab. 2)。比较使用配对自助法混合效应分析,该方法控制了问题难度(Sec. G.2);方法被与一个强顺序搜索基线(类似于 AIA [Alur et al., 2025])进行比较。我们测试了两种设置:c=0(无群体锚点)和 c=1(有群体锚点)。相对改进可视化于图 3,绝对值见表 19。


我们看到 BLF 系统对所有模型都有帮助,尤其对 Kimi K2.5,在 c=0 设置下从 BI=64.4(校准后的 NoBel 基线;表 19)提高到 BI=70.2(增益 5.8 BI),在 c=1 设置下从 65.8 提高到 72.0(增益 6.2 BI)。BLF+Kimi 的最终性能接近整体最佳系统 BLF+Pro,后者在 c=1 设置下从 70.9 提高到 73.3,但请注意 Kimi 大约便宜 5 倍(按输入 token 成本计)且是开放权重模型。Kimi 校准后的 NoBel BI 比 Pro 低约 5,但这本身是未校准 NoBel 基线上更大差距(约 12;见图 3)的残余。单靠分层校准就缩小了大部分差距(这是 Kimi 最大的单个组件贡献);进一步的 BLF 添加(结构化信念状态 + 先验收缩聚合)在 cal-NoBel 之上又增加了约 6 BI。BLF 对 Pro 和 Flash 也有显著帮助,但对 Sonnet 和 GPT-5 的改进在统计上不显著,尽管 NoBel 基线相当。(我们在 Sec. E 中推测了这种不对称性的可能原因。)

注意,图 3 中的结果是对数据集和市场问题取平均,掩盖了按来源类型划分的显著不对称性。表 20 显示 BLF 堆栈对市场问题的贡献最大,这些通常需要仔细的顺序搜索和推理,而对数据集问题的收益较小,因为在这种情况下,通常只需一次工具调用就能做出好的预测。



工具使用。图 6 显示了每个问题平均工具调用次数,按来源细分。毫不奇怪,网络搜索在所有来源中占主导地位。特定数据源工具(市场信息、维基百科章节、时间序列获取器)被选择性地使用——仅用于其各自的来源。DBnomics 问题完全由 KNN 模型(Sec. I.1)处理,无需 LLM 工具调用。Polymarket 问题使用最多工具(每个问题约 5.5 次),反映了在网络搜索之外还额外获取市场信息。

5 相关工作

我们将关于基于 LLM 预测的日益增长的文献组织为六个主题。

基准测试。Zou 等人 [2022] 引入了 Autocast,这是第一个用于现实世界事件神经预测的大规模数据集,并发现在语言模型上性能远低于人类专家,但随着模型规模和检索的增加而提高。Halawi 等人 [2024] 将其扩展到来自五个平台的 5,000 多个二元问题,表明检索增强的 GPT-4 接近人类群体的 Brier 分数。ForecastBench [Karger 等人,2025] 提供了一个滚动基准测试,包含市场和数据集问题,使用难度调整的 Brier 分数 [Kucinskas 等人,2025] 在共同排行榜上比较方法。TFRBench [Ahamed 等人,2026] 评估预测推理(不仅仅是准确性)。

FutureX[Zeng 等人,2025] 和 FutureX-Pro[Liu 等人,2026] 引入了一个每日更新问题的实时基准测试,并配备自动化管道以消除数据污染,但侧重于 0-1 准确率而非概率预测。Metaculus FutureEval[Metaculus, 2026] 提供了一个持续更新的实时基准测试,能够抵抗污染(因为答案尚不可知),并为机器人锦标赛提供每年 17.5 万美元的奖金。OpenEP[Guan 等人,2024] 将范围从二元问题扩展到开放式结果预测。[Liptay 等人,2026] 提出了“Bench to the Future 2”,这是一个包含 1417 个二元判断性预测问题的基准测试,问题时间跨度为 2025-10-18 至 2025-10-28,解析窗口为 2025-10 至 2025-12;BTF2 还附带了一个固定的预检索文档语料库。[Goel 等人,2026] 提出了 FutureSim,这是一个使用固定文本语料库(以避免泄漏)来评估在线预测(持续学习)的基准测试。ProphetArena[Yang 等人,2025] 是一个将多个相关的二元预测问题捆绑成一个“市场”的基准测试(例如,“A、B 或 C 会赢得美国选举吗?”变成 3 个二元问题),但在撰写本文时,他们尚未发布历史数据,因此无法进行回测。

评估。Paleka 等人 [2025] 对离线评估的陷阱进行了批判性分析,包括时间泄漏和检索泄漏。Li 等人 [2026] 表明,LLM 无法“模拟”对其知识截止日期之前事件的无知,这进一步使回测的有效性复杂化。我们的四层泄漏防御(Sec. B)解决了其中的几个问题。Prophet Arena [Yang 等人,2025] 认为经济效用(下注利润)可能比 Brier 分数更相关;他们发现 LLM 展现出令人印象深刻的校准性,但在事件回忆方面存在不准确性。

金融预测与交易。几个基准测试将 LLM 评估为金融预测器和交易者。Prediction Arena[Zhang 等人,2026] 在 Kalshi 和 Polymarket 上部署了六个前沿模型并使用真实资金,发现大多数模型亏损(在 Kalshi 上为 −16% 至 −31%)。PolyBench[Cheng 等人,2026] 在约 3.8 万个具有订单簿数据的 Polymarket 问题上评估了七个 LLM,发现只有两个模型获得了正回报。FinTradeBench[Agrawal 等人,2026] 评估结合基本面和技术交易信号的金融推理,发现检索有助于基本面分析,但对时间序列推理没有帮助——这与我们的发现一致,即 LLM 难以处理原始数值数据(Sec. C.4)。[Wang 等人,2026] 提出了一个新的交易基准测试。

零样本和基于提示的预测。Karkar 和 Chopra [2025] 表明,LLM 的预测能力在不同领域和问题类型上“分布不均”(参见图 18)。Pratt 等人 [2024] 发现,超级预测提示策略(分解、基础率、检索)未能使 PaLM 2 比基本提示有所改进,并将模型表观准确性归因于恰好与低基础率对齐的消极偏见。Schoenegger 等人 [2025] 在 GPT-4o、Claude 3.5 和 Llama 3.1 上测试了 38 种提示变体,发现大多数修改带来的收益可忽略不计,有些(例如显式贝叶斯推理提示)反而有害。这些负面结果为我们的智能体方法提供了动机:我们不是设计更好的提示,而是提供工具(搜索、数据访问)和结构化信念跟踪。

智能体和工具增强系统。Hsieh 等人 [2024] 提出了 RTF(预测推理与工具),这是一个使用分层智能体的零样本框架,配备 Python REPL 和 Google 搜索,在无需任何权重更新的情况下,在 Manifold Markets 上取得了与人类群体竞争的 Brier 分数。AIA Forecaster [Alur 等人,2025] 采用了自适应迭代搜索和统计校准(Platt 缩放),与我们类似,但使用简单的文本聚合而非信念状态。此外,他们使用基于 LLM 的校准系统,我们发现其劣于简单的平均聚合(见 Sec. C.10)。CogForecast[Wang 等人,2025] 使用具有不同认知特征的多智能体辩论来减轻固有偏见。


用于预测的强化学习。最近的几项工作应用 RL 来改进预测。Time-R1[Liu 等人,2025] 使用两阶段课程(先时间理解后预测)将“时间逻辑”构建到模型的表示中。Turtle 等人 [2025] 应用 RLVR(具有可验证奖励的 RL)在历史 Polymarket 问题上训练 14B 模型,达到前沿水平的 Brier 分数(0.190)并展示了经济效用(模拟交易中 10%+ 的 ROI)。OpenForecaster[Chandak 等人,2026] 从历史新闻中合成 50K+ 训练问题,并使用带有准确率+Brier 组合奖励的 GRPO 来对抗对冲偏差,表明专用 8B 模型可以匹配 120B+ 通才模型。Jeen 等人 [2026b,a] 在开源模型上使用 RLFT 参加 Metaculus AI 基准锦标赛,达到了当前的 AIBQ2 SOTA(MS=45.8)。[Damani 等人,2026] 使用 RLFT 改进校准。Turtle 等人 [2026] 引入了“Foresight Learning”(我们在表 1 中与之比较的 Lightning Rod Labs 的 Foresight-32B模型背后的训练方法),通过适当评分规则奖励使用已解析结果作为自由监督,表明训练后的 Qwen3-32B 优于未训练的 Qwen3-235B(Brier 分数提高 27%)。[Auzina 等人,2026] 使用 RL,其中奖励函数与信念状态的变化相关,而不仅仅是最终结果。这些 RL 方法与我们互补:它们改进基础模型,而我们改进智能体工具包(工具、信念跟踪、校准)。

集成方法。Schoenegger 等人 [2024] 表明,聚合 12 个不同的 LLM(一个“硅基群体”)可以达到与人类群体相当的准确率,并且前沿模型在见到人类中位数预测时可以更新信念。我们的负面结果——当组件共享相同架构时,模型集成没有帮助(Sec. F)——与他们的发现一致,即集成收益需要真正的多样性(另见 [Aitchison 等人,2026])。

6 结论

总结。我们开发了一个系统,通过利用多种理念——智能体工具使用、结构化信念更新以及分层贝叶斯聚合和校准——在 ForecastBench 挑战中达到了最先进的性能。

局限性。我们的方法目前仅限于预测二元结果。此外,我们的评估仅使用回测,因此结论可能无法完美预测实时预测性能。最终的验证应该是证明回测的性能排名与实时 ForecastBench 性能相关;然而,比赛的提交限制(每两周 2 个变体)和 50 天的报告延迟使得全面的实时消融研究不可行。最后,预测系统可能被用于敏感主题,例如地缘政治或军事事件,并且需要经过人工审核。

未来工作。有用的扩展包括预测分类结果(如 [Yang 等人,2025])和数值结果(如 [Aguirre, 2021]),更好的工具(例如用于时间序列问题的 TimesFM [Das 等人,2024]),学习基于市场交易量估计群体信号的可靠性,对基础模型进行监督微调以更好地进行贝叶斯推理校准 [Qiu 等人,2025],对基础模型进行 RL 微调(见 Sec. 5),使用赌博机算法在线学习元控制器(例如,[van der Hoeven 等人,2018,Afshar 等人,2026]),实时测试和交易(见 Sec. 5),使用信息价值计算进行提前停止或工具选择(见 Sec. K),以及将 BLF 应用于其他需要不确定性建模和顺序信息寻求的任务,例如 ARBench [Zhou 等人,2025] 和医疗对话系统 [Echarghaoui 等人,2026,Nori 等人,2025,Li 等人,2024]。

原文链接:https://arxiv.org/pdf/2604.18576

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
我娶了俄罗斯退役女兵,一个月50次夫妻生活,她却从不提家里人,岳父病危时我塞给她24万,直到10年后我去银行贷款,柜员一句话让我当场愣住

我娶了俄罗斯退役女兵,一个月50次夫妻生活,她却从不提家里人,岳父病危时我塞给她24万,直到10年后我去银行贷款,柜员一句话让我当场愣住

故事情感屋
2026-10-03 15:54:33
一个令人振奋的消息!中国人国庆假期赴日本旅游人数暴跌!

一个令人振奋的消息!中国人国庆假期赴日本旅游人数暴跌!

破镜难圆
2026-10-03 11:00:07
中网史诗翻盘!6届大满贯冠军斯瓦泰克2-1逆转奥运亚军 晋级16强

中网史诗翻盘!6届大满贯冠军斯瓦泰克2-1逆转奥运亚军 晋级16强

醉卧浮生
2026-10-05 13:52:05
63岁刘欢病逝,戳穿最残酷的医疗真相:治病的金钱上限,只有100万…

63岁刘欢病逝,戳穿最残酷的医疗真相:治病的金钱上限,只有100万…

犀利强哥
2026-10-05 06:58:57
暴雨或大暴雨,大雪或雨夹雪来了

暴雨或大暴雨,大雪或雨夹雪来了

第一财经资讯
2026-10-05 19:51:21
孙千一口黄牙坐在CELINE秀场头排,旁边人牙白得反光,她愣是没贴片

孙千一口黄牙坐在CELINE秀场头排,旁边人牙白得反光,她愣是没贴片

西楼知趣杂谈
2026-10-04 17:52:11
国足主帅邵佳一再表态

国足主帅邵佳一再表态

政知新媒体
2026-10-05 21:36:00
CCTV16直播,国足荣誉之战,邵佳一别玩对攻,韦世豪+王上源压阵

CCTV16直播,国足荣誉之战,邵佳一别玩对攻,韦世豪+王上源压阵

替补席看球
2026-10-05 13:56:30
苹果让友商怎么活!iPhone 18 Pro系列国内开售不到半月最新销量出炉:很快破250万台

苹果让友商怎么活!iPhone 18 Pro系列国内开售不到半月最新销量出炉:很快破250万台

快科技
2026-10-04 17:28:04
事态升级!蔡康永风波扯出5位港台明星,已不是道德问题这么简单

事态升级!蔡康永风波扯出5位港台明星,已不是道德问题这么简单

孤城落日
2026-10-05 16:53:01
缅北明家,给中国人起了个蔑称

缅北明家,给中国人起了个蔑称

极目新闻
2026-10-05 18:27:38
瞒妻子投资亏超1亿美元,美国CEO崩溃枪杀妻子后自杀!小舅子:他蜷缩成一团哭了几周

瞒妻子投资亏超1亿美元,美国CEO崩溃枪杀妻子后自杀!小舅子:他蜷缩成一团哭了几周

红星新闻
2026-10-05 16:25:09
新娘婚礼前两天被马蜂蜇伤,嘴唇肿胀自嘲“像蛤蟆精”,当事人:连夜就医,婚礼如期举行

新娘婚礼前两天被马蜂蜇伤,嘴唇肿胀自嘲“像蛤蟆精”,当事人:连夜就医,婚礼如期举行

极目新闻
2026-10-05 14:00:13
缅北电诈回流人员自述被割肾的亲身经历:“那时候不要说一个肾了,锯条腿、锯条手我都愿意,只要能走”

缅北电诈回流人员自述被割肾的亲身经历:“那时候不要说一个肾了,锯条腿、锯条手我都愿意,只要能走”

政知新媒体
2026-10-05 10:12:24
以色列:严禁拥有伊朗、伊拉克、黎巴嫩、阿曼、巴基斯坦、卡塔尔和沙特等27国单一或双重国籍的机组人员执飞或搭乘赴以航班

以色列:严禁拥有伊朗、伊拉克、黎巴嫩、阿曼、巴基斯坦、卡塔尔和沙特等27国单一或双重国籍的机组人员执飞或搭乘赴以航班

第一财经资讯
2026-10-05 09:08:21
全国贷款余额逼近300万亿!房地产泡沫破了,地方债要兑付,信贷刺激正在失效

全国贷款余额逼近300万亿!房地产泡沫破了,地方债要兑付,信贷刺激正在失效

回旋镖
2026-10-05 19:43:05
以媒称初步调查显示:拿斧头砍机长的副驾驶原计划杀死机长 并驾驶飞机撞向以色列摩天大楼

以媒称初步调查显示:拿斧头砍机长的副驾驶原计划杀死机长 并驾驶飞机撞向以色列摩天大楼

闪电新闻
2026-10-05 08:31:46
德拉帕蒂:这次反击要打到俄罗斯军事、政治当局崩溃

德拉帕蒂:这次反击要打到俄罗斯军事、政治当局崩溃

西楼饮月
2026-10-04 23:53:22
能让失明者重见部分光明!2026一项诺奖公布:用光就能开关大脑神经细胞

能让失明者重见部分光明!2026一项诺奖公布:用光就能开关大脑神经细胞

DeepTech深科技
2026-10-05 18:23:12
3岁男童从10楼坠下被水果店雨棚接住,店主:换雨棚980元,男孩父亲转来1000元,自己退回20元,“如果宽裕一点,不会让他赔”

3岁男童从10楼坠下被水果店雨棚接住,店主:换雨棚980元,男孩父亲转来1000元,自己退回20元,“如果宽裕一点,不会让他赔”

晋江电视台
2026-10-04 18:44:50
2026-10-05 21:56:49
CreateAMind incentive-icons
CreateAMind
CreateAMind.agi.top
1610文章数 21关注度
往期回顾 全部

科技要闻

2026年诺奖:三名科学家因光遗传学获奖

头条要闻

缅北电诈头目在中国临刑前对着镜头叫嚣:狼生来要吃肉

头条要闻

缅北电诈头目在中国临刑前对着镜头叫嚣:狼生来要吃肉

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永回应漏洞百出,太平轮旧事被扒

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

房产
游戏
健康
教育
军事航空

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

大塚明夫希望Konami能继续开发《合金装备》系列

刷酸祛痘,为什么有人翻车?

教育要闻

聪明的父母,大多是“农民思维”

军事要闻

俄军连续4天轰炸基辅大桥

无障碍浏览 进入关怀版