Agentic Forecasting using Sequential Bayesian Updating of Linguistic Beliefs
语言信念贝叶斯序贯更新的智能体预测
https://arxiv.org/pdf/2604.18576
![]()
![]()
摘要
我们提出了贝叶斯语言预测器(BLF),这是一个用于二元预测的智能体系统,在ForecastBench基准测试中取得了最先进的性能。该系统基于三个核心理念构建:(1)语言信念状态:一种半结构化表示,结合了数值概率估计和自然语言证据摘要,由LLM在迭代工具使用循环的每一步进行更新。这与将所有检索到的证据附加到不断增长的非结构化上下文中的常见方法形成对比。(2)分层多试验聚合:运行 K K个独立试验,并使用依赖于数据的先验通过逻辑空间平均收缩将它们组合。(3)分层校准:采用具有分层先验的Platt缩放,避免对基础率偏斜的来源的极端预测过度收缩。在ForecastBench排行榜的400个问题上,BLF优于所有顶级公共方法,包括Cassi、GPT-5、Grok 4.20和Foresight-32B。使用混合效应分析来控制问题变异性(占性能方差的62%)的仔细消融研究表明,所有3个组件都对整体收益有贡献,但某些组件的重要性取决于基础LLM以及设置(例如,有无群体先验)。我们所有的实验都基于我们开发的一个稳健的回测框架,该框架的泄漏率低于1.5%,并且可能具有独立的参考价值。
1 引言
预测未来事件的概率是一项基本挑战,在地缘政治、金融和公共卫生领域都有应用[Tetlock and Gardner, 2015, Spiegelhalter, 2025]。近期研究表明,当赋予网络搜索访问权限时,LLM可以达到接近人类的预测水平[Halawi et al., 2024],而像ForecastBench [Karger et al., 2025]这样的基准测试则通过在线排行榜提供了标准化评估。我们提出了BLF(贝叶斯语言预测器),这是一个在ForecastBench上达到新最先进(SOTA)性能的智能体系统。我们的方法围绕三个核心理念组织:
![]()
![]()
2 实验设置
![]()
![]()
回测有效性。我们所有的数据集日期都在我们使用的所有模型的知识截止日期之后(见表 2),这避免了参数化知识泄漏。为最小化搜索和工具使用带来的泄漏,我们实施了一个四层防御:(1)搜索引擎日期过滤,(2)对结果的基于 LLM 的泄漏分类器,(3)数据工具日期钳制,以及(4)对解析来源的 URL 屏蔽。事后审计显示未检测到的泄漏率仅为 1.5%。详见 Sec. B。
外部基线。在我们的 FB 实验中,我们与 FB 排行榜上(截至 2026-04-15)的前 5 名方法进行了比较:这些模型的详细信息见图 7。所有方法都使用群体估计作为强先验(这仅适用于市场问题)。我们还包含两个基线:Crowd+emp(市场问题使用市场价格,数据集问题使用经验先验,无 LLM)和 ZS+crowd+emp(具有群体和经验先验的零样本 LLM (Gemini 3.1 Pro),但无工具或搜索)。所有方法都使用我们的标准提示(Sec. L)。
3 方法
![]()
![]()
![]()
![]()
![]()
集成。我们尝试了集成不同模型的预测,但没有看到任何收益(详见 Sec. F)。
4 结果
在本节中,我们展示了在 ForecastBench 上的结果;更多细节见 Sec. D.1–Sec. D.5,AIBQ2 的结果见 Sec. D.6。
与 SOTA 的比较 图 2比较了 BLF(使用 Gemini 3.1 Pro)与 ForecastBench 上的领先方法和一些基线,以 Brier Index 衡量。(其他指标的结果见 Sec. D.1,按来源划分的结果见图 8。)我们的系统在每种问题类型(总体、市场、数据集)上都取得了针对所有外部方法的最高 BI。
![]()
![]()
消融分析。在本节中,我们逐一去除 BLF 的三个组件(信念状态、收缩聚合、分层校准),并在 Pro-3.1、Flash-3.1、Sonnet-4.6、GPT-5 和 Kimi-K2.5 之间交换基础 LLM(这些 LLM 的详细信息见 Tab. 2)。比较使用配对自助法混合效应分析,该方法控制了问题难度(Sec. G.2);方法被与一个强顺序搜索基线(类似于 AIA [Alur et al., 2025])进行比较。我们测试了两种设置:c=0(无群体锚点)和 c=1(有群体锚点)。相对改进可视化于图 3,绝对值见表 19。
![]()
我们看到 BLF 系统对所有模型都有帮助,尤其对 Kimi K2.5,在 c=0 设置下从 BI=64.4(校准后的 NoBel 基线;表 19)提高到 BI=70.2(增益 5.8 BI),在 c=1 设置下从 65.8 提高到 72.0(增益 6.2 BI)。BLF+Kimi 的最终性能接近整体最佳系统 BLF+Pro,后者在 c=1 设置下从 70.9 提高到 73.3,但请注意 Kimi 大约便宜 5 倍(按输入 token 成本计)且是开放权重模型。Kimi 校准后的 NoBel BI 比 Pro 低约 5,但这本身是未校准 NoBel 基线上更大差距(约 12;见图 3)的残余。单靠分层校准就缩小了大部分差距(这是 Kimi 最大的单个组件贡献);进一步的 BLF 添加(结构化信念状态 + 先验收缩聚合)在 cal-NoBel 之上又增加了约 6 BI。BLF 对 Pro 和 Flash 也有显著帮助,但对 Sonnet 和 GPT-5 的改进在统计上不显著,尽管 NoBel 基线相当。(我们在 Sec. E 中推测了这种不对称性的可能原因。)
注意,图 3 中的结果是对数据集和市场问题取平均,掩盖了按来源类型划分的显著不对称性。表 20 显示 BLF 堆栈对市场问题的贡献最大,这些通常需要仔细的顺序搜索和推理,而对数据集问题的收益较小,因为在这种情况下,通常只需一次工具调用就能做出好的预测。
![]()
![]()
工具使用。图 6 显示了每个问题平均工具调用次数,按来源细分。毫不奇怪,网络搜索在所有来源中占主导地位。特定数据源工具(市场信息、维基百科章节、时间序列获取器)被选择性地使用——仅用于其各自的来源。DBnomics 问题完全由 KNN 模型(Sec. I.1)处理,无需 LLM 工具调用。Polymarket 问题使用最多工具(每个问题约 5.5 次),反映了在网络搜索之外还额外获取市场信息。
5 相关工作
我们将关于基于 LLM 预测的日益增长的文献组织为六个主题。
基准测试。Zou 等人 [2022] 引入了 Autocast,这是第一个用于现实世界事件神经预测的大规模数据集,并发现在语言模型上性能远低于人类专家,但随着模型规模和检索的增加而提高。Halawi 等人 [2024] 将其扩展到来自五个平台的 5,000 多个二元问题,表明检索增强的 GPT-4 接近人类群体的 Brier 分数。ForecastBench [Karger 等人,2025] 提供了一个滚动基准测试,包含市场和数据集问题,使用难度调整的 Brier 分数 [Kucinskas 等人,2025] 在共同排行榜上比较方法。TFRBench [Ahamed 等人,2026] 评估预测推理(不仅仅是准确性)。
FutureX[Zeng 等人,2025] 和 FutureX-Pro[Liu 等人,2026] 引入了一个每日更新问题的实时基准测试,并配备自动化管道以消除数据污染,但侧重于 0-1 准确率而非概率预测。Metaculus FutureEval[Metaculus, 2026] 提供了一个持续更新的实时基准测试,能够抵抗污染(因为答案尚不可知),并为机器人锦标赛提供每年 17.5 万美元的奖金。OpenEP[Guan 等人,2024] 将范围从二元问题扩展到开放式结果预测。[Liptay 等人,2026] 提出了“Bench to the Future 2”,这是一个包含 1417 个二元判断性预测问题的基准测试,问题时间跨度为 2025-10-18 至 2025-10-28,解析窗口为 2025-10 至 2025-12;BTF2 还附带了一个固定的预检索文档语料库。[Goel 等人,2026] 提出了 FutureSim,这是一个使用固定文本语料库(以避免泄漏)来评估在线预测(持续学习)的基准测试。ProphetArena[Yang 等人,2025] 是一个将多个相关的二元预测问题捆绑成一个“市场”的基准测试(例如,“A、B 或 C 会赢得美国选举吗?”变成 3 个二元问题),但在撰写本文时,他们尚未发布历史数据,因此无法进行回测。
评估。Paleka 等人 [2025] 对离线评估的陷阱进行了批判性分析,包括时间泄漏和检索泄漏。Li 等人 [2026] 表明,LLM 无法“模拟”对其知识截止日期之前事件的无知,这进一步使回测的有效性复杂化。我们的四层泄漏防御(Sec. B)解决了其中的几个问题。Prophet Arena [Yang 等人,2025] 认为经济效用(下注利润)可能比 Brier 分数更相关;他们发现 LLM 展现出令人印象深刻的校准性,但在事件回忆方面存在不准确性。
金融预测与交易。几个基准测试将 LLM 评估为金融预测器和交易者。Prediction Arena[Zhang 等人,2026] 在 Kalshi 和 Polymarket 上部署了六个前沿模型并使用真实资金,发现大多数模型亏损(在 Kalshi 上为 −16% 至 −31%)。PolyBench[Cheng 等人,2026] 在约 3.8 万个具有订单簿数据的 Polymarket 问题上评估了七个 LLM,发现只有两个模型获得了正回报。FinTradeBench[Agrawal 等人,2026] 评估结合基本面和技术交易信号的金融推理,发现检索有助于基本面分析,但对时间序列推理没有帮助——这与我们的发现一致,即 LLM 难以处理原始数值数据(Sec. C.4)。[Wang 等人,2026] 提出了一个新的交易基准测试。
零样本和基于提示的预测。Karkar 和 Chopra [2025] 表明,LLM 的预测能力在不同领域和问题类型上“分布不均”(参见图 18)。Pratt 等人 [2024] 发现,超级预测提示策略(分解、基础率、检索)未能使 PaLM 2 比基本提示有所改进,并将模型表观准确性归因于恰好与低基础率对齐的消极偏见。Schoenegger 等人 [2025] 在 GPT-4o、Claude 3.5 和 Llama 3.1 上测试了 38 种提示变体,发现大多数修改带来的收益可忽略不计,有些(例如显式贝叶斯推理提示)反而有害。这些负面结果为我们的智能体方法提供了动机:我们不是设计更好的提示,而是提供工具(搜索、数据访问)和结构化信念跟踪。
智能体和工具增强系统。Hsieh 等人 [2024] 提出了 RTF(预测推理与工具),这是一个使用分层智能体的零样本框架,配备 Python REPL 和 Google 搜索,在无需任何权重更新的情况下,在 Manifold Markets 上取得了与人类群体竞争的 Brier 分数。AIA Forecaster [Alur 等人,2025] 采用了自适应迭代搜索和统计校准(Platt 缩放),与我们类似,但使用简单的文本聚合而非信念状态。此外,他们使用基于 LLM 的校准系统,我们发现其劣于简单的平均聚合(见 Sec. C.10)。CogForecast[Wang 等人,2025] 使用具有不同认知特征的多智能体辩论来减轻固有偏见。
![]()
用于预测的强化学习。最近的几项工作应用 RL 来改进预测。Time-R1[Liu 等人,2025] 使用两阶段课程(先时间理解后预测)将“时间逻辑”构建到模型的表示中。Turtle 等人 [2025] 应用 RLVR(具有可验证奖励的 RL)在历史 Polymarket 问题上训练 14B 模型,达到前沿水平的 Brier 分数(0.190)并展示了经济效用(模拟交易中 10%+ 的 ROI)。OpenForecaster[Chandak 等人,2026] 从历史新闻中合成 50K+ 训练问题,并使用带有准确率+Brier 组合奖励的 GRPO 来对抗对冲偏差,表明专用 8B 模型可以匹配 120B+ 通才模型。Jeen 等人 [2026b,a] 在开源模型上使用 RLFT 参加 Metaculus AI 基准锦标赛,达到了当前的 AIBQ2 SOTA(MS=45.8)。[Damani 等人,2026] 使用 RLFT 改进校准。Turtle 等人 [2026] 引入了“Foresight Learning”(我们在表 1 中与之比较的 Lightning Rod Labs 的 Foresight-32B模型背后的训练方法),通过适当评分规则奖励使用已解析结果作为自由监督,表明训练后的 Qwen3-32B 优于未训练的 Qwen3-235B(Brier 分数提高 27%)。[Auzina 等人,2026] 使用 RL,其中奖励函数与信念状态的变化相关,而不仅仅是最终结果。这些 RL 方法与我们互补:它们改进基础模型,而我们改进智能体工具包(工具、信念跟踪、校准)。
集成方法。Schoenegger 等人 [2024] 表明,聚合 12 个不同的 LLM(一个“硅基群体”)可以达到与人类群体相当的准确率,并且前沿模型在见到人类中位数预测时可以更新信念。我们的负面结果——当组件共享相同架构时,模型集成没有帮助(Sec. F)——与他们的发现一致,即集成收益需要真正的多样性(另见 [Aitchison 等人,2026])。
6 结论
总结。我们开发了一个系统,通过利用多种理念——智能体工具使用、结构化信念更新以及分层贝叶斯聚合和校准——在 ForecastBench 挑战中达到了最先进的性能。
局限性。我们的方法目前仅限于预测二元结果。此外,我们的评估仅使用回测,因此结论可能无法完美预测实时预测性能。最终的验证应该是证明回测的性能排名与实时 ForecastBench 性能相关;然而,比赛的提交限制(每两周 2 个变体)和 50 天的报告延迟使得全面的实时消融研究不可行。最后,预测系统可能被用于敏感主题,例如地缘政治或军事事件,并且需要经过人工审核。
未来工作。有用的扩展包括预测分类结果(如 [Yang 等人,2025])和数值结果(如 [Aguirre, 2021]),更好的工具(例如用于时间序列问题的 TimesFM [Das 等人,2024]),学习基于市场交易量估计群体信号的可靠性,对基础模型进行监督微调以更好地进行贝叶斯推理校准 [Qiu 等人,2025],对基础模型进行 RL 微调(见 Sec. 5),使用赌博机算法在线学习元控制器(例如,[van der Hoeven 等人,2018,Afshar 等人,2026]),实时测试和交易(见 Sec. 5),使用信息价值计算进行提前停止或工具选择(见 Sec. K),以及将 BLF 应用于其他需要不确定性建模和顺序信息寻求的任务,例如 ARBench [Zhou 等人,2025] 和医疗对话系统 [Echarghaoui 等人,2026,Nori 等人,2025,Li 等人,2024]。
原文链接:https://arxiv.org/pdf/2604.18576
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.