网易首页 > 网易号 > 正文 申请入驻

中科大开源自主论文搜索智能体,并提出Agentic RL新范式PSPO!

0
分享至

智猩猩AI整理

论文作者投稿


当研究者面对一个真实的科研问题时,想找的往往不是“与某个关键词相关”的论文,而是同时满足多个条件、能够形成完整证据链的一组工作。这时,难点不只是“如何匹配论文”,更是“下一步应该去哪里找”。

针对这一问题,中国科学技术大学认知智能全国重点实验室团队开源PaperScout智能体,将学术检索建模为一个连续决策过程。

在 PaperScout 中,AI 不再机械执行固定的“先搜索、再扩展”流程,而是根据已经找到的论文,自主决定是发起新搜索,还是沿参考文献继续深挖。

为了训练这种多轮检索 Agent,研究团队进一步提出了面向完整交互序列的强化学习方法PSPO

实验表明,PaperScout 在召回率和相关性两个指标上,显著优于强大的工作流驱动方法以及强化学习基线,验证了 PSPO 策略的有效性。目前该成果已被EMNLP 2026收录。


  • 论文标题:

    PaperScout: An Autonomous Agent for Academic Paper Search with Process-Aware Sequence-Level Policy Optimization

01

复杂学术问题,不是

一次语义匹配

举一个例子:

寻找将强化学习用于蛋白质折叠、但不采用 Transformer 架构的研究。

这类问题同时包含主题、方法、应用场景和排除条件。单轮关键词检索或语义匹配,容易返回“主题相近,条件却不满足”的结果。研究者仍然需要反复改写查询、逐篇筛选,再沿参考文献继续追踪。

近年来,大语言模型开始参与查询改写、候选筛选和引用扩展,但不少系统仍然依赖预先写好的流程。流程变复杂了,真正决定“何时搜索、何时扩展、何时换方向”的,依然是人工规则。


图 1:学术检索从单轮语义匹配、固定工作流,走向能够自主观察和决策的 Agentic Search。

02

PaperScout:

自主决定“搜”还是“扩”

PaperScout 将论文检索建模为一个部分可观测马尔可夫决策过程(POMDP)。通俗地说,检索不再是一次性的“查询—返回”,而是一段不断观察、行动和更新的探索过程。

在每一轮中,PaperScout 都会维护一个动态“论文池”,记录候选论文的内容与元数据、它们与用户问题的相关程度,以及参考文献是否已经被探索。然后,Agent 根据当前论文池和历史记录,自主选择两类动作:

  • Search:生成新的检索式,寻找新的候选论文;

  • Expand:选择一篇已有论文,沿其参考文献继续探索。

新获得的论文经过相关性判断与去重后,会回到论文池中,成为下一轮决策的新证据。

关键在于,Search 和 Expand 不再以固定顺序出现。当某条引用链仍有价值时,PaperScout 可以继续深挖;当扩展结果趋于饱和时,它又能重新搜索,打开新的研究方向。


图 2:PaperScout 维护动态论文池,并根据当前观察自主调用 Search 或 Expand。

03

PSPO:让优化粒度对齐

Agent 的真实动作

让 Agent 学会自主决策,关键难题是如何稳定地训练它。

在多轮论文检索中,环境通常在一次完整回复和工具调用之后,才能判断这一轮是否找到了新的相关论文。但经典 PPO 主要在 token 层面优化,需要把一个交互级反馈分摊给回复中的大量 token。

这会产生一种“粒度错位”:Agent 的真实动作是一整轮搜索或扩展决策,优化算法处理的却是组成这次决策的单个 token。本应评价“这一步找到了多少有价值论文”的反馈,因此容易被稀释。

为此,研究团队提出Proximal Sequence Policy Optimization(PSPO):将每轮生成的完整回复视为一个原子动作,在交互序列层面估计优势并更新策略;同时保留逐轮过程奖励,让模型知道“究竟是哪一步带来了新论文”。


图 3:PPO 在 token 粒度处理交互反馈;PSPO 将一次完整响应视为原子动作,进行序列级优势估计与重要性采样。

PaperScout 的单步奖励同时考虑两件事:奖励新获得的高相关论文,惩罚重复查询或重复扩展。因此,Agent 学到的不只是“最后找到了多少”,还包括“每一步是否有效”。

04

实验:4B 模型也能学会

高效多轮检索

研究团队在两个学术检索基准上进行了评估:包含真实专家查询的RealScholarQuery,以及由顶会论文构造的AutoScholarQuery

PaperScout 使用 Qwen3-4B-Instruct-2507 作为骨干模型,并与 Google Search、Google Scholar、PaSa、SPAR 以及未经过强化学习训练的不同规模模型进行比较。

RealScholarQuery上,PaperScout 的 Recall 达到0.574,高于最佳对比系统的 0.541;F1 达到0.441,相比最佳基线的 0.417 相对提升5.8%;LLM 相关性评分为2.576,Recall@all 为0.691

AutoScholarQuery上,PaperScout 取得0.459 Recall0.134 F12.467 LLM 相关性评分0.811 Recall@all

更值得关注的是,在相同工具调用次数下,PaperScout 通常能获得更高的召回率。经过 PSPO 训练的 4B 模型,在较宽的工具调用区间内可以匹配甚至超过未经强化学习训练的 Qwen3-Max。这说明,对于多轮学术检索,学会更有效地使用工具,可以弥补模型规模的差距。


图 4:在 RealScholarQuery(上)和 AutoScholarQuery(下)上,PaperScout 在相同工具调用次数下取得更高召回率。

PSPO 与其他优化方法的直接对比也支持了这一结论。在 RealScholarQuery 上,PSPO 的 Recall 为0.574,高于 GSPO 的 0.557 和 PPO 的 0.537。

05

它是如何搜索的?

论文展示了一个与 CLIP、ViLD 和 RegionCLIP 相关的复杂检索案例。

面对初始问题,PaperScout 首先将需求拆解为多个语义侧面,分别发起与 CLIP visual localization、ViLD model 和 RegionCLIP model 等相关的搜索,快速获得种子论文。

随后,它选择 RegionCLIP、ViLD、RegionBLIP 等高相关工作进行参考文献扩展,逐步深入区域级视觉语言学习方向。


当沿已有论文继续扩展的边际收益下降时,PaperScout 没有机械地重复 Expand,而是重新发起关于 fine-grained region understanding 的 Search,打开新的检索分支,再继续扩展 FILIP、BLIP-2 等相关工作。


图 5:PaperScout 根据已有上下文在 Search 与 Expand 之间动态切换,并在扩展收益下降后主动开辟新方向。

这个过程很像研究者真实的文献调研:先广泛寻找入口,再沿关键工作深挖;当局部线索趋于饱和后,主动换一组概念重新搜索。PaperScout 学到的,正是在“广度”和“深度”之间动态切换的能力。

06

不只是一个新的论文搜索器

PaperScout 展示了两个值得关注的方向。

第一,学术检索正在从“更好的语义匹配”走向“自主的信息探索”。系统不再只负责对已有候选进行排序,而是主动决定去哪里寻找信息、沿哪条线索继续追踪,以及何时改变方向。

第二,Agent 强化学习需要与真实交互粒度对齐。许多工具型 Agent 的动作,本质上都是一次完整响应触发的一组工具操作。PSPO 所关注的序列级优化和过程奖励,也为训练其他多轮、工具增强型 Agent 提供了新思路。

07

当前边界

论文同时指出,PaperScout 仍有进一步拓展的空间:当前评估主要集中在计算机科学领域;检索范围受公开搜索引擎和开放论文库限制;现有检索后端来源仍然有限;引用扩展主要沿论文参考文献向后追踪,尚未充分利用后续引用和更完整的引文图信号。

更广的学科覆盖、更多源的学术检索、更完整的引文图探索,以及面向真实科研任务的长期自主搜索,都是值得继续探索的方向。

08

相关基准:ScholarQuest

围绕自主学术论文搜索,研究团队还构建了大规模、分类体系引导的评测基准ScholarQuest,用于系统评估开放文献环境中的 Agentic Academic Paper Search。

ScholarQuest 基于 1,000 余个计算机科学主题,覆盖方法导向、设定锚定、比较型和范围约束型四类代表性研究意图,并提供可扩展的答案构建流程与共享检索后端ScholarBase,以支持可复现评测。

评测结果显示,Agentic 方法整体优于单次检索基线,但当前最佳 Agent 的 Recall@100 仅为0.314,Recall@All 为0.355,说明真实开放文献环境下的自主学术搜索仍有很大提升空间。

如果说 PaperScout 关注的是“如何训练一个更会搜索的 Agent”,那么 ScholarQuest 关注的则是“如何在更真实、更系统的环境中评测它”。二者分别从方法与评测两个方面,推进自主学术搜索 Agent 的研究。

09

总结

搜索论文,表面上是寻找文档;更深层次上,它是在一个不断扩展的知识网络中连续决策。

PaperScout 让 AI 从“执行检索流程”走向“自主规划检索过程”:它会观察已经获得的证据,判断下一步应该搜索还是扩展,也会在旧方向趋于饱和时主动寻找新入口。PSPO 则让这种多轮决策能够在更合适的粒度上得到训练。

目前,PaperScout 的论文、项目主页和代码,以及 ScholarQuest 基准论文均已公开。欢迎读者阅读论文、试用项目,并与研究团队交流复杂学术检索与工具增强 Agent 的更多可能。

关注+星标,获取AI前沿进展与开源一线动态

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
国羽男队创耻辱纪录,羽协新掌门人3选1,林丹冷门,奥运冠军或逆袭

国羽男队创耻辱纪录,羽协新掌门人3选1,林丹冷门,奥运冠军或逆袭

有态度网友19GlcR
2026-09-06 15:28:10
就业降级上热搜,胖东来900个基层岗位8万人应聘,江浙沪重回月薪3000时代,劳务派遣成主流

就业降级上热搜,胖东来900个基层岗位8万人应聘,江浙沪重回月薪3000时代,劳务派遣成主流

Mr王的饭后茶
2026-09-05 18:17:40
中小学一定要买校服吗?教育部回应

中小学一定要买校服吗?教育部回应

新京报
2026-09-06 09:27:11
投篮像抛绣球!三无后卫上场时间全队第2,宫鲁鸣为何如此迷恋她?

投篮像抛绣球!三无后卫上场时间全队第2,宫鲁鸣为何如此迷恋她?

弄月公子
2026-09-04 23:08:05
阿森纳2比1逆转切尔西,哈弗茨厄德高建功

阿森纳2比1逆转切尔西,哈弗茨厄德高建功

绿茵狂热者
2026-09-07 02:33:03
奔驰那封回执,把星宇的国内公关干沉默了

奔驰那封回执,把星宇的国内公关干沉默了

娱乐圈的笔娱君
2026-08-31 01:19:35
武大举报风波升级!原配妻子身份查实:她竟也在同一所学校工作

武大举报风波升级!原配妻子身份查实:她竟也在同一所学校工作

小徐讲八卦
2026-09-06 07:34:45
工商银行、农业银行合计拟募资不超过2600亿元

工商银行、农业银行合计拟募资不超过2600亿元

每日经济新闻
2026-09-06 16:24:47
9月6日,人社部和财政部2026年基本养老金上调的通知公布了吗?

9月6日,人社部和财政部2026年基本养老金上调的通知公布了吗?

史之铭
2026-09-07 01:11:07
说真的,大部分人的存款都将归零。

说真的,大部分人的存款都将归零。

老陆不老
2026-09-06 20:07:12
西方战略专家曾直言:从国力角度来讲,中国领土恐怕最终会全收回

西方战略专家曾直言:从国力角度来讲,中国领土恐怕最终会全收回

张鼋卤说体育
2026-08-20 14:37:14
钱的威力大吗?老人有这个数的存款和退休金,就会有10个状态

钱的威力大吗?老人有这个数的存款和退休金,就会有10个状态

暖风吹过竹林
2026-09-06 10:36:46
伊朗称对等回应阶段已结束

伊朗称对等回应阶段已结束

财联社
2026-09-06 20:24:03
印度一大哥脚趾肿痛,医生说要截肢。女婿说先别切,第二天带他来中国,结果医生只说了三个字,全场愣住

印度一大哥脚趾肿痛,医生说要截肢。女婿说先别切,第二天带他来中国,结果医生只说了三个字,全场愣住

LULU生活家
2026-09-06 18:05:04
经济学家王德培:中国老百姓非常不容易,已进入急剧大洗牌阶段!

经济学家王德培:中国老百姓非常不容易,已进入急剧大洗牌阶段!

阿振观点
2026-08-31 06:10:08
普京背后高人浮出水面,俄罗斯的灵魂人物,若没她普京难撑到现在

普京背后高人浮出水面,俄罗斯的灵魂人物,若没她普京难撑到现在

文史达观
2025-03-05 06:45:05
女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

女性长期使用情趣用品,身体可能出现哪些不适?不少人缺乏认知

看世界的人
2026-08-07 09:22:50
卡拉格:哈弗茨在攻防两端都能发挥作用,哲凯赖什取代不了他

卡拉格:哈弗茨在攻防两端都能发挥作用,哲凯赖什取代不了他

懂球帝
2026-09-07 02:57:11
世界杯积分榜:中国女篮暂升小组第1出线希望大增,捷克2连败垫底

世界杯积分榜:中国女篮暂升小组第1出线希望大增,捷克2连败垫底

萧壛记录风土人情
2026-09-06 23:19:58
武大风波愈演愈烈!付某没上班,妻子就在武大,曾某人设彻底反转

武大风波愈演愈烈!付某没上班,妻子就在武大,曾某人设彻底反转

松林侃世界
2026-09-06 09:42:49
2026-09-07 04:20:49
智猩猩
智猩猩
AI 技术内容与服务平台
69文章数 3关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

中尼两国遇难失联人数为何相差如此大 专家解读

头条要闻

中尼两国遇难失联人数为何相差如此大 专家解读

体育要闻

3.9秒绝平!杨舒予18+5成女篮救世主

娱乐要闻

杨紫获白玉兰影后!爸爸:累了就回家

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

健康
教育
亲子
时尚
本地

脑梗取栓成功≠活下来,还有这三关

教育要闻

又有多所学校人事有变化!

亲子要闻

冲上热搜!这种鞋子不要给孩子天天穿

金秋最流行的鞋子,“红色”更时髦!

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

无障碍浏览 进入关怀版