网易首页 > 网易号 > 正文 申请入驻

00后硕士揭开AI推理“黑科技”:两个Token,基模追平强化学习版本

0
分享至


智东西
作者 杨京丽
编辑 李水青

智东西10月10日报道,一项来自麻省理工学院(MIT)等机构的研究发现,只要固定基础模型回答开头的两个Token,就能让模型的数学推理成绩接近对应的强化学习版本。

以艾伦人工智能研究所(Ai2)的基础模型Olmo-3-7B为例,将回答固定为“.\n\nOkay”开头后,模型在MATH-500上的准确率从42%升至78%,超过其强化学习版本的75%。


这个过程没有修改模型参数,也没有给模型增加新的解题示例。模型只是换了一个回答起点,原本没有稳定表现出来的解题能力,似乎就更容易被调用出来。

换句话说,基础模型答错题,有时不一定是完全不会做,而是没有进入能够解题的状态。强化学习的一部分作用,可能正是让模型更容易选择这种有效的回答开头。

这一发现来自论文《基础模型可以借助训练数据中的线索进行推理(Base Models Can Reason By Taking a Cue From Training Data)》。论文于10月5日提交,由MIT、加州大学伯克利分校、华盛顿大学和艾伦人工智能研究所的研究者共同完成。

论文第一作者是麻省理工学院硕士生索菲·L·王(Sophie L. Wang)和加州大学伯克利分校博士生阿米尔·德拉维德(Amil Dravid)。索菲·L·王目前仍是MIT的硕士生,她从2023年进入MIT本科,2026年进入MIT硕士,目前她已先后在ICML和NeurIPS上发表研究成果。


论文链接:

https://arxiv.org/abs/2610.06851

项目链接:

https://www.sophielwang.com/cues

开源地址:

https://github.com/sophicle/cues

一、回答开头只改两个token,基础模型准确率追平强化学习版本

论文将模型回答拆分为“开头token线索”和后续生成内容两部分。研究者通过预先固定回答开头,观察不同开头如何改变模型接下来的生成结果。

他们首先观察Olmo-3-7B在MATH-500上的回答。正确答案中,约有50%的回答以“.\n\n”(句号加两个换行)开头,错误答案中这一比例只有14%。句号和换行本身没有提供数学知识,却与正确率出现了明显关联。

研究者随后从模型可能生成的回答开头中寻找有效线索。他们先用搜索方法找出基础模型较可能生成的短开头,再让模型从每个开头继续回答,比较多次采样结果的一致性。

对Olmo-3-7B,最终选中的开头是“.\n\nOkay”;对Qwen3-14B,选中的是“ Alright,”。研究者把这些文字预先填入模型回答,再让模型自行生成后续内容。

在MATH-500上,Olmo-3-7B基础模型自行生成回答开头时,其准确率约为42%;将回答开头固定为“.\n\nOkay”后,准确率升至约78%,高于其强化学习版本约75%的成绩。

Qwen3-14B使用“ Alright,”作为回答开头后,准确率则从72%提高到87%,与强化学习版本持平。相同开头还被用于GSM8K、AMC 23、AIME 2024等数学测试,在多数测试中都能带来提升。在代码生成测试HumanEval上,固定开头提高了Olmo-3-7B的成绩;Qwen3-14B的成绩则与不固定开头时相近。


论文中展示了一道具体题目的生成差异。题目较为简单,要求计算834名学生占全校人数三分之二时,全校共有多少名学生。

当模型以“.\nAnswer”开头时,它直接给出“1002”,答案错误;当模型以“.\n\nOkay”开头时,它先列出“(2/3)×T=834”,计算出1251,随后又主动检查结果,确认计算没有问题。设置新开头后,模型给出了正确的答案,生成过程中,模型没有获得额外提示,也没有更换参数,仅修改了回答开头。

二、从14%升至65%,强化学习先改变模型的回答开头

如果基础模型在固定开头后已经能达到接近强化学习模型的成绩,强化学习究竟改变了什么?

研究者采用RL-Zero设置,让模型直接根据自己生成答案的对错获得奖励。比较强化学习前后的模型后,他们发现,两者预测分布的最大差异集中在回答最开始的两个token。

对Olmo-3-7B,强化学习将“.\n\nOkay”的生成概率从0.14提高到0.65;对Qwen3-14B,“ Alright,”的生成概率从0.04提高到0.58。强化学习前后,模型的预测差异主要集中在回答最开始的两个token,之后差异明显减小。


研究者还把强化学习模型已经生成的回答开头交给基础模型,让基础模型从相同位置继续回答。Olmo-3-7B在这种条件下可以达到强化学习模型的准确率。

训练曲线显示,预先固定有效开头后,Olmo模型的成绩大约相当于标准强化学习训练100步后的水平,Qwen模型则相当于约50步后的水平。

这说明,在这组实验中,强化学习的一部分作用可能是提高模型选择有效推理开头的概率,让它更容易进入原本已经存在的推理路径。

研究者还控制了回答长度。部分开头会让模型写出更长的回答,但准确率仍低于不固定开头的结果;在相同token预算下,“.\n\nOkay”仍保持优势。因此,成绩提升不能只用回答变长来解释。


三、训练数据改写词语关联,“Chicken”也能诱导推理

“Okay”为什么有效?它可能符合人类开始思考时的表达习惯,但研究者希望进一步确认,效果是否来自训练数据中反复出现的词语关联。

他们将Olmo模型中期训练数据里与推理轨迹共同出现的“Okay”替换为“Chicken”,再从相同检查点继续训练。测试时,模型都被固定为以“.\n\nChicken”开头。

在原始基础模型中,固定“.\n\nChicken”后的MATH-500准确率约为18%,低于不固定开头时的42%。重新训练后,模型则会沿着推理文本的模式继续生成,准确率升至77%,接近“.\n\nOkay”开头的78%。

在使用10B-token中期训练数据的重训实验中,固定“.\n\nChicken”后,MATH-500准确率从2.4%升至37.2%;在使用100B-token数据的另一组实验中,准确率则从18.2%升至76.9%。两组实验的数据规模不同,但都说明,重新建立“Chicken”与推理文本之间的训练关联后,这个词才具备了推理线索的作用。


修改后的模型也没有忘记Chicken的日常含义。面对“A chicken is a”或“She roasted the chicken”这样的句子,它仍然可以生成与鸟类或食物有关的内容。

研究者还将训练数据中的“step by step”替换成“duck duck goose”。重新训练后,“Think duck duck goose”也能像“Think step by step”一样诱导模型推理。

隐藏状态分析显示,不同开头会把模型带向不同类型的训练文本。“.\n\nOkay”更接近合成推理轨迹,“To”更接近解释型数学文本,“Answer”则更接近简短问答文档。研究者还发现,线索越早出现在回答中,产生的影响越持久;等到第三至第六段才插入“Okay”,效果会明显下降。


四、修改回答开头,模型可能拒绝请求

此外,研究者还把同样的方法用于安全测试中,观察不同回答开头会如何影响模型拒绝或遵从请求。

在Olmo-3-7B中,以“I’m sorry”开头的回答更容易拒绝请求,但也会增加对无害请求的误拒绝;“Okay,”会减少拒绝,并增加模型对危险请求给出有害内容的概率。

数学实验中有效的“.\n\nOkay”则呈现出另一种效果:模型会更多拒绝危险请求,同时减少对正常请求的误拒绝,表现出更有选择性的拒绝行为。

论文还发现,仅仅改变空格、标点和换行方式,就可能带来不同结果。“Okay,”和“.\n\nOkay”看起来很接近,但前者可能成为更容易遵从危险请求的开头,后者则更接近先分析、再决定是否拒绝的回答模式。


这说明,回答开头对模型行为的影响并不局限于数学推理,也涉及拒答、安全等问题。

结语:模型能力和稳定发挥之间,还隔着一个“开头”

通过这篇论文可以发现:模型答错题,有时不代表它完全不会做,也可能是没有进入正确的思路。对Olmo-3-7B来说,只是在回答开头加上“.\n\nOkay”,准确率就从约42%提高到了78%。

“Chicken”的实验则说明,词语能起什么作用,和它在训练数据中经常跟什么内容一起出现有关。经过重新训练后,“Chicken”也能引导模型一步步解题。模型记住的可能不只是词语本身,还包括这个词通常会带来什么样的回答。因此,在实验条件下,预先固定有效的回答开头,都可能帮助模型进入更适合解题的状态。

不过,需要注意的是,实验测试的模型主要为Olmo-3-7B和Qwen3-14B,无法确定在其他模型上是否能产生类似的效果。这种方法是否有效,还要看具体模型和任务。这一方法虽然在一定程度上能够提高准确率,但想让模型面对不同问题和不同表达时都能稳定回答,仍然需要高质量的训练数据和充分的模型训练。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
演员周杰透露10年来每天只吃1顿饭,网友质疑“不健康”,医生提醒:长期如此容易营养缺乏

演员周杰透露10年来每天只吃1顿饭,网友质疑“不健康”,医生提醒:长期如此容易营养缺乏

极目新闻
2026-10-09 22:50:14
加拿大、丹麦、德国、法国、意大利、日本、荷兰、英国,发表联合声明

加拿大、丹麦、德国、法国、意大利、日本、荷兰、英国,发表联合声明

政知新媒体
2026-10-10 07:51:17
李兆熊因器官衰竭离世,享年89岁;妻子透露:丧礼预计于10月中旬举行;出生演艺世家,曾凭《大地恩情》让TVB剧集腰斩

李兆熊因器官衰竭离世,享年89岁;妻子透露:丧礼预计于10月中旬举行;出生演艺世家,曾凭《大地恩情》让TVB剧集腰斩

大风新闻
2026-10-10 10:26:04
全球首次!人形机器人用灵巧手自主叠衣,西湖机器人做到了

全球首次!人形机器人用灵巧手自主叠衣,西湖机器人做到了

机器之心Pro
2026-10-09 17:53:00
河南商丘一新郎遭好友婚闹,新人特意租了宾利,有人直接用鸡蛋酱油砸新郎,专业跟拍还没开拍就“翻车”,新娘满心期待落了空

河南商丘一新郎遭好友婚闹,新人特意租了宾利,有人直接用鸡蛋酱油砸新郎,专业跟拍还没开拍就“翻车”,新娘满心期待落了空

大风新闻
2026-10-10 14:49:08
商务部解读中欧贸易投资磋商机制第二次例会成果

商务部解读中欧贸易投资磋商机制第二次例会成果

新华社
2026-10-10 15:20:05
大满贯女单决赛今日出炉,如果王曼昱击败张本美和,将有4大利好

大满贯女单决赛今日出炉,如果王曼昱击败张本美和,将有4大利好

南海浪花
2026-10-10 06:32:28
履新半年,韩少帅兑现捷豹路虎“新时代”

履新半年,韩少帅兑现捷豹路虎“新时代”

汽车商业评论
2026-10-10 10:03:54
湖南永州“女局长出轨多人”举报者再发声 当地已成立联合调查组展开核查

湖南永州“女局长出轨多人”举报者再发声 当地已成立联合调查组展开核查

封面新闻
2026-10-10 15:17:03
乐道首战告捷:两年、20万台与23.4万均价

乐道首战告捷:两年、20万台与23.4万均价

36氪
2026-10-08 17:11:47
尊界制动踏板支架断裂后,岚图、本田、仰望等多家车企高管晒自家刹车部件

尊界制动踏板支架断裂后,岚图、本田、仰望等多家车企高管晒自家刹车部件

澎湃新闻
2026-10-10 10:54:30
秘鲁一位名叫希特勒·墨索里尼的男子当选市长,该国数千人名叫“希特勒”;2018年也曾产生“希特勒”市长,竞选口号是“我是好希特勒”

秘鲁一位名叫希特勒·墨索里尼的男子当选市长,该国数千人名叫“希特勒”;2018年也曾产生“希特勒”市长,竞选口号是“我是好希特勒”

极目新闻
2026-10-10 14:46:03
人均身高不足1.7米,为何高铁站要修60米高?面子工程又一体现?

人均身高不足1.7米,为何高铁站要修60米高?面子工程又一体现?

抽象派大师
2026-10-10 00:53:21
不扒不知道,一扒吓一跳!被判死刑的明珍珍,私下生活能有多壕

不扒不知道,一扒吓一跳!被判死刑的明珍珍,私下生活能有多壕

哄动一时啊
2026-10-10 11:38:30
逼空姐下跪的欧某人,真的是企业高管?

逼空姐下跪的欧某人,真的是企业高管?

仕道
2026-10-10 09:00:12
大闸蟹全线崩盘,面子经济碎了

大闸蟹全线崩盘,面子经济碎了

城事堂
2026-10-10 09:43:42
湖南永州“女局长出轨多人”举报者再发声 当地已成立联合调查组展开核查

湖南永州“女局长出轨多人”举报者再发声 当地已成立联合调查组展开核查

大风新闻
2026-10-10 16:03:31
美国富人为啥不来中国过安稳日子?其实在全球富人眼里,中国才是“最危险的”

美国富人为啥不来中国过安稳日子?其实在全球富人眼里,中国才是“最危险的”

扶苏聊历史
2026-10-10 10:37:15
杀人祭天!一个中国人卖40万!国庆“最炸裂”热搜背后的恐怖,你根本想象不到

杀人祭天!一个中国人卖40万!国庆“最炸裂”热搜背后的恐怖,你根本想象不到

脆皮先生
2026-10-08 21:18:52
河北沧州一女子花15元网购9斤蜜薯后申请仅退款,称有本事就过来拿,商家跨省驱车来回800公里连夜取回:最终只拿回3斤,就是为了出一口气

河北沧州一女子花15元网购9斤蜜薯后申请仅退款,称有本事就过来拿,商家跨省驱车来回800公里连夜取回:最终只拿回3斤,就是为了出一口气

扬子晚报
2026-10-10 07:35:46
2026-10-10 16:39:00
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12709文章数 117184关注度
往期回顾 全部

科技要闻

上世纪成熟的踏板,为何今天还会断裂?

头条要闻

女局长被指出轨多人 同意给前夫500万考虑影响写330万

头条要闻

女局长被指出轨多人 同意给前夫500万考虑影响写330万

体育要闻

十年回首:湖人三榜眼的夏天,与NBA无关

娱乐要闻

宋佳一串三大满贯 争议随之而来

财经要闻

蹭尊界流量?岚图汽车在“玩火”

汽车要闻

二十载再越巅峰 第五代全新别克君越今日正式上市

态度原创

艺术
游戏
家居
亲子
教育

艺术要闻

老一辈艺术家 蔡亮作品集

XGP 10月第一批新阵容公布 《战地6》领衔

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

马上评|食用银鳕鱼致汞中毒,“儿童装”为何没能更安全

教育要闻

评论|杏坛之光,温润山海

无障碍浏览 进入关怀版