网易首页 > 网易号 > 正文 申请入驻

4B模型下棋比肩大师、还会讲棋,陈丹琦团队怎么做到的?

0
分享至

编辑|Panda


9 月 27 日,第 46 届国际象棋奥林匹克团体赛在撒马尔罕落幕。东道主乌兹别克斯坦在最后一轮以 2.5 比 1.5 击败乌克兰,第二次捧起公开组金牌,中国女队则第七次登上女子组最高领奖台。下一场焦点大战也近在眼前:11 月底,两位 20 岁的棋手古克什(Gukesh D)与辛达罗夫(Javokhir Sindarov)将在日内瓦争夺世界冠军头衔,这将是史上最年轻的一场世界冠军对决。

看过近几年顶级棋赛直播的人,大概都熟悉画面一侧那根上下浮动的评估条。引擎会告诉你此刻白方领先半个兵,或者某步棋让胜率一落千丈,但它从不解释原因——这仍要靠坐在解说席上的特级大师。



棋盘最左边那根黑白相间、上下浮动的竖条就是评估条

这其实是 AI 领域一个普遍困境的缩影。最强的专家模型往往是沉默的,而最会说话的语言模型,在专业领域里又常常不够强。国际象棋引擎早已把人类远远甩在身后,却说不出一句人话。前沿大模型能写出头头是道的分析,可它推荐的着法本身未必站得住,解释也就成了无本之木。

近日,普林斯顿大学陈丹琦团队在 arXiv 发布了一项成果,尝试把这两端接起来。



他们训练的模型名叫QUEEN,总参数量约 4B,棋力接近一位典型特级大师,同时能用自然语言讲清楚自己为什么这样走。





  • 论文标题:Language Models that Play Chess and Explain Their Moves
  • 论文地址:https://arxiv.org/abs/2610.03695v1
  • 模型地址:https://huggingface.co/collections/princeton-nlp/queen-chess-models
  • 开源代码:https://github.com/queen-project/queen

会下的不会说,会说的下不好

国际象棋与 AI 的缘分可以追溯到 1950 年。那一年,克劳德·香农(Claude Shannon)估算了国际象棋的计算复杂度,并设想了下棋机器的样子。

此后七十多年,从依靠手工评估函数的「深蓝」,到靠自我对弈成长起来的 AlphaZero,再到基于 Transformer 的 Leela Chess Zero(Lc0),引擎一代比一代强。但它们输出的始终只是一个着法和一串胜率数字。

语言模型这边的问题恰好相反。论文梳理发现,此前专门微调过的国际象棋语言模型大多只在孤立的战术题上训练和评测,连在这种受限场景里都难以选出好棋,解释的质量自然有限。今天的前沿模型进步明显,能给出像样的解释,但代价不菲:作者在附录里提到,用 GPT-5.6-Sol 的高推理档下一整盘棋,成本常常超过 15 美元。

这件事的意义不止于棋盘。论文表示,截至 10 月 2 日,全球共有 1899 位特级大师,不到活跃线上棋手的万分之一。绝大多数棋手一辈子都等不到一位特级大师坐下来给自己讲棋。 一个既下得好、又讲得清、还跑得便宜的模型,填补的正是这块空白。

一位沉默的大师,一位会说话的解说员

QUEEN 的思路可以用一个场景来理解:让一位只会用手指棋盘的沉默大师,和一位口才很好但棋力平平的解说员搭档。大师负责「看」,解说员负责「说」,关键在于让解说员真正读懂大师的手势。



具体来说,「沉默的大师」是 Lc0 家族的BT5 网络(论文称其为 Leela),约 240M 参数、15 层,输入固定为 64 个 token,正好对应棋盘上的 64 个格子,不做搜索就能下到接近超人的水平。

「解说员」是 HuggingFace 的SmolLM3-3B,一个几乎没受过国际象棋训练的通用指令模型。

两者之间的桥梁借鉴了视觉语言模型Flamingo 的门控交叉注意力:Leela 第 i 层的表征,接入语言模型第 2i 层之前,一共插入 16 个桥接模块,约 470M 参数。与原版 Flamingo 只取编码器最后一层不同,这种逐层对接让语言模型能同时看到 Leela 浅层和深层的「想法」。门控初始值设为零,桥接一开始相当于不存在,再随训练逐步打开,避免早期噪声干扰。

接下来是教解说员读懂手势。团队设计了一套四阶段问答课程,由浅入深:先问「某个格子上是什么子」这类静态问题,再问「这个马能走到哪」「谁能将军」这类动态问题,然后给出 1 到 8 步走法,让模型推演出未来局面再作答。所有答案都由程序生成并校验。这一阶段 Leela 和语言模型本体都被冻结,只训练桥接层和新增的词表。之所以要新增 64 个格子和 12 种棋子的专用 token,是因为原有分词器对格子名拆分得不一致,而「bishop」「knight」这些词在日常语料里带着与棋盘无关的含义。

训练后,模型在四类问题上的准确率分别达到 99.97%、99.97%、98.97% 和 96.07%。

用自然语言版的「贝尔曼更新」自我进化

学会读棋之后,模型还不会写分析。团队先用 GPT-5.6-Sol 的低推理档为 15000 个局面生成示范解释,花费 652.35 美元,过滤掉含非法着法或失误的样本后剩下 8602 条,用来做第一轮监督微调,得到的模型 Elo 为 1782。解释写得通顺,但推荐的棋常常不靠谱。

真正让 QUEEN 变强的,是新提出的迭代搜索蒸馏。它的灵感来自 AlphaZero:用搜索得到更好的判断,再把判断「压」回网络里,让网络下次不搜也能直接想到。QUEEN 的做法是把这个过程搬到自然语言上,作为理查德·贝尔曼(Richard Bellman)价值更新的语言版本。

这很像一位棋手的复盘习惯。面对一个局面,模型先写出三个候选着法;然后分别走一步,把三个新局面各自重新分析一遍;如果某个子局面的分析本身出了错,就顺着这个错误继续往下钻,直到找到模型「刚好力所不及」的位置。

随后,由 Qwen3.8-27B 把三份子分析合并成一份对原局面的完整解释,说明为什么选这一步、另外两步差在哪里,并被明确要求不得添加任何新内容。只有当合并后的结论比模型原先的判断更好时,这条数据才会被保留,用来训练下一轮模型。



论文给出了一些例子。白方面对三个候选:Rh2、Qh2+ 和 Qxf3。从对手视角看,三个子局面的评估分别是必被将死、-0.1 和 0.0,取对对手最不利的那个,结论是看似安静的 Rh2 才是杀着,而诱人的将军 Qh2+ 会放走对方的王。每一轮大约从 40 万个根局面出发,最终产出 15 万到 28 万条训练数据。七轮之后,第八代模型被正式命名为 QUEEN。

实验结果

棋力方面,每个模型与 8 个强度不同的引擎对弈 32 盘,按 Lichess 等级分体系换算。QUEEN 最终达到 2697 分,Gemini-3.1-Pro 为 2201,GPT-5.6-Sol 为 2071,同为 4B 规模的前作 C1-4B 则 32 盘全负。作为参照,Lichess 上特级大师快棋等级分的中位数是 2730。七轮迭代中,QUEEN 的分数从 1782 一路涨到 2697,累计提升 915 分,中间第五到第六轮曾短暂回落约 100 分。



论证能力方面,团队在 1000 道战术题和 1000 个实战局面上检验模型给出的主变是否出错。在战术题上,QUEEN 首步不失误率为 91.6%,比第二名 Gemini 高出 9 个百分点;在实战局面上这一数字为 97.1%。

不过,论文也坦率展示了短板。在 GPT-5.6-Sol 担任评委的打分里,QUEEN 的结构连贯性为 3.51,与 Sol 持平,但概念连贯性只有 2.76,明显低于 Sol 的 3.61,语言流畅度也略逊于前沿模型。

换句话说,它找到的变化是对的,但在用「牵制」「前哨」这类术语描述局面时更容易张冠李戴。作者分析,自我蒸馏能把搜索树逐渐压进权重,却教不会模型描述它没见过的棋型,错误的概念还可能在合并过程中层层传递。

消融实验给出了两个结论:

  • Leela 编码器和四阶段课程缺一不可,去掉任何一个,模型的棋力都会跌到 514 分。
  • QUEEN 并非简单复读 Leela:在有 5 个以上合理着法的局面中,它有 53.8% 的情况选了与 Leela 不同的棋。

团队还试验了完全不依赖前沿大模型的版本,用 Stockfish 手工评估特征加模板生成初始解释,结果前四轮的棋力反而更高,第一轮就达到 2115 分。

结语

QUEEN 的价值不只在国际象棋。它真正提供的是一套配方:在一个已有「沉默专家」的领域,用交叉注意力把专家模型接到语言模型上,先用课程教会语言模型读懂专家的表征,再用搜索加蒸馏的方式让解释越写越好。

作者认为,这套方法可以迁移到游戏、机器人和计算机操作等领域,这些地方恰好都不缺强大但不会说话的专用模型。

再过一个多月,日内瓦的世界冠军赛直播里,评估条依然只会给出数字,而能把数字讲成道理的 AI,或许已经不远了。



特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
封杀韦世豪!!!

封杀韦世豪!!!

中场阴谋家
2026-10-06 22:50:58
一场2-1,郑钦文成三重赢家:重返八强 排名超老对手,奖金130万

一场2-1,郑钦文成三重赢家:重返八强 排名超老对手,奖金130万

大秦壁虎白话体育
2026-10-07 21:26:07
泰国失联的上海教师回国!多方出手,囚禁缅甸11天获救,细节炸裂

泰国失联的上海教师回国!多方出手,囚禁缅甸11天获救,细节炸裂

牛锅巴小钒
2026-10-07 19:50:21
答案来了,韦世豪被红牌罚下为什么还笑?球迷:坚决支持!

答案来了,韦世豪被红牌罚下为什么还笑?球迷:坚决支持!

我就是一个说球的
2026-10-07 19:57:12
上海一家三口长假爬山,下山走野路结果被困,“当时真绝望了,什么都看不见,我还带着老婆、10岁的孩子……”国庆前刚有人在此失足坠崖

上海一家三口长假爬山,下山走野路结果被困,“当时真绝望了,什么都看不见,我还带着老婆、10岁的孩子……”国庆前刚有人在此失足坠崖

都市快报橙柿互动
2026-10-07 17:37:20
为什么一定要拼尽全力考上985、211?不是为了高人一等,是为了以后不用向生活低头

为什么一定要拼尽全力考上985、211?不是为了高人一等,是为了以后不用向生活低头

好爸育儿
2026-10-07 11:07:25
俄罗斯鼠疫事件:实验室鼠疫泄漏,研究员死亡,200人隔离。

俄罗斯鼠疫事件:实验室鼠疫泄漏,研究员死亡,200人隔离。

贴小君
2026-10-07 11:47:34
四川宜宾市高县发生3.0级地震,震源深度5千米

四川宜宾市高县发生3.0级地震,震源深度5千米

界面新闻
2026-10-07 19:01:38
残雪再次领跑赔率榜!诺贝尔文学奖明晚揭晓,会花落中国作家吗?

残雪再次领跑赔率榜!诺贝尔文学奖明晚揭晓,会花落中国作家吗?

都市快报橙柿互动
2026-10-07 20:16:54
在泰失联的上海音乐教师已安全回国

在泰失联的上海音乐教师已安全回国

上观新闻
2026-10-07 15:49:12
28岁实验员打碎病原体试管后离世,近200人隔离,鼠疫疑云再起

28岁实验员打碎病原体试管后离世,近200人隔离,鼠疫疑云再起

庄时利和
2026-10-07 13:41:12
1000赛9连败!周杰伦现场观战,张之臻遭逆转止步上海大师赛首轮

1000赛9连败!周杰伦现场观战,张之臻遭逆转止步上海大师赛首轮

全景体育V
2026-10-07 17:01:03
凌晨于北京离世?同时交往8个男友?75岁的刘晓庆私生活谣言离谱

凌晨于北京离世?同时交往8个男友?75岁的刘晓庆私生活谣言离谱

草莓信箱
2026-10-07 02:09:07
一个蛋挞,照出多少“精神穷人”

一个蛋挞,照出多少“精神穷人”

大道微言
2026-10-07 17:06:26
高市早苗对华重磅改口,一名39岁女性的生命换来的?

高市早苗对华重磅改口,一名39岁女性的生命换来的?

健身狂人
2026-10-06 04:25:10
中国可能要全面双休,全面双休意味着什么?对中国人有什么影响?

中国可能要全面双休,全面双休意味着什么?对中国人有什么影响?

云霄纪史观
2026-10-07 16:37:34
闹大了!网红解密川剧变脸账号消失,变脸是国家二级机密?网友:封号或另有原因

闹大了!网红解密川剧变脸账号消失,变脸是国家二级机密?网友:封号或另有原因

火山詩话
2026-10-07 07:44:10
大闹航班的欧皓辰后续来了,企业至今不敢认领,背后原因太现实

大闹航班的欧皓辰后续来了,企业至今不敢认领,背后原因太现实

削桐作琴
2026-10-07 18:24:14
41岁高中教师突发心梗离世,妻子:出事当天他原本准备去家访,还特意早起理了发;女儿发文缅怀父亲:最后一课,学会接受离别

41岁高中教师突发心梗离世,妻子:出事当天他原本准备去家访,还特意早起理了发;女儿发文缅怀父亲:最后一课,学会接受离别

都市快报橙柿互动
2026-10-07 19:46:41
俄罗斯鼠疫信息被指不透明,免签国人员要小心了,鼠疫属于甲类传染病,新冠还是乙类传染病,比新冠要严重很多,肺鼠疫未治疗死亡100%

俄罗斯鼠疫信息被指不透明,免签国人员要小心了,鼠疫属于甲类传染病,新冠还是乙类传染病,比新冠要严重很多,肺鼠疫未治疗死亡100%

村里的月光
2026-10-07 15:16:19
2026-10-07 23:43:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14143文章数 142744关注度
往期回顾 全部

体育要闻

从骑马舞到开口全中文 德约在北京不止七冠

头条要闻

地雷风波升级 金与正强硬发声:就是野兽也都不能进出

头条要闻

地雷风波升级 金与正强硬发声:就是野兽也都不能进出

娱乐要闻

蔡康永风波再升级!这次谁也救不了他

财经要闻

谷歌签下科技史上最大核能协议

科技要闻

诺贝尔化学奖揭晓,两位科学家摘得大奖

汽车要闻

智能化再提升 2027款东风标致、东风雪铁龙新车更人性化了

态度原创

本地
健康
家居
公开课
军事航空

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

刷酸祛痘,为什么有人翻车?

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

外舰跟监遵义舰 结果自己先"趴窝"了

无障碍浏览 进入关怀版