网易首页 > 网易号 > 正文 申请入驻

Agent能力反超Fable 5!DeepSeek V4 Flash靠自验证提升上限,成本仅为1/11

0
分享至

智猩猩AI整理

编辑:金水

大模型会答错,这是常识。

但如果一个模型自己生成的答案里已经藏着正确解,只是它没认出来,那问题就不在"能不能做对",而在"能不能把对的挑出来"。

斯坦福、UC Berkeley、NVIDIA 的团队提出的LLM-as-a-Verifier最近放出的一组实验,把这个想法落了地:

用DeepSeek V4 Flash同时负责"写答案"和"挑答案",在Terminal-Bench 2.1上把系统成功率推到了88%,过了 Claude Fable 5,成本还低约 11 倍。


没有外接更强的 GPT 或 Claude,生成和验证用的是同一个模型。

不让模型报整数分,而是读评分 token 的 logits,对整条概率分布求期望,得到连续分数。

真正拉开差距的,是"多采样几次之后,能不能把那条对的轨迹选出来"。


  • 论文题目:

    LLM-as-a-Verifier: A General-Purpose Verification Framework

01

DeepSeek V4 Flash 的自验证实验

模型能验证自己的输出吗?

问题很直接,一个模型能不能给自己的 rollout当裁判?

在 Terminal-Bench 2.1 上,团队为每个任务用 deepseek-v4-flash 生成5条 mini-swe-agent 执行轨迹,然后用同一个模型当验证器去给这些轨迹打分、排序、选最优。

听起来像是"考生改自己的卷子",但结果并不随机,尽管验证器判的是自己模型的产出,选出的最优轨迹成功率远高于单次生成的 Pass@1。



几个值得品一下的点:

Best-of-3 把 79.4% 抬到 86.5%,Best-of-5 把 78.7% 推到 88.0%,多采样加自验证,是实打实的涨点,不是噪声。

Best-of-5 还有一个更关键的数字,Oracle(理想选择上限)达到 96.6%

说明对绝大多数任务,5 条候选里至少已经有一条成功了。

模型"会做",只是"没选对"。验证器的天花板很高,空间还很大。


成功率被拉到与更强的闭源模型相近水平,而 DeepSeek 一侧单任务成本约0.11 美元,对照模型约1.3 美元——成本不到后者的十分之一。

论文把 Terminal-Bench V2 排行榜上不同模型、不同 Agent 配置跑出的执行轨迹汇总到一起后,发现理想选择器对任务的覆盖率最高能到 98.9%,对的答案大概率就在候选里。


02

连续验证到底

怎么"分得出高下"

标准 LM 评委为什么容易翻车?

常见的 LLM-as-a-Judge,直接让模型吐一个 1–5 的整数分。

问题在两条质量其实差很多的長轨迹,很可能同时拿到 4 分或 5 分。

论文在 Terminal-Bench V2 上测到,单次离散打分的平局率达到 26.7%,超过四分之一的对比,直接判不出胜负。

LLM-as-a-Verifier是一个通用的「验证器框架」,给任意智能体(agent)提供细粒度反馈。核心思想和普通 LLM-as-a-Judge 不同,它不把评分压成一个离散分数。

LLM-as-a-Verifier 不只读最终分数,而是保留每个评分 token 的概率分布,再做概率加权,得到一条连续的验证分数。

就算两个候选都输出"4 分",只要模型对不同档位的置信分布不一样,连续分数照样能把它们拉开。


连续分数本身就能拉开好坏差距。在此基础上,验证还能沿三个方向继续放大:


1、评分粒度 G

把刻度从粗拉到细(比如 1 档到 20 档)。

模型并没有多获得信息,只是解码空间更细了,原先会被四舍五入成同分的邻近判断,现在能落在不同的连续值上。

信号噪比从 0.775 升到 0.799,准确率从 73.1% 到 77.5%。

2、重复评估 K

同一对多评几次再平均,相当于蒙特卡洛估计,方差随次数下降。

单次评估容易被无关特征带偏,多跑几次能压掉这部分噪声。准确率从 74.7% 提到 77.5%(K=1→16)。

3、标准分解 C

长程任务里“对不对”其实混了好几件事。

拆成是否满足需求、输出格式是否正确、日志有没有失败信号,分别评再平均,减少模型只盯最显眼因素就下结论的偏置。

单标准 75.2%–76.4%,三标准合起来 78.3%。

候选多了怎么办?

候选一多,两两比较是 O(N²),5 条还行,几十条就贵了。框架用Probabilistic Pivot Tournament(PPT)把成本压到 O(Nk):

1)环传递:随机哈密顿环先比相邻对,每个候选各当一次 A、一次 B,抵消位置偏好;

2)选枢轴:按环传成绩取前 k 个当枢轴;

3)枢轴锦标赛:非枢轴只跟枢轴比,预算集中在最不确定的头部候选;

4)聚合:把胜场质量归一化,取最高者返回。

重复评估时 A/B 槽位交替,位置偏差再次抵消。


实测 k=3 就略超此前 V1 的结果,k=9 已经接近全量两两比,却少算一大半比较。

03

怎么接入你的电脑

步骤一:安装

pip install llm-verifier

如果要跑最新开发版,克隆仓库后执行

pip install -e

步骤二:准备「验证器后端」

真正关键的是准备验证器后端。

llm_verifier 本身不直接打分,而是调用一个大模型当 verifier。

按仓库说明,需要在环境里配置 DEEPSEEK_API_KEY 或 VERTEX_API_KEY,也可以接一个能返回 logprobs 的 OpenAI 兼容服务。

verifier 必须能返回 logprobs,否则就退回成普通的离散打分。

步骤三:把密钥写进 .env

在项目根目录(或运行目录)创建 .env文件:

OPENAI_BASE_URL=http://localhost:8000/v1

04

总结

生成已经卷到头了,下一程的杠杆,在验证。

真正卡住系统上限的,是验证器还没把它们全挑出来。

5次采样距 96.6% 的理想上限仍有明显空间,下一步最直接的提升,就是把现有候选选得更准。

LLM-as-a-Verifier 最聪明的地方,不是又训了个更大的模型,而是换了个"读模型"的方式,把离散结论变成连续概率,再沿粒度、重复、分解三个维度缩放。

它对做 agent 的人最直接的启发可能是这句:别再让模型给自己盖棺定论,读它的概率,而不是听它的结论。

一个会答错的模型,开始自己给自己挑答案。它挑得还不够完美,但方向已经对了,多采样负责"覆盖到",连续验证负责"认出来"。

关注+星标,获取AI前沿进展与开源一线动态

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
刘翔发文后上海体育局通报:11年平均月薪7174元,几十万买断,体育人争光成了一张遮羞布

刘翔发文后上海体育局通报:11年平均月薪7174元,几十万买断,体育人争光成了一张遮羞布

李晚书
2026-09-10 15:36:04
今夜,利空!美国,重大发布

今夜,利空!美国,重大发布

券商中国
2026-09-11 00:11:56
“高考数学132分,入学考试12分”,大学回应

“高考数学132分,入学考试12分”,大学回应

第一财经资讯
2026-09-10 11:04:09
网传中国农大一学生因不当言论被开除,网友不服……

网传中国农大一学生因不当言论被开除,网友不服……

慧翔百科
2026-09-10 17:21:21
注意了!9月30日起零钱通不能微信付款,你的钱还能正常用吗?

注意了!9月30日起零钱通不能微信付款,你的钱还能正常用吗?

一些小事
2026-09-09 06:23:03
浏览破亿!Anthropic对齐负责人亲认:十年内AI灭绝人类概率超10%

浏览破亿!Anthropic对齐负责人亲认:十年内AI灭绝人类概率超10%

新智元
2026-09-10 09:46:52
男子教师节给40多位老师发祝福短信后被停机,运营商:证明号码是本人使用可恢复

男子教师节给40多位老师发祝福短信后被停机,运营商:证明号码是本人使用可恢复

澎湃新闻
2026-09-10 17:46:08
韩旭21+9杨舒予19分,女篮双核苦苦支撑,29分不敌法国止步8强

韩旭21+9杨舒予19分,女篮双核苦苦支撑,29分不敌法国止步8强

钉钉陌上花开
2026-09-10 22:02:58
事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

人生录
2026-09-11 00:05:21
潜逃25年!命案女逃犯在乌鲁木齐落网

潜逃25年!命案女逃犯在乌鲁木齐落网

环球网资讯
2026-09-10 20:20:46
重庆一初二女生在楼道里遭殴打,嫌疑人已被抓获,公安局长通宵审问,刑事拘留2人行政拘留3人

重庆一初二女生在楼道里遭殴打,嫌疑人已被抓获,公安局长通宵审问,刑事拘留2人行政拘留3人

扬子晚报
2026-09-10 15:32:19
快讯!巴基斯坦可能要打大仗了!

快讯!巴基斯坦可能要打大仗了!

故事终将光明磊落
2026-09-10 10:55:49
央行、证监会送温暖!盘后,A股利好来得太及时了

央行、证监会送温暖!盘后,A股利好来得太及时了

星图金融研究院
2026-09-10 15:42:53
山东青岛一外籍货轮靠港维修期间起火,什么是“靠港维修”?维修期间有哪些问题必须注意?

山东青岛一外籍货轮靠港维修期间起火,什么是“靠港维修”?维修期间有哪些问题必须注意?

贵重物品爱美食
2026-09-10 19:14:47
柳叶刀:中国人精神压力极大 全国精神障碍患病人数已达1.9亿

柳叶刀:中国人精神压力极大 全国精神障碍患病人数已达1.9亿

可达鸭面面观
2026-09-10 13:18:53
青岛货轮火灾事故已致25人遇难 涉事货轮为散货船,长约190米,8月31日抵达青岛

青岛货轮火灾事故已致25人遇难 涉事货轮为散货船,长约190米,8月31日抵达青岛

红星新闻
2026-09-10 21:41:28
火力全开,几度哽咽,扎哈罗娃五分钟怒斥日本:“你们不应该跪下来道歉吗”,屠杀中国、苏联平民时,戴的不正是菊花纹章吗

火力全开,几度哽咽,扎哈罗娃五分钟怒斥日本:“你们不应该跪下来道歉吗”,屠杀中国、苏联平民时,戴的不正是菊花纹章吗

第一财经资讯
2026-09-10 14:22:34
警察找了逃犯8年没人影,结果他早变性成女人?看完照片,怪不得找不到...

警察找了逃犯8年没人影,结果他早变性成女人?看完照片,怪不得找不到...

英国那些事儿
2026-09-10 00:48:21
女篮输法国29分!揪出2个表现最差之人,坑惨了球队

女篮输法国29分!揪出2个表现最差之人,坑惨了球队

体育哲人
2026-09-10 22:35:19
尴尬现状!中国三大球集体哑火,已全部走下亚洲之巅

尴尬现状!中国三大球集体哑火,已全部走下亚洲之巅

米修体育
2026-09-10 23:51:55
2026-09-11 02:47:00
智猩猩
智猩猩
AI 技术内容与服务平台
91文章数 4关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

特朗普:如果伊朗拥核 我会对最高领袖说"能为您效劳吗"

头条要闻

特朗普:如果伊朗拥核 我会对最高领袖说"能为您效劳吗"

体育要闻

16岁的国产小库里,还有多少功课要做

娱乐要闻

参加晚宴,刘亦菲因合照深陷争议

财经要闻

向松祚:年轻人不必过早买房

汽车要闻

标配全线控底盘 全新一代智己LS6预售20.99万起

态度原创

时尚
本地
教育
家居
军事航空

“蛇精”围攻,葫芦爷爷求饶

本地新闻

拼假 13 天国内长线路线合集

教育要闻

再次学会说话

家居要闻

2026建博会(广州) 公装联探展交流活动

军事要闻

中东“两线战火”同时升级

无障碍浏览 进入关怀版