网易首页 > 网易号 > 正文 申请入驻

Agent能力反超Fable 5!DeepSeek V4 Flash靠自验证提升上限,成本仅为1/11

0
分享至

智猩猩AI整理

编辑:金水

大模型会答错,这是常识。

但如果一个模型自己生成的答案里已经藏着正确解,只是它没认出来,那问题就不在"能不能做对",而在"能不能把对的挑出来"。

斯坦福、UC Berkeley、NVIDIA 的团队提出的LLM-as-a-Verifier最近放出的一组实验,把这个想法落了地:

用DeepSeek V4 Flash同时负责"写答案"和"挑答案",在Terminal-Bench 2.1上把系统成功率推到了88%,过了 Claude Fable 5,成本还低约 11 倍。


没有外接更强的 GPT 或 Claude,生成和验证用的是同一个模型。

不让模型报整数分,而是读评分 token 的 logits,对整条概率分布求期望,得到连续分数。

真正拉开差距的,是"多采样几次之后,能不能把那条对的轨迹选出来"。


  • 论文题目:

    LLM-as-a-Verifier: A General-Purpose Verification Framework

01

DeepSeek V4 Flash 的自验证实验

模型能验证自己的输出吗?

问题很直接,一个模型能不能给自己的 rollout当裁判?

在 Terminal-Bench 2.1 上,团队为每个任务用 deepseek-v4-flash 生成5条 mini-swe-agent 执行轨迹,然后用同一个模型当验证器去给这些轨迹打分、排序、选最优。

听起来像是"考生改自己的卷子",但结果并不随机,尽管验证器判的是自己模型的产出,选出的最优轨迹成功率远高于单次生成的 Pass@1。



几个值得品一下的点:

Best-of-3 把 79.4% 抬到 86.5%,Best-of-5 把 78.7% 推到 88.0%,多采样加自验证,是实打实的涨点,不是噪声。

Best-of-5 还有一个更关键的数字,Oracle(理想选择上限)达到 96.6%

说明对绝大多数任务,5 条候选里至少已经有一条成功了。

模型"会做",只是"没选对"。验证器的天花板很高,空间还很大。


成功率被拉到与更强的闭源模型相近水平,而 DeepSeek 一侧单任务成本约0.11 美元,对照模型约1.3 美元——成本不到后者的十分之一。

论文把 Terminal-Bench V2 排行榜上不同模型、不同 Agent 配置跑出的执行轨迹汇总到一起后,发现理想选择器对任务的覆盖率最高能到 98.9%,对的答案大概率就在候选里。


02

连续验证到底

怎么"分得出高下"

标准 LM 评委为什么容易翻车?

常见的 LLM-as-a-Judge,直接让模型吐一个 1–5 的整数分。

问题在两条质量其实差很多的長轨迹,很可能同时拿到 4 分或 5 分。

论文在 Terminal-Bench V2 上测到,单次离散打分的平局率达到 26.7%,超过四分之一的对比,直接判不出胜负。

LLM-as-a-Verifier是一个通用的「验证器框架」,给任意智能体(agent)提供细粒度反馈。核心思想和普通 LLM-as-a-Judge 不同,它不把评分压成一个离散分数。

LLM-as-a-Verifier 不只读最终分数,而是保留每个评分 token 的概率分布,再做概率加权,得到一条连续的验证分数。

就算两个候选都输出"4 分",只要模型对不同档位的置信分布不一样,连续分数照样能把它们拉开。


连续分数本身就能拉开好坏差距。在此基础上,验证还能沿三个方向继续放大:


1、评分粒度 G

把刻度从粗拉到细(比如 1 档到 20 档)。

模型并没有多获得信息,只是解码空间更细了,原先会被四舍五入成同分的邻近判断,现在能落在不同的连续值上。

信号噪比从 0.775 升到 0.799,准确率从 73.1% 到 77.5%。

2、重复评估 K

同一对多评几次再平均,相当于蒙特卡洛估计,方差随次数下降。

单次评估容易被无关特征带偏,多跑几次能压掉这部分噪声。准确率从 74.7% 提到 77.5%(K=1→16)。

3、标准分解 C

长程任务里“对不对”其实混了好几件事。

拆成是否满足需求、输出格式是否正确、日志有没有失败信号,分别评再平均,减少模型只盯最显眼因素就下结论的偏置。

单标准 75.2%–76.4%,三标准合起来 78.3%。

候选多了怎么办?

候选一多,两两比较是 O(N²),5 条还行,几十条就贵了。框架用Probabilistic Pivot Tournament(PPT)把成本压到 O(Nk):

1)环传递:随机哈密顿环先比相邻对,每个候选各当一次 A、一次 B,抵消位置偏好;

2)选枢轴:按环传成绩取前 k 个当枢轴;

3)枢轴锦标赛:非枢轴只跟枢轴比,预算集中在最不确定的头部候选;

4)聚合:把胜场质量归一化,取最高者返回。

重复评估时 A/B 槽位交替,位置偏差再次抵消。


实测 k=3 就略超此前 V1 的结果,k=9 已经接近全量两两比,却少算一大半比较。

03

怎么接入你的电脑

步骤一:安装

pip install llm-verifier

如果要跑最新开发版,克隆仓库后执行

pip install -e

步骤二:准备「验证器后端」

真正关键的是准备验证器后端。

llm_verifier 本身不直接打分,而是调用一个大模型当 verifier。

按仓库说明,需要在环境里配置 DEEPSEEK_API_KEY 或 VERTEX_API_KEY,也可以接一个能返回 logprobs 的 OpenAI 兼容服务。

verifier 必须能返回 logprobs,否则就退回成普通的离散打分。

步骤三:把密钥写进 .env

在项目根目录(或运行目录)创建 .env文件:

OPENAI_BASE_URL=http://localhost:8000/v1

04

总结

生成已经卷到头了,下一程的杠杆,在验证。

真正卡住系统上限的,是验证器还没把它们全挑出来。

5次采样距 96.6% 的理想上限仍有明显空间,下一步最直接的提升,就是把现有候选选得更准。

LLM-as-a-Verifier 最聪明的地方,不是又训了个更大的模型,而是换了个"读模型"的方式,把离散结论变成连续概率,再沿粒度、重复、分解三个维度缩放。

它对做 agent 的人最直接的启发可能是这句:别再让模型给自己盖棺定论,读它的概率,而不是听它的结论。

一个会答错的模型,开始自己给自己挑答案。它挑得还不够完美,但方向已经对了,多采样负责"覆盖到",连续验证负责"认出来"。

关注+星标,获取AI前沿进展与开源一线动态

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
中国女篮输法国,看看媒体专家怎么说!杨毅:没有人想打大清篮球

中国女篮输法国,看看媒体专家怎么说!杨毅:没有人想打大清篮球

章民解说体育
2026-09-10 22:22:02
重磅承诺!普京亲口向特朗普拍板:俄军打完乌克兰,绝不打欧洲

重磅承诺!普京亲口向特朗普拍板:俄军打完乌克兰,绝不打欧洲

小小科普员
2026-09-10 15:03:33
刘翔,教科书式公关

刘翔,教科书式公关

贩财局
2026-09-10 13:41:33
人民日报发声!已经不是简单道歉的事,多名律师支持男童一方起诉

人民日报发声!已经不是简单道歉的事,多名律师支持男童一方起诉

放开他让wo来
2026-09-10 10:43:36
快讯!巴基斯坦可能要打大仗了!

快讯!巴基斯坦可能要打大仗了!

故事终将光明磊落
2026-09-10 10:55:49
生育大局已定?不出意外的话,明年中国新生人口将迎来3大变化

生育大局已定?不出意外的话,明年中国新生人口将迎来3大变化

你在偷看谁
2026-09-10 21:09:48
天呢!网传大批00后开始坐牢,原因令人震惊...

天呢!网传大批00后开始坐牢,原因令人震惊...

慧翔百科
2026-09-10 08:27:31
注意了!9月30日起零钱通不能微信付款,你的钱还能正常用吗?

注意了!9月30日起零钱通不能微信付款,你的钱还能正常用吗?

一些小事
2026-09-09 06:23:03
女儿跟对象开玩笑,说父母是农民,没有退休金。男方愣了下:“你说的是真的吗?”女儿点头,男方脸色一沉:“那咱们不合适。”

女儿跟对象开玩笑,说父母是农民,没有退休金。男方愣了下:“你说的是真的吗?”女儿点头,男方脸色一沉:“那咱们不合适。”

背包旅行
2026-09-10 18:14:09
事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

人生录
2026-09-11 00:05:21
尴尬现状!中国三大球集体哑火,已全部走下亚洲之巅

尴尬现状!中国三大球集体哑火,已全部走下亚洲之巅

米修体育
2026-09-10 23:51:55
特朗普承诺,如果中期选举赢了,将向所有美国成年人每人发5000美元,财长贝森特台下鼓掌

特朗普承诺,如果中期选举赢了,将向所有美国成年人每人发5000美元,财长贝森特台下鼓掌

极目新闻
2026-09-10 15:27:14
太揪心了!离出口仅160米,2名工人被泥石流封在隧道9天,靠喝泥坑水活了下来

太揪心了!离出口仅160米,2名工人被泥石流封在隧道9天,靠喝泥坑水活了下来

可达鸭面面观
2026-09-10 11:44:35
纱窗效应明显!iPhone Duo屏下前摄被吐槽 网友:还不如5年前的小米MIX 4

纱窗效应明显!iPhone Duo屏下前摄被吐槽 网友:还不如5年前的小米MIX 4

快科技
2026-09-10 15:43:16
湖北小县城的工资已经开始崩塌

湖北小县城的工资已经开始崩塌

火锅局
2026-09-10 13:09:05
4岁男童被指摸女子臀部!前国脚:换成球员 二话不说上去先揍她一顿

4岁男童被指摸女子臀部!前国脚:换成球员 二话不说上去先揍她一顿

念洲
2026-09-10 14:40:19
华人女子希腊失踪案最新进展:一公园内发现其护照被撕成22块碎片,附近有人类骸骨

华人女子希腊失踪案最新进展:一公园内发现其护照被撕成22块碎片,附近有人类骸骨

红星新闻
2026-09-10 13:15:44
委内瑞拉给了中国一个说法。 
委内瑞拉把650亿桶石油控制权交给美国后,终于给最大债主中国交底了

委内瑞拉给了中国一个说法。 委内瑞拉把650亿桶石油控制权交给美国后,终于给最大债主中国交底了

扶苏聊历史
2026-09-10 16:42:29
普京通告全球:世界最大组织诞生,中俄辛苦25年,美国劫难来了?

普京通告全球:世界最大组织诞生,中俄辛苦25年,美国劫难来了?

素衣读史
2026-09-11 00:53:29
美国跟法国“杠上了”

美国跟法国“杠上了”

环球时报国际
2026-09-10 16:28:40
2026-09-11 03:35:00
智猩猩
智猩猩
AI 技术内容与服务平台
91文章数 4关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

特朗普:如果伊朗拥核 我会对最高领袖说"能为您效劳吗"

头条要闻

特朗普:如果伊朗拥核 我会对最高领袖说"能为您效劳吗"

体育要闻

16岁的国产小库里,还有多少功课要做

娱乐要闻

参加晚宴,刘亦菲因合照深陷争议

财经要闻

向松祚:年轻人不必过早买房

汽车要闻

标配全线控底盘 全新一代智己LS6预售20.99万起

态度原创

房产
教育
亲子
旅游
家居

房产要闻

别不服!海南的亿万富豪,只有不到300个!

教育要闻

再次学会说话

亲子要闻

“无为”的养育孩子,就是啥也不管放任他吗?

旅游要闻

大理旅游便民卡“橙意”上线,全年不限次出游!

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版