智猩猩AI整理
编辑:金水
大模型会答错,这是常识。
但如果一个模型自己生成的答案里已经藏着正确解,只是它没认出来,那问题就不在"能不能做对",而在"能不能把对的挑出来"。
斯坦福、UC Berkeley、NVIDIA 的团队提出的LLM-as-a-Verifier最近放出的一组实验,把这个想法落了地:
用DeepSeek V4 Flash同时负责"写答案"和"挑答案",在Terminal-Bench 2.1上把系统成功率推到了88%,超过了 Claude Fable 5,成本还低约 11 倍。
![]()
没有外接更强的 GPT 或 Claude,生成和验证用的是同一个模型。
不让模型报整数分,而是读评分 token 的 logits,对整条概率分布求期望,得到连续分数。
真正拉开差距的,是"多采样几次之后,能不能把那条对的轨迹选出来"。
![]()
论文题目:
LLM-as-a-Verifier: A General-Purpose Verification Framework
01
DeepSeek V4 Flash 的自验证实验
模型能验证自己的输出吗?
问题很直接,一个模型能不能给自己的 rollout当裁判?
在 Terminal-Bench 2.1 上,团队为每个任务用 deepseek-v4-flash 生成5条 mini-swe-agent 执行轨迹,然后用同一个模型当验证器去给这些轨迹打分、排序、选最优。
听起来像是"考生改自己的卷子",但结果并不随机,尽管验证器判的是自己模型的产出,选出的最优轨迹成功率远高于单次生成的 Pass@1。
![]()
![]()
几个值得品一下的点:
Best-of-3 把 79.4% 抬到 86.5%,Best-of-5 把 78.7% 推到 88.0%,多采样加自验证,是实打实的涨点,不是噪声。
Best-of-5 还有一个更关键的数字,Oracle(理想选择上限)达到 96.6%。
说明对绝大多数任务,5 条候选里至少已经有一条成功了。
模型"会做",只是"没选对"。验证器的天花板很高,空间还很大。
![]()
成功率被拉到与更强的闭源模型相近水平,而 DeepSeek 一侧单任务成本约0.11 美元,对照模型约1.3 美元——成本不到后者的十分之一。
论文把 Terminal-Bench V2 排行榜上不同模型、不同 Agent 配置跑出的执行轨迹汇总到一起后,发现理想选择器对任务的覆盖率最高能到 98.9%,对的答案大概率就在候选里。
![]()
02
连续验证到底
怎么"分得出高下"
标准 LM 评委为什么容易翻车?
常见的 LLM-as-a-Judge,直接让模型吐一个 1–5 的整数分。
问题在两条质量其实差很多的長轨迹,很可能同时拿到 4 分或 5 分。
论文在 Terminal-Bench V2 上测到,单次离散打分的平局率达到 26.7%,超过四分之一的对比,直接判不出胜负。
LLM-as-a-Verifier是一个通用的「验证器框架」,给任意智能体(agent)提供细粒度反馈。核心思想和普通 LLM-as-a-Judge 不同,它不把评分压成一个离散分数。
LLM-as-a-Verifier 不只读最终分数,而是保留每个评分 token 的概率分布,再做概率加权,得到一条连续的验证分数。
就算两个候选都输出"4 分",只要模型对不同档位的置信分布不一样,连续分数照样能把它们拉开。
![]()
连续分数本身就能拉开好坏差距。在此基础上,验证还能沿三个方向继续放大:
![]()
1、评分粒度 G
把刻度从粗拉到细(比如 1 档到 20 档)。
模型并没有多获得信息,只是解码空间更细了,原先会被四舍五入成同分的邻近判断,现在能落在不同的连续值上。
信号噪比从 0.775 升到 0.799,准确率从 73.1% 到 77.5%。
2、重复评估 K
同一对多评几次再平均,相当于蒙特卡洛估计,方差随次数下降。
单次评估容易被无关特征带偏,多跑几次能压掉这部分噪声。准确率从 74.7% 提到 77.5%(K=1→16)。
3、标准分解 C
长程任务里“对不对”其实混了好几件事。
拆成是否满足需求、输出格式是否正确、日志有没有失败信号,分别评再平均,减少模型只盯最显眼因素就下结论的偏置。
单标准 75.2%–76.4%,三标准合起来 78.3%。
候选多了怎么办?
候选一多,两两比较是 O(N²),5 条还行,几十条就贵了。框架用Probabilistic Pivot Tournament(PPT)把成本压到 O(Nk):
1)环传递:随机哈密顿环先比相邻对,每个候选各当一次 A、一次 B,抵消位置偏好;
2)选枢轴:按环传成绩取前 k 个当枢轴;
3)枢轴锦标赛:非枢轴只跟枢轴比,预算集中在最不确定的头部候选;
4)聚合:把胜场质量归一化,取最高者返回。
重复评估时 A/B 槽位交替,位置偏差再次抵消。
![]()
实测 k=3 就略超此前 V1 的结果,k=9 已经接近全量两两比,却少算一大半比较。
03
怎么接入你的电脑
步骤一:安装
pip install llm-verifier如果要跑最新开发版,克隆仓库后执行
pip install -e步骤二:准备「验证器后端」
真正关键的是准备验证器后端。
llm_verifier 本身不直接打分,而是调用一个大模型当 verifier。
按仓库说明,需要在环境里配置 DEEPSEEK_API_KEY 或 VERTEX_API_KEY,也可以接一个能返回 logprobs 的 OpenAI 兼容服务。
verifier 必须能返回 logprobs,否则就退回成普通的离散打分。
步骤三:把密钥写进 .env
在项目根目录(或运行目录)创建 .env文件:
OPENAI_BASE_URL=http://localhost:8000/v104
总结
生成已经卷到头了,下一程的杠杆,在验证。
真正卡住系统上限的,是验证器还没把它们全挑出来。
5次采样距 96.6% 的理想上限仍有明显空间,下一步最直接的提升,就是把现有候选选得更准。
LLM-as-a-Verifier 最聪明的地方,不是又训了个更大的模型,而是换了个"读模型"的方式,把离散结论变成连续概率,再沿粒度、重复、分解三个维度缩放。
它对做 agent 的人最直接的启发可能是这句:别再让模型给自己盖棺定论,读它的概率,而不是听它的结论。
一个会答错的模型,开始自己给自己挑答案。它挑得还不够完美,但方向已经对了,多采样负责"覆盖到",连续验证负责"认出来"。
关注+星标,获取AI前沿进展与开源一线动态
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.