大家好,我是 Ai 大模型的老章
Perplexity 悄悄放了个 27B 模型:pplx-decider-v1.1-27b
我进模型卡一看,底座又是Qwen3.8-27B
最近我已经写了好几篇 Qwen3.8-27B 的魔改版本,量化的、蒸馏的、跑 Agent 的、做 Computer Use 的,现在连 Perplexity 都下场了,Qwen3.8-27B 真的快成开源圈的「公共底盘」了
![]()
但这次的 Perplexity 模型有点特别,它不聊天、不写代码,它只干一件事:做判断
巧的是,OpenAI 前阵子在 DevDay 上也发了一个干同样活的东西,叫 Decisions API
一个开放权重能自己部署,一个托管 API 按量付费,正好放一起对比着看
先说结论:这是个啥
省流:它是一个「决策模型」
读进去一段文本或者一张图,按你事先定义好的问题和候选项,直接吐出判断结果、概率和置信度,中间没有任何长篇大论
![]()
![]()
![]()
可以把它想成一个手速极快的 AI 审单员
能力
Perplexitypplx-decider-v1.1-27b
OpenAI Decisions API
是/否判断
noul
:输出「是」的概率
predicate
:输出条件成立的概率
多选一
choicechoice
分级打分
scorescore
输入
文本、图片
文本、图片
输出
选项、概率、分数
选项、概率、置信度、分数
交付形态
开放权重,可自托管,也有 API
托管 API,POST /v1/decisions
价格
每百万输入 token 0.02 美元
每百万输入 token 0.10 美元,不收输出费
举个例子,输入一句客服工单:
My Stripe integration keeps failing. Please help ASAP.
再问它:这单该派给账单、技术支持还是销售?
决策模型不会先跟你寒暄「这是一个很好的问题」,它直接给你一个选项加一组校准过的概率,比如technical_support拿走绝大部分概率,程序拿到结果就能直接分流
![]()
Perplexity Decider 与 OpenAI Decisions 对比 决策模型这条赛道是怎么冒出来的
要理解 Perplexity 为什么做这个,得往前倒一个月
9 月中旬,TypeSafe AI 发布了闭源的Jev,提出了「系统一模型(System One Model)」的说法
意思是:现在的大模型都是「系统二」,慢慢想、逐个 token 往外吐字,适合聊天和写作,但放到软件自动化里就很别扭,你只是想让它判断一下这单该不该退款,它先给你写三段分析,你还得祈祷它别把 JSON 吐坏
Jev 的思路是一次前向计算直接输出类型化的结果,配上校准过的概率,程序拿来就能当 if-else 用
之前我专门写过一篇《大模型做决策的四个流派》,聊的就是社区怎么拿 Qwen 去复刻 Jev,还写过 Google 用扩散模型做快思考决策的那篇
这一个月下来,复刻 Jev 的开源项目多到 Hugging Face 上有人专门做了个排行榜,叫Jev Decision Index,目前已经收录了 111 个开源复现
![]()
有个细节挺好玩:Perplexity 的二元判断类型叫noul,这个名字跟 Jev 用的一模一样,而它推理代码的 Python 包名直接叫autojev
所以这事说白了,就是 Perplexity 也加入了「开源复刻 Jev」的大军,而且一出手就冲到了第一
v1.1 到底强在哪
pplx-decider 其实是第二版了,v1 之前就发过,v1.1 是在同一个底座上的升级
官方给的成绩:Decision Index 总分从56.4 涨到 61.56,反超 Jev 3.5 分以上
Decision Index 类别
Jev
v1
v1.1
Knowledge 知识
51.4
40.9
Language 语言理解
62.0
63.5
Retrieval 检索分类
55.4
54.9
Tools 工具调用
75.1
79.3
Arts 审美品味
37.7
39.4
总分
57.9
56.4
涨分主要靠两件事:
拿掉因果掩码:全注意力层改成非因果(noncausal),也就是每个 token 可以同时看到前后文,做判断题比只能往前看更合适,模型卡特别强调,用默认的因果推理跑出来的结果复现不了官方成绩
喂了更多数据:大头来自开源的 tasksource 数据集合,模型卡里专门致谢了这个项目
结构上也很有意思,它把原来 Qwen 那个全词表的lm_head换成了一个单独的决策头,readout.safetensors里存的是一个形状为[255, 5120]的 BF16 矩阵,从形状看一次最多能在 255 个候选里打分
另外模型里还存了一个校准温度,用官方的DecisionModel.predict会自动帮你乘上,如果你自己拿 logits 算,记得只乘一次,并且只在当前题目的有效候选里做归一化
我感觉:校准这件事比分数本身更值钱
做业务路由的人都懂,模型说 90% 把握的时候,如果真实准确率也接近 90%,你才敢据此设阈值、自动放行,否则那个概率就是个装饰品
Knowledge 这一项 v1.1 依然输给 Jev,需要大量世界知识的判断题,它还差点意思
排行榜:Decision Index 0.3 第一名
Perplexity 公告里说,v1.1 在 Hugging Face 新版 Decision Index 上拿了最高分
![]()
Decision Index 0.3:111 个开源复现,Perplexity Decider v1.1 排第一
在榜单上,Perplexity Decider v1.1 拿到62.8,Fastino GLiDE no-thinking 60.2,Jev 本尊 60.1,Torchcast Decision 27B 59.9
注意这里的 62.8 和模型卡里的 61.56 对不上,因为榜单换了评测套件版本,Jev 的分数也从 57.9 变成了 60.1,看相对排名就好
![]()
榜单前列,颜色区分全量微调、LoRA、推理技巧等路线
这个榜我觉得设计得挺用心:
总分 = 20% 公开基准 + 50% 同类能力的私有测试 + 30% 新领域私有任务
私有部分从不公开,所以光靠刷公开题拿不到高分
37 个公开基准分成知识、语言、检索、工具、艺术五大类,都做了随机基线校正,0 分等于瞎猜,没作答按错误算
分项雷达图里,Perplexity 在语言理解(62.3)和检索分类(64.7)都是第一,工具调用排第二,知识推理排第二,艺术品味排第三
![]()
五大领域雷达图,Jev 与前三名对比
真正让我想说 Qwen3.8-27B YYDS 的,是这张榜的前排
你往下数:Torchcast Decision 27B、Kev 27B、JEV-27B、Eikos 27B-FP8 Qwen3.8-27B LoRA、simple-jev Qwen3.8-27B、reflex Qwen3.8-27B……一大串 27B,相当一部分直接在名字里写着 Qwen3.8-27B
Perplexity 自己的 v1 模型页显示,Qwen3.8-27B 下面的微调模型已经有 478 个
一个底座能被这么多团队拿去做同一件事,还能一路卷到超过闭源原版,这说明它的语义理解底子足够厚,27B 这个体量也刚好卡在「单卡能放下」的甜点位
本地部署要什么配置
这是老章最关心的部分
Python 3.12+
一张 CUDA 显卡,光权重就要大约49 GiB,还得留出推理工作内存
仓库总大小52.2 GB
换算成硬件,单卡 80GB 的 A100/H100,或者 96GB 的 RTX PRO 6000 比较稳妥,榜单本身就是在一张 RTX PRO 6000 上跑的
24GB、32GB 的消费级卡直接放 BF16 权重是放不下的,社区里已经有人做了 v1 的量化版本,v1.1 的量化估计也快了
Mac 用户先别激动,官方推理代码写死了 CUDA
另外有个小坑,v1.1 的模型卡里写着需要「带认证的 Hugging Face 访问权限」,下载前先登录 HF 账号,如果页面提示要申请就先点申请
官方用法如下,下载仓库、装好requirements.txt里锁定的依赖之后:
import sys
from pathlib import Path
from huggingface_hub import snapshot_download
checkpoint = Path(snapshot_download("perplexity-ai/pplx-decider-v1.1-27b"))
sys.path.insert(0, str(checkpoint / "source" / "src"))
from autojev.model import DecisionModel, answer
model = DecisionModel(checkpoint, device="cuda")
question = {
"type": "choice",
"instructions": "Which team should handle this request?",
"criteria": {
"billing": "Charges and refunds",
"support": "Technical integration errors",
"sales": "Questions about buying a product",
},
}
row = {"state": "My integration keeps failing. Please help.", "question": question}
probabilities = model.predict([row])[0]print(answer(question, probabilities))
想做是/否判断,把type换成noul就行,v1 的模型卡给过示例:
{"type": "noul", "instructions": "Does this message express urgency?"}
一个容易踩的坑:这个权重没有完整词表的lm_head,所以你没法直接丢进 vLLM 当普通 Qwen 模型 serve
模型卡说得很清楚,如果你的推理框架要求Qwen3_5ForConditionalGeneration这种标准结构,需要单独导出一份,把决策头的第 i 行映射回词表里对应的 token 行,同时还得保留非因果注意力,否则成绩复现不了
现阶段老老实实用官方那份推理代码最省心,模型卡也说了model.py是从训练评测时逐字节拷贝过来的
OpenAI Decisions API:同一个思路,托管版
再看 OpenAI 这边
Decisions API 目前是公开测试,官方说几周内正式 GA,只有一个模型gpt-6-luna可用,走单独的/v1/decisions端点
官方说法是比走 Responses API 快大约 10 倍
请求就三块:model、input(共享的证据,文本或图文消息)、questions(要问的问题列表)
请求 API 返回里会有choice、每个选项的probabilities和一个单独的confidence
score类型的设计我挺喜欢,它返回的是各等级概率的加权平均,比如「外观问题 / 有替代方案 / 完全阻塞」三档概率是 0.1、0.7、0.2,分数就是 1.1,能落在两档之间,比硬选一档信息量大
几个值得记住的细节:
图片只能传 base64 data URL,不支持图片链接和
file_id,一次请求最多 128 张图同一份输入可以一次问多个独立问题,每个问题类型可以不同;有前后依赖的问题要拆成多次请求
每个问题都可能返回
refusal,表示模型拒答,但不影响同一请求里其他问题官方建议给
choice留一个other兜底选项,覆盖不到的输入统一扔进人工队列定价:输入每百万 token0.10 美元,不收输出、不收缓存读写费用
支持零数据保留(ZDR)和 HIPAA,数据驻留覆盖美国和欧洲
OpenAI 自己也划了边界:要生成自定义结构的 JSON、要写解释,继续用 Responses API 的 Structured Outputs;要调用工具,用 function calling
两家最大的区别:产品层级
Perplexity 给的是模型,你可以下载权重放在自己机房,数据不出门,想怎么调就怎么调
OpenAI 给的是服务,模型、部署、加速、扩缩容它全包,你只管发请求
所以两边不能简单换个 API 地址就迁移:
二元判断一个叫
noul,一个叫predicatePerplexity 的选项写在
criteria字典里,OpenAI 写在choices数组里,score则用levels图片传入方式、返回结构都不一样
价格上 Perplexity API 是 0.02 美元每百万输入 token,比 v1 便宜一半,是 OpenAI 的五分之一
速度我就不下结论了,两家都没给同硬件、同输入、同并发的对比数据,谁快谁慢现在说都是瞎猜
放进 Agent 里怎么用
决策模型最适合待的位置,是 Agent 流程的最前面当「分诊台」
下面这张图是我理解的典型用法
![]()
决策模型在 Agent 流程中的分诊位置
用户请求进来,先让决策模型判断:简单问题丢给便宜的小模型,复杂推理交给大模型,需要查资料就调搜索,高风险的直接转人工
它只负责返回选择结果,真正的模型调用、工具调用、业务动作都由你的程序执行
阈值怎么定?OpenAI 文档的建议很实在:用你自己业务里标注过的样本去调,按误判的代价来定,误放一单高风险请求和误拦一单正常请求,成本可不一样
除了路由,我觉得这几类场景都很顺手:
客服工单分类、紧急程度打分
内容审核、Agent 运行中的安全护栏
RAG 里判断检索回来的段落到底相关不相关
商品图片有没有破损,这个 OpenAI 文档里就有现成例子
Perplexity Decider 可以看作开放权重、能自托管的决策模型;OpenAI Decisions 是同类能力的托管 API,思路高度一致,模型、训练数据、接口协议各自独立
我建议:
数据敏感、调用量大、手里有 80GB 以上显卡的团队,Perplexity 这个值得认真试,Decision Index 第一名、价格还低,自己部署之后边际成本更低
不想碰运维、要合规背书的团队,直接用 OpenAI Decisions API,ZDR 和 HIPAA 都给你准备好了
只有消费级显卡的个人玩家,先等量化版,或者先用 API 体验
知识密集型的判断,比如需要大量专业常识的审核,两家都要先拿自己的数据测一遍,v1.1 的 Knowledge 分数还低于 Jev
再说一句 Qwen3.8-27B,开源复刻 Jev 的榜单前排几乎被它的各种改版刷满了,现在连 Perplexity 都选它当底座,这个底座的生命力真是没话说
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.