网易首页 > 网易号 > 正文 申请入驻

Qwen3.8-27B 彻底成神了:Perplexity拿它改出最强开源决策大模型,可本地部署!

0
分享至

大家好,我是 Ai 大模型的老章

Perplexity 悄悄放了个 27B 模型:pplx-decider-v1.1-27b

我进模型卡一看,底座又是Qwen3.8-27B

最近我已经写了好几篇 Qwen3.8-27B 的魔改版本,量化的、蒸馏的、跑 Agent 的、做 Computer Use 的,现在连 Perplexity 都下场了,Qwen3.8-27B 真的快成开源圈的「公共底盘」了


但这次的 Perplexity 模型有点特别,它不聊天、不写代码,它只干一件事:做判断

巧的是,OpenAI 前阵子在 DevDay 上也发了一个干同样活的东西,叫 Decisions API

一个开放权重能自己部署,一个托管 API 按量付费,正好放一起对比着看

先说结论:这是个啥

省流:它是一个「决策模型」

读进去一段文本或者一张图,按你事先定义好的问题和候选项,直接吐出判断结果、概率和置信度,中间没有任何长篇大论




可以把它想成一个手速极快的 AI 审单员

能力

Perplexitypplx-decider-v1.1-27b

OpenAI Decisions API

是/否判断

noul

:输出「是」的概率

predicate

:输出条件成立的概率

多选一

choicechoice

分级打分

scorescore

输入

文本、图片

文本、图片

输出

选项、概率、分数

选项、概率、置信度、分数

交付形态

开放权重,可自托管,也有 API

托管 API,POST /v1/decisions

价格

每百万输入 token 0.02 美元

每百万输入 token 0.10 美元,不收输出费

举个例子,输入一句客服工单:

My Stripe integration keeps failing. Please help ASAP.

再问它:这单该派给账单、技术支持还是销售?

决策模型不会先跟你寒暄「这是一个很好的问题」,它直接给你一个选项加一组校准过的概率,比如technical_support拿走绝大部分概率,程序拿到结果就能直接分流


Perplexity Decider 与 OpenAI Decisions 对比 决策模型这条赛道是怎么冒出来的

要理解 Perplexity 为什么做这个,得往前倒一个月

9 月中旬,TypeSafe AI 发布了闭源的Jev,提出了「系统一模型(System One Model)」的说法

意思是:现在的大模型都是「系统二」,慢慢想、逐个 token 往外吐字,适合聊天和写作,但放到软件自动化里就很别扭,你只是想让它判断一下这单该不该退款,它先给你写三段分析,你还得祈祷它别把 JSON 吐坏

Jev 的思路是一次前向计算直接输出类型化的结果,配上校准过的概率,程序拿来就能当 if-else 用

之前我专门写过一篇《大模型做决策的四个流派》,聊的就是社区怎么拿 Qwen 去复刻 Jev,还写过 Google 用扩散模型做快思考决策的那篇

这一个月下来,复刻 Jev 的开源项目多到 Hugging Face 上有人专门做了个排行榜,叫Jev Decision Index,目前已经收录了 111 个开源复现


有个细节挺好玩:Perplexity 的二元判断类型叫noul,这个名字跟 Jev 用的一模一样,而它推理代码的 Python 包名直接叫autojev

所以这事说白了,就是 Perplexity 也加入了「开源复刻 Jev」的大军,而且一出手就冲到了第一

v1.1 到底强在哪

pplx-decider 其实是第二版了,v1 之前就发过,v1.1 是在同一个底座上的升级

官方给的成绩:Decision Index 总分从56.4 涨到 61.56,反超 Jev 3.5 分以上

Decision Index 类别

Jev

v1

v1.1

Knowledge 知识

51.4

40.9

Language 语言理解

62.0

63.5

Retrieval 检索分类

55.4

54.9

Tools 工具调用

75.1

79.3

Arts 审美品味

37.7

39.4

总分

57.9

56.4

涨分主要靠两件事:

  • 拿掉因果掩码:全注意力层改成非因果(noncausal),也就是每个 token 可以同时看到前后文,做判断题比只能往前看更合适,模型卡特别强调,用默认的因果推理跑出来的结果复现不了官方成绩

  • 喂了更多数据:大头来自开源的 tasksource 数据集合,模型卡里专门致谢了这个项目

结构上也很有意思,它把原来 Qwen 那个全词表的lm_head换成了一个单独的决策头,readout.safetensors里存的是一个形状为[255, 5120]的 BF16 矩阵,从形状看一次最多能在 255 个候选里打分

另外模型里还存了一个校准温度,用官方的DecisionModel.predict会自动帮你乘上,如果你自己拿 logits 算,记得只乘一次,并且只在当前题目的有效候选里做归一化

我感觉:校准这件事比分数本身更值钱

做业务路由的人都懂,模型说 90% 把握的时候,如果真实准确率也接近 90%,你才敢据此设阈值、自动放行,否则那个概率就是个装饰品

Knowledge 这一项 v1.1 依然输给 Jev,需要大量世界知识的判断题,它还差点意思

排行榜:Decision Index 0.3 第一名

Perplexity 公告里说,v1.1 在 Hugging Face 新版 Decision Index 上拿了最高分


Decision Index 0.3:111 个开源复现,Perplexity Decider v1.1 排第一

在榜单上,Perplexity Decider v1.1 拿到62.8,Fastino GLiDE no-thinking 60.2,Jev 本尊 60.1,Torchcast Decision 27B 59.9

注意这里的 62.8 和模型卡里的 61.56 对不上,因为榜单换了评测套件版本,Jev 的分数也从 57.9 变成了 60.1,看相对排名就好


榜单前列,颜色区分全量微调、LoRA、推理技巧等路线

这个榜我觉得设计得挺用心:

  • 总分 = 20% 公开基准 + 50% 同类能力的私有测试 + 30% 新领域私有任务

  • 私有部分从不公开,所以光靠刷公开题拿不到高分

  • 37 个公开基准分成知识、语言、检索、工具、艺术五大类,都做了随机基线校正,0 分等于瞎猜,没作答按错误算

分项雷达图里,Perplexity 在语言理解(62.3)和检索分类(64.7)都是第一,工具调用排第二,知识推理排第二,艺术品味排第三


五大领域雷达图,Jev 与前三名对比

真正让我想说 Qwen3.8-27B YYDS 的,是这张榜的前排

你往下数:Torchcast Decision 27B、Kev 27B、JEV-27B、Eikos 27B-FP8 Qwen3.8-27B LoRA、simple-jev Qwen3.8-27B、reflex Qwen3.8-27B……一大串 27B,相当一部分直接在名字里写着 Qwen3.8-27B

Perplexity 自己的 v1 模型页显示,Qwen3.8-27B 下面的微调模型已经有 478 个

一个底座能被这么多团队拿去做同一件事,还能一路卷到超过闭源原版,这说明它的语义理解底子足够厚,27B 这个体量也刚好卡在「单卡能放下」的甜点位

本地部署要什么配置

这是老章最关心的部分

  • Python 3.12+

  • 一张 CUDA 显卡,光权重就要大约49 GiB,还得留出推理工作内存

  • 仓库总大小52.2 GB

模型仓库 52.2 GB

换算成硬件,单卡 80GB 的 A100/H100,或者 96GB 的 RTX PRO 6000 比较稳妥,榜单本身就是在一张 RTX PRO 6000 上跑的

24GB、32GB 的消费级卡直接放 BF16 权重是放不下的,社区里已经有人做了 v1 的量化版本,v1.1 的量化估计也快了

Mac 用户先别激动,官方推理代码写死了 CUDA

另外有个小坑,v1.1 的模型卡里写着需要「带认证的 Hugging Face 访问权限」,下载前先登录 HF 账号,如果页面提示要申请就先点申请

官方用法如下,下载仓库、装好requirements.txt里锁定的依赖之后:

import sys
from pathlib import Path
from huggingface_hub import snapshot_download

checkpoint = Path(snapshot_download("perplexity-ai/pplx-decider-v1.1-27b"))
sys.path.insert(0, str(checkpoint / "source" / "src"))

from autojev.model import DecisionModel, answer

model = DecisionModel(checkpoint, device="cuda")
question = {
"type": "choice",
"instructions": "Which team should handle this request?",
"criteria": {
"billing": "Charges and refunds",
"support": "Technical integration errors",
"sales": "Questions about buying a product",
},
}
row = {"state": "My integration keeps failing. Please help.", "question": question}
probabilities = model.predict([row])[0]

print(answer(question, probabilities))

想做是/否判断,把type换成noul就行,v1 的模型卡给过示例:

{"type": "noul", "instructions": "Does this message express urgency?"}

一个容易踩的坑:这个权重没有完整词表的lm_head,所以你没法直接丢进 vLLM 当普通 Qwen 模型 serve

模型卡说得很清楚,如果你的推理框架要求Qwen3_5ForConditionalGeneration这种标准结构,需要单独导出一份,把决策头的第 i 行映射回词表里对应的 token 行,同时还得保留非因果注意力,否则成绩复现不了

现阶段老老实实用官方那份推理代码最省心,模型卡也说了model.py是从训练评测时逐字节拷贝过来的

OpenAI Decisions API:同一个思路,托管版

再看 OpenAI 这边

Decisions API 目前是公开测试,官方说几周内正式 GA,只有一个模型gpt-6-luna可用,走单独的/v1/decisions端点

官方说法是比走 Responses API 快大约 10 倍

请求就三块:model、input(共享的证据,文本或图文消息)、questions(要问的问题列表)

请求 API 返回里会有choice、每个选项的probabilities和一个单独的confidence

score类型的设计我挺喜欢,它返回的是各等级概率的加权平均,比如「外观问题 / 有替代方案 / 完全阻塞」三档概率是 0.1、0.7、0.2,分数就是 1.1,能落在两档之间,比硬选一档信息量大

几个值得记住的细节:

  • 图片只能传 base64 data URL,不支持图片链接和file_id,一次请求最多 128 张图

  • 同一份输入可以一次问多个独立问题,每个问题类型可以不同;有前后依赖的问题要拆成多次请求

  • 每个问题都可能返回refusal,表示模型拒答,但不影响同一请求里其他问题

  • 官方建议给choice留一个other兜底选项,覆盖不到的输入统一扔进人工队列

  • 定价:输入每百万 token0.10 美元,不收输出、不收缓存读写费用

  • 支持零数据保留(ZDR)和 HIPAA,数据驻留覆盖美国和欧洲

OpenAI 自己也划了边界:要生成自定义结构的 JSON、要写解释,继续用 Responses API 的 Structured Outputs;要调用工具,用 function calling

两家最大的区别:产品层级

Perplexity 给的是模型,你可以下载权重放在自己机房,数据不出门,想怎么调就怎么调

OpenAI 给的是服务,模型、部署、加速、扩缩容它全包,你只管发请求

所以两边不能简单换个 API 地址就迁移:

  • 二元判断一个叫noul,一个叫predicate

  • Perplexity 的选项写在criteria字典里,OpenAI 写在choices数组里,score则用levels

  • 图片传入方式、返回结构都不一样

价格上 Perplexity API 是 0.02 美元每百万输入 token,比 v1 便宜一半,是 OpenAI 的五分之一

速度我就不下结论了,两家都没给同硬件、同输入、同并发的对比数据,谁快谁慢现在说都是瞎猜

放进 Agent 里怎么用

决策模型最适合待的位置,是 Agent 流程的最前面当「分诊台」

下面这张图是我理解的典型用法


决策模型在 Agent 流程中的分诊位置

用户请求进来,先让决策模型判断:简单问题丢给便宜的小模型,复杂推理交给大模型,需要查资料就调搜索,高风险的直接转人工

它只负责返回选择结果,真正的模型调用、工具调用、业务动作都由你的程序执行

阈值怎么定?OpenAI 文档的建议很实在:用你自己业务里标注过的样本去调,按误判的代价来定,误放一单高风险请求和误拦一单正常请求,成本可不一样

除了路由,我觉得这几类场景都很顺手:

  • 客服工单分类、紧急程度打分

  • 内容审核、Agent 运行中的安全护栏

  • RAG 里判断检索回来的段落到底相关不相关

  • 商品图片有没有破损,这个 OpenAI 文档里就有现成例子

总结

Perplexity Decider 可以看作开放权重、能自托管的决策模型;OpenAI Decisions 是同类能力的托管 API,思路高度一致,模型、训练数据、接口协议各自独立

我建议:

  • 数据敏感、调用量大、手里有 80GB 以上显卡的团队,Perplexity 这个值得认真试,Decision Index 第一名、价格还低,自己部署之后边际成本更低

  • 不想碰运维、要合规背书的团队,直接用 OpenAI Decisions API,ZDR 和 HIPAA 都给你准备好了

  • 只有消费级显卡的个人玩家,先等量化版,或者先用 API 体验

  • 知识密集型的判断,比如需要大量专业常识的审核,两家都要先拿自己的数据测一遍,v1.1 的 Knowledge 分数还低于 Jev

再说一句 Qwen3.8-27B,开源复刻 Jev 的榜单前排几乎被它的各种改版刷满了,现在连 Perplexity 都选它当底座,这个底座的生命力真是没话说

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
千万别躺平!底层早就挤爆了,外卖员遍地都是,普通人翻身两条路

千万别躺平!底层早就挤爆了,外卖员遍地都是,普通人翻身两条路

白米饭怎么吃
2026-10-10 20:17:53
高岗随刘少奇访问苏联期间,在会议上突然提议把东北变成苏联的第17个加盟共和国,斯大林听后当场讥讽道:“张作霖同志。”

高岗随刘少奇访问苏联期间,在会议上突然提议把东北变成苏联的第17个加盟共和国,斯大林听后当场讥讽道:“张作霖同志。”

人生录
2026-10-09 16:01:05
某些无良媒体,你丫还有点良知和节操吗?

某些无良媒体,你丫还有点良知和节操吗?

涛哥锐评
2026-10-06 20:56:04
石家庄一高速服务区成网红打卡点:内部含美食街、超市、酒店,总建筑面积达3.6万平方米,甚至还能骑行,游客称以为进了大商场

石家庄一高速服务区成网红打卡点:内部含美食街、超市、酒店,总建筑面积达3.6万平方米,甚至还能骑行,游客称以为进了大商场

极目新闻
2026-10-10 18:33:21
别再逼孩子运动了!孩子最缺的不是篮球、游泳,而是无序运动

别再逼孩子运动了!孩子最缺的不是篮球、游泳,而是无序运动

新东方家庭教育
2026-10-09 09:35:50
1978年,原空军副司令张积慧被解除职务,被关押两年,1980年转业到地方,连降六级,先后担任成都420厂副厂长等职务,他始终勤恳工作

1978年,原空军副司令张积慧被解除职务,被关押两年,1980年转业到地方,连降六级,先后担任成都420厂副厂长等职务,他始终勤恳工作

回京历史梦
2026-10-10 06:25:11
简直就是奇迹:美国林肯号航母5000多大兵在芭堤雅疯狂玩了5天,竟然仅有2个打架的!

简直就是奇迹:美国林肯号航母5000多大兵在芭堤雅疯狂玩了5天,竟然仅有2个打架的!

步论天下事
2026-09-07 09:40:52
咸鱼涉黄:“夜总会”不会消失,但会转移

咸鱼涉黄:“夜总会”不会消失,但会转移

梁欢欢的理智与情感
2026-09-22 11:04:57
泽连斯基至今还不明白?乌克兰只能是中立的,它不能偏西或靠东!

泽连斯基至今还不明白?乌克兰只能是中立的,它不能偏西或靠东!

小鹿姐姐情感说
2026-10-11 09:45:44
你不使劲踩,它会断吗?尊界V800 是台好车!

你不使劲踩,它会断吗?尊界V800 是台好车!

难得君
2026-10-09 00:13:17
断崖下滑!阿森纳 5000 万巨星彻底崩盘!昔日王牌位置不保

断崖下滑!阿森纳 5000 万巨星彻底崩盘!昔日王牌位置不保

澜归序
2026-10-11 09:41:55
四川曾有老虎,为什么没吃大熊猫?护林员说:80%的人不知道,老虎就算“饿疯了”,也不会将大熊猫当作美餐

四川曾有老虎,为什么没吃大熊猫?护林员说:80%的人不知道,老虎就算“饿疯了”,也不会将大熊猫当作美餐

回京历史梦
2026-10-04 02:50:05
36岁亨德森英超生涯第四次梅开二度,上一次是在2014年

36岁亨德森英超生涯第四次梅开二度,上一次是在2014年

懂球帝
2026-10-10 23:54:04
老了肌肉流失怎么办?医生:2样东西必须吃,2件事做得越早越好

老了肌肉流失怎么办?医生:2样东西必须吃,2件事做得越早越好

健康科普365
2026-09-30 11:40:19
世界乒坛进入战国时代,刘国梁养狼计划成功,他不是不懂球的胖子

世界乒坛进入战国时代,刘国梁养狼计划成功,他不是不懂球的胖子

姜大叔侃球
2026-10-10 20:04:58
敬一丹曾爆料:主持揭露东莞特殊服务节目时,她与导演发生争执

敬一丹曾爆料:主持揭露东莞特殊服务节目时,她与导演发生争执

言过于诚
2026-09-21 10:04:14
老板娘问我她屁股翘不翘?我该怎么回答?

老板娘问我她屁股翘不翘?我该怎么回答?

太急张三疯
2026-10-11 08:22:21
泽连斯基与多个欧洲国家领导人通话

泽连斯基与多个欧洲国家领导人通话

澎湃新闻
2026-10-11 05:28:04
出口是中国经济遮羞布?全网都在喊,可一查发现,有人动了手脚?

出口是中国经济遮羞布?全网都在喊,可一查发现,有人动了手脚?

陈穟侃故事
2026-10-09 21:12:34
美媒:泽连斯基六次无视美国要求后,特朗普决定推进与俄罗斯的柴油协议

美媒:泽连斯基六次无视美国要求后,特朗普决定推进与俄罗斯的柴油协议

观察者网
2026-10-10 22:40:09
2026-10-11 10:24:49
Ai学习的老章 incentive-icons
Ai学习的老章
Ai学习的老章
3536文章数 11199关注度
往期回顾 全部

科技要闻

上世纪成熟的踏板,为何今天还会断裂?

头条要闻

牛弹琴:特朗普发出最后通牒 泽连斯基的至暗时刻来了

头条要闻

牛弹琴:特朗普发出最后通牒 泽连斯基的至暗时刻来了

体育要闻

十年回首:湖人三榜眼的夏天,与NBA无关

娱乐要闻

梅艳芳63岁冥诞骨灰被盗,亲哥从不知情

财经要闻

黄仁勋长女完婚,万亿帝国如何传承?

汽车要闻

千匹马力+三把锁/顶配能浮水 银河战舰700限时焕新价16.98万起

态度原创

数码
亲子
艺术
教育
军事航空

数码要闻

苹果新一代Apple TV 4K有望于10月13日正式亮相

亲子要闻

医院曝光新毒物!多个厂家投毒,坑害婴幼儿,江浙沪已沦为重灾区

艺术要闻

黄沙万里不见泪|仇英《明妃出塞图》:昭君从来不是悲情美人

教育要闻

看起来这道题很复杂,实际其中有很多的奥妙

军事要闻

美乌将举行新一轮会谈

无障碍浏览 进入关怀版