网易首页 > 网易科技 > 网易科技 > 正文

Jev突然火了:大模型负责回答,它负责判断

0
分享至

出品 | 网易智能

作者 | 小扣

编辑 | 王凤枝

Jev火得有点出乎意料。

它是TypeSafe推出的一款新AI模型,不写长答案,只做选择、评分和是非判断。大模型进入越来越长的工作流后,许多步骤不需要重新生成一段内容,只要决定下一步,这正是Jev瞄准的空档。

据Vercel公布的数据,Jev上线第一天,每100个付费团队里就有近13个调用了它,首日调用团队数超过此前新模型纪录的两倍。随后,Cloudflare提供了调用入口,LangChain和Langfuse也迅速跟进。

开发者可以把Jev放在大模型前后:任务开始前,它先判断该调用哪个工具或模型;大模型给出结果后,它再检查答案是否合格、流程要不要继续。复杂的推理和生成仍然交给大模型,Jev接走那些规则写不完、又不值得每次调用大模型的小判断。

这套分工是否成立,取决于Jev的判断能不能信。开发者通常会设置一道概率门槛,例如高于0.9就自动放行,拿不准的再交给大模型或人。Jev所说的0.9是否真代表九成把握,会直接影响整条工作流。

图:TypeSafe展示的一条安全工作流。Jev负责告警分类、处置和后续动作选择,最终动作仍由外围程序执行。来源:TypeSafe AI。

它接走的是大模型身边的小判断

TypeSafe把这类产品称为“System One”模型。开发者预先写好问题、选项和返回格式,程序拿到结果后便可直接进入下一步。官方价格是每百万输入Token 0.042美元,输出不收费;端到端延迟为70至500毫秒。和需要逐字生成答案的通用模型相比,它更像一条听得懂自然语言的if/else。

图:TypeSafe公布的结构化输出与工具调用错误率对比,Jev在其自建测试中的错误率均为0%。这是厂商自测,不是独立基准。来源:TypeSafe AI。

便宜、快,不等于什么都该交给它。TypeSafe列出的已知局限包括计数、数值运算和日期比较。代码能算清的金额、时间和数量,仍应留给代码;Jev适合处理的是“这条反馈更像投诉还是咨询”“这个操作是否可疑”“两件商品是不是同一款”之类的语义判断。

在自建工作流中,TypeSafe测得Jev最高可把速度提高193.6倍,成本降到对照模型的0.3%以下。

图:TypeSafe公布的工作流评测结果。这是厂商自测,不是独立基准。来源:TypeSafe AI。

厂商自测给出了很高的倍率,Every的一次试用则更接近日常用法。它拿37份文本分别做21项检查,Jev合计返回777个判断,耗时不到0.7秒,估算费用约0.0025美元。速度和费用已经足够诱人,准确率则要按具体任务重测。尤其是Jev把概率作为产品的一部分,开发者不只要看它选得对不对,还得知道它有没有高估自己的把握。

配合的前提,是它的概率能信

用概率划门槛,得先分清两件事:它有没有选对答案,以及它报出的把握是否可靠。开发者Charly Poly用Banking77做了一轮意图分类测试。这套数据包含77类银行业务,例如银行卡被吞、转账失败和修改个人信息。测试跑了三个随机种子,在验证集上选择门槛,再到留出的测试集报告结果。

据他公开的测试帖,Jev的宏平均F1为0.782,高于ModernBERT的0.712。在托管环境里,Jev的中位延迟为299毫秒,BART为5131毫秒。把自动处理的目标精度固定在90%后,Jev可以接下67.5%的样本,ModernBERT为35.7%。在这项意图路由任务里,Jev既快,也能在较高精度下多处理一部分请求。

问题出在它对概率的估计上。Jev声称有80%至95%把握的样本,实际正确率只有64%;还有6.6%的样本,正确标签被它打成了零概率。衡量概率与真实正确率差距的ECE指标,Jev也落后于ModernBERT。

GitHub项目jevcal用1600条Civil Comments判断结果做了另一轮测试。项目作者拿一半数据拟合Platt校准器,再到从未参与拟合的另一半数据上检验。校准后,Jev的Brier分数从0.0837降至0.0248;衡量排序能力的AUC仍为0.9264。

这次调整没有让Jev更会选答案,只是重新标定了它的概率刻度。jevcal使用的是另一项二分类任务,验证的是校准方法,不是Banking77中那6.6%零概率样本的修复结果。因此,模型返回的概率不能直接当作业务门槛。开发者需要先拿自己的数据重新校准,再决定哪些请求可以直接放行,哪些还得交给大模型或人。

复杂任务,要先拆成小判断

校准只能修正概率刻度,不能让Jev突然更会处理复杂问题。反钓鱼测试里,直接让它判断整封邮件,准确率只有62.6%,低于Claude Haiku的81.3%。研究者把问题拆成五个具体信号,再用逻辑回归汇总,Jev的准确率升到95.0%。

同样拆成五个小问题后,Jev的准确率为95.0%,Haiku为93.2%,只靠关键词和固定规则判断的传统程序为91.8%。Jev与Haiku的差距还不足以证明它更准,取得这五项判断的费用却约为Haiku的二十七分之一,速度约为五倍。在这项反钓鱼测试中,Jev的价值主要是便宜、快速地完成大量小判断,再由程序汇总;复杂任务仍不必直接交给它拍板。

开发者Patrick Dappollonio把同样的思路用在商品匹配产品Pricogni中。原系统留下9081组低置信度商品,原本都要人工复核。Jev只回答两件事:两条商品是不是同一件,主要差异属于哪一类。把握较大的结果自动归类,拿不准的继续留给人。

六路并发运行13分22秒,费用为0.32美元。最终49%的商品组被否定,21%被确认,还有30%留在人工队列。作者抽查的20个否定都站得住,20个确认中有两组仍可争议;大部分保留结果也确实需要人判断。这次,Jev的判断只被用来补充商品分类,没有直接改动商品状态或价格。它只是替人工筛掉一部分较容易判断的商品,把精力留给剩下的疑难项。

不是所有判断任务,都该交给Jev

反钓鱼和商品匹配的测试说明,Jev可以便宜地接下大量小判断。但这不等于工作流里只要出现“判断”,就值得额外调用一次Jev。

TokenTrim用5835条查询做了一组对照:先检索相似问题,再让Jev判断每道题的难度,把它交给相应的大模型;随后拿掉Jev,其他环节保持不变,看看准确率会不会下降。

加入相似问题检索和Jev后,准确率从最佳单模型的60.3%升到62.4%。但拿掉Jev、只保留检索,准确率仍是62.4%,成本还略低。至少在TokenTrim这套任务和路由方法中,真正带来提升的是检索,Jev给出的难度判断没有增加价值。

多加一层判断,也会多一个需要处理的故障。开发者Mnilax记录过一次工作流中断:Jev没有返回答案,智能体把沉默当成更安全的选择,整条流程停住,后来才由第二个智能体恢复。Jev如果负责决定大模型是否继续工作,超时、空结果和降级方案就得提前写好。

首日近13%的付费团队愿意试,Jev不缺尝鲜者。它能不能真正留下,要看拿掉它以后,工作流是否真的会变慢、变贵或变差。

相关推荐
热点推荐
伊万卡罕见现身白宫迎贵客!穿中国设计师郭培作品亮相

伊万卡罕见现身白宫迎贵客!穿中国设计师郭培作品亮相

列国漫游
2026-09-25 05:36:44
3名赴泰女子被囚禁,泰国警方解救时抓获4名男子!现场缴获铁链及吸毒用具

3名赴泰女子被囚禁,泰国警方解救时抓获4名男子!现场缴获铁链及吸毒用具

红星新闻
2026-09-24 13:29:55
3-1,世界第60胜世界第22,53岁卡纳瓦罗率队掀翻伊朗,终结5连败

3-1,世界第60胜世界第22,53岁卡纳瓦罗率队掀翻伊朗,终结5连败

侧身凌空斩
2026-09-24 23:56:01
邵佳一真大胆,9年绝对主力被拿下,助国足3-0大胜,球迷:这人早该换了

邵佳一真大胆,9年绝对主力被拿下,助国足3-0大胜,球迷:这人早该换了

我就是一个说球的
2026-09-24 22:43:44
彻底不要底线的荒诞操作,终于引起全网网友公愤了!

彻底不要底线的荒诞操作,终于引起全网网友公愤了!

胖胖说他不胖
2026-09-24 10:55:23
刘国梁,现场见证国乒这场历史性失利!王楚钦:有很大部分原因在我这里

刘国梁,现场见证国乒这场历史性失利!王楚钦:有很大部分原因在我这里

南方都市报
2026-09-24 22:19:43
彻底怒了!韩国体协会长柳承敏:日本亚运会是我见过办赛水平最差的大赛

彻底怒了!韩国体协会长柳承敏:日本亚运会是我见过办赛水平最差的大赛

新杀猪的秀才
2026-09-24 15:27:42
国乒男团不敌东道主日本队,无缘亚运乒乓首金

国乒男团不敌东道主日本队,无缘亚运乒乓首金

澎湃新闻
2026-09-24 19:24:04
美国欢迎晚宴的国宴菜单公布,恰逢中国中秋节,但是月饼不再出现

美国欢迎晚宴的国宴菜单公布,恰逢中国中秋节,但是月饼不再出现

光电科技君
2026-09-24 23:26:47
单日狂揽32金!24日结束,金牌榜更新:中国奖牌破百 诞生大遗憾

单日狂揽32金!24日结束,金牌榜更新:中国奖牌破百 诞生大遗憾

大秦壁虎白话体育
2026-09-24 22:07:17
特朗普亲自接机,最破防的是日本!

特朗普亲自接机,最破防的是日本!

环球策论
2026-09-24 19:11:15
大熊猫“平平”“福双”将会落户美国亚特兰大动物园

大熊猫“平平”“福双”将会落户美国亚特兰大动物园

界面新闻
2026-09-24 23:02:46
哥哥的鲜血、父亲的教诲、10·7的火光:内塔尼亚胡为何对哈马斯、真主党和伊朗战意十足?

哥哥的鲜血、父亲的教诲、10·7的火光:内塔尼亚胡为何对哈马斯、真主党和伊朗战意十足?

寰球经纬所
2026-09-23 13:44:00
越南深度改革对我国的启示

越南深度改革对我国的启示

大国老记老顾
2026-09-24 11:18:00
韩国游泳选手:潘展乐会主动过来开玩笑,还叫我“欧巴”逗我

韩国游泳选手:潘展乐会主动过来开玩笑,还叫我“欧巴”逗我

懂球帝
2026-09-24 22:50:12
亚运会|王楚钦谈男团失利:心情非常沉重,能力上还有差距

亚运会|王楚钦谈男团失利:心情非常沉重,能力上还有差距

北青网-北京青年报
2026-09-24 21:31:04
中东国家已然看清:采购再多的中国先进武器,也难以换来长久安全

中东国家已然看清:采购再多的中国先进武器,也难以换来长久安全

兵卒史
2026-09-24 20:27:00
网传比亚迪陷入风波,员工怒了,到底咋回事?

网传比亚迪陷入风波,员工怒了,到底咋回事?

慧翔百科
2026-09-23 12:05:38
再这么打下去,亚运会真快办不下去了!东道主日本苦拼两天才8金

再这么打下去,亚运会真快办不下去了!东道主日本苦拼两天才8金

荆楚寰宇文枢
2026-09-24 23:12:47
三年前,人人热议的成都“牵手门”事件,彻底改变女主的人生轨迹

三年前,人人热议的成都“牵手门”事件,彻底改变女主的人生轨迹

四海神君
2026-09-24 13:40:04
2026-09-25 07:03:00

科技要闻

Claude在DNA里挖出新发现!大佬张锋点赞

头条要闻

5架战机飞越白宫 致敬中美两国元首夫妇

头条要闻

5架战机飞越白宫 致敬中美两国元首夫妇

体育要闻

巴图姆,以父之名

娱乐要闻

93岁游本昌去世 最后一句话惹人泪目

财经要闻

跌光1400亿,“女王”亏麻了

汽车要闻

全新第四代博越L 上市限时价9.29万元起

态度原创

教育
游戏
数码
时尚
公开课

教育要闻

平行线分类讨论,一个视频学会!

R星公布《GTA6》399.99美元收藏套装 不含游戏

数码要闻

罗技G PRO X3 LIGHTSPEED头戴式游戏耳麦发售,到手价1699元

檀健次和孟子义,邀你一起来Fendi跳舞

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版
×