网易首页 > 网易号 > 正文 申请入驻

不写字的 AI 凭什么刷屏? Jev,把「判断」做成了软件零件

0
分享至


AI 圈这几天最受关注的名字,是一个不会聊天的模型,Jev。

它不写文章、不写代码,也不陪用户聊天。有人问它「这封邮件紧急吗」,它不会先写三段分析再下结论,而是直接回答「紧急,概率 95%」。

发布才一周,创始人发布的官宣帖在 X 上的浏览量冲上数千万;主流 AI 模型网关 Vercel,上线 24 小时内就有近 13% 的付费团队接入。有人拿它打《毁灭战士》,移动、瞄准、绕障一气呵成,流畅得不像机器;有人让它和 GPT-6 Astra 在《我的世界》里用 8 分 43 秒打赢末影龙,总花销不到 1 美元,其中 Jev 只占 0.01 美元;还有开发者实测 6 个代码 PR 后推算,审 1000 个只需 7 美分,而同等工作交给 Claude Opus 5 要 14.5 美元。

一个不会聊天的模型,为什么能引来整个技术圈集体关注?

热度从哪里来

先交代出身。Jev 来自美国创业公司 TypeSafe AI。创始人 Diogo Almeida 是 OpenAI 老将,也是 InstructGPT 和 RLHF(基于人类反馈的强化学习)论文的共同作者,这两项工作正是 ChatGPT 技术路线的重要前身。2024 年他离开 OpenAI,带队隐身研发两年,直到 2026 年 9 月 15 日才正式亮相。资本早已押注,DCVC 领投了 4000 万美元种子轮。

Jev 这个名字本身也经过设计,取自 19 世纪英国经济学家威廉·杰文斯。杰文斯用「杰文斯悖论」说明一个道理:效率提升,有时反而会带来更大的总体消耗。一家 AI 公司拿一位经济学家当名字,隐隐指向它对「效率」的执念,这正是 Jev 的立身之本。

发布当天,它在 Hacker News 冲到 1800 多分、近 500 条评论;OpenRouter、Cloudflare、LangChain 等主流平台先后接入;几天之内,社区还出现了开源仿制版。

发布 36 小时,TypeSafe 收到的内测申请就涉及约 14 万名开发者;9 月 21 日 Jev 向所有人开放,每位新用户直接送 5 美元额度,约合 1.2 亿 token。按官方口径,一次判断通常只烧几百个 token,省着点够个人尝鲜几十万次。换句话说,它几乎把「决策」这件过去很贵的事,做到了接近免费,热度的含金量也在这里。

为什么一个不会说话的模型能引爆这样的热度?因为过去两年,大家可能让 AI 干了太多它不擅长的事。

看看社区都拿它干了什么。有人把它接进 Claude Code 做上下文清理,让长对话不再越聊越笨;也有人因此翻车,用不做推理的分类模型去删改 Agent 历史,模型忘掉了试过的操作、陷入循环。还有人拿它实时判断跑酷游戏里下一个平台落点、给 Agent 验收任务、在 40 秒内拆完 724 条实时广告。这些用法有个共同点,都不是要它「说」,而是要它「判」。

过去一年,Agent 概念正当红,可真正落地时大家才发现:一个 Agent 跑起来,要做的不是「想」,而是无数次「判断」,调哪个工具、留哪些上下文、这次操作有没有风险、结果要不要人工复查。这些高频判断题交给动不动就「深度思考」的大模型,既慢又贵。Jev 的走红正踩在这个节点上,在最需要的时候递上一把顺手又便宜的刀。

Jev 是什么:把「判断」做成零件

做 AI 产品的人都熟悉一个困境:系统里每天有海量琐碎判断,这封邮件算不算投诉,这笔退款该不该自动批,这条评论要不要删。

最常见的做法,是每次都请一个大模型来回答。但大模型的核心工作方式是「生成」:用户要一个「是或否」,它可能先写三段分析再给结论,按字数收费,还要等上几秒甚至几十秒,回来的文字还得让程序拆解、校验,格式不对就重来。

更麻烦的是,大模型说「我很确定」时,这句话本身不附带刻度。「很确定」到底是七成还是九成?剩下那部分不确定性落在哪个方向?无从得知。于是大量本该由机器自动完成的判断,卡在一种两难里:用大模型太贵太慢,靠写死的规则又不够灵活。

TypeSafe 把这类模型命名为「System One」,借用了诺贝尔经济学奖得主卡尼曼《思考,快与慢》里的框架:人脑有两套系统,System 1 负责不费力的直觉快判断,System 2 负责缓慢的深度推理。GPT、Claude 这些主流模型全是「System 2」路线,逐字推演、组织语言、生成答案,能力强,但慢、贵、输出不可控。

Jev 则是第一个公开的「System One」模型。它放弃文本生成,专做决策:给它一段状态,比如一份文档、一条工单、一段聊天记录,再附上几个预设好类型的问题,它一次并行返回所有答案,每个答案都带概率和置信度。

这个概念并非空穴来风,卡尼曼的理论本身就给出了依据:人脑在做大量琐碎决策时,靠的正是那个不费力的系统一;只有在真正复杂的问题上,才启动缓慢的系统二。TypeSafe 想做的,就是给软件也装一个「系统一」,让高频、明确、低风险的判断变得又快又便宜,把宝贵的「系统二」留给真正需要深度推理的任务。


人脑的快慢思考,如何变成 AI 的两种路线

工作流程大致五步:先描述决策需求,系统生成问题集供用户挑选;再从历史标注数据里选样本喂给它,优化判断逻辑;最终对每个输入返回「决策结果+置信概率」,用户可以设阈值,低于阈值的转人工或交回大模型。要提醒一句:Jev 本身无状态,不记忆历史;所谓「复用」要靠外部配置层,把高置信度的判断模式沉淀下来反复调用。

输出形式只有三种,全是「强类型」:Choice(从选项里选一个)、Score(在刻度上打分)、Noul(判断一件事成立与否,返回 0 到 1 的概率)。它不可能输出类型之外的东西,也就从结构上杜绝了生成式模型那种「幻觉」:它不会编造一篇不存在的文章,最多只是选错一个选项。


Jev 只输出三种「强类型」结果:Choice、Score、Noul


Jev 的工作流程:把「判断」做成软件可直接使用的零件

快 20–200 倍、省 40–400 倍:一次分工的胜利

按 TypeSafe 官方数据:端到端响应时间 70 到 500 毫秒,传统大模型要 3 秒到 300 多秒,快 20 到 200 倍;每百万输入 token 只要 0.042 美元,输出免费,成本低 40 到 400 倍。这一设计带来的数字相当夸张。但这两个区间的上限,是厂商在自家工作流里跑出的最乐观值,独立实测通常达不到那么多倍。一次请求还能并行回答多个判断问题,问题多了延迟也基本不变。


同一个判断,两种响应速度

这里不妨打个比方。过去请 AI 做事,像请一位作家替人写报告,他文采飞扬,可用户要的只是一个「是或否」,他还得先洋洋洒洒写八百字。Jev 则像请了一位裁判,什么都不写,只在摆好的选项里果断亮分。同样是做判断,前者的强项在表达,后者的强项在决策。而软件后端九成以上的调用,需要的恰恰是后者。

TypeSafe 反复强调的一个词是「校准」,训练方法叫 RLCD(面向校准决策的强化学习)。这里要打个折扣:让「模型说有 95% 把握的答案,在真实世界里大约 95% 是对的」,是 RLCD 的设计目标,并不是已经拿到验证的结论,官方目前还没公布可靠性图或 ECE(期望校准误差)数据。而且官方文档自己说明,「把握」衡量的是各选项之间的相对偏好,不等于答案的绝对正确率。

TypeSafe 自评的四项业务工作流里,Jev 准确率 67.8%,最强的基线模型是 74.1%;OpenRouter 用 3080 条真实客服语料(Banking77)实测,Jev 是 81.0%,Claude Opus 5 是 84.4%。也就是说,它并不「更准」,只是把速度和成本压了下来。准确率恰恰是最需要冷静看待的一项,这也是为什么高置信度要设阈值转人工,在把判断交给它之前,最好先用自己的数据测一测。

另外提醒中文读者:Jev 对中文的支持目前弱于英文,官方文档明确标注 CJK 语言「可用但准确率不等同英文」,中文场景建议先用自有材料测过再决定。这个服务目前在中国大陆还无法直接使用,官方并没有公布地区限制名单,主要是服务节点集中在美国西海岸、尚未覆盖亚太,想用的中文开发者得先想想接入渠道。

置信概率的意义:一条输入,两条路径

这引出 Jev 真正的用法:完全信任模型,要担出错风险;完全人工审核,又效率低下。现在可以按业务容错率设一个阈值:高置信度直接自动化执行,低置信度转人工或升级到大模型,既提升自动化比例,又守住风险底线。

用一位开发者的比喻:以前的 LLM 像是返回一个自由格式的字符串,得自己写正则、解析、异常处理、重试;Jev 像是直接返回一个强类型对象,字段类型确定、值域确定,连置信度都算好了。

至于「快而可靠」里的「可靠」,实际测试要打个问号。有媒体拿 190 次财报任务实测:第一轮 45 次全对,是因为增长率事先算好喂给了它,那一串「满格把握」说明不了什么;一旦把正确选项从列表里拿掉,Jev 会把八成以上的置信度押在与事实矛盾的描述上,毛利率题连错 10 次时,报出的把握也都在八成以上。它真正的卖点是便宜,而不是这份「把握」。

当然,官方也坦承,并非所有任务都能获得同等提升,这些数字是基于自有业务自动化工作流跑出来的。横向看,Jev 单次请求能并行处理多个判断问题,数量增加而延迟基本不变,这让它特别适合嵌入现有软件:代码继续控制业务流程,Jev 只负责其中一个范围明确的判断,像是给程序加了一个只管判断的专职模块。

JEV 与传统大语言模型(LLM)在响应速度与调用成本上的对比(对数刻度)

哪里该用,哪里别碰

Jev 擅长的高频固定判断,恰恰是 Agent 落地时最拖后腿的部分。在一个真正的 Agent 里,它至少能顶三个位置。

  • 模型路由:判断这次请求该调用哪个大模型,还是根本不用调用、直接走预设逻辑,能省下大把 token 钱。
  • 工具调用门槛:判断该不该调工具、调哪个工具,不必每次都让大模型做选择,响应快得多。
  • 验证与监督:对大模型生成的结果做校验,看是否符合要求、有没有风险,不必把输出再喂给大模型审一遍。


Jev 在 Agent 里顶的三个位置

落到具体业务上,客服工单分类、用户意图识别、内容合规校验、商品打标、实时风控、查询路由到知识库,凡是「从几个明确选项里做决定」的活,都是它的主场。

但边界同样清晰:如果要的是写文案、生成摘要、创作故事、开放域问答这类「生成非固定结果」的场景,Jev 帮不上忙,还得回到大模型。如果决策逻辑极其复杂、选项没有固定边界、或者样本少得连判断依据都没有,也别硬用。它只支持文本输入,选择字段的候选上限是 255(官方文档),评测也主要基于自有业务工作流,而非 MMLU 等公开基准。

一句话:它是一把精密的扳手,不是瑞士军刀。放对位置,它是利器;放错位置,就成了隐患。

更现实的用法,是把它当 Agent 架构里的一层。过去一个 Agent 跑起来,判断一次调一次 LLM,路由一次调一次,验证一次再调一次,延迟、成本和不确定性层层叠加。把高频判断拆给 Jev 后,架构就变成「规则+决策模型+LLM+工具」的多层协同:LLM 继续负责复杂推理,Jev 负责那些又小又急的判断题。这种拆法,可能是它在工程上最值钱的地方。

热闹背后的真问题

围绕 Jev 的争议不少,Redis 之父 antirez 就公开泼冷水:Jev 或许有一些很狭窄的应用场景,但围绕它出现的炒作,恰恰说明 AI 泡沫里的大多数人分不清什么重要、什么不重要。这种质疑不无道理,Jev 并没有抬高 AI 的能力上限,它只是把「判断」这件小事做得又快又便宜。

也有人直接说它「不就是个 JSON 分类器吗」。但大模型研究工程师 Sebastian Raschka 提醒别低估它:传统分类器训练完标签就固定了,场景一变就要重训;Jev 能在运行时接收自然语言标签,结合上下文对动态选项做判断,泛化能力完全不同。2026 年 9 月 20 日,谷歌 Gemma 官方账号发了条「DiffusionGemma as Jev」,把自家的扩散模型适配成 Jev 式决策接口,风向的变化比争吵更说明问题。

技术之外,Jev 真正触及的,是行业一个长久的困惑:为什么模型已经这么能聊,大规模自动化却没有随之而来?TypeSafe 的答案是,聊天形态的模型,天生不是软件该依赖的接口。软件需要的不是一篇篇「文章」,而是一个个确定、可靠、能插进控制流的判断。把「判断」单独拆成一层,让大模型专注复杂推理,这可能是 Agent 架构下一轮演进的起点。

质疑者担心的是热度跑在能力前面;支持者看重的是它把「判断」做成了一种可复用的基础能力。两者其实并不矛盾,分野恐怕要等 Agent 真正大规模落地后才有答案。对普通读者而言,比起记住这些数字,更值得留意的是这个信号:当判断开始按件计价、按毫秒交付,软件自动化的门槛,正在被一点点磨低。

(本文首发钛媒体APP,作者 | 硅谷Tech-news,编辑 | 焦燕)

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
近3000名教育局长,相当一部分没教过书:谁在掌舵中国基层教育?

近3000名教育局长,相当一部分没教过书:谁在掌舵中国基层教育?

王姐懒人家常菜
2026-09-25 09:59:36
信号不寻常!日本最新动作,非常阴险

信号不寻常!日本最新动作,非常阴险

斐君观点
2026-09-24 15:19:40
已确认!是西安籍演员窦骁

已确认!是西安籍演员窦骁

91.6陕西交通广播
2026-09-24 15:34:33
迪卡侬已经把新百伦惹毛了

迪卡侬已经把新百伦惹毛了

蔚然未来消费
2026-09-25 08:36:56
恐怖三分雨!韩国狂轰15记三分,中国女篮外线迎来终极大考

恐怖三分雨!韩国狂轰15记三分,中国女篮外线迎来终极大考

潇湘烟雨水
2026-09-25 07:44:50
利差明摆着,美国利息5%,中国1.68%,为何没人敢做人民币套利?

利差明摆着,美国利息5%,中国1.68%,为何没人敢做人民币套利?

補懂事的孩紙
2026-09-24 18:28:07
日本媒体确认了:日本首相高市早苗与乌克兰总统泽连斯基举行了会谈,高市表示,关于乌克兰危机,日本将致力于对乌克兰援助并对俄罗斯制裁

日本媒体确认了:日本首相高市早苗与乌克兰总统泽连斯基举行了会谈,高市表示,关于乌克兰危机,日本将致力于对乌克兰援助并对俄罗斯制裁

吉刻新闻
2026-09-24 07:32:30
美方在台湾问题上有了新说辞:若中国和平统一,美国不会反对

美方在台湾问题上有了新说辞:若中国和平统一,美国不会反对

吕醿极限手工
2026-08-27 14:18:48
突发!梁王拆对,国羽男双大调整!

突发!梁王拆对,国羽男双大调整!

佑铭羽球
2026-09-25 11:00:04
热刺有救了!英超冠军名帅或将空降!利物浦弃帅实力碾压德泽尔比

热刺有救了!英超冠军名帅或将空降!利物浦弃帅实力碾压德泽尔比

澜归序
2026-09-25 08:50:59
亚足联主席这下尴尬了,U23国足0-0阿联酋,小组第一出线了

亚足联主席这下尴尬了,U23国足0-0阿联酋,小组第一出线了

星Xin辰大海
2026-09-25 07:13:48
金亨泰:《剑星》为不同服装扫描约七至八名模特

金亨泰:《剑星》为不同服装扫描约七至八名模特

3DM游戏
2026-09-24 13:07:07
四名议员施压特朗普,想恢复对台军售,鲁比奥表态,释放两大信号

四名议员施压特朗普,想恢复对台军售,鲁比奥表态,释放两大信号

DS北风
2026-09-24 14:30:03
彻底不要底线的荒诞操作,终于引起全网网友公愤了!

彻底不要底线的荒诞操作,终于引起全网网友公愤了!

胖胖说他不胖
2026-09-24 10:55:23
本周五中秋节,别再说“中秋快乐”了,送你30句高级祝福语,好听不俗套

本周五中秋节,别再说“中秋快乐”了,送你30句高级祝福语,好听不俗套

小谈食刻美食
2026-09-22 17:56:46
特朗普向全世界许下一个承诺!全世界该谢的不是美国,是中国!

特朗普向全世界许下一个承诺!全世界该谢的不是美国,是中国!

一些小事
2026-09-25 10:25:51
马斯克、黄仁勋等人参加白宫欢迎宴会

马斯克、黄仁勋等人参加白宫欢迎宴会

凤凰网科技
2026-09-25 11:28:14
单日狂揽32金!24日结束,金牌榜更新:中国奖牌破百 诞生大遗憾

单日狂揽32金!24日结束,金牌榜更新:中国奖牌破百 诞生大遗憾

大秦壁虎白话体育
2026-09-24 22:07:17
大反转!伊朗突然改口!

大反转!伊朗突然改口!

财经要参
2026-09-24 07:06:54
杭州坠亡女童离世六年后母亲即将迎来三胎 ,回应49天怀孕争议

杭州坠亡女童离世六年后母亲即将迎来三胎 ,回应49天怀孕争议

大厂编外实习生
2026-09-24 12:49:25
2026-09-25 14:48:49
钛媒体APP incentive-icons
钛媒体APP
独立财经科技媒体
139891文章数 862647关注度
往期回顾 全部

科技要闻

华为赛力斯,一次声势浩大的权、利再分配

头条要闻

美方报告呼吁撤出派驻台湾的军事训练人员 国防部回应

头条要闻

美方报告呼吁撤出派驻台湾的军事训练人员 国防部回应

体育要闻

这场青春风暴,中国足球等了太久

娱乐要闻

肖战因拍《十日终焉》连续做半个月梦

财经要闻

月饼卖不动了...

汽车要闻

全新第四代博越L 上市限时价9.29万元起

态度原创

家居
健康
数码
艺术
游戏

家居要闻

2026建博会(广州) 公装联探展交流活动

鼻子三角区的痘,千万别乱挤!

数码要闻

纯风冷压2000W不是梦!猫头鹰要搞革命性散热技术:目前有一大硬伤

艺术要闻

419米!温州第一大民企出手,“浙江第一高楼”施工新进展!

魔兽玩家随机取名 生成后却被判违规并强制改?

无障碍浏览 进入关怀版