![]()
9 月 21 日,过去一周迅速走红的 AI 模型 Jev,正式宣布向所有用户开放。
开发团队 TypeSafe AI 当天宣布取消候补名单,任何人都可以直接注册使用,新用户还可获得 5 美元初始额度。
就在几天前,Jev 还只是一个刚刚发布的新模型,但很快就在硅谷开发者社区里火了起来。Vercel、LangChain、Browser Use 等平台和团队陆续接入,各种 Demo 也开始密集出现。更特别的是,它几乎完全不同于过去几年人们熟悉的大模型形态。它不聊天、不写文章,甚至不会生成一句完整的话。
![]()
(来源:X)
开发者只需要给它一段复杂的状态信息,再规定需要回答的问题和候选结果,Jev 就会直接返回一个结构化判断以及对应概率。比如,不是让模型解释“这个客户是否可能流失”,而是直接得到“流失概率 82%”;不是让它分析 Agent 下一步应该做什么,而是直接从几个候选动作里选出一个。
TypeSafe 把这类模型称为 System One Model,名字来自丹尼尔·卡尼曼《思考,快与慢》里的“系统一”。代表一种快速、直觉式的判断机制。
它由前 OpenAI 研究员 Diogo Almeida 创立的 TypeSafe AI 推出。Almeida 曾参与 InstructGPT 和早期 RLHF 研究,离开 OpenAI 后与团队研发 Jev 约两年。公司此次亮相时也披露完成 4,000 万美元种子轮融资。
![]()
图|创始人 Diogo Almeida(来源:Typesafe AI)
一周内,开发者把 Jev 塞进了各种软件
9 月 18 日,Vercel 公布数据称,Jev 接入 AI Gateway 后 24 小时,已有接近 13% 的付费团队使用过它,是 GPT-5.6 系列同期的两倍以上。Vercel 因此把 Jev 称为 AI Gateway 历史上“被采用最快”的模型。截至 9 月 20 日,其公开榜单显示,Jev 的团队覆盖率已经升至 27.8%,请求量占比达到 20.8%。
![]()
(来源:Vercel)
真正让 Jev 快速出圈的,则是一批开发者做出来的 Demo。
例如浏览器自动化团队 Browser Use 做了一个名为 jev-ultrafast 的浏览器 Agent。用户只需要给出一句任务,比如“帮我找 9 月 20 日从苏黎世飞往伦敦的单程航班”,系统就会读取网页上的按钮、输入框和下拉菜单,并把它们整理成一张可操作的元素列表。
在这个过程中,Jev 不负责生成整套操作过程,而是在每一步快速判断“接下来做什么、操作哪个元素”,例如点击出发地输入框、选择日期或者按下搜索按钮;只有遇到“输入 Zurich(苏黎世)”这类需要生成文字的动作时,才临时调用一个小型语言模型。公开演示中,这套 Agent 在 Google Flights 上找到对应航班只用了 7.1 秒,单次运行成本约 0.0039 美元;项目记录的 Jev 决策延迟中位数约为 178 毫秒。
![]()
(来源:X)
另一个案例发生在沙盒游戏《我的世界》(Minecraft)里。开发者 Ronak Malde 把 GPT-6 Astra 和 Jev 组成了一套游戏 Agent:Astra 像“指挥官”,负责规划接下来要收集什么物资、走什么路线、怎样前往末地并击杀末影龙;Jev 则负责根据角色当前看到的游戏状态,快速决定眼下具体执行哪个动作;真正的移动、转向和操作再由程序发送到游戏中。
最新一次测试里,这个 Agent 从空背包开始,在一个新的生存模式世界中自行收集物资、利用下界赶路,最后用床爆炸击杀末影龙,全程用时 8 分 43 秒,开发者称模型调用成本不到 1 美元。
![]()
(来源:X)
LangChain 则把 Jev 拿去做 Agent 评测。在 9 月 20 日公布的一组实验里,Jev 平均每次判断耗时约 0.44 秒,成本约 0.00035 美元;在连续打分任务上,它的分数方差比参与比较的 GPT-5.6 Luna、Terra 和 Claude Sonnet 4.6 低 92~913 倍。
这些案例有一个共同点。开发者没有把 Jev 当成另一个聊天机器人,而是在代码原本需要做一次语义判断的地方,把它塞进去。相比传统大模型,最直观的体验差异是快得多,也便宜得多。过去一个 Agent 每走一步,都可能要等模型生成几秒钟。但由于Jev 不生成文字,只返回判断和概率,很多调用可以压到几百毫秒以内。
为什么偏偏是一个“不说话”的模型火了?
有舍才有得。Jev 能够达到这些效果,在于它主动放弃了大语言模型最擅长的一部分能力——文本生成。
传统大模型依赖自回归解码,一个 token 接一个 token 往后生成。但现实中的大量工程场景,真正需要的往往只是一个明确结果:通过还是拒绝、几个选项中选哪一个,或者一个风险概率。为了拿到这些字段,传统方案通常仍要先让模型生成一段文本或 JSON,再由下游程序解析和校验。
Jev 直接砍掉了这一步,它把输出限制在 Choice、Score 或 Bool 等结构化结果中,并支持多个判断并行执行。省去逐 token 串行生成之后,推理延迟和调用成本也随之大幅下降。
与这种极简输出配套的,是 TypeSafe 提出的 RLCD(校准决策强化学习)。它关注的不只是答案对不对,还包括模型给出的概率是否与真实准确率匹配:如果模型长期给出“90% 的把握”,这些判断在统计意义上的正确率也应该接近 90%。对于自动化系统来说,这种校准尤其重要,因为它可以直接成为分流依据:高置信度结果自动执行,低置信度结果再交给更强模型或人工复核。
![]()
(来源:TypeSafe AI)
不过,想要真正看清 Jev,还逃不开另一个问题:它是一个新模型吗?
Jev 上线后,不少开发者的第一反应就是:“这不就是一个分类器吗?”这种质疑并不是没有依据。Transformer 编码器、判别模型和 reranker 早已可以在有限候选项之间打分,Jev 的确没有凭空发明一种全新的判断能力。
它真正不同的地方,更接近于把过去高度专用的分类能力做成一个通用模型。
传统分类器往往围绕固定任务和固定标签训练,而 Jev 允许开发者在运行时直接用自然语言定义问题和候选项,不需要为每一套标签重新训练。同一个模型,既可以给工单分流,也可以判断一次工具调用是否存在风险,还可以给 Agent 的输出打分。大模型研究者 Sebastian Raschka 也认为,这种面向动态标签的零样本泛化能力,是 Jev 与传统封闭式分类器的重要区别。
不过目前,TypeSafe 尚未完整公开 Jev 的网络架构细节和参数规模,外界已知的是它采用 Transformer 路线,并使用合成数据训练。社区测试中也已经出现一些问题,例如改变候选项的排列顺序,可能明显影响输出概率;在部分真实数据集上,它的概率校准也未必优于 CatBoost 等传统算法。TypeSafe 自己同样承认,Jev 在算术、计数、日期和对抗性输入等任务上仍然不够稳定。
所以,Jev 不是一次底层架构革命。它更值得关注的地方,在于提出了一种更明确的模型分工。复杂推理和长程规划交给大语言模型,确定性的业务逻辑继续交给代码,而大量高频、边界清晰的“快判断”,则单独交给 Jev。
这和它的名字来源倒也十分相称。Jev 的名字取自经济学中的“杰文斯悖论”,意思是当一种资源的使用效率提高、单次成本下降后,总使用量反而可能随之增长。TypeSafe 押注的正是这一点,未来的软件不一定需要在每一步都调用昂贵的大模型,便宜又大碗的智能判断才是市场想要的。
1.https://www.typesafe.ai/blog/introducing-jev
2.https://www.typesafe.ai/
3.https://docs.typesafe.ai/
4.https://techcrunch.com/2026/09/15/former-openai-researcher-diogo-almeida-launches-typesafe-ai/
5.https://vercel.com/blog/ai-gateway-jev-model-launch
6.https://vercel.com/ai-gateway/leaderboards/models
7.https://github.com/browser-use/jev-ultrafast
8.https://github.com/rmalde/minecraft-agent
9.https://blog.langchain.com/jev-as-a-judge/
10.https://sebastianraschka.com/
11.https://en.wikipedia.org/wiki/Jevons_paradox
运营/排版:何晨龙
注:封面/首图由 AI 辅助生成
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.