网易首页 > 网易号 > 正文 申请入驻

24 天估值暴涨 37 倍,这就是 AI 圈年度爽文

0
分享至


Jev 火了,一个非文本的 AI 模型在今天拿到了由 a16Z 领投的 8.7 亿美元融资,其公司 TypeSafe 的估值直接来到了 75 亿美元。

在 9 月 15 号刚刚发布时,TypeSafe 种子轮才 4000 万美元、估值约 2 亿;24 天,估值翻了 37 倍。


根据 Jev 创始人在 X 晒出的成绩单,Jev 在几天内容就突破了 100 万用户,模型推出三周,单日处理了数万亿 Token,有大约三分之一的财富 500 强都在使用这款决策模型。

一时间,决策模型遍地开花。从 OpenAI 开发者大会上发布的 Decisions API,到开源平台 vLLM 一口气发布了 6 款决策模型,再到今天,微软也发布了自己的决策模型——Microsoft-Decision-1。


什么是决策模型,这是一个不会聊天、不会写代码、不会总结文档的模型,我们给它一段上下文和一组预先定义好的候选答案,它能在短时间内返回每个选项的校准概率,仅此而已。

而为什么是现在火起来,根本原因还得是 Agent 真的跑起来了。

在一个 Agent 任务里有几十次小的分支判断,路由到哪个模型、这个工具调用要不要放行、继续还是停止。这些判断答案空间有限、调用量大、全在关键路径上。用前沿 LLM 做每一次判断,任务的延迟就会按秒叠加、账单会按 token 不断增加。

正如微软在 Decision-1 模型发布的技术博客里提到的一样, Agentic AI 成为现实后,成本成了人们决定怎么用 AI 的主要因素。


当大家都开始做决策模型

普通大模型接到任务后,会按照 token 逐步生成文字。哪怕用户要求它输出类似决策的 JSON 格式文本,模型仍然需要处理格式错误、解释混入、字段缺失,等等常见的文本模型问题。

微软今天发布的 Microsoft-Decision-1 和之前的决策模型一样,它的输入是 一段证据 + 一个问题 + 一组固定选项,模型会单次前向直接输出每个选项的概率,而这些输出是给程序用的,不是给人看的。


举个例子,Agent 已经准备调用一个外部工具,Decision-1 可以在「继续执行」「重试」「换工具」「转人工」之间给出概率。应用再根据阈值决定下一步:

  • 置信度足够高,直接执行;
  • 几个选项接近,交给更大的模型;
  • 出现「cannot tell」,转人工复核。

目前 Decision-1 支持 yes/no、多选、评分、分类,也可以按照一套 rubric 给 AI 回复或 Agent 动作打分。它一次调用最多处理 32K token,输入和输出都是文本与 JSON,不生成解释或推理过程。

这款模型以 Qwen3.5-9B 为基座,由微软继续训练,而训练数据来自经过 Microsoft Open Data 流程的公开数据集,以及团队生成的合成数据。


所以总结下来,它的工作更像一个评分器,大模型负责提出方案,Decision-1 负责检查方案是否满足条件;大模型负责写出回复,Decision-1 负责判断回复能不能交付。

这类决策模型大概率也会作为 Agent 基础设施的一层留下来,但不会取代普通大模型。

微软在技术博客里提到 Decision-1 在 36 个测试集、近 15 万道题里取得最高准确率,速度比 Quyet-1.0-Large 快 4.5 倍,比 GPT-6 Sol 快 35 倍。


而除了准确度和时延,微软 Decision-1 真正的杀手锏是校准概率。当模型说由 90% 把握时,并能做到真的对 90%,于是我们可以设阈值,高于 90% 自动执行,低于就转人工或升级大模型。

OpenAI 推进类似的产品是此前在开发者大会亮相的 Decisions API,如今正式开放公测,由 GPT-6 Luna 驱动。

它支持根据文本和图片判断条件成立的概率、从预设选项中作出选择,或按照指定标准评分,可以用于投诉分流、图片检查、模型路由和风险筛查等任务。


图|https://platform.openai.com/decisions

根据 OpenAI 公布的数据,相比通过 Responses API 调用同一模型,Decisions API 在特定任务中的速度最高可提升 10 倍,每百万输入 Token 收费 0.10 美元,不收取输出及缓存费用。

而在开源社区,vLLM 也一口气推出了 6 款决策模型。和微软 Decision-1 一样,它们同样基于不同版本的 Qwen 模型进行后训练。



有网友把这段时间涌现的决策模型汇总了起来,发现其中大多数的决策模型都是不同版本的千问模型,除了 OpenAI 的Decision API 和 Jev 本身。


图|来源:X@Michaelzsguo

我们在 vLLM 的 Decision 2.0 首页也能体验这些决策模型是如何运行的。它最适合这些任务:

  • 请求分类、模型路由、搜索结果相关性判断;
  • 给 AI 回复或 Agent 动作打分;
  • 安全拦截、数据校验、工单分流;
  • 从固定动作中选择下一步;
  • 大规模文本标注。

在 Demo 项目里主要列举了 LLM 路由等功能,用户输入的提示词 17 x 24 的结果是什么,决策模型的输出是针对 6 个决策的结果,包括模型、复杂程度、是否尝试越狱、需要什么工具、是否需要事实核查,以及延迟优先级六个选择。


图|https://huggingface.co/spaces/vllm-sr/decision-studio

普通的选择分类很擅长处理明确的规则,比如文件后缀是 .jpg 就交给图片处理器,金额超过 1 万元就要求二次确认。

但「这条客服消息是不是紧急」「这段检索内容有没有回答问题」「这条命令是不是有破坏性」,代码很难只靠规则判断。

Jev 这类决策模型就是来处理这些模糊的判断,但分支和动作仍然由代码控制。


图|https://x.com/akshay_pachaar/status/2101037514945597645

严格来说,它没有从零发明「判断」这件事。分类器、重排模型、奖励模型、验证器和内容审核模型,早就在处理受限选择。

新的地方在于,决策模型把这些能力包装成了一个跨任务的接口:应用可以在请求时声明问题、候选项和评分标准,模型返回类型化结果和概率。


廉价智能的未来

TypeSafe 在发布 Jev 时,把它称为第一个 System One Model。

它最大的吸引力就是足够便宜、足够快:部分任务可以达到 70–500 毫秒延迟,输入价格为每百万 Token 0.042 美元。按照 TypeSafe 的说法,部分场景下,它能比通用大模型工作流快几十到几百倍,成本也低几十到几百倍。


对于需要不断处理小型判断的 Agent 工作流来说,这意味着许多过去用大模型不划算的任务,现在也有了调用 AI 的可能。


图|创始团队 20 多人:CEO Diogo Almeida(前 OpenAI 研究员)、Sasha Sheng(前 Meta)、Erik Gafni。

在最近的融资新闻里,Jev 创始人 Diogo 对 a16z 说,AI 已经很强,但过去十年软件本身几乎没变。产品最多在侧边加一个能执行部分操作的聊天机器人,却没有让软件真正理解意图、做判断、自己完成更多工作。


图|人工智能在三年内衰落的幅度,相当于个人电脑在15年内的衰落幅度。

AI 正在帮助人类更快地写软件,却还没有让软件本身更智能;Jev 的价值,就在于把最新模型的能力以传统软件能承受的成本嵌进去。


人一天能向 AI 提出的问题终究有限,但一款软件每天需要处理的判断,却可能有成千上万次。当每一次判断都便宜到足以忽略,AI 的使用规模也就不再受限于有多少人愿意打开聊天框。


过去几年,整个行业都在努力提高智能的上限,让模型解决越来越复杂的问题。而现在,越来越多的公司开始争夺另一件事:让最普通、最微小的判断,也值得调用一次 AI。

从这个角度看,TypeSafe 在短短 24 天里暴涨至 75 亿美元的估值,还有微软、OpenAI 的加入,他们押注的也许就是这样一个未来:

人们未必会使用更多 AI 产品,但我们每天使用的每一款软件,都可能在背后调用 AI 成千上万次。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

事态已经全面升级!赖清德有可能成为新中国历史上,唯一一位在任台湾地区领导人中出现重大变故的人物

人生录
2026-09-11 00:05:21
这是今年最讽刺的绿毛龟事件吗?

这是今年最讽刺的绿毛龟事件吗?

雷斯林
2026-10-09 19:30:15
24元救命药飙涨到1200元,网友:趁火打劫吧?

24元救命药飙涨到1200元,网友:趁火打劫吧?

东方豪侠
2026-10-09 14:59:31
变天了!世界不再认中国“全球第三”,双核格局成型,美国清醒了

变天了!世界不再认中国“全球第三”,双核格局成型,美国清醒了

麓谷隐士
2026-10-10 00:10:04
《伟大的长征》口碑井喷,本是冲着于和伟来的,却被48岁男配惊艳

《伟大的长征》口碑井喷,本是冲着于和伟来的,却被48岁男配惊艳

乐天闲聊
2026-10-10 03:47:57
唐国强再次回应“谁叫王俊凯”被攻击一事:后来见面已当面道歉,解释因年龄代沟不认识王俊凯;此前因此事被骂到关闭评论

唐国强再次回应“谁叫王俊凯”被攻击一事:后来见面已当面道歉,解释因年龄代沟不认识王俊凯;此前因此事被骂到关闭评论

大风新闻
2026-10-09 21:24:03
马斯克母亲和黄仁勋父母受邀现身白宫,受到特朗普热情接待并合影

马斯克母亲和黄仁勋父母受邀现身白宫,受到特朗普热情接待并合影

玖宇维
2026-10-10 11:23:27
当年被全村嘲笑的本田四不像,现在回头看才知道它有多超前

当年被全村嘲笑的本田四不像,现在回头看才知道它有多超前

味健的汽车
2026-10-10 10:25:16
中共中央批准,开除连辑党籍

中共中央批准,开除连辑党籍

新京报
2026-10-09 18:02:07
林志斌谈雅阁刹车踏板:3000N压不裂,是压出来的不是算出来的

林志斌谈雅阁刹车踏板:3000N压不裂,是压出来的不是算出来的

固件更新中
2026-10-09 15:13:14
局势急剧升级!莫迪贸然采取军事行动,印军越境实施火力打击,美方出动 F‑35A 战机予以支援,中印边境是否将出现变局,引发各界广泛讨论

局势急剧升级!莫迪贸然采取军事行动,印军越境实施火力打击,美方出动 F‑35A 战机予以支援,中印边境是否将出现变局,引发各界广泛讨论

z千年历史老号
2026-10-10 21:50:36
深度长文:女性高潮,为什么存在?那本不是进化宿命!(近万字)

深度长文:女性高潮,为什么存在?那本不是进化宿命!(近万字)

宇宙时空
2026-10-10 16:08:03
四五十元一个的面包没人买了,开面包店的年轻人集体闭店

四五十元一个的面包没人买了,开面包店的年轻人集体闭店

每日人物
2026-10-10 10:18:40
广西男子河道捞沙时捡到春秋编钟卖了30万元,被判5年并追缴违法所得

广西男子河道捞沙时捡到春秋编钟卖了30万元,被判5年并追缴违法所得

极目新闻
2026-10-10 12:10:07
摄影师泰国失联再迎噩耗!曝转卖细节,大使馆出手,绑匪威胁撕票

摄影师泰国失联再迎噩耗!曝转卖细节,大使馆出手,绑匪威胁撕票

小鋭有话说
2026-10-10 17:13:41
大闸蟹全线崩盘?中小规格跌至5元,大精品一只仍高达百元

大闸蟹全线崩盘?中小规格跌至5元,大精品一只仍高达百元

界面新闻
2026-10-10 14:10:45
赴屏东辅选狂攻新潮流,郑丽文怒批:还来一个洋流,乱流这么多

赴屏东辅选狂攻新潮流,郑丽文怒批:还来一个洋流,乱流这么多

海峡导报社
2026-10-10 21:46:04
厄尔尼诺给中国出难题!真正的考验不是暖冬,而是2027年夏天!

厄尔尼诺给中国出难题!真正的考验不是暖冬,而是2027年夏天!

琴音缭绕回
2026-10-10 22:10:00
广东省珠海市委原常委、统战部原部长郭才武被“双开”

广东省珠海市委原常委、统战部原部长郭才武被“双开”

界面新闻
2026-10-10 17:03:31
“滚回你的国家去!”希腊一中学爆出种族歧视风波,学生占领校园抗议

“滚回你的国家去!”希腊一中学爆出种族歧视风波,学生占领校园抗议

以希腊之名
2026-10-09 18:20:24
2026-10-10 22:43:00
爱范儿 incentive-icons
爱范儿
消费科技第一媒体
39530文章数 2602663关注度
往期回顾 全部

科技要闻

上世纪成熟的踏板,为何今天还会断裂?

头条要闻

郑钦文晋级中网决赛创历史 曾让决赛对手泪洒中网赛场

头条要闻

郑钦文晋级中网决赛创历史 曾让决赛对手泪洒中网赛场

体育要闻

十年回首:湖人三榜眼的夏天,与NBA无关

娱乐要闻

宋佳一串三大满贯 争议随之而来

财经要闻

双汇因抗生素超标共被罚1.29亿元

汽车要闻

千匹马力+三把锁/顶配能浮水 银河战舰700限时焕新价16.98万起

态度原创

艺术
旅游
游戏
本地
公开课

艺术要闻

吴冠中一幅《黄山竹林》,3220万!

旅游要闻

央视关注!国庆假期,代县政府大院向游客开放,收获好评!

《魔兽无限》经典女角色新模型曝光!11月4日回归

本地新闻

踏访沙县第一村,寻国民小吃本源

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版