网易首页 > 网易号 > 正文 申请入驻

3B 小模型,8 毫秒完成决策!开源了

0
分享至

大家好,我是 Ai 学习的老章

前文介绍了Perplexity基于Qwen3.8-27B改成一个决策大模型

今天再介绍一个更极速,更小巧的

Liquid AI 正式在 Hugging Face 上开放了两个重磅模型的权重:3B 参数的 d1-3B,以及仅有 600M 参数的多模态 d1-omni-600M

最炸裂的亮点在于速度和机制:它彻底告别了逐字吐字(Token by Token)的生成方式,通过单次前向计算直接输出分类、打分或路由结论,官方实测在单张 RTX 4090 上,完成一次决策仅需 8 毫秒,输出 Token 消耗直接归零

今天老章就带大家扒一扒这次开放的 d1 决策模型到底强在哪、底层怎么跑通的、本地怎么上手,以及有哪些商业授权上的门道

简介

我们平时习惯了的大语言模型,绝大多数属于生成式架构,不管回答多简单的问题,都要经历漫长的自回归解码,一个 Token 接一个 Token 往外蹦

但在真正的工程落地场景中,海量需求根本不需要模型写长篇大论,比如:

  • Agent 收到用户指令后判断该调哪个 Tool

  • 客服工单进来瞬间自动分流到具体业务组

  • 对内容做合规检测、涉黄涉暴与毒性过滤

  • 检索增强 RAG 流程里的精准重排与质量打分

  • 自动化质检里给某张图片缺陷做等级判定

这些场景如果全挂在百亿千亿参数的生成式大模型上,响应延迟动辄高达几百毫秒甚至数秒,显存占用惊人,还要靠各种 JSON Schema 去严防死守模型别胡言乱语

下面这张图直观对比了传统生成式大模型与 d1 决策模型的工程落地差异:


传统生成式 LLM 与 d1 决策模型对比

Liquid AI 这次拿出的 d1 系列,主打的就是快准狠的「单次前向决策」

它定义了三种专门面向决策的基础原语(Primitives):

  • noul :即 Yes/No 判断,直接输出 0 到 1 之间的校准概率值,比如判断某条文本是否为垃圾信息

  • choice :多选一分类,输入一组选项名称和判定标准,输出各个选项的概率分布和最高置信度项,完美契合工单路由和 Tool 调度

  • score :有序梯度评分,支持 2 到 10 级的阶梯评级,输出期望分值、置信度和概率分布,专门解决评估和质检打分

每一次调用,返回结果里的 output_tokens 都是整整齐齐的 0,彻底根除了幻觉和格式崩塌的问题

架构与多模态全家桶

这次放出的两个模型,底层走的是完全不同的骨干网络方案:

1. d1-3B:小体量下的决策天花板

  • 基础骨干来自于 Liquid 最新的多模态视觉模型 LFM2.5-VL-3B,属于 Decoder-only 架构

  • 官方团队融合了 LFM2.5-2.6B 和 LFM2.5-VL-3B 的文本骨干权重,再针对长输入、选项乱序打乱、修复数据捷径等细节进行微调和权重合并

  • 视觉编码器采用 SigLIP2 NaFlex 400M,最大上下文达到 32K,全面支持文本与图像联合决策

下图展示了 d1-3B 的底层模型结构与权重混合训练流程:


d1-3B 架构示意图

2. d1-omni-600M:端侧极简多模态

  • 基于 LFM2.5-Encoder-350M 双向编码器研发

  • 分阶段引入了音频与视觉模块:音频端训练了一个 FastConformer 编码器加适配器;视觉端借用了 LFM2.5-VL-450M 的编码器配合 LoRA 更新

  • 参数量只有 600M,但能够吃进「文本+图片」或者「文本+音频」的混合状态,体积小到连边缘小设备都能轻松吃下

下图呈现了 d1-omni-600M 如何将文本、视觉与音频融合的整体架构:


d1-omni-600M 架构示意图 性能与实测数据

大家最关心的肯定还是两件事:准不准?到底有多快?

在衡量决策能力的权威基准 Decision Index v0.2.1 公开集上,d1-3B 拿下了 48.57 的高分:


Decision Index 表现对比

这个成绩直接压倒了所有 10B 以下的模型,甚至超越了体积大它 12 倍的专有决策模型 Decider 35B-A3B(47.11) 尤其在工具调用(Tools)测试维度上,d1-3B 冲到了 74.5 的高分,对于正在搭 Agent 框架的团队来说相当诱人

再看速度,官方公布的端到端延迟测试相当硬核:

  • RTX 4090 :单次决策仅需 8 毫秒(启用 CUDA Graph 编译模式),未经编译为 16 毫秒

  • AMD MI325X :单次决策仅需 9 毫秒,打包吞吐量达到 1106 次/秒

  • Jetson AGX Thor :单次决策 16 毫秒

  • Jetson AGX Orin 64GB :单次决策 26 毫秒

  • Jetson Orin Nano :最入门的边缘盒子也能做到 50 毫秒以内

  • Apple M5 Pro :走 MPS 加速耗时 30 毫秒

更厉害的是状态复用机制:如果针对同一个上下文同时提问 3 个决策问题,耗时仅仅是单问题的 1.3 倍左右,并不会出现 3 倍线性暴涨

官方在 Hugging Face 空间还开放了 10 个免环境配置的在线体验 Demo,涵盖手势控制游戏、实时内容审核等全套高帧率实机演示:


Hugging Face Space 演示 怎么用

目前模型权重已经全部上传至 Hugging Face,本地调用非常平滑

只要 Python 环境里装了 transformers>=5.14,几行代码就能跑起来:

pip install "transformers>=5.14" torch torchvision pillow

在 Python 中定义你想问的问题模式(schema),直接调用 system_one 函数:

import torch
from transformers import AutoModel
from transformers.image_utils import load_image

device = "cuda" if torch.cuda.is_available() else "mps" if torch.backends.mps.is_available() else "cpu"
dtype = torch.float32 if device == "cpu" else torch.bfloat16

# 加载 d1-3B 模型
model = AutoModel.from_pretrained(
"LiquidAI/d1-3B",
trust_remote_code=True,
dtype=dtype
).to(device)

# 定义决策问题 schema
questions = {
"refund": {
"type": "noul",
"instructions": "Is the customer asking for a refund?",
},
"team": {
"type": "choice",
"instructions": "Which team should handle this?",
"criteria": {
"billing": "Charges, refunds, invoices",
"technical": "App or site faults",
"fraud": "Suspected unauthorised use",
},
},
"urgency": {
"type": "score",
"instructions": "How urgent is this?",
"criteria": ["Can wait", "Today", "Blocking the customer now"],
},
}

# 单次前向推理
result = model.system_one(
"I was charged twice this month, please refund one of them.",
questions
)

print(result)

不仅支持文本,图像输入也同样简洁,直接传 images=[image] 就能同步完成视觉判定

同时官方宣布首日支持 llama.cpp,对 Apple Silicon、AMD、高通芯片以及支持 NVFP4 量化的 NVIDIA 硬件都做好了全栈适配,想在边缘设备裸跑的同学完全不必担心驱动和框架束缚

商业授权与避坑提醒

这里老章必须特意提醒大家一句:开放权重(Open-weight)不等于无条件免费商用!

翻阅官方仓库的协议条款可以发现,d1 系列使用的是 Liquid AI 自家的 LFM Open License v1.0 协议:

  • 年营收 1000 万美元以下 :无论是个人开发者、科研机构还是中小团队,都可以免费用于商业用途和衍生开发

  • 年营收 1000 万美元及以上 :如果大公司希望把模型直接集成到商业产品中,必须联系官方获取专门的商业许可

所以各位在做技术选型时,既要看到它 8ms 的超高性能红利,也要看清团队目前的合规边界

总结

对于过去必须依赖云端闭源模型、承受几百毫秒延迟和高昂 Token 账单的开发者来说,Liquid AI 这波开放权重来得非常及时

小巧轻量、单次前向、毫秒级响应、零 Token 消耗,直接击中了 Agent 体系中最需要确定性和高并发的核心痛点

虽然 8ms 是基于特定测试环境和 CUDA Graph 编译后的极限成绩,实际复杂业务中可能还会有前处理与排队开销,但比起传统大模型动辄卡顿数秒的表现,已经带来了质的飞跃

想要亲自上手把玩的朋友,可以直接去 Hugging Face 拉取权重开整了

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
日本劫难开始,中方不救,特朗普没有料到,轮到自己被日本人骂

日本劫难开始,中方不救,特朗普没有料到,轮到自己被日本人骂

叮当当科技
2026-10-10 14:34:15
“权贵们的新套路!”北理工裴轶的来时路被扒:和协和4+4竟是一个套路

“权贵们的新套路!”北理工裴轶的来时路被扒:和协和4+4竟是一个套路

妍妍教育日记
2026-10-05 10:10:15
热搜第一,医院门诊告示“豆包诊断患者改问千问”?

热搜第一,医院门诊告示“豆包诊断患者改问千问”?

梅斯医学
2026-10-10 07:53:27
胡塞的末日近了?五路人马围剿胡塞,伊朗为何突然改口?

胡塞的末日近了?五路人马围剿胡塞,伊朗为何突然改口?

井普独白
2026-10-10 12:34:58
两性关系:发现了没,寿命长的男人,大多都有这五个好习惯

两性关系:发现了没,寿命长的男人,大多都有这五个好习惯

荔子言
2026-09-08 14:55:50
成都蓉城输球不冤,但边裁是不是和主队有仇?刚上岗的吗,规则都搞不懂?

成都蓉城输球不冤,但边裁是不是和主队有仇?刚上岗的吗,规则都搞不懂?

我就是一个说球的
2026-10-10 23:28:52
陈幸同为何1-4不敌佐藤瞳,赛后陈幸同毫不客气说出原因并非轻敌

陈幸同为何1-4不敌佐藤瞳,赛后陈幸同毫不客气说出原因并非轻敌

光辉与阴暗
2026-10-11 08:37:01
男子在ICU抢救,母亲不知道取款密码,无法取出儿子存款救命,银行:家属须出具法定监护人身份证明

男子在ICU抢救,母亲不知道取款密码,无法取出儿子存款救命,银行:家属须出具法定监护人身份证明

南方都市报
2026-10-10 20:06:04
10月10日两场重磅发布会!退休人员请注意

10月10日两场重磅发布会!退休人员请注意

叮当当科技
2026-10-10 14:02:52
我已经50岁了,二婚没多久就开始恶心呕吐,去医院一查竟然是怀孕

我已经50岁了,二婚没多久就开始恶心呕吐,去医院一查竟然是怀孕

千秋文化
2026-07-04 19:16:43
二十年花百万养出仇人!虐待、私吞千万遗产?68岁刘佩琦法庭痛哭

二十年花百万养出仇人!虐待、私吞千万遗产?68岁刘佩琦法庭痛哭

棠棣分享
2026-08-12 19:29:19
1978年的哈佛演讲,他骂完苏联骂美国,却精准预言了48年后的我们

1978年的哈佛演讲,他骂完苏联骂美国,却精准预言了48年后的我们

老达子
2026-10-03 06:40:10
人老了,只剩一个人的时候,千万要记住:1、不要再找老伴儿;2、不去养老院;3、不雇保姆,干不动了,就…

人老了,只剩一个人的时候,千万要记住:1、不要再找老伴儿;2、不去养老院;3、不雇保姆,干不动了,就…

犀利强哥
2026-10-09 16:28:16
华为客服回应“华为手机上懂车帝App相关视频无法播放”

华为客服回应“华为手机上懂车帝App相关视频无法播放”

21世纪经济报道
2026-10-09 18:47:46
央视直播11日中国大满贯,周启豪战松岛辉空,王曼昱对佐藤瞳

央视直播11日中国大满贯,周启豪战松岛辉空,王曼昱对佐藤瞳

乒乓球球
2026-10-10 22:01:08
8天卖出70万份的超长蛋挞,打卡热潮褪去,多地门店陆续下架;商家:买过尝过就不会再买了

8天卖出70万份的超长蛋挞,打卡热潮褪去,多地门店陆续下架;商家:买过尝过就不会再买了

扬子晚报
2026-10-10 07:41:18
闺女被同学欺负大半年,我找了班主任好几次都没用,昨天我直接穿着工作制服去了学校,班主任看见我的肩章,吓得腿发软没敢吭声

闺女被同学欺负大半年,我找了班主任好几次都没用,昨天我直接穿着工作制服去了学校,班主任看见我的肩章,吓得腿发软没敢吭声

橙心故事说
2026-10-10 15:15:08
就在刚刚,1-4不敌佐藤瞳!这场失利之后,陈幸同将接连收到4个不利消息

就在刚刚,1-4不敌佐藤瞳!这场失利之后,陈幸同将接连收到4个不利消息

锐评利物浦
2026-10-10 20:37:05
云南玉昆球迷意难平!不止因为1-7上海申花,更多在于以下五点!

云南玉昆球迷意难平!不止因为1-7上海申花,更多在于以下五点!

格斗社
2026-10-10 22:07:58
打赏陪睡案女主播合租室友发声:魏莹每月陪睡一两次,枕头没干过,经常哭到缺氧

打赏陪睡案女主播合租室友发声:魏莹每月陪睡一两次,枕头没干过,经常哭到缺氧

世界圈
2026-08-24 20:54:42
2026-10-11 09:32:49
Ai学习的老章 incentive-icons
Ai学习的老章
Ai学习的老章
3536文章数 11199关注度
往期回顾 全部

科技要闻

上世纪成熟的踏板,为何今天还会断裂?

头条要闻

新人花3小时手搓AI婚纱照 婚礼迎宾照特意保留AI水印

头条要闻

新人花3小时手搓AI婚纱照 婚礼迎宾照特意保留AI水印

体育要闻

十年回首:湖人三榜眼的夏天,与NBA无关

娱乐要闻

宋佳一串三大满贯 争议随之而来

财经要闻

双汇因抗生素超标共被罚1.29亿元

汽车要闻

千匹马力+三把锁/顶配能浮水 银河战舰700限时焕新价16.98万起

态度原创

数码
教育
本地
旅游
艺术

数码要闻

AMD再次上调GDDR6显存供货价格 10月1日起生效

教育要闻

忻州市开展“十·一三”建队节示范性入队仪式

本地新闻

踏访沙县第一村,寻国民小吃本源

旅游要闻

路通景美产业兴 黄河太行入画来

艺术要闻

黄沙万里不见泪|仇英《明妃出塞图》:昭君从来不是悲情美人

无障碍浏览 进入关怀版