网易首页 > 网易号 > 正文 申请入驻

仅14MB的开源小模型Needle 2,冲上了Github趋势榜!

0
分享至

智猩猩AI整理

编辑:金水

全球联网设备里,真正能跑 GPU 或 NPU 的只是少数。真正的大头,是那几十亿台价格在 200 美元以下的手机、树莓派,还有各种微控制器。

可就算是 FunctionGemma 270M、LFM2.5 230M 这种已经算小的模型,在便宜手机上跑起来依然吃力——光是 f16 权重,就得占掉几百 MB。

更尴尬的是,当 Agent 的核心工作只是「把人话翻译成函数调用」时,我们却一直拿几百 MB、几十亿参数的大模型去干「打开客厅灯」这种事。

用云端大模型做解析,等于用大模型的价钱买了一个解析器的活,还顺手把用户对话上传了。

因此,研究人员开源了一个45M参数的端侧工具调用模型Needle 2,适用于手机、可穿戴设备、智能家居系统和机器人等。

整个模型只是 14MB 的二进制文件,在大约 28MB 的 RAM 上就能运行整个会话。

底层基于他们提出的SAN(Simple Attention Network,简单注意力网络)架构;

并配套发了架构论文《A Controlled Study of Attention-Only Transformers》。


在工具名识别(98.3%,公开基准全场第一)和陌生 schema 泛化(域外 28.7%,领先第二名 11.7 个点)上超过了比它大 5–70 倍的小模型;开源后它在 GitHub 上多次冲上Github趋势榜,并积累起约 8.8k star。


但要先把结论说清楚:Needle 2 不是完整 Agent。它不会闲聊,也不做自主规划与多步推理,只承担 Agent 里自然语言到函数调用这一环。

本文想讨论的也不是小模型战胜大模型,而是一个更实际的问题Agent 内部的工作,能不能拆开分给不同大小的模型?


01

它怎么做到这么小

核心思路很简单,先搭一个更省参数的骨架,再让模型从训练开始就活在 2-bit 里,最后用四条硬约束把可预测性锁死。

1. 删掉 FFN,用固定变换换掉最占地方的零件

论文有一组很说明问题的控制实验,在 6M–87M 参数规模下,直接删掉 Transformer 最占参数的前馈层(FFN),loss 差 0.47 nats;但把省下的参数重新分给更多注意力层,差距立刻缩到 0.006 nats。

更有意思的是,纯注意力网络在从上下文找答案上更强,在从权重里回忆知识上更弱,而工具描述本来就在上下文里,短板正好用不到。

那 FFN 被换成了什么?一个固定的 Walsh-Hadamard 变换(正交矩阵,零可学习参数,算得快)。

非线性靠学习到的对角缩放和输入相关的门控补上。世界知识则放进哈希 n-gram 的查表记忆(engram),真正参与矩阵乘的活跃参数只有约 35M。

骨架最终是,27 层、512 宽、GQA、多路残差流,再加上 QK-normalization 让训练稳住。


2. 量化上它生来就是 2-bit

权重、激活、KV cache 全程在量化态下训练,部署的就是训练时的模型,不是近似版。

体积账很直接45M 参数 × 2 bit ≈ 11MB 出头,加上引擎和元数据,整个二进制大约 14MB。

推理时权重永不解压进内存,直接在寄存器里展开做计算;语法匹配还能提前跳过大量非法 token,单个二进制还会自动探测 CPU 选最优内核。

3.让小模型敢上生产的是四条硬约束

语法约束解码(物理上吐不出格式错误的 JSON)、无自由文本兜底(处理不了就返回空调用)、置信度门控(低于阈值就升级大模型)、256-token 滑动窗口把内存钉在约 28MB。

一句话就是用可预测性换掉通用性。它不追求聪明,但绝不给你意外。生产环境里,后者往往更值钱。

02

性能评估

(1)实验配置

官方在五个公开基准上测,用最严的 ordered strict exact match 口径(函数名、顺序、每个参数全对才算成功)。

测量条件也很明确。Needle 2跑的是真正出货的C++引擎和生产配置:CQ2 2-bit量化、工具检索开启、256-token滑动窗口(含窗口驱逐),没有任何放宽。

对比的基线里,LFM2.5和FunctionGemma用发布checkpoint在vLLM上以f16、全上下文运行,Apple FM则用设备端版本。

(2)核心结果

先看最直接的设备动作基准 Mobile Actions(961 行)。

这一项Needle 2 拿63.7% 排第三,略输LFM2.5 的 69.1% 和 FunctionGemma 的 64.0%,但工具名识别 98.3% 是四家唯一破 98 的,非空率 99.4% 也是最高。

也就是说它认工具认得最准,只是整调用对上的没那么多。


真正让 Needle 2 扬眉吐气的是 Seal-Tools 域外。

这里整块工具域被故意排除在训练之外,专门考它没见过的 schema 怎么泛化:

Needle 2 准确率 28.7%,而第二名 LFM2.5 只有 17.0%、FunctionGemma 15.6%,领先 11.7 个点,工具名识别 58.7% 同样第一;

域内(700 行)它也一样领先(32.6% vs 26.9% vs 16.3%)。


在BFCL v4 单轮实验中,Overall 只有 42.6% 排最后,Apple FM 61.7%、LFM2.5 60.8% 都远在前面。

Python simple 它拿 61.2,距离大它 6 倍的 FunctionGemma(62.3)只差 1 分;

真正拉胯的是 Java(29.0)、JavaScript(32.0)和并行多调用(22.5),而这些恰恰是企业 SDK、它训练分布外的场景。


从这三张表得出的结论,它赢在两处(工具名识别第一、陌生 schema 泛化领先 11.7 点),输在两个综合场景(Mobile Actions 第三、BFCL 垫底);

但别忘了,它是 2-bit、256 token 窗口、45M 参数,对手是 f16、全上下文、大它 5–70 倍,把体积和内存放进等式,性价比曲线才是它真正的主张。

03

使用教程

安装很简单,一行命令就行:

pip install cactus-needle

推理引擎会从 Hugging Face 自动下载并缓存一次,之后不用联网。

气隙环境的离线安装方式写在 doc/apis.md 里。

装好后,声明一个工具就能跑通闭环:

# [{'city': 'Lagos', 'temp_c': 27, 'sky': 'clear'}]

机制其实就三件事:签名定参数类型,docstring 就是工具描述,run() 自动完成「选工具 → 执行 → 喂回结果」。

这里有个最重要的提醒,模型完全靠你写的工具描述来做决策,描述写得好不好,直接决定成不成功。

Hacker News 有人实测,只写"calculator"会失败,改成"Use for any arithmetic or math question"才正常。

它还能直接做结构化抽取。把 Pydantic 模型传进去,拿到的是带类型的对象,不用再自己解析字符串:

print(invoice.vendor, invoice.total)  # -> Acme Corp 1200.0

给参数加约束也很直接,这些约束会编进解码语法里:

    return {"sent": amount, "to": to}

最后,可以注入一些「系统事实」来帮模型理解相对表达。注意,这里传的是事实,不是指令:

# 「明天早上七点叫我」就能据此算出绝对时间

从安装到跑通第一个工具调用,基本十分钟内能完成。

04

小模型的另一种活法

Needle 2 五个基准里唯一稳拿第一的,是工具名识别 98.3%。不是巧合,是取舍,把预算全砍在翻译人话这一件事上。

更值得看的不是 14MB,而是它验证的路线,任务足够窄,参数账就能重算。

这背后是 Agent 分工的思路,高频低复杂度的从意图到调用放本地小模型,知识问答和复杂推理交给云端大模型,低置信度再升级。

但边界要划清,置信度门控只管路由,不能代替权限校验、PLC 安全互锁、执行层审计和功能安全。

一个模型自信地输出调用,和这个调用被授权、被安全执行,是两回事。工业若采纳这类架构,安全边界必须建在执行层。

一个模型的价值,不取决于它有多大或多小,而取决于它在系统里承担的角色是否被清晰地定义、诚实地验证。

关注+星标,获取AI前沿进展与开源一线动态

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
俄乌战场捅出大篓子!没打过仗的中国,却亮出了最缺的拦截神器

俄乌战场捅出大篓子!没打过仗的中国,却亮出了最缺的拦截神器

旧史新谭
2026-09-05 23:26:21
中国大师赛决出2冠!混双世界第1为国羽夺首金,安洗莹轰21-6,斩获今年第7冠! 

中国大师赛决出2冠!混双世界第1为国羽夺首金,安洗莹轰21-6,斩获今年第7冠! 

刘姚尧的文字城堡
2026-09-06 15:47:42
明明是“戏混子”被硬捧成实力派,片酬8000万,这5位真被高估了

明明是“戏混子”被硬捧成实力派,片酬8000万,这5位真被高估了

生命之泉的奥秘
2026-09-06 21:44:40
随着阿拉维斯5-2、马拉加0-0,西班牙人1-1,西甲最新积分榜出炉

随着阿拉维斯5-2、马拉加0-0,西班牙人1-1,西甲最新积分榜出炉

侧身凌空斩
2026-09-07 05:11:43
唏嘘!知名童星因病离世,年仅29岁!

唏嘘!知名童星因病离世,年仅29岁!

阿废冷眼观察所
2026-09-06 14:43:13
嚷嚷废掉英语的人,根本不是忧国,只是接受不了普通人有翻身的工具

嚷嚷废掉英语的人,根本不是忧国,只是接受不了普通人有翻身的工具

浪子的烟火人间
2026-09-05 22:52:36
杨紫成90后首位白玉兰影后!《家业》热播曝爸爸暖喊:累了就回家

杨紫成90后首位白玉兰影后!《家业》热播曝爸爸暖喊:累了就回家

达达哥
2026-09-06 19:09:24
赢捷克4分!中国女篮3人高光表现,挽救了球队

赢捷克4分!中国女篮3人高光表现,挽救了球队

体育哲人
2026-09-06 22:51:21
扎哈罗娃犀利回应高市早苗:“无异于要求太阳停止照耀”

扎哈罗娃犀利回应高市早苗:“无异于要求太阳停止照耀”

扬子晚报
2026-09-06 22:37:59
妻子和19岁女儿在家,被同一男人骗了财和色,丈夫后悔外出打工

妻子和19岁女儿在家,被同一男人骗了财和色,丈夫后悔外出打工

情感艺术家
2026-09-06 06:12:16
中国女篮74 70!杨舒予扳平 加时取胜!韩旭22+14,张子宇状态不佳3+6

中国女篮74 70!杨舒予扳平 加时取胜!韩旭22+14,张子宇状态不佳3+6

有态度网友19GlcR
2026-09-07 02:52:55
生育大局已定!2026新生儿预估出炉,低生育率根本不是年轻人懒生

生育大局已定!2026新生儿预估出炉,低生育率根本不是年轻人懒生

铭记历史呀
2026-09-07 01:04:11
2026年度大瓜,被扒出来的细节越来越多

2026年度大瓜,被扒出来的细节越来越多

三个妈妈六个娃
2026-09-05 21:07:22
阿里P8:人一旦失业,就会“扣扣搜搜”。家庭收入从去年140万降到今年50多万

阿里P8:人一旦失业,就会“扣扣搜搜”。家庭收入从去年140万降到今年50多万

蚂蚁大喇叭
2026-09-06 17:09:52
中方发布了撤侨通告,各种迹象表明,台当局最后的据点或许要塌?

中方发布了撤侨通告,各种迹象表明,台当局最后的据点或许要塌?

究竟谁主沉浮
2026-09-06 00:36:47
眼看“无力回天”,郑丽文主动交权离任?她的回应让大陆松了口气

眼看“无力回天”,郑丽文主动交权离任?她的回应让大陆松了口气

黑翼天使
2026-09-06 20:40:27
女团爱豆红毯裙太紧勒出尴尬线,全程捂肚不敢动,网友吵翻了

女团爱豆红毯裙太紧勒出尴尬线,全程捂肚不敢动,网友吵翻了

时光慢旅人
2026-09-05 17:14:21
1876 年左宗棠吃老农一块饼,走七步便下杀令,实则保全众人性命

1876 年左宗棠吃老农一块饼,走七步便下杀令,实则保全众人性命

唠叨说历史
2026-06-12 11:35:58
片方选择放弃,沈腾《欢迎来龙餐馆》输了

片方选择放弃,沈腾《欢迎来龙餐馆》输了

小椰的奶奶
2026-09-07 00:27:48
中国车市正在换轨!插混时代结束,HEv或将成为下一个爆款

中国车市正在换轨!插混时代结束,HEv或将成为下一个爆款

小怪吃美食
2026-09-07 00:19:36
2026-09-07 06:00:49
智猩猩
智猩猩
AI 技术内容与服务平台
69文章数 3关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

中尼两国遇难失联人数为何相差如此大 专家解读

头条要闻

中尼两国遇难失联人数为何相差如此大 专家解读

体育要闻

3.9秒绝平!杨舒予18+5成女篮救世主

娱乐要闻

杨紫获白玉兰影后!爸爸:累了就回家

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

亲子
本地
手机
家居
公开课

亲子要闻

冲上热搜!这种鞋子不要给孩子天天穿

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

手机要闻

华为最贵手机发布前瞻:三折叠防窥屏+阔屏游戏神器,钱包又要扛不住了

家居要闻

2026建博会(广州) 公装联探展交流活动

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版