网易首页 > 网易号 > 正文 申请入驻

11个梅西赢不了球:一个4B小模型,讲清了AI Agent的3个方向

0
分享至

AI大模型 · 深度观察


11个梅西赢不了球:一个4B小模型,讲清了AI Agent的3个方向

一个 4B 模型,论文日榜第一。

各位刀友好,我是刀哥!先说个丢人的事。

9 月 10 日凌晨,AK(@_akhaliq,52万粉丝,Hugging Face 的机器学习增长负责人)发了条推文,三行字:NeoHorse-1,Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness。配图是论文页,标着" Paper of the day",17.9K 浏览。


一个 4B 模型,论文日榜第一。我很好奇,但结果丢人了。我盯着 Routing Harness 研究了一晚上,一直以为这模型自己会路由,就是能自己判断简单活自己干,硬骨头丢给其他大模型。

翻完论文才发现,全搞反了。

NeoHorse根本不负责路由。真正的路由器是基元律动此前开源的 Routing Harness——OpenSquilla,它架在模型池前面,每轮对话先估算"这个任务需要多强的能力"。

从 C0(边界清晰的低风险请求)到 C3(最高能力档)分四级,再决定派给谁。Claude Code 那种在 opus、sonnet、haiku 之间切换的做法,则是把路由写在了 Agent 自己的提示词里。

NeoHorse 是模型池里接单的那个。它只是干了一件没人干过的事:把路由器的派单记录,当成了自己的教材。

这个误会值多少钱?很可能决定一个 AI Agent 创业公司的生死。因为搞反这个关系的人,大概率也搞反了接下来 AI 竞争的焦点。


一、三条正在发生的行业共识

基元律动创始人王云鹤(前华为诺亚方舟实验室主任、盘古大模型负责人)在一篇博客里把这件事说得很直白:

Agent = Models + Harness,模型数量会持续增加、专业化程度加深、成本持续下降,模型之间不会归一,而是需要被组织。

所谓"七国八制",各家的长板各不相同,价格也不一样,真正的问题不是谁最强,而是怎么把这一堆模型组织起来解决一个任务

道理好理解,现实是不是这样,我们用数据说话。

  • 1单价在降,账单在涨。

    Agent 任务不是一问一答,是"搜索→规划→工具调用→代码→复核→修复"的循环,一个任务平均调用三个以上模型。根据基元律动公开的账单数据:最贵的模型只承担约10%的核心推理,却拿走约75%的 token 开销。

  • 2模型不会归一。

    还在等"一个最强模型终结比赛"的人,可以看看皇马银河战舰——齐达内、罗纳尔多、贝克汉姆、菲戈堆进同一支球队,纸面实力历史级,结果颗粒无收。

  • 模型圈现在一模一样:Kimi K3 把开源参数推到 2.8 万亿,Fable 5.1 和 GPT-6 Astra 把上下文卷到百万 token 级,每家都有长板,排名月月洗牌。这个格局不会收敛。

  • 3训练任务本身在升级。

    chat 是一问一答,reasoning 加思维链,coding 要求可验证执行,agent 是多步骤、多工具、多模型、带环境反馈。下一级台阶已经露出来:持续学习。竞争焦点正从"模型能力"转向"模型进化能力"。

三条合在一起,结论就浮出来了:模型不归一,所以 Agent 需要组织模型;而组织模型的那一层,每天看着所有任务的来龙去脉——谁擅长什么、在哪里翻车、翻车之后怎么爬起来。改进模型的方式,就握在这一层手里。

二、NeoHorse 具体做了什么

普通模型的训练语料是"题目+答案",NeoHorse 的语料是 Harness 里的真实执行轨迹:任务请求、能力需求评估、路由选择、工具调用、环境反馈、错误与恢复路径。

被中途替换的失败轨迹也留着,正确答案只说明怎么做对,翻车现场才说明哪里容易出错、出错后怎么恢复

这些轨迹不是拿来就训。先过结构校验,确认请求、回复、工具调用和环境结果一一对应;再过六维语义评估,其中一条是"有没有在正确的时机停下来"。

还有个很专业的细节:"完成"和"达标"分开记录,训练集和评测集严格隔离,不让模型提前见过考题。

训练方法上,路由器的 C0–C3 能力分档本来是线上派单用的,NeoHorse 把它离线复用成了课程表:由易到难排成三阶段,再做路由引导的在策略蒸馏。

模型

基模

NeoHorse

提升

4B

9B

结果:10 项评测平均分,4B 从基模的 58.94 提到 64.87(+5.93),9B 从基模的 65.60 提到 69.04(+3.44),4B 全部高于 Qwen3.5-4B 底座,已经接近 9B 底座水平(官方内部自测)。

最能说明问题的是这组对照:同一套课程配置下,Harness 真实轨迹比公开合成工具数据 Toucan 在五项可比测试上平均高 6.26 分。起作用的不是数据多,是数据从真实执行里获取的,数据质量高。

9 月 8 日 NeoHorse-1 开源,Apache 2.0,原生 262K 上下文,Hugging Face、ModelScope、GGUF 同步上线,首日下载 3,000+。


三、两层意义:飞轮补齐一环,RSI 跑通第一圈

商业上,基元律动采取的闭环是:开源 Harness 建生态(已验证)→ TokenRhythm API 商业化(进行中)→ 任务执行沉淀反馈(已就绪)→ 反馈训练 Agent-Native 模型 → 模型回到 API 降本提效。

五环里,"模型"此前一直靠外部供给,飞轮最关键的一环握在别人手里,轮子就转不起来。NeoHorse-1 补上它的方式,是验证了这件事:Harness 执行反馈,确实能训练出更好的模型。

把基元律动想象成一家足球俱乐部。开源 Harness 是对外开放的训练基地和青训方法论,全世界的球员和教练都可以来看、来用,这是生态。TokenRhythm API 是比赛日卖门票。

每场比赛的跑动热图、传球成功率、失误集锦,全部自动归档——这是任务执行沉淀的反馈。青训教练拿着这些录像和数据训练梯队小将——这是反馈训练模型。小将踢出来了升上一队,工资比外购球星便宜,配合还更默契——这是模型回到 API 降本提效。

之前的问题在于:一队主力全靠租借别家球星。租来的梅西再强,合同在别人手里,说收回就收回,而且他也不会按你的战术长球。NeoHorse-1 证明的是:自家青训营,真的能用自己的比赛数据,培养出踢得上主力的球员。

技术上,递归自我改进(RSI)被拆成两个环:Data-RSI——Agent 干活时,每次路由、工具调用、失败恢复都变成结构化记录,筛完进数据池,随系统运行自然增长;

Model-RSI——评测定位短板,调整下一轮数据分布,更新模型,放回模型池继续干。一个攒经验,一个改教案。NeoHorse-1 是两个环第一次在同一框架里闭环。

技术上的两个环,放进青训营打比方就是:Data-RSI 是每场比赛后自动归档的技术统计,谁跑位失误、哪次配合打成了,录像越攒越多,不用人催,赛季越长家底越厚。

Model-RSI 是教练组的赛季复盘,发现左路防守是短板,下赛季训练计划就加重左路比重,练完再拉上场检验。一个管攒录像,一个管改训练大纲。NeoHorse-1 是第一次,录像分析室和教练办公室在同一家俱乐部里转了起来。

基元律动公开数据

OpenSquilla 开源至今:7,000+ stars、17 万+ clone、1 万+ 装机

TokenRhythm API:单日 token 调用 500B+、54,000+ 用户


四、我的看法:它的位置在入口

NeoHorse 这条 4B/9B 产品线,不是去跟 Kimi K3、Fable、Astra 抢主战场的。它的位置在入口:简单任务 4B/9B 就地解决,复杂任务整理好现场再交给怪兽。

我一直认为大模型会不断吃掉外围 Agent 能力,GPT-6 Astra 这种把编程、研究、计算机操作全部内化的旗舰就是证据。

所以小模型的出路不是变得更全能,而是把入口那一段做到完美漂亮——听懂要什么、判断有多难、调工具、出错退回来。

质疑也摆在这:一轮验证够不够?(Harness 成果只有 NeoHorse-1,多代成才才叫体系,一批天才只能叫撞大运。)4B 能不能代表方向?都有道理。

我建议盯三个数字:模型进入 API 后的成本、成功率、毛利。飞轮是真的,这三个数会一圈比一圈好看;是假的,第二波数据就会露馅。

五、那它到底能干什么?五个能直接抄的用法

光讲道理没用,说点能上手摸的。它最适合的是高频、流程清晰、结果可验证的活,官方评测也证实了这点:

tau²-Bench(多轮人机工具交互)90.82,PinchBench(标准化工作流)82.25,WorkBuddy(职场多步骤任务)相比底座提升近 10 分(均为官方内部评测)。

现在可以参与 NeoHorse 的免费内测,也可以到魔搭上,根据自己的电脑配置,安装模型。把 4B 的 GGUF 装进了自己电脑,只需要三步:

pip install modelscope

modelscope download --model TokenRhythm/NeoHorse-1-4B-GGUF --local_dir ./NeoHorse-1-4B-GGUF

# Modelfile 就这几行,FROM 指向下载目录里那个 .gguf 文件

FROM ./NeoHorse-1-4B-GGUF/NeoHorse-1-4B-BF16.gguf

PARAMETER num_ctx 32768

PARAMETER temperature 1.0

ollama create neohorse-1-4b -f ./Modelfile

ollama run neohorse-1-4b

打开 ollama 也能选中 neohorse-1-4b 模型,开始对话。


做一个相对复杂,带工具调用的测试:确认今天北京日期,然后帮我看下厦门明天的天气,如果下雨就提醒我带伞。


成功了!

用法一:信息抽取,格式强迫症的福音

"把这段会议纪要整理成 JSON,字段固定为 owner、task、deadline,原文没提到的填 null,不要推测。"

后面粘上任意会议纪要。这类"抽字段"的活是每个自动化流程的第一步,量大、单价低,但格式又不能出错,让 4B 干这个,边际成本约等于零。

用法二:联网调研,逼它给证据

"NeoHorse-1 是什么时候开源的、用的什么协议?告诉我这两个信息你分别从哪里查到的。"

打开客户端的联网搜索后问。它的训练里专门有"结论要有证据支撑"这一项,所以更可能标注来源,而不是凭印象给个日期。

用法三:日志筛错,只许看不许编

"下面是一段服务日志。只依据日志内容输出 JSON:error_count、first_error_time、root_cause、evidence_lines。日志里没有的填 null。"

"没有的填 null"是关键,它在测模型会不会为了把答案填满而脑补。

用法四:多步计算,看中间结果丢不丢

"三笔订单:A 是 1288 元打 85 折,B 是 960 元打 9 折,C 是 1500 元减 260。先输出计划,再分别算实付,按从高到低排序,最后给总额。"

小模型最常见的塌方点就是算到第三步忘了第一步的数,但是NeoHorse没有。


用法五:写能跑的脚本

"写一个 Python 脚本:遍历当前目录下所有 .log 文件,统计每个文件里 ERROR 开头的行数,输出成 CSV。"

代码是"可验证执行"的任务,能不能跑、跑完对不对,一眼见分晓,正好是它后训练增益最集中的地方之一(HumanEval 4B 从 87.20 提到 96.95)。

使用路径主要是三条,按需选:

用法

怎么做

适合谁

本地聊天+联网

ollama 跑起来,客户端打开 Web Search

纯尝鲜,零成本

自动化流水线

Cherry Studio / Open WebUI 里注册工具

想把重复劳动交出去的人

嵌入自己的产品

SGLang/vLLM 起服务,OpenAI 兼容接口

在做 Agent 产品的团队

也说说它不适合什么:需要长程调试、复杂状态维护的重活,目前还是大模型的优势区;闲聊和创意写作也别找它,增益不在那儿;它是纯文本模型,没有视觉能力。另外,4B 处理高频轻量任务,9B 接多步执行,真遇到硬骨头,让路由把它送去该去的地方,这才是这套体系的正确打开方式。


公司里每周写周报写项目复盘。说实话大多数时候是应付,但偶尔认真回看一次"这事当时怎么搞砸的",下次就真能绕开那个坑。

NeoHorse 干的就是这件事,只不过它没有情绪、不会偷懒、每次翻车都被完整记录。白天在 Harness 里接单干活,晚上路由器翻它的执行记录,找出它在哪类任务上反复摔跤,下周的训练就多安排这类题。

十一个梅西赢不了球。但一个知道自己该干嘛、每场比赛都复盘的球队,加上一套会看录像的体系,能赢。这事在足球里成立过,现在有人在 AI 里又试了一次。我觉得,这事儿靠谱。

刀哥问一嘴

你用小模型做过什么?评论区聊聊。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
边立明任广州市副市长

边立明任广州市副市长

新快报新闻
2026-09-23 12:45:03
没有任何退路可言!中国国防部向世界警告:解放军已做好全部准备

没有任何退路可言!中国国防部向世界警告:解放军已做好全部准备

阿芒娱乐说
2026-09-23 15:11:19
突发!陈冠希的新瓜,有点料!

突发!陈冠希的新瓜,有点料!

财经要参
2026-09-23 07:56:49
西贝餐厅风波再升级!官媒下场锐评,字字严厉,戳进罗永浩心窝

西贝餐厅风波再升级!官媒下场锐评,字字严厉,戳进罗永浩心窝

知法而形
2026-09-23 11:54:37
国台办:坚决反对建交国同中国台湾地区开展任何形式的官方往来

国台办:坚决反对建交国同中国台湾地区开展任何形式的官方往来

环球网资讯
2026-09-23 10:58:40
张宇祥当选上海嘉定区区长

张宇祥当选上海嘉定区区长

澎湃新闻
2026-09-23 16:34:28
陈皮加一物,化掉一身痰和湿,痰湿没了,湿气少了,肺气足了

陈皮加一物,化掉一身痰和湿,痰湿没了,湿气少了,肺气足了

白米饭怎么吃
2026-07-01 10:42:55
亚运奖牌榜:中国单日狂揽16金碾压日韩 累计48金20银10铜领跑

亚运奖牌榜:中国单日狂揽16金碾压日韩 累计48金20银10铜领跑

醉卧浮生
2026-09-23 20:33:26
亚运会乒乓球:张本智和收获奖牌!3:0大获全胜,松岛辉空3:2险胜

亚运会乒乓球:张本智和收获奖牌!3:0大获全胜,松岛辉空3:2险胜

国乒二三事
2026-09-23 06:51:57
已击毙!伊朗军方宣布重大战果。

已击毙!伊朗军方宣布重大战果。

回京历史梦
2026-09-23 09:21:02
33岁女演员确诊癌症,已失去生活自理能力,家人苦撑2年公开求助:她想活下去,还想回去唱戏

33岁女演员确诊癌症,已失去生活自理能力,家人苦撑2年公开求助:她想活下去,还想回去唱戏

扬子晚报
2026-09-23 15:56:49
北理工女老师开“女权课”冲上热搜:公开叫嚣让男性低人一等,特殊性选修课,扬言修学分自觉退出

北理工女老师开“女权课”冲上热搜:公开叫嚣让男性低人一等,特殊性选修课,扬言修学分自觉退出

李晚书
2026-09-23 14:33:49
沙特的救兵来了,比土耳其还猛,中方已仁至义尽,红海浑水不能蹚

沙特的救兵来了,比土耳其还猛,中方已仁至义尽,红海浑水不能蹚

墨兰史书
2026-09-23 19:50:04
杨幂在米兰成“洋幂”了?还自曝是一时兴起的DIY

杨幂在米兰成“洋幂”了?还自曝是一时兴起的DIY

木子爱娱乐大号
2026-09-23 15:30:25
杭州商K全关,全链条溯源倒查

杭州商K全关,全链条溯源倒查

老凤说财经
2026-09-23 16:33:19
北约秘书长吕特抛出惊人预判,他警示外界,一旦中国采取行动收复台湾,俄罗斯有可能随之在欧洲发起行动,北约要提前做好....

北约秘书长吕特抛出惊人预判,他警示外界,一旦中国采取行动收复台湾,俄罗斯有可能随之在欧洲发起行动,北约要提前做好....

回京历史梦
2026-09-23 09:20:36
遭张展硕逆转!韩国名将无缘卫冕后破防:很生气,最后50米我垮了

遭张展硕逆转!韩国名将无缘卫冕后破防:很生气,最后50米我垮了

我爱英超
2026-09-23 19:33:01
惨遭20分大逆转!中国男篮再遭打击:CBA总冠军被非洲球队打崩溃了?

惨遭20分大逆转!中国男篮再遭打击:CBA总冠军被非洲球队打崩溃了?

篮球快餐车
2026-09-23 17:59:53
全国中小学将推行每周至少半天校外实践教学

全国中小学将推行每周至少半天校外实践教学

中国青年报
2026-09-23 14:28:23
王慧文发文声援西贝:想组局买下来!评论区立马有人给老王出主意

王慧文发文声援西贝:想组局买下来!评论区立马有人给老王出主意

大厂青年
2026-09-23 17:07:42
2026-09-23 21:27:00
刀哥聊AI
刀哥聊AI
深度评测AI工具、AI大模型,资深大厂架构师,出海智能硬件创业者
107文章数 13关注度
往期回顾 全部

科技要闻

一夜三款新模型,AI价格战再升级

头条要闻

网友发帖称上海一家餐厅点9瓶矿泉水收621元 店员回应

头条要闻

网友发帖称上海一家餐厅点9瓶矿泉水收621元 店员回应

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

性能与实用兼得 全新奥迪S5 Avant上市 57.18万元

态度原创

艺术
家居
手机
房产
军事航空

艺术要闻

深圳4座新全球总部:大疆尖塔、京东画境、OPPO曲面、科达利窗口

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

小米18 Pro Max手机发布:首发第六代骁龙8超级至尊版,6999元起

房产要闻

楼市变天!三亚第一个"接住"新政的楼盘出现了

军事要闻

韩国最新型潜艇首次披露

无障碍浏览 进入关怀版