网易首页 > 网易号 > 正文 申请入驻

11个梅西赢不了球:一个4B小模型,讲清了AI Agent的3个方向

0
分享至

AI大模型 · 深度观察


11个梅西赢不了球:一个4B小模型,讲清了AI Agent的3个方向

一个 4B 模型,论文日榜第一。

各位刀友好,我是刀哥!先说个丢人的事。

9 月 10 日凌晨,AK(@_akhaliq,52万粉丝,Hugging Face 的机器学习增长负责人)发了条推文,三行字:NeoHorse-1,Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness。配图是论文页,标着" Paper of the day",17.9K 浏览。


一个 4B 模型,论文日榜第一。我很好奇,但结果丢人了。我盯着 Routing Harness 研究了一晚上,一直以为这模型自己会路由,就是能自己判断简单活自己干,硬骨头丢给其他大模型。

翻完论文才发现,全搞反了。

NeoHorse根本不负责路由。真正的路由器是基元律动此前开源的 Routing Harness——OpenSquilla,它架在模型池前面,每轮对话先估算"这个任务需要多强的能力"。

从 C0(边界清晰的低风险请求)到 C3(最高能力档)分四级,再决定派给谁。Claude Code 那种在 opus、sonnet、haiku 之间切换的做法,则是把路由写在了 Agent 自己的提示词里。

NeoHorse 是模型池里接单的那个。它只是干了一件没人干过的事:把路由器的派单记录,当成了自己的教材。

这个误会值多少钱?很可能决定一个 AI Agent 创业公司的生死。因为搞反这个关系的人,大概率也搞反了接下来 AI 竞争的焦点。


一、三条正在发生的行业共识

基元律动创始人王云鹤(前华为诺亚方舟实验室主任、盘古大模型负责人)在一篇博客里把这件事说得很直白:

Agent = Models + Harness,模型数量会持续增加、专业化程度加深、成本持续下降,模型之间不会归一,而是需要被组织。

所谓"七国八制",各家的长板各不相同,价格也不一样,真正的问题不是谁最强,而是怎么把这一堆模型组织起来解决一个任务

道理好理解,现实是不是这样,我们用数据说话。

  • 1单价在降,账单在涨。

    Agent 任务不是一问一答,是"搜索→规划→工具调用→代码→复核→修复"的循环,一个任务平均调用三个以上模型。根据基元律动公开的账单数据:最贵的模型只承担约10%的核心推理,却拿走约75%的 token 开销。

  • 2模型不会归一。

    还在等"一个最强模型终结比赛"的人,可以看看皇马银河战舰——齐达内、罗纳尔多、贝克汉姆、菲戈堆进同一支球队,纸面实力历史级,结果颗粒无收。

  • 模型圈现在一模一样:Kimi K3 把开源参数推到 2.8 万亿,Fable 5.1 和 GPT-6 Astra 把上下文卷到百万 token 级,每家都有长板,排名月月洗牌。这个格局不会收敛。

  • 3训练任务本身在升级。

    chat 是一问一答,reasoning 加思维链,coding 要求可验证执行,agent 是多步骤、多工具、多模型、带环境反馈。下一级台阶已经露出来:持续学习。竞争焦点正从"模型能力"转向"模型进化能力"。

三条合在一起,结论就浮出来了:模型不归一,所以 Agent 需要组织模型;而组织模型的那一层,每天看着所有任务的来龙去脉——谁擅长什么、在哪里翻车、翻车之后怎么爬起来。改进模型的方式,就握在这一层手里。

二、NeoHorse 具体做了什么

普通模型的训练语料是"题目+答案",NeoHorse 的语料是 Harness 里的真实执行轨迹:任务请求、能力需求评估、路由选择、工具调用、环境反馈、错误与恢复路径。

被中途替换的失败轨迹也留着,正确答案只说明怎么做对,翻车现场才说明哪里容易出错、出错后怎么恢复

这些轨迹不是拿来就训。先过结构校验,确认请求、回复、工具调用和环境结果一一对应;再过六维语义评估,其中一条是"有没有在正确的时机停下来"。

还有个很专业的细节:"完成"和"达标"分开记录,训练集和评测集严格隔离,不让模型提前见过考题。

训练方法上,路由器的 C0–C3 能力分档本来是线上派单用的,NeoHorse 把它离线复用成了课程表:由易到难排成三阶段,再做路由引导的在策略蒸馏。

模型

基模

NeoHorse

提升

4B

9B

结果:10 项评测平均分,4B 从基模的 58.94 提到 64.87(+5.93),9B 从基模的 65.60 提到 69.04(+3.44),4B 全部高于 Qwen3.5-4B 底座,已经接近 9B 底座水平(官方内部自测)。

最能说明问题的是这组对照:同一套课程配置下,Harness 真实轨迹比公开合成工具数据 Toucan 在五项可比测试上平均高 6.26 分。起作用的不是数据多,是数据从真实执行里获取的,数据质量高。

9 月 8 日 NeoHorse-1 开源,Apache 2.0,原生 262K 上下文,Hugging Face、ModelScope、GGUF 同步上线,首日下载 3,000+。


三、两层意义:飞轮补齐一环,RSI 跑通第一圈

商业上,基元律动采取的闭环是:开源 Harness 建生态(已验证)→ TokenRhythm API 商业化(进行中)→ 任务执行沉淀反馈(已就绪)→ 反馈训练 Agent-Native 模型 → 模型回到 API 降本提效。

五环里,"模型"此前一直靠外部供给,飞轮最关键的一环握在别人手里,轮子就转不起来。NeoHorse-1 补上它的方式,是验证了这件事:Harness 执行反馈,确实能训练出更好的模型。

把基元律动想象成一家足球俱乐部。开源 Harness 是对外开放的训练基地和青训方法论,全世界的球员和教练都可以来看、来用,这是生态。TokenRhythm API 是比赛日卖门票。

每场比赛的跑动热图、传球成功率、失误集锦,全部自动归档——这是任务执行沉淀的反馈。青训教练拿着这些录像和数据训练梯队小将——这是反馈训练模型。小将踢出来了升上一队,工资比外购球星便宜,配合还更默契——这是模型回到 API 降本提效。

之前的问题在于:一队主力全靠租借别家球星。租来的梅西再强,合同在别人手里,说收回就收回,而且他也不会按你的战术长球。NeoHorse-1 证明的是:自家青训营,真的能用自己的比赛数据,培养出踢得上主力的球员。

技术上,递归自我改进(RSI)被拆成两个环:Data-RSI——Agent 干活时,每次路由、工具调用、失败恢复都变成结构化记录,筛完进数据池,随系统运行自然增长;

Model-RSI——评测定位短板,调整下一轮数据分布,更新模型,放回模型池继续干。一个攒经验,一个改教案。NeoHorse-1 是两个环第一次在同一框架里闭环。

技术上的两个环,放进青训营打比方就是:Data-RSI 是每场比赛后自动归档的技术统计,谁跑位失误、哪次配合打成了,录像越攒越多,不用人催,赛季越长家底越厚。

Model-RSI 是教练组的赛季复盘,发现左路防守是短板,下赛季训练计划就加重左路比重,练完再拉上场检验。一个管攒录像,一个管改训练大纲。NeoHorse-1 是第一次,录像分析室和教练办公室在同一家俱乐部里转了起来。

基元律动公开数据

OpenSquilla 开源至今:7,000+ stars、17 万+ clone、1 万+ 装机

TokenRhythm API:单日 token 调用 500B+、54,000+ 用户


四、我的看法:它的位置在入口

NeoHorse 这条 4B/9B 产品线,不是去跟 Kimi K3、Fable、Astra 抢主战场的。它的位置在入口:简单任务 4B/9B 就地解决,复杂任务整理好现场再交给怪兽。

我一直认为大模型会不断吃掉外围 Agent 能力,GPT-6 Astra 这种把编程、研究、计算机操作全部内化的旗舰就是证据。

所以小模型的出路不是变得更全能,而是把入口那一段做到完美漂亮——听懂要什么、判断有多难、调工具、出错退回来。

质疑也摆在这:一轮验证够不够?(Harness 成果只有 NeoHorse-1,多代成才才叫体系,一批天才只能叫撞大运。)4B 能不能代表方向?都有道理。

我建议盯三个数字:模型进入 API 后的成本、成功率、毛利。飞轮是真的,这三个数会一圈比一圈好看;是假的,第二波数据就会露馅。

五、那它到底能干什么?五个能直接抄的用法

光讲道理没用,说点能上手摸的。它最适合的是高频、流程清晰、结果可验证的活,官方评测也证实了这点:

tau²-Bench(多轮人机工具交互)90.82,PinchBench(标准化工作流)82.25,WorkBuddy(职场多步骤任务)相比底座提升近 10 分(均为官方内部评测)。

现在可以参与 NeoHorse 的免费内测,也可以到魔搭上,根据自己的电脑配置,安装模型。把 4B 的 GGUF 装进了自己电脑,只需要三步:

pip install modelscope

modelscope download --model TokenRhythm/NeoHorse-1-4B-GGUF --local_dir ./NeoHorse-1-4B-GGUF

# Modelfile 就这几行,FROM 指向下载目录里那个 .gguf 文件

FROM ./NeoHorse-1-4B-GGUF/NeoHorse-1-4B-BF16.gguf

PARAMETER num_ctx 32768

PARAMETER temperature 1.0

ollama create neohorse-1-4b -f ./Modelfile

ollama run neohorse-1-4b

打开 ollama 也能选中 neohorse-1-4b 模型,开始对话。


做一个相对复杂,带工具调用的测试:确认今天北京日期,然后帮我看下厦门明天的天气,如果下雨就提醒我带伞。


成功了!

用法一:信息抽取,格式强迫症的福音

"把这段会议纪要整理成 JSON,字段固定为 owner、task、deadline,原文没提到的填 null,不要推测。"

后面粘上任意会议纪要。这类"抽字段"的活是每个自动化流程的第一步,量大、单价低,但格式又不能出错,让 4B 干这个,边际成本约等于零。

用法二:联网调研,逼它给证据

"NeoHorse-1 是什么时候开源的、用的什么协议?告诉我这两个信息你分别从哪里查到的。"

打开客户端的联网搜索后问。它的训练里专门有"结论要有证据支撑"这一项,所以更可能标注来源,而不是凭印象给个日期。

用法三:日志筛错,只许看不许编

"下面是一段服务日志。只依据日志内容输出 JSON:error_count、first_error_time、root_cause、evidence_lines。日志里没有的填 null。"

"没有的填 null"是关键,它在测模型会不会为了把答案填满而脑补。

用法四:多步计算,看中间结果丢不丢

"三笔订单:A 是 1288 元打 85 折,B 是 960 元打 9 折,C 是 1500 元减 260。先输出计划,再分别算实付,按从高到低排序,最后给总额。"

小模型最常见的塌方点就是算到第三步忘了第一步的数,但是NeoHorse没有。


用法五:写能跑的脚本

"写一个 Python 脚本:遍历当前目录下所有 .log 文件,统计每个文件里 ERROR 开头的行数,输出成 CSV。"

代码是"可验证执行"的任务,能不能跑、跑完对不对,一眼见分晓,正好是它后训练增益最集中的地方之一(HumanEval 4B 从 87.20 提到 96.95)。

使用路径主要是三条,按需选:

用法

怎么做

适合谁

本地聊天+联网

ollama 跑起来,客户端打开 Web Search

纯尝鲜,零成本

自动化流水线

Cherry Studio / Open WebUI 里注册工具

想把重复劳动交出去的人

嵌入自己的产品

SGLang/vLLM 起服务,OpenAI 兼容接口

在做 Agent 产品的团队

也说说它不适合什么:需要长程调试、复杂状态维护的重活,目前还是大模型的优势区;闲聊和创意写作也别找它,增益不在那儿;它是纯文本模型,没有视觉能力。另外,4B 处理高频轻量任务,9B 接多步执行,真遇到硬骨头,让路由把它送去该去的地方,这才是这套体系的正确打开方式。


公司里每周写周报写项目复盘。说实话大多数时候是应付,但偶尔认真回看一次"这事当时怎么搞砸的",下次就真能绕开那个坑。

NeoHorse 干的就是这件事,只不过它没有情绪、不会偷懒、每次翻车都被完整记录。白天在 Harness 里接单干活,晚上路由器翻它的执行记录,找出它在哪类任务上反复摔跤,下周的训练就多安排这类题。

十一个梅西赢不了球。但一个知道自己该干嘛、每场比赛都复盘的球队,加上一套会看录像的体系,能赢。这事在足球里成立过,现在有人在 AI 里又试了一次。我觉得,这事儿靠谱。

刀哥问一嘴

你用小模型做过什么?评论区聊聊。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
都是肤白貌美!数十位美女齐聚惠州网红直播,引发争议不断,网友:不偷不抢不躺平,已经很好了

都是肤白貌美!数十位美女齐聚惠州网红直播,引发争议不断,网友:不偷不抢不躺平,已经很好了

火山詩话
2026-09-23 09:51:52
父女在商场遭人堵截辱骂,4岁女儿被吓哭躲到桌子底下“我让爸爸给你道歉,你放过我们好吗”,外卖小哥热心解围,男子:愿拿1000元感谢

父女在商场遭人堵截辱骂,4岁女儿被吓哭躲到桌子底下“我让爸爸给你道歉,你放过我们好吗”,外卖小哥热心解围,男子:愿拿1000元感谢

背包旅行
2026-09-23 14:42:17
表姑向我借了85000元,17年没还,我去银行注销旧卡时,柜员看了眼卡说:女士,最后一笔转账留言您要看吗?

表姑向我借了85000元,17年没还,我去银行注销旧卡时,柜员看了眼卡说:女士,最后一笔转账留言您要看吗?

品读时刻
2026-09-22 09:04:55
刘銮雄半山豪宅被蓄意曝光!游泳女教练不讲武德,以后难进富豪圈

刘銮雄半山豪宅被蓄意曝光!游泳女教练不讲武德,以后难进富豪圈

揽星河的笔记
2026-09-21 13:05:12
林诗栋混双3-0淘汰奥运亚军!王皓灵魂拷问生效 王楚钦为石头辩护超暖

林诗栋混双3-0淘汰奥运亚军!王皓灵魂拷问生效 王楚钦为石头辩护超暖

颜小白的篮球梦
2026-09-23 09:36:02
十月中旬开始,压力慢慢消散,好日子正在靠近的三大生肖

十月中旬开始,压力慢慢消散,好日子正在靠近的三大生肖

情感事聊
2026-09-23 15:43:03
10.99万!日产新车正式上市

10.99万!日产新车正式上市

科技堡垒
2026-09-23 11:49:21
我有个朋友专门去打麻将勾引女人,盯上哪个了 基本上是无往不利…

我有个朋友专门去打麻将勾引女人,盯上哪个了 基本上是无往不利…

糖逗在娱乐
2026-09-22 13:50:59
川男泰国遭绑架卖进缅甸电诈园区79天!会中医少挨许多打。亲姐赴泰30多万救回

川男泰国遭绑架卖进缅甸电诈园区79天!会中医少挨许多打。亲姐赴泰30多万救回

听心堂
2026-09-23 16:06:44
收拾好行李准备撤,基辅官员连夜逃走,乌克兰公民却被挡在门外

收拾好行李准备撤,基辅官员连夜逃走,乌克兰公民却被挡在门外

风信子的花
2026-09-23 11:18:04
泽连斯基“抽搐”传闻的48小时,谁在受益?

泽连斯基“抽搐”传闻的48小时,谁在受益?

子桑说
2026-09-23 18:00:10
为什么越来越多人用苹果手机?网友一句话说透:但凡不穷就会换苹果!

为什么越来越多人用苹果手机?网友一句话说透:但凡不穷就会换苹果!

一个有灵魂的作者
2026-09-21 16:41:15
成都二手房突破23.3万套,房价神话破灭,买家时代来了?

成都二手房突破23.3万套,房价神话破灭,买家时代来了?

说故事的阿袭
2026-09-23 15:36:52
闲鱼公布调查结果:老子没涉黄!

闲鱼公布调查结果:老子没涉黄!

城事堂
2026-09-23 14:45:46
国际油价集体收跌,美油跌2.73%,跌破90美元关口

国际油价集体收跌,美油跌2.73%,跌破90美元关口

每日经济新闻
2026-09-23 05:18:11
清华在编老师真实收入曝光,网友觉得实在,即便存200万又怎样…

清华在编老师真实收入曝光,网友觉得实在,即便存200万又怎样…

慧翔百科
2026-09-23 12:14:45
Netflix出品的成人动漫,太过瘾了

Netflix出品的成人动漫,太过瘾了

来看美剧
2026-08-25 20:18:24
苏有朋林心如古巨基复刻25年前剧照!《情深深雨濛濛》三人组合体,引回忆杀

苏有朋林心如古巨基复刻25年前剧照!《情深深雨濛濛》三人组合体,引回忆杀

草莓解说体育
2026-09-22 16:31:37
62岁华人男子帕劳潜水失踪超5天,家属停止寻人:让他回归深爱的大海,不能要求别人冒着生命危险寻找;其曾任潜水教练,32年潜水超5100次

62岁华人男子帕劳潜水失踪超5天,家属停止寻人:让他回归深爱的大海,不能要求别人冒着生命危险寻找;其曾任潜水教练,32年潜水超5100次

扬子晚报
2026-09-22 21:44:09
1993年,粮票作废当晚,几十万粮店职工在柜台后坐了一整夜

1993年,粮票作废当晚,几十万粮店职工在柜台后坐了一整夜

鉴古知薇
2026-09-19 18:16:46
2026-09-23 18:48:49
刀哥聊AI
刀哥聊AI
深度评测AI工具、AI大模型,资深大厂架构师,出海智能硬件创业者
107文章数 13关注度
往期回顾 全部

科技要闻

一夜三款新模型,AI价格战再升级

头条要闻

33岁黄梅戏女演员确诊癌症 家人公开求助:她想活下去

头条要闻

33岁黄梅戏女演员确诊癌症 家人公开求助:她想活下去

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

性能与实用兼得 全新奥迪S5 Avant上市 57.18万元

态度原创

数码
时尚
本地
艺术
游戏

数码要闻

ID-COOLING预告FLOW 500:前置电源M-ATX兼容机箱,10月见

消失的天后,带病复出,先赚10个亿

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

艺术要闻

《圣教序》原稿震撼展出,再现王羲之笔法真面目,原来我们都练错了!

从花札到Nintendo Switch2 任天堂已走过137年

无障碍浏览 进入关怀版