网易首页 > 网易号 > 正文 申请入驻

深度丨从Cursor到Genspark,AI应用企业为什么开始训练自己的模型?

0
分享至



过去两年,AI 应用赛道有一条心照不宣的分工。大厂烧钱做预训练,把模型的能力上限不断推高,应用公司则调 API,叠加 Prompt、RAG 和工具链,把通用智能包装成具体产品。各干各的,边界清楚。

只是这门生意的账,正变得越来越难算。应用公司一边要烧钱获客,一边还要为每一次模型调用付费,用户用得越多,交给模型公司的钱就越多,忙活一场,像是在给模型公司打工。大家开始寻找新的出路,Genspark 给出了一份参考答案。

Genspark 用户有大量做 PPT 的需求,平台一天最多要生成 12 万份。用户大规模生成 PPT 时,既要保证成品质量,也要控制每次生成、检查和修改带来的调用费用。

这周,Genspark 给出了自己的解法 —— Gen-1 Slides,基于开源的 MiniMax M3 联合 Fireworks 做后训练。结果是,综合质量逼近 Claude Opus 5,单份 PPT 的模型成本却从约 4.16 美元降到 0.44 美元,砍掉了近九成。


这背后的信号比 Genspark 产品本身更大。头部应用公司在选择模型之外,现在又多了一项工作:判断哪些任务需要自己训练,在维持交付质量的同时降低服务成本;用户增长之外,还得算算能否留下收益。


当模型调用成为一笔持续支出

做一份商业 PPT,看上去是图文排版,实际上是一整套交付工程。基座模型在榜单上近乎全能,但应用团队还需要衡量它完成实际任务的质量、速度和费用情况。在保证体验的同时控制调用成本,开始成为产品规模扩大后绕不开的问题。

一份 PPT 从想法到成品,要经过搜集资料、列大纲、写内容、排版、生成图表、检查修改一连串步骤,每一步都是一次模型调用,调用轮次越多,费用就越高。通用模型单步表现不差,但难免会有疏漏和犯错。一旦中间某个环节出错,后面几十轮调用就会沿着错误的轨迹越走越远,需要修改的轮次也变得越来越多。

通用模型需要处理各种任务,应用团队则要对某一类任务的交付结果负责,两者关注的重点有所不同。用户也不关心模型懂多少宏大命题,他们只要在可控的成本里,让模型交出一份拿得出手、不用从头重改的成品。Genspark 的横向对比显示,顶尖通用模型的论述深度几乎挑不出毛病,但视觉和交互得分不算拔尖,成品仍需要经历多轮检查和修改。


门槛更高的法律行业也一样。全球估值最高的美国法律 AI 公司 Harvey 做过一个实验,让默认配置的 Agent 审查一间虚拟资料室,而模型的大量调用费用花在了无效尝试上。


来源:Harvey

有意思的是,Harvey 没有换模型,在重新设计了任务拆解和编排方式后,同一模型的合格率立刻蹿升,综合成本反而降了。


来源:Harvey

这个实验说明,工具如何使用、材料如何组织,都会影响模型的表现。应用团队可以先从工作流入手,解决反复出现的问题。如果这些问题能够被清楚地描述和评价,还可以进一步尝试后训练,让模型更稳定地完成相应任务。

对于大规模的应用企业,这个成本账就值得好好算。Agent 的多轮试错极其烧 Token,顶流模型的多轮调用会增加单次任务成本,影响产品的定价和利润空间,账单很容易击穿毛利。如果为了省钱砍掉一部分自检轮次,模型的真实水平又发挥不出来。应用企业迫切需要找到一种办法,在可接受的成本下稳定完成任务。


基于 MiniMax M3,Genspark 算清了一笔账

直接换便宜模型并不等于省钱,失败率和返工率一上去,省下的 Token 费很快会被吃回去。Genspark 换了个思路,拿开放权重的 MiniMax M3 做垂直后训练,保留较低的调用成本,同时提高PPT质量。

具体怎么练?Genspark 把自己做 PPT 的完整工作流拆成约 2,000 个贴近真实业务的构建任务,让模型在里面反复操练。每一轮产出,内部评分器都会从内容、视觉到任务完成度逐项打分,分数直接作为强化学习的奖励信号。训练目标里专门写进了“检查”和“修改”,模型交稿前必须自己预览、挑错、返工,而不是一次性生成完就撒手。评分器的意见还会回流做自蒸馏,评分规则也持续修补,防止模型练着练着学会钻奖励的空子。

效果可以拿数据说话。在相同的 200 个真实任务、同一套工具和工作流下,三个模型的账很清楚。


来源:Genspark

和原始 M3 比,Gen-1 每份只多花约 0.10 美元就补上了基础底座与顶级模型之间的质量差。和 Opus 5 比,每份少花 3.72 美元,同样的预算能做出约 9.6 倍的 PPT,质量还在同一档。


来源:Genspark

拆开看,提升最大的是视觉设计,任务完成度和内容深度仍略逊于 Opus,专用训练重塑了模型的能力结构,并没有让它全面反超。真实用户的反馈更直接,合计 157 万次线上任务里,原始 M3 的低分比例是 18.0%,Gen-1 降到 3.6%,与 Opus 的 3.4% 基本持平,平均评分也从 3.80 星追到了 4.25 星。


来源:Genspark

完成这轮训练也需要投入算力。单是最后一轮强化学习,就动用了 96 张 NVIDIA B300,跑了大约一周,相当于 1.6 万多个 GPU 小时,这还没算前期试错、任务构建和人工评估的投入。


来源:Genspark

有两点要说清。其一,降九成只是模型推理费,工具调用、渲染、存储的账另算,真正该比的是交付一份合格 PPT 的总成本。其二,后训练不是一锤子买卖,任务量足够大、质量足够稳,节省才会兑现。但对 Genspark 这样日产 12 万份 PPT 的平台,答案并不难算。开放权重让它跳过了预训练的天价门槛,把资源全部压在自己最熟悉的任务上,而真实任务和用户反馈,正在变成别人拿不走的模型资产。


从 Cursor 到 Harvey,一条共识正在形成

Genspark 并不是孤例。往前看,代码和法律这两个最“重”的垂直行业里,早有人走上了同一条路,这些公司也同样开始利用产品中积累的任务经验,训练更适合自身业务的模型。

比如,Cursor面对的问题是让生成的代码适应已有项目。对模型提出的要求是,需要理解原来的架构,也要判断修改是否符合开发者的要求。程序员的指令往往只有一两句话,模型得自己摸清几十万行的存量架构。仅靠公开代码语料,很难充分覆盖这些判断。

所以 Cursor 干脆自己下场,专有引擎 Composer 2 先在 Kimi K2.5 的开放底座上吃透工程代码,再进沙盒做强化学习,甚至把模型推进真实用户流量,拿开发者的采纳和撤销当奖励信号,最快 5 小时就能滚动训练一轮。产品每天的真实使用,都在给模型上新的课。

Harvey需要解决的是如何评价法律工作。答案是否准确、风险是否遗漏、引用能否支持结论,都需要专业判断。团队将这些要求拆成可供训练和评测使用的指标。

它的自研模型 Tenet 用公开判例、合成数据和合伙人标注做后训练,全程不碰客户底稿,等于造了一座高保真的“模拟考场”,专门教模型什么叫专业。在更细的报表审查场景,Harvey 基于 GLM-5.2 定制的模型,解析成本比 Claude Sonnet 5 降低五成。

应用层真正的壁垒,是摸透这门生意里最琐碎的交付关卡,并带来足够的成本节省。两个案例的共同之处,是团队先明确任务要求,再据此组织训练。业务经验由此进入了模型开发过程,而不只体现在提示词和产品设计中。


应用公司的护城河 在哪里?

红杉合伙人 Sonya Huang 有句话在业内流传很广:“Not your weights, not your product”,翻译过来就是,不握有权重,就谈不上真正拥有产品。但这不是劝大家和闭源巨头硬脱钩,而是学会根据成本、响应速度和业务要求,决定哪些任务继续调用外部模型,哪些值得自己训练。Harvey、Glean 这些先行者,本质上都在向新型应用研究实验室蜕变。

光有权重也挡不住对手。开源底座人人能下,微调出来的些许领先,转头就会被通用模型的下一次版本更新抹平。真正难复制的,是一套持续自进化的工程飞轮。应用企业需要持续从用户的反馈中识别问题,通过评测判断改动是否有效,并让训练跟上产品变化。这些工作都需要持续进行。

AI 应用的竞争,第一阶段拼谁先接上模型,第二阶段拼谁先理顺工作流。对应用公司来说,调用通用模型和训练专用模型可以同时进行。前者让产品持续获得新的模型能力,后者则为高频任务提供了控制成本的机会。在此情况下,真正要比拼的只剩一件事 —— 谁能把每一次交付做得更便宜、更稳,再把省下的成本和攒下的经验,滚成下一次更好的交付。





特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
胡军全家看秀,穿得一样年纪?胡军儿子比爹稳重,女儿比妈还像妈

胡军全家看秀,穿得一样年纪?胡军儿子比爹稳重,女儿比妈还像妈

八卦宝宝
2026-09-24 00:40:17
用了几个月突然变砖!二手电脑更新系统后被锁死:重装系统也没用

用了几个月突然变砖!二手电脑更新系统后被锁死:重装系统也没用

快科技
2026-09-22 14:41:36
央国企摸底55岁在岗职工,内退重新启动,和过去老模式差别很大

央国企摸底55岁在岗职工,内退重新启动,和过去老模式差别很大

职场资深秘书
2026-09-24 17:13:30
《兰香如故》王氏认怂!直到兰香当家,才懂她服气背后的心酸

《兰香如故》王氏认怂!直到兰香当家,才懂她服气背后的心酸

丁隗解说
2026-09-23 17:25:50
缺少头号射手!国足重庆周日迎战新西兰,这场才是真正大考验

缺少头号射手!国足重庆周日迎战新西兰,这场才是真正大考验

谭颞爱搞笑
2026-09-25 08:38:53
恭喜!韩娱最高龄产妇诞下一子!

恭喜!韩娱最高龄产妇诞下一子!

奋斗在韩国
2026-09-24 16:57:14
美国代表拒绝伊朗的报价,理由很干脆,霍尔木兹海峡控制权易手

美国代表拒绝伊朗的报价,理由很干脆,霍尔木兹海峡控制权易手

史料布籍
2026-09-24 20:44:12
“电车不保值”的时代,被一款中国车终结了

“电车不保值”的时代,被一款中国车终结了

财经无忌
2026-09-23 17:13:22
吃大补的东西身体会有什么反应?

吃大补的东西身体会有什么反应?

康富贵碎碎念
2026-09-22 11:48:26
图恩放话:就算丢了参议院多数,我也要再干一届

图恩放话:就算丢了参议院多数,我也要再干一届

碳基打工人
2026-09-24 07:42:31
李在赣神魔?阿德耶米面对大半个空门将球打飞惊呆克洛普

李在赣神魔?阿德耶米面对大半个空门将球打飞惊呆克洛普

懂球帝
2026-09-25 03:50:10
日本前首相鸠山由纪夫公开告诫高市,中国当年放弃巨额战争赔款,附带明确的条件,相关内容早已落实在书面文件,不可肆意违背过往承诺

日本前首相鸠山由纪夫公开告诫高市,中国当年放弃巨额战争赔款,附带明确的条件,相关内容早已落实在书面文件,不可肆意违背过往承诺

唠叨说历史
2026-09-02 16:16:45
男子100米预赛谢震业10秒30曾克理10秒22 泰国飞人汶颂飙出9秒95

男子100米预赛谢震业10秒30曾克理10秒22 泰国飞人汶颂飙出9秒95

劲爆体坛
2026-09-24 20:31:02
现场画面!白宫举行隆重仪式迎接中国国家主席

现场画面!白宫举行隆重仪式迎接中国国家主席

看看新闻Knews
2026-09-24 23:44:05
王健林已经惨到什么程度了?

王健林已经惨到什么程度了?

叶葉夜
2026-08-11 23:30:32
柬埔寨破获特大毒品枪支案,7名中国人落网,有人身上纹龙画虎,缴获840公斤毒品、49支长短枪及近8000发子弹

柬埔寨破获特大毒品枪支案,7名中国人落网,有人身上纹龙画虎,缴获840公斤毒品、49支长短枪及近8000发子弹

扬子晚报
2026-09-24 12:20:02
密密麻麻!33岁女子体内取出197枚,医生:从医以来第一次见

密密麻麻!33岁女子体内取出197枚,医生:从医以来第一次见

上海约饭局
2026-09-19 10:42:08
倘若西安事变中,张学良真把蒋介石枪决了,1936年的中国恐怕连1937年都撑不过去

倘若西安事变中,张学良真把蒋介石枪决了,1936年的中国恐怕连1937年都撑不过去

人生录
2026-09-22 10:58:44
民众呼吁“取消养老特权”!71岁专家引发争议,养老差距真相大白

民众呼吁“取消养老特权”!71岁专家引发争议,养老差距真相大白

百科密码
2026-08-31 10:02:15
闲鱼上的ChatGPT代充暗号,已经进化到我看不懂的程度了。

闲鱼上的ChatGPT代充暗号,已经进化到我看不懂的程度了。

数字生命卡兹克
2026-09-24 08:48:22
2026-09-25 09:28:49
ZFinance
ZFinance
Z世代的一站式AI、科技和财经资讯
275文章数 22关注度
往期回顾 全部

科技要闻

DeepSeek涨价后客户没少 年化收入10亿美元

头条要闻

王皓回应国乒男团决赛的失利:年轻队员需要成长空间

头条要闻

王皓回应国乒男团决赛的失利:年轻队员需要成长空间

体育要闻

巴图姆,以父之名

娱乐要闻

93岁游本昌去世 最后一句话惹人泪目

财经要闻

月饼卖不动了...

汽车要闻

全新第四代博越L 上市限时价9.29万元起

态度原创

家居
教育
游戏
本地
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

德国竞赛题:看似送分题,出错太多了

CDPR称《巫师4》选择及后果将给玩家留下深刻印象

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

军事要闻

韩国首架“准隐身”战斗机正式入列

无障碍浏览 进入关怀版