网易首页 > 网易号 > 正文 申请入驻

扶稳坐好,世界模型,元年已到

0
分享至


一天一天贴近咱的心,它走心,咱放心。

文 | 佘宗明

AI大佬杨立昆该偷着乐了——他断言的「LLM(大语言模型)只是过渡品,JEPA(联合嵌入预测架构)+世界模型才是通往AGI正途」,似乎正得到应验。

2026年被钉上「世界模型元年」的铭牌,即为印证。这不是我的「自定义」,而是很多实锤在现实墙面上砸出的标记。

2026年1月,谷歌DeepMind开放Genie 3公测,世界模型首次以可交互形态对普通用户开放;几乎同一时间,蚂蚁集团旗下灵波科技连续发布世界模型产品;4月,腾讯开源混元3D世界模型2.0;6月,蔚来向超70万用户推送世界模型驱动的端到端驾驶系统;7月,蚂蚁灵波在几天内连发六款模型,昆仑万维在WAIC上宣布2026年为「世界模型元年」……


虽然时下「元年」二字已被滥用,可拐点是它最好的证明。众多迹象显示:算力成本、模型连贯性、产业资本,三条此前各自爬坡的曲线,在2026年同时跨过商用临界点。

说到这,有些人可能被动开启了「懵逼树上懵逼果,懵逼树下你和我」模式:什么大语言模型、世界模型、我秀我型?

让我用比豆包还直白还简单还不拐弯抹角的方式回答你:大语言模型「管」信息世界,最擅长跟咱们侃大山;世界模型「管」物理世界,能预判物体碰撞、行人动向、空间变化。

你让ChatGPT写出行车方案,它三两下搞掂,你让它预判出路边小孩突然横穿马路它只能来上一句「臣妾做不到啊」。毕竟理解符号与文字,不懂重力、碰撞、空间时序。

而世界模型的核心能力,是在数字空间复刻那套完整的物理规则说人话就是:AI终于可以开始看懂我们身处的真实世界明白原来牛顿的万有引力掌管着我们的日常。

被杨立昆、李飞飞们偏爱的世界模型,不算新概念,但2026年的特殊之处在于,世界模型不再是仅供演示的概念,而是三类普通人高频接触的产品标配:玩游戏时动态生成的无限开放世界、家用机器人提前预演的家务动作、自动驾驶车辆预判的千万种路况风险。

谷歌让普通人「创造世界」,蚂蚁让机器人「预演世界」,蔚来让汽车「预判世界」,这三件事接连发生,本就意味着:风,已经来了。

那,世界模型将如何改变我们的生活?

谷歌、蚂蚁、蔚来「让事情发生」的游戏、机器人、自动驾驶三个领域的变化,就可供我们窥斑见豹。

01/

游戏,终于可以从「预制」变「现炒」了

如果你是个游戏老玩家,大概率都经历过「就这?」时刻:很多的所谓开放世界游戏,肝了200小时后,再无新鲜劲可言。二周目?不过是把同样的路再走一遍、跟同样的NPC说同样的话。

没办法,当下游戏多是预制——包装得再精美,地图都是开发者提前设计的,NPC台词都是照剧本来的,咱们能走的路、能进的门、能看到的风景,都在设计文档里画好了边界。

我不是针对某款游戏,我是说绝大多数都是。

听到这,你是不以为凡游戏「预则无味,不预则废」?

谷歌拍了拍我们,说「来感受疾风吧」,顺带着就抛出了Genie 3。

年初的Genie 3开放公测,就第一次让普通用户用「一句话生成一个能交互的3D世界」,摸到了「生成式世界」的门槛。


生成一个世界不难,难的是生成的世界有基本的物理常识——角色不能穿墙,重力依旧存在。你离开某个场景再回来,它能像DM(地下城主)那样,还记得之前有什么。

这绝对是游戏玩家的福音:它意味着,世界模型驱动的游戏,我们玩三遍,三遍是三个不同的宇宙,它可以没有固定剧情,没有预设结局,整个世界根据我们的行为动态生长。在这个世界里放了一把火,下次回来,那片废墟还在冒烟。

担心无「国服」版本的玩家也不用担心。昆仑万维推出的开源世界模型Matrix-Game,算是平替:它也能模拟复杂建筑的玻璃反光,还能跑GTA风格的大地图自由探索。

腾讯开源混元3D世界模型2.0,则让游戏开发者也有了趁手工具:因为它能把文字、图片、视频直接变成3D世界资产,跟现有游戏工作流对接。这么一来,游戏开发者以后可能就不用再从零开始建模,没准对着AI说「我要一座哥特式城堡」,再拿着AI生成的草稿精修,就行了。

你要说现在的世界模型游戏有多能打,倒也未必。毕竟还是「幼詹形态」,场景连贯性只能维持几分钟,实时交互延迟还太高,画面精细度离3A大作往往差着十个《荒野大镖客》。

但它指向的方向很清晰,那就是从「开发者给你一个限定世界」变成「AI给你生成一个无限世界」。方向已定,接下来就等技术成熟了。

等技术成熟后,被颠覆的恐怕不只是游戏行业,任何需要「构建虚拟空间」的场景,比如建筑设计师在AI生成的空间里穿行,导演在AI生成的场景里提前预览镜头,都能让世界模型帮忙。

单就游戏来说,我觉得,在游戏将来「主打现炒」后,玩法也会更多样,以后再「读档」可能就不是再回到某个存档点了,而是让AI重新生成一个类似但不同的世界,让咱再试一次。想象一下,玩《黑暗之魂》,每次死亡后BOSS战的场景布局都不一样,咱是不就能喜提无限重玩的乐趣了?

02/

机器人从仿真到逼真再到……「如真」

生活不止眼前的游戏,还有远方的诗和田野+手头的琐事。游戏世界模型能让咱们「无限流体验」一时爽,机器人世界模型则能让咱们拥有建国后成精的Robot。

现在的机器人,虽然扭起秧歌来比「四肢残废」的我好太多,但要论懂其中的力矩、角动量、摩擦力、惯性、简谐运动等基础物理知识,它可能得喊我一声「大哥」。

事实就摆在那:机器人在仿真环境里可以是王虹是邓煜,到了真实世界里就是数学「学废了」的世另我

数据可以佐证这点:机器人在仿真环境中操控成功率能达到89.4%,但落到真实家庭场景,暴跌至12.4%。业界将其从仿真到现实的鸿沟称作Sim2Real Gap,我则称其为「另一个马里亚纳海沟」。

原因无他:仿真环境堪比无干扰温室,光线均匀得像摄影棚,物体摆放得整整齐齐,桌面平整得像乒乓球台。真实世界呢,往往糙很多:阳光可能在桌面上切出光斑,桌面上可能还有水渍,旺财可能突然从桌子下窜出来。

这就导致,仿真环境里训练好的机器人,就像只在恒温泳池里练过游泳的选手,第一次下海就被浪拍懵了——乘风破浪不了一点。

机器人训练师不是没想过解法,但方式也很原始:让它在真实环境里反复试错。学开门就摔一千次门,学抓杯子就碰碎几百个杯子。

但咱就是说,为了训练一个端茶机器人,让它在客厅里搞一万次破坏,这成本……是不是太高了?

世界模型提供了另一种解法让机器人在虚拟世界里脑补无数次真实场景,学会应对各种意外,再回到现实。那些试错不需要在真实世界里发生,世界模型帮它在脑子里跑完。预演完后,带着经验回到现实。

清华大学FIB-Lab的研究就认为,用合成数据训练的机器人策略,真实世界表现有显著提升。划重点:「显著提升」,以后要考。机器人表现从「真的难用」到「勉强能用」再到「十分好用」,产业才能实现实现指数级爆发。

国内在这条路上跑得最猛的,是蚂蚁集团旗下的灵波科技。虽然才成立才1年半,但它已经拿出了覆盖机器人从看到动的十余款模型。


上个月更是猛:灵波几天内连发六款模型,覆盖视觉、空间感知、VLA(视觉语言动作)、世界模型和世界动作模型。其中最值得关注的,是LingBot-World和LingBot-VA这对组合。

LingBot-World负责生成可交互的虚拟环境,第一代单次能生成接近10分钟的连贯视频。2.0版本更进一步,支持无限时长的实时交互,还引入了Agent机制,让生成的世界从可观看的背景变成了能互动的环境。LingBot-VA则是具身原生世界动作模型,从一开始就是为机器人学动作设计的,不是拿现成视频生成模型改改就用的二手方案。

LingBot-World是「世界」,LingBot-VA是「动作」,扣在一起,就是机器人在虚拟世界里「脑补」无数次试错的关键组件。这套大脑还不挑身体——LingBot-VLA 2.0已经适配了17个机器人品牌的20多种构型,同个大脑能装到不同品牌机器人身上。以前换个机器人就得重新训练,现在「一脑多机」也能变为现实了。

灵波CEO朱兴今年6月说了句话,点出了这件事的深层意义:「随着‘大脑’更加聪明,AI将反向定义硬件。」翻译下就是:不是机器人长什么样,决定了它能干什么,而是大脑需要什么能力,反过来定义机器人该长什么样、该装什么传感器。

这有点像智能手机时代:不是手机决定了APP长什么样,而是iOS和安卓定义了手机该有什么功能。

普通人能感知到的变化已经出现了。2026年5月,中国首个面向具身智能的应用中试基地落地杭州滨江,华为和阿里达摩院都参与了,基地聚焦新消费、新物流、新制造。

嗯,我期待的就是,让机器人从「仅供表演用」变为能替我搬砖。

虽说机器人面对多变量家庭环境依旧笨拙,世界模型也无法一步实现完美操作,但就现在这进化速度……反正我是不想被现状限制住想象力。

03/

自动驾驶,会被老司机附体

FSD、城市NOA、高速NGP……这些也会是世界模型的跑马场。

现在看,自动驾驶是成了三个领域中世界模型离普通人最近的一个——因为它已经上路了。

今年6月,蔚来就向超过70万用户推送了世界模型驱动的端到端驾驶系统。2026年4月,Momenta的R7模型已经量产上车。

这消息,至少让我对智驾的安全性多了些信任——因为世界模型可以智驾系统被老司机附体,从反应快进化到想得远。

传统自动驾驶的逻辑,大抵可以理解为「看到什么躲什么」:摄像头拍到前方有个行人→识别为障碍物→赶紧刹车。

其要害是反应快,需要「先看到,再行动」。就像作为新手司机的我,开车时眼睛盯着前方,手里攥着方向盘,遇到情况才踩刹车。

世界模型则会教它不光要「看到」,还要「预判」:那个站路边低头看手机的人,会不会突然冲过来?前面那辆车,会不会不打灯就变道?路面上那片积水,会不会让旁边的车打滑?


习惯是「养」成的。传统自动驾驶是从人类司机的驾驶行为里学习,问题是,人类司机大部分时间都在正常开车,急刹、变道是少数情况,这些数据太稀疏了,所以自动驾驶在应对突发情形时可能应对不足。

世界模型则可以生成无数种「如果发生××情况会怎样」的场景,让自动驾驶系统在虚拟世界里经历无数次「差点出事」,再回到真实路面上。

据Momenta称,R7在搭载世界模型后,预判前方车辆掉落物品、小动物突然横穿等突发状况的能力有显著提升。

又是「显著提升」,鉴于这说法来自厂商,姑且存疑,但单说这方向——从「快反应」到「能预判」,应该是靠谱的。

犹记得,英伟达CEO黄仁勋在2026年CES上断言:「物理AI的ChatGPT时刻即将到来」,现在看,自动驾驶就是其第一个大规模主流落地场景。

这对提升智驾安全性绝对大有裨益。凯文·凯利说过:「在自动驾驶方面,我们不能满足于99%的安全性,必须追求99.99%的精准。安全性达到98%不是一件困难的事情,但是越往后越困难……最后的部分难度最大、耗时最久。」

世界模型要解决的,正是那最后1%的长尾问题——那也许是咱们一万次正常驾驶才能碰到一次的偶发情况。

毋庸讳言,自动驾驶的世界模型尚处在早期,用「它还是个孩子」来为其不足开脱不合理,但理就是那么个理儿。

但假以时日,世界模型大概率会是通往全场景无人出行的底层技术底座。

联想到2026年已有70万辆车在跑,「假以时日」里的时日不会是太久,因为那些车辆每跑一公里,世界模型都在变聪明一点……一天一天贴近咱的心,它走心,咱放心。

04/

我们的物理世界,离被重塑还会远吗?

说到这,我想起这几年常被技术圈提到的一个词——「AI下半场」。

自从ChatGPT问世以来,它带来了石破天惊的链式反应。这两年,「上半场拼参数,下半场拼落地」之类的说法蔚为风行。

但大家默认的前提是,这里的AI指的是大语言模型。AI落地路径也被理解为:让大语言模型根据垂直场景定向优化,深耕行业,解决问题。

可真要落地,未必只有LLM一条路。按杨立昆的说法,世界模型是更好的那条路——它天然靠近我们赖以生活的物理世界。

大模型的确可以让信息变得无限廉价,写文章、做翻译、写代码,边际成本趋近于零。可很多事,它干不了。

世界模型要做的是让「物理经验的复制」变得廉价——让机器人不需要在真实世界里摔一万次就能学会端茶,让自动驾驶不需要真的撞一次才能学会避让,让游戏世界不需要几百人花几年建模就能无限生成……


而这些,兴许只是我们的物理世界被普遍重塑的缩影与前兆。

想想假若我们生活的物理空间变成了可以被生成、被预演、被重写的东西,该有多刺激?

别说它生成的世界还不够精细,预演的场景还不够全面,预判的意外还不够准确,这些问题确实存在,但别忘了,互联网刚诞生时只能发几KB的邮件,智能手机刚诞生时连多任务都跑不动。

世界模型元年已到,还是上车扶稳坐好吧。

✎作者 | 佘宗明

✎运营 | 李玩

转载须经许可

广告合作请联系微信号:rabgogo88

或手机号:18810070968

敬请关注


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
向世界宣布:4台总推力66吨!中国已悄然成为世界航空发动机强国

向世界宣布:4台总推力66吨!中国已悄然成为世界航空发动机强国

北海史记
2026-09-11 11:56:13
越闹越大!107名毕业生被指认卖国,和星宇股份有没有关系

越闹越大!107名毕业生被指认卖国,和星宇股份有没有关系

平老师666
2026-09-08 21:41:14
郑钦文美网奖金92.6万美元,到手为何只剩三成?

郑钦文美网奖金92.6万美元,到手为何只剩三成?

林子说事
2026-09-11 04:45:23
户晨风骂了三年华为折叠屏是智商税,苹果也出了折叠屏,他连还嘴的机会都没了

户晨风骂了三年华为折叠屏是智商税,苹果也出了折叠屏,他连还嘴的机会都没了

不掉线电波
2026-09-10 13:04:14
2-1!C罗被“打脸”,刚指挥队友“排布人墙”,后脚就被直接破门

2-1!C罗被“打脸”,刚指挥队友“排布人墙”,后脚就被直接破门

汪星人哟
2026-09-11 15:29:36
撕破脸?黄晓明公开内涵,直言帮太多白眼狼,杨颖遭殃 向太没说

撕破脸?黄晓明公开内涵,直言帮太多白眼狼,杨颖遭殃 向太没说

阿库财经
2026-09-11 15:04:53
难怪皇马要买他!1.7亿欧巨星超值:9分钟进2球,还助攻凯恩破门

难怪皇马要买他!1.7亿欧巨星超值:9分钟进2球,还助攻凯恩破门

体育知多少
2026-09-11 05:57:22
与何超琼同居14年,至今没结婚没孩子没名分,地位早已碾压陈百强

与何超琼同居14年,至今没结婚没孩子没名分,地位早已碾压陈百强

君笙的拂兮
2026-09-09 19:40:43
北大教授最无耻的诡辩:穷人无路可走,在他们眼里就是享受福利

北大教授最无耻的诡辩:穷人无路可走,在他们眼里就是享受福利

放开他让wo来
2026-08-23 01:10:08
演员陈赫自曝确诊!已暂停工作

演员陈赫自曝确诊!已暂停工作

背包旅行
2026-09-09 18:39:24
演员章若楠说大家卸了妆都长一样

演员章若楠说大家卸了妆都长一样

韩小娱
2026-09-11 11:15:08
美媒:中国6代机“歼-50”再次试飞,产量预计和歼-20一样多,将取代苏-30和歼-11

美媒:中国6代机“歼-50”再次试飞,产量预计和歼-20一样多,将取代苏-30和歼-11

蓝星杂谈
2026-09-11 18:37:23
索罗金:干洗店98元账单收了13000,我没看就扫码,15分钟退回来

索罗金:干洗店98元账单收了13000,我没看就扫码,15分钟退回来

懂球帝
2026-09-11 20:25:15
结婚10年未生育,刘翔的回应,尽显通透!网友:刘翔的父母亲,是非常希望有孩子的

结婚10年未生育,刘翔的回应,尽显通透!网友:刘翔的父母亲,是非常希望有孩子的

火山詩话
2026-09-11 11:30:06
广州180万女性不婚,不是不愿嫁,是两件现实难事

广州180万女性不婚,不是不愿嫁,是两件现实难事

荷兰豆爱健康
2026-09-11 19:03:04
方媛好能忍!郭富城本人满脸皱纹,还有老年斑,个子不高像小老头

方媛好能忍!郭富城本人满脸皱纹,还有老年斑,个子不高像小老头

八卦王者
2026-09-09 14:23:41
吴曦+老蒯破门!U23国足2-0生擒乌兹,争取小组第一出线,亚运会拿牌

吴曦+老蒯破门!U23国足2-0生擒乌兹,争取小组第一出线,亚运会拿牌

刀锋体育
2026-09-11 08:33:09
2026年出生人口预测:老百姓对断绝香火危机的冷漠,官方看到都无奈

2026年出生人口预测:老百姓对断绝香火危机的冷漠,官方看到都无奈

非虚构人间
2026-09-11 01:40:57
扎心对比!全球买 iPhone17 Pro 工时图,郑州位次来了

扎心对比!全球买 iPhone17 Pro 工时图,郑州位次来了

珂尔
2026-09-09 10:33:58
自然资源部正式发布报告 我国稀土、钨、锡等14种矿产储量居世界第一

自然资源部正式发布报告 我国稀土、钨、锡等14种矿产储量居世界第一

每日经济新闻
2026-09-11 16:08:32
2026-09-11 22:07:00
数字力场 incentive-icons
数字力场
抵抗熵增,打捞有趣。
622文章数 61042关注度
往期回顾 全部

科技要闻

苹果折叠屏比小米华为贵5000元,该怎么选

头条要闻

女演员被指卖韭菜盒子 此前曾称被前夫坑到负债600万

头条要闻

女演员被指卖韭菜盒子 此前曾称被前夫坑到负债600万

体育要闻

37岁还能场场进球,还能翻跟头!

娱乐要闻

黄晓明直言帮太多白眼狼,杨颖遭殃

财经要闻

女装“玖姿”母公司跨境贸易迷局:安正时尚说谎了吗?

汽车要闻

买菜车也有小乐趣 风云T7不止是台合格家用SUV

态度原创

艺术
时尚
本地
房产
军事航空

艺术要闻

费欣画自家闺女,拍了330多万!

衣服别总是只穿黑色,看看这几款蓝色单品,清爽高级不过时

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

房产要闻

别再等了!广州改善好房,正在进入“卖一套少一套”时代

军事要闻

涉伊朗核问题 中国和俄罗斯投下反对票

无障碍浏览 进入关怀版