![]()
2026年中,全球AI赛道迎来范式级转向,头部玩家集体押注世界模型。
OpenAI发布Sora2.0实现物理级视频生成,xAI推出Grok World可模拟城市级交通与工业产线,李飞飞团队推出的Atlas首创空间上下文三维构建能力,字节Vertex模型进入最后攻坚阶段。
显示,作为世界模型的核心算力底座,AI芯片相关企业包揽榜单前十中的7席,算力硬件类上榜企业达14家,较去年大幅增加9家。
![]()
图源:网络
从拼参数、拼算力的大语言模型军备竞赛,到拼理解、拼推演的世界模型之争,AI赛道的下半场,已经悄然开场。
01.
从“会说话”到“会推演”
以GPT-4o为代表的大语言模型,依托海量文本训练掌握人类语言逻辑,擅长问答与内容生成,本质是对已有知识的复述;世界模型则通过学习真实世界的视频、图像与交互数据掌握物理规律,擅长场景模拟、态势推演与结果预测,本质是对现实世界的仿真还原。
世界模型的概念可追溯至2018年DeepMind的经典论文,但此后数年间始终局限于实验室前沿探索。
转折点出现在2024年,OpenAI发布初代Sora,首次让全球直观感受到AI对三维空间、物体属性与物理运动的深度理解。它不靠拼接现有视频,而是在内部 “渲染”出符合现实逻辑的虚拟世界。
2025年因此被业内称为“世界模型产业化元年”,谷歌、英伟达及国内厂商密集跟进,赛道快速从学术走向产业。
进入2026年,Atlas带来新一轮技术跃迁,它首创空间上下文机制,将每张输入图像与对应的相机位姿绑定,把不同位置、不同视角的局部信息整合为完整的三维空间,在单一模型内统一了场景生成、三维重建、新视角生成、深度预测等原本分散的任务。
![]()
图源:World Labs官方
官方演示的斯坦福校园案例中,仅需少量游客视角的随手照片,Atlas就能还原草坪、拱廊与建筑全貌,并生成上帝视角的漫游画面;机器人仿真场景中,仅用两段手机视频各取24帧,即可重建大型训练环境,生成机器人沿路径运动时的第一视角画面与深度数据。
OpenAI首席科学家伊利亚・苏茨克维曾直言:“世界模型是通往通用人工智能的唯一路径。”而在产业端,共识已经形成:大语言模型的边际红利正在见顶,下一个十年的AI增长曲线,将由世界模型拉开。
02.
千亿量级押注
经过三年高速发展,纯大语言模型的能力边际效应正在快速递减。训练成本指数级攀升,但用户体验的提升越来越有限;同时,AI要真正走进实体世界,光靠 “会说话”远远不够,必须具备对物理世界的理解与推演能力。
世界模型,正是打破这一天花板的关键。也因此,这场技术竞赛从一开始就带着千亿级的投入量级。
![]()
图源:网络
OpenAI是毫无争议的领跑者,据市场机构测算,其在世界模型方向累计研发投入已超150亿美元,Sora核心团队规模超800人。
![]()
Sora 2.0效果图
图源:Open AI
升级后的Sora2.0实现了物理动力学级精准,可生成带猫完成花样滑冰三周跳、桨板后空翻等复杂场景,篮球反弹、流体水花等细节的物理误差较初代降低72%,OpenAI最新估值也随之突破2500亿美元。
马斯克则打出了“数据+场景”的组合牌,依托特斯拉每年数十亿公里的自动驾驶数据,以及Optimus机器人的实体交互数据,xAI推出的Grok World更偏向实体世界的高精度模拟,可直接用于机器人动作预演与自动驾驶场景推演。典型应用场景包括:模拟城市级早晚高峰交通流,为自动驾驶算法补充长尾极端场景训练;预演机器人在产线上的抓取、装配动作,大幅降低实体调试的时间与成本。对马斯克而言,世界模型正是串联特斯拉、xAI、SpaceX三大业务的核心技术底座。
![]()
图源:网络
在上,马斯克以1.28万亿元人民币的财富蝉联全球首富,而世界模型正是他串联特斯拉、xAI、SpaceX三大业务的核心技术底座。
放眼国内,字节跳动依托抖音与TikTok日均超10亿次的视频流数据,其自研 EX-4D框架可将单目视频转换为4D多视角场景,技术路线对标谷歌Genie3与 Meta V-JEPA 2,核心目标是构建可模拟物理规律的通用数字孪生。目前字节采取前台落地、幕后迭代的策略,由Seedance视频模型与豆包承接商业化,世界模型本体持续攻坚,目标2026年底达到全球SOTA水平。
03.
商业化路径
从技术验证到产业落地,世界模型的商业化路径正逐步清晰,目前主要集中在四大核心领域。
具身机器人被认为是空间最大的落地方向,传统机器人训练依赖真实环境试错,成本高、周期长;引入世界模型后,机器人可以在虚拟仿真环境中完成上万次动作训练,预判碰撞、抓取效果,再迁移到真实场景,效率提升数十倍。
![]()
智元机器人参加2026胡润品牌嘉年华活动
图源:网络
目前,特斯拉Optimus、国内的智元机器人、宇树科技等头部企业,均已将世界模型作为运动控制的核心模块。
自动驾驶是第二大核心场景,世界模型可模拟车辆、行人行为轨迹,推演雨雪、夜间等极端工况,提供近乎无限的仿真数据,大幅提升复杂路况下的决策安全性。特斯拉FSD、百度Apollo等头部方案,均已将世界模型纳入核心技术架构。
工业与科研是确定性最强的B端市场。从产线仿真、矿山作业模拟到药物分子推演,世界模型可在虚拟空间完成低成本验证,大幅缩短研发周期。目前华为、百度的工业级世界模型已率先在能源、制造行业落地。
内容创意是最先感知变革的领域。以Sora为代表的文生视频模型本质是场景化世界模型,随着技术成熟,影视制作、游戏开发、广告营销等行业将率先迎来生产力升级。
但行业挑战同样不容忽视。一是技术与资金门槛极高,世界模型需要海量高质量数据、超大规模算力支撑,还要突破物理精准建模、长时序误差累积等难题,目前全球具备全栈研发能力的企业不超过10家。二是规模化商业化路径仍不清晰,不同于大语言模型可通过API快速变现,世界模型落地多需深度定制,与场景强绑定,复制难度大、交付周期长,多数企业仍处于试点阶段。
尽管挑战重重,产业方向已十分明确。就像十年前的移动互联网、五年前的大语言模型一样,世界模型正在开启全新的AI时代。这场竞赛的核心胜负手,不在于模型规模与算力高低,而在于谁能率先将虚拟世界的模拟能力转化为真实世界的产业价值,抢占下一代AI的产业话语权。
本文由胡润百富综合整理
联系方式
官网:http://www.hurun.net
微信:hurun-1999
邮箱:service@hurun.net
❖ END ❖
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.