网易首页 > 网易号 > 正文 申请入驻

7 篇 ECCV 论文!极佳视界联合顶尖高校,打通空间智能从「看得稳」到「摸得准」再到「决策灵」的落地瓶颈

0
分享至


以推理决策与物理重建,让空间智能从生成走向因果交互。

作者丨张 璐

编辑丨幸丽娟

在生成式 AI 的演进历程中,从二维像素走向三维物理世界,是人工智能迈向现实落地的必经之路。

以 3D Gaussian Splatting、Sora 级视频生成以及多模态大模型为代表的技术,曾让行业看到了空间智能的巨大潜力。然而,当这些原本运行在数字世界中的算法尝试走向真实硬件与物理场景时,整个行业正在遭遇一场前所未有的“落地阵痛”。

当前的视觉与空间模型看似绚丽,却普遍陷入了三重难以逾越的瓶颈:决策依赖暗盒式的直接预测,缺乏对物理因果的常识推理;三维资产仅停留于视觉逼真,剥离了质量与形变等物理属性;世界模型缺乏对动作控制的精确响应,沦为无法评估安全的离线画面。

缺乏逻辑推理、缺乏真实物理属性、缺乏控制闭环,这三大软肋直接阻断了物理 AI从实验室 Demo 迈向工业落地的可能。突破这些瓶颈的关键,不再是单一模型参数的堆叠,而是要建立一套贯穿“空间感知、物理推演到具身决策”的技术演进图谱。

在本届计算机视觉顶级学术会议 ECCV 上,极佳视界(GigaAI)展现出了极其瞩目的学术爆发力,共有 13 篇论文成功入选。其中,有 7篇落在了空间智能这个研究方向。

极佳视界联合清华大学、中国科学院自动化研究所、浙江大学、上海交通大学等顶尖学术机构,将这 7 项重磅研究汇聚成了一套完整的技术破局方案。不同于零散的学术试验,这一系列成果展示出了一条极其清晰的技术演进路径:物理 AI 的终局,不仅是生成逼真的画面,而是打造能够理解物理规律、预测未来演化、并与真实世界无缝交互的具身大脑。


01


打破暗盒与离线,

重构具身大脑与试车场

在传统的具身智能与自动驾驶开发中,模型大多扮演着一个“暗盒”角色:输入传感器图像与自然语言指令,通过端到端神经网络直接预测并输出末端执行器的动作坐标或车辆轨迹。

这种“图像进,动作出”的暗盒模仿范式,在环境简单、分布内的数据集上或许能跑出不错的成功率。然而,一旦面对真实世界中复杂的物体遮挡、未见过的物品样式、随机的动态扰动以及长程多步骤任务时,暗盒模型就会暴露出致命的缺陷:它无法解释自己“为什么这么做”,也无法在遇到偏差时进行自我修正。

极佳视界的破局思路很明确:把“思维链推理”与“强化学习”深度融入决策闭环。无论是微观的桌面操控,还是宏观的道路驾驶,都打造出了可落地的技术标杆。

从暗盒操控到显式推理:VLA-R1 将 R1 强化学习引入具身决策


论文:VLA-R1:Enhancing Reasoning in Vision-Language-Action Models 合作机构:极佳视界 × 中国科学院自动化研究所 × 清华大学 论文链接:https://arxiv.org/abs/2510.01623

传统的具身操控大多依赖暗盒式的模仿学习,试图直接从像素跳跃到末端执行器的控制坐标。这种跳过逻辑推导的直觉反应,在面对遮挡、复杂常识与多目标干扰时极易失效。

要打破这种局限,关键在于赋予模型像人类一样“先推理、后动手”的能力。

极佳视界联合中科院自动化所、清华大学打造的VLA-R1框架,首次将类似 DeepSeek-R1 的强化学习(RL)与显式思维链(CoT)深度融入具身操控中。


VLA-R1 整体训练框架:结合 SFT 显式思维链推理与 GRPO 强化学习的多维可验证奖励对齐

VLA-R1 改变了传统模型直接输出动作坐标的做法,强制要求模型在输出控制指令前,先生成一段可解释的文本思维链。机械臂必须像人类一样,显式推导并回答“当前物体的空间遮挡关系如何”、“哪一个是目标容器”、“如何规划无碰撞路径”等物理常识问题,并同步预测出物理可供性区域与 3D 运动轨迹。

为了支撑这一高质量的逻辑推导,团队专门构建了包含 1.3 万条精细化标注的 VLA-CoT 数据引擎,为模型注入丰富的物理常识与空间因果关系。同时,在强化学习训练阶段,VLA-R1 摒弃了传统人工打分或模糊的倾向性奖励,而是从空间对齐、轨迹一致性与输出格式规整度三个维度设计了可精确计算的硬约束奖励机制(GRPO),大幅提升了模型在复杂场景下的决策稳健度。

在实验评估中,引入 GRPO 强化学习后,VLA-R1 的可供性区域 IoU 指标飙升至36.51,轨迹平均误差大幅降至91.74

复杂任务实例:把面包放进微波炉

在真实餐桌场景的复杂真机测试中,面对物体的临时移动与随机遮挡,配备 VLA-R1 的机械臂表现出了极强的鲁棒性与确定性,将具身操控从“碰运气式模仿”带入了“可解释、可验证决策”的新阶段。

从视频播放到闭环评估:OmniNWM 打造可响应、能打分的驾驶世界模型


论文:OmniNWM: Omniscient Driving Navigation World Models 合作机构:上海交通大学 × 清华大学 × 鉴智机器人 × 东方理工大学(联合新加坡国立大学、武汉大学等) 论文链接:https://arxiv.org/pdf/2510.18313

如果说 VLA-R1 攻克的是微观物理空间下的具身决策,那么在宏观自动驾驶领域,物理 AI 则需要一个具备全局视角与动作响应能力的世界模型作为“数字试车场”。

在自动驾驶与宏观导航场景中,过去的世界模型大多停留在“生成逼真视频”的离线展示阶段,既无法响应连续的动作控制,也缺乏安全评估机制。极佳视界联合上海交大、清华等机构推出的OmniNWM,则在单一生成框架下实现了状态、动作与奖励打分的三者统一。


OmniNWM 核心架构图

在状态表征上,OmniNWM 打破了单一 RGB 摄像头的视觉局限,能同步生成全景 RGB 视频、语义分割图、度量深度图以及 3D Occupancy(占据网格),确保生成的虚拟环境具备高度一致的空间物理表征。

在动作控制层,它利用归一化的全景 Plücker 射线图将车辆轨迹编码为像素级控制信号,彻底解耦了对特定相机外参的依赖,使得生成的视频与 3D 空间能够极其精准地响应任意车辆规划的转向、加速与换道轨迹。

更具颠覆性的是其评估机制,OmniNWM 抛弃了外接评估模型的传统做法,直接利用内生生成的 3D Occupancy 占据网格,构建了一套面向碰撞安全与交通规则遵循的稠密奖励函数。这使得模型在合成未来预测场景的同时,就能自动为当前车辆的驾驶策略进行精准打分。

3D 语义占用场景演示

实验表明,OmniNWM 在视频生成质量、长时距生成稳定性以及控制响应精度上均达到了行业领先水平。它将驾驶世界模型从单纯的“画图工具”,正式推进至能够直接服务于自动驾驶端到端策略训练与安全测试的数字试车场基础设施。

02


告别“纸片模型”,赋予 3D 资产

真实物理触感与 4D 动态推演

解决了大脑的逻辑推理与闭环评估后,物理 AI 面对的下一个核心考题,是“环境与资产”的真实性。如果仿真世界里的物体只是视觉逼真,机器人一旦与之发生力学交互或跨时空演进,系统就会因为缺乏真实物理响应而失去意义。

极佳视界的破局点,在于将“视觉表征”与“物理系统”深度结合,并打通了从静态 3D 到动态 4D 的连续推演通道。

从离线优化到秒级重构:ReconPhys 赋能 3D 资产真实物理属性


论文:ReconPhys:Reconstruct Appearance and Physical Attributes from Single Video 合作机构:极佳视界 × 中国科学院自动化研究所 × 清华大学 论文链接: https://arxiv.org/abs/2604.07882

传统方法在赋予 3D 资产形变与力学参数时,通常依赖极其昂贵的人工标注与离线计算,需要针对具体场景优化数小时,极难规模化应用。

极佳视界联合中科院自动化所、清华大学发起的ReconPhys研究,打破了外观重建与物理估计割裂的范式。它创新性地将 3DGS的视觉表示与可微弹簧-质点物理系统深度绑定,让高斯粒子在具备几何外观的同时,天然绑定了刚度、质量与阻尼等物理属性。


为了摆脱对人工物理标注的依赖,团队利用可微渲染与可微物理系统的协同,构建了纯视觉引导下的自监督优化链路,仅凭渲染像素级的监督即可反向推导出物体的真实物理特性。

更具实用价值的是,ReconPhys 将繁重的物理反算过程消化在训练阶段。在实际推理时,模型无需再进行离线迭代,仅需输入一段普通的单目视频,不到 1 秒即可直接前馈式输出一套绑定了完整物理属性的 3DGS 资产。


这种秒级物理重构的能力,为机器人柔性操控、物理图形仿真以及大规模 Real-to-Sim 数据生成提供了低门槛的高效入口。

从静态定格到几何感知:MoGe4D 驱动单图推演 4D 动态世界


论文:Geometry-Aware Single-Image 4D Synthesis via Dense Trajectory Generation 合作机构:极佳视界× 清华大学 论文链接: https://arxiv.org/abs/2512.05044

静态空间的表达已被逐渐攻克,但真实世界本质上是随时间连续演进的。以往的方法常常将 3D 重建与动态运动生成剥离,导致 4D 画面在视角变动或动态生成时频频出现结构崩塌。

极佳视界与清华大学提出的MoGe4D,尝试将两者在统一框架下深度打通。它先从单张图片估计出初始的三维几何结构,再以此几何为强约束条件,利用专门的 4D-STraG 模块预测空间各点相对于首帧的动态轨迹,最后由 4D-ViSM 模块完成任意视角下的动态渲染。

此外,团队还专门构建了包含 6 万组带稠密 4D 点轨迹的真实视频数据集 TrajScene-60K,为运动生成提供了坚实的数据支撑。在渲染质量、视角一致性与时空稳定性上,MoGe4D 大幅超越了现有的主流生成范式,单张显卡约 6 分钟即可稳定推演出高质量的 4D 视频,为沉浸式影视、空间内容生产与数字孪生提供了更统一的技术工具。


传统 4D 生成范式(a、b)与 MoGe4D 几何感知生成范式(c)的技术路线对比

03


筑牢工业级 3D 高精几何底座

与工程落地管线

具身大脑决定了如何决策,真实物理赋予了触感与环境响应,而最底层的三维几何重建,则是支撑起整个物理 AI 世界的技术地基。

在过去的 3D 感知与重建管线中,行业普遍面临着两难境地:要么为了追求几何一致性而陷入极其昂贵的算力开销;要么为了追求生成速度,导致重建出的 3D 资产充斥着杂点、重影与边缘模糊。

极佳视界通过一系列从算法范式到工程架构的创新,把 3D 感知与重建推向了“工业级可用”的高标准。

从 2D 匹配到 3D 对齐:VolSplat 构建稳定可信的三维体素几何


论文:VolSplat: Rethinking Feed-Forward 3D Gaussian Splatting with Voxel-Aligned Prediction 合作机构:极佳视界 × 浙江大学× 香港中文大学 × 清华大学×南洋理工大学 × 阿德莱德大学 × 莫纳什大学 论文链接: https://arxiv.org/abs/2509.19297

现有的前馈式 3DGS 重建方法,大多依赖 2D 像素特征强行推算 3D 结构,在面对多视角或弱纹理场景时极易产生杂点与几何扭曲。

极佳视界联合浙大、清华等多所全球顶尖高校推出的VolSplat,直接抛弃了传统的 2D 盲目匹配范式。它将多视角图像特征反投影到统一的 3D 体素网格中进行空间融合,再由 3D 解码器在体素空间直接预测高斯参数。


传统像素对齐范式(左)与 VolSplat 体素对齐范式(右)的前馈 3DGS 重建流程对比

这种从2D 匹配转向3D 对齐的建模方式,不仅让多视角对齐自然地发生在三维空间中,还能根据场景复杂度按需调整高斯密度,显著提升了几何一致性与可信度。这为前馈式 3DGS 提供了一条更符合空间结构本质的技术路线,也推动了 3D 内容生产从快速生成迈向稳定生成、可信生成。

工业级工程优化:AnchorSplat 与 2K Retrofit 解锁高清与低功耗

在建立了稳定的体素几何框架之后,极佳视界还针对工业生产管线中的“渲染细节”与“算力吞吐”两大落地瓶颈,给出了极具实用价值的工程解决方案:

从反向优化到点锚机制:AnchorSplat 0.01 秒重塑高频细节

论文:AnchorSplat: Fast and Structure Consistent Detail Synthesis for Gaussian Splatting 合作机构:极佳视界 × 中国科学院自动化研究所 × 上海科技大学 × 清华大学 论文链接:https://arxiv.org/pdf/2607.01290

现实中许多通过 AI 生成或扫描的粗糙 3D 资产普遍存在偏糊、偏稀的问题,而传统耗时数分钟的反向优化极难适应工业流水线。

极佳视界与中科院自动化所、上科大推出的AnchorSplat,打造了一个完全运行在 3D 空间内的即时资产增强网络。

它通过“点锚机制”约束新高斯粒子的局部生长,以单次倍增替代传统的迭代密化,在0.01 秒内即可重塑高频细节,为大规模 3D 内容生产与资产修复补齐了关键一环。

从全图计算到稀疏精修:2K Retrofit 低功耗解锁生产级高清


论文:2K Retrofit:Entropy-Guided Efficient Sparse Refinement for High-Resolution 3D Geometry Prediction 合作机构:极佳视界 × 北京航空航天大学 × 国防科技大学(联合 OpenHelix Robotics 等) 论文链接:https://arxiv.org/pdf/2603.19964

针对自动驾驶全景感知等大场景高清预测中的算力爆炸难题,极佳视界联合北航、国防科技大学等机构发起的2K Retrofit,洞察到几何预测残差 90% 以上都集中在边缘与遮挡交界处。

模型无需修改或重训原始 Backbone,而是利用冻结的基础模型生成稳定的全局粗几何,再利用熵信息精准定位少量关键区域进行稀疏精修。

这种“全局稳态 + 稀疏精修”的思路,以极低的算力开销将现有的几何基础模型直接推进至 2K 分辨率的生产级应用场景。

04


结语:从视觉生成

迈向物理世界的闭环演进

纵观极佳视界在 ECCV 上展现的学术成果,13 篇入选论文展现了其深厚的学术积淀,而其中直指“空间智能与物理 AI”的 7 项重磅成果,则勾勒出了一条极其严密的技术演进主线:

VolSplat、AnchorSplat 与 2K Retrofit打牢工业级 3D 几何底座;以ReconPhys 与 MoGe4D赋予空间 4D 动态推演与真实物理触感;最终通过VLA-R1 与 OmniNWM在具身操控与驾驶场景中打通“逻辑思考、动作执行与闭环评估”的完整决策链路。

空间智能与 Physical AI 的终局,绝不仅仅是生成一段漂亮的视觉 Demo 或重建一个精致的静态模型,而是要打造能够理解物理规律、预测未来演化、并与真实世界无缝交互的数字与物理实体。

物理 AI 的竞争,正在从单纯的“画质比拼”与“离线生成”,全面转向“物理可信、逻辑可推理、控制可闭环”的深水区。极佳视界通过这一系列全栈技术的集中布局,不仅攻克了具身智能落地的关键瓶颈,更在通往下一代通用物理世界 AI 的征程上,铺设了切实可行且具备示范效应的技术基石。

为了方便大家抱团交流、互通会议消息,我们专门建了ECCV 2026参会交流群!进群你会解锁这些「福利」

  • 会议情报站投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航场馆分布、报告厅怎么走,群里随时问;

    议题共读热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编现场海报精华整理,一键收藏不遗漏;

    约局广场约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

进群传送门:扫码进群或添加微信Qvv0909777,备注:ECCV + 单位/学校+姓名+方向。

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
笑麻!原来这才是浙江人有钱的原因,网友:全家没有一个闲着

笑麻!原来这才是浙江人有钱的原因,网友:全家没有一个闲着

另子维爱读史
2026-09-23 20:07:36
多家银行存款利息涨了,年利率最高超过2%!超50万亿元存款今年到期,银行高管:90%以上没有“搬家”

多家银行存款利息涨了,年利率最高超过2%!超50万亿元存款今年到期,银行高管:90%以上没有“搬家”

每日经济新闻
2026-09-22 16:38:13
情况不妙了,另一场大战随时开打,朝俄动作不断,中国避得开?

情况不妙了,另一场大战随时开打,朝俄动作不断,中国避得开?

史潎的生活日记
2026-09-21 18:19:22
中方通报后,新西兰回应了,新总理发声:预计中国不会反对

中方通报后,新西兰回应了,新总理发声:预计中国不会反对

丁懰惊悚影视解说
2026-09-21 16:36:45
外媒:沙特国王发表“罕见”声明,强烈谴责也门胡塞武装

外媒:沙特国王发表“罕见”声明,强烈谴责也门胡塞武装

环球网资讯
2026-09-22 22:17:06
西媒:巴萨更衣室有人开费兰玩笑,说其他人没在队里有更多机会

西媒:巴萨更衣室有人开费兰玩笑,说其他人没在队里有更多机会

懂球帝
2026-09-23 21:01:04
特朗普下令空袭胡塞,美军战机挂满弹药,没想到起飞之前突然生变

特朗普下令空袭胡塞,美军战机挂满弹药,没想到起飞之前突然生变

影孖看世界
2026-09-23 01:18:09
一个国家能蠢到什么程度?看看法国就明白了:法国黑人接近800万,巴黎新生儿里70%是黑人

一个国家能蠢到什么程度?看看法国就明白了:法国黑人接近800万,巴黎新生儿里70%是黑人

怪味历史连连看
2026-09-08 01:55:32
9个小毛病是癌症先锋军!“癌前病变”,需要你加倍重视!

9个小毛病是癌症先锋军!“癌前病变”,需要你加倍重视!

常笑健康
2026-09-16 16:14:19
小汪宝七个月了,自己拿枕头玩累了就躺,马筱梅在家炖汤陪娃

小汪宝七个月了,自己拿枕头玩累了就躺,马筱梅在家炖汤陪娃

荒野老五
2026-09-23 12:39:41
一旦开战恐全军覆没?美专家警告美军,解放军实力比伊朗强几十倍

一旦开战恐全军覆没?美专家警告美军,解放军实力比伊朗强几十倍

最终冲刺啊
2026-09-21 21:32:28
女子吐槽自己在广州老城区,遭受了30年最严重的“男凝”,网友在评论区表达了不一样的看法

女子吐槽自己在广州老城区,遭受了30年最严重的“男凝”,网友在评论区表达了不一样的看法

笔尖下的人生
2026-09-23 16:14:44
山东泰山3消息!彭啸助亚运队第1出线,泽卡谈战术,李小恒迎喜迎

山东泰山3消息!彭啸助亚运队第1出线,泽卡谈战术,李小恒迎喜迎

王大发不懂球
2026-09-23 20:25:47
九十多岁的父亲住进康养医院,据说管理不错,可她发现了伤口,说是护工打的,记者两次来到医院门口,没有等到回应

九十多岁的父亲住进康养医院,据说管理不错,可她发现了伤口,说是护工打的,记者两次来到医院门口,没有等到回应

极目新闻
2026-09-23 07:31:56
郭士强没想到,为中国男篮2连败找好的理由,被党刊发文一剑封喉

郭士强没想到,为中国男篮2连败找好的理由,被党刊发文一剑封喉

梦回千年aa
2026-09-23 05:18:41
不反华了?美媒公开赔罪,中国54岁铁娘子出山,中美稳定利好全球

不反华了?美媒公开赔罪,中国54岁铁娘子出山,中美稳定利好全球

知法而形
2026-07-07 16:10:54
53秒60!何诗蓓百自断层第一剑指双冠,菲律宾归化No2余依婷No4

53秒60!何诗蓓百自断层第一剑指双冠,菲律宾归化No2余依婷No4

全球热点大揭秘
2026-09-22 16:01:29
沙特猛然醒悟,手中最大的底牌,对胡塞根本没有用,中国开始出手

沙特猛然醒悟,手中最大的底牌,对胡塞根本没有用,中国开始出手

观烽墟
2026-09-23 00:33:19
“中国足球小将”再获大品牌赞助,董路更有底气了!

“中国足球小将”再获大品牌赞助,董路更有底气了!

总在茶余后
2026-09-23 18:11:38
高血压疫苗快要落地了吗?打了真能停降压药吗

高血压疫苗快要落地了吗?打了真能停降压药吗

周哥一影视
2026-09-23 00:31:59
2026-09-23 21:47:00
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7669文章数 20785关注度
往期回顾 全部

科技要闻

网易未来大会圆满落幕 硅基智能跨越临界点

头条要闻

女子骑车被30余厘米长竹棍贯穿脖颈 丈夫跪地哭求救命

头条要闻

女子骑车被30余厘米长竹棍贯穿脖颈 丈夫跪地哭求救命

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

焕新价17.78万起 长城猛龙PLUS力魂版与Hi4 255 Ultra上市

态度原创

艺术
健康
手机
亲子
公开课

艺术要闻

深圳4座新全球总部:大疆尖塔、京东画境、OPPO曲面、科达利窗口

痘痘没成熟,千万别硬挤!

手机要闻

时隔6年透明版再度回归!小米18 Pro透明特别版发布:9999元起

亲子要闻

离职举报“炒菜锅洗拖把”,良心老师不该没有前程 | 新京报快评

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版