网易首页 > 网易号 > 正文 申请入驻

深度|CVPR 2026 Best Paper Finalist 全解析:15 篇入围之作,华人研究者几乎承包奖台

0
分享至


今年的 CVPR 在丹佛落幕,在已揭晓的奖项中,华人研究者拿下了 Best Paper 的第一作者席位,两篇 Honorable Mention 的核心作者群同样以华人为主体。 15 篇候选中,12 篇有华人研究者深度参与,华人作者总数超过 80 人。年度趋势有三个关键词:

3D 更易摘奖。从生成(TRELLIS.2)、重建(D4RT、VGGT-Ω)到数据集(3DReflecNet),再到通用分割(SAM 3D),3D 视觉已经占据了 CVPR 2026 最受关注的位置。Gaussian Splatting、前馈重建、4D 动态场景成为三条同时在奔跑的技术路线。

Diffusion 无处不在。生成模型的影响力早已溢出图像生成的狭义定义,它渗透进了散景渲染(MagicBokeh)、图像编辑(ChordEdit)、推理加速(SeaCache),乃至 3D 生成(TRELLIS.2)。本届 15 篇候选中,至少有 6 篇与 Diffusion 相关。

小团队仍有机会。Lord Sen 的 Mapping Networks 来自 NIT Rourkela——一所印度国家理工学院,作者只有两人,其中第一作者还是本科生。Liangsi Lu 的 ChordEdit 来自广东工业大学。这提醒我们 CVPR 的评审机制并未完全向资源优势机构倾斜,足够新颖且严谨的学术贡献依然可以脱颖而出。

D4RT 摘得 Best Paper:华人研究者在 3D/4D 视觉赛道集体爆

Best Paper D4RT 来自 Google Deepmind,DeepMind 官方博客将其定性为"让 AI 以四维方式认知世界的突破"。D4RT 的 一作 Chuhan Zhang 是 Google DeepMind 研究科学家,团队来自 Google DeepMind、UCL、牛津大学,华人作者还包括 Shuyang Sun、Junyu Xie(牛津实习生)、Junlin Zhang。

D4RT(Dynamic 4D Reconstruction and Tracking)的核心方法,是用一个统一的前馈 Transformer 模型,同时解决动态场景的深度估计、相机参数恢复与时空对应关系。三个过去被拆开处理的子任务,被整合进了一套端到端系统。

其关键创新在于 Independent Querying Mechanism:不同于传统的逐帧稠密解码方式,D4RT 让模型以任意时空点为 Query,灵活指出 3D 位置,从而规避了繁重的逐帧计算。相比此前最优方法,D4RT 推理速度快出 18 至 300 倍,在 TAPVid-3D 等多项基准上刷新纪录。


两篇 Honorable Mention 分别来自 Meta Superintelligence Labs 和 NVIDIA。

  • SAM 3D 来自 Meta Superintelligence Labs,由 Piotr Dollár、Georgia Gkioxari 和 Jitendra Malik 三位大牛领衔,AuthorList 读起来几乎就是 Meta AI 华人研究者的点名册:Xingyu Chen、Hao Tang、Weiyao Wang、Xiang Li、Aohan Lin、Jiawei Liu、Ziqi Ma、Bowen Song、Xiaodong Wang、Jianing Yang、Bowen Zhang、Fu-Jen Chu,12 人中大部分是华人,含多名来自中国顶校的实习生。人工在环的数据标注流水线 + 合成预训练与真实场景对齐的多阶段训练框架,让 SAM 3D 在真实世界物体 3D 重建的人类偏好测试中,以至少 5:1 的胜率超越近期工作。

  • NitroGen 的 Motivations 简单粗暴:互联网上堆积着数十亿小时的游戏录像,这些数据几乎没有被系统性利用。能不能像 GPT 学语言一样,让模型从游戏视频中学会玩游戏?NVIDIA 联合 Stanford、Caltech 给出了回答:40,000 小时的跨 1000+ 款游戏训练数据,一个统一的视觉—动作基础模型(Vision-Action Foundation Model),以及 52% 的迁移学习提升率。三位共同一作分别来自:NVIDIA 研究院的 Linxi Jim Fan(Caltech/NVIDIA)、斯坦福的 Anas Awadalla,以及来自 Caltech 的博士生 Guanzhi Wang——他同时也是 Voyager 和 MineDojo 的作者,是具身领域少有的、在多项代表性工作上持续贡献的年轻研究者。



02 华人研究者版图:海外科技公司与国内高校并行

以机构为统计口径,Meta AI 以 12+ 位华人作者高居榜首,SAM 3D 几乎是一个华人研究者的聚集工作。NVIDIA 以 8-9 人位列第二,横跨 PixelDiT(生成模型)和 NitroGen(具身智能)两个赛道。Google DeepMind 的 4 位华人作者贡献了今年的 Best Paper。Microsoft Research Asia 则通过 TRELLIS.2,展示了 MSRA 在 3D 生成方向持续深耕的成果。

在国内高校中,清华大学以约 9 名华人作者的参与体量高居首位,涉及 ViT³、TRELLIS.2 和 MIA 三篇工作,是贡献最多的单一中国高校。BUPT(北京邮电大学)以 7 人参与 MIA 一文,体现出其在 AI 安全方向的深厚积累。CUHK-Shenzhen(香港中文大学深圳校区)的 7 位华人作者全部集中在 3DReflecNet 这一工作上。

纯学术路径产出的作品往往有更扎实的理论基础:ViT³(清华)、TRELLIS.2(清华+MSRA)、3DReflecNet(CUHK-SZ)、MIA(BUPT+清华)均属此类。公司内研则更善于整合大规模计算资源和数据,三篇获奖作品(D4RT、SAM 3D、NitroGen)全部出自美国顶级科技公司内研团队。产学联合实习路径已成为重要的第三极:PixelDiT(UR 博士实习 NVIDIA)、TRELLIS.2(清华博士实习 MSRA)、MagicBokeh(SIAT 实习 vivo)均是在实习期间产出的顶会成果。


从三维世界建模到视觉智能体


Best Paper Finalists 现场公布图

每年 CVPR 的 Best Paper Finalists 都像是一张切片。它未必完整覆盖计算机视觉领域最热门的方向,却往往能够揭示研究界正在重新思考哪些基础问题。观察 CVPR 2026 的 15 篇 Best Paper Finalist,可以看到一个明显变化:视觉研究的关注点正在从单一任务的精度提升,转向更加完整的系统问题。这 15 篇论文大致可以归入四条主线:三维视觉与空间智能、生成模型的架构重构与推理加速、高效学习与评测反思,以及多模态 Agent。它们共同回答了一个更大的问题:当视觉模型已经拥有较强的感知与生成能力,下一步究竟应该向哪里演化。


3D 更易摘奖:视觉模型开始真正进入空间

15 篇候选论文中,有 5 篇直接围绕 3D 展开。无论从论文数量还是获奖结果来看,三维视觉都是今年最清晰的一条主线。这并不只是一次热点轮动,而是视觉模型能力边界的一次系统性扩展。过去的 3D 视觉更多被视为计算机视觉中的专门分支,研究者围绕深度估计、点云生成、多视角匹配和相机位姿展开工作。如今,3D 表示正在从任务输出变成基础能力。


D4RT Moedel Overview

D4RT 和 VGGT-Ω 所代表的前馈式重建路线,正在压缩传统三维视觉中冗长的处理链路。相机参数、深度、空间对应关系和动态轨迹,不再依赖多个模块逐步优化,而是可以在统一模型中直接预测。D4RT 进一步将问题推进到动态场景:模型不仅要恢复几何结构,还要理解物体如何随时间运动。静态重建回答的是物体在哪里,动态重建回答的是世界正在如何变化。对于机器人、自动驾驶、增强现实和世界模型而言,后一个问题显然更加接近真实需求。


TRELLIS.2项目介绍视频

SAM 3D 和 TRELLIS.2 则分别代表了三维视觉向通用化和生成式建模扩展的两种路径。SAM 3D 关注自然图像中的真实物体,需要处理遮挡、背景干扰、不可见表面和复杂布局。模型不仅要恢复可见几何,还要依赖大规模数据中学习到的先验补全缺失结构。TRELLIS.2 则将问题推进到更底层的表示空间:如果三维对象无法被稳定压缩、编辑和导出,再强的生成模型也难以真正落地。网格、体素、点云、隐式场和高斯基元各有优势,结构化潜空间的设计因此成为三维生成能否继续扩展的关键。

3DReflecNet 则把视线重新拉回真实世界。透明、反射和低纹理物体长期以来都是三维重建的薄弱环节。玻璃、镜面和金属表面会破坏光度一致性,纯色表面又缺少稳定特征。这些问题很难通过单纯扩大模型规模解决,必须依赖更具针对性的数据和评测体系。把这些论文放在一起,可以看到一条逐渐成形的技术栈:上游是复杂场景和真实数据,中间是结构化表示与规模扩展,下游是动态重建和可交互应用。三维视觉的终点已经不再是生成一张更加精细的点云,而是建立能够被智能体理解、预测和操作的空间表征。

Diffusion 无处不在:生成模型正在变成视觉基础设施

Diffusion 仍然是 CVPR 2026 最重要的技术关键词之一。但它的影响力已经溢出传统图像生成,开始进入三维资产建模、单步图像编辑、移动端散景渲染和推理链路优化。Diffusion 正在从一种特定模型,逐渐变成视觉系统中的通用计算框架。


PixelDiT生成图像示例

PixelDiT 重新打开了像素空间生成这条路线。当前主流生成模型通常依赖 VAE,先将图像压缩到潜空间,再完成去噪和解码。这样做可以降低计算成本,但也会引入细节损失和误差积累。PixelDiT 直接在像素空间建模,试图摆脱传统两阶段链路对图像质量的约束。SeaCache 则关注扩散模型的另一个核心问题:为什么推理仍然如此缓慢。逐步去噪意味着大量重复计算,不同时间步之间并非所有特征都需要重新生成。通过识别可以安全复用的中间表示,SeaCache 将注意力从重新训练模型转向更精细地优化现有推理链路。


ChordEdit编辑图像示例

ChordEdit 和 MagicBokeh 则展示了 Diffusion 在具体视觉任务中的外溢能力。ChordEdit 将图像编辑重新组织为低能量传输问题,希望在单步推理中同时保留原始结构和编辑效果。MagicBokeh面向移动计算摄影,将超分辨率、深度估计和散景渲染整合进统一框架。TRELLIS.2 进一步将这种影响延伸到三维生成,使扩散模型能够在更加紧凑的结构化潜空间中生成可用的三维资产。

这一组论文说明,生成模型研究已经进入更加成熟的阶段。下一步竞争的重点不再只是生成质量,而是整个系统是否足够直接、稳定、高效,并且能够嵌入真实应用。Diffusion 已经不再是一个独立赛道,而正在成为视觉基础设施。

高效学习:真正需要减少的是无效计算

除了 3D 和 Diffusion,今年还有一组候选论文值得单独讨论。它们没有共同使用某一种模型,却在回答同一个问题:视觉系统中究竟有多少计算是可以被省略的。

传统模型压缩通常围绕剪枝、量化、蒸馏和低秩分解展开。完整模型先被训练出来,再通过工程手段逐步缩小。NuWa、ViT³、Mapping Networks 和 Rethinking Dataset Distillation 则将问题向前推进了一步:模型从一开始是否就应该针对具体任务设计,推理过程中是否能够动态适应输入,权重空间能否被重新参数化,数据压缩的评测方式是否可靠。


NuWa模型结构图

NuWa的出发点非常现实。很多边缘设备并不需要识别所有类别。工业相机、无人机和车载模块往往只服务于有限任务。既然设备需求本身具有明确边界,就没有必要保留完整模型中的全部知识。ViT³ 重新划分了训练与推理的边界。传统视觉模型完成训练后,参数基本固定,而 Test-Time Training 允许模型根据当前输入进行轻量级适应。对于长序列和复杂上下文而言,这意味着模型不必提前存储所有可能用到的信息,而可以在现场更新内部状态。

Mapping Networks 从参数空间本身入手。它假设大型神经网络的有效参数空间可能位于低维流形附近。与其直接优化海量权重,不如训练一个更加紧凑的潜变量,再通过映射关系生成目标参数。Rethinking Dataset Distillation 则把矛头对准评测体系本身。数据集蒸馏希望使用极少量样本替代完整训练集,但如果软标签已经携带了大量监督信息,那么性能提升究竟来自数据选择,还是来自额外注入的知识,就必须重新拆解。

这组论文重新定义了效率。效率不只是让模型变小,也不只是让推理更快。它还包括移除与任务无关的知识、减少重复计算、压缩权重表达空间,以及检查评测协议中是否存在被忽略的信息泄漏。真正需要被压缩的,不只是参数,而是整个系统中的无效部分。

从感知到行动:视觉模型也需要接受审计

NitroGen 和 Black-box Membership Inference Attacks on the Pre-training Data of Image-generation Models 看起来属于完全不同的领域。一篇讨论通用游戏智能体,另一篇讨论生成模型的训练数据审计。但它们其实指向同一个变化:视觉模型正在从单一工具变成开放环境中的系统。


NitroGen模型结构

NitroGen 的逻辑并不复杂。互联网上已经积累了大量游戏视频,其中包含丰富的视觉信息和动作序列。这些数据过去主要服务于娱乐内容传播,很少被系统性用于训练通用智能体。当模型开始从跨游戏视频中学习视觉到动作的映射,游戏环境就不再只是 benchmark,而是智能体训练场。不同游戏具有不同画面风格、物理规则、动作空间和任务目标。一个能够在多种游戏之间迁移的模型,本质上是在学习更加通用的行为先验。这种路径对具身智能同样具有启发:真实机器人数据昂贵、稀缺,并且伴随设备成本和安全风险。虚拟环境无法替代真实世界,却可以为感知、控制和跨任务迁移提供规模更大的训练基础。

模型能力越强,审计问题就越重要。图像生成模型通常依赖大规模互联网数据训练。对于闭源平台而言,外部用户无法查看训练集,也无法访问内部参数。Black-box Membership Inference Attacks 研究的是一个非常现实的问题:在仅有黑盒调用权限的条件下,能否判断某张图像是否进入过模型预训练数据。这类研究不只是为了发现漏洞,也关系到版权保护、隐私治理和训练数据追踪。

未来的视觉基础模型需要同时接受两类评价。一类评价模型是否足够强,包括生成质量、三维理解、推理效率和动作能力;另一类评价模型是否足够可信,包括数据来源、版权边界、隐私风险和外部可验证性。视觉模型正在走向行动,也正在走向审计。回看今年的三篇获奖工作,D4RT、SAM 3D 和 NitroGen 分别落在动态空间建模、真实世界三维重建和通用视觉动作模型上。它们并不是孤立的例外,而是恰好对应了同一条演进路径。计算机视觉正在从完成单一任务的算法,逐渐演变为能够感知、生成、行动和接受审计的系统。


Best Paper Finalists 研究方向

CVPR 2026 的奖台上,没有一篇工作是靠堆参数或刷榜取胜的。Best Paper D4RT 赢在了对问题本质的重新定义;SAM 3D 赢在了数据规模与训练范式的双重突破;NitroGen 赢在了将具身智能与互联网规模数据结合的正确时机。而贯穿这一切的,是华人研究者在计算机视觉领域无处不在的身影。

本报告基于 15 篇 Best paper list、CVPR 2026 官网、OpenReview、Google Scholar 及全网公开信息整理,部分数据为估算,如有出入欢迎指正。

加入ZF讨论群,请先添加小助手微信

我们相信认知能够跨越阶层,

致力于为年轻人提供高质量的科技和财经内容。

稿件经采用可获邀进入Z Finance内部社群,优秀者将成为签约作者,00后更有机会成为Z Finance的早期共创成员。

我们正在招募新一期的实习生

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
胡军全家看秀,穿得一样年纪?胡军儿子比爹稳重,女儿比妈还像妈

胡军全家看秀,穿得一样年纪?胡军儿子比爹稳重,女儿比妈还像妈

八卦宝宝
2026-09-24 00:40:17
用了几个月突然变砖!二手电脑更新系统后被锁死:重装系统也没用

用了几个月突然变砖!二手电脑更新系统后被锁死:重装系统也没用

快科技
2026-09-22 14:41:36
央国企摸底55岁在岗职工,内退重新启动,和过去老模式差别很大

央国企摸底55岁在岗职工,内退重新启动,和过去老模式差别很大

职场资深秘书
2026-09-24 17:13:30
《兰香如故》王氏认怂!直到兰香当家,才懂她服气背后的心酸

《兰香如故》王氏认怂!直到兰香当家,才懂她服气背后的心酸

丁隗解说
2026-09-23 17:25:50
缺少头号射手!国足重庆周日迎战新西兰,这场才是真正大考验

缺少头号射手!国足重庆周日迎战新西兰,这场才是真正大考验

谭颞爱搞笑
2026-09-25 08:38:53
恭喜!韩娱最高龄产妇诞下一子!

恭喜!韩娱最高龄产妇诞下一子!

奋斗在韩国
2026-09-24 16:57:14
美国代表拒绝伊朗的报价,理由很干脆,霍尔木兹海峡控制权易手

美国代表拒绝伊朗的报价,理由很干脆,霍尔木兹海峡控制权易手

史料布籍
2026-09-24 20:44:12
“电车不保值”的时代,被一款中国车终结了

“电车不保值”的时代,被一款中国车终结了

财经无忌
2026-09-23 17:13:22
吃大补的东西身体会有什么反应?

吃大补的东西身体会有什么反应?

康富贵碎碎念
2026-09-22 11:48:26
图恩放话:就算丢了参议院多数,我也要再干一届

图恩放话:就算丢了参议院多数,我也要再干一届

碳基打工人
2026-09-24 07:42:31
李在赣神魔?阿德耶米面对大半个空门将球打飞惊呆克洛普

李在赣神魔?阿德耶米面对大半个空门将球打飞惊呆克洛普

懂球帝
2026-09-25 03:50:10
日本前首相鸠山由纪夫公开告诫高市,中国当年放弃巨额战争赔款,附带明确的条件,相关内容早已落实在书面文件,不可肆意违背过往承诺

日本前首相鸠山由纪夫公开告诫高市,中国当年放弃巨额战争赔款,附带明确的条件,相关内容早已落实在书面文件,不可肆意违背过往承诺

唠叨说历史
2026-09-02 16:16:45
男子100米预赛谢震业10秒30曾克理10秒22 泰国飞人汶颂飙出9秒95

男子100米预赛谢震业10秒30曾克理10秒22 泰国飞人汶颂飙出9秒95

劲爆体坛
2026-09-24 20:31:02
现场画面!白宫举行隆重仪式迎接中国国家主席

现场画面!白宫举行隆重仪式迎接中国国家主席

看看新闻Knews
2026-09-24 23:44:05
王健林已经惨到什么程度了?

王健林已经惨到什么程度了?

叶葉夜
2026-08-11 23:30:32
柬埔寨破获特大毒品枪支案,7名中国人落网,有人身上纹龙画虎,缴获840公斤毒品、49支长短枪及近8000发子弹

柬埔寨破获特大毒品枪支案,7名中国人落网,有人身上纹龙画虎,缴获840公斤毒品、49支长短枪及近8000发子弹

扬子晚报
2026-09-24 12:20:02
密密麻麻!33岁女子体内取出197枚,医生:从医以来第一次见

密密麻麻!33岁女子体内取出197枚,医生:从医以来第一次见

上海约饭局
2026-09-19 10:42:08
倘若西安事变中,张学良真把蒋介石枪决了,1936年的中国恐怕连1937年都撑不过去

倘若西安事变中,张学良真把蒋介石枪决了,1936年的中国恐怕连1937年都撑不过去

人生录
2026-09-22 10:58:44
民众呼吁“取消养老特权”!71岁专家引发争议,养老差距真相大白

民众呼吁“取消养老特权”!71岁专家引发争议,养老差距真相大白

百科密码
2026-08-31 10:02:15
闲鱼上的ChatGPT代充暗号,已经进化到我看不懂的程度了。

闲鱼上的ChatGPT代充暗号,已经进化到我看不懂的程度了。

数字生命卡兹克
2026-09-24 08:48:22
2026-09-25 09:28:49
ZFinance
ZFinance
Z世代的一站式AI、科技和财经资讯
275文章数 22关注度
往期回顾 全部

科技要闻

DeepSeek涨价后客户没少 年化收入10亿美元

头条要闻

王皓回应国乒男团决赛的失利:年轻队员需要成长空间

头条要闻

王皓回应国乒男团决赛的失利:年轻队员需要成长空间

体育要闻

巴图姆,以父之名

娱乐要闻

93岁游本昌去世 最后一句话惹人泪目

财经要闻

月饼卖不动了...

汽车要闻

全新第四代博越L 上市限时价9.29万元起

态度原创

艺术
数码
教育
公开课
军事航空

艺术要闻

阿齐兹·苏莱曼诺夫 2026年油画新作

数码要闻

105元拿下三刀头!米家电动剃须刀S101云纹刀网版上新

教育要闻

德国竞赛题:看似送分题,出错太多了

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

韩国首架“准隐身”战斗机正式入列

无障碍浏览 进入关怀版