网易首页 > 网易号 > 正文 申请入驻

浙大 × 字节 × 港中深最新研究:告别高斯堆砌,终结 3D 冗余|ECCV 2026

0
分享至


为什么字节要把“空间表示”的体积压掉 90%?

作者丨吴思梦

编辑丨岑 峰

如果有一天,沉浸式直播里的每一个主播都拥有一个实时跟随的 3D 分身,观众可以在任何角度切进去和他对话,看到他的表情、衣服褶皱、头发飘动的细节,那么这个 3D 分身究竟应该有多大?

这不是一个凌空蹈虚的问题,已经逐渐落定变成一个非常具体的工程问题。

过去几年,3D Gaussian Splatting(3DGS)让“从一堆照片里恢复出可以实时渲染的 3D 场景”这件事,第一次变得既真实又快速。今天的 AI 已经非常擅长从多视角图像中重建 3D 世界,而且这个世界的视觉质量已经接近照片级。


3D Gaussian Splatting 从多视角图像重建场景,并支持新视角合成。

图源:Kerbl et al., SIGGRAPH 2023

最直接的例子就是3DGaussian Splatting(3DGS)本身。2023 年的原始论文就是从多张带相机位姿的照片/视频中建立一个 3D Gaussian 表示,然后从没有真正拍摄过的视角渲染新画面。论文的核心贡献之一,就是同时做到高视觉质量和实时渲染。

你可以把它想象成这样:

你拿着手机围着一个房间拍了一圈照片。AI并没有把这些照片简单拼起来,而是从它们之间的关系推断出一个三维表示。然后你把“虚拟摄像机”放到原来没有拍过的位置,AI依然可以给你渲染出一张看起来像真实照片的画面。

这就叫Novel View Synthesis,新视角合


但接下来发生的事情,把这个能力推到了另一个问题面前。

当 3D 不再只是离线建模出来的城市或物体,而是要实时地跟着一个人跑、跟着一个房间转、跟着一次直播传输给成千上万的设备时,问题就从“AI 能不能生成一个 3D 世界”落到了另一个更为朴素的问题:这个 3D 世界,能不能装得下、传得动、跑得起来?

在 ECCV 2026,浙江大学、字节跳动与香港中文大学(深圳)团队的PointSplat被收录为会议论文,聚焦面向人体的紧凑型 Gaussian Splatting,正是从这个问题出发的。


论文给它的定位写得很克制:让 3D 人体表示(3D human representations)变得更加紧凑,目标场景是沉浸式直播(immersive live streaming)。它没有声称要解决“所有 3D 表示的存储危机”,但它指出了一个更普遍的方向。

当 3D 开始成为 AI 理解和生成现实世界的重要表示,“表示本身的紧凑性”会变成一个绕不过去的问题。

01


高斯的代价:越真实,就越重

要理解 PointSplat 在做什么,必须先理解 3DGS 在做什么。

3DGS 的基本想法是把一个 3D 场景拆成大量“高斯椭球”。每一个高斯都记录着自己的位置、尺度、旋转方向、透明度,以及外观信息。成千上万、几十万个这样的高斯一起渲染,就构成了一个看起来真实的 3D 世界。

这种表示有三个非常突出的优点:真实、可渲染、速度快。 它让神经辐射场(NeRF)时代的“高质量但慢”第一次变成了“高质量且实时”。

但它也带来了一个非常直接的代价。

高斯数量越多,显存占用越大,计算开销越高,存储体积越大,传输带宽要求也越严格。当场景从一栋楼变成一个城市,从一个静物变成一个需要实时跟着动的人,这些成本都会被迅速放大。


图片来源:Papantonakis et al., I3D 2024

于是过去几年里,3D 研究里出现了两股并行的力量。

一股继续在追问“如何更高质量地还原世界”,即更清晰的几何、更逼真的光影、更稳定的视角一致性。另一股则开始追问另一个看起来没那么性感、但迫在眉睫的问题: 能不能用更少的 3D primitives,表达同样的世界?

PointSplat 属于后者,但它走了一条和“剪枝”“压缩”“量化”都不太一样的路。它不是在已经生成好的高斯上做减法,而是想从一开始,就少生成一些。

02


从视角中心,

到“围绕一个人只建一次”

过去一段时间里,一种非常流行的做法是 view-centric(以视角为中心) 的 3DGS 预测。它的逻辑非常直觉化:给定一张图像,模型预测出一批高斯;换一个视角,再预测一批;多视角的高斯融合在一起,组成并呈现最终的 3D 表示。

这种做法的好处是模块清晰、训练稳定。

但它有一个非常隐蔽的问题。 同一个人,明明只有一个身体。 然而在 view-centric 框架下,每一个视角都被要求“独立地”预测一遍这个人的高斯。这意味着:肩膀被编码了一次,侧面被编码了一次,背后又被编码了一次;同一个主体的几何和外观信息,被不同视角的模型反复存了好几份。

论文里把这个现象叫做 inter-view redundancy,跨视角冗余。

这是 PointSplat 真正想解决的事情。它不是来单纯地“压一压”高斯的,而是来改变“高斯到底是怎么被预测出来的”这件事。 它的核心思路可以浓缩成一句话:从 view-centric 转向 human-centric(以人为中心)。


图源:Guo et al., ECCV 2026

具体怎么做,可以拆成三个步骤。

第一步,模型不再急于从图像里直接吐高斯。它会先估一个非常粗的、围绕这个人的几何 proxy(代理体),相当于一个非常粗糙的“人体在哪、长什么样”的空间轮廓。

第二步,基于这个 proxy 做 ray casting(光线投射)从每个相机视角投出射线,打到 proxy 上,把那些根本不在人体上、或者从当前视角看不到的 3D 点直接筛掉。这一步的目的不是“重建精细几何”,而是“提前把没用的点排除掉”。

第三步,模型拿到这个筛过的、共享的 3D 点集,再用 Point-Image Transformer 把多视角的几何信息和外观信息融合起来,直接预测 Gaussian attributes,也就是每一个高斯最终的位置、尺度、旋转、透明度和外观。

整个流程的关键变化在于:预测的空间变了。


图源:Guo et al., ECCV 2026

原来是“图像 → 像素 → 高斯”,每一个视角都各自为政。现在变成了“多视角图像 → 一个共享的 3D 点集 → 高斯”,所有视角共同服务于同一个 3D 表示。

用一句更接近直觉的话讲: 问题不一定是 3D 世界里有太多东西,而是 AI 可能把同一个东西看了几遍,就存了几遍。

这句话大概是理解 PointSplat 最重要的钥匙。它把“压缩”这个听起来像是工程优化的词,重新拉回到了一个更本质的问题——3D 表示到底应该以什么为单位来组织?

如果未来 3D 表示要成为 AI 的基础设施,那它组织的单位,很可能不再是“视角”,也不再是“高斯的数量”,而是被表示的那个主体本身。

03


一项工作与一个方向:

3DGS 的范式迁移

如果只看 PointSplat 这一篇论文,很容易把它当成一次“压缩算法的工程改进”。但如果把它放进 3DGS 整个技术演进的时间线里,会看到一个更有意思的趋势。

过去几年里,3DGS 的主流使用方式是 per-scene optimization(单场景优化)。也就是说,对每一个场景、每一段视频、每一组照片,都要单独跑一遍优化流程,最终才能得到一份高斯表示。这种方式质量很好,但代价是“一个场景训练一次”,难以泛化,也很难实时。

而 PointSplat 走的是另一条路:feed-forward reconstruction framework(前馈式重建框架)。给定稀疏的多视角图像,模型不需要为这一组输入专门训练,而是直接预测出一份紧凑的 Gaussian representation。

这件事的意义不在于“它比单场景优化快了”,而在于它代表了一个方向的转向。 过去的范式是“拍照片 → 单场景优化 → 得到 3DGS”。 现在的范式开始变成“多视角输入 → 模型直接预测 → 得到 3D 表示”。

用更直白的话讲:3DGS 正在从一种“场景级别的优化结果”,变成一种“模型级别的生成能力”。 这是一个非常关键的差别。

前者意味着每个场景都是孤岛,要重建就要重新算一遍。 后者意味着模型学会了“如何从图像里读出 3D”,这件事可以泛化到新的主体、新的视角、新的设备。 而 PointSplat 在这个转向里,又叠加了一层自己的判断:即便模型已经可以前馈式预测 3D 了,预测的方式也要从 view-centric 改成 human-centric,否则跨视角冗余会白白吃掉大量的表示空间。

把这两件事合在一起看,能看到一条线:

per-scene optimization → feed-forward prediction → human-centric / subject-centric prediction

3D 表示正在从“每个场景算一遍”慢慢走向“模型学会如何表示 3D”,而 PointSplat 是这条线上一个非常具体的、针对人体的回答。

这也是为什么这次工作的署名名单值得单独看一眼。

浙大这边,是长期深耕 3D 视觉、计算机图形学和几何方向的团队,包括 Hujun Bao、Sida Peng、Xiaowei Zhou 等研究者,他们在 3DGS、可微渲染、点云学习这一串技术栈上有非常深的积累。

字节跳动这边,Jing Zhang、Xianchao Shen 等作者参与了这篇工作,但公开材料里并没有给出明确的业务部署信息。我们可以合理地把字节的参与理解为它在 3D / 数字人 / 直播相关技术上的投入。

港中大(深圳)的 Lingteng Qiu 同样参与其中,这也是港中深近年来在图形学、3D 视觉方向上比较活跃的一个侧写。

需要诚实地说一句:三方在这篇工作里共同瞄准的,是论文里写得很清楚的那个应用场景——immersive live streaming(沉浸式直播)。至于未来这套方法能不能走进数字人、VR/AR、远程交互、空间智能,仍然是值得讨论的产业想象。

04


更轻的表示:3D 的未竟之问

如果把视角再拉长远一点,会发现 PointSplat 其实不只是关于“压缩了多少高斯”。

它指向的是一个更普遍的问题:当 3D 表示开始成为 AI 基础设施的一部分,它应该用什么样的方式存在? 3DGS 的第一个阶段解决的是“如何让机器快速生成一个看起来真实的 3D 世界”。这件事已经基本完成了。从几张照片到一个可以实时渲染的场景,从静物到城市,从离线到准实时。

但 AI 不只是需要“看见”世界。它还需要保存、传输、理解和生成世界。 这就意味着,3D 表示开始同时面对一组相互拉扯的指标:

• 质量:看起来够不够真。

• 数量:能不能表示足够复杂的世界。

• 计算:能不能在普通设备上跑得动。

• 传输:能不能在合理带宽下流动。

• 泛化:能不能不靠每个场景单独训练。

过去这些指标往往是分别被讨论的。PointSplat 把其中的“紧凑性”和“泛化能力”绑在了一起——通过 human-centric 的预测方式,让同一组多视角输入生成的 Gaussian 表示既更小,又更集中于真正的主体。

而这,只是其中一个非常具体的问题。围绕“3D 表示到底应该长什么样”,正在形成一个越来越密集的研究和工程地带。

沿着这条线再往前想一步,会发现一个更大的画面正在浮现:图像曾经是互联网的“通用语言”,视频是它的延伸。今天,文本和图像是大型模型训练和推理的主要载体。

而 3D 表示,无论是高斯、点云、网格、还是它们的混合体,都很可能正在成为下一阶段 AI 基础设施的一部分。

到那个时候,问题就不只是“AI 能不能生成 3D”。

或许是“AI 究竟应该用什么方式,保存一个世界”。 PointSplat 没有回答这个问题,它只是把这个问题从一个抽象的担忧,变成了一个具体可做的工程方向。它也没有改变 3D 产业,更没有让“3D 危机”被某个中国团队一夜解决。


PointSplat 与其他方法的新视角合成结果对比

图源:Guo et al., ECCV 2026

但它做对了一件事,它在所有人都还在卷“更真实”的时候,提前问了一句“够不够轻”。 而当 3D 真的开始进入直播、进入数字人、进入机器人和空间智能,这句话很可能会被反复提起。

05


最后

3DGS 把世界变成了可以实时渲染的高斯。PointSplat 进一步追问:如果这个世界真的要被大规模传输、理解和交互,它能不能更轻一点?

这个问题其实提前触碰到了 3D 表示的下一阶段:当画质和渲染速度逐渐逼近瓶颈,竞争的焦点也会从“把世界还原得多逼真”,转向“如何用更少、更合理的表示,把一个 3D 世界组织起来”。

而在这场竞赛刚刚开始的时候,中国的研究力量已经站在了一个非常具体的位置上,用一篇 ECCV 2026 的正会论文,认真回答一个工程上绕不开的小问题。

小问题,往往才是大趋势真正开始的地方。

论文链接:https://arxiv.org/abs/2606.32036?utm_source

为了方便大家抱团交流、互通会议消息,我们专门建了ECCV 2026参会交流群!进群你会解锁这些「福利」

  • 会议情报站投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航场馆分布、报告厅怎么走,群里随时问;

    议题共读热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编现场海报精华整理,一键收藏不遗漏;

    约局广场约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

进群传送门:扫码进群或添加微信Qvv0909777,备注:ECCV + 单位/学校+姓名+方向。

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
亚运会乒乓球:日本2大世界冠军被淘汰!伊藤0:3,林诗栋蒯曼晋级

亚运会乒乓球:日本2大世界冠军被淘汰!伊藤0:3,林诗栋蒯曼晋级

国乒二三事
2026-09-23 13:29:19
专访|吴心伯:中美元首再会晤“承上启下”,推动两国关系稳中有进

专访|吴心伯:中美元首再会晤“承上启下”,推动两国关系稳中有进

澎湃新闻
2026-09-23 07:22:28
如今的中国底层,正出现一个超大规模的赌场?

如今的中国底层,正出现一个超大规模的赌场?

游文刀
2026-09-22 21:37:08
随着伊朗1-4、中国0-0,亚运男足八强已全部诞生:6大劲旅在列

随着伊朗1-4、中国0-0,亚运男足八强已全部诞生:6大劲旅在列

侧身凌空斩
2026-09-23 15:26:24
问界运营模式“调整”后,首位车企高层公开拜访华为任正非

问界运营模式“调整”后,首位车企高层公开拜访华为任正非

每日经济新闻
2026-09-23 17:21:03
太讽刺了!自己支持率跌到32%,却平均每天点名拜登3次,特朗普的"甩锅账本"被扒光

太讽刺了!自己支持率跌到32%,却平均每天点名拜登3次,特朗普的"甩锅账本"被扒光

可达鸭面面观
2026-09-22 20:05:12
演员黄渤发生意外

演员黄渤发生意外

品读时刻
2026-09-23 09:07:48
第4金!亚运会男子200自决赛:张展硕1分43秒49破亚洲纪录夺冠

第4金!亚运会男子200自决赛:张展硕1分43秒49破亚洲纪录夺冠

全景体育V
2026-09-23 16:35:38
日本爱知·名古屋亚运会的办赛方式正是大部分国人梦寐以求的......

日本爱知·名古屋亚运会的办赛方式正是大部分国人梦寐以求的......

细雨中的呼喊
2026-09-23 15:23:55
杨利伟含泪宣布!首批14名航天员停训停航,5人一辈子没等来火箭

杨利伟含泪宣布!首批14名航天员停训停航,5人一辈子没等来火箭

李博世财经
2026-09-23 09:54:37
不愿回国!两名朝鲜亚运代表团成员,希望留在日本寻求庇护

不愿回国!两名朝鲜亚运代表团成员,希望留在日本寻求庇护

全景体育V
2026-09-22 19:39:04
涉黑头目黄大发案二审维持原判:判处死刑立即执行;其控制近十个乡村,违法揽地从中渔利,侵占农民私有土地,霸占民宅,或涉暴力强拆事件

涉黑头目黄大发案二审维持原判:判处死刑立即执行;其控制近十个乡村,违法揽地从中渔利,侵占农民私有土地,霸占民宅,或涉暴力强拆事件

台州交通广播
2026-09-23 13:17:39
亚运女子游泳金牌全被中国选手拿下,仅剩一个项目日本选手能争金

亚运女子游泳金牌全被中国选手拿下,仅剩一个项目日本选手能争金

体娱一家亲
2026-09-23 17:53:27
补时连续废人动作!央视名嘴怒斥阿联酋队:想格斗别报错亚运项目

补时连续废人动作!央视名嘴怒斥阿联酋队:想格斗别报错亚运项目

我爱英超
2026-09-23 16:16:17
西贝餐厅风波再升级!官媒下场锐评,字字严厉,戳进罗永浩心窝

西贝餐厅风波再升级!官媒下场锐评,字字严厉,戳进罗永浩心窝

知法而形
2026-09-23 11:54:37
时隔60年再入亚运决赛!日乒男团3-0韩国 松岛张本户上都在进步

时隔60年再入亚运决赛!日乒男团3-0韩国 松岛张本户上都在进步

颜小白的篮球梦
2026-09-23 18:09:32
已击毙!伊朗军方宣布重大战果!

已击毙!伊朗军方宣布重大战果!

故事终将光明磊落
2026-09-21 19:03:25
台湾网红“馆长”在直播中表示,未来将不再组织赴大陆的活动,因为来一次亏一次,高昂的成本实在烧不起

台湾网红“馆长”在直播中表示,未来将不再组织赴大陆的活动,因为来一次亏一次,高昂的成本实在烧不起

人生录
2026-09-21 16:43:29
维尼修斯状态断崖下滑!皇马高层一头雾水,找不到维尼修斯低迷根源,迪奥曼德成左路替代人选

维尼修斯状态断崖下滑!皇马高层一头雾水,找不到维尼修斯低迷根源,迪奥曼德成左路替代人选

福酱的小时光
2026-09-23 17:20:33
17000名员工失业的饭碗谁来担?罗永浩回应了:你老板让人看得,顺便回应了“罗太君”的外号

17000名员工失业的饭碗谁来担?罗永浩回应了:你老板让人看得,顺便回应了“罗太君”的外号

王老师你还好吗
2026-09-23 06:36:55
2026-09-23 20:47:00
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7669文章数 20785关注度
往期回顾 全部

科技要闻

一夜三款新模型,AI价格战再升级

头条要闻

网友发帖称上海一家餐厅点9瓶矿泉水收621元 店员回应

头条要闻

网友发帖称上海一家餐厅点9瓶矿泉水收621元 店员回应

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

性能与实用兼得 全新奥迪S5 Avant上市 57.18万元

态度原创

本地
教育
手机
数码
旅游

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

教育要闻

拯救躺平的孩子有个最简单办法:把他当“狗”养!

手机要闻

小米18 Pro Max手机发布:首发第六代骁龙8超级至尊版,6999元起

数码要闻

国补3299元起 Xiaomi Pad 9 Pro发布:12.5英寸高分高刷护眼屏

旅游要闻

秀我中国|层林尽染 二龙山农场尽展好风光

无障碍浏览 进入关怀版