AI科技评论 1小时前
浙大× 字节 × 港中深最新研究:告别高斯堆砌,终结 3D 冗余
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

为什么字节要把 " 空间表示 " 的体积压掉 90%?

作者丨吴思梦

编辑丨岑 峰

如果有一天,沉浸式直播里的每一个主播都拥有一个实时跟随的 3D 分身,观众可以在任何角度切进去和他对话,看到他的表情、衣服褶皱、头发飘动的细节,那么这个 3D 分身究竟应该有多大?

这不是一个凌空蹈虚的问题,已经逐渐落定变成一个非常具体的工程问题。

过去几年,3D Gaussian Splatting(3DGS)让 " 从一堆照片里恢复出可以实时渲染的 3D 场景 " 这件事,第一次变得既真实又快速。今天的 AI 已经非常擅长从多视角图像中重建 3D 世界,而且这个世界的视觉质量已经接近照片级。

3D Gaussian Splatting 从多视角图像重建场景,并支持新视角合成。

图源:Kerbl et al., SIGGRAPH 2023

最直接的例子就是3DGaussian Splatting(3DGS)本身。2023 年的原始论文就是从多张带相机位姿的照片 / 视频中建立一个 3D Gaussian 表示,然后从没有真正拍摄过的视角渲染新画面。论文的核心贡献之一,就是同时做到高视觉质量和实时渲染。

你可以把它想象成这样:

你拿着手机围着一个房间拍了一圈照片。AI 并没有把这些照片简单拼起来,而是从它们之间的关系推断出一个三维表示。然后你把 " 虚拟摄像机 " 放到原来没有拍过的位置,AI 依然可以给你渲染出一张看起来像真实照片的画面。

这就叫Novel View Synthesis,新视角合

但接下来发生的事情,把这个能力推到了另一个问题面前。

当 3D 不再只是离线建模出来的城市或物体,而是要实时地跟着一个人跑、跟着一个房间转、跟着一次直播传输给成千上万的设备时,问题就从 "AI 能不能生成一个 3D 世界 " 落到了另一个更为朴素的问题:这个 3D 世界,能不能装得下、传得动、跑得起来?

在 ECCV 2026,浙江大学、字节跳动与香港中文大学(深圳)团队的PointSplat被收录为会议论文,聚焦面向人体的紧凑型 Gaussian Splatting,正是从这个问题出发的。

论文给它的定位写得很克制:让 3D 人体表示(3D human representations)变得更加紧凑,目标场景是沉浸式直播(immersive live streaming)。它没有声称要解决 " 所有 3D 表示的存储危机 ",但它指出了一个更普遍的方向。

当 3D 开始成为 AI 理解和生成现实世界的重要表示," 表示本身的紧凑性 " 会变成一个绕不过去的问题。

01

高斯的代价:越真实,就越重

要理解 PointSplat 在做什么,必须先理解 3DGS 在做什么。

3DGS 的基本想法是把一个 3D 场景拆成大量 " 高斯椭球 "。每一个高斯都记录着自己的位置、尺度、旋转方向、透明度,以及外观信息。成千上万、几十万个这样的高斯一起渲染,就构成了一个看起来真实的 3D 世界。

这种表示有三个非常突出的优点:真实、可渲染、速度快。 它让神经辐射场(NeRF)时代的 " 高质量但慢 " 第一次变成了 " 高质量且实时 "。

但它也带来了一个非常直接的代价。

高斯数量越多,显存占用越大,计算开销越高,存储体积越大,传输带宽要求也越严格。当场景从一栋楼变成一个城市,从一个静物变成一个需要实时跟着动的人,这些成本都会被迅速放大。

图片来源:Papantonakis et al., I3D 2024

于是过去几年里,3D 研究里出现了两股并行的力量。

一股继续在追问 " 如何更高质量地还原世界 ",即更清晰的几何、更逼真的光影、更稳定的视角一致性。另一股则开始追问另一个看起来没那么性感、但迫在眉睫的问题: 能不能用更少的 3D primitives,表达同样的世界?

PointSplat 属于后者,但它走了一条和 " 剪枝 "" 压缩 "" 量化 " 都不太一样的路。它不是在已经生成好的高斯上做减法,而是想从一开始,就少生成一些。

02

从视角中心,

到 " 围绕一个人只建一次 "

过去一段时间里,一种非常流行的做法是 view-centric(以视角为中心) 的 3DGS 预测。它的逻辑非常直觉化:给定一张图像,模型预测出一批高斯;换一个视角,再预测一批;多视角的高斯融合在一起,组成并呈现最终的 3D 表示。

这种做法的好处是模块清晰、训练稳定。

但它有一个非常隐蔽的问题。 同一个人,明明只有一个身体。 然而在 view-centric 框架下,每一个视角都被要求 " 独立地 " 预测一遍这个人的高斯。这意味着:肩膀被编码了一次,侧面被编码了一次,背后又被编码了一次;同一个主体的几何和外观信息,被不同视角的模型反复存了好几份。

论文里把这个现象叫做 inter-view redundancy,跨视角冗余。

这是 PointSplat 真正想解决的事情。它不是来单纯地 " 压一压 " 高斯的,而是来改变 " 高斯到底是怎么被预测出来的 " 这件事。 它的核心思路可以浓缩成一句话:从 view-centric 转向 human-centric(以人为中心)。

图源:Guo et al., ECCV 2026

具体怎么做,可以拆成三个步骤。

第一步,模型不再急于从图像里直接吐高斯。它会先估一个非常粗的、围绕这个人的几何 proxy(代理体),相当于一个非常粗糙的 " 人体在哪、长什么样 " 的空间轮廓。

第二步,基于这个 proxy 做 ray casting(光线投射)从每个相机视角投出射线,打到 proxy 上,把那些根本不在人体上、或者从当前视角看不到的 3D 点直接筛掉。这一步的目的不是 " 重建精细几何 ",而是 " 提前把没用的点排除掉 "。

第三步,模型拿到这个筛过的、共享的 3D 点集,再用 Point-Image Transformer 把多视角的几何信息和外观信息融合起来,直接预测 Gaussian attributes,也就是每一个高斯最终的位置、尺度、旋转、透明度和外观。

整个流程的关键变化在于:预测的空间变了。

原来是 " 图像 → 像素 → 高斯 ",每一个视角都各自为政。现在变成了 " 多视角图像 → 一个共享的 3D 点集 → 高斯 ",所有视角共同服务于同一个 3D 表示。

用一句更接近直觉的话讲: 问题不一定是 3D 世界里有太多东西,而是 AI 可能把同一个东西看了几遍,就存了几遍。

这句话大概是理解 PointSplat 最重要的钥匙。它把 " 压缩 " 这个听起来像是工程优化的词,重新拉回到了一个更本质的问题—— 3D 表示到底应该以什么为单位来组织?

如果未来 3D 表示要成为 AI 的基础设施,那它组织的单位,很可能不再是 " 视角 ",也不再是 " 高斯的数量 ",而是被表示的那个主体本身。

03

一项工作与一个方向:

3DGS 的范式迁移

如果只看 PointSplat 这一篇论文,很容易把它当成一次 " 压缩算法的工程改进 "。但如果把它放进 3DGS 整个技术演进的时间线里,会看到一个更有意思的趋势。

过去几年里,3DGS 的主流使用方式是 per-scene optimization(单场景优化)。也就是说,对每一个场景、每一段视频、每一组照片,都要单独跑一遍优化流程,最终才能得到一份高斯表示。这种方式质量很好,但代价是 " 一个场景训练一次 ",难以泛化,也很难实时。

而 PointSplat 走的是另一条路:feed-forward reconstruction framework(前馈式重建框架)。给定稀疏的多视角图像,模型不需要为这一组输入专门训练,而是直接预测出一份紧凑的 Gaussian representation。

这件事的意义不在于 " 它比单场景优化快了 ",而在于它代表了一个方向的转向。 过去的范式是 " 拍照片 → 单场景优化 → 得到 3DGS"。 现在的范式开始变成 " 多视角输入 → 模型直接预测 → 得到 3D 表示 "。

用更直白的话讲:3DGS 正在从一种 " 场景级别的优化结果 ",变成一种 " 模型级别的生成能力 "。 这是一个非常关键的差别。

前者意味着每个场景都是孤岛,要重建就要重新算一遍。 后者意味着模型学会了 " 如何从图像里读出 3D",这件事可以泛化到新的主体、新的视角、新的设备。 而 PointSplat 在这个转向里,又叠加了一层自己的判断:即便模型已经可以前馈式预测 3D 了,预测的方式也要从 view-centric 改成 human-centric,否则跨视角冗余会白白吃掉大量的表示空间。

把这两件事合在一起看,能看到一条线:

per-scene optimization → feed-forward prediction → human-centric / subject-centric prediction

3D 表示正在从 " 每个场景算一遍 " 慢慢走向 " 模型学会如何表示 3D",而 PointSplat 是这条线上一个非常具体的、针对人体的回答。

这也是为什么这次工作的署名名单值得单独看一眼。

浙大这边,是长期深耕 3D 视觉、计算机图形学和几何方向的团队,包括 Hujun Bao、Sida Peng、Xiaowei Zhou 等研究者,他们在 3DGS、可微渲染、点云学习这一串技术栈上有非常深的积累。

字节跳动这边,Jing Zhang、Xianchao Shen 等作者参与了这篇工作,但公开材料里并没有给出明确的业务部署信息。我们可以合理地把字节的参与理解为它在 3D / 数字人 / 直播相关技术上的投入。

港中大(深圳)的 Lingteng Qiu 同样参与其中,这也是港中深近年来在图形学、3D 视觉方向上比较活跃的一个侧写。

需要诚实地说一句:三方在这篇工作里共同瞄准的,是论文里写得很清楚的那个应用场景—— immersive live streaming(沉浸式直播)。至于未来这套方法能不能走进数字人、VR/AR、远程交互、空间智能,仍然是值得讨论的产业想象。

04

更轻的表示:3D 的未竟之问

如果把视角再拉长远一点,会发现 PointSplat 其实不只是关于 " 压缩了多少高斯 "。

它指向的是一个更普遍的问题:当 3D 表示开始成为 AI 基础设施的一部分,它应该用什么样的方式存在? 3DGS 的第一个阶段解决的是 " 如何让机器快速生成一个看起来真实的 3D 世界 "。这件事已经基本完成了。从几张照片到一个可以实时渲染的场景,从静物到城市,从离线到准实时。

但 AI 不只是需要 " 看见 " 世界。它还需要保存、传输、理解和生成世界。 这就意味着,3D 表示开始同时面对一组相互拉扯的指标:

• 质量:看起来够不够真。

• 数量:能不能表示足够复杂的世界。

• 计算:能不能在普通设备上跑得动。

• 传输:能不能在合理带宽下流动。

• 泛化:能不能不靠每个场景单独训练。

过去这些指标往往是分别被讨论的。PointSplat 把其中的 " 紧凑性 " 和 " 泛化能力 " 绑在了一起——通过 human-centric 的预测方式,让同一组多视角输入生成的 Gaussian 表示既更小,又更集中于真正的主体。

而这,只是其中一个非常具体的问题。围绕 "3D 表示到底应该长什么样 ",正在形成一个越来越密集的研究和工程地带。

沿着这条线再往前想一步,会发现一个更大的画面正在浮现:图像曾经是互联网的 " 通用语言 ",视频是它的延伸。今天,文本和图像是大型模型训练和推理的主要载体。

而 3D 表示,无论是高斯、点云、网格、还是它们的混合体,都很可能正在成为下一阶段 AI 基础设施的一部分。

到那个时候,问题就不只是 "AI 能不能生成 3D"。

或许是 "AI 究竟应该用什么方式,保存一个世界 "。 PointSplat 没有回答这个问题,它只是把这个问题从一个抽象的担忧,变成了一个具体可做的工程方向。它也没有改变 3D 产业,更没有让 "3D 危机 " 被某个中国团队一夜解决。

PointSplat 与其他方法的新视角合成结果对比

但它做对了一件事,它在所有人都还在卷 " 更真实 " 的时候,提前问了一句 " 够不够轻 "。 而当 3D 真的开始进入直播、进入数字人、进入机器人和空间智能,这句话很可能会被反复提起。

05

最后

3DGS 把世界变成了可以实时渲染的高斯。PointSplat 进一步追问:如果这个世界真的要被大规模传输、理解和交互,它能不能更轻一点?

这个问题其实提前触碰到了 3D 表示的下一阶段:当画质和渲染速度逐渐逼近瓶颈,竞争的焦点也会从 " 把世界还原得多逼真 ",转向 " 如何用更少、更合理的表示,把一个 3D 世界组织起来 "。

而在这场竞赛刚刚开始的时候,中国的研究力量已经站在了一个非常具体的位置上,用一篇 ECCV 2026 的正会论文,认真回答一个工程上绕不开的小问题。

小问题,往往才是大趋势真正开始的地方。

论文链接:https://arxiv.org/abs/2606.32036?utm_source

为了方便大家抱团交流、互通会议消息,我们专门建了ECCV 2026参会交流群!进群你会解锁这些「福利」

会议情报站投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

同行茶话会天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

前沿补给站最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

现场后援团:(会议期间专属开启):到了会场也不用慌——

路线导航场馆分布、报告厅怎么走,群里随时问;

议题共读热门 session、Keynote 现场探讨,错过也能追;

Poster 汇编现场海报精华整理,一键收藏不遗漏;

约局广场约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

进群传送门:扫码进群或添加微信 Qvv0909777,备注:ECCV + 单位 / 学校 + 姓名 + 方向。

搞科研 / 搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲 PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI 科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI 科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 字节跳动 紧凑型 香港中文大学 浙江大学
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论