为什么字节要把 " 空间表示 " 的体积压掉 90%?
作者丨吴思梦
编辑丨岑 峰
如果有一天,沉浸式直播里的每一个主播都拥有一个实时跟随的 3D 分身,观众可以在任何角度切进去和他对话,看到他的表情、衣服褶皱、头发飘动的细节,那么这个 3D 分身究竟应该有多大?
这不是一个凌空蹈虚的问题,已经逐渐落定变成一个非常具体的工程问题。
过去几年,3D Gaussian Splatting(3DGS)让 " 从一堆照片里恢复出可以实时渲染的 3D 场景 " 这件事,第一次变得既真实又快速。今天的 AI 已经非常擅长从多视角图像中重建 3D 世界,而且这个世界的视觉质量已经接近照片级。
3D Gaussian Splatting 从多视角图像重建场景,并支持新视角合成。
图源:Kerbl et al., SIGGRAPH 2023
最直接的例子就是3DGaussian Splatting(3DGS)本身。2023 年的原始论文就是从多张带相机位姿的照片 / 视频中建立一个 3D Gaussian 表示,然后从没有真正拍摄过的视角渲染新画面。论文的核心贡献之一,就是同时做到高视觉质量和实时渲染。
你可以把它想象成这样:
你拿着手机围着一个房间拍了一圈照片。AI 并没有把这些照片简单拼起来,而是从它们之间的关系推断出一个三维表示。然后你把 " 虚拟摄像机 " 放到原来没有拍过的位置,AI 依然可以给你渲染出一张看起来像真实照片的画面。
这就叫Novel View Synthesis,新视角合成。
但接下来发生的事情,把这个能力推到了另一个问题面前。
当 3D 不再只是离线建模出来的城市或物体,而是要实时地跟着一个人跑、跟着一个房间转、跟着一次直播传输给成千上万的设备时,问题就从 "AI 能不能生成一个 3D 世界 " 落到了另一个更为朴素的问题:这个 3D 世界,能不能装得下、传得动、跑得起来?
在 ECCV 2026,浙江大学、字节跳动与香港中文大学(深圳)团队的PointSplat被收录为会议论文,聚焦面向人体的紧凑型 Gaussian Splatting,正是从这个问题出发的。
论文给它的定位写得很克制:让 3D 人体表示(3D human representations)变得更加紧凑,目标场景是沉浸式直播(immersive live streaming)。它没有声称要解决 " 所有 3D 表示的存储危机 ",但它指出了一个更普遍的方向。
当 3D 开始成为 AI 理解和生成现实世界的重要表示," 表示本身的紧凑性 " 会变成一个绕不过去的问题。
01
高斯的代价:越真实,就越重
要理解 PointSplat 在做什么,必须先理解 3DGS 在做什么。
3DGS 的基本想法是把一个 3D 场景拆成大量 " 高斯椭球 "。每一个高斯都记录着自己的位置、尺度、旋转方向、透明度,以及外观信息。成千上万、几十万个这样的高斯一起渲染,就构成了一个看起来真实的 3D 世界。
这种表示有三个非常突出的优点:真实、可渲染、速度快。 它让神经辐射场(NeRF)时代的 " 高质量但慢 " 第一次变成了 " 高质量且实时 "。
但它也带来了一个非常直接的代价。
高斯数量越多,显存占用越大,计算开销越高,存储体积越大,传输带宽要求也越严格。当场景从一栋楼变成一个城市,从一个静物变成一个需要实时跟着动的人,这些成本都会被迅速放大。
图片来源:Papantonakis et al., I3D 2024
于是过去几年里,3D 研究里出现了两股并行的力量。
一股继续在追问 " 如何更高质量地还原世界 ",即更清晰的几何、更逼真的光影、更稳定的视角一致性。另一股则开始追问另一个看起来没那么性感、但迫在眉睫的问题: 能不能用更少的 3D primitives,表达同样的世界?
PointSplat 属于后者,但它走了一条和 " 剪枝 "" 压缩 "" 量化 " 都不太一样的路。它不是在已经生成好的高斯上做减法,而是想从一开始,就少生成一些。
02
从视角中心,
到 " 围绕一个人只建一次 "
过去一段时间里,一种非常流行的做法是 view-centric(以视角为中心) 的 3DGS 预测。它的逻辑非常直觉化:给定一张图像,模型预测出一批高斯;换一个视角,再预测一批;多视角的高斯融合在一起,组成并呈现最终的 3D 表示。
这种做法的好处是模块清晰、训练稳定。
但它有一个非常隐蔽的问题。 同一个人,明明只有一个身体。 然而在 view-centric 框架下,每一个视角都被要求 " 独立地 " 预测一遍这个人的高斯。这意味着:肩膀被编码了一次,侧面被编码了一次,背后又被编码了一次;同一个主体的几何和外观信息,被不同视角的模型反复存了好几份。
论文里把这个现象叫做 inter-view redundancy,跨视角冗余。
这是 PointSplat 真正想解决的事情。它不是来单纯地 " 压一压 " 高斯的,而是来改变 " 高斯到底是怎么被预测出来的 " 这件事。 它的核心思路可以浓缩成一句话:从 view-centric 转向 human-centric(以人为中心)。
图源:Guo et al., ECCV 2026
具体怎么做,可以拆成三个步骤。
第一步,模型不再急于从图像里直接吐高斯。它会先估一个非常粗的、围绕这个人的几何 proxy(代理体),相当于一个非常粗糙的 " 人体在哪、长什么样 " 的空间轮廓。
第二步,基于这个 proxy 做 ray casting(光线投射)。从每个相机视角投出射线,打到 proxy 上,把那些根本不在人体上、或者从当前视角看不到的 3D 点直接筛掉。这一步的目的不是 " 重建精细几何 ",而是 " 提前把没用的点排除掉 "。
第三步,模型拿到这个筛过的、共享的 3D 点集,再用 Point-Image Transformer 把多视角的几何信息和外观信息融合起来,直接预测 Gaussian attributes,也就是每一个高斯最终的位置、尺度、旋转、透明度和外观。
整个流程的关键变化在于:预测的空间变了。
原来是 " 图像 → 像素 → 高斯 ",每一个视角都各自为政。现在变成了 " 多视角图像 → 一个共享的 3D 点集 → 高斯 ",所有视角共同服务于同一个 3D 表示。
用一句更接近直觉的话讲: 问题不一定是 3D 世界里有太多东西,而是 AI 可能把同一个东西看了几遍,就存了几遍。
这句话大概是理解 PointSplat 最重要的钥匙。它把 " 压缩 " 这个听起来像是工程优化的词,重新拉回到了一个更本质的问题—— 3D 表示到底应该以什么为单位来组织?
如果未来 3D 表示要成为 AI 的基础设施,那它组织的单位,很可能不再是 " 视角 ",也不再是 " 高斯的数量 ",而是被表示的那个主体本身。
03
一项工作与一个方向:
3DGS 的范式迁移
如果只看 PointSplat 这一篇论文,很容易把它当成一次 " 压缩算法的工程改进 "。但如果把它放进 3DGS 整个技术演进的时间线里,会看到一个更有意思的趋势。
过去几年里,3DGS 的主流使用方式是 per-scene optimization(单场景优化)。也就是说,对每一个场景、每一段视频、每一组照片,都要单独跑一遍优化流程,最终才能得到一份高斯表示。这种方式质量很好,但代价是 " 一个场景训练一次 ",难以泛化,也很难实时。
而 PointSplat 走的是另一条路:feed-forward reconstruction framework(前馈式重建框架)。给定稀疏的多视角图像,模型不需要为这一组输入专门训练,而是直接预测出一份紧凑的 Gaussian representation。
这件事的意义不在于 " 它比单场景优化快了 ",而在于它代表了一个方向的转向。 过去的范式是 " 拍照片 → 单场景优化 → 得到 3DGS"。 现在的范式开始变成 " 多视角输入 → 模型直接预测 → 得到 3D 表示 "。
用更直白的话讲:3DGS 正在从一种 " 场景级别的优化结果 ",变成一种 " 模型级别的生成能力 "。 这是一个非常关键的差别。
前者意味着每个场景都是孤岛,要重建就要重新算一遍。 后者意味着模型学会了 " 如何从图像里读出 3D",这件事可以泛化到新的主体、新的视角、新的设备。 而 PointSplat 在这个转向里,又叠加了一层自己的判断:即便模型已经可以前馈式预测 3D 了,预测的方式也要从 view-centric 改成 human-centric,否则跨视角冗余会白白吃掉大量的表示空间。
把这两件事合在一起看,能看到一条线:
per-scene optimization → feed-forward prediction → human-centric / subject-centric prediction
3D 表示正在从 " 每个场景算一遍 " 慢慢走向 " 模型学会如何表示 3D",而 PointSplat 是这条线上一个非常具体的、针对人体的回答。
这也是为什么这次工作的署名名单值得单独看一眼。
浙大这边,是长期深耕 3D 视觉、计算机图形学和几何方向的团队,包括 Hujun Bao、Sida Peng、Xiaowei Zhou 等研究者,他们在 3DGS、可微渲染、点云学习这一串技术栈上有非常深的积累。
字节跳动这边,Jing Zhang、Xianchao Shen 等作者参与了这篇工作,但公开材料里并没有给出明确的业务部署信息。我们可以合理地把字节的参与理解为它在 3D / 数字人 / 直播相关技术上的投入。
港中大(深圳)的 Lingteng Qiu 同样参与其中,这也是港中深近年来在图形学、3D 视觉方向上比较活跃的一个侧写。
需要诚实地说一句:三方在这篇工作里共同瞄准的,是论文里写得很清楚的那个应用场景—— immersive live streaming(沉浸式直播)。至于未来这套方法能不能走进数字人、VR/AR、远程交互、空间智能,仍然是值得讨论的产业想象。
04
更轻的表示:3D 的未竟之问
如果把视角再拉长远一点,会发现 PointSplat 其实不只是关于 " 压缩了多少高斯 "。
它指向的是一个更普遍的问题:当 3D 表示开始成为 AI 基础设施的一部分,它应该用什么样的方式存在? 3DGS 的第一个阶段解决的是 " 如何让机器快速生成一个看起来真实的 3D 世界 "。这件事已经基本完成了。从几张照片到一个可以实时渲染的场景,从静物到城市,从离线到准实时。
但 AI 不只是需要 " 看见 " 世界。它还需要保存、传输、理解和生成世界。 这就意味着,3D 表示开始同时面对一组相互拉扯的指标:
• 质量:看起来够不够真。
• 数量:能不能表示足够复杂的世界。
• 计算:能不能在普通设备上跑得动。
• 传输:能不能在合理带宽下流动。
• 泛化:能不能不靠每个场景单独训练。
过去这些指标往往是分别被讨论的。PointSplat 把其中的 " 紧凑性 " 和 " 泛化能力 " 绑在了一起——通过 human-centric 的预测方式,让同一组多视角输入生成的 Gaussian 表示既更小,又更集中于真正的主体。
而这,只是其中一个非常具体的问题。围绕 "3D 表示到底应该长什么样 ",正在形成一个越来越密集的研究和工程地带。
沿着这条线再往前想一步,会发现一个更大的画面正在浮现:图像曾经是互联网的 " 通用语言 ",视频是它的延伸。今天,文本和图像是大型模型训练和推理的主要载体。
而 3D 表示,无论是高斯、点云、网格、还是它们的混合体,都很可能正在成为下一阶段 AI 基础设施的一部分。
到那个时候,问题就不只是 "AI 能不能生成 3D"。
或许是 "AI 究竟应该用什么方式,保存一个世界 "。 PointSplat 没有回答这个问题,它只是把这个问题从一个抽象的担忧,变成了一个具体可做的工程方向。它也没有改变 3D 产业,更没有让 "3D 危机 " 被某个中国团队一夜解决。
PointSplat 与其他方法的新视角合成结果对比
但它做对了一件事,它在所有人都还在卷 " 更真实 " 的时候,提前问了一句 " 够不够轻 "。 而当 3D 真的开始进入直播、进入数字人、进入机器人和空间智能,这句话很可能会被反复提起。
05
最后
3DGS 把世界变成了可以实时渲染的高斯。PointSplat 进一步追问:如果这个世界真的要被大规模传输、理解和交互,它能不能更轻一点?
这个问题其实提前触碰到了 3D 表示的下一阶段:当画质和渲染速度逐渐逼近瓶颈,竞争的焦点也会从 " 把世界还原得多逼真 ",转向 " 如何用更少、更合理的表示,把一个 3D 世界组织起来 "。
而在这场竞赛刚刚开始的时候,中国的研究力量已经站在了一个非常具体的位置上,用一篇 ECCV 2026 的正会论文,认真回答一个工程上绕不开的小问题。
小问题,往往才是大趋势真正开始的地方。
论文链接:https://arxiv.org/abs/2606.32036?utm_source
为了方便大家抱团交流、互通会议消息,我们专门建了ECCV 2026参会交流群!进群你会解锁这些「福利」
会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。
同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。
前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。
现场后援团:(会议期间专属开启):到了会场也不用慌——
路线导航:场馆分布、报告厅怎么走,群里随时问;
议题共读:热门 session、Keynote 现场探讨,错过也能追;
Poster 汇编:现场海报精华整理,一键收藏不遗漏;
约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。
进群传送门:扫码进群或添加微信 Qvv0909777,备注:ECCV + 单位 / 学校 + 姓名 + 方向。
搞科研 / 搞技术,信息差很重要。
来,一起快人一步!
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲 PPT
大会报告全文
热门论文解读
学术新星访谈
未经「AI 科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI 科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。


登录后才可以发布评论哦
打开小程序可以发布评论哦