一个场景吃掉700MB显存!3DGS存储焦虑怎么解?这篇综述划了五个方向

作者:凤凰证券 发布时间:2026-07-28 21:15:14

一个场景吃掉700MB显存!3DGS存储焦虑怎么解?这篇综述划了五个方向

过去三年,3D Gaussian Splatting(3DGS)几乎成为实时 3D 场景重建与新视角合成的"默认答案"。

与需要沿每条光线反复查询神经网络的 NeRF 不同,3DGS 使用数百万个可学习的各向异性高斯显式表示场景,再通过可微、分块式光栅化器直接生成图像,在视觉质量与实时渲染之间取得了难得的平衡。

但当场景从一个房间扩展到城市级环境,从静态走向 4D 动态,从桌面 GPU 走向移动端、机器人和边缘设备,问题也随之改变:系统不仅要"重建得出来",还要在有限显存、带宽和功耗下稳定跑起来。

此时,真正限制 3DGS 上限的,往往不只是高斯表示本身,而是投影、分块、排序、混合和梯度回传组成的整条光栅化流水线。

为回答" 3DGS 的瓶颈究竟在哪里",香港科技大学(广州)3DAgentWorld Lab、南洋理工大学、阿里巴巴集团和其域创新科技近日联合发布《3D Gaussian Splatting Rasterization: A Survey》。这项工作不再按照传统综述数字人、自动驾驶、SLAM 等下游任务简单分析,而是把可微光栅化器视为 3DGS 的核心计算引擎,从底层数据流重新组织快速增长的技术版图。

从"做什么"转向"在哪里改":重新理解 3DGS 技术演进

已有 3DGS 综述大多围绕应用场景展开。这种方式便于寻找特定任务的解决方案,却容易掩盖不同工作背后的共同问题:稀疏视角重建、抗锯齿、几何致密化、大场景渲染,看似属于不同赛道,实际都可能反复遭遇相同的投影误差、可见性排序、透明度混合和梯度传播难题。

联合团队因此提出一种"光栅化中心"的分类方式:不再只问一种方法用于什么任务,而是追问它究竟改动了流水线的哪个位置、缓解了哪类系统瓶颈,以及这些改动如何影响画质、速度、显存和存储成本。

△论文提出的三层光栅化分类体系:表示与优化、光栅化流水线、场景驱动扩展。

整套技术版图被划分为三个层次。

第一层是表示与优化,包括高斯内核参数化、几何投影、致密化、正则化、剪枝和压缩;

第二层直接进入光栅化流水线,关注 α 混合、特征场与着色、硬件线程调度、可见性和排序;

第三层讨论这些底层改动如何支持 4D 动态场景、超大规模环境、稀疏视角、无位姿输入以及 3DGS-SLAM。

拆开实时渲染"黑盒":五个环节,五类瓶颈

标准 3DGS 之所以能够实现高速渲染,核心在于一条经过高度优化的、基于瓦片的可微光栅化流水线。3D 高斯基元首先被投影到二维屏幕,系统随后判断它会覆盖哪些图像分块,并将其复制到对应的"瓦片"中。

接下来,每个瓦片内的高斯按照深度排序,再由 CUDA 线程块逐像素完成 α 混合。进入训练阶段后,图像损失还需要沿着同一路径反向传播,最终更新高斯的位置、尺度、旋转、不透明度和球谐函数颜色等参数。

△基于瓦片的光栅化流程:投影后复制到多个瓦片,按深度排序,再进行逐像素 α 混合。

这条流水线中的每个环节,都对应着不同的工程难题。投影阶段需要处理混叠和几何畸变。瓦片分配会带来大量的高斯复制和内存访问。逐瓦片深度排序不仅增加计算延迟,还可能导致画面出现"跳变"。α 混合除了处理透明度,还需要兼容语义特征和物理材质。反向传播则依赖大规模梯度累积,并频繁使用原子操作。

论文的一项关键价值,就是把散落在不同研究中的优化方法重新放回一个统一的框架中,系统比较它们的作用位置、性能收益和额外代价。

四个典型问题,光栅化优化如何落地投影与深度:二维化并不等于问题消失

把 3D 高斯压缩为二维可以增强表面表达,但也会引入深度近似误差。相机旋转可能改变光线方向上的相对次序,造成可见性翻转和跳变。

△3D 高斯压缩为 2D splat 后的深度简化问题。瓦片分配:减少无效复制和访存

宽松的包围区域会把大量并未与椭圆相交的高斯复制到瓦片中。Speedy-Splat 通过 SnugBox 和 AccuTile 逐步收紧候选区域,从源头减少无效分配与访存。

△不同瓦片分配策略。SnugBox 与 AccuTile 逐步缩小候选区域,减少无效高斯复制。α 混合:从采样值走向体渲染一致性

传统 3DGS 用高斯在采样点的函数值近似不透明度。Vol3DGS 改为沿相机光线积分一维高斯密度,使 α 与真实覆盖更一致,对半透明结构和几何表面也更稳定。

△Vol3DGS 沿相机光线积分高斯密度,计算体渲染一致的 α。致密化:高斯并非越多越好

标准致密化容易让像素数量快速膨胀。Taming 3DGS 结合多视角显著性、梯度和高斯属性进行评分,并用可预测增长曲线控制新增数量,让模型预算在训练前就可设定。

△Taming 3DGS 通过显著性评分和可预测增长曲线控制致密化预算统一评测:不寻找"万能冠军",找到效率 - 质量的共赢

为了让不同设计能够在同一坐标系中比较,联合团队在 Mip-NeRF 360、Tanks&Temples 和 Deep Blending 三个常用基准数据集的 11 个场景上,使用统一的 3DGS 光栅化实现评估 27 种代表性方法,并报告了对应的指标及其可视化图表。

实验结果证明团队不应该也无法在所有指标上找到通吃的"冠军",但可以找到某些子方向的专精:

更灵活的几何内核通常能改善重建质量;

多种效率方法可以在质量损失较小的情况下显著减少高斯数量;

部分代表性方法把训练时间压缩到 5 分钟以内;

一些压缩方法在特定数据集上实现超过 8 倍的高斯数量压缩,同时仍获得正向重建指标变化。

从整体趋势看,多数效率导向方法可将像素数量减少约 40% — 70%,但极端压缩仍会带来明显质量风险。存储方面,标准 3DGS 的典型全分辨率场景可能需要约 700 — 800MB。论文汇总的代表性方法中,HAC++、PyramidGS 等可在特定设置下实现约 15 — 20 倍压缩,层级或锚点式方案通常可达到约 3 — 5 倍缩减。

从论文走向可复现的系统比较

为了降低复现和横向比较的门槛,团队同步开源 Github 仓库,面向代表性 3DGS 方法提供统一的训练、渲染和评测流程,支持数据集路径配置、GPU 与系统资源检查、场景级 / 数据集级 / 方法级指标汇总,并持续接入新的方法和开源实现。

对于研究者,这套框架可以帮助快速定位一种工作究竟改动了表示、投影、排序、混合还是存储;对于工程团队,它提供了一份更接近部署现实的检查清单:不能只看重建指标,还要同时考察训练时长、峰值显存、高斯数量、排序延迟、模型体积和设备能耗。

3DGS 的未来:从"看起来更好"走向"系统跑得更好"

基于整套光栅化分析,论文提出五个值得关注的方向:

摆脱逐瓦片强制排序的免排序(Sort-free)或顺序鲁棒可见性建模;

原生支持 4D 与在线更新的动态可见性光栅化;

面向移动 GPU、张量核心和专用加速器的硬件感知像素;

一次前向同时输出颜色、深度、法线、语义和材质的统一多输出高斯点;

排名前五配资公司

覆盖显存、排序延迟、压缩率和能耗的系统级标准评测。

如果说 3DGS 技术的第一阶段证明了显式点基表示能够以实时速度逼近高质量神经渲染,那么下一阶段的竞争极有可能下沉到系统层:谁能用更少排序、更少访存、更稳定的梯度,在同一硬件预算下承载更大的场景、更多的属性和更复杂的动态。

这无疑也是这篇综述试图回答的核心问题:3DGS 的未来,不只取决于"高斯还能如何设计",更取决于光栅化器如何与算法、内存和硬件协同演进。

作者团队

这篇论文由一支横跨 3D 视觉研究、基础模型研发和产业化部署的联合团队完成。作者单位包括香港科技大学(广州)、南洋理工大学、阿里巴巴集团和其域创新科技。

详细介绍:

赵北震(Beizhen Zhao),香港科技大学(广州)信息枢纽人工智能学域博士生,研究方向为 3D/4D 重建与大规模场景重建算法压缩与加速。

正配配资

付博亦(Boyi Fu),香港科技大学(广州)信息枢纽人工智能学域硕士生,研究方向为空间智能与 3D/4D 场景重建。

于思成(Sicheng Yu),香港科技大学(广州)信息枢纽人工智能学域博士生,研究方向为 3D/4D 场景重建和生成。

王子建(Zijian Wang),香港科技大学(广州)信息枢纽人工智能学域硕士生,研究方向为 3D 重建 / 生成与世界模型。

赵开勇(Kaiyong Zhao),深圳市其域创新科技有限公司创始人兼 CEO,国家级创业人才、珠江人才、深圳市海外高层次人才,中国计算机学会分布式专委会常委。曾任大疆部门负责人、达闼首席架构师兼研发副总裁、浪潮 GPU 负责人。拥有 16 年 AI 与三维空间计算经验,出版 50 余篇论文及专著,持有国际国内专利 100 余项,是国内最早的 CUDA 推广者之一。长期推动 3D 重建、空间智能与 3DGS 产业化。

吴鹏程(Pengcheng Wu),新加坡南洋理工大学计算与数据科学学院高级研究科学家,曾在新加坡管理大学和南洋理工大学从事研究工作,并参与创办计算机视觉公司 DeepIR。其研究覆盖机器学习、计算机视觉、数据挖掘、强化学习和联邦学习。

王浩(Hao Wang),香港科技大学(广州)人工智能学域助理教授,曾在 TikTok 和地平线机器人从事研究,主要研究兴趣在于开发基于人工智能的多模态数据感知和生成算法,包括文本、图像、视频和 3D 形状,涉及研究可控视觉内容生成、视觉到文本生成和跨模式检索的各种深度学习方法,并且与工业界保持广泛合作。近年已在 TPAMI、IJCV、CVPR、NeurIPS、ICLR 等发表 50 余篇论文并担任多个顶会 / 顶刊的审稿人。

元股证券:ygzq.hk

许主洪(Steven Hoi),阿里巴巴集团副总裁、新加坡管理大学计算机科学教授,IEEE Fellow、ACM 杰出会员。曾任全球最大企业软件厂商 Salesforce 集团副总裁、Salesforce Research Asia 创始董事总经理,并创立多模态基础模型公司 HyperGAI。曾在南洋理工大学和新加坡管理大学任教,其研究覆盖机器学习、多模态人工智能、计算机视觉、自然语言处理和大规模数据分析,近年已发表论文 300 余篇。曾任 Neurocomputing 主编、IEEE TPAMI 副主编、亚洲机器学习会议 ACML 程序委员会共同主席、ACM SIGMM 社交媒体研讨会大会共同主席,并长期担任 NeurIPS、ICLR、ICML 等国际顶级会议的领域主席,以及 CVPR、ICCV、AAAI、KDD、SIGIR、WWW 等会议的程序委员会成员。

熊辉(Hui Xiong),香港科技大学(广州)讲座教授、人工智能学域主任、AI+ 实验室主任;曾担任美国罗格斯 - 新泽西州立大学杰出教授、罗格斯信息安全中心主任、美国罗格斯大学 - 科大讯飞大数据联合实验室主任。获 AAAS(美国科学促进会) Fellow、IEEE Fellow、ACM 杰出科学家等荣誉。曾任百度研究院副院长并主管 5 个实验室。主要研究方向为人工智能、信息安全、数据科学。主持国家自然科学基金 2 项,主持美国 NSF 基金 10 项。与众多世界知名科技企业开展产学研合作,包括 Citrix Systems Inc.、IBM、SAP、华为、科大讯飞、腾讯、阿里、OPPO、百度等。近年已在国际顶级期刊会议发表论文 300 余篇,任国际计算机学会数据挖掘及知识发现专委会秘书长(ACM SIGKDD Secretary),Encyclopedia of GIS 共同主编、ACM TKDD 和 ACM TMIS 编委。曾任 ACM SIGKDD 和 IEEE ICDM 2015 等多个国际顶级会议(共同)程序委员会主席或大会主席。

论文:https://www.preprints.org/manuscript/202607.0776

代码:https://github.com/3DAgentWorld/Advanced3DGS

Github 仓库:https://github.com/3DAgentWorld/Advanced3DGS

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  完  —

【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目 / 主页链接,以及联系方式。

� �   我们会 ( 尽量 ) 及时回复你 : )

� � 点亮星标 � �

科技前沿进展每日见交易系统失败原因