MMGS:基于多视角排序的最优传输聚合实现 10 倍压缩的 3DGS

一、论文信息

论文题目:MMGS: 10× Compressed 3DGS through Optimal Transport Aggregation based on Multi-view Ranking

论文作者:Beizhen Zhao, Sicheng Yu, Ziran Yin, Dongxu Shen, Hao Wang

发表单位:The Hong Kong University of Science and Technology

二、论文主要贡献

文章针对3D高斯溅射(3DGS)依赖2D视角梯度引导优化 导致的严重冗余、几何结构退化的核心问题,提出了一套将高斯优化建模为全局几何分布匹配问题的压缩框架MMGS ;该框架融合多视角高斯贡献排序最优传输全局聚合保分布特性的OT基致密化三大模块,从生成、聚合、分裂全生命周期管控高斯冗余,在仅保留10%高斯基元、实现10倍训练加速的同时,渲染质量超越原生3DGS与现有主流压缩方案,在多个公开基准数据集上达成了最优的压缩效率与渲染保真度平衡。

三、论文创新点

  1. 提出多视角3D高斯贡献排序机制,通过纹理感知结构误差度量与3D逆累积几何投票,从多视角几何一致性维度筛选有效高斯,解决了传统2D投影梯度引导致密化带来的视角依赖冗余与几何歧义问题;
  2. 将高斯冗余缩减建模为离散最优传输问题,采用重要性平衡KD-Tree实现分块高效求解,以Gelbrich距离近似Bures-Wasserstein距离度量分布差异,通过矩匹配方式全局聚合冗余高斯,在大幅压缩基元数量的同时完整保留场景的几何分布特性;
  3. 设计了带收缩正则化的最优传输基致密化分裂策略,沿主特征轴对称分裂并严格匹配一阶、二阶统计矩,在保证优化稳定性的同时避免了传统启发式分裂带来的渲染闪烁与分布突变问题。

四、方法

目标是使用最少的高斯基元重建高保真3D辐射场。框架将优化过程视为几何分布匹配问题 ,而非对特定视角的过拟合,因此提出了一套基于多视角贡献排序与最优传输的流水线方案。

图 1:MMGS 的流程。首先,提出了一种多视角 3D 高斯排序机制,通过在一致的 3D 位置验证候选高斯体,解决了 2D 梯度的几何歧义。然后,设计了一种全局最优传输算法,根据排序分数将原始元素聚合成具有代表性的高斯体。最后,引入了一种基于 OT 的加密策略,在拆分过程中保持母分布,以实现稳定优化。

4.1 多视角3D高斯排序

标准3DGS的致密化过程依赖2D投影损失的梯度,但2D梯度可能导致候选高斯产生歧义,进而对视角相关的误差产生过拟合。为解决该问题,提出多视角3D排序机制,通过检测多观测视角下的结构异常,识别重要高斯,确保致密化仅发生在经过验证的几何不一致区域。

4.1.1 纹理感知结构映射

首先建立了一种 超越简单光度差异的鲁棒误差 度量。纯 L 1 \mathcal{L}_1 L1损失往往对高斯难以有效表征的结构细节不敏感,因此定义了纹理感知结构映射,同时捕捉梯度强度与局部曲率。

设输入RGB图像为 I ∈ R H × W × 3 I \in \mathbb{R}^{H × W × 3} I∈RH×W×3,首先将其转换至亮度空间 ℓ ( I ) \ell(I) ℓ(I)。为捕捉结构边缘,采用复合算子:梯度幅值图 G G G 通过水平、垂直Sobel核 K x K_x Kx、 K y K_y Ky 卷积计算得到,定义为 G ( ℓ ) = ( K x ∗ ℓ ) 2 + ( K y ∗ ℓ ) 2 + ϵ G(\ell)=\sqrt{(K_x * \ell)^2+(K_y * \ell)^2+\epsilon} G(ℓ)=(Kx∗ℓ)2+(Ky∗ℓ)2+ϵ ;曲率图 H H H 通过离散拉普拉斯算子计算,定义为 H ( ℓ ) = ∣ K L a p ∗ ℓ ∣ H(\ell)=|K_{\mathcal{L}ap} * \ell| H(ℓ)=∣KLap∗ℓ∣。复合纹理图结合一阶与二阶导数信息,用于突出高几何复杂度区域,定义为:

T ( I ) = N ( G ( ℓ ( I ) ) + λ H ( ℓ ( I ) ) ) T(I)=\mathcal{N}\left( G(\ell(I))+\lambda H(\ell(I)) \right) T(I)=N(G(ℓ(I))+λH(ℓ(I)))

其中 λ \lambda λ 用于平衡边缘与角点的敏感度, N ( ⋅ ) \mathcal{N}(\cdot) N(⋅) 表示将数值归一化至0,1区间的min-max归一化操作。

随后为每个视角构建双准则误差掩码。一个误差像素只有同时具备显著的光度偏差与结构偏差时,才会被判定为有效。设渲染图像为 I ^ ( v ) \hat{I}^{(v)} I^(v),真实图像为 I ( v ) I^{(v)} I(v),二元掩码定义为:

M ( v ) = I ( ∣ T ( I ^ ( v ) ) − T ( I ( v ) ) ∣ > τ 1 ) ∧ I ( ∣ I ^ ( v ) − I ( v ) ∣ > τ 2 ) M^{(v)}=\mathbb{I}\left( |T(\hat{I}^{(v)})-T(I^{(v)})|>\tau_1 \right) \land \mathbb{I}\left( |\hat{I}^{(v)}-I^{(v)}|>\tau_2 \right) M(v)=I(∣T(I^(v))−T(I(v))∣>τ1)∧I(∣I^(v)−I(v)∣>τ2)

其中 τ \tau τ 为预定义阈值, I ( ⋅ ) \mathbb{I}(\cdot) I(⋅) 为指示函数。该交集操作促使模型聚焦于结构错位区域,过滤瞬态噪声。

4.1.2 基于逆累积的3D几何投票

采用多视角投票模块定位特定的3D基元,以验证几何一致性。并非仅依赖瞬时梯度,而是在所有视角子集上累积每个高斯的几何缺陷得分。

对于视角 v v v 中的像素 u u u,设 ω i , u ( v ) = α i ⋅ T i , u \omega_{i,u}^{(v)}=\alpha_i \cdot T_{i,u} ωi,u(v)=αi⋅Ti,u 表示高斯 g i g_i gi 对该像素的贡献权重,其中 α i \alpha_i αi 为不透明度, T i , u T_{i,u} Ti,u 为透射率。通过累积所有视角下的误差标记,定义高斯 g i g_i gi 的几何缺陷得分 C i C_i Ci:

C i = ∑ v ∈ V ∑ u ∈ I M u ( v ) ⋅ I ( ω i , u ( v ) > ϵ v ) C_i=\sum_{v \in \mathcal{V}} \sum_{u \in I} M_{u}^{(v)} \cdot \mathbb{I}\left(\omega_{i,u}^{(v)}>\epsilon_v\right) Ci=v∈V∑u∈I∑Mu(v)⋅I(ωi,u(v)>ϵv)

较高的 C i C_i Ci 表明该高斯在不同视角下均存在重建缺陷,需要进一步优化。

4.1.3 面向致密化与剪枝的重要性采样

最终推导得到两种不同的度量指标,用于引导高斯的生命周期管理:

  • 致密化得分 S d S_d Sd :该得分为多视角平均一致性计数,用于识别当前高斯密度不足以表征几何的区域。计算公式为 S d ( g i ) = ⌊ C i ∣ V ∣ ⌋ S_d(g_i)=\left\lfloor\frac{C_i}{|V|}\right\rfloor Sd(gi)=⌊∣V∣Ci⌋,得分≥1的高斯被标记为几何缺陷区域,优先进行致密化。
  • 剪枝得分 S p S_p Sp :该得分为加权光度贡献得分,用于引导冗余基元的移除。计算公式为:
    S p ( g i ) = N ( ∑ v ∈ V L ( v ) ⋅ ∑ u M u ( v ) ⋅ ω i , u ( v ) ) S_{p}\left(g_{i}\right)= \mathcal{N}(\sum_{v \in \mathcal{V}} \mathcal{\mathcal{L}^{(v)}} \cdot \sum_{u} M_{u}^{(v)} \cdot \omega_{i, u}^{(v)}) Sp(gi)=N(v∈V∑L(v)⋅u∑Mu(v)⋅ωi,u(v))
    其中 L \mathcal{\mathcal{L}} L 为损失函数,由 1 − λ s s i m 1-\lambda_{ssim} 1−λssim 比例的 L 1 \mathcal{L}1 L1损失与 λ s s i m \lambda{ssim} λssim 比例的(1-SSIM)损失组合而成。得分越低,代表该基元对全局光度误差的减少贡献越小,越可能是冗余基元。

该模块将几何一致性与光度误差解耦,专门针对硬几何区域进行致密化,同时对软冗余区域执行剪枝。

4.2 基于最优传输的聚合算法

尽管排序方法移除了部分漂浮伪影,但它无法解决表征同一局部表面的重叠高斯的冗余问题。为进一步压缩高斯集合的冗余度,提出一种全局聚合机制。将高斯缩减建模为离散最优传输问题,而非简单的剪枝任务,即寻找一组稀疏基元,使其与原始稠密分布的瓦瑟斯坦距离最小

最优传输(Optimal Transport, OT) 是数学中研究"如何以最小代价把一个分布变成另一个分布"的理论。

瓦瑟斯坦(Wasserstein)距离 是一种衡量两个概率分布之间差异的度量,其核心思想是计算将一个分布"搬运"到另一个分布所需的最小工作量或成本。

具体解释

4.2.1 重要性加权空间划分

在百万级高斯上直接求解全局最优传输问题在计算上是不可行的。为使其可解,采用自适应重要性加权划分策略,而非标准的空间划分------原因在于辐射场的信息密度是非均匀的。

为模拟光栅化渲染过程,为每个高斯 g i g_i gi 引入视觉贡献得分 W j = α i ⋅ C i \mathcal{W}_j=\alpha_i \cdot C_i Wj=αi⋅Ci(不透明度与几何缺陷得分的乘积),作为传输问题中该高斯的"分布质量"。

随后构建重要性平衡KD-Tree。与基于坐标中位数分割的标准KD-Tree不同,按照累积视觉贡献均分的原则划分空间,即满足:

∑ g i ∈ P l e f t W i ≈ ∑ g j ∈ P r i g h t W j ≈ 1 2 ∑ g k ∈ P p a r e n t W k \sum_{g_i \in \mathcal{P}{left}} \mathcal{W}i \approx \sum{g_j \in \mathcal{P}{right}} \mathcal{W}j \approx \frac{1}{2} \sum{g_k \in \mathcal{P}_{parent}} \mathcal{W}_k gi∈Pleft∑Wi≈gj∈Pright∑Wj≈21gk∈Pparent∑Wk

每次空间分割后,左、右子空间的高斯总贡献权重,都约等于父节点总权重的 1/2。这保证了划分得到的子块并非空间大小相等,而是信息含量均等,从而可以为每个子块分配统一的预算,在局部求解OT问题。

KDTree

4.2.2 高斯瓦瑟斯坦距离与代价矩阵

在每个子块内,旨在将源高斯集合 S s r c = { ( μ i , ∑ i , α i ) } i = 1 N S_{src}=\{(\mu_i, \sum_i, \alpha_i)\}{i=1}^N Ssrc={(μi,∑i,αi)}i=1N 映射到规模更小的目标高斯集合 S t g t = { ( μ j ′ , ∑ j ′ , α j ′ ) } j = 1 K S{tgt}=\{(\mu_j', \sum_j', \alpha_j')\}_{j=1}^K Stgt={(μj′,∑j′,αj′)}j=1K,其中 K ≪ N K \ll N K≪N。

通过Bures-瓦瑟斯坦距离度量两个高斯分布之间的差异。两个高斯分布 S i \mathcal{S}_i Si 与 S j \mathcal{S}_j Sj 之间的平方瓦瑟斯坦距离定义为:

d W 2 ( S i , S j ) = T r ( ∑ i + ∑ j − 2 ( ∑ i 1 / 2 ∑ j ∑ i 1 / 2 ) 1 / 2 ) + ∥ μ i − μ j ∥ 2 2 d_W^2\left(\mathcal{S}{i}, \mathcal{S}{j}\right)=Tr\left( \sum_i+\sum_j-2\left(\sum_i^{1/2}\sum_j\sum_i^{1/2}\right)^{1/2} \right) + \| \mu_i-\mu_j \|_2^2 dW2(Si,Sj)=Tr i∑+j∑−2 i∑1/2j∑i∑1/2 1/2 +∥μi−μj∥22

然而,对每对高斯都计算协方差乘积的矩阵平方根,计算开销过高。为加速计算,采用Gelbrich距离作为紧下界近似,其定义为:

d G 2 ( S i , S j ) = ∥ μ i − μ j ∥ 2 2 + ∥ ∑ i 1 / 2 − ∑ j 1 / 2 ∥ F 2 d_G^2\left(\mathcal{S}{i}, \mathcal{S}{j}\right)=\left\| \mu_i-\mu_j \right\|_2^2+\left\| \sum_i^{1/2}-\sum_j^{1/2} \right\|_F^2 dG2(Si,Sj)=∥μi−μj∥22+ i∑1/2−j∑1/2 F2

其中 ∥ ⋅ ∥ F \|\cdot\|_F ∥⋅∥F 为Frobenius范数(矩阵所有元素

平方和的平方根)。基于该距离,可以高效计算代价矩阵 C ∈ R N × K C \in \mathbb{R}^{N × K} C∈RN×K,其中每个元素 C i j C_{ij} Cij 为对应源高斯与目标高斯之间的Gelbrich距离平方。

4.2.3 重心投影与聚合

采用基于期望最大化(EM)的迭代算法求解最优传输聚合问题:

  • E步(传输规划) :采用硬聚类策略,将每个源高斯分配到传输代价最小的目标高斯,从而确定最优传输计划。传输规划计算公式为:

    π i j = W i ⋅ I ( j = arg ⁡ min ⁡ k C i k ) \pi_{ij}=\mathcal{W}i \cdot \mathbb{I}\left(j=\arg \min{k} C_{ik}\right) πij=Wi⋅I(j=argkminCik)

    其中 W i \mathcal{W}_i Wi 为第 i i i 个源基元的重要性权重, I ( ⋅ ) \mathbb{I}(\cdot) I(⋅) 为指示函数。

  • M步(矩匹配更新) :通过严格的矩匹配更新目标高斯的参数,使聚合后的高斯保留簇内的总统计矩。目标高斯的均值与协方差更新公式为:

    μ j ′ = ∑ i π i j μ i ∑ i π i j , ∑ j ′ = ∑ i π i j ( ∑ i + ( μ i − μ j ′ ) ( μ i − μ j ′ ) T ) ∑ i π i j \mu _{j}^{\prime }=\frac {\sum _{i}\pi _{ij}\mu _{i}}{\sum _{i}\pi _{ij}}, \quad \sum _{j}^{\prime }=\frac {\sum _{i}\pi _{ij}\left( \sum_i+(\mu_i-\mu_j')(\mu_i-\mu_j')^T \right) }{\sum _{i}\pi _{ij}} μj′=∑iπij∑iπijμi,j∑′=∑iπij∑iπij(∑i+(μi−μj′)(μi−μj′)T)

为避免显式计算差值矩阵带来的高昂内存开销,利用方差恒等式高效实现该更新过程。这种分块的最优传输聚合方式,可以在最小化3D概率分布散度的前提下,将基元数量降低数个量级。

4.3 带收缩正则化的最优传输基致密化策略

标准3DGS的致密化策略基于启发式规则,会引入突变的不连续性,造成优化不稳定与较长的预热阶段。提出基于最优传输的致密化策略,当高斯需要分裂时,保证分裂后的子高斯组合分布在创建时刻与父高斯的一阶、二阶矩保持一致

设父高斯 g ∼ N ( μ , ∑ ) g \sim N(\mu, \sum) g∼N(μ,∑) 分裂为两个等权重的子高斯 g 1 g_1 g1、 g 2 g_2 g2,两个子高斯共享相同的协方差 ∑ ′ \sum' ∑′。为保留一阶矩,要求子高斯均值的平均值等于父高斯均值,即 1 2 ( μ 1 + μ 2 ) = μ \frac{1}{2}(\mu_1+\mu_2)=\mu 21(μ1+μ2)=μ。

沿父高斯协方差的主特征轴方向进行分裂:设 ∑ = R S 2 R T \sum = R S^2 R^T ∑=RS2RT 为协方差的特征分解,其中 S = d i a g ( s 1 , s 2 , s 3 ) S=diag(s_1, s_2, s_3) S=diag(s1,s2,s3) 为特征值对角矩阵;识别最大特征值对应的主轴线索引 k = arg ⁡ max ⁡ i s i k=\arg \max_i s_i k=argmaxisi,以及对应的特征向量 v k v_k vk。两个子高斯的均值沿该方向对称偏移,定义为:

μ 1 = μ + δ v k , μ 2 = μ − δ v k \mu_1=\mu+\delta v_k, \quad \mu_2=\mu-\delta v_k μ1=μ+δvk,μ2=μ−δvk

其中 δ = η ⋅ s k \delta=\eta \cdot s_k δ=η⋅sk 为偏移量,由分裂因子 η \eta η 调制。

为保留二阶矩,混合分布的协方差必须等于原高斯的协方差。沿主轴线方向,混合协方差等于子高斯内部协方差加上均值偏移带来的簇间协方差,即:

∑ m i x t u r e = ∑ l o c a l + ∑ m e a n s ⇒ ( s k ′ ) 2 + δ 2 \sum_{mixture }=\sum_{local }+\sum_{means } \Rightarrow (s_k')^2+\delta^2 mixture∑=local∑+means∑⇒(sk′)2+δ2

令其等于原高斯对应维度的方差 s k 2 s_k^2 sk2,可推导得到子高斯沿主轴线的尺度更新规则:

( s k ′ ) 2 = s k 2 − δ 2 ⇒ s k ′ = s k 1 − η 2 (s_k')^2=s_k^2-\delta^2 \Rightarrow s_k'=s_k \sqrt{1-\eta^2} (sk′)2=sk2−δ2⇒sk′=sk1−η2

在实际训练中,严格的矩匹配会导致新分裂的核空间重叠度过高,引发优化歧义。因此引入收缩正则化,对所有维度的尺度均施加等比例的收缩约束,使混合分布的总方差略小于原分布。这一约束既保证了新基元有足够的区分度以独立优化,又避免了分裂突变导致的渲染闪烁伪影。

五、实验

表1:各基线方法在效率与渲染质量上的权衡。通过将效率拆分为压缩率(3DGS 的原始点数量除以该方法的原始点数量)和 ∆PSNR(相对于 vanilla 3DGS 的绝对 PSNR 变化)来评估。更优秀的方法能够在保持 ∆PSNR≥0 的同时实现高稀疏性。

表2:Mip-NeRF360、Tanks & Temples 和 DeepBlending 数据集的定量比较。最佳结果已加粗。每个单元格的颜色显示了最佳和第二佳结果。

相关推荐
迁移科技17 小时前
周转箱拆垛码垛自动化实战:3D视觉实现 ±2mm 毫米级稳定作业
3d·自动化·视觉检测
a11177620 小时前
汽车3D配置器 THreeJS 开源项目
前端·3d·html·汽车
dalong1021 小时前
WPF:3D正八面体自动旋转
3d·wpf
数字新视界21 小时前
3D数字化孪生管理解决方案
物联网·3d·数字孪生·3d可视化
宇擎智脑科技1 天前
img2threejs 架构深度解析:AI 如何高效地从图片“雕刻“3D 模型
人工智能·3d·agent
海伯森技术2 天前
海伯森3D线光谱共焦技术在表面粗糙度检测的应用
3d
脾气有点小暴2 天前
ECharts 伪 3D 柱状图完整注释 + 实现原理说明
前端·3d·信息可视化·vue·echarts
lialaka2 天前
「声纹迷宫(Acoustic Labyrinth)」:具身交互智能驱动的实时声学解构与全双工语音数字人控制台
人工智能·3d·交互