
图1:概述:给定输入图像和目标高斯预算,AdaptiveSplat可生成稀疏但高质量的重建结果----控制基本图元分配的同时,能够保持场景保真度的能力。相比之下,现有方法在高稀疏度下会出现伪影及过度平滑现象。
目录
- 摘要
- 一、出发点
- 二、问题表述
- 三、基于纹理的场景能量估计
- 四、纹理感知选择性剪枝
-
- [Step 1: 3D 点云聚类(超级簇 SuperCluster)](#Step 1: 3D 点云聚类(超级簇 SuperCluster))
- [Step 2: 超级簇的能量分配](#Step 2: 超级簇的能量分配)
- [Step 3: 二值掩码构建与剪枝策略(Binary Mask Construction)](#Step 3: 二值掩码构建与剪枝策略(Binary Mask Construction))
- 五、自适应高斯预测头 (Adaptive Gaussian Head)
- 实验
标题:AdaptiveSplat: Texture-Aware Controllable 3D Gaussian Allocation for Feed-Forward Reconstruction
Vision and AI Lab, Indian Institute of Science, Bangalore;Samsung R&D Institute India - Bangalore
链接:badrinaths.github.io/projects/adaptive-splat/
摘要
在前馈式 3DGS 重建中,按用户指定的 Gaussian budget 控制表示规模,同时保持新视角合成质量。输入多张 context images + 剪枝预算 β;可接 MASt3R/VGGT 等前馈 backbone,输出紧凑的 3D Gaussian 表示以及新视角渲染结果。核心是在低纹理区域用更少、更大的高斯;高纹理区域保留更多高斯;剪枝后重新预测保留高斯属性。
一、出发点
-
- 现有 feed-forward 3DGS 通常像素对齐预测:每个输入像素对应一个高斯,N=mHW,表示高度冗余。
-
- 直接剪枝会产生空洞 / black patches;若再逐场景微调,又破坏 feed-forward 范式。
-
- 不同区域复杂度不同:高频纹理需要密集高斯,低纹理区域可用更少高斯表示。
对应创新点
- 纹理能量估计:用 DWT 聚合水平/垂直/对角高频响应。
- 区域级剪枝:在 xyzrgb 空间形成 SuperCluster,低纹理区域优先剪枝。
- 自适应高斯头:输入 mask + feature,重新预测保留高斯的尺度、旋转、不透明度和 SH。

Fig.2:剪掉低纹理区域中的冗余高斯后,剩余高斯需要自适应扩大 / 调整来填补空缺。在Toy experiment:低纹理区域直接剪枝VS优化剩余高斯后 PSNR 29.6→31.4,SSIM 0.79→0.86。
二、问题表述
传统模型 : 给定 m m m 个输入视角 { ( I k , v k ) } k = 1 m \{(I_k, v_k)\}_{k=1}^m {(Ik,vk)}k=1m(其中 I k ∈ R H × W × 3 I_k \in \mathbb{R}^{H \times W \times 3} Ik∈RH×W×3 为 RGB 图像, v k v_k vk 为相机姿态),传统模型会生成像素对齐的 N = m × H × W N = m \times H \times W N=m×H×W 个高斯基元,无法自定义高斯总数。
本文模型 : 引入显式的修剪预算 Pruning Budget β ∈ [ 0 , 1 ) \beta \in [0, 1) β∈[0,1)。目标是预测一个紧凑的高斯子集 G = { g i } i = 1 B \mathcal{G} = \{g_i\}_{i=1}^B G={gi}i=1B,其中保留的高斯总数为: B = ⌊ ( 1 − β ) N ⌋ B = \lfloor (1 - \beta) N \rfloor B=⌊(1−β)N⌋
单个 3D 高斯的参数定义 : g i = { μ i , s i , q i , α i , ρ i } g_i = \{\bm{\mu}_i, \bm{s}_i, \bm{q}_i, \alpha_i, \bm{\rho}_i\} gi={μi,si,qi,αi,ρi}: μ i ∈ R 3 \bm{\mu}_i \in \mathbb{R}^3 μi∈R3:3D 空间中心位置(均值)。 s i ∈ R 3 \bm{s}_i \in \mathbb{R}^3 si∈R3:各向异性缩放尺度(Scale)。 q i ∈ R 4 \bm{q}_i \in \mathbb{R}^4 qi∈R4:四元数表示的 3D 旋转(Rotation)。 α i ∈ 0 , 1 \alpha_i \in 0, 1 αi∈0,1:不透明度(Opacity)。 ρ i ∈ R h \bm{\rho}_i \in \mathbb{R}^h ρi∈Rh:球谐函数系数(Spherical Harmonics),用于建模与视角相关的外观颜色。
三、基于纹理的场景能量估计
为了度量图像局部的复杂度和纹理丰富度, 利用 2D 离散小波变换(DWT) 来提取高频细节 。
单层 2D 小波变换公式 : W i j d = ∑ u ∑ v I k ( u , v ) ⋅ ψ d ( i − u , j − v ) W_{ij}^d = \sum_u \sum_v I_k(u, v) \cdot \psi^d(i-u, j-v) Wijd=u∑v∑Ik(u,v)⋅ψd(i−u,j−v)含义: I k ( u , v ) I_k(u,v) Ik(u,v) 为输入图像, ψ d \psi^d ψd 为方向小波基函数。 d ∈ { h , v , d i a g } d \in \{h, v, diag\} d∈{h,v,diag} 分别代表水平(Horizontal)、垂直(Vertical)和对角线(Diagonal)方向的高频细节分量。
像素级纹理能量 : E i , j ( k ) = ∑ d ∈ { h , v , d i a g } ∣ W i j d ∣ E_{i,j}^{(k)} = \sum_{d \in \{h, v, diag\}} \vert{}W_{ij}^d\vert{} Ei,j(k)=d∈{h,v,diag}∑∣Wijd∣含义: 将三个方向的高频响应绝对值相加,用以度量视角 k k k 中像素 ( i , j ) (i, j) (i,j) 处的局部复杂程度。高频响应越大,说明此处纹理越复杂(如边缘、细线条)。


四、纹理感知选择性剪枝
Step 1: 3D 点云聚类(超级簇 SuperCluster)
从预训练骨干网络提取每个视角 I k I_k Ik 的密集点图 P k = { p i } i = 1 H W \mathcal{P}k = \{p_i\}{i=1}^{HW} Pk={pi}i=1HW(包含 3D 坐标 ( x , y , z ) (x, y, z) (x,y,z) 与 RGB 颜色 ( r , g , b ) (r, g, b) (r,g,b))。组合所有视角的点构成全局点云 P = ⋃ k = 1 m P k = { p i } i = 1 N \mathcal{P} = \bigcup_{k=1}^m \mathcal{P}k = \{p_i\}{i=1}^N P=⋃k=1mPk={pi}i=1N。利用 K-means 算法在 ( x , y , z , r , g , b ) (x, y, z, r, g, b) (x,y,z,r,g,b) 6维空间中将点云 P \mathcal{P} P 划分成 K K K 个超级簇(SuperCluster, S C SC SC): S C i = { p ∈ P ∣ ∣ p − c i ∣ 2 ≤ ∣ p − c j ∣ 2 , ∀ j ≠ i } SC_i = \{ p \in \mathcal{P} \mid \vert{}p - c_i\vert{}^2 \le \vert{}p - c_j\vert{}^2, \forall j \neq i \} SCi={p∈P∣∣p−ci∣2≤∣p−cj∣2,∀j=i}其中质心 c i c_i ci 的计算方式为: c i = 1 ∣ S C i ∣ ∑ p ∈ S C i p c_i = \frac{1}{\vert{}SC_i\vert{}} \sum_{p \in SC_i} p ci=∣SCi∣1p∈SCi∑p几何意义: 空间位置接近且颜色相似的点会被聚类到同一个超级簇中。对于平滑表面,可以用较少但体积较大的高斯来覆盖。
Step 2: 超级簇的能量分配
将 2D 像素的纹理能量平均映射到对应的 3D 超级簇上: E S C i = 1 ∣ S C i ∣ ∑ p ∈ S C i E ˉ ( π ( p ) ) E_{SC_i} = \frac{1}{\vert{}SC_i\vert{}} \sum_{p \in SC_i} \bar{E}(\pi(p)) ESCi=∣SCi∣1p∈SCi∑Eˉ(π(p)) 含义: π k ( p ) \pi_k(p) πk(p) 表示3D点 p p p 在图像 I k I_k Ik 上的 2D 投影, E ˉ ( p ) \bar{E}(p) Eˉ(p) 表示像素的小波高频能量。超级簇能量 E S C i E_{SC_i} ESCi 代表了该 3D 区域的平均几何/纹理复杂度。
Step 3: 二值掩码构建与剪枝策略(Binary Mask Construction)
根据能量从低到高对所有超级簇进行排序: { S C 1 , S C 2 , ... , S C K } \{SC_1, SC_2, \dots, SC_K\} {SC1,SC2,...,SCK}。低能量区域(平滑区/无纹理区): 只需要保留少量高斯 (例如,保留比例 γ = 0.1 \gamma = 0.1 γ=0.1,即仅保留前 10% 能量较高的点,修剪掉 90%)。高能量区域(复杂区): 100% 完整保留所有高斯 (0% 修剪)。截断索引 ℓ \ell ℓ 的选取:按能量升序累加,寻找最大的索引 ℓ \ell ℓ,满足修剪预算限制: ∑ j = 1 ℓ γ ∣ S C j ∣ ≤ B \sum_{j=1}^\ell \gamma \vert{}SC_j\vert{} \le B j=1∑ℓγ∣SCj∣≤B 对于区域 j < ℓ j < \ell j<ℓ(低能量):保留 γ ∣ S C j ∣ \gamma \vert{}SC_j\vert{} γ∣SCj∣ 个高斯。对于边界区域 S C ℓ SC_\ell SCℓ:保留剩余所需数量 ∣ R ℓ ∣ = B − ∑ j = 1 ℓ − 1 γ ∣ S C j ∣ \vert{}R_\ell\vert{} = B - \sum_{j=1}^{\ell-1} \gamma \vert{}SC_j\vert{} ∣Rℓ∣=B−∑j=1ℓ−1γ∣SCj∣。对于区域 j > ℓ j > \ell j>ℓ(高能量):完整保留(不进行裁剪)。
最后为每个视角生成二值掩码(Binary Mask): M i , j = 1 G j ∈ G r e t ∩ G i , j ∈ { 1 , ... , H W } M_{i,j} = \mathbb{1}G_j \\in \\mathcal{G}_{ret} \\cap \\mathcal{G}_i, \quad j \in \{1, \dots, HW\} Mi,j=1Gj∈Gret∩Gi,j∈{1,...,HW} 掩码数值为 1 1 1 表示该位置的高斯被选中保留, 0 0 0 则代表被修剪。
五、自适应高斯预测头 (Adaptive Gaussian Head)
生成二值掩码 M 1 , ... , M m M_1, \dots, M_m M1,...,Mm 后,根据保留高斯的索引预测对应的属性 : f θ ( F , M ) → { s i , q i , α i , ρ i } i = 1 B f_\theta(F, M) \rightarrow \{\bm{s}_i, \bm{q}_i, \alpha_i, \bm{\rho}i\}{i=1}^B fθ(F,M)→{si,qi,αi,ρi}i=1B
网络结构 : 基于 DPT (Dense Prediction Transformer) 架构构建,增加了卷积融合层,将从多视角 Vision Transformer (ViT) 提取的密集特征图 F F F 与修剪二值掩码 M 1 , ... , M m M_1, \dots, M_m M1,...,Mm 进行融合。
输出结果 : 仅针对保留下来的 B B B 个高斯索引,自适应地预测出对应的尺度 s i \bm{s}_i si、旋转四元数 q i \bm{q}_i qi、透明度 α i \alpha_i αi 和球谐系数 ρ i \bm{\rho}_i ρi。
训练的动态剪枝策略:为了确保模型在测试阶段面对不同的剪枝预算率 β \beta β 时都能表现稳定,训练时剪枝预算率从均匀分布中随机采样 : β ∼ U [ 0 , 1 ) \beta \sim \mathcal{U}[0, 1) β∼U[0,1),使Gaussian Head在不同预算率 ,都能自适应地预测和调整剩余 3D 高斯的属性。损失函数为图像间Photometric Loss:
L = 1 ∣ v t ∣ ∑ v ∈ v t ( ∥ I v − I ^ v ∥ 2 2 + λ ⋅ LPIPS ( I v , I ^ v ) ) \mathcal{L} = \frac{1}{\vert{}v_t\vert{}} \sum_{v \in v_t} \left( \Vert{}I_v - \hat{I}_v\Vert{}_2^2 + \lambda \cdot \text{LPIPS}(I_v, \hat{I}_v) \right) L=∣vt∣1v∈vt∑(∥Iv−I^v∥22+λ⋅LPIPS(Iv,I^v))
推理:用户指定期望的稀疏度水平 β ∈ 0 , 0.8 \beta \in 0, 0.8 β∈0,0.8;系统计算输入图像的 2D 小波变换(DWT),对全局 3D 点云聚类(SuperCluster)并根据能量进行排序与选择,生成对应的二值掩码 M 1 , ... , M m M_1, \dots, M_m M1,...,Mm;将特征和掩码输入 Gaussian Head,直接单次前馈预测出适应当前剪枝率的高斯属性 ( s i , q i , α i , ρ i \bm{s}_i, \bm{q}_i, \alpha_i, \bm{\rho}_i si,qi,αi,ρi),完成高效渲染。
实验

Fig.5定性对比:基线在无微调时出现黑洞,在高剪枝率下伪影/模糊更明显。
结论:AdaptiveSplat 在多个数据集和不同 β 下整体优于传统剪枝基线。强剪枝优势:β=0.8 时,基线经常出现空洞/过平滑;本文通过"纹理剪枝 + 属性重预测"保持较稳定质量。效率收益:随着剪枝增强,渲染 FPS 提升;但论文说明 GPU memory load 与基础模型相同,主要收益在输出表示和渲染端。
代价 / 局限:DWT 会受镜面高光、光照高频影响;几何精度指标不足。

