【稀疏重建】StructSplat:基于非校准稀疏视图的可泛化3DGS

图1:基于非校准稀疏视图的新视角合成的定性对比结果 。我们的方法能够减少伪影、模糊现象及位移

目录

标题:StructSplat: Generalizable 3D Gaussian Splatting from Uncalibrated Sparse Views

哈尔滨工业大学(深圳);大湾大学;广州云蝶科技有限公司

链接:https://structsplat.github.io

摘要

  StructSplat------一个前馈式且可泛化的三维高斯重建框架,该框架可直接作用于未校准图像,而无需相机参数 。现有方法要么依赖于场景级优化,要么假设已知相机位姿,并常将几何信息与外观特征混杂于统一的骨干网络中,从而限制了重建的保真度和泛化能力。核心思想是采用一种结构化表示方式,该方式能组织几何、语义及纹理线索,并明确界定它们在重建过程中的角色。具体而言,我们引入了一种像素对齐的特征注入机制,以实现从二维观测数据中精确建模纹理;引入了语义感知先验信息以提升全局一致性;并设计了一套相机对齐策略,以防止信息泄露并增强泛化能力。实验结果表明,我们的方法在具有挑战性的基准测试中显著优于现有方法:在DL3DV数据集上,我们的方法达到了28.045 PSNR ,比AnySplat(22.377)高出+5.67 dB;在跨数据集评估中,我们在ACID数据集上较AnySplat提升了+1.94 dB,在RealEstate10K数据集上则提升了+1.72 dB。

一、问题定义与表达 (Problem Formulation)

  模型的目标是从一组未标定(Uncalibrated)的源图像中,以前馈(Feed-forward)方式直接预测 3D 高斯集合 G \mathcal{G} G,

  • 输入 : N N N 张源图像 I s = { I i s ∈ R H × W × 3 } i = 1 N \mathcal{I}^s = \{I_i^s \in \mathbb{R}^{H \times W \times 3}\}_{i=1}^N Is={Iis∈RH×W×3}i=1N。
  • 3D 高斯表征 :为每个源图像的每个像素预测一个高斯基元,集合表示为: G = { ( μ j , α j , c j , s j , r j ) } j = 1 N M H W \mathcal{G} = \{(\mu_j, \alpha_j, c_j, s_j, r_j)\}_{j=1}^{N M H W} G={(μj,αj,cj,sj,rj)}j=1NMHW μ j \mu_j μj:中心位置(Spatial Position / Center) α j \alpha_j αj:不透明度(Opacity) c j \mathbf{c}_j cj:颜色(Color) s j \mathbf{s}_j sj:缩放因子(Scale) r j \mathbf{r}_j rj:旋转四元数(Rotation Quaternion)
  • 新视角渲染 (Novel View Synthesis):预测的 3D 高斯通过可微溅射与光栅化(Differentiable Splatting and Rasterization) 渲染出目标视角 p t \mathbf{p}^t pt 的图像: I ^ t = Render ( G , p t ) \hat{\mathcal{I}}^t = \text{Render}(\mathcal{G}, \mathbf{p}^t) I^t=Render(G,pt)

  

图2:StructSplat概述。在给定未校准源图像的情况下,我们采用一种能够整合纹理、语义及几何线索 的结构化表征方式,直接进行前馈3D重建而无需使用相机参数 。编码器可提取多级特征,这些特征驱动两条解码路径:Gaussian解码器 用于预测以相机为中心的高斯分布,而相机解码器则用于估计相机参数,随后由相机对齐模块执行统一配准;经配准后的高斯分布随后被转换为全局表征,并通过可微分溅射技术进行渲染

二、特征编码 (Structured Feature Encoders)

  为了同时兼顾 3D 几何一致性高分辨率纹理细节,StructSplat 使用了三个互补的编码器:

1.几何编码器 (Geometry Encoder):

  基于 VGGT ,使用注意力机制的模型捕获全局几何结构和多视角关系,输出像素对齐的深度图与相机参数估计,为高斯重构提供稳定的结构引导。

2.语义编码器 (Semantic Encoder):

  利用预训练的大模型(DINOv3)提取高层语义特征,捕获视角无关(View-invariant)的对应关系,增强跨视角重构的鲁棒性。

3.纹理编码器 (Texture Encoder):

  采用轻量级卷积层直接从输入图像提取高分辨率特征,保留图像空间的高频外观细节(High-frequency appearance details),防止几何主导的特征破坏高频色彩与纹理

  

三、高斯解码与 DPT Head 改进 (Gaussian Prediction)

  高斯解码器(Gaussian Decoder)负责生成像素对应的相机-高斯属性。DPT (Dense Prediction Transformer) 解码头改进:

  • Reassembling Block(重组块):重新设计,对齐和拼接几何与语义特征,特征投影,维持原始 DPT 的通道维度。
  • Late-stage Texture Injection(晚期纹理注入):经过多级级联的 Reassembling 和 Fusion 块,高分辨率纹理特征在临近最终预测层之前(Late-stage)才被注入。设计目的:显式保留细微的视觉细节,减少纹理退化。

图3:几何导向特征无法捕捉外观细节 。我们为 VGGT 附加一个颜色头,以直接进行二维重建,但即使在训练视图上,也观察到较差的颜色保真度和纹理细节 。这表明几何导向特征无法捕捉外观信息,从而促使我们采用带有专用外观路径的结构化表示方法。

  

图 4:高斯解码器头架构 。通过改进标准 DPT解码器头,解码器整合了结构化表征以预测相机中心高斯属性 。如右图所示,重新设计的"重组块"对几何特征与语义特征进行空间对齐及拼接,并利用投影层来保持通道维度。在经过级联的"重组块"与"融合块"处理后,于后期阶段注入高分辨率纹理特征,从而显式保留精细视觉细节,最终输出结果。

4. 世界坐标系全局对齐 (Coordinate Transformation)

  由于高斯解码器首先输出的是相机局部坐标系(Local Camera Coordinate System)下的属性(如沿相机 z z z 轴的深度值和局部旋转四元数 r r r),为了构建统一的 3D 场景,必须将其转换至统一的世界坐标系(Unified World Coordinate System):

  • 相机解码 (Camera Decoder):估计各视角的相机内参(Intrinsics)和外参(Extrinsics)。
  • 坐标变换 (Rigorous Transformation Step):利用估计出的相机内外参,对各高斯的中心位置 μ j \mu_j μj 和旋转 r j r_j rj 进行严密的空间变换: μ world = R cam → world ⋅ μ camera + t cam → world \mu_{\text{world}} = \mathbf{R}{\text{cam} \to \text{world}} \cdot \mu{\text{camera}} + \mathbf{t}_{\text{cam} \to \text{world}} μworld=Rcam→world⋅μcamera+tcam→world保证所有视角预测出的 3D 高斯在全局空间中具备严格的一致性。

  

五、无信息泄露训练的相机对齐

  核心痛点:信息泄露 (Information Leakage) :训练阶段,Target View 和 Source View 的相机外参必须统一在同一个坐标系下。如果将其一起输入特征提取器 ,由于几何提取器中的交叉注意力机制(Cross-Attention),目标图像的信息会不可避免地泄漏给源特征。这相当于高斯解码器"暗度陈仓"提前看到了目标视角的 Ground Truth,从而破坏训练监督的公正性与模型的泛化能力。

   1.双流并行策略 (Parallel-Stream Strategy)

  • 混合集合 A A A (Mixed Set A A A):包含源视角和目标视角,用于联合估计全局相对相机位姿。
  • 仅源视角集合 B B B (Source-only Set B B B):仅包含源视角,用于独立提取特征并预测高斯属性(彻底隔离目标视角)。

两个集合估计出的相机位姿处于不同的局部世界坐标系中,所以需要以集合 B B B 中的源相机为锚点(Anchors),将集合 A A A 中的目标视角相机对齐 到集合 B B B 的坐标系中。

   2.旋转与平移对齐 (Alignment Formulations)

  旋转对齐 :设 q s , i A q_{s,i}^A qs,iA 和 q s , i B q_{s,i}^B qs,iB 分别代表第 i i i 个源视角在集合 A A A 和集合 B B B 中预测的旋转四元数。目标是寻找一个单位四元数 Δ q \Delta q Δq,使得 q s , i A q_{s,i}^A qs,iA 与 q s , i B q_{s,i}^B qs,iB 对齐。该过程转化为带约束的优化问题: Δ q ∗ = arg ⁡ max ⁡ ∥ Δ q ∥ = 1 ∑ i = 1 n Re ( Δ q ⋅ q s , i A ⋅ ( q s , i B ) − 1 ) --- (1) \Delta q^* = \arg\max_{\Vert{}\Delta q\Vert{}=1} \sum_{i=1}^n \text{Re}\left( \Delta q \cdot q_{s,i}^A \cdot (q_{s,i}^B)^{-1} \right) \quad \text{--- (1)} Δq∗=arg∥Δq∥=1maxi=1∑nRe(Δq⋅qs,iA⋅(qs,iB)−1)--- (1)符号释义: Re ( ⋅ ) \text{Re}(\cdot) Re(⋅):提取四元数的实部。 n n n:源视角的数量。求解方法:利用拉格朗日乘子法(Lagrange multiplier formulation)精确求解该优化问题。

  平移对齐 :对于平移向量 τ s , i A \tau_{s,i}^A τs,iA 和 τ s , i B \tau_{s,i}^B τs,iB,目标是求解缩放因子 λ ∈ R \lambda \in \mathbb{R} λ∈R 和偏移量 Δ τ ∈ R 3 \Delta \tau \in \mathbb{R}^3 Δτ∈R3,使得 λ τ s , i A + Δ τ \lambda \tau_{s,i}^A + \Delta \tau λτs,iA+Δτ 与 τ s , i B \tau_{s,i}^B τs,iB 尽可能接近。构建最小二乘问题: ( λ ∗ , Δ τ ∗ ) = arg ⁡ min ⁡ λ , Δ τ ∑ i = 1 n ∥ λ τ s , i A + Δ τ − τ s , i B ∥ 2 2 --- (2) (\lambda^*, \Delta \tau^*) = \arg\min_{\lambda, \Delta \tau} \sum_{i=1}^n \left\Vert{} \lambda \tau_{s,i}^A + \Delta \tau - \tau_{s,i}^B \right\Vert{}_2^2 \quad \text{--- (2)} (λ∗,Δτ∗)=argλ,Δτmini=1∑n λτs,iA+Δτ−τs,iB 22--- (2)

   3.目标视角位姿变换与最终对齐

  求解出最优的变换参数 Δ q ∗ \Delta q^* Δq∗、 λ ∗ \lambda^* λ∗ 和 Δ τ ∗ \Delta \tau^* Δτ∗ 后,直接将其作用于混合集合 A A A 中预测出的第 j j j 个目标视角位姿 ( q t , j A , τ t , j A ) (q_{t,j}^A, \tau_{t,j}^A) (qt,jA,τt,jA),映射得到在集合 B B B 统一坐标系下的目标视角位姿 ( q t , j B , τ t , j B ) (q_{t,j}^B, \tau_{t,j}^B) (qt,jB,τt,jB): q t , j B = Δ q ∗ ⋅ q t , j A q_{t,j}^B = \Delta q^* \cdot q_{t,j}^A qt,jB=Δq∗⋅qt,jA τ t , j B = λ ∗ τ t , j A + Δ τ ∗ \tau_{t,j}^B = \lambda^* \tau_{t,j}^A + \Delta \tau^* τt,jB=λ∗τt,jA+Δτ∗

  

图5:包含或不包含相机对齐的渲染流程 。由于几何提取器中采用交叉注意力机制,目标图像信息不可避免地会泄露至源特征中;相比之下,相机对齐策略可使高斯解码器利用仅来自源视图的纯特征,从而有效防止特征泄漏。

实验

   数据集与评估指标 (Datasets and Evaluation) :在三个大型数据集上进行评估,分别是 DL3DV、RealEstate10K 和 ACID 。DL3DV使用官方 Benchmark 的划分作为测试集。RealEstate10K / ACID:直接使用在 DL3DV 上训练好的模型进行跨数据集评估 (Cross-dataset Evaluation),用以验证模型的泛化能力。数据清洗与预处理 :仔细排除了训练集中与测试集重叠及异常的样本,确保评估的公正性。统一将所有模型的输出和 Ground-Truth 图像 resize 并中心裁剪(Center-crop)至 256 × 256 256 \times 256 256×256 尺寸。评估指标:采用 PSNR、SSIM 和 LPIPS 三项指标。

  Baseline分类:根据输入要求的不同,将对比的方法分为两大类:

  • Intrinsics-dependent :不需要相机外参(位姿),但仍然依赖已知相机内参。包含:PF3plat, SelfSplat, NoPoSplat, FLARE。
  • Entirely Camera-Parameter-Free :既不需要内参也不需要外参(StructSplat 属于此类)。包含:Splatt3R, RayZer, AnySplat, Depth Anything 3。

  实现细节 :训练加速-结合了 bfloat16 (BF16) 混合精度训练以及 DeepSpeed 优化库。调度器采用 Warmup-Stable-Decay (WSD) 学习率策略,确保收敛稳定性。训练阶段联合渲染源视角与目标视角来计算损失;最终评估时,所有定量指标仅在目标视角上计算。

  

表1:与表征重建方法的对比。本表未使用任何相机参数的方法的最佳结果和次优结果分别以粗体及下划线标出。需注意,本表中所有指标均在未进行任何后优化的情况下进行评估。("Weak"表示仅依赖内参,"No"表示未使用任何相机参数的方法)

  

相关推荐
小柯南敲键盘1 小时前
跨境电商图片翻译工具推荐:批量AI翻译+视频字幕+智能抠图
人工智能·python·音视频
qfljg3 小时前
如何学习opencode和openclaw源码
深度学习
zhenaibo5214 小时前
摘要、研究背景、文献综述AI风险高,怎么优化?
人工智能·深度学习·自然语言处理
DogDaoDao4 小时前
【H266/VVC提案解读】ITU-T H.274 (V4) 规范深度解读 — 视频编码 SEI 消息的全面演进
音视频·实时音视频·视频编解码·流媒体·h266·vvc·视频编解码标准
蓝速科技6 小时前
蓝速科技 3D 全息舱 AI 数字人一体机全尺寸选型实测指南
人工智能·科技·3d
hhzz6 小时前
Tiger AI 平台「手势识别」功能全解析:从数字手势 0–9,到中国手语字母,再到本地视频批量识别——一条链路,三种输入,双模型可同开;双手比划,机器秒懂
人工智能·python·深度学习·aigc·音视频
martindelophy6 小时前
DeepSeek Harness 插件开发实战:用自然语言检查、修改并渲染 Timeline Studio 视频工程
音视频
自学机械人的小白ing6 小时前
深度学习系统学习
人工智能·深度学习·学习
HyperAI超神经6 小时前
128K长上下文+智能体强化训练!LFM2.5-2.6B解锁端侧大模型高效部署;DETR用Transformer斩断NMS与Anchor,重塑目标检测
人工智能·深度学习·目标检测·计算机视觉·数据集·transformer