【三维重建】QuerySplat:在 3DGS 预测中解耦几何与外观表征

图 1:QuerySplat 概览。对不同视角数量的未校准图像,QuerySplat 采用无姿态约束、前向传播且无需像素对齐的方式,重建出清晰且高保真度的3DGS场景。与现有方法相比,该方法能够生成结构更为连贯的场景,并可在数秒内处理真实场景下的输入图像。

目录

标题:QuerySplat: Decoupling Geometry and Appearance Representations in 3DGS Prediction

北京航空航天大学虚拟现实技术与系统国家重点实验室;InSpatio Research; 浙江大学CAD&CG国家重点实验室

链接:https://inspatio.github.io/querysplat

摘要

  尽管前馈式 3DGS 能够实现高效的三维重建,但实现高保真渲染仍面临挑战。现有的像素对齐方法存在空间灵活性不足和结构冗余严重的问题,而基于查询的方法则缺乏三维先验信息,且将几何结构与外观信息混为一谈,导致渲染结果模糊且受姿态影响。

  QuerySplat 是由几何先验信息和显式外观解耦驱动的前馈式 3DGS 框架。具体设计了一个双分支基于查询的解码器:几何分支利用预训练的视觉几何模型进行空间理解,这使 QuerySplat 自然具备无姿态建模能力;而外观分支则通过一条与几何属性回归分离的专用路径来恢复高频细节。大量实验表明,QuerySplat 有效缓解了早期基于查询模型存在的模糊渲染问题,并在渲染保真度方面 consistently 优于像素对齐方法。在具有挑战性的 DL3DV 基准测试集上,该方法实现了最先进的新视角合成性能------相较于最佳的无姿态和需姿态基准模型,其平均 PSNR 增益分别达到 2.30 dB 和 1.04 dB。

  

一、相关工作

基于查询的三维场景表示:

   为克服像素对齐的约束,基于查询的方法采用可学习的token来聚合空间信息 。该范式源于2D视觉的 DETR(2020),现已成功拓展至3D感知领域(DETR3D与Mask3D)以及通过体素VoxFormer(2023)或三平面LRM(2024)表示进行场景重建的场景。近期,TokenGS将这一机制引入 FFR 3DGS 中,彻底摆脱了对二维像素网格的依赖。然而,尽管这种方法释放了空间自由度,但通过统一查询同时学习复杂几何结构与细粒度纹理会引发严重的属性纠缠问题。这一优化瓶颈会降低渲染质量------导致结果过度平滑或模糊------并且仍对精确的相机位姿保持严格依赖。

   TokenGS 抛弃了"每个像素对应一个高斯点"的强绑定,转而采用Encoder-Decoder 架构 :Encoder 提取输入图像的多视角特征;Decoder 引入一组可学习的 Gaussian Token(Query),通过 Cross-Attention 机制动态地从图像特征中聚合三维空间与外观信息,实现高斯体元数量与输入分辨率的解耦。

  • 直接 3D 空间坐标回归 : Token 直接回归 3D 高斯的真实世界坐标 ( x , y , z ) (x, y, z) (x,y,z)、缩放尺度、旋转四元数、不透明度以及球谐颜色系数。这种无约束的连续空间回归赋予了模型更强的空间分配自由度(细节区域分配更多高斯,平坦区域分配更少)。

  • 可见性约束(Visibility Loss) 为防止高斯点优化发散到无梯度的空白空间,可见性损失惩罚那些未投影到任何有效监督视角的体元,确保高斯点集中分布在物体表面附近。

  • 支持测试时优化(Token-Tuning)与动静态分离:推理时,模型允许仅微调特定的 Token 嵌入而无需改动网络权重,以极低的计算开销进一步提高重建保真度;同时支持划分静态/动态 Token,灵活处理动态场景的 4D 重建。

视觉几何模型(VGMs)

  在海量数据集上进行预训练后,展现出强大的多视图空间推理能力。这一范式由 DUSt3R 和 MASt3R 针对无姿态点云映射回归任务率先提出 ,近期通过诸如 VGGT、Pi3、DA3(以及 VGGT -Ω等高性能架构得到了进一步发展。为将这些基础模型扩展至大规模场景,诸如 ZipMap 和 Scal3R等方法引入了测试时训练(TTT)机制以确保全局一致性;而 LingBot-Map 则采用纯前馈流式处理范式,无需后优化开销。尽管在架构和系统层面取得了这些快速进展,但将 VGMs 集成到下游三维生成流水线中的程度仍相对有限。

  

二、 整体架构与预训练特征提取

  给定一组输入图像 I in = { I i } i = 1 N \mathcal{I}{\text{in}} = \{I_i\}{i=1}^N Iin={Ii}i=1N,网络旨在通过单次前馈预测一个可渲染的 3D 高斯集合。 G = F θ ( I in ) = { g k } k = 1 K , g k = ( r k , p k , s k , α k , c k ) \mathcal{G} = F_\theta(\mathcal{I}{\text{in}}) = \{g_k\}{k=1}^K, g_k = (\mathbf{r}_k, \mathbf{p}_k, \mathbf{s}_k, \alpha_k, \mathbf{c}_k) G=Fθ(Iin)={gk}k=1K,gk=(rk,pk,sk,αk,ck) 其中 g k g_k gk 的参数分别代表旋转四元数、中心坐标、各向异性缩放、不透明度和球谐颜色系数。

  为了提供强大的多视角几何先验,模型引入了 冻结的预训练视觉几何模型(VGM用的VGGT),它可以推断几何特征 F geo \mathbf{F}_{\text{geo}} Fgeo、相机位姿、内参以及稠密深度。冻结 VGM 可以有效保留其通用几何推理能力,防止与高斯生成器联合微调时破坏相机和几何的一致性。同时,模型通过 Sim(3) 变换,实现了一个无需外部标注的自校准坐标系(Self-Calibrated Coordinate System)。

  

图 2:方法概览。视觉几何模型(VGM)用于编码具有几何感知能力的内存并定义相机参数;几何查询从 VGM 特征中解码空间高斯参数,而外观查询则读取 RGB/Plucker 内存以预测其余参数。所得的高斯分布通过在 VGM 定义的坐标系中采用可微分的"splatting"方法进行监督训练。

三、 几何/外观 解耦查询(Decoupled Queries)

  模型将"高斯点放在哪里"(几何)与"高斯点长什么样"(外观)分开处理。这是因为过早混入包含高频局部纹理的外观特征,会干扰依赖空间布局的几何梯度,导致高斯点生成不稳定

  • 几何查询(Geometry Queries):一组可学习的 Token Q geo \mathbf{Q}{\text{geo}} Qgeo 通过 Transformer 解码器与几何特征 F geo \mathbf{F}{\text{geo}} Fgeo 进行交叉注意力交互。 Z geo = D geo ( Q geo , F geo ) \mathbf{Z}{\text{geo}} = D{\text{geo}}(\mathbf{Q}{\text{geo}}, \mathbf{F}{\text{geo}}) Zgeo=Dgeo(Qgeo,Fgeo)解码后的 Z geo \mathbf{Z}_{\text{geo}} Zgeo 被映射为高斯点的中心坐标 p \mathbf{p} p、缩放 s \mathbf{s} s 和旋转 r \mathbf{r} r。

  • 外观查询(Appearance Queries):利用带有 Plücker 射线嵌入的 RGB 图像构建外观特征 F app \mathbf{F}{\text{app}} Fapp。外观解码器以 Z geo \mathbf{Z}{\text{geo}} Zgeo 为基础状态,结合可学习的外观查询 Q app \mathbf{Q}{\text{app}} Qapp 提取特征。 Z app = D app ( Z geo , Q app , F app ) \mathbf{Z}{\text{app}} = D_{\text{app}}(\mathbf{Z}{\text{geo}}, \mathbf{Q}{\text{app}}, \mathbf{F}{\text{app}}) Zapp=Dapp(Zgeo,Qapp,Fapp)最终 Z app \mathbf{Z}{\text{app}} Zapp 被映射为不透明度 α \alpha α 和球谐颜色 c \mathbf{c} c。

四、 损失函数与优化策略

   训练总损失 : L = L photo + λ vis L vis + β cd ( t ) L cd + β α ( t ) L α \mathcal{L} = \mathcal{L}{\text{photo}} + \lambda{\text{vis}}\mathcal{L}{\text{vis}} + \beta{\text{cd}}(t)\mathcal{L}{\text{cd}} + \beta{\alpha}(t)\mathcal{L}_{\alpha} L=Lphoto+λvisLvis+βcd(t)Lcd+βα(t)Lα

  • 光度重建损失(Photometric reconstruction ):结合了像素级 L 1 L_1 L1、结构级 SSIM 和感知级 LPIPS,是主要的渲染监督信号。 L photo = L 1 + λ ssim L ssim + λ lpips L lpips \mathcal{L}{\text{photo}} = \mathcal{L}1 + \lambda{\text{ssim}}\mathcal{L}{\text{ssim}} + \lambda_{\text{lpips}}\mathcal{L}_{\text{lpips}} Lphoto=L1+λssimLssim+λlpipsLlpips
  • 可见性正则化(Visibility regularization):借鉴 TokenGS,惩罚落在相机视锥外的高斯点,防止产生无渲染梯度的"漂浮物"。
  • 早期阶段正则化(Early-stage regularization ):仅在初始化阶段使用,随后逐步移除。
    -- 倒角距离损失(Chamfer distance ):约束预测的高斯中心 G p \mathcal{G}p Gp 贴近 VGM 深度反投影生成的伪点云 P \mathcal{P} P。 L cd = d CD ( G p , P ) \mathcal{L}{\text{cd}} = d_{\text{CD}}(\mathcal{G}p, \mathcal{P}) Lcd=dCD(Gp,P)
    -- 不透明度下限约束(Opacity-floor regularizer ):防止高斯点过早变得完全透明而消失( α min ⁡ \alpha
    {\min} αmin 为设定的下限)。 L α = E α ∈ A max ⁡ ( 0 , log ⁡ α min ⁡ − log ⁡ ( max ⁡ ( α , ϵ ) ) ) \mathcal{L}{\alpha} = \mathbb{E}{\alpha \in \mathcal{A}} \\max(0, \\log\\alpha_{\\min} - \\log(\\max(\\alpha, \\epsilon))) Lα=Eα∈Amax(0,logαmin−log(max(α,ϵ)))

  此外,该模型支持可选的测试时优化(TTO),通过冻结网络权重并仅优化提取的特征,来在运行时间与重建保真度之间取得平衡。这种几何与外观双分支解耦的设计,在处理复杂 3D 场景时,通常能显著减少模糊和过度平滑的现象。

  

实验

  1. 实现细节与渐进式查询扩展(Progressive Fine-tuning
  • 核心特征提取器 :确认使用预训练的 VGGT- Ω \Omega Ω 作为 3D 重建特征提取器,每个查询 Token 负责预测 64 个高斯基元。
  • 硬件与数据 :在 64 张 A800 GPU 上使用 DL3DV 数据集,BF16 精度训练。 渐进式查询扩展(核心 Trick):模型并非一开始就使用全部高斯点。基础训练:使用 1024 个查询点训练 300K 次迭代。
  • 微调阶段 :将查询数量翻倍递增,最终达到 8192 个。新增的查询 Token 并非随机初始化,而是通过对旧 Token 施加微小扰动来继承先验: q i new = q i   m o d   N old old + ξ q_{i}^{\text{new}} = q_{i \bmod N_{\text{old}}}^{\text{old}} + \xi qinew=qimodNoldold+ξ这种策略类似于传统 3DGS 中的高斯分裂(Splitting),能以可控的计算代价显著增加高斯数量,提升高频细节表达。
  1. 对比实验与性能结论
  • 严格防泄漏.为了公平对比 Pose-free(无位姿先验)模型,QuerySplat 仅使用 All-view 通道进行位姿估计和 Sim(3) 对齐,绝对禁止用目标视角的 GT 特征来辅助重建。
  • 测试时优化(TTO):文章特别测试了仅用 20 步和 50 步的轻量级测试时优化。即便不使用 TTO,QuerySplat 在 PSNR、SSIM 和 LPIPS 指标上也全面超越了现有的 Posed 和 Pose-free 前馈方法。
  • 定性优势:突破了以往基于 Query 的 3DGS 容易出现模糊(过度平滑)的瓶颈。由于几何与外观的双分支解耦,它在保留非像素对齐框架结构优势的同时,达到了与像素对齐方法(Pixel-aligned)相媲美的视觉锐利度和纹理保真度。
相关推荐
鲁邦通物联网1 小时前
充电站底层脱机DLB引擎解构:基于Linux调度的边缘计算网关并发控制实战
linux·运维·人工智能·边缘计算·边缘计算网关·5g数采·工业级边缘计算网关
ADRU1 小时前
深度拆解DeepSeek Harness插件热更新实现原理
人工智能·ai·ai编程
李昊哲小课1 小时前
大模型应用开发课程——项目 13~16 完整教程
人工智能·大模型·智能体
有脚就行1 小时前
第32篇-弹性训练与容错-让训练任务永不中断
人工智能
移动云开发者联盟1 小时前
密态计算落地!MobileClaw解锁安全AI新范式
大数据·人工智能·安全
一次旅行1 小时前
2026‑08‑19 AI产业深度解读|Mojo正式开源、Agent记忆剂量研究、OpenAI收紧模型安全管控
人工智能·开源·mojo
HackTwoHub1 小时前
开箱即用 AI 渗透测试系统,整合多类AI工具、Web安全、内网攻防、二进制逆向、API测试、流量分析等多个安全领域
人工智能·安全·web安全·网络安全·系统安全·网络攻击模型·安全架构
TAN-90°-2 小时前
Deep Learning for Computer Vision——Training CNNs and CNN Architectures
人工智能·深度学习·神经网络·算法·机器学习·计算机视觉·cnn
0x3F(小茶)2 小时前
Tokenization(分词算法):一切大语言模型的地基
人工智能·算法·语言模型