上交大&华为用“减法“做3D部件生成,从整体中雕刻部件,解决拼接裂缝难题

不"拼积木",改"做雕刻"

目录

[01 两类传统部件生成路线的固有短板](#01 两类传统部件生成路线的固有短板)

[02 减法组合:先整体,再逐步剥离部件](#02 减法组合:先整体,再逐步剥离部件)

联合分裂预测器:分解流Transformer

[03 实验结果](#03 实验结果)

[定量指标 PartObjaverse数据集](#定量指标 PartObjaverse数据集)

定性对比

消融实验,验证三大关键设计

[04 写在最后](#04 写在最后)


3D模型生成已经能产出细节、质感俱佳的完整资产,但绝大多数输出的是一整块不可拆分网格。游戏动画要绑骨骼、3D打印要分材质、数字内容要部件复用编辑------都需要模型拆成独立语义部件。但现有的两条部件生成路线,都卡在"保全局外形"和"保部件完整"之间二选一。

上海交大与华为联合推出 SCULPT,提出减法组合(Subtractive Composition) 新思路:

借鉴现实石雕雕刻逻辑:先生成完整物体,再迭代地从整体中剥离部件,每一步同时预测被剥离部件和剩余物体,两者联合降噪生成,而不是生成完再强行拼合。

该方案部件数量自适应物体本身复杂度,不需要预设部件数量,在PartObjaverse基准测试上,部件、语义分组、物体三层维度的倒角距离全部刷新最优,部件拼接还原完整模型时不会损失外形质量,同时还支持真实照片输入,输出带纹理的拆分3D部件资产。

01 两类传统部件生成路线的固有短板

要理解SCULPT的创新,要先看清现有方案的底层缺陷,这也是论文整套设计的出发点。

分割后处理路线(代表:PartField、SAMPart3D):

先生成完整3D网格,之后依靠分割网络给网格打上部件标签。优势是完整物体几何不会被破坏;致命问题在于,分割仅仅对现有表面做划分。当我们把部件拆分开,部件互相贴合的接触面本身不存在,分割算法不会去生成这部分隐藏的几何与材质。相当于只切蛋糕,不会补蛋糕切口处的奶油,拆分之后每个部件内侧是空洞,很难直接用于动画、3D打印。

图| SAMPart3D整体框架

加法部件生成路线(代表:Part123、OmniPart):

按照包围盒或者token序列,逐个产出独立部件,再把所有部件拼在一起。优点是每个部件是完整独立网格;痛点在于各个部件独立生成,部件交界位置缺少约束,很容易出现缝隙、网格互相穿透、材质纹理对不上。同时大多方案需要预先设置最大部件数量,物体简单时会产出多余空部件,复杂物体又会部件数量不够,部件数量很难自适应目标物体。

图| OmniPart整体框架

还有一部分自回归部件生成工作,虽然逐个输出部件,但条件只参考完整物体和已经生成部件,不存在显式的"剩余物体"状态,没有约束还没有被生成的部分,容易出现部件重复、几何丢失。

两类方案共同的矛盾点:要么保全局外形牺牲部件交界质量;要么保单个部件完整,牺牲组装之后整体一致性。SCULPT的减法组合,就是尝试同时解决这一组矛盾。

02 减法组合:先整体,再逐步剥离部件

SCULPT复用TRELLIS.2预训练结构化3D隐式表示作为底座,这套隐变量把3D资产拆分为稀疏结构、几何、材质三级,所有完整物体、部件、剩余物体全部复用同一套坐标体系,不需要做完缩放、对齐配准。

图| 分解推演过程:部件‑剩余物体序列转换,迭代剥离部件直至剩余物体为空

整套推理流程逻辑非常贴近雕刻:

  1. 输入一张条件图片,用TRELLIS.2得到完整物体的隐变量 【初始整块石材】;

  2. 送入联合分裂预测器 ,输入当前剩余物体隐变量和条件图像,同时输出本次剥离出来的部件 ,以及剥离之后剩下物体隐变量

  3. 将剥离出来部件保存,把剩余物体 回传给预测器,进入下一轮分裂;

  4. 循环直到剩余物体的稀疏支持域为空,或者到达最大迭代上限;如果达到上限物体还没有拆完,会把剩下未拆分部分也作为一个部件输出;

  5. 将全部保存下来部件分别解码,直接在原始坐标系合并,就可以还原完整物体,无需后处理焊接网格。

核心思想:每一步部件和剩余物体是联合降噪一起生成,而不是生成完再做切割或者拼接

预测器在部件+剩余物体两者稀疏支持域的并集上运算,允许部件交界体素可以两边同时存在,不再强制体素非此即彼的硬分割,形成一个接口壳(interface shell),专门处理部件贴合的接触面几何,从生成阶段就维护交界位置的一致性。

图| SCULPT生成完整3D对象以及连贯部件结构示意图

联合分裂预测器:分解流Transformer

预测器分为三级,对应稀疏结构、几何、材质三个阶段,依次运行。

架构分为两条分支:

  • 一条联合降噪分支,负责同时预测部件+剩余物体;
  • 另一条剩余物体控制分支,以ControlNet的方式,把当前剩余物体3D特征注入Transformer块。

联合分支初始化来自预训练TRELLIS.2权重,控制分支残差投影初始化为零,再整套微调。

图| SCULPT框架总览图

训练目标包含两部分:

  1. 流匹配损失:对打包后的(部件,剩余物体)配对做整流流匹配,完成联合降噪训练;
  2. 组合损失:专门约束部件与剩余物体两者合并之后,要覆盖输入剩余物体的空间范围,防止拆分后出现几何凭空丢失。

推理阶段会做支持域裁剪,强制新生成部件、剩余物体的空间范围不能超过输入剩余物体,保证每一步不会向外扩张出多余几何。

训练数据方面,基于PartVerse‑XL数据集构建训练样本。对于每一个带部件标注的完整模型,按照部件中心坐标得到一套确定的部件剥离顺序,每一次剥离就构造一组训练对(输入剩余物体,输出剥离部件+新剩余物体)。

这套构造天然就提供终止样本:当全部部件剥离完毕,目标剩余物体是空,教会模型判断什么时候拆分结束。

03 实验结果

定量指标 PartObjaverse数据集

表| 匹配单图像输入条件下在 PartObjaverse 数据集上的几何对比

在PartObjaverse基准上,SCULPT实现部件、语义分组、物体三层最低倒角距离CD,精细几何F1@0.05同样全部最优:

  • 对比加法生成代表OmniPart:部件层级CD从0.0136降至0.0107,组装后物体CD从0.0032降至0.0020。
  • 对比后处理分割基线TRELLIS.2+PartField:部件CD下降7.0%,语义分组CD下降8.5%,组装物体CD下降4.8%。

需要客观看待一个指标细节:在宽松阈值F1@0.1上,TRELLIS.2+PartField在部件层(0.8897 vs 0.8858)和语义分组层(0.8903 vs 0.8851)略高于SCULPT------后处理分割直接拿原始生成网格打标签,天然在宽松阈值占优;但在衡量精细几何的F1@0.05上SCULPT全面反超,物体层更是F1@0.1和F1@0.05双项最优(0.9839/0.9212)。说明分割方案适合大体轮廓,部件拆分后精细接触面几何质量不如SCULPT的联合生成模式。

定性对比

图| 定性对比结果,红色方框为部件重新组装得到完整物体

定性测试覆盖数据集图片、文生图输出图片、真实拍摄照片输入。可以看到,SCULPT拆分出来每一个部件自带完整纹理材质;重新组装之后轮廓、外观高度贴合输入图片。而加法生成方案组装后容易出现外形偏移;分割类方案部件缺少内侧接触面。

同时它支持递归拆分,把已经剥离出来部件再次送入分裂预测器,把部件进一步拆分成更细小组件,可以把复杂武器模型拆解超过100个细粒度零件。

消融实验,验证三大关键设计

表| 部件层级消融实验

  1. 必须完整适配三级隐变量(Voxel only):仅仅训练稀疏结构阶段,几何材质沿用原始预训练权重,性能暴跌。说明拆分逻辑不能只处理体素占位,几何、材质阶段都要适配部件‑剩余物体联合生成。
  2. 组合损失L_{comp}不可或缺:去掉该损失,部件+剩余物体合并不能保证覆盖原始物体,会丢失几何,CD大幅上涨。
  3. 推理阶段支持域裁剪(Clip):关闭裁剪,生成的部件、剩余物体可以向外扩张超出原始物体边界,引入大量错误几何。

消融清晰证明,完整三级适配、组合损失、推理裁剪,三者共同构成这套减法生成的核心。

04 写在最后

SCULPT跳出"加法拼积木"或者"切现成网格"两套范式,借鉴雕塑雕刻,把部件感知3D生成定义为减法组合:保存显式剩余物体状态,每一步联合生成剥离部件和剩下物体,在生成阶段就处理部件之间交界,而不是生成结束之后补救。

它证明:先做高质量完整物体,再迭代雕刻剥离部件,是兼顾部件质量与组装后全局外形的可行路线。未来方向包括可控拆分粒度、进一步加速迭代推理、拓展文本条件输入,以及把这套减法思想迁移到其他3D表征。

Ref

论文标题:SCULPT: SUBTRACTIVE COMPOSITION FOR 3D PART GENERATION

论文链接:https://arxiv.org/pdf/2608.13541

项目主页:https://sculptpart.github.io/

相关推荐
kolyle6 天前
Hi3D V3.0 2048³精度+48小时免费体验:3D生成模型的工程拐点与企业落地
3d·3d生成·企业ai·多模态ai·多模型路由·hi3d v3.0·极智词元
深蓝学院3 个月前
仅用一张图生成大范围3D世界场景,并直接导入具身智能模拟器
具身智能·3d生成
AI生成未来9 个月前
从平面走向3D!中科大提出Pro3D-Editor,渐进式3D编辑新范式实现三维全视角精准一致
3d·3d生成
聚梦小课堂10 个月前
3D生成软件Rodin 2.0 简单测试案例
人工智能·图形图像·3d生成·rodin·产品体验
Polaris_T1 年前
CVPR 2025 | 文本和图像引导的高保真3D数字人高效生成GaussianIP
数字人·cvpr 2025·3d生成
ScienceLi11252 年前
PhyCAGE:符合物理规律的图像到 3D 生成
3d生成
AI生成未来2 年前
ECCV`24 | 首次解决文本到3D NeRFs分解问题!港中文等提出DreamDissector
3d·eccv·3d生成·eccv2024
AI生成未来2 年前
牛津&Meta最新!PartGen:基于多视图扩散模型的多模态部件级3D生成和重建!
3d·3d重建·3d生成