gaussian grouping训练自定义数据集

gaussian grouping是一个语义分割3DGS的方法。

它在每个3DGS点云中加入一个叫Identity Encoding的特征向量,

在渲染时把特征向量渲染到2D图像,每个像素位置为一个特征向量,使用额外的线性分类层对每个2D位置的特征向量分类。得到mask。

这个mask和gt mask计算2D损失,同时3D正则化损失利用3D空间一致性,强制执行Identity Encoding在特征距离上接近其最近的3D高斯点。

训练Identity Encoding和线性分类层。

如果训练时有比较完美的mask, 渲染的效果也是很好的。

下面以mip360/kitchen为例训练gaussian grouping. 其他数据集类似。

假设初步只有一些拍摄的图像。放在input文件夹。

用3DGS的convert.py文件处理mip360/kitchen之后,

可得到images和相关下采样图像文件夹,sparse文件夹。

kitchen数据集自带标注好的mask, 如果没有,需要自己标注mask(可以用prepare_pseudo_label.sh),

mask放在kitchen/object_mask文件夹下,格式为png.

train.json设置:

假设mask里面只有2类物体,即前景和背景,前景的像素值取的是255, 背景是0,

那么,在gaussian-grouping/config/gaussian_dataset/train.json中,

"num_classes"要写256.

你会纳闷,为什么只有2类却要写256类?

因为你的前景像素值取的是255,从数字上看,它是第255个类别,想输出类别255,分类器中就要有>=255个类别。如果前景像素值取1,那么"num_classes"可以写2。

类别写小了会报错cuda非法内存访问。

当cuda内存有限时,可以设置较小的"reg3d_max_points"和"reg3d_sample_size"。

train.py

数据集图片过大时可能需要resize,用到images_2, images_4文件夹,

而假设你标注的mask只有一个尺寸。

那么训练的时候就需要把mask调整到和渲染mask一个尺寸。

python 复制代码
logits = classifier(objects)
# Object Loss
if len(viewpoint_cam.objects.shape) > 2:
    gt_obj = viewpoint_cam.objects[:,:,0]  #mask是单通道时不需要这步
    gt_obj_reshaped = gt_obj.unsqueeze(0).unsqueeze(0)
    gt_obj_resized = F.interpolate(gt_obj_reshaped,
                                   size=(logits.shape[1], logits.shape[2]),
                                   mode='nearest')
    gt_obj_resized = gt_obj_resized.squeeze(0).squeeze(0)
    gt_obj = gt_obj_resized.cuda().long()
else:
    gt_obj = viewpoint_cam.objects.cuda().long()

训练很简单,

bash 复制代码
train.py -s data/mip360/kitchen -r 2  -m output/kitchen --config_file config/gaussian_dataset/train.json

渲染时,num_classes要和前面一致:

bash 复制代码
render.py -m output/kitchen --num_classes 256

会在output/kitchen中得到mask等结果。

相关推荐
zyxzyx49几秒前
AI 核心趋势:多模态融合、AI Agent 与低代码开发的落地场景与挑战
人工智能
PPIO派欧云1 分钟前
PPIO上线智谱最新旗舰模型GLM-4.7
人工智能
光羽隹衡3 分钟前
《深度学习》CUDA安装配置、pytorch库、torchvision库、torchaudio库安装
人工智能·pytorch·深度学习
深圳市快瞳科技有限公司4 分钟前
基于计算机视觉的鸟类数量统计技术原理解析
人工智能·计算机视觉
SelectDB技术团队5 分钟前
慢 SQL 诊断准确率 99.99%,天翼云基于 Apache Doris MCP 的 AI 智能运维实践
大数据·数据库·人工智能·sql·apache
模型启动机6 分钟前
对话奥特曼:OpenAI的真实未来蓝图
人工智能·ai·chatgpt·大模型
lusasky7 分钟前
AI领域开发TOP开源产品-GitHub-2025
人工智能·开源·github
智驱力人工智能9 分钟前
超越识别 将光学字符识别(OCR)技术转化为可靠业务能力的交付思维 光学字符识别 金融票据OCR识别系统 物流单据自动识别技术
人工智能·opencv·算法·目标检测·ocr·边缘计算
jiayong2312 分钟前
AI应用领域编程语言选择指南:Java vs Python vs Go
java·人工智能·python
yi个名字16 分钟前
从 Vibe Coding 到 MCP 智能体:在 IDE 里搭建可部署的工作流与 API 应用
ide·人工智能