论文阅读——ScanQA

ScanQA: 3D Question Answering for Spatial Scene Understanding

输入:点云P和问题Q,输出:答案A

点云p由三维坐标点组成。本文模型使用额外的点云特征:点云高度、颜色、法线和多视图图像特征,这些特征将 2D 外观特征投影到点云上。将上面这些特征结合,作为模型的3d特征。

ScanQA model网络结构:

模型包括3D &language encoder, 3D & language fusion, and object localization & QA layers

VoteNet的骨干网络是PointNet++,VoteNet的输入是3d特征,输出的是物体候选区域,然后使用非线性层候选物体的表示。

transformer encoder提供K和V

Fusion是一个带有注意力的两层MLP

最上面一层目标定位Object localization module模块是用于决定VoteNet输出的目标框属于该问题的最大似然,也就是,网络会生成很多框,但是只有一部分是和问题相关的,这个模块要把它选出来。使用CEloss。

Object classification module预测了什么物体是和问题有关系的。CEloss。

Answer classification module预测问题的答案。

LOSS:

VoteNet有个检测损失Ldet,还有最上面三个模块的定位损失Lloc,分类损失Lobj,答案损失Lans,四者相加。L = Lans + Lobj + Lloc + Ldet

相关推荐
用户5619035069335 分钟前
OpenAI兼容API报401/404/429怎么解决?API Key、Base URL、模型名排查
人工智能
lucky_syq5 分钟前
专栏目录与学习路线 | 48 篇正文导览
人工智能·学习
TechEdu20260610 分钟前
[人工智能]RLlib:基于Ray的可扩展强化学习框架
人工智能·ai
加多22 分钟前
DeepSeek Harness 深度分析:用途、问题、架构原理与使用指南
人工智能·架构
风流 少年34 分钟前
Spring AI 2.0:Flux
java·人工智能·spring
小马过河R43 分钟前
Graph Engineering 深度解析:模型越强,越需要给它画好“地图”
人工智能·langchain·graph·ai工程化·harness·驾驭工程
leisoo809744 分钟前
涨停板次日表现因子怎么挖掘本地化Python全流程实战
大数据·人工智能·python
lucas_AI1 小时前
喂张白纸也能吐出证件号?文档 MLLM 的"关系级泄露"被测出来了
人工智能·算法·掘金技术征文
Old Uncle Tom1 小时前
手机银行用户画像设计
人工智能·智能手机
kyriewen1 小时前
前端切图仔被 AI 新闻淹死的第 N 天,我用 TRAE Work 定时任务救了自己
前端·人工智能·trae