LSS论文阅读

计算机视觉通用做法:

通常将图像作为输入,并输出一个与坐标系无关的预测(例如在分类中 19, 30, 16, 17

或一个与输入图像相同坐标系中的预测(例如在目标检测、语义分割或全景分割中 7, 1, 15, 36

单目3d目标检测分为3类

1、二阶段,第一阶段网络学习2d目标检测,第二阶段网络学习2d到3d的恢复

2、伪lidar:学习深度估计,同时预测bev

3、类似于detr3d,用3维参考点,基于内外参去各个2维图像上收集信息

BEV有两个体系

第一种体系是LSS, 通过显示深度估计获取3d信息

第二种体系是BEVFormer,通过3d采样点投影到2d来获取信息。

pipeline

图像特征提取-> lift升为3维-->外参矩阵获取2d信息->splat,将3维信息拍平到bev平面上

特点

1、训练从6个图像中随意选5个,进而使模型获取对任意相机的处理能力

2、对内外参增加噪声,用于应对内外参噪声的问题。

相关推荐
boppu11 分钟前
布草特殊污渍去渍剂的种类及作用
大数据·人工智能
AIsoft_868828 分钟前
会议录音转文字与AI纪要工具推荐:免费额度与核心功能对比指南
人工智能
sphw29 分钟前
nixnb: Jupyter Notebook 优雅分享
ide·人工智能·jupyter
mingo_敏33 分钟前
DeepAgents : 权限(Permissions)
人工智能·深度学习·langchain
合调于形41 分钟前
Bianfchheng (Liuu) 《边城(六)》字母标调拼音拼写实测案例
人工智能·自然语言处理·人机交互·语音识别·学习方法
凯丨1 小时前
AI 蠕虫来了:恶意文档如何通过 Copilot for Word 自我传播?
人工智能·c#·copilot
武子康1 小时前
GPT-5.6 Luna 降价 80%:Agent 真正该重算的是单次成功成本
人工智能·chatgpt·llm
Gu Gu Study1 小时前
ScoutLoop开放域深度研究引擎(agent的初步设计想法)
人工智能·python
HyperAI超神经2 小时前
15亿参数挑战机器人控制,MiniCPM-RobotManip正式开源;覆盖文本/图/视频/动作序列,英伟达发布全模态模型Cosmos3-Edge
人工智能·深度学习·机器人·多模态·图像生成·具身智能·智能体
搞科研的小刘选手2 小时前
【国际生态学协会主办】2026年生态环境与人工智能国际学术会议(ICAIEE 2026)
人工智能·生态环境·学术会议·会议推荐