FlashOcc

参考资料:

(67 封私信 / 80 条消息) 轻量级占用网络要来了!FlashOcc:主打实时性,高精度快速高效内存 - 知乎

论文地址: ++https://arxiv.org/abs/2311.12058++

代码链接: ++https://github.com/Yzichen/Flas++


简介:

occ三维体素优势很多,但是同样显存和算力开销很大,限制了模型部署。

FlashOcc能够在不影响精度的前提下,提升推理速度,节约训练时间与训练成本。


Flashocc的Pipeline :

1. 二维图像编码器

  • backbone提取多相机视角的 2D 图像特征 。
  • Neck 模块(例如 FPN-LSS)融合多尺度特征。

2. 视角变换模块

  • 利用网络进行像素级的深度预测
  • 并结合相机的内外参矩阵,完成2d到3d投影
  • 沿着高度方向进行"压扁"(Pooling 操作),最终得到一个扁平的、纯 2D 的 BEV 特征表达 。

3. BEV 编码器 (BEV Encoder)

  • 使用2D 卷积来处理上一步得到的 2D BEV 特征 。同时,进行多尺度特征融合。通道数被硬性设置为 高度层数 \times 类别数。 也就是 16 \times 10 = 160 个通道。

4. 通道到高度转换

  • 简单 PyTorch 里的 tensor.view()tensor.reshape() 函数

  • 将数据从"通道"维度重新排列(Reshape)到"高度(Height/Z)"维度上 。将2d的bev特征图 变成 3D 占据体素矩阵。


总结:技术选型带来的工程价值

  • 极致降本: 去除了沉重的 3D 卷积,使得显存占用和推理延迟大幅度降低 。这对于那些需要在几十 TOPS 算力的低端芯片上跑通端到端和复杂感知的高阶智驾公司(如卓驭、地平线)来说,是非常完美的工程化方案 。

  • 高度兼容: 它的整体架构与主流传统 BEV 网络(如 BEVDet)高度兼容 。开发团队只需保留原有流水线,把原来的 3D 预测头替换为 Channel-to-Height 模块就能直接跑通,非常容易整合到车企现有的感知流水线中 。

相关推荐
蜡台3 分钟前
AI Agent(智能体)入门基础教程
人工智能
Akir.weiwen39 分钟前
Token 层差异:从颜色值到语义状态的三层跃迁
人工智能·设计规范
迷迭香yy40 分钟前
集合竞价数据挖掘实战:用Python构建开盘信号识别系统
人工智能·python·数据挖掘
大模型momo1 小时前
Spring AI 实战:多 Agent 协作实战 —— 分工拆解复杂旅游行程任务
人工智能·spring·ai·agent·旅游
小程故事多_801 小时前
从A2C、TRPO、PPO到GRPO,强化学习策略梯度算法完整演进与大模型落地实战解析
人工智能·算法
冬奇Lab2 小时前
开源项目第176期:Better Harness — 不审查 diff,审查工作流本身,给 AI 编程 Agent 的五维评估框架
人工智能·开源·agent
冬奇Lab2 小时前
代码库知识库系列(07):混合检索 BM25 + 向量——Q8 还是失败,而且总分退步了
人工智能
ajassi20002 小时前
AI语音智能体开发日记(十一)为智能设备“声”临其境——详解音频资源自动化生成流程
人工智能·ai·ai编程
2601_949499942 小时前
400G组网低功耗优选!芯瑞科技400G VR4 QSFP112光模块赋能智算中心高速互联
大数据·人工智能·科技
GoAI3 小时前
# AI Agent 记忆框架横向对比报告总结
人工智能·大模型·llm·多模态