CVPR 2018 最佳论文精读:Taskonomy——计算机视觉任务之间的迁移学习

CVPR 2018 最佳论文精读:Taskonomy------计算机视觉任务之间的迁移学习

阅读笔记

一、文章背景

本文精读的是 CVPR 2018(计算机视觉与模式识别大会)最佳论文Taskonomy: Disentangling Task Transfer Learning。CVPR 大会自 1985 年开始举办,已走过 30 余年,是计算机视觉领域的顶级会议。

今年大会概况:

  • 论文投稿 3300 篇,录取 979 篇,录取率近 30%
  • 70 篇论文做口头报告,224 篇论文做快速汇报
  • 参会人数超 6000 人,约为 2014 年的 3 倍
  • 审稿人数量达 1 万人
  • 另组织了 21 个讲座、48 个研讨班和博士论坛,超 115 家公司赞助

二、作者群简介

  • 第一作者 Amir R. Zamir:斯坦福大学和加州大学伯克利分校博士后研究员,CV 领域发表 30 余篇论文,曾获 CVPR 2016 最佳学生论文奖。
  • Alexander Sax:斯坦福大学计算机系硕士毕业生,即将赴伯克利读博,已以硕士生身份发表两篇 CVPR 论文。
  • 沈博魁:斯坦福大学本科毕业生,继续在本校读博,本科期间已发表 2 篇 CVPR 论文和 1 篇 ICCV 论文。
  • Leonidas Guibas:斯坦福大学计算机系教授,ACM 和 IEEE 院士,美国工程院和科学院院士,博士导师为图灵奖得主高德纳(Donald Knuth)。
  • Jitendra Malik:加州大学伯克利分校计算机系教授,ACM、IEEE 院士,美国工程院及科学院院士,计算机视觉领域学术权威。
  • Silvio Savarese:斯坦福大学计算机系教授,研究方向为计算机视觉和计算机图形学(李飞飞的丈夫)。

三、论文的主要贡献

论文核心在于研究计算机视觉任务之间的关系 ,并提出一个计算框架,能够定量学习任务之间的相似度;相似任务可以帮助数据较少的任务取得较好效果。这正体现了迁移学习(Transfer Learning)的核心思想:从已学习的任务或领域迁移到数据较少、学习更困难的任务或领域。

两个关键贡献:

  1. 任务关联性与数据效率:很多视觉任务(如物体识别、景深估计、边界发掘、姿势估计)存在逻辑或直觉上的联系,但部分任务间关系并不直观(如边界发掘和光影如何帮助姿势估计)。论文展示了任务间关联性可带来数据上的巨大便利------用更少的数据学习更多任务,为缺乏大规模人工标注的新任务带来希望。
  2. 无先验的计算框架 :框架不需要事先准备的知识(如人为决定哪两个任务相关),也不同于利用概率建模的方法需要对任务结构加以先验概率。该框架完全从数据和结果出发,避免了先验信息的不完整和不准确

四、论文的核心方法

方法由四个组成部分构成:

  1. 任务相关的建模:为每个独立任务建立模型,有两个目标------尽可能提高自身任务精度;过程中提取有代表性的中间表征结果,以有助于迁移学习。

  2. 迁移建模:利用第一部分学习到的中间表现层,在目标任务上学习从原本表现层到任务目标的迁移。除单个原任务外,还可利用多个原任务共同提升效果,从而把多个任务与一个目标任务关联起来。

  3. 任务关系的归一化(文章亮点) :得到迁移学习结果后,利用两两任务之间的关系获得一个矩阵,完整表征所有任务的联系。但直接用迁移损失函数值刻画关系无法比较;归一化到 0~1 也不行,因为没考虑损失函数变化速度与目标任务精度的关系。因此作者提出按次序归一化的方法:不再看两两任务间绝对迁移数值,而是看在测试集上哪个原任务相对其他任务能更多地获取目标任务精度,使所有任务可比。目的就是构建任务与任务之间的关系矩阵。

  4. 任务关系图谱 :从关系矩阵中提取所有任务真正的关系图谱,即从完全全连通图中寻找最有价值的子图。作者采用布尔值整数规划(Boolean Integer Programming)方法,在限制条件下挖掘出有代表性的子图。

五、实验结果

作者构建了一个含 400 多万张图片的新数据集,覆盖 26 个计算机视觉任务。实验发现:

  • 3D、2D 类任务自然被归为一类;上下文分割、景象识别等高层任务被分在一起。
  • 将不同两两任务随机组合成"随机任务图谱",按学习到的结构做迁移学习,效果显著优于随机结果。
  • 学习到的结构不仅能帮助目标任务提升性能,在任务间关系的解释性上效果也很好。

六、小结

  • 论文研究了计算机视觉任务之间的关系,提出计算框架实现迁移学习;
  • 核心方法包含任务建模、迁移建模、关系归一化、关系图谱四个组成部分;
  • 实验证明该框架可提升目标任务性能,且具有良好的可解释性。
相关推荐
Zentceh6 小时前
全彩夜视 vs 黑白夜视:信息密度、AI识别准确率对比
人工智能·科技·计算机视觉·车载系统·无人机·量子计算·视频
AI的探索之旅8 小时前
97 个 OpenCV 实例(十五):几何校正,透视变换 + ECC 对齐
人工智能·opencv·计算机视觉
qq_25294131689 小时前
牛目标检测数据集 | 牛只检测 智慧畜牧 动物识别 目标检测5017期
人工智能·深度学习·目标检测·计算机视觉·动物识别··牛识别
硅谷秋水9 小时前
Zero-WAM:基于人类视频的上下文世界-动作建模,用于开放式任务泛化
人工智能·深度学习·计算机视觉·语言模型·机器人·音视频
YOLO数据集集合9 小时前
珊瑚健康状态检测数据集 | 珊瑚检测 白化监测 海洋生态 水下目标检测9034期
人工智能·目标检测·计算机视觉·珊瑚健康·白化监测·水下目标
HYHYLLLL9 小时前
【2026年】多模态AI在水务场景的应用
人工智能·深度学习·计算机视觉·水务
欧特克_Glodon1 天前
OpenCV计算机视觉开发入门与实践<二十七>:图像分割概述
c++·人工智能·opencv·计算机视觉
hahaha60162 天前
HLS高层次综合设计技巧--C++类和模板
图像处理·人工智能·算法·计算机视觉
qq_25294131682 天前
航拍羊群目标检测数据集 | 航拍羊群 智慧畜牧业 动物检测 无人机巡检5010期
人工智能·yolo·目标检测·计算机视觉·无人机·羊群识别·羊群