论文阅读:AugGAN: Cross Domain Adaptation with GAN-based Data Augmentation

Abstract

  • 基于GAN的图像转换方法存在两个缺陷:保留图像目标保持图像转换前后的一致性,这导致不能用它生成大量不同域的训练数据。
  • 论文提出了一种结构感知 (Structure-aware)的图像转换网络(image-to-image translation network)。

Proposed Framework

  • 为了将图像正确地转换,我们需要编码信息包含:1)相互风格信息 (Mutual style)2)结构信息
  • 在我们同时优化图像转化和语义分割的假设下,通过我们的参数共享策略,语义分割子任务作为图像转化的辅助正则化。
  • 框架具体过程可以参考上面的图示。

结构感知编码和分割子任务

  • 文章认为通过训练分割子任务,可以将图像的结构化信息学习出来。

多任务网络的权重共享

  • 生成器解析网络 之间共享权值,允许生成器充分利用上下文感知的特征向量。
  • 我们计算了两个网络反卷积层之间的差异,并以零矩阵为目标,通过均方误差将差建模为损失函数。给出了软分权损失函数的数学表达式:

循环一致性

  • 循环一致性损失已被证明在防止网络在目标域内生成随机图像方面是相当有效的。

对抗性学习

  • 网络包括两个生成对抗网络:

实验

Synthetic Datasets

Reality Datasets

  • 从实验结果来看效果并不够好,但是这种学习方法还是值得借鉴的。

Reference

1\] Huang S W, Lin C T, Chen S P, et al. Auggan: Cross domain adaptation with gan-based data augmentation\[C\]//Proceedings of the European Conference on Computer Vision (ECCV). 2018: 718-731.

相关推荐
大千AI助手2 分钟前
灾难性遗忘:神经网络持续学习的核心挑战与解决方案
人工智能·深度学习·神经网络·大模型·llm·持续学习·灾难性遗忘
gotouniverse3 分钟前
之前自学RAG时做的调研
人工智能
新智元10 分钟前
刚刚,英伟达祭出下一代 GPU!狂飙百万 token 巨兽,投 1 亿爆赚 50 亿
人工智能·openai
霍格沃兹_测试20 分钟前
从零开始搭建Qwen智能体:新手也能轻松上手指南
人工智能
SmartJavaAI29 分钟前
Java调用Whisper和Vosk语音识别(ASR)模型,实现高效实时语音识别(附源码)
java·人工智能·whisper·语音识别
CV-杨帆31 分钟前
论文阅读:ACL 2023 MPCHAT: Towards Multimodal Persona-Grounded Conversation
论文阅读
七元权31 分钟前
论文阅读-SelectiveStereo
论文阅读·深度学习·双目深度估计·selectivestereo
山东小木31 分钟前
JBoltAI需求分析大师:基于SpringBoot的大模型智能需求文档生成解决方案
人工智能·spring boot·后端·需求分析·jboltai·javaai·aigs
君名余曰正则34 分钟前
【竞赛系列】机器学习实操项目08——全球城市计算AI挑战赛(数据可视化分析)
人工智能·机器学习·信息可视化
算家计算40 分钟前
一张图+一段音频=电影级视频!阿里Wan2.2-S2V-14B本地部署教程:实现丝滑口型同步
人工智能·开源·aigc