【论文阅读】RoSteALS: Robust Steganography using Autoencoder Latent Space-2023-CVPR

摘要

RoSteALS使用一个轻量级的秘密编码器将秘密信息映射到图像的潜空间中,并通过对潜空间进行微小的偏移来嵌入秘密信息。

该方法使用预训练的自编码器作为基础模型,不需要学习图像分布,因此训练过程简单且效果良好。

方法

架构图:训练期间只更新秘密编码器和秘密解码器,图像的编码器和解码器是锁定的

说明

使用自编码器VQGAN

利用编码器将秘密信息映射到图像的潜在层中,

使用Res50作为解码器,

当平均验证损失停止改善时,训练终止。

图像质量通过冻结的自编码器在第一次迭代中保证,编码器和解码器从头开始训练。

为了提高鲁棒性,插入了噪声模型,其中包括3种类型的噪声,可微的加性和线性噪声(亮度,饱和度,对比度),近似可微噪声(JPEG压缩),不可微噪声(飞溅)

实验数据集

MIRFlickR dataset 100k张,256*256的图像

PSNR在32~34之间,bit acc挺高,但是用了bch纠错码,实际负载率没那么高,而且没有做隐写分析的实验

即使在L=200中,训练也只需要30个epoch就能收敛,因为RoSteALS的唯一目标是学习秘密的编码和解码模块。

这篇代码还是很好复现的,3090显卡半小时能跑一个epoch(6000张train图),比较轻量

相关推荐
m0_6501082414 小时前
PaLM-E:具身智能的多模态语言模型新范式
论文阅读·人工智能·机器人·具身智能·多模态大语言模型·palm-e·大模型驱动
m0_650108241 天前
PaLM:Pathways 驱动的大规模语言模型 scaling 实践
论文阅读·人工智能·palm·谷歌大模型·大规模语言模型·全面评估与行为分析·scaling效应
小殊小殊1 天前
【论文笔记】视频RAG-Vgent:基于图结构的视频检索推理框架
论文阅读·人工智能·深度学习
有点不太正常1 天前
《ShadowCoT: Cognitive Hijacking for Stealthy Reasoning Backdoors in LLMs》——论文阅读
论文阅读·大模型·agent安全
小殊小殊1 天前
【论文笔记】大型语言模型的知识蒸馏与数据集蒸馏
论文阅读·人工智能·深度学习
SatoshiGogo3 天前
AIGC 论文笔记
论文阅读·aigc
walnut_oyb3 天前
arXiv|SARLANG-1M:用于 SAR 图像理解的视觉-语言建模基准
论文阅读·人工智能·机器学习·计算机视觉·语言模型·自然语言处理
m0_650108244 天前
Gemini 2.5:重塑多模态 AI 边界的全面解读
论文阅读·人工智能·多模态大模型·gemini 2.5·跨模态融合
钟屿4 天前
Back to Basics: Let Denoising Generative Models Denoise 论文阅读学习
论文阅读·人工智能·笔记·学习·计算机视觉
张较瘦_4 天前
[论文阅读] AI + 数据库 | 拆解智能数据库:交互、管理、内核三层革新,AI 如何重塑数据处理
数据库·论文阅读·人工智能