第七十五周周报

学习目标:

实验

学习时间:

2024.2.17-2024.2.23

学习产出:

实验

1、根据stylegan2作者的回复,对比了tensorflow版本和ViTGAN的参数,重新修改了stylegan2的参数,目前正在跑。

2、根据DViTGAN的随机数种子,重新实验ViTGAN,进行定性实验。

3、lusn128的结果不理想,正在调参。

论文

根据审稿意见,大概看了一下审稿人提到的三篇Diffusion与Vision Transformer结合的论文。

Scalable Diffusion Models with Transformers:将U-Net替换为Vision Transformer,在潜空间中训练扩散模型

DiffiT: Diffusion Vision Transformers for Image Generation:将U-Net替换为一个u形编码器和解码器,引入时间依赖自注意力模块以便注意力层在去噪过程的不同阶段能够进行有效调整。

All are Worth Words: A ViT Backbone for Diffusion Models:设计一个通用的基于ViT的架构U-ViT,将时间、条件和噪声图像patch在内的所有输入作为标记,并在浅层和深层之间采用long skip connection。

相关推荐
云知谷2 小时前
【C++基本功】C++适合做什么,哪些领域适合哪些领域不适合?
c语言·开发语言·c++·人工智能·团队开发
rit84324992 小时前
基于MATLAB实现基于距离的离群点检测算法
人工智能·算法·matlab
初学小刘3 小时前
深度学习:从图片数据到模型训练(十分类)
人工智能·深度学习
递归不收敛4 小时前
大语言模型(LLM)入门笔记:嵌入向量与位置信息
人工智能·笔记·语言模型
之墨_4 小时前
【大语言模型】—— 自注意力机制及其变体(交叉注意力、因果注意力、多头注意力)的代码实现
人工智能·语言模型·自然语言处理
从孑开始5 小时前
ManySpeech.MoonshineAsr 使用指南
人工智能·ai·c#·.net·私有化部署·语音识别·onnx·asr·moonshine
涛涛讲AI5 小时前
一段音频多段字幕,让音频能够流畅自然对应字幕 AI生成视频,扣子生成剪映视频草稿
人工智能·音视频·语音识别
可触的未来,发芽的智生5 小时前
新奇特:黑猫警长的纳米世界,忆阻器与神经网络的智慧
javascript·人工智能·python·神经网络·架构
WWZZ20256 小时前
快速上手大模型:机器学习2(一元线性回归、代价函数、梯度下降法)
人工智能·算法·机器学习·计算机视觉·机器人·大模型·slam
AKAMAI6 小时前
数据孤岛破局之战 :跨业务分析的难题攻坚
运维·人工智能·云计算