第七十五周周报

学习目标:

实验

学习时间:

2024.2.17-2024.2.23

学习产出:

实验

1、根据stylegan2作者的回复,对比了tensorflow版本和ViTGAN的参数,重新修改了stylegan2的参数,目前正在跑。

2、根据DViTGAN的随机数种子,重新实验ViTGAN,进行定性实验。

3、lusn128的结果不理想,正在调参。

论文

根据审稿意见,大概看了一下审稿人提到的三篇Diffusion与Vision Transformer结合的论文。

Scalable Diffusion Models with Transformers:将U-Net替换为Vision Transformer,在潜空间中训练扩散模型

DiffiT: Diffusion Vision Transformers for Image Generation:将U-Net替换为一个u形编码器和解码器,引入时间依赖自注意力模块以便注意力层在去噪过程的不同阶段能够进行有效调整。

All are Worth Words: A ViT Backbone for Diffusion Models:设计一个通用的基于ViT的架构U-ViT,将时间、条件和噪声图像patch在内的所有输入作为标记,并在浅层和深层之间采用long skip connection。

相关推荐
aqi002 小时前
15天学会AI应用开发(七)有了大模型为什么还要引入RAG
人工智能·python·大模型·ai编程·ai应用
用户5191495848453 小时前
libcurl Headers API 释放后重利用漏洞:跨请求复用头句柄导致堆内存安全风险
人工智能·aigc
踩蚂蚁3 小时前
自定义语音唤醒词:从训练到部署的完整链路实践
人工智能
用户5191495848453 小时前
CVE-2025-1094 PostgreSQL SQL注入与WebSocket劫持远程代码执行利用工具
人工智能·aigc
IT_陈寒4 小时前
SpringBoot自动配置这个坑,我踩进去又爬出来了
前端·人工智能·后端
冬奇Lab15 小时前
Agent 系列(23):Web Agent——让 Agent 真正浏览网页
人工智能·llm·agent
冬奇Lab15 小时前
每日一个开源项目(第135篇):codebase-memory-mcp - 给 AI Agent 一张代码库的知识图谱
人工智能·开源·llm