猜测了一个sora模型结构

如果是上述的这种结构,可以确定的是patch 的size (一个图像的小片)是固定大小的

那么调节一个视觉分辨率大小通过patchs的大小决定。

如图所示可以证明输入的时候图片没有本物理人为的分割为小片,是通过一个模型进行分割为

小片。

通过上面两个图也可以证明patchs 是后分的,且patch 大小是固定的

patchs 的大小决定了视觉分辨率。

这个模型整体分为 外围的扩散模型和中间的自回归模型两个部分下图可以证明

还有一点能证明使用了视觉自回归,就是后面的各种功能,比如给定一个图生成视频,这个时候

只需要扩散模型输入最后一步t方可像生成token 一样生成视频 最后输出方可。

一些输入图像以少生成多的都是自回归生成的 类似mask

总结就是 dif(扩散)模型 中间夹个vit模型 所以大部分人都

相关推荐
冬奇Lab12 分钟前
开源项目第184期:MiroFish — 盛大出品的群体智能预测引擎,用数千 AI Agent 模拟社会演化来预测未来
人工智能·开源·资讯
科研小刘带你玩学术24 分钟前
【IEEE论文解析】深度强化学习如何优化未来智能无线通信系统?
人工智能·边缘计算·无线通信·6g·深度强化学习·智能系统·ieee论文
LyridRelan29 分钟前
Skill Cli MCP 的三者关系以及部分Q&A
人工智能·ai·个人开发
我就是妖怪34 分钟前
KMP全栈开发:从Android到AI Agent的技术演进与实践
android·人工智能
夏沫的梦35 分钟前
用 TRAE Work 3 小时搞定 3 天工作量:一场竞品调研报告的实战复盘
人工智能
等一朵映山红41 分钟前
多模态向量库选型:ChromaDB 适配图文多模态数据实战
人工智能
zhangfeng11331 小时前
2026-08-10/11 AI 领域重要动态筛选(侧重 AI coding 与具身智能)
人工智能·microsoft
leoZ2311 小时前
Vue3 还原一个企业级后台-01-项目背景与选题
图像处理·人工智能·chatgpt·智慧城市·边缘计算·openvino·dreamfusion
ltqvibe1 小时前
企业数智化中台的五层架构——AI框架为什么需要纵向贯通
大数据·人工智能·架构