漫话大模型:Sora 之后,所有视频模型都在抄同一个剧本:DiT2024 年 2 月,Sora 发布,全世界第一次看到 AI 生成的 60 秒连贯视频。同一年,一篇 2022 年的老论文突然被翻出来顶礼膜拜。这篇论文叫《Scalable Diffusion Models with Transformers》,作者是两位刚从博士毕业的年轻人 William Peebles 和 Saining Xie。他们在论文里提出了一种叫 DiT(Diffusion Transformer,扩散 Transformer)的架构。