Hi-DiT:一文读懂Hybrid Latent-Pixel Diffusion Transformer的本质与技术细节

写在前面

欢迎大家关注Rocky的知乎:Rocky Ding

《三年面试五年模拟》AIGC/LLM/AI Agent算法工程师/开发工程师求职面试秘籍独家资源:【三年面试五年模拟】WeThinkIn/AIGC-Interview-Book,欢迎大家Star~

Rocky最新撰写的10万字AI Agent(AI智能体)深入浅出全维度解析文章: 深入浅出完整解析AI Agent(AI智能体)的核心基础知识

AIGC/LLM/AI Agent算法岗/开发岗求职面试内推学习社群 (涵盖AIGC、LLM大模型、AI Agent、传统深度学习、自动驾驶、机器学习、计算机视觉、自然语言处理、强化学习、大数据挖掘、具身智能、元宇宙、AGI等AI行业最新面试干货经验与核心知识)欢迎大家加入:https://t.zsxq.com/33pJ0


大家好,我是Rocky。

核心导读

图像生成模型一直在两条路之间摇摆。Latent Diffusion Model(LDM)先把图像压缩到 VAE 潜空间,再做扩散,计算量低、全局结构容易学;Pixel Diffusion 直接在像素空间建模,保留了边缘、纹理和文字笔画,却要在同一套参数里同时处理全局布局和高频细节,优化成本很高。Hi-DiT 的价值,恰好落在这条矛盾的交界处:它没有选择一个新的"更大 latent",也没有把整张图像都搬到 pixel 空间,而是让不同时间段使用不同表示。

论文的中心判断是:扩散轨迹本身已经包含了一个天然的任务调度器。高噪声阶段主要决定"画什么、在哪里画",低噪声阶段主要决定"边缘是否锐利、纹理是否真实";因此,模型应该把语义规划交给 latent stream,把高频修复交给 pixel stream,并用时间门控把两者接起来。

论文提出的 Hi-DiT(Hybrid Latent-Pixel Diffusion Transformer)在共享的 Diffusion Transformer 主干中维护两条流:latent stream 始终负责结构和语义,pixel stream 只在低噪声区间注入。像素分支不是重新训练一套完整的 pixel DiT,而是从 Transformer 隐状态出发,经过两级 PixelShuffle 上采样和轻量预测头,输出高频残差,再与 VAE 解码得到的结构底图融合。

在论文报告的 ImageNet 256×256 评测中,Hi-DiT 使用 689M 参数,在 CFG 下取得 FID 1.06;512×512 上 FID 为 1.26;在 MS-COCO 256×256 文生图上,FID 为 5.15。数字说明混合路径有竞争力,但不能把它理解成"只加一个像素头就自动超过所有模型":结果依赖预训练 VAE、DINOv2 表征对齐、两阶段训练、采样器和 CFG 设置,论文也没有给出大规模开放数据或跨 VAE 的系统验证。

问题背景:作者到底想解决什么

latent 的压缩效率和重建上限

设输入图像为 x ∈ R H × W × 3 x\in\mathbb{R}^{H\times W\times3} x∈RH×W×3,VAE 编码器把它映射为 z = E ( x ) z=\mathcal{E}(x) z=E(x)。扩散模型在 z z z 上学习速度场,采样完成后再通过解码器 D \mathcal{D} D 得到图像 x ^ = D ( z ^ ) \hat{x}=\mathcal{D}(\hat{z}) x^=D(z^)。在典型配置中,VAE 的空间下采样因子为 16,256×256 的图像只需要处理 16×16 的 latent token 网格,这正是 LDM 能够扩展到高分辨率的原因。

代价也很明确:压缩不是无损操作。可把原图近似拆成低频结构和高频细节:

x = x L F + x H F , x L F ≈ D ( E ( x ) ) . x=x^{\mathrm{LF}}+x^{\mathrm{HF}},\qquad x^{\mathrm{LF}}\approx\mathcal{D}(\mathcal{E}(x)). x=xLF+xHF,xLF≈D(E(x)).

低频部分包括物体布局、颜色块和大尺度形状,高频部分包括毛发、树叶、织物、边缘、文字笔画等快速变化的信号。VAE 解码器通常可以恢复前者,却会把后者变得柔和。即使换成更强的语义 VAE,扩散过程仍然只在压缩流形里运行,模型没有直接观察最终像素的机会。

pixel 的信息完整性和优化困难

Pixel Diffusion 绕过 VAE,理论上可以直接学习细节。但如果每个像素都成为建模对象,序列长度和显存都会迅速增长;如果把像素组成 patch,又会重新遇到"一个 token 要回归大块高分辨率区域"的问题。更深层的困难是目标干扰:高噪声时模型需要确定全局结构,低噪声时模型需要修正局部纹理,这两个目标在同一套参数、同一个输入尺度上竞争容量。

图 1 把三种范式放在一起比较。LDM 在压缩空间工作,Pixel Diffusion 直接处理原始视觉 token,Hi-DiT 则把 latent 作为结构主线,在后半段接入 pixel 信息。

这张图最值得注意的地方,不是"多了一条支路",而是支路何时参与。Hi-DiT 的设计把表示空间选择从静态架构决策变成了随时间变化的调度决策。

去噪时间为什么可以承担任务分工

论文采用 Flow Matching 作为统一表述。给定干净样本 x 0 x_0 x0 和噪声 ϵ \epsilon ϵ,线性概率路径为:

x t = ( 1 − t ) x 0 + t ϵ , x_t=(1-t)x_0+t\epsilon, xt=(1−t)x0+tϵ,

模型学习速度场 v θ v_\theta vθ:

d x t d t = v θ ( x t , t , c ) , \frac{\mathrm{d}x_t}{\mathrm{d}t}=v_\theta(x_t,t,c), dtdxt=vθ(xt,t,c),

对应的训练目标可以写为:

L F M = E t , c , x 0 , ϵ ∥ v θ ( x t , t , c ) − ( ϵ − x 0 ) ∥ 2 . \mathcal{L}{\mathrm{FM}}=\mathbb{E}{t,c,x_0,\epsilon}\left\\left\\\|v_\\theta(x_t,t,c)-(\\epsilon-x_0)\\right\\\|\^2\\right. LFM=Et,c,x0,ϵ∥vθ(xt,t,c)−(ϵ−x0)∥2.

在高噪声阶段,输入里几乎没有可用纹理,模型首先要建立轮廓、构图和类别语义;在低噪声阶段,结构已经相对稳定,剩余误差更多来自边缘、纹理和局部颜色。这个"粗到细"的时间异质性并非 Hi-DiT 独有的经验观察,但它把一个常被当作采样细节的问题,提升成了架构分工原则。

核心思路:用一句主线串起来

可以把 Hi-DiT 看成一个共享主干的两阶段控制系统:

  1. 早期只走 latent stream。 先在低维、稳定的 VAE 表示中建立全局语义和空间布局。
  2. 跨过阈值后打开 pixel stream。 把与当前噪声水平一致的像素输入编码为 token,与 latent token 在同一个 Transformer 中交互。
  3. latent predictor 保持结构,pixel predictor 生成高频残差。 VAE 解码结果提供低频底图,像素预测头只需补回局部细节。
  4. 下一步继续同步更新。 新的像素状态反馈给下一次低噪声迭代,避免只在最后一步做一次性锐化。

图 2 展示了完整架构。早期阶段只有 latent embedder、共享 Transformer 和 latent predictor;晚期阶段,VAE 解码的结构底图与 pixel embedder 同时进入主干,输出端再分别产生 latent 速度和像素修正。

这是一种"任务分解",不是"模型堆叠"。latent 和 pixel 并非各自运行一遍完整扩散再做结果平均,而是在同一主干中共享参数、共享条件向量和空间对应关系。这样既保留了 latent 的全局建模效率,也让高频分支能够读取语义上下文。

方法展开:沿着论文原始逻辑拆解

1. Latent Stream:先建立可修正的结构底图

输入图像通过预训练 VAE 编码得到 z 0 z_0 z0,再沿概率路径构造 z t = ( 1 − t ) z 0 + t ϵ z_t=(1-t)z_0+t\epsilon zt=(1−t)z0+tϵ。Latent Embedder 把 latent token 投影到 Transformer 隐空间,主干输出经过 Latent Predictor 预测速度场 v θ z v_\theta^z vθz。对应损失为:

L l a t = E t , c , z 0 , ϵ ∥ v θ z ( z t , t , c ) − ( ϵ − z 0 ) ∥ 2 . \mathcal{L}{\mathrm{lat}}=\mathbb{E}{t,c,z_0,\epsilon}\left\\left\\\|v_\\theta\^z(z_t,t,c)-(\\epsilon-z_0)\\right\\\|\^2\\right. Llat=Et,c,z0,ϵ∥vθz(zt,t,c)−(ϵ−z0)∥2.

采样时,模型根据速度估计干净 latent z ^ 0 \hat{z}0 z^0,再得到结构底图 x ^ b a s e = D ( z ^ 0 ) \hat{x}{\mathrm{base}}=\mathcal{D}(\hat{z}_0) x^base=D(z^0)。这个底图的定位很关键:它不是最终图像,而是为像素分支提供稳定的低频锚点。把 pixel predictor 设计成"从纯噪声直接画完整图像",会让它重新承担全局建模负担;让它围绕底图预测残差,问题就从高维分布建模变成了局部误差修复。

2. Pixel Stream:输入使用同噪声水平的像素 token

在门控打开的时间步,Hi-DiT 对真实像素 x x x 施加与 latent 分支一致的噪声调度,构造 x t x_t xt,再通过 Pixel Embedder 得到像素 token。论文把 pixel patch 的大小设为 VAE 下采样因子 p = 16 p=16 p=16,于是 256×256 像素被划分为 16×16 个 patch,与 latent token 保持相同序列长度。每个空间位置都能对应到同一位置的 latent 语义和 pixel 细节。

官方实现中,Pixel Embedder 采用瓶颈结构:先用卷积把 RGB patch 映射到较小的中间维度,再用线性层映射到 Transformer 隐空间。实现还会对 pixel embedding 做随机保留,这相当于给共享主干加入输入级正则,减少模型完全依赖像素支路的风险。

3. High-Frequency Pixel Predictor:先上采样,再预测小子块

直接从一个 16×16 的 token 网格预测完整 256×256 图像,要求每个 token 一次性回归 16×16×3 个像素,回归空间很大。Hi-DiT 改用层级解码:先把 Transformer 隐状态投影成二维特征网格,再连续两次执行卷积和 PixelShuffle,每次把空间分辨率放大 2 倍。两级之后,空间分辨率放大 4 倍,最终线性层只需预测 p / 4 × p / 4 p/4\times p/4 p/4×p/4 的局部子块。

第 i i i 个上采样块的形式为:

G i = SiLU ⁡ ( GroupNorm ⁡ ( PixelShuffle ⁡ ( Conv ⁡ ( G i − 1 ) ) ) ) , i ∈ { 1 , 2 } . \mathbf{G}i=\operatorname{SiLU}\left(\operatorname{GroupNorm}\left(\operatorname{PixelShuffle}\left(\operatorname{Conv}(\mathbf{G}{i-1})\right)\right)\right),\quad i\in\{1,2\}. Gi=SiLU(GroupNorm(PixelShuffle(Conv(Gi−1)))),i∈{1,2}.

特征上采样后,模型用 AdaLN 注入时间和条件信息。令 c ^ \hat{c} c^ 是时间嵌入与类别或文本条件的和,则:

γ , β = MLP ⁡ ( c ^ ) , \\gamma,\\beta=\operatorname{MLP}(\hat{c}), γ,β=MLP(c^),

x H F = Linear ⁡ ( LayerNorm ⁡ ( G 2 ) ⊙ ( 1 + γ ) + β ) . x^{\mathrm{HF}}=\operatorname{Linear}\left(\operatorname{LayerNorm}(\mathbf{G}_2)\odot(1+\gamma)+\beta\right). xHF=Linear(LayerNorm(G2)⊙(1+γ)+β).

这个设计的本质是把"高分辨率预测"拆成两步:卷积负责建立局部空间连续性,线性层负责输出小范围像素。它增加了一个轻量的归纳偏置,也降低了单层线性回归的难度。官方实现对应的 PixelFinalLayer 使用 256 个中间通道、两级 PixelShuffle,并把每个 token 展开成 4×4 的 RGB 子块。

4. Time-Gated Injection:门控的不是输出,而是整个参与时机

令 h z 0 h_z^0 hz0 和 h x 0 h_x^0 hx0 分别表示 latent 与 pixel 的输入嵌入,Hi-DiT 采用硬门控:

h z x 0 = h z 0 + G ( t ) h x 0 , G ( t ) = 1 ( t < τ ) . h_{zx}^0=h_z^0+\mathcal{G}(t)h_x^0,\qquad \mathcal{G}(t)=\mathbb{1}(t<\tau). hzx0=hz0+G(t)hx0,G(t)=1(t<τ).

论文和官方实现都把默认阈值设为 τ = 0.3 \tau=0.3 τ=0.3。当 t ≥ 0.3 t\geq0.3 t≥0.3 时,pixel embedding 不进入主干;当 t < 0.3 t<0.3 t<0.3 时,pixel embedding 才与 latent embedding 融合。这里的时间方向与"噪声多少"的直觉容易混淆:论文将 t = 0 t=0 t=0 视为干净端、 t = 1 t=1 t=1 视为噪声端,所以 t < τ t<\tau t<τ 对应低噪声阶段。

输出端也遵循相同调度。latent 预测得到的结构底图与高频残差相加:

x f i n a l = D ( z ^ 0 ) + 1 ( t < τ ) x H F . x_{\mathrm{final}}=\mathcal{D}(\hat{z}_0)+\mathbb{1}(t<\tau)x^{\mathrm{HF}}. xfinal=D(z^0)+1(t<τ)xHF.

门控带来的收益有两层。第一,早期主干不必同时承担语义布局和像素细节,减少容量竞争;第二,像素分支从训练开始就只在它真正有信息价值的区间接收梯度,避免在高噪声输入上学习没有意义的纹理。

5. 优化与两阶段训练:先把主干训练成 LDM,再学像素修复

Hi-DiT 的总损失由 latent 去噪损失和 pixel 重建损失组成:

L p i x = λ r e c ∥ x f i n a l − x G T ∥ 2 + λ p e r LPIPS ⁡ ( x f i n a l , x G T ) , \mathcal{L}{\mathrm{pix}}=\lambda{\mathrm{rec}}\|x_{\mathrm{final}}-x_{\mathrm{GT}}\|^2+\lambda_{\mathrm{per}}\operatorname{LPIPS}(x_{\mathrm{final}},x_{\mathrm{GT}}), Lpix=λrec∥xfinal−xGT∥2+λperLPIPS(xfinal,xGT),

L t o t a l = L l a t + 1 ( t < τ ) L p i x . \mathcal{L}{\mathrm{total}}=\mathcal{L}{\mathrm{lat}}+\mathbb{1}(t<\tau)\mathcal{L}_{\mathrm{pix}}. Ltotal=Llat+1(t<τ)Lpix.

论文实验还引入 DINOv2 表征对齐损失帮助 latent 主干学习语义结构。官方代码给出的训练流程更具体:第一阶段用 ldm-only 模式冻结并跳过 pixel 模块,只训练 latent 主干和表征对齐;第二阶段从第一阶段检查点继续训练,解冻 pixel predictor,在低噪声样本上加入 MSE 与 LPIPS 像素损失。这样的顺序避免了随机初始化的像素头反向干扰尚未稳定的语义主干。

这里有一个值得工程团队注意的边界:论文表述的是"联合优化",仓库实际提供的是先 latent、后 pixel 的分阶段脚本。二者并不矛盾,但复现时不能只照抄模型结构;训练阶段、冻结策略、latent 统计量和 VAE 权重都属于方法的一部分。

6. 推理:跨过阈值时用 VAE 解码结果初始化 pixel 状态

采样从 latent 噪声开始。当第一步进入 t < τ t<\tau t<τ 的区间,模型把当前仍带噪的 latent 状态解码为像素输入:

x t 0 d e c = D ( z t 0 ) . x_{t_0}^{\mathrm{dec}}=\mathcal{D}(z_{t_0}). xt0dec=D(zt0).

随后,pixel predictor 输出高频修正,像素状态按下式递推:

x t − 1 i n p u t = x t d e c + x H F . x_{t-1}^{\mathrm{input}}=x_t^{\mathrm{dec}}+x^{\mathrm{HF}}. xt−1input=xtdec+xHF.

这一步保证了训练和推理看到的 pixel 输入具有相同的噪声语义。官方采样脚本还区分 ODE 与 SDE:SDE 路径会调用 pixel refinement 并以约 0.46 的默认权重融合解码结果和 pixel prediction;ODE 路径则保留 latent-only 兼容路径。因此,论文的指标不能脱离采样模式、步数、CFG 区间和像素融合权重理解。

实验与证据:结果能支撑到什么程度

ImageNet 256×256:收益来自混合路径,而不只是参数规模

论文在 ImageNet 256×256 上使用 50,000 个生成样本,比较 AR、latent diffusion 和 pixel diffusion。结果如下,Hi-DiT 的 689M 参数明显少于 2B 的 JiT-G。

模型 类型 参数量 FID(无 CFG) IS(无 CFG) FID(CFG) IS(CFG)
DiT-XL Latent Diffusion 675M 9.62 121.5 2.27 278.2
SiT-XL Latent Diffusion 675M 8.61 131.7 2.06 270.3
VA-VAE Latent Diffusion 675M 2.17 205.6 1.35 295.3
REPA Latent Diffusion 675M 5.78 158.3 1.29 306.3
PixelDiT Pixel Diffusion 797M --- --- 1.61 292.7
JiT-G Pixel Diffusion 2B --- --- 1.82 292.6
Hi-DiT(CFG=2.4) Latent+Pixel 689M 1.66 213.6 1.06 296.6
Hi-DiT(CFG=3.0) Latent+Pixel 689M 1.66 213.6 1.10 319.4

无 CFG 时 FID 1.66,说明收益并非完全依赖指导强度;CFG=2.4 时 FID 1.06,CFG=3.0 时 IS 上升到 319.4 但 FID 略升。这个结果提醒我们,FID、IS、Precision、Recall 衡量的是不同维度,不能只拿一个最低 FID 宣布模型全面胜出。

ImageNet 512×512:结构设计具有分辨率扩展能力

方法 类型 FID IS Precision Recall
VAR AR 2.63 303.2 --- ---
xAR AR 1.70 281.5 --- ---
DiT Latent Diffusion 3.04 240.8 0.84 0.54
SiT Latent Diffusion 2.62 252.2 0.84 0.57
REPA Latent Diffusion 2.08 274.6 0.83 0.58
ADM Pixel Diffusion 3.85 221.7 0.84 0.53
SiD2 Pixel Diffusion 1.50 --- --- ---
JiT-G Pixel Diffusion 1.78 306.8 --- ---
Hi-DiT(CFG=4.6) Latent+Pixel 1.26 295.0 0.80 0.62
Hi-DiT(CFG=5.8) Latent+Pixel 1.31 310.2 0.80 0.61

512×512 的结果支持了"latent 负责全局、pixel 负责细节"的可扩展性判断,但仍然是 ImageNet 类别条件生成。它证明的是在相近实验设定下的分辨率扩展,不等价于已经解决开放域高分辨率文生图。

MS-COCO 文生图:轻量配置也能受益

在 MS-COCO 256×256 上,Hi-DiT 采用与 U-ViT-S/2(Deep)接近的轻量主干,使用 30,000 个验证集文本提示评测:

类型 模型 FID
GAN AttnGAN 35.49
GAN DM-GAN 32.64
GAN XMC-GAN 9.33
AR AutoNAT-S 5.36
AR MAR 6.36
Diffusion VQ-Diffusion 19.75
Diffusion Frido 8.97
Diffusion U-ViT-S/2 5.48
Diffusion Hi-DiT 5.15

这里的提升幅度比 ImageNet 更克制,但它说明混合路径并不只适用于类别标签。latent stream 提供文本条件下的语义布局,pixel stream 负责局部边缘和纹理,二者在小模型上仍有协同空间。

图 3 给出了 ImageNet 和 MS-COCO 的定性比较。视觉样例能帮助理解伪影和细节差异,但它不能替代大规模统计;更严格的判断应结合 FID、Precision/Recall、样本数和采样设置。

消融:真正有贡献的是三件事的组合

论文在相同设置下训练 80 个 epoch,逐步加入 latent 输入和高频 Pixel Predictor:

Latent 输入 Pixel Predictor 参数量 FID ↓
✗ MLP 682M 3.38
✓ MLP 682M 1.74
✓ HF Pixel Predictor 689M 1.65

从 3.38 降到 1.74,主要说明 latent scaffold 让 pixel-space 优化更容易;从 1.74 降到 1.65,说明层级上采样比直接 MLP 回归更适合高频细节。参数只增加 7M,却带来可测的改善,这比单纯扩大主干更能支持"结构设计有效"的判断。

阈值消融:门控太早和太晚都会伤害模型

门控阈值 τ \tau τ FID ↓ Inception Score ↑
0.7 1.73 264.3
0.5 1.68 266.1
0.3 1.65 267.7
0.1 1.75 265.8

τ = 0.7 \tau=0.7 τ=0.7 时 pixel 分支过早进入,主干重新面对语义和纹理的容量竞争; τ = 0.1 \tau=0.1 τ=0.1 时 pixel 分支介入太晚,来不及参与足够多的细节修复。最佳点在 0.3 附近,支持了"门控本身是方法核心"的说法,但表格只测试了四个离散值,不能证明 0.3 在所有数据集、VAE 和采样器上都是通用最优。

成本:质量提升换来小幅显存和延迟增加

模型 Epoch FID ↓ 每 epoch 时间 ↓ 每图时间 ↓ 峰值显存
SiT 1400 2.06 17.1 min 1.52 s 32.90G
VA-VAE 800 1.35 17.7 min 1.58 s 34.43G
Hi-DiT 800 1.06 18.1 min 1.67 s 35.52G

在论文的实验环境下,Hi-DiT 每张图推理时间比 SiT 增加约 0.15 秒,峰值显存增加约 2.6G。它把额外成本集中在低噪声阶段,而不是整条轨迹都运行 pixel 分支,这正是时间门控的工程意义:用有限的后段计算换取高频质量。

图 4 展示了不同 CFG 下的 FID--IS 曲线。Hi-DiT 的曲线整体位于更优区域,说明优势并非只由单个 CFG 点制造。但曲线依然依赖各模型的实现、采样步数和指导范围,跨论文横向比较时需要保持这些条件一致。

这篇工作的边界与可复现性

第一,论文仍然依赖一个强 VAE。 Hi-DiT 可以绕过 VAE 的高频重建上限,却没有消除 VAE 对 latent 语义和结构的依赖。VAE 的下采样倍率、latent 通道数、归一化统计量都会改变 token 对齐和训练稳定性。若换成另一个 VAE, p = 16 p=16 p=16 的 patch 对齐和默认阈值都需要重新验证。

第二,pixel 分支不是免费增强。 低噪声阶段需要额外的像素编码、Transformer 激活和高分辨率预测,显存与延迟都会上升。论文报告的 1.67 秒/图来自 8 张 A100 的特定实验环境,不能直接当作消费级 GPU 或在线服务的端到端延迟。

第三,指标覆盖仍然有限。 ImageNet 结果是类别条件生成,MS-COCO 只报告 FID;论文没有系统评估复杂文字渲染、长尾概念、人体手部、极端宽高比、编辑一致性或多轮生成。定性图显示细节改善,但不足以证明开放域产品质量已经达到同等水平。

第四,复现依赖训练阶段和采样路径。 官方实现把训练拆成 latent-only 与 pixel finetuning 两步,并在 SDE 采样时执行像素融合;如果把两阶段合并、跳过 DINOv2 对齐,或只走 ODE latent-only 路径,得到的模型并不是论文报告的同一系统。仓库还需要预处理 ImageNet HDF5、缓存 VAE latent、保存 latent 统计量,并准备 8×A100 规模的训练资源。

第五,门控函数仍是手工硬阈值。 1 ( t < τ ) \mathbb{1}(t<\tau) 1(t<τ) 简单、可解释、容易复现,但它把真实连续的频率变化近似成了二元开关。更细致的做法可能是让门控随样本内容、频率残差或不确定性动态变化;这也是 Hi-DiT 从"阶段分工"走向"可学习调度"的自然下一步。

如果继续研究或落地,应该关注什么

对算法工程师:把表示空间选择做成可测量的调度问题

下一步不应只问"latent 还是 pixel",而应测量每个时间步的结构误差、频率误差、语义一致性和边际算力收益。可以把门控从固定 τ \tau τ 扩展为 g ( t , x t , c ) g(t,x_t,c) g(t,xt,c),让模型根据当前样本决定是否注入 pixel token;也可以只对高频残差大的区域启动局部 pixel 分支,避免对整张图做全分辨率处理。

对系统工程师:把后段计算预算纳入采样器设计

Hi-DiT 的思想适合和自适应步长、蒸馏、缓存、区域注意力结合。高噪声阶段保持高吞吐 latent 路径,低噪声阶段只为难修复区域增加计算,可能比"所有步都使用同一分辨率和同一主干"更适合在线生成。真正的系统指标应同时报告 FID、每图 FLOPs、峰值显存、首图延迟和批量吞吐。

对产品团队:高频细节要绑定用户可感知的失败类型

模型指标提升只有转化成可感知的质量才有产品价值。文字渲染、细线图标、商品材质、人物五官和局部编辑,是最适合检验 pixel refinement 的场景。建议把评测集按失败类型拆分,而不是只使用一个平均 FID;如果用户主要抱怨构图错误,增加 pixel 分支未必比改善文本条件或 latent 语义更有效。

对研究判断:把"混合"看作时间分工,而不是模块相加

Hi-DiT 最有价值的启发是,扩散模型的表示空间不必在整个轨迹里保持不变。未来的生成系统可能同时使用 latent、pixel、patch、频域和区域 token,但每种表示只在它最擅长的时间段和空间范围内出现。长期看,护城河不在于多接一条分支,而在于能否建立稳定的任务调度、训练信号和成本闭环。

术语与概念速查

术语 含义
LDM 在 VAE 压缩后的 latent 空间执行扩散,计算高效但受重建细节上限约束。
Pixel Diffusion 直接在像素或像素 patch 空间去噪,细节信息完整但优化和计算更困难。
Flow Matching 学习从噪声分布到数据分布的连续速度场,Hi-DiT 用 v-prediction 训练。
Latent Stream 处理 VAE latent,承担全局布局、语义和低频结构。
Pixel Stream 处理带噪像素 token,主要在低噪声阶段补高频细节。
Time-Gated Injection 通过 1 ( t < τ ) \mathbb{1}(t<\tau) 1(t<τ) 控制 pixel token 何时进入共享主干。
HF Pixel Predictor 通过卷积、PixelShuffle、AdaLN 和局部线性层预测高频像素残差。
CFG Classifier-Free Guidance,通过条件与无条件预测的差异增强条件一致性。
FID 比较生成图像与真实图像特征分布的距离,越低越好。
IS 综合图像可识别性与类别多样性,越高越好,但不能单独代表细节质量。

拓展思考:值得继续扩展研究与思考的创新点

  1. 连续门控。 把硬阈值改为可学习的连续权重,让 pixel 分支平滑地从 0 过渡到 1,并研究门控是否可以由频谱能量、重建残差或语义不确定性驱动。
  2. 区域级高频路由。 只在文字、边缘、脸部或纹理密集区域启用 pixel token,其他区域继续使用 latent token,形成空间和时间二维的稀疏调度。
  3. VAE 与 pixel 分支联合适配。 让 VAE 专注可逆的低频结构,pixel 分支专门承担不可压缩的细节,研究两者的码率、重建和扩散损失如何共同优化。
  4. 蒸馏与少步采样。 Hi-DiT 把计算集中在后段,适合研究后段专用蒸馏器,减少 50 步采样下的额外调用次数,同时保留细节修复能力。
  5. 更严格的开放域评测。 除了 FID 和 IS,还应加入文字准确率、局部感知质量、频率保真度、编辑前后身份一致性、不同宽高比和真实用户偏好。
  6. 统一视觉生成接口。 当 latent、pixel 和频域 token 都可以按阶段调度时,Diffusion Transformer 更像一个可编排的视觉计算平台,而不是固定输入输出的单一网络。

结语:真正的创新,是给模型一张时间表

Hi-DiT 没有试图证明 latent diffusion 已经过时,也没有把 pixel diffusion 包装成无成本的升级。它承认两条路线各自擅长不同任务,再利用去噪时间把任务分开:latent 负责先把世界组织起来,pixel 负责最后把世界变清楚。

这背后的研究判断比 1.06 的 FID 更值得记住:生成模型的下一轮效率提升,可能来自"何时使用什么表示",而不仅是"把同一表示做得更大"。 当模型开始拥有一张可学习的时间表,架构设计就从静态堆模块,进入了动态分配计算和信息的阶段。

推荐阅读

1. 深入浅出完整解析AI Agent(AI智能体)的核心基础知识

2025年可以说是AI Agent全面落地应用的元年,因此Rocky在持续撰写对AI Agent的全维度解析文章:

深入浅出完整解析AI Agent(AI智能体)的核心基础知识

2. 深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识

Rocky对扩散模型的本质原理与和核心基础知识进行了全面系统的深入浅出分析讲解,同时不断跟进补充扩散模型的最新技术发展,希望能给大家带来帮助:

深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识

3. 入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识

Rocky对AIGC时代"中场时刻"之后的主流AIGC创作大模型的核心基础知识进行了全面系统的深入浅出分析讲解,力求让大家通俗易懂理解AIGC时代的技术浪潮的本质价值:

入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识

4. 深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识

Rocky对FLUX.1 Kontext和FLUX.1 Krea的核心基础知识作了全面系统的梳理与解析:

深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识

5. 深入浅出完整解析DeepSeek系列核心基础知识

Rocky对DeepSeek系列模型的核心基础知识作了全面系统的梳理与解析:

深入浅出完整解析DeepSeek系列核心基础知识

6. 深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识

Rocky对Stable Diffusion 3和FLUX.1的核心基础知识作了全面系统的梳理与解析:

深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识

7. 深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识

Rocky对Stable Diffusion XL的核心基础知识作了全面系统的梳理与解析:

深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识

8. 深入浅出完整解析Stable Diffusion(SD)核心基础知识

Rocky对Stable Diffusion 1.x-2.x系列模型的核心基础知识做了全面系统的梳理与解析:

深入浅出完整解析Stable Diffusion(SD)核心基础知识

9. 深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识

Rocky对Stable Diffusion中最为关键的U-Net结构进行了深入浅出的全面解析,包括其在传统深度学习中的价值和在AIGC中的价值:

深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识

10. 深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识

对于AIGC时代中的"ResNet"------LoRA模型,Rocky进行了深入浅出的全面讲解:

深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识

11. 深入浅出完整解析ControlNet核心基础知识

AIGC图像创作开源社区已经形成以Stable Difffusion/FLUX为核心,ConrtolNet和LoRA作为首要AI辅助工具的变化万千的AIGC图像创作工作流。

ControlNet正是让AI图像创作社区无比繁荣的关键一环,它让AIGC图像创作过程更加的可控,更有助于广泛地将AIGC算法解决方案应用到各行各业中:

深入浅出完整解析ControlNet核心基础知识

12. 深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识

AI绘画和AI视频是两个互相促进、相互交融的领域,2024年无疑是AI视频领域的爆发之年,Rocky对AI视频领域核心的Sora、Seedance、Keling等大模型进行了全面系统的梳理与解析:

深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识

13. 深入浅出完整解析AIGC时代Transformer核心基础知识

在AIGC时代中,Transformer为AI行业带来了深刻的变革。Transformer架构正在一步一步重构所有的AI技术方向,成为AI技术架构大一统与多模态整合的关键核心基座,大有一统"AI江湖"之势。Rocky也对Transformer模型进行持续的深入浅出梳理与解析:

深入浅出完整解析AIGC时代Transformer核心基础知识

14. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识

AIGC创作框架正是AIGC算法工作流的运行载体,目前主流的AIGC创作框架有ComfyUI、Diffusers、Stable Diffusion WebUI等 。在传统深度学习时代,PyTorch、TensorFlow以及Caffe是传统深度学习模型的基础运行框架,到了AIGC时代,Rocky相信ComfyUI就是AIGC时代的"PyTorch"、Stable Diffusion WebUI就是AIGC时代的"TensorFlow"、Diffusers就是AIGC时代的"Caffe":

深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识

15. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识

在AIGC时代中,如何快速转身,入局AIGC产业?如何成为AIGC/LLM/AI Agent算法/开发工程师?如何在学校中系统性学习AIGC/LLM/AI Agent知识,斩获心仪的AIGC/LLM/AI Agent算法/开发offer?

Don't worry,Rocky为大家总结整理了全面的AIGC/LLM/AI Agent算法/开发工程师成长秘籍,为大家答疑解惑,希望能给大家带来帮助:

手把手教你成为AIGC/LLM/AI Agent算法/开发工程师,斩获AIGC/LLM/AI Agent算法/开发offer!

16. AIGC产业的深度思考与分析

2023年3月21日,微软创始人比尔·盖茨在其博客文章《The Age of AI has begun》中表示,自从1980年首次看到图形用户界面(graphical user interface)以来,以OpenAI为代表的科技公司发布的AIGC模型是他所见过的最具革命性的技术进步。

Rocky也认为,AIGC及其生态,会成为AI行业重大变革的主导力量。AIGC会带来一个全新的红利期,未来随着AIGC的全面落地和深度商用,会深刻改变我们的工作、生活、学习以及交流方式,各行各业都将被重新定义,过程会非常有趣。

那么,在此基础上,我们该如何更好的审视AIGC的未来?我们该如何更好地拥抱AIGC引领的革新?Rocky准备从技术、产品、商业模式、长期主义等维度持续分享一些个人的核心思考与观点,希望能帮助各位读者对AIGC有一个全面的了解:

深入浅出全面解析AIGC时代核心价值与发展趋势(2025年版)

17. AI算法工程师的独孤九剑秘籍

为了方便大家实习、校招以及社招的面试准备,同时帮助大家提升扩展技术基本面,Rocky将符合大厂和AI独角兽价值的算法高频面试知识点撰写总结成《三年面试五年模拟》之独孤九剑秘籍:

【三年面试五年模拟】AIGC时代的算法工程师的求职面试秘籍(持续更新中)

18. 深入浅出完整解析AIGC时代中GAN(Generative Adversarial Network)系列模型核心基础知识

GAN系列模型作为传统深度学习时代的最热门生成式Al模型,在AIGC时代继续繁荣,作为Stable Diffusion/FLUX系列大模型的"得力助手",广泛活跃于AlGC图像创作的产品与工作流中:

深入浅出完整解析AIGC时代中GAN(Generative Adversarial Network)系列模型核心基础知识

相关推荐
勤劳X码农1 小时前
2026年学生配音软件怎么选?免费AI配音指南
人工智能
鬼手点金1 小时前
opencode组件详解-安装方式
人工智能·python·优化器·分析器·nanogpt
武子康1 小时前
Cosmos Curator 清洗视频时,哪些片段应该留下?
人工智能·llm·agent
AI浩1 小时前
Migician:揭示多模态大语言模型中自由形式多图定位的魔力
人工智能·语言模型·自然语言处理
三声三视1 小时前
周日晚九点半,两份 JD 喂进 tri-jobhunt:全中的那份和缺一项的,都拿了 70 分
人工智能·ai·skillhub·tri-skill·tri-jobhunt
硅谷秋水1 小时前
从语言模型到作用于世界的系统:智能体AI在数字、社交、虚拟及物理环境中的进展与局限
人工智能·机器学习·语言模型·自然语言处理
乃嘿仔1 小时前
AI 热点日报 · 2026-09-27
人工智能
weixin_177297220691 小时前
成立三年估值80亿美元:法律AI公司Harvey给中国企业的四个启发
大数据·人工智能
镭封1 小时前
从人工到AI:短视频配音方式正在发生哪些变化
人工智能·音视频·语音识别·媒体