写在前面

欢迎大家关注Rocky的知乎:Rocky Ding
《三年面试五年模拟》AIGC/LLM/AI Agent算法工程师/开发工程师求职面试秘籍独家资源:【三年面试五年模拟】WeThinkIn/AIGC-Interview-Book,欢迎大家Star~
Rocky最新撰写的10万字AI Agent(AI智能体)深入浅出全维度解析文章: 深入浅出完整解析AI Agent(AI智能体)的核心基础知识
AIGC/LLM/AI Agent算法岗/开发岗求职面试内推学习社群 (涵盖AIGC、LLM大模型、AI Agent、传统深度学习、自动驾驶、机器学习、计算机视觉、自然语言处理、强化学习、大数据挖掘、具身智能、元宇宙、AGI等AI行业最新面试干货经验与核心知识)欢迎大家加入:https://t.zsxq.com/33pJ0
大家好,我是Rocky。
核心导读:生成顺序本身就是一种模型设计
把图像变成离散 token,再交给 Transformer,是否就必须像写文章一样从左到右,一个接一个生成?MaskGIT 给出的研究答案十分清晰:图像可以先在全局范围提出候选,再按照置信度逐步确定内容。决定推理延迟的因素因此增加了一个新的维度------哪些位置必须等待,哪些位置可以同时计算。
2022 年的 MaskGIT 使用双向注意力预测被随机遮住的视觉 token,再用掩码比例调度控制每轮保留多少预测。在 ImageNet 256×256 上,它用 227M 参数、8 轮生成获得 FID 6.18;相同规模与设置的 VQGAN 自回归基线是 256 步、FID 18.65。这组对照比单独强调"最高 64 倍加速"更能说明问题:把训练时的条件形式与推理时的生成顺序共同改造,可以同时改变质量和延迟。

图 1 展示的三类任务有共同结构:给出已知视觉内容或类别条件,补全未知视觉 token。但它们的实验条件并不相同。类别生成主要使用 ImageNet;图像补全的系统评测使用在 Places2 上训练的模型。这里没有一个可以自由理解自然语言指令的文本编码器,不能把这篇论文直接称为通用文生图或任意指令编辑系统。
Rocky认为,这篇工作的跨周期价值在于建立了一种可复用的设计方法:把生成视为逐步解决不确定性的过程,将并行性放进模型训练目标,而不只是等模型训练完成后再做算子优化。它也提出了一个持续影响离散生成研究的问题:置信度驱动的确定顺序,能否比固定空间顺序更适合图像?
本文对应 arXiv:2202.04200v1。下文区分论文实验、官方实现细节与技术推导,保留正文和附录的完整图表证据。
1. 图像 token 的空间依赖,为何不必服从扫描顺序
标准光栅扫描自回归将二维图像 token 网格展平成序列。若类别条件为 c c c,其概率分解可以写成:
p θ ( Y ∣ c ) = ∏ i = 1 N p θ ( y i ∣ y < i , c ) . p_\theta(Y\mid c)=\prod_{i=1}^{N}p_\theta(y_i\mid y_{<i},c). pθ(Y∣c)=i=1∏Npθ(yi∣y<i,c).
这条公式是对自回归机制的说明。它让训练目标和联合概率分解十分明确,但在通常的一次预测一个 token 的采样实现中,第 i + 1 i+1 i+1 个位置需要等待第 i i i 个位置确定。图像中一只鸟的头部、翅膀和背景,未必恰好按照这个空间顺序依赖。
MaskGIT 让待预测位置同时看到已知 token 的双向上下文。一轮前向即可为多个未知位置输出分布,再把一部分预测转成下一轮的条件。这样的局部条件建模不等于沿某个固定序列精确计算完整图像的自回归似然,二者的概率解释需要分开。

图 2 中,浅色位置尚未确定,深色位置已经确定。MaskGIT 的已确定区域散布在画面各处,反映的是生成置信度,而不是一个从左上向右下移动的写入指针。图中 8 轮与 256 轮是神经网络执行次数的比较;一次双向全序列计算与一次带缓存的自回归计算,单步成本不相同。
这还意味着,图像编辑能力来自"已知区域能够从各方向成为条件"。不能据此推论所有自回归模型都无法编辑:改变 token 排列、条件接口或训练任务,也能设计具有补全能力的自回归系统。MaskGIT 说明的是其双向掩码形式让这个接口更直接。
2. 两阶段架构:压缩图像与预测语义各自承担什么

第一阶段学习 VQGAN 图像 tokenizer,将连续图像压缩为离散代码,再由解码器恢复像素。第二阶段固定这种视觉表示,用双向 Transformer 学习被遮挡 token 的条件分布。前者决定重建瓶颈,后者决定在这个表示空间中能生成什么。
论文在每个数据集上训练一个 tokenizer,训练分辨率为 256×256,空间下采样倍数为 16,码本包含 1024 个条目。于是,256×256 输入对应 16×16,也就是 256 个 token 位置;512×512 对应 32×32,也就是 1024 个位置。码本大小与序列长度是两个量:一个是每个位置可选多少视觉符号,一个是需要填写多少位置。
这层压缩对并行生成非常关键。直接在数十万个像素位置上预测,会有完全不同的计算规模;离散 token 把空间成本降下来,也把局部纹理重建的一部分职责交给 tokenizer。生成结果中的小字、人脸细节或结构失真,可能同时受到压缩表示和第二阶段预测的影响。
第二阶段的主要配置是 24 层、8 个注意力头、768 维嵌入与 3072 维前馈层,总参数约 227M,使用可学习位置嵌入、LayerNorm、0.1 dropout 和 0.1 label smoothing。训练采用 Adam,动量系数为 0.9/0.96,批量 256,使用 4×4 TPU;ImageNet 训练 300 个 epoch,Places2 训练 200 个 epoch。数据增强包括 RandomResizeAndCrop。
这些配置说明,论文主要研究的是生成目标和采样顺序的改变,而不是依靠一个远大于基线的 Transformer 赢得比较。复现时仍应同时记录 tokenizer、网络、掩码分布和采样温度,单独匹配 227M 参数并不充分。
3. 掩码训练:模型真正学习的是哪些条件分布
给定离散 token 网格 Y Y Y,训练随机采样 r ∈ [ 0 , 1 ) r\in[0,1) r∈[0,1),通过递减函数 γ ( r ) \gamma(r) γ(r) 决定遮挡比例,遮住约 ⌊ γ ( r ) N ⌋ \lfloor\gamma(r)N\rfloor ⌊γ(r)N⌋ 个位置。 γ ( 0 ) = 1 \gamma(0)=1 γ(0)=1、 γ ( 1 ) = 0 \gamma(1)=0 γ(1)=0,使模型在训练中既见到几乎空白的画面,也见到只缺少少数局部内容的画面。
原论文公式(1)为掩码位置上的交叉熵目标:
L m a s k = − E Y ∈ D ∑ i : m i = 1 log p θ ( y i ∣ Y ‾ M ) . \mathcal L_{\mathrm{mask}}=-\mathbb E_{Y\in\mathcal D}\left\\sum_{i:m_i=1}\\log p_\\theta(y_i\\mid \\overline Y_M)\\right. Lmask=−EY∈Di:mi=1∑logpθ(yi∣YM).
其中, Y ‾ M \overline Y_M YM 是被掩码替换后的输入, m i = 1 m_i=1 mi=1 表示第 i i i 个位置被遮挡。公式将掩码采样隐含在训练过程中;实现上需要随机采样掩码集合。类别条件可以额外输入,公式为简洁起见省略。
损失只要求模型恢复被遮住的视觉 token,已知位置承担上下文作用。相较只训练一种固定遮挡率,这种分布覆盖让模型适配从全局构图到局部填充的不同信息状态。因此,训练阶段的掩码分布与推理阶段的轨迹必须共同考虑。
这里有一个容易忽略的统计边界:不同掩码调度会改变训练任务的难度和条件信息量。一个经常只遮少量 token 的模型可能获得较低的掩码 NLL,却不能据此推论它从全掩码状态开始生成更好。论文后面的消融正好给出了这种现象。
4. 掩码并行解码:每轮都预测,再选择哪些预测成为事实
推理从全部未知的位置开始。每轮首先用当前可见 token 作为条件,为未知位置同时预测类别分布,再从每个分布中采样一个 token。接着计算这些候选的置信度,确定本轮保留哪些结果,其余位置继续保持掩码,进入下一轮。
置信度是所采样 token 在对应分布中的概率。若某个位置采样到的 token 并非概率最大的选项,不能把该位置的置信度偷换成最大概率。已知位置在论文描述中被赋予高置信度,以避免它们重新被当成未知位置处理。
原论文还给出一个未编号的掩码更新式。设下一轮需要保留 n = ⌊ γ ( t / T ) N ⌋ n=\lfloor\gamma(t/T)N\rfloor n=⌊γ(t/T)N⌋ 个未知位置,按置信度从小到大排序,可以用阈值写为:
m i ( t + 1 ) = { 1 , c i < c ( n ) , 0 , c i ≥ c ( n ) . m_i^{(t+1)}=\begin{cases}1,&c_i<c_{(n)},\\0,&c_i\ge c_{(n)}.\end{cases} mi(t+1)={1,0,ci<c(n),ci≥c(n).
这里保留原文的阈值写法, c ( n ) c_{(n)} c(n) 表示对应排序位置的置信度。它表达的是"低置信度继续遮住",但等值概率、索引起点和边界需要实现作出明确处理。不能只照抄一个比较符号就声称完整复现采样器。
官方开源实现使用 (step + 1) / num_iter 计算进度,按照最初未知位置数计算后续掩码长度,因此也支持局部补全;对已知 token 使用特殊高置信度保护,并在选择掩码位置时引入随机扰动。随机选择温度随生成进度降低,让早期探索更充分、后期更确定。
一个细节尤其有工程价值:代码先把当轮完整采样结果保存到输出轨迹,再构造下一轮的掩码状态。内部为了循环稳定保留至少一个掩码,并不意味着最终输出还缺一个 token;最终返回的是重新掩码之前保存的完整候选。调试时必须区分"下一轮状态"和"本轮可解码的图像"。
论文的直觉是:早期只确定少量可靠结构,随后已有条件越来越丰富,一次可以确定更多内容。已接受的位置通常被固定,所以早期错误也可能成为后续条件。这种方法并没有保证全局一致性,更没有保证每轮画质都单调改善。
5. MaskGIT 的速度:并行轮数减少,不代表分辨率免费

图 4 在单 GPU 上比较不同 token 长度的 Transformer 解码时间。256 token 设置中,自回归基线约 4.61 秒,MaskGIT 约 0.12 秒;1024 token 设置约 29.96 秒对 0.46 秒。论文据此报告约 30--64 倍加速范围。图中的 MaskGIT 运行时间设置采用 8 轮,不能把它与主表 512 分辨率的 12 轮质量结果自动组合成同一工作点。
延迟优势来自串行依赖深度的大幅缩短,但每轮仍需要计算 token 序列上的双向注意力。空间分辨率增加会增加序列长度、注意力计算和显存占用。"迭代轮数可以固定"不能推导出"整张图的计算量与分辨率无关"。
此外,这张图比较的是论文当时的自回归 Transformer 解码基线,不是包含输入处理、图像编解码、传输、并发排队和后处理的产品端到端延迟,也不是对所有后来优化的自回归实现作出的永久结论。
对工程团队,正确的测试至少应同时记录分辨率、token 数、迭代轮数、批量、设备、峰值显存、tokenizer 解码时间和质量指标。少报其中一项,都可能让"更快"失去可复用意义。
6. ImageNet 生成证据:最有解释力的是匹配基线
表 1 保留原论文主要定量比较。□ 表示取自既有论文;VQGAN* 是作者用相同架构规模和设置训练的对照;† 参数量来自实现估算。CAS 以百分数显示,真实训练数据的参考 Top-1/Top-5 为 76.6/93.1。
| 模型 | FID↓ | IS↑ | Prec↑ | Rec↑ | 参数 | 步骤 | CAS Top-1↑ | CAS Top-5↑ |
|---|---|---|---|---|---|---|---|---|
| ImageNet 256×256 | --- | --- | --- | --- | --- | --- | --- | --- |
| DCTransformer□ | 36.51 | n/a | 0.36 | 0.67 | 738M | >1024 | --- | --- |
| BigGAN-deep | 6.95 | 198.2 | 0.87 | 0.28 | 160M | 1 | 43.99 | 67.89 |
| Improved DDPM□ | 12.26 | n/a | 0.70 | 0.62 | 280M | 250 | --- | --- |
| ADM□ | 10.94 | 101.0 | 0.69 | 0.63 | 554M | 250 | --- | --- |
| VQVAE-2□ | 31.11 | ~45 | 0.36 | 0.57 | 13.5B† | 5120 | 54.83 | 77.59 |
| VQGAN□ | 15.78 | 78.3 | n/a | n/a | 1.4B | 256 | --- | --- |
| VQGAN* | 18.65 | 80.4 | 0.78 | 0.26 | 227M | 256 | 53.10 | 76.18 |
| MaskGIT (Ours) | 6.18 | 182.1 | 0.80 | 0.51 | 227M | 8 | 63.14 | 84.45 |
| ImageNet 512×512 | ImageNet 512×512 | ImageNet 512×512 | ImageNet 512×512 | ImageNet 512×512 | ImageNet 512×512 | ImageNet 512×512 | ImageNet 512×512 | ImageNet 512×512 |
| BigGAN-deep | 8.43 | 232.5 | 0.88 | 0.29 | 160M | 1 | 44.02 | 68.22 |
| ADM□ | 23.24 | 58.06 | 0.73 | 0.60 | 559M | 250 | --- | --- |
| VQGAN* | 26.52 | 66.8 | 0.73 | 0.31 | 227M | 1024 | 51.29 | 74.24 |
| MaskGIT (Ours) | 7.32 | 156.0 | 0.78 | 0.50 | 227M | 12 | 63.43 | 84.79 |
256 分辨率下,匹配基线从 FID 18.65 到 6.18,IS 从 80.4 到 182.1,说明质量提升没有简单依赖更大参数量。512 分辨率下,匹配基线 FID 从 26.52 到 7.32,步数由 1024 减为 12。这里的结论范围是该 tokenizer、训练设置和采样配置下的比较。
Precision 与 Recall 还揭示质量和覆盖面的区别。256 分辨率时,BigGAN-deep 的 Precision 0.87 高于 MaskGIT 的 0.80,但 Recall 0.28 低于 0.51。MaskGIT 不是每个维度都第一,而是在这组特征指标下更好地兼顾视觉质量与分布覆盖。FID 和 IS 也不能充分描述所有局部细节或语义关系。

图 5 将生成样本和真实训练样本放在一起,便于观察同一类中姿态、构图和背景的变化。这样的精选定性图可以解释 Recall 差异的视觉含义,但不能单凭几行图片证明整个数据分布都被覆盖,也不能作为排除训练集记忆的严格证据。
CAS 的评测逻辑是用生成图像训练分类器,再在真实验证图像上测试。它考察生成数据是否包含对真实识别有用的类别变化,与"分类器认为某张生成图属于正确类别"不是同一个任务。主表的 256 设置使用 RandAugment,因此还需与附录不使用该增强的结果分开。
7. MaskGIT 图像编辑:从未知 token 接口走向局部替换

图 6 将目标类别设为 tiger cat,再遮住图像中的框选位置。已知背景和新类别一起成为条件,使模型能够把动物形态融入已有画面。这是一种类别条件的局部重绘,研究重点是上下文融合,不是自然语言指令理解。
因为 tokenizer 会重建整张图像,已知区域的像素未必天然逐点保持不变。论文在补全中使用生成结果与原始输入的线性边界融合处理,以缓和边界问题。实际产品若要求衣服 logo、身份证件文字或品牌图形严格保持,仅靠"未遮住区域作为条件"不足以保证像素一致性。

图 7 的首行是内补全,其余行展示不同方向的外扩。一个输入对应多个合理结果,反映出这类任务天然存在条件不确定性。例如画面外的建筑形态没有唯一真值,生成目标是符合已知上下文的合理延续,而不是恢复某个必然存在的真实世界状态。
表 2 对 Places2 补全作定量评测。外扩遮掉右侧 50%;内补全遮掉中心宽、高各 50% 的矩形,因此缺失的是总面积的 25%,不是整张图面积的 50%。带 512 标记的方法按 512×512 评估,其余按对应的 256×256 评估;□ 是引用结果,† 的 ICT 使用在 Places2 子集上训练的公开模型。
| 任务 | 模型 | FID↓ | IS↑ |
|---|---|---|---|
| OutpaintingRight 50% | Boundless □ ^{\square} □ | 35.02 | 6.15 |
| OutpaintingRight 50% | In&Out □ ^{\square} □ | 23.57 | 7.18 |
| OutpaintingRight 50% | InfinityGAN | 10.60 | 5.57 |
| OutpaintingRight 50% | Boundless TF (TFHub) | 7.80 | 5.99 |
| OutpaintingRight 50% | MaskGIT (Ours) 512 ^{512} 512 | 6.78 | 11.69 |
| InpaintingCenter 50% × 50% | DeepFill | 11.51 | 22.55 |
| InpaintingCenter 50% × 50% | ICT † ^{\dagger} † | 13.63 | 17.70 |
| InpaintingCenter 50% × 50% | HiFill 512 ^{512} 512 | 16.60 | 19.93 |
| InpaintingCenter 50% × 50% | CoModGAN 512 ^{512} 512 | 7.13 | 21.82 |
| InpaintingCenter 50% × 50% | MaskGIT (Ours) 512 ^{512} 512 | 7.92 | 22.95 |
MaskGIT 的外扩 FID 为 6.78,在这张表中较好;内补全 FID 7.92 则落后于 CoModGAN 的 7.13。虽然 MaskGIT 的内补全 IS 22.95 最高,也不能写成内补全"全面领先"。表中分辨率、公开模型来源和训练子集并不完全一致,应把它理解为方法级的实验比较,而非所有因素受控的因果实验。
8. 掩码调度消融:为何损失更低,生成反而更差

论文比较指数、三次、平方、余弦、线性、平方根和对数调度。余弦调度可以写成 γ ( r ) = cos ( π r / 2 ) \gamma(r)=\cos(\pi r/2) γ(r)=cos(πr/2)。它在前期保留较高掩码率,让模型只先确定少量可靠位置,随后逐渐加快填入速度。
表 3 中每种调度报告其较优设置下的迭代次数和指标,不能把不同的 T T T 当成固定计算预算比较。
| 掩码调度 | T | FID↓ | IS↑ | NLL |
|---|---|---|---|---|
| Exponential | 8 | 7.89 | 156.3 | 4.83 |
| Cubic | 9 | 7.26 | 165.2 | 4.63 |
| Square | 10 | 6.35 | 179.9 | 4.38 |
| Cosine | 10 | 6.06 | 181.5 | 4.22 |
| Linear | 16 | 7.51 | 113.2 | 3.75 |
| Square Root | 32 | 12.33 | 99.0 | 3.34 |
| Logarithmic | 60 | 29.17 | 47.9 | 3.08 |
余弦在 10 轮获得 FID 6.06;主表 8 轮的 6.18 是不同采样轮数下的工作点,两者并不矛盾。对数调度 NLL 3.08 最低,但 FID 29.17 明显较差,说明较容易的条件预测任务可以降低训练损失,却不能保证从几乎没有视觉信息的状态开始生成得更好。
更严格地说,掩码 NLL 不是光栅扫描自回归模型的同口径完整图像负对数似然。跨调度比较还同时改变了模型看到的信息分布。将这里的 NLL 曲线直接解释成"似然与图像质量天然负相关"也过于宽泛。
图 8 还显示,增加迭代次数并非总有收益。论文提出的解释涉及过于保守的逐步选择可能损害多样性,但这是对实验现象的解释,不是已证明的普适规律。工程上应把轮数当作需要验证的质量---延迟参数,而不是设置得越大越放心。
9. 掩码比例与可恢复信息:不要把统计现象写成信息论定理

图 9 依次展示原始图像、掩码输入、单次重建,以及对同一掩码比例随机采样 100 个掩码后得到的重建图像中位数。95%、90%、85%、75% 的遮挡率对应非常不同的已知信息量。高遮挡率下,多种补全都合理;随着可见 token 增多,重建结果逐渐集中。
这里的中位数图像是多个结果的统计汇总,不能当作一次正常生成的输出。即使视觉上能看见主体,也不能据此声称模型用 10% token 对任意图像实现了无损恢复。token 之间的冗余、数据分布先验、图像内容和掩码位置都会影响结果。

图 10 的 PSNR 描述重建接近程度,LPIPS 则参与考察感知差异与生成变化。论文观察到约 90% 掩码附近的变化,支持"信息较少时存在大量合理候选"的解释。它不是一个适用于所有 tokenizer、分辨率和数据集的固定阈值。
这一观察与余弦调度形成联系:在信息极少时,过早固定大量内容可能把彼此并不一致的独立候选锁进上下文。让早期决策更谨慎,为后续条件积累留出空间,是一种可以继续验证的机制解释。
10. 分类器筛选与评价协议:高分究竟用了多少候选
表 4 引入基于分类器的额外筛选或引导。MaskGIT 和 VQGAN 的 0.05 acceptance rate 表示只保留约 5% 候选;平均每保留一个结果,需要生成约 20 个候选,并承担分类器计算成本。ADM 的 1.0 guidance 是另一种利用分类器的方法,不能把这几列统称为相同的推理过程。
| 数据集 | 模型 | 筛选或引导 | FID↓ | IS↑ |
|---|---|---|---|---|
| ImageNet 256 × 256 256 \times 256 256×256 | ADM | 1.0 guidance | 4.59 | 186.70 |
| ImageNet 256 × 256 256 \times 256 256×256 | VQGAN | 0.05 acceptance rate | 5.88 | 304.8 |
| ImageNet 256 × 256 256 \times 256 256×256 | MaskGIT | 0.05 acceptance rate | 4.02 | 355.6 |
| ImageNet 512 × 512 512 \times 512 512×512 | ADM | 1.0 guidance | 7.72 | 172.71 |
| ImageNet 512 × 512 512 \times 512 512×512 | MaskGIT | 0.05 acceptance rate | 4.46 | 342.0 |
MaskGIT 在 256 下 FID 4.02、IS 355.6,以及 512 下 FID 4.46、IS 342.0,属于筛选后的结果。它们不代表主表默认 8 轮或 12 轮生成一次即可获得相同分布。拒绝采样也不是 classifier-free guidance;一个使用额外分类器筛候选,一个在条件与无条件预测间组合引导信号,计算结构不同。
Rocky认为,研究报道最需要保留的不是漂亮数字后面的一串星号,而是获得数字所购买的推理预算。选择更多候选、筛掉低分样本,可能提高观感,同时缩小生成分布。产品若需要稳定延迟和足够多样性,就不能只复制最高分。
表 5 进一步给出不同评测协议下的 Precision、Recall 和 CAS。这里 Precision/Recall 使用 Inception 特征,主表相应指标使用 VGG 特征;CAS 不使用 RandAugment,真实数据参考值变为 73.1/91.5。
| 模型 | Prec↑ | Rec↑ | CAS Top-1↑ | CAS Top-5↑ |
|---|---|---|---|---|
| BigGAN-deep | 0.82 | 0.27 | 42.65 | 65.92 |
| VQ-GAN* | 0.61 | 0.47 | 47.50 | 68.90 |
| MaskGIT (Ours) | 0.78 | 0.50 | 58.20 | 79.65 |
因此,附录 MaskGIT 的 CAS 58.20/79.65 与主表 63.14/84.45 不构成自相矛盾。它们回答的是不同数据增强协议下的识别泛化问题。严谨的横向比较需要把特征网络、分类器训练增强和评测数据同时对齐。
11. MaskGIT 类别生成图集:多样性是哪些变化

图 11 比较 BigGAN-deep、VQVAE-2 与 MaskGIT。BigGAN 使用 truncation 1.0;标注取自论文的 VQVAE-2 样本不是作者在完全同一设置下重新生成。鹰的姿态、背景和海葵的外观变化有助于观察模型是否只给出单一"标准答案",但这种可视化不替代样本总体统计。

图 12 可以观察生成内容是否随环境变化而保持类别特征。鱼、水面与人物等背景组合也提醒我们,类别标签无法约束画面中的全部内容;出现与训练分布相关的背景不等于模型接受了用户对背景的精确控制。

图 13 继续补足类别内多样性证据。更高 Recall 是整体统计意义上的覆盖,单张样本仍可能有局部结构问题。对于需要身份保持或精确数量的产品,类别条件生成还远不足以形成完整控制接口。
12. MaskGIT 补全图集:条件控制、外扩记忆与评测公平性

图 14 把同一组输入与多个类别条件组合,展示金鱼、熊、鸟类等目标在局部区域中的替换。它支持条件组合能力,但不能证明每次编辑都保持目标以外的所有属性,也不包含任意文本指令的语言泛化测试。

图 15 通过逐次保留一部分已有内容、继续补全下一部分形成宽幅画面。局部上下文可以维持相邻区域的连续性,但有限窗口之外的结构可能逐渐失去约束。外扩跨度越大,就越需要单独验证颜色漂移、场景重复和远距离几何一致性。

图 16 特意保留不能按原设定向上补全方法对应的空白区域。这些空格有实验语义,不能用别的图片填满。固定光栅顺序的基线在这里受其条件方向限制,而 MaskGIT 可以从任意已知位置获得上下文。

图 17 增补水景和自然场景案例。ImageGPT 的样本分辨率为 192,与采用视觉 tokenizer 的较高分辨率方法不一致,因此这里主要看补全方向与内容连贯性,不能把所有清晰度差别归因于生成顺序。

图 18 将输入、多个基线、MaskGIT 与真实图像并列。真实图像提供的是数据中的一种实际补全,不意味着其他合理生成都应逐像素接近它。对建筑或室内场景,更有价值的观察是边缘连续、透视一致和物体是否被不合理截断。

图 19 展示向右外扩;InfinityGAN 的相应样本由其作者提供。这里能观察相邻结构延续和纹理过渡,但表 2 已经提醒我们,不同方法的训练与评测设置并非完全一致。图像直观印象应与这一条件一起阅读。

图 20 把可见区域进一步缩小,未知部分更大,合理解空间也随之扩大。小输入窗口中的人物或物体既要被延续,又可能在边界上被重新解释。实际编辑系统应把"允许重绘多大范围""主体必须保持哪些属性"做成明确约束,而不是仅用一项平均 FID 代表编辑可靠性。
13. MaskGIT 的边界与可复现性:并行性并不消除错误累积

图 21 对论文结论同样重要。长幅外扩会出现内容遗忘、颜色或语义漂移;物体跨越边界时可能改变身份或结构;类别生成仍可能出现人脸、文字、对称性与细节过度平滑问题。这说明局部条件分布学得很好,也不必然得到全局一致、可控的完整系统。
从机制看,固定已接受 token 降低了推理复杂度,也可能限制纠错;从表示看,离散 tokenizer 的压缩决定可恢复的精细信息;从控制看,类别标签无法表达复杂关系;从评测看,ImageNet 和 Places2 都不能充分覆盖开放世界长文本生成。
官方仓库已经提供实现,可检查掩码调度、随机采样和模型配置。本文核对的是公开解码实现与 v1 论文的关系,未声称独立重训并复现所有指标。代码版本可能继续变化,严格复现还需要固定提交、权重、数据预处理、随机种子、采样温度与指标实现。
公平的后续研究应首先匹配 tokenizer 和数据,再比较生成目标;否则更好的视觉码本、更强增强或更多训练步数都可能被误记为采样方法的贡献。若同时改变模型规模、目标和推理轮数,应给出分层消融,而不是只保留一条最好结果。
14. 从 MaskGIT 继续研究:哪些问题值得长期投入
对算法工程师,最值得继续研究的是置信度校准和可撤销决策。低熵并不等于正确;模型可能很确信一个局部错误。若允许有限范围重新掩码和修正,能否改善全局结构,同时保持较低延迟?需要比较相同总计算预算下的固定保留、局部回退和更高轮数。
对生成系统开发者,应把采样过程视为可调资源。根据当前不确定性、输入遮挡面积和用户质量需求分配轮数,可能比对所有请求使用固定步数更有效。但这种自适应策略仍需验证停止条件,避免用平均延迟掩盖困难样本的长尾。
对产品团队,应把局部可编辑性、主体保持和边界一致性单列为验收目标。用户愿意付费的往往是"修改这部分,并稳定保持其他部分",不是一个脱离工作流的平均分。MaskGIT 给出了方便的掩码接口,产品可靠性还需要约束、验证和失败恢复。
对科研判断,真正可迁移的经验是训练分布与采样轨迹的一致设计。是否使用离散 token、是否允许并行、是否需要跨位置纠错,这些选择彼此耦合。将论文简化为"把 GPT 换成 BERT 就能快 64 倍",会遗漏它最重要的研究内容。
15. MaskGIT 术语与概念速查
| 概念 | 在本文中的含义 | 常见误读 |
|---|---|---|
| VQGAN tokenizer | 将图像压缩为可解码的离散视觉代码 | 把码本 1024 当成所有分辨率的 token 数 |
| MVTM | 掩码视觉 token 建模 | 当成完整联合分布的标准 AR 似然 |
| 双向注意力 | 未知位置可利用各方向的已知视觉上下文 | 当成无需任何位置或空间建模 |
| 置信度 | 当前实际采样 token 的预测概率 | 默认总是取最大概率 |
| 掩码调度 | 决定每轮仍有多少位置未知 | 只影响速度,不影响训练难度与质量 |
| CAS | 用生成数据训练分类器,再在真实数据上评估 | 生成图被现成分类器判对的比例 |
| 拒绝采样 | 生成候选后基于分类器保留部分结果 | 与 CFG 或单次直接生成混用 |
| 外扩 | 以已知区域为条件生成画面之外的内容 | 恢复唯一正确的真实场景 |
16. MaskGIT 拓展思考:从位置并行走向可靠生成
MaskGIT 把图像生成的重要自由度从"用什么网络"扩展到"让哪些决策同时发生"。它的成功说明,视觉分布允许一种不同于固定扫描顺序的计算组织方式;它的失败又说明,压缩后的局部可预测性不能替代全局约束。
一个有价值的后续实验是把总推理预算固定,分别改变早期保留比例、回退机制和置信度估计,再同时测量 FID、Recall、结构一致性和编辑保持率。这样才能判断收益来自更多计算、更好的排序,还是更有效的纠错。
Rocky认为,跨周期能力来自理解这种取舍:并行生成提供效率,置信度调度分配决策,约束与验证支撑可靠性。论文已经证明前两者能在特定视觉任务上形成有效组合;把它转化为稳定的创作与编辑系统,还需要把第三者补齐。
推荐阅读
1. 深入浅出完整解析AI Agent(AI智能体)的核心基础知识
2025年可以说是AI Agent全面落地应用的元年,因此Rocky在持续撰写对AI Agent的全维度解析文章:
深入浅出完整解析AI Agent(AI智能体)的核心基础知识
2. 深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识
Rocky对扩散模型的本质原理与和核心基础知识进行了全面系统的深入浅出分析讲解,同时不断跟进补充扩散模型的最新技术发展,希望能给大家带来帮助:
深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识
3. 入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识
Rocky对AIGC时代"中场时刻"之后的主流AIGC创作大模型的核心基础知识进行了全面系统的深入浅出分析讲解,力求让大家通俗易懂理解AIGC时代的技术浪潮的本质价值:
入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识
4. 深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识
Rocky对FLUX.1 Kontext和FLUX.1 Krea的核心基础知识作了全面系统的梳理与解析:
深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识
5. 深入浅出完整解析DeepSeek系列核心基础知识
Rocky对DeepSeek系列模型的核心基础知识作了全面系统的梳理与解析:
6. 深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识
Rocky对Stable Diffusion 3和FLUX.1的核心基础知识作了全面系统的梳理与解析:
深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识
7. 深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识
Rocky对Stable Diffusion XL的核心基础知识作了全面系统的梳理与解析:
深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识
8. 深入浅出完整解析Stable Diffusion(SD)核心基础知识
Rocky对Stable Diffusion 1.x-2.x系列模型的核心基础知识做了全面系统的梳理与解析:
深入浅出完整解析Stable Diffusion(SD)核心基础知识
9. 深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识
Rocky对Stable Diffusion中最为关键的U-Net结构进行了深入浅出的全面解析,包括其在传统深度学习中的价值和在AIGC中的价值:
深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识
10. 深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识
对于AIGC时代中的"ResNet"------LoRA模型,Rocky进行了深入浅出的全面讲解:
深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识
11. 深入浅出完整解析ControlNet核心基础知识
AIGC图像创作开源社区已经形成以Stable Difffusion/FLUX为核心,ConrtolNet和LoRA作为首要AI辅助工具的变化万千的AIGC图像创作工作流。
ControlNet正是让AI图像创作社区无比繁荣的关键一环,它让AIGC图像创作过程更加的可控,更有助于广泛地将AIGC算法解决方案应用到各行各业中:
12. 深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识
AI绘画和AI视频是两个互相促进、相互交融的领域,2024年无疑是AI视频领域的爆发之年,Rocky对AI视频领域核心的Sora、Seedance、Keling等大模型进行了全面系统的梳理与解析:
深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识
13. 深入浅出完整解析AIGC时代Transformer核心基础知识
在AIGC时代中,Transformer为AI行业带来了深刻的变革。Transformer架构正在一步一步重构所有的AI技术方向,成为AI技术架构大一统与多模态整合的关键核心基座,大有一统"AI江湖"之势。Rocky也对Transformer模型进行持续的深入浅出梳理与解析:
深入浅出完整解析AIGC时代Transformer核心基础知识
14. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识
AIGC创作框架正是AIGC算法工作流的运行载体,目前主流的AIGC创作框架有ComfyUI、Diffusers、Stable Diffusion WebUI等 。在传统深度学习时代,PyTorch、TensorFlow以及Caffe是传统深度学习模型的基础运行框架,到了AIGC时代,Rocky相信ComfyUI就是AIGC时代的"PyTorch"、Stable Diffusion WebUI就是AIGC时代的"TensorFlow"、Diffusers就是AIGC时代的"Caffe":
深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识
15. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识
在AIGC时代中,如何快速转身,入局AIGC产业?如何成为AIGC/LLM/AI Agent算法/开发工程师?如何在学校中系统性学习AIGC/LLM/AI Agent知识,斩获心仪的AIGC/LLM/AI Agent算法/开发offer?
Don't worry,Rocky为大家总结整理了全面的AIGC/LLM/AI Agent算法/开发工程师成长秘籍,为大家答疑解惑,希望能给大家带来帮助:
手把手教你成为AIGC/LLM/AI Agent算法/开发工程师,斩获AIGC/LLM/AI Agent算法/开发offer!
16. AIGC产业的深度思考与分析
2023年3月21日,微软创始人比尔·盖茨在其博客文章《The Age of AI has begun》中表示,自从1980年首次看到图形用户界面(graphical user interface)以来,以OpenAI为代表的科技公司发布的AIGC模型是他所见过的最具革命性的技术进步。
Rocky也认为,AIGC及其生态,会成为AI行业重大变革的主导力量。AIGC会带来一个全新的红利期,未来随着AIGC的全面落地和深度商用,会深刻改变我们的工作、生活、学习以及交流方式,各行各业都将被重新定义,过程会非常有趣。
那么,在此基础上,我们该如何更好的审视AIGC的未来?我们该如何更好地拥抱AIGC引领的革新?Rocky准备从技术、产品、商业模式、长期主义等维度持续分享一些个人的核心思考与观点,希望能帮助各位读者对AIGC有一个全面的了解:
深入浅出全面解析AIGC时代核心价值与发展趋势(2025年版)
17. AI算法工程师的独孤九剑秘籍
为了方便大家实习、校招以及社招的面试准备,同时帮助大家提升扩展技术基本面,Rocky将符合大厂和AI独角兽价值的算法高频面试知识点撰写总结成《三年面试五年模拟》之独孤九剑秘籍:
【三年面试五年模拟】AIGC时代的算法工程师的求职面试秘籍(持续更新中)
18. 深入浅出完整解析AIGC时代中GAN(Generative Adversarial Network)系列模型核心基础知识
GAN系列模型作为传统深度学习时代的最热门生成式Al模型,在AIGC时代继续繁荣,作为Stable Diffusion/FLUX系列大模型的"得力助手",广泛活跃于AlGC图像创作的产品与工作流中:
深入浅出完整解析AIGC时代中GAN(Generative Adversarial Network)系列模型核心基础知识