
写在前面
一个很多人没注意到的事实:
- 图像生成的 SOTA (Stable Diffusion 3、FLUX、Sora)走的是多步迭代路线------从一团噪声开始,一步步"修"成完整图像
- 语言模型的 SOTA (GPT、Claude、Qwen)走的是自回归路线------一个字一个字往外吐,吐完不回头
表面上看,这是两条完全不同的路。但仔细看,它们本质上都是"多步过程"------都是把"一次性画完/写完"这件事,拆成很多小步来做。
更有意思的是,这两条路在 2025 年已经开始互相靠拢:
- 文本生成开始出现"扩散模型"------Google 的 Gemini Diffusion、Inception Labs 的 Mercury,都用多步迭代生成文字
- 图像生成也开始有"自回归模型"------LlamaGen、VAR 证明,把图切成小块逐块生成,也能打平扩散
两条路正在走向同一个地方。 这篇就是想把这个观察讲清楚。
一、Flow Matching:一种让你"反复打磨"的生成方式
1.1 从画家的工作方式说起
先抛开技术,想一个画家是怎么完成一幅画的。
一种画法是"一笔到底":画家从左上角开始,一笔一笔画到右下角,每落一笔都不再回头修改。画到哪算哪,画完收工。
另一种画法是"分层推进":
- 第一步:用淡色打轮廓,整张画的大形先立起来
- 第二步:铺大色块,确定光影和主色调
- 第三步:刻画五官、衣褶、树叶这种细节
- 第四步:全局调整,把颜色再统一一下

第二种方式就是 Flow Matching 在干的事。
1.2 Flow Matching 怎么"画"一张图
Flow Matching(简称 FM)生成一张图,过程是这样的:
第 0 步:从一团纯随机噪声开始------就像一张完全杂乱的雪花点画布。
第 1 步到第 N 步:每一步,模型都看着当前的"半成品",判断"现在哪些地方还太模糊/太乱,需要再清晰一点",然后修改一点点。
最终步:噪声全部消除,一张清晰完整的图像出现。

关键点是:每一步都能看到整张图的全局状态,然后做全局性的微调。不是"从左上角画到右下角",而是"整张图一起推进,从粗糙到精细"。
这就是"先画轮廓再画细节"的技术实现。
1.3 它跟 Diffusion 什么关系
你可能听过"扩散模型"(Diffusion Model)这个词。Midjourney、DALL-E 3、Stable Diffusion 都是扩散模型。
Flow Matching 其实是 Diffusion 的升级版------训练更快、采样更灵活、数学上更漂亮。2024-2025 年发布的 SOTA 图像模型(Stable Diffusion 3、FLUX、Sora 的视频生成)基本都是基于 Flow Matching 或它的变种。
技术细节我们不展开(放附录了),你只要记住一句话:FM 和 Diffusion 是同一类"多步迭代去噪"的方法,FM 是这条路上当前最成熟的形式。
二、自回归:一种"永不回头"的生成方式
2.1 一个字一个字往外吐
大语言模型(GPT、Claude、Qwen 这些)的生成方式,跟 FM 完全不一样。
它们走的是 自回归(Autoregressive,简称 AR):
第 1 步 :根据输入 prompt,生成第 1 个字
第 2 步 :根据 prompt + 第 1 个字,生成第 2 个字
第 3 步 :根据 prompt + 前 2 个字,生成第 3 个字
......
第 N 步:根据 prompt + 前 N-1 个字,生成第 N 个字
每生成一个字,它就立刻被锁死------模型永远不能回头修改之前生成的字。

2.2 跟"一笔到底"的画家一模一样
这就像那种"一笔到底"的画家------从左上角画到右下角,每落一笔都不再回头修改。画错了也只能接着往下画。
AR 模型有两个天生的局限:
- 没法整体规划:它写第 100 个字的时候,看不到第 101 个字以后会怎么写,只能靠"预测能力"硬撑
- 没法回头修改:第 50 个字写错了,第 100 个字也没法把它"涂掉重写"
这两个局限,是 AR 跟 FM 最本质的差异。
三、都是"多步过程",但"能不能回头"差了十万八千里
3.1 它们的共同点
把 FM 和 AR 并排放:
| FM (图像) | AR (语言) | |
|---|---|---|
| 总步数 | N 步(几十到上百) | N 步(几百到上千 token) |
| 每步干什么 | 修一点点噪声 | 生成一个 token |
| 中间状态 | 一张半清晰的图 | 一段写了一半的文 |
| 最终输出 | 完整图像 | 完整文本 |
共同点非常明显:都是"一次做不完,分 N 步做"。
为什么要分步?因为一次性生成一整张图或一整篇文,对模型来说太难了------输出空间太大,没法一步到位。把它拆成 N 步,每步只做一个小决定,复杂问题就变简单了。
3.2 它们的根本差异:能不能回头
但"分 N 步做"这件事,有两种完全不同的做法:
AR 的做法:每步产出"最终结果"的一部分
- 第 k 步产出的第 k 个字,就是最终输出的第 k 个字
- 一旦产出,永远不修改
- 第 k+1 步只能往后接,不能回头改第 k 步
FM 的做法:每步产出"中间状态"的一次修订
- 第 k 步产出的是一张"半成品图",不是最终图像的一部分
- 第 k+1 步可以修改第 k 步画的所有东西
- 直到最后一步,所有像素都还在被调整
差异就是这一句话:能不能回头。

3.3 这个差异有多重要
"能不能回头"不是一个小差异,它决定了模型的几个根本能力:
整体规划能力
- FM 强:每步都能看到整张图的全局,调整任何位置
- AR 弱:每步只能看到"已生成的前面部分",看不到后面
这就是为什么图像模型擅长"整体构图、对称布局",而语言模型经常在长文本里出现"开头说 A,中间变成 B,结尾忘记 A"这种毛病。
修改和精修能力
- FM 天然支持:多走几步就是在精修
- AR 天然不支持:要精修只能让模型重新生成一遍
这也是为什么你让 ChatGPT"把第二段改得更简洁一点",它会把整段重写一遍而不是"只改需要改的地方"------因为 AR 没法做局部修改。
生成速度
- AR 可以流式输出:生成一个字就可以立刻显示一个字,用户感知很快
- FM 要等所有步做完:第 1 步到第 N-1 步都是半成品,第 N 步才有最终结果
这就是为什么语言模型可以边想边打字,而 Midjourney 要"转圈圈"几十秒才能一次性出图。
两种路线,各有优势,各有代价。
四、2025 年,两条路开始互相靠拢
本来这两条路是分得挺清楚的:图像走 FM/Diffusion,语言走 AR。但 2025 年开始,边界开始模糊。
4.1 文本也开始走"多步迭代"
Google 的 Gemini Diffusion(2025) :用离散扩散模型(Discrete Diffusion)生成文本。不像 GPT 那样一个字一个字吐,而是整段文本一起、分多步迭代------从"全是 mask 的空白"开始,每一步把一些 mask 替换成真实文字,直到全部填完。
Inception Labs 的 Mercury(2025) :号称"超快扩散语言模型",走的就是扩散路线,速度比 GPT 这种 AR 模型快 10 倍以上------因为扩散可以并行解码多个位置。
文本走扩散的好处:
- 速度:可以并行解码多个 token,打破 AR 的串行瓶颈
- 规划能力:每步都能看到全文,长文本一致性更好
- 可控生成:可以中途注入约束(比如"必须包含 X 这个词"),AR 做不到
4.2 图像也开始走"自回归"
LlamaGen(2024):把图像切成小块(visual tokens),用 Llama 这种自回归语言模型逐块生成。效果打平甚至超过当时的扩散模型。
VAR(Visual AutoRegressive,2024):微软做的多尺度自回归,先粗后细逐尺度生成图像。
Chameleon(Meta,2024) :多模态模型,用同一套 AR 框架同时处理文本和图像------文本和图像被统一到同一个"逐 token 生成"框架下。
图像走 AR 的好处:
- 统一框架:文本和图像可以塞进同一个模型训练
- 长序列理解:AR 天然擅长处理"序列",可以跟语言理解能力共享
4.3 一张图看清楚
| 图像生成 | 语言生成 | |
|---|---|---|
| 多步迭代路线 | Stable Diffusion 3、FLUX、Sora | Gemini Diffusion、Mercury |
| 自回归路线 | LlamaGen、VAR、Chameleon | GPT、Claude、Qwen |
两条路都在对方的地盘上出现了。

五、几个开放问题
写到这里,几个有意思的问题就浮出来了。这篇不给结论------因为这些问题的答案还在演化中,给结论太早。只是把问题摆出来,留给读者自己想。
问题一:为什么两条路会互相靠拢?
图像走 FM 走了 5 年,语言走 AR 走了 5 年,为什么 2025 年突然开始互相渗透?
是因为研究者终于发现"某种路线更适合某种模态"其实是个误解?是因为多模态模型的兴起逼着大家统一框架?是因为某条路的硬件效率到了瓶颈必须换路线?
问题二:下一代多模态模型会怎么选?
GPT-4o、Gemini 这种多模态模型,内部是怎么同时处理图像和语言的? 是两套路线分开跑,还是统一成一套?
如果统一,统一在哪条路上?
问题三:"多步"是不是生成的本质?
AR 和 FM 都是"多步过程",这个共性是不是揭示了"生成"的本质?
是不是任何复杂的东西(图、文、音乐、视频、代码),都无法"一次性生成",只能"多步生成"?
如果是这样,那"多步"这件事本身,有没有一个统一的数学框架?
问题四:人脑的创作是哪种?
画家画画,是"一笔到底"还是"反复打磨"?
作家写文章,是"从第一字写到最后一字"还是"先大纲再草稿再精修"?
人脑的创作过程,是不是也是某种"多步迭代"?如果是,更靠近 AR 还是更靠近 FM?
问题五:推理型 LLM(o1/R1)算哪种?
OpenAI 的 o1、阿里的 R1 这类"先想再答"的模型,会先吐一段"思考过程",再吐最终答案。
这算 AR(逐 token 吐),还是某种伪 FM(全局迭代精修)?
如果把"思考过程"看成"草稿",把"最终答案"看成"精修后的结果",推理型 LLM 是不是在用 AR 的外壳做 FM 的事?
写在最后
这篇讲的不是"哪个更好",而是一个观察:
图像生成和语言生成,过去五年走了两条完全不同的路。但 2025 年开始,这两条路正在互相渗透、互相靠拢。
背后的共性是:生成都是多步过程 。差异是:能不能回头修改之前的步。
至于这两条路最终会不会合流,或者会流向什么样的下一代模型------现在还没有答案。但这个问题本身,可能比任何具体模型都更值得想。
附录:几个核心公式
正文里完全没提数学。这里补几个最关键的公式,给想深挖的读者一个入口。
A.1 Flow Matching 的核心思想
FM 学的是一个速度场 v(x, t),把噪声 x₀ 沿一条"流"带到目标数据 x₁。训练时,用一条已知路径做监督:
ψ_t(x) = (1 - t) · x₀ + t · x₁ (线性插值路径)
u_t(x) = x₁ - x₀ (这条路径的速度场)
模型 v 要逼近 u。损失函数就是:
L = E[‖v(ψ_t(x), t) - (x₁ - x₀)‖²]
生成时,从噪声 x₀ 开始,沿学到的 v 积分,得到 x₁。
A.2 Diffusion 的前向/反向过程
Diffusion 是 FM 的特例(选不同的路径和速度场)。
前向过程(加噪):
q(x_t | x_0) = N(x_t ; √ᾱ_t x_0, (1-ᾱ_t)I)
反向过程(去噪,模型学这个):
p_θ(x_{t-1} | x_t) = N(x_{t-1} ; μ_θ(x_t, t), Σ_θ(x_t, t))
训练损失(简化版 DDPM):
L = E[‖ε - ε_θ(x_t, t)‖²]
其中 ε 是真实加的噪声,ε_θ 是模型预测的噪声。
A.3 自回归的概率分解
AR 把一个长序列的概率,分解成 N 个条件概率的乘积:
p(x_1, x_2, ..., x_N) = ∏_{i=1}^{N} p(x_i | x_1, ..., x_{i-1})
每一项都是一个"根据前面所有 token 预测下一个 token"的分类问题。
A.4 离散扩散(文本扩散)的核心思想
离散扩散把"连续加噪"改成"离散替换"------把 token 逐步替换成 mask 符号,再反向逐步恢复。
前向(加 mask):
q(x_t | x_0) = 以概率 β_t 把每个 token 替换成 [MASK]
反向(去 mask):
p_θ(x_{t-1} | x_t) = 预测每个 [MASK] 位置的真实 token
这就是 Gemini Diffusion 用的框架。
相关参考资料
Flow Matching 原始论文
- Lipman Y, et al. Flow Matching for Generative Modeling. ICLR 2023. https://arxiv.org/abs/2210.02747
Flow Matching 在图像生成的 SOTA
- Esser S, et al. Scaling Rectified Flow Transformers for High-Resolution Image Synthesis (Stable Diffusion 3). https://arxiv.org/abs/2403.03206
- FLUX 模型(Black Forest Labs):https://blackforestlabs.ai/
- OpenAI Sora 技术报告:https://openai.com/index/video-generation-models-as-world-simulators/
文本扩散模型
- Google Gemini Diffusion:https://deepmind.google/models/gemini-diffusion/
- Mercury (Inception Labs):https://arxiv.org/abs/2506.17298
- Hugging Face 综述:https://huggingface.co/blog/ProCreations/diffusion-language-model
自回归图像生成
- Sun P, et al. Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation (LlamaGen). https://arxiv.org/abs/2406.06525
- Tian K, et al. Visual Autoregressive Modeling (VAR). https://arxiv.org/abs/2404.02905
- Meta Chameleon:https://arxiv.org/abs/2405.09818
综述与对比
- Diffusion Meets Flow Matching:https://diffusionflow.github.io/
- Awesome Diffusion Language Models:https://github.com/VILA-Lab/Awesome-DLMs