漫话大模型:先画轮廓再画细节——从 Flow Matching 看生成模型的“殊途同归“

写在前面

一个很多人没注意到的事实:

  • 图像生成的 SOTA (Stable Diffusion 3、FLUX、Sora)走的是多步迭代路线------从一团噪声开始,一步步"修"成完整图像
  • 语言模型的 SOTA (GPT、Claude、Qwen)走的是自回归路线------一个字一个字往外吐,吐完不回头

表面上看,这是两条完全不同的路。但仔细看,它们本质上都是"多步过程"------都是把"一次性画完/写完"这件事,拆成很多小步来做。

更有意思的是,这两条路在 2025 年已经开始互相靠拢:

  • 文本生成开始出现"扩散模型"------Google 的 Gemini Diffusion、Inception Labs 的 Mercury,都用多步迭代生成文字
  • 图像生成也开始有"自回归模型"------LlamaGen、VAR 证明,把图切成小块逐块生成,也能打平扩散

两条路正在走向同一个地方。 这篇就是想把这个观察讲清楚。

一、Flow Matching:一种让你"反复打磨"的生成方式

1.1 从画家的工作方式说起

先抛开技术,想一个画家是怎么完成一幅画的。

一种画法是"一笔到底":画家从左上角开始,一笔一笔画到右下角,每落一笔都不再回头修改。画到哪算哪,画完收工。

另一种画法是"分层推进"

  • 第一步:用淡色打轮廓,整张画的大形先立起来
  • 第二步:铺大色块,确定光影和主色调
  • 第三步:刻画五官、衣褶、树叶这种细节
  • 第四步:全局调整,把颜色再统一一下

第二种方式就是 Flow Matching 在干的事

1.2 Flow Matching 怎么"画"一张图

Flow Matching(简称 FM)生成一张图,过程是这样的:

第 0 步:从一团纯随机噪声开始------就像一张完全杂乱的雪花点画布。

第 1 步到第 N 步:每一步,模型都看着当前的"半成品",判断"现在哪些地方还太模糊/太乱,需要再清晰一点",然后修改一点点。

最终步:噪声全部消除,一张清晰完整的图像出现。

关键点是:每一步都能看到整张图的全局状态,然后做全局性的微调。不是"从左上角画到右下角",而是"整张图一起推进,从粗糙到精细"。

这就是"先画轮廓再画细节"的技术实现。

1.3 它跟 Diffusion 什么关系

你可能听过"扩散模型"(Diffusion Model)这个词。Midjourney、DALL-E 3、Stable Diffusion 都是扩散模型。

Flow Matching 其实是 Diffusion 的升级版------训练更快、采样更灵活、数学上更漂亮。2024-2025 年发布的 SOTA 图像模型(Stable Diffusion 3、FLUX、Sora 的视频生成)基本都是基于 Flow Matching 或它的变种。

技术细节我们不展开(放附录了),你只要记住一句话:FM 和 Diffusion 是同一类"多步迭代去噪"的方法,FM 是这条路上当前最成熟的形式。

二、自回归:一种"永不回头"的生成方式

2.1 一个字一个字往外吐

大语言模型(GPT、Claude、Qwen 这些)的生成方式,跟 FM 完全不一样。

它们走的是 自回归(Autoregressive,简称 AR)

第 1 步 :根据输入 prompt,生成第 1 个字

第 2 步 :根据 prompt + 第 1 个字,生成第 2 个字

第 3 步 :根据 prompt + 前 2 个字,生成第 3 个字

......

第 N 步:根据 prompt + 前 N-1 个字,生成第 N 个字

每生成一个字,它就立刻被锁死------模型永远不能回头修改之前生成的字。

2.2 跟"一笔到底"的画家一模一样

这就像那种"一笔到底"的画家------从左上角画到右下角,每落一笔都不再回头修改。画错了也只能接着往下画。

AR 模型有两个天生的局限

  • 没法整体规划:它写第 100 个字的时候,看不到第 101 个字以后会怎么写,只能靠"预测能力"硬撑
  • 没法回头修改:第 50 个字写错了,第 100 个字也没法把它"涂掉重写"

这两个局限,是 AR 跟 FM 最本质的差异。

三、都是"多步过程",但"能不能回头"差了十万八千里

3.1 它们的共同点

把 FM 和 AR 并排放:

FM (图像) AR (语言)
总步数 N 步(几十到上百) N 步(几百到上千 token)
每步干什么 修一点点噪声 生成一个 token
中间状态 一张半清晰的图 一段写了一半的文
最终输出 完整图像 完整文本

共同点非常明显:都是"一次做不完,分 N 步做"。

为什么要分步?因为一次性生成一整张图或一整篇文,对模型来说太难了------输出空间太大,没法一步到位。把它拆成 N 步,每步只做一个小决定,复杂问题就变简单了。

3.2 它们的根本差异:能不能回头

但"分 N 步做"这件事,有两种完全不同的做法:

AR 的做法:每步产出"最终结果"的一部分

  • 第 k 步产出的第 k 个字,就是最终输出的第 k 个字
  • 一旦产出,永远不修改
  • 第 k+1 步只能往后接,不能回头改第 k 步

FM 的做法:每步产出"中间状态"的一次修订

  • 第 k 步产出的是一张"半成品图",不是最终图像的一部分
  • 第 k+1 步可以修改第 k 步画的所有东西
  • 直到最后一步,所有像素都还在被调整

差异就是这一句话:能不能回头。

3.3 这个差异有多重要

"能不能回头"不是一个小差异,它决定了模型的几个根本能力:

整体规划能力

  • FM 强:每步都能看到整张图的全局,调整任何位置
  • AR 弱:每步只能看到"已生成的前面部分",看不到后面

这就是为什么图像模型擅长"整体构图、对称布局",而语言模型经常在长文本里出现"开头说 A,中间变成 B,结尾忘记 A"这种毛病。

修改和精修能力

  • FM 天然支持:多走几步就是在精修
  • AR 天然不支持:要精修只能让模型重新生成一遍

这也是为什么你让 ChatGPT"把第二段改得更简洁一点",它会把整段重写一遍而不是"只改需要改的地方"------因为 AR 没法做局部修改。

生成速度

  • AR 可以流式输出:生成一个字就可以立刻显示一个字,用户感知很快
  • FM 要等所有步做完:第 1 步到第 N-1 步都是半成品,第 N 步才有最终结果

这就是为什么语言模型可以边想边打字,而 Midjourney 要"转圈圈"几十秒才能一次性出图。

两种路线,各有优势,各有代价

四、2025 年,两条路开始互相靠拢

本来这两条路是分得挺清楚的:图像走 FM/Diffusion,语言走 AR。但 2025 年开始,边界开始模糊。

4.1 文本也开始走"多步迭代"

Google 的 Gemini Diffusion(2025) :用离散扩散模型(Discrete Diffusion)生成文本。不像 GPT 那样一个字一个字吐,而是整段文本一起、分多步迭代------从"全是 mask 的空白"开始,每一步把一些 mask 替换成真实文字,直到全部填完。

Inception Labs 的 Mercury(2025) :号称"超快扩散语言模型",走的就是扩散路线,速度比 GPT 这种 AR 模型快 10 倍以上------因为扩散可以并行解码多个位置。

文本走扩散的好处

  • 速度:可以并行解码多个 token,打破 AR 的串行瓶颈
  • 规划能力:每步都能看到全文,长文本一致性更好
  • 可控生成:可以中途注入约束(比如"必须包含 X 这个词"),AR 做不到

4.2 图像也开始走"自回归"

LlamaGen(2024):把图像切成小块(visual tokens),用 Llama 这种自回归语言模型逐块生成。效果打平甚至超过当时的扩散模型。

VAR(Visual AutoRegressive,2024):微软做的多尺度自回归,先粗后细逐尺度生成图像。

Chameleon(Meta,2024) :多模态模型,用同一套 AR 框架同时处理文本和图像------文本和图像被统一到同一个"逐 token 生成"框架下

图像走 AR 的好处

  • 统一框架:文本和图像可以塞进同一个模型训练
  • 长序列理解:AR 天然擅长处理"序列",可以跟语言理解能力共享

4.3 一张图看清楚

图像生成 语言生成
多步迭代路线 Stable Diffusion 3、FLUX、Sora Gemini Diffusion、Mercury
自回归路线 LlamaGen、VAR、Chameleon GPT、Claude、Qwen

两条路都在对方的地盘上出现了

五、几个开放问题

写到这里,几个有意思的问题就浮出来了。这篇不给结论------因为这些问题的答案还在演化中,给结论太早。只是把问题摆出来,留给读者自己想。

问题一:为什么两条路会互相靠拢?

图像走 FM 走了 5 年,语言走 AR 走了 5 年,为什么 2025 年突然开始互相渗透?

是因为研究者终于发现"某种路线更适合某种模态"其实是个误解?是因为多模态模型的兴起逼着大家统一框架?是因为某条路的硬件效率到了瓶颈必须换路线?

问题二:下一代多模态模型会怎么选?

GPT-4o、Gemini 这种多模态模型,内部是怎么同时处理图像和语言的? 是两套路线分开跑,还是统一成一套?

如果统一,统一在哪条路上?

问题三:"多步"是不是生成的本质?

AR 和 FM 都是"多步过程",这个共性是不是揭示了"生成"的本质?

是不是任何复杂的东西(图、文、音乐、视频、代码),都无法"一次性生成",只能"多步生成"?

如果是这样,那"多步"这件事本身,有没有一个统一的数学框架?

问题四:人脑的创作是哪种?

画家画画,是"一笔到底"还是"反复打磨"?

作家写文章,是"从第一字写到最后一字"还是"先大纲再草稿再精修"?

人脑的创作过程,是不是也是某种"多步迭代"?如果是,更靠近 AR 还是更靠近 FM?

问题五:推理型 LLM(o1/R1)算哪种?

OpenAI 的 o1、阿里的 R1 这类"先想再答"的模型,会先吐一段"思考过程",再吐最终答案。

这算 AR(逐 token 吐),还是某种伪 FM(全局迭代精修)

如果把"思考过程"看成"草稿",把"最终答案"看成"精修后的结果",推理型 LLM 是不是在用 AR 的外壳做 FM 的事

写在最后

这篇讲的不是"哪个更好",而是一个观察:

图像生成和语言生成,过去五年走了两条完全不同的路。但 2025 年开始,这两条路正在互相渗透、互相靠拢。

背后的共性是:生成都是多步过程 。差异是:能不能回头修改之前的步

至于这两条路最终会不会合流,或者会流向什么样的下一代模型------现在还没有答案。但这个问题本身,可能比任何具体模型都更值得想。


附录:几个核心公式

正文里完全没提数学。这里补几个最关键的公式,给想深挖的读者一个入口。

A.1 Flow Matching 的核心思想

FM 学的是一个速度场 v(x, t),把噪声 x₀ 沿一条"流"带到目标数据 x₁。训练时,用一条已知路径做监督:

复制代码
ψ_t(x) = (1 - t) · x₀ + t · x₁     (线性插值路径)
u_t(x) = x₁ - x₀                      (这条路径的速度场)

模型 v 要逼近 u。损失函数就是:

复制代码
L = E[‖v(ψ_t(x), t) - (x₁ - x₀)‖²]

生成时,从噪声 x₀ 开始,沿学到的 v 积分,得到 x₁。

A.2 Diffusion 的前向/反向过程

Diffusion 是 FM 的特例(选不同的路径和速度场)。

前向过程(加噪)

复制代码
q(x_t | x_0) = N(x_t ; √ᾱ_t x_0, (1-ᾱ_t)I)

反向过程(去噪,模型学这个)

复制代码
p_θ(x_{t-1} | x_t) = N(x_{t-1} ; μ_θ(x_t, t), Σ_θ(x_t, t))

训练损失(简化版 DDPM):

复制代码
L = E[‖ε - ε_θ(x_t, t)‖²]

其中 ε 是真实加的噪声,ε_θ 是模型预测的噪声。

A.3 自回归的概率分解

AR 把一个长序列的概率,分解成 N 个条件概率的乘积:

复制代码
p(x_1, x_2, ..., x_N) = ∏_{i=1}^{N} p(x_i | x_1, ..., x_{i-1})

每一项都是一个"根据前面所有 token 预测下一个 token"的分类问题。

A.4 离散扩散(文本扩散)的核心思想

离散扩散把"连续加噪"改成"离散替换"------把 token 逐步替换成 mask 符号,再反向逐步恢复。

前向(加 mask)

复制代码
q(x_t | x_0) = 以概率 β_t 把每个 token 替换成 [MASK]

反向(去 mask)

复制代码
p_θ(x_{t-1} | x_t) = 预测每个 [MASK] 位置的真实 token

这就是 Gemini Diffusion 用的框架。

相关参考资料

Flow Matching 原始论文

Flow Matching 在图像生成的 SOTA

文本扩散模型

自回归图像生成

综述与对比

相关推荐
HYHYLLLL18 分钟前
【2026年】多模态AI在水务场景的应用
人工智能·深度学习·计算机视觉·水务
像风一样自由202028 分钟前
17.Milvus如何完成一次向量相似度检索
人工智能·postgresql·大模型·milvus·rag·智能体
CODER030433 分钟前
ubuntu24.04:降内核+显卡驱动+cuda+cudnn+pytorch+anaconda+pycharm
人工智能·pytorch·深度学习·自然语言处理·cuda·ubuntu24.04·降内核
苏灿烤鱼1 小时前
从“生成内容”到“生成可执行对象”:我把 OpenMAIC 源码翻了一遍,发现 AI Agent 正在变成应用操作系统
开源·agent·ai编程
像风一样自由20201 小时前
19.Milvus数据分片扩展与高并发设计
postgresql·大模型·milvus·rag·智能体
绵满9 小时前
"AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning" 论文笔记
大模型·智能体记忆
Flynt11 小时前
OpenJDK禁AI代码半年了,现在执行得怎么样?答案是:全靠自觉
java·开源·ai编程
stormzhangV13 小时前
AI 视频迎来了奇点时刻
开源·ai编程
孟健13 小时前
Uber:70% 的 PR 来自 Agent,AI 账单却没涨
ai编程