写在前面

欢迎大家关注Rocky的知乎:Rocky Ding
《三年面试五年模拟》AIGC/LLM/AI Agent算法工程师/开发工程师求职面试秘籍独家资源:【三年面试五年模拟】WeThinkIn/AIGC-Interview-Book,欢迎大家Star~
Rocky最新撰写的10万字AI Agent(AI智能体)深入浅出全维度解析文章: 深入浅出完整解析AI Agent(AI智能体)的核心基础知识
AIGC/LLM/AI Agent算法岗/开发岗求职面试内推学习社群 (涵盖AIGC、LLM大模型、AI Agent、传统深度学习、自动驾驶、机器学习、计算机视觉、自然语言处理、强化学习、大数据挖掘、具身智能、元宇宙、AGI等AI行业最新面试干货经验与核心知识)欢迎大家加入:https://t.zsxq.com/33pJ0
大家好,我是Rocky。
核心导读:统一主干,不等于所有任务共用同一种视觉表示
让一个模型既看懂图片,又生成图片,听起来像是把两种能力接进同一个 Transformer。但理解任务与生成任务需要保留的信息并不相同。识别"这是一只猫"可以容忍纹理和局部细节的变化;重新生成这张猫的图片,则需要足够的外观信息来恢复视觉内容。
Janus 系列针对这一差异作出一个明确选择:理解侧使用偏语义的视觉编码,生成侧使用能够还原图像的离散视觉编码,再把两条路径接入共享的自回归语言模型。Janus-Pro 延续这一架构,改进重点放在训练阶段分工、数据规模与质量,以及模型规模上。
Rocky认为,Janus-Pro 的研究价值,是展示"合理分工的表征接口"如何与训练资源配置共同作用。 架构提供兼容两种任务的基础,数据和训练决定这个基础能否转化为实际能力。它既不是把两个完整模型放在一起,也不是证明一种视觉 tokenizer 已经同时满足所有需求。
本文讨论《Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling》,以 arXiv:2501.17811v1 为依据。核心结果包括 Janus-Pro-7B 的 MMBench 79.2、GenEval 0.80 和 DPG-Bench 84.19。下面将完整保留论文四张标准图与五张表,并解释这些分数的协议、范围和局限。论文没有独立编号的数学公式,文中的公式均是帮助理解机制的解释性表达。
一、从研究问题出发:为什么要解耦视觉编码
1.1 语义理解与视觉重建具有不同的信息需求
理解侧可以利用经过图文对齐训练的视觉编码器,提取对物体、场景与关系更有用的特征。生成侧则需要一个可预测、可解码的视觉表示,让输出序列能够还原成图片。如果让同一个编码体系同时承担所有目标,语义不变性与细节保持之间可能产生冲突。
Janus 的思路是分离两种视觉编码,但共享处理它们的语言主干。这样,理解路径可以保留预训练语义表示的优势,生成路径也可以继续使用离散图像重建体系。解耦减少了一类表示层冲突,却没有消除共享主干中的多任务竞争。 两种任务仍共享计算和参数,训练比例与损失尺度依然重要。

图1|论文 Figure 1 的两部分合并保留:左侧为四项理解指标的平均表现,右侧为文生图指令遵循评测。
理解侧概览使用 POPE、MME-Perception、GQA、MMMU,并先将 MME-Perception 除以 20,使其落入可比较的数值范围,再求平均。这个平均分是作者选定指标和归一化方式下的概览,不是天然存在的"统一智能分数"。生成侧使用 GenEval 与 DPG-Bench,二者也不能替代视觉审美、纹理质量和生产可用性评测。
1.2 Pro版本解决的是哪些可观察问题
前代 Janus 已验证视觉编码解耦能够工作,但短提示词生成不稳定,输出质量还有明显波动。Janus-Pro 从训练配方、数据和规模三个维度改进,而非提出一套完全不同的生成范式。

图2|384×384 输出的对照样例,展示短提示词稳定性、细节与简单文字生成的变化。
这些样例说明模型能够生成更合理的结果,但样例选择本身不能量化整体失败率。"能够生成简单文字"也不等于长文本、多语言和复杂版式都可靠。评价此类改进,仍需把任务拆为内容出现、属性绑定、文字正确性和视觉细节等维度。
二、Janus-Pro架构:两条视觉入口,共享一个自回归主干

图3|理解侧采用语义视觉编码,生成侧采用离散视觉编码,分别经适配器进入共享语言模型。
2.1 理解路径如何工作
理解侧使用 SigLIP-Large-Patch16-384 提取图像特征,把二维特征网格展平为序列,再通过两层 MLP 的 understanding adaptor 映射到语言模型输入空间。图像特征与文本组成多模态条件,语言模型使用文本预测头生成回答。
这一路径不要求输入图像先被转换成生成用的 VQ 索引,因此能够更直接地利用已有语义编码器。它并不意味着视觉输入被完美保留:384×384 的输入分辨率仍限制小字、细小物体和复杂文档的可见信息。
2.2 生成路径如何工作
生成侧使用来自 LlamaGen 工作的 VQ tokenizer,将图像转换为离散 ID。每个 ID 对应码本向量,再经 generation adaptor 映射到语言模型输入空间。语言模型另有用于视觉 token 预测的图像头,输出视觉代码,最后由视觉解码器还原图像。
论文给出码本大小为 16,384、空间下采样倍数为 16。384×384 图像对应的视觉代码数量可以推导为:
N = 384 16 × 384 16 = 24 × 24 = 576. N=\frac{384}{16}\times\frac{384}{16}=24\times24=576. N=16384×16384=24×24=576.
这里 576 是一张图像的 token 数,16,384 是每个位置可选择的代码数量,二者分别控制序列长度与分类空间。表1里的 100K 则是语言模型配置中的词表规模,不能把这三组数字混为一谈。
对文本条件 c c c 和视觉 token 序列 z z z,生成分布可写成:
p θ ( z ∣ c ) = ∏ i = 1 576 p θ ( z i ∣ c , z < i ) . p_\theta(z\mid c)=\prod_{i=1}^{576}p_\theta(z_i\mid c,z_{<i}). pθ(z∣c)=i=1∏576pθ(zi∣c,z<i).
这一解释性表达明确了 Janus-Pro 的自回归性质。模型先逐个预测视觉代码,再调用视觉解码器;它不是通过扩散过程迭代去噪,也不能与 JanusFlow 的方法混用。
2.3 模型名称与参数口径
论文将两个版本命名为 Janus-Pro-1B 和 Janus-Pro-7B,但在实现与实验表中,小版本使用的是 1.5B 的语言模型。名称中的"1B"不应被误当成精确参数统计,更不能直接等同于整个系统包括视觉模块后的参数量。
论文 Table 1 的架构配置如下。
| Janus-Pro-1B | Janus-Pro-7B | |
|---|---|---|
| Vocabulary size | 100K | 100K |
| Embedding size | 2048 | 4096 |
| Context Window | 4096 | 4096 |
| #Attention heads | 16 | 32 |
| #Layers | 24 | 30 |
两种配置都支持 4096 的上下文窗口,宽度、注意力头数和层数则不同。上下文长度包含实际进入主干的序列内容,并不意味着可以另外免费增加图像条件。模型大小、视觉序列和输出预算,需要在服务容量规划时一起计算。
三、训练配方:为什么要把ImageNet学习前移
3.1 三个训练阶段分别负责什么
前代 Janus 使用三阶段训练。Stage I 训练适配器与图像预测头,让新接入的视觉模块适应语言主干;Stage II 进行统一预训练,更新除理解编码器与生成编码器之外的组件;Stage III 进行监督微调,并进一步解冻理解编码器。
Janus-Pro 延续这个框架,但重新分配了生成任务在不同阶段的工作。原来 Stage II 的文生图步骤先大量使用 ImageNet 类别名条件,再转到普通文生图数据,其中前一部分占该阶段文生图训练步骤的 66.67%。作者认为这个分配效率不高。
Pro 的改变是延长 Stage I,让模型在语言主干冻结的情况下充分学习类别条件的视觉生成;Stage II 则去掉 ImageNet,直接使用带有普通描述的文生图数据。训练资源因而更集中于从类别条件扩展到复杂文本条件。
这里"主干冻结也能生成合理图像"不表示模型没有学习。适配器和图像头仍在训练,它们利用固定主干的计算结构建立视觉输入与输出的映射。这个结果反映出预训练主干的可复用性,同时也依赖任务难度与可训练接口的容量。
3.2 多任务比例改变了什么
Stage III 中,理解、纯文本、文生图三类数据比例从 7:3:10 调整为 5:1:4。换算为比例,理解从 35% 到 50%,纯文本从 15% 到 10%,生成从 50% 到 40%。这是采样配方的变化,不能直接等同于三种任务的有效梯度贡献。
序列长度、每种样本参与损失的 token 数和损失归一化方式,还会影响实际优化强度。例如,同样一条样本,短文本回答与 576 个视觉 token 的输出,不一定产生相同规模的训练信号。因此,"比例更均衡"必须与损失实现和效果测试一起解释。
3.3 完整超参数与早停差异
论文 Table 2 给出三个阶段的完整配置。为便于阅读,下面把原表合并单元格展开为各阶段列。
| Hyperparameters | Janus-Pro-1B / Stage 1 | Janus-Pro-1B / Stage 2 | Janus-Pro-1B / Stage 3 | Janus-Pro-7B / Stage 1 | Janus-Pro-7B / Stage 2 | Janus-Pro-7B / Stage 3 |
|---|---|---|---|---|---|---|
| Learning rate | 1.0 × 10 − 3 1.0 \times 10^{-3} 1.0×10−3 | 1.0 × 10 − 4 1.0 \times 10^{-4} 1.0×10−4 | 4.0 × 10 − 5 4.0 \times 10^{-5} 4.0×10−5 | 1.0 × 10 − 3 1.0 \times 10^{-3} 1.0×10−3 | 1.0 × 10 − 4 1.0 \times 10^{-4} 1.0×10−4 | 4.0 × 10 − 5 4.0 \times 10^{-5} 4.0×10−5 |
| LR scheduler | Constant | Constant | Constant | Constant | Constant | Constant |
| Weight decay | 0.0 | 0.0 | 0.0 | 0.0 | 0.0 | 0.0 |
| Gradient clip | 1.0 | 1.0 | 1.0 | 1.0 | 1.0 | 1.0 |
| Optimizer | AdamW ( β 1 = 0.9 , β 2 = 0.95 \beta_1 = 0.9, \beta_2 = 0.95 β1=0.9,β2=0.95 ) | AdamW ( β 1 = 0.9 , β 2 = 0.95 \beta_1 = 0.9, \beta_2 = 0.95 β1=0.9,β2=0.95 ) | AdamW ( β 1 = 0.9 , β 2 = 0.95 \beta_1 = 0.9, \beta_2 = 0.95 β1=0.9,β2=0.95 ) | AdamW ( β 1 = 0.9 , β 2 = 0.95 \beta_1 = 0.9, \beta_2 = 0.95 β1=0.9,β2=0.95 ) | AdamW ( β 1 = 0.9 , β 2 = 0.95 \beta_1 = 0.9, \beta_2 = 0.95 β1=0.9,β2=0.95 ) | AdamW ( β 1 = 0.9 , β 2 = 0.95 \beta_1 = 0.9, \beta_2 = 0.95 β1=0.9,β2=0.95 ) |
| Warm-up steps | 600 | 5000 | 0 | 600 | 5000 | 0 |
| Training steps | 20K | 360K | 80K | 20K | 360K | 40K |
| Batch size | 256 | 512 | 128 | 256 | 512 | 128 |
| Data Ratio | 1:0:3 | 2:3:5 | 5:1:4 | 1:0:3 | 2:3:5 | 5:1:4 |
表中 Stage II 写的是 360K 步,实施细节明确说明实际采用早停,在 270K 步停止。 复现时应该同时保留计划配置与实际执行量;本文不静默把表里的 360K 改成 270K,也不把计划上限写成已完成训练量。
1B 与 7B 的 Stage III 分别列出 80K 和 40K 步,其他条件也并非全部相同。因此,大模型与小模型的性能差异不是纯粹的单变量参数规模实验。它们支持这套训练路线可扩展,但不足以单独拟合严格的 Scaling Law。
图像预处理同样有任务差异:理解数据按长边缩放并以 RGB(127,127,127) 填充短边;生成数据按短边缩放,再裁剪长边,最终都得到 384×384。理解路径优先保留完整内容,生成路径使用固定画幅,这会影响边缘物体是否保留以及训练样本的实际构图。
论文使用 sequence packing 提升训练利用率,在一个训练步中按指定比例混合数据。1.5B 与 7B 分别使用 16 和 32 个节点、每节点8张 A100 40GB,整体训练约9天和14天。相应硬件规模为128与256张卡;这些数据是作者的训练投入描述,不是他人复现必然需要或足够的精确预算。
四、数据扩展:更多样本与更好的监督分别贡献什么
4.1 理解侧加入约九千万样本
Stage II 的理解数据参考 DeepSeek-VL2,增加约九千万条样本,包括图像描述,以及表格、图表和文档理解数据。Stage III 还扩展了 MEME 理解、中文对话和提升交互体验的数据。
这些改动增加的不只是数量,也改变了任务覆盖。自然图像描述、文档读取和对话行为的监督目标不同,不能把能力提升全部归因于"模型见过更多图片"。如果要识别因果贡献,需要固定其他条件,分别测试规模、任务分布和标注质量。
4.2 生成侧加入约七千二百万合成审美样本
作者认为前代真实数据存在较多噪声,影响输出稳定性。Pro 加入约七千二百万合成审美样本,并在统一预训练中将真实与合成数据比例设置为 1:1。论文观察到收敛更快、画面更稳定、审美表现改善。
真实与合成的 1:1 是训练数据配方,不能直接证明二者对模型的有效信息量相等。合成数据可能提供更干净的图文关系与风格一致性,也可能复制生成模型的偏差、重复构图和长尾缺失。采用合成数据的收益,需要通过未参与合成与筛选的独立测试集检验。
论文提到部分合成数据的提示词公开可用。提示词公开不等于全部训练图片、生成器配置、筛选规则与去重流程均已公开。 下载可推理的权重,与完整重建训练数据,是不同的复现层级。
4.3 三项改进共同变化,归因必须克制
Janus-Pro 同时改变训练阶段、数据和模型规模。1B 版本相对 Janus 的明显提升提示配方和数据本身有作用;7B 的进一步提升说明扩大主干仍有收益。但论文没有给出足够完整的全因子消融,因此无法从现有表格中精确分配每一项改动的贡献百分比。
Rocky认为,理解这类技术报告应抓住"可复用的资源分配原则",同时保留因果边界。 将易任务放到冻结主干的适配阶段,把昂贵的主干更新用于更丰富的条件学习,是一个值得验证的策略,而不是不加条件适用于所有模型的规则。
五、理解实验:统一模型并非所有细分指标都第一
论文 Table 3 完整比较理解专用模型与同时支持理解、生成的模型。Und. Only 表示仅理解,Und. and Gen. 表示兼具理解与生成,† 表示使用外部预训练扩散模型。参数列是 LLM 参数量,不是所有组件的总和。
| Type | Model | # LLM Params | POPE↑ | MME-P↑ | MMB↑ | SEED↑ | GQA↑ | MMMU↑ | MM-Vet↑ |
|---|---|---|---|---|---|---|---|---|---|
| Und. Only | LLaVA-v1.5-Phi-1.5 | 1.3B | 84.1 | 1128.0 | - | - | 56.5 | 30.7 | - |
| Und. Only | MobileVLM | 1.4B | 84.5 | 1196.2 | 53.2 | - | 56.1 | - | - |
| Und. Only | MobileVLM-V2 | 1.4B | 84.3 | 1302.8 | 57.7 | - | 59.3 | - | - |
| Und. Only | MobileVLM | 2.7B | 84.9 | 1288.9 | 59.6 | - | 59.0 | - | - |
| Und. Only | MobileVLM-V2 | 2.7B | 84.7 | 1440.5 | 63.2 | - | 61.1 | - | - |
| Und. Only | LLaVA-Phi | 2.7B | 85.0 | 1335.1 | 59.8 | - | - | - | 28.9 |
| Und. Only | LLaVA | 7B | 76.3 | 809.6 | 38.7 | 33.5 | - | - | 25.5 |
| Und. Only | LLaVA-v1.5 | 7B | 85.9 | 1510.7 | 64.3 | 58.6 | 62.0 | 35.4 | 31.1 |
| Und. Only | InstructBLIP | 7B | - | - | 36.0 | 53.4 | 49.2 | - | 26.2 |
| Und. Only | Qwen-VL-Chat | 7B | - | 1487.5 | 60.6 | 58.2 | 57.5 | - | - |
| Und. Only | IDEFICS-9B | 8B | - | - | 48.2 | - | 38.4 | - | - |
| Und. Only | Emu3-Chat | 8B | 85.2 | 1244 | 58.5 | 68.2 | 60.3 | 31.6 | 37.2 |
| Und. Only | InstructBLIP | 13B | 78.9 | 1212.8 | - | - | 49.5 | - | 25.6 |
| Und. and Gen. | DreamLLM† | 7B | - | - | - | - | - | - | 36.6 |
| Und. and Gen. | LaVIT† | 7B | - | - | - | - | 46.8 | - | - |
| Und. and Gen. | MetaMorph† | 8B | - | - | 75.2 | 71.8 | - | - | - |
| Und. and Gen. | Emu† | 13B | - | - | - | - | - | - | - |
| Und. and Gen. | NExT-GPT† | 13B | - | - | - | - | - | - | - |
| Und. and Gen. | Show-o-256 | 1.3B | 73.8 | 948.4 | - | - | 48.7 | 25.1 | - |
| Und. and Gen. | Show-o-512 | 1.3B | 80.0 | 1097.2 | - | - | 58.0 | 26.7 | - |
| Und. and Gen. | D-Dit | 2.0B | 84.0 | 1124.7 | - | - | 59.2 | - | - |
| Und. and Gen. | Gemini-Nano-1 | 1.8B | - | - | - | - | - | 26.3 | - |
| Und. and Gen. | ILLUME | 7B | 88.5 | 1445.3 | 65.1 | 72.9 | - | 38.2 | 37.0 |
| Und. and Gen. | TokenFlow-XL | 13B | 86.8 | 1545.9 | 68.9 | 68.7 | 62.7 | 38.7 | 40.7 |
| Und. and Gen. | LWM | 7B | 75.2 | - | - | - | 44.8 | - | 9.6 |
| Und. and Gen. | VILA-U | 7B | 85.8 | 1401.8 | - | 59.0 | 60.8 | - | 33.5 |
| Und. and Gen. | Chameleon | 7B | - | - | - | - | - | 22.4 | 8.3 |
| Und. and Gen. | Janus | 1.5B | 87.0 | 1338.0 | 69.4 | 63.7 | 59.1 | 30.5 | 34.3 |
| Und. and Gen. | Janus-Pro-1B | 1.5B | 86.2 | 1444.0 | 75.5 | 68.3 | 59.3 | 36.3 | 39.8 |
| Und. and Gen. | Janus-Pro-7B | 7B | 87.4 | 1567.1 | 79.2 | 72.1 | 62.0 | 41.0 | 50.0 |
Janus-Pro-7B 的 MMBench 为79.2,明显高于前代 Janus 的69.4;MM-Vet 从34.3提升到50.0,MMMU 从30.5提升到41.0。这些结果支持整体理解能力改善。
但细分指标不能被"整体最好"的措辞掩盖:ILLUME 的 POPE 为88.5,高于 Janus-Pro-7B 的87.4;ILLUME 的 SEED 为72.9,也高于72.1;TokenFlow-XL 的 GQA 为62.7,高于62.0。Janus-Pro-1B 的 POPE 为86.2,甚至低于前代 Janus 的87.0。统一训练的收益与局部退化可以同时存在。
不同基准衡量不同能力。POPE关注对象幻觉,MMMU涵盖跨学科问题,文档与OCR又受输入分辨率限制。将它们平均可以形成概览,但不能替代产品场景的专项验收。若应用主要需要读取密集小字,通用榜单提升仍不足以消除384×384输入瓶颈。
表中的模型来自不同时间、训练数据和评测设置。它展示该版本报告的比较结果,不代表所有模型在统一成本、统一提示词与统一数据约束下重训后的结论。
六、生成实验:GenEval与DPG-Bench分别证明了什么
6.1 GenEval关注对象与组合约束
论文 Table 4 如下,完整保留对象、计数、颜色、位置和属性绑定结果。
| Type | Method | Single Obj. | Two Obj. | Counting | Colors | Position | Color Attri. | Overall↑ |
|---|---|---|---|---|---|---|---|---|
| Gen. Only | LlamaGen | 0.71 | 0.34 | 0.21 | 0.58 | 0.07 | 0.04 | 0.32 |
| Gen. Only | LDM | 0.92 | 0.29 | 0.23 | 0.70 | 0.02 | 0.05 | 0.37 |
| Gen. Only | SDv1.5 | 0.97 | 0.38 | 0.35 | 0.76 | 0.04 | 0.06 | 0.43 |
| Gen. Only | PixArt-α | 0.98 | 0.50 | 0.44 | 0.80 | 0.08 | 0.07 | 0.48 |
| Gen. Only | SDv2.1 | 0.98 | 0.51 | 0.44 | 0.85 | 0.07 | 0.17 | 0.50 |
| Gen. Only | DALL-E 2 | 0.94 | 0.66 | 0.49 | 0.77 | 0.10 | 0.19 | 0.52 |
| Gen. Only | Emu3-Gen | 0.98 | 0.71 | 0.34 | 0.81 | 0.17 | 0.21 | 0.54 |
| Gen. Only | SDXL | 0.98 | 0.74 | 0.39 | 0.85 | 0.15 | 0.23 | 0.55 |
| Gen. Only | DALL-E 3 | 0.96 | 0.87 | 0.47 | 0.83 | 0.43 | 0.45 | 0.67 |
| Gen. Only | SD3-Medium | 0.99 | 0.94 | 0.72 | 0.89 | 0.33 | 0.60 | 0.74 |
| Und. and Gen. | SEED-X† | 0.97 | 0.58 | 0.26 | 0.80 | 0.19 | 0.14 | 0.49 |
| Und. and Gen. | Show-o | 0.95 | 0.52 | 0.49 | 0.82 | 0.11 | 0.28 | 0.53 |
| Und. and Gen. | D-DiT | 0.97 | 0.80 | 0.54 | 0.76 | 0.32 | 0.50 | 0.65 |
| Und. and Gen. | LWM | 0.93 | 0.41 | 0.46 | 0.79 | 0.09 | 0.15 | 0.47 |
| Und. and Gen. | Transfusion | - | - | - | - | - | - | 0.63 |
| Und. and Gen. | ILLUME | 0.99 | 0.86 | 0.45 | 0.71 | 0.39 | 0.28 | 0.61 |
| Und. and Gen. | TokenFlow-XL | 0.95 | 0.60 | 0.41 | 0.81 | 0.16 | 0.24 | 0.55 |
| Und. and Gen. | Chameleon | - | - | - | - | - | - | 0.39 |
| Und. and Gen. | Janus | 0.97 | 0.68 | 0.30 | 0.84 | 0.46 | 0.42 | 0.61 |
| Und. and Gen. | Janus-Pro-1B | 0.98 | 0.82 | 0.51 | 0.89 | 0.65 | 0.56 | 0.73 |
| Und. and Gen. | Janus-Pro-7B | 0.99 | 0.89 | 0.59 | 0.90 | 0.79 | 0.66 | 0.80 |
Janus-Pro-7B 的 Overall 为0.80,相比 Janus 的0.61提高0.19,即19个百分点。相对增幅约31.1%,但相对增幅与百分点是两种不同描述,应避免混用。小版本已经达到0.73,说明提升不能全部解释为扩大到7B。
Position 从0.46到0.79,是一个明显改善;Color Attri. 从0.42到0.66,也显示属性组合更强。但 Counting 为0.59,低于 SD3-Medium 的0.72;Two Obj. 为0.89,低于 SD3-Medium 的0.94。Overall 更高,不等于每种提示词都更可靠。
GenEval 依赖规则化任务与视觉评测器。它能够反映组合指令遵循,却不是照片真实性、复杂文本排版或高分辨率细节的综合排名。尤其不能仅凭0.80就断言模型在所有文生图体验上都超过 DALL-E 3 或其他生成模型。
6.2 DPG-Bench关注密集描述的语义约束
论文描述 DPG-Bench 包含1065条较长、较密集的提示词,用于评估复杂文本与图像的语义对应。Table 5 完整结果如下。
| Method | Global | Entity | Attribute | Relation | Other | Overall↑ |
|---|---|---|---|---|---|---|
| SDv1.5 | 74.63 | 74.23 | 75.39 | 73.49 | 67.81 | 63.18 |
| PixArt-α | 74.97 | 79.32 | 78.60 | 82.57 | 76.96 | 71.11 |
| Lumina-Next | 82.82 | 88.65 | 86.44 | 80.53 | 81.82 | 74.63 |
| SDXL | 83.27 | 82.43 | 80.91 | 86.76 | 80.41 | 74.65 |
| Playground v2.5 | 83.06 | 82.59 | 81.20 | 84.08 | 83.50 | 75.47 |
| Hunyuan-DiT | 84.59 | 80.59 | 88.01 | 74.36 | 86.41 | 78.87 |
| PixArt-Σ | 86.89 | 82.89 | 88.94 | 86.59 | 87.68 | 80.54 |
| Emu3-Gen | 85.21 | 86.68 | 86.84 | 90.22 | 83.15 | 80.60 |
| DALL-E 3 | 90.97 | 89.61 | 88.39 | 90.58 | 89.83 | 83.50 |
| SD3-Medium | 87.90 | 91.01 | 88.83 | 80.70 | 88.68 | 84.08 |
| Janus | 82.33 | 87.38 | 87.70 | 85.46 | 86.41 | 79.68 |
| Janus-Pro-1B | 87.58 | 88.63 | 88.17 | 88.98 | 88.30 | 82.63 |
| Janus-Pro-7B | 86.90 | 88.90 | 89.40 | 89.32 | 89.48 | 84.19 |
Janus-Pro-7B 的 Overall 为84.19,高于前代的79.68,也略高于表中 SD3-Medium 的84.08。两者相差0.11,论文没有给出可用于判断这项小差异显著性的置信区间或多次随机重复结果,因此不应把它扩展为稳定、全面的代际领先。
DPG 的 Overall 不是把展示的 Global、Entity、Attribute、Relation 和 Other 五列简单平均即可重算的量。例如,直接平均 Janus-Pro-7B 的五个子项,结果不会等于84.19。阅读与复现应遵循基准的实际聚合协议,不应该为了让表格"看起来一致"自行修改数值。
同样,7B 的 Global 为86.90,低于1B版本的87.58;更大的模型也不保证每个子项单调改善。表格的价值,是帮助识别能力结构与取舍,而不只是提供一个可以引用的最高分。
七、从官方推理示例理解生成成本
官方仓库 README 中的 Janus-Pro 示例使用384×384输出和576个视觉 token,并以条件与无条件分支实现 classifier-free guidance。对两个分支的 logits,可将指导方式写为:
ℓ g u i d e d = ℓ u n c o n d + w ( ℓ c o n d − ℓ u n c o n d ) , \ell_{\mathrm{guided}}=\ell_{\mathrm{uncond}}+w\left(\ell_{\mathrm{cond}}-\ell_{\mathrm{uncond}}\right), ℓguided=ℓuncond+w(ℓcond−ℓuncond),
p ( z i ) = s o f t m a x ( ℓ g u i d e d / τ ) . p(z_i)=\mathrm{softmax}\left(\ell_{\mathrm{guided}}/\tau\right). p(zi)=softmax(ℓguided/τ).
w w w 是引导强度, τ \tau τ 是采样温度。示例代码中默认 w = 5 w=5 w=5、 τ = 1 \tau=1 τ=1,这些是示例设置,不足以证明论文所有表格都使用同一采样协议。实际评测还需锁定提示模板、随机种子、候选数和解码参数。
两条分支在生成过程中复用同一个已采样视觉 token,但文本条件不同。每步获得主干隐藏状态后,图像头预测下一个代码,代码经生成嵌入映射返回主干输入。完成576步后,视觉解码器一次性把代码网格还原为图片。
代码中的 use_cache=True 与 past_key_values 能减少历史前缀的重复计算,但不能消除576个位置之间的串行依赖。parallel_size=16 表示并行生成16个候选样本,也不表示单张图片的576个位置一次性并行预测;CFG还会让条件分支的计算批次进一步增加。
如果在相同下采样倍率下把边长从384提高到768,视觉 token 数将从576增加到2304。这是几何推导,不是论文已经验证的768版本。 上下文预算、缓存、注意力计算、训练分布与视觉解码器都可能受影响,不能只改一个输出尺寸参数就认为完成高分辨率扩展。
八、定性能力与信息瓶颈

图4|同一张论文标准图中包含图像描述、地标识别、文字读取、常识问答和文生图样例;完整保留各子面板。
这些例子展示了共享模型在不同任务之间切换的能力。理解回答的流畅程度、图像语义的丰富程度,与每项事实是否正确仍需分别判断。图中的文字回答属于模型输出样例,不能将其所有细节自动当作独立核实的事实。
论文在结论中明确承认两类限制。理解侧受384×384输入限制,细粒度OCR等任务容易受损;生成侧受低分辨率和视觉tokenizer重建损失影响,小面积人脸等区域可能缺少细节。
扩大语言模型可以改善条件学习,但无法恢复编码阶段已经丢掉的信息。若输入预处理使小字不可辨,或生成码本的重建能力不足,继续扩大主干可能遇到收益瓶颈。提升系统能力,需要同时检查编码分辨率、量化重建误差与生成建模能力。
九、复现与落地边界
官方 Janus 仓库提供 Janus-Pro-1B 与 Janus-Pro-7B 的权重入口及推理示例,这使推理验证具有明确起点。但跑通推理、复现评测和从头复现训练是三个层次:后两者还需要锁定数据、预处理、训练阶段、评测器和采样协议。
复现实验时,应明确小版本的1.5B语言主干口径,记录Stage II实际270K早停,保留理解与生成各自的预处理方式,并区分模型名称、语言模型参数量及整个系统开销。比较同一模型时,应先固定这些条件,再讨论软件优化或硬件差异。
论文没有展示完整的自由形式图像编辑、多轮视觉编辑或视频生成评测。共享理解与生成主干,提供了进一步探索的基础,但不能把接口上的可能性直接当成已经验证的产品能力。它也没有证明所有多任务训练都能避免负迁移。
在落地时,一个合格产物至少需要满足内容正确、约束满足、细节可用和成本可接受。模型在GenEval上表现较好,适合成为组合指令研究的起点;如果任务是高清商业海报、密集文本或精细身份保持,就应引入相应专项测试,而不能依赖总体分数作决定。
十、值得继续研究的方向
首先,将"表征解耦"的收益从其他改进中分离。固定语言主干、数据量与训练预算,比较共享和解耦视觉编码;再分别加入数据质量与阶段配方变化。这样的实验更能回答模块设计的因果作用。
其次,建立多任务梯度与数据比例的联合诊断。采样比例不等于优化贡献,实际训练可以记录不同任务的有效token量、损失尺度、梯度方向与验证集退化,找到理解和生成之间更稳定的平衡点。这是研究建议,不能当成论文已实现的方法。
再次,研究分辨率与视觉token数量的共同扩展。局部裁剪、动态分辨率、更高质量tokenizer或分层视觉代码,都可能改变信息瓶颈与推理成本。每次扩展都需要同时测量输入信息保留、输出细节和端到端吞吐。
最后,比较合成数据的覆盖质量。对同样的数据预算,改变生成器、提示词多样性、筛选阈值和去重方法,评估长尾概念、组合关系与真实场景泛化。数据增长只有转化为新的有效监督,才能形成持续收益。
术语与概念速查
| 概念 | 在Janus-Pro中的含义 | 容易混淆的地方 |
|---|---|---|
| 视觉编码解耦 | 理解与生成采用不同编码路径 | 不等于两个独立语言主干 |
| SigLIP | 理解侧的语义视觉编码器 | 不负责直接解码生成图像 |
| VQ tokenizer | 把图像转换为可预测、可解码的视觉代码 | 16,384码本大小与576序列长度不同 |
| 图像预测头 | 从共享隐藏状态预测视觉代码 | 不等于语言模型的文本预测头 |
| CFG | 组合条件和无条件logits加强条件控制 | 不保证所有引导强度都提高质量 |
| Stage II早停 | 正文报告实际270K停止 | 表2中360K是需要一起解释的计划配置 |
| GenEval与DPG | 对象组合与密集描述的指令遵循评测 | 不等于完整画质与生产可靠性评价 |
Janus-Pro说明,统一多模态系统可以通过不同的视觉表示接入同一个自回归主干,再通过训练分工和数据扩展提升能力。长期值得借鉴的,是把表示需求、训练阶段与验收目标放到同一套系统设计中:该共享的地方共享,该保留差异的地方保留差异,再用受控实验验证取舍。
推荐阅读
1. 深入浅出完整解析AI Agent(AI智能体)的核心基础知识
2025年可以说是AI Agent全面落地应用的元年,因此Rocky在持续撰写对AI Agent的全维度解析文章:
深入浅出完整解析AI Agent(AI智能体)的核心基础知识
2. 深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识
Rocky对扩散模型的本质原理与和核心基础知识进行了全面系统的深入浅出分析讲解,同时不断跟进补充扩散模型的最新技术发展,希望能给大家带来帮助:
深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识
3. 入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识
Rocky对AIGC时代"中场时刻"之后的主流AIGC创作大模型的核心基础知识进行了全面系统的深入浅出分析讲解,力求让大家通俗易懂理解AIGC时代的技术浪潮的本质价值:
入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识
4. 深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识
Rocky对FLUX.1 Kontext和FLUX.1 Krea的核心基础知识作了全面系统的梳理与解析:
深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识
5. 深入浅出完整解析DeepSeek系列核心基础知识
Rocky对DeepSeek系列模型的核心基础知识作了全面系统的梳理与解析:
6. 深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识
Rocky对Stable Diffusion 3和FLUX.1的核心基础知识作了全面系统的梳理与解析:
深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识
7. 深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识
Rocky对Stable Diffusion XL的核心基础知识作了全面系统的梳理与解析:
深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识
8. 深入浅出完整解析Stable Diffusion(SD)核心基础知识
Rocky对Stable Diffusion 1.x-2.x系列模型的核心基础知识做了全面系统的梳理与解析:
深入浅出完整解析Stable Diffusion(SD)核心基础知识
9. 深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识
Rocky对Stable Diffusion中最为关键的U-Net结构进行了深入浅出的全面解析,包括其在传统深度学习中的价值和在AIGC中的价值:
深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识
10. 深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识
对于AIGC时代中的"ResNet"------LoRA模型,Rocky进行了深入浅出的全面讲解:
深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识
11. 深入浅出完整解析ControlNet核心基础知识
AIGC图像创作开源社区已经形成以Stable Difffusion/FLUX为核心,ConrtolNet和LoRA作为首要AI辅助工具的变化万千的AIGC图像创作工作流。
ControlNet正是让AI图像创作社区无比繁荣的关键一环,它让AIGC图像创作过程更加的可控,更有助于广泛地将AIGC算法解决方案应用到各行各业中:
12. 深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识
AI绘画和AI视频是两个互相促进、相互交融的领域,2024年无疑是AI视频领域的爆发之年,Rocky对AI视频领域核心的Sora、Seedance、Keling等大模型进行了全面系统的梳理与解析:
深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识
13. 深入浅出完整解析AIGC时代Transformer核心基础知识
在AIGC时代中,Transformer为AI行业带来了深刻的变革。Transformer架构正在一步一步重构所有的AI技术方向,成为AI技术架构大一统与多模态整合的关键核心基座,大有一统"AI江湖"之势。Rocky也对Transformer模型进行持续的深入浅出梳理与解析:
深入浅出完整解析AIGC时代Transformer核心基础知识
14. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识
AIGC创作框架正是AIGC算法工作流的运行载体,目前主流的AIGC创作框架有ComfyUI、Diffusers、Stable Diffusion WebUI等 。在传统深度学习时代,PyTorch、TensorFlow以及Caffe是传统深度学习模型的基础运行框架,到了AIGC时代,Rocky相信ComfyUI就是AIGC时代的"PyTorch"、Stable Diffusion WebUI就是AIGC时代的"TensorFlow"、Diffusers就是AIGC时代的"Caffe":
深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识
15. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识
在AIGC时代中,如何快速转身,入局AIGC产业?如何成为AIGC/LLM/AI Agent算法/开发工程师?如何在学校中系统性学习AIGC/LLM/AI Agent知识,斩获心仪的AIGC/LLM/AI Agent算法/开发offer?
Don't worry,Rocky为大家总结整理了全面的AIGC/LLM/AI Agent算法/开发工程师成长秘籍,为大家答疑解惑,希望能给大家带来帮助:
手把手教你成为AIGC/LLM/AI Agent算法/开发工程师,斩获AIGC/LLM/AI Agent算法/开发offer!
16. AIGC产业的深度思考与分析
2023年3月21日,微软创始人比尔·盖茨在其博客文章《The Age of AI has begun》中表示,自从1980年首次看到图形用户界面(graphical user interface)以来,以OpenAI为代表的科技公司发布的AIGC模型是他所见过的最具革命性的技术进步。
Rocky也认为,AIGC及其生态,会成为AI行业重大变革的主导力量。AIGC会带来一个全新的红利期,未来随着AIGC的全面落地和深度商用,会深刻改变我们的工作、生活、学习以及交流方式,各行各业都将被重新定义,过程会非常有趣。
那么,在此基础上,我们该如何更好的审视AIGC的未来?我们该如何更好地拥抱AIGC引领的革新?Rocky准备从技术、产品、商业模式、长期主义等维度持续分享一些个人的核心思考与观点,希望能帮助各位读者对AIGC有一个全面的了解:
深入浅出全面解析AIGC时代核心价值与发展趋势(2025年版)
17. AI算法工程师的独孤九剑秘籍
为了方便大家实习、校招以及社招的面试准备,同时帮助大家提升扩展技术基本面,Rocky将符合大厂和AI独角兽价值的算法高频面试知识点撰写总结成《三年面试五年模拟》之独孤九剑秘籍:
【三年面试五年模拟】AIGC时代的算法工程师的求职面试秘籍(持续更新中)
18. 深入浅出完整解析AIGC时代中GAN(Generative Adversarial Network)系列模型核心基础知识
GAN系列模型作为传统深度学习时代的最热门生成式Al模型,在AIGC时代继续繁荣,作为Stable Diffusion/FLUX系列大模型的"得力助手",广泛活跃于AlGC图像创作的产品与工作流中:
深入浅出完整解析AIGC时代中GAN(Generative Adversarial Network)系列模型核心基础知识