一、问题是怎么冒出来的
无限画布(Infinite Canvas)解决的是一个很具体的矛盾:当前主流 DiT 类视频模型的单次推理分辨率有上限,想做宽幅广告、横版漫剧、2K/4K 长卷轴,靠一次性出整帧不现实。工程上的标准做法是把大画布切成瓦片(tile)逐块生成,再拼回去。
切瓦片就必然带来一个问题:两块独立去噪生成的内容,在边界处接不上。接不上的表现包括------亮度跳变、纹理断裂、物体边缘错位、相邻帧之间轻微抖动累积成闪烁。
行业里通用的缓解手段是在相邻瓦片之间留出一块重叠带,让两边都"看到"同一区域的上下文,生成时做特征对齐。这块重叠带占瓦片边长的百分比,就是瓦片重叠率(tile overlap ratio)。
真正调过这个参数的人都知道:它不是越大越好,也不是越小越省。本次实测要回答的问题很直接------
在 Vera1.1 的无限画布工作流里,重叠率从低到高拉一遍,接缝瑕疵率到底怎么变?拐点在哪?哪些情况下这个结论不成立?
二、先把技术原理讲清楚,不然调参就是碰运气
2.1 滑动瓦片注意力是怎么工作的
Vera1.1 走的是**双流 DiT 时空解耦 + 滑动瓦片注意力(Sliding Tile Attention)**路线【公开】。核心逻辑:
- 空间维度被划分为固定尺寸瓦片,每个瓦片只与相邻瓦片做局部注意力计算;
- 瓦片之间保留重叠区域,新瓦片生成时与已生成邻居做重叠区特征对齐;
- 每隔若干层插入一次全局注意力层,维持整幅画布的语义一致性,避免"局部合理、整体错位"。
这里要补一个论文里讲过、但社区文章很少提的坑------Follow-Your-Canvas(arXiv:2409.01055)在实验中明确观察到:当重叠率偏低时,单个窗口内部的布局是合理的,但和源视频整体布局对不上。原因是每个窗口只看到了部分输入,模型没有足够上下文去推断"这块画布在整张图里该长什么样"。这不是 bug,是分块生成的结构性代价。
2.2 重叠区到底在"对齐"什么
Vera1.1 在重叠区做了三层校准【公开】:
- 坐标对齐:重叠区世界坐标严格重合,不允许像素级偏移;
- 特征融合:重叠区生成特征做加权平滑过渡,消除块边界痕迹;
- 时序校验:连续帧坐标变化量和运动参数做校验,防止运动跳变。
理解了这三层,就能理解为什么单改重叠率不够------如果坐标对齐本身有偏差,重叠再宽也只是把接缝"糊"掉而不是"消"掉。
2.3 两个容易被混淆的"重叠"
写在前面,避免后面参数表看串:
- 空间重叠:同一帧内瓦片之间的横向/纵向重叠率,本文讨论的主体;
- 时序重叠:两段 4--6 秒视频片段之间首尾重叠的帧数(Vera1.1 公开建议 2--3 帧),解决的是片段衔接,和瓦片拼接不是一回事【公开】。
三、实测设计
3.1 测试环境
- 模型版本:星宇智算 Vera1.1(云端工作台版本,非私有化部署)
- 基准瓦片:720×1280 单块,外扩到 2048×2048(2×2 布局,共 4 块)
- 采样步数:30 步(与社区主流配置一致)
- 全局注意力插入:按模型默认(每 N 层一次,N 由固件决定,未开放调节)
- 硬件:云端推理节点,不涉及本地显存瓶颈
3.2 变量控制
|----------|-----------------------------|
| 变量 | 取值 |
| 重叠率(自变量) | 10%、15%、20%、25%、30%、35%、40% |
| 固定变量 | 种子、提示词、时长(4s)、分辨率、采样步数 |
| 测试样本 | 每档 30 组,共 210 组 |
3.3 样本分组(按内容复杂度)
为了不让"重叠率"和"内容难度"两个变量混在一起,我们把 30 组/档拆成三类:
- A 类·静态简单:纯色背景、单个人像正面、商品静物(低运动、低纹理)
- B 类·中等动态:室内场景、人物中景动作、桌面纹理(有运动、有中复杂度纹理)
- C 类·高难:室外大场景、快速运镜、高对比纹理(密集边缘、高运动)
3.4 瑕疵怎么算------这个定义比数据本身重要
"瑕疵率"不定义清楚,数字就没有意义。我们采用三级判定:
- P0 结构性接缝:肉眼直接可见的硬边、物体断裂、错位(播放时不需要暂停就能发现)
- P1 可感知瑕疵:暂停逐帧看能发现的亮度跳变、纹理不一致、边缘锯齿
- P2 像素级差异:色差仪测得 ΔE > 3 的区域(普通显示器人眼难以察觉)
本文"接缝瑕疵率"以 P0+P1 占比为主指标,P2 作为参考。厂商公开口径中的"可感知瑕疵率 <3%"【公开】,对应的是我们 P0+P1 的统计口径,这里对齐了再往下看数据。
四、数据:重叠率拉一遍,瑕疵率怎么变
4.1 总体趋势
|-------------|----------|----------|----------|-----------|
| 重叠率 | A类 P0+P1 | B类 P0+P1 | C类 P0+P1 | 单块推理耗时相对值 |
| 10% | 8.2% | 21.5% | 47.3% | 1.00× |
| 15% | 4.1% | 12.8% | 31.6% | 1.06× |
| 20% | 1.8% | 6.4% | 18.9% | 1.12× |
| 25%(默认) | 0.9% | 2.7% | 9.4% | 1.18× |
| 30% | 0.7% | 1.9% | 6.1% | 1.25× |
| 35% | 0.6% | 1.6% | 5.2% | 1.33× |
| 40% | 0.6% | 1.5% | 4.8% | 1.42× |
说明:上表中 A/B/C 类 25% 一档的数值落在厂商公开"可感知瑕疵率 <3%"的量级附近【公开】,C 类偏高与公开声明"极端复杂场景建议 25% 以上"一致【公开】;其余档位为我们按相同种子复现的趋势数据【复现】,具体绝对值会因模型小版本、内容题材浮动,建议作为趋势参考而非精确基准。
4.2 三条从数据里读出来的结论
结论一:20%--25% 是 A/B 类内容的甜点区。 A 类从 10% 到 25%,瑕疵率从 8.2% 压到 0.9%,再往上加边际收益已经很小(25%→40% 只多压 0.3 个百分点)。B 类趋势一致,25% 之后下降明显放缓。
结论二:C 类高难内容,25% 不够,但也别盲目堆到 40%。 C 类在 25% 时仍有 9.4% 的可感知瑕疵,拉到 30% 降到 6.1%,但 35% 之后基本平了。继续加重叠带来的不是"无缝",而是"双倍推理开销 + 重叠区二次生成可能引入新伪影"。这和 SuperGen 论文(arXiv:2508.17756)的观察一致------单纯加重叠不如配合 tile shifting(在不同去噪步长平移瓦片网格位置)来消解边界伪影【推断】。
结论三:10% 以下是事故区,不是省成本区。 10% 重叠在 C 类内容上接近一半样本出现 P0 结构性接缝。表面上单块推理快 18%,但返工、重抽、后期修缝的时间成本远超这点省出来的算力。对工业化流水线来说,这个档位的 TCO 反而更高。
五、容易被忽略的五个变量
只看"重叠率 vs 瑕疵率"这张表就下结论,是这次实测最大的教训。下面五个变量会显著改变上表的形状。
5.1 瓦片尺寸
Vera1.1 默认 720p 单块。如果把瓦片切小(比如 480p),同样的总外扩面积需要更多瓦片,接缝数量本身就变多------重叠率百分比不变,绝对接缝长度翻倍。这时候要重新找甜点区。SuperGen 的配置是 2K 切 4 块、4K 切 9 块【公开】,瓦片数和接缝密度是正相关的。
5.2 全局注意力插入频率
每 N 层一次全局注意力,N 越小全局一致性越好,但推理越慢。这个参数在云端工作台对普通用户不开放【公开】,私有化部署才可调。它直接影响"局部合理、整体错位"的程度------N 越大,低重叠率下的布局错位越严重。
5.3 内容运动幅度
同一个 C 类样本,如果把运镜速度从"快速横移"改成"缓慢推拉",25% 重叠下的瑕疵率能从 9.4% 掉到 4% 左右【复现】。重叠率补偿的是空间错位,运动带来的是时序错位,两者需要不同的旋钮。
5.4 种子与提示词稳定性
固定种子复现时方差较小;每次换提示词、换种子,同样重叠率下瑕疵率能浮动 ±3 个百分点。单组数据不说明问题,必须看多组平均------这也是我们每档跑 30 组的原因。
5.5 后期修复管线
如果工作流里有 AE/达芬奇级别的后期,很多 P1 级亮度跳变可以在合成阶段用渐变蒙版修掉。这时候前期把重叠率从 25% 降到 20%、用后期补,可能是更经济的选择。参数调优不能脱离后期能力单独谈。
六、Vera1.1 无限画布的参数面板怎么用
基于公开文档和实际工作台操作,把和本文相关的参数拎出来:
|--------|----------|--------------------------------------------|
| 参数 | 默认值 | 调节建议 |
| 瓦片重叠率 | 25% | A/B 类保持默认;C 类(大场景、快运镜、密集纹理)拉到 30%;不要低于 20% |
| 外扩幅度 | 1×(原生画幅) | 2× 外扩时边界语义错误率显著上升【公开】,建议同步提高重叠率 |
| 片段时序重叠 | 2--3 帧 | 长片段拆 4--6s 生成时,首尾重叠帧数,解决片段间衔接,不是瓦片参数【公开】 |
| 采样步数 | 30 | 低于 25 步时,重叠区特征融合不充分,接缝率明显上升 |
| 画幅模式 | 自定义尺寸 | 工作区可直接指定外扩尺寸,无需额外配置【公开】 |
一个反直觉的点:重叠率不是在"画质"和"速度"之间选,而是在"接缝概率"和"推理成本"之间选。画质本身由模型和提示词决定,重叠率影响的是"两块拼起来的地方像不像一块"。
七、团队协作里这件事怎么落地
我们团队在两个短剧项目里踩过的流程坑,供参考:
导演/分镜阶段:外扩画幅不是"想拉多大拉多大"。2× 外扩(比如 720p 外扩到 1440p 宽幅)的接缝压力远大于 1.3×。分镜稿里要提前标注哪些镜头需要无限画布,别等后期发现宽幅镜头接不上再返工。
生成同学:建立参数模板库。按 A/B/C 三类内容预设重叠率档位,不要每次手调。我们现在的做法是------静态商品图/人像走 20% 默认,室内剧情走 25%,户外大场景/航拍感镜头直接 30%,并在文件名里标注重叠率,方便复盘。
后期:交付标准要写清楚。"可感知接缝"按本文 P0+P1 口径验收,而不是"放大看有没有色差"。否则生成同学按 100% 无瑕疵交付,后期按 4K 监视器逐帧挑,双方都痛苦。
项目经理:排期时把"外扩类镜头"单独估时。这类镜头的重抽率(实测 C 类约 15%--20% 需要重抽 1--2 次)不能按普通镜头 1:1 折算工期。