VVC 帧间编码分区加速方法

一、为什么帧间编码分区加速是 VVC 落地的关键瓶颈?

H.266/VVC 相比 H.265/HEVC 可节省约 50% 的码率,但代价是编码复杂度暴增至 HEVC 的 8-10 倍。在 Random Access(RA)配置下,帧间编码占据了编码器绝大部分的运行时间。

帧间编码的核心目标是消除时间冗余------利用已编码的参考帧来预测当前帧。但 VVC 在帧间编码中引入了大量新工具和更灵活的分区结构,使得 RDO(率失真优化)的搜索空间呈指数级膨胀。如果不做任何优化,一个 128×128 的 CTU 在帧间编码时需要递归遍历所有可能的划分组合和预测模式,计算量极其惊人。

根据 IEEE Access 2025 综述的统计,在 VVC 帧间编码中:

  • CU 分区决策是最主要的计算瓶颈,占据了最多的编码时间
  • 编码时间节省的文献报告范围约为 10%-55% ,BD-rate 增加通常不超过 3%
  • 深度学习方法通常能实现最大的时间节省(约 50% 以上),但以训练数据和推理开销为代价

二、VVC 帧间编码复杂度的三大根源

2.1 QTMT 分区结构的组合爆炸

VVC 用四叉树加多类型树(QTMT)替代了 HEVC 的纯四叉树分区。一个 CU 在每个节点面临 6 种选择

划分方式 含义 约束
不划分(NS) 保持当前 CU 直接进入模式决策
四叉树(QT) 等分四块 仅在 QT 阶段可用
水平二叉树(BTH) 上下等分两块 进入 MTT 后不可回 QT
垂直二叉树(BTV) 左右等分两块 进入 MTT 后不可回 QT
水平三叉树(TTH) 按 1:2:1 上下分三块 进入 MTT 后不可回 QT
垂直三叉树(TTV) 按 1:2:1 左右分三块 进入 MTT 后不可回 QT

CTU 最大尺寸从 HEVC 的 64×64 扩展到 VVC 的 128×128 ,最小 CU 可达 4×4 (亮度)。更大的尺寸范围和更多的划分方式导致递归深度更深、分支因子更大。研究表明,QTMT 分区过程在帧内编码中占据 91.7% 的时间,在帧间编码中同样是最大瓶颈。

2.2 帧间预测模式的扩展

VVC 在 HEVC 的 Merge/Skip 和 AMVP 两种基本帧间预测模式之上,引入了大量新模式:

预测模式 功能 复杂度影响
扩展 Merge 候选列表从 5 扩到 6,增加 HMVP 候选构建开销
MMVD Merge + 运动矢量差 额外搜索起点
仿射运动补偿(AME) 4/6 参数模型,描述旋转/缩放 比平移模型昂贵得多
SbTMVP 子块级时域 MV 预测 增加时域搜索
AMVR 自适应 MV 精度(1/4, 1/2, 1, 4 像素) 多精度遍历
BCW CU 级加权双向预测 双向搜索 × 权重组合
BDOF 双向光流优化 亚像素级光流计算
DMVR 解码端 MV 细化 双边匹配迭代
GPM 几何分区预测 任意角度分区尝试
CIIP 帧内+帧间联合预测 额外帧内 Planar 计算
Triangle 三角形分区预测 两种单向预测组合

对于每个 CU,编码器需要逐一评估上述模式的 RD 代价,选择最优者。这意味着即使不考虑分区递归,单个 CU 的帧间模式决策就已经非常耗时。

2.3 运动估计的高昂代价

运动估计(ME)是帧间编码中最耗时的子模块之一。VVC 中 ME 的复杂度增长来自:

  • 多参考帧:VVC 支持更多的参考帧,每个参考帧都需要独立搜索
  • 亚像素精度:默认 1/4 像素精度,仿射模式下需要更细的插值
  • 仿射 ME:需要搜索控制点运动矢量(CPMV),参数空间远大于平移 MV
  • 大搜索范围:128×128 CTU 意味着更大的搜索窗口

一个典型的统计数据:运动估计在帧间编码中占据约 40%-70% 的时间(取决于配置和内容)。


三、分区加速的技术原理:从暴力搜索到智能剪枝

3.1 核心思路:缩小 RDO 搜索空间

分区加速的本质是在 RDO 的递归遍历过程中,通过某种策略提前跳过或终止不可能成为最优的划分路径,从而减少实际需要计算的 RDO 次数。

一个 CU 的 RDO 遍历过程可以表示为:

复制代码
对当前 CU:
  1. 计算不划分(NS)的 RD 代价
  2. 对每个候选划分方式(QT/BTH/BTV/TTH/TTV):
     a. 执行划分
     b. 对每个子块递归执行上述过程
     c. 累加子块 RD 代价作为该划分的总代价
  3. 选择 RD 代价最小的方案

加速策略就是在步骤 2 中跳过某些划分方式 (提前剪枝),或在步骤 1 之后直接决定不划分(提前终止),而不需要遍历所有候选。

3.2 统计特征驱动的加速

最直观的加速方式是利用视频内容的统计特征来预测分区趋势:

运动一致性分析

帧间编码中,运动平坦的区域(如静止背景)倾向于使用大块不划分,运动复杂的区域(如移动物体边界)倾向于细分。常用的运动一致性度量包括:

  • 运动矢量方差:相邻块 MV 的方差小 → 运动一致 → 倾向不划分
  • 帧差值:当前帧与参考帧的像素差均值小 → 静态区域 → 倾向不划分
  • 三帧差法:利用连续三帧的差分判断运动区域

一个代表性工作(Amna et al., ICMLC 2024)通过统计分析发现运动补偿与静态区域之间的相关性,据此判断当前区域是否应进行"不划分"测试,从而跳过不必要的分区遍历。

纹理复杂度分析

虽然帧间编码主要关注时间冗余,但空间纹理特征同样影响分区决策:

  • 平均局部方差(ALV):CU 内部像素的局部方差,反映纹理同质性。ALV 低 → 平滑区域 → 倾向不划分或大块
  • 梯度方向:水平梯度显著 > 垂直梯度 → 垂直二叉树(BTV)更可能优于水平二叉树(BTH)
  • 边缘检测:Canny 等边缘检测器可提取块内主边缘方向,直接推断划分方向

GBM-QTMT(Bakkouri et al., Signal Image Video 2024)提出了基于梯度提升机(GBM)的方法:第一步提取 ALV 特征,第二步用 GBM 分类器为每种 QT CU 尺寸构建二分类模型并提取阈值,第三步基于阈值执行快速分区决策。

时空相关性预测

已编码 CU 的分区信息对当前 CU 有强预测力:

  • 空域相关:左方和上方 CU 的划分深度可以设定当前 CU 的搜索范围
  • 时域相关:前一帧同位置 CU 的分区结构可以预测当前帧的分区趋势
  • 父子相关:父 CU 的分区结果可以约束子 CU 的候选集

3.3 机器学习驱动的加速

当统计特征的阈值难以覆盖所有场景时,机器学习方法可以自动学习更复杂的特征-决策映射。

随机森林(RF)方法

Kulupana 等人提出了一种经典的 RF 框架:

  1. 对每种块尺寸(共 17 种)分别训练一个 RF 分类器
  2. 每个 RF 包含 40 棵决策树,最大深度 20
  3. 特征提取:为每种块尺寸和每种划分方式提取 131 种特征
  4. 特征筛选:按与划分决策的相关性排序,选取 top-N 特征
  5. 决策树子集优化:从 40 棵树中筛选最优子集
  6. 样本加权:分类错误带来的 RD-cost 损失越大,样本权重越大

在 VTM-8.0 上实现 42% 的时间节省,BD-rate 仅增加 1.26%

SVM 方法

为不同 CU 尺寸训练独立的 SVM 分类器,利用纹理信息预测划分方式。典型性能:时间节省 30%-63%,BDBR 增加 1.1%-2.7%。

CNN 方法

CNN 因其强大的图像特征提取能力,成为 VVC 帧间分区加速的前沿方向。典型工作流程:

复制代码
当前 CU 像素 → CNN 网络 → 各划分模式的概率分布 → 只对 Top-K 模式做 RDO

代表性工作 Deep Learned Fast H.266/VVC Inter-Coding(Lo et al., ICMLC 2024)提出了两条加速路径:

  1. CNN 预测分区模式:设计 CNN 模型预测当前 CU 的合适分区模式,跳过低概率的水平和垂直模式
  2. 背景分析提前终止:通过统计分析发现运动补偿与静态区域的相关性,判断当前区域是否应直接进行"不划分"测试

LAI-CNN(APSIPA 2025)则提出了轻量级三阶段预测方案:

  • 集成 VVC 帧间编码结构约束
  • 三阶段提前退出机制
  • 在 VTM22.0 RA 配置下实现 36%-49% 的时间节省,BDBR 仅增加 1.36%-3.48%

3.4 优化方法

通过数学建模将分区决策转化为可解析的优化问题:

  • RD 代价单峰性:预测模式的 RD 代价与 PU 尺寸之间存在单峰特性,可在代价上升时提前终止
  • 自适应模式排序:根据相邻 CU 信息自适应排序候选模式,使最优模式更可能排在前面
  • 拉格朗日乘子优化:建立 R-λ 模型,更精确地估计最优 QP 和模式选择

3.5 硬件协同方法

从芯片架构角度优化 RDO 流水线:

  • 并行 RDO:同一深度的不同候选划分可并行评估
  • 流水线气泡消除:通过分区调度优化、转置存储器重设计减少空闲等待
  • 面向硬件的分区剪枝:在硬件实现中嵌入轻量剪枝策略

代表性工作(Huang et al., TCSVT 2025)针对 QTMTT 在硬件 RDO 流水线中的四类气泡,提出三步消除策略,在 28nm 工艺下实现 4K@40fps 吞吐,硬件周期最高削减 77.9%,BD-Rate 损失仅 0%-1.21%。


四、性能全景对比

基于 IEEE Access 2025 综述和各代表性论文的数据,下表汇总了不同方法类别的典型性能范围:

方法类别 代表方法 编码时间节省 BDBR 增加 特点
统计/启发式 帧差法+边缘检测 30-36% 0.5-1.5% 极轻量,硬件友好
优化方法 自适应排序/单峰搜索 30-50% 0.4-2.0% 有数学支撑,无需训练
随机森林 Kulupana RF (VTM-8.0) ~42% ~1.26% 特征工程+子集优化
GBM GBM-QTMT (Springer 2024) 30-45% 0.8-2.0% ALV 特征+阈值提取
SVM 多尺寸 SVM (VTM-10.0) 31-63% 1.1-2.7% 按尺寸训练分类器
CNN Deep Inter-CNN (ICMLC 2024) 35-50% 1.0-3.0% 端到端分区预测
轻量 CNN LAI-CNN (APSIPA 2025, VTM22.0) 36-49% 1.36-3.48% 三阶段提前退出
深度学习 DeepQTMT 类方法 44-67% 1.3-3.2% 加速比最高
硬件协同 Bubble-Removing (TCSVT 2025) 77.9% 周期 0-1.21% 面向 ASIC 实现

关键趋势:

  • 深度学习方法通常能达到 50% 以上的时间节省,但需要大规模训练数据和推理开销
  • 启发式方法保持轻量和硬件友好,BDBR 影响小,但加速比有天花板
  • 机器学习方法(RF/SVM/GBM)在两者之间提供平衡的折衷
  • CU 分区是最主要的优化目标,其次是运动估计

五、帧间编码特有的加速机遇

与帧内编码不同,帧间编码有一些独特的加速机遇:

5.1 静态区域检测

视频中的静止背景区域在帧间编码中通常使用大块 Merge/Skip 模式即可高效编码。通过帧差分析或运动补偿残差分析,可以直接跳过分区递归:

复制代码
如果 当前CU的帧差均值 < 阈值:
    直接使用 Merge/Skip 模式,不进行分区遍历

这种方法对监控视频、视频会议等背景稳定的场景特别有效。

5.2 时域分区复用

前一帧同位置 CU 的分区结构对当前帧有很强的参考价值。如果前一帧某区域选择了不划分,当前帧大概率也会选择不划分(除非该区域出现了新的运动物体)。

5.3 运动矢量一致性

如果一个区域内的运动矢量高度一致(如整体平移),说明该区域属于同一运动物体,不需要细分。运动矢量方差可作为分区决策的有效特征。

5.4 SKIP/Merge 模式提前判定

VVC 的 Merge 候选列表扩展到 6 个候选。如果第一个候选(通常是最可能的最优 MV)的 RD 代价已经足够低,可以直接采用而不评估其他模式,同时跳过分区遍历。


六、挑战与开放问题

6.1 级联误差问题

在递归分区过程中,上层的错误决策会传播到整个子树。例如,如果一个大 CU 被错误地判定为"不划分",那么其内部所有更细粒度的分区可能性都被忽略了,可能导致显著的 BDBR 增加。这对加速算法的精度提出了很高要求。

6.2 跨 QP 泛化

不同 QP 下最优分区结构差异很大------高 QP 倾向大块、低 QP 倾向精细划分。固定阈值或固定模型难以跨 QP 泛化。解决方案包括 QP 条件训练和自适应阈值。

6.3 推理开销与实际收益的平衡

深度学习模型的推理时间可能抵消部分加速效果。特别是在实时编码场景中,如果 CNN 推理延迟 > RDO 节省的时间,则得不偿失。轻量化模型设计(知识蒸馏、量化推理)是关键方向。

6.4 混合流水线

单一方法各有短板。IEEE Access 2025 综述指出的核心未来方向是混合流水线------将多种方法组合为分层决策系统:

复制代码
Layer 1: 廉价统计过滤器(帧差/方差)→ 处理简单CU(~40%的CU)
Layer 2: ML分类器(RF/SVM)→ 处理中等复杂度CU(~35%)
Layer 3: 深度学习模型 → 处理困难CU(~25%)
Layer 4: 完整RDO → 仅对极少数无法决策的CU

这种分层设计可以在整体效率和精度之间取得更优平衡,但如何设计层间切换策略和训练统一的决策框架仍是开放问题。

6.5 VVC 帧间特有工具的联合优化

现有工作主要聚焦于 QTMT 分区和基本帧间模式选择,但 VVC 引入的仿射运动估计、GPM、CIIP 等新工具的加速仍有大量空间。这些工具的决策之间还存在耦合关系,联合优化是一个有前景的方向。


七、实践建议

基于领域文献和综述结论,对不同应用场景给出建议:

应用场景 推荐策略 理由
实时通信(RTC) 统计方法 + 硬件并行 推理延迟敏感,避免 ML 模型开销
离线转码/流媒体 CNN-based 方法 加速比高,推理开销可接受
嵌入式/移动端 统计 + 优化方法 计算资源受限,轻量优先
监控视频 静态区域检测 + 统计 背景稳定,帧差法极有效
ASIC 编码芯片 硬件协同 + 轻量剪枝 固定功能设计,需高吞吐
云端通用编码器 混合流水线 可灵活配置,按需选择层级

八、总结

VVC 帧间编码分区加速是一个多层次的技术问题,核心矛盾在于标准通过增加分区灵活性和预测模式来提升编码效率,但这种灵活性依赖暴力式 RDO 搜索来探索所有可能组合,导致编码时间数量级增长。

现有的加速方法从四个维度展开:

  1. 统计方法------利用运动一致性、纹理复杂度等特征做轻量剪枝
  2. 优化方法------通过 RD 代价建模和搜索空间结构特性减少候选
  3. 学习方法------用 ML/DL 模型从数据中自动学习分区决策策略
  4. 硬件方法------从架构层面消除流水线瓶颈

每种方法都在加速比、编码效率损失、实现复杂度和适用场景之间做出了不同的权衡。未来的趋势指向混合流水线------将多种方法的优势组合为分层决策系统,实现整体最优的复杂度-效率平衡。


主要参考来源:

  • ShahHosseini & Javadtalab, "Recent Advances in Complexity Reduction Methods for VVC Inter Coding: A Review," IEEE Access, 2025. DOI: 10.1109/ACCESS.2025.3640436
  • Lo & Lo, "Deep Learned Fast H.266/VVC Inter-Coding with Background Analysis," ICMLC 2024. DOI: 10.1109/ICMLC63072.2024.10935011
  • Lu et al., "Accelerating VVC Inter-Frame Coding: A Lightweight CNN for Fast QTMT Partitioning," APSIPA 2025. DOI: 10.1109/APSIPAASC65261.2025.11248974
  • Bakkouri et al., "GBM-QTMT: Gradient Boosting Machine-based fast QTMT partition decision for VVC inter-coding," SIViP, 2024. DOI: 10.1007/s11760-024-03780-3
  • Huang et al., "A 77.9%-Cycle-Reduced Bubble-Removing Strategy for Hardware RDO Supporting QTMTT in VVC," TCSVT, 2025. DOI: 10.1109/TCSVT.2025.3624844
  • Li et al., "DeepQTMT: A Deep Learning Approach for Fast QTMT-based CU Partition of Intra-mode VVC," arXiv:2006.13125
相关推荐
Lee_jerome1 小时前
python神经网络编程入门(二十)——RNN LSTM 数学原理与结构拆解
深度学习·numpy·lstm·参数量·sigmoid·tanh·门控机制
音视频工程实战2 小时前
音频元数据标准化设计:封面、章节、时间戳全链路统一存储规范
音视频
满怀冰雪2 小时前
15-Paddle 高层 API 入门:paddle.Model 的训练与评估流程
人工智能·python·深度学习·机器学习·paddle
妍妍爱学习16 小时前
自动编码器与变分自动编码器:同一脉络下的进化
深度学习·无监督学习·概率模型·自动编码器·变分自动编码器
小白说大模型17 小时前
人工智能:深度学习中的卷积神经网络(CNN)实战应用
人工智能·深度学习·cnn
程序员老陆17 小时前
从零写一个 FFmpeg 播放器:架构设计远比“解码显示”复杂
ffmpeg·音视频·播放器
Keepreal49618 小时前
《从零构建大模型》——从头实现GPT模型进行文本生成
gpt·深度学习·llm
卡梅德生物科技小能手18 小时前
卡梅德生物科普 TPBG(5T4)
经验分享·深度学习·生活
kuinnebula19 小时前
MP4音频帧定位与提取
音视频