【论文解读】系数能量引导的快速变换算法:Beyond VVC 编码器优化新思路

论文:Coefficients Energy Guided Fast Transform Algorithm in Beyond VVC

作者:Minzhe Chen, Yiming Wang, Junyan Huo, Fuzheng Yang(西安电子科技大学)

发表会议:IEEE Data Compression Conference (DCC) 2026

实验平台:ECM 17.0


一、引言:为什么 Beyond VVC 需要快速变换算法?

H.266/VVC(Versatile Video Coding)作为最新一代国际视频编码标准,于 2020 年正式定稿,相比上一代 HEVC 可节省约 50% 的码率。然而,这种压缩效率的大幅提升是以编码复杂度的急剧增长为代价的------VVC 编码器的计算复杂度约为 HEVC 的 10 倍以上。

在 VVC 标准定稿之后,JVET(联合视频专家组)并未停下脚步,而是启动了 Beyond VVC 探索计划,以 ECM(Enhanced Compression Model) 作为软件参考平台,持续探索下一代视频编码技术。ECM 在 VVC 基础上引入了更多编码工具和更精细的决策机制,使得编码复杂度进一步攀升至"极高"水平。

在众多编码模块中,变换编码 是消除空间冗余和残差相关性的核心环节。VVC 在变换模块中引入了多项创新------多变换选择(MTS)、低频不可分离变换(LFNST)、子块变换(SBT)等------这些技术在提升压缩效率的同时,也带来了显著的计算开销。在 Beyond VVC/ECM 中,不可分离变换(Non-Separable Transform, NST)作为 LFNST 的扩展形式,其变换核选择过程尤为耗时:编码器需要对每个预测模式的变换集中的多个候选变换核逐一进行完整的率失真优化(RDO)计算。

本文解读的论文正是瞄准这一痛点,提出了一种基于系数能量引导的快速变换核选择框架,通过自适应重排序和三层快速剪枝策略,在不损失编码效率的前提下显著降低 NST 变换核选择的计算复杂度。


二、VVC 变换编码技术背景

2.1 变换编码的基本原理

变换编码是现代视频压缩中消除空间冗余的关键步骤。在混合编码框架中,其位于预测之后、量化之前:

复制代码
原始像素 → 预测(帧内/帧间) → 残差 → 变换 → 量化 → 熵编码 → 码流

变换的核心目标有两个:

  • 能量集中(Energy Compaction):将空间域中分散的能量集中到少数低频系数上,使大部分高频系数量化后趋于零。
  • 去相关性(Decorrelation):消除残差块中相邻像素间的统计相关性,使变换后的系数更加独立,便于熵编码。

离散余弦变换(DCT)因其良好的能量集中特性、可分离性和快速算法,自 JPEG、H.261 以来一直是视频编码的核心变换。VVC 在此基础上进行了重大扩展。

2.2 VVC 变换编码的核心工具

多变换选择(MTS)

VVC 在传统的 DCT-II 之外,引入了 DST-VII 和 DCT-VIII 两种新变换核,共 5 种变换组合:

水平方向 垂直方向 适用场景
DCT-II DCT-II 默认变换,平滑区域
DST-VII DST-VII 帧内预测残差,边缘区域
DST-VII DCT-VIII 混合方向纹理
DCT-VIII DST-VII 混合方向纹理
DCT-VIII DCT-VIII 纹理丰富区域

不同的残差分布特性对应不同的最优变换核。编码器通过 RDO 遍历候选变换核,选择率失真代价最小的组合。MTS 仅对亮度分量生效,且在 SPS 和 CU 级别均可控制开关。

低频不可分离变换(LFNST)

LFNST 是 VVC 引入的一种二次变换技术,在主变换(Primary Transform,如 DCT-II)之后、量化之前对低频系数进行进一步处理:

复制代码
残差 → 主变换(DCT-II/MTS) → LFNST(仅低频) → 量化 → 熵编码

LFNST 的核心思想:帧内预测的残差经过主变换后,部分低频系数仍可能保留预测方向的信息,LFNST 通过不可分离变换进一步去除这种低频冗余。

不可分离变换意味着将二维系数块展平为一维向量后进行矩阵乘法,而非分别在行、列方向进行一维变换。这虽然计算复杂度更高,但能捕捉二维空间中的全部相关性。

为控制复杂度,VVC 中的 LFNST 采用缩减的不可分离变换(RST),将 N 维向量映射到 R 维空间(R < N),缩减因子为 N/R。LFNST 仅处理 4x4 或 8x8 的低频区域,支持两种变换尺寸,由 TU 大小隐式决定。

每个预测模式对应一个包含多个候选变换核的变换集(Transform Set),编码器需要通过 RDO 从中选择最优变换核。

大尺寸变换高频置零

VVC 支持最大 64x64 的变换块。对于宽或高为 64 的变换块,仅保留左上角 32x32 的低频系数,高频部分直接置零。这一技术在 DST-VII 和 DCT-VIII 中扩展为保留 16x16 的低频区域,有效降低大尺寸变换的计算复杂度。

2.3 从 VVC 到 Beyond VVC:ECM 中的变换编码

ECM 作为 Beyond VVC 的探索平台,在 VVC 变换编码基础上进一步扩展:

  • NST 扩展:不可分离变换(NST)在 ECM 中作为 LFNST 的增强形式,每个预测模式的变换集包含 3 个候选变换核,编码器需要逐一评估。
  • 更多预测模式:ECM 增加了帧内预测方向和模式数量,进一步增加了变换核选择的候选空间。
  • 更精细的 RDO:ECM 在更多决策点上引入了率失真优化,导致编码器复杂度急剧增加。

在 ECM 17.0 中,NST 变换核选择的流程可以概括为:

复制代码
对于每个 CU:
  对于每个候选预测模式:
    对于该模式变换集中的 3 个 NST 变换核:
      1. 执行主变换得到一次变换系数
      2. 执行 NST 得到二次变换系数
      3. 执行量化
      4. 执行反量化 + 反变换得到重建残差
      5. 计算失真(D)
      6. 估计码率(R)
      7. 计算 RD 代价 = D + λ·R
    选择 RD 代价最小的变换核

对于每个 CU,上述流程需要重复执行多次(3 个变换核 x 多个预测模式),每次都涉及完整的变换-量化-熵编码计算。这正是论文要解决的核心问题:如何在不遍历所有变换核的情况下,快速找到最优(或近似最优)的 NST 变换核?


三、核心思想:用系数能量替代完整 RDO

3.1 关键洞察:CoefAbsSum 与 RD 性能的相关性

论文的核心洞察在于:变换的根本目标是能量集中,而前向变换系数的绝对值之和(CoefAbsSum)可以直接反映变换核的能量集中能力。

具体来说:

CoefAbsSum=∑i∣Ci∣\text{CoefAbsSum} = \sum_{i} |C_i|CoefAbsSum=i∑∣Ci∣

其中 CiC_iCi 是前向变换后的第 iii 个变换系数。

CoefAbsSum 越小,意味着变换后能量越集中------大部分系数趋近于零,仅有少数系数承载了主要的信号能量。这与率失优化的目标高度一致:能量越集中,量化后非零系数越少,编码所需比特数越低,RD 代价越小。

这一洞察的关键优势在于:计算 CoefAbsSum 只需要前向变换一步,无需量化、反变换、熵编码和完整 RD 代价计算。前向变换本身就是变换核选择流程的第一步,因此 CoefAbsSum 可以"免费"获取,作为变换核好坏的快速预判指标。

3.2 从"遍历全部"到"智能跳过"

传统方法对每个变换核都执行完整的 RDO 流程,计算量巨大。论文的思路是:

  1. 先排序:用 CoefAbsSum 对 3 个变换核排序,优先处理潜力最大的。
  2. 再剪枝:对排序后的变换核,用三种策略逐步剪枝,跳过明显不佳的候选。

这样,在很多情况下,编码器只需完整评估 1-2 个变换核(甚至 0 个),而非全部 3 个,从而节省计算时间。


四、技术方案详解

论文提出的框架包含两大技术模块:自适应重排序策略三层快速剪枝算法

4.1 自适应重排序策略

问题描述

在 ECM 中,每个帧内预测模式的 NST 变换集包含 3 个候选变换核。传统方法按固定顺序依次评估这 3 个变换核,没有考虑它们之间的相对优劣。

解决方案

论文提出根据 CoefAbsSum 对 3 个变换核进行自适应排序:

复制代码
对于当前预测模式的变换集 {K1, K2, K3}:
  对每个变换核 Ki:
    执行前向变换,计算 CoefAbsSum_i
  按 CoefAbsSum 从小到大排序,得到排序后的变换核序列 {K(1), K(2), K(3)}
    其中 CoefAbsSum(1) ≤ CoefAbsSum(2) ≤ CoefAbsSum(3)

排序后,CoefAbsSum 最小(潜力最大)的变换核排在最前面,编码器优先对其进行完整 RDO 评估。这一重排带来两个好处:

  • 提高早期终止概率:如果第一个评估的变换核 RD 性能就很好,后续变换核更容易被剪枝跳过。
  • 为后续剪枝提供基准:排序靠前的变换核的 RD 代价可作为后续变换核的阈值参考。
计算开销分析

计算 CoefAbsSum 的额外开销极小------前向变换本就是 RDO 流程的第一步,排序仅需在已计算的变换系数上求绝对值之和。对于 3 个变换核,排序的时间复杂度为 O(3N)(N 为系数个数),相对于完整 RDO 的计算量可以忽略不计。

4.2 三层快速剪枝算法

在重排序基础上,论文设计了三个递进式的快速剪枝策略,依次应用于排序后的变换核序列。

策略一:调整的 RD 代价阈值剪枝

核心思想:利用已评估变换核的 RD 代价作为阈值,快速跳过后续表现不佳的变换核。

复制代码
对排序后的变换核 {K(1), K(2), K(3)}:
  评估 K(1) 的完整 RD 代价 → 得到 best_cost
  
  对于 K(2):
    如果 best_cost 已经足够低(低于调整阈值):
      跳过 K(2) 和 K(3) 的完整评估
    否则:
      评估 K(2) 的完整 RD 代价
      如果 K(2) 的 RD 代价 < best_cost:
        更新 best_cost
  
  对于 K(3):
    如果 best_cost 低于更严格的阈值:
      跳过 K(3) 的完整评估
    否则:
      评估 K(3)

这里的"调整阈值"是论文的关键设计:对于排序靠后的变换核(CoefAbsSum 更大),使用更严格的 RD 代价阈值。这是因为 CoefAbsSum 更大意味着变换核的潜力更低,除非其 RD 代价显著优于当前最优,否则不值得完整评估。

阈值调整公式(根据论文思路推断):

Thresholdi=best_cost×(1+αi)\text{Threshold}_i = \text{best\_cost} \times (1 + \alpha_i)Thresholdi=best_cost×(1+αi)

其中 αi\alpha_iαi 随变换核排序位置 iii 的增大而减小(即阈值更严格),αi>0\alpha_i > 0αi>0 是可调参数。当排序靠后的变换核 RD 代价超过该阈值时,直接跳过。

策略二:基于 CoefAbsSum 的预筛选

核心思想:在执行完整 RDO 之前,直接用 CoefAbsSum 值判断是否值得进一步评估。

复制代码
对于变换核 K(i):
  如果 CoefAbsSum(i) > threshold_coef:
    直接跳过该变换核的完整 RDO 评估

这里 threshold_coef 可以是一个绝对阈值,也可以是相对于 CoefAbsSum(1) 的比例阈值。例如:

如果CoefAbsSumi>CoefAbsSum(1)×β则跳过\text{如果} \quad \text{CoefAbsSum}i > \text{CoefAbsSum}{(1)} \times \beta \quad \text{则跳过}如果CoefAbsSumi>CoefAbsSum(1)×β则跳过

其中 β>1\beta > 1β>1 是比例因子。这一策略直接利用了"CoefAbsSum 越小变换越好"的原理------如果某个变换核的 CoefAbsSum 远大于最优变换核,其 RD 性能几乎不可能更优,可以安全跳过。

策略三:历史 RD 性能比较

核心思想:利用编码过程中积累的历史信息,跳过在相似条件下表现持续不佳的变换核。

复制代码
维护历史统计表:
  对每个预测模式 → 每个 NST 变换核 → 历史选择频率/平均 RD 代价

对于当前 CU 的预测模式 m 和变换核 K(i):
  如果 K(i) 在模式 m 的历史选择频率极低(或历史平均 RD 代价极高):
    跳过 K(i) 的完整 RDO 评估

这一策略的合理性在于:相似内容和预测模式下,最优变换核的选择具有一定的时序一致性。如果某个变换核在大量历史编码中几乎从未被选中,那么在当前 CU 中它被选中的概率也很低。

三个策略的关系是递进式的------先通过 CoefAbsSum 预筛排除明显不佳的候选,再用历史统计进一步过滤,最后对剩余候选使用 RD 代价阈值剪枝。这样,只有极少数变换核需要经过完整的 RDO 评估。

4.3 整体算法流程

将以上各部分整合,完整的快速变换核选择算法流程如下:

复制代码
输入:当前 CU、预测模式 m、变换集 T_m = {K1, K2, K3}
输出:最优变换核 K* 及其 RD 代价

步骤 1:计算 CoefAbsSum
  对每个 Ki ∈ T_m:
    执行前向主变换 + NST
    计算 CoefAbsSum_i

步骤 2:自适应重排序
  按 CoefAbsSum 升序排列,得到 {K(1), K(2), K(3)}

步骤 3:CoefAbsSum 预筛选(策略二)
  对 K(2), K(3):
    如果 CoefAbsSum(i) / CoefAbsSum(1) > β:
      标记为"预筛跳过"

步骤 4:历史性能筛选(策略三)
  对未被预筛跳过的 K(i):
    查询历史统计
    如果历史选择频率 < f_min:
      标记为"历史跳过"

步骤 5:完整 RDO 评估 + RD 代价阈值剪枝(策略一)
  best_cost = ∞
  对 K(1), K(2), K(3)(跳过已标记的):
    如果 best_cost < threshold_i:
      跳过
    否则:
      执行完整 RDO → 得到 RD_cost
      如果 RD_cost < best_cost:
        best_cost = RD_cost, K* = K(i)
  
步骤 6:更新历史统计
  更新模式 m 下 K* 的历史选择频率

五、实验结果分析

5.1 实验设置

  • 平台:ECM 17.0(Beyond VVC 探索模型)
  • 测试配置:All-Intra(AI)、Random-Access(RA)、Low-Delay(LD)
  • 测试序列:JVET 通用测试条件(CTC)标准序列集
  • 评估指标:BD-rate(编码效率变化)、编码时间比(ETR, Encoding Time Ratio)

5.2 主要结果

指标 数值 含义
编码时间比(ETR) 98.7% 编码时间减少 1.3%
Y 分量 BD-rate 0.00% 亮度编码效率零损失
Cb 分量 BD-rate +0.03% 色度编码效率几乎无损
Cr 分量 BD-rate +0.01% 色度编码效率几乎无损
结果解读

编码效率方面:Y 分量 BD-rate 为 0.00%,意味着该算法在亮度分量上完全没有引入编码效率损失。Cb 和 Cr 分量分别仅有 0.03% 和 0.01% 的微小变化,在实际应用中可以忽略不计。这证明了该框架是一种"近乎无损"的编码加速方法。

编码时间方面:1.3% 的时间节省看似不大,但需要结合 Beyond VVC/ECM 的背景来理解。ECM 17.0 是一个"具有极高编码复杂度的探索平台",其中 NST 变换核选择只是众多耗时模块之一。在如此庞大的编码器中,仅通过优化变换核选择就实现 1.3% 的整体时间节省,说明该模块在编码器中占有可观的计算比重。

更重要的是,这 1.3% 的时间节省是在几乎零编码损失的前提下实现的------传统的编码加速方法通常会以牺牲编码效率为代价(如 BD-rate 增加 0.5%-2%),而本文方法在效率和时间两方面都取得了优异表现。

5.3 结果的深层意义

与 VVC 快速算法的对比:在 VVC(VTM)平台上,类似 LFNST 快速选择算法通常能实现更大的时间节省(5%-15%)。这并非本文方法效果不佳,而是因为 ECM 相比 VTM 引入了更多编码工具和更复杂的决策流程,NST 变换核选择在整体编码时间中的占比相对下降。1.3% 的整体时间节省,换算到 NST 模块本身,实际上代表了更大幅度的模块级加速。

近零损失的实现难度:在 Beyond VVC 这样复杂的编码框架中,保持 0.00% 的 Y 分量 BD-rate 并非易事。任何剪枝策略都有"误剪"风险------即跳过了实际上最优的变换核。本文通过 CoefAbsSum 这一高度可靠的预判指标,结合三层渐进式剪枝,有效控制了误剪率,实现了近零损失。


六、技术亮点与创新分析

6.1 CoefAbsSum:从变换本质出发的快速指标

论文最大的创新在于选取了 CoefAbsSum 作为变换核评估的快速指标。这一选择并非随意:

  • 理论根基扎实:变换的核心目标是能量集中,CoefAbsSum 直接度量了能量集中程度。
  • 计算几乎免费:前向变换是 RDO 流程的必经步骤,CoefAbsSum 只需在已有结果上求和。
  • 与 RD 性能高度相关:能量越集中,量化后非零系数越少,码率越低,RD 代价越小。
  • 无需训练:不像基于机器学习的方法需要大量训练数据和模型推理,CoefAbsSum 是纯数学计算,适用于任何视频内容。

6.2 自适应重排序:化被动为主动

传统编码器对变换核的评估顺序是固定的,重排序策略将"被动遍历"变为"主动优先":

  • 优先评估潜力最大的变换核,使后续剪枝更有效。
  • 排序本身开销极小,但为后续剪枝策略提供了高质量的基准。
  • 这种"先排序、再剪枝"的思路具有通用性,可推广到其他编码决策场景。

6.3 三层渐进式剪枝:多维度信息融合

三个剪枝策略分别利用了不同维度的信息:

策略 利用的信息 判断维度 计算开销
CoefAbsSum 预筛选 当前 CU 的变换系数 变换能量 极低(求和)
历史性能比较 历史编码统计 时序一致性 极低(查表)
RD 代价阈值 当前 CU 的 RD 代价 率失真性能 中等(需部分 RDO)

三个策略从粗到细、从免费到有代价,形成了高效的漏斗式过滤------大部分变换核在低开销阶段就被跳过,只有少数需要经过完整 RDO 评估。


七、在 Beyond VVC 标准演进中的定位与意义

7.1 Beyond VVC 的复杂度挑战

Beyond VVC/ECM 的设计哲学是"不计复杂度地追求压缩效率"------通过引入更多编码工具、更精细的决策机制来探索压缩性能的上限。这使得 ECM 的编码复杂度远超 VVC,在实际部署中面临严峻挑战。

论文开篇即指出:"Beyond VVC 是一个具有极高编码复杂度的探索平台"。这意味着,如果在 ECM 中引入的新技术不能有效控制复杂度,它们在下一代标准中落地的可能性就会降低。

7.2 快速算法对标准化的价值

在视频编码标准的制定过程中,编码工具的压缩效率计算复杂度是两个核心评估维度。一个编码工具即使能带来显著的码率节省,如果其复杂度过高,也可能在标准化讨论中被否决或简化。

本文提出的快速变换框架,为 Beyond VVC 中 NST 技术的实用化提供了重要支撑:

  • 降低部署门槛:1.3% 的整体编码时间减少使得 ECM 在实际测试和评估中更加可行。
  • 保持编码效率:近零的 BD-rate 变化证明该优化不会影响编码性能评估的准确性。
  • 框架通用性:CoefAbsSum 引导的快速选择思路不仅适用于 NST,也可推广到 MTS、预测模式选择等其他编码决策中。

7.3 对未来研究的启发

本文的工作为 Beyond VVC 快速编码研究提供了几个有价值的方向:

  1. 能量准则的推广:CoefAbsSum 的成功表明,基于变换系数统计特性的快速指标具有很大潜力。未来可以探索更多此类指标(如系数方差、熵、稀疏度等)在快速编码中的应用。

  2. 历史信息的利用:历史 RD 性能比较策略展示了时序信息在编码优化中的价值。在视频编码中,相邻帧和相邻块之间的高度相关性使得历史信息具有很高的参考价值。

  3. 渐进式剪枝范式:三层递进式剪枝的框架设计------从免费指标到低开销查表再到部分 RDO------是一种通用的快速决策范式,可以应用于编码器中其他多候选选择场景。

  4. 与 AI 技术的结合:论文的 CoefAbsSum 是一种基于信号特性的传统方法。在 Beyond VVC 中,JVET 也在探索神经网络编码(NNVC)和 ECM 的混合方案。将传统快速指标与轻量级神经网络预测相结合,可能进一步提升剪枝的准确性。


八、总结

本文解读的论文针对 Beyond VVC/ECM 中 NST 变换核选择的计算复杂度问题,提出了一种基于系数能量引导的快速变换算法。该算法的核心贡献可以概括为:

  1. 一个关键指标:CoefAbsSum------前向变换系数绝对值之和,作为变换核好坏的快速预判指标,理论基础扎实、计算开销极低、与 RD 性能高度相关。

  2. 一项排序策略:自适应重排序------将固定顺序遍历变为潜力优先评估,为后续剪枝创造有利条件。

  3. 三层剪枝机制:CoefAbsSum 预筛选、历史 RD 性能比较、调整的 RD 代价阈值剪枝------从粗到细的漏斗式过滤,最大化跳过率的同时最小化误剪风险。

实验结果表明,该框架在 ECM 17.0 上实现了 1.3% 的整体编码时间节省,同时 Y 分量 BD-rate 为 0.00%、Cb 和 Cr 分量仅分别变化 0.03% 和 0.01%,证明了其"近乎无损"的特性。

在 Beyond VVC 探索阶段,编码复杂度的控制是新技术走向标准化的关键瓶颈之一。本文的工作不仅为 NST 的快速实现提供了有效方案,其"系数能量引导 + 渐进式剪枝"的技术思路也为更广泛的 Beyond VVC 快速编码研究提供了有价值的参考。


参考文献

  • 1 Minzhe Chen, Yiming Wang, Junyan Huo, Fuzheng Yang. "Coefficients Energy Guided Fast Transform Algorithm in Beyond VVC." IEEE DCC 2026.
  • 2 B. Bross et al., "An Overview of the Versatile Video Coding (VVC) Standard," IEEE TCSVT, 2021.
  • 3 "Analysis of the Transform Coding Module in the Post-VVC Standard," IEEE, 2024.
  • 4 JVET, "Algorithm Description for Enhanced Compression Model (ECM)," JVET-Y0022.
相关推荐
美港探案3 小时前
MiniMax H3 炸场!视频大模型拼“真实生产”时代到来
音视频
AI创界者16 小时前
AIGC进阶】Sulphur-2 视频生成大模型离线实战:文生视频/图生视频本地一键部署整合包解压即用与调优指南
人工智能·aigc·音视频
ldsweet20 小时前
HarmonyOS NEXT 音频播放器开发:AVPlayer 封装、播放列表与后台播放实战
华为·音视频·harmonyos
林澈在路上20 小时前
2026 AI 写歌 APP 推荐:国产软件哪个好用实测
大数据·人工智能·aigc·音视频·音频
湿滑路面20 小时前
VideoPipe中集成多模态大模型做视频(图片)分析
人工智能·算法·音视频
数字会议深科技1 天前
自主音视频会议核心技术沉淀:两项发明专利赋能专业会务设备稳健运行
人工智能·音视频·音频·国际会议·会议解决方案·会议讨论系统·高端会议
2zcode1 天前
抑郁症多模态音视频与脑电信号数据集
音视频·情绪识别·抑郁症·心理健康分析
FlightYe1 天前
音视频修炼之视频基础(一):视频基础理论
android·c++·vscode·音视频·androidx·android runtime
中微极客1 天前
2026上半年AI视频模型技术突破:从生成到“导演级”控制的工程实践
人工智能·深度学习·音视频