基于 JVET-AQ0014-v3 提案文档与六组 CTC 性能对比数据的系统性分析,揭示神经网络视频编码在压缩效率与计算复杂度之间的权衡全景
| 数据来源 | JVET 43rd Meeting, Geneva, July 2026 |
| 软件版本 | NNVC-17.1 (VTM-24.0 based) |
| 测试条件 | CTC RA/LDB/LDP/AI Main10 |
01 引言:当神经网络走进视频编码标准
视频编码技术在过去三十年间持续演进,从 H.261 到 H.264/AVC,再到 H.265/HEVC 和 H.266/VVC,每一代标准都在压缩效率上实现了约 50% 的提升。然而,随着传统编码工具逐渐逼近信息论的理论极限,进一步提升变得愈发困难。神经网络视频编码(Neural Network Video Coding, NNVC) 应运而生------它并非推翻传统框架,而是将深度学习工具嵌入到 VVC 的混合编码架构中,在关键模块上用神经网络替代或增强传统算法。
JVET(联合视频专家组)于 2022 年正式启动 NNVC 标准化探索,设立了专门的 AhG(Ad-hoc Group)来协调软件开发。本文基于 JVET-AQ0014-v3 提案文档及六组详细的 CTC(Common Test Conditions)性能对比数据,对 NNVC-17.1 版本进行系统性分析,涵盖架构演进、版本对比、操作点生态及质量-复杂度权衡等核心议题。
关键背景: NNVC 采用"混合架构"策略------以 VTM(VVC Test Model)为基础,在帧内预测、环路滤波等模块引入神经网络工具,而非完全端到端的神经编码。这种渐进式路径既保证了与传统标准的兼容性,又能逐步验证 NN 工具的实际增益。
02 NNVC 技术架构概览
2.1 混合编码框架
NNVC 的核心设计理念是 在 VVC 传统编码框架的关键环节引入神经网络工具,而非完全替换。当前 NNVC-17.1 基于 VTM-24.0,集成了以下关键 NN 组件:
| 组件 | 全称 | 功能说明 |
|---|---|---|
| NNLF | NN-based Loop Filter | 替代 ALF/SAO 等传统滤波器,提供更精细的重建质量。支持多个操作点(HOP5/LOP7/VLOP4) |
| NNIP | NN-based Intra Prediction | 用神经网络增强传统帧内预测模式,提升 I 帧编码效率 |
| DRF | Deep Reference Frame | 从 DPB 中两帧合成新参考帧插入 RPL,增强运动估计。分离/低动态范围两个版本 |
| SADL | Small Adhoc Deep-Learning Library | NNVC 专用的轻量推理库,支持 SIMD 加速和内存策略管理 |
2.2 SADL:嵌入式推理引擎的演进
SADL 是 NNVC 软件栈的关键基础设施。在 NNVC-17 版本周期中,SADL 获得了多项重要优化:
- 3x3 卷积加速(MR 207):针对 NNLF 中大量使用的小核卷积进行专用优化
- 内存策略管理(MR 218):动态管理模型参数内存,降低峰值占用
- GridSample 改进(MR 217/216):优化空间采样操作,支持 Conv2DTranspose
- SIMD 3x3 stride 2(MR 215):利用 SIMD 指令集加速步长为 2 的 3x3 卷积
- 文档更新 (MR 219)和 peeling 修复(MR 214)
这些优化直接带来了实际收益------NNVC-17.1 相比 NNVC-16.2 在编码效率不变的前提下,解码速度提升了约 13%(DecT 从 100% 降至 87%)。
2.3 配置体系与操作点
NNVC 定义了一套完整的配置体系,覆盖从纯 VTM 模式到全功能 NNVC 的多个层次:
| 配置名称 | 启用工具 | 配置文件 |
|---|---|---|
| NNVC VTM mode | 无(纯 VTM 基准) | encoder_xxx_vtm.cfg |
| NNVC Anchor / EE1 | Intra Pred + LOP.6 | encoder_xxx_nnvc.cfg |
| NNVC HOP | Intra Pred + HOP.5 | Anchor + HOP5.cfg |
| NNVC VLOP | Intra Pred + VLOP.4 | VTM + vlop4.cfg |
| NNVC DRF | NNVC anchor + DRF | Anchor + drf.cfg |
| NNSR | 超分辨率 | nnsr.cfg |
| NNPF | 自适应后处理滤波 | nnpf_xxx.cfg |
03 NNVC-17.1 版本演进与软件变更
3.1 版本时间线
从 2021 年 5 月首次在 VTM-11.0 上启用 MCTF 开始,NNVC 经历了近五年的持续迭代。以下是关键版本节点:
- 2021年5月 --- NNVC-1.0:VTM-11.0 基线,启用 MCTF
- 2022年12月 --- NNVC-3.0:首个独立分支版本
- 2023年5月 --- NNVC-5.0:第一个 LOP 模型集成
- 2024年5月 --- NNVC-9.0:LOP 模型持续优化
- 2025年7月 --- NNVC-14.0:引入 VLOP4、DRF 和混合端到端框架
- 2025年11月 --- NNVC-15.0:基于 VTM-23.13
- 2026年2月 --- NNVC-16.0:集成 VTM-23.14、LOP7、LDRF/HDRF、NNSR2
- 2026年4月17日 --- NNVC-16.2:16.0 的维护版本
- 2026年4月25-28日 --- NNVC-17.0 / 17.1:VTM-24.0 对齐、SADL 加速、新数据集框架、混合框架改进
3.2 NNVC-17 的核心变更
NNVC-17 版本周期引入了多项重要变更,涵盖基础设施和算法两个层面:
- VTM-24.0 对齐(MR 439):将 NNVC 的 VTM 基线从 23.14 升级至 24.0,主要影响 PQ 序列的编码
- 紧凑数据集框架(MR 438, JVET-AP0072):支持新训练数据集的集成,用于评估新数据对已集成模型的影响
- EE1-4.2 帧级 RDO(MR 437, JVET-AP0183):改进混合端到端编码中 intra slice 的灵活性和并行测试能力
- SADL 全面升级:3x3 加速、内存管理、GridSample、Conv2DTranspose、SIMD 优化
- 混合端到端框架改进:支持集群并行测试,使用外部编码器/解码器
04 性能基准:NNVC-17.1 vs VTM 基线
这是最核心的性能对比------NNVC-17.1 锚点配置(NNLF LOP7 + NNIP)相对于 VTM 纯模式基线的 BD-rate 增益。数据覆盖四种编码配置,测试序列按 CTC 标准分类(A1/A2: 4K超高清, B: 1080p, C: WVGA, D: WVGA, E: 720p, F: 屏幕内容)。
4.1 总体性能概览
| 编码配置 | Y-PSNR BD-rate | 解码时间 |
|---|---|---|
| Random Access | -8.23% | 2024% |
| Low Delay B | -6.36% | 2116% |
| Low Delay P | -7.07% | 2198% |
| All Intra | -8.71% | 1501% |
BD-rate 为负值表示码率节省(即在相同质量下消耗更少比特)。NNVC-17.1 在四种配置下均实现了 6%-9% 的亮度 BD-rate 增益,其中 All Intra 配置表现最优(-8.71%),这主要归功于 NNIP(神经网络帧内预测)对 I 帧编码效率的显著提升。
4.2 分类别详细数据(Random Access Main10)
| 序列类别 | Y-PSNR | U-PSNR | V-PSNR | Y-MSIM | EncT | DecT CPU |
|---|---|---|---|---|---|---|
| Class A1 (4K) | -9.29% | -13.23% | -15.33% | -9.53% | 116% | 1997% |
| Class A2 (4K) | -8.54% | -14.99% | -10.30% | -8.74% | 115% | 1918% |
| Class B (1080p) | -7.90% | -16.44% | -14.84% | -7.83% | 117% | 2067% |
| Class C (WVGA) | -7.61% | -14.94% | -14.29% | -7.91% | 115% | 2073% |
| Class D (WVGA) | -8.12% | -14.13% | -13.57% | -6.99% | 109% | 1869% |
| Class F (屏幕) | -4.42% | -8.65% | -7.81% | -5.47% | 120% | 1195% |
| Overall | -8.23% | -15.11% | -13.88% | -8.37% | 116% | 2024% |
关键发现: 色度分量(U/V-PSNR)的增益显著大于亮度分量(Y-PSNR),达到 13%-16% 的码率节省。这表明 NNLF 在恢复色度细节方面具有特别突出的能力,这对 4:2:0 采样的视频内容意义重大。屏幕内容序列(Class F)的增益相对较小(-4.42%),说明 NN 工具对自然场景视频的优化效果优于屏幕内容。
4.3 编码时间影响
| 编码配置 | EncT |
|---|---|
| All Intra | 166% |
| Random Access | 116% |
| Low Delay B | 107% |
| Low Delay P | 109% |
编码时间增加幅度可控(107%-166%),其中 All Intra 因 NNIP 的帧内预测搜索开销增加了 66%。相比之下,解码复杂度是真正的瓶颈------RA 配置下解码时间高达基线的 20 倍(2024%),这意味着 NNVC 当前阶段的解码复杂度仍远超实用部署门槛。
05 版本迭代:NNVC-16.2 vs NNVC-17.1
NNVC-17.1 相比 NNVC-16.2 的性能对比揭示了一个重要信息:编码效率完全持平(BD-rate = 0.00%),但解码速度有显著提升。
| 编码配置 | Y-PSNR | U-PSNR | V-PSNR | EncT | DecT CPU |
|---|---|---|---|---|---|
| Random Access | 0.00% | 0.00% | 0.00% | 99% | 87% |
| Low Delay B | 0.00% | 0.00% | 0.00% | 99% | 87% |
| Low Delay P | 0.00% | 0.00% | 0.00% | 99% | 87% |
| All Intra | 0.00% | 0.00% | 0.00% | 99% | 89% |
这一结果表明,NNVC-17 版本周期的重点在于 工程优化而非算法创新。SADL 的多项改进(3x3 加速、SIMD 优化、内存策略管理)直接转化为 11%-13% 的解码速度提升,而 VTM-24.0 对齐和新数据集框架的引入并未影响编码效率。这种"效率不变、速度提升"的迭代模式在标准化过程中是有价值的------它为后续算法优化奠定了更高效的软件基础。
06 操作点与配置生态:质量-复杂度权衡全景
NNVC 最重要的设计决策之一是定义了多个操作点(Operation Point),形成从超低复杂度到高质量的全谱系覆盖。以下数据均基于 Random Access Main10 配置,以 NNVC-17.1 锚点(NNLF LOP7 + NNIP)为基准。
6.1 复杂度-质量阶梯
| 操作点 | DecT (倍) | Y-PSNR | 定位 |
|---|---|---|---|
| VLOP4 | 0.5x | +2.34% | 超低复杂度,面向移动端 |
| LOP7 (Anchor) | 1.0x | 0.00% | 基准配置 |
| LDRF | 11.4x | -1.44% | 低动态范围参考帧增强 |
| HDRF | 37.3x | -2.49% | 高动态范围参考帧增强 |
| HOP5 | 84.5x | -4.91% | 最高质量操作点 |
6.2 各配置详细对比
| 配置 | Y-PSNR | U-PSNR | V-PSNR | Y-MSIM | EncT | DecT CPU |
|---|---|---|---|---|---|---|
| VLOP4 (超低操作点) | +2.34% | +9.15% | +9.25% | +1.55% | 99% | 50% |
| LOP7 (锚点) | 0.00% | 0.00% | 0.00% | 0.00% | 100% | 100% |
| LDRF (低动态范围滤波) | -1.44% | +0.53% | -1.46% | -2.08% | 110% | 1137% |
| HDRF (高动态范围滤波) | -2.49% | -1.03% | +0.14% | -2.91% | 137% | 3729% |
| HOP5 (高操作点) | -4.91% | -17.18% | -17.82% | -4.03% | 290% | 8448% |
6.3 深度解读
VLOP4:面向移动端的轻量方案。 作为"超低操作点",VLOP4 以 2.34% 的亮度质量损失换取了 解码时间减半(50%)。色度分量损失较大(+9%),但编码时间几乎不变(99%)。这是目前最接近实用部署的配置------在移动设备等算力受限场景中,50% 的解码时间意味着可能实现实时解码。代价是需要接受约 2% 的码率损失。
LDRF / HDRF:DRF 滤波器的两个层级。 深度参考帧(Deep Reference Frame)通过神经网络从 DPB 中的两帧合成新参考帧,插入参考图像列表以增强运动估计。LDRF(低动态范围版本)带来 1.44% 的亮度增益,但解码复杂度增至 11.4 倍;HDRF(高动态范围版本)进一步提升至 2.49% 增益,解码复杂度增至 37.3 倍。值得注意的是,HDRF 在色度分量上也有改善(U-PSNR -1.03%),而 LDRF 的色度 U-PSNR 略有退化(+0.53%)。
HOP5:质量上限的探索。 高操作点(HOP5)代表了 NNLF 模型的最高质量配置,实现了 4.91% 的亮度 BD-rate 增益和高达 17% 的色度增益。但代价极为高昂------解码时间达到锚点的 84.5 倍,编码时间也增至 2.9 倍。HOP5 的价值在于标定 NNVC 的质量上限,为未来轻量化模型的设计提供目标参考。
07 深度洞察与趋势分析
7.1 解码复杂度:NNVC 落地的核心瓶颈
纵观所有数据,最突出的特征是 解码复杂度的急剧膨胀。即使是最基础的 LOP7 锚点配置,解码时间也达到了 VTM 基线的 20 倍。而在 HOP5 配置下,这一数字飙升至 84 倍。这意味着:
- 当前 NNVC 的 BD-rate 增益(6%-9% over VTM)远不足以补偿其解码复杂度开销------在相同算力预算下,用更高效的 VTM 编码参数可能获得更好的整体体验
- SADL 的持续优化(NNVC-17 周期实现 13% 加速)方向正确,但加速空间需要从算法层面(模型轻量化、知识蒸馏、量化感知训练)和工程层面(NPU 专用算子、硬件加速)双管齐下
- VLOP4 配置的 50% 解码时间是当前最接近实用的方案,但 2.34% 的质量损失是否可接受取决于应用场景
7.2 色度增益的启示
一个值得关注的现象是:在几乎所有配置中,色度分量的 BD-rate 增益都显著大于亮度分量。在 NNVC-17.1 vs VTM 的基准对比中,U-PSNR 和 V-PSNR 的增益达到 -15% 级别,而 Y-PSNR 仅为 -8%。在 HOP5 配置中,色度增益更是达到 -17%。
这暗示了一个重要方向:传统编码标准在色度处理上存在系统性不足(4:2:0 采样下的色度分辨率天然受限),而神经网络工具在从低分辨率色度重建高频细节方面具有独特优势。未来 NNVC 的标准化推进中,色度增强可能成为一个高性价比的切入点------用相对较小的复杂度代价换取显著的色度质量提升。
7.3 混合架构的渐进式价值
NNVC 选择"在 VVC 框架内嵌入 NN 工具"的混合架构,而非完全端到端的神经编码,这一决策正在被数据验证。混合架构的优势在于:
- 渐进式增益:每个 NN 工具(NNLF、NNIP、DRF)可以独立评估和采纳,避免"全有或全无"的风险
- 兼容性保障:码流结构与 VVC 保持兼容,降低产业部署阻力
- 研究聚焦:将有限的标准化资源集中在增益最大的模块(环路滤波、帧内预测)
但挑战同样存在:NN 工具之间的组合效应尚未充分探索。当前数据显示,各配置的对比仅在 RA 配置下完成,LDB/LDP/AI 配置的数据大量缺失(#VALUE!),说明多配置的全覆盖测试仍在进行中。NNLF + NNIP + DRF 的联合优化空间有待挖掘。
7.4 标准化进程的产业信号
从贡献者列表来看,NNVC 的推动力量涵盖了 InterDigital、Tencent、Huawei、ByteDance、Qualcomm、Nokia、OPPO 等产业链核心玩家。这一阵容传递了明确信号:产业界对 NN 增强编码的投入是真实的、持续的战略性投入,而非学术探索。特别是 Qualcomm 和 Huawei 等芯片厂商的参与,暗示 NNVC 的硬件实现路径已在规划中。
同时,JVET 同步推进的 ECM(Enhanced Compression Model)------一个主要包含传统编码工具的增强模型------与 NNVC 形成互补。这种"双轨制"策略确保了无论 NN 技术是否成熟到可标准化,VVC 之后的编码演进都有路径可走。
08 结论与展望
NNVC-17.1 代表了神经网络视频编码在标准化进程中的一个重要里程碑。基于本文的数据分析,可以得出以下核心结论:
- 编码效率增益确凿:NNVC-17.1 锚点配置相比 VTM 基线实现了 6%-9% 的亮度 BD-rate 增益和 13%-16% 的色度增益,证明了 NN 工具在视频编码中的技术有效性。
- 解码复杂度仍是主要障碍:20-84 倍的解码时间增长远超当前消费级硬件的实时解码能力。VLOP4 配置(50% 解码时间)是最接近实用的方案,但需要接受约 2% 的质量损失。
- 工程优化持续见效:NNVC-17 周期通过 SADL 优化实现了 13% 的解码加速,方向正确但力度仍需加大。算法层面的模型轻量化将是下一个关键突破口。
- 操作点生态初步形成:从 VLOP4 到 HOP5 的五级操作点体系为不同应用场景提供了灵活选择,但多配置全覆盖测试仍需完善。
- 产业投入持续增强:头部科技公司的积极参与和"双轨制"标准化策略表明,NNVC 正在从学术研究向产业标准化稳步推进。
展望未来,NNVC 的发展路径可能呈现以下趋势:模型轻量化技术(知识蒸馏、量化感知训练、网络架构搜索)将成为研究热点;NPU 专用推理算子的标准化将降低部署门槛;色度增强可能作为"高性价比"切入点率先进入实用化阶段。随着 SADL 等推理基础设施的持续优化和芯片级加速的支持,NNVC 有望在未来 2-3 年内逐步从研究阶段过渡到有限场景的试点部署。
数据说明: 本文所有性能数据均来自 JVET-AQ0014-v3 提案文档及配套的六组 CTC 对比数据表(.xlsm)。BD-rate 负值表示码率节省(质量提升),正值表示码率增加(质量损失)。所有操作点对比数据仅覆盖 Random Access Main10 配置;LDB/LDP/AI 配置的数据在原始文件中标注为 #VALUE!,表明相关测试仍在进行中。测试结果由 InterDigital 提供并经过交叉验证。
基于 JVET-AQ0014-v3 提案文档分析 | 数据来源:JVET 43rd Meeting, Geneva, July 2026
NNVC 软件仓库:vcgit.hhi.fraunhofer.de/jvet-ahg-nnvc