NNVC-17.1 深度解析:神经网络视频编码的最新进展与性能全景

基于 JVET-AQ0014-v3 提案文档与六组 CTC 性能对比数据的系统性分析,揭示神经网络视频编码在压缩效率与计算复杂度之间的权衡全景

数据来源 JVET 43rd Meeting, Geneva, July 2026
软件版本 NNVC-17.1 (VTM-24.0 based)
测试条件 CTC RA/LDB/LDP/AI Main10

01 引言:当神经网络走进视频编码标准

视频编码技术在过去三十年间持续演进,从 H.261 到 H.264/AVC,再到 H.265/HEVC 和 H.266/VVC,每一代标准都在压缩效率上实现了约 50% 的提升。然而,随着传统编码工具逐渐逼近信息论的理论极限,进一步提升变得愈发困难。神经网络视频编码(Neural Network Video Coding, NNVC) 应运而生------它并非推翻传统框架,而是将深度学习工具嵌入到 VVC 的混合编码架构中,在关键模块上用神经网络替代或增强传统算法。

JVET(联合视频专家组)于 2022 年正式启动 NNVC 标准化探索,设立了专门的 AhG(Ad-hoc Group)来协调软件开发。本文基于 JVET-AQ0014-v3 提案文档及六组详细的 CTC(Common Test Conditions)性能对比数据,对 NNVC-17.1 版本进行系统性分析,涵盖架构演进、版本对比、操作点生态及质量-复杂度权衡等核心议题。

关键背景: NNVC 采用"混合架构"策略------以 VTM(VVC Test Model)为基础,在帧内预测、环路滤波等模块引入神经网络工具,而非完全端到端的神经编码。这种渐进式路径既保证了与传统标准的兼容性,又能逐步验证 NN 工具的实际增益。


02 NNVC 技术架构概览

2.1 混合编码框架

NNVC 的核心设计理念是 在 VVC 传统编码框架的关键环节引入神经网络工具,而非完全替换。当前 NNVC-17.1 基于 VTM-24.0,集成了以下关键 NN 组件:

组件 全称 功能说明
NNLF NN-based Loop Filter 替代 ALF/SAO 等传统滤波器,提供更精细的重建质量。支持多个操作点(HOP5/LOP7/VLOP4)
NNIP NN-based Intra Prediction 用神经网络增强传统帧内预测模式,提升 I 帧编码效率
DRF Deep Reference Frame 从 DPB 中两帧合成新参考帧插入 RPL,增强运动估计。分离/低动态范围两个版本
SADL Small Adhoc Deep-Learning Library NNVC 专用的轻量推理库,支持 SIMD 加速和内存策略管理

2.2 SADL:嵌入式推理引擎的演进

SADL 是 NNVC 软件栈的关键基础设施。在 NNVC-17 版本周期中,SADL 获得了多项重要优化:

  • 3x3 卷积加速(MR 207):针对 NNLF 中大量使用的小核卷积进行专用优化
  • 内存策略管理(MR 218):动态管理模型参数内存,降低峰值占用
  • GridSample 改进(MR 217/216):优化空间采样操作,支持 Conv2DTranspose
  • SIMD 3x3 stride 2(MR 215):利用 SIMD 指令集加速步长为 2 的 3x3 卷积
  • 文档更新 (MR 219)和 peeling 修复(MR 214)

这些优化直接带来了实际收益------NNVC-17.1 相比 NNVC-16.2 在编码效率不变的前提下,解码速度提升了约 13%(DecT 从 100% 降至 87%)。

2.3 配置体系与操作点

NNVC 定义了一套完整的配置体系,覆盖从纯 VTM 模式到全功能 NNVC 的多个层次:

配置名称 启用工具 配置文件
NNVC VTM mode 无(纯 VTM 基准) encoder_xxx_vtm.cfg
NNVC Anchor / EE1 Intra Pred + LOP.6 encoder_xxx_nnvc.cfg
NNVC HOP Intra Pred + HOP.5 Anchor + HOP5.cfg
NNVC VLOP Intra Pred + VLOP.4 VTM + vlop4.cfg
NNVC DRF NNVC anchor + DRF Anchor + drf.cfg
NNSR 超分辨率 nnsr.cfg
NNPF 自适应后处理滤波 nnpf_xxx.cfg

03 NNVC-17.1 版本演进与软件变更

3.1 版本时间线

从 2021 年 5 月首次在 VTM-11.0 上启用 MCTF 开始,NNVC 经历了近五年的持续迭代。以下是关键版本节点:

  • 2021年5月 --- NNVC-1.0:VTM-11.0 基线,启用 MCTF
  • 2022年12月 --- NNVC-3.0:首个独立分支版本
  • 2023年5月 --- NNVC-5.0:第一个 LOP 模型集成
  • 2024年5月 --- NNVC-9.0:LOP 模型持续优化
  • 2025年7月 --- NNVC-14.0:引入 VLOP4、DRF 和混合端到端框架
  • 2025年11月 --- NNVC-15.0:基于 VTM-23.13
  • 2026年2月 --- NNVC-16.0:集成 VTM-23.14、LOP7、LDRF/HDRF、NNSR2
  • 2026年4月17日 --- NNVC-16.2:16.0 的维护版本
  • 2026年4月25-28日 --- NNVC-17.0 / 17.1:VTM-24.0 对齐、SADL 加速、新数据集框架、混合框架改进

3.2 NNVC-17 的核心变更

NNVC-17 版本周期引入了多项重要变更,涵盖基础设施和算法两个层面:

  • VTM-24.0 对齐(MR 439):将 NNVC 的 VTM 基线从 23.14 升级至 24.0,主要影响 PQ 序列的编码
  • 紧凑数据集框架(MR 438, JVET-AP0072):支持新训练数据集的集成,用于评估新数据对已集成模型的影响
  • EE1-4.2 帧级 RDO(MR 437, JVET-AP0183):改进混合端到端编码中 intra slice 的灵活性和并行测试能力
  • SADL 全面升级:3x3 加速、内存管理、GridSample、Conv2DTranspose、SIMD 优化
  • 混合端到端框架改进:支持集群并行测试,使用外部编码器/解码器

04 性能基准:NNVC-17.1 vs VTM 基线

这是最核心的性能对比------NNVC-17.1 锚点配置(NNLF LOP7 + NNIP)相对于 VTM 纯模式基线的 BD-rate 增益。数据覆盖四种编码配置,测试序列按 CTC 标准分类(A1/A2: 4K超高清, B: 1080p, C: WVGA, D: WVGA, E: 720p, F: 屏幕内容)。

4.1 总体性能概览

编码配置 Y-PSNR BD-rate 解码时间
Random Access -8.23% 2024%
Low Delay B -6.36% 2116%
Low Delay P -7.07% 2198%
All Intra -8.71% 1501%

BD-rate 为负值表示码率节省(即在相同质量下消耗更少比特)。NNVC-17.1 在四种配置下均实现了 6%-9% 的亮度 BD-rate 增益,其中 All Intra 配置表现最优(-8.71%),这主要归功于 NNIP(神经网络帧内预测)对 I 帧编码效率的显著提升。

4.2 分类别详细数据(Random Access Main10)

序列类别 Y-PSNR U-PSNR V-PSNR Y-MSIM EncT DecT CPU
Class A1 (4K) -9.29% -13.23% -15.33% -9.53% 116% 1997%
Class A2 (4K) -8.54% -14.99% -10.30% -8.74% 115% 1918%
Class B (1080p) -7.90% -16.44% -14.84% -7.83% 117% 2067%
Class C (WVGA) -7.61% -14.94% -14.29% -7.91% 115% 2073%
Class D (WVGA) -8.12% -14.13% -13.57% -6.99% 109% 1869%
Class F (屏幕) -4.42% -8.65% -7.81% -5.47% 120% 1195%
Overall -8.23% -15.11% -13.88% -8.37% 116% 2024%

关键发现: 色度分量(U/V-PSNR)的增益显著大于亮度分量(Y-PSNR),达到 13%-16% 的码率节省。这表明 NNLF 在恢复色度细节方面具有特别突出的能力,这对 4:2:0 采样的视频内容意义重大。屏幕内容序列(Class F)的增益相对较小(-4.42%),说明 NN 工具对自然场景视频的优化效果优于屏幕内容。

4.3 编码时间影响

编码配置 EncT
All Intra 166%
Random Access 116%
Low Delay B 107%
Low Delay P 109%

编码时间增加幅度可控(107%-166%),其中 All Intra 因 NNIP 的帧内预测搜索开销增加了 66%。相比之下,解码复杂度是真正的瓶颈------RA 配置下解码时间高达基线的 20 倍(2024%),这意味着 NNVC 当前阶段的解码复杂度仍远超实用部署门槛。


05 版本迭代:NNVC-16.2 vs NNVC-17.1

NNVC-17.1 相比 NNVC-16.2 的性能对比揭示了一个重要信息:编码效率完全持平(BD-rate = 0.00%),但解码速度有显著提升。

编码配置 Y-PSNR U-PSNR V-PSNR EncT DecT CPU
Random Access 0.00% 0.00% 0.00% 99% 87%
Low Delay B 0.00% 0.00% 0.00% 99% 87%
Low Delay P 0.00% 0.00% 0.00% 99% 87%
All Intra 0.00% 0.00% 0.00% 99% 89%

这一结果表明,NNVC-17 版本周期的重点在于 工程优化而非算法创新。SADL 的多项改进(3x3 加速、SIMD 优化、内存策略管理)直接转化为 11%-13% 的解码速度提升,而 VTM-24.0 对齐和新数据集框架的引入并未影响编码效率。这种"效率不变、速度提升"的迭代模式在标准化过程中是有价值的------它为后续算法优化奠定了更高效的软件基础。


06 操作点与配置生态:质量-复杂度权衡全景

NNVC 最重要的设计决策之一是定义了多个操作点(Operation Point),形成从超低复杂度到高质量的全谱系覆盖。以下数据均基于 Random Access Main10 配置,以 NNVC-17.1 锚点(NNLF LOP7 + NNIP)为基准。

6.1 复杂度-质量阶梯

操作点 DecT (倍) Y-PSNR 定位
VLOP4 0.5x +2.34% 超低复杂度,面向移动端
LOP7 (Anchor) 1.0x 0.00% 基准配置
LDRF 11.4x -1.44% 低动态范围参考帧增强
HDRF 37.3x -2.49% 高动态范围参考帧增强
HOP5 84.5x -4.91% 最高质量操作点

6.2 各配置详细对比

配置 Y-PSNR U-PSNR V-PSNR Y-MSIM EncT DecT CPU
VLOP4 (超低操作点) +2.34% +9.15% +9.25% +1.55% 99% 50%
LOP7 (锚点) 0.00% 0.00% 0.00% 0.00% 100% 100%
LDRF (低动态范围滤波) -1.44% +0.53% -1.46% -2.08% 110% 1137%
HDRF (高动态范围滤波) -2.49% -1.03% +0.14% -2.91% 137% 3729%
HOP5 (高操作点) -4.91% -17.18% -17.82% -4.03% 290% 8448%

6.3 深度解读

VLOP4:面向移动端的轻量方案。 作为"超低操作点",VLOP4 以 2.34% 的亮度质量损失换取了 解码时间减半(50%)。色度分量损失较大(+9%),但编码时间几乎不变(99%)。这是目前最接近实用部署的配置------在移动设备等算力受限场景中,50% 的解码时间意味着可能实现实时解码。代价是需要接受约 2% 的码率损失。

LDRF / HDRF:DRF 滤波器的两个层级。 深度参考帧(Deep Reference Frame)通过神经网络从 DPB 中的两帧合成新参考帧,插入参考图像列表以增强运动估计。LDRF(低动态范围版本)带来 1.44% 的亮度增益,但解码复杂度增至 11.4 倍;HDRF(高动态范围版本)进一步提升至 2.49% 增益,解码复杂度增至 37.3 倍。值得注意的是,HDRF 在色度分量上也有改善(U-PSNR -1.03%),而 LDRF 的色度 U-PSNR 略有退化(+0.53%)。

HOP5:质量上限的探索。 高操作点(HOP5)代表了 NNLF 模型的最高质量配置,实现了 4.91% 的亮度 BD-rate 增益和高达 17% 的色度增益。但代价极为高昂------解码时间达到锚点的 84.5 倍,编码时间也增至 2.9 倍。HOP5 的价值在于标定 NNVC 的质量上限,为未来轻量化模型的设计提供目标参考。


07 深度洞察与趋势分析

7.1 解码复杂度:NNVC 落地的核心瓶颈

纵观所有数据,最突出的特征是 解码复杂度的急剧膨胀。即使是最基础的 LOP7 锚点配置,解码时间也达到了 VTM 基线的 20 倍。而在 HOP5 配置下,这一数字飙升至 84 倍。这意味着:

  • 当前 NNVC 的 BD-rate 增益(6%-9% over VTM)远不足以补偿其解码复杂度开销------在相同算力预算下,用更高效的 VTM 编码参数可能获得更好的整体体验
  • SADL 的持续优化(NNVC-17 周期实现 13% 加速)方向正确,但加速空间需要从算法层面(模型轻量化、知识蒸馏、量化感知训练)和工程层面(NPU 专用算子、硬件加速)双管齐下
  • VLOP4 配置的 50% 解码时间是当前最接近实用的方案,但 2.34% 的质量损失是否可接受取决于应用场景

7.2 色度增益的启示

一个值得关注的现象是:在几乎所有配置中,色度分量的 BD-rate 增益都显著大于亮度分量。在 NNVC-17.1 vs VTM 的基准对比中,U-PSNR 和 V-PSNR 的增益达到 -15% 级别,而 Y-PSNR 仅为 -8%。在 HOP5 配置中,色度增益更是达到 -17%。

这暗示了一个重要方向:传统编码标准在色度处理上存在系统性不足(4:2:0 采样下的色度分辨率天然受限),而神经网络工具在从低分辨率色度重建高频细节方面具有独特优势。未来 NNVC 的标准化推进中,色度增强可能成为一个高性价比的切入点------用相对较小的复杂度代价换取显著的色度质量提升。

7.3 混合架构的渐进式价值

NNVC 选择"在 VVC 框架内嵌入 NN 工具"的混合架构,而非完全端到端的神经编码,这一决策正在被数据验证。混合架构的优势在于:

  • 渐进式增益:每个 NN 工具(NNLF、NNIP、DRF)可以独立评估和采纳,避免"全有或全无"的风险
  • 兼容性保障:码流结构与 VVC 保持兼容,降低产业部署阻力
  • 研究聚焦:将有限的标准化资源集中在增益最大的模块(环路滤波、帧内预测)

但挑战同样存在:NN 工具之间的组合效应尚未充分探索。当前数据显示,各配置的对比仅在 RA 配置下完成,LDB/LDP/AI 配置的数据大量缺失(#VALUE!),说明多配置的全覆盖测试仍在进行中。NNLF + NNIP + DRF 的联合优化空间有待挖掘。

7.4 标准化进程的产业信号

从贡献者列表来看,NNVC 的推动力量涵盖了 InterDigital、Tencent、Huawei、ByteDance、Qualcomm、Nokia、OPPO 等产业链核心玩家。这一阵容传递了明确信号:产业界对 NN 增强编码的投入是真实的、持续的战略性投入,而非学术探索。特别是 Qualcomm 和 Huawei 等芯片厂商的参与,暗示 NNVC 的硬件实现路径已在规划中。

同时,JVET 同步推进的 ECM(Enhanced Compression Model)------一个主要包含传统编码工具的增强模型------与 NNVC 形成互补。这种"双轨制"策略确保了无论 NN 技术是否成熟到可标准化,VVC 之后的编码演进都有路径可走。


08 结论与展望

NNVC-17.1 代表了神经网络视频编码在标准化进程中的一个重要里程碑。基于本文的数据分析,可以得出以下核心结论:

  1. 编码效率增益确凿:NNVC-17.1 锚点配置相比 VTM 基线实现了 6%-9% 的亮度 BD-rate 增益和 13%-16% 的色度增益,证明了 NN 工具在视频编码中的技术有效性。
  2. 解码复杂度仍是主要障碍:20-84 倍的解码时间增长远超当前消费级硬件的实时解码能力。VLOP4 配置(50% 解码时间)是最接近实用的方案,但需要接受约 2% 的质量损失。
  3. 工程优化持续见效:NNVC-17 周期通过 SADL 优化实现了 13% 的解码加速,方向正确但力度仍需加大。算法层面的模型轻量化将是下一个关键突破口。
  4. 操作点生态初步形成:从 VLOP4 到 HOP5 的五级操作点体系为不同应用场景提供了灵活选择,但多配置全覆盖测试仍需完善。
  5. 产业投入持续增强:头部科技公司的积极参与和"双轨制"标准化策略表明,NNVC 正在从学术研究向产业标准化稳步推进。

展望未来,NNVC 的发展路径可能呈现以下趋势:模型轻量化技术(知识蒸馏、量化感知训练、网络架构搜索)将成为研究热点;NPU 专用推理算子的标准化将降低部署门槛;色度增强可能作为"高性价比"切入点率先进入实用化阶段。随着 SADL 等推理基础设施的持续优化和芯片级加速的支持,NNVC 有望在未来 2-3 年内逐步从研究阶段过渡到有限场景的试点部署。


数据说明: 本文所有性能数据均来自 JVET-AQ0014-v3 提案文档及配套的六组 CTC 对比数据表(.xlsm)。BD-rate 负值表示码率节省(质量提升),正值表示码率增加(质量损失)。所有操作点对比数据仅覆盖 Random Access Main10 配置;LDB/LDP/AI 配置的数据在原始文件中标注为 #VALUE!,表明相关测试仍在进行中。测试结果由 InterDigital 提供并经过交叉验证。


基于 JVET-AQ0014-v3 提案文档分析 | 数据来源:JVET 43rd Meeting, Geneva, July 2026

NNVC 软件仓库:vcgit.hhi.fraunhofer.de/jvet-ahg-nnvc

相关推荐
科技新资讯1 小时前
视频出海精细化升级:帧级对口型技术与商用工具落地能力分析
人工智能·音视频
诸葛大钢铁1 小时前
视频转音频怎么转换?在线工具、VLC、FFmpeg 三种方法详解
ffmpeg·音视频·mp4转mp3·视频转音频·视频转mp3·视频提取音频
xingyuzhisuan2 小时前
团队实践:引入 Vera 1.1 之后,视频内容团队工作流重构
人工智能·重构·音视频
OpenApi.cc3 小时前
MoCode — AI Agent Server (Docker) + macOS Desktop Client(开源项目)
数据结构·人工智能·深度学习·神经网络
美狐美颜SDK开放平台3 小时前
第三方美颜SDK接入教程:直播APP实现实时美颜、滤镜与美型效果的方法
人工智能·深度学习·音视频·sdk·美颜sdk·视频美颜sdk·直播app开发
AI服务老曹15 小时前
边云协同视频分析性能优化指南:多站点部署下的资源瓶颈突破与调优实战
性能优化·音视频
wxson728217 小时前
【Android视频监控系统技术总结】
android·音视频
努力的小Qin18 小时前
梯度下降如何实现参数优化:从线性回归到 Sigmoid 分类
人工智能·python·神经网络
程序员老陆19 小时前
FFmpeg6操作 RTMP参数详解
ffmpeg·音视频·rtmp