【H266/VVC提案解读】ITU-T H.274 (V4) 规范深度解读 — 视频编码 SEI 消息的全面演进

规范编号 : ITU-T H.274 (01/2026) | 对应标准 : ISO/IEC 23002-7 | 来源文档: JVET-AR0041-v2

从生成式人脸视频到 AI 使用限制,从数字签名到编码器优化信息------解读 2026 年最新发布的 ITU-T H.274 第四版如何重新定义视频比特流的元数据能力。


目录

  1. [规范全景:H.274 是什么](#规范全景:H.274 是什么)
  2. [四版演进史:从 2020 到 2026](#四版演进史:从 2020 到 2026)
  3. [V4 新增 15 类 SEI 消息总览](#V4 新增 15 类 SEI 消息总览)
  4. [AI 使用限制请求 (AURR) --- 标准化的 AI 边界](#AI 使用限制请求 (AURR) — 标准化的 AI 边界)
  5. [生成式人脸视频 (GFV/GEFV) --- 当编码标准遇见生成式 AI](#生成式人脸视频 (GFV/GEFV) — 当编码标准遇见生成式 AI)
  6. [数字签名内容 (DSC) --- 比特流级别的来源验证](#数字签名内容 (DSC) — 比特流级别的来源验证)
  7. [编码器优化信息 (EOI) --- 人机协同编码的元数据](#编码器优化信息 (EOI) — 人机协同编码的元数据)
  8. [物体掩码信息 (OMI) --- 从像素到语义的桥梁](#物体掩码信息 (OMI) — 从像素到语义的桥梁)
  9. [SEI 处理链 (SPO/PON) --- 里程碑式的架构创新](#SEI 处理链 (SPO/PON) — 里程碑式的架构创新)
  10. [源图像时序信息 (SPTI) --- 编码前时间的忠实记录](#源图像时序信息 (SPTI) — 编码前时间的忠实记录)
  11. [模态信息 (MI) --- 超越可见光](#模态信息 (MI) — 超越可见光)
  12. [文本描述信息 (TDI) --- 比特流中的版权与标记](#文本描述信息 (TDI) — 比特流中的版权与标记)
  13. [图像格式元数据 (IFM) --- EXIF/XMP/ICC 内嵌](#图像格式元数据 (IFM) — EXIF/XMP/ICC 内嵌)
  14. [打包区域信息 (PRI) --- 多层画面合成指引](#打包区域信息 (PRI) — 多层画面合成指引)
  15. [三项既有 SEI 扩展](#三项既有 SEI 扩展)
  16. 行业影响与趋势展望
  17. 结语

1. 规范全景:H.274 是什么

ITU-T H.274 全称 "Versatile supplemental enhancement information messages for coded video bitstreams"(编码视频比特流的通用补充增强信息消息),由 ITU-T SG21(Study Group 21)与 ISO/IEC JTC 1/SC 29 联合开发,以"双胞胎文本"形式同时发布为 ITU-T H.274 和 ISO/IEC 23002-7。

该规范定义了两类关键元数据:

  • 视频可用性信息 (VUI):描述视频信号的基本属性------色彩原色、传输特性、矩阵系数、色度采样位置、帧率、宽高比等,使解码端能正确呈现解码后的画面。
  • 补充增强信息 (SEI) 消息:携带在视频比特流中的辅助数据,本身不影响解码画面的像素值,但可辅助解码、显示、后处理、安全验证等流程。

关键设计原则 :规范明确指出,除非被引用规范另行规定,VUI 参数和 SEI 消息的解释和使用并非强制功能。这意味着 SEI 是"建议性元数据"------编码端可选择嵌入,解码端可选择使用,但一旦某上层规范(如 H.266 VVC 的特定 profile)引用了特定 SEI,则必须遵循。

H.274 主要面向 Rec. ITU-T H.266 | ISO/IEC 23090-3 (VVC) 设计,但其语法足够通用,也可用于其他编码标准的比特流。这使得 VVC 生态的元数据能力不仅服务于传统视频播放,还能承载 AI 推理、内容溯源、隐私保护等新一代需求。


2. 四版演进史:从 2020 到 2026

H.274 自 2020 年首次发布以来,经历了四版迭代,每一版都在前一版基础上增加新的 SEI 消息类型:

V1 (2020-08-29)

ITU-T H.274 / ISO/IEC 23002-7:2021。初版,定义 VUI 参数和基础 SEI 消息集,包括胶片颗粒特性、帧打包排列、解码图像哈希、主显示色彩体积、内容亮度级别、全景视频投影等约 17 类 SEI 消息。

V2 (2022-05-22)

ITU-T H.274 (V2) / ISO/IEC 23002-7:2022。新增 9 类 SEI 消息:标注区域 (AR)、Alpha 通道信息、深度表示信息、多视角采集信息、可伸缩维度信息、扩展 DRAP 指示、显示方向、色彩变换信息、多视角位置。

V3 (2023-09-29)

ITU-T H.274 (V3) / ISO/IEC 23002-7:2024。新增 4 类 SEI 消息:快门间隔信息、神经网络后滤波特性 (NNPFC)、神经网络后滤波激活 (NNPFA)、相位指示。首次将神经网络模型嵌入比特流。

V4 (2026-01-13)

ITU-T H.274 (V4) --- 当前版本。新增 15 类 SEI 消息 + 3 项既有 SEI 扩展,覆盖 AI 治理、生成式视频、数字签名、编码器优化、物体掩码、处理链编排等全新领域。由 ITU-T SG21 审批通过,ISO/IEC 23002-7 第四版在发布时处于准备出版阶段。

SEI 消息数量增长趋势

四版迭代累计从约 17 类增长至约 45 类 SEI 消息:

复制代码
SEI 消息数量
 45 |                                          ████
 30 |                          ████           ████
 26 |            ████          ████           ████
 17 |  ████      ████          ████           ████
  0 +------------------------------------------------
        V1          V2            V3            V4
       2020        2022          2023          2026
版本 年份 新增 SEI 数量 累计 SEI 总数 里程碑
V1 2020 ~17 ~17 基础 SEI 消息集定义
V2 2022 +9 ~26 多视角、深度、Alpha 通道
V3 2023 +4 ~30 神经网络后滤波引入
V4 2026 +15 ~45 AI 治理、生成式视频、数字签名

3. V4 新增 15 类 SEI 消息总览

V4 版本一次性引入了 15 类全新的 SEI 消息,加上 3 项既有 SEI 的扩展,是 H.274 历史上最大规模的一次更新。这些新 SEI 消息可按功能域分为四大类:

AI 治理类

SEI 消息 缩写 功能
AI 使用限制请求 AURR 声明视频内容不得用于特定类别的 AI 应用(训练、推理、生成式 AI 等),可区分商业/学术/政府等使用语境
文本描述信息 TDI 携带文本描述,支持版权信息、AI 标记、内容分级、编码器描述等 7 种用途

生成式 AI 类

SEI 消息 缩写 功能
生成式人脸视频 GFV 携带面部参数和神经网络,在解码端通过生成式模型重建人脸画面
增强型生成人脸视频 GEFV 对 GFV 生成的人脸画面进行后处理增强,通过 EnhancerNN 提升视觉质量

安全溯源类

SEI 消息 缩写 功能
数字签名内容初始化 DSCI 携带数字证书引用,指定安全哈希算法,定义验证周期
数字签名内容选择 DSCS 选择哪些 NAL 单元参与验证,支持多验证子流
数字签名内容验证 DSCV 携带数字签名,基于哈希算法验证内容来源和完整性

编码与处理类

SEI 消息 缩写 功能
编码器优化信息 EOI 标识视频已为人观或机器分析做过何种优化
物体掩码信息 OMI 携带物体掩码数据,服务于机器视觉任务
SEI 处理顺序 SPO 定义多条 SEI 消息的执行顺序,形成"处理链"
处理顺序嵌套 PON 允许将一个处理链的输出作为另一个处理链的输入
源图像时序信息 SPTI 记录编码前源图像之间的真实时间间隔
模态信息 MI 标识画面来源是可见光、红外还是紫外
图像格式元数据 IFM 将 EXIF、JFIF、XMP、ICC 等静态图像元数据嵌入视频比特流
打包区域信息 PRI 描述多个矩形区域如何从解码画面中打包/提取

4. AI 使用限制请求 (AURR) --- 标准化的 AI 边界

AURR (AI Usage Restrictions Request) 是 V4 中社会影响最深远的新增 SEI 消息。它允许内容创建者在比特流层面声明:这段视频的画面不应被用于哪些类型的 AI 应用

4.1 限制类别

通过 aurr_restriction[i] 语法元素,编码端可声明以下限制类别:

含义
0 不得用于任何 AI 应用
1 不得用于 AI 训练
2 不得用于 AI 推理
3 不得用于任何生成式 AI 应用
4 不得用于生成式 AI 的训练
5 不得用于生成式 AI 的推理(即不得用于生成式修改或创作)
6-255 保留

4.2 使用语境

AURR 还可通过 aurr_context[i] 位掩码指定限制适用的语境:

位掩码 语境
0x0001 商业用途
0x0002 非商业用途
0x0004 官方政府用途
0x0008 研究与学术用途

4.3 与处理链的集成

AURR 的设计巧妙地与 SPO/PON 处理链架构集成:

  • 当 AURR 被放置在 SPO 定义的处理链末端时,限制适用于后处理输出而非原始解码画面。
  • 当 AURR 被包含在 PON 消息中时,限制适用于后处理后的视频。
  • 当存在 SPO 但处理链中未包含 AURR 类型,且 AURR 未被 PON 包含时,限制同时适用于裁剪解码画面和处理链输出。

规范关键说明 :虽然接收系统被请求遵守 AURR 的指示,但本规范不对接收系统施加一致性要求 。也就是说,AURR 是一种"请求"而非"强制约束"。此外,aurr_sei_exclusion_flag 允许将 NNPFC、NNPFA、GFV 和 GEFV 等 AI 处理 SEI 排除在限制范围之外,保证标准内建的 AI 后处理功能不受外部 AI 限制的影响。

这一设计反映了标准制定者对 AI 治理的务实态度:在比特流中提供声明机制,但将执行权交给应用层和法律框架。值 0-2 覆盖所有类型 AI 模型,值 3-5 专指生成式 AI,形成了从"全禁止"到"细粒度控制"的分层限制体系。


5. 生成式人脸视频 (GFV/GEFV) --- 当编码标准遇见生成式 AI

GFV (Generative Face Video) 和 GEFV (Generative Enhancement Face Video) 是 V4 中技术前沿性最强的新增 SEI 消息对。它们代表了视频编码从"压缩已有像素"向"传输生成指令"的范式转变。

5.1 GFV 的工作流程

GFV SEI 消息携带以下关键信息:

  • 面部参数:包括关键点坐标 (keypoints)、3D 空间坐标、多种矩阵参数(仿射变换、协方差、嘴部矩阵、眼部矩阵、头部旋转/平移/位置等)。
  • TranslatorNN:一个翻译神经网络,将 SEI 中信令的面部参数格式转换为解码系统支持的特定格式。
  • GenerativeNN:一个人脸画面生成神经网络,使用翻译后的面部参数、解码画面和色键信息生成人脸画面。
  • 色键 (Chroma Key) 信息:标识背景区域,用于人脸区域与背景区域的差异化处理和融合。

核心流程可用伪代码概括:

python 复制代码
# 基础画面 (base picture): gfv_base_pic_flag = 1
# 生成画面: gfv_base_pic_flag = 0
if gfv_base_pic_flag:
    # 存储基础画面作为后续生成的参考
    StoreBasePicture()
else:
    # 从 SEI 提取面部参数 -> 翻译网络 -> 生成网络
    translated_params = TranslatorNN(extracted_params)
    generated_face = GenerativeNN(base_pic, translated_params, chroma_key)
    # 使用 alpha 混合将人脸与背景融合
    final_output = alpha_blend(generated_face, background, alpha)

5.2 关键点与矩阵参数体系

GFV 定义了丰富的面部参数体系,支持 2D 和 3D 空间:

矩阵类型 含义 典型尺寸
0 仿射变换矩阵 2x2 或 3x3
1 协方差矩阵 2x2 或 3x3
2 嘴部矩阵(嘴部运动) 由信令指定
3 眼部矩阵(开闭状态和程度) 由信令指定
4 头部旋转参数 2x2 或 3x3
5 头部平移矩阵 1x2 或 1x3
6 头部位置矩阵 1x2 或 1x3
7 紧凑特征矩阵 由信令指定
8-31 应用自定义矩阵 由信令指定

5.3 色键融合机制

GFV 使用色键信息区分画面中的人脸区域和背景区域:

  • gfv_chroma_key_value_present_flag[c]:标识色键值是否显式存在
  • gfv_chroma_key_thr_lower:色键下限阈值(缺省值 48)
  • gfv_chroma_key_thr_upper_delta_minus1:上下限差值(缺省值 26)
  • 透明度指示 alpha[x][y] 基于色键阈值计算,用于人脸与背景的 alpha 混合

5.4 GEFV 的增强机制

GEFV SEI 消息通过 EnhancerNN 神经网络对 GFV 生成的人脸画面进行后处理增强。其工作流程包括:

  1. 从关联的 GFV SEI 消息获取生成的人脸画面
  2. 提取基础画面和生成画面作为 EnhancerNN 的输入张量
  3. 将矩阵参数和瞳孔坐标等增强参数作为辅助输入
  4. 执行增强网络,输出提升后的人脸画面

GEFV 引入了瞳孔坐标 (gefv_pupil_coordinate_present_idx) 这一精细参数,支持左眼、右眼或双眼的瞳孔位置信令,为人脸动画的细节增强提供了额外控制维度。

技术意义:GFV/GEFV 的核心思路是:与其传输高码率的人脸视频像素,不如传输低码率的面部参数 + 神经网络模型,在解码端通过生成式 AI 重建画面。这一范式如果成熟,可能从根本上改变人脸视频的编码方式------从"压缩像素"到"压缩语义 + 生成像素"。


6. 数字签名内容 (DSC) --- 比特流级别的来源验证

DSC (Digitally Signed Content) 由三条 SEI 消息组成,形成完整的比特流内容来源验证体系:

DSCI --- 初始化

  • 携带数字证书引用,标识内容提供者身份
  • 指定安全哈希算法 (SHA-1 到 SHA-512/256)
  • 定义验证周期 (verification period)
  • 支持图像分段签名模式
  • 必须出现在每个 IRAP 或 GDR AU 中

DSCS --- 选择

  • 选择哪些 NAL 单元参与验证
  • 区分 VCL 和 non-VCL NAL 单元
  • 支持多个验证子流 (verification substream)
  • 将图像划分为可验证的段

DSCV --- 验证

  • 携带数字签名
  • 基于 DSCI 指定的哈希算法计算消息摘要
  • 允许接收端验证内容来源和完整性
  • 支持一个或多个验证系统并行使用

支持的哈希算法

算法 块大小 (bits) 摘要大小 (bits)
0 SHA-1 512 160
1 SHA-224 512 224
2 SHA-256 512 256
3 SHA-384 1024 384
4 SHA-512 1024 512
5 SHA-512/224 1024 224
6 SHA-512/256 1024 256

验证周期与子流

DSC 引入了"验证周期"概念------从一条 DSCI 消息到下一条相同 dsci_id 的 DSCI 消息之间的 AU 序列。在此周期内:

  • DSCI 必须出现在每个 IRAP 或 GDR AU 中,且位于所有验证包含 NAL 单元之前。
  • DSCS 指定哪些 NAL 单元属于验证子流,支持按图像段 (picture segment) 划分。
  • DSCV 携带数字签名,与 DSCI 中的哈希算法配合验证。
  • 当 CVS 包含多个不同 dsci_id 的 DSCI 时,每个 ID 定义独立的验证系统,可并行使用。

这套机制使视频内容能够像文档数字签名一样被验证来源和完整性,适用于版权保护、证据链保全、内容认证等场景。


7. 编码器优化信息 (EOI) --- 人机协同编码的元数据

EOI (Encoder Optimization Information) SEI 消息解决了视频编码领域一个日益重要的问题:随着视频越来越多地被机器"观看"(AI 检测、识别、分析),编码器需要告知解码端这段视频究竟是为谁优化的。

7.1 观看目标标识

EOI 通过两个独立字段区分优化目标:

字段 含义
eoi_for_human_viewing_idc 3 已为人观做了优化
2 适合人观但未特意优化
1 不适合人观
0 是否适合人观未知
eoi_for_machine_analysis_idc 3 已为机器分析做了优化
2 适合机器分析但未特意优化
1 不适合机器分析
0 是否适合机器分析未知

一致性约束eoi_for_human_viewing_idceoi_for_machine_analysis_idc 不得同时为 1(即不得同时声明"不适合人观"且"不适合机器分析"),否则比特流不一致。

7.2 优化类型

通过 eoi_type 位掩码可同时标识多种已应用的优化类型:

位掩码 优化类型 说明
0x01 对象优化 检测到的对象区域相比其他区域做了差异化优化
0x02 时间重采样 帧率调整(子采样或插帧)
0x04 空间重采样 分辨率调整
0x08 时间质量优化 质量随时间波动
0x10 空间质量优化 降噪、去除斑点等画面级质量改善
0x20 隐私保护优化 去除或替换个人身份信息
0x40 亮度自适应 调整平均亮度以节省显示能耗

7.3 对象优化的细分

当对象优化被启用时,eoi_object_based_idc 进一步描述了对象区域之外的处理方式:

位掩码 对象外区域的处理
0x01 模糊处理
0x02 使用更粗的量化参数编码
0x04 覆盖为常量采样值
0x08 以非常量方式覆盖
0x10 按对象大小差异化处理

7.4 隐私保护元数据

当隐私保护优化被启用时,EOI 可进一步声明:

保护方法 (eoi_privacy_protection_method_idc):

位掩码 保护方法
0x01 模糊:使个人信息区域不可识别或难以识别
0x02 替换:用不同于原始内容替换个人信息区域
0x04 遮罩:遮盖个人信息区域
0x08 像素化:修改个人信息区域的像素大小

受保护信息类型 (eoi_privacy_info_type):

位掩码 受保护信息类型
0x01 身份信息(如人脸)
0x02 车辆信息(如车牌)
0x04 可推断位置的信息(如路牌文字)

这些元数据使下游系统能理解隐私保护的处理方式,而非仅从画面中猜测。


8. 物体掩码信息 (OMI) --- 从像素到语义的桥梁

OMI (Object Mask Information) SEI 消息将物体掩码 (object mask) 数据嵌入比特流,与主层 (primary layer) 关联。当 OMI 存在时,规范期望同时存在 SDI (Scalability Dimension Information) SEI 消息且 sdi_aux_id[i] 等于 AUX_OBJECT_MASK

这意味着 OMI 设计为通过可伸缩编码 (scalable coding) 的辅助层 (auxiliary layer) 传输物体掩码------主层包含视频内容,辅助层包含对应的二值化掩码,标识哪些像素属于被追踪的物体。

应用场景:OMI 为机器视觉任务提供了比特流内建的语义标注:自动驾驶视频可标注行人/车辆区域,监控视频可标注入侵物体,AI 分析系统可直接从比特流获取物体位置而非通过额外推理。这代表了视频编码标准从"为人眼编码"向"为人眼 + 机器编码"的范式扩展。


9. SEI 处理链 (SPO/PON) --- 里程碑式的架构创新

SPO (SEI Processing Order) 和 PON (Processing Order Nesting) 是 V4 中架构层面最重要的创新。在 V4 之前,多条 SEI 消息的处理顺序是隐式的,依赖实现约定。SPO/PON 将处理顺序显式化、可嵌套化。

9.1 SPO --- 处理链定义

SPO SEI 消息定义了一个有序的 SEI 消息处理链:

  • 通过 po_id 标识一个处理链
  • 通过 po_sei_payload_type[] 列出处理链中各 SEI 消息的 payloadType
  • 通过 po_sei_processing_order[] 指定每条 SEI 消息的执行顺序
  • 通过 po_sei_importance_flag[]po_sei_processing_degree_flag[] 进一步控制每步的处理重要性和程度
  • 处理链定义在 CLVS (Coded Layer Video Sequence) 范围内持续有效

9.2 PON --- 处理链嵌套

PON SEI 消息允许将多个 SPO 定义的处理链进行嵌套:

  • 一个 PON 可关联多个 SPO(通过 pon_num_po_ids_minus1 指定数量)
  • 使一个处理链的输出成为另一个处理链的输入
  • 支持 NNPFA 消息在嵌套环境中的输入画面位移 (nnpfa_num_input_pic_shift_minus1)

9.3 处理链示例

复制代码
// 典型处理链示例
Processing Chain 1 (SPO, po_id=0):
  Step 1: NNPFC (神经网络后滤波特性) - 定义后滤波模型
  Step 2: NNPFA (神经网络后滤波激活) - 应用后滤波
  Step 3: AURR (AI 使用限制) - 限制后处理输出的 AI 使用

Processing Chain 2 (SPO, po_id=1):
  Step 1: GFV (生成式人脸视频) - 生成人脸画面
  Step 2: GEFV (增强型生成人脸视频) - 增强人脸画面

// PON 嵌套两个链
PON: [Chain 1] -> [Chain 2]
  先应用 NN 后滤波,再在滤波后的画面上执行 GFV 生成

AURR 在处理链中的位置有特殊语义:当 AURR 位于处理链末端时,限制适用于处理链的输出;当 AURR 被包含在 PON 中时,限制适用于嵌套处理后的最终输出。这使内容创建者能精确控制 AI 限制的应用范围。


10. 源图像时序信息 (SPTI) --- 编码前时间的忠实记录

SPTI (Source Picture Timing Information) SEI 消息记录了编码前源图像之间的真实时间间隔。对于摄像机捕获内容,这是图像传感器曝光产生连续源画面之间的时间差。

时序类型

通过 spti_source_type 位掩码,SPTI 可标识 8 种时序关系:

位掩码 时序类型 说明
0x01 慢动作 源画面间隔 < 解码输出间隔
0x02 加速动作 源画面间隔 > 解码输出间隔
0x04 高速摄影 源画面间隔 < 1/120 秒
0x08 延时摄影 源画面间隔 > 1.001/24 秒
0x10 时间反转 解码画面按时间逆序输出
0x20 静止/冻结帧 源画面间隔为 0
0x40 间歇或事件驱动 源画面间隔非常数
0x80 保留 ---

SPTI 与帧打包排列 SEI 和帧场信息 SEI 有交互规则:当帧打包为时间交错 (type 5) 时,SPTI 分别适用于每个组成画面;当存在帧场信息时,SPTI 仅适用于 ffi_duplicate_flag 为 0 的画面,且对顶场和底场分别适用。


11. 模态信息 (MI) --- 超越可见光

MI (Modality Information) SEI 消息标识画面来源的电磁辐射类型,支持非可见光成像场景:

模态类型
0 未指定或通过其他方式确定
1 可见光画面
2 红外画面
3 紫外画面
4-31 保留

当模态为红外 (2) 或紫外 (3) 时,规范要求解码端忽略 VUI 中的 vui_colour_primariesvui_transfer_characteristicsvui_matrix_coefficients------因为这些色彩参数对非可见光画面无意义。

MI 还可选地携带电磁波波长范围信息,通过指数-尾数 (mantissa-exponent) 浮点编码指定最小波长:

复制代码
MinWavelength = mi_min_wavelength_mantissa * 10^(mi_min_wavelength_exponent_plus15 - 15)

这一 SEI 消息使视频编码标准能覆盖安防监控(红外夜视)、工业检测(紫外)、医学成像等专业领域。


12. 文本描述信息 (TDI) --- 比特流中的版权与标记

TDI (Text Description Information) SEI 消息提供关于画面的文本描述,支持以下 7 种用途:

用途
0 应用自定义
1 版权信息
2 AI 标记信息
3 一般评论信息
4 内容分级信息(符合美国/加拿大 RRT)
5 Tag URI(标识比特流所属)
6 编码器描述
7-255 保留

值得注意的是,值 2 ("AI 标记信息") 的存在表明 V4 将 AI 相关元数据提升到了与版权和内容分级同等的基础设施级别。结合 AURR 和 GFV/GEFV,H.274 V4 形成了从"标记 AI 生成内容"到"限制 AI 使用"再到"内建 AI 生成能力"的完整 AI 元数据体系。


13. 图像格式元数据 (IFM) --- EXIF/XMP/ICC 内嵌

IFM (Image Format Metadata) SEI 消息将传统静态图像的元数据格式嵌入视频比特流,支持 7 种元数据类型:

元数据类型 参考标准
0 EXIF 属性信息 CIPA-DC-008-2023
1 JFIF 元数据(JFIF 段) ITU-T T.871 / ISO/IEC 10918-5
2 JFIF 扩展标记 ITU-T T.871 / ISO/IEC 10918-5
3 图像起始后的首个 JFIF 标记 ITU-T T.871 / ISO/IEC 10918-5
4 XMP 元数据 (XML 或 JSON-LD) ISO 16684-1 / ISO 16684-3
5 ICC 色彩配置文件 ISO 15076-1 / ISO 20677
6 TIFF/EP 结构 ISO 12234-2

IFM 支持两种携带方式:直接内嵌 (ifm_data_payload_byte) 或通过 URI 引用 (ifm_data_uri)。对于超过 131,072 字节的大型元数据(如完整 ICC 配置文件),规范建议使用 URI 引用而非内嵌。

对于 ICC 配置文件 (type 5),IFM 还标识了 ICC 主版本号和次版本号,支持从 profile 4.2 到 profile 5.0 的多个 ICC 版本。


14. 打包区域信息 (PRI) --- 多层画面合成指引

PRI (Packed Regions Information) SEI 消息描述了一个或多个层中编码画面的矩形区域如何被打包,使接收端能从裁剪解码画面中重建目标画面。

关键语法元素包括:

  • pri_num_regions_minus1:区域数量
  • pri_use_max_dimensions_flag:是否使用最大维度
  • pri_region_size_len_minus1:区域尺寸字段位宽
  • pri_region_id_present_flag:是否携带区域 ID
  • pri_target_pic_params_present_flag:是否携带目标画面参数

PRI 与 V2 引入的标注区域 (AR) SEI 消息不同:AR 标注画面中的感兴趣区域供应用层使用,PRI 则用于画面重建------将多个区域从解码画面中提取并拼装成目标画面,适用于多画面合成、子画面提取等场景。


15. 三项既有 SEI 扩展

V4 除了新增 15 类 SEI 消息外,还对 3 项既有 SEI 消息进行了功能扩展:

15.1 胶片颗粒特性 (Film Grain Characteristics) 扩展

V1 引入的胶片颗粒模拟 SEI 在 V4 中获得了扩展,增强了电影质感模拟的参数表达能力和精度。

15.2 神经网络后滤波特性 (NNPFC) 扩展

V3 引入的 NNPFC 在 V4 中扩展了神经网络模型的描述能力,新增输入/输出顺序标识 (nnpfc_inp_order_idcnnpfc_out_order_idc)、填充类型 (nnpfc_padding_type) 等,使后滤波神经网络能处理更复杂的输入输出配置。

15.3 神经网络后滤波激活 (NNPFA) 扩展

NNPFA 扩展了激活机制,新增输入画面位移 (nnpfa_num_input_pic_shift_minus1) 支持,允许在候选输入画面列表中选择特定画面作为 NNPF 输入,特别适用于与 SPO/PON 处理链集成的场景。


16. 行业影响与趋势展望

V4 新增 SEI 技术影响力评估

从社会影响、技术前沿性、落地可行性、标准化程度、生态依赖度五个维度评估六类关键新增 SEI 消息:

复制代码
                    社会影响
                       100
                        |
                        |   AURR ████████████████
                        |
             生态依赖 ──+── 技术前沿
                        |   GFV ████████████
                        |   EOI ████████████████
                        |   OMI ████████
                        |   DSC ████████████
                        |   SPO/PON ██████
                        |
                    标准化程度  落地可行性
SEI 消息 社会影响 技术前沿 落地可行性 标准化程度 生态依赖 一句话评价
AURR ★★★★★ ★★★ ★★★★ ★★★★★ ★★★ 社会影响最高,标准化程度高
GFV ★★★ ★★★★★ ★★ ★★★ ★★★★ 技术前沿性最强,落地待验证
DSC ★★★★ ★★★ ★★★ ★★★★★ ★★★★★ 标准化程度高,生态依赖度高
EOI ★★★ ★★★ ★★★★★ ★★★★★ ★★ 落地可行性最高,实现简单
OMI ★★★ ★★★★ ★★★ ★★★★ ★★★ 语义丰富但编码开销大
SPO/PON ★★ ★★★★ ★★★ ★★★★★ ★★★★ 架构完善,普及依赖生态

信号一:AI 治理进入编码标准

AURR SEI 消息的出现标志着 AI 内容治理从"平台政策"层下沉到"编码标准"层。内容创建者可以在比特流中直接声明 AI 使用限制,而非依赖平台的内容使用条款。虽然 AURR 是"请求"而非"强制",但它为 AI 内容溯源和治理提供了标准化的元数据基础设施。结合 TDI 的 AI 标记信息 (值 2),H.274 V4 形成了"标记 AI 生成 → 限制 AI 使用"的完整链路。

信号二:生成式 AI 与视频编码融合

GFV/GEFV 将生成式神经网络模型参数嵌入比特流,代表了编码标准从"压缩已有内容"向"传输生成指令"的范式探索。虽然 GFV 目前聚焦于人脸视频这一特定场景,但其架构------SEI 携带参数 + 翻译网络 + 生成网络------具有向更广泛场景扩展的潜力。如果这一路径成熟,未来的视频编码可能不只是"压缩像素",而是"压缩语义 + 重建像素"。

信号三:内容溯源与安全验证

DSC 三消息体系使视频比特流具备了与 PDF 数字签名类似的来源验证能力。在深度伪造 (Deepfake) 和 AI 生成内容泛滥的时代,比特流级别的数字签名为内容真实性验证提供了技术底座,适用于新闻媒体、司法取证、版权保护等高信任场景。

信号四:机器视觉友好的编码

EOI 和 OMI 共同构成了"机器视觉友好编码"的元数据基础:EOI 告知解码端视频是否为机器分析做过优化以及做了哪些优化,OMI 直接在比特流中嵌入物体掩码。这意味着未来的视频编码标准不仅为"人眼"服务,也为"机器眼"服务------视频文件本身可以携带机器视觉任务所需的语义标注。

信号五:SEI 处理链的架构化

SPO/PON 将 SEI 消息的处理从"无序集合"升级为"有序处理链",这是 SEI 架构层面的里程碑。随着 V4 引入的 SEI 消息越来越多(累计约 45 类),且彼此之间存在处理依赖关系(如 NNPFC → NNPFA → AURR),显式定义处理顺序变得不可或缺。SPO/PON 为未来更复杂的 SEI 组合提供了架构基础。


结语

ITU-T H.274 (V4) 是 SEI 消息规范历史上最大规模的一次更新,其新增的 15 类 SEI 消息和 3 项扩展覆盖了 AI 治理、生成式视频、数字签名、编码器优化、机器视觉、处理链架构等全新领域。这些新增能力使视频编码标准从传统的"压缩 + 显示辅助"角色,扩展为"压缩 + AI + 安全 + 语义 + 治理"的多维元数据平台。

特别值得关注的是三大趋势的交汇:AURR/TDI 为 AI 内容治理提供基础设施,GFV/GEFV 将生成式 AI 引入编码流程,DSC 为内容真实性提供密码学验证。这三者共同构成了视频编码标准应对 AI 时代挑战的技术应答。

该规范由 JVET (Joint Video Experts Team) 开发,以 JVET-AR0041 文档编号在 JVET 第 44 次会议(2026 年 10 月,杭州)周期内推进。作为 ITU-T H.266 (VVC) 生态的关键配套规范,H.274 V4 的发布标志着视频编码元数据能力进入了一个全新的发展阶段。


本文基于 ITU-T H.274 (V4) 规范文档 (JVET-AR0041-v2) 撰写,仅供技术参考。规范版权归 ITU-T 和 ISO/IEC 所有,完整内容请参阅 ITU-T 官方出版物

相关推荐
平原20184 小时前
LTX-2.5 22B 本地部署:ModelScope 下载、8 步推理与图生视频命令
音视频
淡淡的香烟5 小时前
Android视频直播播放器简单封装
android·物联网·音视频
show43316 小时前
2026视频处理小程序技术选型指南:链接解析+OCR+ASR+AI配音多引擎对比
小程序·ocr·音视频
昨日之日200616 小时前
LTX-2.5:更清晰、更可控、同步音画、多镜头连贯的AI视频神器
人工智能·音视频
hz5678919 小时前
视频会议终端对接详解:协议兼容、系统集成与常见问题
安全·实时音视频·信息与通信
点云-激光雷达-Slam-三维牙齿21 小时前
批量音频转文本 ASR 目前中文识别效果最好的qwen3 模型
音视频
小柯南敲键盘21 小时前
跨马翻译:跨境电商批量图片翻译与视频字幕一站式工具
人工智能·python·音视频
weixin_446260851 天前
AVA-Encoder:面向智能体原生视频表征学习框架
学习·音视频
cdprinter1 天前
信刻——留置谈话音视频数据集中自动刻录归档解决方案
自动化·音视频