规范编号 : ITU-T H.274 (01/2026) | 对应标准 : ISO/IEC 23002-7 | 来源文档: JVET-AR0041-v2
从生成式人脸视频到 AI 使用限制,从数字签名到编码器优化信息------解读 2026 年最新发布的 ITU-T H.274 第四版如何重新定义视频比特流的元数据能力。
目录
- [规范全景:H.274 是什么](#规范全景:H.274 是什么)
- [四版演进史:从 2020 到 2026](#四版演进史:从 2020 到 2026)
- [V4 新增 15 类 SEI 消息总览](#V4 新增 15 类 SEI 消息总览)
- [AI 使用限制请求 (AURR) --- 标准化的 AI 边界](#AI 使用限制请求 (AURR) — 标准化的 AI 边界)
- [生成式人脸视频 (GFV/GEFV) --- 当编码标准遇见生成式 AI](#生成式人脸视频 (GFV/GEFV) — 当编码标准遇见生成式 AI)
- [数字签名内容 (DSC) --- 比特流级别的来源验证](#数字签名内容 (DSC) — 比特流级别的来源验证)
- [编码器优化信息 (EOI) --- 人机协同编码的元数据](#编码器优化信息 (EOI) — 人机协同编码的元数据)
- [物体掩码信息 (OMI) --- 从像素到语义的桥梁](#物体掩码信息 (OMI) — 从像素到语义的桥梁)
- [SEI 处理链 (SPO/PON) --- 里程碑式的架构创新](#SEI 处理链 (SPO/PON) — 里程碑式的架构创新)
- [源图像时序信息 (SPTI) --- 编码前时间的忠实记录](#源图像时序信息 (SPTI) — 编码前时间的忠实记录)
- [模态信息 (MI) --- 超越可见光](#模态信息 (MI) — 超越可见光)
- [文本描述信息 (TDI) --- 比特流中的版权与标记](#文本描述信息 (TDI) — 比特流中的版权与标记)
- [图像格式元数据 (IFM) --- EXIF/XMP/ICC 内嵌](#图像格式元数据 (IFM) — EXIF/XMP/ICC 内嵌)
- [打包区域信息 (PRI) --- 多层画面合成指引](#打包区域信息 (PRI) — 多层画面合成指引)
- [三项既有 SEI 扩展](#三项既有 SEI 扩展)
- 行业影响与趋势展望
- 结语
1. 规范全景:H.274 是什么
ITU-T H.274 全称 "Versatile supplemental enhancement information messages for coded video bitstreams"(编码视频比特流的通用补充增强信息消息),由 ITU-T SG21(Study Group 21)与 ISO/IEC JTC 1/SC 29 联合开发,以"双胞胎文本"形式同时发布为 ITU-T H.274 和 ISO/IEC 23002-7。
该规范定义了两类关键元数据:
- 视频可用性信息 (VUI):描述视频信号的基本属性------色彩原色、传输特性、矩阵系数、色度采样位置、帧率、宽高比等,使解码端能正确呈现解码后的画面。
- 补充增强信息 (SEI) 消息:携带在视频比特流中的辅助数据,本身不影响解码画面的像素值,但可辅助解码、显示、后处理、安全验证等流程。
关键设计原则 :规范明确指出,除非被引用规范另行规定,VUI 参数和 SEI 消息的解释和使用并非强制功能。这意味着 SEI 是"建议性元数据"------编码端可选择嵌入,解码端可选择使用,但一旦某上层规范(如 H.266 VVC 的特定 profile)引用了特定 SEI,则必须遵循。
H.274 主要面向 Rec. ITU-T H.266 | ISO/IEC 23090-3 (VVC) 设计,但其语法足够通用,也可用于其他编码标准的比特流。这使得 VVC 生态的元数据能力不仅服务于传统视频播放,还能承载 AI 推理、内容溯源、隐私保护等新一代需求。
2. 四版演进史:从 2020 到 2026
H.274 自 2020 年首次发布以来,经历了四版迭代,每一版都在前一版基础上增加新的 SEI 消息类型:
V1 (2020-08-29)
ITU-T H.274 / ISO/IEC 23002-7:2021。初版,定义 VUI 参数和基础 SEI 消息集,包括胶片颗粒特性、帧打包排列、解码图像哈希、主显示色彩体积、内容亮度级别、全景视频投影等约 17 类 SEI 消息。
V2 (2022-05-22)
ITU-T H.274 (V2) / ISO/IEC 23002-7:2022。新增 9 类 SEI 消息:标注区域 (AR)、Alpha 通道信息、深度表示信息、多视角采集信息、可伸缩维度信息、扩展 DRAP 指示、显示方向、色彩变换信息、多视角位置。
V3 (2023-09-29)
ITU-T H.274 (V3) / ISO/IEC 23002-7:2024。新增 4 类 SEI 消息:快门间隔信息、神经网络后滤波特性 (NNPFC)、神经网络后滤波激活 (NNPFA)、相位指示。首次将神经网络模型嵌入比特流。
V4 (2026-01-13)
ITU-T H.274 (V4) --- 当前版本。新增 15 类 SEI 消息 + 3 项既有 SEI 扩展,覆盖 AI 治理、生成式视频、数字签名、编码器优化、物体掩码、处理链编排等全新领域。由 ITU-T SG21 审批通过,ISO/IEC 23002-7 第四版在发布时处于准备出版阶段。
SEI 消息数量增长趋势
四版迭代累计从约 17 类增长至约 45 类 SEI 消息:
SEI 消息数量
45 | ████
30 | ████ ████
26 | ████ ████ ████
17 | ████ ████ ████ ████
0 +------------------------------------------------
V1 V2 V3 V4
2020 2022 2023 2026
| 版本 | 年份 | 新增 SEI 数量 | 累计 SEI 总数 | 里程碑 |
|---|---|---|---|---|
| V1 | 2020 | ~17 | ~17 | 基础 SEI 消息集定义 |
| V2 | 2022 | +9 | ~26 | 多视角、深度、Alpha 通道 |
| V3 | 2023 | +4 | ~30 | 神经网络后滤波引入 |
| V4 | 2026 | +15 | ~45 | AI 治理、生成式视频、数字签名 |
3. V4 新增 15 类 SEI 消息总览
V4 版本一次性引入了 15 类全新的 SEI 消息,加上 3 项既有 SEI 的扩展,是 H.274 历史上最大规模的一次更新。这些新 SEI 消息可按功能域分为四大类:
AI 治理类
| SEI 消息 | 缩写 | 功能 |
|---|---|---|
| AI 使用限制请求 | AURR | 声明视频内容不得用于特定类别的 AI 应用(训练、推理、生成式 AI 等),可区分商业/学术/政府等使用语境 |
| 文本描述信息 | TDI | 携带文本描述,支持版权信息、AI 标记、内容分级、编码器描述等 7 种用途 |
生成式 AI 类
| SEI 消息 | 缩写 | 功能 |
|---|---|---|
| 生成式人脸视频 | GFV | 携带面部参数和神经网络,在解码端通过生成式模型重建人脸画面 |
| 增强型生成人脸视频 | GEFV | 对 GFV 生成的人脸画面进行后处理增强,通过 EnhancerNN 提升视觉质量 |
安全溯源类
| SEI 消息 | 缩写 | 功能 |
|---|---|---|
| 数字签名内容初始化 | DSCI | 携带数字证书引用,指定安全哈希算法,定义验证周期 |
| 数字签名内容选择 | DSCS | 选择哪些 NAL 单元参与验证,支持多验证子流 |
| 数字签名内容验证 | DSCV | 携带数字签名,基于哈希算法验证内容来源和完整性 |
编码与处理类
| SEI 消息 | 缩写 | 功能 |
|---|---|---|
| 编码器优化信息 | EOI | 标识视频已为人观或机器分析做过何种优化 |
| 物体掩码信息 | OMI | 携带物体掩码数据,服务于机器视觉任务 |
| SEI 处理顺序 | SPO | 定义多条 SEI 消息的执行顺序,形成"处理链" |
| 处理顺序嵌套 | PON | 允许将一个处理链的输出作为另一个处理链的输入 |
| 源图像时序信息 | SPTI | 记录编码前源图像之间的真实时间间隔 |
| 模态信息 | MI | 标识画面来源是可见光、红外还是紫外 |
| 图像格式元数据 | IFM | 将 EXIF、JFIF、XMP、ICC 等静态图像元数据嵌入视频比特流 |
| 打包区域信息 | PRI | 描述多个矩形区域如何从解码画面中打包/提取 |
4. AI 使用限制请求 (AURR) --- 标准化的 AI 边界
AURR (AI Usage Restrictions Request) 是 V4 中社会影响最深远的新增 SEI 消息。它允许内容创建者在比特流层面声明:这段视频的画面不应被用于哪些类型的 AI 应用。
4.1 限制类别
通过 aurr_restriction[i] 语法元素,编码端可声明以下限制类别:
| 值 | 含义 |
|---|---|
| 0 | 不得用于任何 AI 应用 |
| 1 | 不得用于 AI 训练 |
| 2 | 不得用于 AI 推理 |
| 3 | 不得用于任何生成式 AI 应用 |
| 4 | 不得用于生成式 AI 的训练 |
| 5 | 不得用于生成式 AI 的推理(即不得用于生成式修改或创作) |
| 6-255 | 保留 |
4.2 使用语境
AURR 还可通过 aurr_context[i] 位掩码指定限制适用的语境:
| 位掩码 | 语境 |
|---|---|
0x0001 |
商业用途 |
0x0002 |
非商业用途 |
0x0004 |
官方政府用途 |
0x0008 |
研究与学术用途 |
4.3 与处理链的集成
AURR 的设计巧妙地与 SPO/PON 处理链架构集成:
- 当 AURR 被放置在 SPO 定义的处理链末端时,限制适用于后处理输出而非原始解码画面。
- 当 AURR 被包含在 PON 消息中时,限制适用于后处理后的视频。
- 当存在 SPO 但处理链中未包含 AURR 类型,且 AURR 未被 PON 包含时,限制同时适用于裁剪解码画面和处理链输出。
规范关键说明 :虽然接收系统被请求遵守 AURR 的指示,但本规范不对接收系统施加一致性要求 。也就是说,AURR 是一种"请求"而非"强制约束"。此外,
aurr_sei_exclusion_flag允许将 NNPFC、NNPFA、GFV 和 GEFV 等 AI 处理 SEI 排除在限制范围之外,保证标准内建的 AI 后处理功能不受外部 AI 限制的影响。
这一设计反映了标准制定者对 AI 治理的务实态度:在比特流中提供声明机制,但将执行权交给应用层和法律框架。值 0-2 覆盖所有类型 AI 模型,值 3-5 专指生成式 AI,形成了从"全禁止"到"细粒度控制"的分层限制体系。
5. 生成式人脸视频 (GFV/GEFV) --- 当编码标准遇见生成式 AI
GFV (Generative Face Video) 和 GEFV (Generative Enhancement Face Video) 是 V4 中技术前沿性最强的新增 SEI 消息对。它们代表了视频编码从"压缩已有像素"向"传输生成指令"的范式转变。
5.1 GFV 的工作流程
GFV SEI 消息携带以下关键信息:
- 面部参数:包括关键点坐标 (keypoints)、3D 空间坐标、多种矩阵参数(仿射变换、协方差、嘴部矩阵、眼部矩阵、头部旋转/平移/位置等)。
- TranslatorNN:一个翻译神经网络,将 SEI 中信令的面部参数格式转换为解码系统支持的特定格式。
- GenerativeNN:一个人脸画面生成神经网络,使用翻译后的面部参数、解码画面和色键信息生成人脸画面。
- 色键 (Chroma Key) 信息:标识背景区域,用于人脸区域与背景区域的差异化处理和融合。
核心流程可用伪代码概括:
python
# 基础画面 (base picture): gfv_base_pic_flag = 1
# 生成画面: gfv_base_pic_flag = 0
if gfv_base_pic_flag:
# 存储基础画面作为后续生成的参考
StoreBasePicture()
else:
# 从 SEI 提取面部参数 -> 翻译网络 -> 生成网络
translated_params = TranslatorNN(extracted_params)
generated_face = GenerativeNN(base_pic, translated_params, chroma_key)
# 使用 alpha 混合将人脸与背景融合
final_output = alpha_blend(generated_face, background, alpha)
5.2 关键点与矩阵参数体系
GFV 定义了丰富的面部参数体系,支持 2D 和 3D 空间:
| 矩阵类型 | 含义 | 典型尺寸 |
|---|---|---|
| 0 | 仿射变换矩阵 | 2x2 或 3x3 |
| 1 | 协方差矩阵 | 2x2 或 3x3 |
| 2 | 嘴部矩阵(嘴部运动) | 由信令指定 |
| 3 | 眼部矩阵(开闭状态和程度) | 由信令指定 |
| 4 | 头部旋转参数 | 2x2 或 3x3 |
| 5 | 头部平移矩阵 | 1x2 或 1x3 |
| 6 | 头部位置矩阵 | 1x2 或 1x3 |
| 7 | 紧凑特征矩阵 | 由信令指定 |
| 8-31 | 应用自定义矩阵 | 由信令指定 |
5.3 色键融合机制
GFV 使用色键信息区分画面中的人脸区域和背景区域:
gfv_chroma_key_value_present_flag[c]:标识色键值是否显式存在gfv_chroma_key_thr_lower:色键下限阈值(缺省值 48)gfv_chroma_key_thr_upper_delta_minus1:上下限差值(缺省值 26)- 透明度指示
alpha[x][y]基于色键阈值计算,用于人脸与背景的 alpha 混合
5.4 GEFV 的增强机制
GEFV SEI 消息通过 EnhancerNN 神经网络对 GFV 生成的人脸画面进行后处理增强。其工作流程包括:
- 从关联的 GFV SEI 消息获取生成的人脸画面
- 提取基础画面和生成画面作为 EnhancerNN 的输入张量
- 将矩阵参数和瞳孔坐标等增强参数作为辅助输入
- 执行增强网络,输出提升后的人脸画面
GEFV 引入了瞳孔坐标 (gefv_pupil_coordinate_present_idx) 这一精细参数,支持左眼、右眼或双眼的瞳孔位置信令,为人脸动画的细节增强提供了额外控制维度。
技术意义:GFV/GEFV 的核心思路是:与其传输高码率的人脸视频像素,不如传输低码率的面部参数 + 神经网络模型,在解码端通过生成式 AI 重建画面。这一范式如果成熟,可能从根本上改变人脸视频的编码方式------从"压缩像素"到"压缩语义 + 生成像素"。
6. 数字签名内容 (DSC) --- 比特流级别的来源验证
DSC (Digitally Signed Content) 由三条 SEI 消息组成,形成完整的比特流内容来源验证体系:
DSCI --- 初始化
- 携带数字证书引用,标识内容提供者身份
- 指定安全哈希算法 (SHA-1 到 SHA-512/256)
- 定义验证周期 (verification period)
- 支持图像分段签名模式
- 必须出现在每个 IRAP 或 GDR AU 中
DSCS --- 选择
- 选择哪些 NAL 单元参与验证
- 区分 VCL 和 non-VCL NAL 单元
- 支持多个验证子流 (verification substream)
- 将图像划分为可验证的段
DSCV --- 验证
- 携带数字签名
- 基于 DSCI 指定的哈希算法计算消息摘要
- 允许接收端验证内容来源和完整性
- 支持一个或多个验证系统并行使用
支持的哈希算法
| 值 | 算法 | 块大小 (bits) | 摘要大小 (bits) |
|---|---|---|---|
| 0 | SHA-1 | 512 | 160 |
| 1 | SHA-224 | 512 | 224 |
| 2 | SHA-256 | 512 | 256 |
| 3 | SHA-384 | 1024 | 384 |
| 4 | SHA-512 | 1024 | 512 |
| 5 | SHA-512/224 | 1024 | 224 |
| 6 | SHA-512/256 | 1024 | 256 |
验证周期与子流
DSC 引入了"验证周期"概念------从一条 DSCI 消息到下一条相同 dsci_id 的 DSCI 消息之间的 AU 序列。在此周期内:
- DSCI 必须出现在每个 IRAP 或 GDR AU 中,且位于所有验证包含 NAL 单元之前。
- DSCS 指定哪些 NAL 单元属于验证子流,支持按图像段 (picture segment) 划分。
- DSCV 携带数字签名,与 DSCI 中的哈希算法配合验证。
- 当 CVS 包含多个不同
dsci_id的 DSCI 时,每个 ID 定义独立的验证系统,可并行使用。
这套机制使视频内容能够像文档数字签名一样被验证来源和完整性,适用于版权保护、证据链保全、内容认证等场景。
7. 编码器优化信息 (EOI) --- 人机协同编码的元数据
EOI (Encoder Optimization Information) SEI 消息解决了视频编码领域一个日益重要的问题:随着视频越来越多地被机器"观看"(AI 检测、识别、分析),编码器需要告知解码端这段视频究竟是为谁优化的。
7.1 观看目标标识
EOI 通过两个独立字段区分优化目标:
| 字段 | 值 | 含义 |
|---|---|---|
eoi_for_human_viewing_idc |
3 | 已为人观做了优化 |
| 2 | 适合人观但未特意优化 | |
| 1 | 不适合人观 | |
| 0 | 是否适合人观未知 | |
eoi_for_machine_analysis_idc |
3 | 已为机器分析做了优化 |
| 2 | 适合机器分析但未特意优化 | |
| 1 | 不适合机器分析 | |
| 0 | 是否适合机器分析未知 |
一致性约束 :
eoi_for_human_viewing_idc和eoi_for_machine_analysis_idc不得同时为 1(即不得同时声明"不适合人观"且"不适合机器分析"),否则比特流不一致。
7.2 优化类型
通过 eoi_type 位掩码可同时标识多种已应用的优化类型:
| 位掩码 | 优化类型 | 说明 |
|---|---|---|
0x01 |
对象优化 | 检测到的对象区域相比其他区域做了差异化优化 |
0x02 |
时间重采样 | 帧率调整(子采样或插帧) |
0x04 |
空间重采样 | 分辨率调整 |
0x08 |
时间质量优化 | 质量随时间波动 |
0x10 |
空间质量优化 | 降噪、去除斑点等画面级质量改善 |
0x20 |
隐私保护优化 | 去除或替换个人身份信息 |
0x40 |
亮度自适应 | 调整平均亮度以节省显示能耗 |
7.3 对象优化的细分
当对象优化被启用时,eoi_object_based_idc 进一步描述了对象区域之外的处理方式:
| 位掩码 | 对象外区域的处理 |
|---|---|
0x01 |
模糊处理 |
0x02 |
使用更粗的量化参数编码 |
0x04 |
覆盖为常量采样值 |
0x08 |
以非常量方式覆盖 |
0x10 |
按对象大小差异化处理 |
7.4 隐私保护元数据
当隐私保护优化被启用时,EOI 可进一步声明:
保护方法 (eoi_privacy_protection_method_idc):
| 位掩码 | 保护方法 |
|---|---|
0x01 |
模糊:使个人信息区域不可识别或难以识别 |
0x02 |
替换:用不同于原始内容替换个人信息区域 |
0x04 |
遮罩:遮盖个人信息区域 |
0x08 |
像素化:修改个人信息区域的像素大小 |
受保护信息类型 (eoi_privacy_info_type):
| 位掩码 | 受保护信息类型 |
|---|---|
0x01 |
身份信息(如人脸) |
0x02 |
车辆信息(如车牌) |
0x04 |
可推断位置的信息(如路牌文字) |
这些元数据使下游系统能理解隐私保护的处理方式,而非仅从画面中猜测。
8. 物体掩码信息 (OMI) --- 从像素到语义的桥梁
OMI (Object Mask Information) SEI 消息将物体掩码 (object mask) 数据嵌入比特流,与主层 (primary layer) 关联。当 OMI 存在时,规范期望同时存在 SDI (Scalability Dimension Information) SEI 消息且 sdi_aux_id[i] 等于 AUX_OBJECT_MASK。
这意味着 OMI 设计为通过可伸缩编码 (scalable coding) 的辅助层 (auxiliary layer) 传输物体掩码------主层包含视频内容,辅助层包含对应的二值化掩码,标识哪些像素属于被追踪的物体。
应用场景:OMI 为机器视觉任务提供了比特流内建的语义标注:自动驾驶视频可标注行人/车辆区域,监控视频可标注入侵物体,AI 分析系统可直接从比特流获取物体位置而非通过额外推理。这代表了视频编码标准从"为人眼编码"向"为人眼 + 机器编码"的范式扩展。
9. SEI 处理链 (SPO/PON) --- 里程碑式的架构创新
SPO (SEI Processing Order) 和 PON (Processing Order Nesting) 是 V4 中架构层面最重要的创新。在 V4 之前,多条 SEI 消息的处理顺序是隐式的,依赖实现约定。SPO/PON 将处理顺序显式化、可嵌套化。
9.1 SPO --- 处理链定义
SPO SEI 消息定义了一个有序的 SEI 消息处理链:
- 通过
po_id标识一个处理链 - 通过
po_sei_payload_type[]列出处理链中各 SEI 消息的 payloadType - 通过
po_sei_processing_order[]指定每条 SEI 消息的执行顺序 - 通过
po_sei_importance_flag[]和po_sei_processing_degree_flag[]进一步控制每步的处理重要性和程度 - 处理链定义在 CLVS (Coded Layer Video Sequence) 范围内持续有效
9.2 PON --- 处理链嵌套
PON SEI 消息允许将多个 SPO 定义的处理链进行嵌套:
- 一个 PON 可关联多个 SPO(通过
pon_num_po_ids_minus1指定数量) - 使一个处理链的输出成为另一个处理链的输入
- 支持 NNPFA 消息在嵌套环境中的输入画面位移 (
nnpfa_num_input_pic_shift_minus1)
9.3 处理链示例
// 典型处理链示例
Processing Chain 1 (SPO, po_id=0):
Step 1: NNPFC (神经网络后滤波特性) - 定义后滤波模型
Step 2: NNPFA (神经网络后滤波激活) - 应用后滤波
Step 3: AURR (AI 使用限制) - 限制后处理输出的 AI 使用
Processing Chain 2 (SPO, po_id=1):
Step 1: GFV (生成式人脸视频) - 生成人脸画面
Step 2: GEFV (增强型生成人脸视频) - 增强人脸画面
// PON 嵌套两个链
PON: [Chain 1] -> [Chain 2]
先应用 NN 后滤波,再在滤波后的画面上执行 GFV 生成
AURR 在处理链中的位置有特殊语义:当 AURR 位于处理链末端时,限制适用于处理链的输出;当 AURR 被包含在 PON 中时,限制适用于嵌套处理后的最终输出。这使内容创建者能精确控制 AI 限制的应用范围。
10. 源图像时序信息 (SPTI) --- 编码前时间的忠实记录
SPTI (Source Picture Timing Information) SEI 消息记录了编码前源图像之间的真实时间间隔。对于摄像机捕获内容,这是图像传感器曝光产生连续源画面之间的时间差。
时序类型
通过 spti_source_type 位掩码,SPTI 可标识 8 种时序关系:
| 位掩码 | 时序类型 | 说明 |
|---|---|---|
0x01 |
慢动作 | 源画面间隔 < 解码输出间隔 |
0x02 |
加速动作 | 源画面间隔 > 解码输出间隔 |
0x04 |
高速摄影 | 源画面间隔 < 1/120 秒 |
0x08 |
延时摄影 | 源画面间隔 > 1.001/24 秒 |
0x10 |
时间反转 | 解码画面按时间逆序输出 |
0x20 |
静止/冻结帧 | 源画面间隔为 0 |
0x40 |
间歇或事件驱动 | 源画面间隔非常数 |
0x80 |
保留 | --- |
SPTI 与帧打包排列 SEI 和帧场信息 SEI 有交互规则:当帧打包为时间交错 (type 5) 时,SPTI 分别适用于每个组成画面;当存在帧场信息时,SPTI 仅适用于 ffi_duplicate_flag 为 0 的画面,且对顶场和底场分别适用。
11. 模态信息 (MI) --- 超越可见光
MI (Modality Information) SEI 消息标识画面来源的电磁辐射类型,支持非可见光成像场景:
| 值 | 模态类型 |
|---|---|
| 0 | 未指定或通过其他方式确定 |
| 1 | 可见光画面 |
| 2 | 红外画面 |
| 3 | 紫外画面 |
| 4-31 | 保留 |
当模态为红外 (2) 或紫外 (3) 时,规范要求解码端忽略 VUI 中的 vui_colour_primaries、vui_transfer_characteristics 和 vui_matrix_coefficients------因为这些色彩参数对非可见光画面无意义。
MI 还可选地携带电磁波波长范围信息,通过指数-尾数 (mantissa-exponent) 浮点编码指定最小波长:
MinWavelength = mi_min_wavelength_mantissa * 10^(mi_min_wavelength_exponent_plus15 - 15)
这一 SEI 消息使视频编码标准能覆盖安防监控(红外夜视)、工业检测(紫外)、医学成像等专业领域。
12. 文本描述信息 (TDI) --- 比特流中的版权与标记
TDI (Text Description Information) SEI 消息提供关于画面的文本描述,支持以下 7 种用途:
| 值 | 用途 |
|---|---|
| 0 | 应用自定义 |
| 1 | 版权信息 |
| 2 | AI 标记信息 |
| 3 | 一般评论信息 |
| 4 | 内容分级信息(符合美国/加拿大 RRT) |
| 5 | Tag URI(标识比特流所属) |
| 6 | 编码器描述 |
| 7-255 | 保留 |
值得注意的是,值 2 ("AI 标记信息") 的存在表明 V4 将 AI 相关元数据提升到了与版权和内容分级同等的基础设施级别。结合 AURR 和 GFV/GEFV,H.274 V4 形成了从"标记 AI 生成内容"到"限制 AI 使用"再到"内建 AI 生成能力"的完整 AI 元数据体系。
13. 图像格式元数据 (IFM) --- EXIF/XMP/ICC 内嵌
IFM (Image Format Metadata) SEI 消息将传统静态图像的元数据格式嵌入视频比特流,支持 7 种元数据类型:
| 值 | 元数据类型 | 参考标准 |
|---|---|---|
| 0 | EXIF 属性信息 | CIPA-DC-008-2023 |
| 1 | JFIF 元数据(JFIF 段) | ITU-T T.871 / ISO/IEC 10918-5 |
| 2 | JFIF 扩展标记 | ITU-T T.871 / ISO/IEC 10918-5 |
| 3 | 图像起始后的首个 JFIF 标记 | ITU-T T.871 / ISO/IEC 10918-5 |
| 4 | XMP 元数据 (XML 或 JSON-LD) | ISO 16684-1 / ISO 16684-3 |
| 5 | ICC 色彩配置文件 | ISO 15076-1 / ISO 20677 |
| 6 | TIFF/EP 结构 | ISO 12234-2 |
IFM 支持两种携带方式:直接内嵌 (ifm_data_payload_byte) 或通过 URI 引用 (ifm_data_uri)。对于超过 131,072 字节的大型元数据(如完整 ICC 配置文件),规范建议使用 URI 引用而非内嵌。
对于 ICC 配置文件 (type 5),IFM 还标识了 ICC 主版本号和次版本号,支持从 profile 4.2 到 profile 5.0 的多个 ICC 版本。
14. 打包区域信息 (PRI) --- 多层画面合成指引
PRI (Packed Regions Information) SEI 消息描述了一个或多个层中编码画面的矩形区域如何被打包,使接收端能从裁剪解码画面中重建目标画面。
关键语法元素包括:
pri_num_regions_minus1:区域数量pri_use_max_dimensions_flag:是否使用最大维度pri_region_size_len_minus1:区域尺寸字段位宽pri_region_id_present_flag:是否携带区域 IDpri_target_pic_params_present_flag:是否携带目标画面参数
PRI 与 V2 引入的标注区域 (AR) SEI 消息不同:AR 标注画面中的感兴趣区域供应用层使用,PRI 则用于画面重建------将多个区域从解码画面中提取并拼装成目标画面,适用于多画面合成、子画面提取等场景。
15. 三项既有 SEI 扩展
V4 除了新增 15 类 SEI 消息外,还对 3 项既有 SEI 消息进行了功能扩展:
15.1 胶片颗粒特性 (Film Grain Characteristics) 扩展
V1 引入的胶片颗粒模拟 SEI 在 V4 中获得了扩展,增强了电影质感模拟的参数表达能力和精度。
15.2 神经网络后滤波特性 (NNPFC) 扩展
V3 引入的 NNPFC 在 V4 中扩展了神经网络模型的描述能力,新增输入/输出顺序标识 (nnpfc_inp_order_idc、nnpfc_out_order_idc)、填充类型 (nnpfc_padding_type) 等,使后滤波神经网络能处理更复杂的输入输出配置。
15.3 神经网络后滤波激活 (NNPFA) 扩展
NNPFA 扩展了激活机制,新增输入画面位移 (nnpfa_num_input_pic_shift_minus1) 支持,允许在候选输入画面列表中选择特定画面作为 NNPF 输入,特别适用于与 SPO/PON 处理链集成的场景。
16. 行业影响与趋势展望
V4 新增 SEI 技术影响力评估
从社会影响、技术前沿性、落地可行性、标准化程度、生态依赖度五个维度评估六类关键新增 SEI 消息:
社会影响
100
|
| AURR ████████████████
|
生态依赖 ──+── 技术前沿
| GFV ████████████
| EOI ████████████████
| OMI ████████
| DSC ████████████
| SPO/PON ██████
|
标准化程度 落地可行性
| SEI 消息 | 社会影响 | 技术前沿 | 落地可行性 | 标准化程度 | 生态依赖 | 一句话评价 |
|---|---|---|---|---|---|---|
| AURR | ★★★★★ | ★★★ | ★★★★ | ★★★★★ | ★★★ | 社会影响最高,标准化程度高 |
| GFV | ★★★ | ★★★★★ | ★★ | ★★★ | ★★★★ | 技术前沿性最强,落地待验证 |
| DSC | ★★★★ | ★★★ | ★★★ | ★★★★★ | ★★★★★ | 标准化程度高,生态依赖度高 |
| EOI | ★★★ | ★★★ | ★★★★★ | ★★★★★ | ★★ | 落地可行性最高,实现简单 |
| OMI | ★★★ | ★★★★ | ★★★ | ★★★★ | ★★★ | 语义丰富但编码开销大 |
| SPO/PON | ★★ | ★★★★ | ★★★ | ★★★★★ | ★★★★ | 架构完善,普及依赖生态 |
信号一:AI 治理进入编码标准
AURR SEI 消息的出现标志着 AI 内容治理从"平台政策"层下沉到"编码标准"层。内容创建者可以在比特流中直接声明 AI 使用限制,而非依赖平台的内容使用条款。虽然 AURR 是"请求"而非"强制",但它为 AI 内容溯源和治理提供了标准化的元数据基础设施。结合 TDI 的 AI 标记信息 (值 2),H.274 V4 形成了"标记 AI 生成 → 限制 AI 使用"的完整链路。
信号二:生成式 AI 与视频编码融合
GFV/GEFV 将生成式神经网络模型参数嵌入比特流,代表了编码标准从"压缩已有内容"向"传输生成指令"的范式探索。虽然 GFV 目前聚焦于人脸视频这一特定场景,但其架构------SEI 携带参数 + 翻译网络 + 生成网络------具有向更广泛场景扩展的潜力。如果这一路径成熟,未来的视频编码可能不只是"压缩像素",而是"压缩语义 + 重建像素"。
信号三:内容溯源与安全验证
DSC 三消息体系使视频比特流具备了与 PDF 数字签名类似的来源验证能力。在深度伪造 (Deepfake) 和 AI 生成内容泛滥的时代,比特流级别的数字签名为内容真实性验证提供了技术底座,适用于新闻媒体、司法取证、版权保护等高信任场景。
信号四:机器视觉友好的编码
EOI 和 OMI 共同构成了"机器视觉友好编码"的元数据基础:EOI 告知解码端视频是否为机器分析做过优化以及做了哪些优化,OMI 直接在比特流中嵌入物体掩码。这意味着未来的视频编码标准不仅为"人眼"服务,也为"机器眼"服务------视频文件本身可以携带机器视觉任务所需的语义标注。
信号五:SEI 处理链的架构化
SPO/PON 将 SEI 消息的处理从"无序集合"升级为"有序处理链",这是 SEI 架构层面的里程碑。随着 V4 引入的 SEI 消息越来越多(累计约 45 类),且彼此之间存在处理依赖关系(如 NNPFC → NNPFA → AURR),显式定义处理顺序变得不可或缺。SPO/PON 为未来更复杂的 SEI 组合提供了架构基础。
结语
ITU-T H.274 (V4) 是 SEI 消息规范历史上最大规模的一次更新,其新增的 15 类 SEI 消息和 3 项扩展覆盖了 AI 治理、生成式视频、数字签名、编码器优化、机器视觉、处理链架构等全新领域。这些新增能力使视频编码标准从传统的"压缩 + 显示辅助"角色,扩展为"压缩 + AI + 安全 + 语义 + 治理"的多维元数据平台。
特别值得关注的是三大趋势的交汇:AURR/TDI 为 AI 内容治理提供基础设施,GFV/GEFV 将生成式 AI 引入编码流程,DSC 为内容真实性提供密码学验证。这三者共同构成了视频编码标准应对 AI 时代挑战的技术应答。
该规范由 JVET (Joint Video Experts Team) 开发,以 JVET-AR0041 文档编号在 JVET 第 44 次会议(2026 年 10 月,杭州)周期内推进。作为 ITU-T H.266 (VVC) 生态的关键配套规范,H.274 V4 的发布标志着视频编码元数据能力进入了一个全新的发展阶段。
本文基于 ITU-T H.274 (V4) 规范文档 (JVET-AR0041-v2) 撰写,仅供技术参考。规范版权归 ITU-T 和 ISO/IEC 所有,完整内容请参阅 ITU-T 官方出版物。