《一种超分辨率重建方法和相关装置》专利解析

这篇专利(WO2021233008A1,申请人:腾讯)主要涉及基于人工智能的视频超分辨率重建技术 。与上一篇侧重于"端侧模型结构轻量化"的专利不同,这篇专利的核心痛点在于:传统的端到端AI超分模型在面对线上真实的复杂场景(如视频压缩伪影、不同内容类型)时,泛化能力差、画质不够理想

为此,该专利提出了一套 "AI模型初步重建 + 基于掩膜的精细化后处理" 的组合方案,并设计了一套高度模拟真实线上退化场景的模型训练方法

以下是该专利方法过程的详细解析,分为推理阶段(实际应用)训练阶段(模型学习) 两部分:


一、 推理阶段:视频超分重建过程(S201 - S205)

在实际播放视频时,系统通过以下五个步骤将低清视频转化为高清视频:

步骤 S201:获取低分辨率视频帧序列

获取需要处理的第一分辨率(低分辨率)的待处理视频帧序列。

步骤 S202:AI模型初步超分重建

将低分辨率视频帧输入到分辨率重建模型 (如基于EDSR和DRCN改进的轻量级网络)中,进行初步的超分辨率重建,得到第二分辨率的初始重建视频帧(SR图像)

  • 注:此时得到的SR图像虽然分辨率提高了,但可能还存在模糊、噪声或不符合特定场景视觉习惯的问题。
步骤 S203:残差分离确定"轮廓区域"与"平坦区域"(核心创新)

为了进行精细化的后处理,系统通过残差分离技术生成掩膜(Mask),将图像划分为需要增强的"轮廓区域"和需要去噪的"平坦区域"。具体过程如下:

  1. 生成混合残差:将 AI输出的SR图像 减去 传统双三次插值(Bicubic)放大的图像,得到混合残差。
  2. 生成高通残差:将 Bicubic放大图像 减去 经过高斯低通滤波(模糊)的图像,得到高通残差。
  3. 计算掩膜 :将上述两个残差相乘 。结果大于0的赋为1,得到高频掩膜 (代表轮廓/纹理区域);小于0的赋为1,得到低频掩膜(代表平坦/无纹理区域)。
步骤 S204:差异化后处理(轮廓增强 + 平坦去噪)

根据上一步得到的掩膜,对初始SR图像进行"因地制宜"的后处理,得到最终的目标重建视频帧

  • 对轮廓区域(高频) :乘以轮廓增强系数 α\alphaα
    • 场景自适应 :如果是动画/游戏视频(线条简单),α>1\alpha > 1α>1(增强锐度);如果是真人影视(过度锐化会显得突兀),α≤1\alpha \le 1α≤1(保持自然)。
  • 对平坦区域(低频) :乘以去噪系数 β\betaβ(如0.21),以抑制平坦区域(如天空、湖面)的噪声。
  • 最终融合:将处理后的轮廓、处理后的平坦区域,与Bicubic基底图像相加,输出最终高清画面。
步骤 S205:生成并播放高清视频序列

将处理后的目标视频帧按顺序组合,替换原低清视频帧进行播放。


二、 训练阶段:模型训练与数据集构造过程(S601 - S605)

为了让AI模型在"线上真实场景"中表现更好,该专利在训练数据构造上做了极具针对性的设计:

步骤 S601 - S602:模拟真实的"低清退化"过程(构造LR样本)

线上视频的低清不仅仅是因为分辨率低,还因为视频压缩带来的伪影和噪声

  • 系统对4K等高清原始视频进行双三次插值降采样
  • 同时,使用不同的固定码率系数(CRF,如20~35之间随机) 进行视频压缩处理,模拟线上真实的压缩失真和块效应。
  • 抽帧后得到低分辨率(LR)样本集
步骤 S603:模拟真实的"模糊退化"过程(构造HR标签)

由于真实的退化过程中"降采样"和"图像模糊"的先后顺序很难确认,为了方便训练,专利采用了一种巧妙的替代方案:

  • 不对LR样本做模糊处理,而是对原始的高清视频帧进行"轮廓增强处理"(如使用PS智能锐化)。
  • 这样相当于让模型在训练时,直接学习如何"无中生有"地恢复出更丰富的高频细节,赋予了模型轮廓增强的能力。由此得到高分辨率(HR)样本集
步骤 S604:剔除平坦区域,聚焦高频细节(构造训练集)

模型训练时,如果包含大量没有纹理的区域(如蓝天、纯色墙面),会浪费算力且干扰模型学习。

  • 系统对HR图像求边缘算子图(如Sobel/Laplacian算子)。
  • 设定阈值,将像素值极低的区域判定为平坦区域
  • 在裁剪训练Patch(如64x64)时,直接剔除包含平坦区域的图像块,只保留纹理细节丰富的部分用于训练,大幅提升模型对高频细节的学习效率。
步骤 S605:模型迭代训练

使用上述构造的"硬核"训练集,采用L1损失函数对初始模型进行训练,最终得到泛化能力极强的分辨率重建模型。


三、 专利技术优势总结

  1. 解决"AI味"与泛化差的问题
    传统的AI超分往往"一刀切",导致真人视频看起来有噪点或过于锐利。该专利通过残差分离掩膜,实现了**"该锐化的地方锐化(轮廓),该去噪的地方去噪(平坦)"**,并且可以根据视频类型(动漫vs真人)动态调整系数,画质更符合人眼主观感受。
  2. 极度贴近线上真实业务场景
    在训练数据中引入了视频压缩编码噪声(CRF) ,并在标签端使用PS锐化来补偿模糊退化,使得模型在实验室训练时就能"见多识广",直接部署到线上长视频/短视频APP中时,面对各种压缩伪影都能有极好的鲁棒性。
  3. 训练效率更高
    通过算子图剔除无纹理的平坦区域,让神经网络把宝贵的算力全部集中在"如何恢复复杂纹理"上,加快了模型收敛,提升了超分效果。
相关推荐
Luke Ewin16 分钟前
Qwen3-ASR藏语语音识别 | 少数民族(藏语|维吾尔语)语音识别 | 本地化部署藏语语音识别模型
人工智能·语音识别·asr·藏语asr
byte轻骑兵17 分钟前
【BlueZ 】蓝牙配对/绑定基础:BlueZ 中安全机制的入门级源码解析
linux·人工智能·bluez·电脑蓝牙·嵌入式蓝牙
飞哥数智坊17 分钟前
当下 Agent 缺少的,也许是读懂产物的能力
人工智能
新知图书19 分钟前
14.1 多模态试驾预约Agent系统概述
人工智能·agent·ai agent·智能体
哦哦~92121 分钟前
AI赋能CFD:从Fluent仿真到物理信息机器学习的智能流体工程实战
人工智能·机器学习·cfd·fluent
QH1392923188023 分钟前
R&S FSPN50 FSPN26 FSWP26 相位噪声分析仪典型应用案例
人工智能·百度·微信·集成测试·音视频·facebook·oneapi
用户52746756142124 分钟前
给 Agent 一份 package-lock:别让 Skill、MCP 和权限各自漂移
人工智能
2601_9676598924 分钟前
2026信创深化落地期档案管理系统选型推荐:恒智科技综合档案管理系统
数据库·人工智能·科技
学习星球29 分钟前
6G核心网架构深度解析——AI Native时代的网络变革
网络·人工智能·5g·架构·go·信息与通信