《一种超分辨率重建方法和相关装置》专利解析

这篇专利(WO2021233008A1,申请人:腾讯)主要涉及基于人工智能的视频超分辨率重建技术 。与上一篇侧重于"端侧模型结构轻量化"的专利不同,这篇专利的核心痛点在于:传统的端到端AI超分模型在面对线上真实的复杂场景(如视频压缩伪影、不同内容类型)时,泛化能力差、画质不够理想。

为此,该专利提出了一套 "AI模型初步重建 + 基于掩膜的精细化后处理" 的组合方案,并设计了一套高度模拟真实线上退化场景的模型训练方法。

以下是该专利方法过程的详细解析,分为推理阶段(实际应用) 和训练阶段(模型学习) 两部分:


一、 推理阶段:视频超分重建过程(S201 - S205)

在实际播放视频时,系统通过以下五个步骤将低清视频转化为高清视频:

步骤 S201:获取低分辨率视频帧序列

获取需要处理的第一分辨率(低分辨率)的待处理视频帧序列。

步骤 S202:AI模型初步超分重建

将低分辨率视频帧输入到分辨率重建模型 (如基于EDSR和DRCN改进的轻量级网络)中,进行初步的超分辨率重建,得到第二分辨率的初始重建视频帧(SR图像)。

  • 注:此时得到的SR图像虽然分辨率提高了,但可能还存在模糊、噪声或不符合特定场景视觉习惯的问题。
步骤 S203:残差分离确定"轮廓区域"与"平坦区域"(核心创新)

为了进行精细化的后处理,系统通过残差分离技术生成掩膜(Mask),将图像划分为需要增强的"轮廓区域"和需要去噪的"平坦区域"。具体过程如下:

  1. 生成混合残差:将 AI输出的SR图像 减去 传统双三次插值(Bicubic)放大的图像,得到混合残差。
  2. 生成高通残差:将 Bicubic放大图像 减去 经过高斯低通滤波(模糊)的图像,得到高通残差。
  3. 计算掩膜 :将上述两个残差相乘 。结果大于0的赋为1,得到高频掩膜 (代表轮廓/纹理区域);小于0的赋为1,得到低频掩膜(代表平坦/无纹理区域)。
步骤 S204:差异化后处理(轮廓增强 + 平坦去噪)

根据上一步得到的掩膜,对初始SR图像进行"因地制宜"的后处理,得到最终的目标重建视频帧:

  • 对轮廓区域(高频) :乘以轮廓增强系数 α\alphaα 。
    • 场景自适应 :如果是动画/游戏视频(线条简单),α>1\alpha > 1α>1(增强锐度);如果是真人影视(过度锐化会显得突兀),α≤1\alpha \le 1α≤1(保持自然)。
  • 对平坦区域(低频) :乘以去噪系数 β\betaβ(如0.21),以抑制平坦区域(如天空、湖面)的噪声。
  • 最终融合:将处理后的轮廓、处理后的平坦区域,与Bicubic基底图像相加,输出最终高清画面。
步骤 S205:生成并播放高清视频序列

将处理后的目标视频帧按顺序组合,替换原低清视频帧进行播放。


二、 训练阶段:模型训练与数据集构造过程(S601 - S605)

为了让AI模型在"线上真实场景"中表现更好,该专利在训练数据构造上做了极具针对性的设计:

步骤 S601 - S602:模拟真实的"低清退化"过程(构造LR样本)

线上视频的低清不仅仅是因为分辨率低,还因为视频压缩带来的伪影和噪声。

  • 系统对4K等高清原始视频进行双三次插值降采样。
  • 同时,使用不同的固定码率系数(CRF,如20~35之间随机) 进行视频压缩处理,模拟线上真实的压缩失真和块效应。
  • 抽帧后得到低分辨率(LR)样本集。
步骤 S603:模拟真实的"模糊退化"过程(构造HR标签)

由于真实的退化过程中"降采样"和"图像模糊"的先后顺序很难确认,为了方便训练,专利采用了一种巧妙的替代方案:

  • 不对LR样本做模糊处理,而是对原始的高清视频帧进行"轮廓增强处理"(如使用PS智能锐化)。
  • 这样相当于让模型在训练时,直接学习如何"无中生有"地恢复出更丰富的高频细节,赋予了模型轮廓增强的能力。由此得到高分辨率(HR)样本集。
步骤 S604:剔除平坦区域,聚焦高频细节(构造训练集)

模型训练时,如果包含大量没有纹理的区域(如蓝天、纯色墙面),会浪费算力且干扰模型学习。

  • 系统对HR图像求边缘算子图(如Sobel/Laplacian算子)。
  • 设定阈值,将像素值极低的区域判定为平坦区域。
  • 在裁剪训练Patch(如64x64)时,直接剔除包含平坦区域的图像块,只保留纹理细节丰富的部分用于训练,大幅提升模型对高频细节的学习效率。
步骤 S605:模型迭代训练

使用上述构造的"硬核"训练集,采用L1损失函数对初始模型进行训练,最终得到泛化能力极强的分辨率重建模型。


三、 专利技术优势总结

  1. 解决"AI味"与泛化差的问题 :
    传统的AI超分往往"一刀切",导致真人视频看起来有噪点或过于锐利。该专利通过残差分离掩膜,实现了**"该锐化的地方锐化(轮廓),该去噪的地方去噪(平坦)"**,并且可以根据视频类型(动漫vs真人)动态调整系数,画质更符合人眼主观感受。
  2. 极度贴近线上真实业务场景 :
    在训练数据中引入了视频压缩编码噪声(CRF) ,并在标签端使用PS锐化来补偿模糊退化,使得模型在实验室训练时就能"见多识广",直接部署到线上长视频/短视频APP中时,面对各种压缩伪影都能有极好的鲁棒性。
  3. 训练效率更高 :
    通过算子图剔除无纹理的平坦区域,让神经网络把宝贵的算力全部集中在"如何恢复复杂纹理"上,加快了模型收敛,提升了超分效果。
相关推荐
思无邪6614 分钟前
用 AI 做 JS 逆向:从抓包到复现的完整方法论
开发语言·javascript·人工智能
KeyAction666632 分钟前
AI改写战争规则,也在改写商业规则:体系对抗时代已经到来
大数据·人工智能
小蒋观天下36 分钟前
专项方案:大场景港口AI安防、多干扰环境下的算法调优与落地实操
人工智能·深度学习·算法·安全·机器学习·计算机视觉·ai大模型
冬奇Lab37 分钟前
一天一个开源项目(第231篇):MiniMind —— 花3块钱、2小时,从零训练一个 64M 参数的大语言模型
人工智能·开源·资讯
揽秀亭长43 分钟前
视频转脚本有哪些方法?5种方案技术拆解
人工智能·音视频
冬奇Lab43 分钟前
LLM 驱动的自动化测试系列(07):移动端自动化(三)——Mobile-Agent-v3 与自研 GUI-Owl 模型路线
android·人工智能·测试
乃嘿仔44 分钟前
AI 热点日报 · 2026-10-08
人工智能·chatgpt
Qyr9944 分钟前
2026年全球二极管模组行业市场规模全景研判:竞争格局与发展趋势全解析
大数据·人工智能
weixin_177297220691 小时前
从零搭建企业AI知识库:系统架构与核心模块拆解
人工智能·系统架构
IT大白鼠1 小时前
DeepSeek Harness 详解开源插件化 AI Agent 运行时:架构、模式、安装与生态
人工智能·架构·开源