眼见不一定为实:WAIC 2026 探展合合信息,实测 AI 去反光 + AI 跨模态鉴伪两项黑科技

一、为什么这两项技术值得开发者关注

大模型正在从"能聊天"走向"能干活",无论是 Agent 自动读文档、还是多模态模型理解图片,前提都是输入信息本身要真、要清。但现实世界给 AI 的输入常常是"脏"的:

  • 隔着玻璃拍下的证件、展品,反光把关键信息直接"吞"掉;

  • 社交平台、聊天记录里流转的图片和视频,有相当比例已经被 AI 编辑或生成,肉眼很难分辨;

  • 生成式 AI 写出来的文本越来越接近真人表达,传统的"查重"逻辑基本失效。

这正是 WAIC 2026 上合合信息"用 AI 洞悉文海万象"展台想回答的两个具体问题:图像看不清怎么办,内容真假辨不清怎么办。前者对应"智能高清·去反光",后者对应 AI 跨模态鉴伪技术。两者背后都是合合信息在多模态文本智能领域的技术积累,一个刚拿下 CVPR 2026 NTIRE 国际赛道冠军,一个已经在金融、保险等强合规场景做到日均数十万条全量核验。下面分别展开。


二、AI 去反光技术:把"反光"从图像里干净地"减掉"

2.1 现场体验:隔着玻璃扫古画

展台核心装置是一座以宫灯为灵感设计的展示柜,柜内摆放着六件中华传世书画复刻本------《兰亭集序》《簪花仕女图》《瑞鹤图》《千里江山图》《清明上河图》《桃源仙境图》,涵盖书法、人物、花鸟、山水、风俗几大门类。装置特意使用了不同颜色和覆膜效果的玻璃增加干扰难度,观众用扫描全能王 App 隔玻璃扫描,AI 在几秒内自动剥离灯带投影、人影、背景杂物倒影等干扰层,还原画作本身的色彩与笔触细节。

下面是现场素材包里的实拍对比图(左:原始反光图,右:去反光后):

《千里江山图》复刻本:左侧原图能明显看到玻璃反射出的观众轮廓与灯带投影,青绿山水的渐变层次被大片白雾状反光覆盖;右侧处理后,石青、石绿颜料的渐变过渡清晰可辨,连远山与近景的墨线勾勒都重新"浮"了出来。

《簪花仕女图》复刻本 :左侧图中能看到两道明显的灯管反射光斑斜穿画面,仕女裙带的纹理几乎被光斑"切断";右侧处理后光斑完全消失,纱罗裙裾的层叠质感和仕女手中花枝的细节都得到保留。

这组对比图直观说明了去反光技术要解决的核心矛盾:反光区域往往意味着信息缺失,简单粗暴地"抹掉"反光容易连带丢失原图细节,处理不干净又会留下光斑残影。这也是这项技术在学术界被称为"高难度场景"的原因。

2.2 技术挑战:为什么反光去除比想象中难

单图像反光去除(Single Image Reflection Removal,SIRR)在计算机视觉里是个存在了十几年的经典难题,核心难点可以拆成三层:

第一层,反光是"叠加态",不是"遮挡"。 玻璃反光的成像模型通常被建模为 I = T + R(观测图像 = 透射层 + 反射层),两层图像在像素级别是线性叠加而非物理遮挡,模型必须先"分离"再"重建",而不是简单地检测一个区域再打码抹除。

第二层,真实场景里反光形态高度多样。 展台装置故意用了不同颜色、不同覆膜的玻璃就是在模拟这一点------灯光角度、玻璃材质、拍摄距离都会让反光呈现完全不同的强度、色彩和形状,一个只在实验室采集的"干净"数据集上训练的模型,遇到真实场景往往泛化能力很差。

第三层,"去反光"和"保细节"是一对天然矛盾。 传统方法为了彻底去掉反光痕迹,容易连带模糊掉透射层本身的纹理和色彩细节,这也是行业公开评价里"传统去反光方法容易造成细节模糊、画质下降"的由来。

针对第三点,合合信息给出的解法是官方介绍中提到的"高保真还原"技术方案:先对反光区域(光斑、倒影、投影)做精准定位,再结合画面本身的线条走向、背景纹理规律和色彩分布特征,对反光造成的信息缺失区域做智能补全,而不是简单地做模糊平滑。这也是文中反复强调的一点------这是"复原",不是"生成":模型补全的依据是原图残留的像素证据和材质规律,目标是让观众看到画作本来的样子,而非凭空创造一幅新画。

2.3 RdNafNet 的两阶段级联架构

更值得展开的是CVPR2026 NTIRE挑战赛技术报告里的公开披露------论文附录显示,夺冠团队"RRay"的成员署名邮箱域名正是合合信息(Intsig Information)的企业邮箱,这意味着报告里公开的架构图,就是合合信息本次夺冠方案的官方技术披露,而不是外部参考资料。

报告里的 Figure 6(RdNafNet 架构总览图) 显示,这是一个两阶段级联 的设计思路:团队观察到单阶段模型虽然能去掉明显的反光,但反光原本覆盖的区域会伴随细节丢失;于是把整个还原过程拆成两段------第一阶段用 RDNet 作为骨干网络 ,专门负责把输入图像里可见的反光"打掉",输出一张反光已消除但细节还比较粗糙的中间结果;第二阶段换用 NAFNet 作为骨干网络 ,专门针对这张中间结果做更精细的图像修复,把第一阶段处理时可能损失的纹理、色彩细节补回来。这个"先去反光、再修细节"的分工设计,跟前文提到的"高保真还原"思路是同一个工程逻辑:把"消除干扰"和"恢复细节"拆成两个独立目标分别优化,而不是让一个模型同时兼顾两件互相拮抗的任务

2.4 落地能力:更广、更真

从展会现场到公开资料,扫描全能王"智能高清·去反光"被总结为三个核心优势:

  • 更广:模型具备较强的图像理解能力,能应对玻璃、白板、证件塑封膜、自然环境拍摄等多种材质下的深度交织、透明度变化、色彩干扰等复杂情况,不是只针对单一材质调优的"窄场景"模型;

  • 更真:前面提到的"高保真还原"方案,在反光造成信息部分缺失的情况下依然尽量保留原图纹理细节,让处理结果经得起放大细看。

2.5 应用场景:从博物馆到产线

这项技术的价值不止于"扫古画"这种展示级场景。据现场介绍,它已经能覆盖三类典型日常/产业场景:

  1. 文化记录与保护:玻璃相框里的老照片、橱窗艺术海报、展板文字图像,一键去除光线干扰,降低"看清"这一基础动作的门槛;

  2. 证件与文档采集:塑封证件、玻璃展示柜内票据在拍摄时天然存在反光干扰,去反光技术能显著提升后续 OCR 识别与信息提取的准确率;

  3. 产业级视觉感知:车载感知、安防监控、工业质检等领域,反光是影响视觉算法稳定性的常见噪声源,相关算法思路也为这类场景提供了创新参考。

对开发者而言,一个直观的类比是:如果说过去做图像预处理还要依赖偏振镜头、专业布光这类硬件手段,那么这类 AI 算法本质上是把"物理层面的降噪"迁移到了"算法层面",用普惠的方式把一项专业能力装进了手机摄像头。


三、AI 跨模态鉴伪技术:与 AI 伪造的"魔法对轰"

3.1 为什么现在需要跨模态鉴伪

世界经济论坛《Global Risks Report 2026》把"错误信息与虚假信息"列为未来两年全球第二大风险,报告特别指出深度伪造和 AI 生成的错误、虚假信息正在扩散。这不是危言耸听------当 Midjourney、ChatGPT、Gemini 这类主流大模型的生成质量肉眼已经很难分辨真伪时,"眼见为实"这句老话正在失效。

WAIC 现场,合合信息把这种"失效"做成了一场互动游戏------"AI 较真大赛"。挑战内容包括转账截图、社交媒体人像照片、萌宠视频、学术论文等真实生活场景素材,玩家需要在多组素材中找出唯一真实的一张。下面是现场实拍的两个关卡:

关卡 3「电信诈骗」:三张转账截图(转账回执、银行流水、退款记录)放在一起做真伪判断,界面设计模拟了真实诈骗话术场景中常见的转账/退款截图形式。

关卡 4「电商仅退款」:这一关我选错了------系统提示 MISS,判定我选择的图片其实是伪造的,AIGC 置信度高达 91.90%,鉴定依据栏标注了" "透视与拓扑畸变检测" 、底层伪号与频域级检测、语义与结构级检测"等多个维度。这也印证了官方现场反馈:"一张看似普通的支付转账截图,金额却被 AI 悄然篡改,让不少观众直呼'看走眼'"。

亲测下来,这个小游戏的价值不只是娱乐------它用最直接的"猜错了"体验,让人意识到自己对 AI 伪造内容的辨别能力有多脆弱,这恰好也是这项技术要解决的核心问题:人眼的判断力正在被 AI 生成内容的进化速度甩开,需要一套系统性的、跨模态的可信鉴别体系来补位

3.2 技术解析:三条介质各有各的"破绽"

本届 WAIC 上,合合信息把 AI 跨模态鉴伪的覆盖范围从此前的图像、人脸视频,进一步拓展到图片、视频、文本三大主要信息介质,应用场景也从银行、保险等专业合规风控场景,扩大到社交聊天、图文资讯、电商交易、短视频、学术研究等更泛化的大众场景。三类介质分别有独立的检测逻辑:

图像鉴伪 :核心思路是对图像底层特征做深度分析,覆盖 AI 生成、AI 编辑、人工伪造(PS)等多种伪造类型。以图像鉴伪领域公认的高难度场景"图生图"为例(即用一张已有图片作为参照再生成新图,痕迹比"文生图"更隐蔽),技术方案综合捕捉图像的频谱细节高层语义:一方面分析图像语义信息是否自洽,另一方面捕捉频域伪影(生成模型上采样过程留下的高频规律性痕迹)、建模噪声分布异常,多重证据交叉验证判断图片是否来自 AI 模型生成或篡改。

展台上提供了互动性关卡,让大家去肉眼分辨图片是否为AI生成。

视频鉴伪:官方采用"动静结合"的检测策略。动态维度上依托视频时序信息、运动规律、时空频域特征、传感器噪声等检测方式,捕捉帧间物体抖动、运动轨迹异常、时空网格伪影这类典型的 AI 生成漏洞;静态维度则结合单帧画面的图像语义和频谱伪影特征做交叉验证。这也是现场展示中"新闻视频中人物口型细微异常引发观众反复讨论"的技术支撑所在。

现场报道里提到的那段新闻视频是个很典型的样本------伪造痕迹不在某一帧的画质瑕疵上,而在于人物开口说话时,口型变化的节奏和语音对不上,观众要反复回放好几遍才能确认"哪里不对"。这恰恰是"动静结合"策略里"动态维度"要抓的东西:单看一帧画面完全正常,问题只在多帧之间的运动轨迹和时序规律里才会暴露。公开材料里没有披露这段视频的具体判定置信度,但从报道描述看,系统给出判断依据用的正是帧间运动异常这条线索,而不是靠单帧画质"挑错处"。

生成式 AI 文本鉴定 :这是三条路径里最容易被低估、也最考验技术深度的一条。传统文本鉴伪多依赖词频、句长等表层统计特征,很容易被"同义词改写"、"提示词伪装"等手段绕过。合合信息的方案思路是从"统计表象"深入"语义深层"------预判模型生成文字过程中偏好的高概率表达形式,进而找出 AI 文本与人类写作在深层语义连贯性、句法结构微小畸变、高维逻辑表征上的本质差异。相比"猜词概率",这种思路更接近对语言模型生成机制本身的建模。

对这套跨模态鉴伪思路背后可能涉及的学术脉络感兴趣的开发者,可以参考两个方向不同但都值得深挖的公开项目(同样是学术参考资料,非公司技术原理):

  • FakeShield(ICLR 2025):一个可解释的图像伪造检测与定位框架,核心思路是引入多模态大模型,不仅判断图像"是不是假的",还能给出篡改区域的掩码和基于像素级伪影、语义不一致的人类可读解释,解决了传统鉴伪模型"黑盒判断、说不清为什么"的痛点,覆盖拼接、复制粘贴、去除、DeepFake、AIGC 编辑等多种伪造类型;

  • AIDE(ICLR 2025):论文标题直译是"给 AI 生成图像检测做一次体检",作者构建了一个名为 Chameleon 的高难度基准数据集------里面的图片是能通过人眼"图灵测试"的、经过摄影师和 AI 艺术家精心调整的样本,结果发现现有主流检测器普遍把这些图判断成"真实"。这篇论文很有价值的一点在于验证了单一特征维度(比如只看语义或只看噪声)的检测方案泛化能力有限,因此提出结合 CLIP 语义特征与 DCT 频域分块特征的混合方案。这也从侧面说明了为什么跨模态、多维度证据交叉验证是鉴伪技术的必然演进方向。

3.3 落地成果:从专业风控到全民可用

技术指标之外,更值得关注的是落地规模。据现场介绍,合合信息 AIGC 鉴伪技术已在金融、保险、电商等多场景应用,仅图文鉴伪一项即可实现日均数十万条内容全量核验,逐步从传统的人工抽样审核模式过渡为全量自动核验,有效降低漏判、误判风险;在综合鉴定准确率上,公开信息显示已做到超过 98%。

更重要的变化是应用边界的扩大------从过去主要服务银行、保险这类专业合规场景,扩展到了普通人日常会遇到的社交聊天、电商交易、短视频分享等场景。这也是"**扫描全能王 AI 鉴伪小程序"**的定位:当你收到一张说不清真假的转账截图、看到一张有点"完美过头"的人像照片时,不再需要专业风控知识,打开小程序扫一下就能得到判断依据。


四、两项技术放在一起看:合合信息在解决什么问题

把去反光和跨模态鉴伪放在同一个展台展示并不是偶然。按现场技术负责人的说法,今年 WAIC 合合信息的展示围绕"看清、看透、看懂"形成了一条完整逻辑:"智能高清·去反光"解决图像"看清"的问题,跨模态鉴伪解决内容真实性"看透"的问题,二者共同指向同一个命题------大模型和 Agent 要在真实世界里做出可靠决策,前提是喂给它们的信息本身足够干净、足够可信。

对开发者来说,这两项技术分别对应了多模态 AI 应用落地时两类经常被低估的基础设施需求:输入质量治理 (去反光是其中一种典型的图像预处理)和内容可信度校验(鉴伪是内容安全链路的关键一环)。无论是在做企业级文档处理系统,还是在做面向 C 端的内容平台风控,这两类能力都值得纳入技术选型的考虑范围。


五、写在最后:亲自体验一下

如果你对文中提到的AI鉴伪能力感兴趣,可以打开"扫描全能王 AI 鉴伪小程序",上传一张图片、一段视频或一段文本,即可获得包含置信度和判定依据的检测结果,重点体验一下它跨图片、视频、文本三种介质的统一判断能力。

技术之外,更想分享的一个感受是:AI 的能力是双刃剑,它既能生成越来越逼真的虚假内容,也在同步进化出识别虚假内容的能力;它既可能因为反光、模糊这些"小毛病"丢失信息,也能反过来把这些信息干净地找回来。合合信息在 WAIC 现场展示的这两项技术,某种程度上正是这场"猫鼠游戏"里技术演进的一个缩影。

相关推荐
AvatarAI_Walker1 小时前
2026年7月安徽健康 IP 孵化:四家机构服务特点与场景关注方向梳理
大数据·人工智能·tcp/ip·精选
栋***t1 小时前
从“纸质试卷”到“AI智能组卷”,麦塔在线考试系统如何重构出题逻辑?
java·大数据·人工智能·算法·重构
不爱记笔记1 小时前
音视频转笔记工具横评2026,通义听悟、Ai好记、NotebookLM 实测对比
人工智能·笔记·ai·音视频·飞书·obsidian
Highcharts.js1 小时前
如何下载使用Highcharts Grid 开发web可编辑表格
前端·人工智能·grid 表格·web 表格·在线编辑表格·highcharts表格安装·表格开发工具
服装 AI 增长黑客2 小时前
AI落地服装店:从流量焦虑到经营闭环,哪些能力真实可用?
人工智能
weiwin1232 小时前
MAF 入门(7):在 MAF 中使用 RAG
人工智能
JuiceFS2 小时前
GPFS、Alluxio、JuiceFS 怎么选?一文看懂架构与适用场景
人工智能·后端
爱吃程序猿的喵2 小时前
LingBot-Map 复现与原理剖析:基于 Geometric Context Transformer 的流式 3D 重建
人工智能·python·深度学习·计算机视觉·3d·transformer
俊哥V2 小时前
每日 AI 研究简报 · 2026-07-23
人工智能·ai