⭐CVPR2025 AKiRa:让视频生成玩转相机光学的黑科技[特殊字符]

📄论文题目:AKiRa: Augmentation Kit on Rays for optical video generation

✍️作者及机构:Xi Wang、Robin Courant、Marc Christie、Vicky Kalogeiton(法国巴黎综合理工学院、雷恩大学等)

🧩面临问题:当前文本条件视频扩散模型虽提升了视频质量,但在相机控制方面存在明显局限。多数方法仅简化考虑相机运动,忽略焦距(缩放)、镜头畸变(鱼眼效果)、光圈和焦点(景深)等关键光学参数1。同时,缺乏含丰富光学信息的训练数据,导致生成内容光学一致性不足,难以实现电影级叙事效果2。

🎯创新点及其具体研究方法:

1️⃣ 提出首个光学视频生成框架:实现对相机运动及光学参数(焦距、畸变、光圈等)的精细控制,可生成缩放、鱼眼、景深等复杂电影级效果3。方法上,在预训练视频生成骨干网络基础上,训练相机适配器,将光学参数整合到生成 pipeline 中,使模型直接利用相机和光学参数生成内容4。

2️⃣ 设计含光学参数的相机模型表示:基于 Plücker 坐标构建光线表示(方向和矩),编码焦距和镜头畸变信息;新增光圈图,关联每个像素与焦点的距离,建模景深效果,形成 9 维相机映射匹配视频帧维度56。

3️⃣ 提出 AKiRa 光线增强工具包:通过数据增强解决光学训练数据缺失问题。包括焦距增强(模拟缩放,区分于前后移动)、畸变增强(调整径向畸变系数并优化裁剪防黑边)、光圈增强(基于深度估计渲染景深效果),同时采用样条插值确保参数平滑过渡,避免闪烁78。

#CVPR 顶会 #视频生成 #计算机视觉 #深度学习 #相机控制 #光学视频生成 #AI 动画


相关推荐
deephub8 小时前
告别脆弱的单体应用,用多智能体网络构建稳定的生产力工具
人工智能·python·大语言模型·多智能体
烟雨江南aabb8 小时前
Python第六弹:python爬虫篇:什么是爬虫
开发语言·爬虫·python
DogDaoDao8 小时前
【AI Agent 深度解析】OpenHuman 开源项目全面分析 — 打造你的个人 AI 超级智能助手
人工智能·深度学习·开源·大模型·ai agent·智能体·openhuman
AI布道师-wang8 小时前
第 5 章:幻觉、记忆与局限——它不是神
人工智能·chatgpt
Deepoch8 小时前
以终端智能实现自主除草:Deepoc具身模型开发板的技术落地
人工智能·开发板·具身模型·deepoc·除草
前端白袍8 小时前
AI+:OpenClaw:开源 AI Agent 框架的定位与技术分析
人工智能·开源·openclaw
MomentYY8 小时前
第 1 篇:Agent 到底是什么?别被概念唬住了
人工智能·python·agent
字节跳动数据库8 小时前
TRAE × 火山引擎 Supabase:为你的 AI 应用装上“数据引擎”
人工智能·后端
高洁018 小时前
中国人工智能培训网—AI系列录播课
人工智能·机器学习·数据挖掘·transformer·知识图谱
AI医影跨模态组学8 小时前
Radiology(IF=15.2)北京大学肿瘤医院影像科孙应实教授团队:CT预测微卫星不稳定性高结肠癌区域淋巴结转移
人工智能·深度学习·论文·医学·医学影像·影像组学