你有没有想过,有一天,你拿手机随手拍下一段跳舞的视频,上传给AI,几分钟后,屏幕里出现的不再是那个固定角度的画面------而是一个可以任意旋转、从正面看、从背后看、从侧面看,都无比清晰的"数字人"?
这不是科幻片。这是浙江大学、蚂蚁集团和港科大的研究团队,在2026年8月刚发表的一项成果,叫做 4DAnyone。代码已经开源,任何人都可以去试。

01
PART
AI → 容易忽略的事情
视频只有一个角度
我们每天在手机里录了多少视频?孩子第一次走路,朋友在台上演讲,健身房里练了很久终于打出那个动作......这些视频有一个共同的缺点:只有一个角度。
镜头在哪,你就只能看到哪里。身后那片你没拍到的空间,永远缺席。
这是一个看起来理所当然的限制。毕竟,一台手机就一个摄像头,你没法同时站在左边、右边和背后。
然而4DAnyone做的事情,就是打破这个限制。

02
PART
一个视频 → 360° 旋转视角视频
360 度无死角旋转视频
这项技术的核心想法,听起来有点魔幻:
你只给它一个普通的单目视频,比如一段街拍、一段舞蹈、一段运动视频,镜头还可以在轻微移动,不需要固定三脚架,不需要告诉它摄像机的型号、焦距、位置------什么都不用。
它先从这段视频里,提取出人物的3D骨架------就像X光一样,把人的骨骼结构在三维空间中还原出来。
然后,它用AI"脑补"出如果有16台摄像机围着这个人拍,各个角度分别会拍到什么。
最后,这16路视频合在一起,训练出一个"4D高斯泼溅"模型------一种可以实时渲染、任意视角观看的数字化人物。
结果是:那个只有一台手机拍到的人,变成了一个可以在数字空间里360°自由旋转的立体影像,每一帧都跟得上原始动作,每一个角度都是真实还原,不是胡编的。

03
PART
AI 视频→ 这件事情为啥这么难
角色一致性
你可能会想:AI那么厉害,这不是早就能做了吗?
还真没有。难就难在一致性上。
以前那些AI如果要生成多角度的画面,会出现一个头疼的问题:正面看是一件红色上衣,侧面AI生成的变成了蓝色;从左边看到的手臂,和从右边看到的对不上。不同角度之间,画面像是来自两个不同的人。
为什么?因为AI要同时生成十几个角度的视频,算力有限,它不得不分批处理,批次之间信息不互通,于是"漂移"了。
04
PART
4D anyone → 多角度视频
2 个关键设计
4DAnyone专门解决了这个问题,用了两个关键设计:

第一个叫RCP(参考上下文压缩),把之前已经生成好的角度,压缩成精简的"记忆"喂给下一批,就像你让一个画师同时画多个角度的同一个人,给他看前面画的草稿而不是让他凭空发挥------一致性大幅提升,而且计算成本不随角度数量暴增。
第二个叫TCR(目标上下文路由),在AI生成的早期阶段,让不同批次之间互相"对齐全局结构",到了细节阶段再各自精修------就像盖房子,先把框架搭一致,再装修各自的房间。
这两个设计组合在一起,让生成质量在主流评测上大幅超过此前所有同类方法。

05
PART
4D anyone→ 设计骨架
深度视频·骨架
4DAnyone还有一个和其他方法不同的地方:它的几何引导用的是3D骨架,而不是深度图。
听起来像技术细节,但背后有很实用的考量:
深度估计很容易翻车。 从一段手持手机的随意视频里,去精确推算每个像素离摄像头有多远,这件事本身就很不可靠。一旦深度估计错了,后续生成的所有角度全都跟着歪。
骨架更稳。 现代的人体姿态估计技术已经相当成熟,从单目视频里提取一个人的3D骨架,误差很小,非常可靠------哪怕人在快速运动、部分遮挡,骨架依然能给出一个"大体没错"的答案。
所以4DAnyone选择了"宁可稀疏,但要准"的路线:用骨架提供准确的空间结构,把衣服纹理、脸部细节这些事留给AI自己从视频里学习。这个思路,让它在野外真实视频上的泛化能力,比依赖精确深度估计的方法强得多。

06
PART
如何用?
这项技术与你有什么关系?
你可能在心里嘀咕:听起来很厉害,但和我的生活有什么关系?
想象一下几个场景:
你的孩子第一次学会独立走路。 现在你只有一段手机视频。有了这项技术,这个珍贵瞬间将来可以被还原成一个可以从任意角度重温的立体影像------不是照片,也不是视频,是可以在数字空间里"环绕"的记忆。
你是电商卖家。 一件衣服的上身效果,现在需要请模特、租摄影棚、多角度拍摄。以后或许只需要一段随手拍的视频,AI帮你生成可以360°旋转的试穿展示。
你做游戏或影视内容。 传统方法想做一个可以任意角度渲染的数字人,需要一套48台摄像机的摄影阵列,成本极高。4DAnyone让这件事的门槛从专业摄影棚降到了一台手机。
更远的方向:元宇宙、虚拟现实、具身AI。 当AI体要"认识"和"理解"真实世界里的人的时候,4D人体重建是一个基础能力。4DAnyone让这个能力的获取方式,从"昂贵的专业设备"变成了"一段普通视频"。

07
PART
它的边界在哪里
4D anyone 的局限性
有意思的是,这篇论文在最后诚实地列出了失败案例。
如果一个人穿着一件布料松散飘动的大裙子,骨架只能追踪到身体结构,但飘动的裙摆在不同角度之间很难保持一致------还原质量会明显下降。
还有,如果人做了一个非常罕见的动作,比如芭蕾舞者踮起脚尖,人体姿态估计模型可能会把这个动作认错,后续生成的所有角度都会跟着把姿势搞错。
这是技术现阶段真实的边界,研究团队没有回避它。
另外,论文也特别提到了伦理问题:这项技术能生成高度逼真的人体视频,存在被用于深度伪造、侵犯隐私的风险。研究团队明确反对任何未经本人同意的恶意使用。

08
PART
AI 4D 数字人
值得关注
过去几年,AI让图像生成爆炸,让文字生成爆炸,让语音生成爆炸。
但"把真实世界里的人,变成数字空间里可以任意操控的存在"这件事,一直有一道很高的门槛------它需要昂贵的专业设备,需要严格控制的拍摄条件,需要大量的标定和校准工作。
4DAnyone做的事,是把这道门槛大幅压低。
一段随手拍的视频进去,一个可以自由旋转的4D数字人出来。
这不是玩具。这是基础设施的变化。
当一件原本需要专业团队、专业设备才能做到的事情,变成了每个人拿手机就能启动的流程------它能带出什么,没有人能完全预见。

代码已经在 GitHub 上开源,模型也在 HuggingFace 上公开,论文发表在SIGGRAPH Asia 2026。感兴趣的同学可以自己去看演示效果,那些在舞台上表演、在球场上运动的人,被AI还原成可以360°旋转的立体影像,在屏幕上跟着你的视角转动------还是挺震撼的。

09
PART
4D anyone 技术实现
代码实战
附:想自己跑一遍的同学,看这里
以下内容面向有 Python 基础、手边有 GPU 的同学。官方建议至少一张 H20(80GB显存)用于生成,一张 RTX 4090(24GB显存)用于重建;没有本地机器的可以用 AutoDL 或者 Vast.ai 租用。
第一步:拉代码、建环境
...Python
git clone https://github.com/ant-research/4DAnyone.git
cd 4DAnyone
git submodule update --init third_party/GVHMR
conda create -n 4danyone python=3.11 -y
conda activate 4danyone
pip install -r requirements.txt
第一次运行时,模型权重会自动下载(包括 HuggingFace 上的 Wan2.2 底座和 4DAnyone 的训练权重)。也可以手动提前拉:
...Python
python scripts/download_smplx.py # 人体参数化模型 SMPL-X
python scripts/download_model.py # 4DAnyone 权重
python scripts/download_example.py # 示例视频

第二步:准备你的输入视频
视频有几个硬性要求,否则效果会大打折扣:
-
竖版比例(9:16),单人出镜,全身或半身均可
-
至少 121 帧(30fps 下约 4 秒)
-
镜头不要大幅移动,轻微手持抖动可以接受
-
人物尽量占画面主体,背景干扰越少越好
第三步:运行推理,生成多视角视频
最简单的跑法,生成围绕人物均匀分布的 4 个视角:
...Python
python inference.py \
--video_path"data/source/pexels/10331522-uhd_2160_4096_25fps.mp4" \
--views_per_layer 4
想要更完整的环绕效果,可以生成 3 个仰角层、每层 16 个视角(共 48 路视频),这需要约 8 张 GPU 并行:
...Python
python inference.py \
--video_path "你的视频路径.mp4" \
--views_per_layer 16 \
--layer_pitches '-10,15,35'

只想看正面到背面的半圆效果,可以限定水平范围:
...Python
python inference.py \
--video_path "你的视频路径.mp4" \
--views_per_layer 8 \
--start_yaw=-90 \
--yaw_span 180
推理完成后,输出结构大致如下:
...Python
data/fdanyone/<clip>/
├── cameras.json # 各摄像机参数
├── skeletons/ # 各角度的骨架可视化视频
└── videos/
├── sparse/ # RCP 参考视角视频(中间产物)
└── dense/ # 最终生成的所有目标视角视频
第四步(可选):重建成可交互的 3DGS 模型
如果你想把生成的多视角视频进一步重建成可以实时旋转、渲染的 3D 模型,需要先装 Nerfstudio:
...Python
pip install nerfstudio

然后导出某一帧的多视角数据,用 splatfacto 训练一个高斯泼溅模型:
...Python
导出第 0 帧的所有视角
python scripts/export_nerfstudio.py \
--result_dir data/fdanyone/<clip> \
--frame_index 0
训练 3DGS 模型
ns-train splatfacto \
--data data/nerfstudio/<clip>/frame_000 \
--pipeline.model.background-color random
训练完成后,Nerfstudio 提供一个本地 Web 界面,可以直接在浏览器里拖动视角实时渲染。
显存不够怎么办?
官方正在开发低显存(<32GB)推理模式,还在 TODO 列表里,尚未发布。目前折中方案:减少 views_per_layer 到 4 或 6,单 GPU 显存占用会显著下降;生成质量略有影响,但可以跑通。
更多transformer,VIT,swin tranformer
参考头条号:人工智能研究所
v号:人工智能研究Suo, 启示AI科技
动画详解transformer 在线视频教程

