《MotionLLM:从人体运动和视频理解人类行为》论文核心部分详解

论文原标题:MotionLLM: Understanding Human Behaviors from Human Motions and Videos

这是一篇被 2025年IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI) 接收的正式期刊论文,属于多模态大语言模型(MLLM)应用于人体运动理解 的前沿工作。Project page: https://lhchen.top/MotionLLM

一、问题背景:

1. 两种模态的天然互补性

模态 优势 缺陷
视频(Video) 富含环境上下文、人-物交互、场景语义------比如"打高尔夫"和"扫地"的骨架运动很相似,但视频场景完全不同 计算量大、隐私风险高、包含大量冗余信息
骨架(Motion) 轻量、隐私友好、精确捕捉关节运动轨迹 缺乏环境上下文------只能看到"手臂在摆动",不知道是在"挥高尔夫球杆"还是"扫地"

2. 现有方法的三大缺陷

缺陷 具体表现 后果
① 只处理单一模态 MotionGPT只处理骨架,Video-LLaVA只处理视频 无法利用两种模态的互补优势
② 缺乏高质量的视频-骨架-文本配对数据 现有数据集要么只有视频-文本(如WebVid),要么只有骨架-文本(如HumanML3D),很少有同时包含三者的 无法训练统一的跨模态理解模型
③ 用共享投影器处理不同模态 Video-LLaVA用同一个投影器处理图像和视频(模态差异小),但视频和骨架的模态差异巨大 共享投影器无法同时有效处理两种差异巨大的模态

本文提出MotionLLM,其核心主张用不同的投影器分别处理视频和骨架 (因为模态差异太大),然后用统一的LLM进行推理;同时构建包含视频-骨架-文本三元组的大规模数据集MoVid,让两种模态在训练中互相增强。

二、核心贡献(三个关键词)

贡献 核心内容 通俗解释
① MoVid数据集 包含24k视频-骨架-文本三元组(Motion-X重标注)+ 472k QA指令对(H3DQA + Motion-XQA) 首次为"视频+骨架"联合理解提供大规模训练数据
② MotionLLM模型 不同的V-L投影器分别处理视频和骨架(视频用MLP,骨架用线性层),统一送入LLM进行推理 给视频和骨架各配一个"翻译官",因为两种"语言"差异太大,不能用同一个翻译
③ MoVid-Bench基准 人工标注的1,350个测试样本,覆盖5个维度:身体部位、时序、方向、推理、抗幻觉 首次为"视频+骨架"联合理解提供标准化评估基准

三、核心创新点详解:

整体框架流程:两阶段训练 ,先分别训练视频和骨架的V-L投影器 (让两种模态都能被LLM理解),再联合指令微调 (让LLM学会同时利用两种模态的信息进行推理);推理时输入视频或骨架,输出动作描述、问答或推理结果

创新点1:MoVid数据集的三大组成部分

子集 来源 规模 生成方式 用途
H3DQA HumanML3D骨架+文本 272k QA对 GPT-4从骨架描述生成多轮QA 骨架模态指令微调
Motion-X Caption Motion-X(视频+骨架配对) 24k条 GPT-4V从15×下采样视频帧重新标注 视频-骨架-文本三元组对齐
Motion-XQA Motion-X Caption基础上 200k QA对 GPT-4从新标注生成多轮QA 双模态联合指令微调

关键设计 :Motion-X Caption是视频-骨架-文本三元组------同一个动作既有视频,又有对应的骨架数据,还有GPT-4V生成的文本描述。这是实现"模态互补"的数据基础。

创新点2:分离的V-L投影器

为什么不能用共享投影器?

模型 模态组合 模态差异 投影器设计
LLaVA 图像→文本 单一线性层
Video-LLaVA 图像+视频→文本 共享投影器
MotionLLM 视频+骨架→文本 分离投影器(视频用MLP,骨架用线性层)

核心洞察:视频是像素级的稠密数据,骨架是坐标级的稀疏数据,两者的特征分布完全不同。用同一个投影器处理两种差异巨大的模态,会迫使投影器"妥协",导致两种模态都无法得到最优表示。

创新点3:两阶段渐进式训练

阶段 目标 可训练模块 数据
Stage 1:模态翻译 让视频和骨架的投影器学会把各自的特征"翻译"成LLM能理解的Token 仅投影器(视频MLP、骨架线性层) 视频-文本对 + 骨架-文本对
Stage 2:统一指令微调 让LLM学会利用两种模态进行推理 投影器 + LLM(LoRA) 多轮QA数据(H3DQA + Motion-XQA)
自回归文本生成

通俗例子:输入是"一个人在挥高尔夫球杆"的视频,模型要生成描述。它先看到视频,预测第一个词可能是"这个人";然后看到"这个人",预测下一个词可能是"正在";看到"这个人正在",预测下一个词可能是"挥动"......直到生成完整的"这个人正在挥动高尔夫球杆"。

四、比较的基准和数据集:

1. 骨架理解(MoVid-Bench-Motion,表4)

方法 整体准确率 说明
GPT-3.5 31.33% 纯文本,无法理解骨架
MotionGPT 36.86% 仅骨架,训练数据有限
MotionLLM 49.50% +12.64%

2. BABEL-QA(表5)

方法 整体准确率 说明
MotionCLIP-R 42.0% 专家模型,闭集分类
MotionLLM(未微调) 37.2% 开放生成,未针对BABEL优化
MotionLLM*(微调后) 43.6% 超越专家模型

3. 视频理解(MoVid-Bench-Video,表4)

方法 整体准确率 说明
Video-LLaVA 42.53% 仅视频,无骨架辅助
MotionLLM 49.00% +6.47%

4. MVBench(表6)

方法 平均准确率 说明
VideoChat 30.1% 视频理解基线
Video-LLaVA 26.3% 视频理解基线
MotionLLM 31.6% 新SOTA

5. ActivityNet-QA(表7)

方法 准确率 说明
Video-LLaVA 45.3% 视频理解SOTA
MotionLLM 53.3% +8.0%
数据集

MoVid(训练数据)

子集 规模 模态 生成方式
H3DQA 272k QA对 骨架+文本 GPT-4从HumanML3D生成
Motion-X Caption 24k条 视频+骨架+文本 GPT-4V重新标注
Motion-XQA 200k QA对 视频+骨架+文本 GPT-4从新标注生成

额外训练数据

数据 用途
Valley(70.2万视频-文本对) Stage 1视频投影器训练
BABEL-QA(2k QA对) 指令微调
Video-ChatGPT(10万QA对) 保留通用VQA能力

MoVid-Bench(评估基准)

类型 数量 覆盖维度
运动(Motion) 700个 Body, Seq, Dir, Rea, Hall
视频(Video) 650个 Body, Seq, Dir, Rea, Hall

五个评估维度

  1. Body(身体部位):是否准确描述具体身体部位的运动

  2. Seq(时序):是否理解动作的先后顺序

  3. Dir(方向):是否准确判断左右/前后方向

  4. Rea(推理):是否能推断动作的意图或因果

  5. Hall(抗幻觉):是否生成不存在的细节

总结

MotionLLM通过分离的V-L投影器高质量的视频-骨架-文本三元组数据,让AI第一次实现了"既看视频又读骨架"的联合理解------视频提供环境上下文,骨架提供精确运动,两者互补,让动作理解更全面、更准确、更鲁棒。

相关推荐
麻雀飞吧1 小时前
搜索“近期量化入门”时,先补交易理解再看 Python 和 API
人工智能·python
Leinwin1 小时前
GPT-Image-2.5 API 上手:Flare 与 Sunburst 怎么选,成本怎么算
人工智能·gpt
星核0penstarry1 小时前
B站AI大赛3万份投稿背后的真相:门槛下移后,新的壁垒是什么?
人工智能·个人开发·ai编程·自动写代码
新新学长搞科研2 小时前
【EI检索丨院士主讲】2026年人工智能、大数据与社会计算国际学术会议(ABDSC 2026)
人工智能
广州山泉婚姻2 小时前
C/C++动态内存:堆内存的申请、使用与释放
c++·人工智能
纪伊路上盛名在2 小时前
Omni-Mol:用多模态大语言模型构建通用多任务分子模型
人工智能·语言模型·自然语言处理·蛋白质·通用模型·生物大分子·混合专家moe
硅谷秋水2 小时前
超越模仿:通过离线策略Q-规划实现机器人策略的自我改进
人工智能·深度学习·机器学习·机器人
Fairy要carry2 小时前
制造业实习02-控制下载速度的几个问题
人工智能
Csvn2 小时前
第 21 章 排错与调试实战
人工智能·aigc·agent