MotionDiffuse: Text-Driven Human Motion Generation withDiffusion Model # 论文阅读

URL

https://arxiv.org/pdf/2208.15001

主页:https://mingyuan-zhang.github.io/projects/MotionDiffuse.html

TD;DR

22 年 8 月商汤的文章,引用量 200+。基于 SD,任务是输入文本的动作描述,生成对应的动作序列。

已有的 motion 生成方法的输入 condition 可以分为 3 类,包括预设好的 pose 序列类别、音乐、自然语言,本文主要关注的是自然语言生成的方式。用语言生成的方法大多只能支持少量词语的短句生成,或者只能生成简单的 pose

Model & Method

因为是 22 年的文章,当时还有 motion module 这个东西,所以本文生成连续帧的方式是吧时间信息 t 通过 positional embedding 的方式注入到训练过程中,生成的动作序列长度是固定的。

Dataset & Results

Thought

  • 文章比较老,t 注入的方式没有什么参考价值。可以参考一下造数据的方法,和 gt 格式
  • 本文似乎可以用 prompt 分别控制 body 的每一个独立肢体 lib
相关推荐
大模型最新论文速读9 小时前
合成数据的正确打开方式:格式比模型重要,小模型比大模型好用
论文阅读·人工智能·深度学习·机器学习·自然语言处理
m0_7431064618 小时前
【浙大&南洋理工最新综述】Feed-Forward 3D Scene Modeling(一)
论文阅读·人工智能·计算机视觉·3d·几何学
Zik----18 小时前
中文论文写作格式
论文阅读
CV-杨帆2 天前
论文阅读:arxiv 2026 Security Considerations for Artificial Intelligence Agents
论文阅读
Marlowee2 天前
UI-Ins 论文深度解读:Instruction-as-Reasoning 范式与 GUI Grounding 的多视角推理
论文阅读
赵庆明老师3 天前
CSSCI论文写作14:如何用学术语言呈现论证
论文阅读·论文写作
StfinnWu3 天前
论文阅读 Guided Real Image Dehazing Using YCbCr Color Space
论文阅读·计算机视觉
民乐团扒谱机3 天前
【读论文】基于非线性光学的全光子人工神经网络处理器
论文阅读·笔记·论文
有Li3 天前
SparseXMIL: 利用稀疏卷积实现数字病理学全玻片图像上下文感知和内存高效分类/文献速递-多模态医学影像最新进展
论文阅读·文献·医学生
西柚小萌新4 天前
【论文阅读】--MIRIX:面向多智能体的记忆系统
论文阅读