MotionDiffuse: Text-Driven Human Motion Generation withDiffusion Model # 论文阅读

URL

https://arxiv.org/pdf/2208.15001

主页:https://mingyuan-zhang.github.io/projects/MotionDiffuse.html

TD;DR

22 年 8 月商汤的文章,引用量 200+。基于 SD,任务是输入文本的动作描述,生成对应的动作序列。

已有的 motion 生成方法的输入 condition 可以分为 3 类,包括预设好的 pose 序列类别、音乐、自然语言,本文主要关注的是自然语言生成的方式。用语言生成的方法大多只能支持少量词语的短句生成,或者只能生成简单的 pose

Model & Method

因为是 22 年的文章,当时还有 motion module 这个东西,所以本文生成连续帧的方式是吧时间信息 t 通过 positional embedding 的方式注入到训练过程中,生成的动作序列长度是固定的。

Dataset & Results

Thought

  • 文章比较老,t 注入的方式没有什么参考价值。可以参考一下造数据的方法,和 gt 格式
  • 本文似乎可以用 prompt 分别控制 body 的每一个独立肢体 lib
相关推荐
程序喵;14 小时前
A Learning-Based Approach to Static Program Slicing —— 论文笔记
论文阅读
regret~1 天前
【论文笔记】DKTNet: Dual-Key Transformer Network for small object detection
论文阅读·目标检测·transformer
图学习的小张1 天前
论文笔记:基于细粒度融合网络和跨模态一致性学习的多模态假新闻检测
论文阅读·学习
图学习的小张2 天前
论文笔记:LAFF 文本到视频检索的新基准
论文阅读
wgggfiy2 天前
chatgpt学术科研prompt模板有哪些?chatgpt的学术prompt有哪些?学术gpt,学术科研
论文阅读·人工智能·gpt·chatgpt·prompt·aigc
小嗷犬3 天前
【论文笔记】Visual Instruction Tuning
论文阅读·深度学习·大模型·多模态
Yanc_L3 天前
【论文阅读】MEDICAL GRAPH RAG: TOWARDS SAFE MEDICAL LARGE LANGUAGE MODEL VIA
论文阅读·人工智能·语言模型
皮卡丘ZPC3 天前
Frequency-aware Feature Fusion for Dense Image Prediction 论文阅读
论文阅读
chnyi6_ya3 天前
论文笔记:Anytime Continual Learning for Open Vocabulary Classification
论文阅读·人工智能
爱思德学术-IAAST3 天前
本省第一所!新大学,揭牌!
论文阅读·学习·学习方法·论文笔记·学术