【AIGC核心技术剖析】AI生成音乐:MAGNeT一种直接操作多个音频令牌流的掩码生成序列建模方法

MAGNeT是一种直接操作多个音频令牌流的掩码生成序列建模方法。与先前的工作不同,MAGNeT由一个单阶段、非自回归的变压器组成。在训练期间,论文使用掩码调度器预测从掩码令牌中获得的跨度,而在推断期间,论文通过多个解码步骤逐渐构建输出序列。为了进一步提高生成音频的质量,论文引入了一种新颖的重评分方法,其中论文利用外部预训练模型对MAGNeT的预测进行重评分和排名,然后用于后续解码步骤。最后,论文探索了MAGNeT的混合版本,在这个版本中,论文在自回归方式下生成前几秒钟,而序列的其余部分则以并行方式解码。论文展示了MAGNeT在文本到音乐和文本到音频生成任务中的高效性,并进行了广泛的实证评估,考虑了客观指标和人类研究。所提出的方法与评估基线相当,同时速度显著更快(比自回归基线快7倍)。通过消融研究和分析,论文阐明了构成MAGNeT的每个组件的重要性,同时指出了在自回归和非自回归建模之间的权衡,考虑延迟、吞吐量和生成质量。

案例:

项目地址:https://pages.cs.huji.ac.il/adiyoss-lab/MAGNeT/

源码:https://github.com/facebookresearch/audiocraft/blob/main/docs/MAGNET.md

相关推荐
rocksun1 分钟前
使用MCP Toolbox for Databases访问数据库
数据库·人工智能·mcp
Codebee3 分钟前
三码合一:OneCode注解驱动的新时代编码范式
aigc·ai编程·编程语言
PetterHillWater11 分钟前
AWS使用提示词与RAG来减少大模型幻觉
aigc
ai小鬼头12 分钟前
AIStarter:一键部署AI工具,轻松提升效率的秘密武器!
css·人工智能·github
极客密码27 分钟前
Cursor真的很好用,但我强烈建议你试试 Augment
aigc·ai编程·cursor
szxinmai主板定制专家1 小时前
89104 PCIe Switch芯片国产替代 - PCIE5.0国产AI服务器高性能扩展,支持海光/龙芯/飞腾等
人工智能
Listennnn1 小时前
AI趋势与提示词工程
人工智能
王天天(Bennet)1 小时前
【防火墙基础之传统墙到 UTM 到 NGFW 再到 AI 的变化】
人工智能·网络安全·防火墙·ngfw·防火墙发展与认知
一只特立独行的程序猿2 小时前
手机、平板音频软件开发调测常用命令
音视频
Virgil1393 小时前
【TrOCR】训练代码
人工智能·深度学习·ocr