【读论文】复调音乐信号的主旋律提取:方法、应用与挑战

1 SALAMON J, GÓMEZ E, ELLIS D P W, et al. Melody Extraction from Polyphonic Music Signals: Approaches, Applications and ChallengesJ. IEEE Signal Processing Magazine, 2013.

IEEE信号处理杂志

复调音乐信号的主旋律提取:方法、应用与挑战

Justin Salamon,IEEE学生会员,Emilia Gómez,IEEE会员,Daniel P.W. Ellis,IEEE高级会员,Gaël Richard,IEEE高级会员

摘要------主旋律提取算法旨在生成一系列频率值,对应于音乐录音中主导旋律的音高。在过去十年间,主旋律提取已发展为一个活跃的研究主题,涌现出涵盖各类技术的大量算法方案。本文对这些技术、主旋律提取的应用场景以及尚存的挑战进行了综述。我们首先从音乐学与信号处理双重视角探讨"旋律"的定义,并通过案例研究解读主旋律提取算法针对特定音乐片段的输出结果。随后,我们基于一项国际评估活动的结果,对各类主旋律提取算法进行全面的对比分析。我们探讨了算法设计、评估以及基于主旋律提取的应用相关问题。最后,我们从算法性能、开发流程与评估方法三个层面,讨论了主旋律提取研究中仍待解决的若干挑战。

关键词:主旋律提取;音乐信息检索;评估;综述;音频内容处理

I. 引言

音乐是首个被数字技术彻底重构的大众市场产业,这一进程始于激光唱片,发展至今,普通消费者可在本地智能手机或音乐播放器中存储数千首曲目,还可通过云音乐服务即时获取数百万首曲目。海量的音乐资源催生了对音乐描述、索引、搜索与交互新方法的需求。近年来音频处理技术的进步,催生了可通过直接分析音频文件的音乐内容,帮助用户与音乐进行交互的各类技术。从复调音乐信号中提取旋律,正是这样一项技术,且已受到音频信号处理与音乐信息检索(MIR)研究领域的广泛关注。该任务被称为"主旋律提取""音频主旋律提取""主导旋律提取""主导旋律估计"或"主导基频估计",其目标是从录制的音乐音频信号中自动获取一组代表主导旋律线条音高的频率值序列(图1)。

音频信号 → 系统 → 旋律音高序列

图1. 主旋律提取:从复调音乐的音频信号中获取一组代表旋律音高的频率值序列。

音乐转录,即将音频信号转换为所有演奏音符的描述信息,是受过训练的音乐专业学生通常可以完成的任务,且长期以来一直是计算研究的主题。然而,由于音乐和声的频谱结构复杂且存在刻意的交叠,该任务已被证实难度极大。在该领域最早的研究之一中,后藤真孝指出,许多有价值的音乐任务,例如基于旋律的检索,或用于卡拉OK的旋律声部抑制,仅通过更有限的转录即可实现------即仅恢复单条旋律线,将其作为任意时刻旋律可能范围内的"最强"音高 1 ^{1} 1。这一思路被Emilia Gómez、Beesuan Ong与Sebastian Streich采纳,他们将主旋律提取任务设为2004年国际音乐信息检索大会(ISMIR)附属音频描述竞赛的参赛项目,该竞赛由巴塞罗那庞培法布拉大学音乐技术组主办 2 ^{2} 2。这一活动之后催生了面向音乐信息检索技术的音乐信息检索评估交流活动(MIREX) 3 ^{3} 3,并在随后数年中形成了一系列组织完善、参与广泛的国际评估,相关内容将在第三节中阐述。

为明确主旋律提取的技术任务,我们首先应考察"旋律"的音乐学概念------这一概念最终取决于听众的主观判断 2 ^{2} 2,因此会随应用场景的不同而变化(例如符号化旋律相似度计算 4 ^{4} 4或音乐转录 5 ^{5} 5)。数百年来的音乐学研究 6 ^{6} 6未能就"旋律"的定义达成明确共识,但出于形成统一解读的实际需求,MIR领域选择了简化、务实的定义,使该任务可通过信号处理方法实现。一种广为接受的定义认为 2 ^{2} 2:"旋律是单声道的音高序列,听众在听完一段复调音乐后,若被要求用口哨或哼唱再现该作品,会复现出这一序列;而当听众将该序列与原作品对比聆听时,会将其识别为作品的核心部分。"

J. Salamon与E. Gómez任职于西班牙巴塞罗那庞培法布拉大学信息与通信技术系音乐技术组(MTG)(电子邮箱:justin.salamon@upf.edu, emilia.gomez@upf.edu)。

D. P. W. Ellis任职于美国纽约哥伦比亚大学电气工程系,邮编10027(电子邮箱:dpwe@ee.columbia.edu)。

G. Richard任职于法国巴黎电信学院,法国电信研究院,法国国家科学研究中心电信与信息处理实验室,邮编75634,巴黎13区(电子邮箱:gael.richard@telecomparistech.fr)。

这一定义仍存在相当程度的主观性,因为不同听众听完同一首歌后可能哼唱不同的声部(例如主唱声部与吉他独奏声部)。在实际研究中,研究重点集中于我们所称的"单声源主导基频估计"。也就是说,在被分析的整首作品中,旋律被限定为属于单一声源,且该声源被认为是混音中最突出的乐器或人声。即便在这一定义下,主观因素也无法完全消除(例如,如何定义"突出"?),但在实践中,通过选用包含明确主唱或主奏乐器的音乐素材,可规避这一问题。由此,我们修正后的任务定义为:"从包含主唱或主奏乐器的音乐内容中进行单声源主导基频估计"。尽管这一定义的覆盖范围有限,无法涵盖所有可被视为旋律的内容,但其解决方案仍将催生出功能强大的技术。

需要说明的是,我们使用基频(下文简称 f 0 f_0 f0)这一术语,指代与音高这一听觉属性关联最紧密的物理特性 7 ^{7} 7。尽管如此,在主旋律提取相关文献中,音高与 f 0 f_0 f0两个术语常被互换使用,为便于阅读,本文也采用同样的用法。我们需要定义的最后一个音乐术语是"复调音乐"。尽管音乐学对单声部、主调、支声与复调织体进行了区分,但在本文中,"复调"仅指代任何包含两个及以上同时发声音符的音乐类型,这些音符可由不同乐器演奏(例如人声、吉他与贝斯),也可来自一件可同时演奏多个音符的单一乐器(例如钢琴)。

明确了旋律与复调的定义后,将主旋律提取定义为一项信号处理挑战就变得更为清晰:给定一段复调音乐录音,我们需要自动估计对应主唱或主奏乐器音高的 f 0 f_0 f0值序列。此外,我们还必须估计该声部未出现在混音中的时间区间(即"浊音检测"问题)。对于人类听众而言,这一任务似乎微不足道------我们中的许多人即便未受过音乐训练,也能唱出喜爱歌曲的旋律。受过音乐训练的人甚至可以将旋律转录为乐谱。然而,当我们尝试将这一任务自动化时,会发现其极具挑战性。

该任务的复杂性主要源于两个因素:首先,复调音乐信号由录音中所有乐器产生的声波叠加而成,且多数时候这些乐器同时演奏。考察信号的频谱内容时,不同声源的频率分量相互叠加,使得很难将特定频段的能量对应到具体乐器的音符上。混音与母带处理技术进一步加剧了这一难度:混响会模糊音符的起止时刻,增加声源之间的重叠;动态范围压缩会缩小弱声源与强声源的音量差异,加剧干扰。其次,即便我们得到了音频信号基于音高的表示,仍需判断哪些音高值属于主导旋律,哪些仅属于伴奏。图2展示了这一挑战,其中显示了若干复调音乐片段的频谱图(上图)、目标旋律序列(下图红色曲线),以及某主旋律提取算法的估计结果(下图蓝色曲线)(参见第二节)。

正如第六节将讨论的,主旋律提取具有诸多潜在应用,包括哼唱检索(通过演唱或哼唱部分旋律搜索歌曲)、翻唱歌曲识别(检测两段录音是否为同一音乐作品的不同演绎版本) 8 9 ^{89} 89、曲风分类(基于曲风自动整理音乐收藏) 10 ^{10} 10、自动去主旋律以生成卡拉OK伴奏 11 ^{11} 11以及歌手特征分析 12 ^{12} 12。该技术在计算音乐学与民族音乐学领域也有广泛应用,例如音乐转录 13 ^{13} 13、音准分析 14 ^{14} 14以及自动旋律动机与模式分析 15 ^{15} 15。确定歌曲的旋律还可作为中间步骤,用于从音乐信号中提取其他语义标签。最后,主旋律提取在研究领域之外也有诸多用途,例如电声作曲与音乐教育。主旋律提取技术正逐步被整合进Adobe Audition¹与Melodyne²等专业音乐制作工具中。

本文其余部分结构如下:第二节首先通过案例研究,考察前沿算法针对不同音乐片段的输出结果,揭示该任务的难点与易出错之处。第三节对2005年至今的主旋律提取算法进行全面综述。第四节介绍主旋律提取常用的评估指标与测试数据集。第五节基于上述数据集,讨论主旋律提取算法的准确率表现。第六节介绍基于主旋律提取技术开发的部分软件与研究应用。第七节讨论改进主旋律提取算法仍需应对的若干挑战。最后在第八节给出总结。

¹ http://www.adobe.com/products/audition.html

² http://www.celemony.com/cms/

II. 案例研究

为更深入理解主旋律提取的难点,以及困扰主旋律提取算法的各类误差,我们首先详细考察某前沿算法针对若干音乐片段的实际提取结果 16 ^{16} 16。为简洁起见,我们仅选用一种前沿算法,但观察到的误差类型(及其代表的挑战)是所有方法共有的。

图2展示了该算法针对三类音乐片段的输出结果:(a) 人声爵士、(b) 流行音乐、© 歌剧。

图2. 案例研究示例。上图:对数频率频谱图。下图:提取的旋律 16 ^{16} 16(蓝色)与基准真值(红色)。片段:(a) 人声爵士,(b) 流行乐,© 歌剧。

每幅图分为上下两部分:上图显示对数频率频谱图,呈现这些复调音乐信号复杂的谐波模式。下图显示算法估计的最终旋律线(蓝色),叠加在基准真值标注(红色)之上。

在解读图中的各类误差之前,先了解正确的提取结果是什么样的,图(a)给出了示例。可以看到,蓝色(估计值)与红色(基准真值)旋律序列几乎完全重叠,且几乎不存在仅出现单条序列的帧。完美重叠意味着算法的音高估计是准确的。不存在仅出现单条序列的帧,说明我们未出现任何浊音检测错误------仅出现红色序列,意味着我们错误地将实际存在旋律的帧估计为清音。仅出现蓝色序列,则意味着发生浊音误报,即我们错误地将某一其他有声声源纳入了旋律,而实际上该帧中并不存在旋律。在图(a)中可以看到,算法正确估计了主唱的音高,同时排除了第3至4秒之间演奏的钢琴和弦音符。

在图(b)的示例中,同时存在音高误差(第4至7秒)与浊音误差(第7至9秒)。该片段选自一首流行歌曲,编曲包含主唱、吉他伴奏与和声。两类误差的来源均为和声------和声演唱的稳定音高与主旋律线处于同一音域。结果,算法错误地跟踪了和声,导致错误的音高估计(持续至第7秒),随后出现浊音误报------因为主唱暂停后,和声仍在继续演唱。

最后,图©的示例中,算法出现了八度误差。该片段选自一首男高音演唱的歌剧咏叹调,旋律的音级被正确估计,但处于错误的八度中(比歌手实际音高高一个八度)。此处的八度误差很可能源于歌手实际采用的演唱技巧。与流行或爵士歌手不同,古典歌手经过训练,可产生共鸣极强的声音(使其声音能压过管弦乐队被听众听到)。在低频段,这种共鸣会导致二次谐波的振幅往往大于基频;在高频段,(尤其在男歌手的演唱中)会在3kHz左右出现清晰的共振峰(即"歌手共振峰") 17 ^{17} 17。两者共同作用,会导致算法赋予 2 f 0 2f_0 2f0的权重高于 f 0 f_0 f0( f 0 f_0 f0为正确的基频),正如图©上图的频谱图中第10至12秒所呈现的那样。真实 f 0 f_0 f0二倍频处的显著度提升,再加上旋律音域相对较低(算法通常会对低频跟踪设置偏向),导致算法将旋律跟踪到了正确音高的上一个八度,从而产生了观测到的八度误差。

III. 算法综述:2005年至今

主旋律提取与音高(基频)估计密切相关,后者有着悠久的研究传统。早期的音乐音高估计方法,处理的是单声道音乐录音的 f 0 f_0 f0估计,均改编自语音处理领域的技术 32 ^{32} 32。此后,研究人员提出了多种专门针对单声道音乐信号 f 0 f_0 f0估计的方法 33 ^{33} 33。近年来,也有学者提出了用于估计复调录音中多个并发乐器 f 0 f_0 f0的算法(多音高估计)。更详细的综述可参见文献 34 ^{34} 34

正如引言中所述,主旋律提取与单声道音高估计、多音高估计均存在两点重要区别。与单声道音高估计不同,主旋律提取处理的是复调素材及其带来的各类挑战(参见第一节)。与多音高估计不同,主旋律提取需要识别出复调中承载旋律的特定声部,但无需估计其余声源的音高值。

将主旋律提取系统视为单声道音高跟踪器的扩展,有助于理解其原理。单声道音高跟踪器通常接收音频信号 x ( t ) x(t) x(t),计算在一系列候选音高频率上取值的函数 S x ( f τ , τ ) S_x(f_\tau, \tau) Sx(fτ,τ),该函数表示每个时间帧 τ \tau τ上各音高候选的相对得分或似然度。该函数既可在时域计算(例如在一定滞后范围内计算的自相关函数),也可在频域计算(例如在一定频率范围内计算的幅度谱函数)。随后,局部周期估计通常会施加时序约束,例如通过动态规划实现。由此,估计得到的音高值序列 f ^ \hat{f} f^(表示为每个时间帧对应一个值的向量)可推导为:

f ^ m o n = arg ⁡ max ⁡ f ∑ τ S x ( f τ , τ ) + C ( f ) (1) \hat{f}{mon} = \arg\max_f \sum\tau S_x(f_\tau, \tau) + C(f) \tag{1} f^mon=argfmaxτ∑Sx(fτ,τ)+C(f)(1)

其中 f τ f_\tau fτ是 f f f的第 τ \tau τ个元素, C ( f ) C(f) C(f)用于表示时序约束。例如, S x ( f , τ ) S_x(f, \tau) Sx(f,τ)的一种常见选择是自相关函数,形式为:

S x ( f , τ ) = r x x ( 1 f ; τ ) = 1 W ∫ τ − W / 2 τ + W / 2 x ( t ) x ( t + 1 f ) d t (2) S_x(f, \tau) = r_{xx}\left(\frac{1}{f}; \tau\right) = \frac{1}{W} \int_{\tau-W/2}^{\tau+W/2} x(t) x\left(t+\frac{1}{f}\right) dt \tag{2} Sx(f,τ)=rxx(f1;τ)=W1∫τ−W/2τ+W/2x(t)x(t+f1)dt(2)

其中 W W W为自相关分析窗的长度。

在主旋律提取中,观测信号 y ( t ) y(t) y(t)由目标单声道旋律信号 x ( t ) x(t) x(t)与叠加的伴奏"噪声"组成:

y ( t ) = x ( t + n ( t ) (3) y(t) = x(t + n(t) \tag{3} y(t)=x(t+n(t)(3)

将单声道跟踪器扩展至该场景下并取得良好效果,有两种路径:

第一种是改进底层音高候选评分函数的鲁棒性,使其在存在其他周期信号的情况下仍能反映目标音高;我们称之为基于显著度的主旋律提取

f ^ s a l = arg ⁡ max ⁡ f ∑ τ S y ′ ( f τ , τ ) + C ′ ( f ) (4) \hat{f}{sal} = \arg\max_f \sum\tau S'y(f\tau, \tau) + C'(f) \tag{4} f^sal=argfmaxτ∑Sy′(fτ,τ)+C′(f)(4)

其中 S y ′ S'_y Sy′是基于混合信号 y y y计算得到的改进音高显著度函数。计算显著度函数有多种不同方法(参见第三节B小节第3点)。例如,部分函数将候选频率 f f f的显著度计算为其各次谐波的加权和:

S y ′ ( f τ , τ ) = ∑ h = 1 N h g ( f τ , h ) ∣ Y ( h ⋅ f , τ ) ∣ (5) S'y(f\tau, \tau) = \sum_{h=1}^{N_h} g(f_\tau, h) |Y(h\cdot f, \tau)| \tag{5} Sy′(fτ,τ)=h=1∑Nhg(fτ,h)∣Y(h⋅f,τ)∣(5)

其中 N h N_h Nh为求和的谐波数量, g ( f τ , h ) g(f_\tau, h) g(fτ,h)为谐波加权函数 5 ^{5} 5, Y ( f , τ ) Y(f, \tau) Y(f,τ)为短时傅里叶变换:

Y ( f , τ ) = ∫ − W / 2 W / 2 w ( t ) y ( τ + t ) e − j 2 π f t d t (6) Y(f, \tau) = \int_{-W/2}^{W/2} w(t) y(\tau+t) e^{-j2\pi f t} dt \tag{6} Y(f,τ)=∫−W/2W/2w(t)y(τ+t)e−j2πftdt(6)

其中 w ( t ) w(t) w(t)为窗函数。

注意,在公式(4)中我们使用 C ′ ( f ) C'(f) C′(f)而非 C ( f ) C(f) C(f)表示时序约束,因为对于复调场景,这是一个复杂得多的问题:即便采用改进的显著度函数,也无法保证旋律的频率始终出现在函数的最大值处。正如第三节B小节第4点将介绍的,可通过采用维特比解码、跟踪智能体、聚类等跟踪技术来解决这一问题。

另一种路径是尝试将混合信号分解为独立的声源,其中至少有一个信号 x ^ ( t ) \hat{x}(t) x^(t)以旋律信号为主,其程度足以适配基本未经修改的音高跟踪器;我们称之为基于源分离的主旋律提取

f ^ s e p = arg ⁡ max ⁡ f ∑ τ S x ^ ( f τ , τ ) + C ′ ( f ) (7) \hat{f}{sep} = \arg\max_f \sum\tau S_{\hat{x}}(f_\tau, \tau) + C'(f) \tag{7} f^sep=argfmaxτ∑Sx^(fτ,τ)+C′(f)(7)

其中 x ^ ( t ) \hat{x}(t) x^(t)通过分解或矩阵分解技术估计得到(参见第三节C小节)。

A. MIREX主旋律提取评估

自2005年设立以来,已有超过50种主旋律提取算法提交至音乐信息检索评估交流活动(MIREX) 3 ^{3} 3。在这项年度活动中,不同算法在同一组音乐数据集上接受评估,以实现各方法间的定量对比,并评估当前主旋律提取领域的前沿准确率水平。我们认为MIREX是本综述的良好参考点,因为绝大多数对研究领域产生影响的主旋律提取算法,都曾在某个阶段参与过MIREX。受篇幅限制,本文不讨论2005年之前的方法(例如文献 1 ^{1} 1),相关早期研究的更多信息可参见文献 34 ^{34} 34

表I总结了2005年以来所有提交至MIREX的算法中,16种代表性算法的特征。为此,我们尝试将提取流程拆解为多数算法共有的一系列步骤。由于部分作者在数年间提交了多种算法,我们仅选用其最新的(已发表的)成果,因为在多数情况下,这代表了单一算法演进的最新版本。若某一算法未包含某个步骤(或作者未提及该步骤),则在表格中标记为"-"。"N/A"表示该步骤与对应方法无关(例如Poliner与Ellis 30 ^{30} 30直接根据功率谱确定旋律,因此多音高表示与该方法无关)。最后需要说明的是,部分算法(即Durrieu 28 ^{28} 28与Tachibana 29 ^{29} 29提出的算法)无法按照与其余方法相同的步骤进行拆解,因此在表格中合并了部分步骤的列。

表I 2005年至2012年MIREX中16种主旋律提取算法的算法架构

第一作者/ MIREX年份 预处理 谱变换与处理 多音高表示(显著度函数) 跟踪 浊音检测 方法类型
Paiva 2005 18 ^{18} 18 - 听觉模型 + 自相关峰值 汇总自相关图 多音高轨迹 + 音符删除 显著度谷值 基于显著度
Marolt 2005 19 ^{19} 19 - STFT + SMS谐波加噪声 音调模型EM拟合 片段 + 片段聚类 响度滤波
Goto 2005 20 ^{20} 20 带通滤波 多速率滤波器组 + 基于瞬时频率的峰值选择 音调模型EM拟合 跟踪智能体 -
Cancela 2008 21 ^{21} 21 - 常数Q变换 + 高通滤波 + 对数功率归一化 谐波度图 轮廓跟踪 + 加权 + 平滑 自适应阈值
Ryynänen 2008 5 ^{5} 5 - STFT + 频谱白化 谐波求和 音符事件HMM + 全局HMM 静音模型
Dressler 2009 22 ^{22} 22 - MRFFT + 瞬时频率峰值校正 + 幅度阈值 频谱峰成对比较 流式规则 动态阈值
Rao 2009 23 ^{23} 23 - 高分辨率FFT + 主瓣幅度匹配 SMS + 双向失配(TWM) 动态规划 NHC阈值
Salamon 2011 16 ^{16} 16 等响度滤波 STFT + 瞬时频率峰值校正 谐波求和 轮廓跟踪 + 轮廓过滤 显著度分布
Jo 2011 24 ^{24} 24 - 可变窗长STFT 谐波求和 稳定候选 + 基于规则的选择 隐式
Arora 2012 25 ^{25} 25 - STFT + 对数谱 + 峰值选择 对数谱逆傅里叶变换 谐波聚类跟踪 + 聚类得分 谐波求和阈值 基于显著度 + 源分离预处理
Hsu 2010 26 ^{26} 26 谐波/打击乐分离 MRFFT + 人声声部判别 归一化次谐波求和 全局趋势 + 动态规划 分类器
Yeh 2012 27 ^{27} 27 谐波/打击乐分离 MRFFT + 人声声部判别 归一化次谐波求和 趋势估计 + HMM -
Durrieu 2009 28 ^{28} 28 用于主旋律源分离的源/滤波器模型 维特比平滑 能量阈值 基于源分离
Tachibana 2011 29 ^{29} 29 两级谐波/打击乐分离 动态规划 信噪比阈值
Poliner 2006 30 ^{30} 30 下采样至8kHz STFT + 限制至2kHz + 幅度归一化 N/A 支持向量机分类器 能量阈值 数据驱动
Sutton 2006 31 ^{31} 31 半音衰减 + 带通 N/A N/A 单声道音高跟踪器的HMM组合 置信度HMM 单声道方法

表格最后一列"方法类型"尝试根据底层思路对算法进行分类,多数可归入上述的基于显著度与基于源分离两类。但部分方法不属于上述任何类别,包括数据驱动方法------该方法将功率谱直接输入机器学习算法,由分类器根据每帧观测到的频谱估计旋律音符。

需要注意的是,尽管主旋律提取包括检测演唱旋律与主奏乐器旋律两类,但许多算法是专门针对人声乐句提取开发的。原因有二:首先,大量流行音乐都包含演唱旋律,这使得声乐主旋律提取具有商业吸引力;其次,人声具有多数乐器不具备的独特特征 35 ^{35} 35,算法可利用这些独特特征更准确地识别旋律。

B. 基于显著度的方法

从表I中可以明显看出,占比最大的一类方法,是基于音高显著度的时频表示(显著度函数)的方法。这类方法的通用架构及可能的子步骤如图3所示。

图3. 基于显著度的主旋律提取算法框图。

  1. 预处理 :作为第一步,部分方法会进行某种预处理,通常是施加滤波以增强预期存在旋律的频段内容:Goto 20 ^{20} 20施加261.6Hz至约4kHz的带通滤波,Salamon与Gómez 16 ^{16} 16施加基于感知的等响度滤波 7 ^{7} 7。部分方法在进一步处理前,采用源分离技术增强旋律信号:Hsu 26 ^{26} 26与Yeh 27 ^{27} 27使用原本设计用于谐波-打击乐分离(HPSS)的技术,将其适配为旋律-伴奏分离(参见第三节C小节)。

  2. 谱变换与处理 :接下来,信号被切分为时间帧,并施加变换函数以得到每帧的频谱表示。最直接的方法是施加短时傅里叶变换(STFT),窗长通常在50至100毫秒之间 5 16 19 23 25 ^{516192325} 516192325。这样的窗长通常既能提供足够的频率分辨率以区分不同音符,又能保持合适的时间分辨率,以跟踪旋律在短时间内的音高变化。

尽管如此,部分方法尝试克服傅里叶变换固有的时频分辨率限制,采用多分辨率变换,例如多速率滤波器组 20 ^{20} 20、常数Q变换 21 ^{21} 21或多分辨率FFT(MRFFT) 26 27 36 ^{262736} 262736。总体而言,这类变换在低频段使用更大的窗(需要更高的频率分辨率以区分相邻音符),在高频段使用更小的窗(需要更高的时间分辨率以跟踪快速变化的谐波)。文献 16 ^{16} 16对比了STFT与MRFFT,结果表明对于主旋律提取任务,使用两种变换不存在统计学上的显著差异。但由于主旋律提取系统的每一步都对前一步的输出高度敏感,部分算法确实可能从多分辨率变换中获益。最后需要说明的是,部分方法采用旨在模拟人类听觉系统的变换 7 ^{7} 7,例如Paiva 18 ^{18} 18使用的模型。

施加变换后,多数方法仅保留频谱峰值用于后续处理。除峰值检测本身外,还可采用不同的峰值处理技术:部分方法根据幅度或正弦性准则过滤峰值,试图滤除不代表谐波内容或主唱声部的峰值 19 20 23 26 27 ^{1920232627} 1920232627。另一些方法施加频谱幅度归一化,以降低音色对分析的影响------Cancela 21 ^{21} 21与Arora 25 ^{25} 25取对数谱,Ryynänen与Klapuri(使用全频谱而非仅峰值)则施加频谱白化 5 ^{5} 5。最后,Dressler 36 ^{36} 36与Salamon、Gómez 16 ^{16} 16通过从相位谱计算瞬时频率,得到每个频谱峰更精确的频率与幅度估计。

  1. 显著度函数 :基于显著度的算法核心在于多音高表示,即显著度函数。该函数给出了(预期存在旋律的范围内)每个可能音高值随时间变化的显著度估计。图4展示了某显著度函数的输出示例(由Salamon与Gómez 16 ^{16} 16提出的算法计算),其峰值被视为旋律的候选值,在后续阶段进一步处理。

获取显著度函数有多种方法:多数方法采用某种形式的谐波求和,即某一音高的显著度为其各次谐波频率幅度的加权和 5 16 21 24 26 27 ^{51621242627} 51621242627。Goto 20 ^{20} 20与Marolt 19 ^{19} 19使用期望最大化算法,将一组音调模型拟合到观测频谱上。基频对应某一音高的音调模型,其估计的最大后验概率(MAP)被视为该音高的显著度。其他方法包括Rao 23 ^{23} 23计算的双向失配、Paiva 18 ^{18} 18使用的汇总自相关,以及Dressler 37 ^{37} 37提出的频谱峰成对分析。

从图4中可以明显看出,显著度函数方法存在一个主要的不良效应------会出现"伪"音高值,其 f 0 f_0 f0是实际有声声源 f 0 f_0 f0的精确整数倍或分数倍。这种效应会导致通常所说的八度误差,即算法选择的音高值比旋律的正确音高恰好高或低一个八度。(这类误差可在图2的示例©中观察到。)

不同算法采用不同策略减少八度误差的数量。部分算法,例如Cancela 21 ^{21} 21与Dressler 22 ^{22} 22,尝试直接减少显著度函数中伪音高值的数量。Dressler的方法是:检查可能属于同一谐波序列的频谱峰对,若两峰之间存在大量高振幅频谱峰,则衰减其求和结果。Cancela的方法是:若频率为 2 k ⋅ f 0 2k\cdot f_0 2k⋅f0、 3 k ⋅ f 0 / 2 3k\cdot f_0/2 3k⋅f0/2与 3 k ⋅ f 0 3k\cdot f_0 3k⋅f0的频谱分量平均幅度,高于频率为 k ⋅ f 0 k\cdot f_0 k⋅f0的分量平均幅度,则衰减支撑该 f 0 f_0 f0的谐波求和(这将衰减 f 0 f_0 f0为真实 f 0 f_0 f0的1/2、2/3或1/3的伪音高值)。

文献 34 ^{34} 34中,Klapuri提出了一种基于频谱平滑度减少八度误差的方法。对显著度函数中的每个峰值,在平滑其对应谐波频率的频谱包络后,重新计算峰值幅度。代表八度误差的峰值具有不规则的包络(相比真实音符更平滑的包络),因此会被该过程衰减。

Paiva 18 ^{18} 18与Salamon 16 ^{16} 16提出了另一种应对八度误差的思路------他们首先将显著度函数的峰值分组为音高轮廓,然后判断哪些轮廓是伪轮廓并将其移除。其核心思想是,一旦显著度峰值被分组为轮廓,由于重复轮廓具有相隔一个八度的相同轨迹,检测重复轮廓会变得更容易。判断两条轮廓中哪一条是伪轮廓,可基于轮廓显著度与旋律整体音高连续性的准则完成。最后需要说明的是,几乎所有方法都会在算法的跟踪阶段,通过惩罚大幅音高跳变,非显式地减少八度误差。

图4. 人声爵士片段(图2中的示例(a))的显著度函数输出示例,采用文献 16 ^{16} 16提出的算法计算。

  1. 跟踪:给定显著度函数的峰值,剩余任务是确定哪些峰值(即音高值)属于旋律。这是每种算法最关键的阶段之一,且有趣的是,这也是差异最大的步骤------几乎每种算法都采用不同的方法。

多数方法尝试直接从显著度峰值中跟踪旋律,但部分方法(即Paiva、Marolt、Cancela与Salamon)包含一个初步分组阶段,将峰值分组为连续的音高轮廓(也称为"片段"或"轨迹"),再从中筛选出旋律 16 18 19 21 ^{16181921} 16181921。该分组通常基于时间、音高与显著度连续性约束,跟踪连续帧中的峰值来完成。

给定音高轮廓(若未进行分组则为显著度峰值),研究人员提出了多种跟踪技术以得到最终的旋律序列:Marolt 19 ^{19} 19使用聚类,Goto 20 ^{20} 20与Dressler 22 ^{22} 22使用基于启发式规则的跟踪智能体。Ryynänen 5 ^{5} 5与Yeh 27 ^{27} 27使用隐马尔可夫模型(HMM),Rao 23 ^{23} 23与Hsu 26 ^{26} 26使用动态规划。最后,Paiva 18 ^{18} 18与Salamon 16 ^{16} 16采用了不同的思路------他们并非跟踪旋律,而是尝试删除所有不属于旋律的音高轮廓(或音符)。

  1. 浊音检测:主旋律提取中一个常被忽视的重要部分是浊音检测,即判断旋律何时存在、何时不存在。算法的浊音检测步骤通常在整个流程的最后一步实施,但也存在例外(例如Salamon在过滤其他非旋律轮廓之前,就基于整首作品音高轮廓的显著度分布设置阈值,移除不显著的轮廓)。

一种常见方法是使用固定或动态的逐帧显著度阈值,Paiva、Marolt、Cancela、Dressler、Rao与Arora均采用该方法。其他策略包括:Ryynänen的算法在HMM跟踪部分整合了静音模型;Hsu的算法使用基于音色的分类器,判断人声是否存在。

C. 基于源分离的方法

与基于显著度的主旋律提取不同的另一种策略,是使用源分离算法从混音中分离出旋律声源。图5展示了采用源分离进行主旋律提取的部分策略框图。这类方法是表I中提及的方法中出现最晚的一类,近年来随着音频源分离研究的进展逐渐受到关注。

尽管关于旋律与主唱声源分离已有大量研究(参见文献 28 38 -- 43 ^{2838--43} 2838--43及其中的参考文献),但这类算法通常采用基于信噪比的指标评估,仅有少数从估计旋律频率序列的角度(即本文的目标)接受过评估。

图5. 基于源分离的主旋律提取算法框图。

表I中有两种方法基于源分离------Durrieu等人 28 ^{28} 28与Tachibana等人 29 ^{29} 29提出的算法。

Durrieu将信号的功率谱建模为两个分量的瞬时叠加:主唱人声与伴奏。主唱人声的贡献用源/滤波器模型表示,伴奏的贡献则表示为任意数量具有不同频谱形状的声源之和。其提出了两种源/滤波器模型表示方式:平滑瞬时混合模型(SIMM)与平滑高斯缩放混合模型(SGSMM)。前者将主奏乐器(或人声)表示为所有可能音符的瞬时混合,后者更符合实际------任意时刻仅允许一组源/滤波器对处于激活状态,但计算量更大。两种模型的参数均通过期望最大化框架估计。

模型参数估计完成后,使用维特比算法在模型参数(包含声源的 f 0 f_0 f0)中寻找平滑轨迹,从而得到最终的旋律序列。浊音检测的实现方式为:首先基于估计的模型参数,使用维纳滤波分离出旋律信号,然后计算该信号每帧的能量,以确定旋律存在帧的能量阈值。

Tachibana等人提出的方法则截然不同。该方法利用了旋律相比持续和弦音符具有更强时变特性的特点。为此,他们采用了谐波-打击乐分离(HPSS)算法 44 ^{44} 44。该算法最初设计用于从混音中分离谐波与打击乐成分,原理是分离在时域平滑的声源(谐波内容)与在频域平滑的声源(打击乐内容)。通过改变分析所用的窗长,该算法可用于分离"持续"(即和弦)声音与"时变"(旋律+打击乐)声音。

移除伴奏后,再次运行该算法,这次采用原始形式以移除打击乐成分。经过这两步处理后,所得信号中的旋律应得到显著增强。旋律频率序列可直接从增强信号的频谱图中,通过动态规划寻找最大化频率序列最大后验概率的路径得到------其中给定频谱时某一频率的概率,与其谐波倍频处的能量加权和成正比,转移概率则是两个相邻频率值间距的函数。浊音检测通过对第二次HPSS算法输出的两个信号(旋律信号与打击乐信号)设置马氏距离阈值实现。

最后,从表I中可以看到,部分学者尝试结合基于显著度与基于源分离的方法。其中,源分离被用作预处理步骤以衰减伴奏信号,再从处理后的信号计算显著度函数。Hsu 26 ^{26} 26与Yeh 27 ^{27} 27均使用Tachibana提出的HPSS方法,但他们并未直接从所得信号的频谱估计旋律,而是继续计算显著度函数,并执行与其他基于显著度的方法类似的后续步骤。

为完整起见,我们在此简要介绍几种人声声源分离算法。如前所述,尽管这些方法未从主旋律提取的角度接受评估,但它们可与单声道音高跟踪算法结合,构建主旋律提取系统------从分离出的人声信号估计旋律 f 0 f_0 f0序列;也可像上述Hsu与Yeh的方法一样,用作预处理步骤。

我们已经介绍了Durrieu等人 28 ^{28} 28提出的源/滤波器模型,以及Tachibana等人 29 ^{29} 29采用的HPSS方法。另一种分离主唱人声的思路,是利用音乐伴奏通常具有重复结构、而人声变化更多的特点。

Huang等人 41 ^{41} 41基于这一特点,假设伴奏的频谱图可建模为低秩矩阵,而人声的频谱图为稀疏矩阵。他们使用鲁棒主成分分析(RPCA)将信号的频谱图分解为目标人声矩阵与伴奏矩阵。

Rafii与Pardo 42 ^{42} 42提出了另一种利用重复性的方法------他们首先对混音的频谱图施加自相关,计算伴奏的重复周期。通过计算连续重复片段频谱图的中位数,得到仅包含重复信号(伴奏)的频谱图。利用该频谱图生成时频掩膜,即可从混音中分离出人声。Liutkus等人 43 ^{43} 43对该方法进行了扩展,通过搜索歌曲中的局部周期,使其适用于完整歌曲(其中重复周期可能在主歌与副歌间变化);Rafii与Pardo也做了进一步扩展,将算法应用于信号的局部窗口,并通过计算自相似矩阵更好地识别歌曲中的重复片段。

文献 42 ^{42} 42中,作者还开展了将其方法与现有音高跟踪器结合以执行主旋律提取的实验,我们预计未来会有更多基于源分离的主旋律提取算法参与MIREX评估。

D. 其他方法

尽管多数主旋律提取方法要么基于显著度,要么基于源分离,但也有学者提出了一些截然不同的策略。

表I中首先出现的是Poliner与Ellis 30 ^{30} 30提出的数据驱动方法。他们并未将音乐声学知识手工编码进系统(例如以基于谐波求和的显著度函数形式),而是提出使用机器学习训练分类器,直接根据功率谱估计旋律音符。

作为预处理步骤,他们将音频下采样至8kHz,并使用STFT得到频谱表示。丢弃2kHz以上的频率仓,剩余频率仓的幅度在短时间范围内归一化,以降低不同乐器音色的影响。将得到的256维特征向量用于训练支持向量机分类器,训练数据中每帧都标注为60个可能输出类别之一,对应跨越五个八度的60个MIDI音符。浊音检测通过基于200至1800Hz之间的幅度平方能量设置全局阈值实现。

Sutton等人 31 ^{31} 31提出了另一种完全不同的策略。他们并未设计处理复调音频信号的算法,而是计算两种不同单声道音高估计器返回的音高序列,然后使用HMM将其结合。其基本假设是:尽管单声道音高估计器并非为处理同时存在多个音高的音频设计(通常会导致大量估计误差),但通过结合不同估计器的输出,可得到更可靠的结果。

IV. 评估:指标与音乐数据集

如前所述,主旋律提取算法需要实现两个目标:估计旋律的正确音高(音高估计),以及估计旋律存在与不存在的时刻(浊音检测)。主旋律提取算法的输出通常包含两列:第一列为固定间隔的时间戳(例如MIREX采用10毫秒间隔),第二列为 f 0 f_0 f0值,表示算法对每个时间戳(即每个分析帧)的旋律音高估计。算法甚至可以在估计旋律不存在的帧(非旋律帧)中也报告一个音高,这样我们便可独立评估音高估计与浊音检测性能。

为评估算法针对某一音频片段的性能,我们将算法输出与该片段的基准真值进行对比。基准真值文件与输出文件格式相同,包含代表该片段旋律的正确 f 0 f_0 f0值序列。基准真值的生成方式为:对片段的独奏旋律音轨运行单声道音高跟踪器(这意味着我们需要获取每首评测歌曲的分轨录音)。借助SMSTools³或WaveSurfer⁴等图形用户界面,对单声道音高跟踪器的输出进行人工检查,必要时予以修正。

给定基准真值文件,通过逐帧对比算法输出与基准真值,完成对算法的评估。对于基准真值中的非旋律帧,算法应检测到旋律不存在。对于旋律帧,算法应返回与基准真值匹配的频率值。若算法的频率估计值与基准真值的偏差在50音分(即半个半音)以内,则视为正确。

³ http://mtg.upf.edu/technologies/sms

http://www.speech.kth.se/wavesurfer/

A. 评估指标

基于逐帧对比,我们计算五项全局指标,从不同维度评估算法针对该音频片段的性能。这些指标首次应用于2005年MIREX 2 ^{2} 2,此后已成为评估主旋律提取算法的事实标准指标集。

设系统估计的旋律音高频率向量为 f f f,真实序列为 f ∗ f^* f∗;定义浊音指示向量 V V V,其第 τ \tau τ个元素 v τ = 1 v_\tau=1 vτ=1表示检测到旋律音高,对应的基准真值为 v ∗ v^* v∗。定义"清音"指示量 v ˉ τ = 1 − v τ \bar{v}\tau = 1-v\tau vˉτ=1−vτ。需要注意的是,即便算法报告某时刻无浊音( v τ = 0 v_\tau=0 vτ=0),仍可报告一个估计的旋律音高( f τ > 0 f_\tau>0 fτ>0)。各项指标定义如下:

  • 浊音召回率 :基准真值中标记为旋律帧的所有帧中,被算法估计为旋律帧的比例。

    R e c v x = ∑ τ v τ v τ ∗ ∑ τ v τ ∗ (8) Rec_{vx} = \frac{\sum_\tau v_\tau v^*\tau}{\sum\tau v^*_\tau} \tag{8} Recvx=∑τvτ∗∑τvτvτ∗(8)

  • 浊音误报率 :基准真值中标记为非旋律帧的所有帧中,被算法错误估计为旋律帧的比例。

    F A v x = ∑ τ v τ v ˉ τ ∗ ∑ τ v ˉ τ ∗ (9) FA_{vx} = \frac{\sum_\tau v_\tau \bar{v}^*\tau}{\sum\tau \bar{v}^*_\tau} \tag{9} FAvx=∑τvˉτ∗∑τvτvˉτ∗(9)

  • 原始音高准确率 :基准真值的旋律帧中, f τ f_\tau fτ被视为正确(即与基准真值 f τ ∗ f^*_\tau fτ∗偏差在半个半音以内)的帧的比例。

    A c c p i t c h = ∑ τ v τ ∗ T M ( f τ ) − M ( f τ ∗ ) ∑ τ v τ ∗ (10) Acc_{pitch} = \frac{\sum_\tau v^*\tau \mathcal{T}\left\\mathcal{M}(f_\\tau) - \\mathcal{M}(f\^\*_\\tau)\\right}{\sum\tau v^*_\tau} \tag{10} Accpitch=∑τvτ∗∑τvτ∗TM(fτ)−M(fτ∗)(10)

    其中阈值函数 T \mathcal{T} T定义为:

    T a = { 1 若 ∣ a ∣ < 0.5 0 若 ∣ a ∣ ≥ 0.5 (11) \mathcal{T}a = \begin{cases} 1 & \text{若 } |a|<0.5 \\ 0 & \text{若 } |a| \geq 0.5 \end{cases} \tag{11} Ta={10若 ∣a∣<0.5若 ∣a∣≥0.5(11)

    函数 M \mathcal{M} M将以赫兹为单位的频率映射到旋律轴上,表示为相对于任意参考频率 f r e f f_{ref} fref(本文中为55Hz,即A1)的半音数(实数):

    M ( f ) = 12 log ⁡ 2 ( f f r e f ) (12) \mathcal{M}(f) = 12 \log_2\left(\frac{f}{f_{ref}}\right) \tag{12} M(f)=12log2(freff)(12)

  • 原始色度准确率 :与原始音高准确率类似,但将估计与基准真值的 f 0 f_0 f0序列均映射到单个八度内。该指标衡量忽略八度误差时的音高准确率,而八度误差是主旋律提取系统的常见误差:

    A c c c h r o m a = ∑ τ v τ ∗ T \< M ( f τ ) − M ( f τ ∗ ) \> 12 ∑ τ v τ ∗ (13) Acc_{chroma} = \frac{\sum_\tau v^*\tau \mathcal{T}\left\\left\<\\mathcal{M}(f_\\tau) - \\mathcal{M}(f\^\*_\\tau)\\right\>_{12}\\right}{\sum\tau v^*_\tau} \tag{13} Accchroma=∑τvτ∗∑τvτ∗T⟨M(fτ)−M(fτ∗)⟩12(13)

    通过对半音尺度的音高差取模12(一个八度)实现八度等价,其中:

    < a > 12 = a − 12 ⌊ a 12 + 0.5 ⌋ (14) \left< a \right>_{12} = a - 12\left\lfloor \frac{a}{12} + 0.5 \right\rfloor \tag{14} ⟨a⟩12=a−12⌊12a+0.5⌋(14)

  • 总体准确率 :该指标结合音高估计与浊音检测任务的性能,给出系统的整体性能得分。定义为所有帧中被算法正确估计的比例:对于非旋律帧,正确意味着算法将其标记为非旋律;对于旋律帧,正确意味着算法既将其标记为旋律帧,又给出了正确的旋律 f 0 f_0 f0估计(即与基准真值偏差在半个半音以内):

    A c c o v = 1 L ∑ τ v τ ∗ T M ( f τ ) − M ( f τ ∗ ) + v ˉ τ ∗ v ˉ τ (15) Acc_{ov} = \frac{1}{L} \sum_\tau v^*\tau \mathcal{T}\left\\mathcal{M}(f_\\tau) - \\mathcal{M}(f\^\*_\\tau)\\right + \bar{v}^*\tau \bar{v}_\tau \tag{15} Accov=L1τ∑vτ∗TM(fτ)−M(fτ∗)+vˉτ∗vˉτ(15)

    其中 L L L为总帧数。

算法在整个音乐数据集上针对某项指标的性能,通过对数据集中所有片段的单片段得分取平均得到。

B. 音乐数据集

多年来,不同研究团队贡献了带标注的音乐数据集,用于MIREX中的主旋律提取评估。可免费获取的分轨录音数量有限,且标注过程耗时,因此与其他MIR任务相比,多数数据集规模相对较小。表II介绍了目前MIREX中用于评估的数据集,这些数据集自2009年起保持固定。

表II MIREX中主旋律提取评估的测试数据集

数据集 描述
ADC2004 20段时长约20秒的片段,涵盖流行、爵士与歌剧曲风。包含真实录音、合成歌声以及由MIDI文件生成的音频。总时长:369秒。
MIREX05 25段时长10-40秒的片段,涵盖摇滚、节奏布鲁斯、流行、爵士与独奏古典钢琴曲风。包含真实录音以及由MIDI文件生成的音频。总时长:686秒。
INDIAN08 四段时长1分钟的北印度古典声乐表演片段。每段片段有两种混音,伴奏量不同,共8段音频剪辑。总时长:501秒。
MIREX09 (0dB) 374首中文歌曲的卡拉OK录音(即带卡拉OK伴奏的演唱录音)。旋律与伴奏以0dB的信伴比混合。总时长:10020秒。
MIREX09 (-5dB) 与MIREX09 (0dB)相同的374段片段,但旋律与伴奏以-5dB的信伴比混合。总时长:10020秒。
MIREX09 (+5dB) 与MIREX09 (0dB)相同的374段片段,但旋律与伴奏以+5dB的信伴比混合。总时长:10020秒。

V. 性能表现:2005年至今

A. 提取准确率

图6展示了表I中16种算法在MIREX评估数据集上取得的结果。需要注意的是,部分算法仅在所有数据集新增之前参与过MIREX,因此我们仅能得到这些算法的部分结果。图中用垂直虚线区分了仅在部分数据集上接受评估的算法(虚线左侧)与在全部六个数据集上接受评估的算法(虚线右侧)。我们仅对在全部六个数据集上接受评估的算法计算均值。

要大致了解算法性能,只需关注两项评估指标------原始音高准确率(图6a)与总体准确率(图6b)。前者反映算法跟踪旋律音高的效果,后者则结合了音高估计指标与浊音检测的效果,因此浊音相关指标在一定程度上也能在该指标中得到体现。

首先看原始音高准确率,我们首先注意到,所有算法的准确率均随分析数据集的不同而变化。部分数据集对所有方法而言普遍难度更高(例如MIREX09 (-5dB),其中伴奏音量更大,会掩盖旋律),但总体而言,性能的差异并非均匀分布。这凸显了不同方法在处理不同音乐素材时的优势与劣势。

例如,我们看到Dressler的方法在ADC2004与MIREX05数据集上表现优于其他所有方法,这两个数据集包含声乐与器乐作品的混合;但在旋律始终为人声的其他数据集上并非如此。一方面,这意味着她的方法可推广到更广泛的音乐素材;但另一方面,我们也看到,利用人声独特特征的方法(例如Tachibana或Salamon的方法)在声乐旋律上表现更佳。

我们还看到,Hsu、Tachibana与Yeh采用的HPSS旋律增强方法,在旋律声源相对伴奏较弱时(MIREX09 (-5dB))尤其具有优势。

最后,考察MIREX05数据集的原始音高准确率结果可以发现,2005年至2009年结果逐步提升,此后原始音高准确率基本保持不变(更多关于性能演进的内容见第五节B小节)。总体而言,所有数据集上的平均音高准确率在70%-80%之间。

再看总体准确率,所有算法的性能相比原始音高准确率均有所下降,因为浊音检测被纳入了结果。需要注意的是,Goto与Yeh的结果人为偏低,因为这些方法未包含浊音检测步骤。

该步骤的重要性取决于算法的预期用途。例如,若我们计划将其用作转录系统的第一步,那么确保输出中不包含不属于旋律的音符至关重要。另一方面,依赖旋律序列对齐算法的相似度类应用,可应对对齐中的缺口,因此对浊音误差的敏感度更低。

如果考察全部6个数据集的平均结果,可以看到,取得最佳总体准确率的算法,是那些同时具备良好原始音高准确率与有效浊音检测方法的算法。总体而言,性能最佳的算法总体准确率在65%至75%之间。尽管这显然表明仍存在诸多挑战(参见第七节),但这样的准确率已足以支撑在主旋律提取算法之上构建新的应用(参见第六节)。

最后需要说明的是,图6未反映的一项重要性能维度是每种方法的计算成本。根据预期应用的不同,我们可能面临资源限制(例如时间、计算能力),这会影响算法的选择。尽管部分算法难以推导大O表示法的复杂度估计,但总体而言,包含源分离技术的算法(通常实现为迭代矩阵运算),其计算复杂度显著高于基于显著度的方法。在这方面,Dressler的算法尤其值得关注------在2009年参与的算法中,它同时实现了最低的运行时间与最高的平均总体准确率(仅Salamon & Gómez取得了更高的平均准确率,但2011年无运行时间数据)。

图6. 表I中16种主旋律提取算法在MIREX中取得的(a)原始音高准确率与(b)总体准确率。垂直虚线区分了仅在部分数据集上接受评估的算法(虚线左侧)与在全部六个数据集上接受评估的算法(虚线右侧)。

B. 我们是否在进步?

上一节提到,部分数据集的性能在过去3-4年间未出现显著提升,这反映了主旋律提取算法研发周期中存在的问题。图7展示了六个MIREX数据集的总体准确率随年份的演进情况。对于每个数据集,我们绘制了截至某一年取得的最佳总体准确率结果(例如2008年绘制截至2008年的最佳结果,2009年绘制截至2009年的最佳结果,依此类推)。

我们之前的观察似乎得到了证实------对于最早的两个数据集(ADC2004与MIREX05),2005年至2009年结果稳步提升,此后性能不再改善。对于较新的数据集(INDIAN08与三个MIREX09数据集),我们看到截至2011年性能逐步提升;2012年没有任何算法在任一数据集上超越前人结果。

图7. 六个MIREX数据集的最佳总体准确率结果随年份的演进。

这凸显了MIREX评估活动的一个重要局限------由于数据集(ADC2004除外)均保密以用于未来评估,研究人员无法分析数据以理解算法失效的原因。无法聆听音频内容、无法检查算法中间步骤的输出,仅靠最终结果(即便拆分为多项指标),只能告诉你哪里出错、如何出错,却无法说明出错的原因。

在算法研发中,研究人员使用可免费获取的公开数据集。由于制备数据集通常需要分轨录音,且需要大量人工标注,因此这类数据集非常少:ADC2004数据集、MIREX05训练数据集(参见脚注5)、MIR-1K数据集⁵以及RWC流行数据集⁶。但问题不止于此:前两个数据集尽管音乐素材多样,但规模极小(分别为20段与13段片段);后两个数据集规模更大,但仅限于单一音乐曲风(分别为中文流行乐与日文流行乐)。这意味着这些数据集要么规模过小,无法给出统计上稳定的结果;要么同质化严重,无法代表我们期望算法适用的全部音乐风格。

文献 50 ^{50} 50详细研究了当前主旋律提取评估面临的挑战。作者重点关注MIREX评估的三个方面:基准真值生成、测试集中所用片段的时长,以及数据集本身的规模与内容。他们首先指出,缺乏生成基准真值标注的统一协议,可能导致评估中的系统误差。通过对比算法在完整片段上的性能,与取自同一片段的更短子片段上的性能,他们还发现,短片段往往无法代表整首歌曲,这意味着测试集应使用完整歌曲而非片段。最后,他们基于数据集规模讨论了结果的稳定性与代表性,正如我们上文所述。

正如作者指出的,这些发现并未否定MIREX结果的价值,而是强调我们无法有把握地将这些结果推广到规模大得多的完整歌曲数据集上。为应对这些问题,音频主旋律提取标注倡议⁷(AMEAI)于2012年末启动。该倡议的目标是建立统一的标注协议,并编制一个全新的公开评估数据集。该数据集计划由完整歌曲组成,规模足以提供统计上稳定的结果,且风格足够多样,能覆盖比现有评估数据集更多的音乐类型。

VI. 软件与应用

A. 软件

尽管已提出多种主旋律提取算法,但可供人们下载使用的开源实现相对较少。这类工具对于促进对比评估、提升研究可复现性、推动基于主旋律提取技术的新应用开发至关重要(参见第六节B小节)。以下列出已知的可免费获取的主旋律提取相关工具:

  • LabROSA melodyextract2005⁸:包含Poliner与Ellis提交至2005年MIREX的主旋律提取系统代码 30 ^{30} 30。可在Linux与OSX系统上运行,需要Matlab与Java环境。
  • FChT⁹:Cancela等人在文献 45 ^{45} 45中提出的扇形啁啾变换(FChT)与 f 0 f_0 f0图(显著度函数)的开源Matlab/C++实现。
  • separateLeadStereo¹⁰:Durrieu等人在文献 40 ^{40} 40中报道的算法的开源Python实现。代码包含主旋律提取功能,以及主奏乐器/伴奏源分离功能。
  • IMMF0salience¹¹:一款开源的vamp插件¹²,用于可视化从Durrieu等人算法中间步骤得到的显著度函数 28 40 ^{2840} 2840
  • MELODIA¹³:一款vamp插件,提供适用于Windows、OSX与Linux系统的编译库。该插件实现了Salamon与Gómez提出的主旋律提取算法 16 ^{16} 16,除最终输出(即旋律的 f 0 f_0 f0序列)外,还提供算法中间步骤的可视化,例如在筛选最终旋律之前计算的显著度函数与音高轮廓。

为完整起见,我们在此简要介绍部分商用软件:Dressler的算法被整合进弗劳恩霍夫研究所的"面向音乐游戏的主旋律提取"库¹⁴中;Adobe Audition(参见脚注1)与Melodyne(参见脚注2)也整合了部分主旋律提取功能,不过这些产品所用算法的细节并未公开。

https://sites.google.com/site/unvoicedsoundseparation/mir-1k

http://staff.aist.go.jp/m.goto/RWC-MDB/

http://ameannotationinitiative.wikispaces.com

http://labrosa.ee.columbia.edu/projects/melody/

http://iie.fing.edu.uy/investigacion/grupos/gpa/fcht.html

¹⁰ http://www.durrieu.ch/research/jstsp2010.html

¹¹ https://github.com/wslihgt/IMMF0salience

¹² http://www.vamp-plugins.org/

¹³ http://mtg.upf.edu/technologies/melodia

¹⁴ http://www.idmt.fraunhofer.de/en/Departments_and_Groups/smt/products/melody_extraction.html

B. 基于主旋律提取的应用

过去十年间,主旋律提取算法的性能不断提升,如今已能提供足够好的结果,支撑更复杂的应用构建。以下总结了部分这类应用,其广泛的应用范围证明了主旋律提取算法对于音乐信息检索与计算音乐分析的重要性。

  1. 检索:主旋律提取最具商业吸引力的应用之一是音乐检索,即通过自动分析与对比歌曲,帮助用户找到感兴趣的音乐或发现新作品。在这一广阔的应用领域中,我们重点介绍两种不同但相关的检索应用:版本识别与哼唱检索。

版本识别(也称为翻唱识别)的任务是,自动检索用户提交给系统的音乐录音的不同演绎版本。应用场景包括检测YouTube等网站上的版权侵权,以及自动分析音乐家之间的创作相互影响。由于旋律通常是不同演绎版本中保持不变的少数音乐要素之一,多项研究探索了将主旋律提取用于版本识别,思路包括尝试完整转录旋律 46 ^{46} 46、将其作为计算相似度的中层表示 47 ^{47} 47,或将其与其他调性特征(例如和声、低音线条或整体伴奏)结合 8 9 ^{89} 89

第二种检索任务是哼唱检索(QBH),适用于用户记得歌曲旋律但不掌握任何编辑信息(例如标题、专辑或艺术家)的场景。哼唱检索系统允许用户演唱或哼唱旋律作为搜索查询,帮助用户检索相关信息。构建哼唱检索系统的一个重要问题是生成旋律数据库(歌曲索引),用于与演唱查询进行比对。

尽管可以在互联网上找到许多歌曲的MIDI版本,但这种方法始终存在局限------无法为现存的海量音乐收藏手动生成(即转录)MIDI文件。另一种解决方案是将查询与其他查询(即用户录制的旋律)进行匹配,SoundHound¹⁵采用的就是这种方式。尽管这避免了手动转录的需求,但该方法仍存在同样的"冷启动"问题------一首歌在用户录制之前,在系统中"不存在"。

使用主旋律提取自动为哼唱检索系统创建旋律索引,可缓解这一问题。尽管目前尚未推出基于主旋律提取的商用哼唱检索系统,但研究原型已展现出良好的前景 9 48 49 ^{94849} 94849

¹⁵ http://www.soundhound.com

  1. 分类 :自动音乐分类旨在通过自动为歌曲集合分配描述性标签,帮助个人用户与大型音乐语料库管理者整理收藏。组织音乐最常用的标签之一是音乐曲风。旋律的特征往往与音乐曲风相关(例如颤音的使用、音域),可辅助曲风识别。文献 10 ^{10} 10中,作者提出了一种基于主旋律提取得到的旋律相关特征的曲风分类系统,并证明将这些特征与更常用的梅尔频率倒谱系数(MFCC)等音色特征结合,有助于提升分类准确率。

  2. 去主旋律 :音乐去主旋律指的是从复调音乐混音中"移除"主奏乐器。自动实现这一功能,对于卡拉OK场所与爱好者而言是极具吸引力的应用------任何歌曲都可自动转换为卡拉OK伴奏。主旋律提取可作为去主旋律的第一步,提供旋律的"乐谱",用于引导源分离算法从混音中消除旋律 11 ^{11} 11

  3. 转录 :如前所述,基于频率的旋律中层表示已可用于多种应用。但有时需要一直转录为符号化记谱(例如西方五线谱)。首先,音乐转录本身就是一个有吸引力的最终目标------帮助用户通过自动生成的乐谱学习音乐 5 ^{5} 5。自动转录还有助于将口头传承的音乐传统(例如弗拉门戈)的符号表示形式化 13 ^{13} 13。最后,通过得到旋律的符号表示,我们可以应用已开发的大量符号化旋律相似度与检索技术 4 ^{4} 4。无论哪种情况,从复调录音中得到旋律的符号转录,第一步都是应用主旋律提取算法,其输出随后经过时间与音高量化,生成音乐音符。

  4. 计算音乐分析:最后一项应用,我们介绍几个主旋律提取可用于计算音乐分析的例子。与前述应用旨在提升我们查找、表示与交互音乐的方式不同,此处的目标是通过自动分析了解音乐内容本身。

文献 15 ^{15} 15中,作者将主旋律提取与模式识别算法结合,检测音乐学家预先定义的音乐模式是否存在。这类分析使音乐学家能够研究特定音乐风格的重要方面,例如验证已有的音乐假说。

文献 14 ^{14} 14将主旋律提取用于另一种分析:从印度古典音乐片段中提取旋律,并汇总为高频率分辨率的音高直方图。所得直方图用于音准分析------这是卡纳提克音乐(印度古典音乐的一种)的重要研究维度。歌手的音准可用于识别作品的拉格(raga),同时也能体现表演者的音乐表现力。

VII. 挑战

尽管主旋律提取算法自2005年以来已取得显著进步,但仍存在诸多挑战。以下各节将从算法设计与评估两方面,讨论未来主旋律提取研究需要应对的若干重要问题。

A. 器乐音乐与高度复调音乐

前文综述中提到,尽管多数方法可处理器乐音乐,但其中许多是专门针对声乐音乐定制的。我们提到,这既源于声乐音乐的普及性,也源于算法可利用人声的独特性。然而,若我们希望开发可推广到更广泛音乐素材的算法,就必须妥善解决器乐音乐的主旋律提取问题。

与人声主旋律提取相比,器乐音乐的主旋律提取面临两大挑战:首先,器乐音乐不像声乐那样受限。乐器的音域更宽,可产生快速变化的音高序列,且包含大幅音高跳变。其次,演奏旋律的乐器,在音色与单个音符的音高轮廓上,可能与其他伴奏乐器更为接近,这使得区分旋律与伴奏的任务更加复杂。

无论演奏旋律的乐器是什么,随着混音中乐器数量的增加,任务难度都会上升。这会导致频谱内容的重叠度更高,更难正确区分各个有声声源。即便我们能正确区分不同音符的音高值,判断其中哪些属于旋律也变得更加困难。

目前,算法主要设计用于处理主调音乐素材,即单一主导主奏乐器(或人声)搭配和声伴奏的音乐¹⁶。要从(例如)具有高度复调性、多条旋律线相互竞争的赋格中准确提取特定旋律,是当前主旋律提取算法尚无法做到的。

即便在更简单的主调场景中,也存在对主旋律提取极具挑战性的例子,例如包含和声甚至第二声部的歌曲。第二声部通常与旋律的运动方式非常相似,处于相同音域,且音量往往相当。这使得判断两个声部中哪一个是真正的旋律极具挑战性。

¹⁶ 严格来说,主调意味着伴奏与旋律具有相同的节奏,此处我们使用该术语的广义,指代所有包含主导旋律与某种形式和声伴奏的音乐。

B. 浊音检测

考察算法性能时我们发现,取得高总体准确率的关键,是高原始音高准确率与良好浊音检测方法的结合。迄今为止,多数方法主要关注主旋律提取的前者(音高估计),对后者关注较少(从表I中可以看到,部分算法甚至未包含浊音检测步骤)。通常,浊音检测仅在处理链的最后一步,通过施加简单的全局能量阈值实现。

目前,即便采用最有效浊音检测方法的算法,其平均浊音误报率(即在不存在旋律的地方检测到旋律)也超过20%。文献 16 ^{16} 16中作者指出,其算法性能最具潜力的提升方向,是降低浊音误报率------尽管该指标在MIREX中已处于最低水平之列。

C. 开发周期与评估

第五节B小节中我们提到,部分MIREX数据集的性能近年来未出现显著提升,这反映了主旋律提取算法研发周期中存在的问题。由于MIREX数据集(ADC2004除外)均保密以用于未来评估,研究人员无法分析数据以理解算法失效的原因。无法聆听音频内容、无法检查算法中间步骤的输出,仅靠最终结果(即便拆分为多项指标),只能告诉你哪里出错、如何出错,却无法说明出错的原因。

在算法研发中,研究人员使用可免费获取的公开数据集。由于制备数据集通常需要分轨录音,且需要大量人工标注,因此这类数据集非常少:ADC2004数据集、MIREX05训练数据集,MIR-1K数据集以及RWC流行数据集。但问题不止于此:前两个数据集尽管音乐素材多样,但规模极小;后两个数据集规模更大,但仅限于单一音乐曲风。这意味着这些数据集要么规模过小,无法给出统计上稳定的结果;要么同质化严重,无法代表我们期望算法适用的全部音乐风格。

文献 50 ^{50} 50详细研究了当前主旋律提取评估面临的挑战。作者重点关注MIREX评估的三个方面:基准真值生成、测试集中所用片段的时长,以及数据集本身的规模与内容。他们首先指出,缺乏生成基准真值标注的统一协议,可能导致评估中的系统误差。通过对比算法在完整片段上的性能,与取自同一片段的更短子片段上的性能,他们还发现,短片段往往无法代表整首歌曲,这意味着测试集应使用完整歌曲而非片段。最后,他们基于数据集规模讨论了结果的稳定性与代表性。

正如作者指出的,这些发现并未否定MIREX结果的价值,而是强调我们无法有把握地将这些结果推广到规模大得多的完整歌曲数据集上。为应对这些问题,音频主旋律提取标注倡议(AMEAI)于2012年末启动。该倡议的目标是建立统一的标注协议,并编制一个全新的公开评估数据集。该数据集计划由完整歌曲组成,规模足以提供统计上稳定的结果,且风格足够多样,能覆盖比现有评估数据集更多的音乐类型。

VIII. 结论

本文对主旋律提取算法进行了综述,不仅考虑了算法设计与性能方面,还探讨了任务的定义、潜在应用以及尚存的挑战。

我们首先考察了旋律的定义,并指出,为开发与评估主旋律提取算法,我们需要简化且务实的定义。通过将任务限定为"从包含主唱或主奏乐器的音乐内容中进行单声源主导基频估计",实现了这一目标。我们从信号处理角度阐述了主旋律提取面临的挑战,并说明了主旋律提取、单声道音高估计与多音高估计之间的区别。

通过案例研究,我们强调了主旋律提取算法最常见的几类误差,并明确了其可能的成因。随后,我们通过考察2005年以来提交至MIREX评估活动的16种最具代表性的算法,对算法设计进行了全面综述。我们指出了所采用方法与信号处理技术的高度多样性,并将算法划分为两大类:基于显著度的方法与基于源分离的方法。

我们介绍了评估主旋律提取算法最常用的指标,并基于这些指标考察了算法性能。我们发现,性能最佳的算法原始音高准确率在70%-80%之间,总体准确率在65%-75%之间。我们还发现,尽管部分早期数据集的性能提升有限,但总体性能在数年间逐步提升。

接下来,我们列出了可免费获取的主旋律提取软件,并介绍了部分已基于主旋律提取技术开发的应用,包括:检索(版本识别与哼唱检索)、曲风分类、自动去主旋律、音乐转录与计算音乐分析。

最后,我们讨论了研究界仍需应对的挑战。我们指出,当前算法主要设计用于处理主调声乐音乐,未来必须扩展至器乐与高度复调素材。我们强调了浊音检测的重要性,并指出了公开评估数据集匮乏导致的开发周期问题。最后,我们考察了评估流程本身,并指出,为了能将主旋律提取算法的结果可靠地推广到更大的音乐数据集,我们需要全新的、规模更大且更具异质性的测试数据集。

经过近十年的正式评估,以及数十套完整系统的开发,我们有理由追问:关于解决这一问题的最佳方法,我们学到了什么?在我们对基于显著度与基于源分离方法的区分中,评估结果显示,两类方法中都有跻身性能最佳行列的系统。有人可能认为,源分离(以及完整复调转录)的进一步发展,最终将涵盖这一问题,但即便不考虑计算成本更高的问题,如何建模听众大脑中对完整音乐信号的感知与认知处理,仍是一个悬而未决的问题------我们认为,听众在聆听音乐时,并不会对声音进行完整的声源分解。

尽管难以给出精确定义,但旋律无疑是音乐信息中极为重要且独特的维度,而可自动从音乐音频中提取旋律的系统,必将成为未来音乐信息技术的核心。

参考文献

1 M. Goto and S. Hayamizu, "A real-time music scene description system: Detecting melody and bass lines in audio signals," in Working Notes of the IJCAI-99 Workshop on Computational Auditory Scene Analysis, 1999, pp. 31--40.

2 G. E. Poliner, D. P. W. Ellis, F. Ehmann, E. Gómez, S. Streich, and B. Ong, "Melody transcription from music audio: Approaches and evaluation," IEEE Trans. on Audio, Speech and Language Process., vol. 15, no. 4, pp. 1247--1256, 2007.

3 J. S. Downie, "The music information retrieval evaluation exchange (2005--2007): A window into music information retrieval research," Acoustical Science and Technology, vol. 29, no. 4, pp. 247--255, 2008.

4 R. Typke, "Music retrieval based on melodic similarity," Ph.D. dissertation, Utrecht University, Netherlands, 2007.

5 M. Ryynänen and A. Klapuri, "Automatic transcription of melody, bass line, and chords in polyphonic music," Computer Music J., vol. 32, no. 3, pp. 72--86, 2008.

6 A. L. Ringer. (2013) Melody. Grove Music Online, Oxford Music Online (last checked Jan. 2013). Online. Available: http://www.oxfordmusiconline.com/subscriber/article/grove/music/18357

7 B. C. J. Moore, An Introduction to the Psychology of Hearing, 5th ed. San Diego: Academic Press, 2003.

8 R. Foucard, J.-L. Durrieu, M. Lagrange, and G. Richard, "Multimodal similarity between musical streams for cover version detection," in IEEE Int. Conf. on Acoustics, Speech, and Signal Processing (ICASSP), 2010, pp. 5514--5517.

9 J. Salamon, J. Serrà, and E. Gómez, "Tonal representations for music retrieval: From version identification to query-by-humming," Int. J. of Multimedia Info. Retrieval, special issue on Hybrid Music Info. Retrieval, vol. 2, no. 1, pp. 45--58, Mar. 2013.

10 J. Salamon, B. Rocha, and E. Gómez, "Musical genre classification using melody features extracted from polyphonic music signals," in Proc. IEEE Int. Conf. on Acoust., Speech and Signal Process. (ICASSP), Kyoto, Japan, Mar. 2012.

11 J.-L. Durrieu, G. Richard, and B. David, "An iterative approach to monaural musical mixture de-soloing," in Proc. IEEE Int. Conf. on Acoust., Speech and Signal Process. (ICASSP), Apr. 2009, pp. 105--108.

12 A. Mesaros, T. Virtanen, and A. Klapuri, "Singer identification in polyphonic music using vocal separation and pattern recognition methods," in Proc. 8th Int. Conf. on Music Inform. Retrieval, 2007, pp. 375--378.

13 E. Gómez, F. Cañadas, J. Salamon, J. Bonada, P. Vera, and P. Cabañas, "Predominant fundamental frequency estimation vs singing voice separation for the automatic transcription of accompanied flamenco singing," in 13th Int. Soc. for Music Info. Retrieval Conf., Porto, Portugal, Oct. 2012.

14 G. K. Koduri, J. Serrà, and X. Serra, "Characterization of intonation in carnatic music by parametrizing pitch histograms," in 13th Int. Soc. for Music Info. Retrieval Conf., Porto, Portugal, Oct. 2012, pp. 199--204.

15 A. Pikrakis, F. Gómez, S. Oramas, J. M. D. Báñez, J. Mora, F. Escobar, E. Gómez, and J. Salamon, "Tracking melodic patterns in flamenco singing by analyzing polyphonic music recordings," in 13th Int. Soc. for Music Info. Retrieval Conf., Porto, Portugal, Oct. 2012.

16 J. Salamon and E. Gómez, "Melody extraction from polyphonic music signals using pitch contour characteristics," IEEE Trans. on Audio, Speech and Language Processing, vol. 20, no. 6, Aug. 2012.

17 J. Kreiman and D. V. L. Sidtis, Foundations of voice studies: an interdisciplinary approach to voice production and perception. Hoboken, NJ: Wiley-Blackwell, 2011, ch. 10.

18 R. P. Paiva, T. Mendes, and A. Cardoso, "Melody detection in polyphonic musical signals: Exploiting perceptual rules, note salience, and melodic smoothness," Computer Music J., vol. 30, pp. 80--98, Dec. 2006.

19 M. Marolt, "On finding melodic lines in audio recordings," in 7th Int. Conf. on Digial Audio Effects (DAFx'04), Naples, Italy, Oct. 2004, pp. 217--221.

20 M. Goto, "A real-time music-scene-description system: predominant-f0 estimation for detecting melody and bass lines in real-world audio signals," Speech Communication, vol. 43, pp. 311--329, 2004.

21 P. Cancela, "Tracking melody in polyphonic audio," in 4th Music Inform. Retrieval Evaluation eXchange (MIREX), 2008.

22 K. Dressler, "An auditory streaming approach for melody extraction from polyphonic music," in 12th International Society for Music Information Retrieval Conference, Miami, USA, Oct. 2011, pp. 19--24.

23 V. Rao and P. Rao, "Vocal melody extraction in the presence of pitched accompaniment in polyphonic music," IEEE Trans. on Audio Speech and Language Processing, vol. 18, no. 8, pp. 2145--2154, Nov 2010.

24 S. Jo, S. Joo, and C. D. Yoo, "Melody pitch estimation based on range estimation and candidate extraction using harmonic structure model," in Interspeech, Makuhari, Japan, Sep. 2010, pp. 2902--2905.

25 V. Arora and L. Behera, "On-line melody extraction from polyphonic audio using harmonic cluster tracking," IEEE Trans. on Audio Speech and Language Processing, vol. 21, no. 3, pp. 520 --530, Mar. 2013.

26 C. Hsu and J. R. Jang, "Singing pitch extraction by voice vibrato/tremolo estimation and instrument partial deletion," in 11th Int. Soc. for Music Info. Retrieval Conf., Utrecht, The Netherlands, Aug. 2010, pp. 525--530.

27 T.-C. Yeh, M.-J. Wu, J.-S. Jang, W.-L. Chang, and I.-B. Liao, "A hybrid approach to singing pitch extraction based on trend estimation and hidden Markov models," in IEEE Int. Conf. on Acoustics, Speech and Signal Processing (ICASSP), Kyoto, Japan, Mar. 2012, pp. 457--460.

28 J.-L. Durrieu, G. Richard, B. David, and C. Févotte, "Source/filter model for unsupervised main melody extraction from polyphonic audio signals," Trans. Audio, Speech and Lang. Proc., vol. 18, no. 3, pp. 564-- 575, March 2010.

29 H. Tachibana, T. Ono, N. Ono, and S. Sagayama, "Melody line estimation in homophonic music audio signals based on temporal-variability of melodic source," in IEEE Int. Conf. on Acoustics, Speech and Signal Processing (ICASSP), Mar. 2010, pp. 425--428.

30 G. Poliner and D. Ellis, "A classification approach to melody transcription," in Proc. 6th Int. Conf. on Music Inform. Retrieval, London, Sep. 2005, pp. 161--166.

31 C. Sutton, "Transcription of vocal melodies in popular music," Master's thesis, Queen Mary, University of London, London, UK, 2006.

32 W. Hess, Pitch determination of speech signals: algorithms and devices. Berlin: Springer-Verlag, 1983.

33 E. Gómez, A. Klapuri, and B. Meudic, "Melody description and extraction in the context of music content processing," J. of New Music Research, vol. 32, no. 1, pp. 23--40, 2003.

34 A. Klapuri, "Signal processing methods for the automatic transcription of music," Ph.D. dissertation, Tampere University of Technology, Finland, Apr. 2004.

35 J. Sundberg, The Science of the Singing Voice. DeKalb, IL: Northern Illinois University Press, 1987.

36 K. Dressler, "Sinusoidal extraction using an efficient implementation of a multi-resolution FFT," in Proc. 9th Int. Conf. on Digital Audio Effects (DAFx-06), Montreal, Canada, Sep. 2006, pp. 247--252.

37 --, "Pitch estimation by the pair-wise evaluation of spectral peaks," in AES 42nd Int. Conf., Ilmenau, Germany, Jul. 2011, pp. 278--290.

38 A. Ozerov, P. Philippe, F. Bimbot, and R. Gribonval, "Adaptation of Bayesian models for single-channel source separation and its application to voice/music separation in popular songs," IEEE Trans. on Audio, Speech, and Language Process., vol. 15, no. 5, pp. 1564--1578, Jul. 2007.

39 Y. Li and D. Wang, "Separation of singing voice from music accompaniment for monaural recordings," IEEE Trans. on Audio Speech and Language Processing, vol. 15, no. 4, pp. 1475--1487, May 2007.

40 J.-L. Durrieu, B. David, and G. Richard, "A musically motivated mid-level representation for pitch estimation and musical audio source separation," IEEE Journal on Selected Topics on Signal Processing, vol. 5, no. 6, pp. 1180--1191, Oct. 2011.

41 P.-S. Huang, S. D. Chen, P. Smaragdis, and M. Hasegawa-Johnson, "Singing voice separation from monaural recordings using robust principal component analysis," in IEEE Int. Conf. on Acoustics, Speech and Signal Processing (ICASSP), Kyoto, Japan, Mar. 2012, pp. 57--60.

42 Z. Rafii and B. Pardo, "Repeating pattern extraction technique (REPET): A simple method for music/voice separation," IEEE Trans. on Audio Speech and Language Processing, vol. 21, no. 1, pp. 71--82, Jan. 2013.

43 A. Liutkus, Z. Rafii, R. Badeau, B. Pardo, and G. Richard, "Adaptive filtering for music/voice separation exploiting the repeating musical structure," in IEEE Int. Conf. on Acoustics, Speech and Signal Processing (ICASSP), Kyoto, Japan, Mar. 2012, pp. 53--56.

44 N. Ono, K. Miyamoto, H. Kameoka, J. Le Roux, Y. Uchiyama, E. Tsunoo, T. Nishimoto, and S. Sagayama, "Harmonic and percussive sound separation and its application to MIR-related tasks," in Advances in Music Information Retrieval, ser. Studies in Computational Intelligence, Z. Ras and A. Wieczorkowska, Eds. Springer Berlin / Heidelberg, 2010, vol. 274, pp. 213--236.

45 P. Cancela, E. López, and M. Rocamora, "Fan chirp transform for music representation," in 13th Int. Conf. on Digital Audio Effects (DAFx), Graz, Austria, Sep. 2010, pp. 54--61.

46 W.-H. Tsai, H.-M. Yu, and H.-M. Wang, "Using the similarity of main melodies to identify cover versions of popular songs for music document retrieval," J. of Information Science and Engineering, vol. 24, no. 6, pp. 1669--1687, 2008.

47 M. Marolt, "A mid-level representation for melody-based retrieval in audio collections," Multimedia, IEEE Transactions on, vol. 10, no. 8, pp. 1617--1625, Dec. 2008.

48 J. Song, S. Y. Bae, and K. Yoon, "Mid-level music melody representation of polyphonic audio for query-by-humming system," in 3rd Int. Conf. on Music Info. Retrieval, Paris, France, Oct. 2002.

49 M. Ryynänen and A. Klapuri, "Query by humming of MIDI and audio using locality sensitive hashing," in IEEE Int. Conf. on Acoustics, Speech and Signal Processing (ICASSP), Apr. 2008, pp. 2249--2252.

50 J. Salamon and J. Urbano, "Current challenges in the evaluation of predominant melody extraction algorithms," in 13th Int. Soc. for Music Info. Retrieval Conf., Porto, Portugal, Oct. 2012.

作者简介

Justin Salamon(S'12)于2007年在英国剑桥大学获得计算机科学学士学位(荣誉学位)。2008年,他在西班牙巴塞罗那庞培法布拉大学获得认知系统与交互媒体硕士学位。目前,他是庞培法布拉大学音乐技术组(MTG)的研究员与博士生。在博士学习期间,他曾作为访问研究员,赴法国巴黎声学/音乐协调与研究所(IRCAM)的声音分析-合成研究团队交流。他的主要研究方向是音乐信息检索(MIR),聚焦基于内容的音乐信息检索、音频与音乐处理,包括音乐流估计、旋律与低音线条提取与特征分析、哼唱/示例检索、分类、音乐与旋律相似度及索引技术。

Emilia Gómez(M'13)是庞培法布拉大学信息与通信技术系音乐技术组(MTG)的博士后研究员与助理教授(讲师)。她毕业于塞维利亚大学,获电信工程学位,专业方向为信号处理。随后,她在巴黎IRCAM获得声学、信号处理与计算机音乐应用(ATIAM)深入研究文凭(DEA)。2006年7月,她在庞培法布拉大学获得计算机科学与数字通信博士学位,研究方向为音乐音频信号的调性描述。她的主要研究兴趣包括音乐音频信号的旋律与调性描述、计算机辅助音乐分析与计算民族音乐学。

Daniel P. W. Ellis(M'96--SM'04)在麻省理工学院(MIT)获得电气工程博士学位。他是美国纽约哥伦比亚大学电气工程系副教授。他的语音与音频识别与组织实验室(LabROSA)致力于从音频中提取高层信息的各个方向,包括语音识别、音乐描述与环境声音处理。他还运营着拥有全球2000名感知与认知听觉研究者的AUDITORY邮件列表。在麻省理工学院期间,他是媒体实验室的研究助理;之后数年,他在加州伯克利国际计算机科学研究所担任研究科学家,目前仍是该所的外部研究员。

Gaël Richard(SM'06)于1990年获得法国巴黎电信学院(原法国国立高等电信学校)国家工程师学位,1994年获得巴黎第十一大学LIMSI-CNRS实验室语音合成方向博士学位,并于2001年9月获得巴黎第十一大学指导研究资格(HDR)。博士毕业后,他在新泽西州立罗格斯大学CAIP中心工作两年;1997年至2001年,他先后任职于法国阿尔西的马特拉公司与蒙特鲁日的飞利浦公司。2001年,他加入巴黎电信学院信号与图像处理系,现任音频声学与波形研究组主任、音频信号处理全职教授。他合作发表了超过100篇论文与专利,同时也是欧盟委员会在音频信号处理与人机交互领域的专家之一。

相关推荐
VALENIAN瓦伦尼安教学设备1 小时前
ASHOOTER激光对中仪如何通过颜色确定调整是否合适
数据库·嵌入式硬件·算法
何时梦醒1 小时前
🤖 Harness 工程:用 LLM as Judge + Best of N 打造自优化的 AI 代码生成流水线
前端·人工智能
货拉拉技术1 小时前
重塑 Agent 度量衡:基于 LLM-as-a-Judge 的离线评估体系与实践
算法·设计模式
Wang's Blog1 小时前
AI Agent白手起家58: 项目可观测性——用 LangSmith 实现全链路追踪
数据库·人工智能
小白狮ww1 小时前
小模型「扛」住自由运镜:InSpatio-World 开源实时 4D 模拟器
人工智能·ai
Alkaid20771 小时前
【手搓 Agent 第2.1关】搭建 Agent 进阶能力:RAG(上)
人工智能·agent
躺不平的理查德1 小时前
OpenCV Mat 备忘录
人工智能·opencv·计算机视觉
Days20501 小时前
剪纸风城市文旅宣传海报提示词分享
人工智能·ai作画·gpt-image
只会迪霸戈1 小时前
系统验收测试从3天缩短到3小时:用 TRAE Work 跑完30+接口并自动生成验收报告
人工智能
love530love1 小时前
Photoshop 2026 AI 功能排障复盘:Camera Raw 卡死 / Neural Filters 灰 / 皮肤平滑下载失败 全定位
人工智能·ui·photoshop