国标GB/T 7714-2015标准引用格式
POLINER G E, ELLIS D P W. A classification approach to melody transcriptionC
//Proceedings of the 6th International Conference on Music Information Retrieval (ISMIR 2005). London: Queen Mary, University of London, 2005: 53-59.
文章目录
一种旋律转录的分类方法
Graham E. Poliner 和 Daniel P.W. Ellis
LabROSA,电子工程系,哥伦比亚大学,纽约,NY 10027,美国
{graham,dpwe}@ee.columbia.edu
摘要
旋律为多声部音频提供了一种重要的概念性概括。旋律内容的提取具有实际应用价值,从基于内容的音频检索到音乐结构分析均涵盖其中。与以往基于音乐音高谐波(或周期)结构模型的转录系统不同,我们提出了一种基于分类 的自动旋律转录系统,该系统除了从训练数据中学习到的内容之外,不做任何额外假设。我们通过预测ISMIR 2004旋律竞赛评估集以及新生成的测试数据中的旋律来评估我们算法的成功率。结果表明,支持向量机 旋律分类器产生的效果可与当前最先进的基于模型的转录系统相媲美。
关键词: 旋律转录,分类
1 引言
旋律提供了一种简洁且自然的音乐描述方式。即使对于复杂的多声部信号,感知上的主旋律也是最方便、最易于记忆的描述,并可作为交流和检索的直观基础,例如通过哼唱查询。然而,要部署基于旋律的大规模音乐组织和检索系统,我们需要能够从录制的音乐音频中自动提取旋律的机制。这种转录在音乐学分析和各种潜在的信号变换应用中也具有价值。因此,近年来在主旋律检测领域涌现了大量研究(Goto,2004;Eggink和Brown,2004;Marolt,2004;Paiva等,2004;Li和Wang,2005)。
然而,以往的方法都依赖于基于规则的分析核心,该分析假定特定的音频结构,即音乐音高由特定基频的一组谐波实现。这一假设在音乐声学中有坚实的依据,但并非严格必要:在许多领域(如自动语音识别)中,可以在不了解事件在特征中如何表示的先验知识的情况下,为特定事件构建分类器。
在本文中,我们通过研究一种机器学习系统来生成自动旋律转录,从而深入探究这一见解。我们提出的系统仅通过带标签的示例训练,就能学会推断正确的旋律标签。我们的算法通过一个直接从音频特征数据训练的支持向量机分类器,执行主导旋律音符分类。因此,该系统可以轻松推广到学习许多旋律结构,或针对特定流派进行专门训练。
2 系统描述
我们转录系统的基本流程如下:首先,将输入音频波形转换为某种归一化短时幅度谱 的特征表示。一个在真实多乐器录音和合成MIDI音频上训练的支持向量机(SVM)将每一帧分类为具有特定的主导音高,量化到半音级别。下面将更详细地描述这些步骤中的每一步:
2.1 声学特征
原始音乐录音被合并为单声道并降采样到 8 k H z 8\mathrm{kHz} 8kHz。该波形 x n xn xn通过短时傅里叶变换(STFT)进行转换:
X S T F T k , n = ∑ m = 0 N − 1 x n − m ⋅ w m ⋅ e − j 2 π k m / N ( 1 ) X_{STFT}k,n = \sum_{m = 0}^{N - 1}xn - m \cdot wm \cdot e^{-j2\pi km / N} \quad (1) XSTFTk,n=m=0∑N−1xn−m⋅wm⋅e−j2πkm/N(1)
使用 N = 1024 N = 1024 N=1024点离散傅里叶变换(即128 ms)、一个 N N N点汉宁窗 w n wn wn,以及相邻窗口944点重叠(得到 10 m s 10\mathrm{ms} 10ms的时间网格)。在大多数情况下,仅使用低于 2 k H z 2\mathrm{kHz} 2kHz的频点(即前256个频点)。为改善在不同乐器音色上的泛化能力,我们还尝试了多种特征归一化方案(详见第3节)。在所有情况下,每个音频帧由一个256维的输入向量表示。
2.2 支持向量机
带标签的音频特征向量用于训练一个SVM,该SVM为系统所区分的每个音符分配一个类别标签 。SVM是一种有监督分类系统 ,它利用高维特征空间中的线性函数假设空间,来学习与所有训练模式距离最远的分离超平面。因此,SVM分类试图推广得到类别之间的最优决策边界。给定空间中的带标签训练数据通过最大间隔超平面进行分离。在 N N N类多类判别的情况下,从 N ( N − 1 ) / 2 N(N - 1) / 2 N(N−1)/2个成对判别函数的输出中采取多数投票。为了对每一帧的主旋律音符进行分类,我们假设某一时刻的旋律音符仅依赖于低于 2 k H z 2\mathrm{kHz} 2kHz的归一化频率数据。我们进一步假设每一帧独立于所有其他帧。
2.3 训练数据
一个有监督分类器需要大量特征向量及其真实标签的配对语料来进行训练。通常,更多数量和更多样性的训练数据将产生更准确和更成功的分类器。因此,在基于分类的转录方法中,最大的问题变成了收集合适的训练数据。尽管与真实音频对齐的数字乐谱数量非常有限,但仍有一些方向有助于生成带标签的音频。在本实验中,我们研究了多轨录音和MIDI音频文件作为训练数据来源。
2.3.1 多轨录音
流行音乐录音通常通过叠加多个独立录制的音轨来创建。在某些情况下,艺术家(或其唱片公司)可能会以CD或 12 ∘ 12^{\circ} 12∘黑胶单曲的形式提供单独的人声和乐器音轨。"清唱"人声录音可以作为完整合奏音乐中真实音高的来源,因为它们通常可以使用标准工具进行音高跟踪。只要我们能够记录清唱录音中的哪些时间点对应于完整音乐(人声加伴奏)中的哪些时间点,我们就可以自动提供真实音高。请注意,清唱录音仅用于生成真实音高;分类器不在孤立人声上进行训练(因为我们不期望在那样数据上使用它)。
我们获得了30组多轨录音,涵盖爵士、流行、R&B和摇滚等流派。数字录音从CD读取,然后降采样为 8 k H z 8\mathrm{kHz} 8kHz采样率的单声道文件。 12 ∘ 12^{\circ} 12∘黑胶录音从模拟转换为数字单声道文件,采样率为 8 k H z 8\mathrm{kHz} 8kHz。
对于每首歌曲,使用YIN基频估计器(de Cheveigne和Kawahara,2002)估计旋律轨道的基频。基频预测以 10 m s 10\mathrm{ms} 10ms步长计算,并限制在100到 1000 H z 1000\mathrm{Hz} 1000Hz范围内。YIN定义了一个周期性度量:
P p e r i o d i c i t y = P P E R I O D I C P T O T ( 2 ) P_{periodicity} = \frac{P_{PERIODIC}}{P_{TOT}} \quad (2) Pperiodicity=PTOTPPERIODIC(2)
其中 P P E R I O D I C P_{PERIODIC} PPERIODIC是检测到的周期性的谐波所对应的能量, P T O T P_{TOT} PTOT是一帧的总能量;只有周期性至少为 95 % 95\% 95%(对应于清晰的浊音音符)的帧才被用作训练样本。
为了将清唱录音与完整合奏录音对齐,我们沿着Turetsky和Ellis(2003)中描述的思路,对每个信号的STFT表示执行动态时间规整(DTW)对齐。对该时间对齐进行平滑和线性插值,以获得逐帧对应关系。对齐结果经过手动验证和校正,以确保训练数据的完整性。通过计算在对应于STFT帧的时刻,单音预测最接近的MIDI音符编号,来分配目标标签。
2.3.2 MIDI文件
MIDI介质使用户能够合成音频并同时创建数字乐谱。存在大量MIDI文件集,包含来自各种流派的众多演绎版本。我们的MIDI训练数据由从www.findmidis.com下载的30首经常下载的流行歌曲组成。
使用Apple iTunes中的MIDI合成器,将训练文件从标准MIDI文件格式转换为采样率为 8 k H z 8\mathrm{kHz} 8kHz的单声道音频文件(.WAV)。
为找到对应的真实音高,将MIDI文件解析为包含相关音频信息(即轨道、通道号、音符事件等)的数据结构。通过利用MIDI中表示主声部的约定,来隔离和提取旋律。通常,流行MIDI文件中的主声部由独立通道上的单音轨道表示。若主音轨中存在多个同时音符,则假定旋律为其中最高的音符。通过在与合成音频分析中每个STFT帧精确对应的时刻对MIDI转录进行采样,来确定目标标签。
2.3.3 重采样音频
当代表性训练集可用性有限时,可以通过对录音进行重采样以实现整体音高偏移,从而扩展训练数据的数量和多样性。将多轨和MIDI录音以对应于半音阶上对称半音频率偏移(即 ± 1 , 2 , ... 6 \pm 1,2,\ldots 6 ±1,2,...6半音)的速率进行重采样。真实标签相应地缩放,并进行线性插值以调整时间对齐。这种方法使训练分布更接近高斯分布,并减少了训练集中特定调性造成的偏差。
3 实验
使用WEKA实现的Platt多项式序列最小优化(SMO)SVM算法,将频域音频特征映射到MIDI音符编号类别(Witten和Frank,2000;Platt,1998)。使用默认学习参数值( C = 1 \mathrm{C} = 1 C=1,epsilon = 10 − 12 = 10^{- 12} =10−12,容差参数 = 10 3 = 10^{3} =103)来训练分类器。每个音频帧由一个256维输入向量表示,对于 N N N类分类,有60个潜在输出类别,覆盖从G2到F#7的五个八度范围;对于 N N N个二元分类,有12个潜在输出类别,代表一个八度的半音音阶。我们选择了30个多轨录音和30个具有清晰主导旋律的MIDI文件用于实验;对于每个文件,随机选择1000个存在主导旋律的帧(10秒音频数据)作为训练帧。指定10个多轨录音和10个MIDI文件作为测试集,并使用ISMIR 2004旋律竞赛测试集作为验证集(Gomez等,2004)。这是2004年夏季进行的首次此类国际主旋律提取评估。评估数据(现已发布)包含20个片段,来自5种风格各4个,覆盖广泛的音乐流派,每个片段约30秒音频。按照该评估的惯例,为了计算准确率,我们将每个有音高帧的真实频率量化到最近的半音(即其MIDI编号),并统计分类器预测不同音符(或在某些情况下预测不同半音,即容忍八度错误)的帧为错误。在本文中,我们不涉及检测不包含任何"前景"旋律(因此不应转录任何音符)的帧的问题。
3.1 N N N类分类
我们使用七种不同的音频特征归一化方案训练了独立的 N N N类SVM分类器。三种归一化使用STFT,四种使用梅尔频率倒谱系数(MFCC)。第一种情况下,我们直接使用STFT的幅度,并归一化使得每首歌曲中能量最大的帧的值为1。第二种情况下,STFT幅度在每个时间帧内进行归一化,使其在一个51帧的局部频率窗口内达到零均值和单位方差,目的是减少训练和测试数据中不同乐器音色和上下文带来的影响。第三种归一化方案对STFT幅度应用立方根压缩,使较大的频谱幅度看起来更相似;立方根压缩通常用作人耳响度敏感度的近似。
第四种特征配置通过计算STFT幅度的逆傅里叶变换(IFT)得到音频信号的自相关。对对数STFT幅度进行IFT得到倒谱,这是我们的第五种特征类型。由于整体增益和宽频谱形状包含在前几个倒谱系数中,而周期性出现在更高的索引处,该特征也执行了一种音色归一化。我们还尝试了将这些基于自相关的特征按照频谱应用的局部均值和方差均衡进行归一化,以及通过滤波(对高阶倒谱系数乘以指数权重)进行归一化。
对于所有归一化方案,我们比较了在多轨训练集、MIDI训练集以及两者组合上训练的SVM分类器。一个示例学习曲线(基于局部归一化频谱数据)如图1所示。分类误差数据通过在训练集的随机选择部分上进行训练,用于交叉验证、测试和验证。测试集和验证集的分类误差在大约100秒随机选择的训练音频后趋于渐近。尽管仅在MIDI数据上训练的分类器在ISMIR验证集上泛化良好,但MIDI文件内部方差太大,导致该分类器在MIDI测试集上泛化较差。

图1 :分类器帧错误率随训练数据量变化的曲线,分别在真实录音(左)和MIDI合成(右)上训练。训练数据的 100 % 100\% 100%对应30,000帧或300秒音频。曲线显示了在训练集、测试集以及独立的ISMIR 2004集(见正文)上的准确率。
表1比较了在不同归一化方案上训练的分类器的准确率。我们分别展示了仅在多轨音频、仅在MIDI合成以及两种数据源组合上训练的分类器的结果。帧准确率结果针对ISMIR 2004旋律评估集,对应于最近半音的10次转录。
基于分类的方法的一个缺点是,分类器在与训练数据不相似的测试数据上会表现不可预测,而我们方法的一个特别弱点在于故意忽略频谱与音高之间关系的先验知识,导致系统无法从已见过的音符泛化到不同音高。例如,ISMIR测试集中女声歌剧样本的最高 f 0 f_{0} f0值超过了我们所有训练数据中的最高音高。此外,ISMIR集包含的风格流派差异(如歌剧)与我们的流行音乐语料库不匹配。然而,如果期望输出状态映射到一个八度范围内,则大量此类错误会减少。忽略八度错误后,在ISMIR测试集上的平均有音高帧准确率超过了 70 % 70\% 70%。
表1 :在ISMIR 2004集上,每种考虑的归一化方案在仅多轨音频、仅MIDI合成或两者组合训练下的帧准确率百分比。
| 归一化方案 | 多轨 | MIDI | 两者组合 |
|---|---|---|---|
| STFT | 54.5 | 45.8 | 59.0 |
| 51-点归一化 | 52.7 | 51.3 | 62.7 |
| 立方根 | 55.1 | 47.1 | 62.4 |
| 自相关 | 53.6 | 51.9 | 59.0 |
| 倒谱 | 48.5 | 44.7 | 52.1 |
| 归一化自相关 | 40.8 | 38.5 | 44.6 |
| 提升倒谱 | 53.4 | 48.6 | 60.3 |
我们额外训练了六个分类器,以展示重采样音频对分类成功率的影响。将所有多轨和MIDI文件重采样到正负1到6个半音,并使用最佳性能的归一化方案,在ISMIR 2004测试集上测试了在这些重采样音频上训练的分类器。图3显示了当重采样训练数据量从 ± 1 ... 6 \pm 1\ldots 6 ±1...6半音变化时的分类成功率。

图3 :包含经过移调的训练数据版本的影响。当训练数据在所有半音移调(最高到 ± 6 \pm 6 ±6半音)上被复制时,原始转录的帧准确率提高了约 5 % 5\% 5%绝对值,而半音(八度等价)转录的帧准确率提高了约 2 % 2\% 2%绝对值。
包含重采样训练数据将分类准确率提高了超过 5 % 5\% 5%。在图2中,显示了使用重采样音频训练的SVM分类器与2004年评估中20个测试样本的最佳性能系统相比的有音高帧转录成功率,其中音高估计已经过时间偏移以最大化转录准确率(Paiva等,2004)。

图2:在ISMIR 2004评估集的20个片段上,转录帧准确率的变化。实线表示基于分类的转录器;虚线表示2004年评估中最佳性能系统的结果。上图是原始音高准确率;下图将所有结果折叠到一个八度的12个半音箱中,以忽略八度错误。
3.2 N N N个二元分类器
除了 N N N类旋律分类之外,我们训练了12个二元SVM分类器,代表西方音阶的一个八度("半音"类)。分类器在给定半音的所有出现以及相等数量的随机选择的负例上进行训练。我们将到分类器边界超平面的距离作为这些类别中每个类别的对数后验概率的粗略等价;图4显示了一个示例"后验图",展示了这12个不同分类器的激活随时间的变化,针对两个示例;真实标签叠加在上面。对于上方的简单旋律,我们可以看到系统表现良好;对于下方的女声歌剧示例,我们系统对数据的不熟悉非常明显。
图表标题
图4:"后验图"显示12个分类器在八度不同音符上训练的到分类器边界距离的时间变化。真实标签用点绘制。上图是一个表现良好的简单旋律示例。下图是一个表现较差的女声歌剧片段。
4 讨论与结论
首先观察表1,最明显的结果是除"NormAutoco"外,所有特征表现大致相同,其中51点跨频率局部均值和方差归一化略占优势。从某种意义上说,这并不奇怪,因为它们都包含大致等效的信息,但这也引发了关于我们的归一化(以及系统泛化能力)效果如何的问题(尽管注意,"多轨"和"MIDI"数据之间最大的差异------这在一定程度上是泛化失败的度量------出现在第一行,即仅通过全局最大值归一化的STFT特征)。可能还存在更好的归一化方案有待发现。
观察表中的列,我们看到更真实的多轨数据确实比MIDI合成构成更好的训练集,后者与大多数评估片段的声学相似度要低得多。同时使用两者,从而获得更多样化的训练集,总能带来显著的准确率提升------对表现最佳的51点归一化特征而言,绝对提升高达 10 % 10\% 10%。我们可以假设在额外的多样化数据(例如,歌剧)上训练将进一步提高在该评估集上的性能。
如图2所示,我们基于分类器的系统与2004年评估中最佳性能系统相比具有竞争力,且平均略好几个百分点。这一结果还须考虑到该系统中未应用任何后处理。相反,性能代表了每个音频帧的原始独立分类的得分。通常,从简单的中值滤波 到复杂的音乐期望模型,各种平滑、清理和离群值去除技术都被用来改进底层声学模型的原始音高估计。
这正是我们对图4中所示的多个并行分类器感兴趣的基础。通过将声学模型的结果表示为不同音符上的概率分布,该前端可以有效地与基于概率推理的后端集成。特别是,我们正在研究从上述大量MIDI文件中提取的旋律中训练可能的音符序列模型。我们进一步对隐藏模式模型感兴趣,这些模型可以学习并识别旋律所暗示的局部调性或"模式"等潜在约束,并自动将这些约束纳入旋律中,就像Ryynanen和Klapuri(2004)中明确做的那样。
我们注意到,最差的表现出现在"歌剧"样本上,尤其是女声歌剧,如前述,其中一些音符超出了我们训练集覆盖的范围(因此我们的分类器永远无法报告)。虽然这突显了基于模型的转录与我们基于示例的分类器相比的优势(因为它们直接跨音高泛化),但存在一种自然的折中方案:通过将我们的训练音频按正负几个半音进行重采样,并将这些"移调"版本作为额外训练数据(真实标签相应偏移),我们可以"教会"我们的分类器,即一个简单频谱偏移对应一个音符变化,正如基于模型的系统中隐含的那样。
同样,我们可以问,训练后的分类器可能学到哪些基于模型的系统尚未知晓的内容。通过在上下文中训练特定音符的所有示例,分类器转录器不仅可以观察到与目标音高对应的频谱(或自相关)中的显著谐波,还可以观察到伴奏中的任何统计规律性(例如最可能的伴奏音符)。观察图4,例如上方面板的最后一个音符,尽管实际音符是B,但分类器将其与G混淆------可能是因为在许多训练实例中,旋律G包含了来自伴奏B的强谐波,这在某些情况下可能是一个有用的规律性。的确,注意到我们当前的分类器仅用几秒训练材料就似乎饱和了,我们可以考虑通过包含更丰富的条件输入来训练更复杂的分类器;上面建议的推断"模式"隐藏状态显然是一个竞争者。
完整的旋律竞赛不仅涉及确定主旋律活跃帧的音符,还涉及区分旋律和非旋律(伴奏)帧,这显然是一个非常困难的问题。然而,它非常适合分类器:一旦我们有了带标签的真实数据,我们可以训练一个单独的分类器(或在现有分类器中增加一个新的输出)来指示何时检测到背景且不应发出旋律音符;不同的特征(包括总体能量)和不同的归一化方案适用于这个决策。
总之,我们已经表明,这种新颖的旋律转录方法------将所有内容基本留给学习算法,并且没有将音乐音高结构的实质性先验知识硬编码------是可行的、具有竞争力的,且易于实现。最大的挑战是获取训练数据,尽管在我们的配置中所需的数据量并不过多。我们强调,这仅仅是一个更完整的音乐转录系统的第一阶段,我们旨在每一层都建立在从音乐示例中学习而不是通过编码的专家知识的原则之上。
致谢
非常感谢Emilia Gomez、Beesuan Ong和Sebastian Streich组织了2004年ISMIR旋律竞赛,并提供了结果。本工作得到了哥伦比亚学术质量基金和美国国家科学基金会(NSF)资助号 IIS-0238301的支持。本文中的任何观点、发现、结论或建议均为作者个人意见,并不一定反映NSF的观点。
参考文献
A. de Cheveigne and H. Kawahara. Yin, a fundamental frequency estimator for speech and music. Journal Acoustic Society of America, 111(4):1917-1930, 2002.
J. Eggink and G. J. Brown. Extracting melody lines from complex audio. In Proc. Int. Conf. on Music Info. Retrieval ISMIR-03, pages 84-91, 2004.
E. Gomez, B. Ong, and S. Streich. Ismir 2004 melody extraction competition contest definition page, 2004. http://ismir2004.ismir.net/melody_contest/results.html.
M. Goto. A predominant-f0 estimation method for polyphonic musical audio signals. In 18th International Congress on Acoustics, pages 1085-1088, 2004.
Y. Li and D. Wang. Detecting pitch of singing voice in polyphonic audio. In IEEE International Conference on Acoustics, Speech, and Signal Processing, pages III.17-21, 2005.
M. Marolt. On finding melodic lines in audio recordings. In DAFx, 2004.
R. P. Paiva, T. Mendes, and A. Cardoso. A methodology for detection of melody in polyphonic music signals. In 116th AES Convention, 2004.
J. Platt. Fast training of support vector machines using sequential minimal optimization. In B. Scholkopf, C. J. C. Burges, and A. J. Smola, editors, Advances in Kernel Methods - Support Vector Learning, pages 185-208. MIT Press, Cambridge, MA, 1998.
M. P. Ryynanen and A. P. Klapuri. Modelling of note events for singing transcription. In Proc. ISCA Tutorial and Research Workshop on Statistical and Perceptual Audio Processing, Jeju, Korea, October 2004. URL http://www.cs.tut.fi/\~mryynane/mryynane_final_sapa04.pdf.
R. J. Turetsky and D. P. Ellis. Ground-truth transcriptions of real music from force-aligned midi syntheses. In Proc. Int. Conf. on Music Info. Retrieval ISMIR-03, 2003.
I. H. Witten and E. Frank. Data Mining: Practical machine learning tools with Java implementations. Morgan Kaufmann, San Francisco, CA, USA, 2000. ISBN 1-55860-552-5.