1.4、音频标注
| 序号 | 标注类型 | 核心任务 | 典型应用 |
|---|---|---|---|
| 1 | 语音转写(ASR) | 将语音内容转写为文字 | 语音助手、会议记录、字幕生成 |
| 2 | 语音活动检测(VAD) | 标记音频中语音段的起止时间 | 降噪处理、语音唤醒、通信系统 |
| 3 | 说话人分类/日志 | 区分音频中有几位说话人、谁在何时说话 | 会议转录、智能音箱、声纹识别 |
| 4 | 声音事件检测(SED) | 识别并标注非语音的环境声音 | 安防监控、智慧城市、内容审核 |
| 5 | 语音情感/语调标注 | 标注说话人的情绪状态和语气 | 智能客服、心理健康分析 |
| 6 | 语言/方言标注 | 标注音频所使用的语言或方言 | 多语言模型训练、翻译系统 |
| 7 | 音素/发音标注 | 标注音素序列、重音、停顿等 | 语音合成(TTS)、发音评测 |
| 8 | 音频质量/噪音标注 | 标注音频的整体质量和噪音类型 | 音频增强、设备测试 |
1.4.1、语音转写(ASR标注)
任务描述:将音频中的人声逐字转写成文本,包含标点和数字标准化。
常用标签体系:
| 标签 | 说明 |
|---|---|
| 转写文本 | 音频内容的完整文字记录 |
| 标点符号 | 添加逗号、句号、问号等,使文本符合语法 |
| 数字标准化 | "123"转写为"一百二十三"或"一二三",按项目要求 |
| 特殊标记 | 如 [笑声] [音乐] [咳嗽] [静音] 等非语音事件 |
标注方式:听音频,逐句、逐字转写;添加合适标点;数字按规则(是"一二三"还是"123");非语音事件用方括号标注。
📌 案例1:客服通话
🎵 音频内容 :客服与客户的对话片段------"喂,您好,请问您需要什么帮助?"
🏷️ 转写结果 :
"喂,您好,请问您需要什么帮助?"📌 标注说明:完整转写,添加问号和逗号,语气词"喂"保留。
📌 案例2:语音指令🎵 音频内容 :用户对智能音箱说------"我想听周杰伦的七里香"
🏷️ 转写结果 :
"我想听周杰伦的《七里香》"📌 标注说明:歌曲名加书名号,歌手名准确转写。
1.4.2、语音活动检测(VAD / 端点检测)
任务描述:标记音频中人声开始和结束的时间点,识别哪些时间段包含人声。
常用标签体系:
| 标签 | 说明 |
|---|---|
| 语音段 (speech) | 包含人声的有效语音片段 |
| 静音段 (silence) | 完全没有声音的空白段 |
| 噪音段 (noise) | 有声音但不是人声(如风声、交通声) |
标注方式:听音频,标注人声的起始和结束时间戳(精确到毫秒);静音段和纯噪音段不标注人声;背景噪音不影响"语音段"判定(只要有人在说话)。
📌 案例1:单人录音
🎵 音频总时长 :10.0秒
📝 内容 :0-0.5秒静音 → 0.5-7.2秒人声 → 7.2-10.0秒静音
🏷️ 标注结果:
- 语音段:
[0.500s, 7.200s]
📌 标注说明:人声从0.5秒开始,7.2秒结束;前后静音不标。
📌 案例2:面试对话🎵 音频总时长 :30.0秒
📝 内容 :0-2.0秒静音 → 2.0-12.0秒人声 → 12.0-14.0秒静音 → 14.0-25.0秒人声 → 25.0-30.0秒静音
🏷️ 标注结果:
- 语音段1:
[2.000s, 12.000s]- 语音段2:
[14.000s, 25.000s]
📌 标注说明:中间静音2秒分开标注为两个独立语音段。
1.4.3、说话人分类 / 说话人日志
任务描述:区分同一音频中的不同说话人,并标注每个时间片段是谁在说话。
常用标签体系:
| 标签 | 说明 |
|---|---|
| 说话人A (speaker_A) | 第一个说话人 |
| 说话人B (speaker_B) | 第二个说话人 |
| 说话人C (speaker_C) | 第三个说话人(可根据实际数量增加) |
| 未知说话人 (unknown) | 无法确认身份的人声 |
标注方式 :听音频,区分不同音色的人声;标注每个说话人的起止时间戳;重叠说话(两人同时说话)需要分别标注;未知说话人用 unknown 标签。
📌 案例1:双人对话
🎵 音频总时长 :20.0秒
📝 内容 :0-8.0秒男声说话 → 8.0-14.0秒女声说话 → 14.0-20.0秒男声说话
🏷️ 标注结果:
[0.000s, 8.000s]→说话人A(男声)[8.000s, 14.000s]→说话人B(女声)[14.000s, 20.000s]→说话人A(男声)
📌 标注说明:同一说话人再次出现时使用相同标签,不重新编号。
📌 案例2:三人会议🎵 音频总时长 :30.0秒
📝 内容 :0-10.0秒说话人A → 10.0-15.0秒说话人B → 15.0-22.0秒说话人C → 22.0-25.0秒说话人A和C重叠说话 → 25.0-30.0秒说话人B
🏷️ 标注结果:
[0.000s, 10.000s]→说话人A[10.000s, 15.000s]→说话人B[15.000s, 22.000s]→说话人C[22.000s, 25.000s]→说话人A和说话人C(重叠,分别标注)[25.000s, 30.000s]→说话人B
📌 标注说明:重叠说话时段,两个说话人同时存在,分别标注时间区间和标签。
1.4.4、声音事件检测(SED)
任务描述:在音频中识别并标注非人声的环境声音事件(如狗叫、汽车鸣笛、玻璃破碎等)。
常用标签体系:
| 标签 | 英文标识 | 说明 |
|---|---|---|
| 狗叫声 | dog_bark | 犬科动物吠叫声 |
| 汽车喇叭 | car_horn | 车辆鸣笛声 |
| 警报声 | alarm | 火警、防盗报警等 |
| 雨声 | rain | 下雨的声音 |
| 敲门声 | knock | 敲门或敲击声 |
| 玻璃破碎 | glass_break | 玻璃碎裂声 |
| 音乐 | music | 背景音乐、乐器演奏 |
| 笑声 | laugh | 人类笑声(非语音内容) |
标注方式:听音频,识别事件类型;标注事件起始和结束时间戳;多个事件重叠需分别标注;只标注预定义标签范围内的事件。
📌 案例1:家庭安防录音
🎵 音频总时长 :12.0秒
📝 内容 :0-2.0秒静音 → 2.0-4.5秒狗叫声 → 4.5-7.0秒敲门声 → 7.0-12.0秒静音
🏷️ 标注结果:
[2.000s, 4.500s]→狗叫声[4.500s, 7.000s]→敲门声
📌 标注说明:每个声音事件独立标注起止时间,事件之间用静音区分。
📌 案例2:街道环境录音🎵 音频总时长 :15.0秒
📝 内容 :0-4.0秒交通噪音 → 4.0-5.5秒汽车鸣笛 → 5.5-9.0秒人声说话 → 9.0-11.0秒警报声 → 11.0-15.0秒交通噪音
🏷️ 标注结果:
[4.000s, 5.500s]→汽车喇叭[9.000s, 11.000s]→警报声
📌 标注说明:背景交通噪音不标注(未被纳入标签体系),只标注预定义事件;人声说话归类为语音,不由SED任务标注。
1.4.5、语音情感 / 语调标注
任务描述:根据音频中的语气、节奏、音高等特征,标注说话人的情绪状态。
常用标签体系:
| 标签 | 英文标识 | 说明 |
|---|---|---|
| 愤怒 | angry | 语气强烈、高频、语速快 |
| 快乐 | happy | 语气轻快、语调上扬 |
| 中性 | neutral | 无明显情绪、平稳陈述 |
| 悲伤 | sad | 语速慢、音调低、气息弱 |
| 恐惧 | fearful | 语气紧张、颤抖、音高不稳 |
| 惊讶 | surprised | 语调突然上扬、语气强烈 |
标注方式 :听整个句子或语音片段,综合判断情感类别;优先标注最明显的情感;中性为默认选项;时长过短(<0.5秒)不标。
📌 案例1:愤怒情绪
🎵 音频内容 :"你凭什么这么做!"(语速快、音量高、尾调上扬)
🏷️ 标签 :
愤怒📌 标注说明:语速急促、音量显著升高、语气带有明显攻击性,符合"愤怒"判定标准。
📌 案例2:悲伤情绪🎵 音频内容 :"我真的很想他......"(语速慢、音量低、尾调下沉)
🏷️ 标签 :
悲伤📌 标注说明:语速明显缓慢,音量偏低,语气低沉无力,符合"悲伤"判定标准。
1.4.6、语言 / 方言标注
任务描述:标注音频中所使用的语言类型或方言,常用于多语言模型训练和语种识别。
常用标签体系:
| 标签 | 英文标识 | 说明 |
|---|---|---|
| 普通话 | mandarin | 标准中文普通话 |
| 粤语 | cantonese | 广东话/香港话 |
| 英语 | english | 英语 |
| 四川话 | sichuanese | 四川方言 |
| 上海话 | shanghainese | 吴语上海话 |
| 多语言混合 | mixed | 包含两种及以上语言 |
标注方式:听完整音频,判断主要语言/方言;如有多种语言,标注占比最高的语言,或标为"混合";不要求听懂含义,靠音系特征判断(如粤语的入声、四川话的儿化音)。
📌 案例1:普通话
🎵 音频内容 :"大家好,欢迎收看今天的新闻。"(标准普通话发音)
🏷️ 标签 :
普通话📌 标注说明:发音清晰,无明显方言口音,符合普通话标准。
📌 案例2:粤语🎵 音频内容 :"今日天气好热啊。"(粤语发音)
🏷️ 标签 :
粤语📌 标注说明:词汇、语调、声母韵母特征均符合粤语,与普通话有明显区别。
1.4.7、音素 / 发音标注
任务描述:标注音频中每个音素的边界、重音、连读、停顿等特征,用于语音合成(TTS)和发音评测。
常用标签体系(以汉语拼音为例):
| 标签 | 说明 |
|---|---|
| 声母 / 韵母 | 标注每个汉字的声母、韵母边界 |
| 音调 | 标注四声调值(1-4声) |
| 重音 | 标记词语的重读位置 |
| 停顿 | 标记句中停顿的时长和位置 |
| 连读 | 标记连续发音的语流特征 |
标注方式:结合波形和频谱图,标记音素边界(精确到10ms);标注声调数值;听辨重音和停顿位置;需要专业语言学背景。
📌 案例1:TTS音素标注
🎵 音频内容 :单字发音------"好"(hǎo)
🏷️ 标注结果:
- 声母
h:[0.000s, 0.150s]- 韵母
ao:[0.150s, 0.500s]- 声调:
第三声(214调值)
📌 标注说明:音素边界清晰,声调为下降转上升的第三声。
📌 案例2:语句停顿标注🎵 音频内容 :"今天天气真好,我们出去玩吧。"
🏷️ 标注结果:
- 停顿时长("真好"之后):
0.350s- 停顿时长("出去玩吧"之前):
0.100s- 重音词:
"真"(强调天气好的程度)
📌 标注说明:句中自然停顿约0.35秒,"真"字有重读。
1.4.8、音频质量 / 噪音标注
任务描述:评估音频的整体质量,标注背景噪音类型和干扰程度。
常用标签体系:
| 标签 | 英文标识 | 说明 |
|---|---|---|
| 清晰 | clear | 无噪音、语音清晰 |
| 背景噪音 | background_noise | 有持续环境噪声 |
| 回声 | echo | 有明显回声或混响 |
| 音量过低 | low_volume | 整体音量显著偏低 |
| 音量过高/削波 | clipping | 音量过大导致失真 |
| 多重噪音 | multiple_noise | 多种噪音混合 |
| 风噪 | wind_noise | 麦克风被风吹产生的声音 |
标注方式:听完整音频,判断主要质量问题;可多选(如"背景噪音 + 回声");标注严重程度(轻微/中等/严重)。
📌 案例1:背景噪音
🎵 音频内容 :一段在咖啡厅录制的采访,人声清晰但背景有持续的杯碟碰撞声和交谈声。
🏷️ 标签 :
背景噪音(中等)📌 标注说明:背景音持续存在但不影响核心人声辨识,判定为"中等"干扰。
📌 案例2:回声失真🎵 音频内容 :一段在空旷会议室录制的语音,有明显回音和混响。
🏷️ 标签 :
回声(严重)📌 标注说明:回声明显导致语音模糊,判定为"严重"质量缺陷,可能需要重新录音。
1.4.9、时间精度标准
| 标注类型 | 时间精度要求 |
|---|---|
| 语音转写(ASR) | 无需时间戳(逐句即可),或按句标注 |
| 语音活动检测(VAD) | 毫秒级(±50ms) |
| 说话人分类 | 毫秒级(±100ms) |
| 声音事件检测 | 毫秒级(±100ms) |
| 语音情感标注 | 按句/按话语片段(无严格时间精度) |
| 语言/方言标注 | 按完整音频或长片段(无严格时间精度) |
| 音素标注 | 10ms级(±10ms) |
| 音频质量标注 | 按完整音频(无严格时间精度) |
1.4.10、输出格式
| 标注类型 | 推荐输出格式 | 样例 |
|---|---|---|
| 语音转写 | JSON / TXT | {"start": 0.0, "end": 5.2, "text": "今天天气真好"} |
| 语音活动检测 | JSON | {"start": 0.5, "end": 7.2, "label": "speech"} |
| 说话人分类 | JSON / RTTM | {"start": 0.0, "end": 8.0, "speaker": "A"} |
| 声音事件检测 | JSON | {"start": 2.0, "end": 4.5, "event": "dog_bark"} |
| 语音情感标注 | JSON / CSV | {"start": 0.0, "end": 3.0, "emotion": "angry"} |
| 语言标注 | JSON / CSV | {"language": "mandarin"} |
| 音素标注 | TextGrid / JSON | {"phoneme": "h", "start": 0.0, "end": 0.15} |
| 音频质量标注 | JSON | {"quality": "background_noise", "severity": "moderate"} |