这篇是写给谁的
- 做播客/口播的:一小时录音里一半是废话,剪掉再发;
- 剪课程/访谈的:几段素材要按顺序拼成一个完整文件;
- 做自媒体的:片头片尾音乐和正文要拼在一起,或者把某段音频掐头去尾。
两个工具是配套关系 :先用「裁剪音频」把每段素材剪到想要的长度,再用「音频拼接」按顺序合成一个文件。这篇把两个都讲透,顺带解决剪音频最烦人的问题------接缝处的"咔哒"爆音。
第一部分:裁剪音频(6 步)
Step 1:进入「裁剪音频」页
官网顶部导航点「裁剪音频」。右上角三步指示:① 加载音频 → ② 设置片段 → ③ 提交裁剪。

注意上传区的小字提示:仅支持音频文件。视频文件请先在「格式转换」或「视频转音频」里提出音轨(下一篇会讲)。
Step 2:加载音频,看懂波形图
点「选择音频文件」,进入裁剪界面:

这个界面信息量不小,逐个说:
- 顶部:文件名 + 总时长(右上角显示文件大小);
- 中间大波形 :横向是时间轴(左 00:00:00 → 右 00:03:31),纵向是音量------波峰越密越高,声音越响。波形两端各有一个蓝色竖条手柄,可以直接拖拽选区;
- 下方三个输入框:开始时间(秒)、结束时间(秒)、输出格式。
关于"为什么用秒数而不是 03:31" :这是最容易卡住新手的地方。输入框要的是纯秒数 ------页面上方显示 00:03:31,换算成秒就是 3×60+31=211。心算不过来就用手机算一下,别填 331。
多花 30 秒读波形,后面省 30 分钟。波形图不只是个装饰:
- 密集高波=声音大而连续(音乐、多人抢话、嘈杂环境)------这种段落慎切,切哪都有声;
- 稀疏低波 =静音、轻声、换气------这里是理想的切点;
- 突然的长段平线=录音里有大段空白(忘关麦克风、等人说话)------裁剪的主目标就是它们。
先扫一眼波形找到"最瘦的位置",比反复试听定位快得多。这也是为什么这个工具把波形做得这么直观------看图下刀,比听声下刀准。
Step 3:定位切点------先拖后微调
两种方式定位,建议先用拖拽粗定位,再用输入框精修:
- 拖波形两端的蓝色手柄,把选区大概拖到想要的范围;
- 输入框里填精确的秒数,开始/结束各一个;
- 中间有「后退5秒」「前进5秒」两个按钮,配合播放键做逐段试听校准。

试听是必须的------图上看着完美、一听切错位置的情况,十次里有三次。点中间的播放键,只播放选区内的内容,确认开头结尾都对。
切点怎么选才不爆音(这是本次的核心技巧,单独展开):
爆音的原理很朴素:声音是振动,波形图上是一条上下摆动的曲线。如果你在曲线摆到中间(非零点)时硬切,切段衔接处会产生一个突兀的跳变------听感就是"咔哒"一声。
所以切点要选在波形最矮的地方------低谷、静音段、说话人换气的间隙。看波形图找"最瘦"的位置下刀,比听十遍更有效。
Step 4:选输出格式

三个选项的选型逻辑:
|---------|------------------|-----------------------|
| 格式 | 定位 | 什么时候选 |
| MP3 | 有损,通用性之王 | 默认选它------体积小、所有平台都认 |
| WAV | 无损,体积大 | 后期还要进剪辑软件二次处理 |
| AAC | 有损,同码率比 MP3 音质略好 | 目标平台明确支持 AAC、追求小体积高音质 |
一个反直觉的点 :如果你裁完还要拼接,裁剪时选 WAV、拼接时输出再选 MP3。原理是:MP3 这类有损编码每存一次就损失一次,中间环节尽量用无损(WAV)当"工作格式",最后一步才转有损。这比"每一步都用 MP3"的最终音质要好一截。
Step 5:立即裁剪

确认选区和格式,点底部蓝色「立即裁剪」。任务进云端队列,完成后去「转换记录」下载------和录音转文字一样,24 小时内记得下载。
Step 6(多段素材):重复以上流程
要剪多段就重复 Step 1-5。每段一个文件,命名建议带序号(01_片头.mp3、02_正文上.mp3),下一步拼接时顺序一目了然。
第二部分:音频拼接(4 步)
Step 1:进入「音频拼接」页,至少选 2 个文件
顶部导航点「音频拼接」。三步指示:① 添加音频 → ② 调整顺序 → ③ 开始拼接。

上传区明确写着:支持多选音频文件,至少选择 2 个文件。只传一个会无法提交------这个工具的存在意义就是把多段合成一段。
Step 2:在处理列表里调整顺序

处理列表几个关键信息:
- 最多可合并 5 个音频文件------超过 5 段的素材,先两两拼接出中间产物,再拼最终版;
- 每行有上移 / 下移 / 删除 操作------拼接顺序以列表从上到下为准,传完先检查顺序,别指望工具帮你智能排序;
- 显示大小和时长------拼之前心算一下总时长,确认没把不该进的文件留在列表里。
顺序排好后选输出格式(MP3/WAV/AAC,逻辑同上------中间环节 WAV,最终输出 MP3)。

Step 3:开始合并

确认顺序和格式,点底部「开始合并」。完成后进「转换记录」下载。
多段素材的批量策略:上限 5 个文件意味着超过 5 段时要分批。推荐"两两合并"策略------8 段素材拆成 5+3 两批,各自合并出 2 个中间文件(此时选 WAV),最后把 2 个中间文件合成 1 个成品(此时选 MP3)。整个流程三次任务搞定,且只在最后一步损失一次音质。
关于接缝爆音,拼接端还有一招
裁剪端我们把切点选在了静音处,但两段素材拼起来时,接缝两侧的音量电平如果不一致,听感上会有一个明显的"台阶"------上一段声音大、下一段声音小(或反过来),衔接处生硬。
工具层面能做的:
- 两段之间留呼吸感:裁剪时在每段开头结尾各保留 0.3-0.5 秒的静音,拼起来就不会"话赶话";
- 音量差异大时:先各自裁剪输出,进剪映/Audition 里把两段音量拉齐再拼------云音雀的拼接是顺序合成,不做音量归一化,这步要在专业工具里补。
FAQ:4 个高频问题
Q1:裁剪能精确到毫秒吗? 输入框单位是秒(支持小数),波形拖拽用于粗定位。要毫秒级精密切割(比如采样对齐),用 Audition 这类专业工具。
Q2:拼接的 5 个文件格式必须一致吗? 不必------MP3 和 WAV 可以混着传,输出格式由你最后统一选。但建议统一成同一格式再传,避免不同源文件的采样率差异导致接缝异常。
Q3:裁剪和拼接能一次完成吗? 不能,这是两个独立工具、两次任务。流程是"先裁后拼"------这也是为什么中间环节建议用 WAV。
Q4:为什么拼接后文件比两段加起来小? 拼接是重新编码。输出 MP3 时按统一码率编码,体积和码率挂钩,和源文件体积无关。音质有没有损失,取决于源文件和输出码率的关系(详见第三篇)。
Q5:拖拽手柄和输入框的选区对不上怎么办? 拖拽是像素级粗定位,输入框是精确值------以输入框的数字为准。拖完后把输入框里的数字微调到你想要的位置即可,两者最后统一。
避坑清单:4 条
- 裁剪只支持音频文件------视频先去提音轨;
- 结束时间填纯秒数------03:31 是 211 秒,别填成 331;
- 切点选波形低谷------在声音中间下刀必出咔哒声;
- 拼接上限 5 个文件、顺序以列表为准------多段素材分批拼,别一次塞。
系列预告
下一篇是系列第三篇也是收官篇:「格式转换」------MP3、WAV、M4A、FLAC、AAC 到底怎么选,视频的 MP4/MOV/WEBM/MKV 又是怎么回事,以及"为什么转完音质变糊"的底层原因。正好把前两篇留下的"中间环节用 WAV"的原理讲透。
有问题评论区见。