从视频里提音频这件事,大部分人卡的不是「提」,而是「存」。提取完成,导出框弹出来:MP3、WAV、AAC,后面跟着一串码率,128k、192k、320k。随手选一个存下,事情就开始失控------拿去剪辑的发现越剪越糊,拷进车载 U 盘的发现读不出来,存成 WAV 的发现一小时录音吃掉 600MB,微信都发不出去。

这里有个普遍误解:存成 WAV 这种「无损格式」,音质就更好,一律存 WAV 最保险。其实不是。格式只是一个容器加一套编码规则,它决定的是「信息怎么被记下来」,不能凭空增加信息。视频里的音轨绝大多数本来就是有损编码------MP4 里通常是 AAC,老一点的片子可能是 MP3 或 AC3------提取出来的是一段已经丢过信息的信号。把它存成 WAV,丢掉的细节不会回来;把它存成低码率 MP3,却会在已有损失上再砍一刀。选格式的本质,是决定「剩下的信息还要不要再损失、损失多少」。
先分清容器和编码,损失只发生在编码层
要理解后面的判断依据,先分清两层概念:容器(Container)和编码(Codec)。WAV、MP4、MKV 是容器,相当于文件柜;PCM、AAC、MP3 是编码,相当于柜子里记录声音的那套字母表。PCM(脉冲编码调制)是最原始的记法:按固定采样率(比如 48kHz,每秒采样 48000 次)和位深(比如 16bit,每个采样点 65536 个刻度)把声波原样数字化,不丢信息,代价是体积------48kHz/16bit 立体声每分钟约 11MB。MP3、AAC 这类有损编码走另一条路:利用心理声学模型(Psychoacoustic Model),把人耳听不到的高频和被强音掩蔽的弱音直接删掉,体积缩到原来的十分之一,代价是信息永久丢失。

关键性质是:有损编码的删除不可逆,而且每重新编码一次就再删一轮------这就是转码代际损失(Generation Loss)。用 ffmpeg 提取音轨时有两条完全不同的路径:
ffmpeg -i input.mp4 -vn -c:a copy output.aac # 流拷贝:原样倒出,零新损失
ffmpeg -i input.mp4 -vn -c:a libmp3lame -b:a 192k output.mp3 # 重编码:解码成 PCM 再压一轮
第一条不动一个字节的音频数据,第二条把 AAC 解码回 PCM 再压成 MP3。三个判断,本质上就是在回答「这次保存走哪条路、丢不丢、丢多少」。
判断一:这条音频还要不要再加工
是什么:用途分两类------「终点」和「中转」。直接发给人听、上传平台的是终点;还要进剪辑软件做降噪、混音、对轨的是中转。
为什么:每多一次有损重编码就多一轮代际损失。中转环节存 MP3,后期做完导出时再压一遍,等于同样的信号被心理声学模型砍了两刀,第二刀砍的还是第一刀剩下的东西。
怎么应对 :中转一律存 WAV(PCM),用体积换安全;到终点再压有损。如果手上只有 MP3 而又需要 WAV 做中间格式,网页端的音频转码工具可以直接互转,不必为此装本地软件------但要清楚,这只是换容器,不会把已丢的信息变回来。

判断二:内容是语音还是音乐
是什么:语音(访谈、课程、字幕素材)的信息集中在 300Hz 到 3.4kHz 这一段;音乐铺满 20Hz 到 20kHz,还带有立体声的空间信息。
为什么:码率该花在哪,取决于内容本身的信息分布。语音用单声道 64-96kbps 就足够清晰,再往上加码率人耳几乎分不出差别;音乐则必须保留立体声,192kbps 以上才算安全线,压成单声道空间感直接消失。
怎么应对:语音选 MP3 96kbps 单声道,体积小一半,清晰度不受影响;音乐选 MP3 320kbps 或 AAC 256kbps 立体声,给镲片、混响这类高频弱信号留足码率。

判断三:文件最后去哪
是什么:同一条音频的「终点环境」不同------车载播放器、网页播放器、剪辑软件时间线、硬盘归档,对格式的要求完全不同。
为什么:兼容性是硬约束。老设备和老车机只认 MP3;网页流媒体主流是 AAC(HLS 协议的标准音频编码);归档则要考虑五年后这条素材还能不能再利用。
怎么应对:对外分发用 MP3,兼容性到顶;网页嵌入用 AAC;长期归档用 WAV 保存提取出来的原始结果,以后需要什么有损版本,随时从归档再压,而不是拿一份 MP3 反复转。
能力边界:这四件事做不到
把边界说死。
第一,有损源存无损不等于音质提升:AAC 提出来存成 WAV,你只是阻止了后续损失,被心理声学模型删掉的高频和掩蔽信号永远回不来,频谱上 16kHz 以上的缺口照样在。
第二,流拷贝虽然零损失,但输出被原编码锁死------视频里是 AC3,你就只能存 AC3 或换封装,想要 MP3 必须付出一次重编码。
第三,在线提取这条路只支持上传本地视频文件,不支持粘贴视频链接在线解析;链接背后的流是另一套技术栈和版权边界,不能混为一谈。
第四,采样率必须与源一致,任何号称「提升音质」的升采样都是自欺欺人。

完整操作路径
完整走一遍。以一段会议录像 MP4 为例:上传本地视频文件------注意只支持本地上传,这正是上一节说的能力边界。
提取完成后先别急着导出,按判断一问自己:
这段音要不要进剪辑?
要,就选 WAV 存中间格式;
不要,直接进判断二、三定有损参数。
整条路径不需要你碰 ffmpeg 参数,但每一步的取舍逻辑,就是前面那三个判断。

收尾
存什么格式,从来不是格式本身的问题,而是「这条音频接下来要经历什么」的问题。先想清楚它是终点还是中转、是语音还是音乐、要去哪个设备,格式选择就退化成查表。工具负责执行,判断只能你自己做。