上个月我接了个活儿:把一期将近两小时的访谈视频整理成文字稿,还要顺手出一版字幕。要是搁以前,我肯定一边看一边手动敲,敲到眼冒金星。后来想想,我平时折腾音频降噪、人声分离那套经验,不就是跟「声音里的信息」打交道的吗?转文字这事儿,本质也是从信号里把内容捞出来。于是我把市面上这类工具挨个试了一遍,最后落在云音雀的「视频转文字」上。这篇文章不是广告,是我这半年折腾下来的一些真实感受和踩过的坑。
这事儿远没有「点一下等结果」那么简单
很多人以为「视频转文字」就是把声音变成字,一键完事。真上手才知道,它和我做音频降噪、人声分离是同一类问题------都是在跟信号较劲,只是目标不同。
语音识别(ASR,Automatic Speech Recognition)这条链路,粗略说是这样走的:
音频进来 → 端点检测(VAD,先把有声音和没声音的段切开)→ 声学模型把声音帧映射成音素/字 → 语言模型按上下文把音素拼成通顺句子 → 标点恢复 → 时间戳对齐(forced alignment)
每一步都在丢东西。VAD 切错了,一句话开头半个字就被削掉;语言模型为了通顺,会把你说错的同音字「纠正」成另一个词;时间戳对齐要是粗暴地按整句给,你后期想精修字幕就抓瞎。
所以别指望它一次出完美稿。我现在的预期是:它能把 80% 的机械劳动替我干了,剩下 20% 我得自己听、自己改。这个预期摆正了,用着就舒服。
什么样的源素材,识别出来才像样
我搞音频的对源素材一向挑剔,转文字也一样。下面几个是我自己验证过的点:
- 采样率:ASR 模型大多吃 16kHz 单声道就够,但你的源如果是 48kHz 采访录音,下采样本身不丢信息,关键是别用乱七八糟的压缩。
- 编码格式:能给 WAV 就别给 MP3。MP3 的量化噪声对「听感」影响不像对 ASR 那么大,但累积起来会让边界音素变模糊。我做过对比,同一段录音 WAV 比 128kbps MP3 的错字少一截。
- 信噪比(SNR):这是我最想强调的。我做降噪时关心的 SNR,转文字时一样要命。空调底噪、马路声、回声,都会让声学模型把「噪声的特征」学进预测里。所以脏素材先降噪再转,比直接转准得多------和我做播客后期的逻辑一模一样。
- 专业术语 / 人名:通用模型不认识你的行业黑话。这时候「热词」功能就关键了,提前把嘉宾名字、专有名词喂进去,识别率肉眼可见地涨。
不同导出格式差别不小,别只导一个 TXT 就完事:
|------|---------------------|-----------------|-------------------------|
| 格式 | 是什么 | 我拿它干嘛 | 注意点 |
| SRT | 最通用的字幕文件,带起止时间和文本 | 丢进剪映 / PR 做硬字幕 | 时间码精度够用,手改时间容易崩 |
| VTT | 网页字幕标准,结构类似 SRT | 视频网站 / B 站投稿挂字幕 | 时间戳格式是 .000 而非 ,000 |
| ASS | 高级字幕,支持样式 / 位置 / 特效 | 需要花字、走位字幕时 | 文本量大会臃肿,普通稿用不上 |
| TXT | 纯文本稿 | 自己读、做笔记、二次处理 | 丢了时间信息,想回查得另存 |
| JSON | 带时间戳和置信度的结构化数据 | 写脚本批量处理、做检索 | 字段多,得自己解析 |
我用的流程,以及云音雀卡在哪几个点上
我现在的标准动作是:拿到视频先不动它,看是不是已经带干净音轨;如果是现场录的脏素材,先用降噪把底噪压一压;再丢给视频转文字工具。
云音雀的「视频转文字」走三步:选视频 → 设参数 → 进转换记录等结果。它把「设参数」单独拎出来这点是合理的,因为真正影响成品的不是工具多花哨,而是这几个旋钮:
- 识别语言:中文 / 英文 / 方言,选错整篇都歪。
- 时间戳粒度:按句还是按词。我要做字幕就选细粒度,后期对轴省事。
- 文本导出格式:纯文本、SRT、VTT、带时间轴的 JSON 等。SRT 给剪辑软件吃,TXT 给我自己读,JSON 留着二次处理。
它对常见视频格式都吃,上传后后台跑,不用盯着。会议录像、课程视频、访谈这三类我实测最稳------因为说话人离麦克风近、信噪比高。
源素材的几个参数对识别效果的影响,我整理成一张表,方便对照着调:
|-----------|--------------------|--------------------|
| 影响因素 | 我的做法 | 对识别的实际影响 |
| 采样率 | 源高就保留,转 16k 单声道喂模型 | 过高无意义,过低丢高频辅音,错字变多 |
| 编码格式 | 能给 WAV 就不给 MP3 | MP3 量化噪声累积,模糊边界音素 |
| 信噪比 (SNR) | 脏素材先降噪再转 | 噪声被声学模型学进预测,错字飙升 |
| 专业术语 | 提前加热词 | 通用模型不认识黑话,热词能救一命 |
| 语速 / 插话 | 接受偶尔漂移,手动修 | 强制对齐在静音段估算偏,时间戳会飘 |
而工具本身那几个设置项,决定的是你后期费不费手:
|-------|--------------------------------|-------------------|
| 参数 | 怎么选 | 我踩过的坑 |
| 识别语言 | 按素材真实语种选,含方言就选对应项 | 选错语种整篇歪,不是改几个字的事 |
| 时间戳粒度 | 做字幕选细(句 / 词级),纯稿选粗 | 只给整句时间,对轴时能累死 |
| 导出格式 | 字幕用 SRT/VTT,稿子用 TXT,二次处理用 JSON | 只导 TXT 丢了时间,回查得重跑 |
| 输入格式 | 常见视频格式都支持,优先清晰音轨 | 源本身带噪,转出来照样糊 |
几个体验过才懂的细节
- 标点恢复不是玄学,但别全信。模型给的逗号句号常常按语气而非语法,我一般导出后自己顺一遍。
- 多人对话时,它目前大多不给「说话人分离」(speaker diarization)。要区分谁说的,得靠你听。这点别指望工具替你做,它只管「说了什么」,不管「谁说的」。
- 外语 / 方言别硬上通用模型。云音雀支持选语言,选对语种比事后改稿省十倍力气。
说句实在话
视频转文字这类工具,早几年还经常翻车,现在端到端模型(像 Whisper 那一套思路)普及之后,日常素材的可用度已经很高了。但它终究是个「帮你干机械活」的帮手,不是神仙。你给它干净、近讲、术语对齐好的素材,它还你一篇能用的初稿;你丢一段远处录的嘈杂录音进去,它也只能尽力。
我把云音雀定位成我音频工作流里「收尾整理」的一环:前面降噪、分离把好声音关,最后转文字把好内容关。工具链顺了,两小时的访谈,真正花在我手上的时间也就二三十分钟。这就够了。