EP :Engineering And Project,VLA :Vision Language Action
音频输入与大语言模型(LLM)结合的三种主流方案,行业标准分为级联流水线、连续特征深度融合、音频离散 Token 原生输入 三类,从工程落地到原生多模态模型逐层说明,核心解决一个矛盾:音频是连续波形信号,LLM 只认离散文本 Token / 向量 Embedding,必须做模态对齐才能共用一套 Transformer 主干。
一、方案 1:级联流水线(工程最常用,所有语音 App/API 底层)
完整链路
原始音频 → ASR 语音识别模型(Whisper/Paraformer)→ 纯文本文字 → 文本送入 LLM 正常推理 → LLM 输出文本 → TTS 转语音输出
共用逻辑
LLM 完全不变,只处理文本;音频能力靠独立语音模型外挂,不存在音频特征流入 LLM 主干。
优缺点
- 优点:开发简单、可单独替换 ASR/LLM、算力隔离、无需微调大模型;市面绝大多数语音对话、语音 API(豆包语音、GPT Realtime 简易版)都用这套。
- 缺点:丢失声学信息(语气、情绪、语速、多人说话、环境音),ASR 转写错误会直接传递给 LLM,级联误差累积。
适用场景
普通语音聊天、录音转文字问答、低成本语音助手。
二、方案 2:音频编码器 + 投影层深度融合(主流多模态语音 LLM,如 Qwen-Omni、AudioPaLM、GPT-4o 音频)
架构核心(真正让音频和文本共用 LLM 主干)
- 音频编码器:Wav2Vec/WavLM/Whisper Encoder,把 16kHz 波形转成时序连续高维声学特征向量;
- 投影适配器(Projector):关键桥梁,把音频特征维度映射到和 LLM 文本 Embedding 完全相同的维度;
- 序列拼接送入 LLM
LLM 的自注意力会同时对音频片段、文字内容做交叉建模,音频、文本共享同一套 Transformer 权重、上下文窗口、注意力机制。
plaintext
音频投影向量序列] + [文本Prompt Token Embedding] → 拼接成一条完整序列,统一输入LLM Transformer
- 推理输出:LLM 输出文本,部分模型再外挂声码器生成语音。
共用机制细节
- 文本:词→词表 Embedding;
- 音频:波形→声学向量→投影对齐 Embedding;
- 二者格式统一,在输入层直接拼接,全程共用 LLM 所有层,模型能听懂语气、情绪、停顿、音色、背景噪音,不只识别文字。
优缺点
- 优点:保留全部声学信息,支持语音总结、情绪分析、多人对话区分、音频事件理解;一次推理统一建模,无中间文本误差。
- 缺点:需要联合微调音频编码器 + 投影层,训练成本更高;推理显存占用更大。
三、方案 3:音频离散 Token 原生输入(端到端语音大模型,Speech LLM)
核心思路
把音频做向量量化 VQ ,压缩成和文字 Token 一样的离散音频码本 Token,扩展 LLM 词表,音频和文本完全统一为 "Token 序列",无连续向量过渡层。
链路:
bash
音频波形 → 声学编码器 → VQ 量化 → 离散音频 Token → 和文本 Token 拼接 → LLM 原生处理
共用逻辑
LLM 词表同时包含文字 Token、音频 Token,自注意力平等对待两种 Token,极致深度融合,支持音频输入 + 音频输出(直接语音对话,不用中间文本中转),代表:AudioPaLM、Step-Audio、OpenAI Realtime 完整端到端模式。
优缺点
- 优点:融合程度最高,支持流式实时语音对话、语音翻译、语音续写语音;延迟最低。
- 缺点:训练难度极大,词表膨胀,量化会轻微损失声学细节。
四、三种方案对比表
表格
| 融合方式 | 是否共用 LLM 主干 | 是否丢失声学信息 | 开发成本 | 代表产品 |
|---|---|---|---|---|
| ASR 级联流水线 | 不共用,音频走独立模型 | 丢失情绪 / 音色 / 环境音 | 极低 | 普通语音聊天小程序、本地 Ollama+Whisper |
| 音频 Encoder + 投影融合 | 完全共用 | 完整保留声学特征 | 中等 | GPT-4o、通义千问 Audio、Qwen-Omni |
| 音频离散 Token 端到端 | 原生统一 Token 体系,深度共用 | 少量量化损失 | 极高 | Realtime API、AudioPaLM、语音原生基座 |
关键补充:实时流式音频的共用逻辑
- WebSocket 流式语音(实时通话)采用增量分块编码 :
麦克风音频分段送入音频编码器,每段生成少量音频向量 / Token,增量拼入 LLM 上下文窗口,边输入边推理,音频流和文本流实时共享同一个 LLM 会话上下文,支持边说边回复。
五、结束语
- 简单工程方案:音频先转文字,LLM 只处理文本,二者完全分离;
- 商用多模态大模型方案:音频转特征 + 投影对齐,和文本 Embedding 拼接后共用 LLM 全部 Transformer 层;
- 原生端到端语音模型:音频转离散 Token,和文字 Token 统一词表,LLM 原生同时处理语音与文本。