EP_VLA_大语言模型与音频输入的结合方式

EP :Engineering And Project,VLA :Vision Language Action

音频输入与大语言模型(LLM)结合的三种主流方案,行业标准分为级联流水线、连续特征深度融合、音频离散 Token 原生输入 三类,从工程落地到原生多模态模型逐层说明,核心解决一个矛盾:音频是连续波形信号,LLM 只认离散文本 Token / 向量 Embedding,必须做模态对齐才能共用一套 Transformer 主干

一、方案 1:级联流水线(工程最常用,所有语音 App/API 底层)

完整链路

原始音频 → ASR 语音识别模型(Whisper/Paraformer)→ 纯文本文字 → 文本送入 LLM 正常推理 → LLM 输出文本 → TTS 转语音输出

共用逻辑

LLM 完全不变,只处理文本;音频能力靠独立语音模型外挂,不存在音频特征流入 LLM 主干。

优缺点

  • 优点:开发简单、可单独替换 ASR/LLM、算力隔离、无需微调大模型;市面绝大多数语音对话、语音 API(豆包语音、GPT Realtime 简易版)都用这套。
  • 缺点:丢失声学信息(语气、情绪、语速、多人说话、环境音),ASR 转写错误会直接传递给 LLM,级联误差累积。

适用场景

普通语音聊天、录音转文字问答、低成本语音助手。

二、方案 2:音频编码器 + 投影层深度融合(主流多模态语音 LLM,如 Qwen-Omni、AudioPaLM、GPT-4o 音频)

架构核心(真正让音频和文本共用 LLM 主干)

  • 音频编码器:Wav2Vec/WavLM/Whisper Encoder,把 16kHz 波形转成时序连续高维声学特征向量;
  • 投影适配器(Projector):关键桥梁,把音频特征维度映射到和 LLM 文本 Embedding 完全相同的维度;
  • 序列拼接送入 LLM
    LLM 的自注意力会同时对音频片段、文字内容做交叉建模,音频、文本共享同一套 Transformer 权重、上下文窗口、注意力机制。
plaintext 复制代码
音频投影向量序列] + [文本Prompt Token Embedding] → 拼接成一条完整序列,统一输入LLM Transformer
  • 推理输出:LLM 输出文本,部分模型再外挂声码器生成语音。

共用机制细节

  • 文本:词→词表 Embedding;
  • 音频:波形→声学向量→投影对齐 Embedding;
  • 二者格式统一,在输入层直接拼接,全程共用 LLM 所有层,模型能听懂语气、情绪、停顿、音色、背景噪音,不只识别文字。

优缺点

  • 优点:保留全部声学信息,支持语音总结、情绪分析、多人对话区分、音频事件理解;一次推理统一建模,无中间文本误差。
  • 缺点:需要联合微调音频编码器 + 投影层,训练成本更高;推理显存占用更大。

三、方案 3:音频离散 Token 原生输入(端到端语音大模型,Speech LLM)

核心思路

把音频做向量量化 VQ ,压缩成和文字 Token 一样的离散音频码本 Token,扩展 LLM 词表,音频和文本完全统一为 "Token 序列",无连续向量过渡层。

链路:

bash 复制代码
音频波形 → 声学编码器 → VQ 量化 → 离散音频 Token → 和文本 Token 拼接 → LLM 原生处理

共用逻辑

LLM 词表同时包含文字 Token、音频 Token,自注意力平等对待两种 Token,极致深度融合,支持音频输入 + 音频输出(直接语音对话,不用中间文本中转),代表:AudioPaLM、Step-Audio、OpenAI Realtime 完整端到端模式。

优缺点

  • 优点:融合程度最高,支持流式实时语音对话、语音翻译、语音续写语音;延迟最低。
  • 缺点:训练难度极大,词表膨胀,量化会轻微损失声学细节。

四、三种方案对比表

表格

融合方式 是否共用 LLM 主干 是否丢失声学信息 开发成本 代表产品
ASR 级联流水线 不共用,音频走独立模型 丢失情绪 / 音色 / 环境音 极低 普通语音聊天小程序、本地 Ollama+Whisper
音频 Encoder + 投影融合 完全共用 完整保留声学特征 中等 GPT-4o、通义千问 Audio、Qwen-Omni
音频离散 Token 端到端 原生统一 Token 体系,深度共用 少量量化损失 极高 Realtime API、AudioPaLM、语音原生基座

关键补充:实时流式音频的共用逻辑

  • WebSocket 流式语音(实时通话)采用增量分块编码
    麦克风音频分段送入音频编码器,每段生成少量音频向量 / Token,增量拼入 LLM 上下文窗口,边输入边推理,音频流和文本流实时共享同一个 LLM 会话上下文,支持边说边回复。

五、结束语

  • 简单工程方案:音频先转文字,LLM 只处理文本,二者完全分离;
  • 商用多模态大模型方案:音频转特征 + 投影对齐,和文本 Embedding 拼接后共用 LLM 全部 Transformer 层;
  • 原生端到端语音模型:音频转离散 Token,和文字 Token 统一词表,LLM 原生同时处理语音与文本。