WhisperBot:整合了Mistral大型语言模型的实时语音转文本系统

项目简介

欢迎来到 WhisperBot。WhisperBot 基于 WhisperLive 和 WhisperSpeech 的功能而构建,在实时语音到文本管道之上集成了大型语言模型 Mistral (LLM)。WhisperLive 依赖于 OpenAI Whisper,这是一个强大的自动语音识别 (ASR) 系统。Mistral 和 Whisper 都经过优化,可作为 TensorRT 引擎高效运行,从而最大限度地提高性能和实时处理能力。

特征

  • 实时语音转文本:利用 OpenAI WhisperLive 将口语实时转换为文本。

  • 大型语言模型集成:添加大型语言模型 Mistral,以增强对转录文本的理解和上下文。

  • TensorRT 优化:Mistral 和 Whisper 都经过优化,可作为 TensorRT 引擎运行,确保高性能和低延迟处理。

先决条件

安装 TensorRT-LLM 来构建 Whisper 和 Mistral TensorRT 引擎。自述文件为 TensorRT-LLM 构建了一个 docker 镜像。除了构建 docker 镜像之外,我们还可以参考 README 和 Dockerfile.multi 在基础 pytroch docker 镜像中安装所需的包。只要确保使用 dockerfile 中提到的正确的基础镜像,一切都会顺利进行。

构建 Whisper TensorRT 引擎

构建 Mistral TensorRT 引擎

  • 将工作目录更改为 TensorRT-LLM 文件夹中的 llama 示例目录。

    cd TensorRT-LLM/examples/llama

  • 将 Mistral 转换为 fp16 TensorRT 引擎。

    复制代码
    python build.py --model_dir teknium/OpenHermes-2.5-Mistral-7B \
                    --dtype float16 \
                    --remove_input_padding \
                    --use_gpt_attention_plugin float16 \
                    --enable_context_fmha \
                    --use_gemm_plugin float16 \
                    --output_dir ./tmp/mistral/7B/trt_engines/fp16/1-gpu/ \
                    --max_input_len 5000
                    --max_batch_size 1

构建 Phi TensorRT 引擎

注意:Phi 仅在主分支可用,尚未发布。因此,请确保从主分支构建 TensorRT-LLM。

  • 将工作目录更改为 TensorRT-LLM 文件夹中的 phi 示例目录。

    cd TensorRT-LLM/examples/phi

  • 构建 phi TensorRT 引擎

    git lfs install
    git clone https://huggingface.co/microsoft/phi-2
    python3 build.py --dtype=float16
    --log_level=verbose
    --use_gpt_attention_plugin float16
    --use_gemm_plugin float16
    --max_batch_size=16
    --max_input_len=1024
    --max_output_len=1024
    --output_dir=phi_engine
    --model_dir=phi-2>&1 | tee build.log

项目链接

https://github.com/collabora/WhisperBot

相关推荐
这张生成的图像能检测吗3 小时前
(论文速读)MMFSL:面向工业轴承故障诊断的多模态小样本学习框架
人工智能·生成对抗网络·数据增强·故障诊断
长三角活动观察3 小时前
【无标题】
人工智能
deepseek233 小时前
erdosproblems 冻结评论与证明声明拆解:机器证明泛滥后,一个数学网站关掉了评论区
人工智能·数学·大模型
liangshanbo12153 小时前
Web Worker 在 AI 前端应用中有什么具体使用场景?
前端·人工智能
daad7773 小时前
手写一个 LPC 语音 Codec:从一帧真实音频看编码到解码的全过程
人工智能·音视频·语音识别
nap-joker3 小时前
解耦多模态对抗自编码器:在不完全多模态神经图像下婴儿年龄预测中的应用
人工智能·特征解耦·婴儿年龄预测·vae-based
Martina_03213 小时前
山谷地形下雨后湿痕总往坡上爬?用6步检查高度场、流向遮罩与分区加载
人工智能·游戏·数学建模·3d·自然语言处理·aigc·关卡设计
跟我学机器学习3 小时前
基于两阶段索引的RAG Agent:检索增强与 Agent 结合实践
人工智能·深度学习·语言模型
Keep_Trying_Go3 小时前
MobileSAM 论文方法详解
人工智能·深度学习·计算机视觉·分割算法
ZhengEnCi4 小时前
AI 生成 App 原型图:一句话真能画出可交互界面吗?从 Text-to-Prototype(文本生成原型)到 D2C(Design to Code,设计转代
人工智能