LLaMA-Omni 2:基于 LLM 的自回归流语音合成实时口语聊天机器人

LLaMA-Omni 2 是基于 Qwen2.5-0.5B/1.5B/3B/7B/14B/32B-Instruct 模型的一系列语音语言模型。与 LLaMA-Omni 类似,它可以同时生成文本和语音应答,从而实现高质量、低延迟的语音交互。通过新引入的流式自回归语音解码器,LLaMA-Omni 2 与 LLaMA-Omni 相比实现了更高的语音质量。

安装

bash 复制代码
git clone https://github.com/ictnlp/LLaMA-Omni2
cd LLaMA-Omni2

conda create -n llama-omni2 python=3.10
conda activate llama-omni2
pip install -e .

快手上手

下载Whisper large v3

bash 复制代码
import whisper
model = whisper.load_model("large-v3", download_root="models/speech_encoder/")

下载 CosyVoice 2

bash 复制代码
huggingface-cli download --resume-download ICTNLP/cosy2_decoder --local-dir models/cosy2_decoder

从 Hugging Face 下载 LLaMA-Omni2 系列型号。LLaMA-Omni2-0.5B/1.5B/3B/7B/14B 仅支持英文,而 LLaMA-Omni2-0.5B/1.5B/3B/7B/14B/32B-Bilingual 支持中英文

LLaMA-Omni2 LLaMA-Omni2-Bilingual
🤗 LLaMA-Omni2-0.5B 🤗 LLaMA-Omni2-0.5B-Bilingual
🤗 LLaMA-Omni2-1.5B 🤗 LLaMA-Omni2-1.5B-Bilingual
🤗 LLaMA-Omni2-3B 🤗 LLaMA-Omni2-3B-Bilingual
🤗 LLaMA-Omni2-7B 🤗 LLaMA-Omni2-7B-Bilingual
🤗 LLaMA-Omni2-14B 🤗 LLaMA-Omni2-14B-Bilingual
- 🤗 LLaMA-Omni2-32B-Bilingual

Gradio

controller

bash 复制代码
python -m llama_omni2.serve.controller --host 0.0.0.0 --port 10000

server

bash 复制代码
python -m llama_omni2.serve.gradio_web_server --controller http://localhost:10000 --port 8000 --vocoder-dir models/cosy2_decoder

worker

bash 复制代码
python -m llama_omni2.serve.model_worker --host 0.0.0.0 --controller http://localhost:10000 --port 40000 --worker http://localhost:40000 --model-path models/$model_name --model-name $model_name

访问 http://localhost:8000/ 并与 LLaMA-Omni2 互动!

本地推理

bash 复制代码
output_dir=examples/$model_name
mkdir -p $output_dir

python llama_omni2/inference/run_llama_omni2.py \
    --model_path models/$model_name \
    --question_file examples/questions.json \
    --answer_file $output_dir/answers.jsonl \
    --temperature 0 \
    --s2s

python llama_omni2/inference/run_cosy2_decoder.py \
    --input-path $output_dir/answers.jsonl \
    --output-dir $output_dir/wav \
    --lang en

鸣谢

  • CosyVoice 2:我们使用 CosyVoice 2 的预训练语音标记器、语流匹配模型和声码器。
  • SLAM-LLM:我们借用了语音编码器和语音适配器的一些代码。
相关推荐
ltqvibe1 天前
企业AI改造的四层路径:从点上应用到企业大脑
大数据·人工智能·本体语义平台·企业ai改造·数据打通·企业大脑·企业认知基础设施
anxiao_m1 天前
园区数字孪生怎么搭建?主流方案与服务商深度对比
大数据·运维·人工智能
Eric.461 天前
AI漫剧量产Prompt参数实操手册:Stable Diffusion+ComfyUI+OpenClaw通用复制即用配置
人工智能·深度学习·stable diffusion·prompt·ai漫剧
Eric.461 天前
OpenClaw 结合 Stable Diffusion 与 ComfyUI 实现本地离线 AI 漫剧全自动流水线|批量渲染、人设一致性、帧闪烁问题工程实践
人工智能·stable diffusion·comfyui·ai漫剧
Splashtop高性能远程控制软件1 天前
AI 落地的连接基建评估:消费品行业远程连接方案的四个技术维度(性能 / 精度 / 安全 / 统一管理)
运维·人工智能·安全·远程工作·splashtop
诺....1 天前
mkv转mp4并将字幕和音频烧进去
音视频
AIkk861 天前
手机释放内存用什么工具方便?2026全平台工具实测科普
人工智能
阿里云大数据AI技术1 天前
从 VDBBench 到 MMEB 榜首:阿里云 AI Search 从引擎到模型的全栈优化
人工智能·elasticsearch·agent
小白说大模型1 天前
LLM集成数据库的幻觉治理:当AI给出的SQL建议是错的
数据库·人工智能·sql·oracle·重构·开源
火山引擎开发者社区1 天前
豆包大模型测评招募丨寻找行业资深 AI 实践者
人工智能