今夕语音中枢一键整合包:本地 LuxTTS 发声 + Whisper 听觉 + AIRI一键接入听觉和发声模块

简介说明

如果你想让 AIRI 这类 AI 桌面宠物真正"开口说话",甚至能通过麦克风听懂你的声音,单独配置 TTS、STT、端口、模型路径、API 参数和麦克风监听状态会比较繁琐。

为了解决这个问题,我整理了一个本地化的语音工具包:今夕语音中枢一键整合包。

它把本地语音合成、语音识别、AIRI 配置、DeepSeek 意识模型配置、麦克风启用、端口设置、测试工具和日志查看集中到一个可视化面板里,目标是让普通用户也能更快搭建 AI 桌宠的"听说能力"。

核心功能

本地 LuxTTS 发声:支持文字转语音,可用于 AIRI 回复发声,让桌宠不只是显示文字,也能用本地声音进行回应。

Whisper-STT 听觉服务:支持语音转文字,适配 AIRI 的 OpenAI Compatible Transcription,让 AIRI 可以接收麦克风语音输入。

AIRI TTS 配置导入:可以把本地 LuxTTS 发声接口写入 AIRI,减少手动填写 Base URL、模型名称和 API Key 的步骤。

AIRI STT 配置导入:可以把本地 Whisper-STT 听觉接口写入 AIRI,让语音识别服务更容易接入桌宠。

DeepSeek 意识配置导入:支持填写 DeepSeek API Key,并选择模型,一键写入 AIRI 的意识模型配置,方便快速切换到 DeepSeek 对话能力。

自动配置麦克风功能:提供启用或重置 AIRI 桌面小麦克风的功能,减少反复进入界面手动开关麦克风监听的麻烦。

端口设置:可以在面板里查看和调整 LuxTTS 后端、AIRI TTS 适配器、Whisper-STT 服务、AIRI 调试端口等关键端口。

测试工具:内置 TTS 发声测试、STT 文件识别测试、麦克风相关测试和端到端自检,方便确认整条语音链路是否正常。

日志功能:提供服务日志查看、请求日志查看和清空日志功能,遇到无法发声、无法识别、端口占用等问题时更方便排查。

可视化控制面板:不用反复打开多个 bat 黑窗口,服务启动、关闭、测试、配置和日志都集中管理。

可移动整合包设计:配置尽量使用相对路径,方便后续移动目录或打包发布。

适合谁使用

这个整合包比较适合下面几类用户:

想给 AIRI 桌面宠物接入本地语音的人。

想让 AI 桌宠同时拥有"说话"和"听声音"能力的人。

想尝试本地 LuxTTS 语音合成的人。

想部署 OpenAI Compatible TTS / STT 接口的人。

不想手动折腾多个模型、端口、配置文件和脚本的人。

想把 DeepSeek 接入 AIRI,做成本地语音桌宠方案的人。

想把 AI 伴侣做得更像"能听、能说、能互动"的桌面角色的人。

它和普通 TTS 工具有什么区别

普通 TTS 工具通常只负责"把文字变成声音"。

今夕语音中枢更偏向一个完整的语音中控:

不只是 TTS,也包含 STT。

不只是生成音频,也适配 AIRI。

不只是发声接口,也包含听觉识别接口。

不只是命令行调用,也提供控制面板。

不只是写入 TTS,还能写入 STT 和 DeepSeek 配置。

不只是单次测试,也能做端到端自检。

不只是运行服务,也能查看日志、调整端口、检测状态。

也就是说,它的重点不是单独跑一个模型,而是把 AI 桌宠语音链路整理成一套更容易使用的本地方案。

AIRI 用户为什么需要它

AIRI 本身支持语音相关能力,但如果要接入本地模型,通常需要配置:

TTS Base URL

STT Base URL

API Key

TTS 模型名称

STT 模型名称

DeepSeek Base URL

DeepSeek API Key

DeepSeek 模型名称

麦克风监听状态

OpenAI Compatible 接口格式

本地服务端口

这些配置对新手并不直观。只要其中一个端口、路径或模型名称填错,就可能出现测试能通过、聊天没声音,或者麦克风显示开启但实际没有识别的问题。

整合包把这些配置集中到控制面板中,提供一键配置、单项配置、测试工具和日志排查,能明显减少反复试错的时间。

测试工具有什么用

测试工具主要用来确认"到底是哪一环出了问题"。

比如:

TTS 发声测试可以确认 LuxTTS 是否能正常生成声音。

STT 音频文件识别可以确认 Whisper-STT 是否能正常转写语音。

端到端自检可以先生成一段 TTS 音频,再送入 STT 识别,用相似度判断 TTS 和 STT 是否都能工作。

日志查看可以帮助判断是端口没启动、接口没响应、模型加载失败,还是 AIRI 没有正确调用本地服务。

这样排查问题时就不用只靠感觉判断,而是可以按链路逐步定位。

端口设置为什么重要

本地语音服务通常会占用多个端口。

今夕语音中枢默认会涉及:

控制面板端口

LuxTTS 热后端端口

AIRI TTS 适配器端口

Whisper-STT 服务端口

AIRI 调试端口

如果端口被其他程序占用,或者 AIRI 配置里的端口和实际服务端口不一致,就会导致功能异常。

所以整合包把端口集中显示和配置,方便用户检查当前服务到底跑在哪个地址上。

日志功能为什么重要

本地 AI 工具最怕的问题不是报错,而是不知道哪里报错。

日志功能可以记录服务启动、接口请求、错误信息和运行状态。

当出现"服务显示启动了但 AIRI 没反应""测试能发声但聊天没声音""麦克风开启后识别慢"等问题时,日志可以提供更直接的排查依据。

这对普通用户和后续远程协助都很有帮助。

本地运行的优势

本地语音方案最大的优点是可控:

不依赖云端 TTS 服务。

语音风格可以使用本地参考音频。

STT 可以走本地 Whisper 识别。

数据链路更清晰。

接口更接近 OpenAI Compatible 格式,方便接入其他软件。

后续可以继续扩展不同模型。

适合离线化、私有化、桌宠整合等场景。

当然,本地运行也需要一定硬件资源。没有显卡也可以尝试 CPU 模式,只是速度会慢一些。

使用建议

第一次使用时,建议先启动全套服务,再进入测试工具页面。

先测试 TTS 是否能发声,再测试 STT 是否能识别音频,最后再做端到端自检。

确认本地服务正常后,再使用 AIRI 推荐配置,把 TTS、STT 和 DeepSeek 配置导入 AIRI。

如果麦克风没有进入监听状态,可以使用自动配置麦克风功能尝试启用或重置。

如果仍然异常,再进入日志页面查看最近错误信息。

图片预览

下载地址

百度网盘 请输入提取码 提取码: sqb8

夸克网盘分享

相关推荐
大鱼>4 天前
Whisper+GPT-SoVITS:语音识别到音色克隆的全链路实战
gpt·whisper·语音识别
维基框架14 天前
Apple的SpeechAnalyzer API实测:系统级语音识别与Whisper的差距在哪里
人工智能·whisper·语音识别·xcode
向阳是我25 天前
在 Mac(M2)上用 faster-whisper 实现高精度中文语音转文字
python·macos·ai·whisper·语音识别
localbob2 个月前
日语视频 SRT 字幕生成软件下载:日语视频本地自动翻译SRT字幕生成、日语视频自动翻译 Faster Whisper v1.7 下载与使用教程(含AMD显卡支持)
whisper·音视频·机器翻译·日语字幕翻译·日语视频翻译·本地ai翻译日语视频
挂科边缘2 个月前
手把手教你使用 Faster-Whisper 实时语音输入转文本,本地部署教程
人工智能·语言模型·whisper·faster-whisper·实时语音输入转文本
三千军2 个月前
Buzz语音转文字离线免费版安装使用(含Whisper最新模型)
whisper·免费·语音转文字·离线·buzz
SUNNY_SHUN2 个月前
把 Whisper、Moonshine、SenseVoice 统统装进手机:sherpa-onnx 离线语音部署框架,GitHub 10.9K Star
人工智能·智能手机·whisper·github
searchforAI2 个月前
培训视频转文字后怎么做团队复盘?把本地视频整理成AI笔记的实操方案
人工智能·笔记·ai·whisper·音视频·语音识别·腾讯会议
Wenzar_2 个月前
VITS+Whisper微调:低延迟TTS实战
java·人工智能·whisper