智能语音助手项目

🎙️ Identity-Aware Multimodal Voice Agent (M-RAG-Voice)

一个具备声纹身份感知动态长期记忆端云混合推理能力的智能语音助手框架。

🏗️ 系统架构

系统采用 Audio-Text-Audio 闭环架构,并嵌入了身份(Identity)层:

📖 项目简介

这是一个探索性的多模态语音交互系统。不同于传统的语音助手,该项目集成了声纹识别 (Speaker Verification)RAG (检索增强生成) 技术。它不仅能听懂"你在说什么",还能识别"你是谁",并根据不同用户的身份调用专属的长期记忆库(如饮食习惯、历史偏好),提供高度个性化的回答。

✨ 核心特性

  • 👥 多用户声纹识别: 集成 CAM++ 模型,支持 1:N 声纹匹配。自动区分"主人"与"访客",支持语音指令注册新用户。
  • 🧠 动态进化记忆: 基于 Milvus 向量数据库构建用户画像。具备"冲突裁决"机制,自动利用 LLM 分析新旧记忆冲突,实现记忆的自我更新与修正。
  • ⚡ 端云混合架构 :
    • 端侧 (Local): 运行高频、低延迟任务(VAD, ASR-SenseVoice, SV-CAM++, TTS)。
    • 云侧/端侧灵活性: LLM (DeepSeek/Qwen) 支持本地部署或 API 调用,平衡隐私与性能。
  • 🛠️ 智能意图路由: 能够区分闲聊、点餐(查询本地知识库)、联网搜索(Tavily)和系统指令。

github : 项目开源地址

相关推荐
一直会游泳的小猫11 分钟前
gstack-guide
开源·安全防护·ai辅助开发·技能工具集·sprint流程
Hical_W1 小时前
Hical 踩坑实录五部曲(五):Boost.MySQL 协程集成的 5 个坑
数据库·mysql·开源
Hical614 小时前
C++26 反射落地实战
c++·开源
IvorySQL4 小时前
从 repack.c 深入理解 PostgreSQL REPACK 的底层实现
数据库·postgresql·开源
沉浸式学习ing4 小时前
B站视频怎么快速总结?AI自动生成要点+思维导图+逐字稿
人工智能·ai·自然语言处理·音视频·语音识别·notion
千桐科技5 小时前
qData 数据中台社区开源版 v1.4.0 发布:元数据管理核心模块正式上线
开源·数据治理·数据集成·数据开发·数据中台·元数据管理·qdata
2601_958352905 小时前
拆解 EN-46:一块 15mA 的 DSP 芯片如何实现 50dB 降噪
人工智能·语音识别·信号处理·嵌入式开发·音频降噪·双麦波束成形·硬件拆解
做萤石二次开发的哈哈6 小时前
怎样通过接口模糊检索语音文件名称?
人工智能·语音识别
容器魔方7 小时前
“驾驭工程”下一跳?JiuwenClaw AgentTeam开启“协同工程”全新范式
人工智能·云原生·容器·架构·开源
日取其半万世不竭9 小时前
Pixelfed 自建教程:开源去中心化图片社交平台
开源·去中心化·区块链