WT3000A M系列 对接 AI 大模型的方案架构

很多工程师第一次看我们的WT3000A M 系列模组,会卡在一个问题。模组巴掌大,凭什么让一台血压计、一台洗地机跟云端大模型连续对话。我们把它拆成两段来看,端上做干净,云上做聪明。这套架构我们叫 1+1。

WT3000A M 系列目前是两颗。WT3000A M06 走 2.4G WiFi,WT3000A M08 内置 4G Cat.1。两颗模组的端侧能力完全一致,唤醒、降噪、本地识别、音频编解码都是同一套。区别只在通信方式,WT3000A M06 适合本来就有无线网的环境, WT3000A M08 给没有 WiFi、又不想让用户配网的产品用。软件协议也一致,一套代码两套都能跑。后面凡是说 M 系列的能力,两颗都算数。

先把端侧这一段讲清楚。麦克风收到的声音,先过 AEC、ANS、AGC、VAD 这一组算法。AEC 负责消掉设备自己喇叭的回声,ANS 压环境噪声,AGC 拉平音量,VAD 判断哪一帧才是人声。这四步做完,才轮到唤醒和识别。模组端侧能认 200 条自定义词条,像开机、开始清洁、查询记录这类固定指令,不用上云就能响应,速度到毫秒级。OPUS 和 MP3 的音频流编解码也在端侧完成,声音先压成流,再往外传。

传这一段靠的是协议分工,不是一股脑塞进去。控制指令和数据走 MQTT,精准、省流量。音频流走 WebSocket,边说边传,云端也在边识别边回话,不用等整句说完。固件升级和资源文件走 HTTP 下载。M06 通过 2.4G WiFi 把这些报文送上网络,M08 直接走 4G Cat.1,开机就有信号,不用连路由器。

语音到了云端,大模型才接手它最擅长的部分。语音先经 ASR 转成文字,再交给 LLM 做语义理解和对话生成,生成的回答经 TTS 变回语音,沿 WebSocket 流式回灌到模组,模组解码后播放。这个来回我们做了抖动缓冲,弱网下说话不卡顿,对话能连续多轮。云端还管多轮对话的逻辑,记得你上一句问了什么,下一句接着答。

这套分工的好处很直接,端侧扛住了大部分快响应,云端只管它擅长的自由对话。血压计的例子最直观。M08 4G 模组往里一焊,老人按一下开始测,测完问一句我这血压和上周比咋样,声纹识别认出是谁在问,云端把历史数据拉出来分析,再用语音念回去。全程没让用户碰过 WiFi。声音克隆还能把家人的声音存进机器,播报不再是一段冷冰冰的机器音。

儿童的陪伴设备验证过另一条路线。WT3000A M系列已经接好了讯飞和扣子的 AI 模型,唤醒率能做到 95%,角色、音色、声音克隆都能自定义。孩子问地球为什么是圆的,模组把问题送上云,大模型用孩子听得懂的话答回来。开发者不用自己去找大模型厂商谈接入,接口是现成的。

洗地机、厨房电器、学习台灯走的也是同一套架构,区别只在云端的行业知识库。洗地机问红酒渍怎么清理,云端调清洁策略。台灯问李白的诗,云端走知识问答。模组侧的能力不动,变的只是云端喂给大模型的领域内容和回答模板。

远程 OTA 让这套架构能一直长。语音指令库可以后台升级,老用户不用换硬件就能用上新说法。BLE 也保留着,配网和近场调试走它。

写到这,这套架构的意思已经很清楚。M 系列模组把收声、降噪、唤醒、传声这几件脏活揽在端侧,把听懂和答对这件难事交给云端大模型,中间用 MQTT、WebSocket、HTTP 三根管道接好。设备厂要做的,是焊一颗模组、写一套 UART 控制协议,剩下的语音算法和大模型对接,都不用自己从头搭。