之前写过几篇手机转SIP的内容,评论区问得最多的是:"AI接电话能不能不联网?"
说实话,之前那些方案都是把语音传到云服务器做ASR识别,再让云端AI判断意图。能用,但有两个问题一直绕不过去:一是按token或分钟收费,用得越多花得越多;二是通话内容全传到第三方服务器,数据安全上心里没底。
最近试了一个新东西:把意图判断型AI直接塞进手机里,通话时在本地完成识别和应答,不联网、不传云端、不花token钱。
跑了一周,说点真实感受。

📞 怎么工作的?
需要一台安卓手机,加一个USB蓝牙模块。
手机插上USB蓝牙,通过HFP协议获取通话声音。APP在本地跑一个叫SenseVoice的ASR模型,把语音转成文字。然后从文字里提取关键字,匹配到预设的意图,触发对应的语音节点应答。
整个链条是:通话开始→播放开场白→ASR识别对方说话→提取关键字→匹配意图→触发下一段语音或动作→通话结束→意向评定。
全部在手机本地完成,不需要联网,不需要云服务器。
🔑 三个核心差异
① 数据不出手机,通话内容不上传云端
市面上所有AI电话产品,无论外呼还是接听,都需要把语音传到云服务器做ASR和AI推理。你们这个方案是纯本地跑SenseVoice+意图判断,语音数据从拾取到识别到应答,全程在手机内部完成。
不是"隐私政策说不上传",是技术上就没有上传的通道。
② 零成本,不花token钱
云端AI按token或按分钟收费,用得越多花得越多。这套方案用的是手机自己的算力。模型文件约130MB,运行内存占用500MB左右。不产生任何API费用,完全免费。
不是"便宜一点",是根本没有这项成本。对于每天几百通电话的小团队,这不是省一点,是省掉一整块。
③ 断网也能用,不怕网络抖动
云端方案一旦网络不稳,ASR识别就拉跨,通话体验直接崩。这套方案ASR和意图判断都在本地跑,不需要手机网络参与,响应速度和端到端实时性更稳定。
手机信号正常就能跑,文字识别大概0.4秒出来。
🔧 怎么配置?
第一步:装APP,加载ASR模型。 装好后把模型文件拷到手机sd卡,占约130MB。
第二步:配意图和关键字。 在APP里设置意图列表,比如"拒绝""肯定""转人工""听不清",每个意图下面加对应的关键字。比如"拒绝"下面加"不需要""别烦我""不同意"。
第三步:配话术节点。 设置开场白,然后给每个分支配语音片段。比如客户说"多少钱",触发报价节点;客户说"怎么买",触发转人工节点。语音片段可以自己录,也可以用APP合成。
第四步:插USB蓝牙,开测。 通话接通后AI自动接管,悬浮窗上能看到实时对话文字。
⚠️ 槽点也说明白
第一,需要USB蓝牙配件。不能纯靠手机自带蓝牙,得插一个USB蓝牙模块,再加一个转接口。多一个硬件,多一个麻烦。
第二,配置需要花时间。意图和关键字要自己根据行业调整,话术节点要自己录。一次配好长期用,但第一次配可能要搞一两个小时。
第三,识别准确率有上限。SenseVoice支持中文、英语、日语、韩语、粤语,但方言和嘈杂环境下还有差距。
第四,适合简单场景。开场白、意向筛选、转人工这些逻辑没问题。复杂谈判和深度对话,目前还接不住。
🤔 适合谁?
-
每天外呼量大,被云端AI按分钟收费心疼的
-
行业对数据合规要求高,录音不能上传云端
-
需要AI接听来电做初步筛选,再转真人
-
手里有旧安卓手机,愿意花点时间配置
如果你追求开箱即用、不差钱,那这套方案可能不适合你。但如果你在意成本、在意数据安全、又愿意折腾一次,值得试试。
💬 评论区聊聊
你现在用的AI电话方案是按分钟收费还是按token?每个月花多少?
APP下载地址和配置步骤我整理好了,私信"本地AI",发截图,不收钱。
🏷️ 标签
#AI电话 #本地AI #意图识别 #通话助手 #降本增效 #分享