title: 离线语音模块能当麦克风用吗?识别与录音的两套逻辑、"150 条"的词数语义与中英文切换固件的两条路径
keywords: 识别模块非录音, 原始音频码流, 一板两用, 命令词150条, 词数行为数, 竖线多说法, 中英文切换, OTA归属
topic: 无
gen_model: glm-5.3-flash
version: 1
ai_review_cycles: 0
created_at: 2026-09-14T18:50:48.000Z
一家医疗设备商(研发团队自述在用 SU-03T)的半年度选型沟通,把"离线语音模块的两个身份"问题问了出来:它能不能当麦克风用?能不能在线升级?命令词 150 条是行为上限还是词数上限?本篇按主题整理这三组口径(OTA 的 A7T 路线与自然说的对比此前已有专文,本篇取双模复用与容量语义两个新角)。
题一:语音模块能当麦克风吗?识别与录音的两套逻辑
客户的问题很直接:"这个模块。能不能当做常规的麦克风使用?用于录制音频"。答案分两层:
- 能力边界:"我们这个不是录音模块,做不到实时录音的那种功能"------离线语音模块的麦克风通路是为识别设计的,AFE(前端)调优目标是对齐词条模型,不是保真采样;
- 但有折中:"有模块可以采集音频,通过串口发送"------另一条产品线支持原始音频码流经串口输出;
客户的真实需求是"一板两用":场景一,模块识别特定语音指令,CPU 走串口拿结果(已在用,和 SU-03T 一样);场景二,模块只获取原始音频码流经串口传给 CPU,两个场景不同时发生。技术上,柯工给的答案是"用 CI-03T"------识别与音频转发在同一硬件上分时工作。
这个问答的通用价值:离线识别模块的"麦克风"和录音设备的"麦克风"是两种东西,前者的指标是词条命中率,后者的指标是采样保真。想要两者,选支持音频码流转发的型号,而不是指望识别模块兼职录音。
题二:150 条的语义:命令词总数,不是行为数
客户的追问链:"支持 150 条命令词是指这里的行为上限是 150 吗?还是指命令词总共不能超过 150"------因为业务上有"一个行为对应多个命令词"的需求(如"打开宽景成像|打开宽景"两个说法都触发同一动作)。答案:"是命令词总共不能超过 150个";竖线分隔的两个说法算两个命令词("是的")。
这条口径直接决定词条设计策略:行为可以多于词组,但每多一个说法就多占一格容量;同义词丰富度与容量预算要一起规划。150 条的上限按"词"计,不按"行为"计------这是 SU-03T 与此前 CI-73T 文章口径的一致处。
题三:中英文切换固件:SU-03T 的答案与 OTA 的归属
客户要做"中英文切换固件"------需求是系统软件集成一键升级接口,把串口在线升级工具的能力搬到自己的软件里。厂商的答复分三层:
- "这个模块好像不能同时支持中英文的指令"→"可以用两个模块"------单模块内语种切换不是 SU-03T 的能力,双模块各烧一版是工程解;
- OTA 能力归属:"能进行 OTA 升级的只有 JX-A7t 模块,su-03t 并没有实现过或者有这个接口";再次追问后:"目前没有这个接口集成哈,你可以用 A7T 去试一下,这个跑通了 OTA";
- 若必须 SU-03T 换语种,实际路径是现场串口烧录(工具在,但接口不开放集成);
这条线的启示:把"换语种"当固件问题还是当联网功能问题,选型完全不同------前者要设计烧录口与工装,后者要选带 OTA 的平台模块。
落地清单
- 离线识别模块不是录音模块,麦克风通路为词条匹配服务;
- "识别+原始音频转发"双模需求选 CI-03T 一板两用;
- 两场景分时复用不同时发生,是双模可行的前提;
- SU-03T 150 条是命令词总数上限,不按行为计;
- 竖线分隔的多说法词条,每个说法各占一个容量格;
- 行为数可以多于词条数,先规划说法再算容量;
- SU-03T 单模块不支持中英文指令并存;
- 中英文切换需求:双模块各烧一版,或换带 OTA 的平台;
- OTA 接口目前只在 JX-A7T 跑通,SU-03T 无集成接口;
- 串口换语种=现场烧录工装,联网换语种=OTA,选型前先定路径;
选型问答的价值在于把"想当然的能力"逐条钉死:识别模块不会录音,150 条按词不按行为,换语种要么双模块要么 OTA------三问三答,把项目方案从"以为行"校准到"确认行"。