每分钟 62 词的尝试言语解码:Willett 2023 高性能语音神经假体精读
原论文:A high-performance speech neuroprosthesis
作者:Francis R. Willett, Erin M. Kunz, Chaofei Fan 等
期刊:Nature,2023
30 秒看懂这篇论文
- 对象:一名因延髓起病 ALS 而无法产生可懂言语的参与者 T12。
- 方法:四枚皮层内微电极阵列记录尝试发音,其中 ventral premotor cortex(area 6v)的信号驱动 RNN 音素解码,再由语言模型生成句子。
- 结果:50 词词表 WER 9.1%;125,000 词词表 WER 23.8%;平均速度 62 词/分钟。
- 机制发现:6v 中发音器官调谐空间交错,瘫痪多年后仍保留精细音素的发音动作结构。
- 边界:单参与者、侵入式、需要大量训练与语言模型;23.8% WER 尚不足以无障碍日常交流。
1. 为什么这篇工作是临床脑解码里程碑?
语音是人类最快的自然交流通道,普通对话约每分钟 160 词。早期语音 BCI 可以识别少量词或句子,但速度慢、词表小。Willett 等人的目标更苛刻:从尝试发音的神经活动中实时输出自由句子,同时把词表扩到 125,000 个词。
它与"听觉语音解码"不同。参与者不是听别人说话,而是在无法清楚发声的情况下主动尝试说话。信号来自运动相关皮层,因此更直接对应临床恢复交流的需求。
2. 植入与参与者:四枚阵列,真正有用的是 area 6v
参与者 T12 患延髓起病 ALS,保留有限口面运动和发声能力,但言语不可懂。研究者植入四枚微电极阵列:两枚位于 ventral premotor cortex 的 area 6v,两枚位于 Broca 区组成部分 area 44。每枚阵列覆盖约 3.2 × 3.2 3.2\times3.2 3.2×3.2 mm。

来源:原论文 Figure 1,PDF 第 2 页;由原论文页面裁切,DOI: 10.1038/s41586-023-06377-x。
1 秒神经活动的简单 Naive Bayes 分类已经能在 area 6v 中以 92% 区分 33 种口面动作、62% 区分 39 个音素、94% 区分 50 个词;area 44 的准确率低于 12%。这不是否定 Broca 区参与语言,而是说明在此参与者、此电极位置与此记录尺度下,area 44 缺少可用于运动输出分类的局部信号。
3. 关键神经发现:发音器官不是整齐分区,而是交错编码
area 6v 的单电极常同时对下颌、喉、唇和舌等多类动作调谐,两个很小阵列内都包含多种发音器官信息。ventral 阵列对语音更有用,dorsal 阵列对一般口面动作更强;但两者结合才能达到最低错误率。
这种交错结构对 BCI 是好消息:不必覆盖整条运动皮层,也可能从有限面积读出完整发音动作空间。同时,它说明音素表征更接近连续的 articulatory geometry,而不是每个音素占据一个独立"按钮"。
4. 解码流水线:神经活动到音素,再到词句
系统只使用 area 6v 记录。阈值跨越率与 spike-band power 经时间分箱和平滑后输入 RNN,网络输出每个时刻的音素概率。随后 Kaldi 中定制的 trigram 语言模型把音素序列转换为最可能句子。作者分别测试 50 词小词表和适合一般英语的 125,000 词大词表。
训练数据来自参与者尝试说出共 10,850 个句子。每个评估日,她先用约 41 分钟、480 个句子更新模型,再对未在训练集重复的句子进行在线测试。输出概率可写为:
W ^ = arg max W P ( x ∣ W ) P L M ( W ) \hat W=\arg\max_W P(\mathbf x\mid W)P_{\mathrm{LM}}(W) W^=argWmaxP(x∣W)PLM(W)
其中神经模型提供音素证据,语言模型提供词序列先验。最终 WER 是整条流水线的成绩,不应当作纯神经分类准确率。
5. 在线结果:62 词/分钟与两种词表

来源:原论文 Figure 2,PDF 第 3 页;由原论文页面裁切,DOI: 10.1038/s41586-023-06377-x。
在能发声的测试日,50 词词表平均 WER 为 9.1%;静默尝试发音为 11.2%。125,000 词词表 WER 为 23.8%。参与者平均以每分钟 62 词尝试说话,是此前手写 BCI 18 词/分钟记录的约 3.4 倍,并开始接近自然对话速度。
大词表结果尤其重要,因为用户可以组合训练中未逐句出现的表达;但 23.8% 意味着平均约四个词就有一个错误。作者也明确指出,这与通用语音识别约 4%--5% WER 相比仍不足以日常无障碍使用。改进语言模型和缓解日内漂移的离线分析可进一步降低 WER,然而不应替代在线报告。
6. 音素混淆揭示了什么?

来源:原论文 Figure 3,PDF 第 4 页;由原论文页面裁切,DOI: 10.1038/s41586-023-06377-x。
RNN 更容易混淆发音方式相近的音素。把音素按唇、舌、喉等 articulatory features 排列后,神经相似性与发音相似性明显对应。这支持一个重要解释:模型并非主要记忆句子标签,而是在读出尝试发音的运动构形。
这也解释了为什么瘫痪多年后仍可解码。外围肌肉控制受损并不等于皮层中的发音计划消失。只要部分运动意图保持稳定,皮层内高分辨率记录就可能绕过下游通路。
7. 哪些工程因素最值得投入?

来源:原论文 Figure 4,PDF 第 5 页;由原论文页面裁切,DOI: 10.1038/s41586-023-06377-x。
词表从很小增加时 WER 上升,但约 1,000 词后收益趋于饱和,说明"取一个中等词表"未必能解决准确率问题。电极数与 WER 近似呈对数线性关系,作者估计电极数翻倍可能把错误率近乎减半。训练数据越多越好,而完全不做当天重训时 WER 明显恶化,暴露记录非平稳性。
因此,未来提升可能更多来自更密、更稳定的记录和在线无监督适配,而不是一味限制用户词汇。模型也应提供置信度、快速纠错和备用输入通道,让偶发错误不至于改变关键意思。
8. 证据边界
论文的在线评估、未重复测试句、静默尝试条件和发音几何分析构成了强证据链。它确实证明了大词表、较高速的侵入式尝试言语到文本在一名 ALS 参与者上可行。
但仍有四个边界。第一,只有一名参与者,疾病类型、残余运动和电极落点可能影响结果。第二,开颅植入及长期维护存在风险。第三,系统训练量大,且每天要校准。第四,语言模型会纠错也会"替用户说话",罕见词、姓名和否定句需要专门评价。论文讨论的是可行路径,不是已成熟的通用产品。
9. 与 2021 手写 BCI 的关系
两篇论文共同说明"选择合适的运动词汇"与"记录分辨率"同样重要。手写 BCI 利用字母轨迹的时间多样性;语音 BCI 利用音素发音动作的连续几何。前者速度较低但字符边界直观,后者更接近自然交流却更依赖语言模型。两者不是简单替代关系,也可能在临床界面中互为备份。
真正面向日常使用时,还应把平均 WER 拆成更具体风险:否定词被漏掉、人物名称被替换、药物剂量被改写,其后果远大于冠词错误。理想界面需要逐词置信度、快速确认与撤回机制,并让用户能够临时关闭强语言先验。脑解码的目标不是输出"最像英语"的句子,而是忠实表达用户本人想说的内容。
此外,62 词/分钟衡量的是参与者尝试说话的节奏,不等于每句话都能无摩擦完成交流。真实使用还要计入发现错误、确认候选和重新表达的时间。后续试验若能同时报告任务完成率、修正后净速度和长期疲劳,将比单一峰值速度更接近临床价值。
总结
Willett 2023 将皮层内语音 BCI 推进到每分钟 62 词,并首次在 125,000 词规模上展示可用的尝试言语解码。真正支撑成绩的是 area 6v 中交错而精细的发音动作表征、RNN 音素模型与语言先验的组合。23.8% 大词表 WER 仍高,单参与者和侵入性也限制外推;但它第一次让"接近自然速度的开放句子交流"从远景变成了可量化的工程路线。
参考资料与图片来源
- Willett, F. R. et al. (2023). A high-performance speech neuroprosthesis. Nature, 620, 1031--1036. DOI: 10.1038/s41586-023-06377-x。
- 文中 Figure 1--4 均来自原论文 PDF;未使用生成图片、重绘图或二次转载图。