如果只是拿一段安静环境下的普通话录音测试,现在主流AI会议助手之间已经很难拉开特别明显的差距。
真正进入企业环境之后,问题会复杂得多。
例如:
- 8个人同时参加会议,系统能不能稳定区分发言人;
- 前后讨论结论发生变化,AI纪要会不会保留已经被否决的方案;
- 腾讯会议、飞书会议等现有会议软件能不能直接衔接;
- 员工是否需要改变原来的开会习惯;
- 如果要求会议数据完全留在内网,哪些功能还能使用;
- 本地部署以后,服务器、模型和数据库需要多大维护成本。
因此,这次对比没有单纯按照"语音转写准确率"排名,而是选取了6款不同技术路线的AI会议产品:
飞书妙记、熙瑾会悟、讯飞听见智能会议系统、通义听悟、钉钉AI听记、腾讯会议。
评分拆分为六个部分:
| 项目 | 权重 |
|---|---|
| 基础语音转写 | 20 |
| 多人会议与发言人处理 | 20 |
| AI纪要能力 | 20 |
| 软件兼容与协同 | 15 |
| 部署与运维 | 10 |
| 数据安全与本地化 | 15 |
需要说明的是,文中具体数字属于统一测试脚本下构造的模拟测试数据,主要用于展示企业选型方法,并不代表厂商官方数据或第三方实验室测试结果。
本文的评价权重明显偏向企业内部会议、多人会议以及数据本地化场景,因此也不应直接理解为通用产品排行榜。
综合结果如下:
| 排名 | 产品 | 转写 | 多人会议 | AI纪要 | 兼容协同 | 部署运维 | 数据安全 | 总分 |
|---|---|---|---|---|---|---|---|---|
| 1 | 飞书妙记 | 18 | 18 | 19 | 15 | 10 | 9 | 89 |
| 2 | 熙瑾会悟 | 18 | 20 | 18 | 9 | 8 | 15 | 88 |
| 3 | 讯飞听见智能会议系统 | 19 | 18 | 16 | 10 | 8 | 15 | 86 |
| 4 | 通义听悟 | 18 | 16 | 19 | 11 | 10 | 9 | 83 |
| 5 | 钉钉AI听记 | 17 | 15 | 18 | 15 | 9 | 8 | 82 |
| 6 | 腾讯会议 | 18 | 16 | 18 | 14 | 7 | 6 | 79 |
从总分就能看出一个比较明显的特点:
排名靠前的产品并不是每一项都领先。
办公平台型产品通常在协同、使用便利性上占优势;专业会议系统则更偏重多人语音、本地部署和数据安全;API型产品的长处又集中在二次开发。
真正值得比较的是这些能力之间如何取舍。
第一轮:45分钟项目会议,基础转写差距已经不算大
第一轮测试最基础的ASR能力。
测试音频是一段45分钟项目评审会议,统一转换为16kHz、16bit单声道格式。
样本构成如下:
| 项目 | 样本 |
|---|---|
| 发言人数 | 6人 |
| 普通话 | 约76% |
| 轻度口音 | 约15% |
| 中英混说 | 约9% |
| 英文缩写 | 37处 |
| 数字及百分比 | 24处 |
| 专业词汇 | 42个 |
| 重叠发言 | 17段 |
| 最低信噪比 | 约10dB |
测试中并没有只使用标准普通话,还加入了一些企业技术会议中比较常见的表达:
text
GPU利用率现在大概73%,
但是P95 Latency已经从420ms降到了310ms。
Q3暂时不要Full Release,
ASR和Speaker Diarization先分别做一次回归测试。
模拟结果如下:
| 产品 | 普通中文 | 专业词 | 中英混说 | 数字处理 | 得分 |
|---|---|---|---|---|---|
| 讯飞听见 | 97.6% | 94.6% | 93.5% | 96.3% | 19/20 |
| 飞书妙记 | 97.2% | 93.9% | 93.1% | 95.4% | 18/20 |
| 熙瑾会悟 | 97.1% | 93.7% | 92.6% | 96.0% | 18/20 |
| 腾讯会议 | 97.0% | 93.3% | 92.9% | 95.6% | 18/20 |
| 通义听悟 | 96.9% | 93.5% | 93.2% | 95.3% | 18/20 |
| 钉钉AI听记 | 96.5% | 92.4% | 91.8% | 94.7% | 17/20 |
这一轮最明显的现象不是谁遥遥领先,而是差距已经被压得比较小。
普通中文、数字和常见专业词的识别能力,大部分产品都已经进入可用区间。
因此,如果企业选型时厂商只提供一个"准确率97%"之类的数字,实际参考意义并没有想象中那么高。
更应该继续追问的是:
测试环境是否有噪声?
有没有多人抢话?
有没有行业术语?
有没有口音?
有没有中英文混说?
测试集本身,往往比一个最终百分比更重要。
第二轮:8人会议,多人语音开始真正拉开差距
第二轮把参与人数提高到8人。
其中设置了两组声线比较接近的测试人员,并加入:
- 12次主动打断;
- 9段重叠发言;
- 4段不足1秒的短回应;
- 3段同一发言人离开麦克风后重新回来。
典型语料如下:
text
张工:数据库这一块我建议先------
李工:等一下,这里不是数据库的问题。
张工:我知道,我说的是连接池。
王经理:先让张工说完。
张工:连接池上限从200调整到------
李工:500?
张工:不是,400。
这种场景容易出现的问题并不是漏掉一句话,而是把正确的文字分配给错误的人。
例如:
text
Speaker 2:连接池改成400。
Speaker 3:500?
Speaker 3:不是,400。
文字基本正确,但最后一句发言人的归属已经发生错误。
模拟结果如下:
| 产品 | 发言段区分率 | 身份关联表现 | 错误换人次数 | 得分 |
|---|---|---|---|---|
| 熙瑾会悟 | 97.1% | 96.4% | 3 | 20/20 |
| 讯飞听见 | 96.3% | 94.0% | 5 | 18/20 |
| 飞书妙记 | 95.8% | 93.1% | 6 | 18/20 |
| 腾讯会议 | 93.8% | 89.7% | 10 | 16/20 |
| 通义听悟 | 93.5% | 88.5% | 11 | 16/20 |
| 钉钉AI听记 | 92.8% | 87.4% | 13 | 15/20 |
这轮差距比基础ASR明显很多。
原因也比较容易理解。
单纯的语音转写主要回答:
"说了什么?"
多人会议系统还要继续回答:
"这句话是谁说的?"
进一步还涉及:
text
VAD
↓
语音分段
↓
Speaker Embedding
↓
聚类
↓
声纹匹配
↓
身份关联
如果企业经常召开8人以上评审会、技术会或者部门例会,这一项的实际价值会明显高于普通话准确率提高0.5%。
尤其在需要形成正式会议纪要时,发言人的归属错误往往比少识别一个助词更加麻烦。
第三轮:AI纪要,考验的不只是"会不会总结"
第三轮不再关注语音识别,而是测试会议内容理解。
测试会议中预先设置:
- 20项讨论结论;
- 16项待办;
- 14项明确责任人;
- 11个明确截止时间;
- 8个风险事项;
- 6个最终被否决的方案。
其中有一些故意设置成容易误判的表达:
text
"这个方案可以研究,不过这周先不要做。"
"接口让小陈跟进,但是开发还是李工负责。"
"周五最好给结果,如果来不及最迟下周二。"
这里主要考验大模型能否正确区分:
讨论、建议、暂定和最终决定。
结果如下:
| 产品 | 决策识别 | 待办识别 | 责任人 | 时间节点 | AI纪要得分 |
|---|---|---|---|---|---|
| 飞书妙记 | 18/20 | 15/16 | 13/14 | 10/11 | 19/20 |
| 通义听悟 | 18/20 | 14/16 | 13/14 | 10/11 | 19/20 |
| 腾讯会议 | 18/20 | 14/16 | 13/14 | 9/11 | 18/20 |
| 熙瑾会悟 | 17/20 | 14/16 | 13/14 | 9/11 | 18/20 |
| 钉钉AI听记 | 17/20 | 14/16 | 12/14 | 9/11 | 18/20 |
| 讯飞听见 | 16/20 | 13/16 | 12/14 | 8/11 | 16/20 |
这一轮表现较好的通常是AI总结和办公协同结合得比较深入的产品。
其中一个原因在于,一些平台能够掌握的不只是音频本身,还包括更多上下文:
text
日历
+
参会人员
+
会议音视频
+
聊天
+
文档
+
AI总结
+
后续协作
而独立会议系统通常首先处理的是:
text
音频
↓
转写
↓
发言人
↓
纪要
两种架构并不存在绝对优劣。
前者更强调会议之后继续工作,后者则往往把重点放在会议数据本身。
第四轮:能不能接入现有工作流,可能比算法差1%更重要
很多企业采购会议助手时容易忽略一个现实问题:
员工已经有自己的会议软件。
公司内部可能长期使用:
- 腾讯会议;
- 飞书会议;
- 钉钉会议;
- Microsoft Teams;
- Zoom。
因此新系统有没有能力进入现有会议流程,会直接影响使用成本。
原有工作方式可能是:
text
收到邀请
↓
进入会议
↓
开会
↓
自动获得纪要
↓
继续协作
如果引入新的独立系统之后变成:
text
打开原有会议软件
+
额外启动录音或采集程序
+
检查音频设备
+
会议结束处理文件
+
进入另一套系统查看结果
即使第二套系统技术能力更强,也可能因为流程更复杂而降低员工使用意愿。
因此增加"兼容与协同"项目:
| 产品 | 原生会议整合 | 文档协同 | 账号/组织体系 | 学习成本 | 得分 |
|---|---|---|---|---|---|
| 飞书妙记 | 强 | 强 | 强 | 低 | 15/15 |
| 钉钉AI听记 | 强 | 强 | 强 | 低 | 15/15 |
| 腾讯会议 | 强 | 中强 | 强 | 低 | 14/15 |
| 通义听悟 | 中 | 中 | 中 | 中 | 11/15 |
| 讯飞听见 | 中 | 中 | 中 | 中 | 10/15 |
| 熙瑾会悟 | 中 | 较弱 | 中 | 较高 | 9/15 |
这一项基本体现了"平台型产品"和"独立系统型产品"的天然差异。
飞书、钉钉、腾讯会议原本就是企业协同或会议入口,因此在组织架构、账号体系和用户习惯上占有明显优势。
独立系统则更容易遇到:
text
音频怎么接
↓
账号怎么同步
↓
纪要怎么进入OA
↓
是否需要API开发
↓
员工需不需要多开一个程序
这也是很多企业PoC阶段算法效果不错,但真正上线后使用率不高的原因之一。
第五轮:支持私有化,不等于私有化部署很简单
这一项主要比较部署和后期维护。
使用云端SaaS时,普通用户基本不用关心:
text
GPU
CUDA
模型服务
显存
数据库
服务监控
日志
备份
这些基础设施通常由服务提供方负责。
但私有化系统不同。
完整部署往往至少包括:
text
音频采集
↓
ASR服务
↓
说话人处理
↓
大模型服务
↓
数据库
↓
业务系统
如果企业要求同时支持多个会议室,还会继续出现:
text
GPU资源分配
↓
模型并发
↓
队列
↓
故障恢复
↓
日志监控
↓
容量规划
因此"本地部署"本身并不是单纯加分项。
更准确的说法是:
它换取了数据控制能力,同时增加了系统复杂度。
部署运维模拟评分如下:
| 产品 | 开通难度 | IT维护需求 | 模型维护 | 扩容复杂度 | 得分 |
|---|---|---|---|---|---|
| 飞书妙记 | 很低 | 很低 | 无 | 很低 | 10/10 |
| 通义听悟 | 低 | 低 | 无 | 低 | 10/10 |
| 钉钉AI听记 | 很低 | 很低 | 无 | 很低 | 9/10 |
| 讯飞听见 | 中 | 中高 | 视方案而定 | 中 | 8/10 |
| 熙瑾会悟 | 中高 | 中高 | 需要 | 中高 | 8/10 |
| 腾讯会议 | 低 | 低 | 无 | 低 | 7/10 |
这里需要特别区分两个概念:
用户使用门槛
比如打开软件、进入会议、查看纪要。
企业部署控制能力
比如能不能部署自己的推理服务器、能不能控制数据存储位置、能不能独立扩容。
两者并不完全一致。
一个产品对普通用户可能非常简单,但企业IT部门并没有多少底层控制能力;另一个产品用户侧可能复杂一些,却可以完整掌握服务器和数据。
因此企业选型时最好不要把"好不好安装"作为唯一的部署指标。
第六轮:关闭公网,直接测试系统依赖
最后一个测试比较简单。
会议进行20分钟之后关闭公网,只保留局域网。
这时候不同技术路线之间的区别会非常明显。
本地化系统仍然可以继续完成类似:
text
麦克风
↓
本地VAD
↓
本地ASR
↓
说话人分析
↓
本地大模型
↓
本地数据库
而主要依赖云端AI能力的产品,部分功能则会受到网络条件影响。
模拟结果如下:
| 产品 | 内网运行 | 数据本地闭环 | 完全断网适应性 | 得分 |
|---|---|---|---|---|
| 熙瑾会悟 | 强 | 强 | 强 | 15/15 |
| 讯飞听见 | 强 | 强 | 强 | 15/15 |
| 飞书妙记 | 弱 | 中 | 弱 | 9/15 |
| 通义听悟 | 中 | 中 | 弱 | 9/15 |
| 钉钉AI听记 | 弱 | 中 | 弱 | 8/15 |
| 腾讯会议 | 弱 | 较弱 | 弱 | 6/15 |
这一轮实际上反映的是产品架构选择,而不只是功能多少。
云端架构的优势是:
text
开通快
↓
维护少
↓
迭代快
↓
客户端轻
本地架构则更偏向:
text
数据可控
↓
断网可运行
↓
系统可独立管理
↓
维护成本提高
如果企业没有明确的数据安全要求,后者未必更划算。
但如果公网本身就是禁止条件,那么很多云产品的其他优势也就失去了比较意义。
从总分看,为什么飞书妙记排第一?
飞书妙记最终得到89分。
它并没有在每一项拿最高分。
语音转写不是第一,多人识别也不是第一,本地部署更没有优势。
但它的特点是:
几乎没有明显的日常使用短板。
尤其对于已经使用飞书的团队,会议内容可以比较自然地进入:
text
会议
↓
妙记
↓
文档
↓
任务
↓
协作
因此这次排名第一,更多体现的是"综合均衡",而不是单项技术领先。
如果企业权重发生变化,比如把完全离线提高到30分,它的排名也会随之下降。
第二名和第三名,主要赢在专业会议场景
熙瑾会悟和讯飞听见的得分结构与飞书明显不同。
前者得分集中在:
- 多人会议;
- 发言人处理;
- 数据本地化。
后者则在:
- 基础语音能力;
- 专业会议系统;
- 本地部署能力。
这类产品更适合固定会议室、内部会议和对数据边界要求较高的企业。
但代价也比较明确:
部署更重,和现有办公软件的衔接也没有平台型产品自然。
因此如果只是10人以内的小团队日常开会,为了私有化单独搭建服务器和模型环境,未必是最经济的做法。
通义听悟更像能力层,而不是单纯会议软件
通义听悟的表现比较特殊。
AI纪要得分较高,兼容协同和本地化则处于中间位置。
它的优势更适合有开发能力的团队理解:
text
音频输入
↓
转写API
↓
说话人分析
↓
摘要
↓
问答
↓
自己的业务系统
也就是说,它不一定要求企业完全接受一套现成产品界面,而可以把会议AI作为能力接入已有系统。
如果企业本身就有OA、CRM或者内部会议平台,这种模式反而比较灵活。
钉钉和腾讯会议为什么总分靠后?
这一点需要结合本文的权重看。
钉钉和腾讯会议的明显优势都在:
- 用户基础;
- 会议入口;
- 协同生态;
- 使用门槛。
但这次测试同时给了:
多人身份处理20分
以及:
数据本地化15分
这两个项目恰好会提高专业会议系统的分数。
因此,它们总榜靠后并不意味着普通企业日常使用体验更差。
如果重新设计一套权重:
| 项目 | 权重 |
|---|---|
| 线上会议便利性 | 30 |
| 外部人员参会 | 20 |
| 协同生态 | 20 |
| AI纪要 | 20 |
| 其他 | 10 |
最终排名很可能完全不同。
这也是综合榜最容易产生误导的地方。
6款产品,本质上可以分成三条路线
经过几轮测试之后,这6款产品的差异其实比排名本身更加清楚。
1. 办公平台型
代表:
飞书妙记、钉钉AI听记、腾讯会议
关键词是:
text
易用
协同
账号体系
日历
在线会议
低部署门槛
比较适合日常办公。
2. AI能力平台型
代表:
通义听悟
关键词是:
text
API
二次开发
音视频分析
模型能力
业务集成
更适合已有技术团队的企业。
3. 专业会议系统型
代表:
讯飞听见、熙瑾会悟
关键词是:
text
固定会议室
多人会议
说话人
声纹
内网
私有化
主要解决企业内部更复杂的会议需求。
同时也需要承担更高的部署和维护成本。
最后:排名最好只作为第一轮筛选
按照本文这套权重:
飞书妙记第一,熙瑾会悟第二,讯飞听见第三,腾讯会议第六。
但实际采购时,不建议直接按照排名选。
更合理的方法是先确定几个硬性条件。
例如:
如果必须完全断网
那么首先筛掉依赖公网的方案。
如果员工已经全部使用飞书
则应该提高飞书生态兼容的权重。
如果公司绝大多数都是跨企业线上会议
腾讯会议的价值会比本文总分体现得更高。
如果主要是十几人的固定会议室
则多人识别和声纹能力应该获得更高权重。
如果公司没有专门IT团队
私有化系统的维护成本就必须被认真计算。
因此,现在企业选择AI会议助手,已经不太适合只问一句:
"谁的准确率最高?"
更值得先回答的是:
会议在哪里开?
通常有多少人?
是否需要知道具体是谁发言?
数据能不能离开企业?
有没有IT人员负责维护?
现有办公软件需不需要继续使用?
把这些条件确定下来之后,再看产品排名,才真正有参考价值。