这是苍何的第 595 篇原创!
大家好,我是苍何。
现在用 AI 干活,要输入的东西越来越多了。
让它写代码,得交代需求;让它做 PPT,得说清楚给谁看、重点讲什么;第一版不满意,还得解释哪里不对、想怎么改。
脑子里已经想明白的事,到了输入框,还得一句一句敲出来。

这时候就会想:直接说出来,能省多少事?
但人一开口,难免有停顿、重复,说到一半还会改主意。要是这些全部原样变成文字,发出去之前,又得自己整理一遍。
我就想随口说,说乱了它帮我捋顺,中间改了主意它也能听明白,省得说完还得自己改半天。
以 Typeless 为代表的这类 AI 语音输入工具,解决的就是这个问题。

Typeless 我也有在用,就是每月 12 刀有点肉疼。原来畅所欲言,也得交月租🐶。

最近网易有道也出了个类似的工具,叫网易叭哥说,9 月 8 日刚上线,官方定位是网易首个 AI 原生语音 Agent。关键它是完全免费的,不限额度,也不用自己配模型,装好登录就能用。

先不说别的,网易都是偷偷做精品,比如网易 UU 远程,用过的都说好,也是完全免费。
我就想试试,换成叭哥说,能不能把每个月这 12 刀省下来。
上手之后,感觉最省事的一点是,说之前不用先把句子组织好。
再加上免费、不限额度,也不用自己配模型,关键识别还贼快,准确率还挺高。

比如我现在要让 Codex 帮我做一份 PPT,打开叭哥说设置好快捷键(或用默认的 fn 键)后,就可以直接开说。

就正常说话,口语会比较多,什么"嗯、啊、好吧"这些词,说实话,直接丢给 AI 完成任务,除了费输入 token,我都怕 AI 瞎学习。
这是叭哥说整理后的文字,段落已经分好了,PPT、Excel、ChatGPT 这些英文名也都识别对了。
●●●帮我做一份给部门同事看的 AI 办公分享 PPT,大家基本没什么技术背景,先做 10 页吧。等一下,分享只有 15 分钟,那改成 6 页吧。主要讲查资料、处理 Excel、做 PPT,用 ChatGPT 和 Claude 举例,每个场景给一个操作例子。涉及到数据的地方,你给我标清一下来源,好吧?找不到就留空,不要编。最后留一页讲哪些内容不适合直接发给 AI。

同样一段话,我交给 Typeless,这是它转换的效果:

就你说了很长一段话,Typeless 会省略掉你的语气词,或者中途说错的地方,比方说我中途说到"先做 10 页吧。等一下,分享只有 15 分钟,那改成 6 页吧",这种,它都是能直接修改好的。
●●●帮我做一份给部门同事看的 AI 办公分享 PPT 吧。大家基本没什么技术背景,分享只有 15 分钟,所以改成 6 页。这次主要讲查资料、处理 Excel 还有做 PPT,用 ChatGPT 和 Claude 举例,每个场景给一个具体操作的例子。涉及到数据的地方要标清来源,找不到你就给我留空就行了,不要去编。最后留一页讲哪些内容不适合直接发给 AI,好吧?

Typeless 有时候整理得太用力,句子是顺了,但读着有点不像我说的话。虽然它也能学我的表达习惯,我还是希望它多留点原味,别把随口聊的几句,整得像在做工作汇报。
然后同样的对话我试了下微信输入法,fn 快捷键还突然失效,让 codex 分析修复一下。

这个是微信输入法输出结果:
scss
●●●帮我做一份给部门同事看的 AI 办公分享 PPT,具体要求如下:1. 基本信息:(a) 目标受众:部门同事(基本没什么技术背景)。(b) 篇幅与时长:一共 6 页(分享时间一共只有 15 分钟)。2. 内容与案例:(a) 主要内容:查资料、处理 Excel、做 PPT。(b) 案例要求:用 ChatGPT 和 Claude 举例,每个场景给一个操作例子。(c) 数据规范:涉及数据的地方标清一下,来源找不到就留空,别编。3. 结尾页:最后一页讲哪些内容不适合直接发给 AI。
可以看到同样的语句,微信输入法给的结构化非常仔细,但耗费的时间我觉得相对是比 Typeless 和叭哥说更长一些。
这一轮下来,叭哥说保留的原话更多,Typeless 把改口整理得更干净,微信输入法列得最细,但体感等得也更久一点。
看了有道的技术介绍,它背后用的是自研 ASR,也就是语音识别模型,会结合前文、当前场景和专业词典理解表达,帮助分辨专业术语、人名、地名和多音字,再由自研翻译与润色模型,接着做纠错、断句、口语精简和结构整理。
常用的人名、产品名,还可以自己加进个人词典,作为热词参与识别。添加后就能生效,不用等模型更新,像"苍何"这种名字就很适合放进去。

还有个问题,在办公室用,总不能对着电脑大声念需求吧。
声音压低的时候, AI 语音输入法能否识别准确,去除噪音我觉得还是蛮重要的。
按官方介绍,中文连续口语、自然停顿、噪声环境和小声实时输入,都是这套 ASR 专门做过优化的场景,正好试一下。
比如我在办公室用这个极低的声音来给叭哥说下达指令,这个视频说实话,有些句子我去听都还没听清楚,但叭哥说还是完整的识别出来了。

●●●帮我整理一下这份 Excel,按订单编号去重,别按客户姓名。原表保留,新建一个工作表放结果,金额为空的单独标出来,不要直接填 0。
我试了下 Typeless,对于极个别的词就识别的没对。
●●●帮我整理一下这份 Excel,按订单编号去重,别按客户姓名。原保保留,新建一个工作表放结果,金额为空的单独标出来,不要直接填 0。
我感觉这个还蛮舒服的,坐在工位上小声交代需求就行,不用搞得旁边同事都知道我在干啥。
还有一个翻译场景我觉得也是非常的痛,就我经常需要和国外客户或者产品进行邮件沟通。
我在想要是我直接说中文,语音输入法识别后,自动转为英文,也不用再复制黏贴再去翻译,就很舒服了。
我看了下网易叭哥说就支持这个功能,上手试了下,好香。
这次我测的是中译英,我看官网列出的能力覆盖 100 多种语言,有其他语种需求也可以试试。

我录了个视频,可以感受下这种丝滑。

说完话,翻译完直接写入,这个我说实话,太方便了。
它把语音识别、跨语言翻译和文本输入连成了一套流程。
我用中文表达,英文直接写进当前输入框,省去了切换翻译工具和来回复制粘贴的步骤。
用来沟通工作内容,数据怎么处理也得说清楚。我看官网上说网易叭哥说语音加密传输,云端不留存语音和文本,输入历史只保存在本机,也承诺不会将语音和文本用于自己或第三方的模型训练。
想试的可以去 bug.youdao.com 直接下载。Mac 和 Windows 都支持,用网易邮箱或手机号登录就能开始用。

我看有道提供的模型测试数据还挺厉害的,口语整理的"顺滑有效率"超过 90%,语义评分为 92/100;热词命中率在各测试集超过 90%,多数场景超过 99%。
我是用下来,热词命中率挺高的,比如 Claude、GPT、Codex 这些也都直接快速命中。
有时候挺可惜的,明明有一肚子话,打着打着嫌麻烦,最后就变成了一句"算了"。
我希望这样的"算了"能少一点,想到什么就先说出来,磕巴点、啰嗦点也没关系。
至少那些本来想说的话,能好好留下来。