微软把语音转写打到 0.1 美元/小时:5 个月降价 72%,AI 音频进入地板价时代
10 美分能买到什么?在微软这里,够让 AI 把一个小时的语音完整转成文字,还附赠说话人分离、词级时间戳和 60 种语言支持。9 月 3 日,微软 AI 部门发布新一代语音识别模型 MAI-Transcribe-2,把转写价格定在每小时音频 0.1 美元,并宣称这是目前市面上最快、最准、最便宜的语音识别模型。
这个价格放在行业里是什么水平,需要一点参照。微软自己的第一款同类模型 MAI-Transcribe-1 在五个月前的 4 月 2 日发布,当时定价每小时音频 0.36 美元。如今新模型把价格砍掉约 72%,相当于同样的任务,账单直接缩水到原来的四分之一多一点。微软官方称,这一价格低于 OpenAI、谷歌与 ElevenLabs 目前任何在售的语音转写方案。考虑到微软同时也是 OpenAI 最大的投资方与云客户,这场降价颇有「左手自研、右手投资对象」左右互搏的味道。

一、五个月三次迭代,价格一路向下
MAI-Transcribe-2 不是一次孤立发布,而是微软语音识别产品线五个月内的第三次迭代。回看这条时间线,节奏快得惊人:4 月 2 日,MAI-Transcribe-1 上线,支持 25 种语言,定价每小时 0.36 美元,官方称其 GPU 成本比主流方案低约一半;6 月 2 日,MAI-Transcribe-1.5 跟进,语言支持扩到 43 种,加入关键词偏置,并登上第三方评测榜;9 月 3 日,MAI-Transcribe-2 直接把语言数推到 60 种,价格降到 0.1 美元。
| 版本 | 发布时间 | 支持语言 | 定价(每 1 小时音频) | 主要更新 |
|---|---|---|---|---|
| MAI-Transcribe-1 | 4 月 2 日 | 25 种 | 0.36 美元 | 首代模型,GPU 成本较主流低约一半 |
| MAI-Transcribe-1.5 | 6 月 2 日 | 43 种 | 约 6 美元/千分钟 | 关键词偏置,多语支持扩围 |
| MAI-Transcribe-2 | 9 月 3 日 | 60 种 | 0.10 美元 | 说话人分离、词级时间戳、限时特价 |
每一次迭代的间隔大约是一个季度,价格中枢却在不断下移。从 0.36 美元到 0.1 美元,语音转写正从一项「按量计费、需要精打细算」的云服务,变成几乎可以忽略成本的基础能力。对开发者而言,这意味着调用语音识别的边际成本低到不再需要纠结,字幕、会议纪要、客服质检、语音搜索这类功能可以放心大胆地往产品里塞。
二、低价之外,能力本身也在升级
价格只是这次发布的一半看点,另一半在能力清单里。MAI-Transcribe-2 在多项指标上明显强于前代。语言支持从 43 种扩展到 60 种,覆盖更多小语种与方言场景。在业内常用的多语种语音识别基准 FLEURS 上,它在排名前 25 的语言里平均词错误率为 3.4%,在第三方评测平台 Artificial Analysis 的榜单上以约 2% 的词错误率位列第二。官方给出的推理速度是:处理 1 小时音频,模型推理耗时约 10 秒,大幅快于多数同类产品。
功能层面同样在补齐。新模型加入说话人分离,会议录音里谁说了什么能按人分开;支持词级时间戳,方便对齐字幕与定位关键片段;支持中英文混说等多语混用场景的自动切换,贴近真实对话里夹带术语与外语的说话习惯;还提供关键词偏置,可以把医学词汇、产品名、人名等冷门专有名词注入识别过程,减少专业领域里的错字。转写风格上则区分逐字稿与净稿两种输出,前者保留口头语与重复,后者自动清理成可读文本。

三、对企业的账单意味着什么
价格变化的冲击力,放在一个具体场景里最容易看清。假设一家大型银行或电信公司,每年需要转写 10 万小时的客服通话录音用于质检与合规,这是行业里相当常见的规模。按五个月前的 0.36 美元单价,一年的转写账单是 3.6 万美元;按新模型的 0.1 美元单价,账单降到 1 万美元。省下的 2.6 万美元或许不算惊人,但要知道,微软把说话人分离、时间戳和 60 语言全部打包进了这个基础价,而不少竞争对手把这些功能单拎出来另外收费。
对企业用户来说,更重要的信号是语音转写正在经历一次「商品化」。当头部云厂商把单位价格打到 0.1 美元的量级,意味着语音识别本身很难再作为独立卖点赚钱,它正在变成客服系统、会议软件、音视频平台里的一个默认组件。那些靠转写 API 差价生存的中间层服务商,将面临直接的价格挤压。微软在发布会上也点明了这个意图:与其说是在卖一个模型,不如说是在重新定义语音转写这项能力的合理价格带。
落到具体产品上,价格下降最先改变的是那些「量大但单价低」的场景。视频创作者给长篇素材加字幕,过去一小时内容的转写成本要几毛钱,现在降到一毛,批量给整季播客出文字稿也变得毫无压力;跨国公司的会议录音转写与翻译,从按分钟计费的增值服务变成随手可用的默认功能;医疗、法律等专业领域虽然还需要靠关键词偏置和定制模型来保证术语不出错,但底层转写的成本已经不再是制约因素。可以预见,接下来一年里,字幕、会议纪要、语音笔记这类功能会像当年的地图定位一样,从付费点慢慢变成免费标配,用户能感受到的变化,会比价格表上的数字来得更直接。

四、为什么要自己跟自己打价格战
微软在语音识别上的激进定价,表面看有些矛盾:它既是 OpenAI 最大的投资方与云客户,OpenAI 旗下也有被广泛使用的语音识别产品;微软却转头推出自研的 MAI 系列,用更低的价格直接冲击同一片市场。拆开看,这其实是微软「既要又要」的战略:继续绑定 OpenAI 的模型生态,同时保留自研能力作为议价筹码与供应链备份,避免在关键 AI 能力上完全受制于人。
语音转写之所以成为突破口,是因为它足够标准化,又足够高频。与千变万化的对话式助手不同,转写任务有明确的评测基准与误差指标,谁准、谁快、谁便宜,一测便知,非常适合用来打价格战立标杆。微软把这款模型定在 0.1 美元,本质是在向市场宣告:在语音这一类成熟的 AI 能力上,规模化带来的成本优势可以转化为碾压级的价格优势。这也符合微软近年来对 AI 的整体态度,与其高价出租别人的能力,不如自建产能,用更低价格争夺开发者生态的入口。

五、还没写进价格表的问题
这轮发布并非没有保留。首先,0.1 美元是官方明说的「限时特价」,期限到今年年底,微软没有公布结束后的标准定价。任何准备把转写能力嵌入长周期产品的团队,都应该先把续费价格问清楚,否则一年后账单可能悄悄回到原位。其次,发布会重点宣传的是批量处理与长音频吞吐,对实时流式转写只字未提,而实时字幕、语音助手这类场景恰恰需要低延迟的流式能力,Artificial Analysis 为此单独维护了一份流式识别榜单,微软在这一项上仍是空白。
对普通用户与开发者而言,这次降价带来的直接变化是:语音转写相关的产品体验会明显变好,无论是播客自动出字幕、会议纪要实时生成,还是客服录音的智能质检,背后的单位成本都在快速下降。而对整个 AI 产业来说,微软这套「五个月迭代三次、价格腰斩再腰斩」的打法,正在把语音识别拖入一场由头部云厂商主导的成本竞赛,留给纯转写服务商的差异化空间,只会越来越窄。