谷歌最新语音转文本模型 Gemini 3.5 Transcribe

谷歌近日宣布推出其 Gemini 家族语音转文字模型的最新版本 ------ Gemini 3.5 Transcribe。这家搜索巨头表示,这是该系列迄今为止精度最高的语音识别模型。

新模型在处理背景噪音和复杂专业术语方面表现更为出色。谷歌指出,得益于这一新模型,macOS 端 Gemini 应用以及 Android 端 Gboard 键盘的 Rambler 功能均已实现性能提升。同时,开发者也可利用该模型打造语音智能体、实时字幕工具或通话后分析系统。

谷歌在博客中写道:"Gemini 3.5 Transcribe 旨在捕捉用户的自然说话风格,从而更好地理解用户意图并识别自定义词汇,让用户能够通过语音高效执行各类任务。"

这款全新的 AI 模型还配备了一系列提升输出质量的新功能。首先,它具备自我纠错能力,能够自动去除口语中的填充词(如"嗯"、"啊"),并实现文本的自动排版。此外,它还能将文件分析、图像生成等复杂任务无缝委派给其他 Gemini 模型处理。

据谷歌介绍,Gemini 3.5 Transcribe 提供了更精准的转录服务,在流式传输和非流式传输场景下的平均词错率(WER)分别仅为 4.0% 和 2.6%。在嘈杂环境中,该模型依然能保持出色的识别效果,并能准确捕捉订单号、邮政编码等字母数字混合实体。

目前,Gemini 3.5 Transcribe 支持 85 种语言,并兼容多种地区口音与方言。在处理预录音频时,它最多可为三位说话人进行语音分离并添加时间戳;同时,模型支持用户自定义专属词汇表,能够精准识别特定领域的专业术语及特殊拼写。

在可用性方面,谷歌表示开发者现已可通过 Google AI Studio 和 Google Antigravity 在 Gemini API 中公开预览 Gemini 3.5 Transcribe。普通用户则可在 Android 和 macOS 平台上进行体验。此外,该模型即将登陆 Google Chrome 浏览器,届时用户可在任意网页输入框中实现"语音输入"。

除了语音识别模型,谷歌在 Gemini 领域近期动作频频。公司刚刚发布了 Gemini 3.7 Flash 模型,正式加入 AI 价格战。同时,面向美国用户的 Android 版 Chrome 浏览器已全面上线 Gemini 功能,该 AI 助手也被集成到了 Waymo 的最新无人驾驶出租车中。

最后,对于有人声音频分离需求的用户,也可以通过简鹿人声分离来使用 AI 模型轻松从音频中分离人声或伴奏,它支持 Windows 和 macOS 系统,是制作音乐处理音频的好帮手。

相关推荐
Frag0ut3 天前
Chrome Dev 最新功能更新:AI 智能体开发工具、HTML-in-Canvas 与双周更新节奏
chrome·google·dev·webmcp·最新功能·双周更新
Helix2504 天前
Chrome 性能优化实战:内存节省、硬件加速与 Flags 设置,让浏览器更流畅
chrome·google·性能优化·内存占用·硬件加速·设置技巧·浏览器优化
Helix2504 天前
Chrome 标签页管理术:分组、固定、搜索与恢复,告别标签页混乱
chrome·google·分组·标签页管理·固定标签·标签页恢复
Helix2505 天前
Chrome 快捷键效率提升:10 个常用快捷键,把浏览速度提升一个量级
chrome·google·浏览器·使用技巧·效率工具·快捷键·爆红教程
不老刘7 天前
Antigravity 应用登录/token 交换超时 · 排查速查笔记
google·antigravity·反重力
seowmt9 天前
结构化数据和自然语言描述哪个更管用?答案分场景
人工智能·google·typescript·go语言·schema
ShineWinsu10 天前
对于ProtoBuffer:ProtoBuffer的介绍以及安装
linux·网络·google·协议·序列化·反序列化·protobuffer
I Am a robert girl17 天前
谷歌迈出RSI一大步:从Gemini模型迭代看AI工程化的新风向
人工智能·大模型·gemini·ai工程化·上下文工程·rsi·工具链集成
4SAPI20 天前
Gemini 4 Pro 泄露参数解析:2M 上下文时代,企业如何规划 Gemini API 中转与多模型架构?
人工智能·gemini
wangruofeng21 天前
Pro 七个月没转正,Flash 四个月连发四代 Stable,写代码怎么选?拆解 Gemini 两条产品线分化逻辑。
google·aigc·ai编程