谷歌最新语音转文本模型 Gemini 3.5 Transcribe

谷歌近日宣布推出其 Gemini 家族语音转文字模型的最新版本 ------ Gemini 3.5 Transcribe。这家搜索巨头表示,这是该系列迄今为止精度最高的语音识别模型。

新模型在处理背景噪音和复杂专业术语方面表现更为出色。谷歌指出,得益于这一新模型,macOS 端 Gemini 应用以及 Android 端 Gboard 键盘的 Rambler 功能均已实现性能提升。同时,开发者也可利用该模型打造语音智能体、实时字幕工具或通话后分析系统。

谷歌在博客中写道:"Gemini 3.5 Transcribe 旨在捕捉用户的自然说话风格,从而更好地理解用户意图并识别自定义词汇,让用户能够通过语音高效执行各类任务。"

这款全新的 AI 模型还配备了一系列提升输出质量的新功能。首先,它具备自我纠错能力,能够自动去除口语中的填充词(如"嗯"、"啊"),并实现文本的自动排版。此外,它还能将文件分析、图像生成等复杂任务无缝委派给其他 Gemini 模型处理。

据谷歌介绍,Gemini 3.5 Transcribe 提供了更精准的转录服务,在流式传输和非流式传输场景下的平均词错率(WER)分别仅为 4.0% 和 2.6%。在嘈杂环境中,该模型依然能保持出色的识别效果,并能准确捕捉订单号、邮政编码等字母数字混合实体。

目前,Gemini 3.5 Transcribe 支持 85 种语言,并兼容多种地区口音与方言。在处理预录音频时,它最多可为三位说话人进行语音分离并添加时间戳;同时,模型支持用户自定义专属词汇表,能够精准识别特定领域的专业术语及特殊拼写。

在可用性方面,谷歌表示开发者现已可通过 Google AI Studio 和 Google Antigravity 在 Gemini API 中公开预览 Gemini 3.5 Transcribe。普通用户则可在 Android 和 macOS 平台上进行体验。此外,该模型即将登陆 Google Chrome 浏览器,届时用户可在任意网页输入框中实现"语音输入"。

除了语音识别模型,谷歌在 Gemini 领域近期动作频频。公司刚刚发布了 Gemini 3.7 Flash 模型,正式加入 AI 价格战。同时,面向美国用户的 Android 版 Chrome 浏览器已全面上线 Gemini 功能,该 AI 助手也被集成到了 Waymo 的最新无人驾驶出租车中。

最后,对于有人声音频分离需求的用户,也可以通过简鹿人声分离来使用 AI 模型轻松从音频中分离人声或伴奏,它支持 Windows 和 macOS 系统,是制作音乐处理音频的好帮手。

相关推荐
wangruofeng11 小时前
Pro 七个月没转正,Flash 四个月连发四代 Stable,写代码怎么选?拆解 Gemini 两条产品线分化逻辑。
google·aigc·ai编程
VIP_CQCRE18 小时前
用 Ace Data Cloud 快速接入 Gemini Chat Completion API:让多模型调用像 OpenAI 一样简单
大模型·api·gemini·ai开发·ace data cloud
XLYcmy5 天前
ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory论文阅读
论文阅读·google·llm·agent·记忆·harness·自进化
亚林瓜子10 天前
Google的编程Agent:antigravity CLI自动模式
ai·google·spec·coding·cli·auto·agy
ServBay10 天前
谷歌发布 Gemini 3.8 Flash,官方跑分很厉害,但又被嘲了?
aigc·ai编程·gemini
deepseek2311 天前
Google Gemini Agentic Video 上线:88% 少 token 的主动取样如何改写长视频理解
python·多模态·ai agent·gemini·视频理解
云卷云舒___________18 天前
谷歌内测Gemini 3.8 Flash,智谱开源GLM-5.3权重,腾讯亮剑Hy4,开源大模型神仙打架 | 8月29日 AI日报
谷歌·腾讯·glm·gemini·混元·智谱·ai日报
小满zs19 天前
Go语言第十章(指针)
后端·google·go
程序员爱钓鱼25 天前
Go 编程实战:闭包 Closure——函数如何记住外部变量
后端·google·go