谷歌最新语音转文本模型 Gemini 3.5 Transcribe

谷歌近日宣布推出其 Gemini 家族语音转文字模型的最新版本 ------ Gemini 3.5 Transcribe。这家搜索巨头表示,这是该系列迄今为止精度最高的语音识别模型。

新模型在处理背景噪音和复杂专业术语方面表现更为出色。谷歌指出,得益于这一新模型,macOS 端 Gemini 应用以及 Android 端 Gboard 键盘的 Rambler 功能均已实现性能提升。同时,开发者也可利用该模型打造语音智能体、实时字幕工具或通话后分析系统。

谷歌在博客中写道:"Gemini 3.5 Transcribe 旨在捕捉用户的自然说话风格,从而更好地理解用户意图并识别自定义词汇,让用户能够通过语音高效执行各类任务。"

这款全新的 AI 模型还配备了一系列提升输出质量的新功能。首先,它具备自我纠错能力,能够自动去除口语中的填充词(如"嗯"、"啊"),并实现文本的自动排版。此外,它还能将文件分析、图像生成等复杂任务无缝委派给其他 Gemini 模型处理。

据谷歌介绍,Gemini 3.5 Transcribe 提供了更精准的转录服务,在流式传输和非流式传输场景下的平均词错率(WER)分别仅为 4.0% 和 2.6%。在嘈杂环境中,该模型依然能保持出色的识别效果,并能准确捕捉订单号、邮政编码等字母数字混合实体。

目前,Gemini 3.5 Transcribe 支持 85 种语言,并兼容多种地区口音与方言。在处理预录音频时,它最多可为三位说话人进行语音分离并添加时间戳;同时,模型支持用户自定义专属词汇表,能够精准识别特定领域的专业术语及特殊拼写。

在可用性方面,谷歌表示开发者现已可通过 Google AI Studio 和 Google Antigravity 在 Gemini API 中公开预览 Gemini 3.5 Transcribe。普通用户则可在 Android 和 macOS 平台上进行体验。此外,该模型即将登陆 Google Chrome 浏览器,届时用户可在任意网页输入框中实现"语音输入"。

除了语音识别模型,谷歌在 Gemini 领域近期动作频频。公司刚刚发布了 Gemini 3.7 Flash 模型,正式加入 AI 价格战。同时,面向美国用户的 Android 版 Chrome 浏览器已全面上线 Gemini 功能,该 AI 助手也被集成到了 Waymo 的最新无人驾驶出租车中。

最后,对于有人声音频分离需求的用户,也可以通过简鹿人声分离来使用 AI 模型轻松从音频中分离人声或伴奏,它支持 Windows 和 macOS 系统,是制作音乐处理音频的好帮手。

相关推荐
程序员爱钓鱼4 天前
Go 编程实战:闭包 Closure——函数如何记住外部变量
后端·google·go
XLYcmy6 天前
小红书 算法一面 十一
google·meta·llm·负载均衡·token·moe·glam
TunerT_TQ12 天前
Google|LangExtract 源码静态评测:从 90 个 Python 文件看大模型结构化信息抽取工程基础
google·开源·github
xiakq24 天前
5 分钟接入 GPT-5.6 完整指南
gpt·openai·claude·gemini·anthropic
寒水馨1 个月前
Linux下载、安装protobuf-v35.1(附安装包protoc-35.1-linux-x86_64.zip)
linux·运维·服务器·google·序列化·protobuf·protoc
寒水馨1 个月前
macOS下载、安装protobuf-v35.1(附安装包protoc-35.1-osx-universal_binary.zip)
macos·google·grpc·序列化·protobuf·protoc·数据交换
元Y亨H1 个月前
大模型技术 模型调用结果解析 概述
google·langchain·llm
小鹿软件办公1 个月前
谷歌 Lyria 3.5 正式上线:全面提升 AI 音乐表现力与创作控制
人工智能·google·lyria 3.5
Coffeeee1 个月前
谷歌的一个优化建议,让我重新学了一遍Android里面如何正确处理位图
android·google·kotlin