当地时间 8 月 26 日,谷歌发布最新语音转文本模型 Gemini 3.5 Transcribe,该模型不仅主打更高的识别准确率,更将能力边界从逐字记录延伸至理解说话人意图并自动整理输出结果,标志着语音识别技术向更深层的语言理解迈进。
与传统语音识别工具不同,Gemini 3.5 Transcribe 能够识别说话人的自我修正、自动删除口头禅,并直接将非结构化口语转换为格式化文本。
谷歌称其为迄今 " 最精准 " 的语音转文本模型,并已将其引入 Android 版 Gboard 及 Mac 版 Gemini 应用,同时通过 Gemini API 向开发者开放预览。
此次发布与 Gemini 3.5 Live 及 Gemini 3.5 Live Experimental 同日推出,共同构成谷歌新的 Gemini Audio 系列。
分析人士指出,随着语音入口加速渗透谷歌旗下 Chrome、Gboard 等高频产品,语音交互有望逐步替代键盘输入,成为用户与 AI 系统的主要连接方式。
截至发稿,谷歌股价周四盘中下跌 1.37%。

从 " 逐字记录 " 到 " 意图理解 "
Gemini 3.5 Transcribe 的核心升级在于对自然语言的语境理解能力。分析指出,此次发布的关键不仅是提升传统意义上的识别准确率,而是让模型能够在转录过程中理解说话人意图,并对原始语音进行 " 编辑 "。
具体而言,当用户说出 " 周二——不,周三见面 " 时,模型可识别出这是一次自我修正,而非将两种表述全部记录下来。
与此同时,模型会自动删除 "um""uh" 等口头禅,并完成标点符号和文本格式的整理。该模型能够将凌乱、非结构化的口述内容直接转化为格式化文本。
在语言覆盖方面,该模型支持超过 85 种语言,具备自动语言识别能力,并能处理多语言混说场景。谷歌还允许用户添加自定义词汇,使模型更准确地识别专业术语、特殊拼写及订单号、邮编等字母数字组合。对于预录音频,模型还支持说话人识别和逐词时间戳。
开发者接口与产品落地双线推进
在面向开发者的能力开放层面,Gemini 3.5 Transcribe 已通过 Gemini API 进入预览阶段,支持实时语音流与录制音频文件两种处理场景。
据谷歌官方文档,文件转录最长支持 1 小时,实时转录则面向低延迟应用场景。开发者可调用低延迟转录、自定义词汇及智能格式化等功能,将语音识别能力嵌入自有应用。
在产品端,Gemini 3.5 Transcribe 已落地 Android 平台的 Gboard Rambler 语音输入功能及 Mac 版 Gemini 应用。
谷歌还计划将其引入 Chrome 浏览器,届时用户可在网页文本输入框内直接通过语音输入内容,涵盖回复消息、撰写帖子及向 Gemini 发出指令等场景。
语音入口之争背后的商业逻辑
此次发布是谷歌系统性推进 Gemini" 语音入口 " 战略的组成部分。
谷歌正将 Gemini 的能力从文本和图像进一步延伸至实时对话、语音翻译和语音输入等场景,Gemini 3.5 Transcribe、Gemini 3.5 Live 及 Gemini 3.5 Live Experimental 共同构成其 Gemini Audio 系列。
从商业化视角看,语音转文本正从单纯的后台基础能力演变为 AI 应用的重要交互入口。随着模型具备 " 听懂—理解—整理—执行 " 的一体化能力,用户与 AI 的交互方式有望从键盘输入向语音指令转移。
对谷歌而言,将 Gemini 3.5 Transcribe 嵌入 Chrome、Gboard、Docs、Gmail 等高频产品,有望进一步扩大 Gemini 在日常生产力场景中的渗透深度,并在语音交互这一新兴入口上巩固其竞争地位。


登录后才可以发布评论哦
打开小程序可以发布评论哦