星途科讯 3小时前
谷歌发布Gemini 3.8 TTS:支持30秒声音复刻与双人对白
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

谷歌正式推出 Gemini 3.8 Flash Text-To-Speech ( TTS ) 和 Flash-Lite TTS 模型,旨在突破 AI 语音合成的表现力瓶颈。相较于传统朗读,新模型能更精准地演绎口音、节奏、情感停顿乃至叹息等细微特征,赋予 AI 音频更强的 " 表演 " 能力。

精细化控制与声音复刻

此次更新的核心在于用户对生成内容的控制权大幅提升。Gemini 3.8 Flash TTS 支持通过自然语言描述创建原创声音,覆盖超过 100 种语言和方言,并提供 2,000 多种现成的生产级声音选项。

备受关注的声音复刻功能允许用户在获得授权的前提下,仅需提供 30 秒音频样本即可重现一致的声音形象。模型能够逐行执行关于语调、语速、方言切换、耳语、笑声及对话提示的指令,甚至能从单一脚本中编排双人对白,确保数小时音频中的声音一致性。这将显著改善播客、有声书、配音及语音代理等场景的听感,减少机械生硬感。

基准测试与竞品对比

基准测试数据显示,Gemini 3.8 Flash TTS 在 Hume AI 的 Voice Design Benchmark 中总体排名第一,口音得分高达 60.8 分;Flash 和 Flash-Lite 模型则在 Hume 整体质量指数中包揽前两名。在 Voice Arena 的多语言测试中,二者表现也位居前列。不过,竞争对手 ElevenLabs 在单项声音质量和拟人化变化类别中仍保持较高分数。

落地应用与安全合规

目前,Flash TTS 已在 Gemini Notebook 中上线,Flash-Lite TTS 则集成至刚刚开放最新 Omni 视频生成器的 Google Vids 中。开发者可通过 Google AI Studio 和 Gemini API 访问这两款模型。

在安全方面,谷歌设置了严格护栏:系统强制验证同意权限,添加 SynthID 水印和 C2PA 凭证。此外,在英国、欧洲经济区(EEA)、印度、德克萨斯州和伊利诺伊州等地区,AI Studio 中禁止使用声音复刻功能。

【星途科讯 图文丨略略 首发于 ZAKER 科技,转载请注明出处】

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

谷歌 ai 英国 印度
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论