全天候科技 1小时前
谷歌Gemini 3.8 Live上线"数字人"实时对话,支持多国语言与口型同步
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

谷歌云旗下 Gemini 3.8 Live with Live Avatar 功能正式面向企业用户全面开放,将实时视频虚拟形象与多语言语音对话能力整合为一体,标志着企业级对话式 AI 从纯语音交互向多模态视觉交互迈进。

该功能于本周正式在 Gemini Enterprise 中上线,此前已在 Google Cloud Next 2026 上完成预览展示。

新版本支持视频虚拟形象的实时唇形同步、97 种语言自动识别与切换,以及后台工具调用与 API 执行,同时提供美国和欧盟双区域端点部署,满足企业合规与数据治理要求。

从客户落地情况来看,Cox Automotive 已将该技术应用于旗下 Autotrader 平台,构建了可实时高亮屏幕内容、引导消费者完成车辆搜索与融资流程的购车 AI 助手;印度 AI 公司 Equal AI 则表示,基于 Gemini 3.8 Live,其平台目前每日处理超过百万次实时通话,覆盖九种印度语言。

这是谷歌本周第二次发布新的人工智能模型。周三,谷歌宣布推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型。

周四截至发稿,谷歌盘中上涨 0.66%。

核心功能:多模态融合,超越语音基础能力

Gemini 3.8 Live with Live Avatar 在原有语音基础上引入视觉交互层,主要面向网页端、移动端及实体交互终端(interactive kiosks)等多种部署场景。

在对话连贯性方面,该模型采用原生语音到语音(speech-to-speech)架构,支持自然打断恢复,且不会丢失对话上下文或中断后台事务处理。

工具调用能力方面,模型可在持续对话的同时,在后台异步执行工具调用与 API 请求,让交互体验更为流畅,不因后台任务而产生明显停顿。

视觉理解方面,Live Avatar 支持实时摄像头画面与屏幕共享的同步处理,可与音频输入并行分析,为服务场景提供更丰富的上下文感知能力。

语言覆盖上,97 种语言支持及自动检测功能,使其具备面向全球多语言市场的规模化部署潜力。

信任机制:水印技术与身份管控并行

针对深度伪造及身份滥用风险,谷歌在该功能的合规设计上采取了双层管控策略。

在虚拟形象使用层面,企业用户可从谷歌提供的预建虚拟形象库中进行部署;而自定义虚拟形象功能则设有严格的企业白名单与身份核验机制,

目前仅限申请通过的企业使用。在内容溯源层面,所有生成的音频与视频流均嵌入谷歌 SynthID 不可感知水印,以确保 AI 生成内容在传播过程中保持可识别性与可验证性。

这一机制的引入,一定程度上回应了企业部署对话式 AI 时面临的监管合规压力,尤其是在金融服务、医疗及客户服务等强监管行业。

客户落地:从购车助手到百万级通话场景

目前已有多家企业披露基于 Gemini 3.8 Live 的应用进展,涵盖汽车电商、电信客服及 CRM 等多个垂直领域。

Cox Automotive 首席产品官 Marianne Johnson 表示,Autotrader 的对话式 AI 虚拟形象将自然语言描述与库存匹配相结合,是其 " 连接智能 " 愿景落地的重要步骤,该愿景旨在让每次消费者互动均能调用 Cox Automotive 的完整数据资产。

Equal AI 首席执行官 Akhilesh Damaraju 称,借助 Gemini 3.8 Live 在打断处理、多语言对话及工具调用稳定性方面的改进,该平台现已实现每日超百万次实时通话处理,覆盖九种印度语言,目标是构建 " 了解你、说你的语言、始终站在你这边 " 的个人 AI。

Salesforce Agentforce 产品副总裁 Bob Van Osten 表示,Salesforce AI Research 与谷歌的合作旨在探索实时多模态能力与代理式 AI 的结合,以打造从首次接触到问题解决全流程的客户服务体验。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

谷歌 ai 印度 美国 欧盟
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论