8 月 5 日,字节跳动正式推出原生音视频全双工大模型 SeedRealtime,并宣布该模型已在豆包 App 全量上线。用户将豆包更新至最新版本后,可通过 " 打电话 " 功能进入视频通话界面,体验实时音视频 AI 交互。
SeedRealtime 采用统一端到端架构,原生融合音频、视频与文本三种模态信号。
与此前业界主流的级联系统不同,后者依赖自动语音识别(ASR)、视觉模型、语音合成(TTS)等多个模块串联,感知、理解和表达分属不同环节,延迟层层叠加,SeedRealtime 将声音、画面、时序与表达统一到同一个端到端模型中。模型不再依赖外部语音活动检测(VAD)进行轮次判断,而是在连续的多模态信息流上同步完成感知、理解、决策与表达。
字节方面披露,SeedRealtime 在三个方向实现了关键突破。
首先是音视频联合理解。
模型原生支持声音、画面与时序信息的深度融合,能够结合场景消解同音词歧义,也能准确理解视觉中的时序指代。用户说 " 这个怎么弄 " 时,模型需要结合当前画面、手势与历史动作判断 " 这个 " 具体指向什么。
其次是主动交互能力。
模型具备持续的环境感知与主动表达能力,能在察觉画面状态变化时主动提醒,并能调用工具融入表达。官方演示中,模型可在博物馆持续观察镜头画面、识别指定文物后主动提醒,也可在用户操作咖啡机时根据画面变化实时纠错。
第三是流畅的交互节奏。
模型能够实时感知用户的对话状态,在适当时机自然接话、停顿与回应;同时具备抗干扰能力,能分辨旁人闲聊与背景噪声,避免误触发。在机场等嘈杂场景中,模型能够区分用户与旁人的对话。
字节披露的端到端人工评测数据显示,相比传统级联系统,SeedRealtime 将音视频对话中的节奏问题减少约一半。" 话未说完被抢断、话音已落却回应迟缓,或是被背景杂音与闲聊误触发 " 等卡壳现象均有明显下降。同时,单次对话能够完整、顺畅交流的概率也有明显提升。
从行业基本面来看,SeedRealtime 的推出符合今年基础模型的演进趋势。自今年上半年以来,头部企业的竞争焦点已明显从单纯追求参数规模,转向多模态实时交互的商业化落地。
豆包 App 是字节跳动在 C 端市场的核心 AI 产品。此次在端内快速全量上线全双工大模型,其业务逻辑在于通过降低交互门槛,进一步争夺用户规模与应用内的停留时长。
不过,音视频全双工技术的常态化运营仍面临直接的工程与商业挑战。连续多模态信息流的实时处理,对云端算力和网络带宽的消耗呈指数级增长。
在 C 端海量并发请求的场景下,如何将模型的推理成本控制在商业可接受的范围内,是包括字节跳动在内所有 AI 研发企业必须跨越的门槛。
另一方面,市场对视频通话类 AI 的真实需求黏性仍需打个问号。主动提醒、实时视频交互等功能,在特定场景下是否会造成用户的体验冗余甚至打扰,目前尚无定论。
SeedRealtime 能否在新鲜感褪去后,沉淀出具有高频、刚需属性的核心应用场景,多模态应用生态能否就此闭环,还需要后续真实的留存数据来验证。


登录后才可以发布评论哦
打开小程序可以发布评论哦