太平洋电脑网 昨天
字节跳动推出SeedRealtime音视频全双工大模型
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

【太平洋科技快讯】8 月 5 日,据字节跳动 Seed 官方消息,原生音视频全双工大模型 SeedRealtime 今日正式发布。该模型核心亮点是将声音、画面、时序与表达统一到同一个端到端模型中,摒弃传统模型先完整接收音视频信息再生成回复的运行逻辑,实现感知、理解、决策与表达同步并行。

据介绍,SeedRealtime 是走向全模态交互的关键一步,在业界率先实现了音视频全双工技术的规模化落地,依托统一架构原生融合音频、视频与文本,能在连续的多模态信息流上实时交互,带来 " 边看、边听、边说 " 的全新体验。目前, SeedRealtime 已在豆包 App 全量上线。

SeedRealtime 实现了三大突破:音视频联合理解、主动的交互能力、流畅的交互节奏。

端到端人工评测数据显示,对比级联式多模态模型,SeedRealtime 的对话节奏违和问题降低五成,大幅改善中途抢话、回复延迟、噪音误触发等常见卡顿问题,完整顺畅完成一轮对话的概率明显提升。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

字节跳动
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论