2026 年 8 月 6 日,豆包宣布视频通话功能迎来一次重大升级。
正式接入原生音视频全双工大模型 SeedRealtime,支持端到端架构,原生融合音频、视频与文本三种模态。
豆包 AI 尝鲜体验:https://api.xubobo.top/qr/q/9Yr2CHUI
我用一句话总结,就是从 " 先听完、再看完、最后作答 ",变成了 " 边看、边听、边说 " 同步进行,所有用户均可免费体验。
1、带来了哪些全新升级
第一,能 " 看懂 " 画面了。 模型原生支持声音、画面与时序信息的深度融合。
能结合当前画面、手势与历史动作判断 " 这个 " 具体指什么;遇到同音词或模糊语音,也能借助视觉场景完成消歧。
外文菜单的实时翻译、咖啡机的分步教学,现在镜头一对、开口一问就能解决。
第二,会 " 主动 " 交互了。 模型具备持续的环境感知与主动表达能力。在博物馆里,持续观察镜头画面,识别到指定文物后主动提醒。
交互从被动响应升级为主动协作。
第三,对话更 " 自然 " 了。 模型能实时感知用户的对话状态,在适当时机自然接话、停顿与回应。
同时具备较强的抗干扰能力,能区分用户对话、旁人闲聊和背景噪声,减少误触发。
第一步:我们把豆包 App 更新至最新版本。
第二步:找到通话入口。
打开豆包 App,进入对话界面后,有两种方式可以找到入口:
方式一:在对话框内直接选择 " 打电话 " 按钮。
方式二:点击对话框旁的 "+" 号,在弹出的菜单中同样选择 " 打电话 "。
第三步:开启视频通话。
进入通话界面后,点击 " 视频通话 " 选项,这样我们就能体验到全新的豆包视频通话功能啦。
豆包 AI 尝鲜体验:https://api.xubobo.top/qr/q/9Yr2CHUI
疑似使用 AI 生成,请谨慎甄别


登录后才可以发布评论哦
打开小程序可以发布评论哦