【CNMO 科技消息】8 月 4 日消息,OpenAI 正式发布经过全面重构的语音交互系统 GPT-Live,解决了 AI 语音助手长期存在的对话停顿和回合切换生硬等核心痛点。该公司工程师 Justin Uberti 和 Zahan Malkani 在技术博文中详细披露了这一历时六个月的底层架构改造。

OpenAI
传统 AI 语音交互采用回合制模式,依赖 " 回合检测器 " 来判断用户何时结束发言。这种机制存在明显缺陷:检测过早会打断用户说话,检测过晚则造成不自然的沉默等待。GPT-Live 彻底摒弃了这一方案,转而采用全双工架构,能够在接收用户语音的同时生成回复,系统每秒多次自主决策应该倾听、发言、暂停还是允许用户打断。
为实现流畅对话,OpenAI 将系统拆分为两个独立层级。音频流通过专用低延迟快速通道在用户设备与 GPT-Live 模型之间传输,而网络搜索、代码执行、调用 GPT-5.5 等前沿模型进行深度推理等重负载任务则在异步边界之外的后台路径完成。这意味着即使复杂查询需要额外数秒处理,语音层仍能保持自然对话,不会出现掉帧、卡顿或连接冻结。
在传输层优化方面,OpenAI 将原有的 Python asyncio 代码替换为 Go 语言,为超过 1.5 亿周活跃用户实现更稳定的帧传输。针对连接建立延迟,团队开发了名为 WARP(WebRTC Abridged Roundtrip Protocol)的开放规范,配合 Instant Connect 功能,将传统 WebRTC 需要六次网络往返的启动流程压缩至单个数据包,使用户几乎可以瞬间发起实时语音会话。
GPT-Live 的推出标志着 AI 语音交互从 " 对讲机模式 " 向自然人机对话的跨越。通过分离即时语音与重型计算任务,OpenAI 构建的语音界面在体验上更接近人际交流,为大规模商用语音 AI 服务树立了新的技术基准。
版权所有,未经许可不得转载


登录后才可以发布评论哦
打开小程序可以发布评论哦