星途科讯 4小时前
PolyAI发布原生音频模型,延迟低至300毫秒媲美真人
index.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

语音 AI 开发商 PolyAI 今日正式发布 Dialog-RSN-1,这是一款能够直接感知并响应音频的原生语音对话大模型。

传统语音 AI 链路通常串联语音识别、文本大模型及语音合成三个独立环节,易导致信息损耗与延迟。Dialog-RSN-1 则在模型内部完成所有语音识别与语义理解,仅将语音输出环节分离。这种架构使 AI 能一次性 " 听懂 " 完整对话,精准捕捉语调、节奏及上下文,无需依赖前置模型。

原生音频理解:捕捉非言语线索

据 PolyAI 介绍,由于直接解析音频流,新模型能识别改变对话走向的非言语线索。用户可提示模型针对来电者的口音、情绪或环境噪音做出反应。与传统转录丢失信息不同,该模型能结合上下文修正发音错误,例如区分品牌名 "Audibel" 与普通单词 "audible",或理解用户大声拼写 "Matthew 有两个 T" 的意图。

这一机制显著提升了响应速度与交互自然度。模型能在后台快速调用工具并基于全量上下文构建回复,同时通过捕捉用户说话节奏,有效降低不当打断的概率,实现类人的轮流发言体验。

性能对比:延迟远低于行业标杆

数据显示,Dialog-RSN-1 的延迟区间为 280 至 500 毫秒,并能稳定在 300 毫秒内响应。相比之下,OpenAI 的 GPT-realtime-2.1 响应延迟通常在 860 至 1900 毫秒之间。

人类正常对话的自然停顿约为 200 至 300 毫秒,且跨文化、语言具有高度一致性。AI 响应若偏离此时机,易引发用户挫败感,尤其在用户试图打断纠错时,高延迟会导致沟通效率大幅降低。

架构解耦:灵活控制语音输出

PolyAI 刻意将文本转语音(TTS)模块从大模型中剥离。这意味着最终用户可独立调整声音音色、情感色彩及节奏,无需对底层对话模型进行昂贵且复杂的重新训练。

这与 GPT-realtime 和 Gemini Live 等内置语音输出的模型形成鲜明对比。后者难以大规模定制声音且流媒体成本高昂。而 Dialog-RSN-1 的解耦架构允许企业在专用硬件上高效运行 TTS,自主控制资源投入,从而降低整体计算成本。

技术层面,PolyAI 利用内部数据,通过监督微调和强化微调对开放权重的多模态模型进行后训练。其训练管道兼容 Gemma、GPT-OSS、Qwen 和 Mistral 等多种基座。公司的目标是在 A100 GPU 上部署 8B 密集或 30B 稀疏模型时,将延迟控制在 300 毫秒以下。

【星途科讯 图文丨踢三脚 首发于 ZAKER 科技,转载请注明出处】

评论
大家都在看