星途科讯 3小时前
PolyAI发布原生音频模型,延迟低至300毫秒媲美真人
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

语音 AI 开发商 PolyAI 今日正式发布 Dialog-RSN-1,这是一款能够直接感知并响应音频的原生语音对话大模型。

传统语音 AI 链路通常串联语音识别、文本大模型及语音合成三个独立环节,易导致信息损耗与延迟。Dialog-RSN-1 则在模型内部完成所有语音识别与语义理解,仅将语音输出环节分离。这种架构使 AI 能一次性 " 听懂 " 完整对话,精准捕捉语调、节奏及上下文,无需依赖前置模型。

原生音频理解:捕捉非言语线索

据 PolyAI 介绍,由于直接解析音频流,新模型能识别改变对话走向的非言语线索。用户可提示模型针对来电者的口音、情绪或环境噪音做出反应。与传统转录丢失信息不同,该模型能结合上下文修正发音错误,例如区分品牌名 "Audibel" 与普通单词 "audible",或理解用户大声拼写 "Matthew 有两个 T" 的意图。

这一机制显著提升了响应速度与交互自然度。模型能在后台快速调用工具并基于全量上下文构建回复,同时通过捕捉用户说话节奏,有效降低不当打断的概率,实现类人的轮流发言体验。

性能对比:延迟远低于行业标杆

数据显示,Dialog-RSN-1 的延迟区间为 280 至 500 毫秒,并能稳定在 300 毫秒内响应。相比之下,OpenAI 的 GPT-realtime-2.1 响应延迟通常在 860 至 1900 毫秒之间。

人类正常对话的自然停顿约为 200 至 300 毫秒,且跨文化、语言具有高度一致性。AI 响应若偏离此时机,易引发用户挫败感,尤其在用户试图打断纠错时,高延迟会导致沟通效率大幅降低。

架构解耦:灵活控制语音输出

PolyAI 刻意将文本转语音(TTS)模块从大模型中剥离。这意味着最终用户可独立调整声音音色、情感色彩及节奏,无需对底层对话模型进行昂贵且复杂的重新训练。

这与 GPT-realtime 和 Gemini Live 等内置语音输出的模型形成鲜明对比。后者难以大规模定制声音且流媒体成本高昂。而 Dialog-RSN-1 的解耦架构允许企业在专用硬件上高效运行 TTS,自主控制资源投入,从而降低整体计算成本。

技术层面,PolyAI 利用内部数据,通过监督微调和强化微调对开放权重的多模态模型进行后训练。其训练管道兼容 Gemma、GPT-OSS、Qwen 和 Mistral 等多种基座。公司的目标是在 A100 GPU 上部署 8B 密集或 30B 稀疏模型时,将延迟控制在 300 毫秒以下。

【星途科讯 图文丨踢三脚 首发于 ZAKER 科技,转载请注明出处】

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

zaker 语音识别 流媒体 gpu 语音合成
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论