【CNMO 科技消息】9 月 11 日,小米正式发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1。CNMO 科技从 @小米技术 官微获悉,该模型面向多人同时说话的复杂语音场景,重点解决语音识别中的 " 鸡尾酒会 " 难题,即在嘈杂环境下从多名说话者中识别并转录指定目标用户的语音内容。

小米
据介绍,Xiaomi-CocktailASR-1 采用端到端 LLM 架构,使用目标说话人的一段参考音频作为声纹提示,在多人重叠发言的情况下,可提取并仅转录目标说话人的内容。官方表示,该模型基于大规模多说话人数据训练,在 AliMeeting、AMI、LibriMix 等多个主流多说话人测试集上达到最优性能。与此同时,其在单说话人场景下的识别表现也可与主流单人 ASR 模型相媲美,能够通过同一模型兼顾单人与多人场景,无需在不同语音识别模型之间切换。

除目标说话人识别外,该模型还具备负样本拒识能力。对于音频中不存在目标说话人的情况,模型可输出空文本,以降低非目标语音带来的误识别和误触发风险。小米同时提到,Xiaomi-CocktailASR-1 支持思维链推理模式,可为识别结果提供具备可解释性的推理过程。
目前,Xiaomi-CocktailASR-1 的模型权重与推理代码已经开源。
版权所有,未经许可不得转载


登录后才可以发布评论哦
打开小程序可以发布评论哦