手机中国 23小时前
小米发布目标说话人语音识别大模型Xiaomi-CocktailASR-1
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

【CNMO 科技消息】9 月 11 日,小米正式发布并开源工业级目标说话人语音识别大模型 Xiaomi-CocktailASR-1。CNMO 科技从 @小米技术 官微获悉,该模型面向多人同时说话的复杂语音场景,重点解决语音识别中的 " 鸡尾酒会 " 难题,即在嘈杂环境下从多名说话者中识别并转录指定目标用户的语音内容。

小米

据介绍,Xiaomi-CocktailASR-1 采用端到端 LLM 架构,使用目标说话人的一段参考音频作为声纹提示,在多人重叠发言的情况下,可提取并仅转录目标说话人的内容。官方表示,该模型基于大规模多说话人数据训练,在 AliMeeting、AMI、LibriMix 等多个主流多说话人测试集上达到最优性能。与此同时,其在单说话人场景下的识别表现也可与主流单人 ASR 模型相媲美,能够通过同一模型兼顾单人与多人场景,无需在不同语音识别模型之间切换。

除目标说话人识别外,该模型还具备负样本拒识能力。对于音频中不存在目标说话人的情况,模型可输出空文本,以降低非目标语音带来的误识别和误触发风险。小米同时提到,Xiaomi-CocktailASR-1 支持思维链推理模式,可为识别结果提供具备可解释性的推理过程。

目前,Xiaomi-CocktailASR-1 的模型权重与推理代码已经开源。

版权所有,未经许可不得转载

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

小米 语音识别 开源
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论