【CNMO 科技消息】9 月 23 日,千问正式发布 Qwen-Audio-3.1 系列语音大模型,覆盖语音识别、语音合成和实时语音交互三大核心模型,并新增音频创作模型 TTS-Next 和音频理解模型 ASR-Next。

千问
其中,Qwen-Audio-3.1-ASR 主打语音识别与文本整理,支持 30 种语言和 16 种中文方言,首字响应时间约 160 毫秒,可实现边说边转写。该模型还加入原生转写润色能力,能够自动去除语气词与重复表达,并对语义进行重组。

Qwen-Audio-3.1-ASR-Next 则将处理范围从语音文本扩展至完整音频信息,支持分角色语音识别,可对应呈现说话人、时间戳和转写文本。同时,该模型还能理解人物情绪、环境声和机械声,用于声音描述、事件定位、音频问答与推理等场景。

在生成端,Qwen-Audio-3.1-TTS 支持多语种和方言合成,并可在同一音色下实现跨语言自然迁移。除基础发音外,模型还支持通过指令控制情绪、语速和表达方式。此外,新推出的 Qwen-Audio-3.1-TTS-Next 进一步扩展到音频创作,可基于文本、时间戳和参考音频统一生成人声、音效与环境音,用于构建包含角色、情绪、场景和空间关系的全声景作品。

据 CNMO 科技了解,Qwen-Audio-3.1-Realtime 支持全双工实时交互,可同时说和听,用户可随时插话或打断。该模型除理解语音文字外,还可识别声音背后的情绪与意图,并在对话中调用 API、知识库和业务系统完成任务。
目前,Qwen-Audio-3.1 系列模型 API 已上线千问 AI 平台。
版权所有,未经许可不得转载


登录后才可以发布评论哦
打开小程序可以发布评论哦