IT之家 昨天
阿里千问发布语音合成大模型Qwen-Audio-3.0-TTS
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

IT 之家 7 月 20 日消息,阿里千问今日发布语音合成大模型 Qwen-Audio-3.0-TTS,包含面向实时交互的 Flash 版本(首包延时 300ms 级别)和面向高质量生成的 Plus 版本。

官方表示,新模型在细粒度标签控制、freestyle 指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面实现系统性提升,让合成语音从 " 能说话 " 走向 " 会表达 "。在全球第三方权威榜单 Artificial Analysis,Qwen-Audio-3.0-TTS-Plus 斩获冠军

据介绍,Qwen-Audio-3.0-TTS 支持在文本中嵌入结构化标签,用户可直接在文本里嵌入 [ gasp ] (抽气)、 [ giggles ] (轻笑)、 [ angry ] (愤怒)这类标记,直接对语气、情绪和 breath 类细节进行精准调控。

此外,该模型配套开箱即用的精品音色库,将模型在多语种、多方言、指令控制和细粒度表达上的能力沉淀为可直接调用的音色资源,将陆续上架指令风格音色、20 种方言音色、细粒度控制音色以及 14+ 小语种音色。并将音频输出从提升 24KHz 到 48KHz,相当于从电话和普通语音助手的品质提升到录音棚、影视配音的规格,单次语音合成可达 3 分钟

面向全球多语种场景,Qwen-Audio-3.0-TTS-Plus 进行了专项优化,覆盖中、英、日、韩、德等 16 种语言,新增阿拉伯、越南、马来、菲律宾语;并支持广东、重庆、东北、陕西、上海、四川、云南等 20 种方言

Qwen-Audio-3.0-TTS 现已全面开放,IT 之家附链接:

Plus 版本:https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-plus

Flash 版本:https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-flash

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

阿里 it之家 语音合成 上海 广东
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论