
7 月 31 日,阿里巴巴 -W(09988.HK)正式发布新一代语音识别大模型 Qwen-Audio-3.0-ASR-Flash。据介绍,该模型主要在上下文一致性、行业词识别和热词定制化三个维度做了系统性的优化,同时具备语音润色能力,可直接输出结构化文本。
目前,Qwen-Audio-ASR-Flash 系列已经在会议纪要整理、实时字幕、教育录播、智能客服等场景里得到广泛验证,曾在全球权威 AI 评测平台 Artificial Analysis 上,以 1.7% 的错字率拿下全球第一。对语音识别来说,能否准确识别专业词汇,往往是其真正在行业里用起来的关键。
Qwen-Audio-3.0-ASR 现已通过阿里云百炼平台开放调用,提供三个版本:Qwen-Audio-3.0-ASR-Flash(语音识别,最长 5 分钟)、Qwen-Audio-3.0-ASR-Filetrans(离线文件转写)和 Qwen-Audio-3.0-ASR-Streaming(实时语音识别)。


登录后才可以发布评论哦
打开小程序可以发布评论哦