全天候科技 1小时前
微软上新三款语音AI模型:实时转文字准确率登测评榜首,MAI-Voice 2.1覆盖23种语言
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

微软加速补齐语音 AI 能力。当地时间 10 月 1 日,微软发布三款新的语音模型,包括实时语音转文字模型 MAI-Transcribe-2-Streaming,以及文本转语音模型 MAI-Voice-2.1 和更低延迟的 MAI-Voice-2.1-Flash。其中,MAI-Transcribe-2-Streaming 在 AI 基准测试平台 Artificial Analysis 的流式语音识别测试中拿下准确率第一。

AI 基准测试与分析平台 Artificial Analysis 公布数据显示,MAI-Transcribe-2-Streaming 的最终转录词错误率(WER)为2.5%,在 38 款模型中排名第一;从说话结束到返回最终文本仅需约0.13 秒。在更强调实时性的 " 首次部分转录 " 测试中,其 WER 同样为 2.5%,延迟约 0.12 秒。相比之下,此前排名第一的 SpaceXAI Grok Voice Transcribe 2.0 最终 WER 为 2.7%、延迟 0.49 秒。

实时转录冲到第一,微软瞄准 " 边听边行动 "

此次发布的核心模型是 MAI-Transcribe-2-Streaming。微软称,该模型支持60 种语言,并能够持续自动识别语言,不必等到用户一句话说完后才开始输出文字。

与传统语音转文字模型 " 听完—处理—输出 " 的模式不同,流式模型会先快速生成部分转录结果,再随着更多语音信息进入不断修正,最终形成稳定文本。微软表示,模型能够在接收到音频后100 多毫秒就开始产生首批结果。

这意味着语音 AI 的应用场景可以从单纯 " 把声音变成文字 ",进一步向实时交互延伸。例如,在客服场景中,AI 智能体可以在用户尚未说完一句话时就开始识别需求;语音助手则可以提前进行推理、准备工具调用,而不是等用户说完后才启动整个处理流程。

微软称,在实时听写和字幕等应用中,其内部测试显示,文字出现速度约为最接近竞争对手的两倍。

Artificial Analysis 的测试也显示了这一特点:MAI-Transcribe-2-Streaming 的最终 WER 为 2.5%、延迟 0.13 秒,均优于 Grok Voice Transcribe 2.0 的 2.7% 和 0.49 秒;Muse Voice Transcribe 的 WER 为 3.1%、延迟 0.16 秒,ElevenLabs Scribe v2 Realtime 则为 3.6% 和 0.14 秒。

不过,速度并非绝对领先。Artificial Analysis 数据显示,Cartesia Ink Preview 的最终转录延迟约 0.11 秒,略快于微软模型,但 WER 为 3.1%,准确率低于微软。

每小时 0.54 美元,实时能力并不走 " 极致低价 "

在价格方面,微软为 MAI-Transcribe-2-Streaming 提供了每小时 0.54 美元的年末前优惠价格,相当于每 1000 分钟 9 美元。微软表示,该模型目前处于面向开发者的推广阶段。

从 Artificial Analysis 的横向比较看,0.54 美元 / 小时处于主流流式语音模型价格的相对较高位置:与 Gemini 3.5 Transcribe Live 的约 9 美元 /1000 分钟相当,高于 ElevenLabs Scribe v2 Realtime 和 Deepgram Flux 的约 6.50 美元,也明显高于 Cartesia Ink-2 约 4 美元和 Muse Voice Transcribe 约 3 美元。

这也意味着微软此次并非单纯通过低价抢市场,而是试图将准确率、延迟和企业级部署能力结合起来。

微软此前 9 月推出的非流式 MAI-Transcribe-2 主打准确率、说话人识别、时间戳和复杂真实场景等能力,目前支持 60 种语言。微软当时称,该模型在 FLEURS 基准测试中平均 WER 为 5.2%,并在 Artificial Analysis 的准确率与延迟测试中位于 Pareto 前沿。

一端 " 听得快 ",另一端 " 说得快 "

除了转录模型,微软此次还发布 MAI-Voice-2.1 和 MAI-Voice-2.1-Flash,分别对应更高的表达质量和更低的延迟。

其中,MAI-Voice-2.1 支持23 种语言、26 个地区 / 语言环境,微软强调,同一个声音可以跨语言保持一致,同时针对不同语言使用更自然的本地口音。这意味着开发者可以让一个 AI 助手在英语、中文、德语等语言之间切换,而无需为每种语言配置不同的声音。

MAI-Voice-2.1 的价格为每 100 万字符 22 美元,更适合对语音表现力要求较高的场景;MAI-Voice-2.1-Flash 则面向对延迟和成本更加敏感的应用,价格降至每 100 万字符 15 美元。微软称,Flash 版本的模型推理速度提升 55%,成本较可比模型低约 60%。

微软还表示,两款模型均支持基于数秒参考音频进行声音克隆,并加入同意机制等安全措施。

从产品组合来看,微软此次实际上是在同时压缩语音 AI 交互的两端延迟:MAI-Transcribe-2-Streaming 负责快速 " 听懂 ",MAI-Voice-2.1-Flash 负责快速 " 说出 "。微软称,两者结合后,可以为语音智能体释放更多时间用于推理、调用工具和检查答案,同时保持接近自然人类对话的交互节奏。

微软继续补齐自研 AI 模型矩阵

此次发布也延续了微软今年以来扩大 MAI 自研模型矩阵的动作。

微软此前已经推出 MAI-Transcribe-2、MAI-Voice-2、MAI-Thinking-1、MAI-Code-1.1-Flash 以及 MAI-Image 系列模型,并将这些模型逐步接入 Microsoft Foundry 以及 Copilot、Teams、GitHub、Dynamics 365 等产品和服务。

其中,MAI-Transcribe-2 目前已经覆盖会议记录、视频字幕、客服文档、无障碍服务以及语音智能体等场景;微软此次进一步加入实时流式版本,意味着其自研模型的竞争重点正从单项识别准确率,转向实时语音智能体完整链路。

对于微软而言,这一方向的意义并不只在于增加几个模型。随着 AI 智能体从文字交互进一步走向电话客服、语音助手、实时翻译和多模态工作流,语音识别和语音生成的延迟、准确率与成本都会直接影响用户体验和企业部署成本。

此次 MAI-Transcribe-2-Streaming 在 Artificial Analysis 测试中登顶,至少显示微软在语音 AI 这一细分赛道正在加速追赶并进入第一梯队。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

微软 语音助手 语音识别
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论