【CNMO 科技消息】7 月 29 日,OpenAI Developers 官方宣布在 API 中推出两款语音转录模型。其中,GPT-Live-Transcribe 面向低延迟实时转录场景,GPT-Transcribe 则针对已完成音频文件的异步转录及批量处理任务进行优化。

OpenAI
OpenAI 表示,两款模型进一步提升了上下文理解能力,在不同语言、口音及复杂真实环境中能够提供更准确的转录结果,尤其改善了短语、数字、专业术语以及强背景噪声下的识别表现。开发者还可以向模型提供录音内容简介、姓名及领域术语关键词、预期语言和前序转录内容,以提高识别准确率。

测试数据显示,在 OpenAI 新建立的上下文感知自动语音识别评测中,GPT-Live-Transcribe 的语义准确率在未提供自由形式上下文时为 38.5%,加入上下文后提高至 44.6%。在覆盖 22 种语言的 Common Voice 测试中,其转录错误率为 19.70%,略低于 GPT-Realtime-Whisper-1 的 20.33%;在九种语言的真实录音测试中,两者分别为 9.60% 和 11.65%。
GPT-Transcribe 同样可以利用上下文提高表现,其语义准确率由 41.6% 升至 45.2%。在 Common Voice 测试中,该模型的转录错误率为 19.27%,相比 Whisper-1 的 40.37% 明显降低;真实录音测试中的错误率为 8.98%,Whisper-1 则为 15.21%。
版权所有,未经许可不得转载


登录后才可以发布评论哦
打开小程序可以发布评论哦