手机中国 昨天
OpenAI推出两款新转录模型 上下文识别能力更强
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

【CNMO 科技消息】7 月 29 日,OpenAI Developers 官方宣布在 API 中推出两款语音转录模型。其中,GPT-Live-Transcribe 面向低延迟实时转录场景,GPT-Transcribe 则针对已完成音频文件的异步转录及批量处理任务进行优化。

OpenAI

OpenAI 表示,两款模型进一步提升了上下文理解能力,在不同语言、口音及复杂真实环境中能够提供更准确的转录结果,尤其改善了短语、数字、专业术语以及强背景噪声下的识别表现。开发者还可以向模型提供录音内容简介、姓名及领域术语关键词、预期语言和前序转录内容,以提高识别准确率。

测试数据显示,在 OpenAI 新建立的上下文感知自动语音识别评测中,GPT-Live-Transcribe 的语义准确率在未提供自由形式上下文时为 38.5%,加入上下文后提高至 44.6%。在覆盖 22 种语言的 Common Voice 测试中,其转录错误率为 19.70%,略低于 GPT-Realtime-Whisper-1 的 20.33%;在九种语言的真实录音测试中,两者分别为 9.60% 和 11.65%。

GPT-Transcribe 同样可以利用上下文提高表现,其语义准确率由 41.6% 升至 45.2%。在 Common Voice 测试中,该模型的转录错误率为 19.27%,相比 Whisper-1 的 40.37% 明显降低;真实录音测试中的错误率为 8.98%,Whisper-1 则为 15.21%。

版权所有,未经许可不得转载

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

准确 语音识别
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论