OpenAI 近日宣布推出新的转录模型 GPT-Live-Transcribe 和 GPT-Transcribe,分别面向实时语音转录以及音频文件异步转录场景。对此官方表示,这两款模型相比此前的方案进一步提升了上下文理解能力,并针对真实环境中的多语言、多口音语音识别进行了优化。

据了解,GPT-Live-Transcribe 专为低延迟实时转录设计,可用于需要即时语音转换的场景,GPT-Transcribe 则针对已完成音频文件的异步转录以及批量工作负载进行优化。两款模型均支持开发者通过提供录音背景信息、人名及领域术语关键词、预期输入语言,以及此前转录内容等方式,为实时音频转录提供更多上下文信息。
性能方面,OpenAI 也公布了这两款模型在多项语音识别基准测试中的表现。在新的上下文感知自动语音识别测试中,GPT-Live-Transcribe 加入自由形式上下文信息后,语义准确率由 38.5% 提升至 44.6%,GPT-Transcribe 的语义准确率则由 41.6% 提升至 45.2%。

在 Common Voice 的 22 种语言测试中,GPT-Live-Transcribe 的转录错误率为 19.70%,GPT-Realtime-Whisper-1 为 20.33%。而在真实世界音频录制基准的九种语言测试中,GPT-Live-Transcribe 的转录错误率为 9.60%,GPT-Realtime-Whisper-1 是 11.65%。
此外,GPT-Transcribe 在多语言语音识别测试中也相比 Whisper-1 有所提升。在 Common Voice 的 22 种语言测试中,GPT-Transcribe 的转录错误率为 19.27%,Whisper-1 则是 40.37%;在真实世界音频录制基准测试中,GPT-Transcribe 的转录错误率为 8.98%,Whisper-1 是 15.21%。

目前,OpenAI 已通过 API 开放 GPT-Live-Transcribe 和 GPT-Transcribe 这两款模型。其中,GPT-Live-Transcribe 的调用价格为每分钟 0.017 美元(约合人民币 0.12 元),GPT-Transcribe 则是每分钟 0.0045 美元(约合人民币 0.03 元)。
【本文图片来自网络】
加入收藏 点赞 ( 0 ) 踩 ( 0 )


登录后才可以发布评论哦
打开小程序可以发布评论哦