第四波 12小时前
语音识别“卷”起来了:腾讯字节OpenAI,在争啥?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

研究员|卢杨

8 月 4 日,腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview。

同样是语音模型产品,几天前,阿里千问刚推出了 Qwen-Audio-3.0-ASR-Flash;今天早些时候,OpenAI 正式发布 GPT-Live 全双工语音交互系统。语音识别这个 " 老赛道 ",最近突然又热闹起来了。

来源:" 腾讯云 " 微信公众号

腾讯称,Hy ASR 3.0 preview 的方言识别可覆盖粤语、吴语等 10 大方言片区和 20 余个二级小片区。在开源评测集中,Hy ASR 3.0 preview 在多语种的 WER(Word Error Rate, 词错误率)上控制在 3% 左右,其中,中文普通话 WER 3.34%、英语 WER 2.62%、粤语 WER 3.12%。

技术架构上,Hy ASR 3.0 preview 依然采用 MoE 架构,基座为 Hy3。此外,在语音侧,它采用了自研的无监督语音 Encoder,经历了数千万小时级语音数据训练。目前,Hy ASR 3.0 preview 已上线腾讯云提供 API 服务,元宝首发上线并免费开放,WorkBuddy 也在陆续接入中。

01 实测:多数极端情况比较稳 方言识别还有点 " 坑 "

第四波初步测了这款模型。在噪声环境下,普通话语音识别准确度很高,整体错误率不高。这一点与宣称的 " 复杂声学场景专项优化 " 基本吻合:工厂车间、地铁站的嘈杂环境确实能扛住。

唱歌场景下可以准确识别文字内容,快速阅读大段文字可准确识别,甚至方言歌曲歌词也能识别,这个倒是让我们有些意外,毕竟歌声的韵律和音调变化比日常语音复杂得多,能做到识别说明声学特征的提取能力确实可圈可点。

但个别方言语音识别问题也比较明显,存在一些歧义和识别不准的情况。虽然声称覆盖 10 大方言片区,从实测来看,闽南语的真人语音识别并不准确,总体准确率仅 60%。

如果把最近语音模型动作频繁的千问、豆包、GPT、腾讯四家放在一起对比,路线差异比较明显。

千问主要针对长音频处理和行业术语识别等场景,核心目标是提升专业词汇的识别精度。其官宣数据中,医疗场景专业词听中率达 95.36%,工业、IT 编程超 90%,热词定制化准确率多数场景突破了 99%。

GPT 是另一条路。它们最新推出的 GPT-Live,核心是 Full-Duplex 架构,能够同时聆听和说话,用户随时可以打断,实现了更像真人的实时语音交互。其技术壁垒在于解决了长期困扰语音助手的对话延迟和回合制切换生硬等核心痛点。

豆包把功夫下在了多模态层面。其去年 12 月发布的 Doubao-Seed-ASR-2.0,不仅听懂字还能看懂图,能通过单图和多图等视觉信息输入让文字识别更精准。

腾讯 Hy ASR 3.0 preview 则深度融合大语言模型 Hy3 的语义理解能力,通过上下文消除同音词歧义、提升长音频连贯性。

当然,不同技术路径也带来了应用场景策略的分化。千问主攻会议纪要、实时字幕、教育录播、智能客服;GPT 瞄准实时语音交互和情感对话;豆包从输入法到全场景渗透;腾讯目前主推智能客服、内容理解、语音搜索,元宝和 WorkBuddy 负责承接 C 端入口。

02 为何扎堆语音识别赛道?

上海人工智能研究院特聘专家尹智告诉第四波,语音识别本身是相对成熟的技术,这波热潮更多是用户体验层面的变化," 智能体成熟之后,有很多场景大家逐渐开始习惯不打字了,开始说话了。"

他还提到,腾讯一贯的产品策略就是,倾向于在市场趋势明朗化之后入场,"(腾讯)等趋势起来了,别人把坑踩完了他才进去 "。在产品节奏上,他认为腾讯当前入局的时机把握得不错。

来源:" 腾讯云 " 微信公众号

第四波科技智库特约专家王超认为,语音模型本质上还是依赖基座大模型的能力," 不管是语音、图片还是动态的视频,实际上都基于基座模型的能力来确定 "。

在他看来,Hy3 在国际排名上不算特别突出,腾讯选择做语音模型,某种程度上是想用语音模型来打一个差异化的竞争,试试多模态、图片或者语音的生成会不会更优秀一点。但这更重要的是业务驱动逻辑。

王超认为,微信语音输入、游戏语音输入等腾讯核心业务都与语音模型有很强的关联," 与其用别人的模型,不如自己做一个,自己的又安全又好,又比较放心,又比较便宜 "。把业务交在别的模型手里,既要花钱,又无法保证安全性。这些语音模型做出来之后,马上就能应用在自己的各种业务上," 它不是空中楼阁 "。

对于语音识别这个赛道本身,王超认为,归根结底还是要看基座模型的能力," 除此之外,在这条路上所有的线端,它都是支线,做语音模型的,包括豆包、千问,它们业务里面确实有语音模型能使用的场景,没有场景也不去做 "。

王超指出,真正需要做语音模型的,要么是有业务重合度,要么是有大量客户群体察觉到了需求。" 最重要的还是把基座模型的能力搞上去,把 AGI 搞好,这才是真正的路径、真正的趋势。"

编辑|邱慧 张猛

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

语音识别 腾讯 准确 腾讯云 阅读
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论