财经涂鸦 6小时前
网易上线首个AI原生语音Agent「叭哥说」,口语输出对键盘打字效率比值提升至5倍
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

"自研全链路重新定义 AI 语音输入"

作者:苏打

编辑:tuya

出品:财经涂鸦(ID:caijingtuya)

生成式 AI 时代爆发式输入需求下,键盘输入效率跟不上人脑思考速度已成为行业痛点之一。

公司情报专家《财经涂鸦》获悉,9 月 8 日,网易首个 AI 原生语音 Agent" 网易叭哥说 " 正式上线。依托有道多年沉淀的语音识别和翻译技术,该产品跳出传统语音输入 " 语音转文字 " 的工具定位,把人的自然口语直接转化为结构化、可直接复用的高质量文本。

" 语音交互的价值,早已不是单纯替代打字、减少敲击键盘的动作,而是压缩‘脑海里产生想法’到‘指令交付给 AI 执行’之间的距离。" 网易有道相关负责人表示。

生成式 AI 普及之前,人机交互大多是短句检索、关键词问答,用户输入负荷有限。大模型落地后,工作流迅速向 " 写提示词、多轮迭代修改指令、输出长段方案 " 迭代,用户给到   AI   的信息密度与输入总量呈指数级上涨。

Google 公开数据显示,语音输入平均效率可达键盘的 2.5 倍;而网易叭哥说通过自研 ASR 与语义理解链路深度调优,将口语输出对键盘打字的效率比值提升至 5 倍。

「听清、听懂、写好」技术链路全自研

长久以来,大众接触到的语音输入产品,底层逻辑都停留在听写,其中口头禅、重复语句、口误改口、语句跳跃全部原样记录,导致后续编辑成本依旧很高。

叭哥说的核心差异在于,从 " 听见声音 " 进化到 " 听懂人的意图 "。例如,口语表述 " 下午三点开会,呃,不对,改成四点,帮我告诉设计团队 ",叭哥说会识别修正其中的时间变更指令,自动润色为 " 下午四点开会,请通知设计团队 " 输出,产出结果可直接复制用于即时通讯、邮件、文档撰写等真实工作场景。

这一能力来自有道构建的 " 听清、听懂、写好 " 全自研技术链路。

在 " 听清 " 环节,有道自研   ASR   模型 Confucius4-R2T2,即将作为业界开源 SOTA 的真流式语音识别模型进行发布,主打低延时、高质量,一个模型支持不同的推理粒度,适配不同的场景需求。该模型经过海量数据训练,针对日常对话中的思考卡顿、环境噪声、小声说和实时输入等场景进行了重点优化。

在 " 听懂 " 环节,Confucius4-R2T2 具备较强的上下文推理和热词支持能力,可结合前文、当前场景和专业词典理解用户表达,提升同音词、人名、产品名及行业术语的识别准确性,且在多数场景下,热词识别命中率突破   99%;Confucius4-R2T2 面对改口、重复和语义补充,能判断最终表达意图。

在 " 写好 " 环节,叭哥说可调用自研润色生成模型,完成断句分层、冗余口语删减、逻辑梳理、表述规范化。

至此,整套链路的评判标尺不再是 " 逐字识别准确率 ",而是输出结果是否可以直接使用——这也是 AI 原生语音 Agent 和传统语音听写产品最核心的分水岭。

多语种实时翻译与端侧隐私双落地

作为有道持续布局十余年的核心技术赛道,语音翻译方面的大量技术积累也同步下沉,赋能叭哥说。

据悉,目前该产品支持 124 个语种实时语音互译,面向经济、物理、化学、医学等垂直专业领域,翻译精准度可达 98%,覆盖跨语言沟通、跨境会议、外文材料口述整理等多元场景。

伴随 AI 语音能力变强,语音隐私风险同步成为行业焦点——人声包含大量个人习惯和真实想法,一旦上云存储,会带来数据泄露、被用于模型训练的隐患。

因此,隐私保护方面,叭哥说在云端不保留任何语音与文本数据,从源头规避语音原始数据外泄风险,把语音数据主权交还用户。

据官方介绍,网易叭哥说即日起正式开放下载体验。产品将终身免费,希望可以降低 AI 原生语音交互的使用门槛。

本文由公众号财经涂鸦(ID:caijingtuya)原创撰写,如需转载请联系涂鸦君。

添加涂鸦君个人微信(ID:tuyaclub)

加入【公司情报社群】

参与资本市场讨论

获取一手情报

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 网易 有道 网易有道 翻译
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论