闪存猎手 12小时前
腾讯Gander:一边聊天一边处理任务,但时机与准确率存在取舍
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

腾讯混元语音团队联合多所高校的研究者,发布了一个叫 Gander 的模型。它能一边跟你聊天,一边在后台处理复杂任务。技术报告显示,这个模型同时接收语音、图像和文本三种输入。

研究团队在报告里指出,现在的语音助手大多是 " 轮流说话 " 的模式。但真实对话里,人们会互相打断、快速给反馈、边听边说。Gander 要解决的就是这种来回穿插的交流节奏——它持续处理视频、语音和文本,即使在自己说话时也不停。用户可以随时插话,模型也能主动追问或汇报进度,不需要用户先开口。

一个模型拆成两个角色

聊天要快,但搜文件、写代码需要时间规划。研究者认为,单个模型必须在速度和推理能力之间做取舍,于是 Gander 把工作拆给了两个角色。

他们借用人体的说法,把这两个角色叫做 " 小脑 " 和 " 大脑 "。小脑负责实时对话,大脑在后台处理推理和复杂任务。

大脑可以换成 Codex 或 Claude Code 这类智能体系统,不需要重新训练对话模型。测试中,OpenAI GPT-5.6 家族中一个未指明具体型号的模型扮演了这个角色。底层模型变强,整个系统跟着受益。

Gander 把对话切成一秒一段,让小脑决定什么时候听、什么时候说、用户打断时什么时候停。它做这些判断不需要单独的模块去检测语音的起止,而是用最近约两分钟的对话作为记忆。

时机表现与准确率的取舍

目前还没有专门针对 Gander 这类模型的测试,研究者转向了已有的基准。报告称,Gander 在 Full-Duplex-Bench v3 上取得了最好的时机表现,这个基准测试语音助手在不同任务场景下的表现。

在全部100 个场景中,Gander 都在正确的时刻开始说话,打断用户的比例是8%。作为对比,GPT-Realtime 是13.5%,最弱的竞争者接近48%。报告称,Gander 用相对小的模型,与 GPT-Realtime、Gemini Live、Grok 等商业系统同场竞争。

任务准确率上,Gander 略落后。研究者说,部分原因是测试给整个系统打分,语音识别和输出的错误都会算在它头上。如果直接给大脑输入文本,得分会好很多。

视频和音频理解同样有损失:在一项测试中,Gander 的表现不如它的基础模型。研究者把原因归结为训练偏向流畅对话,牺牲了精确感知,涉及的任务包括数物体、在图像中定位物体。

报告显示,Gander 用了约270 万条样本训练。其中一些样本教它在有背景噪音、或者群里没人在跟它说话时保持安静。

开源与腾讯的智能体布局

研究者表示这项工作仍处于早期。如何把 Gander 扩展得更大,仍是一个开放问题,这类系统也没有标准的评估方式。

团队计划在完成 " 开源发布流程 " 后公布权重和训练数据。代码的 GitHub 仓库已经存在,项目页面上有演示。

Gander 发布之前,腾讯在 7 月推出了 Hy3,一个开放语言模型,据报道缩小了与竞争对手的差距,尤其在智能体任务上。Hy3 已经运行在 WorkBuddy、元宝和微信中。腾讯还在谈判拿下智能体创业公司 Manus 的最大股份,此前北京阻止了 Meta 的收购。腾讯认为这笔交易契合自己的计划,包括把智能体嵌入微信。

其他公司也在用编排器把任务分派给不同模型。OpenAI 的 GPT-Live 把对话和推理分开,聊天继续的同时把网页搜索和智能体任务交给后台模型。Sakana AI 的 Fugu 是一个独立语言模型,从可扩展的池子里调用其他模型。OpenAI 还在测试主动型智能体,它们会自己创建后续任务并主动联系用户。

处理打断和避免延迟仍是现实难题。Anthropic 的一项分析发现,有经验的用户大约在9%的工作步骤中打断 Claude Code,新手大约是5%。一项调查显示,构建对话式语音和聊天智能体的团队,报告延迟问题的频率尤其高。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

腾讯 语音助手 live 语音识别
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论