腾讯混元语音团队联合多所高校的研究者,发布了一个叫 Gander 的模型。它的目标很直接:一边跟你聊天,一边在后台把复杂任务干完。技术报告里说,它能同时接收语音、图像和文本。
这件事的看点不在 " 能聊天 ",而在 " 聊天的时候还能干活 "。今天的语音助手大多是回合制——你说完,它回答,然后轮到你。研究者认为,真实对话不是这样的:人会打断对方,会边听边说,会随手给个反馈。Gander 想处理的正是这种来回穿插的节奏。

一个 " 小脑 ",一个 " 大脑 "
对话要快,但翻文件、写代码这类事需要时间规划。研究者提出,单个模型必须在速度和推理能力之间做取舍,于是 Gander 把工作拆成两个角色。
借用人体的说法,它们被叫做 " 小脑 " 和 " 大脑 "。小脑负责实时对话,大脑在后台处理推理和复杂任务。用户可以随时插话,模型也能主动追问或汇报进度,不需要你先开口问。
大脑是可以替换的。它可以换成 Codex、Claude Code 这类智能体系统,而不用重新训练对话模型。测试中,这个角色由 OpenAI GPT-5.6 家族中一个未具名的模型担任。底层模型变强,整个系统跟着受益。
一秒一段,自己判断该听还是该说
Gander 把对话切成一段一秒的片段,让小脑决定什么时候听、什么时候说、用户打断时什么时候停。这些判断不依赖单独的模块去检测语音的起止,而是用大约最近两分钟的对话作为记忆。
由于目前还没有专门针对这类模型的测试,研究者转向了已有的基准。报告称,Gander 在 Full-Duplex-Bench v3 上拿到了最好的时机表现,这个基准测试语音助手在不同任务场景下的表现。
具体数字是:在全部 100 个场景中,Gander 都在正确的时机开口;打断用户的比例为8%。作为对比,GPT-Realtime 是13.5%,最弱的竞争者接近48%。报告称,Gander 用相对小的模型,去和 GPT-Realtime、Gemini Live、Grok 这些商业系统竞争。
代价出现在任务准确率上。研究者说,部分原因是测试打的是整个系统的分,语音识别和输出的错误都会算进去。如果直接给大脑文本,它的得分要好得多。
视频和音频理解同样有损失。在一项测试中,Gander 的表现不如它的基座模型。研究者把原因归到训练上——训练更偏向流畅对话,而不是精确感知。这包括数物体、在图像中定位物体这类任务。
报告显示,Gander 用了约270 万条样本训练。其中一些样本教它在有背景噪音、或者群里没人跟它说话时保持安静。
还在早期,但路线已经摆出来了
研究者说这项工作仍处于早期。如何把 Gander 做大,仍是一个开放问题;如何评估这类系统,也没有标准方法。
团队计划在完成 " 开源发布流程 " 后公布权重和训练数据。代码的 GitHub 仓库已经存在,项目页面上有演示。
Gander 之前,腾讯在 7 月发布了开放语言模型 Hy3,据报道缩小了与竞争对手的差距,尤其在智能体任务上。Hy3 已经跑在 WorkBuddy、元宝和微信里。腾讯还在谈判拿下智能体创业公司 Manus 的最大股份,此前北京方面阻止了 Meta 的收购。腾讯认为这笔交易契合自己的计划,其中包括一个嵌入微信的智能体。
其他公司也在用编排器把任务分派给不同模型。OpenAI 的 GPT-Live 把对话和推理分开,聊天继续的同时,把网页搜索和智能体任务交给后台模型。Sakana AI 的 Fugu 是一个独立语言模型,从可扩展的池子里调用其他模型。OpenAI 还在测试主动型智能体,它们会自己创建后续任务并主动联系用户。
处理打断和避免延迟,仍是现实中的难题。Anthropic 的一项分析发现,有经验的用户大约在9%的工作步骤中打断 Claude Code,新手大约是5%。一项调查显示,做对话式语音和聊天智能体的团队,报告延迟问题的频率尤其高。


登录后才可以发布评论哦
打开小程序可以发布评论哦