智东西 昨天
马斯克发Grok新模型!登智能体测评榜首,比OpenAI家便宜一半
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

智东西

作者 | 江宇

编辑 | 李水青

智东西 7 月 30 日报道,今日,马斯克旗下 SpaceXAI 宣布推出新一代语音模型 Grok Voice Think Fast 2.0,这是该公司迄今能力最强的语音到语音(speech-to-speech)模型。

马斯克连发两条推文,第一条宣布 "Grok Voice 现在在智能体性能方面排名第一 ",第二条则直接喊话网友 " 试试新的 Grok Voice"。

马斯克发文

在权威评测机构 Artificial Analysis 的语音到语音指数(Speech to Speech Index)中,Grok Voice Think Fast 2.0 高推理能力版本以 82.9% 的得分位列第二,仅次于千问 Qwen Audio 3.0 Realtime Plus(84.1%)在衡量智能体性能的 Tau Voice 基准测试中,该模型以 56.5% 的得分排名第一,击败了 OpenAI、Google、阿里千问等厂商的语音模型。

更值得关注的是,该模型平均首音频响应时间仅 0.70 秒,是榜单前五名中唯一低于 1 秒的模型,较前代 Grok Voice Think Fast 1.0 的 1.25 秒大幅提升。

定价方面,Grok Voice Think Fast 2.0每分钟 0.08 美元(约合每小时输入音频 4.80 美元),较前代 3.00 美元有所上涨,但比 GPT-Realtime-2.1 High(10.75 美元 / 小时)便宜约 2.2 倍

在评论区中,不少网友对新模型表现出较高期待。

有网友称,希望利用 Grok Voice 生成多角色有声剧。

还有开发者称,此前一直主要使用 Gemini,如今终于有了新的选择。

一、多位开发者实测后给出好评:响应飞快,对话更自然

AI 公司 Helionova AI 的 CEO Nick White 在 X 上分享了他的实测体验。

他称,已在旗下产品 Tradecraft 上完成了面向 grok-voice-think-fast-2.0 的全栈语音实时升级,"绝对是一次飞跃式的进步"。

在 Nick White 放出的实测音频中,他让 Grok Voice 扮演一名因维修人员爽约而愤怒投诉的客户,自己则扮演客服接线员,双方围绕预约迟到展开了一段多轮实时电话对话。

整个过程中,模型几乎没有明显停顿,能够根据对话内容持续推进情节,并针对客服回答实时作出反馈

另一位开发者则把 Think Fast 2.0 集成进终端工具 GrokTerm,展示 Grok Voice Think Fast 2.0 的对话速度。

视频中,测试者首先让模型介绍新版本亮点,模型以极快速度回应。随后测试者连续发出 " 将应用主题切换为赛博朋克风格 "" 切回原主题 "" 切到另一边屏幕 "" 再切回赛博朋克 " 等指令,模型均快速响应并完成操作,全程对答如流

SpaceXAI 软件工程师 Parker Conrad 也发文称:" 整个语音团队为此倾注了大量的努力、思考和热爱。模型的智能水平、准确性和能力几乎让人感觉不真实。语音领域仍然充满摩擦,Think Fast 2.0 向着‘开箱即用’的目标迈进了一大步——这本就是语音模型应有的样子。"

二、响应仅 0.7 秒,推理更快、识别更准

Grok Think Fast 2.0 定位为下一代语音模型,其升级重点集中在模型能力、响应速度与推理效率三方面。

首先是模型能力。

根据 Artificial Analysis 公布的数据,Think Fast 2.0 综合得分达到 82.9%,相比上一代 75.7% 提升 7.2 个百分点。

其中,在 Big Bench Audio 语音推理测试中获得 97.2%;衡量多人实时语音交互体验的 Full Duplex Bench 达到 95.1%,相比上一代 77.8% 提升明显;Tau Voice 语音智能体测试则达到 56.5%,成为目前该榜单第一。

与此同时,新模型也是目前排行榜前五中响应速度最快的模型。

其平均首次语音响应时间仅 0.70 秒,快于 GPT-Realtime-2 High(1.14 秒)、GPT-Realtime-2.1 High(1.21 秒)以及 Think Fast 1.0(1.25 秒)。

除了速度,Grok Think Fast 2.0 还重点优化了语音识别。

在覆盖 24 种语言、数千条短语的测试中,Think Fast 2.0 整体转写准确率相比 Think Fast 1.0提升约 1.4 倍,相比 Deepgram Nova 3 和 ElevenLabs Scribe v2 提升约 1.5 至 2 倍。

而在背景噪声较大、电话压缩等真实场景下,这一优势进一步扩大,识别误差可降低约 10 倍

另一个变化来自推理效率。

不同于许多语音模型需要先完成推理再生成语音,Think Fast 系列支持一边说话一边完成推理,因此能够在保持低延迟的同时处理复杂任务。

Think Fast 2.0 进一步优化了推理 Token 利用效率,中位数推理 Token 消耗仅为上一代约 40%,意味着工具调用通常能够在模型第一句话结束前便开始执行,从而进一步缩短整体响应时间。

除了推理效率,对话方式也进行了调整。研发团队利用大量强化学习数据,让模型更接近真实的人类交流方式。相比此前版本,新模型会更多使用短句表达,一次只提出一个问题,并尽量避免冗长、重复的表达。

从用户角度来看,整个交流过程会更加自然,即使模型背后正在完成复杂流程规划,用户也不会明显感受到等待。

结语:语音模型竞争进入 " 智能体时代 "

过去一年,OpenAI、Google 与阿里千问等厂商持续升级实时语音模型,竞争重点也逐渐从语音识别、语音合成,转向复杂任务处理、多轮对话以及工具调用能力。

从此次发布来看,SpaceXAI 延续了这一方向。

一方面,Think Fast 2.0 进一步提升了语音推理、实时交互和语音识别能力;另一方面,通过 " 边说边推理 "、更低的推理 Token 消耗以及更快的工具调用速度,其希望让语音智能体能够真正承担客服、电话助手、销售等真实业务场景。

从 Artificial Analysis 最新榜单来看,Think Fast 2.0 已经在语音智能体能力(Tau Voice)上取得第一,并跻身 Speech-to-Speech 综合榜单前列。

随着 8 月 5 日默认模型完成升级,其实际表现也将在更多开发者和企业应用中接受进一步验证。

来源:SpaceXAI、X、Artificial Analysis

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

马斯克 google 阿里 智东西 ceo
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论