
语音 AI 的战争,已经从文本对话框里转移到了汽车座舱、智能眼镜和无线耳机。
7 月,实时语音 Agent 战场上连爆多颗信号弹。
7 月 23 日,Anthropic 为 Claude Voice 做了一次重大升级,语音模式不再局限于 Haiku 轻量模型,Opus 和 Sonnet 开始驱动语音推理,同时接入了 Gmail、Calendar、Slack 等应用。7 月 24 日,亚马逊升级 Alexa+,支持跨 Echo 音箱、手机 App、车载设备和网页端的无缝多轮对话,背后是 Nova 和 Anthropic Claude 混合路由的模型架构。
7 月 28 日,阿里云 Qwen Audio 3.0 Realtime Plus 以 99.2% 的成绩刷新 Artificial Analysis Big Bench Audio 纪录,登顶全球语音推理排行榜,但它的平均首音延迟高达 4.02 秒。7 月 29 日,SpaceXAI(原 xAI)发布 Grok Voice Think Fast 2.0,首音延迟压到 0.70 秒,Big Bench Audio 得分 97.2%,在衡量 Agent 自主执行能力的 τ -Voice 基准上以 56.5% 遥遥领先,GPT-Realtime-2.1 High 是 45.7%,Gemini 3.1 Flash High 是 37.7%。更早一些,7 月 6 日,OpenAI 也发布了 GPT-Realtime-2.1。
SpaceXAI、OpenAI、Anthropic、Amazon、阿里云、Google。这不再是某个细分赛道的局部摩擦,而是一场从 API 到硬件终端、从消费电子到智能座舱的全线交火。
一场 " 毫秒级 " 军备竞赛
过去半年,实时语音 Agent 领域上演了一场激烈的短兵相接。评判胜负的标准落在了三个硬指标上:首音延迟、语音识别精度、调用成本。
先说 SpaceXAI。Grok Voice Think Fast 2.0 的首音延迟为 0.70 秒,从用户说完话到 AI 开口,在大多数人尚未察觉的间隙就已完成了应答。作为对比,v1.0 的 TTFA 是 1.25 秒,GPT-Realtime-2 高推理模式是 2.33 秒,Gemini 3.1 Flash High 是 2.98 秒,Qwen Audio 3.0 Realtime Plus 是 4.02 秒。在 Vapi Humanness Index 的 TTS 延迟实测中,Grok TTS 的流式模式首音延迟已压到 285 毫秒,标准模式 460 毫秒。2.0 在此基础上进一步优化了推理效率:推理 token 减少 60%,工具调用可以在用户说完第一句话之前就开始执行。
xAI 从一开始就把语音管线做成了一体化,自研语音活动检测、自研音频分词器、自研端到端语音模型,传统 ASR → LLM → TTS 的三级流水线被 xAI 压缩成了一个模型。这就是 285 毫秒的物理学解释:每绕过一层中间件,就省掉一层延迟和一层错误概率。
在 Artificial Analysis 的综合语音质量指数上,Think Fast 2.0 总评分 82.9%,较 v1.0 的 75.7% 提升 9.5%,超越了 GPT-Realtime-2.1 的 79.1% 和 Gemini 3.1 Flash 的 69.5%;Full Duplex Bench 从 77.8% 跳升至 95.1%,逼近 GPT-Realtime-2.1 的 95.7%。转录准确率在嘈杂环境中的提升更是以数量级计,10 倍于上一代,远超专业转录模型的水平。
但阿里云在 7 月 28 日打破了这一格局。Qwen Audio 3.0 Realtime Plus 以 99.2% 的成绩刷新 Big Bench Audio 纪录,超过了 Grok Voice Think Fast 2.0 的 97.2%、Step-Audio R1.1 的 97.6% 和 GPT-Realtime-2.1 High 的 96.0%。在会话动态和 Agent 执行维度上也分别以 98.4% 和 54.6% 领先。代价是 4.02 秒的平均首音延迟。Qwen Audio 的 Plus 和 Flash 双版本策略精准契合不同场景:Flash 面向实时交互(首包延迟 300 毫秒级)、Plus 面向高质量生成。但在车载、穿戴、通话这些对延迟零容忍的场景中,4 秒意味着不可用。
这个矛盾暴露了当前技术竞赛中一个绕不开的取舍:追求极致推理精度的模型,往往在延迟上买单,Qwen Big Bench Audio 的 TTFA 是 Grok 的 5.7 倍。而在实时语音领域,延迟是物理天花板,0.5 秒以内的延迟让人感觉 " 在对话 ",1.5 秒左右就变成了 " 在等机器人 ",到 4 秒,用户只会觉得 " 这功能坏了 "。
OpenAI 的打法是另一条路。GPT-Realtime-2.1 在 7 月 6 日发布后,旗舰模型音频输入 32/ 百万 token、输出 64/ 百万 token,mini 版 10 和 20。理论折算约 0.05/ 分钟,独立开发者实测的数据则迅速偏离理论值,一个房产导览 AI 的实际均价约 0.07/ 分钟,最差情况 $0.146/ 分钟。token 计费在长对话场景下的成本膨胀,是 OpenAI 语音模型商业化绕不开的难题。
Google Gemini 3.1 Flash Live 在 3 月发布时曾在 ComplexFuncBench Audio 上以 90.8% 的函数调用准确率和 90 多种语言支持引人注目。但开发者论坛中持续发酵的延迟投诉,某些模型版本从 500 毫秒增至 1800 毫秒,甚至 10 秒以上的等待,暴露出规模化部署中的稳定性隐患。对于车企和穿戴设备厂商,这种不稳定性比 " 慢 " 更致命。
如果再把镜头拉远一点,比七月更早落子的还有两个重量级玩家。
微软在 6 月的 Build 大会上将 Voice Live API 正式推入 GA 阶段。这套 API 把 STT、LLM、TTS、降噪、回声消除、打断处理、Avatar 打包成一个统一接口,开发者不需要自己拼接语音管线。更关键的是微软的双重身份:它既是 GPT-Realtime-2.1 的云平台宿主(企业客户通过 Azure 调用 OpenAI 模型),又在推自己的 Azure-Realtime 自研模型。Voice Live 已经和 Foundry Agent Service 打通,支持 WebSocket 和 WebRTC 低延迟连接,直接嵌入了企业级 Agent 开发的全流程。微软走的是一条 " 平台即壁垒 " 的路线,客户一旦把语音 Agent 跑在 Azure 上,迁移成本远比切换一个 API 端点高得多。
Meta 则在开源侧投下了一枚重弹。4 月,Meta 以 Apache 2.0 协议开源了 Llama-Voice,一个 7B 参数的 TTS 基础模型,支持 52 种语言,10 秒音频即可零样本声音克隆,能在消费级 GPU 上实时运行。上线 48 小时下载量突破 80 万,社区迅速衍生出 podcasting、有声书、游戏 NPC 配音等几十个微调版本。Meta 手里还有 SeamlessStreaming v2,支持 100 多种语言的实时语音翻译,延迟约 2 秒。结合 Ray-Ban Meta Gen 2 这个已经在售的硬件终端,Meta 拥有从开源模型到消费硬件的完整通路,OpenAI 恰好缺这一块。
端到端、混合路由、轮次制、拼积木
SpaceXAI、OpenAI、阿里云和 Google 被归在 " 实时语音 " 这同一个标签下,但底层架构的差异直接决定了它们在延迟、推理深度和成本结构上的分野。加上 Anthropic 和亚马逊,至少能看到四种截然不同的技术选择。
最激进的是 Grok Voice 的原生端到端路线。音频输入、音频输出,全由一个模型完成。这套架构最大胆的一点,是它在 WebSocket 连接中直接处理原始音频信号,不经过 ASR 转文本,也不经过 TTS 合成。60% 的推理 token 压缩从侧面印证了这一点,2.0 不需要把用户说的每句话都拆成详细文本再推理,模型直接在音频语义空间中完成了 " 理解 "。Grok TTS 在 Vapi Humanness Index 上的电话实体识别错误率仅 5.0%,而 ElevenLabs 为 12.0%、Deepgram 为 13.5%。
相比之下,OpenAI 的 Realtime API 虽然标称支持端到端,在成本结构和延迟特征上更像一个 " 多模态 ChatGPT 加实时音频编解码器 "。token 计费,上下文越长越贵,缓存机制(0.40/ 百万输入 token 旗舰版)只能部分对冲。实际部署中 0.05 至 $0.15/ 分钟的波动区间意味着,用户的每一轮追问都在悄悄抬高账单。
Anthropic 和亚马逊则走出了两条既不同于 Grok 也不同于 OpenAI 的混合路线。
Anthropic 选择轮次制(listen → think → speak)而非全双工,以推理深度和工具准确性换取实时流畅度。Claude Voice 的 Opus 模式可以帮用户演练客户提案、推敲逻辑漏洞,同时连接 Gmail、Calendar、Slack 等应用,每一步操作前都要求用户确认,核心逻辑是语音不只是一个交互界面,它应该能推动真实的工作流程。代价是交互节奏不如全双工自然,但在需要深思熟虑的场景中,轮次制的深度优于全双工的流畅。
亚马逊走多模型路由,通过 Bedrock 平台让 Nova 处理快速任务、Anthropic Claude 处理复杂推理,各司其职。6 亿台 Echo 终端是 Alexa 的基本盘,但 7 月升级释放了更重要的信号,Alexa+ 已经跨出硬件,进入了浏览器、手机 App 和车载设备。亚马逊同时推进代号 Moonraker 的 Agent 项目,投入超过 1 亿美元 GPU 算力,目标是实现多任务联动交互,但高昂成本已在内部引发争议。
这两家的共同判断是 " 不为全双工牺牲其他能力 ",在大多数生产力场景中,用户要的是一个靠谱的结果,而不是一个能随时插话的聊天对象。
而在光谱的另一端,Deepgram 和 AssemblyAI 代表的传统语音专业厂商,仍然在三级流水线基础上通过高度优化的专用模型缩小短板。AssemblyAI 在字母数字识别任务上的错误率 16.7%,低于 OpenAI 的 23.3% 和 Deepgram 的 25.5%。Deepgram 一口价 $4.50/ 小时覆盖全链路。但这种 " 拼积木 " 架构的天花板是明确的,每增加一个中间环节,就多一层延迟。对于车载和穿戴场景,传统流水线的天花板约在 600 至 1500 毫秒,而端到端方案已经下探到了 300 毫秒以下。
这四种路线之外,还有一个不可忽视的变量正在浮现:端侧推理。Liquid AI 与奔驰的合作、Meta 的 Llama-Voice 在消费级 GPU 上的实时运行,都指向将语音推理完全放在设备端。这条路目前在算力和模型压缩上有约束,待高通、苹果和车企定制芯片的迭代完成后,端侧语音推理有可能在 2027 至 2028 年进入主流量产。届时,云端语音 API 的商业模式将面临根本性挑战。
当屏幕不再是默认界面
从定价策略来看,SpaceXAI 的战略意图很清晰。
Grok Voice Think Fast 1.0 的定价是 0.05/ 分钟。2.0 涨到 0.08/ 分钟,但伴随的是 TTFA 从 1.25 秒压至 0.70 秒、转录嘈杂环境提升 10 倍、推理速度翻倍和 Agent 执行能力的跃升。更重要的一个动作是,grok-voice-latest 端点将在 8 月 5 日自动从 1.0 迁移到 2.0。大多数开发者没有理由为省 $0.03 而固守旧版。
OpenAI 的 GPT-Realtime-2.1 折算约 0.05 至 0.15/ 分钟。Google 采用类似 token 计费。Qwen Audio 3.0 Realtime Plus 的输入成本约 4.42/ 小时,比 GPT-Realtime-2.1 的 10.75/ 小时便宜六成,但比 Grok Voice 贵了近一倍。
单独看每分钟几美分的价差微不足道。换算成商业场景:一个月 10 万分钟通话量(对大型客服中心而言并不罕见),Grok Voice 2.0 的 8,000 对比 OpenAI 的 7,000 至 $15,000。如果是特斯拉百万辆车队每天产生数百万分钟语音交互,价差将以百万美元计。
但真正透露战略野心的,是 xAI 独立拆分出的 STT 和 TTS API 定价。Grok STT 定价 0.10/ 小时批处理、0.20/ 小时流式,不到 Deepgram 同类服务的几十分之一。Grok TTS 定价 4.20/ 百万字符,比 OpenAI 的约 30 低 86%,比 ElevenLabs 的约 $50 低 90% 以上。这种近乎 " 成本价倾销 " 的策略,只有在马斯克手中同时掌握特斯拉(终端)、Starlink(网络)和 X(数据与分发)时才有商业合理性。语音 API 可以薄利甚至亏损,生态内的其他环节会加倍赚回来。
这套用定价压力倒逼行业洗牌、再用生态锁定效应收割的逻辑,与当年 AWS 碾压传统 IDC 如出一辙。
特斯拉是目前全球最大规模的实时语音 Agent 生产部署。Grok Voice 已经在数百万辆车中投入实战。夏季的车辆软件更新通过 "Hey Grok" 免唤醒词将语音控制从导航扩展到打电话、放音乐、调空调、开手套箱,它能读车辆状态、规划路线、调用搜索和工具。这比任何 API 计费面板、任何开发者 demo 都更有说服力,每一次对话既是一次 A/B 测试,也是一条训练数据。
车载语音市场的膨胀速度佐证了这个判断。据 Global Market Insights 数据,全球车载语音助手市场 2025 年约为 84 亿美元,预计以 9.7% 的年复合增长率扩张至 2035 年的 213 亿美元。智能座舱市场则以 11.8% 的 CAGR 从 2025 年的 82 亿美元奔向 2035 年的 250 亿美元。梅赛德斯 - 奔驰已与 Liquid AI 合作,计划下半年将端侧语音 AI 集成入 MB.OS 操作系统。Lucid 选择了 SoundHound。每一家车企都押注同一个判断,在自动驾驶逐步解放双手之后,语音将成为座舱的主交互通道。
穿戴设备比车载走得更远。Ray-Ban Meta Gen 2 已经将摄像头、麦克风和 AI 语音助手集成进一副与普通太阳镜无异的镜框;Rokid Glasses 选择 MiniMax Speech 作为底层语音引擎。用户可以用语音搜索、翻译、拍照、导航。Meta 没有公开其 AI 眼镜的语音模型供应商,但考虑到 Meta 与 SpaceXAI 的竞争关系以及 OpenAI 与微软的绑定,这本身就说明了一个事实,硬件厂商没有忠诚度,只有 " 谁更快更便宜 " 的判断。一旦某个语音模型在速度和成本上取得决定性优势,硬件厂商的切换只是时间问题。
中国阵营,谁是主力?
国内实时语音的竞争格局,远比一两家公司撑起来的场面要热闹。
阿里云的 Qwen Audio 3.0 Realtime Plus 和 Flash 双版本已覆盖从高精度到低延迟的全场景需求。但放眼整个赛道,国内至少还有五家公司在同一方向上投入了实质性力量。
字节跳动是其中最不可忽视的一家。豆包大模型搭载的 Seeduplex 端到端语音架构,已在超过 700 万辆量产车上落地,覆盖 50 多个汽车品牌。2026 年 4 月,Seeduplex 完成了新一轮升级,通过火山引擎向企业客户输出实时语音能力。字节的优势在于 " 模型加渠道 " 的双重杠杆,既有自研模型,又有抖音和火山引擎的庞大分发网络。
MiniMax 走的是另一条路:扎根语音基础设施,把生意做到了全球。Speech 2.6 模型的端到端延迟压到 250 毫秒以下,支持 40 多种语言,已被 LiveKit(ChatGPT 高级语音模式的技术栈)、Pipecat、Vapi 等海外主流语音平台采用。在智能硬件侧,Haivivi Bubble Pal、Fuzozo、Rokid Glasses 都在用 MiniMax Speech。MiniMax 的策略很明确:不跟 OpenAI 和 SpaceXAI 在通用大模型上正面拼,而在语音这个垂直层做到 " 谁的管道里都有我 "。
科大讯飞是语音领域的资深玩家,在国内市场的根基远比其他几家深厚。据 IDC 数据,讯飞在语音语义市场的份额为 15.6%,位居第一。2026 年 2 月发布的星火 X2 大模型基于全国产算力训练,6 月集中发布了四款企业级 AI 应用,将实时语音交互作为核心卖点。讯飞的核心壁垒不在通用基准跑分上,而在垂直场景的深度渗透:教育口语测评、医疗语音病历、政务热线智能坐席、车载语音,每一块都是需要行业 know-how 的硬骨头。
百度在语音大模型上的投入也值得留意。2026 年 1 月,百度发布了业界首个基于 Cross-Attention 的端到端语音语言大模型,响应延迟压到 412 毫秒。百度地图 AI 副驾在五一期间服务突破 2 亿人次,依托文心大模型实现了全行业独家的双工语音对话能力。百度手里还有小度全系智能硬件和庞大的车企合作网络(比亚迪、吉利等 12 家车企搭载了小度车载系统),在 " 模型加终端 " 的维度上,百度是国内极少数能与字节对标的企业。
智谱 AI 的 GLM-4-Voice 于 2024 年 10 月上线,是国内最早一批端到端语音大模型之一,在中文语义理解和长任务执行上建立了口碑。腾讯混元通过 TRTC 实时音视频平台的 AI 对话能力、搜狗输入法的 AI 语音(98% 准确率、方言识别提升 30%)、腾讯视频的角色扮演语音通话等产品矩阵,把语音 AI 嵌入已有的超级 App 生态中。
这六家中国公司加上阿里云,构成了国内实时语音的 " 七雄 " 格局。各自切入的角度、积累的优势、主攻的战场各不相同,但在一个方向上高度重合:车企是所有人的首要客户画像。中国新能源汽车的智能化竞赛已经推进到语音助手,但多数用户并不清楚 " 支持实时语音 " 这句话背后的延迟差距。毫秒之间,天壤之别。
三个信号
实时语音 Agent 的战局给出了三个清晰信号。
速度即护城河。在文本大模型领域,一个百分点的基准差距或许不会转化为用户体验的差异。但在语音交互中,100 毫秒的延迟差距就能被用户的下意识反应感知到。Qwen 在推理精度上大幅领先,但 4 秒的代价意味着在车载和穿戴场景中暂时出局。0.70 秒对 4.02 秒,这不只是快慢之分,是能用与不能用的区别。
这个物理天花板指向一个清楚的终局,端到端原生架构将逐步替代三级流水线。但 Anthropic 的存在提醒了另一面:速度不是唯一标准,在需要深度推理和可靠执行的场景中," 慢而靠谱 " 比 " 快而飘乎 " 更有价值。终点可能不是某一条路线的全面胜利,而是端到端、轮次制和混合路由各自占据不同场景的生态位。
硬件决定终局。纯 API 模型公司正在面对一个现实,没有自有硬件终端,语音 AI 的商业化天花板就是 API 计费。SpaceXAI 通过特斯拉、Amazon 通过 Echo、Meta 通过 Ray-Ban、百度通过小度和车载合作,凡是拥有硬件出口的公司,在语音入口争夺中天然多一条命。
OpenAI 和 Anthropic 若不能尽快通过合作或自研进入硬件领域,将在下一阶段处于被动。中国市场正以另一套武器打同一场仗,讯飞、字节、百度、阿里在车企供应链中的位置之战,复刻着同一逻辑。语音入口的竞争,说到底是抢一个出厂默认的交互入口。特斯拉车主不会因为 OpenAI 发布了更快的模型就换掉车上的 Grok。Ray-Ban Meta 或 Rokid Glasses 如果绑定了某个语音模型,迁移成本也会使替换变得不划算。一旦被设为默认,换掉它的交易成本就高到让多数人选择忍受。
定价只是起点。Grok TTS 定价比 ElevenLabs 低 90%,Llama-Voice 开源免费,MiniMax 以 250 毫秒延迟服务全球平台,语音基础设施的价格正在被全面压平,但这只是表层。SpaceXAI 靠生态反哺(特斯拉、Starlink、X),Meta 靠开源铺设分发管道,微软靠平台锁定企业客户,亚马逊靠 Echo 终端和 Prime 会员捆绑。语音 API 的定价本身已经很难成为独立商业模式,真正的利润在生态的其他环节。
对于开发者和硬件厂商,此刻需要做一个关键决策:绑定单一模型,还是多模型冗余?前者的成本最低但锁定风险最高;后者的延迟和体验优化复杂度将成倍增加。无论走哪条路,都不能再用 " 等一等再看 " 的心态观望。语音入口的窗口期,不会超过 18 个月。
语音不是大模型的附加功能,它是大模型第一次有机会直接长进物理世界的感官。而感官的租约一旦签下,比 API 合同难解除得多。(本文首发钛媒体 APP,作者 | AGI-Signal,编辑 | 秦聪慧)
更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体 App


