车圈先锋 14小时前
国内有哪些公司在做语音大模型?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

国内语音大模型赛道已形成 车企自研(理想、问界、小米)、科技巨头底层赋能(阿里、百度、腾讯、字节) 和 专业语音厂商(科大讯飞) 三大阵营,2026 年纷纷加速在车载场景的落地。

一、车企自研语音大模型

1. 理想、问界、小米

2024 年底就有媒体对这三家车型的大模型进行了对比测试,聚焦交互体验、出行推荐、娱乐功能和信息问答等方面。

理想汽车在生态整合上表现出优势,其自研大模型深度融入车辆控制系统与用户日常交互。

问界和小米也分别将大模型作为智能座舱的核心交互入口,强调语音的自然感与低延迟。

2. 车载语音的核心要求

车载场景对延迟要求极高,阿里千问 Qwen-Audio-3.0-TTS 的 Flash 版延迟≤ 300ms,专门适配车载语音。

车企自研模型普遍采用端云结合方案,离线处理基础指令,在线调用云端大模型完成复杂任务。

二、科技巨头提供底层语音能力

1. 阿里巴巴

2026 年 7 月推出 Qwen-Audio-3.0-TTS 双版本:Flash 版用于车载 / 实时客服,Plus 版用于有声书 / 数字人直播。

支持自然语言指令调节语速、情绪、口音,降低车企集成门槛。

2. 字节跳动、腾讯、百度

字节跳动(豆包)在四个月内完成了图 - 视频 - 音频全模态覆盖。

腾讯混元、百度文心语音模型均已开放 API,支持多种方言与多语种识别。

这些大厂将语音能力作为 " 多模态门票 ",为车企提供标准化解决方案。

3. MiniMax 等新锐厂商

MiniMax 以 1/4 价格拿下语音榜单双榜第一,推动车载语音成本大幅下降。

其语音模型采用共享思维底座架构,实现 " 边想边说 ",提升交互自然度。

三、专业语音厂商:科大讯飞

科大讯飞深耕语音交互二十余年,积累海量通用口语、方言及专业话术语料,是中文语音方言语料龙头。

其星火大模型持续迭代,面向车载 AI、智能硬件开放语音语料授权,是端侧语音大模型的核心数据供应商。

在政务、教育、医疗等垂直领域也有深厚积累,为车载多场景提供技术支撑。

四、其他参与者

1. 华为

华为盘古大模型主要聚焦商用领域(工业、医疗、自动驾驶等),并未重点押注通用语言大模型。

其在智能驾驶上提出原生基大模型,专为自动驾驶设计,与语音对话路线不同。

2. 中科创达、虹软科技

中科创达在车载 AI 智能座舱领域落地语音交互与自动驾驶感知算法。

虹软科技专注于 3D 视觉感知与车载视觉算法,间接提升语音与视觉融合体验。

五、行业趋势与规范

2026 年语音能力已成为大模型公司的 " 奥运资格赛 " 门槛,投资人更看重多模态覆盖度。

国内语音 AI 已摆脱海外技术复刻,建成端云一体音频大模型生态。

语音模型落地需注意语料来源合规与内容安全,相关行业监管将趋严。

精选参考来源 查看全部

本文由 AI 生成

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

腾讯 自动驾驶 百度 科大讯飞 问界
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论