国内语音大模型赛道已形成 车企自研(理想、问界、小米)、科技巨头底层赋能(阿里、百度、腾讯、字节) 和 专业语音厂商(科大讯飞) 三大阵营,2026 年纷纷加速在车载场景的落地。
一、车企自研语音大模型
1. 理想、问界、小米
2024 年底就有媒体对这三家车型的大模型进行了对比测试,聚焦交互体验、出行推荐、娱乐功能和信息问答等方面。
理想汽车在生态整合上表现出优势,其自研大模型深度融入车辆控制系统与用户日常交互。
问界和小米也分别将大模型作为智能座舱的核心交互入口,强调语音的自然感与低延迟。
2. 车载语音的核心要求
车载场景对延迟要求极高,阿里千问 Qwen-Audio-3.0-TTS 的 Flash 版延迟≤ 300ms,专门适配车载语音。
车企自研模型普遍采用端云结合方案,离线处理基础指令,在线调用云端大模型完成复杂任务。
二、科技巨头提供底层语音能力
1. 阿里巴巴
2026 年 7 月推出 Qwen-Audio-3.0-TTS 双版本:Flash 版用于车载 / 实时客服,Plus 版用于有声书 / 数字人直播。
支持自然语言指令调节语速、情绪、口音,降低车企集成门槛。
2. 字节跳动、腾讯、百度
字节跳动(豆包)在四个月内完成了图 - 视频 - 音频全模态覆盖。
腾讯混元、百度文心语音模型均已开放 API,支持多种方言与多语种识别。
这些大厂将语音能力作为 " 多模态门票 ",为车企提供标准化解决方案。

3. MiniMax 等新锐厂商
MiniMax 以 1/4 价格拿下语音榜单双榜第一,推动车载语音成本大幅下降。
其语音模型采用共享思维底座架构,实现 " 边想边说 ",提升交互自然度。
三、专业语音厂商:科大讯飞
科大讯飞深耕语音交互二十余年,积累海量通用口语、方言及专业话术语料,是中文语音方言语料龙头。
其星火大模型持续迭代,面向车载 AI、智能硬件开放语音语料授权,是端侧语音大模型的核心数据供应商。
在政务、教育、医疗等垂直领域也有深厚积累,为车载多场景提供技术支撑。
四、其他参与者
1. 华为
华为盘古大模型主要聚焦商用领域(工业、医疗、自动驾驶等),并未重点押注通用语言大模型。
其在智能驾驶上提出原生基大模型,专为自动驾驶设计,与语音对话路线不同。
2. 中科创达、虹软科技
中科创达在车载 AI 智能座舱领域落地语音交互与自动驾驶感知算法。
虹软科技专注于 3D 视觉感知与车载视觉算法,间接提升语音与视觉融合体验。
五、行业趋势与规范
2026 年语音能力已成为大模型公司的 " 奥运资格赛 " 门槛,投资人更看重多模态覆盖度。
国内语音 AI 已摆脱海外技术复刻,建成端云一体音频大模型生态。
语音模型落地需注意语料来源合规与内容安全,相关行业监管将趋严。
精选参考来源 查看全部
本文由 AI 生成


登录后才可以发布评论哦
打开小程序可以发布评论哦