
AI 语音模型正迎来爆发期,Boson AI 创始人 Alex Smola 正近距离见证这一进程。这家总部位于加州圣克拉拉的初创公司即将发布其首款语音到语音模型 Higgs RealTime。Smola 认为,语音模型已达到推动人机交互实现下一次飞跃的关键门槛。
Smola 曾任亚马逊杰出科学家及领先机器学习研究员。他创立 Boson 的初衷,是洞察到行业正从纯文本界面转向包含音频和视觉的多模态 AI,以提供更丰富的用户体验。除提升能力外,Boson 致力于构建价格竞争力,其使命是提供比 OpenAI 等竞争对手显著更低的实时音频产品开发和部署成本。
" 我们的成本比竞争对手低一个数量级,且依然非常实用。"Smola 表示。Boson 称,其模型成本仅为其他模型的十分之一。
全栈架构与数据主权
当前,AI 语音技术已成为 OpenAI、Meta 等行业巨头竞相布局的前沿领域。各方团队高度专注于 " 全双工 " 系统,即使用户在说话中途打断 AI,也能实现自然流畅的双向对话。OpenAI CEO Sam Altman 近期透露,他与 ChatGPT 进行语音交流的频率已超过文字聊天,并指出新语音模型 " 确实跨越了一个门槛 "。
Smola 认为,Boson 的关键差异化优势在于其 " 全栈 " 模型架构,这大幅降低了技术成本。该模型允许企业客户在自有数据中心运行系统,并从零开始训练定制的语音和视频模型。这种方法使企业能直接控制敏感商业环境中的数据驻留和模型执行。尽管 Smola 倡导开放权重和可定制模型,与 Meta 及开源社区立场一致,但面向企业客户的需求使其最终构建了专有模型。
资本加持与行业竞争
这家成立三年的初创公司已筹集 7000 万美元资金,获得中国企业家苏华以及新加坡投资公司淡马锡风投部门的支持。Smola 将金融、电信、医疗和保险行业确立为首批目标客户群体。
" 许多用于客户支持和销售的机器交互将通过语音代理实现自动化,"Smola 指出," 它们在某些方面可以完全优于人类。"
构建语音界面的主要障碍之一是延迟。在文本聊天中可接受的一秒响应延迟,在口语对话中会显得尴尬且具有破坏性。此外,全双工音频因增加 GPU 用量而导致高昂成本。为弥合差距,Boson 正在训练 AI 理解 " 人性 " 细微差别,包括解析快乐或被动攻击性等情感语调,以及适应快速说话模式。
Boson 仍面临强劲竞争。微软最近宣布了最新一代语音模型,定位为工作场所生产力工具;OpenAI 推出了全双工音频模型组 GPT-Live,试图成为开发者的默认选择;Meta 则发布了针对语音优化的 Muse Spark 模型,强调与其可穿戴设备的硬件集成,支持随时打断、切换话题或更换语言的自然交谈。
迈向具身智能
展望未来,Smola 设想配备动画面部表情和增强版语音模型的机器人将成为家庭必需品,如同科幻电影《我,机器人》中的场景。他认为,当前的企业价值在于实际自动化,例如在销售电话中保持完整上下文的语音模型,能比人工团队更快地生成实时日志和个人化记录。
最终,Smola 将具身智能(Embodied AI)视为终极目标。结合推理、视觉和语音的机器人,将 " 真正成为技术的终极前沿 "。
【星途科讯 图文丨三一一 首发于 ZAKER 科技,转载请注明出处】


登录后才可以发布评论哦
打开小程序可以发布评论哦