新浪财经 16小时前
智元WITA-Omni Preview登顶DailyOmni全模态理解榜单,超越Gemini、豆包
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

新浪科技讯 7 月 28 日下午消息,近日,具身全模态理解权威榜单 DailyOmni 最新评测结果揭晓,智元自研的具身原生全模态大模型 WITA-Omni Preview 以 85.21 分综合成绩登顶榜首,超过千问、Gemini、豆包、英伟达等国内外领先模型,并在八项细分指标中的六项取得第一。

DailyOmni 是行业公认的检验音视频时序对齐、跨模态联合推理能力的权威第三方榜单。该榜单大量采用真实开放环境音视频素材,核心考验模型融合视觉画面、环境音频信息,精准识别声画对应关系、事件先后顺序及跨模态语义的综合能力,高度贴合人形机器人在真实物理空间开展人机交互所需的核心感知能力。

据悉,WITA-Omni 领先的关键,在于它并不是简单地把聊天模型 " 装进 " 机器人,而是将物理动作和表情提升为与语音并列的一级输出,用一个原生端到端模型统一驱动感知、决策与表达,从 Thinker – Talker 范式上进一步扩展出面向具身输出的   Thinker – Talker – Actor   架构。

在中训练阶段,WITA-Omni 使用千万小时级多模态数据,将强文本、视觉底座进一步升级为能够 " 听得见、看得懂,并进行音画联合推理 " 的全模态模型。(文猛)

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 科技讯 英伟达 新浪 物理
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论