太平洋电脑网 昨天
机器人赛道开始卷大脑了!智元具身大模型登顶DailyOmni权威榜单
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

2026-07-29 11:56 出处 / 作者:PConline 原创整合编辑:科仔播报

【太平洋科技快讯】7 月 28 日,智元官方公众号宣布,智元自研的具身原生全模态大模型 WITA-Omni Preview,凭借领先的音视频联合理解与时序推理能力,以 85.21 分综合成绩登顶具身全模态理解权威榜单 DailyOmni 榜首,超过千问、Gemini、豆包、英伟达等国内外领先模型,并在八项细分指标中的六项取得第一。

图片来源:智元官方公众号,下同

据了解,DailyOmni 是业内公认衡量音视频时序匹配、跨模态联合推理能力的第三方权威榜单。和常规图文、短视频评测任务不同,榜单采用大量真实开放环境音视频素材,重点考核模型融合视觉、音频信息,分辨声画对应关系、事件时序与跨模态语义的能力,高度贴合人形机器人在真实环境人机交互所需的感知核心能力。

架构创新:拓展 Thinker – Talker 范式,新增 Actor 实现具身交互

对具身机器人而言,感知理解与动作反馈并非割裂流程,而是连贯的物理交互过程。 WITA-Omni 没有简单将通用对话模型移植至机器人,而是把肢体动作、面部表情提升至与语音同等优先级输出,打造端到端原生具身交互架构 Thinker – Talker – Actor。

性能优势:分层数据集搭配三阶段训练策略

WITA-Omni 的性能领先并非依靠盲目扩充模型参数,而是来自一套围绕具身全模态交互构建的分层 数据体系与针对性训练方法。

在中训练阶段,WITA-Omni 整合千万小时级自有与开源多模态数据,强化图文基础能力,构建可完成视听联合推理的全模态底座。

模型采用 SFT-OPD-RL 三段式训练流程,让模型自主判断场景中该不该回应、何时回应、对谁回应。

行业价值:端到端架构推动具身智能落地

智元此次登顶 DailyOmni 榜单,证明 WITA-Omni 在物理世界视听时序理解任务具备差异化优势,也是行业首款面向机器人原生打造的端到端多模态交互大模型。

该模型的突破不止拓展模态覆盖范围,而是让机器人在统一时序、统一认知框架下同步完成感知、决策、输出。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 英伟达 物理 考核 短视频
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论