物理世界的下一次智能跃迁,不会来自对任务清单的无限加法,而会来自一个能够随数据、模型和计算持续 Scaling 的通用模型。
今天,章鱼动力正式发布面向具身智能的通用世界模型——SYNWorld V0.5。
其价值在于建立一个能够持续 Scaling 的通用世界模型:随着数据、模型、算力和任务覆盖不断增长,模型能力也能够持续演进,而 V0.5 正是这条 Scaling 曲线的第一个坐标。
重塑生产力:通用是物理 AI 智能跃迁的必由之路
机器人正从执行固定流程的自动化工具,进化为能够理解环境、自主决策的新型生产力。通用具身智能,是下一轮生产力革命的本质驱动力。
过去几年,各类机器人 Demo 不断涌现。但这些能力往往建立在特定任务、特定场景和特定机器人本体之上,换一个物体、一种环境,甚至一个观察视角,模型都需要重新采集数据、重新训练。
这种依赖专机专用、通过定制训练叠加技能的方式,难以通向真正的通用智能。真正的突破,在于让机器人理解不同任务背后共同的物理规律,掌握跨场景、跨本体的通用能力,实现能力的泛化与迁移。
SYNWorld 的长期目标,正是构建一个跨任务、跨环境、跨机器人本体的通用世界模型:将环境理解、未来预测、动作生成、价值判断与任务进度统一建模,形成 " 理解—生成—执行 " 的具身智能闭环。
SYNWorld 模型架构图
统一建模:一个模型同时理解并作用于物理世界
SYNWorld V0.5 是一个统一建模多模态感知、状态变化与机器人动作的生成模型,其核心要义是将 " 理解世界 " 与 " 作用于世界 " 纳入一个统一的模型框架。
模型架构:采用 MoT 架构,以模态专属编解码器处理文本、视觉、动作、力觉、触觉及本体状态,并通过共享自注意力实现跨模态交互与统一建模,支持模型规模与模态范围的持续 Scaling;
参数规模:10+B;
训练数据:30+ 万小时,涵盖大规模异构图像、视频及带动作标注的机器人动作轨迹;
预训练方式:首先从图像与视频中学习物体、场景、空间关系和时间动态,随后引入机器人动作轨迹,建立状态变化与动作之间的联系。
预训练后,SYNWorld V0.5 基座模型形成了对场景理解、世界预测、逆动力学、动作生成等的共享表征,并由此延展出 ACWM(Action-Conditioned World Model) 和WAM(World Action Model) 两条能力路线。二者共享对物理世界的基础理解,但分别面向世界预测与动作生成继续演进。V0.5 所验证的,正是从大规模多模态预训练,到这两条下游能力路线的关键链路,并展现了可被直接观察和检验的模型能力。
我们观察到,SYNWorld V0.5 基座模型已经能够从大规模视觉数据中学习具有泛化性的世界表征。我们采用人工双盲偏好测试的评估范式,以 Cosmos3 Nano 为基线模型,围绕语义跟随、视觉质量、物理规律遵循三个核心维度,在近 100 组涵盖多样化文本 Prompts 的测试集上进行了系统性的对比评测。
结果显示,SYNWorld V0.5 基座相比 Cosmos3 Nano:
在语义跟随维度相对净胜率提升46.7%;
在视觉质量维度提升26.7%;
在物理规律遵循维度提升51.2%。
三项维度均呈现一致且显著的领先优势,充分证明了基座模型在世界预测任务上的系统性突破与代际超越。
SYNWorld ACWM ( Action-Conditioned World Model )
ACWM 预测动作条件下的未来状态:如果机器人执行这组动作,世界接下来会发生什么?它以历史观测和给定动作为条件,预测未来的状态,建立动作与环境变化之间的关系。这条能力路线可以为可交互数字孪生、数据合成、闭环评测、强化学习提供坚实基础。
Action-Conditioned World Model
建模行动因果,实时动作交互,生成未来世界。
SYNWorld WAM ( World Action Model )
WAM 联合建模动作生成与状态演化:面对当前环境与任务,机器人应该做什么?它从当前观测和任务条件出发,联合建模未来动作与状态变化,直接面向动作生成和闭环控制。未来状态预测同时构成辅助训练目标,帮助策略学习获得更完整的世界表征。
World Action Model
建模行动因果,推演世界变化,生成更优策略。
协同 Scaling:数据、模型与基建的一体化设计
SYNWorld V0.5 的研发成果,不只来自模型架构本身。它背后还有两项不可缺少的支撑:一是持续进入系统的真实世界数据,二是贯通数据处理、模型训练、推理与评测的基建(Infra)。它们共同支撑了 SYNWorld V0.5 从数据采集、模型训练到能力验证的完整研发链路,Infra 也将随着模型 Scaling 而持续 Scaling。
围绕真实世界数据供给,我们构建了全系列数采矩阵:覆盖鱼眼头环 Ego、肌电手环、数据手套等多种采集设备,让规模、多样和全模态的数据持续进入 SYNWorld 的数据体系。
延伸阅读:章鱼动力下一代具身数采产品
SYNWorld V0.5 从世界广度到任务深度的数据金字塔
有力的数据供给只是第一步。数据决定模型能够看到多大的世界,Infra 则决定这些经验能否被高效组织、持续学习,并最终转化为新的能力。
随着模型、数据与任务复杂度持续增长,核心挑战已从完成单次训练,转向保障数据处理、分布式训练、持续评测与推理部署的长期稳定协同。为此,我们围绕系统鲁棒性、可扩展性和迭代效率,构建了支撑 SYNWorld 持续扩展的 Infra 体系:
Data Infra:支撑多源、多模态数据的持续接入、清洗与规模化处理,稳定产出模型可用数据,日均数据产能超过1 万小时;
Training Infra:支撑大规模分布式训练与长时间稳定运行,使模型规模持续扩大时仍能保持高效训练,实测训练效率相比同类型开源成果提升10 倍以上;
Inference Infra:提供高效推理与部署能力,缩短模型从训练完成到真实环境验证的周期;
Evaluation Infra:持续跟踪模型在不同任务、场景和本体上的能力变化,支持开环评测、闭环仿真评测、真机评测,为模型迭代和闭环强化提供持续反馈。
整套 Infra 不仅保证数据处理、模型训练和评测任务长时间稳定可控,同时也显著缩短从新数据接入系统,到完成模型训练与能力评测的完整周期。
持续 Scaling:以 V0.5 为起点迈向通用具身智能
SYNWorld V0.5 处于通用世界模型路线的早期阶段。长时预测的一致性、精细物理交互的准确性,以及模型跨任务、跨环境、跨机器人本体的迁移能力,仍将在更大规模的数据、模型和评测中持续提升。
V0.5 的价值在于建立了一条可以继续扩大规模、反复训练并验证的通用世界模型路线。对于已经获得的结果,我们有了可观察、可检验的证据;对于尚未验证的判断,我们将它们转化为下一阶段明确的研究问题。
如果说通用世界模型定义了 SYNWorld 走向通用具身智能的方向,那么 Scaling 就是我们持续回答这些问题的核心路径。我们相信,随着数据规模、模型容量和计算投入持续增长,模型将学习更丰富的物理规律,并将这些能力迁移到更多任务、环境和机器人本体。
接下来,SYNWorld 将沿着这一方向继续演进:
SYNWorld 从 V0.5 到 V2 的参数规模与模态扩展路径
SYNWorld V0.5|现在:10+B 模型参数,贯通统一视觉—动作建模、训练、评测与推理的关键链路,建立规模化验证的起点;
SYNWorld V1.0|计划于 2026 年 10 月:向 20+B 参数规模推进,进一步扩大训练数据、模型容量与评测覆盖,系统验证能力能否随规模持续增长;
SYNWorld V2.0|计划于 2027 年上半年:迈向数百 B 参数的 MoE 世界模型,探索如何以更高效的计算组织,承载更丰富的物理知识与更广泛的通用能力。
但参数规模本身从来不是目标。只有模型能力随着数据、模型和计算规模的增长表现出持续提升,Scaling 才真正成立。
关于SYNWorld V0.5 的模型架构、训练方法与评测结果,我们将在后续发布正式技术报告,系统呈现更多技术细节与实验结果,欢迎持续关注。
今天,我们发布 SYNWorld V0.5。这只是一个开始,物理世界足够复杂,SYNWorld 让物理智能可以持续 Scaling。


登录后才可以发布评论哦
打开小程序可以发布评论哦