远山行客 4小时前
大晓放弃VLA,开悟3.1为何让机器人“先想后做”?
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

大晓放弃 VLA,开悟 3.1 为何让机器人 " 先想后做 "?

看懂 AI 大白话

VLA 路线的机器人,拿到一张冰箱的照片和一句 " 打开冰箱门 " 的指令,直接输出一条动作轨迹,然后机械臂就按这个轨迹伸过去。至于这条轨迹会不会让手肘卡在门把手上、会不会把冰箱撞歪,它不关心——它只是在执行一套记住的 " 标准答案 "。

开悟 3.1 的做法完全不同。同样面对冰箱,它先在 " 脑海 " 里生成 3 到 5 种抓取方式,每种方式都附带未来 5 到 10 秒的演化视频,然后评估哪一种动作代价最小、成功率最高,再挑最优方案执行。推演过程中发现某种姿势虽然能打开门,但反关节、效率低,就不会被选中。

机器人对不同机械臂动作方案进行推演评估

这就是大晓机器人放弃传统 VLA 路线、转向一体化世界模型架构的核心逻辑:让机器人从 " 盲试 " 进化到 " 先想后做 "。

共享隐空间,为什么是理解 + 生成 + 预测凑在一起,而不是各干各的

要理解这个架构,先看一个更生活化的场景:你伸手去拿桌上的水杯。这个过程里,你的大脑同时在干三件事——理解(水杯在哪、什么形状)、生成(想象手伸过去的画面)、预测(手快碰到杯子时会不会碰倒它)。

关键是,这三件事共享同一套底层认知,你不会单独开一个 " 理解模块 " 算完杯子位置,再传给 " 生成模块 " 画个图,再传给 " 预测模块 " 判断稳不稳。信息在一个统一的 " 脑内地图 " 里流转,损失最小。

开悟 3.1 的架构设计,本质上就是在造这样一张 " 脑内地图 "。

它的输入包括视觉观测(图像 / 视频)、文本指令、力触觉反馈、机械臂和灵巧手的策略轨迹。这些多源数据通过混合 Transformer 架构和共享混合注意力机制,被压缩进同一个共享隐空间。

在这个空间里,模型不仅存储当前输入状态,还从海量数据中学习到了物理因果规律、运动学规律和状态演化信息。

基于这个共享隐空间,模型分出两条解码路径。一条是理解与评估路径,解码出对世界的理解、过程分析和结果评估。另一条是预测与执行路径,对未来进行平行推演,在符合物理因果的前提下演算不同策略,从中选出更优轨迹输出到真机执行。

共享隐空间的设计逻辑,用一句话概括就是:理解、生成、预测三项能力共享同一套底层特征表达,无需为每项任务维护独立的编码器,信息损失更少,推理效率更高

对比一下那些 " 外挂 " 路径就清楚了。有些方案是在已有视频生成模型上外挂一个控制模块——视频生成模型负责生成 " 看起来合理 " 的画面,控制模块负责输出动作。

但这两个模块各自独立编码,跨模块传递时信息不断损耗,而且视频生成模型并没有学习物理规律,生成出来的画面可能出现物体穿模、悬空、突然消失。开悟 3.1 原生为具身智能设计,三项能力在底层共享同一个特征空间,物理一致性从一开始就被写进了架构。

VLA 预测 next token,世界模型预测 next state,这是两个完全不同的范式

VLA 的底层逻辑沿袭自大语言模型——预测下一个词。输入一张图片和一句指令,模型直接输出下一个动作 token,再下一个,再下一个,串成一条动作轨迹。

它本质上是一种高级模仿学习:你教它抓水杯,它学会了抓水杯,但一旦水杯位置偏移、光照条件改变,或者换了一款机械臂,泛化能力急剧下降。行业数据显示,仿真环境里机器人成功率能做到 89.4%,一到真实场景就骤降至约 12%。

世界模型预测的是下一个世界状态。大晓机器人开悟世界模型研发负责人王飞明确说:" 大语言模型和 VLA 预测的是下一个词,世界模型预测的是下一个世界状态。" 这个区别不是术语上的咬文嚼字,而是 " 记忆标准答案 " 和 " 学会物理规律 " 之间的本质差异。

开悟 3.1 在端侧实现了 10Hz 频率——每 100 毫秒对未来做出一次预测,预测时长约 3 秒。这意味着机器人在执行动作的过程中,一边动作、一边预测、一边自我调整,能应对动态环境和动态交互。

2026 年 3 月,大晓首次将世界模型部署到机器人端侧大脑,过去世界模型更多放在云端做数据生成和模拟仿真,现在它能在端侧实时控制真机。

平行推演,机器人行动前先在脑子里预演一遍

开悟 3.1 在执行前会生成 3 到 5 条候选轨迹,并附带每条轨迹对应的未来演化视频,通过评估器打分排序,选择行动代价更小、预期收益更高的方案。VLA 不具备这个能力,它拿到图片和指令后直接输出动作轨迹,相当于 " 盲试 "。

这个过程可以类比人类动作:你去抓一瓶水,也不会一开始就把位置精确到毫米,而是在动作执行过程中,手越来越接近目标,大脑不断观察和预测,持续调整。开悟 3.1 的 10Hz 预测频率,就是让机器人获得这种 " 手眼协调 " 级别的实时调整能力。

执行之后的环节同样重要。模型构建了 " 理解—推演—执行—反思 " 全链路自进化闭环:如果真实结果和预期不一致,失败数据会回流到模型,更新下一次推演的状态认知。

下一次推演时,模型首先要知道 " 我刚才失败了 ",还要知道失败发生在哪里、应该怎样规避,再调整下一步策略。

从简化到端侧,架构设计如何实现推理效率

开悟 3.1 是 8B 参数模型,在英伟达 Jetson Thor 芯片上跑出百毫秒级推理延迟。作为对比,约 3.3B 参数的 π 0.5 同样在百毫秒级,但 16B 参数的 NVIDIA Cosmos 3 Nano 延迟达到千毫秒级。开悟 3.1 在模型规模远大于 π 0.5 的情况下,保持了与更小模型相当的实时性。

这个实时性依赖自研的 KairosRT 高性能计算引擎,核心技术包括线性注意力、混合精度量化和多流水线并行。大晓的下一步计划是把 80 亿参数模型轻量化到 20 亿参数级别,部署到 Jetson Thor、Orin 及国产芯片上。

共享隐空间架构本身也贡献了效率提升。因为三项能力共享同一套底层特征,不需要为每项任务维护独立的编码器,推理时少了跨模块传递和拼接的开销。这三项能力共享同一个特征空间,模型结构更简洁,推理效率更高

英伟达在 GTC 2026 发布的 Cosmos 3 也采用了相同的理解、生成、预测一体化架构方向,验证了大晓的技术路线判断。从行业角度看,具身智能正在从 VLA 范式逐步转向世界模型范式,底层逻辑也从 next token 的预测转向 next state 的预测。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 机械臂 物理 规律 ai
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论