大晓放弃 VLA,开悟 3.1 为何让机器人 " 先想后做 "?

看懂 AI 大白话
VLA 路线的机器人,拿到一张冰箱的照片和一句 " 打开冰箱门 " 的指令,直接输出一条动作轨迹,然后机械臂就按这个轨迹伸过去。至于这条轨迹会不会让手肘卡在门把手上、会不会把冰箱撞歪,它不关心——它只是在执行一套记住的 " 标准答案 "。
开悟 3.1 的做法完全不同。同样面对冰箱,它先在 " 脑海 " 里生成 3 到 5 种抓取方式,每种方式都附带未来 5 到 10 秒的演化视频,然后评估哪一种动作代价最小、成功率最高,再挑最优方案执行。推演过程中发现某种姿势虽然能打开门,但反关节、效率低,就不会被选中。
机器人对不同机械臂动作方案进行推演评估
这就是大晓机器人放弃传统 VLA 路线、转向一体化世界模型架构的核心逻辑:让机器人从 " 盲试 " 进化到 " 先想后做 "。
共享隐空间,为什么是理解 + 生成 + 预测凑在一起,而不是各干各的
要理解这个架构,先看一个更生活化的场景:你伸手去拿桌上的水杯。这个过程里,你的大脑同时在干三件事——理解(水杯在哪、什么形状)、生成(想象手伸过去的画面)、预测(手快碰到杯子时会不会碰倒它)。
关键是,这三件事共享同一套底层认知,你不会单独开一个 " 理解模块 " 算完杯子位置,再传给 " 生成模块 " 画个图,再传给 " 预测模块 " 判断稳不稳。信息在一个统一的 " 脑内地图 " 里流转,损失最小。
开悟 3.1 的架构设计,本质上就是在造这样一张 " 脑内地图 "。
它的输入包括视觉观测(图像 / 视频)、文本指令、力触觉反馈、机械臂和灵巧手的策略轨迹。这些多源数据通过混合 Transformer 架构和共享混合注意力机制,被压缩进同一个共享隐空间。
在这个空间里,模型不仅存储当前输入状态,还从海量数据中学习到了物理因果规律、运动学规律和状态演化信息。
基于这个共享隐空间,模型分出两条解码路径。一条是理解与评估路径,解码出对世界的理解、过程分析和结果评估。另一条是预测与执行路径,对未来进行平行推演,在符合物理因果的前提下演算不同策略,从中选出更优轨迹输出到真机执行。
共享隐空间的设计逻辑,用一句话概括就是:理解、生成、预测三项能力共享同一套底层特征表达,无需为每项任务维护独立的编码器,信息损失更少,推理效率更高。
对比一下那些 " 外挂 " 路径就清楚了。有些方案是在已有视频生成模型上外挂一个控制模块——视频生成模型负责生成 " 看起来合理 " 的画面,控制模块负责输出动作。
但这两个模块各自独立编码,跨模块传递时信息不断损耗,而且视频生成模型并没有学习物理规律,生成出来的画面可能出现物体穿模、悬空、突然消失。开悟 3.1 原生为具身智能设计,三项能力在底层共享同一个特征空间,物理一致性从一开始就被写进了架构。
VLA 预测 next token,世界模型预测 next state,这是两个完全不同的范式
VLA 的底层逻辑沿袭自大语言模型——预测下一个词。输入一张图片和一句指令,模型直接输出下一个动作 token,再下一个,再下一个,串成一条动作轨迹。
它本质上是一种高级模仿学习:你教它抓水杯,它学会了抓水杯,但一旦水杯位置偏移、光照条件改变,或者换了一款机械臂,泛化能力急剧下降。行业数据显示,仿真环境里机器人成功率能做到 89.4%,一到真实场景就骤降至约 12%。
世界模型预测的是下一个世界状态。大晓机器人开悟世界模型研发负责人王飞明确说:" 大语言模型和 VLA 预测的是下一个词,世界模型预测的是下一个世界状态。" 这个区别不是术语上的咬文嚼字,而是 " 记忆标准答案 " 和 " 学会物理规律 " 之间的本质差异。
开悟 3.1 在端侧实现了 10Hz 频率——每 100 毫秒对未来做出一次预测,预测时长约 3 秒。这意味着机器人在执行动作的过程中,一边动作、一边预测、一边自我调整,能应对动态环境和动态交互。
2026 年 3 月,大晓首次将世界模型部署到机器人端侧大脑,过去世界模型更多放在云端做数据生成和模拟仿真,现在它能在端侧实时控制真机。
平行推演,机器人行动前先在脑子里预演一遍
开悟 3.1 在执行前会生成 3 到 5 条候选轨迹,并附带每条轨迹对应的未来演化视频,通过评估器打分排序,选择行动代价更小、预期收益更高的方案。VLA 不具备这个能力,它拿到图片和指令后直接输出动作轨迹,相当于 " 盲试 "。
这个过程可以类比人类动作:你去抓一瓶水,也不会一开始就把位置精确到毫米,而是在动作执行过程中,手越来越接近目标,大脑不断观察和预测,持续调整。开悟 3.1 的 10Hz 预测频率,就是让机器人获得这种 " 手眼协调 " 级别的实时调整能力。
执行之后的环节同样重要。模型构建了 " 理解—推演—执行—反思 " 全链路自进化闭环:如果真实结果和预期不一致,失败数据会回流到模型,更新下一次推演的状态认知。
下一次推演时,模型首先要知道 " 我刚才失败了 ",还要知道失败发生在哪里、应该怎样规避,再调整下一步策略。
从简化到端侧,架构设计如何实现推理效率
开悟 3.1 是 8B 参数模型,在英伟达 Jetson Thor 芯片上跑出百毫秒级推理延迟。作为对比,约 3.3B 参数的 π 0.5 同样在百毫秒级,但 16B 参数的 NVIDIA Cosmos 3 Nano 延迟达到千毫秒级。开悟 3.1 在模型规模远大于 π 0.5 的情况下,保持了与更小模型相当的实时性。
这个实时性依赖自研的 KairosRT 高性能计算引擎,核心技术包括线性注意力、混合精度量化和多流水线并行。大晓的下一步计划是把 80 亿参数模型轻量化到 20 亿参数级别,部署到 Jetson Thor、Orin 及国产芯片上。
共享隐空间架构本身也贡献了效率提升。因为三项能力共享同一套底层特征,不需要为每项任务维护独立的编码器,推理时少了跨模块传递和拼接的开销。这三项能力共享同一个特征空间,模型结构更简洁,推理效率更高
英伟达在 GTC 2026 发布的 Cosmos 3 也采用了相同的理解、生成、预测一体化架构方向,验证了大晓的技术路线判断。从行业角度看,具身智能正在从 VLA 范式逐步转向世界模型范式,底层逻辑也从 next token 的预测转向 next state 的预测。


登录后才可以发布评论哦
打开小程序可以发布评论哦