
当 VLA 模型理解语言、感知环境并直接生成机器人动作,一个更基础的问题开始浮现:机器人如何理解一个持续变化的物理世界?物体从哪里移动而来、杯子此前遮住了什么、机械臂正在接近还是远离目标——真正决定下一步动作的信息,往往不只存在于当前一帧,而存在于连续的时间之中。
近日,大晓机器人联合香港大学发布全新的连续物理智能研究成果 StreamPI,直指 VLA 长期存在的 " 单帧智能 " 瓶颈,为其补上关键的 " 时间维度 "。不同于传统 VLA 主要依据当前观测独立决策,StreamPI 为模型建立持续的多模态时序上下文,使机器人能够记住过去、理解状态变化、判断任务进程,并利用跨帧信息增强精细空间感知与动作决策。它推动 VLA 从 " 识别当前状态 ",进一步走向 " 理解一个正在发生的物理过程 "。
VLA 会 " 看 " 和 " 做 ",但还需理解 " 发生了什么 "
以 π 0、π 0.5 为代表的新一代 VLA,正不断拓展机器人在开放环境中的泛化边界。π 0.5 已能够在训练未见过的家庭环境中完成厨房、卧室清洁等 10-15 分钟的长程多阶段任务,机器人基础模型正在从单一技能执行走向更复杂的开放世界操作。

大晓机器人加速物理 AI 迎来 " 开悟时刻 "
但 StreamPI 直指 VLA 更底层的能力缺口:当前大量模型仍依赖单帧决策,能够判断 " 眼前是什么 ",却难以持续理解 " 此前发生了什么 "。缺少历史上下文,不仅限制机器人的时序记忆,也使其难以利用运动视差、状态变化等跨帧线索形成更准确的三维空间判断。这也是当前流式感知与实时 VLA 研究持续关注的问题。
一个最直观的例子是 " 猜杯子 ":物体被藏入杯子并经过多次交换后,答案已不存在于最后一帧,而存在于整个变化过程;面对滚动物体,单帧只能判断 " 它在哪里 ",连续观测才能理解 " 它正往哪里去 "。当关键信息存在于时间之中,机器人需要的不只是看见当下,更要理解过程。
不是简单 " 多看几帧 ",而是从窗口式走向流式
给 VLA 加入时间信息,最直接的方法是把过去多帧图像组成一个窗口,一次性交给模型。但历史越长,视觉信息越多,不仅需要反复计算已经处理过的画面,推理开销持续增加,任务指令也更容易被大量视觉信息稀释,导致机器人在长程执行中逐渐 " 忘记目标 "。
StreamPI 没有简单堆叠历史帧,而是将每个时刻组织为一个完整的 " 视觉观测 + 任务指令 " 时序单元。语言指令持续绑定每一次观测,成为贯穿任务始终的语义锚点,让机器人在不断接收新信息的同时,始终明确 " 正在做什么、目标是什么 "。

大晓机器人在零售场景上的应用
在每个时序单元内部,视觉与语言充分交互;不同时间单元之间,则按照时间顺序持续读取和聚合历史信息。由此,模型既能理解 " 这一刻看到了什么 ",也能追溯 " 此前发生了什么 ",将原本离散的单帧判断连接成连续的时序理解,实现帧内解决 " 这一刻看到了什么 ",帧间解决 " 此前发生了什么 "。
让机器人拥有记忆,并不意味着每次决策都要重算全部历史。StreamPI 采用流式推理:首帧观测被编码后存入键值缓存,后续只需处理新到来的信息,并直接调用历史表示,避免重复计算整个观测窗口。
随着机器人持续行动,新信息不断写入、历史信息持续保留,当前决策始终建立在此前状态之上。与此同时,StreamPI 无需额外引入视频编码器或独立记忆模块,而是通过重构原有 VLA 的注意力机制,直接继承 π 0.5 的视觉—语言表征能力,在不增加额外模型参数的情况下,让单帧 VLA 获得连续时序能力。
真机验证:当 " 时间 " 真正改变动作结果
团队进一步设计四项真机任务,分别检验时序记忆与精细空间感知,每项任务采集 100 条人类遥操作示范。在需要持续记住杯子交换轨迹的 " 猜杯子 "(Shell Game)任务中,StreamPI 将 π 0.5 的成功率从 46.7% 提升至 80.0%;在需要判断物体运动趋势的滚动物体抓取中,则从 26.7% 提升至 63.3%。差距不在于机器人能否 " 看见 " 杯子和瓶子,而在于它能否理解此前发生了什么,以及物体接下来可能去哪里。
在强调空间精度的任务中,效果同样明显。在窄瓶口插笔任务中,成功率从 40.0% 提升至 66.7%;纸杯插入杯套任务则从 60.0% 提升至 92.0%。连续观测带来的运动视差、相对位移和状态变化,让机器人获得单帧图像难以提供的几何线索——时间不仅带来记忆,也在帮助机器人更准确地理解空间。

真实世界任务可视化与真实机器人性能对比
StreamPI 真正探索的,并不只是 " 为 VLA 增加历史信息 ",而是推动机器人从基于当前状态决策,走向基于连续过程决策:现实世界不再是一组彼此孤立的静态画面,而是一条可以被记忆、理解和持续更新的时间流。
大晓机器人是加速具身智能智慧跃迁的机器人公司,由商汤科技联合创始人、执行董事王晓刚出任董事长,世界级 AI 科学家陶大程院士担任首席科学家,公司汇聚全球稀缺的青年 AI 科学家及来自产业界的卓越专家。
空间告诉机器人 " 物体在哪里 ",时间告诉机器人 " 世界正在发生什么 "。未来,团队将探索超过 100 帧的高效时序训练与自适应缓存裁剪,将机器人的时序理解进一步延伸至更长、更复杂的真实任务。


登录后才可以发布评论哦
打开小程序可以发布评论哦