AI 研究 AI,这次有了物理世界的答卷。
一家成立仅三个月的公司,亮出了自己的首款通用物理快系统,Simate-beta:展示记忆、长程任务、精细操作与任务适应能力,并据公司披露,登顶 RoboDojo。
榜单当然不能代表模型的全部能力,但它提供了一个观察研发速度与实力的切面。
据团队介绍,此次参评的基础模型并未针对该榜单进行任何专门优化。
成立三个月,首版模型就交出这样的成绩,值得关注。
团队叫Simate(Silicon Mate)。
来头也不小。据公司介绍,核心团队曾将一段式端到端智驾模型能力推进至对标 Tesla FSD 的水平,并完成量产落地。
放眼全球,跨过这道门槛的团队也属极少数;带着这套积累继续推进通用物理 AI,就更少见了。
不过,这次最有意思的,是他们从创立第一天就定下的研发方式:
AI for Physical AI,让 AI 参与物理智能本身的研究与迭代。
公司围绕这条路线组织模型、数据、算力与实验流程。Simate-beta,正是这套 AI-native 研发体系的第一个实践产物。
而且,研究工具已经开始被外部研究者用起来了。
据公司介绍,来自 MIT、加州理工、清华、北大等高校的研究者已参与 AutoResearch 平台内测。配套其 Sinfra 基础设施覆盖训练、仿真与推理,具体可用资源按申请确认。
同期,Simate 已连续完成多轮数亿元人民币级别融资。
三个月,模型、研究平台、外部试用与融资同步推进。这个速度,确实让人想看看下一步。
团队也给出了预告:已形成面向复杂任务零样本泛化的技术思路,计划于今年年底推出阶段性成果。
在他们看来,GPT-6 开始参与物理世界的操作,是预料之中的进展,Physical AI 的突破可能比外界想象来得更快。他们希望进一步突破逐任务适配与后训练的依赖,推动物理 AI 迎来自己的 「GPT-3 时刻」。
模型与自动化研究等三项研究工作,也将通过论文和技术报告陆续公布,相关成果计划分阶段开源。
这份研发速度,以及它能否持续,成为 Simate 接下来最值得关注的事。
所以,首款模型究竟做到了什么?AI 又是怎么参与研究的?
Simate-beta:面向零样本泛化的通用物理快系统
Simate 最终想逼近的,是零样本(Zero-Shot)与少样本(Few-Shot)的通用物理 AI 操作。
在一个全新的陌生环境中,系统不应该每增加一项新任务,就重新采集一批数据、训练一次模型、重新调一遍工程。
这正是当下物理 AI 最热门、也最具挑战的赛道——百家争鸣,各显神通。
而 Simate 给出的现阶段解法,叫做:通用物理快系统。
也就是系统一。
先用咱人类举个例子:
面对「帮我把桌子收拾一下」这类复杂指令,我们需要「系统二」去理解意图、拆解步骤;
但当手已经伸向杯子,接下来究竟该往左微调几毫米还是往右偏一点,这种毫秒级的动作反应,不可能每一步都依赖深度思考。
物理 AI 亦然。
一个通用的「慢系统」负责高层规划与复杂推理,而一个足够强悍的「快系统」,则负责实时感知眼前不断变化的物理世界,并极速输出动作。
Simate 选择的正是后者——
将快系统的参数量做大,探索零样本泛化能力的涌现,挑战端侧可部署模型的规模与能力上限。
一个通用物理快系统。
不过,大,又要快,很难搞的一个 Trade off。
Simate 选择从两件事情入手:
1、4D 物理感知
理解物理世界,必须同时捕捉空间结构与时间维度的动态变化,让物理表征真正服务于行动。
2、分层时序记忆
长程任务需要记住此前发生的事,连续操作需要追踪状态,即时反应又不能被庞大的历史信息拖慢。
4D 物理感知与分层时序记忆,共同指向与人类快系统处理连续世界方式的对齐。
这条路线,也延续了团队在大规模视觉模型、时序建模、实时推理与量产部署上的积累。具体架构和模型规模,将在后续技术报告中披露。
最终希望达到的状态是:模型既清楚眼前正在发生什么,也记得刚才发生过什么,并能及时决定下一步。
再与 GPT-6 等前沿模型所代表的通用推理能力协同,向复杂任务的零样本执行推进。
从公司目前给出的Simate-beta真机展示来看,测试主要围绕演示驱动的任务适应、记忆、复杂长程执行与精细操作展开。
根据公司提供、更新于2026 年 9 月 23 日的 RoboDojo 榜单,simate-beta 以平均 Score 33.95排名第一,对应SR 为 27.96%。该成绩属于榜单评测,真机表现另行展示。
这份模型答卷背后,是另一套同样值得展开的系统。
让飞轮转起来
这几年,大家已经越来越习惯 AI 写代码。
但其实在 AI 研究里,写代码只是很小一部分。
很多时候,迭代效率,才是决胜的关键。谁能在单位时间内验证完更多研究假设,谁就能先跑出来。
举个最简单的例子。
机器人长程任务总是卡在某个环节,原因无非几种:数据分布失真、模型结构瓶颈、轨迹比例失衡,或者训练策略失效。
每一个方向背后,都对应十几组甚至几十组实验。
如果全靠研究员手动改配置、开任务、盯训练、跑评测,再把结果整理回来,那黄花菜都凉了啊。。。
所以 Simate 做了 AutoResearch,用来加速这一流程——
人类研究员:提出假设、设定目标、划定约束。
AutoResearch 引擎:自动接棒,把剩下的实验拆解、跑通、反馈全流程自动化。
最终结果也揭晓了,他们靠这套方法在 RoboDojo 拿下了第一。
更关键的是速度。
Simate 从成立到登顶 RoboDojo,前后只用了三个月。
就离谱。。。
所以问题来了:
AI 到底该如何「研究 AI」?
显然,只丢一个 Agent 进去是远远不够的。
真正的机器人研发,底层穿透了模型代码、数据管线、训练集群、评测环境、真机反馈,以及过去数月甚至数年的实验记录。
归根结底,这依然是「上下文」的问题。Agent 需要一个能够调度一切的超级接口。
为此,Simate 搭建了一套三层架构:SiPAI + AutoResearch + AI-native Infra。
SiPAI:让模型架构「AI 可研究」
这是一套原生面向「自动化研究」的可插拔模型框架。
简单来说,就是把机器人模型搭建成 AI 能轻松读懂的结构——模块边界、系统接口、配置项与验证流程都被定义得极其清晰。
只有这样,Agent 拿到研究课题后,才能精确知晓:该改哪个模块?改动会波及什么?最后又该如何验证?
目前,Simate 已经完成了这套基础设施的搭建,成功接入了世界模型、世界动作模型、VLA、VLM 等多种主流架构。
无论是人类研究员还是 Agent,都能自由组合组件、调整局部实现,并沿用统一的训练与评测流水线。
AutoResearch:提供实时刷新的「研究上下文」
如果说 SiPAI 提供了一份静态说明书,那么 AutoResearch 解决的就是动态信息差:
研究推进到哪了?以前踩过什么坑?最新的证据是什么?
它将外部前沿论文、团队内部研讨材料、模型代码、数据配比、历史实验日志与最新的评测反馈,全部打通并汇入同一份动态研究 Context 中。
不管是发了新论文、内部代码提交了新版本,还是最新的实验数据推翻了旧假设,这份 Context 都会实时刷新。
这样,Agent 提出的每一个研究建议,才能精确锚定到具体的代码分支与实验版本:
最有趣的地方,在于「人类经验」与「Agent 实验」的深度耦合:
人类研究员可以随时注入约束、调优方向;一旦某次实验验证了有效组件,它会立刻沉淀为后续实验的新起点;某个分支总结出的方法论,也能被接下来的 Agent 无缝复用。
研究成果,真正变成了下一轮研究的生产资料。
AI-native Infra:让 7 × 24 小时的研发飞轮滚起来
当然,Agent 只会写代码还不够,实验必须高效跑起来。
Simate 将训练、推理与评测全流程接入自研 Infra,通过极致的任务编排与资源调度,同时并行推进数十条相互独立的研究路线。
为了防止算力浪费,Simate 采用了高频筛选机制:所有路线先经由「世界模型 + 仿真环境」进行第一轮快速过滤,淘汰掉绝大多数无效方向;
唯有真正具备潜力的方案,才会进入真机实测。
真机上暴露出新问题,再重新流回研究 Context,闭环由此形成:
最终呈现的效果是:人类只需抛出一个探索方向,底层系统就能自动并发驱动数十轮实验狂飙突进。
这也是 Simate 能在三个月内登顶的关键法宝。
不过最令人出乎意料的是,这样一套极其核心的内部生产力工具,他们居然选择直接开源开放!
网页长这样,感兴趣的朋友可以文末自取。
目前,来自清华、MIT、港科大等顶级高校的研究者已率先进驻内测。
弱 RSI,只是起点
创始人张颖,前某一线智驾公司核心技术负责人。
工程实战经验非常丰富,参与过有图、无图、端到端三代智驾方案攻坚,也做过很多年量产。
据介绍,其推动打造的智驾系统是国内最接近 Tesla FSD 的智驾系统。
此外,团队里还有两位灵魂人物。
1、占方能。
香港科技大学助理教授、World Mind Lab 负责人,长期研究世界模型和物理 AI。
2、季马泽宇。
00 后青年科学家,研究方向横跨 3D 感知、灵巧操作和人形机器人全身控制。
加入 Simate 前,他还是硅谷 Assured Robot Intelligence 的创始成员。
ARI 后来被 Meta 收购。
资本市场,也已经用真金白银投票。
成立仅三个月,Simate连续完成多轮每轮数亿元人民币融资。
而这一切,都是在押注同一件事——
Physical RSI。
Simate 从创立第一天便瞄准了这个方向,并且定义了三种不同类型的 RSI。
1、弱 SI:边界明确,快速闭环
人机共驾模式,研究员设定目标与约束,正常执行过程中不再需要研究员逐步参与,异常可以升级处理。
这次登顶 RoboDojo,就是第一阶段的工程验证。
2、中 SI:方向明确,但答案未知
怎么改善模型记忆?某类任务的数据比例到底怎么配?
方向已经有了,但具体哪个方案有效,还得靠多轮实验去找。
这时候,Agent 负责整理上下文、实现方案、跑实验、比较结果;研究员则负责筛假设、解释冲突证据,以及做关键取舍。
这其实也是现阶段最有现实价值的一类。
3、强 SI:研究本身都需要被发现
最难,也是最触及智能本质的一类——
怎么提升模型在全新任务里的泛化能力?
这类问题已经没有清晰的解题路径了。系统得自己理解目标、发现真正值得研究的问题,还要在很长时间里保持方向感、不断修正路线。
这就开始涉及所谓的「研究品味」。
现阶段,这类工作依然需要资深研究者主导。Agent 更多是在文献、证据、实验和路线探索上提供支持。
值得注意的是,Simate 所说的弱、中、强 SI 并无等级之分,三者可以同时存在于同一套研发系统中。
更重要的还是「进化」这个第一性原理本身吧。
One More Thing
系统的每一次自我改进,都在让下一次改进更容易发生。
当数据、模型与真实部署连成一个会自己转起来的闭环,机器人的上限,才不再只取决于人的上限。
这就是 Physical RSI,目前冲线物理 AGI 最热门的候选路线。
当然,Simate 现在展示的,还只是早期形态。
Human-in-the-loop 依然存在,而且研究员仍然掌握着整个循环里最关键的方向判断。
但这恰恰也说明,自动化研究未必要等到「完全无人类参与」那一天,才开始产生价值。
在更强的自主研究能力真正出现之前,先把实验设计、训练、评测、反馈这些高成本、可流程化的环节逐步交给 Agent,本身就已经能显著提升研究吞吐。
RoboDojo 的成绩单,也算是验证了「人机共驾」这条路径,在物理 AI 领域的可行性吧——
RSI,真的开始了。
对了,还有件事。
AutoResearch 科研平台已启动内测,目前正火热招募中!
千卡算力,等你一起来玩儿 ~
官网:https://mate-robot.cn/
AutoResearch 科研平台:https://mate-robot.cn/research/sinfra/
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见


登录后才可以发布评论哦
打开小程序可以发布评论哦