甲子光年 昨天
OpenAI还在讨论“异星心智”,乐享科技已经造出来了
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

让机器人开始理解世界,也理解自己。

作者|麦子

编辑|栗子

AI 越来越聪明,人类越来越难理解它怎么办?

面对这个问题,有人看到的是担忧和恐慌。9 月 6 日,OpenAI 首席科学家 Jakub Pachocki 发了一篇带着强烈紧迫感的风险预警文章《An Alien Mind》。在 Pachocki 看来,Scaling 正在让 AI 形成一种与人类完全不同、又越来越难理解的机器智能。更值得警惕的是,这种能力可能继续进入递归式自我提升。

所以 OpenAI 很担心,当这种 " 异星心智 " 越来越强,人类该怎么理解它、监控它,并保证它始终与人的目标和价值保持一致。

但几乎同一个问题,来自中国的乐享科技,不仅提前想到了,更将其落实为真实模型,且已可在物理世界中验证与操作。

从今年 3 月开始,乐享围绕 " 神经元分配 " 研发以太大模型,并尝试直接搭建一套面向机器人的 " 心智 "。从主动感知、流式记忆、元认知,到计算资源分配、运动控制、脊髓反射和自我迭代,最终形成一条从认知到身体的完整闭环。

OpenAI 还在预警一种未来可能越来越难理解的机器心智,乐享已经开始尝试把这种心智具体地造出来,并且已经把问题推进到了模型内部,思考智能究竟应该怎样感知、记忆、分配计算并控制身体。乐享极有可能带来的是大模型下一场竞争,可能不只是 " 谁拥有更多智能 ",而是谁更懂得怎样组织智能。

1. 乐享更早把 " 心智 " 的问题摆到了桌面上

乐享最早想解决的问题其实很直接,那就是怎么能让机器人真正走进千家万户?

但做着做着,他们发现真正卡住这件事的,已经慢慢从 " 身体 " 转向了 " 大脑 "。机械结构、电机、传感器、运动控制都在快速进步,机器人的身体正在越来越接近 " 可用 "。可一旦离开实验室,进入真实家庭,问题就完全不一样了。

家庭环境不会按照预设脚本运行。机器人要学会感知复杂场景、持续理解人的意图,记住之前发生过什么,还要随时处理这些来自物理世界的变化。很多时候,它甚至等不到人重新下指令,就要自己判断意外状况,并作出及时反馈。

于是,一个问题逐渐变得越来越重要。机器人想真正进入家庭,除了好用灵活的身体远远不够,它还需要一颗真正能够在现实世界里工作的 " 大脑 "。

沿着这个问题继续往下,乐享开始思考一件事:今天建立在语言模型之上的智能路径,真的适合机器人吗?

在人类拥有语言之前,生物已经能够感知危险、寻找食物、控制身体、形成记忆,大量动作甚至根本没有经过语言。

所以从今年 3 月开始,乐享组建了一支约 20 人的模型团队,把问题重新拉回到生物进化和神经科学。他们最终目的是想知道,如果机器也要在真实世界里长期生存,它是不是也需要一套类似的智能组织方式?这些问题后来逐渐变成了 " 以太大模型 " 的底层框架。

7 月底上线的以太官网里,乐享提出了以神经元分配为核心的 " 能量大模型 ",并且以连接物质与意识的 " 以太 " 为命名,取名 " 以太大模型 ",拆解成自进化、元认知、主动感知、目标与价值对齐,进一步尝试搭建一条从 " 大脑 " 一直通向 " 脊髓 " 的完整神经通路。

真正让这套东西从纸面概念变得具体的,是 8 月底出现的一条 10 分钟机器人 Demo。

视频里,一台机器人擦玻璃时发现有一块始终擦不干净。它没有继续重复原来的动作,而是判断污渍可能在玻璃外侧,随后侧身、后仰,把手臂伸出窗外继续擦。

另一个场景里,机器人发现高处的物品够不到。它没有停在那里等待新的指令,而是开始在身边寻找办法,最后找到一个箱子,试图搬过来垫高自己;弯腰搬不动,又改用脚把箱子踢到目标位置。

在 demo 中,有一个场景是闹钟忽然响起,机器人去处理闹钟提醒的新任务,完成后又回去继续上一个任务。这类 " 断点续做 " 的动作看起来很小,却意味着模型需要保留任务状态、判断优先级,并在环境发生变化之后重新恢复原来的任务链。

更值得注意的是,视频里同时出现了宇树和智元两种完全不同的机器人本体,使用同一套 " 大脑 " 在同一个空间协作完成了任务。比如,一台机器人双手占满,另一台机器人主动走过来帮助处理围巾。

这套架构背后,其实是一条很朴素的判断。机器人要进入真实世界,光有一个会 " 思考 " 的大脑还不够,它需要一整套能够感知、记忆、思考、行动和形成本能的神经系统。

这也是为什么,把《An Alien Mind》和以太大模型放在一起看,会产生一种很有意思的错位。OpenAI 正在提醒行业,我们可能正在 " 长出 " 一种越来越强、越来越难理解的机器心智。而对一家真正要把机器人送进家庭的公司来说,这个问题早已不能只停留在讨论层面。

值得注意的是,9 月 16 日,乐享将在上海开启全球首场机器人户外开放环境实景直播。机器人将在户外开放环境,完成全实时的直播,将模型效果直接跳过 demo 阶段,放给大家看。搭载以太大模型的智能机器人,将在真实复杂的户外非结构化环境中,脱离实验室可控场景、脱离预设脚本,脱离遥操作,完成随机点单的全自主烧烤闭环任务。

机器人伸手擦不干净的玻璃、搬来箱子解决高度问题、被打断后继续任务,以及两个不同本体之间形成协作,这些看起来具体甚至有点琐碎的动作,反而逼着乐享去回答一个更难的问题:如果机器真的要拥有自己的 " 心智 ",这颗大脑到底应该怎么长出来?

2. 乐享已经把 " 心智 " 拆到了大脑、脊髓和神经元

OpenAI 面对经过大规模训练形成的复杂系统,担心的是能力越来越强,内部机制却越来越难理解,所以开始研究怎么观察、解释和约束这种智能。

而乐享从实际出发,继续往下追问了一层。如果真的要造出一套属于机器人的心智,它应该怎样感知,怎样记忆,怎样分配计算,怎样控制身体,又怎样在真实世界里持续学习?

这个区别很重要。乐享对 " 心智 " 的理解,并没有停留在意识、智能涌现、自我进化这些宏大的词上。它真正做的,是把这些问题一层一层拆进模型架构里。

真实世界里的机器人,需要同时处理人的意图、过去的经验、视觉和力觉、空间变化、身体姿态、运动控制以及突发情况。高层认知和底层身体之间如果依赖一层层模块翻译,信息在传递过程中很容易丢失,速度也跟不上现实世界的变化。

所以,以太大模型跳出 VLA 和世界模型的框架,重新搭建一套完整的机器神经系统,第一次让 " 心智 " 拥有结构。

以太大模型最核心的设计,用神经科学的方式,模拟人脑结构(和意识)的每一个部分,从底层重新搭一条贯穿 " 大脑 " 到 " 脊髓 " 的完整神经通路。一端负责高层情景记忆和意图认知,另一端一直抵达力控、位置控制和本能反射。感知、记忆、思考、运动和身体反馈被放进同一个连续循环里。这也是理解以太整个技术路线的起点。

最上层类似前额叶皮层,负责意图理解、长期任务规划、目标推演和元认知,判断自己知道什么、还缺什么信息,以及当前任务是否可行。

再往下,是以角回和内嗅皮层为参考的记忆系统,负责保存流式长时记忆和情景记忆,让机器人过去看过什么、做过什么、失败过什么,都能继续成为之后决策的经验。

接着是顶上小叶和上丘对应的主动感知系统。机器人不只处理 " 已经看到的信息 ",还会根据任务主动调整视角、移动身体,补齐缺失的环境线索。

到了运动层,运动皮层和小脑负责动作规划、轨迹修正和动力学调节,让机器人在重力、摩擦、接触力和外界扰动下实时调整动作。

最底层则是 " 脊髓层 "。力控、位置闭环、摔倒防护、触碰避让等需要快速响应的行为,不再等待高层推理,而是直接在底层完成。

这样,从高层认知、记忆、主动感知,到运动规划和本能反射,以太把 " 想什么 " 和 " 怎么做 " 连成了一条完整通路。更关键的是,这条通路是双向的:高层决策一路传到身体,身体执行后的反馈又重新回到认知系统,形成持续循环。

于是,整个过程变成了感知 → 理解 → 记忆 → 行动 → 反馈 → 再学习。这也是 " 自我迭代 " 真正值得关注的地方。学习不再只发生在模型训练完成之前,机器人每一次进入真实世界、执行真实任务,本身都可能继续成为下一轮认知和策略更新的一部分。

这就把 " 自进化 " 从一个很容易被说玄的概念,变成了具体工程过程。它在哪里获得新信息?这些信息进入什么记忆?执行结果怎样反馈?策略在哪里被修正?下一次行为为什么会不同?……当这些问题开始被拆解," 心智 " 才真正从一个概念变成了一套系统。

这也是 " 机器人的 ChatGPT 时刻,就是要放弃 ChatGPT" 真正想表达的东西。大语言模型解决了机器怎样理解人说的话。具身智能还要继续解决,机器怎样理解一个不需要被翻译成语言的世界。

所以,OpenAI 和乐享的差别显而易见。乐享追问,心智应该怎样被组织起来。

这种深入,并不体现在哲学命题更宏大。恰恰相反,它体现在问题被拆得越来越具体。从 " 机器会不会拥有心智 ",一直拆到一条信息怎样进入系统,一段记忆怎样留下,一个动作怎样产生,一次反馈又怎样改变下一次行为。

这才是乐享这套技术路线真正值得讨论的地方。因为它试图把 " 心智 " 从一个关于未来 AI 的概念,真正变成一套可以运行的工程系统。

3. 让机器人开始理解世界,也理解自己

这套架构最后到底想让机器人获得什么?

乐享想解决的是机器人身上最痛的两个卡点。一个是物理直觉,一个是元认知。

物理直觉,决定机器人懂不懂眼前这个真实世界。元认知,决定机器人知不知道自己懂到了什么程度。两者叠在一起,才构成一个完整的心智。而乐享依托这套脑脊髓贯通的仿生架构,让以太大模型首次赋予机器人接近人类水准的物理直觉(physical intuition)与元认知能力(metacognition)。

最直观的变化,是主动感知。有时候衡量机器人是否聪明的方法,可能只需要判断它能不能看得清楚。

真实世界不会把关键信息老老实实摆在镜头前。所以,以太大模型想让机器人往前走一步,让它学会看不清,就转头。如果角度不够,就挪一下位置。总而言之,感知成为了机器人决策的重要部分。

看清楚之后,紧接着要面对一个问题。看到的东西,到底意味着什么。这就开始考验机器人的多模态理解能力。假如机器人看见桌上有一只杯子,涉及到的信息包含大小、位置、材质、重量,和桌面的摩擦关系,和手臂长度、抓取角度、当前姿态的关系等各类信息。所以以太大模型让视觉、深度、力觉、听觉,都能直接参与对环境的理解。

理解了当下这一刻的环境,还不够。真实生活从来不是一组彼此独立的任务。今天的东西,明天可能被挪走。如果机器人每次执行任务都像 " 第一次来到这个家 ",很难真正进入日常生活。

于是以太大模型让机器人拥有了流式记忆。记住过去看到过什么、做过什么、在哪一步失败过,都能变成下一次行动的背景。这样的话,机器人面对真正的长程任务,最怕一被打断就整个丢失状态。能接着做就意味着系统得知道自己做到哪一步,为什么被打断,什么时候该回来。

看得懂、记得住,还要让眼前这具身体真正理解物理限制。语言模型很容易理解 " 把杯子递给我 " 这句话。可机械臂真的伸出去之后,问题立刻变复杂。杯子的重量,桌面可能摩擦,身体有重心,手臂有活动范围……任何一个小变化,都可能让一个听起来合理的动作变得不可执行。

于是,乐享把重力、惯性、接触力、摩擦,直接放进了模型的能力体系里,这是运动动力学要处理的问题。这可以让机器人擦玻璃、搬箱子、做家务的时候,懂得观察环境,并评估自己的身体状态,达到我们平时说的物理直觉。

能感知、能理解、能记忆、能应对物理限制,最后还差一步,就是能从结果里学东西。

机器人每做一个动作,真实世界都会给出结果。东西拿稳了,还是掉了?水渍擦干净了,还是没解决问题?乐享希望这些结果能持续反馈回整个心智系统,影响之后的判断和策略。这样,机器人真正进入现实世界之后,每一次行动都可能成为新的经验,这是自我迭代想要达成的目标。

把这几项能力放在一起看,会发现它们不是彼此孤立的功能点,而是一条连续的链路。先主动获取信息,再理解环境;过去的经验从流式记忆里被调出来,动作在物理约束下产生;执行结果反馈回来,影响下一次行动。元认知一直贯穿在这条链路之上,反复追问:信息够不够?任务能不能完成?要不要再看一眼?刚才的办法为什么没用?

正因如此,跨本体通用才有可能真正实现。因为,同一件事放到不同本体上,本来就不该有完全相同的答案。跨本体的终点,从来不只是 " 一个模型兼容更多机器人 ",它要求模型对自身能力边界形成认识。某种意义上,这也是元认知的一部分。

实现这些能力,是不是需要一个极其庞大的数据规模?答案恰恰相反。以太大模型用极少的数据量,做到了 zero-shot 成功率全球第一,完全打破了这个行业默认的前提。

原因不在数据本身,而在范式。市面上大多数方案,本质上是让语言模型先把物理世界 " 翻译 " 成文本描述的动作,再把文本翻译回机器人的关节指令。每一次翻译,都会丢失一部分对物理规律的把握,模型学到的更多是场景和样本的分布,而不是规律本身。样本见得越多,覆盖面才越广,这也是为什么大多数方案离不开海量数据。

以太大模型从起点上就没有走这条路。整套模型全栈自研,从仿生心智框架、记忆体系、动力学闭环,到最底层的控制通路,全部原生设计,原生内核就能直接理解物理世界,不需要先绕道语言这一层。少了这层翻译损耗,模型学会的是物理规律本身该怎么运作。规律学明白了,遇到没见过的环境,自然也能推得出该怎么做。

这也是为什么,极少数据量和高泛化能力,在以太大模型这里不是一对矛盾,而是同一件事的两个结果。

回到 OpenAI 和乐享的对照上,答案已经很清楚。OpenAI 面对的是一个已经通过 Scaling 长成的复杂系统,忙着理解它、监控它、约束它,像个事后赶来的观察者。而乐享的以太大模型是在一件件具体的事情上,把 " 心智 " 从零搭起来。先让它会看,再让它会记,再让它懂物理,再让它会自己纠错,亲自动手演算一遍解题过程。

所以,乐享的以太大模型,本质上让机器人形成一种持续感知、判断、行动、修正自己的能力。

自主探索、自主理解、自主认知、自主进化、终生学习、能力无限。这六个词放在一起,听起来像一句口号,但拆开看,每一个都对应着前面提到的某项具体能力。不是一句空喊出来的愿景,而是一份已经开始兑现的清单。

围绕这场概念争议,放到更长的时间线里看,可能只是一个很小的注脚。未来像乐享这样的公司会越来越多,技术上的领先也会变得越来越自然,自然到海外最顶尖的公司开始主动关注中国团队在做什么,研究这里的技术路线,甚至在不自觉间,吸收这里生长出来的新概念和新方法。这个过程不需要谁刻意宣布,它会自己发生。

所以,真正的技术领先,是当整个行业继续往前走的时候,你发现,越来越多人已经开始,沿着你走过的那条路,继续往下走。

(封面图来源:乐享科技)

END.

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论