靠鸿蒙式打法,跑出20倍增速。
作者丨苏迪
编辑丨张丽娟
2024 年刘东加入智源研究院时,具身智能还没真正热起来。
但到了 2025 年 8 月成立星源智时,赛道已经烫得发红,声音最大的是造人形机器人的那批,十亿级大额融资也大多集中在它们身上。
作为北京智源人工智能研究院重点孵化的具身智能企业,星源智没跟这股风。不造本体,不做纯算法供应商,而是像华为鸿蒙智行那样,不局限于制造某一种机器人本体,而是用通用具身大脑、世界模型和端侧算力平台,为不同形态的机器人提供统一的智能能力底座。
这在当时是条 " 反叙事 " 的路,本体厂商凭什么把 " 大脑 " 交给第三方?当年汽车行业的 " 灵魂论 " 争论了整整两年,虽然后面传统车企大多还是把 " 灵魂 " 交给了第三方,但机器人行业是否会重演同样的剧本,没人敢断言。
刘东曾负责京东无人配送业务,经历过智能驾驶从狂热到分化的完整周期。他不认为具身智能能一步到位。" 现在的具身智能相当于 2016 年的自动驾驶,融资很猛,Demo 能够展示能力,但离真正产生生产力还有距离。"
所以他不跟同行比谁的人形更像人,他关心的是另一组指标。效果乘以效率再除以成本,系数大于 1 才优先推进,小于 1 只能叫 POC,难以形成商业闭环。
这可能是具身智能行业从概念到生意,最务实的样本之一。后来的市场走向也给出了印证。2026 年上半年,几乎一半的钱涌入了 " 大脑派 " 公司,大脑从赛道的边缘走到了中央。星源智也在订单侧跑出阶段性验证:成立数月后收入过千万元,今年订单规模预计超万台,营收涨了 20 倍。
一个尚未闭合的商业闭环
刘东创业的起点,开始于一个被搁置的项目。
2023 年,京东内部差点启动一个带机械臂的配送机器人项目。
立项的动因,来自于刘东在京东搭建的那套无人配送网络,到了小区门口就卡住了。
室外无人车把快递拉到小区门口,室内机器人再接力上楼,两套体系各自跑通,但车里的货怎么转到能上楼的机器人手里?没有上楼机器人的小区,无人车到了门口怎么办?
解决方法是在每个小区配置人工接驳。无人车到门口,由人把货取出来,挨家挨户送上去。但京东的快递配送集中在上午和下午两拨,两拨之外人工效率并不充分,而公司照样要付一整天的工资。自动化省下来的钱,很容易被接驳环节抵消。
一个为 " 无人 " 而设计的系统,在最末端被 " 人 " 卡住了脖子。更本质的问题是,这个 " 人 " 的环节不是因为技术精度不够,而是系统设计之初就把 " 移动 " 当作核心问题、" 操作 " 当作外部变量。取货、开门、按电梯,这些交给人的事,被当作边界条件排除在外。但边界条件不会消失,它只会变成成本,卡在效率的最后一环。
项目最终没有实施。而那个未闭环的配送链路,一直搁在那里。
但刘东没有放下这件事。2023 年底,多模态大模型的快速进步让他看到了另一条路。如果能让机器人具备一个 " 大脑 ",理解环境、规划路径、操作物体,从取货到上楼的全链路无人化就有可能实现。这个想法让他很兴奋。
恰好在那个时候,北京智源人工智能研究院也在找人。数字世界已经孵化了智谱,物理世界需要再押注一个方向。刘东和院长王仲远聊完之后,双方一拍即合。当时,智源已经把通用具身大脑列为重点方向,而刘东从京东的末端配送困境出发,得出的判断也一样,不做本体,做通用具身大脑。
当时,他把市面上能看到的具身模型捋了一遍,发现大多只能做抓杯子、推盒子这类简短任务,理解不了复杂空间环境,更谈不上长程任务规划。
虽然,通用具身大脑这条路,当时行业里真正在走的人不多,资本手里的子弹大多投给了本体厂商。但刘东觉得,这个方向具备长期价值。
接下来是搭团队。穆亚东以智源学者身份加入,他的研究背景正好强化多模态大模型这一块;何嘉伟、孙振国两位智源的全职研究员,一个擅灵巧操作,一个有智驾底子;刘瑞祥做过车规级量产,知道怎么把技术落地到产品里,负责工程化。
这支团队组合起来,覆盖了做通用具身大脑所需要的几个维度,学术、工程、商业化,都有人盯着。
智元创投 A 计划作为国内首个聚焦具身智能产业链的创新创业加速计划,一直致力于推动机器人前沿技术在真实场景的落地。
在智元创投 A 计划看来," 星源智创办初期,依托北京智源人工智能研究院在该领域的深厚技术积累,聚焦为具身机器人提供通用大脑的端侧算力平台。我们判断这将是具身机器人走向真实场景落地的核心一环。星源智团队高效、务实且具备强大的工程能力,与我们一起在多个客户场景中真正做到了量产的部署态交付。星源智正在通过自身强大的技术能力、产品能力为整个具身机器人行业提供最终落地的保障。"
把后果预判装进机器人大脑里
但具身智能赛道,对 " 大脑 " 应该长什么样,远没有达成共识。
当时行业的主流是 VLA 模型,以多模态大模型为基座,接收视觉和语言输入,直接输出动作指令。这套范式在 2024 年前后几乎是行业标配。
但 VLA 的边界正在显现。它的能力上限受限于基座模型对物理世界的理解,本质上还是语义驱动的指令执行。你让它抓杯子,它能抓起来,但杯子滑不滑、桌面上的物体要不要避开、抓完之后下一步怎么办,它一概不知。它不理解物理世界的因果关系,也不具备长程任务规划的能力。
行业开始把目光转向世界模型。李飞飞、杨立昆近期都已押注这个方向,英伟达、Google、OpenAI 也把世界模型视为通往下一代智能的关键路线。世界模型要解决的核心问题是:让机器在行动之前,先在脑子里推演一遍物理世界的运行规律和动作后果。
但世界模型怎么做,行业里同样没有共识。
智源研究院院长王仲远把现有路线归纳为四类:以语言为中心的 VLA 路线、以像素为中心的视频生成路线、以 3D 结构为中心的仿真路线、以视觉表征为中心的 JEPA 路线。
在刘东看来,部分世界模型方案更多停留在对未来状态的被动预测层面,预测结果没能充分反馈到动作生成。" 真正的世界模型,要能预测物理世界下一个时空状态的变化,以及对你接下来要做的动作做一个闭环思考。"
今年 6 月,星源智发布了具身交互世界模型 ω -EVA。和其他世界模型最大的区别在于,它引入了一个 " 交互闭环 "。
ω -EVA 最大的特色是引入了一个 " 交互闭环 ",就是让机器人在执行动作之前,会先预判这个动作可能会对物体产生什么后果,如果有利就直接执行,如果存在风险则就实时修正。
比如叉车面对一摞货物,它会预判叉臂插入的角度和深度是否会导致货物倾倒,如果预判到风险,会自动调整策略。
发布后不到 20 天,其余团队也开始了类似方向的工作。" 说明大家研发时都想到了这个方向,但我们更早提出来,而且已经能在端侧跑通。" 刘东说。
最近的 WRC 上,星源智又发布了一款最新世界模型 JEPA-WAM。针对现有机器人视觉语言动作模型泛化性不足、视频生成式世界动作模型部署成本高,以及 latent 世界模型中世界建模与动作生成监督割裂等问题,提出全新的 latent 世界建模方案。
一个预判行为后果,一个理解世界变化,两套路径共同服务机器人物理交互决策。
一开始,星源智就在架构上做了一个关键的选择,全模型端侧部署,自研算力平台,让模型直接跑在机器人本地的芯片上,彻底摆脱对云端的依赖。
这个选择解决了行业里一个矛盾:云端模型再强,网络延迟和算力排队是物理限制,机器人不可能举着货等服务器响应。端侧部署意味着推理速度可以达到 30 到 50 赫兹,几十毫秒完成一次完整的推演和修正。
另一个被低估的优势是数据闭环。端侧模型每天接触的真实操作数据,哪次叉货歪了、哪个角度容易滑,可以直接在本地沉淀、筛选、回流,用来迭代基座模型。这比从云端下载日志再训练快了一个数量级。
星源智计划建设一个万平具身数据科学中心,本质上就是在为这套端侧闭环提供 " 燃料 "。他们计划沉淀出数据采集和处理的标准范式,再推广到京东、富士康等合作伙伴的工人环境中,按统一标准采集数据回流训练。
鸿蒙式打法,跑出20倍增速
方向定了,模型跑了,但星源智没有急着铺场景。
创业公司普遍的心态是尽快拿单、尽快落地、尽快证明自己。但刘东在京东有过经验教训:那个无人配送项目,技术完成了 99%,剩 1% 需要人,整个商业模式就卡住了。
所以星源智筛场景只有一个标准:效果乘以效率再除以成本,系数大于 1 才优先推进,小于 1 只能叫 POC,难以形成商业闭环。
这个公式卡掉了大多数需求。工厂生产线上的复杂装配,成功率要到 99.99%,停一次线损失巨大,不碰。涉及旋拧、扣合、罩壳这类精细操作的,超出技术主线。
星源智内部划了两条线,移动加抓放是一条,移动加轻操作是另一条。现阶段,场景选择会尽量聚焦在这两类能力边界内。
但选好的场景怎么进,星源智走了 " 华为不造车 " 的模式。
一条是 Tier 1 供应商,向本体厂商提供软硬件一体的具身大脑解决方案,软件是通用大脑,硬件是自研的具身大脑端侧算力平台。
另一条是整体方案交付方,直接面向终端客户提供完整的机器人方案。外购本体,装上自己的大脑,整套交付。给到客户的不是一个大脑,是能直接投入作业的开箱即用方案。
为什么一定坚持自己做场景?纯粹的算法供应商,往往难以持续获得真实作业数据,模型永远停在实验室的 60 分。只有扎进场景,数据飞轮才能转起来。
" 我们要基于某几个场景把它真正打透,做成数据飞轮,数据回流回来训练基座模型,让它在这个场景里变成 99 分,反过来又能支撑整体解决方案。"
目前,物流是落地最成熟的场景之一。中力是全球领先的电动叉车生产商,产品销往 80 多个国家。海外叉车司机人工成本较高,夏天集装箱里六七十度,年轻人越来越不愿意干。一台搭载星源智大脑的自动叉车,单车装卸从 90 秒缩短到接近 1 分钟,自主识别卡车、规划卸货顺序、分辨托盘类型。投入产出比大于 1,海外客户落地意愿也更明确。
药店是另一个具备商业化潜力的场景。全国连锁药店近 100 万家,夜间值守是刚需。标准拣选机器人可通过融资租赁等方式降低单店部署门槛。药店的 SKU 规整、重量适中,抓取难度低。这套方案还能复用到前置仓和电商无人仓。
电力巡检也在快速推进。这个行业有个老痛点,室内机器人和室外机器人用两套导航方案,互不兼容,机器人走不出房间。星源智的大脑打通了室内室外,能跨越防水板、防鼠板、石子路。电力行业操作任务少,以巡检为主,从 POC 到大规模落地转化比制造场景快得多。
星源智还与北京亦庄签下三年不低于 5 亿元的订单,开放了九大场景,公共服务、小区巡检、医疗、商业拣选、教育。星源智交付的是开箱即用的整体方案,不只有算法,还包括调度平台、充电管理、异常报警、后台运维。机器狗在铁路沿线巡检,评估多少公里配几台、机械臂怎么配置、充电桩设在哪、后台怎么报警,整套系统一起交付。
今年星源智的订单规模预计达到万台级,营收破数亿,比去年翻了 20 倍。
当然,刘东并不觉得行业已经 ready 了。他把具身智能比作自动驾驶的 2016 年,融资猛,Demo 能够展示能力,但离真正产生生产力还有距离。
只是,这并不妨碍像当年做自动驾驶一样,从 L4 的能力里简化出一些 L2 的能力,先落地到能用的场景。
这未必是最性感的打法,但至少每一笔订单都算得过来。至于,具身智能什么时候能真正走出实验室?答案可能不是某个颠覆性的技术突破,而是无数个 " 效果 × 效率 ÷ 成本大于 1" 的微观决策,堆叠出的渐进式落地。
《元桌派 A 一下》
有些创新,注定无法被浓缩成一条新闻。
那些真正定义技术的时刻,往往发生在演示视频之外:感知如何逼近真实,控制如何抵达精微,智能如何在物理世界中找到自己的语法。小饭桌联袂智元创投 A 计划,推出深度访谈栏目《元桌派 A 一下》。每期走进一家具身智能创业公司,了解从技术路线的取舍到工程化落地的沟壑,从学术前沿到产业化的最后一公里。
我们只走进那些被真实场景反复试炼的技术边界。
元桌之上,A 一下。


登录后才可以发布评论哦
打开小程序可以发布评论哦