硬氪获悉,「眸深智能」(Motion Brain)完成近亿元 Pre-A 轮追加融资,本轮投资方包括中国头部物业服务公司、香港财团、多家上市公司联合打造的产业投资平台瑾悦投资、创合汇资本,以及老股东徐汇资本。
这也是继 2026 年 5 月 3 亿元 Pre-A 轮之后,「眸深智能」两个月内再次获得投资,此外,该公司 Pre-A+ 轮的近 5 亿融资也在交割当中。该公司透露,今年上半年以来,「眸深智能」的估值增长超 10 倍,是业内发展速度最快的具身大脑企业之一。
「眸深智能」成立于 2025 年 1 月,定位为全球最懂动作的自进化具身大脑公司,致力于 " 给 10 亿台机器人装原生通用大脑 "。
该公司由复旦大学深度学习实验室主任陈涛教授、原英特尔中国首席科学家张益民博士,与连续创业者穆泽林共同创办。核心团队拥有海思、英特尔、英伟达三大芯片巨头的背景人士,是国内少数具备算子级适配能力的具身大模型团队。
尽管 2025 年才注册成立,「眸深智能」的技术积累从 2022 年已经开始。在技术路线上,「眸深智能」选择了一条与主流 VLA(视觉 - 语言 - 动作)不同的路径——以动作为核心的 " 世界动作模型 "(World Motion Model)。

(图源 / 企业)
从 2022 年起,「眸深智能」团队已经发布了 MLD(隐空间动作扩散模型)。在当时,行业主流是将动作视为离散的信号,导致生成的动作僵硬且缺乏多样性,而「眸深智能」团队在全球 dede 范围内首次提出将动作映射到隐空间(Latent Space),并引入扩散模型(Diffusion Model)。
MLD 相当于让 AI 学会了 " 无师自通 " 地生成动作:不再需要逐帧教机器人如何走路,而是让模型像画家去噪一样,从一团随机噪声中还原出自然、连贯的人体姿态。
如果说 MLD 解决了 " 怎么生成动作 ",「眸深智能」又进一步着眼于如何 " 指挥动作 "。2023 年 9 月,团队创造性发布了 MotionGPT。类比汉字的基本笔画,团队将人体姿态拆解为约 3000 个 " 动作基元 "。就像大语言模型(LLM)通过预测下一个 token 来生成句子一样,MotionGPT 通过预测下一个 " 动作 token" 来生成复杂行为。
这种将连续动作离散化的处理方式,不仅极大地提升了模型对长序列任务的理解能力,更重要的是,它让机器人具备了 Zero-Shot(零样本)泛化能力——没见过的动作指令,也能通过重组动作词汇来理解并执行。这也是全球首个把动作做成 token 的具身大模型,发表于 NeurIPS 2023。
到了 2026 年,团队已经累计发布了 7 代模型,基于前述积累,「眸深智能」团队又进一步推出了 STI- WM(时空一体世界动作模型)具身大模型。
STI-WM 时空一体世界动作模型是完全面向机器人长时序规划、在线闭环控制、真实物理交互打造的原生具身智能框架,实现空间结构、时间演化、物理一致性、执行鲁棒性四维一体化统一。
据介绍,STI-WM 的核心突破在于,彻底摆脱了传统 VLA(视觉 - 语言 - 动作)模型对海量真机数据的重度依赖,采用了 "80% 互联网视频 +10% 动捕数据 +10% 真机数据 " 的训练配方,并 MotionGPT 建立的动作词典,从海量无标注的视频中学习物理规律,再用少量动捕数据校准生物力学特征,最后仅用 10% 的真机数据完成闭环对齐。
也就是说,这种全新的数据训练范式,将真机数据需求降低了 90%,又将动作准确度提升至 99%。
同时,「眸深智能」团队又在今年 3 月提出的 T ² MB(Task*Task Motion Brain)也让机器人具备了离线自进化能力,当模型部署到端侧后,无需联网回传数据,仅凭本地交互就能持续优化性能,任务执行准确度最高提升 25%,解决了机器人落地后发现 bug 必须返厂升级的痛点。
值得注意的是,英伟达 DAIR 实验室在最新 ARDY 模型中,便援引了「眸深智能」的 MLD 与 MotionGPT 两项原创技术——这是近两年英伟达第三代动作模型对该公司技术路线的第四次引用。
不过,真正决定这套大脑能否规模化的,除了技术路线之外,还有端侧算力成本,这也是「眸深智能」的一大竞争壁垒。据介绍,「眸深智能」从第一代模型起就同步推进两个方向——模型压缩与国产芯片适配。
一方面,通过模型蒸馏、冗余参数压缩等工程化方案,「眸深智能」将千亿参数级模型压缩至百亿级别,在具体场景中参数量降低约 75%,端侧推理延迟从约 200 毫秒降至 10 毫秒左右;另一方面,同步适配海思(昇腾 310/910)、地平线、燧原(燧原 S60)等国产芯片平台,实现低功耗、高实时、超低成本的端侧推理。
这套软硬协同的打法,带来的直接结果是,模型端侧推理成本从 20 万元降至 1 万元,大脑续航时间提升 10 倍,而精度和性能却不掉点。这一压缩工作也帮助该团队获得了 IJCAI 2025 全球最佳论文奖,也是近五年唯一获此奖项的中国大陆团队。
依托这一能力,「眸深智能」可在两周内完成一套具身大模型从一个本体到另一个本体的适配,包括复旦自研的 " 光华 1 号 "、宇树 G1、上海人形机器人创新中心的 " 青龙 " 和 " 灵龙 " 等本体。

「眸深智能」创始人、CEO 穆泽林表示,国内具身智能行业普遍采用在国外芯片上训练、再移植适配国产芯片的方案,性能损耗与兼容性问题突出,而「眸深智能」未来在模型训练、推理全流程中将基于国产算力芯片原生开发,实现技术栈完全自主可控。
在商业化层面,「眸深智能」也是目前国内少数有营收的具身智能大脑公司。穆泽林告诉硬氪,其 2025 年审计回款收入千万元,2026 年上半年 3000 万元,预计今年营收规模 5000 万元以上。
目前,公司客户覆盖工业检测、物业、环卫等场景。2026 年第一季度,「眸深智能」已与某港股上市物业公司、A 股上市环卫龙头的机器人产品交付;正在推进与头部连锁零售集团、头部白色家电工厂的人形机器人落地场景研发。
以下是硬氪与穆泽林的交流实录(略经摘编)
硬氪:动作怎么变成 Token?这是行业难点吗?
穆泽林:确实是行业卡点。我们可以把动作理解为「数字化的姿态」:就像小人书的一页是一个静态姿势,连续翻页就成了动画。我们早期通过几十人团队手工标注了几万个姿态,定义了 3000 多个基础动作 Token,类似汉字的 3000 个常用字,组合后能覆盖人类所有行为。
更核心的是让模型学习动作间的关联:就像大语言模型通过学习海量文本掌握字词排列规律,我们让模型观看百万小时的互联网视频(影视剧、监控、Vlog 等),学习「喝水时手会抬到嘴边」「抱胸后大概率会展开手臂」这类动作因果逻辑。同时结合 10% 的动捕数据和 10% 的真机数据做校准,最终实现动作 Token 的端到端生成——支持从文本、图片、3D 点云到动作的转化,也就是原生多模态能力。
硬氪:动作 Token 的组合会不会导致算力需求爆炸?如何优化?
穆泽林:我们不需要穷举所有动作,而是学习动作的排列规律。优化主要有两个方向:一是数据层面,80% 用互联网视频(已做物理先验过滤,确保符合现实规律),降低对高成本动捕 / 真机数据的依赖;二是模型压缩层面,我们在端侧部署上有深厚积累,曾获得全球顶会最佳论文——通过 Token 剪枝、量化、动态优化等技术,能把端侧计算量降低 62 倍,推理延时从 200 毫秒压缩到 10 毫秒,模型参数量减少 80% 的同时精度不降反升(部分任务提升 3%-6%)。
硬氪:现在具身智能领域技术路线分化,有的侧重记忆,你们是侧重动作,您怎么看这种分化?
穆泽林:回归第一性原理:大语言模型的成功本质是 Transformer 架构实现了 Token 的排列生成。具身智能也应该遵循这个逻辑,核心是解决「执行层」问题——让机器人能稳定完成任务。
像记忆优化这类更底层的问题,我认为短期很难通过初创公司突破,需要 DeepSeek、OpenAI 这类巨头在芯片存储、存算一体架构上的长期探索。我们更务实:通过动作 Token 的泛化能力(Zero-Shot)解决新任务执行问题,比如机器人学过拿矿泉水瓶,没学过拿手机,也能通过动作序列迁移完成 80% 的准确度,剩余 20% 通过少量后训练或强化学习校准即可。
硬氪:为什么选择适配国产算力,而不是用更成熟的英伟达卡?
穆泽林:长期来看,国产 GPU 是必然选择—— N 卡会越来越贵、供应受限。我们的核心优势是「懂芯片」:团队有海思、英特尔、英伟达三大芯片巨头的背景,是国内唯一具备算子级适配能力的具身大模型团队。目前已经打通了燧原 S60、昇腾 310/910 等国产芯片的部署,下半年目标是攻克千卡级国产集群训练,实现纯国产化的大模型训练方案。
这不仅能解决供应链安全问题,更能提升资本效率:比如别人训练一次需要 1 万张卡、花费 5 亿,我们通过算子优化,1000 张卡、5000 万就能完成,类似 DeepSeek 的低成本训练逻辑。
硬氪:具身智能芯片的机会在哪里?你们会自己做吗?
穆泽林:端侧具身芯片确实是大机会,目前国内已有 20 多家公司在布局(比如辉曦、光与星辰等),但大多瞄准 200TOPS 算力(类似英伟达 Orin)。我们认为未来模型需要处理触觉、传感器、3D 点云等多模态信号,算力需求会快速提升到 1000-2000TOPS ——如果芯片公司现在量产 200TOPS 的产品,等流片出来时可能已经跟不上模型迭代速度。
我们不会自己做芯片,除非未来公司规模达到数千亿级。现阶段更聚焦「软硬协同」:通过算子优化让模型适配现有芯片,和芯片公司合作而非重复造轮子。
硬氪:未来产业分工会是怎样的?大脑和本体是否会各自形成通用供应商?
穆泽林:本体可能会像汽车行业一样,有不同的特色(比如负载更大、更轻量化),但大脑领域大概率会形成「一超多强」格局——通用大脑的研发门槛极高,国内真正具备研发能力的团队屈指可数。我们目标是成为那个「超级通用大脑」,同时允许其他团队聚焦细分场景(比如快递分拣、电力巡检)。
5-10 年内,不会出现每家机器人公司都自研大脑的情况——大脑的研发投入(人才、算力)远超本体,创业公司更有机会突破,就像 OpenAI 不是大厂孵化的。大厂的优势在纯软件场景,而具身智能需要软硬件深度结合,创业公司的灵活性和专注度更有优势。
首页图源|企业供图


登录后才可以发布评论哦
打开小程序可以发布评论哦