北京潜界科技有限公司(以下简称 "LatentVerse(潜界科技)")成立于 2026 年 5 月,是一家具身基座模型公司,由来自清华大学交叉信息研究院的具身智能研究团队创立。团队成员来自清华大学、北京大学、南洋理工大学,以及字节跳动 Seed、阿里巴巴 Qwen、小米等大模型与具身智能团队,长期围绕具身模型预训练、世界模型、灵巧操作、数据基础设施与端侧部署等方向开展研究。
投资界 8 月 12 日消息,近日,LatentVerse(潜界科技) 宣布完成数亿元种子轮融资,投资方包括高瓴创投、清流资本、英诺天使基金,以及智元机器人、星动纪元等产业投资方。
在机器人逐渐从实验室走向真实世界的过程中,一个核心问题变得越来越清晰:会 " 看 "、会 " 想 "、会 " 做 " 还不够,机器人还需要在持续变化的环境中不断感知反馈,并实时调整自己的动作。这也是 LatentVerse 希望解决的问题。
早期的视觉动作(VA)模型,主要解决如何让机器人根据视觉信息直接完成动作;随后,视觉语言动作模型(VLA)进一步加入语言理解能力,使机器人能够听懂人的指令;世界动作模型(WAM)则尝试让模型预测一个动作发生之后,真实世界可能发生怎样的变化。
LatentVerse 团队长期参与这一技术演进。团队成员此前提出的 DP3 聚焦 3D 具身策略学习;HiRT 探索视觉、语言与机器人动作之间的协同;VPP 进一步研究如何预测动作带来的未来状态。此后,团队又持续探索世界模型与 VLA 的融合,以及灵巧手通用模型等方向。
LatentVerse 创始人兼 CEO 胡钰承为清华大学交叉信息研究院博士,曾在字节跳动 Seed 参与具身智能基座模型研究。其研究长期关注 VLA 与世界动作模型的融合,希望让机器人不仅根据当前环境生成动作,还能够理解:如果这样做,接下来会发生什么。
沿着这一研究路径,LatentVerse 提出了 UTAM(Unified Tactile Action Model)具身全模态世界模型。
简单来说,UTAM 希望让机器人形成一种类似 " 边想、边做、边修正 " 的能力。
LatentVerse 将机器人进入真实世界所需要的能力概括为两个层面:认知智能与接触智能。
认知智能解决的是机器人如何理解任务、适应环境变化,并把已有技能重新组合起来。例如,当桌面布局发生变化时,机器人不能只机械重复训练过的动作,而需要重新判断执行顺序和路径。
接触智能解决的则是动作真正发生之后,机器人能否感受到现实世界的反馈。物体是否滑动、有没有发生形变、抓取力度是否合适,都需要机器人在执行过程中不断感知并调整。
在人类完成复杂操作时," 思考 " 与 " 触觉反馈 " 并不是两个孤立过程。LatentVerse 希望在统一模型中,把这两种能力结合起来。
UTAM:把触觉加入统一模型
UTAM 由多个协同工作的模块组成。其中,视觉语言模块负责理解环境与人的任务意图;世界模型根据学习到的物理规律与技能,预测不同动作可能带来的未来结果;动作模块生成机器人执行计划;而触觉模块则持续感知接触力、滑移和物体形变,对动作进行高频调整。
由此形成一个闭环:
先理解任务、预测结果,再执行动作;动作过程中持续接收真实世界反馈,并及时修正。
相比把触觉仅仅作为动作执行末端的一项传感器信息,LatentVerse 希望将其作为模型的原生模态之一,与视觉、语言、机器人状态和动作共同参与模型训练。
目前,团队已经完成 UTAM 多模态数据基础设施和训练管线建设,打通视频、语言、机器人状态、动作及触觉等数据的采集、清洗、同步、对齐和训练链路,并正在推进各模块联合训练。
团队目前重点验证三类能力:在未见过的物体和环境中的泛化能力,多步骤长程任务的持续执行能力,以及面对滑移、形变和受力异常时的实时修正能力。
本轮融资将主要用于 UTAM 模型研发、多模态具身数据体系、模型训练基础设施,以及机器人在真实场景中的技术验证。
LatentVerse 创始人兼 CEO 胡钰承表示:" 泛化、长程与灵巧不是三个彼此独立的技术指标,而是机器人商业化必须同时满足的能力条件。UTAM 希望让机器人不仅能够理解任务和生成动作,也能够在真实接触过程中感知变化、快速修正并持续完成复杂操作。"
高瓴创投项目负责人表示:" 具身智能从技术验证走向更多真实场景,仍需要持续解决泛化、长程任务执行和灵巧操作等关键问题。潜界科技团队在具身模型、世界模型与灵巧操作等方向有长期积累,UTAM 进一步将触觉作为原生模态纳入统一架构,尝试让机器人形成‘边想、边做、边修正’的闭环能力。高瓴创投长期关注具身智能领域的技术与产业进展,期待团队持续推进具身基座模型的研发与工程验证,在真实场景中不断迭代模型能力。"


登录后才可以发布评论哦
打开小程序可以发布评论哦