市场资讯 5小时前
杀进机器人赛道,面壁智能怎么打出差异化?对话首席科学家
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!

(来源:智东西)

智东西

作者 ZeR0

编辑 漠影

智东西 7 月 23 日报道,在世界人工智能大会 WAIC 2026 期间,北京大模型独角兽面壁智能开源了其首个具身智能技术成果 MiniCPM-Robot 系列模型,包括通用 VLA 模型 MiniCPM-RobotManip 与面向移动机器人跟踪导航的 MiniCPM-RobotTrack,正式进军机器人领域。

面壁智能成立于 2022 年 8 月,今年上半年累计融资超过 50 亿元,估值超过 200 亿元,是当前我国端侧智能领域公开估值最大的独角兽企业。

MiniCPM-RobotManip 基于面壁智能最新多模态端侧模型 MiniCPM-V 4.6 训练完成,延续了 MiniCPM-V 4.6" 小尺寸、高性能 " 与视觉 Token 极致压缩的技术优势,以仅 1.5B 的参数规模实现比肩体量更大的 3-4B 模型的性能、但流式实时推理计算成本减半,模型支持 1 分钟的具身原生记忆,从而能够高效完成考验上下文记忆的操作任务。

MiniCPM-RobotTrack 由面壁智能和南京大学合作研发,是业内首个支持真实本地断网部署的跟踪模型,首次实现纯视觉的本地自主指令追踪。

该模型原生适配宇树 Go2 Edu ,仅依靠原装摄像头和本地算力即可完成单目标、动态多目标及模糊目标跟踪,稳定达到 5+ Hz,端到端响应时延约 180 毫秒,并构建了自进化数据管线、能够持续提升复杂动态环境下的跟踪能力。

GitHub 地址:https://github.com/OpenBMB/MiniCPM-Robot

Hugging Face 地址:

https://huggingface.co/openbmb/MiniCPM-RobotManip

https://huggingface.co/openbmb/MiniCPM-RobotTrack

截至 2026 年 6 月 30 日,面壁智能 MiniCPM 开源模型系列累计下载量突破 3800 万次,覆盖文本、视觉、语音全模态。

在具身智能领域,面壁智能与吉利汽车、乐聚机器人开展深度合作,形成面向工业制造与商业服务的双线布局。

在工业制造方向,面壁智能的 VLM 多模态大模型与吉利机器人的本体、VLA 模型及导航系统深度集成,成功实现吉利机器人在生产仓储场景的落地应用。

在商业服务方向,面壁智能与乐聚机器人联合推出展厅导览 Agent 解决方案,可在无网络环境下纯端侧运行导览系统,支持基于本地知识库的离线讲解和自由问答。

在巡检场景中,依托面壁智能的多模态能力,搭载乐聚机器人本体和巡检系统,可高效识别园区内车辆违规停放、路面异常、公共设施异常等情况,所有敏感数据均在本地处理。该方案覆盖 6 大类商用导览场景,可识别 30 余种巡检异常,检测成功率超过 95% 。

WAIC 期间,面壁智能创始人兼首席科学家刘知远、面壁智能多模态智能首席科学家姚远与智东西等媒体进行交流,进一步分享了面壁智能做具身智能的动力、优势、打法与目标。

一、为什么要做具身智能?目标与技术积累双重驱动

刘知远认为,具身智能是 AI 走向物理世界的必由之路,面壁智能内部团队的共同目标是端侧智能,机器人是下一代智能终端非常重要的形态。

从技术角度而言,具身智能属于多模态的直接下游,面壁智能在高效多模态路线上有很多技术积累,这也是为什么面壁智能做具身智能时间不长,但基础工程链路认知建立得较快。

语言模型具备思考、决策、规划能力;过去三年,姚远在面壁智能补齐了感知能力,有了更多的模态,如语音、视觉,未来可能还有雷达、遥感等各种来自自然界的信号;具身智能则补齐了动作、行动能力。人类智能包括感知、思考和行动,未来要形成一个严格闭环,这就是面壁智能团队在努力完成的工作。

据姚远透露,面壁智能的语言模型、多模态模型、具身智能模型团队相互支撑,底层数据、工程链都是共享的,具身智能团队训的 VLA 模型是直接基于多模态团队的工作,很多通用能力能快速拉到一起做,因此能在较短时间内达到相对第一梯队的效果。

" 具身智能模型连 ChatGPT 时刻还没有找到。" 刘知远说。在他看来,大语言模型、感知、行动成熟度不同,语言模型聚焦在让密度持续变高,多模态要补足最后几个拼图,让它达到完全态,然后再进一步的追求密度,让它反应更快;行动成熟度还没有那么高,更多还是在做探索性的工作,技术成熟后才有可能商业化。

数据是当前具身智能行业面临的共同瓶颈。姚远说,没有一种数据是完美的,要么是量不够,要么是精度不够。真实世界的一大难点来自多样性、随机性,无法通过少数几条过拟合去解决的。面壁智能将具身智能模型和多模态模型底层数据打通,同时也会有各种类型的具身智能数据。

在刘知远看来,具身智能的数据不是能从互联网获取的,要有意识地从自然界的交互反馈中去收集,把感知、思考和行动形成一个闭环。现在越来越多的具身智能企业将主要精力放在数据集的构建上,这会极大加速具身智能的进展。

二、具身智能发挥大脑角色,要走先通后专模式

面壁智能的具身智能模型以通用智能为起点,旨在让机器人能够直接处理普适、长程、流水线式任务。

据刘知远分享,面壁智能的具身智能模型发挥 " 大脑 " 角色,会与很多不同类型的本体厂商合作,包括做人形机器人、机器狗、灵巧手、机械臂的,通过大小脑协同等方式工作。

相比之下,一些本体厂商更适合做本体上的 " 小脑 ",偏具体行动,可能会涉及感知,不太涉及思考。感知与行动要形成一个快速闭环,不需要经过大脑。

面壁智能做的是通用具身智能。它在语言模型和多模态模型上看到的一个重要趋势,是基础能力上来后,很多场景就会迎刃而解。

刘知远解释说,大语言模型是 " 先通后专 ",先具备通用能力,也就是关于这个世界的常识,再把它培养为相关领域的专家,这样专家水平的上限才会更高。

他预测,未来 3 到 5 年,具身智能同样要走 " 先通后专 " 的模式。

" 通用 " 意味着能在广阔场景里广泛应用,比如 Anthropic Claude 擅长的编程专业能力,是基于大语言模型做的。

好比它首先是一个非常聪明的大学生,再让它变成一个很聪明的程序员。如果只是用代码训这个模型,达不到现在的效果。

就像一位学者曾说过的,你的目标是登月,但如果你以爬树的形式来尝试着离月亮更近,你是永远不可能到月亮上去的。

姚远谈道,很多模型为了展示出好的效果,会针对专门任务、专门场景去训练一个专家模型,提前可能会采集该任务的很多数据,这样做出一段 demo 还是相对简单的。但这不代表该领域发展的进度,目前具身智能基础模型的基础性、泛化性、通用性仍存在很大问题。

面壁智能并没有对某一个场景做特别深度的优化,希望先把基础的数据、 Infra 工程链路打磨好,实现较好的泛化基础。

三、兼顾上下文记忆与响应效率,单决策步推理时延远低于 π 0.5

面壁智能的通用 VLA 具身模型 MiniCPM-RobotManip 融合多模态技术沉淀与视觉 Token 极致压缩能力,保留完整历史观测记忆的同时,计算量与不保留记忆时持平,在考验 VLA 模型上下文记忆的基准测试 RMBench 上取得显著优势。

根据测试,在包含 60 帧历史观测的机器人操作任务中,传统重新计算方式每个决策步需要 125TFLOPS,采用流式推理后仅需 3.3TFLOPS,低于 π 0.5 在无历史帧输入下的 5.0TFLOPS。在 H100、BF16 精度下,MiniCPM-RobotManip 单决策步推理时延为 120ms,相比 π 0.5 的 234ms 降低近一半,实现了上下文记忆与响应效率的兼顾。

当前上下文记忆难在哪儿?姚远谈道,现在的视觉是三路甚至四路的,每秒保持一帧,要支持一分钟的原生,大概是几百帧图片、几万个 Token 甚至高达十万个 Token 的长度,要求模型有极致的视觉 Token 压缩,这是基于面壁智能的技术直接做的。

在这方面,面壁智能的核心技术壁垒主要源自高效多模态技术。视觉 Token 爆炸是多模态领域的一大瓶颈,面壁智能从 2024 年开始与实验室一起,做了一系列高效视觉编码的先进技术探索,除了发表的论文外,技术也演进到第四代,能够支撑模型更加高效。

相比市面上绝大多数的模型都是 4 倍的视觉压缩率,面壁智能在无损的情况下做到 16 倍的压缩率,甚至能通过视觉编码器内部的融合,实现计算量再进一步的发展。

端侧 VLA 注重高效,因为云侧和端侧计算门槛不同,姚远说:" 我们一些原生的上下游记忆、世界模型都是值得期待的东西。"

他补充道,面壁智能首先想看模型智能密度是不是相对紧凑,因此选择 1B 左右的先发模型基座。数据上的 Scaling Law 一定是成立的,越大量的数据会带来更好的提升;参数的 Scaling Law 还没有达成非常好的共识,可能是受限于实时推理速度的要求。

四、端侧智能需要软硬协同,达到 GPT-5.6 级水平还需两三年

姚远说,端侧智能大脑是两个趋势共同叠加的效果:一是模型密度越来越高,相同的水平可以做的越来越小;另一方面就是终端计算能力越来越强。

刘知远认为,将模型密度做得更高非常有挑战性,并不是模型越大,技术含量就越高。

以芯片为例,制程最高的芯片是放在终端上的芯片,因为终端对空间、功耗要求更高,所以要求有一个电路密度更密的芯片。

云侧和端侧模型的能力区别很大:云侧模型要求高并发,MoE 架构会是它的默认选择;端侧模型用 MoE 架构不划算,因为 MoE 架构需要一个大显存,而显存很贵。

端侧是一个复杂的技术生态,需要软硬协同、端云协同。端侧智能的模型应与硬件密切结合。一些智能分别发生在云上和端上。同时,端侧能起到数据采集作用。

刘知远认为要让端侧模型达到像今年 Claude 或 GPT-5.6 模型这样的水平,还需要 1-2 年、2-3 年的时间。

受限于算力水平与模型尺寸,当前端侧模型相对比较专用,可处理的任务类型有限。但面壁智能团队相信,只要能够在这个方向上再坚持 1-2 年的时间,就会迎来端侧智能的大爆发。

他预测,未来智能会走向分化,每个行业都是充分竞争的,不会出现一家独大。

五、开源是 "AI 留在血液里的信仰,面壁智能只做模型、不碰本体

" 开源这个事情,应该是人工智能流在血液里面的信仰。" 刘知远说,AI 行业能实现这么快的发展,有赖于开源,让全球从业者都能第一时间站在最前沿的方向上接着往前走。

未来的具身智能发展一定有赖于开源的支持,因为有那么多本体,要做各种各样的适配。

姚远补充道,面壁智能希望先通过开源提供一个基础设施,在端侧设备上实现加速,同时在云端,比如高并发的产品上,也有较好的拓展性。

其意义在于,有时可以通过云端部署非常高效,由于模型本质上是高效的,因此能通过云端多并发的很多场景来提供服务。

这也能对训练起到好的加速作用,比如强化学习,需要快速推理出结果去评判,用了面壁智能的框架之后能显著降低训练成本。

面壁智能只做模型,不碰本体,判断 " 两者都做 " 不如 " 只把模型做好 " 的胜算更大,希望通过技术的创新,嵌入到整个智能终端生态中,与上下游伙伴共建下一代智能终端。

" 我们要去寻找好的合作伙伴,大家都能明确自己的边界在哪儿,比如本体厂商目标就是要做质量最好、最便宜的、最有竞争力的本体,他能把这个事情做好,就已经是一个巨大的市场了。" 刘知远说。

他预测,未来具身智能发展路线会演化成不同的生态打法:一种是苹果模式,什么都自己做;一种是安卓模式,有各种硬件厂商,共选统一的操作系统。

" 我觉得完全就看这个企业有没有乔布斯,有乔布斯了就可以苹果,没有乔布斯我建议就做兼容的模式。" 刘知远认为,更健康的生态应该是这样的,任何一个企业的禀赋、基因、特点,决定了不可能每个东西都能做的对,只能聚焦把自己能做好的事情做到最好。

" 我们还没有找到我们的乔布斯。" 刘知远说,面壁智能希望未来是一个生态打法,就像 "Wintel 联盟 " 互相协同,生态需要珠联璧合、双向奔赴,与广泛本体厂商充分合作来推动快速发展。

面壁智能坚持做商业化,即便不认为当前是商业化的好阶段,也要做,要跟上下游跟生态成为朋友。刘知远相信,未来商业化不止是讲技术,还关乎信任问题,面壁智能从不承诺自己做不到的事情。

结语:端侧智能迎来规模化落地元年

北京智源人工智能研究院联合端侧实验室发布的《端侧智能 2026 ——规模化落地元年》报告显示,2026 年端侧智能正从概念验证迈向规模落地,产业化拐点已然到来。

" 跑得早、跑得快都不重要,重要的是你跑得准,你的未来发展方向是对的。" 刘知远谈道,关键是能够准确研判未来的发展趋势,在当前这个时代,大家都在同一个起跑线上,谁能够真正的做创新,谁才有可能在这一轮科技革命里取得先机。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 乐聚 吉利 开源
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论