具身商业前哨 7小时前
当机器人涌向工厂,黄青虬要把墨奇智能的终点留给家庭
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

普通人到底是怎么看待人形机器人这波热潮的?我翻了翻自己的短视频评论区,感觉有点复杂。

一说机器人进工厂,评论区总有两股情绪。一股是兴奋,希望它赶紧替人搬重物、干苦活;另一股是焦虑:机器人越来越聪明,我的工作还保得住吗?

可一说机器人进家庭,大家的态度反而出奇一致。最好能做家务、照顾老人,一个人住时还能跟它聊上几句。

工厂里的机器人让人想到的是效率和替代,家庭里的机器人带来的想象很直接:终于有人替我干家务了。

所以我有一个不太严谨,但越来越坚定的判断:人形机器人的终局一定是进入家庭。但问题是,怎么才能更快地走到那一步?

眼下,具身智能最容易落地的地方还是工厂。场景封闭、任务固定,投入产出也容易计算。家庭却没有标准答案:东西摆放没有规律,任务随时会变化,还要考虑安全、隐私和价格。

就在大多数企业都在往工厂冲的时候,我注意到了「墨奇智能」。这家成立大约八个月、估值超过70 亿元的公司,却把家庭放在了终点。

但真正让我感兴趣的,是联合创始人兼 CTO 黄青虬对数据、模型和产品的判断。

WRC 期间,墨奇智能的轮式双臂机器人 KINO 用 15 分钟完成了一套家务:清理桌面、给冰箱补货、处理洗烘衣物,最后把衣服叠好。整个流程包含七八十个动作。

但更值得聊的是黄青虬的一句话:" 你选什么场景,就意味着你能拿到什么样的数据;你能拿到什么样的数据,就意味着你能训练出什么样的模型。"

01

数据的价值,要看机器人从中学会什么

具身智能谈数据,现在最显眼的指标是 " 积累了多少小时数据 "。但黄青虬认为,小时数并不能直接代表数据质量。一方面,动作轨迹要足够精准;另一方面,数据必须来自足够丰富的真实场景。

什么叫真实?就是让真实的人,在真实的环境里,干真实的活。黄青虬把它称为" 三个真实 "。

比如擦桌子。实验室里数采员的目标是完成规定动作,轨迹录进系统就算交差了,这多少带着一点摆拍和班味儿。而真正做家务的人会盯着污渍,调整方向和力度,没擦干净就再来一次。

这样的数据里,记录着人为了把桌子擦干净而做出的判断和调整,机器人需要学会这些。

所以墨奇智能选择先去酒店、公寓等泛家庭场景这里空间不大、物品繁杂,接近家庭,却更容易形成稳定的作业和付费场景。它们既是商业起点,也是一间每天都在变化的训练室。

墨奇智能还自研了 Sense Kit 数采系统,让一线人员工作时记录动作。按公司说法,即使手伸进洗衣机,或者面对缺少纹理的白墙,系统仍能进行毫米级轨迹重建。

采回来还不够。墨奇智能虽然只成立八个月,却舍得花半年搭建一套数据处理体系。

我更愿意把这套系统比喻成一座图书馆:原始轨迹只是送到门口的书,先过质量门禁,检查时间同步、轨迹精度、动作完整性和可执行性;合格后再分类、建立索引。今天训练叠衣服,明天训练放杯子,系统必须能准确调出对应内容。否则,数据再多也只是一间堆满纸箱的仓库。

标注是在告诉模型,每本书讲了什么。墨奇智能用包括多模态专用大模型在内的教师模型进行自动标注,再结合多种融合策略,生成训练所需的参考答案,按任务和难度分阶段喂给模型。至于哪些标签真正有效,也要在模型训练中反复验证。

目前,墨奇智能已经有了3 万小时的真实场景数据,年底目标是提升至 15 万至 20 万小时。在人人谈百万小时的行业里,它先把数据质量做好:小时数只是库存,能被准确找到、读懂并变成能力,才算真正有用。

02

端到端的 System 1,怎样自己把活干完

聊到最近大热的机器人模型能力,黄青虬很少围着 VLA、世界模型这些名词打转。在他看来,技术架构会变,模型最后能做什么更重要。也因此,墨奇没有用某种技术架构给模型命名,而是把它叫作 MoRA,全称为 MORPHI Reasoning & Autonomy,强调理解世界与自主行动。

这里的 " 自主 ",指的是机器人到了现场以后,不等人一步步发指令,也能把一件事做完。要改变的核心,是直接面对环境、生成动作轨迹的 System 1。

行业常见的分工是,System 2 通常负责理解意图、拆解任务,而且很多时候运行在云端;System 1 接收指令并生成动作轨迹,System 0 再把轨迹变成关节信号。

很多方案把目标、记忆、进度判断和失败恢复都放在 System 2,System 1 只负责眼前的一小步。任务要求 " 抓住衣服左角 ",它就抓住左角;接下来没人发指令,它便不知道该往哪里走。

墨奇智能则是把一部分能力从云端下沉到端侧,让System 1 这颗 " 大脑 " 不再只是动作执行器。System 2 负责理解用户想要什么,并做大的任务安排。进入现场以后,物品怎么抓、门开到什么角度、没抓稳要不要重试,都交给 System 1 判断。只有碰到超出能力边界的异常,它才请 System 2 介入。

在具体执行上,墨奇智能强调端到端:System 1 接收语言或图像给出的目标,结合环境观察,连续输出动作轨迹。同时,它被部署在机器人本地,能够一边做、一边看结果,再决定下一步,不必每个动作都等待云端下令。

Agentic-Native 解决的正是这种持续执行能力:把目标、记忆和进度感知放进System 1。它要记得上一毫秒做了什么,手臂才能动得连贯;门已经打开,就别再开一次;几分钟前枕头从沙发掉了下来,最后还要放回原处。动作做错了,它能自己发现;环境变了,也能继续往下做。

过去的 System 1 更强调听话,墨奇智能希望它能够扛事。System 2 告诉机器人做什么,System 1 负责在真实世界里把它做成。机器人能不能连续工作 15 分钟,甚至几个小时,就看这颗 " 大脑 " 能不能一直记住目标。

03

十五分钟长程任务,考验的是可靠性

在今年的 WRC 现场,我看到墨奇智能首次公开亮相的机器人 KINO。它没有双足,也没有五指灵巧手,而是使用轮式底盘和夹爪。坦白说,单看形态,它并不抢眼。

但我注意到,KINO 的机身用了大量圆角,机器人脸上的表情格外抢眼。这些设计不会提高抓取成功率,却会影响一个人愿不愿意让它站在家里。现场也有不少观众对它的" 表情管理 " 印象很深。

在媒体采访中,黄青虬说,机器人的终局是双足人形。只是现阶段,限制机器人干活的主要是上半身。腿走得再漂亮,手上干不了活,也很难产生生产力。于是墨奇智能先用轮式底盘绕开平衡问题,用夹爪完成多数操作,把资源集中在手臂和模型上。

底盘做得窄,也是从现实的居住空间倒推出来的。沙发、桌腿和门框会不断压缩通道。底盘太大,再聪明也进不了卧室。

相比外形,更能说明墨奇智能特别之处的是现场那段15 分钟的 Demo。KINO 先清理桌面、检查冰箱,再处理洗烘衣物,最后回到桌前叠衣服

黄青虬算过一笔账:整段任务有七八十个动作,如果全程成功率要达到 90%,单个动作的成功率就要接近 99.9%。一个环节只差零点几个百分点,连续几十次以后,差距会被迅速放大。

所以长程任务看的不是机器人会多少招,而是出错以后还能不能接着干。脏衣篓被人踢开了,它要重新寻找;桌子收拾完,又有人扔来一块香蕉皮,它得意识到任务还没有结束;衣服没抓好,它应该再试一次,而不是死机或者直接跳过。

家庭需要的从来不是一次完美表演,而是有人把活干完。

当然,一段 15 分钟的演示不能等同于成熟产品。更难啃的是安全、隐私和成本。一旦接触老人和孩子,容错空间会小得多。

墨奇智能计划明年交付千台机器人。这个目标能不能完成,要看客户是否愿意买单,也要看 KINO 能不能从展馆里的长程演示,走向真实场景中的每天稳定工作。

但我依然愿意继续看墨奇智能。黄青虬知道家庭服务机器人很难,所以先从酒店和公寓里的琐碎工作做起,积累数据,让机器人少问云端一句,多自己处理一步。双足和灵巧手并没有被放弃,只是暂时往后排了排。

没人能保证墨奇智能这条路线一定成功。但在一个大家都急着展示结果的行业里,它至少愿意承认问题有多难,再把那些不漂亮的基础工作做完。

判断一台家庭机器人有没有希望,不必先看它走路像不像人,也不用看它能不能摆出漂亮动作。

等你转身去忙自己的事,它还能不能把一屋子的活干完?那才是家庭机器人真正要过的考试。

欢迎您在评论区跟我们交流

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 创始人 规律 短视频 普通人
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论