碳基打工人 9小时前
6B参数全开源,宇树把人形机器人"大脑"打成白菜价
index.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

做具身智能的人,大概都懂行业里最难言的痛处:外面宣传吹得天花乱坠,实际工程里全在搞特异性打补丁。走路用一套强化学习,抓杯子切另一套扩散模型,一旦把二指夹爪换成五指灵巧手,前面的算法几乎瞬间报废。

宇树刚刚全面开源的通用人形基座大模型(UnifoLM-WLA-1.0),直接把这道卡了全行业几年的死穴给强行干穿了。6B 参数、2500 小时真机实测数据、64 项复杂任务,全部塞进同一套权重里直接开源。

它最狠的不是刷分,是这三项工业级泛化

宇树这次最狠的突破不是模型刷分,而是三项极其冷血的工业级泛化能力。下面逐条拆开看。

单一权重通吃全身协同:彻底抛弃了 " 小脑管走路、大脑管抓取 " 的割裂拼装。这套 6B 基础模型用同一套权重,把底盘导航、全身大范围移动和桌面毫米级操作焊死在了一起,厨房端茶、端脏衣服进洗衣机,全是一模驱动。

跨末端执行器的泛化:这是真正的技术分水岭——不管前端装的是廉价的两指夹爪,还是极其复杂的五指仿生灵巧手,模型不用全盘重训,在统一表征下全部自适应跑通。

真正的端侧实时闭环:头部与双腕双目立体视觉注入,策略推理延迟直接压到了 106 毫秒(Sub-110ms)。没有云端往返的延迟卡顿,动作才能做到像生物一样的流畅咬合。

底座与数据是怎么堆出来的

底座用 Qwen3-VL-4B 做空间常识推理,外挂 MMDiT 动作流专家,硬生生啃下了约 2500 小时的高质量真机多任务数据。这套组合不是简单拼装,而是把空间常识推理和动作生成两条链路接在了一起。

更具杀伤力的是他们的姿态:海外很多团队把具身算法当成融资壁垒死死藏着,而宇树直接把代码、模型权重和数据链路全部开源,甚至附带了完整的真机部署指南。

硬件是骨肉,开源基座才是狠活

做机器人硬件是把骨肉做扎实,而把具身基座做成开源基建,才是真正要把整个物理 AGI 时代往前强推一步的狠活。看来宇树不只是一家卖机器人的硬件厂,他们刚放出的这个 UnifoLM-WLA,正在把最核心的具身大脑打成白菜价。

评论
大家都在看