融中财经 昨天
具深科技李德栋:出货量和Demo都是假象,真正的拐点在“连续交付”
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

导读

THECAPITAL

从 " 机时租 " 到数据闭环,具深科技想做机器人界的 " 水电煤 "。

编按

" 身体力行 ",古已有之。《淮南子 · 氾论训》有 " 圣人以身体之 ",《礼记 · 中庸》亦言 " 力行近乎仁 "。古人所重,不只在 " 知 ",更在知之后的 " 行 " ——以身体感知世界,在行动中验证认知。

两千多年后,这四个字在具身智能时代有了新的现实含义:具(身),让智能拥有进入物理世界的载体;智能(体),赋予机器感知、理解与决策的能力;创新(力),推动技术突破瓶颈、建立壁垒;执(行),让这些能力最终转化为产品、交付与真实价值。

值此之际,《融资中国》推出 " 身体力行 " 具身智能专刊,将目光投向一批正在产业深处生长的未来独角兽。我们试图记录的,是一场从 " 知 " 到 " 行 " 的跨越,也是新一代机器人企业从技术走向产业的成长之路。

本文 3196 字,约 4.6 分钟

作者 |   冯晓亭    编辑 | 吾人

来源 |  

(ID:thecapital)

具身智能这波浪潮里,多数创业公司抢着做 " 更聪明的大脑 ",来自上海的具深科技却押在了另一头——机器人的 " 小脑 "。

具深科技联合创始人、CTO 李德栋的判断很直接:" 大脑可借,小脑必长。" 上层的语言、视觉、决策模型可以换、可以借用现成的能力,但把 " 想做什么 " 稳定变成身体 " 真正做到什么 " 的全身运动执行底座,只能靠机器人自己在真实场景里长期跑出来。

围绕这个判断,具深搭出了三块拼图。分别是 CereBase 3.0 通用机器人小脑基座、VisWDC 5.0 纯视觉全身数据系统,以及把机器人按使用时长出租给客户的 RoboNow" 机时租 " 服务平台,三者串成一条从数据生产、技能训练,到真实交付、数据回流的闭环。这套闭环已经在顶级舞台演艺、多机协同和真实机器人运行中持续产生数据。今年 5 月,公司完成数千万元融资,红杉中国种子基金、徐汇科创投等机构参与。

在李德栋看来,具身智能眼下正从 " 能站、能走、能展示 ",走向 " 能不能连续交付、创造价值 " 的阶段,真正决定成败的,不是模型参数好不好看,也不是 Demo 做得多炫,而是身体能否在真实世界持续把事情做成。" 具身智能的下半场,将从‘能力展示’走向‘运行时闭环’,从‘训练更大的脑’走向‘让不同的大脑都能通过同一套全身运动执行底座,稳定控制不同的人形机器人’。"

以下为采访实录,以飨读者:

《本刊》:世界模型、VLA、端到端、分层大小脑等路线的差异究竟在哪里?

李德栋:这些路线并不互斥。世界模型注重预测环境变化和长程规划;VLA 注重视觉、语言与动作对齐;端到端强调减少人工接口、直接优化任务结果;分层大小脑则回答不同时间尺度如何协同。人形机器人既要进行秒级甚至分钟级推理,也要依靠高频本体反馈维持平衡、处理接触并修正动作。

我们更看好 " 统一表征 + 分层执行 + 闭环反馈 ":上层智能决定意图,执行底座把意图变为连续动作,并根据身体和环境变化实时纠偏。

《本刊》:机器人需要一个 " 超级大脑 ",还是多个专用模型协同?

李德栋:机器人同时面对毫秒级平衡、秒级调整和分钟级规划,无法由同一频率的模型包办。当前更可行的是 " 大脑 + 小脑 + 反射层 ":大脑决策,小脑执行,反射层异常保底。" 大脑可借 " 是指上层模型可替换,可升级;" 小脑必长 " 是指稳定、恢复和本体适配必须靠持续真机运行积累。

《本刊》:从语言理解到动作执行,中间最容易发生信息损失的是哪一步?

李德栋:最大损失常发生在 " 任务意图 " 到 " 可执行运动 " 之间。大模型能说 " 走过去、弯腰、拿起杯子 ",但本体真正需要的是连续时序中的质心、支撑域、接触顺序、末端轨迹、关节约束和安全边界。

具深构建运动语义中间层,把文本、音乐、视频、动捕、VLA 等输入转为统一运动表征;执行时再融合 IMU、关节位置与速度、力矩、温度、接触、电量和通信等底层本体状态

反馈,由本体解码器生成动作并在线修正。这样既保留上层语义,也不把动力学和安全风险暴露给上层。

《本刊》:机器人需要多强的推理能力,才能进入真实工业和商业环境?

李德栋:进入真实工业和商业环境,并不要求机器人先拥有接近人类的通用推理能力。对于边界明确的任务,只要机器人能够理解任务目标、判断少量关键状态、在不确定时重新观察或请求人工介入,推理能力就已经基本够用。真正决定它能否落地的,是低频决策能否通过高频运动闭环被稳定执行。

人形机器人面对的是不同时间尺度的问题:上层模型负责秒级甚至分钟级的任务理解与规划;运动策略根据环境变化持续调整步态和全身动作;更底层的控制与安全模块则要在毫秒级处理平衡、接触和突发扰动。因此,真实场景不追求 " 每一步都深度思考 ",而是在正确时刻进行正确粒度的推理。

当运行中出现关节温升、算力过载或通信抖动时,系统还应完成 " 状态监测—分级降载—本地保底—恢复或受控退出 "。所以,商业化机器人真正需要的不是最高 " 智商 ",而是任务范围内够用的推理能力,加上可感知、可纠偏、可降级的执行能力。

《本刊》:泛化究竟应该如何定义?

李德栋:泛化不是一个单一指标,应分层评估:换物体仍能做,是对象泛化;换位置、光照和干扰仍能做,是场景泛化;把技能组合成新任务,是任务泛化;迁移到不同身高、自由度和执行器的机器人仍能完成,则是跨本体泛化。

具深尤其看重后两者。路径不是宣称零适配,而是 " 共享运动表征 + 本体解码器 + 真实数据回流 ":成功数据扩展能力,失败数据暴露边界,人工接管数据教会系统恢复,使新增本体和场景的适配成本持续下降。

《本刊》:未来具身大脑会掌握在整机企业手里,还是形成独立平台公司?

李德栋:两类公司都会存在。整机企业掌握与硬件强耦合的控制、安全和制造参数;独立平台公司则聚焦跨本体运动表征、技能接口、运行时安全和部署工具链。行业规模化不能让每个上层模型为每款本体重复开发执行系统,未来会形成 " 上层智能模型—全身运动执行底座—机器人本体 " 的分工。

具深希望成为运动智能基础设施公司:向上承接不同模型和内容输入,向下统一状态与动作接口,以舞台、商体和服务场景的真实交付持续迭代。

《本刊》:具身智能行业目前处于什么阶段?距离规模化商业化还有多远?

李德栋:行业正在从 " 能站、能走、能展示 " 进入 " 能否连续交付和创造价值 " 的阶段,但不同形态与场景节奏不同。轮式机器人会更早在固定路线、单一任务中验证 ROI;双足人形的短期工程难度更高,但跨地形、跨工具、跨场景复用的上限也更高。

我们不必等到通用智能成熟:文娱展演、数字体育、科研数采和部分生活服务等限定场景,未来半年将进入工程化复制窗口。通用劳动力仍需更长时间。判断商业化拐点,应看任务成功率、连续运行、异常恢复、设备利用率、单位任务成本和复购。

《本刊》:中国企业在这轮具身智能浪潮中的独特优势是什么?

李德栋:中国企业的优势不是单点,而是完整链路:供应链降低试错成本,密集且多样的场景提供数据,工程团队和客户距离近,能够把现场问题快速送回研发,再将改进部署到现场。真正的优势是 " 闭环迭代速度 ":本体、算法、运维、保险、租赁和场景方协同,成功、失败和人工接管数据持续回流。

下一阶段不能只依赖成本优势,还要把接口、数据标准、可靠性验证和全球合规做成能力,才能从项目交付走向平台化复制。

《本刊》:如何看待行业热度与泡沫?什么样的公司会在洗牌中活下来?

李德栋:行业存在局部泡沫,主要表现为用一次演示替代连续交付、用参数替代任务价值、用远期想象替代现金流。但资本前置投入也有必要,因为模型、数据与本体工程都需要长期投入。洗牌后能留下的企业大概率具备三点:卡住一个真正的产业瓶颈;在真实场景中形成可重复交付与数据回流;保持清晰的成本与组织纪律。对具深而言,标准不是机器人会多少个 " 节目 ",而是技能能否在不同本体上稳定复用,失败后能否恢复,异常时能否安全退出,并最终转化为客户愿意持续购买的机器人劳动能力。

机器人的智能,最终不是模型回答得多漂亮,而是身体能否在真实世界持续把事情做成。具身智能的下半场,将从 " 能力展示 " 走向 " 运行时闭环 ",从 " 训练更大的脑 " 走向 " 让不同的大脑都能通过同一套全身运动执行底座,稳定控制不同的人形机器人 "。

(头图人物:具深科技联创、CTO 李德栋)

#  线索爆料  # rzcj@thecapital.com.cn

END

融中 2025-2026 年度中国产业投资榜单

盛大发布 ~

融中 2025-2026 年度中国有限合伙人榜单

融中独家发布量子九龙图:

九大标杆定义中国量子力量 ~

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 物理 融资 独角兽
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论