量子位 昨天
算力需求两年涨10倍,机器人为了走进真实物理世界,正在疯狂「吃算力」
index.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

田晏林 发自 凹非寺 量子位 | 公众号 QbitAI

上周五,逐际动力线下黑客松实训大赛「创学营 2026」的收官现场,选手们正在云上跑最后一轮仿真评测。

他们打开浏览器,登录一台远在云端的工作站,旋转着 Isaac Sim 里的机械臂场景,调整参数,生成数据。

这一幕要放在 3 年前很难实现。

筹办类似的比赛,光是找场地、配机器就要耗费 1 个月的时间。

机器人训练可不是打开电脑,写写代码这么简单。

背后需要 Isaac Sim、NVIDIA Omniverse 等仿真环境,需要 GPU 算力支撑,还涉及不同版本软件、驱动和开发工具的统一配置。

一场创学营办下来,每多一名选手,对主办方的环境部署、设备采购和资源管理都会提出更多要求。

更麻烦的是,活动结束后,这些高性能设备又可能长期闲置。买得越多,浪费越大。

逐际动力选择了一种不同的方式。

借助阿里云旗下的 AI 创研算力平台无影灵构的云上工作站,选手们可以快速接入统一研发环境,算力资源按照实际需求弹性调整,不需要提前采购大量固定设备。

这场演练明面上是在探索「机器人怎么变聪明」,背后的隐藏副本则是「如何让研发机器人的公司,变得更高效」。

为什么训练一个机器人,这么费机器?

大模型让机器人开始具备理解和推理能力。

但从会聊天到会干活,还需要经历一整套复杂流程:遥操作数据采集、算法调试、仿真训练、真机部署。

与数字 AI 不同,机器人面对的是一个高度复杂、不断变化的真实世界。

它需要理解空间,需要感知物体,需要预测动作,还需要在真实环境里不断试错。

每一个环节都离不开计算资源支撑。

△图片由 AI 生成

这也是为什么,具身智能的竞争从来不只是模型参数竞争,更是一场围绕算力、数据和工程效率展开的长期竞赛。

逐际动力联合创始人兼 CTO 谌骅告诉量子位,过去两年,粗略估算,公司研发团队对算力的需求增长了 5 到 10 倍。(吞卡兽 .jpg)

而且是有多少卡就能吃掉多少卡。

算力需求暴涨,只是问题的一面。

更大的变化在于,机器人研发正在从单点实验走向复杂工程协作。

过去,一名算法工程师拥有一台高性能工作站,配置好环境,就能完成部分研发工作。

但今天,一个完整的具身智能团队,需要同时处理仿真训练、数据处理、模型迭代、多人协作和真机验证。

研发资源不再只是「一台机器」,而是一整套持续运行的基础设施。

阿里云智能集团副总裁、终端智能计算事业部总裁张献涛认为,云计算的发展已经经历了两次基础设施迁移。

第一朵云支撑了互联网,第二朵云支撑了移动互联网。

而现在,机器人时代需要第三朵云。

这一次,云需要解决的不只是计算资源的问题,而是让算力、开发环境和 3D 交互能力一起进入机器人研发流程。

话说回来,为什么机器人研发会逼出第三朵云?

一个机械臂抓取物体,看似只是伸手、移动、拿起几个动作,但背后需要理解物体位置、形态、重量、摩擦力以及周围环境变化。

一个人形机器人行走,也不是简单输出几个动作指令,而需要持续调整重心、处理身体平衡、关节控制和空间反馈。

尤其在人形机器人研发中,3D 仿真环境需要同时处理复杂场景、机器人运动和物理交互,对图形算力提出了更高要求。

这让机器人研发天然成为高算力行业。

但过去,支撑这种研发的基础设施没有跟上产业速度。

此前,业内通常采用采购工作站 - 安装软件 - 配置 GPU 环境 - 逐台维护这套模式。

这简直是一种「折磨」。

麻烦不说,关键是在团队规模较小时,尚且勉强可行,一旦团队扩大、任务增加,这种方式越来越难适应快速变化的研发节奏和快速扩张的团队规模。

谌骅也表示,实际工作中,团队在仿真环境的配置,训练资源的调度上总会遇到各种各样的小问题。

比如 CUDA、ROS2、Isaac Sim 等工具链组合复杂,依赖库、驱动之间极易出现版本冲突;

软件、仿真器迭代更新速度快,团队多台本地工作站硬件型号不一,很难做到全设备环境完全统一。

「单人配置耗时长达大半天,这些都是机器人研发中的隐藏成本。」

此外,外包和跨地域协作带来账号、数据权限、审计和离场的回收压力,也是具身智能公司不得不考虑的现实问题。

拥有一个可以云端灵活调用、弹性扩容、开箱即用和安全环境的工作站,迫在眉睫。

把工作站搬上云之后

在与多家具身智能公司沟通后,张献涛发现,当行业走到工程化阶段,环境、算力、数据、仿真这些事,眼下每家公司都在自己搭一遍。

「这背后不是谁愿意重复造轮子,而是这一层还没有变成标准件。」

在他看来,共性越强的部分,越应该被尽早沉淀成标准件。

无影灵构要承载的就是这些共同需求:把具身智能的研发现场搬到云上,环境按需复用,算力随任务调度。

「本体、模型、数据和真实场景,始终应该长在机器人公司自己手里。我们要做的是把基础设施带来的研发摩擦降到最低。」张献涛说。

今年 3 月,逐际动力与阿里云无影深聊了下。

尽管逐际动力很早就和阿里云建立长期合作,但此前双方仅依托 PAI 平台、通用 GPU 算力,完成大规模模型训练的底层算力合作。

而这一次,他们讨论的问题聚焦在具身智能研发全链路的前端工程痛点:

仿真难可信、训练难稳定、真机难规模化、数据难形成高质量闭环。

这四个问题背后,又共同受到环境碎片化、算力错配、成本和安全治理等因素影响。

过去,机器人团队往往需要自己搭建一整套研发环境。

买 GPU 工作站、安装 CUDA 和 ROS2、配置 Isaac Sim、管理不同版本依赖,再把数据在本地和云端之间反复搬运。

对于成熟团队,这是一笔持续投入;对于快速成长的机器人公司,这更像是一种重复建设。

无影灵构给出的思路,是把过去摆在工位上的高性能工作站搬到云端。

一些重型计算单元(GPU、仿真环境、数据盘)全部上云,工程师只用轻量设备通过网络串流画面操作云端工作站。

对工程师来说,最直观的变化首先发生在环境交付。

机器人研发环境最大的痛点之一,就是复杂。

CUDA 版本、驱动版本、仿真软件版本之间存在大量依赖关系。一台机器能运行,不代表十台机器都能稳定运行。

尤其对于创学营这类需要快速接入大量开发者的场景,如果每个人都从零开始配置环境,时间成本非常高。

无影灵构提前把研发机器人要用的所有软件、驱动打包做成固定模板镜像。

想新增开发机器,一键复制模板就行;新人登录账号,点开就能用一模一样的环境,不用自己折腾安装。

谌骅表示,过去团队本地配置 Isaac 仿真环境时,经常会遇到各种报错,而在无影灵构 AI 工作站里,可直接选现成镜像启动。

「半小时就能开工,很少出故障,稳定很多。」

这不只是节省安装时间,还让机器人研发环境具备了软件行业熟悉的标准化能力。

算力弹性,是另一个关键变化。

机器人研发天然需要大量试错。

算法调优、仿真训练、模型评测,不同阶段对于算力的需求并不相同。

传统模式下,企业只能按照峰值需求采购硬件。

结果就是:忙的时候,GPU 永远不够;闲的时候,高价值设备长期闲置。

更麻烦的是,显卡更新换代很快,一次性花几千万自建算力,过两年硬件升级,钱等于打了水漂。

云端工作站改变的是算力获取方式。

据无影灵构产品经理王姣阳介绍,企业可以根据不同任务灵活选择 GPU 规格。

日常研发保持稳定资源,高峰期遇到训练营、大规模测试等任务时,可以快速扩容,项目结束后再释放。

「算力跟着需求灵活调整。」谌骅说。

从买设备,到调用算力,机器人研发正在进入一种新的资源组织方式。

但对于具身智能而言,仅仅解决算力供给还不够。

决定云端工作站能否落地的,还得看云上的机器人研发体验,能不能接近本地。

云端工作站,先要过「像不像本地」这一关

判断一个云端工作站好不好用,还得看工程师能否感觉到 GPU 在哪里。

就拿机器人仿真训练来说,工程师需要实时操作 3D 场景,拖动机器人模型,调整环境参数,观察运动结果。

任何一个环节出现延迟,都会直接影响调试效率。

这也是无影灵构区别于普通云主机的地方。

它解决的不是单纯的计算能力,而是云端 3D 工作站体验。

无影灵构通过无影自研的 ASP 流化协议,对图形渲染、视频编码、网络传输、终端解码和输入回传进行整体优化,让云端 GPU 完成渲染后,将画面实时传输到本地终端。

在现有 Isaac Sim 对比测试中,这种差异更加明显。

在简单操作场景下,拖动坐标轴时,无影 ASP 与 NVIDIA WebRTC streaming 均可以达到 30fps。

但当操作复杂度提升到模型文件拖动旋转时,WebRTC 帧率下降至约 22fps,而无影仍保持约 29fps,高出 7fps,帧率提升约 32%,达到满帧水平的 97% 左右。

稳定帧率,对于机器人研发意味着什么?

工程师旋转机械臂模型、调整仿真场景时,不会因为云端传输产生明显迟滞。

除了画面流畅度,带宽效率也是云端工作站能否规模使用的关键。

在相同模型旋转操作中,无影 ASP 平均带宽约 1.9Mbps,相比 WebRTC 等方案降低约 50%。

按每天使用 8 小时估算,单台终端日均流量消耗约 7GB。

更低的带宽占用,能够支持更多研发人员远程接入。

再看弱网环境下,无影灵构的表现也是相当稳。

在丢包率达到 10%、带宽限制在 5Mbps 的两组独立测试中,无影仍能维持约 27fps,相比其他方案帧率提升约 29%。

发生断网后,系统也支持自动恢复和重新连接。

这些技术层面的量化指标,表明云端工作站正在从「远程 GPU」变成「机器人研发基础设施」。

别看把工作站搬上云,貌似只换了台机器的位置,无影灵构 AI 工作站实际要同时解决四件事:

环境交付——把 CUDA、ROS2、Isaac Sim 这套极易冲突的工具链预制成行业镜像,一键复制;

图形算力—— 3D 仿真场景要在云端渲染、串流到本地,还要保证工程师拖动视角时的实时手感;

弹性调度——高峰期分钟级扩出上百台,项目结束即释放;

安全治理——数据不落地、权限可管、外包人员离场即回收。

这四件事里,前两件是技术门槛,后两件是工程门槛。一件都不能缺。

目前,无影灵构与逐际动力的合作主要集中在模型训练、仿真评测和云上研发环境。

但随着机器人研发进入数据驱动和持续迭代阶段,无影灵构的价值也将从提供云上工作站,进一步延伸到承载完整的具身智能研发工作空间。

未来,灵构将逐步连接遥操作数据采集、数据处理、标注质检、模型训练和仿真评测,让任务能够从工作空间发起,让结果重新回到项目,并通过统一的权限、版本和运行记录,使研发过程更加可复现、可比较、可审计。

据悉,多家具身智能头部企业已基于无影灵构 AI 工作站构建云上数据采集工厂和仿真评测,加速机器人的研发周期。

算力像水电一样,还需要最后一里路

从逐际动力与无影灵构的合作可以看出,整个具身智能行业研发方式正在发生剧烈变化。

越来越多机器人团队正在从「买设备、配环境、管服务器」,转向「按需调用算力、复用研发环境、云上协同开发」。

原因很简单,机器人研发天然需要大量试错。

但真实机器人测试成本高、周期长。

这也是为何逐际动力会将与无影灵构合作的第一站,放在仿真评测上。

但仿真只是起点。当机器人进入长期研发阶段,仅有算力还不够。

机器人团队还需要解决环境配置、模型训练、数据处理、真机部署等一系列问题。

换句话说,行业需要的不只是一台更大的服务器,而是一套完整的研发基础设施。

这也是为什么,机器人企业正在尝试把自身积累的工程经验进一步标准化。

今年 4 月,逐际动力正式开源「FluxVLA Engine」。

这是一个标准化具身智能大模型工程底座。

目标是让拥有真实场景数据的合作伙伴、用户,也能够自主完成数据处理、模型搭建、仿真评测和真机部署,大幅降低了 VLA 全研发周期的工程门槛。

某种程度上,它与无影灵构探索的方向形成了呼应。

据王姣阳介绍,无影灵构也在推动具身智能研发中各类零散的基础能力实现标准化。

包括高性能 3D 工作站、统一开发环境、行业镜像、算力调度以及企业级安全管理,让机器人团队不必重复搭建底层研发设施,而可以将更多资源投入到模型、算法和场景验证中。

两者关注的,其实都是降低具身智能研发门槛,只是切入角度不同。

FluxVLA Engine 承载的是逐际动力在机器人研发过程中的核心经验。

从数据处理到模型训练,从仿真评测到真机适配,这些环节直接连接机器人能力迭代和最终产品表现,因此需要机器人企业持续沉淀。

谌骅也说,FluxVLA Engine 和无影灵构代表了具身智能基础设施中不同方向的平台能力,双方完全可以在研发环境、工具链和基础设施层面展开更深的结合。

因为无影灵构并不参与机器人本体设计,也不替代企业定义模型路线,只是提供稳定的云上工作空间,让不同技术路线的机器人团队都可以更高效地开展研发。

直白点说,机器人公司负责回答「机器人应该如何工作」;无影灵构负责解决「研发这件事如何更高效完成」。

有没有觉得这条路径,和云计算的发展非常相似?

云计算没有替互联网公司创造产品,也没有决定应用应该如何创新。

但它把服务器、存储、网络这些过去需要企业自己建设的基础能力,变成了可以按需调用的公共资源。

最终,互联网公司的竞争焦点也从「谁有更多服务器」,转向「谁能做出更好的产品」。

而现在,具身智能行业也在经历类似变化。

当算力、环境和研发工具逐渐基础设施化,机器人公司的竞争重点,也将从「谁搭建了更多底层设施」,转向「谁能让机器人更快学会新技能,并真正进入真实场景」。

One more thing

技术本质上没有壁垒,壁垒是迭代速度,技术领先只是时间红利。

这是谌骅给出的判断。

在具身智能这个技术路线尚未收敛、各家都在快速试错的阶段,时间红利就是一切。

实际上,无影灵构在具身智能之前,已经在 AIGC 的 3D 内容生成、工业设计的实时渲染、影视广告的后期制作这些高算力 3D 场景里跑了好几年。

那些行业同样被高端工作站的采购周期折磨,同样面临项目来了缺算力、项目走了机器闲置的窘境,同样需要在云端完成低延迟的 3D 交互。

只不过,具身智能对这套基础设施的要求更苛刻:

仿真场景的 3D 交互要更实时,ROS2 和 Isaac Sim 的镜像要更完整,数据安全策略要更严格,算力弹性要更灵敏。

从这个角度看,具身智能更像是高算力 3D 云工作站的一个极限考场。

基础设施从来不抢主角的戏,它只是把已经铺好的路,往更多需要的地方多修一程。

具身智能恰好是这一程里,目前最着急赶路的那批人。

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

评论
大家都在看