财联社-深度 16小时前
数百亿热钱涌入世界模型,智源王仲远:世界模型是未来,但现在谈现金流还早
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

《科创板日报》9 月 18 日讯(记者 李明明)2026 年以来的 AI 圈,没有哪条赛道比世界模型更拥挤。

2 月,AI 教母李飞飞创立的 World Labs 完成 10 亿美元融资;一个月后,图灵奖得主杨立昆离开 Meta 创办的 AMI Labs,以 10.3 亿美元种子轮刷新欧洲 AI 创业史纪录。

国内的热钱更猛:极佳视界三个月内连续完成三轮融资、吸金约 35 亿元,千寻智能开年融了 45 亿元;英伟达推出号称全球首个全开源物理 AI 全能模型的 Cosmos 3,小鹏在 CVPR 上亮出世界模型技术图谱,吉利发布 WAM 世界行为模型。

据《科创板日报》不完全统计,前 7 个月国内相关融资超 666 亿元,超 50 家企业获投。

但一位头部 VC 合伙人对融资热潮泼了冷水,严格按照预训练标准筛选,真正在做世界模型的创业公司,最多不过 3-5 家。多数项目只是把融资书上的赛道名称,从仿真、3D、视频生成换成了世界模型。李飞飞今年 6 月更直言:世界模型是当今 AI 领域最重要、也最被滥用的术语之一。

喧嚣之中,智源研究院是个特殊的存在——它不是公司,不进行融资,却发布了研发中的悟界 · Physis-v0.1,定位为全球首个通用世界基座模型。

近日,《科创板日报》记者在北京专访了智源研究院院长王仲远。他表示,VLA 是当下,世界模型是未来。并判断,第一条稳定现金流,可能最早出现在工业仿真和影视游戏两条线交织的地带。

现在谈稳定现金流,还有点早

世界模型最清晰的付费方是谁?自动驾驶、机器人、游戏影视、仿真训练、工业数字孪生——这是几乎所有从业者都会被问到的问题。

" 说实话,现在谈世界模型有稳定现金流,还有点早。"王仲远的回答没有任何修饰。

他把几条线拆开来看:自动驾驶和工业数字孪生对物理真实性的要求最高,付费意愿也最强,但世界模型目前的能力,还不足以满足它们核心环节的需求;游戏和影视是相对宽容的场景,对幻觉的容忍度更高,有可能最先看到付费案例,但更多是作为辅助工具存在;机器人领域,本质上还是要先把硬件、数据、模型这个循环悖论解开——具身能力不足,限制了真机数据的采集;数据稀缺导致模型能力弱、落地难,于是能力更加无法提升。

王仲远的判断是:第一条稳定现金流,可能最早出现在工业仿真和影视游戏两条线交织的地带——比如用世界模型做合成数据、做预演评估。

这个判断的另一面,是他对行业现状的警惕。演示很强、收入很弱,是今年世界模型公司的通病。怎么区分 " 能签合同的世界模型 " 和 " 能发论文的世界模型 "?

" 核心区别就一条:它能不能在真实场景里稳定地、可预期地工作。" 王仲远说,很多 demo 看起来很漂亮,但那是选了最好的 case。

他给出一个自认为最不会骗人的指标:闭环成功率。把世界模型作为策略评估器,接一个 policy 进来,它在模型里成功执行的概率,跟它在真机上执行的概率,是不是高度一致。" 如果这个指标对不上,说再多都没用。"

猪在天上飞:被误用的世界模型

世界模型并不是新概念。

1943 年,心理学家 Kenneth Craik 就提出,人的心智通过运行现实的小尺度模型来推理;上世纪九十年代它被引入计算机科学,2018 年 David Ha 的《World Models》让它重新成为显学。真正把它推上风口的,是 2024 年春节横空出世的 Sora —— OpenAI 用 World Simulator 介绍这个视频生成模型,概念从此彻底泛化。

" 一群猪能在天上和飞机一起飞吗?现实世界不行,但视频生成模型可以。" 王仲远反复强调一句话:视频生成不等于世界模型。视频生成模型的训练数据里有大量科幻电影,目标从来不是还原物理规律——物体凭空消失、违背重力,在内容创作里是想象力,放到物理世界里就是错误。要是世界基座模型无法区分真实和虚幻,进入物理世界真正干活,就会产生重大风险。他半开玩笑地说,机器人装上这种大脑,可能会误认为自己是钢铁侠。

他还有一个更朴素的反问:每个人闭上眼睛都能对未来做简单预测,但没人能在脑子里生成高精度画面。人类的世界模型从来不是渲染器,机器为什么必须是?

在王仲远看来,当下被冠以世界模型的路线大致有四条:以语言为中心的多模态理解模型、以像素为中心的视频生成模型、以三维结构为中心的空间智能模型、以视觉表征为中心的 JEPA 系列模型、——距离真正面向物理世界的基座模型,都还有很大距离。

有意思的是,过往在许多人的认知中并没有将基于大语言模型所构建的 VLM、VLA 归结为世界模型技术路线之一,但近期 GPT-6 Astra 的发布,在预训练中以语言为中心、融入具身数据,实现对具身模型的降维打击,一定程度再次证明了其对技术的预判性。

不过,真正面向物理世界的基座模型,仍需同时处理语言、动作、视觉、触觉等多重要素,因此智源也在尝试走第五条路,将所有模态压缩进统一的潜空间,再由不同解码器还原成文本、视觉或动作。他承认这是一场押注," 可能是错的,过两年结果会验证 "。

这背后是一个更大的判断:大语言模型的核心是预测下一个词,世界模型的核心应该是预测下一个物理状态。一瓶水和一瓶咖啡放在桌子旁边,跌落时产生的物理状态完全不同,人类一看就知道。世界模型要补的,就是这块人类与生俱来、机器完全缺失的常识。

世界模型在他这里也不只是模拟器:不是生成数据,而是基于未来可能的状态做出当下最优的决策,有点像《奇异博士》,能预测各种不同的未来,基于当下状态选择最优的结果。大语言模型已经在文案、编程上造就了巨头,但物理世界才是真实的人类社会生产生活环境——这个空间和产值的上限,是非常巨大的。

VLA 是当下,世界模型是未来

谈到世界模型,绕不开具身智能。王仲远的概括很干脆:VLA 是当下,世界模型是未来。

王仲远不否认 VLA 的价值——特定场景、特定任务,采集特定数据就能完成,工厂里分拣、打包已经在真实流水线上干活。但局限同样清晰:模型偏大,响应速度满足不了真实物理世界的动作频率;更根本的是,解决不了泛化、长程和空间物理规律的理解推理。" 整个具身大模型的发展,可以类比大模型在 GPT-3 之前的探索期。"

所以他给行业开的药方是沿途下蛋:一边在相对封闭的工业场景落地——工厂环境固定、枯燥、能规避伤人风险,会是最快规模化的场景——一边在落地过程中持续采集数据,反哺基座模型训练。" 我们不能等到数据完全 Ready,再来探索技术路径。"

当下的世界模型确实还没到 GPT 时代,因为数据非常缺乏。这是王仲远对行业瓶颈最直接的表述。

文本数据语义清晰、易于获取,物理世界的 3D、4D 数据却极度稀缺、散成孤岛。但他认为视频数据是被低估的富矿——最容易海量获得、又真实反映物理世界,它里面的有价值信息,现在的技术还没充分挖掘出来。

他讲了一个观察很久的例子:一个两岁的小女孩,父母从没教过她拆糖果、串蓝莓,但她天天刷短视频,看着视频里的小姐姐吃,自己学会了把五颗蓝莓串在一根牙签上——通过视频学习技能,再通过实践反复尝试直到成功。" 这就是强化学习的本质。从第一性原理看,海量视频数据的价值还远没有兑现。"

算力上他相对乐观:悟界 Emu3.5 已验证了与大语言模型同架构可以 Scale Up,算力基础设施、训练框架、工具链大都可以复用;Physis 模型的潜空间学习本质上要求极致压缩,算力需求反而可控。对更远的未来他留了个口子:人脑只有 10 到 20 瓦功耗,吃的是蔬菜,却能训练出极强的世界模型——更经济有效的路径,并非没有可能。

没有公认 Benchmark 的行业

世界模型目前没有公认的评测体系。现有评测大多以视频生成为核心,刷榜成风,他笑言,定义都不明确的时候,你甚至能刷到世界模型榜单第一这样的文章。为此,智源团队提出了 W0 到 W5 的分级体系,类似自动驾驶的 L0 到 L5:从生成逼真视频,到响应动作,到理解物理后果,再到跨领域泛化。

他特别点出动作因果的可溯性——给一个 action,模型能不能正确预测物理后果。智源会做第三方评测的探索," 但这需要跟学界、业界一起推动,不是一家能独立完成的 "。

自动驾驶重监管、机器人重硬件、游戏重内容周期,资源押在哪个可商业验证的场景?王仲远绕开了问题本身:" 我们作为新型研发机构,不会像创业公司那样押注某一个商业场景。我们做的是公共底座——把通用的物理理解能力训出来,通过不同的 decoder 对接不同场景。不押具体场景,但全力押通用的物理基座能力。"

不押什么,同样明白:不做已经被 VLA 跑通、已证明能商业闭环的事——那是企业该做的。他打了个比方:把 M 款模型和 N 款硬件的适配从 M × N 简化到 M+N,让生态里的每家都能在上面生长。

智源行为世界模型创新中心负责人叫陈博远,今年 22 岁,北大元培学院本科生,国际顶会 ACL 最佳论文得主。这个团队正在做的 Physis-v0.1,以预测下一物理状态为核心,版本号只敢定到 0.1。

王仲远不讳言它的早期,他把世界模型的现状比作深度学习的 2012 年:神经网络刚兴起,只能解决具体场景的具体任务,走到 ChatGPT 用了整整十年。" 但现在演化速度更快,可能三年五年就有足够的数据累积。技术是先行的,早于产品,早于系统。"

被问到中美差距——大语言模型时代的通行说法是六到十二个月——王仲远的回答很干脆:" 世界模型方向上没有差距。这绝对是世界上最前沿的方向,我们有机会站在同一起跑线。"

赛道里的热钱还在涌进来,标签还在被抢贴,但一个清醒的判断正在浮出水面:现在所有的热闹,都还只是序章。真正的世界模型,距离我们依然遥远。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 自动驾驶 机器人 融资 科创板
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论