作者 | 汤安迪
编辑 | 周欢
" 我们有语言的基础模型,没有物理的。"
2021 年,加州理工学院的一群人跟气象学家说:我们要用 AI 预测天气。
气象学家们的反应很统一,别闹了。数值天气预报是几十年堆出来的 bottom-up 物理建模,流体动力学方程一行一行解出来的,你们 AI 凭什么?
一年后,这个叫 FourCastNet 的模型,精度逼近传统数值模式,速度快了几万倍,跑在消费级 GPU 上。
再一年后,DeepMind 和华为跟进了。华为那个模型,叫盘古气象。
带头的人叫 Anima Anandkumar,Caltech Bren 讲席教授,前 NVIDIA AI 研究负责人,AWS 云 AI 团队的创始成员之一。
最近她上了 Latent Space 的 AI for Science 访谈,83 分钟,核心观点就一句:
我们有语言的基础模型,但我们没有物理的基础模型。
这句话对中文读者的信息量,比看起来大得多。
当所有人在卷 LLM 的时候,她在卷托卡马克。当监管者把 AI 等同于聊天机器人的时候,她的模型在给聚变堆做数字孪生。而这两条线的最大潜在买家名单里,中国都在前排:华为的盘古气象是她亲口点名的跟进者,EAST、BEST、CFETR 这些中国聚变装置,恰好是她等离子体仿真技术最对口的客户。
以下是这场访谈的完整内容,小标题为基哥自己加的。
从张量到英伟达
Latent Space:先介绍一下你自己吧。
Anima Anandkumar:我在 AI 领域干了二十多年,比深度学习还早。那时候概率模型的理论基础都得从头建。深度学习起飞之后,我也一只脚踩在工业界。在 NVIDIA 领导 AI 研究,更早之前在 AWS 帮忙创立了云 AI 团队,做了差不多十年前第一批云 AI 产品。
一只脚在工业界,一只脚在学术界,这让我一直在想一件事:怎么把理论和实践捏在一起,做大规模的 AI,但也是有原理的 AI。
Latent Space:你最近的工作里有个叫 TorchLean 的东西,它和你 "AI for Science" 的大计划是什么关系?
Anima Anandkumar:我的大命题是 AI 和科学的结合。大家现在都在想怎么用语言模型做科学。可以,语言模型能产生假设、产生想法。但想法不够,瓶颈是测试和验证:这些东西在现实世界里到底成不成立?
所以我的精力集中在:怎么造出有保证的 AI。保证它在物理世界里能 work。一条路是神经算子,把物理世界建模出来,保持物理正确。另一条路是符号化验证:你说一个定理是对的,那就在 Lean 这样的形式化语言里证明它。
TorchLean 就在这个范畴里。不止验证数学命题,还要验证神经网络自己声称能做到的事。比如你要把神经网络放进控制环路,控制无人机也好,控制核反应堆也好,你需要鲁棒性。TorchLean 让神经网络成为验证环路的一部分。
Latent Space:神经网络看起来那么不受约束,你具体能证明什么?输入输出的界?
Anima Anandkumar:TorchLean 是一个整体框架。你可以用类似 PyTorch 的抽象方式写神经网络,但它是完全在 Lean 里形式化的。然后我们把 certified robustness 的算法,比如 CROWN,都在这个框架下实现了。
Latent Space:举个具体例子。我在运行一个核反应堆,我不想让它熔毁,你能给我什么样的保证?
Anima Anandkumar:最自然的就是 certified robustness:输入被扰动一定量,输出会跟着扰动多少,敏感性分析。对不同神经架构自动拿到这些界,就不只是训练神经网络在控制环路里表现好,而是同时照顾安全、鲁棒、稳定,这些都是控制系统里的人操心的事。
(基哥:这段话值得每个做具身智能的人读三遍。把神经网络塞进机器人控制环路,正是当下中国机器人公司每天在做的事。而 " 自动给出扰动上界 " 这种 certified robustness,就是机器人安全认证的学术前沿:比 " 我们测了一万次没摔 " 高一个维度。)
为什么是傅里叶
Transformer 在物理世界是死路
Latent Space:进入神经算子。傅里叶神经算子是你最早的架构之一,为什么这么成功?
Anima Anandkumar:它在效率和表达力之间卡到了一个很好的平衡点。傅里叶空间是个对偶空间,它让我们能捕捉非局部现象。自然界大量现象。
流体、材料形变、量子化学,都是非局部的:微分是局部的,但它的逆运算是积分,积分是非局部的。这些模型能抓住这一点,同时傅里叶变换本身又高效。
Latent Space:对 AI 工程师来说,这是不是就等于 " 还是同一个神经网络,只不过在傅里叶域里干活 "?
Anima Anandkumar:最简单的理解:把 Transformer 里的 attention map 换成傅里叶,其他东西还在,非线性、残差连接、升维到更高通道空间。好架构的最佳实践都保留了,但傅里叶帮你拿到 all-to-all 的全局依赖,不用付出 Transformer 那种二次复杂度。
Transformer 是二次复杂度、全连接;傅里叶变换是准线性复杂度、仍然是全局连接。这就是那个甜蜜的中间地带。
Latent Space:我来扮演一下反方。视觉和视频模型不也在学现实世界的映射吗?
Anima Anandkumar:分辨率太低,这是关键。物理世界我要什么分辨率?一千乘一千乘一千,那已经是上百亿的量级了。图像和视频现在根本不做这么高的分辨率。
而且视频模型是自回归的,本质只预测下一步;它们是为了 " 看起来好看 " 服务的,不是为了精确仿真。流体、等离子体、材料形变这些现象要求高保真,你不能说 " 每维扔 50 个网格点 ",细节丢了,现象就错了。
再算一笔账:语言是一维的,context length 到百万级大家就已经在挣扎了。物理是 3D 加时间,每维几百到一千个网格点,相当于几千亿到一万亿的 context。全世界的算力都不够跑一个这样的 Transformer,而且你还得把这些算力全堆在一个地方。所以必须换架构。
Latent Space:但物理数据也不够多吧?
Anima Anandkumar:永远不可能像语言那么多。我们的天气模型只有大约 5 万个样本,5 万张高分辨率全球天气图,跟语言模型比什么都不是。别的领域更少,因为仿真太贵,真实数据又拿不到。
所以这里必须认真想归纳偏置,必须把物理约束加进去,不能只靠数据。我 20 多年前的本科毕业论文做的是分数阶傅里叶变换,我完全同意不能用石器时代的古典技术,特征学习、表达力、可优化性都得要。
但在物理世界,架构设计必须更动脑子。
天气、气候
" 只有一个地球 "
Latent Space:聊聊天气。FourCastNet 是怎么开始的?
Anima Anandkumar:2021 年,我们找有意思的应用场景,天气数据是开源的。
ECMWF 的 ERA5 再分析数据。数据在那儿,那就去试呗。很多气象学家劝我们别做,说传统天气预报是几十年精雕细琢的物理建模。结果我们训出来,精度几乎追平传统模式,速度快几万倍。超级计算机要跑的东西,消费级 GPU 就能跑。我觉得这件事改变了所有人的想法。
之后 DeepMind、华为,很多家都在一年后跟进做了自己的模型。我们是第一个把天气模型开源的,而且是很宽松的许可证,所以公司、气象机构都能在我们上面搭东西。现在全球南方的小气象机构也能有过去只有大机构才有的预报能力,这是在把天气建模民主化。
Latent Space:你的洞察是什么?别人为什么没想到?
Anima Anandkumar:第一层是:传统方法每次都重新解一遍偏微分方程,而 AI 从数据里学规律,可以一样准但快得多。
第二层是:短期天气和长期气候,传统上是两套系统分开做的。但对我来说,只有一个地球。
如果一个模型敢叫基础模型,它就该同时做两周的天气预报和几十年的气候模拟。FourCastNet 3 做到了,因为我们把地球的球面几何放进去了。其他架构在短期天气上精度不错,但你让它跑几个月试试,很快就数值爆炸。因为它假设世界是个矩形,世界不是。
Allen AI Institute 现在基于我们的神经算子架构做了气候模型。这是唯一能跑通的 AI 气候模拟器。其他架构做不了气候,因为气候要求你把地球当成球,在长 rollout 里保住这个信息。
Latent Space:训练数据长什么样?训练目标是什么?
Anima Anandkumar:全球天气,给定当前的风场、湿度等等,自回归地预测下一个六小时,然后滚下去。只训六小时单步,加一点点多步微调。我知道这听起来很疯狂,但它现在能稳定滚好几个月。
分辨率是 0.25 度,这是数据决定的。验证极端天气靠 ensemble:在初始条件上加噪声,跑几十条轨迹,看飓风路径的概率分布,算不同区域的登陆概率。传统模式跑 ensemble 贵到离谱,AI 快几万倍,意味着能跑超大规模 ensemble ——这对风险评估是质变。
2023 年秋天 ECMWF 把 AI 天气模型开放给公众,是个大节点。像飓风 Lee,我们的模型比标准模式提前好几天正确预测了登陆。极端事件人命关天、经济代价巨大,公众和气象学家就是在这些事件之后真正买账的。
Latent Space:直觉上,极端事件样本那么少,AI 应该做不好才对。
Anima Anandkumar:这也是我们第一次尝试时的惊喜。更广义的经验是:物理世界可能更宽容。飓风这种极端事件有非常明确的物理签名。
它极端,但极端得很有规律。所以你可能不需要那么多样本。物理世界有大量结构,传统数值方法挖不出来,因为它们追求的是 " 任何场景下都要把方程解对 "。
AI 是从数据里学,它能发现这些问题其实比想象中好对付。等离子体、聚变堆也是一样,几千个样本,我们就能把 disruption 预测得很好。
聚变堆的数字孪生
快一百万倍
Latent Space:讲讲聚变。
Anima Anandkumar:这是托卡马克。我们能对复杂的等离子体演化建模,比传统仿真快一百万倍。某种意义上我们在造等离子体的数字孪生,然后就能做更多事—,比如下一步是做控制,用完整有效的物理,去预防 disruption,让聚变可持续。
Latent Space:给观众解释一下 disruption。
Anima Anandkumar:等离子体物理学家最头疼的现象:某一瞬间,整个等离子体收缩成一小束,猛射进容器壁,可能打坏反应堆。所以必须在那之前停机,可持续聚变也就无从谈起。这是个大瓶颈。
物理实验太贵了。你在数字孪生里捕捉得越多,同时保证物理有效性,就能在数字世界里做设计。我们和英国原子能管理局(UKAEA)合作,在美国也和几家机构合作。托卡马克在做,stellarator(仿星器)也在做,仿星器很棘手,但理想目标是在数字孪生里把它们设计出来。
作为做 AI 的人,我不提前选边。我乐意和不同路线合作,看 AI 能不能加速所有路线。物理世界里你造一个装置,就得砍掉很多冒险路线,只押最可能成的那个。AI 让我们能同时探索。
碳封存、汽车、光刻、量子点
Latent Space:还有哪些应用?
Anima Anandkumar:可能性是无穷的。碳封存:把二氧化碳封到地下,建模它怎么扩散、储层压力怎么累积、几十年里怎么迁移,比传统仿真快得多。
还有任意几何形状上的空气动力学:汽车、飞机。这里有个漂亮的隐空间技巧——你可以把一辆车拓扑变换成一个甜甜圈,在甜甜圈上建模,再变回来。在隐空间里把物理学好,模型就能跨几何形状泛化。
Latent Space:更大的图景是 " 物理的基础模型 "?
Anima Anandkumar:这就是未来。现在我们看到的都是窄 surrogate,我们在不断加宽。但理想状态是一个模型能处理多种现象,而且是多物理耦合,真实世界里所有物理是耦合着一起来的。
另一半更有意思:逆问题。不止正向仿真,还要问 " 最好的设计是什么 "。以前是工程师拍脑袋设计,再去风洞里验证;现在 AI 直接给出优化设计,而且有物理护栏,你知道它真的能工作。
比如逆向光刻的掩模设计,这是个逆设计问题。还有量子点的门设计,非线性光子学。共同点都是:正向模型仿真物理,然后逆着优化出最好的设计。人类不擅长这个——面对高度非线性的现象,人类想不出 " 这几个门这么组合就能把电子拉到位 "。我们的合作者手动搞了很久搞不定,AI 给出的设计又高效,又因为仿真在环路里,我们知道它 work。
Latent Space:多物理之间能迁移吗?没见过的物理能泛化吗?
Anima Anandkumar:完全没见过的物理没法迁移,你说要超越标准模型,那没有任何数据,不可能。但如果是:见过热传导、见过材料拉伸,现在要处理 " 热导致形变 " 的耦合——这种可以用少得多的样本微调出来,因为它分别认识这两种现象。我们在很多论文里都看到了这种课程式迁移。
Latent Space:领域专家想上手,门槛在哪?
Anima Anandkumar:神经算子是开源库,已经在 PyTorch 生态里被广泛使用,文档、架构、示例、配方都有很多。去玩就是了。
理论转应用,再转回来
一个完整的圆
Latent Space:你早年做很理论的东西,六七年前开始大规模做应用。是什么触发了这个转变?
Anima Anandkumar:我感觉自己是跟着 AI 一起长大的。神经网络不好使的年代,你得建理论基础,祈祷它能带你走到算法 work 的地方。
张量方法就是那个思路:概率模型难,但张量方法给了我们实用、可并行、可大规模、还有理论根基的路。
深度学习起飞后,理论不应该成为约束,它应该成为使能器。所以我去了 AWS,去了 NVIDIA,把东西做到规模,把手弄脏。
现在我看到一个完整的圆:纯数据驱动的方法在饱和。一方面是效率问题——怎么让模型更省能、更省硬件。另一方面是物理世界这种地方:数据不够,要求的是硬外推。而发现,按定义就是外推,你永远不会有关于新发现的数据。所以又得回到有原理的思考:架构设计、算法设计、损失函数设计。把深度学习中所有好用的东西拿走,但让它们更有原理。
"AI 不只是语言模型 "
Latent Space:你最近加入了联合国科学咨询委员会。想做什么?
Anima Anandkumar:很荣幸。现在地缘政治上是个微妙的时刻,我不是那方面的专家。但涉及 AI 的议题,让科学家在场很重要。我希望提供不带偏见的科学证据:AI 怎么影响全球,怎么让红利抵达每个人,怎么让获取更民主,怎么控制意料之外的伤害。
天气模型这边我已经很兴奋了——用更好的天气气候建模服务农业,联合国在全世界有专门的机构和地面人员。
我觉得有一点必须说:现在很多监管框架把 AI 等同于语言模型。是,语言模型能操纵人,有各种该管的坏处。但 AI for Science 不一样。一刀切正是很多问题来源。
Latent Space:最后一个固定问题:如果你能凭空消除你领域里的一个瓶颈,你选哪个?
Anima Anandkumar:更多算力。我知道这答案很懒。但我是说给研究的算力。
国家实验室在建更多超算,这是好事。没有算力我们没法实验、没法创新。这一点我怎么强调都不过分。
Latent Space:给大家一个行动号召吧。
Anima Anandkumar:去玩神经算子库,动手试不同的架构和用例。但更重要的是想清楚一件事:AI for Science 不只是语言模型和 agent,那些某种意义上只是外部的壳。在 AI 真正理解物理世界之前,不是把它当符号,而是能基于它仿真、设计、控制,就永远缺一大块。
这一块,现在没人补。
小结
这场 83 分钟的访谈,信息密度最高是那个框架:
LLM 是一场语言的游戏,物理世界是另一场游戏,两场游戏的规则不一样。
语言的世界里,数据管够、scaling 为王、Transformer 通吃。物理的世界里,数据永远稀缺、分辨率是无底洞、归纳偏置必须回来、外推才是发现的定义。
这个框架的兑现路径异常清晰:华为盘古已经证明中国公司能在这条路线上做出世界级跟进;EAST、BEST、CFETR 意味着全球最大的聚变装置买家在中国。
" 人工智能 +" 行动里,AI for Science 恰好是唯一自带物理护栏、不被 LLM 内容监管拖累的赛道。
而做机器人的那批人,迟早要面对她反复讲的那个问题,控制环路里的神经网络,你拿什么保证它不疯?
语言模型教会了 AI 说话。Anima Anandkumar 想教会 AI 的,是物理。
谁先说,不重要。谁先造出来,才重要。
•END •
欢迎点击奇偶工作室视频号,看最新视频 ~
↓↓↓
Question. Write.Narrate. Believe. Become a story. 易简传媒的愿景是提问和传播商业故事,让读者更开阔,更聪明。有 2500 万微信粉丝关注我们的账号,欢迎大家关注:
↓↓↓


登录后才可以发布评论哦
打开小程序可以发布评论哦