文|万湑龙
2025 年 11 月 5 日,小鹏在广州办了第七届科技日。
何小鹏在台上宣布,小鹏的定位从 " 未来出行探索者 " 升级为 " 物理 AI 世界的出行探索者,面向全球的具身智能公司 "。同一场发布会,他一次摆出了四样东西:第二代 VLA 大模型、Robotaxi、全新一代人形机器人 IRON,还有汇天的飞行汽车。
从那天起," 物理 AI" 成了这家公司的旗号。今年 4 月 1 日," 小鹏汽车 " 正式改叫 " 小鹏集团 ",名字里拿掉了 " 汽车 "。再往后,第二代 VLA 在 3 月推送上车,8 月机器人业务拿下超 9 亿美元融资。一路走到 8 月 27 日这场叫 "TIME 时间 " 的活动,小鹏给第二代 VLA 做了一次重大升级。
这次升级的主题只有一个词:时间。去年科技日发布的第二代 VLA,解决了机器 " 看见世界、做出动作 " 的问题;而这一次,它要解决的是 " 理解世界在流动 " 的问题。这一步有多重要?说白了,一个只看得见眼前、记不住刚才的司机,永远算不上会开车。
为什么 " 看懂时间 " 这么难
先把时间拨回 2023 年。
那一年 7 月,谷歌 DeepMind 发布了一个叫 RT-2 的模型,第一次把 " 视觉、语言、动作 " 缝进同一个大脑,学术圈管它叫 VLA。几乎同一时期,特斯拉把端到端的自动驾驶推上车,何小鹏第二年 6 月专门飞到旧金山去试了一版 FSD,回来还在微博上找马斯克借更新的内测版。那时候信的人不多,但方向已经变了。
要理解小鹏这次做的事,得先知道智驾这门手艺是怎么一步步走到今天的。最早的一代,靠工程师写规则,红灯停、绿灯行、车道线里走,一条一条 if-else 堆出来。它的毛病摆在明面上:真实世界的路况比规则本厚得多,规则永远写不完。于是有了端到端,把感知和决策塞进同一个神经网络,信息不再在模块之间传来传去地损耗。再往后,是为了补上 " 可解释 " 这个洞,把语言塞进来,才有了 VLA。

麦吉尔大学、清华、小米那批人合写的一篇综述,把 VLA 的演进切成了四段:Pre-VLA、模块化 VLA、端到端 VLA,再到增强型 VLA。国内能打的,理想在做 MindVLA,元戎启行、华为、蔚来也各自押了路线。按华金证券的梳理,特斯拉、地平线、Momenta 走端到端,理想、小鹏、元戎启行做 VLA,蔚来、华为、吉利则在试世界模型。三条路,最终都指向同一个终点:让车学会预测。可有一条,谁都没绕过去:不管模型多大,它看到的世界始终是 " 当下 "。
而真实的世界,偏偏不是一张张静止的照片。前车为什么突然刹停,那个行人为什么折返,旁边那辆车是不是要加塞,这些判断靠的不是 " 看见 ",是 " 记得 " 和 " 预判 "。一个看不懂时间的司机,反应再快,也只是个高级点的应激反射。
这恰好戳中了黄仁勋一直在讲的那件事。他把 AI 的进化排成四步:感知、生成、代理,最后是物理 AI,那种能走出屏幕、在真实世界里动手干活的 AI。今年 1 月的 CES 上,他放话说物理 AI 的 "ChatGPT 时刻 " 已经到了。数字 AI 学的是互联网上的文本和图片,物理 AI 得在一条条真实的马路上学因果,而因果的载体,就是时间。
记住 30 秒,预判 6 秒
小鹏这次拿出来的东西,拆开看是三件。
第一件叫 Infini-VLA 长时序架构,负责 " 记住 "。它让模型能留住前 30 秒的道路信息,把连续发生的事串成一条线,而不是一帧一帧孤立地看。30 秒什么概念?城区道路五六十公里的时速,30 秒够一辆车从正常行驶到稳稳停住,也够一个行人横穿好几条马路。过去模型只盯着 " 此刻 ",现在它脑子里装着刚刚发生的 30 秒,判断的底气自然不一样了。
第二件叫流式自回归推理,负责 " 边看边想 "。老路子的逻辑是 " 看、算、输出、再看 ",串行着走,像一格格推。新法子把这几件事并起来做,端到端的响应速度快了 300%。碰上前车急刹、行人折返、旁车加塞,车子的反应会像个开了半辈子出租的老司机——谈不上神,但稳,且不慌。

第三件叫 X-Foresight 预测世界模型,负责 " 预判 "。它根据目标物的位置、速度、运动趋势和路况,推演未来 6 秒周边交通参与者的可能动作。6 秒,正好是那辆突然变道的车从并线到驶入你前方的时间,也是一次急刹从发生到停稳的时间。把 " 接下来 6 秒 " 算进决策里,这就不是应激,是提前量。
顺带一提,这三件事背后还藏着一个叫 MoT 的混合架构,干的是调度:城区、园区、泊车,不同场景交给不同的 " 专家 " 去处理,免得互相干扰。说白了,就是把模型的能力分门别类,该谁上谁上。
合起来的效果,官方给了一个数:综合安全能力提升 20 倍。这个数具体怎么算的,口径是什么,我一时拆不干净,但方向是对的——安全这件事,从来不是靠某一个指标堆出来的,是 " 记得住、想得快、猜得准 " 三样凑齐了,才谈得上。
更大的模型,是为了走得更远
" 为什么我们需要一个更大的模型?" 小鹏通用智能中心负责人刘先明在现场问了这么一句,又自己答了:参数量够大,泛化能力才够强,而泛化,是快速进入全球市场的前提。
于是端侧模型的参数量扩大了 3.5 倍,是主流 VLA 的 15 倍以上。这里有个很多人会忽略的点:智驾模型是跑在车上的,端侧算力就那么多,参数越大,越考验压缩和部署的功夫。这也是为什么他们同时拿出一个叫图灵 VLA 2.0 Lite 的蒸馏版,把大模型的能力 " 挤 " 进算力更低的平台,让老车主也能沾光。9 月首批推送,G9L 的 Max 版先上。
还有那个叫 Master Agent 的东西,更值得盯一眼。它建在自研的 Omni 全模态模型上,把负责开车的 VLA 和负责聊天的座舱大模型 VLM,第一次缝成一个整车大脑。以前的车是 " 听懂一句话 ",现在是 " 理解你想干什么 " ——你说一句 " 靠边停 ",它自己找位置、自己变道、自己停稳,从语音指令一路走到自主执行。小鹏还把 Robotaxi 上的部分 L4 能力,下放到了量产车。

全球化这件事,这次也交了底。第二代 VLA 已经在德国做完了本地化验收测试,用中国数据训练的模型,几乎不加本地数据,在德国城市道路上的体验和国内高度接近。目标是明年上半年先在欧洲拿到监管许可,再陆续交付。这背后其实是个挺硬的事实:一套能跨语言、跨路权、跨驾驶习惯还不太掉链子的模型,靠的是通用能力,不是堆本地规则。而这,又绕回了那句 " 为什么需要更大的模型 "。
一套底座,两副身体
8 月 24 日,就在这场体验日前三天,小鹏的机器人业务完成首轮融资:超 9 亿美元,投后估值超 63 亿美元,刷新中国具身智能单轮私募融资的纪录。IDG 资本领投,高榕参投,腾讯和阿里两家战略投资方也进来了。
这事跟智驾有什么关系?关系大了。因为驱动那辆车的模型底座,和驱动那个人形机器人 IRON 的,是同一套。IRON 身上那三颗图灵 AI 芯片,算力 2250 TOPS,跑的就是小鹏那套物理世界基座模型,端侧部署,不用远程遥控就能自己干活。全身 76 个自由度,单手 21 个,这些数字放在人形机器人圈子里,是排得上号的。而且这具机器人做得相当拟人,首创的全包覆柔性晶格,把关节和线束都藏进柔软的 " 皮肤 " 里,好看,也安全。
说白了,小鹏现在讲的故事,从 " 一家会做智驾的车企 ",悄悄换成了一套物理 AI 底座:先在一辆车上跑通,再复制到一具人形机器人上,往后还有飞行汽车。这也是他们今年 4 月 1 号把 " 小鹏汽车 " 正式改叫 " 小鹏集团 " 的底气:名字里少了个 " 汽车 ",格局里多了整个物理世界。
广州那边也没闲着。天河那个约 11 万平方米的机器人量产基地,今年 2 月就动了工。按计划,IRON 今年年底量产,先在自家门店和园区里试用,2027 年再对外交付。从一辆车到一具机器人,从一门手艺到一个平台,这一步迈得不小,但逻辑是通的:物理世界里的难题,本质上是同一类难题。
护城河不在模型里
写到这里,我得说句泼冷水的话。
如果小鹏只是发布了一个更大的模型,这新闻撑不了几天。模型这种东西,今天你 3.5 倍,明天他 5 倍,卷参数是没有尽头的。真正难抄的,是支撑这个模型一遍遍变强的那个东西——他们叫它 AI Infra。

数据、训练、仿真、评估、部署、算力,这条链子小鹏搭了好几年。钱也是实打实砸进去的,2026 年一季度研发投入 29.1 亿元,同比涨了 46.8%,上半年累计 58.2 亿元,相当一部分压在图灵芯片、VLA 大模型这些物理 AI 项目上。百万级的车队在路上跑,攒下的是十亿级的数据资产;单次训练的数据吞吐量到了 1 亿 clips,比半年前涨了 10 倍。数据越多,暴露的问题越充分,模型迭代越快,又能生产更多数据——这是个正向循环,转起来了才有复利。
何小鹏在财报电话会上说过一句我印象很深的话:Scaling Law 在物理 AI、在自动驾驶和机器人身上,一样成立。翻译过来,就是 " 大力出奇迹 " 这件事,在马路和车间里同样有效,只要你能源源不断把真实世界的反馈喂回模型。
这也注定了,物理 AI 这事急不得。数字 AI 可以靠抓取互联网上的海量文本一夜起来,物理 AI 得一辆车一辆车地跑,一个场景一个场景地磨。护城河不在某一版模型有多惊艳,而在你能不能让模型持续进化。产品会换代,模型会过时,能留下来的,是持续迭代的那套能力。
我一直觉得," 时间 " 是这个行业里最被低估的一个词。车厂们吵了这么多年的算力、参数、芯片,争的其实是同一件事——谁能让机器更早地明白,世界是连续流淌的,不是一张张静止的截图。让 AI 记住过去的 30 秒,预判接下来的 6 秒,表面看是参数的跃迁,往深了说,是机器第一次学着用 " 因果 " 而不是 " 像素 " 去看路。
而对一家公司来说,时间同样是最诚实的裁判。那些靠一版爆款模型、一场融资故事起高楼的公司,时间会替我们记住它们的下场;而真正愿意把十年的数据、十亿级的场景、一代代工程师的耐心压进去的企业,时间也终会给它一个交代。
AI 学会看时间,用了这么多年。而时间会记住,谁是真的在做事。


登录后才可以发布评论哦
打开小程序可以发布评论哦