新浪财经头条 10小时前
物理AI重塑智驾
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

来源:巨潮 WAVE

文|谢泽锋

从 " 看见什么做什么 " 到 " 想象接下来会发生,再主动行动 ",物理 AI 浪潮正在重塑智能驾驶的演进路径。

年初 CES 上黄仁勋宣布物理 AI 正进入 "ChatGPT 时刻 " 的倒计时,3 月份的 GTC 大会,老黄又将其定义为继数字 AI 之后的‌下一个万亿级增长浪潮‌。

Momenta R7 量产上车,宇树科技、智元机器人、优必选持续出货,标志着 AI 正从‌数字世界的 " 思考 " ‌(文本视频生成)转向‌物理世界的 " 行动 " ‌(机器人感知、决策、执行)的根本性跃迁。

当 AI 不再只是 " 看 " 世界,而是开始在数字真正的现实世界里理解物体动作和因果联系,智能驾驶行业正在经历一场从 " 数字 AI" 到 " 物理 AI" 的底层重构。

自 2025 年初,比亚迪发动掀桌子式的智驾价格下沉," 全民智驾 " 风起云涌,大幅推动了智驾技术的普及。

步入 2026 年,一段式端到端、VLA(视觉 - 语言 - 行动)、世界模型为代表的技术路线,正推动行业从 " 机器模仿人类 " 向 " 超越人类智能 " 驾驶模式迈进,新一轮发展周期已经开启。

演进

回望历史,智能驾驶的历史演进,本质是从模块割裂到 " 端到端融合 "、从应激反应到智能进化的技术范式革命。

20 世纪初,自动驾驶概念就已出现,1925 年 8 月,世界首辆自动驾驶汽车出现在纽约街头。到 2004 年,DARPA 挑战赛成为行业发展史上的重要转折点。

当年 3 月 13 日,莫哈韦沙漠,由美国国防部高级研究计划局(DARPA)主办的 DARPA 自动驾驶汽大挑战赛正在这里举行。这是世界上首个自动驾驶汽车长距离比赛,卡内基梅隆大学、斯坦福大学、麻省理工以及大众、英特尔等 15 支团队参加角逐。

首届赛事没有完赛者,行驶最远的卡内基梅隆大学 " 红之队 " 才走了全程的不到 5%。然而,就是这 5% 的距离,开启了人类对智能驾驶探索的历程。

DARPA 大挑战赛随后开枝散叶,无数自动驾驶人才都是在这里展现才华后,又落到谷歌、优步、通用、福特、Waymo 等企业,其中就有驭势科技 CEO 吴甘沙。

不过,早期的智能驾驶只能算是辅助工具,依赖规则算法与高精地图,理想甚至将其类比为 " 昆虫动物智能 "。这种模块化割裂的设计,导致系统泛化能力孱弱,无法达到拟人化的水平;

感知、预测、决策、控制模块化分而治之的思路,逻辑性强,但传输过程不可避免产生误解和损耗。

因此,端到端方案焕发生机。

2024 年 3 月,特斯拉在北美推送 FSD V12 版本,其最大的突破是将感知、决策与控制整合为单一神经网络模型,内部称为 "Photon In, Control Out",移除了 30 万行手写代码,用神经网络取代,实现了感知和决策规划两大模块的算法 " 端到端 ",彻底重构了技术架构。

跟随特斯拉的脚步,国内分段式端到端在 2024 — 2025 年大规模落地,一段式端到端与 VLA 技术则在 2025 — 2026 年集中上车。

彼时,业内分为 " 一段式 " 和 " 两段式 " 两个流派,华为、百度 Apollo、小鹏等都是两段式玩家,商汤、Momenta 等则是 " 一段式 " 的拥趸。

时至今日,一段式端到端已成主流。不过早期端到端技术存在明显短板,它是一个 " 黑箱 ",人们难以追溯其决策逻辑,事故发生后也无法快速定位问题。

为此,行业转向 VLA(视觉 - 语言 - 行动模型),它实现了自动驾驶的 " 真 " 端到端。通过融合计算机视觉、自然语言处理与强化学习,构建了集环境感知、语义理解与决策执行的统一智能体,完成了从 " 黑箱 " 到 " 可解释大脑 " 的变革。

随着物理 AI 的到来,达到人类智能甚至 " 超越人类智能 " 成为可能。在保证高效响应的同时,物理 AI 让决策逻辑更具可解释性。

未来五年,VLA 与世界模型这两条路线的深度融合,或将成为终极方案。L3/L4 高级别乃至无人驾驶的世界即将来临。

融合

"VLA 对自动驾驶是锦上添花,很难雪中送炭。"

Momenta CEO 曹旭东认为 VLA 的训练起源于 LLM,其训练侧重点(语义)与自动驾驶的实际需求存在明显偏差。这也就意味着,VLA 语义的优先级远高于驾驶,陷入了 " 好钢没用在刀刃上 " 的困境。因此,Momenta 坚定地选择了世界模型路线。

无独有偶,华为车 BU CEO 靳玉志也秉持类似的观点。他认为,VLA 通过语言大模型将视觉信息转化为文本 token 再进行决策,看似捷径,实则无法真正理解物理世界。VLA 就像 " 背题库的学生 ",在复杂或突发场景容易失效;而世界模型虽研发难度更大,但那才是自动驾驶的终极彼岸。

华为倾向于‌ WA(World-Action,世界 - 动作)‌路径,即跳过语言中间层,直接利用多源感知(视觉、声音、触觉等)构建理解因果逻辑的世界模型,实现更本质的自动驾驶能力。

进入 2026 年,特斯拉 FSD V14 的推出改变了行业认知,大模型能力不是在 VLA 和世界模型之间二选一,而是两者的深度融合。特斯拉在新版本中集成了 xAI 的 Grok 大模型,同时利用世界模型进行‌数据生成与闭环仿真‌。

行业迅速形成了一套被广泛接受的共识。黑芝麻智能 CEO 单记章就此得出:"VLA 加上世界模型,是智能驾驶未来最有可能的技术路线,而且有机会超越人类的驾驶能力。"

如果说,端到端是技术路线,那么 VLA 和世界模型就是在这个路线上分出了两个不同方向上的强化,VLA 增强了理解,世界模型强化了预测。

世界模型的做法是直接给汽车装上一个 " 智能大脑 ",他能模拟物理世界的运行规律,不依赖工程师预设的规则,而是提前通过海量真实数据训练,让模型拥有理解预测物理世界的能力。

因此,VLA 解决的是理解当下的问题,世界模型解决的是预测未来的难题。

时下的实际产业发展中,VLA+ 世界模型的融合方案成为越来越多车企的选择。小鹏曾被认为坚持 VLA 路线,但在 CVPR 2026 大会上,小鹏通用智能中心负责人刘先明明确指出,‌ VLA 与世界模型并非 " 二选一 " 的相互对立关系‌,而是共同构成小鹏物理世界基座模型的两大支柱。

小鹏发布的 X-Mind,正是将预测性世界模型内嵌为 VLA 模型的视觉思维链,让模型在输出动作之前先完成时空推演。

蔚来在 1 月也已将世界模型加闭环强化学习架构推送至数十万辆车,地平线在 6 月底发布的 HSD V2.0 也采用世界模型 + 端到端强化学习的双引擎。

可见,一种深度融合式的方案,已经在全行业铺开。

终局

越来越多的汽车和智能驾驶公司将自己定义为 " 物理 AI 企业 "。

马斯克近年来一直在全球兜售他的 "AI 宏图 ",他说,特斯拉正在从一家汽车公司转变为一家 AI 公司,未来的成长空间主要是自机器人、自动驾驶和 AI 基础设施。

李想也把理想汽车重新定位为一家人工智能企业;何小鹏将小鹏汽车的定位升级为 " 物理 AI 世界的出行探索者,面向全球的具身智能公司 ";Momenta 更是被称为 " 物理 AI 第一股。轻舟智航宣布战略重心从 " 无人驾驶 " 全面升级为 " 通用物理 AI",卓驭科技则转向 " 移动物理 AI",并提出 " 未来存活下来的智驾公司都将是物理 AI 公司 "。

物理 AI 浪潮下,智能驾驶逻辑已经从价格战、堆配战转向 " 基模 " 之战。

过去汽车行业的竞争是 " 堆配置 ",激光雷达数量、芯片算力、续航里程,比拼的是参数堆叠。而在物理 AI 时代,竞争逻辑变为 " 建底座 ",谁掌握物理世界的理解与行动能力,谁就掌握价值链主导权。

甚至,世界模型让智驾、座舱和机器人以及一切智能终端走向技术融合。特斯拉用同一个基础模型驱动 FSD、Optimus 和智能体;用单一端到端神经网络取代模块化架构,实现从自动驾驶汽车到人形机器人 Optimus 的基础模型统一。

理想汽车也已将‌基座模型‌与‌ VLA ‌研发团队合并,以统一技术底座支撑‌智能驾驶‌、‌智能座舱‌及‌人形机器人‌三大业务线;高通把汽车与机器人放进同一个事业群。

华为 ADS 5.0 搭载 WEWA 2.0,云端引入 Multi-Agent 多智能体群体博弈,让无数 AI 驾驶者互相博弈学习;Momenta R7 世界模型已实现量产首发;蔚来 NWM 是中国首个智驾世界模型。

不过,目前所有的智驾系统距离真正的物理 AI 终极形态还相去甚远。一方面,相比大语言模型,世界模型需要巨量的真实世界数据,截至 2026 年 5 月,FSD(监督版)车队累计行驶突破‌ 100 亿英里‌(约 160 亿公里),位居全球第一,而其他新势力品牌由于车辆数较少,累计里程均在数十亿公里,未来还需数据量的积累。

其次,物理 AI 还需高算力芯片和大规模模型训练。有消息显示,特斯拉可能握有约 23 万张 H100 等效算力;小鹏 Robotaxi 则瞄准了 L4 级无人驾驶,搭载 4 颗图灵 AI 芯片,车端算力高达 3000TOPS,号称全球最强;

靳玉志此前表示,2026 年华为乾崑智驾研发投入将超 180 亿元,未来 5 年将至少再砸下 700 亿元用于 AI 算力的提升,其算力规模在 29 个月的周期里实现了 21 倍增长。

随着头部智驾企业迈入物理 AI 赛道,算力竞赛将再上升一个台阶。

写在最后

1988 年.莫拉维克在其著作《智力后裔》中明阐述这样一个观点:对人类来说很难的任务(如逻辑推理、下棋),AI 反而容易完成;而对人类来说很简单的事(如走路、抓取物体),AI 却极难实现‌。

后来,这一问题被业界称为 " 莫拉维克悖论 ",让机器人下棋、解题轻而易举,但让它像婴儿一样感知物理世界却极为困难。

现有智驾正卡在这一环节,看似智能,却缺乏最基本的物理直觉,这也是许多人不敢完全放手的核心原因。

2026 年被称为 " 物理 AI 元年 ",作为物理 AI 上半场的自动驾驶,将是车企角逐的焦点。但距离真正的智能驾驶终极形态,还有相当长的距离。

特别声明:以上内容仅代表作者本人的观点或立场,不代表新浪财经头条的观点或立场。如因作品内容、版权或其他问题需要与新浪财经头条联系的,请于上述内容发布后的 30 天内进行。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 自动驾驶 机器人 物理 智能驾驶
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论