51CTO技术栈 20小时前
AI下一站是空间智能!AI教母李飞飞:开发者不只要写应用,还要给AI创造一个能行动的世界
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

编辑 | 姜篇

"There is more beyond language intelligence."

李飞飞:语言智能之外,还有更大的世界。

大模型能写代码、做数学题,也能从一张照片里认出桌子和杯子。可如果把它放进一间陌生的房间,它未必知道杯子离桌边还有多远,伸手去拿会不会碰倒旁边的水壶。

李飞飞把这条差距称为 AI 的下一章:空间智能。

备注:李飞飞被业界称为 "AI 教母 ",是 ImageNet 项目的主要推动者之一。她现任斯坦福大学计算机科学教授、斯坦福以人为本人工智能研究院联合主任,同时也是空间智能公司 World Labs 联合创始人兼 CEO。

在新一期访谈中,李飞飞用了两个多小时讨论人类视觉、AI 学习和创造力。

讲到 World Labs 时,她把话题拉回正在发生的技术变化:大语言模型让机器掌握了文字和概念,下一步要让它理解空间、时间和物体之间的关系。

开发者很快就会遇到这类模型。游戏场景、机器人训练、建筑设计和虚拟制作已经开始接入世界模型。

过去 API 返回文字或图片,现在 World Labs 想返回一个可以进入、编辑和继续运行的环境。

以下为访谈内容,我们进行了翻译与整理。

主持人提到了一个场景。

一个孩子见过猫以后,即使只看到书架后面露出一截尾巴,也可能认出那是一只猫。他没有看过几百万张猫的图片,更没有浏览过整个互联网。

李飞飞:孩子也许只见过 3 只猫,最多 10 只。可今天的模型之所以能稳定识别相似场景,靠的是规模庞大的训练数据。人类如何用少量经验形成对物体和环境的理解,至今没有被完全解释。

李飞飞认为,孩子只看过很少的样本,也能识别新的场景;这种学习机制仍未被当前 AI 复现

软件团队也有同样的问题。

故障原因写在日志里,Agent 可以继续追;业务规则只存在于老员工脑子里,它只能猜。仓库缺少文档、服务边界没人记录、事故复盘散落在聊天记录里,模型读完整个代码库也补不齐这些信息。

给 Agent 准备上下文,不能只靠扩大窗口。

图像模型可以给画面里的物体打标签,但空间理解要回答更多问题:杯子在哪里,桌面有多高,前面的物体遮住了什么,人转过身以后房间是否还是同一个房间。

机器人面对的要求更高。

它伸手拿杯子之前,要估计距离和方向;动作执行以后,还得预测杯子、水壶和桌面会发生什么变化。

语言能描述这些关系,却无法完整替代三维结构和物理过程。李飞飞因此认为,语言智能不是 AI 能力的终点。

"Unlocking spatial and physical intelligence is really the next chapter."

李飞飞:解锁空间与物理智能,才是 AI 的下一章。

李飞飞介绍 World Labs 的技术方向,空间与物理智能将补上语言模型尚未覆盖的能力

这也是 " 世界模型 " 与聊天机器人的区别。聊天机器人根据输入生成回答;世界模型还要维护一个环境,理解其中的物体和规律,并估计一次动作会把环境变成什么样。

World Labs 将这套能力拆成渲染、模拟和规划。渲染负责呈现世界,模拟负责计算变化,规划负责决定下一步怎样行动。真正困难的地方,是让三者在同一个循环里保持一致。

李飞飞在访谈中介绍了 World Labs 的做法。

用户输入一句话、一张图片或一幅草图,模型尝试把它变成三维世界。这个世界可以移动视角、继续扩展,也能交给创作工具和机器人训练流程使用。

李飞飞介绍 World Labs 的目标,将文字、图片和草图转换成可探索的三维环境

漂亮的 3D 画面只能证明模型会生成画面,不能证明它理解了这个空间。

开发者还要检查尺度是否稳定、换个视角后物体会不会变形、碰撞关系是否正确,以及离开后再回来,环境是否仍然保持原样。

World Labs 在官方技术文章中也承认,世界模型内部存在不同目标。

世界模型距离稳定的生产工具还有一段路。中间缺的那些评测、编辑、存储和运行能力,正好都是软件工程要补的部分。

训练世界模型主要是图形学和机器人团队的工作,把它做成产品却离不开普通应用开发。

一个线上家装工具需要账户、项目管理和多人协作;一个机器人训练平台需要数据版本、任务队列和评测系统;一个可探索的 AI 场景,也需要在网页和移动端稳定加载。模型负责生成世界,产品仍需要前端、后端、数据和平台工程。

开发者可以关注几项更具体的能力:

· WebGPU、Three.js 和实时 3D 渲染;

· 3D Gaussian Splatting 等新型场景表示;

· 世界模型 API 的异步任务、存储和前端集成;

· 仿真环境与真实设备之间的数据闭环;

· 空间一致性、物理正确性和动作成功率评测。

大多数开发者不需要从头训练世界模型。把生成的环境接进产品,并让它可编辑、可评测、可运行,已经足够形成一条很长的开发链路。

这场访谈里,李飞飞反复使用一个词:agency。

它可以理解成人决定目标、主动学习并采取行动的能力。李飞飞并不主张远离 AI。她担心的是,工具变得方便以后,人开始被动接受答案,连提出问题和判断结果的过程也一并省掉。

"It is about enhancing and augmenting humanity."

李飞飞:AI 应该增强人的能力。

李飞飞认为,AI 应该增强人的能力,而不是夺走人的选择权

她谈到年轻人使用 AI 时,给出了两种都不理想的结果。

一种是因为担心作弊,学校拒绝让学生使用 AI;另一种是学生把思考全部交给工具,逐渐失去学习动力。

李飞飞认为,AI 教育最坏的结果,是工具拿走年轻人的学习主动性和动力

她甚至建议学校教授 Prompt,因为向模型准确描述背景、限制和目标,本身就是一种需要练习的能力。

李飞飞把 Prompt 视为一项需要教育和训练的能力

开发工作也是如此。Agent 可以读仓库、生成场景或运行测试,开发者仍要决定为什么做、结果能不能用、失败后怎样收场。AI 进入的环境越复杂,这些判断越不能交给一次模型调用。

过去两年,开发者熟悉的 AI 入口一直是聊天框和代码编辑器。

空间智能把下一批入口指向了浏览器里的 3D 环境、机器人模拟器、设计工具和现实设备。

语言模型不会因为世界模型出现就消失。比较现实的组合是:语言模型理解意图,世界模型建立环境并模拟变化,Agent 负责调用工具和执行动作。

开发者可以先做一件很具体的事:把世界模型当成一种新的可编程媒介,而不是一张更炫的图片。去调用 API,检查生成结果能否保持一致,把它接进现有产品,再看看渲染、交互、评测和数据链路里还缺什么。

当生成结果要被真正使用时,缺口会立刻出现。下一批开发工具和产品,可能就从这些缺口里长出来。

参考链接:

https://www.youtube.com/watch?v=N5AQFYtqx8Q

——好文链接——

推理工程才是 AI 真正的战场!旧金山 AI 工程师:开发者别卷 Prompt 了,模型决定会不会做,推理系统决定能不能交付

程序员远没到 " 完了 " 的时候!Sam Altman:OpenAI 不包办一切,模型只是底座,开发者仍是 AI 生态的主角

AI 时代,最强开发者更像 CEO!Claude Code 创始人:" 一人军队 " 时代将要到来,好想法成为新的稀缺资源

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

李飞飞 ai 斯坦福 斯坦福大学 创始人
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论