
编译 | 茄子
编辑 | 程茜
智东西 8 月 3 日消息,昨天,OpenAI 联合创始人、现 Anthropic 预训练团队成员、AI 大神安德烈 · 卡帕西(Andrej Karpathy)在 X 展示了一种模型测试的新方法。他让 Claude Opus 5 将《指环王》开篇的故事用 Three.js 制作成 3D 动画,预算 100 万 token。最终,Claude Opus 5 运行约 2 小时,写出约 5500 行代码,任务成本约为 10 美元(约合人民币 68 元),卡帕西认为成片虽然有些粗糙,但很有趣。

与 " 用 SVG 画一只骑自行车的鹈鹕 " 这类静态测试相比,《指环王》测试把任务从一次代码生成扩展到持续约 2 小时的完整制作流程。
Claude Opus 5 需要理解原文、拆解场景、创建多边形资产,将人物和物体放入三维坐标,再编写镜头与动画代码,并在运行过程中检查和修改结果。最终交付物不是视频模型合成的画面,而是一个能够在浏览器中运行的 Three.js 程序。
Claude Opus 5 根据《指环王》开篇生成的 Three.js 动画画面(图源:X)
但测试也暴露了模型的短板。Claude Opus 5 不能高效观看连续视频,也无法进入场景试玩,只能缓慢截取不同时点的画面逐张检查。卡帕西称,Claude Opus 5 因此出现了数次错误,最终成片仍有不少粗糙之处。
芬兰手游公司 Supercell 创意 AI 主管、AIGC 创作者鲁普 · 雷尼斯托(Roope Rainisto)提议,将程序化动画输入 Seedance 等视频模型,提高画面质量。卡帕西赞同这一思路,认为程序化代码可以负责分镜和控制,视频到视频模型则负责纹理和最终视觉效果。

一、从骑车鹈鹕到搭建中土世界,卡帕西把静态测试扩展为两小时 3D 任务
过去测试大模型视觉编程能力时,开发者经常让模型 " 用 SVG 画一只骑自行车的鹈鹕 "。这类任务结果直观,生成时间短,也方便比较模型能否正确理解物体、空间关系和代码语法。
卡帕西认为,模型能力已经开始越过这类单幅图像测试的范围。他此次将任务扩展为一个长程项目,向 Claude Opus 5 输入《指环王》开篇第一段,提供 100 万 token 预算,并要求该模型用 Three.js 把文字内容渲染出来。
Three.js 是一款面向网页的 JavaScript 3D 库。开发者可以用它处理场景、灯光、阴影、材质、纹理和三维数学运算,并在浏览器中绘制 3D 内容。
这意味着 Claude Opus 5 面对的并不是一次简单的 " 文字转画面 " 请求。该模型需要先理解原文涉及的场景和叙事元素,再将这些内容拆解为程序能够调用的几何资产,确定它们在 x、y、z 三个坐标轴上的位置,并编写镜头、动作和时间线代码。
经过约 2 小时运行,Claude Opus 5 生成了约 5500 行代码,用程序化方式完成了故事渲染。卡帕西评价成片 " 有些粗糙,但很有趣 "。并且,令他感到难以置信的是,Claude Opus 5 能够在三维坐标中摆放和组织多种多边形资产,编写动画代码,并最终生成可以运行的内容。
卡帕西在评论区附上了 " 鹈鹕骑自行车 " 测试提出者西蒙 · 威利森(Simon Willison)的博客链接,供用户查看更多测试案例。他还公开了此次项目的源码和浏览器版本,用户可以直接运行或继续修改。卡帕西随后调侃称,可以期待 "《侠盗猎车手》霍比屯版 ",它说不定会赶在《侠盗猎车手 6》之前问世。

二、Claude Opus 5 生成动画,配音由 ElevenLabs 生成
这段作品并非全部由 Claude Opus 5 独立完成。有网友在评论区询问,视频中的音频是否也由 Claude Opus 生成。卡帕西回复称,配音来自 AI 语音公司 ElevenLabs,而且由他手动选择声音,因为他对配音效果有明确偏好。

卡帕西同时称,大模型可以比较容易地调用此类语音 API。此次实验中,Claude Opus 5 主要负责 Three.js 场景、资产和动画代码,ElevenLabs 则承担配音生成。
Three.js 官方账号在评论区给出专业建议,提示模型应当合理使用 " 实例化网格 " 优化渲染性能。实例化网格能够批量渲染外形、材质一致、位置不同的物体,削减 GPU 渲染指令开销。
卡帕西将这条建议交给 Claude Opus 5 后,模型检查了场景代码。按照模型给出的统计,原版霍比屯场景包含 1569 次独立渲染调用;如果对草地、野花等重复物体使用实例化网格,只需 4 次调用即可渲染 1154 个同类物体。
这组数据说明,Claude Opus 5 生成的初版程序虽然能够运行,但没有主动采用这一常见的 3D 渲染优化方式,仍需外部专业反馈。

三、10 美元让定制化世界成为可能,但 Claude Opus 5 还不会 " 玩 " 自己的作品
卡帕西没有披露输入、输出和工具调用分别消耗了多少 token,因此 100 万 token 是任务预算,不能直接理解为模型最终输出了 100 万 token。
此次实验的价值,不在于用 10 美元替代一部专业动画电影,而在于让过去投入产出比过低、几乎没人愿意制作的一次性项目变得可行。大模型能够连续工作约 2 小时,完成数千行只服务于特定场景的代码。
卡帕西认为,这类能力可能催生按需生成的高度定制化世界。未来用户只需给出一个主题,大模型就能临时生成一个类似《侠盗猎车手》的可探索世界。例如,用户可以进入模型生成的中土世界,以旁观者、非玩家角色或原作人物的身份参与《指环王》的故事。
不过,模型的生成能力已经走在审查能力之前。Claude Opus 5 无法连续观看动画或控制角色试玩,只能逐张检查截图。这种方式不仅速度慢,还会丢失动作和镜头之间的连续信息。
卡帕西称,Claude Opus 5 在检查和修改过程中数次出错。该模型虽然能够生成 5500 行代码,却无法确认最终结果在画面、空间和时间线上是否全部正确。
与静态 SVG 相比,这项测试不再只看模型能否生成一张图,而是观察模型能否持续规划、运行程序、检查结果并修复错误。实验说明,Claude Opus 5 已经可以把一段文字转化为可运行的 3D 场景,但视觉审查和错误修复能力仍未跟上代码生成能力。
卡帕西的实验没有提供一个新的标准化评测分数,但提出了另一种观察模型的方法 : 将模型放进开放式、跨模态、长时间运行的任务中,检查它能否把文字理解、代码生成、空间推理和视觉反馈串成完整工作流。
结语:模型已经能够搭建场景,完整游戏仍需形成测试闭环
从静态 SVG 到可运行的 3D 程序,大模型能够承担的任务长度和复杂度都在增加。一些过去因制作成本过高而无人实施的定制内容,已经可以用较低成本快速验证。
要让这类程序进一步变成可玩的游戏,模型还需要理解连续视频、操作游戏角色,并根据试玩结果定位和修改代码。目前,这些环节仍需人类参与。


登录后才可以发布评论哦
打开小程序可以发布评论哦