如果把 AI 送回 1911 年,只让它掌握爱因斯坦所能了解的知识,AI 能否在 4 年后的 1915 提出相对论?
这个听起来有些离谱的测验,来自诺奖得主、Google DeepMind 联合创始人哈萨比斯。
哈萨比斯真正想考的,是 AI 能不能仅以 1911 年的知识水平,直面当时的知识和物理难题,自己提出一套新的解释框架,并完成一套超出训练材料的推理,而不是只会照着答案复读。
如果能做到,他认为这将成为检验 AGI 的一项有力测试。
而这个设想最巧妙的地方就在于,科学史已经告诉我们发生了什么,只要我们能把知识节点控制好,就有机会对照着历史,观察模型有没有获得超越训练数据的推理能力。
Nature 在文章中,还给这类测试起了个相当响亮的名字:
爱因斯坦测试。
更有意思的是,还真有人动手做了。
今年 3 月,独立研究者 Michael Hla 把知识截止时间进一步提前到 1900 年,并从零训练了一个历史语言模型GPT-1900,试图让它重新发现光量子、狭义相对论和广义相对论。
实验中,GPT-1900 竟然吐出了一段跟爱因斯坦 1905 年论文高度相似的论述:
光可能不是连续的,而是由许多彼此分离、频率不同的部分组成。
但这场实验最终并没有诞生一个 "AI 爱因斯坦 "。
因为 GPT-1900 在大多数物理任务上都失败了,其亮眼回答也高度依赖人类整理好的问题和提示,就连那个号称封闭在 1900 年的知识世界,也没有完全挡住现代 AI 的影响。
Nature 在最新研究中梳理了这些尝试,并指向了一个比 "AI 有没有答对 " 更难的问题:
AI 究竟能不能创造真正的新 idea?以及它距离成为一名科学家,还差什么?
把 AI 关进 1900 年,它冒出了 " 光量子 " 的影子
220 亿 token,喂出一个 "1900 年的大脑 "
Michael Hla 将自己的项目命名为Machina Mirabilis。
这个名字借用了爱因斯坦的" 奇迹年 "。
1905 年,26 岁的爱因斯坦接连发表 4 篇改变物理学的论文,涉及光量子、布朗运动、狭义相对论和质能关系。
这个爆发式产出的一年,后来被称为 "Annus Mirabilis",即 " 奇迹年 "。
△AI 生图
Hla 想知道:如果一个 AI 拥有爱因斯坦当时能够接触到的知识,它能不能也迎来自己的 " 奇迹时刻 "?
为此,他借助 Andrej Karpathy 的 nanochat 训练框架,从零训练了一个33 亿参数的 Transformer 语言模型,并将其称为GPT-1900。
模型的主要预训练材料来自 1900 年以前的书籍和报纸,总计约 220 亿 token。
为了增强它的研究能力,Hla 又收集了 2600 多部历史物理书籍、期刊和科学著作,包括牛顿的《光学》、麦克斯韦和法拉第的相关著作,形成了约2.9 亿 token的历史物理语料。
此外,Hla 还专门清理了可能泄漏答案的数据。
如果一份文献中出现 " 爱因斯坦 "" 量子力学 "" 相对论 " 等现代概念,整份文献都会被删除。现代人添加的前言、脚注,以及明显不属于 1900 年前的词汇,同样需要被过滤。
一通操作下来,一个理论上 " 不知道 20 世纪物理学 " 的大脑诞生了。
GPT-1900 摸到了光量子的门槛,但这场考试可能早已 " 漏题 "
随后,Hla 给 GPT-1900 出了道光电效应题,大意是:
为什么频率不够高时,光再亮也打不出电子;而提高频率,却能让电子获得更多能量?
同时 Hla 还附上了几条关键线索:
光的频率低于某个门槛时,再亮也不行;
超过门槛后,提高亮度主要会增加打出的电子数量,而提高频率才会增加电子的动能;
把当时流行的经典假设也摆了出来,方便模型对照判断哪里出了问题。
这些矛盾,原本最终是靠爱因斯坦的光量子解释破的局:
光的能量是一份一份传递的,每一份的能量与频率有关。
Hla 想看看,GPT-1900 能想到哪一步?
功夫不负有心人,GPT-1900 真在一次回答里冒出了这样的描述,大意是:
这确实挺神似爱因斯坦 " 能量一份份传递 " 的解释,Hla 也把它形容为 " 直觉的闪现 "。
但千万先别急着把诺贝尔奖递过去。
Hla 坦言:GPT-1900 距离 " 重新发现光量子 " 还有很远。
它在大多数物理任务上都翻车了,而那些看似突破的回答,可能只是模型在拼接合理的词句,谈不上形成了真正可靠的物理理解。
更何况,在整个测试里,Hla 已经替它筛好了现象、理好了矛盾,模型要做的,只是找出哪项假设可能出错,并给出解释。
这比科学家自己找问题、定方向,可容易太多了。
爱因斯坦当年可没有人替他划重点。
而且更麻烦的是,它所在的 "1900 年 " 也不是完全密封的:
Hla 虽给这个 "1900 年的大脑 " 做了数据清洗,实验过程中却仍借助了现代 AI Claude的帮助——用 Claude Sonnet 4、Claude 3 Haiku 等模型生成指令问答,强化学习也靠现代模型评分。
△详情可点进文末仓库链接查看
这意味着,Hla 虽然过滤了其中涉及现代知识的内容,但这座 "1900 年的房间 " 也没有完全隔绝现代知识。
实验者自己也在日志中承认:现代模型的介入,让这场实验的 " 零污染 " 人设有点立不住了…
毕竟研究者很难证明,GPT-1900 到底有没有偷看过光量子理论。
也就是说,考 AI 创造力之前,研究者得先证明一件事:它没偷看答案。
只要有一条后世信息漏进训练集," 重新发现 " 就可能变成一次偷偷摸摸的知识召回。
可就算未来真能造出完全零污染的历史模型,一个更根本的问题依然悬而未决:
仅仅复现了正确答案,就足以让 AI 被称为科学家吗?
研究人员给出的答案是否定的。
会冒出新 idea 之后,AI 距离科学家还有多远?
Google DeepMind 研究员 Tom Zahavy 在一篇题为《LLM 无法跳跃》的立场论文中,把科学推理分成了三个层次。
第一种是归纳:从大量例子中总结规律。
第二种是演绎:从已有前提出发,推导出必然结论。
第三种则是溯因:面对一个异常现象,发明一个此前不存在的原因或解释。
Zahavy 认为,当前的大模型已经非常擅长归纳,也在迅速提高演绎能力,但仍缺少爱因斯坦式的 " 溯因飞跃 "。
模型可以沿着一条已经铺好的逻辑链往下推,却很难从零开始提出一套全新的解释框架。
△标题就说明了一切
无独有偶,Sendhil Mullainathan 研究一个学习行星轨道的基础模型时,也撞见了同样的现象:
在设定好的行星轨道任务里,模型预测得头头是道;一换新场景,就没法举一反三地运用牛顿力学了。
它更像是给每套数据临时拼出一套规则,还分不清哪些理论真正正确、值得检验,哪些只是碰巧符合眼前的数据。
这就好比一个学生背下了所有历年真题的答案,但却始终没有学会题目背后的底层原理,于是,老师稍微改个数字,他就不会做了。
MIT 计算机科学家 Jacob Andreas则一针见血地指出,AI 产生一套相对论式表述本身可能并不是最困难的部分,真正困难的是它能不能判断哪些理论是正确的,或者至少值得被实验检验?
毕竟会生成理论只是第一步,知道哪个理论值得赌上时间、经费和职业生涯,才可能让 AI 成为一名真正的科学家。
△AI 生图
此外,Andreas 还强调:
怎么判断一个想法值不值得深挖、又如何评估它的重要性;这才是 AI 与人类专家最大的分水岭。
因为真实的科研工作从来不是解答一道整理好的习题,而是在混沌中自主做出判断。
或许未来有一天,随着科技的发展,AI 真的能通过 " 爱因斯坦测试 ",推导出相对论级别的成果;
但在宣布 "AI 成为爱因斯坦 " 之前,AI 至少得向所有人证明一件事,即:
在没人替它划重点时,它照样能自己找到那个值得追问的问题、判断问题的价值并主动验证和修正。
否则,它就永远只会复述已有知识,而非真正的科学家。
参考链接:
[ 1 ] https://www.nature.com/articles/d41586-026-02804-x?utm_source=x&utm_medium=social&utm_campaign=nature&linkId=63673104
[ 2 ] https://michaelhla.com/blog/machina-mirabilis.html
[ 3 ] https://github.com/michaelhla/gpt1900/blob/master/PROJECT_LOG.md#4-instruction-data-generation
[ 4 ] https://www.tomzahavy.com/files/llms-cant-jump.pdf
[ 5 ] https://arxiv.org/abs/2507.06952
[ 6 ] https://x.com/Nature/status/2099077628900565498
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见


登录后才可以发布评论哦
打开小程序可以发布评论哦