量子位 23小时前
奥特曼点名:他才是AI界最重要的研究者,但几乎没人知道他
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

最新访谈中,奥特曼给出了一个罕见的评价:

「他可能是 AI 历史上最重要、却不太为人所知的研究者。」

这个人就是Alec Radford,真 · GPT 之父。

你可能没听过他,但你大概率用过他发明的东西。

GPT-1、GPT-2、CLIP、Whisper,他都是论文第一作者。

此外,他还参与了 GPT-3、DALL · E、Scaling Law、GPT-4 和 GPT-4o 等一系列关键工作。

奇怪的是,这样一个履历几乎横跨大模型每次关键转向的人,没有博士学位,也很少接受采访。

ChatGPT 红遍全球时,聚光灯下几乎看不到他的身影。

但如果顺着过去十年的 AI 论文往回翻,会发现一个更奇怪的现象:

每当模型开始获得一种此前没有的通用能力,Alec Radford 的名字,往往已经提前出现在作者栏里。

OpenAI 真正起飞,从招进 Alec 开始

最新一期《Invest Like The Best》节目中,主持人问奥特曼:

「这家公司一路走来,你最欣赏的幕后功臣是谁?」

奥特曼脱口而出,是Alec Radford

Alec 做出的工作,后来真正演变成了 GPT 系列。

除此之外,他还不断启发、引导身边的人,把研究推向一些后来被证明极为重要的方向。

《连线》也同样给过一个分量极重的判断:

OpenAI 的崛起之路,真正始于它聘用了当时还默默无闻的 Alec Radford。

2016 年,Alec 加入 OpenAI。那年他只有 23 岁。

那时,他还是个半夜吃菠萝洋葱披萨、和同学一起打 Kaggle 比赛的毛头小子,在波士顿的宿舍里创办了一家小型 AI 公司:Indico

接受邀请加入 OpenAI 后,Alec 也没觉得多重要,反而感觉这份工作「有点像读研究生」。

没有太多短期压力,也没有必须立即做成的产品。他可以自由寻找一个当时还没人知道答案的问题:语言模型究竟能干什么?

他的第一次尝试,是拿 20 亿条 Reddit 评论训练语言模型。数据规模不小,结果却没什么用。

这个实验和 OpenAI 早期的许多探索一样,失败了。

但 OpenAI 让他继续做下去,时任 CTO 的 Greg Brockman 回忆:

「我们当时就觉得,Alec 很厉害,就让他做他想做的事吧。」

于是,这个年轻人得以继续尝试他的实验。但很快,他就受限于 OpenAI 的算力不足。

既然跑不起更大的实验,Alec 便把范围缩小,找来大约 1 亿条亚马逊商品评论,让模型做一件简单到近乎乏味的事:根据前面的文字,预测下一个字符

这个过程中,一个意外出现了。

虽然没有人教模型什么叫好评、什么叫差评,但模型内部有一个神经元,开始主动区分评论的正负情绪。

把它调向一个方向,模型更容易生成好评;调向另一个方向,它便开始吐槽商品。

OpenAI 后来把它叫作「无监督情感神经元」

这次实验第一次给出了 Alec 真正想找的答案:

当模型被要求在足够多的数据上完成预测任务时,它可能自行学会一些训练目标里从未明确写出的能力。

Ilya   Sutskever 还鼓励他跳出亚马逊评论,让模型去学习规模更大、内容更多样的文本,甚至是整个互联网。

问题是,以当时的神经网络架构,处理如此庞大的数据可能需要数年。

但很快,OpenAI 迎来了好运。因为在 2017 年,谷歌那篇改写 AI 进程的论文《Attention Is All You Need》,横空出世。

Ilya 一眼就看中了 Transformer 架构。他的第一反应是:「这正是我们一直在等的东西!」

Alec 随即把 Transformer 接到此前的实验路线上。他找来 BooksCorpus 数据集,其中包括 7000 多本尚未正式出版的英文书籍,题材横跨爱情、冒险和奇幻。

与许多句子被打散的数据集相比,书籍保留了长篇连续叙事,更适合让模型学习前后文之间的远距离关系。

他并没有像谷歌那样用 Transformer 做机器翻译,而是让它预测下一个最可能出现的词。

机器有了反应:一个词,接着一个词,再一个词——每个新词都是从那七千本书中隐藏的模式推断出来的。

对 Alec 来说,「这两周内取得的进展,比过去两年加起来都多」。这套实验最终成为 GPT-1 的预训练基础。

他与同事开始谈论一个叫「Big Transformer」的方向:不要给模型设计更多精巧规则,直接把模型、数据和计算规模做大,看看它还能学出什么。

2018 年,这条路线有了正式名字:

Generative Pre-trained Transformer(生成式预训练 Transformer),简称 GPT。

第一篇 GPT 论文共有四位作者,排在第一位的,就是 Alec Radford。

GPT-1 没有立即轰动世界,但它给 OpenAI 带来了一样更重要的东西:方向。

Alec 取得突破后,OpenAI 管理层作出了一系列关键决定。他们开始把研究资源从机器人等分散项目中收拢,集中到语言模型。

比起继续设计复杂的新结构,团队更愿意收集更多数据、投入更多算力,把已经显示出潜力的方法继续放大。

一年后,GPT-2发布。

它的参数量从 GPT-1 的 1.17 亿增加到 15 亿,训练数据也从 7000 多本书扩展到约 800 万个网页。

GPT-2 论文共有 6 位作者,Alec 仍然排在第一位,并与 Jeffrey Wu 为共同一作。

这一次,模型不再需要针对每项任务重新训练。只靠预测下一个词,它已经能尝试翻译、问答和摘要,甚至在多个零样本测试中取得不错的成绩。

2020 年初,OpenAI 把这种关系写进《神经语言模型的 Scaling Laws》论文。

Alec 同样在 10 位作者之列。此前依靠一次次实验积累的判断,开始被描述成可以预测的数学规律。

同年 5 月,OpenAI 把模型进一步放大到 1750 亿参数,做出了 GPT-3。

此时,论文作者已经从 GPT-1 的 4 人增加到 31 人。

第一作者变成 Tom Brown,Alec 排在第 29 位,仅位于 Ilya Sutskever 和 Dario Amodei 之前。

署名位置的变化,也暗示了 GPT 项目性质的改变。

它不再是 Alec 主导的少数人实验,而是 OpenAI 调动研究、工程和算力共同完成的大型项目。

Alec 最早推动的路线,已经变成这家公司最重要的技术战略。

但就在 GPT 真正开始为外界熟知、即将产生巨大影响的时候,Alec 却已经把目光移向了别处。

语言之外,他又连续押中图像和语音

GPT-3 发布后,Alec 做回了他的老本行:图像。

早在加入 OpenAI 之前,他最有影响力的作品就是DCGAN

他与 Luke Metz、Soumith Chintala 把卷积网络引入 GAN,解决了这类模型难以稳定训练的问题。

他们还发现,模型在学习生成卧室图片时,会自行形成关于床、窗户和场景结构的视觉表征。

后来反复出现在 Alec 研究中的那种直觉,此时已经露出雏形:

只要找到一个足够通用的训练任务,模型可能在完成任务的过程中,自己学出更多能力

其实吧,这中间还有个八卦。

2016 年,黄仁勋在英伟达大会上展示 DCGAN 生成的图像,却把主要功劳归给了 Yann LeCun 当时领导的 Facebook 实验室。

Alec 和几位同伴坐在波士顿办公室里看直播,非常受伤。

不久后,Alec 就离开波士顿,加入 OpenAI。

他的朋友 Victoroff 甚至认为,这次被忽视是 Alec 决定前往 OpenAI 的重要原因之一。

几年后,他带着 GPT 重新回到图像。

2020 年,OpenAI 发布Image GPT:把图片展开成一串像素,再像预测下一个词一样,预测下一个像素。

Alec 排在论文作者第二位。

它证明,GPT 并不天然属于语言。只要数据能够被表示成序列,同一套方法也可以用来学习图像。

只是逐个生成像素实在太慢。半年后,DALL · E把图片压缩成视觉 Token,再将文字和图像放进同一条 Transformer 序列。

「牛油果形状的扶手椅」「遛狗的萝卜宝宝」,这些从未存在的组合第一次被模型画了出来。

与 DALL · E 同一天发布的,还有CLIP

这一次,Alec 重新回到共同第一作者的位置。

OpenAI 拿出从互联网收集的 4 亿组图文对,让模型只做一道选择题:哪段文字和哪张图片是一对?

没有固定类别,也没有为每项任务专门训练。

最终,CLIP 在没有使用 ImageNet 训练集的情况下,零样本识别准确率已经与早期有监督训练的 ResNet-50 相当。

图像之外,他也在尝试声音。

2020 年的Jukebox把音频压缩成离散编码,再让 Transformer 像生成文字一样生成音乐。

两年后,同一条路线通向了更实用的Whisper

Alec 又排在论文作者第一位。

OpenAI 从互联网上收集了 68 万小时音频及其文本,数据并不完美,却包含不同语言、口音、噪声和使用场景。

Whisper 没有专门针对某一张榜单优化,在多个不同来源的数据集上进行零样本测试时,它却表现得更加稳健,更能应对真实世界里的口音、背景噪声和专业词汇。

这些工作表面横跨图像、语言、多模态和语音,背后却源自 Alec 的同一个判断:

少规定一些规则,多提供一些数据和算力,通用能力可能自己出现。

他似乎总能比行业共识早一步,找到下一个值得放大的简单任务。

OpenAI 最神秘的男人

大佬的辉煌过往,不胜枚举,介绍到这里就结束了。

回到他本人,几乎可以说「曾是」OpenAI 最神秘的男人。

与他的论文影响力相比,Alec 几乎不经营个人品牌。

虽然有 X 账号,坐拥 7 万粉,但他很少围绕自己发东西,大多是转发。

上面置顶的,至今还是 2018 年发布 GPT-1 时的那条消息。

「这是我过去一年一直在做的事情。」

他先列出 CoVe、ELMo 和 ULMFiT 三项启发来源,然后用一句颇为朴素的话介绍成果:

「一个 Transformer 语言模型,只需少量调整,就能被迁移到各种自然语言处理任务。」

谁能想到,这项工作预告了一个全新的时代?

关于 Alec 的公开长篇采访,寥寥无几;而他的个人网站,也简单得近乎空白。

只有姓名、「Latest Posts」和分页按钮,几乎没有其他内容。

(连照片都一直用同一张,大佬实在太低调了)

这与他的行业地位形成了一种奇怪的反差。

公众谈起 OpenAI 和 GPT,最先想到的是奥特曼和 Ilya Sutskever;但研究者谈起过去十年的关键论文,却很难绕过 Alec Radford。

奥特曼在最新访谈中形容,如果去问那些与 Alec 共事过的人,他们当然会先说:

这是一个「几十年一遇的天才」、极具创造力的思考者,对自己的研究有极深的理解。

但话说完之前,每个人都会补上另一句:

他也是他们合作过的最善良、最好的人之一。

One More Thing

不过,这位评价超高的 GPT 之父,在科研上确实挺不走寻常路的…

2024 年 12 月,Alec 离开工作近九年的 OpenAI,从事独立研究。

但当所有人都期待他做出下一个 GPT 的时候——

Alec 跑去搞了个「老头 AI」。

今年 4 月,他和 Nick Levine、David Duvenaud 共同推出Talkie

这是一个拥有 130 亿参数的「古董语言模型」,基础模型使用 2600 亿个 Token 训练。

它的预训练语料有一条硬规矩:

1931 年 1 月 1 日之后出版的英文材料,统统不!准!进!

所以,它读过蒸汽机、飞机和第一次世界大战,却不知道电视机、互联网和第二次世界大战后来发生了什么。

更不可能知道 Python。

但就这么个老古董,研究人员给它看了几个 Python 程序示例,再让它解决 HumanEval 编程题。

它居然真的写出了几段简单代码。

这个实验真正测试的是:一个从未接触现代计算机的语言模型底座,获得少量新示例和后训练后,能以多快的速度吸收一项完全陌生的技能?

啥?你是说当全网都还在猛猛 Scaling、想办法让模型读得更多的时候…

GPT 之父却反手把它「断网」了近一百年??

如果模型没见过答案,依然能够现学现用,那它靠的究竟是记忆,还是学习?

也不知道大佬这次,究竟又提前押注了什么…

不过按照他的惯例,等外界终于看懂这道题时,他本人多半已经跑去做下一道了 ~

参考链接:

[ 1 ] https://x.com/InvestLikeBest/status/2086849947119333878?s=20

[ 2 ] https://www.wired.com/story/what-openai-really-wants/

[ 3 ] https://www.bostonglobe.com/2023/06/10/business/how-couple-olin-college-students-helped-spark-ai-chatbot-revolution/

[ 4 ] https://www.newyorker.com/books/under-review/can-sam-altman-be-trusted-with-the-future

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—    —

点亮星标

科技前沿进展每日见

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 奥特曼
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论