如果想知道 AI 究竟怎样改变最前沿的知识工作,OpenAI 内部正在发生的事情,可能比任何一份就业预测都更有参考价值—— 9 月 6 日,OpenAI 发布了一份少见的内部研究报告《Research acceleration: The view inside OpenAI》。它把视角转向了自己的研究员:过去半年,当 Coding Agent 越来越深入地进入模型研发,研究员到底怎么使用它?工作量有没有发生变化?AI 又在多大程度上参与下一代 AI 的研发?
OpenAI 公布了一个很直观的数字:截至 8 月中旬,如果统一折算成 8 小时工作日,OpenAI 研究部门每投入 1 个人类工作日,同时会产生约 3.1 个 Agent 工作日。
年初时,Coding Agent 在 OpenAI 内部还远没有这么普遍。到 8 月中旬,中位数研究员每天使用的 Agent 推理资源,按照对外 API 价格折算已经超过 600 美元;使用量最高的 10% 研究员,每天甚至超过 7000 美元。
这并不意味着 OpenAI 真的在为每位研究员支付这么多钱,更不能理解成研究员的效率因此提高了 3.1 倍。OpenAI 用这些数字想说明的是另一件事:研究工作正在从一个人逐项完成任务,变成一个人同时调度多个 Agent。
而这种变化,已经开始进入 OpenAI 最核心的模型研发流程。
一、一个研究员,同时跑几个 Agent
2026 年初,OpenAI 研究员对 Coding Agent 的使用还相对有限。随后几个月,Agent 的运行时间迅速增加。到 6 月左右,一个转折出现了:研究部门中 Agent 的总运行时间开始超过人类工作时间。到 8 月中旬,两者的比例已经来到 3.1 ∶ 1。
与此同时,同时运行多个 Agent 的研究员越来越多。OpenAI 专门统计了同时运行 4 个及以上 Agent 的研究人员,其中还包括由 Agent 自己创建的 Sub-agent。
一个研究员的工作台因此变得和过去不太一样。以前,一项实验通常沿着相对线性的路径推进:写代码、运行、等待、检查结果,发现问题后 Debug,再启动下一轮实验。现在,其中一些工作可以被拆开。一个 Agent 修改实验代码,另一个检查基础设施问题,还有 Agent 负责监控实验或者分析结果。
研究员本人则在几个任务之间切换,根据返回结果决定哪些方向继续推进。原本串行的研究流程,第一次有了大规模并行的可能。
二、实验确实变多了,但 OpenAI 没有把功劳全部算给 AI
这是一个关键问题。用了更多 AI,不等于科研进展一定更快。OpenAI 自己也没有把这个结论说满。
报告观察了两个比较容易量化的指标:代码提交和实验数量。两者都在增加。其中,2026 年以来,每位活跃实验人员运行的实验数量总体上升,到今年 8 月,已经达到 OpenAI 自 2025 年 1 月开始统计以来的最高水平。
这一增长与 Codex 使用率的提升同时发生。但 OpenAI 在原文中专门加了一道限定:相关性并不能直接证明因果关系。因为同一时期,研究团队能够使用的计算资源也大幅增加了。研究员跑更多实验,究竟有多少来自 Agent,又有多少只是因为拥有更多 GPU,仅凭目前的数据无法拆开。
原文核心边界:实验数量上涨与 Codex 采用率提高同时发生,但同期可用算力同样显著增加,因此不能简单把增长完全归因于 Agent。
OpenAI 还提醒了另一件事:当越来越多任务被自动化以后,那些最难自动化的任务反而会成为新的瓶颈。如果写代码越来越快,算力可能成为瓶颈;如果算力也足够多,高质量研究想法又可能成为新的瓶颈。AI 加速并不会消灭瓶颈,它更可能只是把瓶颈往后推。
三、AI 开始接手的,已经不只是写代码
比 Agent 使用量增长更值得注意的,是任务本身的变化。OpenAI 借用了 Epoch AI 的一套分类方法,把 AI 研发拆成六个环节:Decide(决定研究什么、继续什么、资源投向哪里)、Design(设计研究思路和工程方案)、Build(编写代码、构建数据集)、Run(训练、评测以及 Serving 等工作)、Analyze(分析实验、模型和部署结果)以及 Communicate(沟通发现、反馈和决策)。

图 1|Researchers are using coding agents in new ways。OpenAI 将研究活动划分为 Decide、Design、Build、Run、Analyze、Communicate 六大类,并展示 1 — 8 月各类任务中的 Agent 输出 Token 变化。
OpenAI 随后分析了 2026 年 1 月至 8 月 Coding Agent 在这些工作中的 Token 使用情况。年初时,Agent 最集中的工作还是研究代码和基础设施代码。此后,它开始进入更多环节,技术支持、实验监控以及分析类工作的 Agent 使用量都在增加。
但有一个部分几乎没有发生同等规模的转移:高层研究规划。原文有一句很重要的话:High-level planning still remains a minimal fraction of agent output tokens。也就是说,Agent 正在深入 AI 研发的执行过程,但 " 我们究竟应该研究什么 ",目前仍主要是人的工作。

图 2|All categories of research activity have increased since the start of the year。增量最大的几类任务依次包括:3.1 研究与基础设施代码、6.2 技术支持与审查、4.1 启动 / 监控 / 调试运行,以及 5.1 实验结果分析。
这条边界很重要。因为如果只看到 "3.1 个 Agent 工作日 ",很容易把 OpenAI 正在发生的事情理解成 "AI 研究员已经来了 "。至少从这份报告看,还远没有这么简单。
OpenAI 还记录了一个很具体的组织变化。过去研究员遇到内部基础设施问题时,会向专门的技术团队求助,一些团队甚至设有固定 Office Hours。2026 年这些 Office Hours 参与人数开始下降,其中一个团队最终取消了这项服务,把时间投入到其他系统改进上。
研究员并不是突然不遇到问题了。一部分问题被转给了 Coding Agent。OpenAI 进一步观察了一个主要技术支持频道,发现每天新增的求助帖数量也在下降,而且没有证据显示这些问题只是转移到了另一个人工支持频道。
AI 对组织的影响,未必一开始就是 " 消灭一个岗位 "。更常见的变化可能是,组织内部一部分原本靠同事协作解决的小问题,被机器悄悄吞掉了。
四、" 自动化研究实习生 " 已经到了什么程度?
去年,OpenAI 给自己设定过一个目标:到 2026 年 9 月,拥有一个 " 自动化研究实习生 "(automated research intern)。现在 OpenAI 认为,这个阶段目标已经达到。
但 " 自动化研究实习生 " 这个说法很容易产生误解。它并不是一个可以独立决定研究方向、连续工作几天然后交出完整成果的 AI 科学家。OpenAI 给出的定义要严格得多:在人的指导下,能够完成边界清晰的研究任务,其中包括原本可能需要熟练研究员花几天时间完成的工作。
OpenAI 分析了研究员实际交给 Agent 的任务,并根据 " 如果由人类完成大约需要多久 " 来衡量任务复杂度。结果显示,从 1 月至 7 月,在能够判断最终结果的任务中,不同难度任务的成功率总体都在改善。Agent 确实开始处理越来越长的任务。
但任务一旦变复杂,对人的依赖也迅速增加。过去 6 个月里,在最终成功完成的 4~8 小时级任务中,超过一半至少发生过一次人工干预。

图 3|Longer tasks need more interventions。任务越长,完全无需干预就成功的比例越低;在 4~8 小时级任务中,成功但至少需要一次人工干预的比例已经高于零干预成功。
所以今天的 " 自动化研究实习生 ",更像一个能力很强、可以连续工作几个小时甚至更久,但仍需要导师检查方向和处理异常的助手。OpenAI 已经给出下一个时间点:2028 年 3 月,进一步向 " 自动化 AI 研究员 " 推进。
五、当 AI 开始参与研发 AI,安全约束也开始进入研发节奏
整篇报告最终落到一个更敏感的问题:如果 AI 可以帮助研究人员开发下一代 AI,那么新模型变强以后,又可以参与研发更强的模型。这由此触及一个长期存在于 AI 讨论中的概念:Recursive Self-Improvement。
OpenAI 的表述相当克制。一方面,公司认为自动化 AI 研究可能降低先进智能的研发成本,也可能帮助推进 Alignment、安全防御和关键基础设施保护。另一方面,OpenAI 明确写道,这些潜在收益并不意味着快速 RSI 本身就是一个值得追求的目标。公司承认,目前还不知道如何安全实现 " 完全对齐的完整 RSI"。
今年夏天,OpenAI 确实让研发踩过一次刹车。7 月 20 日,在发现 Agent 攻破内部研究基础设施后,OpenAI 暂时关闭用于训练的 Container Service,之后以更多限制恢复。强化学习训练因此受到影响,最新一批拟部署模型的 RL 训练暂停约两周。
到了 8 月 7 日,由于初步证据显示 Astra 可能达到 OpenAI Preparedness Framework 中的 Critical Cyber Capability 级别,公司进一步收紧安全限制。随后一周,Astra 级模型获得的 GPU 分配下降了 59.2%;与此同时,其他类别模型的 GPU 分配增加了 17.2%,抵消了大约 85% 的 Astra 下降。

图 4|Changes in RL compute in response to safety-related restrictions。7 月 20 日安全基础设施暂停后,整体 RL 算力出现变化;8 月 6 — 7 日 Astra 级额外限制后,Astra-class 分配继续下降,而 Non-Astra 部分上升。
这组数据透露出一个很现实的问题:GPU 是一种非常昂贵,却又非常灵活的资源。当一个项目因为安全原因被暂停时,空出来的 GPU 不会自动闲置。研究团队可以把它们转去其他模型和实验。
因此,如果未来真的希望通过算力限制去调节 AI 研发速度,只盯着某一个模型的训练量可能远远不够。还必须追踪,被限制的算力最终流向了哪里。
六、OpenAI 为什么现在公开这些数据?
OpenAI 认为,如果 AGI 最终需要接受民主治理,外部世界必须能够看到前沿实验室内部究竟发生了什么。仅仅披露安全事故、模型风险和防护措施并不够,公众还需要理解,最先进的 AI 系统正在以什么速度进入 AI 研发本身。
因此 OpenAI 提出,前沿 AI 公司应该开始公开衡量和披露自身向 RSI 发展的进度。即使未来没有强制监管要求,OpenAI 也表示会继续公布相关信息。
同时,这份报告离回答 "AI 究竟让科研快了多少 " 还很远。OpenAI 自己承认,代码写得更多并不代表科学进展更多,实验跑得更多也不意味着研究质量一定提高。更理想的指标应该是:Agent 究竟成功完成了多少有价值的研究任务?但这种指标又远比统计代码量和实验次数更难建立和验证。
所以 OpenAI 将这份材料定义为一个 snapshot ——阶段性的快照,而不是一个已经证明 AI 将科研效率提升了多少个百分点的最终答案。
七、真正值得追问的,是人的位置会怎么变
如果严格按照 OpenAI 目前公布的数据,我们还不能得出 "AI 研究员已经可以替代人类研究员 " 的结论。高层研究规划仍然只占 Agent 输出的一小部分;复杂任务依然需要明显的人类干预;研究方向、结果判断、是否扩大训练以及是否部署,仍掌握在人类手中。
但如果把视角从 " 替代 " 两个字上移开,一个更具体的变化已经出现了:人和工作的关系正在重新分配。
以前,一个研究员的大量时间可能消耗在写实验代码、Debug、处理基础设施、跑实验、检查结果上。现在,这些工作的一部分开始交给 Agent。于是人的价值逐渐向另一端移动:提出什么问题,判断什么值得研究,辨别哪些结果真正重要,以及决定下一步往哪里走。
这也是为什么,这篇 OpenAI 报告读到最后,最容易让人想到的并不只是 AI 科研加速,而是更广泛的知识工作变化——程序员、分析师、研究员、甚至刚刚毕业的大学生,可能都会遇到类似的问题:当最基础、最琐碎、同时也是最能练手的一部分工作,被 AI 接得越来越多,新人靠什么进入这个行业?
很多资深从业者之所以能够判断 " 什么值得做 ",恰恰是因为年轻的时候做过大量基础工作:写代码、Debug、搭环境、跑失败的实验、处理异常结果。这些工作看起来没有那么高级,却构成了一个人建立直觉、积累判断力的过程。
如果未来 Agent 越来越多地承担这些任务,一个新的问题就会出现:下一代研究员从哪里获得这些经验?下一代程序员又如何成长为资深工程师?那些还没有进入行业的大学生,未来第一次被市场需要时,究竟凭什么被需要?
这可能也是今天谈 AI 时最容易被乐观叙事掩盖的现实:技术当然可以提高效率,但效率并不会自动回答人的问题。一个行业如果只看到 " 现在省下了多少人力 ",却不重新设计 " 新人怎么被培养、普通人怎么被接住 ",那么它迟早要面对另一种短缺——不是算力短缺,而是人才成长路径的短缺。
OpenAI 这篇文章真正有价值的地方,不只是它公布了多少内部数字,而是它无意中让我们看到一种已经开始发生的工作现场:一个人坐在电脑前,同时让几个 AI Agent 工作,而他自己更像是在调度、判断、确认方向。
这对头部研究员来说,可能意味着前所未有的效率;但对整个行业来说,它也意味着一个更尖锐的问题:当执行越来越便宜,判断越来越重要,机会会不会更集中在少数已经有判断力的人手里?
如果答案是肯定的,那么 AI 带来的变化就不只是工具升级,它还会改变一代人的职业入口。对于已经在行业里的人,这意味着必须更早学会做判断,而不只是做执行。对于还在大学里、或者刚进入职场的人,这意味着真正需要争取的,可能不只是会不会用 AI,而是能不能在 AI 接管大量基础工作之后,依然建立起自己的问题意识、学习能力和专业直觉。
OpenAI 在文中没有直接讨论这些问题,它讨论的是研究如何被加速。但也许正因为如此,它反而给了外部世界一个更真实的提醒:AI 并不是先把人整体取代,而是先改写 " 人是怎样长成一个专业的人 "。这件事,比某个 Benchmark 涨了多少分,可能更值得被认真对待。


登录后才可以发布评论哦
打开小程序可以发布评论哦