量子位 昨天
PDF当死,ARA该立!论文是时候Agent原生了
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

啥情况?统治科研圈几十年的 PDF 格式,都需要因 AI 而 " 退休 " …

因为以后论文的第一读者不是人,而是 AI??

近日,IEEE Spectrum 重点关注了一项新研究——ARA(Agent-Native Research Artifact)。它不仅能让 AI 理解研究结论,还能复现实验、灵活规避失败路线并继续推进研究,让 AI 从辅助工具升级为科研协作者

据 IEEE 报道,ARA 团队在一篇名为The Last Human-Written Paper: Agent-Native Research Artifacts的论文中,呼吁科学家们停止继续使用 PDF 撰写传统论文,并表示:

AI 需要一种不同的内容格式,而AI 的需求,理应被置于首位。

论文的第一作者刘嘉晨核心论点是:

一旦 AI" 榨干 " 了人类专家所有的数据,它就不再需要人类的任何输入。到那时,AI 将开始自主进化。

现在这些只提升 AI 科学家的能力,却不改造科研知识的共享方式,就像在泥泞路上开 F1 赛车,难以复现并接续前人的工作。

PDF就是过去科研知识共享的最核心代表。

是时候了,ARA 当立。

为什么 PDF 该死?

PDF 代表的是传统论文的最终结果,是科研最后成果的最终呈现,但就是这种呈现," 有问题 "。

ARA 团队认为,真实的科研从来不是一条从问题直通答案的直线,研究者往往要提出十几个假设、尝试几十种方案、调整无数次参数,在经历大量失败后,才能摸索出一条走得通的路径。

然而,当这些探索被写成论文时,那棵枝杈横生的 " 探索树 " 通常会被修剪成一条干净、连贯的成功路径。

ARA 团队将这种损失称为" 叙事税 ",即为了让研究成为一个有头有尾、逻辑自洽且成功的故事,大量的探索过程被主动舍弃,后来者只能被闪耀的新突破亮瞎眼,却看不见前人踩过的坑、受过的罪。

除了 " 叙事税 ",传统论文还存在着" 工程税 "

一篇论文只要能让审稿人信服,便算完成了使命。

但 " 说服审稿人 " 与 " 让 AI 完整复现 " 完全是两套标准。

模型版本、运行环境、超参数、预处理方式、训练技巧……这些决定实验成败的关键细节,往往散落在正文、附录和代码仓库中,有些甚至从未被记录。

研究团队统计了 PaperBench 中的 8921 项专家复现要求,发现仅有 45.4%在论文 PDF 中得到了完整说明。

对咱来说,实验信息少了,我们可以根据过往经验、求助导师或者不断试错补上;

但对AI 来说,论文里没写,那就意味着只能靠猜(或者瞎编),它也很无奈。

因此,ARA 选择彻底换一种思路:

不再将线性叙事的论文视为科研成果本身,而是把研究重组为一个机器可直接操作的知识包。

这个知识包包含四个层次:

科学逻辑层:

记录研究解决了什么问题、为何采用该方法,以及哪些主张可被证伪。

可执行代码层:

不仅提供代码仓库,还包含复现实验所需的环境、配置与关键参数。

探索图层:

将实验过程还原为一张可追踪的路线图,成功与失败的方向、放弃某条路线的原因均被保留。

证据层:

将论文中的每一项主张关联至原始实验结果,方便 AI 核验结论,而非仅采信正文中的概括性描述。

概括来说,论文最后通过 PDF 呈现的只是" 我们最后做成了什么 "

但如果通过 ARA,展现的还有" 为什么这么做 "" 具体怎么做 "" 哪些方法已失败 " 以及 " 原始证据在哪里 ",追求的是知识优于叙事

更形而上来说,PDF 只有结果,ARA 还包括了整个过程。

道理似乎是这个么道理,但 " 一切存在皆合理 ",PDF 能成为人类科研论文最终呈现形式这么多年,一定是有其内在合理性的。

ARA 要取而代之,需要的就不光是理念了。

ARA 真的比 PDF 好用吗?

为了让 ARA 真正跑起来,研究团队设计了三套配套机制:

1、Live Research Manager:负责在研究过程中持续记录实验、决策、转向与失败路线;

2、ARA Compiler:负责将现有的 PDF 和代码仓库转换为 ARA 格式;

3、ARA 原生审稿系统:负责让机器先行完成结构检查与复现验证,并将创新性、重要性与研究品位等判断留给人类审稿人。

为了体现 ARA 真的比 PDF 好用,研究团队分别从理解复现延伸三个维度进行了测试。

在理解测试中,研究人员设置了 450 个问题,要求 AI 从 ARA 或传统 PDF 加代码仓库中寻找答案。

结果显示,使用 ARA 的 AI 准确率达93.7%,而传统材料组仅为72.4%,相差21.3%

差距最大的是 " 复盘失败 ",当问题涉及失败方案、替代路线和实验教训时,ARA 组准确率为 81.4%,传统材料组仅 15.7%——原因很简单,传统论文里压根就没有这些信息。

在复现测试中,团队选取了 15 篇附带 GitHub 仓库的机器学习论文,设置了 150 项复现任务。

其中,ARA 组的难度加权成功率为64.4%,传统组为57.4%。且任务越难,ARA 的优势就越明显

ARA 在简单、中等和困难三档任务中,分别领先4.9%5.6%8.5%

但 ARA 的表现并非一路开挂。

在最具挑战性的研究延伸环节,ARA 组赢下了 3 项 RE-Bench 开放任务,但另有 2 项被传统论文组反超。

不过,也有可取之处。

ARA 组在全部 5 项任务中,都抢先摸到了那步最关键、最值钱的第一步实验操作:利用失败记录迅速绕开已经被验证过无效的研究方向,省去大量重复探索。

这也对应了论文中的另一组数据。在论文分析 24008 次 AI Agent 运行中,90.2% 的资金成本都消耗在失败探索上,而传统论文几乎不会保存这些失败。

对刘嘉晨而言,这正是 ARA 最重要的价值。

在她设想的人机科研关系中,AI 不再只是润色论文、查找资料或生成代码的辅助工具,而是能真正成为参与阅读、复现和延伸研究的科研主体。

科研人员则可以更加聚焦于那些 AI 难以替代的判断、创新和品味工作,即判断问题是否重要、工作是否真正新颖、某条路线是否值得投入。

ARA 也并非完美

不过,虽然 ARA 的成绩单看起来非常亮眼,但它目前更像一位野心勃勃、天资聪颖却根基尚浅的高一新生,才刚入学就想要在高考中考进北大。

它离成为 "PDF 终结者 " 还有很长的一段道路要走。

篇幅有限,简单说三点。

ARA 的第一个缺陷,就是它目前实验的范围较窄,普适性较弱,只覆盖了天然适合代码复现的机器学习领域,能否用于湿实验或理论学科还尚未得到验证。

第二个问题,就是隐私和数据安全问题。

ARA 目前不仅还没有实现细粒度的访问控制,缺少沙箱执行和内容异常检测,相关规则和标准也还没完善妥当。

要是你就这么大大咧咧地把机密数据喂给它,小心下一秒就被你的竞争对手拿走哦。

第三个是不可避免的 AI 幻觉和路径依赖问题。

在 15 篇论文的复现实验中,传统材料组出现了 2 次结果编造,ARA 组也出现了 1 次。

所以它目前应该既不能保证 AI 永远不捏造结果、也不能保证它不会过度傻白甜地相信前人的判断。

当然,这种思考和理念,依然有其创新性和价值。

如果你需要更详细了解,建议你直接前往文末附上的论文和开源地址。

或者更进一步与 ARA 的研究团队、提出者交流。

ARA 提出者

ARA 研究由来自斯坦福大学、密歇根大学、卡内基梅隆大学和 MIT 等多家机构的 37 名研究者共同完成。

其中第一作者是刘嘉晨

她是密歇根大学的计算机科学博士,深耕机器学习系统与大模型基础设施领域。

刘嘉晨,来源 IEEE Spectrum

她曾参与大模型服务、训练系统和 Agentic RL 系统研究,也曾在 Meta 从事大模型预训练与后训练基础设施相关工作。

刘嘉晨的个人主页和密歇根大学官网显示,她曾在 2023 年入选Machine Learning and Systems Rising Stars荣誉榜单。

图源密歇根大学官网

今年 5 月,刘嘉晨在帕洛阿尔托创立Agent-Native Research Lab,已经联动产学研来推动 ARA Commons 科研生态建设。目前,其公开成果主要包括 ARA 协议及论文、配套代码、研究生态构想,以及面向 NeurIPS 2026 的 AI 驱动科研生态研讨会。

实际上,这种 Agent-Native 的理念,也在 AI 狂飙这几年,正在给千行百业带来范式变革。

从 PDF 到 ARA,一方面是 AI 能力的涌现,可以让整个科研过程的价值被重新发现和重视,而不仅仅是呈现一个最终的结果。

过去我们形成了 PDF,是因为所有论文都是人类作为阅读者、使用者、核心对象。

但现在 AI 能力加持,Agent 能力突破,人类看不过来的科研过程 Agent 可以看,人类难以并行的科研复现 Agent 可以复现……

以前是人类— PDF —人类,以后可能是人类— Agent — ARA — Agent —人类

这种变革也不局限于科研领域,在更早之前,一脉源流的已经有:

GUI 已死,CLI 当立…

Markdown 已死,HTML 当立…

Prompt 已死,Loop 当立…

……

"PDF 已死,ARA 当立 "

只是这种趋势下的一种因循结果罢了。

这更本质的是一种 AI 观、价值观上的哲学体现,你依然支持的是 " 人是万物的尺度 ",还是 AI 才是更终极的尺度?

你是碳基生命守护者,还是完全拥抱硅基时代降临…

这无关对错,只是选择,选择的人多了,也就会在某个节点分出对错。

而 ARA 的提出者,显然选择的是 AI 为中心、Agent Native。

当然,目前为止,ARA 这篇研究和论文,依然是 PDF 提交和呈现的。

参考链接:

[ 1 ] https://spectrum.ieee.org/ai-scientist-research-paper-format?itm_source=homepage&itm_medium=hero&itm_campaign=hero-2026-08-06&itm_content=hero1

[ 2 ] https://arxiv.org/abs/2604.24658

[ 3 ] https://amberljc.github.io/

[ 4 ] https://micl.engin.umich.edu/stories/two-cse-phd-students-named-machine-learning-and-systems-rising-stars

[ 5 ] https://github.com/ARA-Labs/Agent-Native-Research-Artifact

[ 6 ] https://the-future-of-research-ecosystem.github.io/

[ 7 ] https://www.agenticresearch.sh/

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—    —

点亮星标

科技前沿进展每日见

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 科研
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论