优墨出品 昨天
炸锅了!浙大上交搞出个狠活:1小时写完学术综述,就差0.3分能发表
index.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

家人们谁懂啊,写文献综述这事儿,简直是研究生的噩梦。

开题要写,中期要写,毕业论文还得写。有人为了一篇综述熬了三个月,头发掉了一半,最后导师一句 " 逻辑不清、分类混乱 " 直接打回重写。结果现在浙大和上交的研究团队跳出来说:别熬了,一小时,我给你整出来。

但别高兴太早,他们自己也很坦诚——离真正 " 能发表 ",还差那么 0.3 分。

这 0.3 分,懂的都懂,有时候就是 " 能投 " 和 " 再改改 " 之间的距离,隔着一条银河。

这玩意儿到底叫啥?DAS,听着挺唬人

浙大、上交联合团队搞了个系统叫 DAS,目标是让 AI 一小时内自动生成一篇面向发表的学术综述。

你可能会说,Deep Research 那些工具不是早就能搜文献、写报告了吗?是,但问题恰恰出在这儿。

市面上那些工具走的都是 " 检索—分析—写作 " 的老套路,产出的东西更像一份研究报告,而不是一篇正经的学术综述。论文怎么分类?哪篇该放哪个章节?某个论点到底该引哪几篇文献?参考文献、交叉引用、图表、最终 PDF 能不能靠得住?这些问题,不是把上下文拉长、多塞几篇论文就能解决的。

DAS 的思路完全不一样。它搞了个 " 有状态智能体闭环 " 框架,从全局文献检索到分类体系构建,再到论文分配、段落规划、引用规划,最后经过语义审查和确定性验证,形成一套 " 生成—审查—修正—再评估 " 的完整闭环,最后直接给你输出一篇带图表、带参考文献的完整 PDF。

翻译一下就是:它不是把搜到的论文硬缝在一起,而是先 " 吃透 " 这些论文,再决定怎么组织、怎么论证、怎么引用。这操作,属实是把写综述这事儿给玩明白了。

先啃下 200 万篇论文,再谈写作

DAS 底层有个叫 DAS-2M 的文献元数据库。团队把 2020 年 1 月以来近 200 万篇论文做了全文解析,用大模型提取出方法、数据集、实验结果、创新点、局限性这些结构化信息。

这有啥用?打个比方,以前写综述就像每次都要重新翻一遍图书馆的所有书,现在相当于提前把所有书都做好了详细读书笔记——一篇论文解析一次,就能被不同的综述主题反复调用。而且这个库是动态更新的,新论文发出来会持续补进去。

用户输入一个主题,系统先从 200 万篇论文里检索候选文献,再基于这些论文建分类体系,通过反向路由判断每篇论文该支撑哪个章节。后面的规划、写作、引用,全都建立在同一套可复用的文献表示上。

说白了就是:先把地基打牢,再往上盖楼。

4.34 分,离最强基线就差 0.31

在 DAS-Bench 评测基准的 30 个综述主题上,DAS 从引用质量、分类体系、论述逻辑和稿件可靠性四个维度接受评测,平均得分 4.34 分。完整参与全部 30 个主题的最强基线得分是 4.03 分。

等会儿,4.34 减 4.03,不就是 0.31 吗?对,就差这 0.31。对人类作者来说,这 0.31 分可能就是 " 改一改能投 " 和 " 还得再打磨一轮 " 的差距。对 AI 来说,这 0.31 分是 " 初稿 " 和 " 能发表 " 之间那道看不见的墙。

专家匿名评测里,DAS 相比传统检索增强方法在 30 个主题中的 27 个更受偏好,相比另一个自动综述系统在 21 个共享主题中的 19 个更受偏好。目前项目网站已经开放了 220 篇自动生成的热门方向综述供在线查看。

那 0.3 分到底差在哪?

说实话,DAS 已经是目前自动综述生成领域最能打的了。但 0.3 分的差距,指向的问题很具体。

一篇高质量综述的核心价值在于批判性分析和原创性见解——不只是把文献整理归类,而是指出这个领域哪里研究不够、哪些结论互相矛盾、未来该往哪走。AI 擅长的是 " 整理 ",不擅长的是 " 判断 "。它能告诉你某篇论文用了啥方法、得了啥结果,但它很难告诉你 " 这个方法的根本假设可能有问题 " 或者 " 这个领域的主流范式正在被挑战 "。

另一个现实问题是引用可靠性。虽然 DAS 在引用维度下了不少功夫,但 AI 生成综述的参考文献准确性仍是学术界普遍担心的事。一篇综述里要是有几个引用对不上,那就是学术事故,直接社死。

研究者该慌吗?

不用慌,但该想的确实得想。

0.3 分的差距,搁以前可能是 " 辅助工具 " 和 " 替代方案 " 之间的鸿沟。可现在,工具已经能一小时干完你半个月的活,虽然最后那 0.3 分还得你自己补——但问题是,你补得过来吗?

未来的学术写作可能变成这样:AI 负责海量文献的快速梳理和组织,人类负责注入批判性思考、建立跨领域连接、提出真正有价值的研究问题。综述作者的角色正在从 " 文献搬运工 " 变成 " 知识策展人 "。

最关键的是,DAS 团队已经把代码、数据、评测基准全部开源了。意味着任何一个研究者、任何一个实验室,都可以在这个基础上继续往前推。今天差 0.3 分,明天呢?

你觉得 AI 写综述这事儿靠谱吗?如果有一天 AI 生成的综述真能直接发表,你会用还是不用?评论区聊聊你的看法,顺手转发给那个还在为文献综述头秃的室友。

评论
大家都在看