科普中国 1小时前
追踪 2.6 万中学生后发现,使用 AI 会让考试成绩大幅下滑!
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

今天的通用 AI 已经能够解答常见的中小学题目,而老师尽管可以规定课堂上不用 AI,却很难知道学生离开教室以后怎么做作业。2025 年,中国青少年研究中心做了一次问卷调查,回收了八千多份有效问卷。调查结果显示,超六成受访中小学生用过 AI,其中 18.3% 经常使用;在列举使用方向时,超过七成学生选了 " 辅助完成作业 " [ 1 ] 。

学生作业是反映学生学习状态的窗口,作业交得更快、分数更高,通常会被当成学得更好。可如果学生用 AI 帮助做作业,这个推断还成立吗?在 AI 的帮助下完成作业,学生是否能学到真本事呢?

最近有一项研究发现,当中学生可以自由选择 AI 工具和用法时,他们的作业交得更快、分数更高,然而闭卷考试成绩却下滑了。换句话说,学生用 AI 做作业,可能没有真正掌握知识。这个结论虽然并不算出人意料,但反映出的问题却必须慎重对待。

作业变好了,考试却更差

2026 年 6 月,三位研究者发布了一篇工作论文,名叫《生成式人工智能的学习惩罚:来自中国中等教育的证据》。研究对象是中国中部一个 100 多万人口的县,包括当地 5 所初中、4 所高中,共 26811 名初一到高三学生,约占全县中学生的 90%。研究者取得了最长 30 个月的校内闭卷月考成绩、周末作业分数和作业平台记录,还取得了一部分学生的县统考及中高考成绩 [ 2 ] 。

2025 年 6 月,学生接受调查,并回忆自己第一次使用生成式 AI 的月份。截至调查时,约 80% 的学生报告使用过 AI,常用工具包括豆包、DeepSeek、ChatGLM、文心一言和通义千问。在使用 AI 的学科中,数学最常见,其次是英语。

研究者用的是一种叫 " 双重差分法 " 的统计方法。大概可以这样理解:原来李雷和韩梅梅的成绩走势很接近。从某个月起,李雷开始用 AI 写作业,韩梅梅没有。那么,如果李雷的成绩曲线从这时候开始明显偏离了原来的轨道,而韩梅梅仍然按原来的走势发展,那么这段额外的偏离就可能与 AI 有关。放大到两万多名学生的规模,研究者比较的正是这种 " 用 AI 前后的变化 " 与 " 没用 AI 的同龄人同期变化 " 之间的差距。

这个方法比单纯的 " 用 AI 前和用 AI 后 " 的对比更可靠,但仍然不是随机实验。学生是自己决定什么时候开始用 AI 的,而如果 " 开始用 AI" 这件事本身和其他同时发生的变化有关——比如某个阶段学习动力下降,或者是 " 因为跟不上进度,才想着找 AI 帮忙 " ——那么这些因素带来的成绩变化都可能被算在 AI 的账上。研究者用了长达 30 个月的连续月考数据去检查两组学生在用 AI 之前的走势是否确实接近,这能在一定程度上降低这种风险。

研究结果显示,在使用 AI 六到十个月后,差距就已经很明显了。周末作业分数平均提高约 18%;每次作业从领取到提交的时间,平均从约 64 分钟缩短到 45 分钟;与此同时,校内闭卷月考平均成绩下降了约 20%。

论文还报告了中考和高考结果。在累计使用 AI 至少两年的学生中,中考成绩约下降 24%,高考成绩约下降 18%。不过,因为这些数据只有很少几个结果时点,证据比较弱。

论文还发现,自由使用 AI 带来的学习损失在不同学科和性别间并不均匀。政治和地理等社会科学类科目的损失最大,其次是理科,语文和英语等语言类相对较小;按性别看,男生的降幅比女生更明显。这可能说明,AI 导致的成绩下降和具体学科的作业形式,以及不同群体使用 AI 的方式有关。

研究者注意到,一部分学生从领取作业到提交作业所用的时间很短,得分却很高,而随后的闭卷考试成绩又比较低。作者按照行为特征分类,把作业完成时间少于 50 分钟的叫做 " 外包 ",少于 45 分钟叫做 " 完全外包 "。按这种行为分类,使用 AI 超过五个月的学生中,81% 被归入 " 外包 " 组,50% 被归入 " 完全外包 " 组。

学习损失也主要集中在这些 " 外包 " 和 " 完全外包 " 组上。那些即使用了 AI、但完成作业的时间仍然和不用 AI 的同学相近的学生,学习损失很小。换句话说,问题似乎不只在于 " 用没用 AI",还在于 AI 有没有替代学生自己的尝试和思考。

人们常把 AI 看成一种能力杠杆,以为它会让强者更强。但至少在这项研究中,结果恰恰相反:原来成绩较高的学生,估算出的成绩降幅反而更大。

研究者按照学生尚未使用 AI 时的平均考试成绩,把他们从低到高平均分成三组。论文估算,开始使用 AI 六到十个月后,原来成绩排在前 1/3 的学生,月考成绩下降约 24%;原来排在后 1/3 的学生,下降约 16%。把中考和高考合并估算后,两组的降幅分别约为 18% 和 11%。

研究者还发现,自称每周使用 AI 不足一小时的学生,月考成绩估计下降约 5%;自称使用五小时以上者下降约 30%。初中生的成绩降幅也比高中生更大。

不过需要注意,这是一项观察性研究,研究对象也局限于一个县。学生何时开始使用 AI 的数据来自事后回忆,可能存在误差;论文中的百分比是统计模型估算的平均变化,而不是每名学生都会出现的固定降幅。

AI 究竟替学生做了哪一步

虽然数字很吓人,但仅凭这项研究,并不能推出 " 只要使用 AI,中学生就一定学得更差 "。毕竟,同样是使用 AI,实际发生的事情可能完全不同。

让 AI 查找一个数据、调整文档格式,是使用;让 AI 检查自己的答案、指出遗漏和错误,也是使用;要求 AI 提示一个难懂概念、换一种方式讲解,仍然是使用;让模型生成解题步骤、写好作文,直接交出可以复制粘贴的成品,也叫使用。

一种更有用的分类方法,是看 AI 在作业中扮演什么角色。它可以是资料助手,帮助搜索、整理和排版。它也可以是编辑,评价学生已经完成的答案。它还可以是导师,只给提示、追问和反馈。AI 可以是共同作者,和学生讨论不同方案。但 AI 也可以是枪手,从理解题目到生成答案全部包办,留给学生的任务只剩提交。

因此,与其问学生有没有用 AI,不如继续问:是在动笔前就索要答案,还是做完以后请 AI 检查?AI 给的是完整成品,还是继续思考的提示?关掉 AI 以后,能不能解释答案,再独立完成一道相似的题目?

最后一个问题尤其重要。关掉 AI 后还能够解释、重做和举一反三,才是学习的重要证据。前面的数据与 " 助手、编辑、导师 " 式使用和 " 枪手 " 式使用的区别相一致,虽然使用了 AI 但作业完成时间没有明显变化的学生,学习损失很小。

今天的通用 AI 很擅长快速组织答案,但作业的目的不只是得到答案。学生先尝试、发现自己的薄弱点,再寻找办法、检查错误并重新完成,这些步骤构成了学习过程。

学习科学早就区分了 " 表现 " 和 " 学习 "。表现是做当前任务时的速度、正确率和流畅度;学习则是比较持久的变化——过一段时间还能想起来,换一道题还能做出来。更顺畅地完成作业,不一定意味着真正掌握知识;而有些练习虽然在当时更困难,但以后留下的东西反而更多 [ 3 ] 。

学生自己不一定能察觉这种差别。AI 把答案直接放到屏幕上以后," 眼前已经有答案 " 很容易被误认为 " 我已经会了 "。

可以把一次学习粗略地看成回路:先尝试,找到自己卡住的地方;复习或搜索,得到一个暂时答案;再验证、发现错误,修改自己的理解;最后重新做一遍。

而 AI 可以在每一步给提示、出反例、检查错误,也可以直接跳到终点,交出完整成品。如果学生放弃自己尝试,那么答案不会变成学生自己的能力。看懂一道数学题的解答,并不等于合上屏幕后还能做出来。

宽泛地讲,学习的目的是让我们形成一些知识框架和基础信息,能够提出一个好问题,能把新信息放进已有框架中,能看出错误和不合理之处,以及能做出良好的决策。要形成这些能力,学习者需要反复回忆、理解、判断、纠错和迁移。如果 AI 直接越过这些环节交出答案,学生就失去了形成能力所需的练习。

当然,学习的关键从来不是 " 动脑越累越好 ",无意义的重复也不会因为痛苦就自动变成有效学习。学习的重点是通过获取和理解新信息而改变大脑加工能力。卡住、犯错、检查和重做,正是这些加工能力的改进过程。

这是学习过程中的必要摩擦,而这些摩擦必然不会愉快。所以容易理解,如果评价只看结果而不看过程,最省力的使用方式——使用 AI 做作业——就会更受学生欢迎。

那么,是否应该一刀切,彻底禁止 AI 进学校呢?

这恐怕也不是个好答案。在教师规定用法、安排练习并检查学生是否真正掌握的实验中,AI 确实可能帮助学习。

一项综述分析了 2022 至 2024 年间发表的 69 篇 ChatGPT 相关实验研究,发现平均效果为正 [ 4 ] ;另一项聚焦 " 批判性思维、创造力、问题解决 " 等高阶思维能力的三层元分析,综合了 19 项实验研究,也得到中等程度的正面结果 [ 5 ] 。不过,这些研究大多持续时间较短,以大学生样本居多,不同研究之间的结果差异也很大。

这两项研究和之前我们看到的那篇论文都是成立的。两者回答的问题并不相同:一个问 " 精心设计的 AI 教学干预有没有用 ",一个问 " 让学生自由使用 AI 会发生什么 "。

AI 既能辅助教学,也能代做作业。区别不在于工具,而在于学生是否自己尝试、判断和纠错。

为什么还要闭卷考试?

如果一份作业只要求从公开材料中拼装格式固定的文字,那么作业设计显然有问题。禁止使用 AI,也不会让这样的机械劳动变成有效学习。

但由此得出 " 以后总能使用 AI,现在就不必练习独立完成 ",又走得太远了。即使使用 AI,人也要拥有判断问题是什么、答案大概应当是什么样,以及哪里必须检查的能力。

学校和职场对一项任务的要求并不相同。工作任务要求成品按时交付且质量合格;而学校布置一道题目,则是希望学生在做题过程中更熟练地掌握方法。

职场里常说 AI 会让 " 强者更强 "。一位资深人士可以把重复步骤交给 AI,把精力投入到检查和取舍上;而一个新人如果把同样的工作交给 AI,却会失去学习的机会。

所以,AI 时代的教育需要把两类任务分开:一些任务可以允许学生与 AI 一起完成,用来练习提问、选择和核验;另一些任务需要不使用 AI,用来判断学生是否掌握了所需的知识和方法。

可以用三个问题作判断:

1. 这项任务首先要求尽快交付成品,还是要求学生学会一种以后要独立使用的方法?

2. AI 替代的是搜索、排版等辅助劳动,还是本应由学生完成的设计、分析、判断和纠错?

3. 不使用 AI 时,学生能不能解释、重做,并把所学用到一道稍有变化的新题上?

落实到一次具体学习中,可以先让学生独立尝试,写下自己卡住的地方;遇到困难后,再让 AI 提示、追问、举反例或指出错误,而不是直接交出成品;最后关闭 AI,由学生重新解释、独立完成,再尝试一道变式题。这样,AI 提供了认知支架和反馈,而不是替学生踏过整条学习回路。

美国康涅狄格州的柴郡学院正在做类似尝试。一名法语教师会让学生先用 AI 修改作业,再逐条检查哪些地方确实改对了,哪些虽然变得更 " 标准 ",却抹掉了自己的表达。AI 只给出修改意见,学生仍然要自己判断 [ 6 ] 。

这家学校还给不同作业标上 " 交通灯 ":绿灯允许充分使用 AI,红灯禁止使用,黄灯则由教师确定哪些工具和步骤可以交给 AI。例如,一份作业可以允许使用 AI 做拼写检查,却不允许直接问聊天机器人。这种方式也许可以给我们一些启示:学生开始做作业前就知道,当前任务是在练习人机协作,还是在检验自己能否独立完成 [ 6 ] 。

中国《中小学生成式人工智能使用指南(2025 年版)》已经提出分学段、以人为本和避免过度依赖,明确不应把生成内容简单复制为作业,也不能把 AI 作为替代性教学主体。这与上述判断大体一致 [ 7 ] 。

进入职场以后,使用 AI 的理由会更加充分,但人仍然需要知道什么时候可以委托,什么时候必须接过判断权。一项针对管理咨询顾问的实验发现,在模型擅长的创意、分析和写作任务中,AI 可以让参与者完成得更快、更好;换成表面相似但模型不擅长的任务,使用 AI 的人反而更容易答错。研究者把这种忽高忽低的能力边界称为 " 锯齿状技术前沿 "。能判断什么时候可以相信 AI,成了重要的能力 [ 8 ] 。

因此,学校不能只培养一种与工具隔绝的考试能力。没有 AI 时,学生应当能够回忆、解释、判断,并把学过的方法用到新问题上;有 AI 时,学生还要会提出问题、交叉核验、发现 AI 的错误或幻觉,并为最终答案负责。

AI 可以参与作业,但不能让学习者完全不做作业。判断 AI 是否真正帮助了学习,应该看在不使用 AI 工具以后,学生还会做些什么。作业成绩和完成速度无法证明是否真正学会,只有关掉 AI 之后,才见分晓。

[ 1 ] 孙宏艳 . 调查发现超六成受访中小学生用过 AI [ N ] . 中国青年报 , 2026-03-26 ( 08 ) .

[ 2 ] Str ö mberg D, Lei V, Wu Y. The Generative AI Learning Penalty: Evidence from Chinese Secondary Education [ R ] . CEPR Discussion Paper No. DP21577, 2026-06-02.

[ 3 ] Soderstrom N C, Bjork R A. Learning Versus Performance: An Integrative Review [ J ] . Perspectives on Psychological Science, 2015, 10 ( 2 ) : 176-190.

[ 4 ] Deng R, Jiang M, Yu X, Lu Y, Liu S. Does ChatGPT Enhance Student Learning? A Systematic Review and Meta-analysis of Experimental Studies [ J ] . Computers & Education, 2025, 227: 105224.

[ 5 ] Liu X, Guo B, He W, Hu X. Effects of Generative Artificial Intelligence on K-12 and Higher Education Students' Learning Outcomes: A Meta-Analysis [ J ] . Journal of Educational Computing Research, 2025, 63 ( 6 ) : 1460-1492.

[ 6 ] Hall P, Santos R. How to Encourage Smarter AI Use in the Classroom [ EB/OL ] . MIT Technology Review, 2026-08-24. https://www.technologyreview.com/2026/08/24/1142630/ai-school-classroom-policies/

[ 7 ] 教育部基础教育教学指导委员会 . 中小学生成式人工智能使用指南(2025 年版) [ Z ] . 2025-05-13.

[ 8 ] Dell'Acqua F, Mollick E, Lifshitz-Assaf H, et al. Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of Artificial Intelligence on Knowledge Worker Productivity and Quality [ J ] . Organization Science, 2025.

作者丨猛犸 哈尔滨理工大学教师

审核丨于乃功 北京工业大学教授 中国人工智能学会理事

苏哲伦 上海市语文高级教师

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 考试成绩 中高考 考试
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论