量子位 昨天
删掉99.95%训练信号,效果反而更好!极端稀疏监督刷新大模型后训练逻辑
index.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

大模型做一道数学题,往往需要生成数千个 token 的推理过程。

直觉上,如果希望通过后训练提升模型的推理能力,必须在大量 token 上施加训练信号,再通过整条推理轨迹上的密集更新,让模型逐渐变强。

但来自亚马逊和杜克大学的研究团队一项最新研究发现:一条包含数千个 token 的推理轨迹,有时只训练其中一个 token,就已经足以明显提升模型的推理能力。甚至能够反超对整条轨迹所有 token 进行训练的效果。

这项工作重新思考了一个长期被忽视的问题:大模型的后训练,真的需要如此密集的学习信号吗?

从 On-Policy Distillation 开始

这项研究的起点是On-Policy Distillation(OPD,在线策略蒸馏)。传统知识蒸馏通常让学生模型学习教师生成的数据,而 OPD 有一个重要区别:推理轨迹由学生模型自己生成,再由教师模型对学生实际走过的每一步提供反馈。

假设学生模型生成了一条 4000 个 token 的数学推理轨迹,标准 OPD 可以在这 4000 个 token 上逐个比较教师模型和学生模型对当前 token 的概率。如果教师认为某个 token 应该更可能出现,就提高它的概率;反之则降低。

因此,一条 trajectory 可以产生数千个训练信号。这种密集的 token-level 信号通常被认为是 OPD 的重要优势之一,研究团队由此提出了一个很简单的问题:如果把这些训练信号一个一个删掉,会发生什么?

99.95% 的信号都删掉呢?

研究团队首先做了一个非常极端的实验。对于学生模型生成的每一条推理轨迹,只随机选择一个 token参与损失函数的计算和反向传播。也就是说,模型仍然完整生成一道题的推理过程,但真正产生训练信号的,只有其中一个随机位置。如果一条回答有 2000 个 token,那么真正参与训练的比例只有约0.05%。

按照通常的直觉,如此极端稀疏的信号应该会让训练基本失效。但结果恰恰相反:随机监督一个 token 仍然能够稳定提升学生模型的数学推理能力。而且,这并不是只出现在某一个特殊 teacher 或 student 上的偶发现象。研究团队在 Qwen3 系列上构造了9 组不同的 teacher – student 配置,覆盖:

更大参数量的教师模型→更小参数量的学生模型;

同规模的教师模型和学生模型;

更小参数量的教师模型→更大参数量的学生模型。

在这些不同设置中,每条轨迹随机训练一个 token,都能够一致地观察到推理能力的提升。

更奇怪的是:一个 token 有时比所有 token 更好

随机一个 token 已经很反直觉,但接下来的结果更加出人意料。在 OPD 中,可以衡量教师模型和学生模型在每个 token 上的分歧程度。有些 token 上,教师模型比学生模型更加认可当前生成结果;另一些 token 上,教师模型则明显认为学生不应该这样生成。于是,研究团队尝试只保留这些最 " 极端 " 的 token。例如,每条轨迹只选择:教师最希望学生增加概率的一个 token,或者教师最希望学生降低概率的一个 token。

结果发现,仅仅监督这样的1 – 2 个 token,在很多实验中就已经可以匹配,甚至超过标准 full-token OPD。换句话说,标准 OPD 可能训练几千个 token,而极端稀疏的 OPD 只训练一个 token,后者却不一定更差。

在一个代表性的 Qwen3 实验中,选择单个极端 token 得到的学生模型不仅超过了标准 OPD 得到的学生,甚至超过了提供监督的教师模型本身。这说明,这里发生的事情可能并不像 " 把 teacher 完整复制给 student" 那么简单。

学生模型变强,并不一定意味着它变得更像教师模型

OPD 的数学目标,本质上是缩小教师模型和学生模型之间的分布差异。因此,一个很自然的解释是:稀疏 OPD 之所以有效,也许只是因为少量 token 已经足以让 student 更接近 teacher。

但实验并不完全支持这个解释。研究团队发现,一些推理性能最好的稀疏 OPD 模型,reverse KL 并没有变得更小,甚至可能变得更大。也就是说:student 的推理能力提高了,但它并不一定在整体分布上更加像 teacher。因此稀疏 OPD 带来的推理性能提升,并不只是来自单纯的模仿。

为什么一个 token 可能有用?

目前尚没有一个完整的理论解释。但一个重要的直觉是:一个 token 的监督,并不等于模型只学习了一个 token。它更像是在一个特定 context 下,对整个模型参数施加了一次方向明确的推动。如果这种推动足够准确,即可通过少量关键更新,推动模型进入一个更好的参数区域。

这也让人联想到人类的学习过程,老师通常不会把学生解答过程中的每一步都逐字纠正。很多时候,老师只是指出几个关键错误、学生修改自己的理解,再重新尝试。真正有效的学习,也许并不需要 micro-level correction。

这只是 OPD 的特殊现象吗?

为了回答这个问题,研究团队又把实验扩展到了其他的实验环境。结果显示,类似的极端稀疏监督现象并不仅仅存在于最初的Qwen3+ 数学推理 +OPD这一实验环境中。它还可以扩展到:

coding reasoning;

Llama 系列模型;

以及基于 PPO 的 RLVR。

特别有趣的是,在 PPO 实验中,即使密集 token 训练无法明显提升推理性能,极端稀疏的 token 更新仍然可能产生有效提升。这意味着,这一现象可能并不只是 OPD 的一个特殊性质。它指向了一个更普遍的问题:人们是不是高估了大模型后训练真正需要的 token-level 优化数量?

后训练一定是 Token-Intensive 的吗?

今天的大模型训练天然以 token 为单位思考计算量。一次大规模后训练通常会涉及海量 token。更多数据、更多 rollout、更长 trajectory、更密集的监督信号,往往也被默认意味着更多、更充分的优化信号。因此,一个很自然的假设是:想让模型学得更多,就需要让更多 token 参与训练。但这项工作的实验并不是在说明 " 大量 token 没有用 ",也不是在声称未来训练大模型只需要一个 token。

真正值得注意的是:

推理性能的提升和监督信号的密度之间,并不是一个简单的 " 越多越好 " 的关系。

在消融实验中,研究团队观察到了一个明显的非单调关系:当逐渐减少参与训练的 token 时,性能可能先下降;但当监督信号极端稀疏到只剩下少数 token 时,性能反而重新上升,并可能超过稠密信号带来的性能提升。

这意味着,未来值得追问的问题或许不应该只是怎样获得更多训练 tokens?而应该进一步问:模型真正需要哪些学习信号?一条 trajectory 里,到底有多少 token 真正在驱动学习?如果几千个 token 的推理轨迹中,只有极少数更新就足以推动模型变强,那么这不仅有助于理解后训练背后的机制,也可能进一步启发更加 token-efficient、memory-efficient 的训练方法。

有时候,模型可能并不需要被逐字逐句地教。也许,只需要在正确的地方推它一下。

论文:Extremely Sparse Supervision Incentivizes Reasoning Ability

作者:Zhishuai Liu, Xingzi Xu, Mehmet Saygin Seyfioglu, Pan Xu, Karim Bouyarmane

链接:https://arxiv.org/abs/2609.04565

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  完  —

【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目 / 主页链接,以及联系方式。

  我们会 ( 尽量 ) 及时回复你 : )

点亮星标

科技前沿进展每日见

评论
大家都在看