
智东西
作者 | 杨京丽
编辑 | 李水青
智东西 10 月 10 日报道,一项来自麻省理工学院(MIT)等机构的研究发现,只要固定基础模型回答开头的两个 Token,就能让模型的数学推理成绩接近对应的强化学习版本。
以艾伦人工智能研究所(Ai2)的基础模型 Olmo-3-7B 为例,将回答固定为 ".nnOkay" 开头后,模型在 MATH-500 上的准确率从 42% 升至 78%,超过其强化学习版本的 75%。

这个过程没有修改模型参数,也没有给模型增加新的解题示例。模型只是换了一个回答起点,原本没有稳定表现出来的解题能力,似乎就更容易被调用出来。
换句话说,基础模型答错题,有时不一定是完全不会做,而是没有进入能够解题的状态。强化学习的一部分作用,可能正是让模型更容易选择这种有效的回答开头。
这一发现来自论文《基础模型可以借助训练数据中的线索进行推理(Base Models Can Reason By Taking a Cue From Training Data)》。论文于 10 月 5 日提交,由 MIT、加州大学伯克利分校、华盛顿大学和艾伦人工智能研究所的研究者共同完成。
论文第一作者是麻省理工学院硕士生索菲 · L · 王(Sophie L. Wang)和加州大学伯克利分校博士生阿米尔 · 德拉维德(Amil Dravid)。索菲 · L · 王目前仍是 MIT 的硕士生,她从 2023 年进入 MIT 本科,2026 年进入 MIT 硕士,目前她已先后在 ICML 和 NeurIPS 上发表研究成果。

论文链接:
https://arxiv.org/abs/2610.06851
项目链接:
https://www.sophielwang.com/cues
开源地址:
https://github.com/sophicle/cues
一、回答开头只改两个 token,基础模型准确率追平强化学习版本
论文将模型回答拆分为 " 开头 token 线索 " 和后续生成内容两部分。研究者通过预先固定回答开头,观察不同开头如何改变模型接下来的生成结果。
他们首先观察 Olmo-3-7B 在 MATH-500 上的回答。正确答案中,约有 50% 的回答以 ".nn"(句号加两个换行)开头,错误答案中这一比例只有 14%。句号和换行本身没有提供数学知识,却与正确率出现了明显关联。
研究者随后从模型可能生成的回答开头中寻找有效线索。他们先用搜索方法找出基础模型较可能生成的短开头,再让模型从每个开头继续回答,比较多次采样结果的一致性。
对 Olmo-3-7B,最终选中的开头是 ".nnOkay";对 Qwen3-14B,选中的是 " Alright,"。研究者把这些文字预先填入模型回答,再让模型自行生成后续内容。
在 MATH-500 上,Olmo-3-7B 基础模型自行生成回答开头时,其准确率约为42%;将回答开头固定为 ".nnOkay" 后,准确率升至约78%,高于其强化学习版本约75%的成绩。
Qwen3-14B 使用 " Alright," 作为回答开头后,准确率则从 72% 提高到 87%,与强化学习版本持平。相同开头还被用于 GSM8K、AMC 23、AIME 2024 等数学测试,在多数测试中都能带来提升。在代码生成测试 HumanEval 上,固定开头提高了 Olmo-3-7B 的成绩;Qwen3-14B 的成绩则与不固定开头时相近。

论文中展示了一道具体题目的生成差异。题目较为简单,要求计算834 名学生占全校人数三分之二时,全校共有多少名学生。
当模型以 ".nAnswer" 开头时,它直接给出 "1002",答案错误;当模型以 ".nnOkay" 开头时,它先列出"(2/3)×T=834",计算出 1251,随后又主动检查结果,确认计算没有问题。设置新开头后,模型给出了正确的答案,生成过程中,模型没有获得额外提示,也没有更换参数,仅修改了回答开头。
二、从 14% 升至 65%,强化学习先改变模型的回答开头
如果基础模型在固定开头后已经能达到接近强化学习模型的成绩,强化学习究竟改变了什么?
研究者采用 RL-Zero 设置,让模型直接根据自己生成答案的对错获得奖励。比较强化学习前后的模型后,他们发现,两者预测分布的最大差异集中在回答最开始的两个 token。
对 Olmo-3-7B,强化学习将 ".nnOkay" 的生成概率从 0.14 提高到 0.65;对 Qwen3-14B," Alright," 的生成概率从 0.04 提高到 0.58。强化学习前后,模型的预测差异主要集中在回答最开始的两个 token,之后差异明显减小。

研究者还把强化学习模型已经生成的回答开头交给基础模型,让基础模型从相同位置继续回答。Olmo-3-7B 在这种条件下可以达到强化学习模型的准确率。
训练曲线显示,预先固定有效开头后,Olmo 模型的成绩大约相当于标准强化学习训练 100 步后的水平,Qwen 模型则相当于约 50 步后的水平。
这说明,在这组实验中,强化学习的一部分作用可能是提高模型选择有效推理开头的概率,让它更容易进入原本已经存在的推理路径。
研究者还控制了回答长度。部分开头会让模型写出更长的回答,但准确率仍低于不固定开头的结果;在相同 token 预算下,".nnOkay" 仍保持优势。因此,成绩提升不能只用回答变长来解释。

三、训练数据改写词语关联,"Chicken" 也能诱导推理
"Okay" 为什么有效?它可能符合人类开始思考时的表达习惯,但研究者希望进一步确认,效果是否来自训练数据中反复出现的词语关联。
他们将 Olmo 模型中期训练数据里与推理轨迹共同出现的 "Okay" 替换为 "Chicken",再从相同检查点继续训练。测试时,模型都被固定为以 ".nnChicken" 开头。
在原始基础模型中,固定 ".nnChicken" 后的 MATH-500准确率约为 18%,低于不固定开头时的 42%。重新训练后,模型则会沿着推理文本的模式继续生成,准确率升至 77%,接近 ".nnOkay" 开头的 78%。
在使用 10B-token 中期训练数据的重训实验中,固定 ".nnChicken" 后,MATH-500 准确率从 2.4% 升至 37.2%;在使用 100B-token 数据的另一组实验中,准确率则从 18.2% 升至 76.9%。两组实验的数据规模不同,但都说明,重新建立 "Chicken" 与推理文本之间的训练关联后,这个词才具备了推理线索的作用。

修改后的模型也没有忘记 Chicken 的日常含义。面对 "A chicken is a" 或 "She roasted the chicken" 这样的句子,它仍然可以生成与鸟类或食物有关的内容。
研究者还将训练数据中的"step by step" 替换成 "duck duck goose"。重新训练后,"Think duck duck goose" 也能像 "Think step by step" 一样诱导模型推理。
隐藏状态分析显示,不同开头会把模型带向不同类型的训练文本。".nnOkay" 更接近合成推理轨迹,"To" 更接近解释型数学文本,"Answer" 则更接近简短问答文档。研究者还发现,线索越早出现在回答中,产生的影响越持久;等到第三至第六段才插入 "Okay",效果会明显下降。

四、修改回答开头,模型可能拒绝请求
此外,研究者还把同样的方法用于安全测试中,观察不同回答开头会如何影响模型拒绝或遵从请求。
在 Olmo-3-7B 中,以 "I ’ m sorry" 开头的回答更容易拒绝请求,但也会增加对无害请求的误拒绝;"Okay," 会减少拒绝,并增加模型对危险请求给出有害内容的概率。
数学实验中有效的 ".nnOkay" 则呈现出另一种效果:模型会更多拒绝危险请求,同时减少对正常请求的误拒绝,表现出更有选择性的拒绝行为。
论文还发现,仅仅改变空格、标点和换行方式,就可能带来不同结果。"Okay," 和 ".nnOkay" 看起来很接近,但前者可能成为更容易遵从危险请求的开头,后者则更接近先分析、再决定是否拒绝的回答模式。

这说明,回答开头对模型行为的影响并不局限于数学推理,也涉及拒答、安全等问题。
结语:模型能力和稳定发挥之间,还隔着一个 " 开头 "
通过这篇论文可以发现:模型答错题,有时不代表它完全不会做,也可能是没有进入正确的思路。对 Olmo-3-7B 来说,只是在回答开头加上 ".nnOkay",准确率就从约 42% 提高到了 78%。
"Chicken" 的实验则说明,词语能起什么作用,和它在训练数据中经常跟什么内容一起出现有关。经过重新训练后,"Chicken" 也能引导模型一步步解题。模型记住的可能不只是词语本身,还包括这个词通常会带来什么样的回答。因此,在实验条件下,预先固定有效的回答开头,都可能帮助模型进入更适合解题的状态。
不过,需要注意的是,实验测试的模型主要为 Olmo-3-7B 和 Qwen3-14B,无法确定在其他模型上是否能产生类似的效果。这种方法是否有效,还要看具体模型和任务。这一方法虽然在一定程度上能够提高准确率,但想让模型面对不同问题和不同表达时都能稳定回答,仍然需要高质量的训练数据和充分的模型训练。


登录后才可以发布评论哦
打开小程序可以发布评论哦