量子位 19小时前
Loss收敛不代表学会:腾讯混元ACL 2026拆解SFT训练中15.3%的“假学会”样本
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

大模型微调(Supervised Fine-Tuning,SFT)是当前最主流的 LLM 落地方案。无论是医疗问答、代码生成,还是法律文书,上到千亿参数大模型、下到端侧小模型,几乎都在用 SFT 做领域适配。

但一个尴尬的事实是:大家都默认 SFT" 训练完就是学完了 "。直到腾讯混元团队对 Qwen、LLaMA、OLMo2 等多个模型家族(1.8B – 14B)和 10 个数据集做了全面排查,发现每个模型、每个数据集上都有一批训练样本——模型在训练中见过,loss 也降下去了,但回头重测就是答不对。平均比例高达15.3%

这就是论文定义的不完全学习现象(Incomplete Learning Phenomenon,ILP)—— SFT 训练的系统性盲区。

发表:ACL 2026 主会长文(Long Paper,Pages 30186 – 30213)

背景

场景与痛点

SFT 是 LLM 从 " 通才 " 变成 " 专才 " 的关键步骤。业界默认做法是:

准备标注数据(QA 对、指令 - 回复对等)

在基座模型上跑 SFT 训练

看 loss 曲线收敛了→认为训练完成

但问题在于:loss 是全局平均,掩盖了样本间的差异。loss 收敛只代表 " 大部分样本学会了 " ——那些始终学不会的样本被淹没了。

与之对比,预训练阶段对数据问题的排查非常深入(Dolma、C4 等都有专门的数据质量研究),但 SFT 阶段几乎没人追问 " 模型到底学会了什么、没学会什么 "。

论文做了什么

这篇论文完成了四项工作:

定义 ILP ——将 SFT 后无法正确复现训练样本的行为正式命名为 "Incomplete Learning"

找到五大根因——不是笼统地说 " 数据不好 ",而是把每个未学会样本对应到一个可解释的原因

提出四步诊断框架—— Detect → Attribute → Intervene → Verify,全流程可复现

验证五种干预——证明了 CPT 补充知识远优于加 epoch,且部分根因无法通过 SFT 本身解决

ILP 现象:训练 loss 收敛后仍有大量样本无法正确复现:

不完全学习现象示意图—— SFT 后训练集回测,部分样本在训练过程中并未被有效学习

四步诊断框架一图胜千言:

三段式诊断框架——检测→归因→干预,覆盖 ILP 全生命周期技术方案——四步诊断框架

整个框架分为四个阶段:

Detect(检测)→ Attribute(归因)→ Intervene(干预)→ Verify(验证)

Step 1:检测(Detect)——怎么知道模型 " 没学会 "?

这是最复杂的一步。难点在于:怎么区分 " 大致理解 " 和 " 真正学会 "?

SFT 通常生成自由文本,这种形式的 " 答对 " 太模糊。论文的做法是:

MC 转换(Multiple-Choice Conversion):

把每条 SFT 数据(QA 对)用 GPT-4 转成 4 选 1 选择题(1 个正确答案 +3 个干扰项)

四级质量过滤:答案可解性→唯一性→干扰项区分度→人工抽检

极端情况直接丢弃(如正确答案和干扰项太接近无法分辨)

案例:原始数据是 "What is the capital of France?→ Paris",转换成:

Q:What is the capital of France?

A. London B. Paris C. Berlin D. Madrid

pass@k 指标(k=5):

对每个 MC 题,用训练好的模型采样 5 次

只要 5 次中有 1 次选对了答案→判定为 " 已学会 "

5 次全部选错→判定为 ILP 样本

这里 k=5 不是随便取的:温度变化可能带来回答的随机性,pass@5= 给了 5 次机会,比 top-1 更公允。

三重验证(Triple Validation):

为避免误判,论文做了三层交叉验证:

跨温度一致性:同一样本在 T=0.1/0.5/1.0 下重新评估,ILP 差异 <0.5%

重测信度(Kappa=0.89):同一批样本两次独立检测,Cohen ’ s Kappa 高达 0.89

跨模型一致性:不同模型家族(Qwen/LLaMA/OLMo2)的 ILP 判定高度一致

检测流程图:

MC 转换方案——将监督响应转化为选择题格式,消除自由文本评估噪声 Step 2:归因(Attribute)——为什么没学会?

这是全文最核心的贡献。论文提出了一个2 × 2 归因矩阵,纵轴是 " 基模型是否已掌握该知识 "(预训练阶段),横轴是 "SFT 标签是否正确 "(标注质量)。

两步快速定位:

知识方向判断:在基座模型上做零样本测试→如果基模型能答对,说明 " 知识已经有了 ",问题出在 SFT 过程的冲突;如果基模型答不对,说明 " 预训练阶段就缺知识 "

训练方向判断:取 early-20% checkpoint 和 late-20% checkpoint,比较:如果先答对后答错→左侧遗忘(IV);如果一直答不对→优化不足(V);如果有多个冲突标签→数据矛盾(III)

最终锁定五大根因:

2 × 2 归因矩阵:

2 × 2 归因框架——横轴「基模型是否已知该知识」,纵轴「SFT 标签是否正确」

关键发现:ILP 与标注质量无关。即使 SFT 标签正确率超过 98%,ILP 仍然存在。说明这不是 " 数据错了 " 的问题,而是 SFT 训练机制本身的系统性不足。

另一个惊人发现:ILP 与模型规模弱相关。从 Qwen-1.8B 换到 Qwen-14B,ILP 仅降低 2.1 个百分点。也就是说,更大规模的模型并不能显著解决 " 学不会 " 的问题——这指向 SFT 优化机制,而不是模型容量。

Step 3:干预(Intervene)——怎么让模型学会?

论文根据五种根因,设计了对症的五类干预:

最惊人的对比实验:

CPT(2 倍训练量)→ ILP 降 12.5%

加 epochs(10 倍训练量)→ ILP 仅降 2%

这意味着:拼命加 SFT 训练轮次几乎没用,真正的瓶颈在于预训练阶段的知识储备。SFT 本身存在物理上限,它只能 " 重新组织 " 已有知识,无法凭空创造新知识。

Step 4:验证(Verify)——干预真的有效吗?

干预后重新走一遍检测流程,对比干预前后的 ILP 率:

使用相同的 MC 转换 +pass@5 评估

引入最小效应量阈值(min_effect=0.01),防止统计噪声

确保干预收益 > 统计波动

实验结果

ILP 现象确实存在

数据集中 ILP 分布:

CPT 引入后医疗、法律、金融等知识密集型领域的准确率持续增长 ILP 与模型规模关系极弱

从 1.8B 到 14B,参数量翻了近 8 倍,ILP 仅降了 2.1 个百分点。ILP 是 SFT 机制层面的问题,不是模型不够大。

干预效果:CPT>> 加 Epochs

10 倍算力换来 2%vs2 倍算力换来 12.5%。该把钱花在预训练,而不是无限堆 SFT epoch。

物理溯源验证

将 ILP 样本中涉及的知识点在 Dolma 5T 语料库中检索:

19.3% 的知识点在 Dolma 中完全不存在→根因 I(知识缺失)

14.5% 存在冲突信息→根因 II(知识冲突)

消融与溯源结果:

CPT 前后各模型准确率对比——提升在跨模型规模和领域中保持稳定

模型家族对比:

应用各项优化策略后各基线模型的性能提升对比项目价值

学术价值

首次系统性定义和量化 SFT 中的不完全学习现象

提出了可复现的诊断框架(Detect → Attribute → Intervene → Verify)

揭示了 SFT 的物理上限:它只能重组已有知识,无法创造新知识

实践指导意义

不要迷信 loss 收敛。训练完了不等于学会了,需要 pass@k+MC 转换做样本级诊断。

加 epoch 性价比极低。10 倍 SFT 算力换 2% 改善,不如把预算投到预训练数据上。

知识缺失是第一大根因。如果你的下游任务有大量模型没见过的新知识,SFT 几乎无能为力——要先做 CPT。

数据去重和一致性是低成本高收益的事。全局 shuffle 和动态分桶实现简单,ROUGE-L 能提升 29%。

2 × 2 矩阵可在几分钟内完成根因定位。不需要全量重训,用 early/late checkpoint 对比即可。

作者团队

腾讯混元大模型团队(Tencent Hunyuan Team)& 新南威尔士大学(UNSW),14 位作者。研究方向涵盖 LLM 推理增强、奖励建模、模型效率优化等。

该工作入选ACL 2026 主会 Long Paper,是 SFT 诊断方向第一篇系统性研究。

论文(arXiv):https://arxiv.org/abs/2604.10079

论文(ACL Anthology):https://aclanthology.org/2026.acl-long.1393/

代码(GitHub):https://github.com/xccc-8071/why-supervised-fine-tuning-fails-to-learn

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—    —

【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁从哪来投稿内容附上项目 / 主页链接,以及联系方式

  我们会 ( 尽量 ) 及时回复你 : )

点亮星标

科技前沿进展每日见

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

腾讯 医疗
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论