大模型微调(Supervised Fine-Tuning,SFT)是当前最主流的 LLM 落地方案。无论是医疗问答、代码生成,还是法律文书,上到千亿参数大模型、下到端侧小模型,几乎都在用 SFT 做领域适配。
但一个尴尬的事实是:大家都默认 SFT" 训练完就是学完了 "。直到腾讯混元团队对 Qwen、LLaMA、OLMo2 等多个模型家族(1.8B – 14B)和 10 个数据集做了全面排查,发现每个模型、每个数据集上都有一批训练样本——模型在训练中见过,loss 也降下去了,但回头重测就是答不对。平均比例高达15.3%。
这就是论文定义的不完全学习现象(Incomplete Learning Phenomenon,ILP)—— SFT 训练的系统性盲区。
发表:ACL 2026 主会长文(Long Paper,Pages 30186 – 30213)
背景
场景与痛点
SFT 是 LLM 从 " 通才 " 变成 " 专才 " 的关键步骤。业界默认做法是:
准备标注数据(QA 对、指令 - 回复对等)
在基座模型上跑 SFT 训练
看 loss 曲线收敛了→认为训练完成
但问题在于:loss 是全局平均,掩盖了样本间的差异。loss 收敛只代表 " 大部分样本学会了 " ——那些始终学不会的样本被淹没了。
与之对比,预训练阶段对数据问题的排查非常深入(Dolma、C4 等都有专门的数据质量研究),但 SFT 阶段几乎没人追问 " 模型到底学会了什么、没学会什么 "。
论文做了什么
这篇论文完成了四项工作:
定义 ILP ——将 SFT 后无法正确复现训练样本的行为正式命名为 "Incomplete Learning"
找到五大根因——不是笼统地说 " 数据不好 ",而是把每个未学会样本对应到一个可解释的原因
提出四步诊断框架—— Detect → Attribute → Intervene → Verify,全流程可复现
验证五种干预——证明了 CPT 补充知识远优于加 epoch,且部分根因无法通过 SFT 本身解决
ILP 现象:训练 loss 收敛后仍有大量样本无法正确复现:
△不完全学习现象示意图—— SFT 后训练集回测,部分样本在训练过程中并未被有效学习
四步诊断框架一图胜千言:
△三段式诊断框架——检测→归因→干预,覆盖 ILP 全生命周期技术方案——四步诊断框架
整个框架分为四个阶段:
Detect(检测)→ Attribute(归因)→ Intervene(干预)→ Verify(验证)
Step 1:检测(Detect)——怎么知道模型 " 没学会 "?
这是最复杂的一步。难点在于:怎么区分 " 大致理解 " 和 " 真正学会 "?
SFT 通常生成自由文本,这种形式的 " 答对 " 太模糊。论文的做法是:
MC 转换(Multiple-Choice Conversion):
把每条 SFT 数据(QA 对)用 GPT-4 转成 4 选 1 选择题(1 个正确答案 +3 个干扰项)
四级质量过滤:答案可解性→唯一性→干扰项区分度→人工抽检
极端情况直接丢弃(如正确答案和干扰项太接近无法分辨)
案例:原始数据是 "What is the capital of France?→ Paris",转换成:
Q:What is the capital of France?
A. London B. Paris C. Berlin D. Madrid
pass@k 指标(k=5):
对每个 MC 题,用训练好的模型采样 5 次
只要 5 次中有 1 次选对了答案→判定为 " 已学会 "
5 次全部选错→判定为 ILP 样本
这里 k=5 不是随便取的:温度变化可能带来回答的随机性,pass@5= 给了 5 次机会,比 top-1 更公允。
三重验证(Triple Validation):
为避免误判,论文做了三层交叉验证:
跨温度一致性:同一样本在 T=0.1/0.5/1.0 下重新评估,ILP 差异 <0.5%
重测信度(Kappa=0.89):同一批样本两次独立检测,Cohen ’ s Kappa 高达 0.89
跨模型一致性:不同模型家族(Qwen/LLaMA/OLMo2)的 ILP 判定高度一致
检测流程图:
△MC 转换方案——将监督响应转化为选择题格式,消除自由文本评估噪声 Step 2:归因(Attribute)——为什么没学会?
这是全文最核心的贡献。论文提出了一个2 × 2 归因矩阵,纵轴是 " 基模型是否已掌握该知识 "(预训练阶段),横轴是 "SFT 标签是否正确 "(标注质量)。
两步快速定位:
知识方向判断:在基座模型上做零样本测试→如果基模型能答对,说明 " 知识已经有了 ",问题出在 SFT 过程的冲突;如果基模型答不对,说明 " 预训练阶段就缺知识 "
训练方向判断:取 early-20% checkpoint 和 late-20% checkpoint,比较:如果先答对后答错→左侧遗忘(IV);如果一直答不对→优化不足(V);如果有多个冲突标签→数据矛盾(III)
最终锁定五大根因:
2 × 2 归因矩阵:
△2 × 2 归因框架——横轴「基模型是否已知该知识」,纵轴「SFT 标签是否正确」
关键发现:ILP 与标注质量无关。即使 SFT 标签正确率超过 98%,ILP 仍然存在。说明这不是 " 数据错了 " 的问题,而是 SFT 训练机制本身的系统性不足。
另一个惊人发现:ILP 与模型规模弱相关。从 Qwen-1.8B 换到 Qwen-14B,ILP 仅降低 2.1 个百分点。也就是说,更大规模的模型并不能显著解决 " 学不会 " 的问题——这指向 SFT 优化机制,而不是模型容量。
Step 3:干预(Intervene)——怎么让模型学会?
论文根据五种根因,设计了对症的五类干预:
最惊人的对比实验:
CPT(2 倍训练量)→ ILP 降 12.5%
加 epochs(10 倍训练量)→ ILP 仅降 2%
这意味着:拼命加 SFT 训练轮次几乎没用,真正的瓶颈在于预训练阶段的知识储备。SFT 本身存在物理上限,它只能 " 重新组织 " 已有知识,无法凭空创造新知识。
Step 4:验证(Verify)——干预真的有效吗?
干预后重新走一遍检测流程,对比干预前后的 ILP 率:
使用相同的 MC 转换 +pass@5 评估
引入最小效应量阈值(min_effect=0.01),防止统计噪声
确保干预收益 > 统计波动
实验结果
ILP 现象确实存在
数据集中 ILP 分布:
△CPT 引入后医疗、法律、金融等知识密集型领域的准确率持续增长 ILP 与模型规模关系极弱
从 1.8B 到 14B,参数量翻了近 8 倍,ILP 仅降了 2.1 个百分点。ILP 是 SFT 机制层面的问题,不是模型不够大。
干预效果:CPT>> 加 Epochs
10 倍算力换来 2%vs2 倍算力换来 12.5%。该把钱花在预训练,而不是无限堆 SFT epoch。
物理溯源验证
将 ILP 样本中涉及的知识点在 Dolma 5T 语料库中检索:
19.3% 的知识点在 Dolma 中完全不存在→根因 I(知识缺失)
14.5% 存在冲突信息→根因 II(知识冲突)
消融与溯源结果:
△CPT 前后各模型准确率对比——提升在跨模型规模和领域中保持稳定
模型家族对比:
△应用各项优化策略后各基线模型的性能提升对比项目价值
学术价值
首次系统性定义和量化 SFT 中的不完全学习现象
提出了可复现的诊断框架(Detect → Attribute → Intervene → Verify)
揭示了 SFT 的物理上限:它只能重组已有知识,无法创造新知识
实践指导意义
不要迷信 loss 收敛。训练完了不等于学会了,需要 pass@k+MC 转换做样本级诊断。
加 epoch 性价比极低。10 倍 SFT 算力换 2% 改善,不如把预算投到预训练数据上。
知识缺失是第一大根因。如果你的下游任务有大量模型没见过的新知识,SFT 几乎无能为力——要先做 CPT。
数据去重和一致性是低成本高收益的事。全局 shuffle 和动态分桶实现简单,ROUGE-L 能提升 29%。
2 × 2 矩阵可在几分钟内完成根因定位。不需要全量重训,用 early/late checkpoint 对比即可。
作者团队
腾讯混元大模型团队(Tencent Hunyuan Team)& 新南威尔士大学(UNSW),14 位作者。研究方向涵盖 LLM 推理增强、奖励建模、模型效率优化等。
该工作入选ACL 2026 主会 Long Paper,是 SFT 诊断方向第一篇系统性研究。
论文(arXiv):https://arxiv.org/abs/2604.10079
论文(ACL Anthology):https://aclanthology.org/2026.acl-long.1393/
代码(GitHub):https://github.com/xccc-8071/why-supervised-fine-tuning-fails-to-learn
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目 / 主页链接,以及联系方式。
我们会 ( 尽量 ) 及时回复你 : )
点亮星标
科技前沿进展每日见


登录后才可以发布评论哦
打开小程序可以发布评论哦