
V3 的三板斧,讲到最后一板了。
前两板:多头潜在注意力压缩了 KV 缓存,混合精度砍了参数内存。这第三板,管的是训练速度——多词元预测(MTP)。
它的核心想法一句话就能说清:别让模型一次只猜下一个字了,让它一次多看几步。
01 传统做法:一次只猜下一个字
先看传统训练。模型读入一段上文,然后预测下一个词元;预测完,把这个词元接回去,再预测下一个。一步一步,像走路一样一格一格往前挪。
这种做法稳,但慢。而且模型每一步只盯着 " 下一步是什么 ",被迫做不了长远打算。
02 MTP 的想法:一次并行猜后面 4 个
多词元预测的思路是:训练时,让模型一次性预测接下来的 n 个词元——比如 4 个。
怎么实现?给每个待预测的位置,配一个额外的、独立的输出头。它们共享同一套 Transformer 主干,却同时吐出 4 组预测结果,如下图所示。

03 为什么有用:损失累加,逼模型想得更远
关键在损失怎么算:训练时,4 个位置的预测损失会全部加起来。
这意味着,模型在猜下一个词元的同时,还得顺便把后面 3 个也猜个八九不离十。它被迫开始 " 往长远看 ",而不是只赌眼前一步。这对模型理解长距离依赖、练出更连贯的表达,都有帮助。
04 但推理时要关掉它
不过,这套机制在推理阶段通常是关掉的。
原因很简单:4 个词元是各自独立预测的,彼此不知道对方说了什么。真要这么生成,上下文的一致性容易被破坏——前面刚说 " 我喜欢吃苹果 ",后面独立猜的可能接出一句驴唇不对马嘴的话,如下图所示。

那它就一点用没有了吗?也不是。在对响应速度要求特别高的场景,比如实时对话、批量处理,可以临时开启,用这种 " 一次性吐一串 " 的方式把推理速度拉上去。相当于一个可开关的 " 超速模式 ":要质量就关掉,要速度就打开。
05 DeepSeek-V3 的改良:顺序预测,既快又连贯
原始思路是完全并行、各猜各的。DeepSeek-V3 借鉴了这个想法,但做了关键改良:不再并行独立猜,而是顺序地预测后续词元。
具体来说,主模型正常预测下一个词元;后面挂的 MTP 模块,一个接一个地预测第 2 个、第 3 个词元——每一步都建立在前一步的结果上,词元之间的上下文依赖完整保留,输出自然更连贯,如下图所示。

06 CEO 与 CTO 怎么看
如果站在行业视角看,这 " 最后一板斧 " 里,同样藏着两个信号。
从 CEO 的视角看:训练速度,就是产品的迭代速度。
一位 AI 公司的 CEO 算的是时间账:
大模型训练动辄几千张卡、跑几个月,快一天就是真金白银。
MTP 让模型在训练时 " 一次多想几步 ",等于让每一次训练迭代都更有信息量,训练效率整体往上走。
对商业来说,这意味着新模型从实验室到用户手里的周期更短。
另一个值得注意的细节是 " 可开关 ":推理时默认关掉保质量,高并发场景打开换速度——这种弹性,恰好是 ToB 产品最需要的:不同客户、不同场景,要不同的速度与质量组合。
从 CTO 的视角看:这是一个 " 训练时用、推理时卸 " 的聪明结构。
一位技术出身的 CTO 会欣赏这种设计:
MTP 的额外输出头和模块,本质上是训练期的 " 辅助教练 " ——逼模型练出长远预测能力;
但模型真正上线回答问题时,这些额外的头可以全部卸掉,主干模型本身一点不变。
也就是说,训练时多出来的复杂度,没有带进推理成本。
再看 DeepSeek-V3 的改良:从 " 并行瞎猜 " 改成 " 顺序预测 ",补上了原始 MTP 最被诟病的连贯性问题。
这种 " 站在别人肩膀上、再补一刀 " 的做法,正是工程创新的典型路径。
结尾:三板斧齐了,V3 讲完了
回顾 V3 的三板斧:
MLA 把 KV 缓存压缩了,混合精度把参数内存砍到四分之一,MTP 让训练一次多想几步。
一个省存储、一个省内存、一个省时间——三个方向,同一个目标:让大模型又好又便宜。
基础模型讲到这就齐了。接下来,就该看 DeepSeek 是怎么在 V3 这块底子上,通过强化学习一步步打磨出 R1 的了。欢迎关注,持续更新。


登录后才可以发布评论哦
打开小程序可以发布评论哦