智能体架构手记 6小时前
DeepSeek-V3的效率优化策略:多词元预测
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

V3 的三板斧,讲到最后一板了。

前两板:多头潜在注意力压缩了 KV 缓存,混合精度砍了参数内存。这第三板,管的是训练速度——多词元预测(MTP)。

它的核心想法一句话就能说清:别让模型一次只猜下一个字了,让它一次多看几步。

01 传统做法:一次只猜下一个字

先看传统训练。模型读入一段上文,然后预测下一个词元;预测完,把这个词元接回去,再预测下一个。一步一步,像走路一样一格一格往前挪。

这种做法稳,但慢。而且模型每一步只盯着 " 下一步是什么 ",被迫做不了长远打算。

02 MTP 的想法:一次并行猜后面 4 个

多词元预测的思路是:训练时,让模型一次性预测接下来的 n 个词元——比如 4 个。

怎么实现?给每个待预测的位置,配一个额外的、独立的输出头。它们共享同一套 Transformer 主干,却同时吐出 4 组预测结果,如下图所示。

03 为什么有用:损失累加,逼模型想得更远

关键在损失怎么算:训练时,4 个位置的预测损失会全部加起来。

这意味着,模型在猜下一个词元的同时,还得顺便把后面 3 个也猜个八九不离十。它被迫开始 " 往长远看 ",而不是只赌眼前一步。这对模型理解长距离依赖、练出更连贯的表达,都有帮助。

04 但推理时要关掉它

不过,这套机制在推理阶段通常是关掉的。

原因很简单:4 个词元是各自独立预测的,彼此不知道对方说了什么。真要这么生成,上下文的一致性容易被破坏——前面刚说 " 我喜欢吃苹果 ",后面独立猜的可能接出一句驴唇不对马嘴的话,如下图所示。

那它就一点用没有了吗?也不是。在对响应速度要求特别高的场景,比如实时对话、批量处理,可以临时开启,用这种 " 一次性吐一串 " 的方式把推理速度拉上去。相当于一个可开关的 " 超速模式 ":要质量就关掉,要速度就打开。

05 DeepSeek-V3 的改良:顺序预测,既快又连贯

原始思路是完全并行、各猜各的。DeepSeek-V3 借鉴了这个想法,但做了关键改良:不再并行独立猜,而是顺序地预测后续词元。

具体来说,主模型正常预测下一个词元;后面挂的 MTP 模块,一个接一个地预测第 2 个、第 3 个词元——每一步都建立在前一步的结果上,词元之间的上下文依赖完整保留,输出自然更连贯,如下图所示。

06 CEO 与 CTO 怎么看

如果站在行业视角看,这 " 最后一板斧 " 里,同样藏着两个信号。

从 CEO 的视角看:训练速度,就是产品的迭代速度。

一位 AI 公司的 CEO 算的是时间账:

大模型训练动辄几千张卡、跑几个月,快一天就是真金白银。

MTP 让模型在训练时 " 一次多想几步 ",等于让每一次训练迭代都更有信息量,训练效率整体往上走。

对商业来说,这意味着新模型从实验室到用户手里的周期更短。

另一个值得注意的细节是 " 可开关 ":推理时默认关掉保质量,高并发场景打开换速度——这种弹性,恰好是 ToB 产品最需要的:不同客户、不同场景,要不同的速度与质量组合。

从 CTO 的视角看:这是一个 " 训练时用、推理时卸 " 的聪明结构。

一位技术出身的 CTO 会欣赏这种设计:

MTP 的额外输出头和模块,本质上是训练期的 " 辅助教练 " ——逼模型练出长远预测能力;

但模型真正上线回答问题时,这些额外的头可以全部卸掉,主干模型本身一点不变。

也就是说,训练时多出来的复杂度,没有带进推理成本。

再看 DeepSeek-V3 的改良:从 " 并行瞎猜 " 改成 " 顺序预测 ",补上了原始 MTP 最被诟病的连贯性问题。

这种 " 站在别人肩膀上、再补一刀 " 的做法,正是工程创新的典型路径。

结尾:三板斧齐了,V3 讲完了

回顾 V3 的三板斧:

MLA 把 KV 缓存压缩了,混合精度把参数内存砍到四分之一,MTP 让训练一次多想几步。

一个省存储、一个省内存、一个省时间——三个方向,同一个目标:让大模型又好又便宜。

基础模型讲到这就齐了。接下来,就该看 DeepSeek 是怎么在 V3 这块底子上,通过强化学习一步步打磨出 R1 的了。欢迎关注,持续更新。

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论