一、这一章要解决的问题:R1 到底是怎么 " 练 " 出来的
前面几章拆完了 DeepSeek-R1 的架构——稠密层、MoE 层、专家、路由器 , 这些都是 " 骨架 " 层面的东西。但骨架搭好了 , 不代表它就会推理。真正让 DeepSeek-R1 学会 " 先想后答 " 的 , 是它的训练方案。
DeepSeek-R1 是推理模型领域的一次重大突破——它不仅开源 , 连模型权重都全部公开 , 直接对标 OpenAI 的 o1 推理模型 , 给整个行业都带来了不小的震动。而 DeepSeek 团队最厉害的地方在于:他们用了好几项技术 , 把推理能力优雅地 " 注入 " 到了基座模型 ( DeepSeek-V3-Base ) 里。
这里有个容易让人意外的地方:整个过程没有用到验证器 , 也没有靠监督微调直接教会模型推理 , 而是把主要功夫下在了强化学习上。换句话说 , 前面几篇聊过的 " 多算几个答案再挑一个 " 那套验证器方法 , 在 DeepSeek-R1 的训练里并不是主角——真正的主角 , 是让模型自己在不断试错中 , 把推理这件事 " 练 " 出来。
二、先看模型说话的方式:什么是 " 思考词元 "
和大多数大模型一样 ,DeepSeek-R1 说话的方式也是一个词一个词往外蹦 ( 逐词元生成 ) 。但它在数学和推理类问题上表现格外突出 , 原因在于一种特殊的训练方法:它会先生成一堆能够解释自己思考过程的 " 思考词元 " ( thinking token ) , 相当于先在草稿纸上把过程写清楚 , 花更多时间琢磨问题 , 再给出正式答案。
这张图画得很直白:问题送进 DeepSeek-R1, 出来的不只是一个答案 , 而是 " 思考 " 和 " 答案 " 两部分——思考部分就是那些思考词元 , 答案部分才是最终交卷的内容。
三、造一个好用的大模型 , 通常要走三步
要理解 DeepSeek-R1 具体做了什么创新 , 得先知道一个 " 标准答案 " ——构建高质量大模型的通用方案 , 通常包含三个关键阶段。
第一步 , 语言建模阶段:用海量的网络文本数据 , 训练模型去预测 " 下一个词该是什么 "。这一步结束 , 产出的是基座模型——它已经会说人话 , 但还不太会好好回答问题、听指令办事。
第二步 , 监督微调阶段:让模型在遵循指令、回答问题这件事上变得更实用。这一步产出的叫指令调优模型 , 也叫监督微调模型 ( SFT 模型 ) 。
第三步 , 偏好调优阶段:通过对齐人类的偏好 , 进一步打磨模型的行为——比如让它说话更得体、更符合人类期待。这一步产出的 , 才是真正可以让用户交互使用的偏好调优大模型。
四、DeepSeek-R1 走的还是这三步,但每一步都动了手脚
DeepSeek-R1 基本上还是沿着这个 " 标准答案 " 往下走 , 但每一步具体怎么实施 , 都藏着自己的创新。
第一阶段 ( 语言建模 ) ,DeepSeek-R1 直接借用了 DeepSeek-V3 那篇论文里训练出来的基座模型——注意 , 用的是 " 基座模型 " 这个半成品 , 而不是已经打磨完成的 DeepSeek-V3 本身。
第二、三阶段依然是监督微调加偏好调优的思路 , 但具体的实现方法 , 和前面说的 " 标准答案 " 有着实实在在的创新差异。
这张图勾勒出 DeepSeek-R1 训练过程的骨架:从 DeepSeek-V3-Base 出发 , 经过监督微调 , 得到一个 "SFT 检查点 ", 再通过强化学习微调 , 最终得到 DeepSeek-R1。
这个骨架里 , 藏着三个特别值得展开讲讲的地方。
五、特别之处一:哪来的 60 万条推理示例
监督微调这一步 , 需要用到数量庞大的长链思维推理示例—— DeepSeek-R1 的训练一共用了 60 万个这样的示例。
这个规模意味着什么 ? 意味着靠人工一条一条去标注 , 几乎是不可能完成的任务——这么大的工作量 , 一来数据本身就极难获取 , 二来人工标注的成本高得吓人。正因为如此 ," 这 60 万条推理数据到底是怎么生成出来的 ", 本身就是这套训练方案里最值得拿出来说道的创新点之一。
六、特别之处二:一个 " 临时工 " 模型立了大功
答案是:这批数据不是人标出来的 , 而是由一个临时性的推理大模型生成的。
这个临时模型没有正式名字 , 专门擅长推理任务 , 设计灵感来自另一个模型—— DeepSeek-R1-Zero ( 这个模型我们下一篇会专门展开讲 ) 。
这个 " 临时工 " 真正的价值 , 并不在于它自己作为一个大模型有多好用——恰恰相反 , 它在非推理类任务上表现其实并不出色。它真正的意义在于:构建它只需要少量标注数据 , 配合大规模的强化学习训练 , 就能 " 练 " 出一个特别擅长解决推理问题的模型。
有了这个专精推理 ( 但其他方面比较 " 偏科 " ) 的临时模型之后 , 开发人员就可以用它批量生成输出结果 , 再拿这些结果去训练一个更通用的模型。这样一来 , 最终炼成的通用模型 , 既能完成推理任务 , 在非推理任务上也能达到用户对一个大模型的正常期待。
七、特别之处三:临时模型本身又是怎么来的
那么问题来了:这个专精推理的临时模型 , 又是怎么被训练出来的 ?
答案是大规模的推理导向的强化学习。
这张图把整套逻辑串了起来:
( 1 ) 推理导向的强化学习 , 练出了那个临时推理模型 ; 临时推理模型生成了长链思维推理数据 ; 这些数据被用来对 DeepSeek-V3-Base 做监督微调 , 得到 SFT 检查点 ;SFT 检查点再经过 ( 2 ) 通用强化学习的进一步打磨 , 才最终变成 DeepSeek-R1。
这里顺带说一句 " 推理导向的强化学习 " 到底和我们比较熟悉的 RLHF ( 基于人类反馈的强化学习 ) 有什么不同。
RLHF 的目标 , 是让模型的表达方式更符合人类偏好——说话更得体、格式更友好、不说危险的内容 , 说白了是在管 " 模型该怎么说话 "。
而推理导向的强化学习目标完全不同 , 它是要让模型真正具备解决数学题、写对代码、理清逻辑这类需要动脑子的能力 , 管的是 " 模型能不能真正想明白 "。
八、来看一眼 , 思考词元到底长什么样
说了这么多 " 长链思维示例 ", 不如直接看一个具体的例子——还是那道熟悉的苹果题 :
用户输入 : 我有 10 个苹果 , 送出去 2 个 , 又买了 5 个 , 吃掉 1 个 , 还剩多少个 ?
思维链推理 : 先确认起始有 10 个苹果 ; 送出去 2 个 ,10-2=8; 又买了 5 个 ,8+5=13; 吃掉 1 个 ,13-1=12。
最终回答 :12
这正是强化学习训练时 , 希望模型去模仿和学习的那种推理过程——先把每一步算清楚、写明白 , 再落到最终答案上。
九、写在最后
这一章开了个头 , 勾勒出 DeepSeek-R1 训练方案的整体轮廓:借用 DeepSeek-V3 的基座模型 , 靠一个专精推理的 " 临时工 " 模型生成海量高质量推理数据 , 再通过监督微调加强化学习 , 最终炼成 DeepSeek-R1。而这一切的起点 , 都指向了那个还没正式登场的关键角色—— DeepSeek-R1-Zero。
下一篇 , 我们将正式认识 DeepSeek-R1-Zero, 看看这个 " 专精推理 " 的模型究竟是怎么被训练出来的。欢迎关注 , 持续更新。


登录后才可以发布评论哦
打开小程序可以发布评论哦