为什么 DeepSeek-R1 这类模型在回答前会先「想很久」,甚至被看到一段 <think>...</think> 的内心小剧场?这篇笔记整理自一堂推理模型公开课,讲清「深度思考」的本质、打造推理能力的四大技术路径,以及 R1 从纯强化学习到知识蒸馏的完整训练链路。
核心导览
- 什么是“深度思考”(Reasoning)与 Test-Time Compute?
- 打造推理大模型的四大技术路径
- 路径一:提示词引导的长思维链(Supervised CoT)
- 路径二:显式推理工作流与树状搜索(Workflow / Search)
- 路径三:模仿学习与错误恢复(Imitation & Journey Learning)
- 路径四:基于结果导向的强化学习(Outcome-based RL)
- 深入解密 DeepSeek-R1 的完整训练链路
- 深度思考的挑战:过度思考(Overthinking)与算力平衡
1. 什么是“深度思考”与 Test-Time Compute?
1.1 深度思考的表面行为与本质
像 OpenAI o 系列、DeepSeek-R1、Claude 3.7 Sonnet (Extended Thinking) 等模型,在给出最终答案前,会先输出一段被 <think>...</think> 包裹的漫长“内心小剧场”。
在思考过程中,模型会自发进行:
- 解题规划(分解目标、设立子计划)
- 探索多种解法(尝试不同路径)
- 自主验证与纠错(“Let me check the answer… Wait, I might be overthinking”)
1.2 核心思想:Test-Time Compute & Test-Time Scaling
在机器学习中,Inference(推论)指模型运行,而 Reasoning(推理/深度思考) 指在测试推理阶段消耗更多计算资源进行探索。
- 深度不够,长度来凑:如果模型本身的层数/参数有限(Training-Time Compute 封顶),可以通过在测试阶段生成更长、更深入的思考序列(Test-Time Compute)来换取更高的任务正确率。
- 类似 AlphaGo 训练了 Policy/Value Network,但在落子测试时依然依靠蒙特卡洛树搜索(MCTS)进行大规模前瞻搜索,测试算力与训练算力可以互相弥补。
2. 打造推理大模型的四大技术路径
李老师将打造深度思考能力归纳为两大类、共四种方法:
类别 A:无需微调模型参数(Zero/Few-Shot & Workflow)
方法 1:Supervised Chain of Thought (Supervised CoT)
- 从最基础的 Few-shot CoT、Zero-shot CoT (“Let’s think step by step”),演进到通过长提示词细致规范模型的思考框架。
- 明确要求模型:先做题目分析 拟定总体计划 逐步执行并给出子计划 采用多方法交叉验算 标记
<think>标签。 - 局限:对基座模型本身的指令遵循能力要求极高,较弱的模型容易忽略复杂规划约束。
方法 2:显式推理工作流程与搜索(Workflow & Search)
直接由外层系统控制模型多次采样与搜索筛选:
- 无限猴子定理与 Self-Consistency(Majority Vote):让模型对同一问题生成成百上千个答案,通过多数投票(Majority Vote)选出最高频答案。
- Best-of-N(结果验证器,Outcome Verifier):训练独立的 Verifier 评估模型生成的候选答案,挑出最优解。
- 过程验证器(Process Verifier, PRM)与束搜索(Beam Search / MCTS):
- 将生成拆解为一步步(如遇到
</step>暂停),由 PRM 对当前步骤打分(评估从该步走到终点的期望成功率)。 - 仅保留得分最高的 Top-N 条路径继续向下探索,剪枝错误路径。
- 将生成拆解为一步步(如遇到
类别 B:需要后训练微调参数(Post-Training & RL)
方法 3:模仿学习与“知错能改”(Imitation & Journey Learning)
- 数据构建难题:高质量的完整思考过程极其稀缺。可通过强模型自生成 答案校验保留正确 CoT 作为监督微调(SFT)数据。
- 从 Shortcut Learning 走向 Journey Learning:
- 若训练数据全是一帆风顺的“完美推导”(Shortcut),模型只会打顺风仗,一旦测试中某步出错就会一路硬拗到底。
- Journey Learning:在树状搜索中故意引入走入死胡同后再回溯纠错的真实搜索轨迹(Depth-First Search + Verifier 反馈),训练模型学会识别错误并逆转思路(“Oops, let’s rethink”)。
- 知识蒸馏(Knowledge Distillation):直接利用强大的 Reasoning 模型(如 DeepSeek-R1)生成的大量思维链微调中小模型(如 Qwen-2.5-32B、Llama-3-8B),低成本复刻推理能力。
方法 4:基于结果导向的强化学习(Outcome-based RL,DeepSeek-R1-Zero 核心)
- 只问结果,不设过程偏见:
- 给模型输入问题,由模型自由生成思考过程。
- 仅根据最终答案的对错给予奖励(Positive/Negative Reward),外加极简的格式奖励(强制包含
<think>标签)。
- 涌现 Aha Moment:在强化学习过程中,模型在没有人工干预的情况下,自主学会了反思、检查、多解法验算以及“突然顿悟”的纠错行为。
3. 深入解密 DeepSeek-R1 的完整训练链路
许多人误以为 DeepSeek-R1 仅仅是靠纯 RL 训练出来的,实际上它巧妙融合了上述所有技术路线:
[DeepSeek-V3 Base]
│
▼ (Pure RL with Outcome Reward)
[DeepSeek-R1-Zero] ── 具有强大的自发推理能力,但输出混乱、多语言混杂、可读性极差
│
▼ (利用 R1-Zero + Supervised CoT 生成数千条高质量思考数据 + 人工清洗改写)
[Cold-Start SFT]
│
▼ (微调 DeepSeek-V3 Base)
[Model A]
│
▼ (RL 强化:加入语言一致性 Reward,提升可读性)
[Model B]
│
▼ (利用 Model B 大规模生成 60 万条通用任务推理数据 + 20 万条常规 SFT 数据)
[General SFT]
│
▼ (微调 DeepSeek-V3 Base)
[Model C]
│
▼ (Secondary RL:针对安全对齐 Safety & 实用性 Helpful 进行强化)
[DeepSeek-R1 (最终正式发布版)]
│
▼ (知识蒸馏 Distillation)
[蒸馏出 Qwen / Llama 等轻量推理模型]
关键认知:
- 纯 RL 的前提是基座底模足够强:在 671B(激活 37B)的 DeepSeek-V3 上做纯 RL 能涌现推理,但在 32B 基座上直接做纯 RL 效果有限。因为 RL 本质上是放大和激发模型已具备的潜在能力,中小模型更适合通过蒸馏直接学习思考轨迹。
- 四种方法并不互斥:经过 RL 训练出的 R1 模型,在 Inference 阶段配合 Majority Vote 或 Best-of-N,性能依然能够进一步大幅跃升!
4. 深度思考的挑战:过度思考(Overthinking)
在课程的后半段,李老师生动展示了 R1 计算简单算式 123 × 456 的过程:
- 尽管模型第一步心算就已经算出了正确答案
56088,但由于强化学习形成的“验算偏好”,它在脑内小剧场硬生生进行了:- 标准乘法展开验算
- 逆向直式分解验算
- 数量级上下界粗估
- 因子多重拆解
- 九项多项式交叉展开……
- 推理瓶颈:长推理消耗极高 Token 成本与响应延迟。如何在简单任务上避免无意义的“过度思考”,将计算算力精准分配在真正困难的环节上,是当前推理模型研究的最前沿课题。
小结
- 深度思考的本质是 Test-Time Compute:训练算力有上限,就用测试阶段更长的思考来补;四大技术路径都是为了让模型在推理时「多想一会」。
- 纯 RL 很依赖基座够强:R1-Zero 的「顿悟时刻」建立在 DeepSeek-V3(671B)这个强基座上,中小模型更适合走知识蒸馏路线,直接学习强模型的思考轨迹。
- 过度思考是当前最前沿的难题:模型会给
123 × 456反复验算好几遍,如何对简单任务省下算力、把算力精准留给真正困难的环节,是推理模型下一步要攻克的课题。