跳转到正文
文章目录

核心问题:GPT-4、DeepSeek R1、推理模型……这些"突破"到底在技术层面做了什么?和"换个 prompt 试试"有什么根本区别?


先说结论:调参侠 vs 真正的技术突破

"调参侠"的工作是:在固定模型的权重(参数)上,通过改变输入(prompt、temperature、top_p)或选择现成工具,让模型输出更好看的结果。

真正的技术突破在于:改变模型权重本身的分布——通过新的训练目标、新的架构、新的优化算法,让模型"学会"了之前根本不会的能力。

两者的分界线很清晰:权重有没有被改变,以及如何被改变。


一、推理模型的技术核心:GRPO + RLVR

问题的起点

传统的 LLM 训练目标是最大化下一个 token 的预测概率(交叉熵损失)。这意味着模型学习的是"语料中什么词最可能出现在这里",而不是"什么推理过程能得出正确答案"。

让模型做数学题时,它学到的是"在这种题型后,通常会出现这样格式的答案"——它在拟合表面模式,而非真正推理。

RLHF 的局限

RLHF(人类反馈强化学习)是 ChatGPT 能"好好说话"的原因——训练一个奖励模型(Reward Model)来模拟人类偏好,再用 PPO 算法优化语言模型。

但奖励模型本身会出错,甚至被"欺骗"(reward hacking):模型学会了用漂亮格式、自信语气让人觉得答案正确,而非真的做对了题。

RLVR:用"可验证奖励"绕过这个问题

RLVR(Reinforcement Learning with Verifiable Rewards)的核心思想极其简单:

不需要人来判断答案对不对——让程序来判断。

</> PYTHON
def verifier(model_output: str, ground_truth: str) -> float:
    """
    奖励函数:可以被程序精确判断的任务
    - 数学题:答案和标准答案完全匹配 → 1.0
    - 代码题:放进解释器跑,通过所有单元测试 → 1.0
    - 格式约束:输出是否符合 <think>...</think> 格式 → 0 or 1
    """
    if check_math_answer(model_output, ground_truth):
        return 1.0
    return 0.0

这个奖励信号是确定性的、无法被语言技巧欺骗的。你不能用"优雅的表述"骗过一个数学验证器。

GRPO:不需要 Critic 模型的强化学习

DeepSeek 在 RLVR 的基础上使用了 GRPO(Group Relative Policy Optimization),这是对 PPO 的一个关键改进:

PPO 需要训练一个和策略模型同等大小的 **Critic(价值网络)**来估计优势函数(Advantage),这几乎让计算成本翻倍。

GRPO 的做法:对同一个问题,采样一组(Group)答案,用这组答案的相对得分作为基线,直接计算优势:

Ai=ri−mean(r1,...,rG)std(r1,...,rG)A_i = \frac{r_i - \text{mean}(r_1, ..., r_G)}{\text{std}(r_1, ..., r_G)}
  • rir_i:第 ii 个采样答案的奖励分数
  • GG:每个问题采样的答案数量(通常 8-16 个)

这意味着:模型对同一道题生成多个不同的推理链,正确的推理链得到正向强化,错误的得到负向惩罚。模型逐渐学会"在内部展开更长、更严谨的推理链"——因为这样才能稳定拿到高奖励。

这就是 DeepSeek R1、OpenAI o1 能"慢思考"的技术根源:不是 prompt 要求它思考,而是训练目标逼着它必须思考才能拿到奖励。

一个关键争议

研究界有一个值得记录的争论:清华大学 2025 年的研究认为,RLVR 的提升本质上是采样效率的压缩——把模型"采样 K 次能成功"的能力,压缩进"采样 1 次就成功"的单次推理中,而非真正扩展了推理边界。

反驳方(arXiv 2506.14245)则引入了新指标 CoT-Pass@K,不仅看最终答案,还验证推理链是否逻辑正确,证明 RLVR 确实在推理质量上带来了真实提升,而非单纯的概率分布调整。

这个争议本身就说明:真正的 AI 研究关心的是"模型到底学到了什么",而不是"跑分更好看"。


二、MoE:用"专家委员会"取代"全能选手"

稠密模型的困境

传统 Transformer 是稠密模型(Dense Model):每个输入 token,都要经过所有参数计算。GPT-3 有 1750 亿参数,每推理一个 token,就要激活全部 1750 亿参数——成本极高。

MoE 的核心设计

MoE(Mixture of Experts)打破了这个逻辑:

</> PLAINTEXT
输入 token
    ↓
[门控网络 / Router]  ← 轻量级,决定"派给谁处理"
    ↓
专家 1  专家 2  专家 3  ...  专家 N
   ↑ 只激活 Top-K 个
    ↓
加权聚合输出

以 DeepSeek-V3 为例:

  • 总参数:671B
  • 每个 token 实际激活:37B(约 5.5%)
  • 专家数量:256 个路由专家 + 1 个共享专家

DeepSeek-V3 采用 671B 总参数、每 token 激活 37B 的 MoE 架构,意味着推理成本只有同等稠密模型的约 1/18,但实际效果与全量激活相近。

DeepSeekMoE 的两个关键创新

① 细粒度专家分割(Fine-grained Expert Segmentation)

传统 MoE 每层有 N 个专家,每次选 Top-K。DeepSeek 将专家数量扩展到 mN 个,每个专家的隐层维度缩小到 1/m,但每次激活 mK 个。这允许更灵活地组合激活专家,同时保持计算量不变——用更细的颗粒度让知识分解更彻底。

② 共享专家隔离(Shared Expert Isolation)

DeepSeek 引入了一个处理所有 token 的共享专家,解决了纯 MoE 的关键缺陷:某些对所有 token 都有益的通用计算,不应该依赖路由来决定是否激活。

共享专家负责处理通用模式(语法、基础语义),路由专家负责专业化处理(数学推理、代码生成等),两者分工互补。

③ 无辅助损失的负载均衡

MoE 最大的工程难题是路由崩塌(Routing Collapse):门控网络可能学会总是把 token 派给同几个专家,导致其他专家完全闲置,效率大打折扣。

传统做法是加辅助损失(Auxiliary Loss)强制均衡,但这会干扰主训练目标。DeepSeek 开创了无辅助损失的负载均衡策略:为每个专家引入偏置项,在训练时监控每一步的专家负载,对过载专家降低偏置、对欠载专家提高偏置,实现动态均衡。


三、MLA:压缩 KV Cache 的注意力机制

标准 Multi-Head Attention 的内存瓶颈

Transformer 的 KV Cache(键值缓存)是长上下文推理的核心开销:处理 100K token 的上下文时,KV Cache 可以占用数十 GB 显存。

MLA(Multi-head Latent Attention)的做法

MLA 通过对 Key 和 Value 进行联合压缩来减少 KV Cache 的内存开销,使用压缩矩阵进行上投影和下投影,并用 RoPE 维护位置信息。

本质上:不缓存完整的 K、V 向量,而是缓存低秩压缩后的潜变量,推理时再解压。这是"用计算换显存"的工程权衡——在现代 GPU 上计算便宜,显存才是稀缺资源。


四、知识蒸馏:让小模型"学"大模型的思考方式

什么是蒸馏(Distillation)?

不是让小模型直接学训练数据,而是让小模型学习大模型(教师模型)的输出分布。

</> PLAINTEXT
教师模型(DeepSeek R1 / 671B)
    ↓ 生成高质量推理链(含 <think> 过程)
学生模型(7B / 14B / 32B)
    ↓ 在这些推理链上做监督微调(SFT)
输出:能推理的小模型

DeepSeek 通过从 R1 系列模型蒸馏,将长链思维推理能力迁移进 V3,使学生模型同时获得推理能力和受控的输出特性。

蒸馏的关键不是"让小模型背诵大模型的答案",而是让小模型学习大模型推理的中间过程——这些中间步骤才是真正的知识载体。

这也解释了为什么 7B 蒸馏模型能在数学推理上超越没有蒸馏过的 70B 模型:能力的边界不在于参数量,而在于训练时接触了什么样的推理轨迹。


五、FP8 混合精度训练:用数值格式换效率

传统训练用 BF16(16位浮点数)存储权重和激活值。DeepSeek-V3 开创性地在这一规模的模型上使用 FP8 混合精度训练框架,通过在跨节点 MoE 训练中重叠计算与通信,显著提升训练效率。

FP8 将每个数值从 2 字节压缩到 1 字节,带来两个好处:

  1. 显存占用减半,可以训练更大 batch
  2. Tensor Core 吞吐量在 FP8 模式下是 BF16 的两倍

代价是精度损失——需要精心设计哪些层用 FP8,哪些保留高精度,防止训练不稳定。


六、Multi-Token Prediction(MTP):同时预测多个 token

标准 LLM 每次训练只预测下一个 token。MTP 让模型在同一个前向传播中同时预测接下来的多个 token。

这不是简单地"生成更多",而是一个训练技巧:

  • 迫使模型在内部表示中编码更长程的语义信息
  • 训练效率更高(同样的 token,产生更多监督信号)
  • 推理时可配合推测解码(Speculative Decoding):先用小模型快速预测多个候选 token,大模型并行验证,整体加速 2-3 倍

七、与调参侠的本质区别:一张对照表

维度 调参侠 真正的技术突破
工作对象 模型的输入(prompt、参数) 模型的权重本身
可复现性 依赖特定模型版本,换个模型就失效 训练出的能力内化在权重里,迁移性强
核心工具 prompt template、API 参数 损失函数、优化算法、架构设计
需要理解 模型的行为模式 模型的内部机制(梯度流、概率分布)
产出形态 更好的 prompt、工作流 新的模型、新的训练方法、论文
瓶颈 模型的能力上限 计算资源、数据质量、理论理解
代表工作 系统提示词工程、Few-shot 设计 GRPO、MoE、MLA、RLVR、蒸馏管线

八、为什么这些技术突破很难?

以 GRPO 训练推理模型为例,真正困难的地方不是"想到用强化学习",而是:

  1. 训练不稳定:RL 训练的策略梯度方差极大,模型容易崩溃或陷入局部最优(比如 DeepSeek R1-Zero 训练出的模型会语言混乱、可读性差)
  2. 奖励稀疏:对于困难数学题,模型可能采样几百次都得不到一个正确答案,梯度信号几乎为零
  3. 分布偏移:模型更新后,之前生成的数据就过时了,需要持续在线采样——这要求推理和训练并行运行,系统复杂度极高
  4. 负载均衡:MoE 训练中路由崩塌是工程噩梦,需要精密的监控和调控机制
  5. 数值稳定性:FP8 训练在某些层容易出现数值溢出,需要精细设计混合精度策略

DeepSeek-V3 的完整训练(包括后训练)仅使用了 278.8 万 H800 GPU 小时,整个训练过程稳定,没有出现不可恢复的损失尖峰或回滚——这个"稳定"背后,是无数工程细节的精心设计。


总结:技术突破的本质是什么?

</> PLAINTEXT
调参侠:在固定空间内寻找最优点
         输入空间 → [黑盒模型] → 输出空间
         只能在输入空间里移动

真正的研究:重新定义这个空间本身
         新的训练目标  →  改变损失函数的形状
         新的架构设计  →  改变参数空间的拓扑
         新的优化算法  →  改变梯度更新的方向
         新的数据策略  →  改变模型见过的世界

2023 年以来的 AI 突破,核心是后训练技术的革命:人们发现,预训练好的大模型是一块"璞玉",通过 RLVR、GRPO、蒸馏等后训练技术,可以以极低的成本(相对于预训练)激发出预训练时已经隐含在权重中、但从未被有效调用的能力。

这不是调参,这是重新设计模型学习什么、怎么学的整个范式。


发布时间:2026年3月25日 | 参考:DeepSeek-V3 Technical Report, arXiv 2506.14245, arXiv 2412.19437 | 标签:GRPO, RLVR, MoE, 推理模型, 知识蒸馏

评论

搜索站内内容

输入关键词开始搜索