1.11 全部算法公式速查表¶
使用说明
本表汇总了 Post-Training 核心算法的目标函数、优势函数、IS 粒度和裁剪方式。目标函数核心列为各算法 Policy Gradient 目标的简化形式,详细推导参见对应章节。
| 算法 | 目标函数核心 | 优势函数 | IS 粒度 | 裁剪/门控 | 范式 | 关键解决的问题 |
|---|---|---|---|---|---|---|
| PPO | \(\min(r_t A_t, \text{clip}(r_t) A_t)\) | GAE + Critic | Token | 对称硬裁剪 | RLHF | 策略突变 / RLHF 稳定性 |
| GRPO | \(\min(r_{i,t} \hat{A}_i, \text{clip}(r_{i,t}) \hat{A}_i)\) | Group Relative | Token | 对称硬裁剪 | RLVR | 去 Critic + 去 RM |
| DAPO | \(\min(r_{i,t} \hat{A}_i, \text{clip}_{\text{asym}}(r_{i,t}) \hat{A}_i)\) | Group Relative | Token | 非对称硬裁剪 | RLVR | 探索-利用解耦 / 熵坍塌 |
| VAPO | 同 DAPO + \(\mu \cdot \mathcal{L}_{\text{NLL}}\) | GAE + Adaptive Critic | Token | 非对称硬裁剪 | RLVR | 长 CoT 精细归因 |
| CISPO | \(\text{sg}(\text{clip}(r_{i,t})) \cdot \hat{A}_i \cdot \log\pi\) | Group Relative | Token | 裁剪IS 权重 | RLVR | 稀有/分岔 token 梯度保留 |
| GSPO | \(\min(s_i \hat{A}_i, \text{clip}(s_i) \hat{A}_i)\) | Group Relative | Sequence | 硬裁剪(极小 \(\varepsilon\)) | RLVR | MoE 路由波动 / 淘汰 Routing Replay |
| SAPO | \(\frac{4}{\tau}\sigma(\tau(r-1)) \cdot \hat{A}_i\) | Group Relative | Token → Seq | Soft Gating | RLVR | Hard Clip 边界不连续 |
GSPO 在表中的特殊位置
GSPO 是表里唯一把 IS 粒度从 Token 升到 Sequence 的算法,也是唯一为特定模型架构(MoE)设计的算法。其他算法(DAPO/CISPO/SAPO/VAPO)都在改 token-level 的"细节",GSPO 直接换了优化粒度——本质上把 importance sampling 的数学前提重新放回成立。详见 1.9 GSPO。