跳转至

1.11 全部算法公式速查表

使用说明

本表汇总了 Post-Training 核心算法的目标函数、优势函数、IS 粒度和裁剪方式。目标函数核心列为各算法 Policy Gradient 目标的简化形式,详细推导参见对应章节。

算法 目标函数核心 优势函数 IS 粒度 裁剪/门控 范式 关键解决的问题
PPO \(\min(r_t A_t, \text{clip}(r_t) A_t)\) GAE + Critic Token 对称硬裁剪 RLHF 策略突变 / RLHF 稳定性
GRPO \(\min(r_{i,t} \hat{A}_i, \text{clip}(r_{i,t}) \hat{A}_i)\) Group Relative Token 对称硬裁剪 RLVR 去 Critic + 去 RM
DAPO \(\min(r_{i,t} \hat{A}_i, \text{clip}_{\text{asym}}(r_{i,t}) \hat{A}_i)\) Group Relative Token 非对称硬裁剪 RLVR 探索-利用解耦 / 熵坍塌
VAPO 同 DAPO + \(\mu \cdot \mathcal{L}_{\text{NLL}}\) GAE + Adaptive Critic Token 非对称硬裁剪 RLVR 长 CoT 精细归因
CISPO \(\text{sg}(\text{clip}(r_{i,t})) \cdot \hat{A}_i \cdot \log\pi\) Group Relative Token 裁剪IS 权重 RLVR 稀有/分岔 token 梯度保留
GSPO \(\min(s_i \hat{A}_i, \text{clip}(s_i) \hat{A}_i)\) Group Relative Sequence 硬裁剪(极小 \(\varepsilon\) RLVR MoE 路由波动 / 淘汰 Routing Replay
SAPO \(\frac{4}{\tau}\sigma(\tau(r-1)) \cdot \hat{A}_i\) Group Relative Token → Seq Soft Gating RLVR Hard Clip 边界不连续

GSPO 在表中的特殊位置

GSPO 是表里唯一把 IS 粒度从 Token 升到 Sequence 的算法,也是唯一为特定模型架构(MoE)设计的算法。其他算法(DAPO/CISPO/SAPO/VAPO)都在改 token-level 的"细节",GSPO 直接换了优化粒度——本质上把 importance sampling 的数学前提重新放回成立。详见 1.9 GSPO