GRPO 与 DAPO:从组内相对优势到长 CoT 强化学习
从原始 GRPO 的组内优势、PPO-Clip 与 KL 出发,分析长 CoT 强化学习中的四类问题,以及 DAPO 如何逐项处理这些问题
LLMRLGRPODAPO
Thoughts, stories, and ideas about development, design, and technology.
从原始 GRPO 的组内优势、PPO-Clip 与 KL 出发,分析长 CoT 强化学习中的四类问题,以及 DAPO 如何逐项处理这些问题