Back to Blog
GRPO 与 DAPO:从组内相对优势到长 CoT 强化学习

GRPO 与 DAPO:从组内相对优势到长 CoT 强化学习

从原始 GRPO 的组内优势、PPO-Clip 与 KL 出发,分析长 CoT 强化学习中的四类问题,以及 DAPO 如何逐项处理这些问题

16 min read
Visits:
LLMRLGRPODAPO
View All Posts
Close