Tag: GRPO
All the articles with the tag "GRPO".
-
从零训练大模型(十六):GRPO / RLVR 组相对优势
GRPO / RLVR 的组相对优势推导:可验证奖励、组内相对优势、去掉 critic,以及课程学习——面向数学推理的高效对齐方法。
All the articles with the tag "GRPO".
GRPO / RLVR 的组相对优势推导:可验证奖励、组内相对优势、去掉 critic,以及课程学习——面向数学推理的高效对齐方法。