疑问:没有使用拒绝采样或者动态采样,用GRPO哪里来的梯度呀

#3
by hujh4 - opened

疑问:没有使用拒绝采样或者动态采样的情况下,数据相对于模型的难度不稳定,用GRPO不是会经常std为0吗,这样不是经常没有梯度吗

Owner

可以参考论文 https://arxiv.org/pdf/2512.16649 里的 Figure 2 中间这张图,DAPO-math-17k 这个数据集对于 Distill-1.5B 的难度其实还是比较合适的,在几千步的训练中 reward 还是比较有信号的。

另外想再问一下,为什么是32卡训了15天,这个配置也是让人有点困惑?

Owner

是说用卡数,还是为什么训 15 天?

主要是卡数,因为大致固定训练的总样本数之后,训练时间依据训练卡数会变化。我的疑问主要是为啥是只用了32卡训15天这么久,而不是64/128卡可能训更短时间?15天训一个RL直觉上确实时间有点长

Owner

因为当时算力资源比较有限,最多只能支撑 4 台机器启动的训练。

Sign up or log in to comment