연구진은 PPO와 GRPO의 clipped surrogate objective가 급격한 파생변수 변화를 일으킨다는 점에 주목했어요. 이를 개선하기 위해 Output Reset (OR)이라는 smooth one-sided saturation rule을 제안했어요. OR은 rollout-relative token log-ratio 공간에서 squared-margin loss를 사용하며, 장점 부호에 따라 업데이트 방향이 결정돼요.
Llama-3.2-1B-Instruct 모델을 Anthropic hh-rlhf 환경에서 실험한 결과, GAE 환경에서 PPO-OR는 PPO-clip보다 평균적으로 0.305% 더 높은 reward-model 점수를 기록했어요. 하지만 seed 간의 spread는 더 컸어요.
group-relative advantages 환경에서는 GRPO-OR가 더 높은 점수를 기록하지 못했지만, spread는 줄어들고 terminal OR residual은 거의 0에 가까워졌으며, overshoot fraction도 감소했어요. GRPO clipped-objective는 여전히 변동성이 컸어요.
연구 결과 OR은 최적화 행동을 변화시키지만, reward 효과는 비교 환경에 따라 달랐어요. GRPO-OR는 G=2에서 reward-score gain을 보여주지 않았고, 더 큰 그룹 크기가 이 결과를 바꿀 수 있을지는 미지수예요.