연구진은 강화 학습을 활용한 검증 가능한 보상(RLVR) 방식의 한계를 극복하기 위해 Off-Context GRPO(OC-GRPO)를 제안했어요. OC-GRPO는 모델이 올바른 해결책을 생성하지 못할 때 발생하는 학습 난관을 해결하기 위해 특권 정보를 활용한 가이드 롤아웃을 사용해요.
기존 GRPO 방식보다 3.9%의 절대적인 성능 향상을 달성했으며, 이는 표준 수학적 추론 벤치마크에서 13.8%의 상대적인 이득에 해당해요.
OC-GRPO는 가이드 롤아웃을 사용하지만, 중요도 보정 객관 함수를 적용하여 원래의 가이드 없는 객관 함수로 업데이트를 조정하여 학습 안정성을 확보해요.