Pulse · AI 뉴스

Off-Context GRPO: 어려운 문제 해결을 위한 특권 정보 활용

OpenAI · 2026-07-22

연구진은 강화 학습을 활용한 검증 가능한 보상(RLVR) 방식의 한계를 극복하기 위해 Off-Context GRPO(OC-GRPO)를 제안했어요. OC-GRPO는 모델이 올바른 해결책을 생성하지 못할 때 발생하는 학습 난관을 해결하기 위해 특권 정보를 활용한 가이드 롤아웃을 사용해요.

기존 GRPO 방식보다 3.9%의 절대적인 성능 향상을 달성했으며, 이는 표준 수학적 추론 벤치마크에서 13.8%의 상대적인 이득에 해당해요.

OC-GRPO는 가이드 롤아웃을 사용하지만, 중요도 보정 객관 함수를 적용하여 원래의 가이드 없는 객관 함수로 업데이트를 조정하여 학습 안정성을 확보해요.

##RLVR##GRPO##Off-Context##추론##강화학습
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기