연구진은 강화 학습(RL)이 복잡한 추론 능력 향상에 핵심적인 역할을 하지만, 프리트레이닝과 분리되어 연구되는 경우가 많다는 점에 주목했어요.
체스를 활용한 통제된 실험을 통해 프리트레이닝 선택(모델 크기, 데이터)이 RL 연산 효율성에 미치는 영향과 RL이 모델에 어떤 변화를 주는지 분석했어요.
연구 결과, 프리트레이닝 손실은 주어진 RL 연산 수준에서 포스트 RL 성능을 잘 예측하며, RL 보상 곡선의 기울기는 프리트레이닝 토큰 수에 따라 거의 선형적으로 개선돼요.