연구진이 체스를 활용해 LLM의 추론 능력 향상을 위한 사전 훈련과 강화 학습(RL)의 관계를 분석했어요. 사전 훈련 데이터 규모와 모델 크기가 RL 학습 효과에 영향을 미치는 것을 확인했어요. RL은 기존 정책을 단순 개선하는 것이 아니라, 쉬운 문제에서는 선호하는 행동을 강화하고 어려운 문제에서는 새로운 행동을 발견하는 역할을 해요.
수학 문제 영역에서도 유사한 패턴이 나타나 사전 훈련과 RL 간의 예측 가능성이 확인됐어요. 사전 훈련 데이터가 많을수록 RL 학습 성능이 향상되고, RL 보상 곡선이 선형적으로 개선되는 것을 관찰했어요. 체스 외 다른 영역에서도 동일한 패턴이 나타나, LLM의 추론 능력 향상을 위한 사전 훈련과 RL의 관계를 정량적으로 분석하는 데 기여했어요.