연구진이 체스 모델을 훈련하며 강화 학습(RL)을 적용한 결과, 합법성(legality)은 48%에서 61%로 상승하고, 체크메이트에 대한 오답(confabulation)은 완전히 사라졌습니다.
실험 결과, 잠재적 사고 벡터에 노이즈를 추가하거나 제거해도 성능에 큰 영향이 없었으며, 정확히 0인 벡터만 성능 저하를 유발했습니다.
강화 학습은 모델의 매개변수를 훈련하는 과정에서 중요한 역할을 하며, 잠재적 사고가 적극적으로 참조되는 추론 시간 스크래치패드 역할을 한다는 기존 가설에 반하는 결과입니다.
연구는 체스 분야에서 강화 학습과 잠재적 추론을 결합한 방식이 성공할 수 있음을 보여주며, 수학 및 논리 분야에서 보고되는 실패 사례와는 다른 결과를 나타냅니다.