연구진은 강화 학습을 활용해 잠재적 추론기의 테스트 시간 확장 성능을 높이는 SLPO(Surrogate Latent Policy Optimization)를 제안했어요. SLPO는 잠재적 경로에 대한 경험적 대리 정책 밀도를 활용하여 경로 수준의 신뢰도 할당과 정확성 감독을 통해 가변 호라이즌 정책을 개선합니다. 기존 방식 대비 더 짧은 수평 거리에서도 성능을 능가하는 잠재적 추론기의 테스트 시간 확장을 가능하게 합니다.
SLPO는 연속적 및 부드러운 사고 환경에서 병렬 샘플링 하에 Pass@k 점수를 향상시키고, 더 어려운 인스턴스에 더 많은 잠재적 계산을 할당하여 결정적 정확도를 높여요. 잠재적 추론기의 테스트 시간 확장을 위한 결과 보상 RL을 가능하게 하는 새로운 방법론입니다.
기존 잠재적 추론기는 모방에 의존하는 경향이 있었지만, SLPO는 결과 보상을 통해 테스트 시간 확장을 가능하게 하여 기존 CoT 방식의 한계를 극복하고 잠재적 추론기의 활용 가능성을 높입니다.