연구진은 강화 학습을 통해 Chain-of-Thought 추론기의 테스트 시간 확장을 유도하는 방법을 제시했어요. 기존 방식은 중간 단계가 언어 토큰으로 디코딩되어 비용이 높았지만, 잠재적 추론은 더 짧은 시간 내에 더 나은 성능을 보여요. 연구진은 서브 정책을 활용한 잠재적 추론 최적화(SLPO)를 통해 잠재적 추론기의 테스트 시간 확장을 가능하게 했어요.
SLPO는 잠재적 전환에 대한 경험적 서브 정책 밀도를 사용하여 경로 수준의 신뢰도 할당을 지원하고, 결과 보상 최적화를 통해 변동 호리즌 정책으로 개선되는 정확성 기반 중단 헤드를 사용해요. 연속적 및 소프트 사고 환경에서 SLPO는 병렬 샘플링 하에 Pass@$k$를 개선하고 더 어려운 인스턴스에 더 긴 잠재적 계산을 할당해요.
SLPO는 잠재적 추론기의 테스트 시간 확장을 가능하게 하여, 기존 방식의 한계를 극복하고 더 효율적인 추론 시스템을 구축하는 데 기여할 것으로 기대돼요.