연구진이 증류 강화 학습(Distilled RL)이라는 새로운 방법을 제안했어요. 이 방법은 강화 학습과 온정책 증류의 한계를 극복하고, 교사 모델의 지식을 학생 모델에 효과적으로 전달합니다. 실험 결과, Distilled RL은 기존 강화 학습 및 증류 방식보다 성능이 우수했어요.
Distilled RL은 역방향 중요 샘플링, 음수 샘플 재설정, 시퀀스 레벨 기하학적 정규화 세 가지 핵심 요소를 포함합니다. 이를 통해 학생 모델이 새로운 지식을 효과적으로 습득하고, 무조건적인 모방을 피할 수 있습니다.
코드는 GitHub에서 확인할 수 있으며, 다양한 환경에서 기존 방식보다 더 나은 성능을 보여주었습니다.