연구진은 다중 모달 LLM의 자기 증류를 위한 새로운 방법인 RP-OPSD(Resolution-Privileged On-Policy Self-Distillation)를 제안했어요. RP-OPSD는 고해상도 이미지와 저해상도 이미지를 활용해 기존 방법의 한계를 극복해요.
학생 모델은 1/4 해상도 이미지에서 경로를 생성하고, 교사 모델은 원본 해상도 이미지를 통해 감독 신호를 제공하여 예측 행동을 학습해요. 이를 통해 저해상도 능력을 강화하고 원본 해상도 추론에 적용할 수 있어요.
Qwen3.5-9B 모델 실험 결과, RP-OPSD는 평균 성능이 5.45% 향상되고 훈련 속도는 1.78배 빨라졌어요. 해상도 차이가 효과적인 자기 증류 정보원임을 입증했어요.