연구진은 외부 교사 모델 없이 시각 정보를 활용한 Visual Contrastive Self-Distillation (VCSD) 방법을 제안했어요.
VCSD는 이미지 콘텐츠 제거를 통해 자기 증류 신호를 생성하며, 원본 이미지와 콘텐츠가 제거된 이미지의 토큰 확률 차이를 활용해요.
ViRL39K 데이터셋 실험 결과, VCSD는 Qwen3-VL 및 Qwen3.5 모델에서 기존 OPSD 방식보다 성능이 향상되었으며, 추가 비용 없이 구현 가능해요.