연구진은 비디오 인스턴스 분할(VIS) 모델 학습 시 영상 데이터 없이도 경쟁력 있는 성능을 낼 수 있도록 이미지 기반 학습 방식을 재검토하는 QueenVIS 프레임워크를 제안했어요.
QueenVIS는 Mask2Former 쿼리에 특징 예측 및 중심 예측 손실을 추가하여 쿼리의 품질을 향상시키고, 쿼리 전파 및 메모리 뱅크 방식으로 시간적 일관성을 유지해요.
YouTube-VIS 및 OVIS 데이터셋에서 MinVIS 대비 최대 6.7% AP 성능 향상을 달성했으며, 영상 데이터 없이도 최신 동영상 기반 모델과 경쟁력 있는 성능을 보여줬어요.