연구진은 이미지 및 비디오 기술에서 데이터 증강의 한계를 극복하기 위해 InstructMixup이라는 새로운 데이터 증강 방법을 제안했어요.
InstructMixup은 시각 샘플 내에서 다중 스케일 두드러진 영역을 추출하고, 지침 기반 생성 모델로 수정하고, 다시 샘플에 병합하는 방식으로 작동하며, 오프라인에서 편집을 미리 계산하여 훈련 비용을 최소화해요.
다양한 벤치마크에서 InstructMixup은 기존 증강 방법보다 뛰어난 성능을 보였으며, CNN, ViT, VLM 등 다양한 모델에서 효과를 입증했어요.