연구진은 LLaVA, GPT-4V와 같은 LVLM의 시각적 입력이 적대적 공격에 취약하다는 문제점을 지적했어요. 이중 적대적 미세 조정 프레임워크를 제안하여 시각 및 의미적 감독 신호를 공동으로 최적화하고, 다양한 다중 모드 작업에 대한 모델의 견고성을 향상시켰어요. 실험 결과, 제안 방법은 이미지 분류, 이미지 캡셔닝, 시각적 질문 답변(VQA) 작업에서 최고 성능을 달성했어요.