본 논문은 텍스트와 시각 정보 간의 불일치를 계층적으로 모델링하는 HCIG(Hierarchical Cross-modal Incongruity Graph Network) 프레임워크를 제안합니다.
HCIG는 토큰, 구, 전체 수준에서 그래프 어텐션 네트워크를 활용하여 모달 간 불일치를 파악하고, 학습된 계층적 어텐션 메커니즘을 통해 정보를 통합합니다.
MMSD 풍자 벤치마크와 MultiBully 사이버 불링 데이터셋에서 HCIG는 각각 85.74% 정확도, 85.29% 매크로 F1 점수를 기록하며 기존 방식보다 우수한 성능을 보였습니다.