본 논문은 밈, 만화, 코믹스와 같은 시각 유머 이해에 어려움을 겪는 AI 시스템의 문제점을 다룹니다. 단일 이미지와 다중 패널 아티팩트에서 시각 유머를 이해하는 데 초점을 맞추고, 유머 생성은 새로운 분야로 봅니다. 멀티모달 정렬, 증거 기반 추론, 제어 생성에 기반한 대형 모델 접근 방식으로 발전해 왔습니다.
기존 유머, 냉소, 일반 MLLM 조사와 대비하여, 인식, 해석 및 추론, 생성을 아우르는 역량 기반 계층 구조로 문헌을 정리합니다. 벤치마크 설계, 평가 프로토콜, 모델링 패러다임을 종합적으로 분석하고, 필드의 발전을 추적합니다.
주요 과제로는 평가의 단축 경로 의존성, 제한적인 문화 및 내러티브 커버리지, 취약한 증거 기반, 안전 및 소유권 문제를 지적하며, 앞으로 해결해야 할 과제를 제시합니다.