연구팀이 벵골어 유튜브 영상 클릭베이트 탐지를 위한 멀티모달 데이터셋 'BanClickThumb'을 공개했어요. 썸네일과 제목의 조합으로 구성된 데이터셋은 10명의 어노테이터가 높은 일치도를 보장하며(Cohen's Kappa: 0.83-0.93) 구축됐어요.
텍스트만 활용한 모델(BanClickTextFormer)은 82% 정확도를, 이미지만 활용한 모델(BanClickImageFormer)은 68% 정확도를 기록한 반면, 제안된 멀티모달 모델(BanClickFusionFormer)은 84%의 최고 정확도를 달성했어요.
연구 결과는 벵골어 클릭베이트 탐지에서 멀티모달 융합의 효과를 입증하며, 저자원 멀티모달 콘텐츠 분석 연구를 위한 공개 벤치마크를 제공합니다.