연구진이 비디오에서 양면성/주저감(A/H)을 인식하는 멀티모달 프레임워크를 개발하여 ABAW11 챌린지에서 활용했어요.
텍스트, 음성, 시각 정보를 융합하는 데 F2LLM-v2-0.6B, WavLM-Large, VideoMAE V2를 사용했으며, 텍스트만으로도 벤치마크 점수가 0.6659로 높게 나타났어요.
크로스 어텐션과 게이티드 멀티모달 유닛(GMU)을 결합한 모델은 검증 세트에서 0.7394의 매크로 F1 점수를 달성하며 단일 모달 대비 11.0% 향상된 성능을 보였어요.