연구진이 장영상 비디오 이해를 위한 새로운 프레임워크 MoD-VLLM을 제안했어요. 기존 방식의 한계를 극복하기 위해 질문과 관련된 비디오 세그먼트를 반복적으로 위치시키는 방식을 사용합니다.
MoD-VLLM은 긍정-부정 비디오 세그먼트 위치 파악 모듈과 모듈화된 동적 그레인율 반사 모듈을 활용하여 핵심 질문과 관련된 비디오 세그먼트를 정확하게 찾아냅니다.
연구진은 MoD-VLLM의 성능을 검증하기 위해 MEventBench라는 새로운 다중 이벤트 장영상 벤치마크를 만들었으며, 기존 방식보다 성능이 뛰어나다는 것을 확인했습니다.