Pulse · AI 뉴스

MoD-VLLM: 다중 이벤트 장영상 비디오 이해를 위한 모듈화된 동적 그레인율 비디오 LLM

MoD-VLLM · 2026-07-17

연구진이 장영상 비디오 이해를 위한 새로운 프레임워크 MoD-VLLM을 제안했어요. 기존 방식의 한계를 극복하기 위해 질문과 관련된 비디오 세그먼트를 반복적으로 위치시키는 방식을 사용합니다.

MoD-VLLM은 긍정-부정 비디오 세그먼트 위치 파악 모듈과 모듈화된 동적 그레인율 반사 모듈을 활용하여 핵심 질문과 관련된 비디오 세그먼트를 정확하게 찾아냅니다.

연구진은 MoD-VLLM의 성능을 검증하기 위해 MEventBench라는 새로운 다중 이벤트 장영상 벤치마크를 만들었으며, 기존 방식보다 성능이 뛰어나다는 것을 확인했습니다.

##비디오LLM##MoD-VLLM##장영상
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기