연구진은 멀티모달 LLM(M-LLM) 기반 비디오 요약 방법의 한계를 지적하며, 기존 방식이 프레임 선택에만 집중하여 전체적인 이해도를 저해하고 정보를 손실한다고 주장했어요.
HAS(Highlight-guided Attention Steering)는 비디오 전체를 고려한 하이라이트 분포를 찾아 M-LLM의 어텐션을 조절하여 비디오 이해도를 높이는 새로운 방법이에요.
HAS는 비디오 전체의 프레임 레벨 하이라이트 분포를 찾고, 이를 M-LLM의 어텐션 스티어링 벡터로 활용하여 중요한 프레임에 집중하고 덜 중요한 프레임을 잊지 않도록 설계됐어요.
다양한 벤치마크 테스트에서 HAS는 기존 방식보다 뛰어난 비디오 요약 성능을 보여줬어요.