연구진이 Grounded LVQA를 위한 VideoTreeSearch(VTS) 프레임워크를 제안했어요. VTS는 시각적 장면 경계를 기반으로 비정형 트리 구조를 생성하여 에이전트가 탐색하도록 합니다. 새로운 프레임워크는 zoom_in, zoom_out, shift, answer 네 가지 동작을 통해 자가 수정 및 복구를 지원해요.
VTS는 CG-Bench에서 +12.5 mIoU, Haystack-Ego4D에서 +7.4 T-F1로 기존 에이전트 방식보다 성능이 향상됐어요. 학습된 정책은 Video-MME, MLVU, LVBench에서도 최고 성능을 기록하며 일반적인 장기 비디오 QA에 적용 가능해요.
자가 수정 계층적 탐색이 성능 향상의 핵심 요소로, 이 기능 제거 시 성능이 저하되는 것으로 확인됐어요. 연구 결과는 GitHub에서 확인할 수 있어요.
VTS는 기존 방식의 조기 수렴 문제를 해결하고, 잘못된 경로에서 복구하는 기능을 명시적으로 학습할 수 있도록 합니다.