PercepCap은 비디오 캡셔닝 시 시공간 이해를 돕는 프레임워크입니다. 기존 MLLM은 시각적 증거를 드러내지 않고 캡션을 생성하여 오류를 파악하기 어렵다는 문제점을 개선합니다. PercepCap은 객체 궤적과 시간적 사건을 포함하는 시공간 인지 추적을 생성하고, 이를 바탕으로 최종 캡션을 생성하는 방식으로 작동합니다. 연구팀은 캡션-앵커 인지 데이터 구축 파이프라인을 통해 캡션과 관련된 시공간 정보를 학습 데이터로 활용했습니다.
PercepCap은 Qwen3-VL 모델을 기반으로 하며, 직접 캡션 및 캡션-QA 평가에서 성능 향상을 보였습니다. 두 단계 학습 전략을 통해 모델을 훈련하며, 시공간 인지 추적과 캡션 품질을 최적화합니다. 연구 결과, PercepCap은 기존 모델 대비 뛰어난 캡션 품질을 보여주었습니다.