연구진은 시각-언어 모델(VLM)이 데이터를 어떻게 해석하는지 파악하는 방법을 제시했어요. 새로운 방법은 트랜스포머 모델의 어텐션을 시각적 토큰에 매핑하여 중요 영역 지도를 생성해요. 생성된 답변 토큰과 해당 토큰이 집중한 이미지 영역 간의 직접적인 대응 관계를 보여줘요. 이를 통해 VLM이 시각적 요소에 어떻게 집중하는지 파악할 수 있어요. 제안 방법은 모델의 행동에 대한 인과적 충실성을 검증하는 삭제 메트릭 평가를 거쳤어요.