LAVIFT는 수술 도구와 조직 간 상호작용을 인식하는 새로운 프레임워크예요. 기존 방식의 한계를 극복하기 위해 잠재적 행동 가이드 시각 미세 조정을 사용했어요. 역동 모델은 각 행동에 따른 시각적 변화를 파악하고, 세계 모델은 행동과 관련된 영역을 표현하도록 인코더를 훈련해요. 실험 결과, 인식률과 이미지-텍스트 정렬이 향상되었으며, 수술 도구와 조직 간 상호작용 영역에 대한 더 강력한 기반을 확보했어요.