연구진은 시각-언어 내비게이션(VLN) 모델이 미래 시각 정보를 활용하여 행동을 결정하는지 확인했어요. 미래 시각 정보를 훈련 및 테스트 시점에 활용했을 때 행동 선택에 도움이 된다는 것을 확인했습니다.
미래 시각 정보를 활용하지 않고도, 훈련 과정에서 미래 시각 정보를 활용하여 모델 성능을 향상시킬 수 있는지 연구했어요. Future-State-Conditioned VLN(FSC-VLN)을 제안했습니다.
FSC-VLN은 R2R val-unseen 데이터셋에서 기존 모델보다 SR/OSR/SPL 성능을 향상시켰으며, 특히 장기 에피소드에서 더 큰 개선 효과를 보였습니다.