연구진은 원격 감지 시각-언어 모델에서 아키텍처 전문화보다 데이터 규모가 더 중요하다고 밝혔어요. 단일 언어 정책과 다중 작업 강화 학습 프레임워크를 활용해 기존 벤치마크에서 경쟁력 있는 성능을 달성했어요. 다양한 데이터와 작업을 통해 충분한 규모로 학습하면 일반적으로 뛰어난 시각-언어 모델이 원격 감지 벤치마크에서 최고 성능을 낼 수 있다는 것을 입증했어요.