멀티모달 대규모 언어 모델(MLLM)이 원격 감지 이미지 장면 이해(RSISU) 분야에서 빠르게 발전하고 있어요. 하지만 기존 원격 감지 MLLM(RS-MLLM)의 성능 한계, 교차 작업 일반화, 작업별 제한 사항에 대한 체계적인 이해는 아직 부족해요.
원격 감지 시각적 정렬과 고해상도 시각적 질의 응답과 같은 특정 분야에서는 RS-MLLM이 여전히 경쟁력을 보이지만, 일반적인 컴퓨터 비전 MLLM(CV-MLLM)은 원격 감지 관련 튜닝 없이도 여러 RSISU 작업에서 RS-MLLM을 능가하는 성과를 보여줘요.
현재 MLLM은 공간 및 관계 추론, 미세한 시각적 이해, 지침 다양성, 이질적인 작업 형식 간 일반화에 어려움을 겪고 있으며, 향후 신뢰성 있는 평가, 멀티모달 및 고해상도 추론, 효율적인 배포, 도구 보강 원격 감지 에이전트 개발이 필요해요.
이번 연구는 RSISU를 위한 강력하고 일반화 가능하며 실용적인 MLLM을 개발하는 데 필요한 체계적인 참고 자료를 제공해요.