연구진은 원격 감지 데이터의 장기적인 시간 이해 능력을 평가하는 ChronoBench 벤치마크를 발표했어요.
ChronoBench는 Land Cover Perception, Temporal Recognition, Long-Term Memory, Spatio-Temporal Reasoning의 4가지 인지 수준으로 구성된 12개의 하위 작업과 17,689개의 QA 페어를 포함하고 있어요.
기존 MLLM은 인간 전문가에 비해 성능이 현저히 떨어지며, 특히 Long-Term Memory가 가장 큰 병목 현상으로 나타났어요.
GeoChrono는 장기적인 지리적 변화 추적, 기억 및 추론 능력을 향상시킨 MLLM으로, ChronoBench에서 기존 모델보다 20% 이상 높은 성능을 달성했어요.