연구진은 이미지 생성 모델의 공간 인지 능력을 평가하기 위한 새로운 프레임워크 ProVisE를 제안했어요.
ProVisE는 이미지 생성 모델이 픽셀 공간에 공간적 판단을 직접 표현하도록 유도하고, 기존 지표와 호환되는 구조화된 예측으로 변환해요.
SpatialGen-Bench 벤치마크를 통해 이미지 생성 모델과 텍스트 기반 VLM의 성능을 비교한 결과, 이미지 생성 모델은 픽셀 공간에서 경쟁력을 보였지만 텍스트 기반 VLM은 복합적인 공간 추론에서 강점을 보였어요.