연구진은 이미지 생성 모델의 공간 인지 능력을 평가하기 위한 새로운 프레임워크 ProVisE를 제안했어요.
ProVisE는 이미지 생성 모델이 픽셀 공간에 직접 공간적 판단을 외부화할 수 있도록 돕고, 기존 벤치마크 지표와 호환되는 구조화된 예측으로 변환해요.
SpatialGen-Bench 벤치마크를 통해 이미지 생성 모델과 텍스트 기반 VLM의 성능을 비교한 결과, 이미지 생성 모델은 픽셀 공간에서 경쟁력을 보였지만, 텍스트 기반 VLM은 복합적인 공간 추론에서 강점을 유지했어요.