연구진이 MLLM의 능동적 관찰 능력을 측정하는 새로운 벤치마크 ActiveVision을 공개했어요. ActiveVision은 17개의 과제로 구성되어 있으며, 모델이 단일 이미지를 보는 대신 반복적인 시각적 인식을 요구해요. GPT-5.5와 Claude Fable 5는 ActiveVision에서 낮은 성능을 보였으며, 인간 참가자 평균 점수보다 훨씬 뒤쳐졌어요.
모델이 스스로 작성하고 실행하는 시각 코드는 현실적인 이미지에서 신뢰성이 떨어지는 것으로 나타났으며, 이러한 오류를 감지하는 데에도 능동적 관찰 능력이 필요해요. 이는 현재 MLLM이 시각적 인식과 추론 간의 연결 고리가 부족함을 시사합니다.