연구진이 MLLM의 능동적 관찰 능력을 측정하는 새로운 벤치마크 ActiveVision을 공개했어요. ActiveVision은 17개의 과제로 구성되어 있으며, 모델이 단일 이미지를 묘사하는 대신 반복적인 시각적 인식을 요구해요.
GPT-5.5와 Claude Fable 5를 포함한 최첨단 MLLM들이 ActiveVision에서 낮은 성능을 보였으며, 인간 참가자들과 비교했을 때 현저한 격차가 나타났어요.
연구 결과, 현재 MLLM은 강력한 능동적 시각 관찰 능력이 부족하며, 시각과 추론 간의 연결을 강화하는 새로운 아키텍처와 훈련 목표가 필요함을 시사해요.