연구진이 3D 장면에서의 시각 정보 기반 행동을 평가하는 벤치마크 SceneActBench를 공개했어요. SceneActBench는 5가지 3D 작업으로 구성되어 있으며, PNG 이미지나 비디오 프레임을 기반으로 에이전트가 3D 환경에서 행동하도록 설계됐어요. 11개의 VLM 모델을 평가한 결과, 모델별 점수가 38.6~50.2점으로 큰 차이를 보였으며, 특정 작업에서만 뛰어난 성능을 보이는 경향을 나타냈어요.