SceneActBench는 3D 장면에서 여러 객체에 대한 에이전트의 행동을 평가하는 새로운 벤치마크입니다. PNG 이미지나 비디오 프레임을 기반으로 에이전트는 3D 환경에서 행동하며, 각 결과는 숨겨진 ground truth와 비교됩니다. 5가지 작업으로 구성된 SceneActBench는 총 520개의 task case를 포함하며, 11개의 VLM 구성에서 성능이 38.6~50.2점으로 나타났습니다.
기존 벤치마크는 텍스트 응답이나 단일 객체 조작만 평가했지만, SceneActBench는 3D 환경에서 여러 객체에 대한 에이전트의 행동을 평가합니다. 모든 작업은 일관된 agent-environment loop를 통해 진행되며, 각 task case는 고유한 geometric metrics로 평가됩니다.
11개의 VLM 구성에서 어떤 모델도 모든 작업에서 일관되게 좋은 성능을 보이지 않았으며, 실패 원인에 대한 분석도 함께 제공됩니다.