연구진이 Masked Visual Actions이라는 새로운 제어 인터페이스를 선보였습니다. 이 인터페이스는 비디오 내에서 임의 객체의 부분적으로 드러난 경로를 통해 로봇의 움직임을 표현합니다. 15시간 분량의 마스크 처리된 비디오 예시로 파인튜닝을 거쳐 다양한 장면과 로봇 구현에서 뛰어난 시각적 충실도와 제어력을 확보했습니다.
Masked Visual Actions는 로봇 움직임을 드러내면 장면의 반응을 예측하는 순방향 동역학 모델로 작동하고, 객체 움직임을 드러내면 그 결과와 일관된 로봇 행동을 복원합니다. 이를 통해 정책 평가, 모델 기반 계획에서의 미래 예측 순위 결정, 원하는 객체 움직임으로부터 로봇 움직임을 합성하는 역 모델링을 지원합니다.
이 연구는 비디오 모델을 활용하여 로봇의 세계 모델링을 위한 새로운 가능성을 제시하며, 향후 로봇 제어 및 계획 분야에 기여할 것으로 기대됩니다.