연구진은 비디오 모델을 활용해 로봇의 세계 모델링을 위한 새로운 방법, Masked Visual Actions를 제안했어요. 이 방법은 비디오 내에서 로봇 동작이나 객체 움직임을 부분적으로 드러내어 모델이 물리적 상호작용을 예측하도록 훈련합니다. 단 15시간의 데이터로 훈련된 모델은 다양한 환경과 로봇에서 뛰어난 성능을 보였어요.
Masked Visual Actions는 로봇 동작을 예측하는 순방향 동역학 모델로 작동하거나, 객체 움직임에 따른 로봇 행동을 복원할 수 있어요. 이를 통해 정책 평가, 미래 예측 순위 결정, 로봇 동작 역모델링 등 다양한 작업에 활용 가능합니다.
연구 결과는 비디오 모델이 로봇 제어 및 세계 모델링에 있어 강력한 도구가 될 수 있음을 보여주며, 향후 로봇 공학 및 인공지능 분야에 기여할 것으로 기대됩니다.