연구진은 비디오의 움직임을 이해하는 데 있어 카메라 움직임과 물체 움직임을 분리하는 것이 중요함을 밝혔습니다. 새로운 Structured Dynamics Model (SDM)을 제안하여, 미래 프레임 특징 예측을 통해 주요 시간 변화 요인을 분리합니다. SDM은 실제 비디오에 대한 자가 지도 학습과 합성 Kubric 데이터에 대한 약한 장면 역학 감독을 결합하여 학습합니다.
ProbeMotion 평가 세트에서 SDM은 기존 방식보다 우수한 성능을 보였으며, VGGT와 같은 강력하게 감독된 표현과도 비교 가능한 성능을 냈습니다.
SDM은 사전 훈련된 이미지 모델을 활용하여 잠재된 비디오 역학을 학습하고 분석하는 데 유용한 편향성을 제공합니다.