연구진은 비디오 내 움직임 이해의 핵심 과제로, 프레임 간 변화가 카메라 움직임과 객체 움직임이라는 두 가지 역학 요소를 얽히게 한다는 점을 지적했어요.
구조화된 움직임 모델(SDM)을 제안하여 미래 프레임 특징 예측을 통해 주요 변화 요인을 분리하고 잔여 역학을 처리해요.
SDM은 실제 비디오에 대한 자가 지도 학습과 Kubric 데이터에 대한 약한 장면 역학 감독을 결합하여 학습하며, ProbeMotion 평가에서 기존 모델보다 우수한 성능을 보여줬어요.
연구 결과, 사전 학습된 이미지 모델을 구조화된 비디오 역학 표현으로 쉽게 재사용할 수 있으며, 잠재된 비디오 역학을 학습하고 분석하는 데 유용한 편향성을 제공하는 것으로 나타났어요.