연구진은 4D 동적 이해를 위한 Geometry Foundation Models(GFM)의 한계를 극복하기 위해 SM4RT를 제안했어요.
SM4RT는 물리적 운동의 구조적 특성을 반영하여 장면 운동을 SE(3) 기반의 6D 트위스트 시퀀스로 분해하는 Structure-of-Motion 방식을 도입했어요.
SM4RT는 단안 RGB 비디오에서 3D 기하, 월드 좌표 운동, 장면 운동 구조를 동시에 추론하여 3D 재구성과 구조적 운동 인식 성능을 향상시켰어요.