연구진이 단안 에고센트릭 비디오에서 시청자와 시점을 4D로 재구성하는 통합 프레임워크 ReViV를 공개했어요.
ReViV는 Masked Generative Egocentric Transformer를 활용해 RGB 비디오, 카메라 경로, 시선 방향, 전신 움직임, 손 움직임, 깊이 정보를 동시에 재구성하며 빠른 추론 속도를 제공해요.
HoloAssist, HOT3D, ARCTIC 등 다양한 벤치마크에서 기존 방식보다 정확하고 효율적인 성능을 보여줬으며, 코드와 모델은 오픈소스로 공개됐어요.