연구진이 3D-VAE의 한계를 극복하고 비디오 파운데이션 모델(VFM)의 강력한 이해 능력을 활용한 VideoRAE를 개발했어요.
VideoRAE는 VFM의 다중 스케일 계층적 특징을 활용하여 경량화된 1D 자기 주의(self-attention) 프로젝터를 통해 압축하며, 디퓨전 트랜스포머와 오토리그래시브 모델 모두 지원해요.
UCF-101 데이터셋에서 VideoRAE는 기존 오토인코더 기반 모델보다 약 5배 빠른 수렴 속도로 최고 수준의 gFVD(Generative Forward Video Distance) 성능을 달성했어요.