OmniVAE는 오디오와 비디오를 함께 생성하는 모델로, 기존 방식의 한계를 극복하기 위해 개발됐습니다. 세그먼트 단위의 오디오·비디오 비교 학습을 통해 두 모달 간의 의미적 정렬을 학습하고, 사전 학습된 의미 인코더를 활용해 학습 가능성을 높입니다. 실험 결과, OmniVAE는 생성 품질 향상과 정확한 교차 모달 동기화에 기여하는 것으로 나타났습니다.
기존 모델은 오디오와 비디오 VAE를 개별적으로 학습하여 두 잠재 공간 간의 정렬이 부족했지만, OmniVAE는 통합 학습을 통해 이 문제를 해결했습니다. 이를 통해 텍스트 기반 오디오·비디오 생성 시 더 높은 품질과 정확도를 달성할 수 있습니다. 연구 결과는 통합 표현 학습의 중요성을 강조합니다.
OmniVAE는 교차 모달 정렬을 학습하는 동시에 사전 학습된 의미 인코더를 활용하여 각 모달의 학습 가능성을 향상시킵니다. 이는 더 나은 오디오·비디오 생성 모델 개발의 기반이 될 수 있습니다.