연구진은 텍스트-비디오 생성 모델 학습에 있어 데이터 분포와 캡션 품질이 미치는 영향을 분석했어요. 통제된 실험을 위해 다양한 글꼴, 색상, 크기, 위치, 속도로 움직이는 글자를 렌더링하는 절차적 테스트베드 'Moving Alphabet'을 개발했어요. 캡션 품질이 좋지 않은 데이터로 학습했을 때, classifier-free guidance나 fine-tuning으로도 성능 회복이 제한적이라는 점을 확인했어요.
Moving Alphabet을 통해 텍스트-비디오 모델은 비디오 이해 능력에 의해 제한되며, 다양한 콘텐츠와 적절한 길이의 비디오 데이터 분포가 일반화에 중요함을 발견했어요. 연구 결과는 대규모 텍스트-비디오 모델 개발에 도움이 될 수 있으며, 사전 학습 데이터 과학에 대한 관심이 필요하다고 강조했어요.
연구진은 텍스트-비디오 모델 학습 데이터의 중요성을 강조하며, 향후 모델 개발 시 데이터 과학에 대한 더 많은 관심이 필요하다고 제안했어요.