연구진은 텍스트 기반 사전 학습의 한계를 극복하기 위해 멀티모달 데이터를 활용한 제로-샷 멀티모달 사전 학습의 확장 가능성을 조사했어요.
결과적으로 모델 크기와 토큰 수에 대한 최적의 비율은 단순한 선형 관계가 아닌 거듭제곱 법칙을 따르는 것으로 나타났어요.
텍스트 데이터 비율에 따라 멀티모달 학습의 효율성이 달라지며, 이를 고려한 효율성 경계를 제시하여 최적의 모델 구성 방법을 제안했어요.
제로-샷 멀티모달 사전 학습은 텍스트 기반 공간 추론 능력을 향상시키고 강력한 멀티모달 인컨텍스트 학습을 가능하게 하는 긍정적인 교차 모달 전이를 유도하는 것으로 확인됐어요.