연구진은 텍스트 기반 사전 훈련의 한계를 극복하기 위해 멀티모달 데이터를 활용한 제로-샷 사전 훈련의 확장 가능성을 분석했어요.
최적 모델 크기와 토큰 수를 파악한 결과, 목표 손실은 예측 가능한 컴퓨팅 법칙을 따르지만, 최적 모델 크기와 토큰 수는 거듭제곱 법칙을 따르는 것을 확인했어요.
언어와 멀티모달 목표는 서로 다른 확장 방식으로 나타났으며, 데이터 구성에 따라 최적의 자원 할당이 달라지는 것을 발견했어요. 특히 텍스트 위주의 데이터는 더 큰 모델 크기에서 효율성을 보였어요.