연구진은 VLM 데이터 구축을 체계적인 혼합 최적화 문제로 정의하고, 데이터 간 비율과 데이터 내 비율을 분리하여 재현 가능한 엔지니어링 분야로 만들었습니다. DecoupleMix 프레임워크는 어떤 데이터를 수집해야 할지 안내하고 데이터셋 검증을 통제된 실험으로 만들 수 있습니다. 실험 결과, DecoupleMix는 휴리스틱 기반의 기존 방식보다 성능이 뛰어났습니다.
단일 변수 반복 검색을 사용하여 데이터 간 비율을 최적화하고, 품질과 난이도를 평가하여 볼록 최적화 문제를 해결하여 데이터 내 비율을 구성합니다. 작은 규모의 프록시에서 발견된 최적 비율은 재조정 없이 더 큰 규모로 원활하게 이전됩니다.
80B 추가적인 다중 모달 지속 사전 훈련 토큰을 사용하여 VLM은 더 큰 다중 모달 예산을 가진 강력한 오픈 소스 모델과 경쟁력을 보였습니다.