연구진이 대규모 비전-언어 모델(LVLM)의 온디바이스 배포를 위해 비전 인코더 'UltraViT'를 개발했어요. UltraViT는 실제 온디바이스 지연 시간을 고려해 설계된 피라미드 구조로, 다양한 공간 믹서를 활용해 효율성을 높였어요. 새로운 2단계 사전 훈련 전략을 통해 LVLM의 고수준 의미론적 정렬에 필요한 풍부한 공간 특징을 확보하고 성능을 1.7배 향상시켰어요.