엔비디아가 LLM 배포 속도 향상을 위해 GPU 간 직접 전송 기술 기반의 '모델익스프레스'를 발표했어요. 모델 가중치 이동 시간을 서버 대기 8분에서 1분으로 단축하는 게 목표입니다.
모델익스프레스는 AI 모델의 규모가 TB 수준으로 커지면서 발생하는 병목 현상을 해결하기 위한 솔루션이에요. LLM 배포 및 강화학습 사후학습 과정 최적화에 활용돼요.
엔비디아는 모델익스프레스를 통해 AI 서비스의 성능과 효율성을 높이고, 더 빠른 모델 배포를 가능하게 할 것으로 기대하고 있습니다.