NVIDIA가 ModelExpress(MX)를 통해 DeepSeek-V4 Pro 시작 시간을 8분에서 2분 미만으로 단축했어요. GPU-to-GPU RDMA를 활용해 GPU 메모리에 모델 가중치를 빠르게 전송하는 방식이에요. MX는 커널 캐시를 재사용하고, 추론 워커는 NIXL을 통해 다른 GPU에서 직접 업데이트된 가중치를 가져와 중앙 집중식 브로드캐스트를 피하고 가중치 이동 병목 현상을 줄여요.
ModelExpress는 추론과 RL(강화 학습) 후 훈련 속도 향상에도 기여해요. 커널 캐시 재사용 외에도 추론 워커가 다른 GPU에서 직접 업데이트된 가중치를 가져와 중앙 집중식 브로드캐스트를 피하고 가중치 이동 병목 현상을 줄여요.