PagedWeight는 MoE LLM 서빙 시 모델 가중치를 런타임에 동적으로 양자화하여 KV 캐시 크기와 모델 가중치 GPU 메모리 요구 사항 간의 균형을 맞추는 새로운 방법입니다. PagedWeight는 모델의 작업 정확도, 메모리 소비, 처리량/지연 시간 간의 복잡한 상호작용을 효과적으로 탐색합니다. 실험 결과, PagedWeight는 기존 양자화 방식 대비 품질-메모리 균형을 개선했습니다.
PagedWeight는 최대 72.0%의 GPU 메모리 절감과 1.94배의 처리량 향상을 달성하며, FP16 수준의 정확도를 유지합니다. 또한 유사한 메모리 예산 내에서 최대 39.3%의 품질 향상을 제공하며, 최대 4.1%의 처리량 손실만 발생합니다.
PagedWeight는 KV 캐시 집약적인 서빙 시나리오에서 MoE LLM의 효율성을 높이는 데 기여하며, 모델 정확도와 메모리 사용량 간의 균형을 최적화하는 데 중요한 역할을 합니다.