연구진은 엣지 디바이스에 MoE 모델을 배포할 때 발생하는 전문가 메모리 문제를 해결하기 위해 DraftExpert라는 새로운 프레임워크를 제안했어요.
DraftExpert는 자가 증류를 통해 경량화된 전문가 드래프트를 학습하고, 이를 활용하여 추론 성능을 향상시키고 전문가 로딩 횟수를 줄여요.
DeepSeek-V2-Lite 및 Moonlight-16B-A3B 모델에서 CPU-GPU 및 Flash-NPU 오프로드 환경에서 디코딩 처리량 1.45배 향상, 드래프트 수용률 84~87%, 프리페치 히트율 86~88%를 달성했어요.