Pulse · AI 뉴스

DraftExpert: 확장 인지 자가 추론 디코딩을 통한 엣지 디바이스 MoE 추론

DeepSeek-V2-Lite · 2026-07-27

연구진은 엣지 디바이스에 MoE 모델을 배포할 때 발생하는 전문가 메모리 문제를 해결하기 위해 DraftExpert라는 새로운 프레임워크를 제안했어요.

DraftExpert는 자가 증류를 통해 경량화된 전문가 드래프트를 학습하고, 이를 활용하여 추론 성능을 향상시키고 전문가 로딩 횟수를 줄여요.

DeepSeek-V2-Lite 및 Moonlight-16B-A3B 모델에서 CPU-GPU 및 Flash-NPU 오프로드 환경에서 디코딩 처리량 1.45배 향상, 드래프트 수용률 84~87%, 프리페치 히트율 86~88%를 달성했어요.

##MoE##추론##DraftExpert##DeepSeek-V2-Lite##Moonlight-16B
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기