연구진이 Windowed-MTP라는 새로운 기법을 개발하여 100만 토큰 컨텍스트에서 MTP(Multi-Token-Prediction) draft head의 KV 캐시 부담을 줄였습니다.
Windowed-MTP는 draft attention에 스트리밍 LLM 스타일의 슬라이딩 윈도우와 어텐션 싱크를 적용하여 draft 비용을 줄이고, 28%에서 44%까지 per-decode-step 비용을 절감했습니다.
기존 MTP 방식 대비 Windowed-MTP는 토큰 생성 속도를 향상시키고, 검증된 출력 분포를 유지하며, 사용되지 않는 draft KV를 재활용하여 효율성을 높입니다.