Unsloth에서 공개한 Qwen3.6-27B NVFP4 모델을 단일 GPU와 2개 GPU 환경에서 벤치마크한 결과, MTP(Multiple Token Prediction) 방식이 특정 조건에서 성능 저하를 일으킬 수 있음이 확인됐습니다.
단일 GPU 환경에서는 nspec=3 설정 시 최대 82% 빠른 추론 속도를 보였지만, 2개 GPU 환경에서는 9%의 미미한 성능 향상만 기록했습니다. 이는 텐서 병렬 통신 비용이 MTP 트레이드오프에 영향을 미치는 것으로 분석됩니다.
동시 요청 수가 증가하거나 컨텍스트 길이가 길어지면 MTP 방식의 장점이 사라지고 오히려 성능 저하를 유발할 수 있으며, 2개 GPU 환경에서는 32K 컨텍스트 길이에서 이미 성능이 감소하는 현상이 나타났습니다.