MTP를 최대한 활용하려면 n_max 값을 튜닝해야 합니다. 기본 설정으로 사용하면 성능 향상을 얻을 수 있지만, 모델과 하드웨어 조합에 따라 최대 성능의 50~100%를 놓칠 수 있습니다. Gemma-31B는 n_max 증가에 따라 성능이 잘 향상되었고, Qwen은 중간 설정이 가장 효과적이었으며, Llama 2도 잘 작동했습니다. 작은 Gemma 모델은 큰 모델과 반대로 작동하는 경향을 보였습니다.