사용자가 RTX PRO 6000 Max-Q에서 Qwen3.6-27B 모델의 vLLM과 SGLang에서 다양한 스펙-디코딩 방법(DFlash, MTP, EAGLE3, ngram)을 벤치마크했어요. DFlash는 SGLang에서 최대 3.3배, vLLM에서 2.5배 빠른 성능을 보여줬어요. EAGLE3는 vLLM에서 로드되지 않는 문제와 DFlash 샘플러의 양자화 호환성 문제를 겪었으며, 이를 해결하기 위한 패치가 필요했어요.
SGLang에서 DFlash를 사용할 때 최대 요청 수를 제한해야 메모리 부족 문제를 해결할 수 있었어요. MTP/NEXTN은 draft depth 증가에 따라 성능이 향상되었고, EAGLE3는 K=3에서 성능이 최고조를 이루는 반면 NEXTN은 draft depth 증가에 따라 성능이 향상되는 차이를 보였어요.
ngram은 성능 향상 효과가 미미하여 큰 의미가 없었으며, 전반적으로 DFlash가 가장 효율적인 스펙-디코딩 방법으로 나타났어요.