Pulse · AI 뉴스

Qwen3.6-27B NVFP4 벤치마크: MTP 활용 시 단점도 존재

Qwen · 2026-07-22

Unsloth에서 공개한 Qwen3.6-27B NVFP4 모델을 단일 GPU와 2개 GPU 환경에서 벤치마크한 결과, MTP(Multiple Token Prediction) 방식이 특정 조건에서 성능 저하를 일으킬 수 있음이 확인됐습니다.

단일 GPU 환경에서는 nspec=3 설정 시 최대 82% 빠른 추론 속도를 보였지만, 2개 GPU 환경에서는 9%의 미미한 성능 향상만 기록했습니다. 이는 텐서 병렬 통신 비용이 MTP 트레이드오프에 영향을 미치는 것으로 분석됩니다.

동시 요청 수가 증가하거나 컨텍스트 길이가 길어지면 MTP 방식의 장점이 사라지고 오히려 성능 저하를 유발할 수 있으며, 2개 GPU 환경에서는 32K 컨텍스트 길이에서 이미 성능이 감소하는 현상이 나타났습니다.

##Qwen##NVFP4##MTP##vLLM##벤치마크
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기