llama.cpp에서 MTP(Multi Token Prediction) 지원이 추가되어 모델이 자체 MTP 헤드를 활용할 수 있게 됐어요.
Qwen3.6, DeepSeek, GLM 등은 자체 MTP 헤드를 탑재하고 있어 이 기능을 활용할 수 있어요.
밀집 모델에서는 최대 2.2배의 성능 향상을 보고하는 반면, MoE 모델에서는 개선 효과가 미미한 것으로 나타났어요.
기존의 draft 모델 방식은 신뢰성이 떨어지므로, native MTP 헤드 사용이 더 효과적인 것으로 확인됐어요.