Azazelionide 사용자가 RTX 5060 Ti에서 Qwen3.5 35B A3B float8 모델을 55 tok/s로 실행하는 방법을 공유했어요. 이는 Q8 양자화된 Qwen3.5 35B를 llama.cpp로 실행하는 것보다 훨씬 빠른 속도예요. MTP를 사용하면 생성 속도를 더욱 향상시킬 수 있어요.
이전 게시물에서 Qwen3.5 35B 모델에 대한 수요가 높았던 점을 감안해 Gated Delta Network 커널을 적용했어요. 현재 CPU와 GPU 성능 저하 없이 61 tok/s로도 실행 가능해요. 블로그 게시물을 통해 속도 향상 트릭을 자세히 설명할 예정이에요.
Reddit 사용자가 RTX 5060 Ti에서 Qwen3.5 35B A3B float8 모델을 실행하는 방법을 공유하며, 더 빠른 속도를 위한 MTP 사용을 고려해볼 것을 제안했어요.