사용자가 Deepseek V4 Flash 모델을 vLLM으로 실행하여 RTX 6000 Blackwell에 준하는 105 t/s 성능을 달성했어요. Blackwell 전용 커널을 Triton으로 재구현하여 얻은 결과입니다.
기존 llama.cpp 방식보다 vLLM이 2~3배 빠른 성능을 보여주며, 특히 병렬 에이전트 워크플로우에서 효과적입니다.
모델을 VRAM에 완전히 로드하기 위해 ~iq2로 압축했으며, 이 과정은 최대 60분까지 소요될 수 있습니다.