사용자가 vLLM을 사용하여 Qwen3.6-27B 모델에 nvfp4 KV 캐시를 구현하는 방법을 공유했어요. 이 방법은 vLLM 이슈 #49011에서 제시된 접근 방식을 opencode/GLM 5.2에 적용한 결과예요. nvfp4를 사용하면 MTP 작업 공간에 약 0.39 GiB를 절약할 수 있어요.
최적화된 구성에는 VLLM_MEMORY_PROFILER_ESTIMATE_CUDAGRAPHS, NCCL_CUMEM_ENABLE, CUDA_DEVICE_MAX_CONNECTIONS, OMP_NUM_THREADS 등의 환경 변수가 포함돼 있어요.
최대 모델 길이 262144, GPU 메모리 활용률 90%로 설정되었으며, kv-offloading-size는 20으로 설정돼 있어요.