Pulse · AI 뉴스

Deepseek V4 Flash, vLLM으로 105 t/s 성능 달성

Deepseek · 2026-07-24

사용자가 Deepseek V4 Flash 모델을 vLLM으로 실행하여 RTX 6000 Blackwell에 준하는 105 t/s 성능을 달성했어요. Blackwell 전용 커널을 Triton으로 재구현하여 얻은 결과입니다.

기존 llama.cpp 방식보다 vLLM이 2~3배 빠른 성능을 보여주며, 특히 병렬 에이전트 워크플로우에서 효과적입니다.

모델을 VRAM에 완전히 로드하기 위해 ~iq2로 압축했으며, 이 과정은 최대 60분까지 소요될 수 있습니다.

##Deepseek##vLLM##Blackwell##최적화
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기