Pulse · AI 뉴스

DeepSeek-V4-Flash 단일 B300 GPU에서 토큰 처리량 770토큰/초로 낮음

DeepSeek · 2026-07-22

DeepSeek-V4-Flash 모델을 단일 B300 GPU에서 vLLM으로 실행 시 토큰 처리량이 770토큰/초로 예상보다 낮습니다. 사용자 환경 설정 문제로 추정하며, 관련 설정 및 경험 공유를 요청했습니다. DSpark 추론 디코딩을 중단하고, flashinfer_trtllm 백엔드를 사용한 결과 개선을 보였습니다.

sparse MLA attention 경로가 eager 모드로 실행되어 성능을 제한할 가능성이 있으며, CUDA 그래프 사용 여부 확인이 필요합니다. 현재 설정은 tensor_parallel_size를 1로 설정하고, kv_cache_dtype을 fp8, block_size를 256으로 설정한 상태입니다.

다른 사용자들이 얻는 토큰 처리량, 사용 중인 MoE 백엔드, sparse MLA attention 경로의 CUDA 그래프 사용 여부 등을 문의했습니다. 환경 설정 오류 가능성을 염두에 두고 문제 해결을 시도 중입니다.

단일 GPU에서 MegaMoE는 expert parallel을 요구하며, DSpark 추론 디코딩은 과도한 오버헤드를 유발할 수 있다는 점을 확인했습니다.

##DeepSeek##vLLM##GPU##CUDA##최적화
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기