Pulse · AI 뉴스

AMD MI50 GPU로 GLM-5.2 추론, llama.cpp RPC로 12.2 토큰/초 달성

GLM-5.2 · 2026-07-23

AMD MI50 GPU 16개로 GLM-5.2 모델을 llama.cpp RPC 환경에서 실행하여 12.2 토큰/초의 추론 속도를 달성했어요. 10.7K 토큰 문서에서 30.9 토큰/초의 입력 속도를 기록하며, 8GPU 노드 구성으로 16,384 토큰 슬롯 2개를 활용했어요. 이전 시도는 vLLM과 Moby Dick 빌드를 통해 14 토큰/초의 디코딩 속도를 냈지만, 1만 토큰 이후 성능이 저하되었던 경험이 있어요.

llama.cpp RPC를 통해 GLM-5.2 UD-Q4_K_XL GGUF 모델을 실행하며, 10.7K 토큰 컨텍스트에서 10.2 토큰/초의 추론 속도를 유지하며 일관성 있는 장문 생성 가능성을 확인했어요. 두 개의 병렬 요청을 처리하여 14.5 토큰/초의 집계 속도를 기록했어요. 모델 크기는 436GB이며, GPU당 32GB VRAM을 사용하고, 100W 전력 제한을 두고 있어요.

직접 연결된 10GbE DAC와 9000 MTU를 사용하여 GPU 간 통신을 최적화했으며, GLM-5.2 AWQ INT4 모델을 vLLM-gfx906 환경에 통합하여 성능을 개선하려는 시도가 있었지만, 1만 토큰 이후 성능 저하가 발생했던 경험이 있어요.

##GPU##llama.cpp##GLM-5.2##AMD
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기