AMD MI50 GPU 16개로 GLM-5.2 모델을 llama.cpp RPC 환경에서 실행하여 12.2 토큰/초의 추론 속도를 달성했어요. 10.7K 토큰 문서에서 30.9 토큰/초의 입력 속도를 기록하며, 8GPU 노드 구성으로 16,384 토큰 슬롯 2개를 활용했어요. 이전 시도는 vLLM과 Moby Dick 빌드를 통해 14 토큰/초의 디코딩 속도를 냈지만, 1만 토큰 이후 성능이 저하되었던 경험이 있어요.
llama.cpp RPC를 통해 GLM-5.2 UD-Q4_K_XL GGUF 모델을 실행하며, 10.7K 토큰 컨텍스트에서 10.2 토큰/초의 추론 속도를 유지하며 일관성 있는 장문 생성 가능성을 확인했어요. 두 개의 병렬 요청을 처리하여 14.5 토큰/초의 집계 속도를 기록했어요. 모델 크기는 436GB이며, GPU당 32GB VRAM을 사용하고, 100W 전력 제한을 두고 있어요.
직접 연결된 10GbE DAC와 9000 MTU를 사용하여 GPU 간 통신을 최적화했으며, GLM-5.2 AWQ INT4 모델을 vLLM-gfx906 환경에 통합하여 성능을 개선하려는 시도가 있었지만, 1만 토큰 이후 성능 저하가 발생했던 경험이 있어요.