AMD Ryzen 7 6800H APU 환경에서 Gemma 4 및 Qwen 3.6 MoE 모델의 llama.cpp 벤치마크 결과를 공유했어요. Qwen 3.6 35B MoE 모델은 더 적은 파라미터로도 더 빠른 추론 속도를 보여줬어요.
Q4_0 양자화가 약 18t/s의 사용 가능한 속도를 제공하는 반면, 31B 모델에서 Q8_0은 2.3t/s로 속도가 현저히 느려지며, 시스템 메모리 대역폭 제한으로 인해 모델 크기를 작게 유지하는 것이 중요해요.
최신 FP4 형식은 AMD 드라이버 스택에서 최적화가 더 필요하며, MoE 모델을 활용하여 높은 파라미터 지능을 유지하면서도 사용 가능한 속도를 얻는 것이 APU 사용자에게 유리해요.