사용자가 36GB 맥북에서 대규모 코딩 모델을 실행하기 위해 llama.cpp를 포크하여 SSD에서 MoE 전문가 가중치를 스트리밍하는 앱을 개발했어요.
SSD 스트리밍을 통해 Qwen3.6-35B-A3B 모델은 10GiB 캐시에서 초당 약 13토큰, 14GiB 캐시에서 약 19토큰의 속도를 보여줬어요.
가장 큰 성능 향상은 저장 장치 위치 변경으로, 2.7배의 성능 향상을 가져왔으며, zero-copy 경로 최적화도 실질적인 성능 향상을 가져왔어요.
개발자는 dual-SSD 스트라이핑과 같은 시도는 오히려 성능 저하를 일으키는 반면, Apple Silicon + Metal 환경에 최적화된 앱을 MIT 라이선스로 공개했어요.