Pulse · AI 뉴스

36GB 맥북에서 35B~480B 코딩 모델 실행하기: SSD 스트리밍 MoE 전문가 활용

llama.cpp · 2026-07-26

사용자가 36GB 맥북에서 대규모 코딩 모델을 실행하기 위해 llama.cpp를 포크하여 SSD에서 MoE 전문가 가중치를 스트리밍하는 앱을 개발했어요.

SSD 스트리밍을 통해 Qwen3.6-35B-A3B 모델은 10GiB 캐시에서 초당 약 13토큰, 14GiB 캐시에서 약 19토큰의 속도를 보여줬어요.

가장 큰 성능 향상은 저장 장치 위치 변경으로, 2.7배의 성능 향상을 가져왔으며, zero-copy 경로 최적화도 실질적인 성능 향상을 가져왔어요.

개발자는 dual-SSD 스트라이핑과 같은 시도는 오히려 성능 저하를 일으키는 반면, Apple Silicon + Metal 환경에 최적화된 앱을 MIT 라이선스로 공개했어요.

##모델최적화##AppleSilicon##llama.cpp##MoE
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기