CachyLLama는 로컬 에이전트 워크플로우에서 프롬프트 평가 지연 문제를 해결하기 위해 llama.cpp를 포크한 프로젝트입니다.
SSD 기반의 지속적인 KV 캐시, 시스템 프롬프트 캐시, 하이브리드 MoE/SSM 지원, 멀티 티어링 등의 기능을 제공하여 콜드 스타트 시간을 획기적으로 단축합니다.
AMD Ryzen 7840U 환경에서 프롬프트 크기가 1,243 토큰일 때 콜드 스타트 9.3초, 워밍업 시 0.41초로 개선되는 성능을 보였습니다.