CachyLLama는 llama.cpp 포크로, 반복적인 프롬프트 처리 문제를 해결하여 느린 하드웨어에서 모델 성능을 개선합니다. SSD 기반 캐시 및 다중 계층 KV 캐시를 통해 장시간 에이전트 세션에서 반복적인 컨텍스트 재처리 시간을 줄여 응답성을 향상시킵니다. 7840U/780M 벤치마크 결과, 15,700 토큰 프롬프트에서 콜드 실행 143.1초 대비 워밍 시간 0.99초로 단축되는 효과를 보였습니다.