LOCKS는 장문 컨텍스트에서 LLM을 사용할 때 병목 현상이 되는 KV 캐시 문제를 해결하기 위한 기술입니다. 페이지별 분산 표현을 요약하여 필요한 정보만 추출하고, 전체 키를 읽지 않고도 효율적인 어텐션 연산을 수행합니다.
LongBench-v1 에서는 전체 캐시와 거의 동일한 성능을 보이며, RULER에서는 최소 예산에서도 전체 키를 읽는 오라클과 유사한 성능을 보여줍니다.
vLLM 플러그인으로 제공되며, 128K 토큰 예산에서 전체 KV 어텐션보다 품질은 유지하면서 토큰 디코딩 지연 시간을 절반으로 줄입니다.