Pulse · AI 뉴스

LOCKS: 효율적인 장문 컨텍스트 디코딩을 위한 페이지 로컬 압축 키 요약

vLLM · 2026-07-28

LOCKS는 장문 컨텍스트에서 LLM을 사용할 때 병목 현상이 되는 KV 캐시 문제를 해결하기 위한 기술입니다. 페이지별 분산 표현을 요약하여 필요한 정보만 추출하고, 전체 키를 읽지 않고도 효율적인 어텐션 연산을 수행합니다.

LongBench-v1 에서는 전체 캐시와 거의 동일한 성능을 보이며, RULER에서는 최소 예산에서도 전체 키를 읽는 오라클과 유사한 성능을 보여줍니다.

vLLM 플러그인으로 제공되며, 128K 토큰 예산에서 전체 KV 어텐션보다 품질은 유지하면서 토큰 디코딩 지연 시간을 절반으로 줄입니다.

##LLM##어텐션##최적화##vLLM
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기