Pulse · AI 뉴스

VarRate: LLM KV 캐시 압축을 위한 트레이닝 없는 가변 레이트 방식

VarRate · 2026-07-17

연구진은 LLM 추론 시 메모리 병목 현상을 일으키는 KV 캐시 압축 방식 'VarRate'을 발표했어요. VarRate는 쿼리 중요도에 따라 토큰별로 가변 레이트 예산을 할당하여 모든 토큰을 유지하는 방식이에요. 기존 방식 대비 정확도가 향상되었으며, LongBench에서 압축률 20%로 원본 모델과 0.8점 이내의 성능을 보였어요.

VarRate는 토큰을 삭제하지 않고 레이트 할당만으로 작동하여 쿼리 기반 선택 방식이 실패하는 경우에도 정확도 손실을 3.5~5.5% 이내로 줄여요. KVzip과 비교했을 때 유사한 성능을 보이면서도 프리필 오버헤드가 약 1/8 수준으로 낮춰요.

VarRate는 기존 방식의 한계를 극복하고, 트레이닝 없이도 효율적인 KV 캐시 압축을 가능하게 하여 LLM의 성능 향상에 기여할 것으로 기대돼요.

##LLM##KV캐시##압축##VarRate##LongBench
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기