DKV (DifferentialKV)는 KV 캐시 압축을 통해 로컬 LLM의 긴 컨텍스트 추론 메모리 요구 사항을 줄이는 오픈소스 프로젝트입니다.
이 프로젝트는 CLI, MLX 백엔드, CUDA 백엔드, 기술 보고서, 완전한 오픈소스 구현을 제공하며, 앵커 기반 표현, 저랭크 압축, 잔차 보존, 희소 라우팅 어텐션 기술을 활용합니다.
GitHub 저장소와 기술 보고서가 공개되었으며, llama.cpp, vLLM, SGLang 등과의 통합 및 개선 아이디어를 환영합니다.