Pulse · AI 뉴스

BeeLlama.cpp v0.4.1: KVarN, KV 정밀도, q2_0-q3_1 KV 캐시, 개선된 지원

llama.cpp · 2026-07-27

BeeLlama.cpp 포크의 최신 버전 v0.4.1이 공개됐어요. KVarN, KV 캐시 정밀도 보정, 다양한 KV 캐시 타입(q2_0-q3_1, q6_0, q6_1) 등 다양한 기능이 추가됐어요.

KVarN은 기존 방식보다 더 나은 정밀도를 제공하며, KV 캐시 정밀도 보정은 모델이 작업 세부 사항을 정확하게 이해하도록 돕는 기능이에요. 특히, 128K 컨텍스트를 지원하며 VRAM 사용량을 줄였어요.

벤치마크 결과, KVarN과 q6_0은 q8_0과 비슷한 성능을 보이면서도 VRAM 사용량은 줄이는 것으로 나타났어요.

##LLM##llama.cpp##KVcache##KVarN
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기