연구진이 LLM 양자화 시 손실과 속도 저하를 줄이는 통계적 손실 없는 양자화 방법(SLQ)을 연구했어요. SLQ는 기존 방식보다 낮은 비트 수로도 성능을 유지하며 최대 3.6배 빠른 추론 속도를 제공해요.
SLQ는 작업 손실 없음, 분포 손실 없음, 가마 제곱 분산 법칙 등 세 가지 손실 없음 개념을 활용하며, 비대칭 양자화를 통해 노이즈 분산 문제를 해결했어요.
연구 결과, SLQ는 파라미터당 3.3~6 비트 수준에서 작업 손실 없음을 달성하고, 평균적으로 5~6 비트에서 분포 손실 없는 성능을 보였으며, llama.cpp와 GG를 활용한 실험 결과도 포함돼 있어요.