GaugeQuant은 LLM의 내부 연속 대칭성을 활용하여 양자화 과정에서 발생하는 이상치를 최소화하는 새로운 기법입니다. 학습 과정에서 LogSumExp 항을 손실 함수에 추가하여 대칭성을 깨고 최적의 베이스를 선택합니다.
stop-gradient 연산자를 사용하여 회전 행렬만 업데이트하며, 기존 언어 모델링 목표에 영향을 주지 않습니다. 별도의 교정 데이터나 양자화 시뮬레이션 없이도 적용 가능하며, 학습 오버헤드도 미미합니다.
LLaMA-2 7B 모델을 W4A4 양자화 방식으로 적용했을 때 퍼플렉시티가 8.22에서 6.73으로 감소하며, 기존 방식과 경쟁력을 보였습니다. W4A16에서는 퍼플렉시티가 11.16에서 5.45로 감소했습니다.