연구진은 Qwen2-VL 모델 패밀리를 대상으로 이미지 손상 정도에 따른 불확실성 신호 변화를 측정했어요.
모델 크기가 커질수록 내부 오류 감지 성능(AUROC)은 크게 향상되지만, 자연어 표현 신뢰도는 낮게 유지돼 모델이 아는 것과 말하는 것 사이의 간극이 커져요.
4비트 양자화는 정확도에는 큰 영향을 주지 않지만(약 -1.6 포인트), 불확실성 신호는 크게 저하돼 모델의 답변 신뢰도 파악이 어려워져요.
제한된 메모리 환경에서는 더 큰 모델을 양자화하는 것이 더 나은 선택이며, 7B-4bit 모델이 가장 높은 정확도와 불확실성 신호(AUROC 0.98)를 제공해요.