연구진은 시각 문서 이해 모델이 답변을 뒷받침하는 증거 영역을 정확히 지목하는 데 어려움을 겪는다는 사실을 확인했어요. 기존 방식은 좌표를 통해 증거 영역을 표시하지만, 이 방식은 모델의 표현 능력을 제한할 수 있어요. 연구 결과, 텍스트로 증거를 인용하고 위치를 파악하는 새로운 방식이 좌표 방식보다 증거 회수율을 높이고 환각 현상을 줄이는 데 효과적이었어요.
새로운 GRPO 학습 방식은 증거 영역에 대한 레이블 없이도 모델이 더 나은 증거를 인용하도록 훈련하여 정확도를 향상시켰어요. 이 방식은 모델이 금속 답안과 검색된 영역의 일부를 읽도록 하여 보상을 제공해요. 연구 결과, 80억 개의 파라미터를 가진 모델의 엄격한 귀속 정확도가 22.4에서 33.8로 향상됐어요.
좌표 인터페이스 없이, 그리고 값비싼 영역 수준의 감독 없이 증거 귀속을 개선할 수 있는 실질적인 방법을 제시하며, 시각 문서 이해 분야에 새로운 가능성을 열었어요.