연구진은 장문 맥락 추론에서 LLM의 주요 문제점인 '반복 복사' 현상을 발견하고, 이 현상은 모델이 문제 해결 대신 입력 텍스트를 그대로 복사하는 것을 의미합니다.
GEAR(Grounding Evidence-Aware Reward)라는 새로운 방법으로, 핵심 증거와의 일치에 보상을 주고 불필요한 맥락과의 일치에 패널티를 주어 모델의 정확한 근거 기반 추론을 유도합니다.
GEAR은 다양한 모델 규모와 벤치마크에서 평균 4.6점의 성능 향상을 보였으며, 반복 복사 및 사고 길이를 줄이는 데 효과적입니다.