LLM 선호도 정렬 연구에서 강화 학습이 주요 방법으로 떠오르고 있어요. 기존 방식은 최종 응답만 평가해 추론 경로에 대한 지침이 부족했는데, Thinking Checklist Reward (TCR)는 추론 과정을 평가하는 새로운 보상 시스템이에요. TCR은 샘플별 사고 체크리스트를 활용해 모델의 추론 과정을 평가하고, 최종 결과 예측 불가능한 사고 과정에 집중하도록 설계됐어요.
다섯 모델에 대한 실험 결과, TCR은 다양한 벤치마크에서 정렬 성능을 향상시켰고, EMA 기반 잔여 공식과 샘플별 체크리스트 감독의 중요성을 입증했어요. 기존 방식의 한계를 극복하고, LLM의 사고 과정을 개선하는 데 기여할 것으로 기대돼요.
TCR은 LLM이 인간의 선호도를 더 잘 반영하도록 돕는 새로운 접근 방식으로, 향후 LLM 개발에 중요한 역할을 할 것으로 보입니다.