연구진이 토큰 수준 오프 정책 학습(TOPL)이라는 새로운 훈련 패러다임을 제안했어요. TOPL은 응답 내에서 좋은 토큰과 나쁜 토큰을 구별하도록 모델을 훈련하여 신뢰성 있는 생성 결과를 얻는 것을 목표로 해요.
문서 요약 작업에서 실험 결과, 다양한 시퀀스 수준 및 토큰 수준 기준 모델 대비 뛰어난 성능을 보여줬고, 기계 번역에도 효과적으로 적용 가능성을 입증했어요.
연구 결과, 토큰 수준 학습 신호가 성능 향상에 중요한 역할을 하며, 학습된 LoRA 어댑터는 해석 가능한 모델 업데이트를 유도하는 것으로 확인됐어요.