연구진이 토큰 수준 오프 정책 학습(TOPL)이라는 새로운 훈련 패러다임을 제안했어요. 이 방법은 모델이 응답 내에서 좋은 토큰과 나쁜 토큰을 구별하도록 훈련하여 신뢰성 있는 토큰 생성을 유도하는 방식이에요. 문서 요약 작업에서 실험 결과, 11개 데이터 세트에서 다양한 시퀀스 수준 및 토큰 수준 기준에 비해 뛰어난 성능을 보였어요. 기계 번역에도 효과적으로 적용 가능하며, 토큰 수준 학습 신호가 성능에 중요한 역할을 한다는 것을 확인했어요.